Нейросеть «фото в видео»: из одного снимка и из нескольких

Запрос «фото в видео» обычно означает не «оживи кадр», а «сделай мне из этого ролик». Разница существенная: из одного снимка выходит один клип на несколько секунд, и всё, что длиннее, собирается из нескольких. Эта глава — про то, как устроен каждый из трёх маршрутов и почему сборка готового ролика не стоит ничего.

Ваш снимокодин кадр, который у вас естьМодель читает сценучто здесь предмет, что фон, где планыДостраивает кадрыдесятки кадров, которых никто не снималКлип со звукомпропорции — от вашего снимкаЧто происходит после того, как вы приложили фотографиюОтсюда — и лёгкость («ветер в листве» просто появляется), и предел:чем больше в кадре того, что нужно додумать, тем дальше клип уедет от снимка.
Первый кадр — ваш. Все остальные модель придумывает: она не добавляет движение к вашему файлу, а снимает эту сцену заново, начиная с него.

Маршрут первый: один снимок — один клип

Базовый случай. Ваша фотография становится первым кадром, модель достраивает остальные, соотношение сторон берётся у самого файла. Длина — от 4 до 15 секунд целыми секундами, звук рождается вместе с картинкой.

Здесь важно понимать предел: из одного снимка не выйдет полутораминутного ролика. Не потому, что нельзя заказать длиннее, а потому что после пяти-шести секунд модель начинает сама придумывать, чем занять кадр, и в клипе появляется второе, незаказанное движение. Длинное видео из фотографий делают иначе — не длинным клипом, а несколькими короткими.

Маршрут второй: два снимка — переход между ними

Возможность, о которой почти никто не знает, потому что в «оживлялке-кнопке» её не бывает: можно задать не только первый кадр, но и последний. Модель придумает движение так, чтобы прийти точно во второй ваш снимок.

Первый кадрваш снимокПереход придумывает модельстолько секунд, сколько вы закажетеПоследний кадрвторой ваш снимокКогда снимков дваОба конца заданы вами — значит, единственное, что модель может испортить, это середина.
Если у вас есть два снимка одной сцены — до и после, лицо и профиль, пустая комната и обставленная, — их можно поставить началом и концом клипа. Всё, что между ними, модель придумает так, чтобы прийти точно во второй кадр.

Что из этого получается на практике:

  • До и после — пустая комната и обставленная, стройка и готовый дом, лицо до и после стрижки.
  • Два ракурса одного предмета — вместо облёта, который модель придумывает сама, вы задаёте обе крайние точки.
  • Два кадра из одной серии — то, что раньше было «выбери один снимок из двадцати», становится движением между ними.

Главное достоинство маршрута — оба конца заданы вами, а значит, единственное, что модель может испортить, это середина.

Маршрут третий: несколько снимков — собранный ролик

Здесь начинается то, на чём чаще всего спотыкаются. Ролик из нескольких фотографий делается не одним запросом, а по кадрам — и потом собирается в один файл.

По одному клипу за раз — и это не придирка

Не просите сгенерировать несколько клипов в одном сообщении. Если такой ход прервётся на середине, работа всё равно оплачивается, а результат теряется: 11,5% всего сгенерированного видео оплачено и не показано пользователю именно так.

Правильный порядок: сначала согласовать список из 3–6 кадров, потом генерировать по одному, глядя на результат.

И вторая вещь, о которой стоит попросить вслух:

Попросите собрать это в один файл

Склейка клипов, обрезка, подкладывание музыки и приведение к нужному формату — локальные операции без отдельной цены. Их нужно просто попросить.

Это стоит знать, потому что просят редко: из 181 переписки, где сгенерировали два клипа и больше, склеили их только 44. Остальные заплатили за несколько роликов и унесли домой набор файлов.

Как удержать одного и того же героя во всех кадрах

Самая частая порча серии: три клипа сгенерированы по трём описаниям — и в каждом другой человек. Это не сбой, а прямое свойство генерации по тексту: у неё нет консистентности персонажа, два клипа по одному описанию это два разных человека.

Что работает:

  • Начать с кадра, а не с текста. Один снимок героя оживляется первым, и дальше он же используется как референс для всех следующих кадров.
  • Повторять описание героя слово в слово. Не пересказывать своими словами в каждом кадре — копировать.
  • Строить последний кадр так, чтобы с него мог начаться следующий. Тогда на склейке не будет скачка.
4–15 сОдин клип из одного снимкаДлиннее собирается из нескольких, а не заказывается одним куском.
3–6Кадров в разумной серииСогласовать список заранее, генерировать по одному.
0Цена склейкиСборка, обрезка и звук — локальные операции без отдельной цены.

Сколько это стоит

Платят за секунды сгенерированного видео. Поэтому ролик из пяти четырёхсекундных кадров стоит ровно как двадцать секунд генерации — и ничего сверху за то, что из них собрали один файл.

Что стоит длина и что стоит разрешение

Тарификация посекундная: клип стоит ровно во столько раз дороже, во сколько он длиннее. Здесь показаны соотношения, а не цены, — точную сумму в ваших токенах чат называет до генерации.

5 с

Разрешение

×1.3

от самого дешёвого варианта — 4 с в обычном разрешении

Одно законченное движение с началом и концом. Рабочая длина для оживлённого фото: дольше — и движение начинает повторяться.

Отсюда единственное правило экономии: сначала самый короткий клип в обычном разрешении, и только если он понравился — тот же кадр длиннее или чётче. Причём поднять разрешение у уже готового клипа дешевле, чем сразу генерировать в высоком: повторный рендер идёт по ставке примерно вдвое ниже. Проверять идею на длинном ролике — самый дорогой способ узнать, что она не сработала.

Приложите снимок — или сразу два, если хотите задать переход.

Загрузка…

Что почитать дальше

Общая механика и лестница сложности — оживить фото нейросетью. Про дозу движения в одном кадре — анимировать фото. Если в ролике должен звучать голос — говорящее фото. А про генерацию видео с нуля, без исходного снимка, — соседняя глава текст в видео.

Частые вопросы

Как сделать видео из фото нейросетью?
Приложите снимок в чат и опишите одно движение — фотография станет первым кадром, а модель достроит остальные. Клип получается длиной от 4 до 15 секунд, со звуком, с тем же соотношением сторон, что у исходного файла. Если нужен ролик длиннее, его собирают из нескольких таких клипов. Попробовать можно в чате Twelver.
Можно ли сделать видео из нескольких фотографий?
Да, но не одним запросом. Порядок такой: согласовать список из 3–6 кадров, сгенерировать их по одному — глядя на результат каждого, — и попросить собрать всё в один файл. Склейка, обрезка и добавление музыки не имеют отдельной цены, поэтому «соберите это в один ролик» — самая дешёвая просьба во всём процессе.
Можно ли задать первый и последний кадр?
Да. Если у вас два снимка, их можно поставить началом и концом клипа — модель придумает переход так, чтобы прийти точно во второй кадр. Хорошо работает для «до и после», для двух ракурсов одного предмета и для двух кадров одной серии. Оба конца заданы вами, поэтому испортить модель может только середину.
Почему в разных клипах получается разный человек?
Потому что у генерации по текстовому описанию нет консистентности персонажа: два клипа по одному описанию — это два разных человека. Лечится только тем, чтобы начать с кадра, а не с текста: оживить один снимок героя и дальше использовать его как референс во всех следующих кадрах, повторяя описание слово в слово.
Какой длины ролик можно получить?
Один клип — от 4 до 15 секунд. Для оживлённой фотографии рабочая длина 4–6 секунд: одно законченное движение с началом и концом. Всё, что длиннее, разумнее собирать из нескольких коротких клипов, а не заказывать одним куском — иначе модель начнёт сама придумывать, чем занять кадр.
Почему не стоит просить несколько клипов в одном сообщении?
Потому что если такой ход прервётся на середине, работа всё равно тарифицируется, а результат теряется — так оплачивается и не доходит до пользователя 11,5% всего сгенерированного видео. Генерируйте по одному клипу за раз и смотрите на каждый: это заодно позволяет остановиться, если первый же кадр показал, что идея не работает.

В чате Twelver можно превратить фотографии в один собранный ролик — по кадру за раз, со звуком, и склеить их в конце без отдельной платы. Стартовые токены на генерацию видео начисляются после регистрации и онбординга.

Попробуйте сами

Всё из этого руководства работает в Twelver

Один чат для текста, картинок, видео, музыки и озвучки — без отдельных сервисов и подписок.

Открыть чат Twelver
Оцените свой опыт