Нейросеть «фото в видео»: из одного снимка и из нескольких
Запрос «фото в видео» обычно означает не «оживи кадр», а «сделай мне из этого ролик». Разница существенная: из одного снимка выходит один клип на несколько секунд, и всё, что длиннее, собирается из нескольких. Эта глава — про то, как устроен каждый из трёх маршрутов и почему сборка готового ролика не стоит ничего.
Маршрут первый: один снимок — один клип
Базовый случай. Ваша фотография становится первым кадром, модель достраивает остальные, соотношение сторон берётся у самого файла. Длина — от 4 до 15 секунд целыми секундами, звук рождается вместе с картинкой.
Здесь важно понимать предел: из одного снимка не выйдет полутораминутного ролика. Не потому, что нельзя заказать длиннее, а потому что после пяти-шести секунд модель начинает сама придумывать, чем занять кадр, и в клипе появляется второе, незаказанное движение. Длинное видео из фотографий делают иначе — не длинным клипом, а несколькими короткими.
Маршрут второй: два снимка — переход между ними
Возможность, о которой почти никто не знает, потому что в «оживлялке-кнопке» её не бывает: можно задать не только первый кадр, но и последний. Модель придумает движение так, чтобы прийти точно во второй ваш снимок.
Что из этого получается на практике:
- До и после — пустая комната и обставленная, стройка и готовый дом, лицо до и после стрижки.
- Два ракурса одного предмета — вместо облёта, который модель придумывает сама, вы задаёте обе крайние точки.
- Два кадра из одной серии — то, что раньше было «выбери один снимок из двадцати», становится движением между ними.
Главное достоинство маршрута — оба конца заданы вами, а значит, единственное, что модель может испортить, это середина.
Маршрут третий: несколько снимков — собранный ролик
Здесь начинается то, на чём чаще всего спотыкаются. Ролик из нескольких фотографий делается не одним запросом, а по кадрам — и потом собирается в один файл.
По одному клипу за раз — и это не придирка
Не просите сгенерировать несколько клипов в одном сообщении. Если такой ход прервётся на середине, работа всё равно оплачивается, а результат теряется: 11,5% всего сгенерированного видео оплачено и не показано пользователю именно так.
Правильный порядок: сначала согласовать список из 3–6 кадров, потом генерировать по одному, глядя на результат.
И вторая вещь, о которой стоит попросить вслух:
Попросите собрать это в один файл
Склейка клипов, обрезка, подкладывание музыки и приведение к нужному формату — локальные операции без отдельной цены. Их нужно просто попросить.
Это стоит знать, потому что просят редко: из 181 переписки, где сгенерировали два клипа и больше, склеили их только 44. Остальные заплатили за несколько роликов и унесли домой набор файлов.
Как удержать одного и того же героя во всех кадрах
Самая частая порча серии: три клипа сгенерированы по трём описаниям — и в каждом другой человек. Это не сбой, а прямое свойство генерации по тексту: у неё нет консистентности персонажа, два клипа по одному описанию это два разных человека.
Что работает:
- Начать с кадра, а не с текста. Один снимок героя оживляется первым, и дальше он же используется как референс для всех следующих кадров.
- Повторять описание героя слово в слово. Не пересказывать своими словами в каждом кадре — копировать.
- Строить последний кадр так, чтобы с него мог начаться следующий. Тогда на склейке не будет скачка.
Сколько это стоит
Платят за секунды сгенерированного видео. Поэтому ролик из пяти четырёхсекундных кадров стоит ровно как двадцать секунд генерации — и ничего сверху за то, что из них собрали один файл.
Что стоит длина и что стоит разрешение
Тарификация посекундная: клип стоит ровно во столько раз дороже, во сколько он длиннее. Здесь показаны соотношения, а не цены, — точную сумму в ваших токенах чат называет до генерации.
Разрешение
×1.3
от самого дешёвого варианта — 4 с в обычном разрешении
Одно законченное движение с началом и концом. Рабочая длина для оживлённого фото: дольше — и движение начинает повторяться.
Отсюда единственное правило экономии: сначала самый короткий клип в обычном разрешении, и только если он понравился — тот же кадр длиннее или чётче. Причём поднять разрешение у уже готового клипа дешевле, чем сразу генерировать в высоком: повторный рендер идёт по ставке примерно вдвое ниже. Проверять идею на длинном ролике — самый дорогой способ узнать, что она не сработала.
Приложите снимок — или сразу два, если хотите задать переход.
Что почитать дальше
Общая механика и лестница сложности — оживить фото нейросетью. Про дозу движения в одном кадре — анимировать фото. Если в ролике должен звучать голос — говорящее фото. А про генерацию видео с нуля, без исходного снимка, — соседняя глава текст в видео.
Частые вопросы
Как сделать видео из фото нейросетью?
Можно ли сделать видео из нескольких фотографий?
Можно ли задать первый и последний кадр?
Почему в разных клипах получается разный человек?
Какой длины ролик можно получить?
Почему не стоит просить несколько клипов в одном сообщении?
В чате Twelver можно превратить фотографии в один собранный ролик — по кадру за раз, со звуком, и склеить их в конце без отдельной платы. Стартовые токены на генерацию видео начисляются после регистрации и онбординга.
Попробуйте сами
Всё из этого руководства работает в Twelver
Один чат для текста, картинок, видео, музыки и озвучки — без отдельных сервисов и подписок.
Открыть чат Twelver