Оживить фото нейросетью

Фотография, на которой всё замерло, — и вопрос, который приходит в голову каждому, кто её пересматривает: а как бы это выглядело в движении. Сегодня для этого достаточно приложить снимок и описать словами, что именно должно ожить. Здесь собрано всё по теме: что происходит с вашим файлом на самом деле, какие кадры оживают чисто, а какие нет, как сформулировать запрос и почему длина клипа — единственная настройка, которая по-настоящему влияет на цену.

Сразу о главном — что именно происходит

Нейросеть не добавляет движение к вашему файлу. Она берёт ваш снимок как первый кадр и достраивает все следующие сама — десятки кадров, которых никто никогда не снимал.

Отсюда всё остальное. Клип получается тем ближе к вашей фотографии, чем меньше в нём нужно додумывать, — и поэтому исход решает исходный снимок, а не удачная формулировка. Это измеренное свойство метода, а не оговорка на всякий случай.

Ваш снимокодин кадр, который у вас естьМодель читает сценучто здесь предмет, что фон, где планыДостраивает кадрыдесятки кадров, которых никто не снималКлип со звукомпропорции — от вашего снимкаЧто происходит после того, как вы приложили фотографиюОтсюда — и лёгкость («ветер в листве» просто появляется), и предел:чем больше в кадре того, что нужно додумать, тем дальше клип уедет от снимка.
Первый кадр — ваш. Все остальные модель придумывает: она не добавляет движение к вашему файлу, а снимает эту сцену заново, начиная с него.

Что оживает чисто, а что нет

Сложность задачи определяет не размер объекта и не длина запроса, а один параметр: сколько сцены модели придётся придумать. По нему выстраивается вся лестница — от пейзажа, где стихия движется сама, до читаемой надписи, которая не выйдет никогда.

Пейзаж, небо, водастихия движется сама, лица в кадре нетПредмет, товарформу надо защитить словами, движение простоеПортрет, один человекработает, если движение минимальноеГруппа людейкаждое лицо — отдельный шанс на подменуЧитаемый текст в кадребуквы превратятся в похожую на текст кашуСколько сцены модель вынуждена придуматьменьше ← придумано → больше
Сложность задачи определяет не размер объекта, а то, сколько сцены нейросети придётся придумать на его месте. Верхняя строка получается почти всегда, нижняя не получается никогда.

Верхняя строка получается практически всегда. Нижняя — не получается в принципе: видеомодель искажает буквы, и текст в кадре превращается в похожую на текст кашу. Если надпись обязана читаться, кадр оживляют без неё, а слова накладывают поверх готового ролика отдельным шагом.

Посмотрите на свой снимок до того, как платить

Почти всё, что может пойти не так, видно заранее — прямо на файле, который вы собираетесь загрузить. Семь вопросов ниже покрывают подавляющее большинство неудачных попыток.

Посмотрите на свою фотографию

Отметьте всё, что верно про снимок, который вы собираетесь оживить. Результат клипа решает исходник, а не формулировка запроса, — и почти всё, что может пойти не так, видно заранее.

Такой кадр оживает хорошо

Ничего чинить заранее не нужно. Соберите бриф и начните с самого короткого клипа.

Как сформулировать запрос

Хороший запрос на оживление — это четыре решения, а не красивое описание: что в кадре, одно движение камеры, что обязано остаться неизменным и чего быть не должно. Два движения камеры в одном запросе возвращаются дрожанием; молчание про звук движок понимает как «сочини музыку сам».

Соберите бриф кадра

Четыре решения — и внизу готовый запрос, который можно скопировать или сразу открыть в чате. Именно эти четыре пункта отделяют клип, который получается с первого раза, от серии платных попыток.

1. Что на фотографии

От этого зависит и движение, и список запретов.

Лицо — самая заметная часть кадра: любое лишнее движение читается как подмена человека.

2. Одно движение камеры

Ровно одно. Два движения подряд возвращаются дрожанием кадра — это свойство метода, а не неудачная попытка.

Самый надёжный вариант. С него стоит начинать.

3. Звук

Звук рождается вместе с картинкой в том же проходе и отдельно не стоит — но если о нём промолчать, движок сам сочинит музыку.

Тишину надо попросить: молчание в запросе движок понимает как «придумай саундтрек».

4. Длина

Решается не здесь, а после первого просмотра: запрос заканчивается просьбой сделать самый короткий вариант. Продлевать имеет смысл только то, что уже понравилось — тарификация посекундная, и длинный клип стоит ровно во столько раз дороже, во сколько он длиннее.

Готовый запрос

Оживи это фото: человек на фотографии — дыхание, редкое моргание, едва заметный поворот головы, лёгкое движение волос. Одно движение камеры на весь клип: камера неподвижна, движется только сцена.
Без изменений остаются: черты лица, возраст, причёска, одежда и фон.
Не должно быть: искажения лица, смены внешности, подмигиваний и улыбок «по команде», читаемого текста и надписей в кадре, любого звука и музыки.
Сделай сначала самый короткий вариант — я посмотрю и скажу, продлевать ли.
Открыть чат и приложить фото

В чате останется приложить сам снимок — запрос уже будет в поле ввода.

Сколько это стоит и почему

Видео — самое дорогое, что умеет ИИ сегодня, и его цена устроена предельно просто: платят за секунды готового клипа. Из этого следует единственное правило экономии, и оно не про выбор модели.

Что стоит длина и что стоит разрешение

Тарификация посекундная: клип стоит ровно во столько раз дороже, во сколько он длиннее. Здесь показаны соотношения, а не цены, — точную сумму в ваших токенах чат называет до генерации.

5 с

Разрешение

×1.3

от самого дешёвого варианта — 4 с в обычном разрешении

Одно законченное движение с началом и концом. Рабочая длина для оживлённого фото: дольше — и движение начинает повторяться.

Отсюда единственное правило экономии: сначала самый короткий клип в обычном разрешении, и только если он понравился — тот же кадр длиннее или чётче. Причём поднять разрешение у уже готового клипа дешевле, чем сразу генерировать в высоком: повторный рендер идёт по ставке примерно вдвое ниже. Проверять идею на длинном ролике — самый дорогой способ узнать, что она не сработала.

4–15 сДлина одного клипаЦелые секунды. Начинать стоит с самой короткой.
1 движениеКамера за клипДва движения подряд возвращаются дрожанием кадра.
Из снимкаСоотношение сторонВертикальная фотография даёт вертикальный клип, квадратная — квадратный.

Приложите фотографию и опишите, что в ней должно ожить. Обработка видео дороже обработки фото: первая генерация доступна после регистрации и онбординга — за них начисляются стартовые токены.

Загрузка…

Движение и речь — это две разные задачи

Отдельно стоит знать про развилку, о которой почти никто не догадывается, пока не упрётся. Заставить снимок двигаться и заставить его говорить — разные маршруты внутри продукта, и смешать их в одном запросе нельзя: это ограничение самого движка, а не интерфейса.

Ваша фотографияФото как первый кадрДвижение, ветер, дыхание, наездкамеры. Звук — атмосфера сцены.Можно задать и последний кадр —тогда модель придумает переходмежду двумя вашими снимками.Фото как референсЧеловек произносит вашу фразу,артикуляция считается вместес картинкой, за один проход.Голос можно задать записьюна 2–15 секунд. Она бесплатна.Один запрос — одна ветка. «Пусть подмигнёт и скажет фразу» приходится разбивать на две задачи.
Движение и речь — разные маршруты. Портрет как «первый кадр» даёт движение; портрет как «референс» плюс запись голоса даёт говорящего человека. Смешать их в одном запросе нельзя — это ограничение самого движка.

Как выглядит вторая ветка на практике, что писать в кавычках и как подставить конкретный голос — в главе говорящее фото.

Куда идти дальше

Главы этой книги разбирают отдельные случаи — у каждого своя механика и свои границы; полный список ниже, в оглавлении. Если вы пришли сюда со словом «бесплатно» или «онлайн» в запросе, вам в главу оживить фото бесплатно и онлайн. Если вы уже пробовали через голосового помощника и вам стало тесно — «Алиса, оживи фото». А старая семейная фотография и разговор про уважение к памяти живут в главе видео из фотографии книги про генерацию видео.

Частые вопросы

Как оживить фото нейросетью?
Приложите снимок в чат и опишите, что на нём должно ожить: одно движение камеры, что видимо меняется и что обязано остаться прежним. Нейросеть возьмёт вашу фотографию первым кадром и достроит остальные. Начинать стоит с самого короткого клипа — по нему видно, как модель поняла кадр. Попробовать можно в чате Twelver.
Оживлённое фото — это моя фотография с движением или новое видео?
Это новое видео, у которого ваш снимок — первый кадр. Все остальные кадры модель придумывает: она не накладывает эффект на файл, а как бы переснимает эту сцену, начиная с вашего кадра. Поэтому чем больше в кадре того, что нужно додумать — движущиеся люди, сложный фон, мелкие детали, — тем дальше результат уедет от оригинала.
Какой длины получается клип?
От 4 до 15 секунд, целыми секундами. Для оживлённой фотографии рабочая длина — 4–6 секунд: одно законченное движение с началом и концом. Дальше модель начинает сама придумывать, чем занять кадр, и в клипе появляется второе, незаказанное движение.
Какие фотографии оживают лучше всего?
Резкие снимки в оригинальном размере, где есть различимые передний и дальний планы, а в кадре нет читаемого текста. Пейзажи и виды оживают почти всегда: стихия — облака, вода, листва — движется естественно сама по себе. Труднее всего групповые снимки: каждое лицо в кадре это отдельный шанс, что модель «поправит» именно его.
Сохранится ли соотношение сторон моей фотографии?
Да. При оживлении снимка соотношение сторон берётся у самого файла: вертикальная фотография с телефона даёт вертикальный клип, квадратная — квадратный. Никакой обрезки под «горизонталь» не происходит. Зато белые поля и следы прежней обрезки уедут в видео как есть, поэтому их лучше убрать заранее.
Будет ли у клипа звук?
Да, звук рождается вместе с картинкой в том же проходе и отдельно не тарифицируется. Побочный эффект: если про звук в запросе промолчать, движок сам сочинит саундтрек. Поэтому тишину нужно просить словами — «без музыки и без посторонних звуков».
Можно ли, чтобы человек на фото что-то сказал?
Да, но это другой маршрут: портрет передаётся как референс, а не как первый кадр, реплика пишется в запросе в кавычках, и артикуляция считается вместе с картинкой за один проход. Смешать это с обычным оживлением в одном запросе нельзя. Подробно — в главе говорящее фото.
Почему у меня получился другой человек?
Почти всегда причина в исходнике, а не в запросе. По нерезкому, шумному или пересланному мессенджером снимку модель додумывает и черты лица тоже — и додумывает каждый раз заново. Возьмите оригинал файла, а не пересланную копию, и просите минимальное движение: дыхание и микродвижения вместо поворотов головы.

В чате Twelver можно приложить фотографию и получить из неё короткий клип со звуком — онлайн, в одной переписке, без отдельных приложений. Стартовые токены на генерацию видео начисляются после регистрации и онбординга.

Содержание

  1. 1.Оживить фото бесплатно и онлайн
  2. 2.«Алиса, оживи фото»: что она умеет и где её потолок
  3. 3.Говорящее фото: как заставить фотографию произнести фразу
  4. 4.Оживить картинку и рисунок нейросетью
  5. 5.Анимировать фото: движение, которое не выдаёт нейросеть
  6. 6.Нейросеть «фото в видео»: из одного снимка и из нескольких

Попробуйте сами

Всё из этого руководства работает в Twelver

Один чат для текста, картинок, видео, музыки и озвучки — без отдельных сервисов и подписок.

Открыть чат Twelver
Оцените свой опыт