«Алиса, оживи фото»: что она умеет и где её потолок

Самый быстрый способ увидеть свою фотографию в движении сегодня — сказать это Алисе. Функция бесплатная, работает секунд за тридцать и не требует ничего, кроме приложения, которое у вас, скорее всего, уже стоит. Эта глава — про то, что именно она делает, где заканчиваются её возможности и что делать дальше, если одной кнопки перестало хватать.

Короткий ответ

Если нужно оживить одну фотографию один раз и просто посмотреть, что получится, — идите в Алису. Это бесплатно и быстро, и никакой другой инструмент не даст вам результат раньше.

Дальше начинается потолок, и он не в качестве картинки, а в четырёх вполне конкретных вещах: длина, звук, речь и второй кадр.

Что Алиса делает

По справке Яндекса функция устроена так: вы прикладываете JPEG или PNG размером до 10 МБ, описываете сюжет, и через полминуты получаете MP4-файл. Разрешение — 480p (854 × 480 пикселей), длительность — до четырёх секунд, звука в файле нет. Соотношение сторон берётся у исходной фотографии. Функция бесплатна с ограничением по числу генераций; отдельно продаётся «буст», добавляющий HD-генерации на месяц.

Это очень хороший продукт для того, чем он является: массовая кнопка, рассчитанная на то, что человек попробует один раз, покажет знакомым и пойдёт дальше. Она сознательно не даёт настроек — и именно поэтому ей так легко пользоваться.

Где потолок

АлисаTwelver
Длина клипадо 4 секунд4–15 секунд, целыми секундами
Разрешение480p (854 × 480), HD — за отдельный буст768p или 2K
Звуквидео создаётся без звуказвук рождается вместе с картинкой в том же проходе
Человек говорит фразунетда — портрет референсом, реплика в кавычках, артикуляция за один проход
Свой голос в кадренетда — 2–15 секунд записи как референс голоса, бесплатно
Второй кадр (переход между двумя снимками)нетда — можно задать и первый, и последний кадр
Что на входеJPEG или PNG до 10 МБснимок в оригинальном размере, плюс при необходимости запись голоса
Ценабесплатно с лимитом генерацийстартовые токены за регистрацию, дальше посекундно
Где работаетсайт и приложения Яндексабраузер на любом устройстве
Параметры Алисы — по справке Яндекса на 7 сентября 2026 года. Обе стороны меняются; сверяйтесь с первоисточником, если для вас критична конкретная цифра.

Три верхние строки — это про масштаб задачи. Четвёртая, пятая и шестая — про другие задачи вообще.

Четыре секунды — это много или мало

Честно: для оживлённой фотографии четырёх секунд обычно хватает. Одно движение с началом и концом укладывается в 4–6 секунд, а дальше модель начинает сама придумывать, чем занять кадр, и в клипе появляется второе, незаказанное движение. Разница между четырьмя секундами и пятнадцатью — это разница не между «плохо» и «хорошо», а между «оживлённый снимок» и «маленькая сцена с сюжетом».

А вот отсутствие звука — это уже не про размер. Клип без звука нельзя никуда выложить как есть: под него всё равно придётся что-то подкладывать отдельным шагом. Звук, рождённый вместе с картинкой, — ветер, шаги, гул комнаты — совпадает с движением в кадре, потому что его сочиняли из того же описания сцены. Подложенный сверху трек так не умеет.

Разговор — это отдельный маршрут, а не настройка

Самое частое разочарование звучит так: «оживил портрет — а как теперь сделать, чтобы он сказал фразу?». Никак — потому что это не соседняя кнопка, а другая ветка обработки. Портрет, который двигается, идёт в модель как первый кадр. Портрет, который говорит, идёт как референс, а реплика пишется словами в запросе. Смешать их в одном запросе нельзя.

Ваша фотографияФото как первый кадрДвижение, ветер, дыхание, наездкамеры. Звук — атмосфера сцены.Можно задать и последний кадр —тогда модель придумает переходмежду двумя вашими снимками.Фото как референсЧеловек произносит вашу фразу,артикуляция считается вместес картинкой, за один проход.Голос можно задать записьюна 2–15 секунд. Она бесплатна.Один запрос — одна ветка. «Пусть подмигнёт и скажет фразу» приходится разбивать на две задачи.
Движение и речь — разные маршруты. Портрет как «первый кадр» даёт движение; портрет как «референс» плюс запись голоса даёт говорящего человека. Смешать их в одном запросе нельзя — это ограничение самого движка.

Как выглядит вторая ветка на практике — в главе говорящее фото.

Вы оживили портрет и хотите, чтобы человек произнёс одну фразу. Что для этого нужно?

Когда переходить, а когда не стоит

Оставайтесь в Алисе, если задача — одна фотография, один раз, для себя или чтобы показать в переписке. Платить за это незачем.

Имеет смысл идти дальше, когда появляется что-то из этого:

  • Нужен звук в файле — ролик пойдёт в публикацию, и подкладывать музыку отдельно не хочется.
  • Человек на снимке должен что-то сказать — поздравление, реплика персонажа, короткое обращение.
  • Снимков два, и нужен переход между ними: до и после, пустая комната и обставленная, лицо и профиль.
  • Нужно разрешение выше, потому что клип пойдёт не в мессенджер, а на экран побольше.
  • Нужна серия с одним и тем же героем в нескольких кадрах — а потом собрать её в один файл.

Попробовать любое из этого можно прямо здесь — приложите снимок и опишите, что должно ожить.

Загрузка…

Что почитать дальше

Как устроен метод целиком и от чего на самом деле зависит результат — оживить фото нейросетью. Про границу бесплатного у сервисов такого рода — оживить фото бесплатно и онлайн. Про дозу движения, из-за которой клип выглядит естественным или, наоборот, «нейросетевым», — анимировать фото.

Частые вопросы

Как оживить фото с Алисой?
В приложении или на сайте Алисы приложите фотографию в формате JPEG или PNG размером до 10 МБ и опишите сюжет. Примерно через полминуты придёт MP4 длительностью до четырёх секунд в разрешении 480p, с тем же соотношением сторон, что у исходного снимка. Функция бесплатна с ограничением по числу генераций.
Есть ли у оживлённого через Алису видео звук?
Нет, по справке Яндекса видео создаётся без звука. Если ролик нужен для публикации, звук придётся подкладывать отдельным шагом. Альтернатива — движок, который сочиняет звук вместе с картинкой в том же проходе: тогда шаги, ветер и гул совпадают с тем, что происходит в кадре, потому что и то и другое сделано из одного описания сцены.
Можно ли через Алису сделать так, чтобы человек на фото говорил?
Нет, речи в этой функции нет. Говорящее фото — вообще другой маршрут обработки: портрет передаётся как референс, а не как первый кадр, реплика пишется словами в запросе, и артикуляция считается вместе с картинкой за один проход. Подробно — в главе говорящее фото.
Как оживить фото без Алисы?
Тем же способом, только с настройками: приложить снимок в чат и описать одно движение камеры, что видимо меняется и что должно остаться прежним. Разница не в качестве кнопки, а в том, что становится доступно — длина до 15 секунд, разрешение выше 480p, звук в том же файле, речь и переход между двумя вашими снимками. Попробовать можно в чате Twelver.
Четырёх секунд достаточно?
Для оживлённой фотографии — как правило, да: одно движение с началом и концом укладывается в 4–6 секунд, а дальше модель начинает сама придумывать, чем занять кадр. Длиннее нужно, когда из снимка делают не оживший кадр, а маленькую сцену — или когда в клипе должна прозвучать фраза.
Что лучше — Алиса или отдельный сервис?
Для одной фотографии один раз лучше Алиса: бесплатно, быстро и без настроек. Отдельный сервис начинает выигрывать, когда появляется требование, которого у кнопки нет, — звук в файле, речь, второй кадр, разрешение выше или серия клипов с одним героем.

В чате Twelver фотография оживает со звуком, длиной до пятнадцати секунд, а при желании — с произнесённой фразой и вашим голосом. Стартовые токены на генерацию видео начисляются после регистрации и онбординга.

Попробуйте сами

Всё из этого руководства работает в Twelver

Один чат для текста, картинок, видео, музыки и озвучки — без отдельных сервисов и подписок.

Открыть чат Twelver
Оцените свой опыт