Wan 2.7: нейросеть для видео с липсинком под вашу запись голосаНейросети по названиям: какая модель что умеет и где её включить

Wan 2.7: нейросеть Alibaba для видео с липсинком под вашу запись голоса

Wan — модель генерации видео от Alibaba. Снимать по тексту и оживлять кадр умеют все соседние движки, и берут её обычно не за это. Wan — единственный инструмент здесь, где аудио на входе задаёт не тембр, а сами слова: вы прикладываете готовую запись, и герой в кадре произносит именно её, попадая губами в звук.

Ниже — сама модель, а не скриншоты. Опишите ролик или загрузите кадр: ответ придёт прямо на эту страницу, регистрация для первой попытки не нужна.

Загрузка…

Что вы сейчас пробуете

Это не демо-режим: запрос уходит в ту же модель, что и в основном чате. Разница только в том, что здесь диалог заканчивается после первого ответа — продолжить можно в чате, и ролик переедет туда вместе с вами. Задача считается от одной до пяти минут — это нормально, страницу закрывать не нужно.

Липсинк под готовую запись — то, чего больше нет нигде

Разница, которую легко пропустить и на которой держится вся глава. Когда другие модели принимают аудио на вход, они слышат в нём тембр: «говори похожим голосом», а что именно говорить — берут из текста запроса. Wan в режиме «кадр в видео» слышит в приложенной записи слова и подгоняет под них артикуляцию.

Практически это значит вот что: если у вас уже есть одобренная озвучка — записанная диктором, синтезированная и утверждённая, склонированная с подписанного согласия, — Wan соберёт ролик, в котором звучит именно она, а не похожая.

Но для говорящей головы это обычно не лучший выбор

Сказать это честнее, чем продать: если задача звучит как «сделай говорящего персонажа», а конкретная запись не обязательна, — берите Hailuo. Там липсинк получается заметно чище, потому что модель сочиняет речь и кадры за один проход, а не подгоняет губы под жёстко заданную дорожку. И доплаты за звук у неё нет.

Режим Wan оправдан ровно в одном случае: когда в готовом ролике должна звучать эта самая дорожка — согласованная реплика, выверенная формулировка, голос, который уже утвердили. За это платят качеством губ, и больше ни за что платить смысла нет.

Два ограничения записи, о которых узнают поздно

Дорожка обрезается по длине ролика. Ролик — максимум пятнадцать секунд, значит и озвучка попадёт в него только первыми пятнадцатью. Сорокасекундный текст не синхронизируется одним вызовом ни за какие деньги: его придётся резать на куски и собирать монтажом.

Если видео длиннее записи, остаток молчит. Не зацикливается и не заполняется — просто тишина до конца кадра. Поэтому длительность ролика имеет смысл ставить по длине дорожки, а не наоборот.

Четыре режима

РежимЧто подаётся на входКогда нужен
Видео по текстуТолько описаниеКадра нет, есть идея. Единственный режим, где пропорции задаются вручную наравне с референсным.
Кадр в видеоИзображение, опционально последний кадр и запись голосаОживить снимок — и единственное место, где работает липсинк под вашу дорожку. Пропорции берутся из кадра.
РеференсыОт 1 до 7 изображений и до 2 видеоУдержать героев и предметы. Единственный движок здесь, который принимает на вход не только картинки, но и видео как референс.
Правка видеоГотовое видео и до 4 изображенийПеренос стиля или локальная замена в кадре. Длительность выхода равна входной.
В режиме референсов на них ссылаются прямо в запросе — [Image 1], [Video 1] в порядке загрузки — и описывают словами: «женщина в красном платье с [Image 1]». Без описания модель путает, кто есть кто.
2–15 сДлительность роликаПо умолчанию 5. Нижний порог здесь самый низкий — двухсекундные вставки заказываются напрямую
7 + 2Референсов за разДо семи изображений и до двух видео — видео как референс не принимает больше никто
5 пропорцийФорматы кадра16:9, 9:16, 1:1, 4:3, 3:4 — включая квадрат, которого нет у Veo

Чем Wan отличается от HappyHorse

Это два движка одного провайдера с почти одинаковым набором режимов, и путать их легко. Разница сводится к трём пунктам.

Wan 2.7HappyHorse 1.1
Липсинк под вашу записьЕсть — единственный движок здесьНет
Референсов за разДо 7 изображений и до 2 видеоДо 9 изображений, видео не принимает
Цена за секундуНиже примерно на третьВыше, но 1080p дорожает мягче (+30% против +50%)
Подробности про второй столбец — в главе про HappyHorse.

Чего Wan не сделает

  • Не синхронизирует длинную озвучку. Потолок ролика — пятнадцать секунд, и дорожка обрезается по нему.
  • Не продолжит ролик. Режима удлинения у неё нет вовсе: правка меняет содержимое, но не добавляет времени. Продолжать и сшивать умеет Seedance.
  • Не поднимется выше 1080p. Как и все движки здесь, кроме Veo.
  • Не задаст пропорции в режимах с видео или кадром на входе. Там формат берётся из исходника, и перекадрировать можно только в монтаже.

Как не потратить лишнего

  • Считайте вход, а не только выход. Режимы с референсным видео и правкой добавляют к счёту длительность входного ролика — до пяти секунд сверх того, что вы заказали. На коротком выходе это заметная добавка, а не округление.
  • 1080p дорожает наполовину. Перебирать варианты имеет смысл в 720p, а разрешение поднимать один раз, на финальном дубле.
  • Длительность ставьте по дорожке. При липсинке лишние секунды не просто оплачиваются — они ещё и молчат.
  • Монтаж бесплатен. Обрезать, склеить, наложить звук, вытащить кадр — обычные операции с файлом, а не генерация.

Частые вопросы

Что такое Wan и чья это нейросеть?
Wan — модель генерации видео от Alibaba, доступная через DashScope. В Twelver подключена версия 2.7 в четырёх режимах: видео по тексту, оживление кадра, референсы и правка готового ролика. Отдельная регистрация у Alibaba не нужна, оплата в рублях с общего баланса.
Может ли Wan сделать так, чтобы человек в кадре произнёс мой текст?
Да, и это её главное отличие: в режиме «кадр в видео» можно приложить запись голоса, и модель синхронизирует под неё артикуляцию — звучать будет именно ваша дорожка, а не похожая. Запись принимается в WAV или MP3, от 2 до 30 секунд и до 15 МБ.
Почему тогда советуют Hailuo, а не Wan, для говорящих персонажей?
Потому что для большинства задач Hailuo делает это лучше и без доплаты за звук: она сочиняет речь и кадры за один проход, а Wan подгоняет губы под жёстко заданную внешнюю дорожку, и качество липсинка от этого ниже. Wan выигрывает только тогда, когда в ролике должна звучать конкретная уже утверждённая запись.
Можно ли синхронизировать минутную озвучку?
Одним вызовом — нет. Ролик не длиннее пятнадцати секунд, и запись обрезается по его длине; если видео окажется длиннее звука, остаток будет молчать. Длинный текст режется на куски по 10–15 секунд и собирается монтажом, который ничего не стоит.
Сколько референсов принимает Wan?
До семи изображений и дополнительно до двух видео — по референсному видео это единственный движок здесь. Ссылаться на них нужно прямо в запросе, как [Image 1] или [Video 1], в порядке загрузки, и описывать словами, иначе модель перепутает субъектов.
Умеет ли Wan редактировать готовое видео?
Да — перенос стиля и локальная замена в кадре, длительность при этом остаётся входной. Чего она не умеет, так это продолжать ролик: удлинения и склейки с придуманными связками есть только у Seedance.
Какие форматы кадра поддерживает Wan?
Пять: 16:9, 9:16, 1:1, 4:3 и 3:4 — включая квадрат, которого нет у Veo. Но задать их вручную можно только в режимах «по тексту» и «референсы»: при оживлении кадра и правке формат берётся из исходного файла.
Нужно ли выбирать Wan в чате вручную?
Нет, списка моделей в интерфейсе нет — движок подбирается под задачу автоматически. Назвать модель явно можно при обращении по API, а попробовать именно Wan — в окне выше на этой странице.

Примеры и цены — на странице генерации видео. Другие модели — в оглавлении книги; про видео вообще — в книге про генерацию видео.

Попробуйте сами

Всё из этого руководства работает в Twelver

Один чат для текста, картинок, видео, музыки и озвучки — без отдельных сервисов и подписок.

Открыть чат Twelver
Оцените свой опыт