Wan 2.7: нейросеть Alibaba для видео с липсинком под вашу запись голоса
Wan — модель генерации видео от Alibaba. Снимать по тексту и оживлять кадр умеют все соседние движки, и берут её обычно не за это. Wan — единственный инструмент здесь, где аудио на входе задаёт не тембр, а сами слова: вы прикладываете готовую запись, и герой в кадре произносит именно её, попадая губами в звук.
Ниже — сама модель, а не скриншоты. Опишите ролик или загрузите кадр: ответ придёт прямо на эту страницу, регистрация для первой попытки не нужна.
Что вы сейчас пробуете
Это не демо-режим: запрос уходит в ту же модель, что и в основном чате. Разница только в том, что здесь диалог заканчивается после первого ответа — продолжить можно в чате, и ролик переедет туда вместе с вами. Задача считается от одной до пяти минут — это нормально, страницу закрывать не нужно.
Липсинк под готовую запись — то, чего больше нет нигде
Разница, которую легко пропустить и на которой держится вся глава. Когда другие модели принимают аудио на вход, они слышат в нём тембр: «говори похожим голосом», а что именно говорить — берут из текста запроса. Wan в режиме «кадр в видео» слышит в приложенной записи слова и подгоняет под них артикуляцию.
Практически это значит вот что: если у вас уже есть одобренная озвучка — записанная диктором, синтезированная и утверждённая, склонированная с подписанного согласия, — Wan соберёт ролик, в котором звучит именно она, а не похожая.
Но для говорящей головы это обычно не лучший выбор
Сказать это честнее, чем продать: если задача звучит как «сделай говорящего персонажа», а конкретная запись не обязательна, — берите Hailuo. Там липсинк получается заметно чище, потому что модель сочиняет речь и кадры за один проход, а не подгоняет губы под жёстко заданную дорожку. И доплаты за звук у неё нет.
Режим Wan оправдан ровно в одном случае: когда в готовом ролике должна звучать эта самая дорожка — согласованная реплика, выверенная формулировка, голос, который уже утвердили. За это платят качеством губ, и больше ни за что платить смысла нет.
Два ограничения записи, о которых узнают поздно
Дорожка обрезается по длине ролика. Ролик — максимум пятнадцать секунд, значит и озвучка попадёт в него только первыми пятнадцатью. Сорокасекундный текст не синхронизируется одним вызовом ни за какие деньги: его придётся резать на куски и собирать монтажом.
Если видео длиннее записи, остаток молчит. Не зацикливается и не заполняется — просто тишина до конца кадра. Поэтому длительность ролика имеет смысл ставить по длине дорожки, а не наоборот.
Четыре режима
| Режим | Что подаётся на вход | Когда нужен |
|---|---|---|
| Видео по тексту | Только описание | Кадра нет, есть идея. Единственный режим, где пропорции задаются вручную наравне с референсным. |
| Кадр в видео | Изображение, опционально последний кадр и запись голоса | Оживить снимок — и единственное место, где работает липсинк под вашу дорожку. Пропорции берутся из кадра. |
| Референсы | От 1 до 7 изображений и до 2 видео | Удержать героев и предметы. Единственный движок здесь, который принимает на вход не только картинки, но и видео как референс. |
| Правка видео | Готовое видео и до 4 изображений | Перенос стиля или локальная замена в кадре. Длительность выхода равна входной. |
Чем Wan отличается от HappyHorse
Это два движка одного провайдера с почти одинаковым набором режимов, и путать их легко. Разница сводится к трём пунктам.
| Wan 2.7 | HappyHorse 1.1 | |
|---|---|---|
| Липсинк под вашу запись | Есть — единственный движок здесь | Нет |
| Референсов за раз | До 7 изображений и до 2 видео | До 9 изображений, видео не принимает |
| Цена за секунду | Ниже примерно на треть | Выше, но 1080p дорожает мягче (+30% против +50%) |
Чего Wan не сделает
- Не синхронизирует длинную озвучку. Потолок ролика — пятнадцать секунд, и дорожка обрезается по нему.
- Не продолжит ролик. Режима удлинения у неё нет вовсе: правка меняет содержимое, но не добавляет времени. Продолжать и сшивать умеет Seedance.
- Не поднимется выше 1080p. Как и все движки здесь, кроме Veo.
- Не задаст пропорции в режимах с видео или кадром на входе. Там формат берётся из исходника, и перекадрировать можно только в монтаже.
Как не потратить лишнего
- Считайте вход, а не только выход. Режимы с референсным видео и правкой добавляют к счёту длительность входного ролика — до пяти секунд сверх того, что вы заказали. На коротком выходе это заметная добавка, а не округление.
- 1080p дорожает наполовину. Перебирать варианты имеет смысл в 720p, а разрешение поднимать один раз, на финальном дубле.
- Длительность ставьте по дорожке. При липсинке лишние секунды не просто оплачиваются — они ещё и молчат.
- Монтаж бесплатен. Обрезать, склеить, наложить звук, вытащить кадр — обычные операции с файлом, а не генерация.
Частые вопросы
Что такое Wan и чья это нейросеть?
Может ли Wan сделать так, чтобы человек в кадре произнёс мой текст?
Почему тогда советуют Hailuo, а не Wan, для говорящих персонажей?
Можно ли синхронизировать минутную озвучку?
Сколько референсов принимает Wan?
Умеет ли Wan редактировать готовое видео?
Какие форматы кадра поддерживает Wan?
Нужно ли выбирать Wan в чате вручную?
Примеры и цены — на странице генерации видео. Другие модели — в оглавлении книги; про видео вообще — в книге про генерацию видео.
Попробуйте сами
Всё из этого руководства работает в Twelver
Один чат для текста, картинок, видео, музыки и озвучки — без отдельных сервисов и подписок.
Открыть чат Twelver