Hailuo (MiniMax H3): видео со звуком и говорящими персонажами
Hailuo — модель генерации видео компании MiniMax, и в Twelver она стоит движком по умолчанию: просьба «сними ролик» без уточнений уходит именно сюда. Выбирают её за две вещи, которых нет у соседей по книге: звук она сочиняет вместе с картинкой и не берёт за него отдельно, а по фотографии и голосовой записи умеет собрать говорящего человека — с попаданием губ в речь.
Ниже — сама модель, а не скриншоты. Опишите сцену или загрузите кадр: ответ придёт прямо на эту страницу, регистрация для первой попытки не нужна.
Что вы сейчас пробуете
Это не демо-режим: запрос уходит в ту же модель, что и в основном чате. Разница только в том, что здесь диалог заканчивается после первого ответа — продолжить можно в чате, и ролик переедет туда вместе с вами. Генерация видео занимает заметно больше времени, чем ответ текстом, — это нормально, страницу закрывать не нужно.
Звук — часть ролика, а не отдельная операция
H3 генерирует звуковую дорожку одновременно с изображением: речь, шумы обстановки, эффекты. Это не музыка, подложенная сверху, — звук сочиняется под то, что происходит в кадре, поэтому дверь хлопает тогда, когда она закрывается.
Управляется он прозой в том же описании: напишите, что должно быть слышно, — «шум дождя по крыше», «гул толпы вдалеке», «тишина, только шаги». Отдельного переключателя нет.
Здесь звук не стоит ничего сверху
Это важное отличие от соседей. У Seedance включение звука удваивает цену ролика и решается до генерации, а у Grok Imagine звуковой дорожки нет вовсе. У Hailuo звук входит в ту же посекундную ставку — отключить его, чтобы сэкономить, нельзя, потому что экономить не на чем.
Говорящий персонаж: фотография плюс голос
Единственный движок здесь, который делает произнесённую реплику с движением губ. Собирается она из двух файлов в режиме референсов:
- Референсное изображение — тот, кто говорит. Одного достаточно.
- Референсное аудио — образец голоса, от 2 до 15 секунд. Модель берёт из него тембр.
- Реплику впишите в описание в кавычках и укажите, что голос следует референсному аудио. Так написан и собственный пример MiniMax; формулировка работает одинаково независимо от того, откуда модель возьмёт слова.
Референсы и «первый кадр» не смешиваются
Роли референсов и роли первого/последнего кадра — разные режимы, и запрос, где есть и то и другое, провайдер отклоняет. Практический вывод: говорящий персонаж всегда собирается через референсы, а не через «оживить это изображение». Если вы загрузили фотографию и просите заставить её говорить — это режим референсов, и фотография в нём работает как описание героя, а не как первый кадр.
Один и тот же герой в нескольких роликах
Генерация по одному лишь тексту сочиняет человека заново при каждом вызове — два клипа «про того же мужчину» дадут двух разных людей, и это верно для любой модели в этой книге. Режим референсов — рабочий способ обойти это: приложите изображение героя (или предмета, или логотипа) и сошлитесь на него в описании — «женщина с референсного изображения 1», — и он останется собой от клипа к клипу.
Ссылаться нужно именно по порядку загрузки: модель различает референсы по номеру, а не по содержимому. За раз принимаются до девяти изображений, трёх видео и трёх аудио.
Все пять режимов
| Режим | Что подаётся на вход | Когда нужен |
|---|---|---|
| Видео по тексту | Только описание | Кадра нет, есть идея. Единственный режим, где соотношение сторон задаётся вручную — и обязательно. |
| Кадр в видео | Одно изображение | Оживить снимок. Кадр можно сделать как первым, так и последним — во втором случае модель придумает, что было до него. |
| Между двумя кадрами | Первый и последний кадр | Задан старт и финал, нужен переход между ними: превращение, сборка, смена состояния. |
| По референсам | До 9 изображений, 3 видео, 3 аудио | Тот же герой в разных роликах, свой стиль, свой голос. Говорящий персонаж — тоже сюда. |
| Перерендер в 2K | Свой же 768P-ролик | Понравившийся черновик поднять в качестве, не генерируя заново. |
2K: поднимать качество, а не переснимать
Перерендер готового 768P-ролика в 2K стоит за секунду заметно дешевле, чем генерация в 2K с нуля. Арифметика при этом честная и стоит того, чтобы её знать: черновик в 768P плюс перерендер выходят примерно в ту же сумму, что и сразу 2K, — экономии на одном-единственном удачном ролике нет.
Выигрыш появляется на втором дубле и дальше, а дубли будут почти всегда. Перебирать варианты в 768P и поднять разрешение один раз — на том, что уже нравится, — дешевле, чем платить полную 2K-ставку за каждую попытку.
Перерендер требует точного совпадения
Модель не «увеличивает» файл, а генерирует его заново в большем разрешении, поэтому ей нужны то же описание и те же входные материалы, что были у исходной 768P-генерации. Любое расхождение — и получится другое видео за те же деньги. Проще всего попросить перерендер сразу после того, как ролик понравился, не переписывая бриф.
Чего Hailuo не сделает
Полезнее знать заранее, поэтому честно и без смягчений.
- Не трогает чужое видео. Поменять деталь в уже снятом ролике или продолжить его она не умеет — ни одним из пяти режимов. Референсное видео задаёт стиль и движение нового клипа, но исходник при этом не редактируется. Правка и удлинение готового ролика — это Seedance, и включены обе модели обычно вместе.
- Не понимает команды камеры в квадратных скобках.
[Pan right],[Zoom in]и прочие метки из гайдов по Hailuo — это синтаксис снятых с поддержки моделей Director. В H3 они не делают ничего, а попадая в описание, ещё и сбивают его. Движение камеры пишется прозой: «камера медленно отъезжает». - Не снимает длинных сцен. Пятнадцать секунд — потолок одного ролика, и удлинения у этой модели нет. Всё, что длиннее, собирается склейкой, а склейка бесплатна.
- Не переставляет соотношение сторон у готового материала. Оно берётся из входного изображения; параметр действует только в режиме «по тексту». Нужен вертикальный ролик из горизонтального кадра — сначала кадрируйте изображение, это тоже бесплатная операция.
Портрет крупным планом — сюда
Если Seedance отказалась оживлять фотографию с крупным узнаваемым лицом, это не общий запрет, а её собственный фильтр. Hailuo такие кадры берёт: за 45 дней измерений у неё не было ни одного отказа по содержанию, тогда как у Seedance их набралось полсотни. Проверка качества здесь происходит после генерации, а не на подаче, — но несостоявшаяся генерация не оплачивается, так что цена ошибки та же.
Как не потратить лишнего
Видео — самая дорогая операция в чате, и считается она по секундам, без округлений в вашу пользу: пятнадцатисекундный ролик стоит почти вчетверо дороже четырёхсекундного. Отсюда порядок действий:
- Черновики — короткими, в 768P. Ракурс, движение и настроение видно уже на пяти секундах. Длину и 2K добавляйте по одному и в конце.
- Референсные видео держите короткими. Они тарифицируются по своей собственной длительности, по ставке выходного разрешения, — то есть десятисекундный референс стоит как десять секунд готового ролика, сверх самого ролика.
- Изображений в одном запросе — до пяти. Шестое и дальше считаются отдельно. На практике больше пяти референсов и не нужны: модель начинает путаться в номерах раньше, чем упирается в лимит.
- Монтаж ничего не стоит. Обрезать, склеить, поменять размер, наложить готовую музыку или озвучку — обычные операции с файлом, а не генерация.
Частые вопросы
Что такое Hailuo и чья это нейросеть?
Есть ли у Hailuo звук?
Как сделать, чтобы персонаж говорил?
Какой длины ролик получится?
Можно ли отредактировать уже снятое видео через Hailuo?
Стоит ли сразу генерировать в 2K?
Почему не работают команды вроде [Pan right]?
Нужно ли выбирать Hailuo в чате вручную?
Примеры и цены — на странице генерации видео. Что и когда мы подключали — в записи о подключении Hailuo. Другие модели — в оглавлении книги; про видео вообще — в книге про генерацию видео.
Попробуйте сами
Всё из этого руководства работает в Twelver
Один чат для текста, картинок, видео, музыки и озвучки — без отдельных сервисов и подписок.
Открыть чат Twelver