Hailuo (MiniMax H3): видео со звуком и говорящими персонажамиНейросети по названиям: какая модель что умеет и где её включить

Hailuo (MiniMax H3): видео со звуком и говорящими персонажами

Hailuo — модель генерации видео компании MiniMax, и в Twelver она стоит движком по умолчанию: просьба «сними ролик» без уточнений уходит именно сюда. Выбирают её за две вещи, которых нет у соседей по книге: звук она сочиняет вместе с картинкой и не берёт за него отдельно, а по фотографии и голосовой записи умеет собрать говорящего человека — с попаданием губ в речь.

Ниже — сама модель, а не скриншоты. Опишите сцену или загрузите кадр: ответ придёт прямо на эту страницу, регистрация для первой попытки не нужна.

Загрузка…

Что вы сейчас пробуете

Это не демо-режим: запрос уходит в ту же модель, что и в основном чате. Разница только в том, что здесь диалог заканчивается после первого ответа — продолжить можно в чате, и ролик переедет туда вместе с вами. Генерация видео занимает заметно больше времени, чем ответ текстом, — это нормально, страницу закрывать не нужно.

Звук — часть ролика, а не отдельная операция

H3 генерирует звуковую дорожку одновременно с изображением: речь, шумы обстановки, эффекты. Это не музыка, подложенная сверху, — звук сочиняется под то, что происходит в кадре, поэтому дверь хлопает тогда, когда она закрывается.

Управляется он прозой в том же описании: напишите, что должно быть слышно, — «шум дождя по крыше», «гул толпы вдалеке», «тишина, только шаги». Отдельного переключателя нет.

Здесь звук не стоит ничего сверху

Это важное отличие от соседей. У Seedance включение звука удваивает цену ролика и решается до генерации, а у Grok Imagine звуковой дорожки нет вовсе. У Hailuo звук входит в ту же посекундную ставку — отключить его, чтобы сэкономить, нельзя, потому что экономить не на чем.

Говорящий персонаж: фотография плюс голос

Единственный движок здесь, который делает произнесённую реплику с движением губ. Собирается она из двух файлов в режиме референсов:

  • Референсное изображение — тот, кто говорит. Одного достаточно.
  • Референсное аудио — образец голоса, от 2 до 15 секунд. Модель берёт из него тембр.
  • Реплику впишите в описание в кавычках и укажите, что голос следует референсному аудио. Так написан и собственный пример MiniMax; формулировка работает одинаково независимо от того, откуда модель возьмёт слова.

Референсы и «первый кадр» не смешиваются

Роли референсов и роли первого/последнего кадра — разные режимы, и запрос, где есть и то и другое, провайдер отклоняет. Практический вывод: говорящий персонаж всегда собирается через референсы, а не через «оживить это изображение». Если вы загрузили фотографию и просите заставить её говорить — это режим референсов, и фотография в нём работает как описание героя, а не как первый кадр.

Один и тот же герой в нескольких роликах

Генерация по одному лишь тексту сочиняет человека заново при каждом вызове — два клипа «про того же мужчину» дадут двух разных людей, и это верно для любой модели в этой книге. Режим референсов — рабочий способ обойти это: приложите изображение героя (или предмета, или логотипа) и сошлитесь на него в описании — «женщина с референсного изображения 1», — и он останется собой от клипа к клипу.

Ссылаться нужно именно по порядку загрузки: модель различает референсы по номеру, а не по содержимому. За раз принимаются до девяти изображений, трёх видео и трёх аудио.

Все пять режимов

РежимЧто подаётся на входКогда нужен
Видео по текстуТолько описаниеКадра нет, есть идея. Единственный режим, где соотношение сторон задаётся вручную — и обязательно.
Кадр в видеоОдно изображениеОживить снимок. Кадр можно сделать как первым, так и последним — во втором случае модель придумает, что было до него.
Между двумя кадрамиПервый и последний кадрЗадан старт и финал, нужен переход между ними: превращение, сборка, смена состояния.
По референсамДо 9 изображений, 3 видео, 3 аудиоТот же герой в разных роликах, свой стиль, свой голос. Говорящий персонаж — тоже сюда.
Перерендер в 2KСвой же 768P-роликПонравившийся черновик поднять в качестве, не генерируя заново.
В режимах с изображением или референсами пропорции берутся из исходника — кадр не растягивается.
4–15 сДлительность роликаЦелые секунды, по умолчанию 5. Тарификация строго посекундная
768P / 2KРазрешение2K дороже примерно в 1,6 раза за секунду
9 + 3 + 3Референсов за разИзображения, видео и аудио; видео и аудио — по 2–15 с, суммарно 15 с

2K: поднимать качество, а не переснимать

Перерендер готового 768P-ролика в 2K стоит за секунду заметно дешевле, чем генерация в 2K с нуля. Арифметика при этом честная и стоит того, чтобы её знать: черновик в 768P плюс перерендер выходят примерно в ту же сумму, что и сразу 2K, — экономии на одном-единственном удачном ролике нет.

Выигрыш появляется на втором дубле и дальше, а дубли будут почти всегда. Перебирать варианты в 768P и поднять разрешение один раз — на том, что уже нравится, — дешевле, чем платить полную 2K-ставку за каждую попытку.

Перерендер требует точного совпадения

Модель не «увеличивает» файл, а генерирует его заново в большем разрешении, поэтому ей нужны то же описание и те же входные материалы, что были у исходной 768P-генерации. Любое расхождение — и получится другое видео за те же деньги. Проще всего попросить перерендер сразу после того, как ролик понравился, не переписывая бриф.

Чего Hailuo не сделает

Полезнее знать заранее, поэтому честно и без смягчений.

  • Не трогает чужое видео. Поменять деталь в уже снятом ролике или продолжить его она не умеет — ни одним из пяти режимов. Референсное видео задаёт стиль и движение нового клипа, но исходник при этом не редактируется. Правка и удлинение готового ролика — это Seedance, и включены обе модели обычно вместе.
  • Не понимает команды камеры в квадратных скобках. [Pan right], [Zoom in] и прочие метки из гайдов по Hailuo — это синтаксис снятых с поддержки моделей Director. В H3 они не делают ничего, а попадая в описание, ещё и сбивают его. Движение камеры пишется прозой: «камера медленно отъезжает».
  • Не снимает длинных сцен. Пятнадцать секунд — потолок одного ролика, и удлинения у этой модели нет. Всё, что длиннее, собирается склейкой, а склейка бесплатна.
  • Не переставляет соотношение сторон у готового материала. Оно берётся из входного изображения; параметр действует только в режиме «по тексту». Нужен вертикальный ролик из горизонтального кадра — сначала кадрируйте изображение, это тоже бесплатная операция.

Портрет крупным планом — сюда

Если Seedance отказалась оживлять фотографию с крупным узнаваемым лицом, это не общий запрет, а её собственный фильтр. Hailuo такие кадры берёт: за 45 дней измерений у неё не было ни одного отказа по содержанию, тогда как у Seedance их набралось полсотни. Проверка качества здесь происходит после генерации, а не на подаче, — но несостоявшаяся генерация не оплачивается, так что цена ошибки та же.

Как не потратить лишнего

Видео — самая дорогая операция в чате, и считается она по секундам, без округлений в вашу пользу: пятнадцатисекундный ролик стоит почти вчетверо дороже четырёхсекундного. Отсюда порядок действий:

  • Черновики — короткими, в 768P. Ракурс, движение и настроение видно уже на пяти секундах. Длину и 2K добавляйте по одному и в конце.
  • Референсные видео держите короткими. Они тарифицируются по своей собственной длительности, по ставке выходного разрешения, — то есть десятисекундный референс стоит как десять секунд готового ролика, сверх самого ролика.
  • Изображений в одном запросе — до пяти. Шестое и дальше считаются отдельно. На практике больше пяти референсов и не нужны: модель начинает путаться в номерах раньше, чем упирается в лимит.
  • Монтаж ничего не стоит. Обрезать, склеить, поменять размер, наложить готовую музыку или озвучку — обычные операции с файлом, а не генерация.

Частые вопросы

Что такое Hailuo и чья это нейросеть?
Hailuo — модель генерации видео компании MiniMax. В Twelver подключено поколение H3, пришедшее на смену линейкам Hailuo 2.3, 02, Director и S2V. Отдельная регистрация у MiniMax не нужна, оплата в рублях с общего баланса.
Есть ли у Hailuo звук?
Да, и он не оплачивается отдельно: речь, шумы и эффекты генерируются вместе с картинкой и входят в ту же посекундную ставку. Опишите нужный звук словами в том же запросе — отдельного шага и отдельного переключателя нет.
Как сделать, чтобы персонаж говорил?
Нужны два файла: изображение говорящего и запись голоса длиной от 2 до 15 секунд. Реплику впишите в описание в кавычках и укажите, что голос следует референсному аудио. Модель синхронизирует движение губ с речью. Важно: это режим референсов, и смешивать его с «первым кадром» нельзя — запрос с обоими провайдер отклонит.
Какой длины ролик получится?
От 4 до 15 секунд целыми секундами, по умолчанию 5. Удлинения готового ролика у этой модели нет — более длинное видео собирается склейкой, которая бесплатна.
Можно ли отредактировать уже снятое видео через Hailuo?
Нет. Hailuo всегда генерирует новый ролик; референсное видео задаёт ему стиль и движение, но исходник не правит. Изменить деталь в готовом ролике или продолжить его умеет Seedance — про неё есть отдельная глава.
Стоит ли сразу генерировать в 2K?
Обычно нет. Перерендер понравившегося 768P-ролика в 2K стоит за секунду дешевле, чем генерация в 2K с нуля, поэтому выгоднее перебрать дубли в 768P и поднять качество один раз. Перерендеру нужны то же описание и те же входные файлы, что были у исходной генерации.
Почему не работают команды вроде [Pan right]?
Это синтаксис моделей Director, снятых с поддержки. H3 их не распознаёт: в лучшем случае они игнорируются, в худшем — засоряют описание. Движение камеры описывайте обычными словами.
Нужно ли выбирать Hailuo в чате вручную?
Нет, списка моделей в интерфейсе нет — движок подбирается под задачу автоматически, и для видео по умолчанию берётся как раз Hailuo. Назвать модель явно можно при обращении по API, а попробовать именно её — в окне выше на этой странице.

Примеры и цены — на странице генерации видео. Что и когда мы подключали — в записи о подключении Hailuo. Другие модели — в оглавлении книги; про видео вообще — в книге про генерацию видео.

Попробуйте сами

Всё из этого руководства работает в Twelver

Один чат для текста, картинок, видео, музыки и озвучки — без отдельных сервисов и подписок.

Открыть чат Twelver
Оцените свой опыт