Gemini TTS: озвучка диалога двумя голосами в одном файлеНейросети по названиям: какая модель что умеет и где её включить

Gemini TTS: озвучка диалога двумя голосами и управление подачей словами

Gemini TTS — движок синтеза речи от Google, и начнём с честного: он примерно вчетверо с половиной дороже соседнего Qwen3-TTS, который и озвучивает текст по умолчанию. Переплата оправдана в трёх случаях, и главный из них — диалог двух собеседников, записанный за один вызов: больше здесь этого не умеет никто.

Ниже — сама модель. Вставьте текст или реплики двух героев: ответ придёт прямо на эту страницу, регистрация для первой попытки не нужна.

Загрузка…

Что вы сейчас пробуете

Это не демо-режим: запрос уходит в тот же движок, что и в основном чате. Разница только в том, что здесь диалог заканчивается после первого ответа — продолжить можно в чате, и аудио переедет туда вместе с вами.

Диалог двумя голосами — то, ради чего сюда и приходят

Обычная озвучка читает текст одним голосом. Здесь можно задать реплики двух собеседников, и модель запишет их разными голосами в одном файле, с естественными переходами между репликами — не два отдельных файла, склеенных потом в монтаже.

Отсюда очевидный набор задач:

  • Подкаст с двумя ведущими
  • Интервью, вопрос-ответ
  • Сценка или диалог в обучающем ролике
  • Аудиореклама с двумя персонажами

Подача, заданная словами — и работает по-русски

Второе, чего нет у соседа: манеру чтения можно описать обычными словами — «прочитай медленнее и теплее», «бодро, как ведущий новостей», «шёпотом, с паузами». Модель это выполнит.

Именно здесь Qwen не помощник

У Qwen3-TTS похожий режим есть, но он работает только на английском и китайском: русское указание «читай мягче» там просто игнорируется, и стиль приходится задавать выбором голоса.

Так что если подачей нужно управлять по-русски — это единственная причина, ради которой стоит сознательно платить вчетверо больше. Для всего остального дешевле Qwen.

Много языков

Список языков здесь несопоставимо шире: Qwen говорит на десяти, Gemini — на нескольких десятках. Если нужен язык за пределами английского, китайского, испанского, русского, итальянского, французского, корейского, японского, немецкого и португальского, выбора всё равно нет.

Длинный текст обрежется молча — и его оплатят

Самое неприятное свойство движка. У него нет ограничения на длину текста, о которое можно было бы споткнуться: провайдер просто обрезает всё, что не помещается примерно в одиннадцать минут речи, — без ошибки и без предупреждения. Вы получаете оборванный файл и платите за него полностью.

Поэтому здесь стоит собственный предел в 7 000 символов на запрос: это заведомо внутри провайдерского потолка. Текст длиннее нужно резать на части самостоятельно и склеивать готовые файлы — склейка бесплатна.

Цена считается по секундам, а не по символам

Второе отличие от Qwen, о котором лучше знать заранее: здесь платят за произведённое аудио, а не за отправленный текст. Примерно двадцать пять единиц за секунду речи.

Практический вывод: точную стоимость видно только после генерации. Оценить её заранее можно грубо — обычная речь идёт около одиннадцати символов в секунду, то есть тысяча символов превращается примерно в полторы минуты аудио. У Qwen считают прямо по символам, и там цена известна до запуска.

2 голосаВ одном файлеДиалог с естественными переходами — больше никто здесь так не умеет
7 000Символов за запросНаш предел: провайдер молча обрежет всё сверх ~11 минут речи
~4,5×Дороже QwenЗа тот же объём текста — берите осознанно

Gemini или Qwen — короткая развилка

ЗадачаКакой движок
Диалог двух собеседниковGemini TTS
Управление подачей словами по-русскиGemini TTS
Редкий языкGemini TTS
Обычная озвучка на русскомQwen3-TTS
Длинный текст и экономияQwen3-TTS
Свой клонированный голосQwen3-TTS
Правило простое: если задача не в первых трёх строках — вы переплачиваете.

Чего Gemini TTS не сделает

  • Не клонирует ваш голос. Голос можно сконструировать по описанию, но воспроизвести конкретного человека по записи — это Qwen3-TTS.
  • Не предупредит об обрезке. Следить за длиной текста — ваша забота.
  • Не назовёт цену заранее. Счёт считается по произведённому аудио.
  • Не будет дешёвым. Для рядовой озвучки это неоправданный выбор.

Частые вопросы

Что такое Gemini TTS?
Gemini TTS — движок синтеза речи от Google. В Twelver он подключён наравне с Qwen3-TTS, но дороже примерно вчетверо с половиной, поэтому по умолчанию озвучка идёт через Qwen. Gemini берут ради диалога двумя голосами, управления подачей по-русски и редких языков.
Как озвучить диалог двух персонажей?
Задать реплики двух собеседников — модель запишет их разными голосами в одном файле с естественными переходами. Это единственный подключённый движок, который так умеет: остальные читают текст одним голосом, и диалог пришлось бы собирать в монтаже.
Можно ли попросить прочитать текст медленнее или с другой интонацией?
Да, обычными словами: «прочитай медленно и тепло», «бодро, как ведущий новостей». И работает это в том числе по-русски — у Qwen похожий режим есть только для английского и китайского. Ради этого имеет смысл переходить на Gemini осознанно.
Почему у озвучки обрезался конец текста?
Потому что провайдер молча обрезает всё, что не помещается примерно в одиннадцать минут речи, — без ошибки и без предупреждения, а оплачивается запрос полностью. Поэтому в Twelver стоит собственный предел в 7 000 символов на запрос; более длинный текст нужно резать на части и склеивать готовые файлы, склейка бесплатна.
Сколько будет стоить озвучка?
Точно — известно только после генерации: здесь платят за произведённое аудио, а не за отправленный текст. Грубая прикидка: речь идёт примерно одиннадцать символов в секунду, то есть тысяча символов даёт около полутора минут звука. Если нужна предсказуемая цена до запуска, используйте Qwen3-TTS — там считают по символам.
Можно ли клонировать голос в Gemini TTS?
Нет. Сконструировать голос по описанию можно, а воспроизвести конкретного человека по его записи — нет; для этого есть Qwen3-TTS, у которого клонирование стоит символически и делается один раз.
Какой движок озвучки выбрать?
По умолчанию Qwen3-TTS: он дешевле примерно вчетверо с половиной, говорит по-русски, тянет длинный текст и умеет клонировать голос. Gemini TTS оправдан в трёх случаях — диалог двумя голосами, управление подачей словами по-русски и язык за пределами десяти, которые знает Qwen.

Примеры и цены — на странице озвучки текста. Что и когда мы подключали — в записи о подключении. Другие модели — в оглавлении книги; про озвучку вообще — в книге про озвучку.

Попробуйте сами

Всё из этого руководства работает в Twelver

Один чат для текста, картинок, видео, музыки и озвучки — без отдельных сервисов и подписок.

Открыть чат Twelver
Оцените свой опыт