Gemini TTS: озвучка диалога двумя голосами и управление подачей словами
Gemini TTS — движок синтеза речи от Google, и начнём с честного: он примерно вчетверо с половиной дороже соседнего Qwen3-TTS, который и озвучивает текст по умолчанию. Переплата оправдана в трёх случаях, и главный из них — диалог двух собеседников, записанный за один вызов: больше здесь этого не умеет никто.
Ниже — сама модель. Вставьте текст или реплики двух героев: ответ придёт прямо на эту страницу, регистрация для первой попытки не нужна.
Что вы сейчас пробуете
Это не демо-режим: запрос уходит в тот же движок, что и в основном чате. Разница только в том, что здесь диалог заканчивается после первого ответа — продолжить можно в чате, и аудио переедет туда вместе с вами.
Диалог двумя голосами — то, ради чего сюда и приходят
Обычная озвучка читает текст одним голосом. Здесь можно задать реплики двух собеседников, и модель запишет их разными голосами в одном файле, с естественными переходами между репликами — не два отдельных файла, склеенных потом в монтаже.
Отсюда очевидный набор задач:
- Подкаст с двумя ведущими
- Интервью, вопрос-ответ
- Сценка или диалог в обучающем ролике
- Аудиореклама с двумя персонажами
Подача, заданная словами — и работает по-русски
Второе, чего нет у соседа: манеру чтения можно описать обычными словами — «прочитай медленнее и теплее», «бодро, как ведущий новостей», «шёпотом, с паузами». Модель это выполнит.
Именно здесь Qwen не помощник
У Qwen3-TTS похожий режим есть, но он работает только на английском и китайском: русское указание «читай мягче» там просто игнорируется, и стиль приходится задавать выбором голоса.
Так что если подачей нужно управлять по-русски — это единственная причина, ради которой стоит сознательно платить вчетверо больше. Для всего остального дешевле Qwen.
Много языков
Список языков здесь несопоставимо шире: Qwen говорит на десяти, Gemini — на нескольких десятках. Если нужен язык за пределами английского, китайского, испанского, русского, итальянского, французского, корейского, японского, немецкого и португальского, выбора всё равно нет.
Длинный текст обрежется молча — и его оплатят
Самое неприятное свойство движка. У него нет ограничения на длину текста, о которое можно было бы споткнуться: провайдер просто обрезает всё, что не помещается примерно в одиннадцать минут речи, — без ошибки и без предупреждения. Вы получаете оборванный файл и платите за него полностью.
Поэтому здесь стоит собственный предел в 7 000 символов на запрос: это заведомо внутри провайдерского потолка. Текст длиннее нужно резать на части самостоятельно и склеивать готовые файлы — склейка бесплатна.
Цена считается по секундам, а не по символам
Второе отличие от Qwen, о котором лучше знать заранее: здесь платят за произведённое аудио, а не за отправленный текст. Примерно двадцать пять единиц за секунду речи.
Практический вывод: точную стоимость видно только после генерации. Оценить её заранее можно грубо — обычная речь идёт около одиннадцати символов в секунду, то есть тысяча символов превращается примерно в полторы минуты аудио. У Qwen считают прямо по символам, и там цена известна до запуска.
Gemini или Qwen — короткая развилка
| Задача | Какой движок |
|---|---|
| Диалог двух собеседников | Gemini TTS |
| Управление подачей словами по-русски | Gemini TTS |
| Редкий язык | Gemini TTS |
| Обычная озвучка на русском | Qwen3-TTS |
| Длинный текст и экономия | Qwen3-TTS |
| Свой клонированный голос | Qwen3-TTS |
Чего Gemini TTS не сделает
- Не клонирует ваш голос. Голос можно сконструировать по описанию, но воспроизвести конкретного человека по записи — это Qwen3-TTS.
- Не предупредит об обрезке. Следить за длиной текста — ваша забота.
- Не назовёт цену заранее. Счёт считается по произведённому аудио.
- Не будет дешёвым. Для рядовой озвучки это неоправданный выбор.
Частые вопросы
Что такое Gemini TTS?
Как озвучить диалог двух персонажей?
Можно ли попросить прочитать текст медленнее или с другой интонацией?
Почему у озвучки обрезался конец текста?
Сколько будет стоить озвучка?
Можно ли клонировать голос в Gemini TTS?
Какой движок озвучки выбрать?
Примеры и цены — на странице озвучки текста. Что и когда мы подключали — в записи о подключении. Другие модели — в оглавлении книги; про озвучку вообще — в книге про озвучку.
Попробуйте сами
Всё из этого руководства работает в Twelver
Один чат для текста, картинок, видео, музыки и озвучки — без отдельных сервисов и подписок.
Открыть чат Twelver