Gemini 3.8 Flash TTS в Twelver: диалог двумя голосами и подача, заданная словами
Аудио

Gemini 3.8 Flash TTS в Twelver: диалог двумя голосами и подача, заданная словами

Мы перевели озвучку Google на Gemini 3.8 Flash TTS. Инструменты те же — один голос, диалог двумя голосами, голос по описанию. Указания о подаче теперь идут отдельно от текста, поэтому модель им следует, но никогда не зачитывает их вслух.

Что нового

  • Диалог двух собеседников — разными голосами, в одном файле, за один вызов.
  • Подачу можно описать по-русски: «медленно, тепло, к концу почти шёпотом».
  • Смех, вздох и паузу ставят тегами <laugh>, <sigh>, <short pause> прямо в тексте — они звучат, а не читаются словами.
  • Несколько десятков языков — и турецкий, и арабский, и хинди, которых нет у Qwen.
  • Секунда готовой речи — примерно на 10% дешевле прежней версии.

Кратко о модели

ПараметрЗначение
МодельGemini 3.8 Flash TTS (Google)
ЗаменилаGemini 3.1 Flash TTS (предварительная версия)
РежимыОдин голос · диалог двумя голосами · голос по описанию
ЯзыкиНесколько десятков, включая русский
Текст за запросДо 7 000 символов
ОплатаЗа секунды готового аудио
Где в TwelverЧат · MCP-сервер
Цены в рублях — на странице озвучки текста.

Диалог двумя голосами

Одна просьба — и два ведущих подкаста разговаривают друг с другом, с естественными паузами между репликами. Это не два файла, склеенных в монтаже.

Анна спрашивает, почему большие города стоят на реках, Пётр объясняет. Смешок в третьей реплике — тег <laugh> в тексте. 30 секунд.

Подача, заданная словами — по-русски

Указание: «мама читает сказку на ночь; медленно, тепло, с паузами, к концу всё тише, почти шёпотом». Сам текст — без пометок. 21 секунда.

Язык, которого нет у Qwen

Рекламная реплика кофейни по-турецки. 8 секунд.

Когда брать Gemini, а когда хватит более дешёвого Qwen3-TTS, — в главе про Gemini TTS.

Частые вопросы

Что нового в Gemini 3.8 Flash TTS?
Это стабильная версия вместо предварительной. Указания о подаче теперь передаются отдельно от текста, поэтому модель им следует и не зачитывает их вслух, а секунда речи стала примерно на 10% дешевле. Возможности прежние: один голос, диалог двумя голосами и голос по описанию.
Как озвучить диалог двух персонажей?
Напишите реплики двух собеседников по ролям — модель запишет их разными голосами в одном файле. Попробовать можно в главе про Gemini TTS, там окно с самой моделью.
Gemini TTS или Qwen3-TTS?
Для обычной начитки Qwen3-TTS примерно вчетверо дешевле и умеет клонировать ваш голос. Gemini берите для диалога двумя голосами, для подачи, заданной словами по-русски, и для языков за пределами десяти, которые знает Qwen.
Можно ли вызывать Gemini 3.8 Flash TTS из Claude или Cursor?
Да, через MCP: озвучка доступна по протоколу MCP в Claude, Cursor и других клиентах — см. страницу MCP.

Попробовать

Открыть в чате Twelver
Оцените свой опыт