Qwen3-TTS: озвучка текста вашим собственным голосомНейросети по названиям: какая модель что умеет и где её включить

Qwen3-TTS: озвучка текста, которая говорит вашим собственным голосом

Qwen3-TTS — движок озвучки от Alibaba, и именно он озвучивает текст по умолчанию. Причин две: он примерно вчетверо с половиной дешевле соседнего Gemini TTS за тот же объём текста, и он умеет клонировать ваш голос с десятисекундной записи — дальше все следующие озвучки читает он.

Ниже — сама модель. Вставьте текст, который нужно озвучить: ответ придёт прямо на эту страницу, регистрация для первой попытки не нужна.

Загрузка…

Что вы сейчас пробуете

Это не демо-режим: запрос уходит в тот же движок, что и в основном чате. Разница только в том, что здесь диалог заканчивается после первого ответа — продолжить можно в чате, и аудио переедет туда вместе с вами.

Свой голос: десять секунд записи — и он ваш навсегда

Клонирование здесь дешевле любой другой операции в главе и делается один раз. Дальше клонированный голос доступен во всех будущих озвучках, и это меняет характер работы: голос перестаёт быть настройкой отдельного заказа и становится вашим активом.

Что нужно от записиТребование
ДлинаОт 3 секунд, рекомендуется 10–20, максимум 60
КачествоЧистая речь без музыки и шума, от 24 кГц
ФорматWAV, MP3 или M4A, до 10 МБ
Двадцати секунд достаточно. Более длинная запись не делает голос заметно лучше, а вот шум и музыка на фоне портят результат сильно.

Клонировать в двадцать раз дешевле, чем придумывать

У движка есть и второй путь — «сконструировать» голос по описанию: «тёплый мужской баритон, неторопливый». Работает, но стоит примерно в двадцать раз дороже клонирования.

Поэтому, если у вас есть хотя бы десять секунд чистой речи нужного человека — с его согласия, — клонировать почти всегда правильнее и заметно дешевле. Конструирование оправдано, когда записи нет вовсе.

Длинный текст: до десяти минут за один запрос

Провайдер синтезирует короткими кусками, но делить текст руками не нужно: движок сам режет его и собирает обратно в один файл. Потолок — 10 000 символов, это примерно десять минут речи — статья целиком или сценарий ролика.

Считается озвучка по символам, и это её приятное свойство: цену видно до запуска, прямо по длине вашего текста. У Gemini TTS платят за секунды готового аудио, то есть узнают стоимость постфактум.

Указания вроде «читай медленнее» по-русски не сработают

У движка есть режим, где манерой чтения управляют словами. Но он работает только на английском и китайском — на русском такое указание будет проигнорировано.

На практике это значит вот что: на Qwen стиль — это выбор голоса, а не инструкция. Нужен другой тон — берите другой голос, а не просите прочитать иначе. Если управлять подачей по-русски действительно необходимо, это тот единственный случай, ради которого стоит перейти на Gemini TTS и заплатить вчетверо больше.

~4,5×Дешевле Gemini TTSЗа тот же объём текста — поэтому именно он стоит по умолчанию
10 000Символов за запросОколо десяти минут речи; делить текст руками не нужно
10 языковВключая русскийАнглийский, китайский, испанский, русский, итальянский, французский, корейский, японский, немецкий, португальский

Qwen или Gemini — короткая развилка

ЗадачаКакой движок
Обычная озвучка на русскомQwen
Длинный текст, экономияQwen
Свой клонированный голосQwen
Диалог двух собеседников в одном файлеGemini TTS
Управление подачей словами по-русскиGemini TTS
Редкий язык, которого нет в списке десятиGemini TTS

Чего Qwen3-TTS не сделает

  • Не озвучит диалог двумя голосами в одном файле. Это умеет только Gemini TTS.
  • Не примет указание о манере чтения по-русски. Только на английском и китайском.
  • Не заговорит на редком языке. Список — десять языков; всё остальное к Gemini.
  • Не сделает голос из грязной записи. Музыка и шум на фоне образца портят клон, и переделать его можно только новой записью.

Частые вопросы

Что такое Qwen3-TTS?
Qwen3-TTS — движок синтеза речи от Alibaba, который в Twelver озвучивает текст по умолчанию. Он примерно вчетверо с половиной дешевле Gemini TTS за тот же объём текста, говорит по-русски и умеет клонировать голос по короткой записи.
Как клонировать свой голос для озвучки?
Нужна чистая запись речи: от трёх секунд, лучше десять-двадцать, в WAV, MP3 или M4A до 10 МБ и с частотой от 24 кГц. Записывать дольше минуты смысла нет. После этого голос сохраняется и доступен во всех будущих озвучках — повторно платить за клонирование не нужно.
Сколько стоит клонирование голоса?
Само создание голоса стоит символически — примерно в двадцать раз дешевле, чем сконструировать голос по текстовому описанию. Если запись нужного голоса есть, клонировать почти всегда правильнее; конструирование оправдано, только когда записи нет вовсе.
Какой длины текст можно озвучить за один раз?
До 10 000 символов — это около десяти минут речи, то есть статья целиком или сценарий ролика. Делить текст вручную не нужно: движок сам режет его на куски и собирает обратно в один файл.
Можно ли попросить прочитать текст медленнее или мягче?
По-русски — нет. Управление манерой чтения словами у этого движка работает только на английском и китайском. На Qwen стиль задаётся выбором голоса, а не инструкцией: нужен другой тон — берите другой голос. Если управлять подачей по-русски принципиально, придётся перейти на Gemini TTS, который дороже примерно вчетверо.
На каких языках говорит Qwen3-TTS?
На десяти: английский, китайский, испанский, русский, итальянский, французский, корейский, японский, немецкий и португальский. Для более редкого языка нужен Gemini TTS — он покрывает несколько десятков.
Можно ли заранее узнать, сколько будет стоить озвучка?
Да, и это отличие от соседнего движка: здесь считают по символам, поэтому цену видно по длине вашего текста ещё до запуска. У Gemini TTS платят за секунды готового аудио, а значит стоимость выясняется уже после генерации.

Примеры и цены — на странице озвучки текста. Что и когда мы подключали — в записи о подключении. Другие модели — в оглавлении книги; про озвучку вообще — в книге про озвучку.

Попробуйте сами

Всё из этого руководства работает в Twelver

Один чат для текста, картинок, видео, музыки и озвучки — без отдельных сервисов и подписок.

Открыть чат Twelver
Оцените свой опыт