Qwen3-TTS: озвучка текста, которая говорит вашим собственным голосом
Qwen3-TTS — движок озвучки от Alibaba, и именно он озвучивает текст по умолчанию. Причин две: он примерно вчетверо с половиной дешевле соседнего Gemini TTS за тот же объём текста, и он умеет клонировать ваш голос с десятисекундной записи — дальше все следующие озвучки читает он.
Ниже — сама модель. Вставьте текст, который нужно озвучить: ответ придёт прямо на эту страницу, регистрация для первой попытки не нужна.
Что вы сейчас пробуете
Это не демо-режим: запрос уходит в тот же движок, что и в основном чате. Разница только в том, что здесь диалог заканчивается после первого ответа — продолжить можно в чате, и аудио переедет туда вместе с вами.
Свой голос: десять секунд записи — и он ваш навсегда
Клонирование здесь дешевле любой другой операции в главе и делается один раз. Дальше клонированный голос доступен во всех будущих озвучках, и это меняет характер работы: голос перестаёт быть настройкой отдельного заказа и становится вашим активом.
| Что нужно от записи | Требование |
|---|---|
| Длина | От 3 секунд, рекомендуется 10–20, максимум 60 |
| Качество | Чистая речь без музыки и шума, от 24 кГц |
| Формат | WAV, MP3 или M4A, до 10 МБ |
Клонировать в двадцать раз дешевле, чем придумывать
У движка есть и второй путь — «сконструировать» голос по описанию: «тёплый мужской баритон, неторопливый». Работает, но стоит примерно в двадцать раз дороже клонирования.
Поэтому, если у вас есть хотя бы десять секунд чистой речи нужного человека — с его согласия, — клонировать почти всегда правильнее и заметно дешевле. Конструирование оправдано, когда записи нет вовсе.
Длинный текст: до десяти минут за один запрос
Провайдер синтезирует короткими кусками, но делить текст руками не нужно: движок сам режет его и собирает обратно в один файл. Потолок — 10 000 символов, это примерно десять минут речи — статья целиком или сценарий ролика.
Считается озвучка по символам, и это её приятное свойство: цену видно до запуска, прямо по длине вашего текста. У Gemini TTS платят за секунды готового аудио, то есть узнают стоимость постфактум.
Указания вроде «читай медленнее» по-русски не сработают
У движка есть режим, где манерой чтения управляют словами. Но он работает только на английском и китайском — на русском такое указание будет проигнорировано.
На практике это значит вот что: на Qwen стиль — это выбор голоса, а не инструкция. Нужен другой тон — берите другой голос, а не просите прочитать иначе. Если управлять подачей по-русски действительно необходимо, это тот единственный случай, ради которого стоит перейти на Gemini TTS и заплатить вчетверо больше.
Qwen или Gemini — короткая развилка
| Задача | Какой движок |
|---|---|
| Обычная озвучка на русском | Qwen |
| Длинный текст, экономия | Qwen |
| Свой клонированный голос | Qwen |
| Диалог двух собеседников в одном файле | Gemini TTS |
| Управление подачей словами по-русски | Gemini TTS |
| Редкий язык, которого нет в списке десяти | Gemini TTS |
Чего Qwen3-TTS не сделает
- Не озвучит диалог двумя голосами в одном файле. Это умеет только Gemini TTS.
- Не примет указание о манере чтения по-русски. Только на английском и китайском.
- Не заговорит на редком языке. Список — десять языков; всё остальное к Gemini.
- Не сделает голос из грязной записи. Музыка и шум на фоне образца портят клон, и переделать его можно только новой записью.
Частые вопросы
Что такое Qwen3-TTS?
Как клонировать свой голос для озвучки?
Сколько стоит клонирование голоса?
Какой длины текст можно озвучить за один раз?
Можно ли попросить прочитать текст медленнее или мягче?
На каких языках говорит Qwen3-TTS?
Можно ли заранее узнать, сколько будет стоить озвучка?
Примеры и цены — на странице озвучки текста. Что и когда мы подключали — в записи о подключении. Другие модели — в оглавлении книги; про озвучку вообще — в книге про озвучку.
Попробуйте сами
Всё из этого руководства работает в Twelver
Один чат для текста, картинок, видео, музыки и озвучки — без отдельных сервисов и подписок.
Открыть чат Twelver