Озвучка длинного текста: где реальные пределы

«Без ограничений» — одно из самых частых слов в этом запросе, и честный ответ на него не «конечно, без ограничений», а число. Пределы есть у всех, они разные и почти всегда не там, где их ждут: не в длине текста как таковой, а в размере одного запроса. Разберём, где именно, и что делать со статьёй на сорок тысяч символов.

600Символов за один вызов движкаВнутренний шаг. Вы его не видите — текст делится сам.
10 000Символов за один запрос≈ 15 минут речи. Это и есть реальный потолок.
Без счётаЗапросов подрядГолос сохраняется, поэтому части звучат одинаково.

Почему потолок именно такой

Полезно понимать механику, потому что она объясняет, почему число именно такое, и заодно показывает, что его не выкручивают из вредности.

  • Движок синтезирует короткими кусками — примерно по 600 символов. Это его собственное ограничение, и оно не ваша забота: текст режется и склеивается автоматически, вручную делить ничего не нужно.
  • Узкое место — не синтез, а сборка. Куски нужно склеить и нормализовать в один файл, и вот эта операция и упирается во время. На десяти тысячах символов она проходит с запасом; на двадцати — уже как повезёт, а призом за неудачу становится двадцатиминутный необработанный WAV.
  • Отсюда 10 000 как рабочий предел — это не «столько разрешили», а «столько проходит надёжно».

Что это значит на практике

Пятнадцать минут речи за один запрос — это длинная статья, полный сценарий ролика или глава книги. Подавляющее большинство задач в этот размер укладывается целиком, и делить ничего не приходится.

Посчитайте на своём тексте

Сколько это в минутах — и влезет ли целиком

Вставьте свой текст. Лимит и стоимость здесь считаются в символах, а не в словах, поэтому единственный честный ответ на вопрос «а без ограничений ли» — это число.

130 символов12 с речи

Одним запросом, без вопросов

12 с речи. Такой текст уходит целиком за один раз.

Открыть чат и озвучить

Скорость речи здесь — 11.1 символа в секунду: столько получается на нашей собственной русской озвучке. Живой темп чуть отличается от диктора к диктору, поэтому считайте это оценкой, а не секундомером.

Если текст всё-таки длиннее

Тогда его делят — и здесь важна одна деталь, которая делает деление безболезненным: голос сохраняется между запросами. Части будут звучать одинаково, а не как три разных диктора.

  1. Режьте по смыслу, а не по счётчику. Граница части — конец раздела или абзаца, а не 10 000-й символ посреди предложения.
  2. Не меняйте голос между частями. Это главное и единственное, что нужно соблюсти.
  3. Склейте файлы в один. Соединение аудио — локальная операция без отдельной цены, о ней достаточно попросить.
  4. Слушайте стыки. Единственное место, где деление слышно, — переход между частями; если пауза вышла короткой, добавьте абзацный отступ в начале следующей.

У вас статья на 25 000 символов. Что произойдёт, если вставить её целиком?

Про «бесплатно без ограничений»

Два слова в одном запросе, и они тянут в разные стороны. Безлимитной бесплатной озвучки не существует нигде: секунда синтеза — это вызов платной модели, и сервис, обещающий безлимит, прячет потолок в другом месте — водяной знак в начале файла, обрезка после первой минуты, очередь или дневной лимит.

Здесь ограничение одно и оно в балансе. Зато озвучка — одна из самых дешёвых операций: она считается по символам, и стартовых токенов за регистрацию и онбординг хватает на реальную работу с текстами. Ни водяного знака, ни обрезки, ни лимита на число обращений в день.

Одно ограничение, которого нет в цифрах

Вся эта глава про технические пределы, поэтому стоит назвать и тот, что техническим не является. Длину текста считает движок; чьим голосом он читается — решаете вы, и здесь предел один: свой голос или чужой с согласия его владельца. Запись, взятая из чужого ролика, остаётся чужим голосом на любом объёме текста — и пятнадцать минут озвучки чужим голосом ровно в столько же раз хуже, во сколько они длиннее пробной фразы.

Вставьте текст и послушайте.

Загрузка…

Что почитать дальше

Как устроена задача целиком — клонировать голос и озвучить им текст. Что делает озвучку живой, а не «роботом», — озвучить текст голосом. Если голос нужен не дикторский — голос персонажа для озвучки.

Частые вопросы

Есть ли озвучка текста без ограничений?
Безлимитной бесплатной озвучки не существует: за каждой секундой стоит вызов платной модели, и сервисы, обещающие безлимит, прячут потолок в водяном знаке, обрезке или дневном лимите. Реальный предел здесь один и он честный: 10 000 символов за один запрос, примерно пятнадцать минут речи. Число обращений при этом не ограничено, водяных знаков и обрезки нет.
Сколько символов можно озвучить за раз?
10 000 — это примерно пятнадцать минут речи, то есть длинная статья, полный сценарий ролика или глава книги. Внутри этого объёма текст делится на куски примерно по 600 символов и склеивается обратно автоматически, вручную резать ничего не нужно.
Почему предел именно 10 000 символов?
Узкое место не в синтезе, а в сборке: озвученные куски нужно склеить и нормализовать в один файл, и именно эта операция упирается во время. На десяти тысячах символов она проходит с запасом; на вдвое большем объёме — уже как повезёт, а ценой неудачи становится длинный необработанный файл. Так что это «столько проходит надёжно», а не «столько разрешили».
Как озвучить текст длиннее лимита?
Разделите его по смыслу — по разделам или абзацам, а не по счётчику символов — и озвучьте части подряд. Голос между запросами сохраняется, поэтому все части будут звучать одинаково. Затем попросите склеить файлы в один: соединение аудио — локальная операция без отдельной цены.
Будет ли слышно место склейки?
Обычно нет: голос один и тот же, тембр и темп не меняются. Единственное место, где деление может быть заметно, — пауза на стыке частей. Если она вышла слишком короткой, начните следующую часть с нового абзаца: модель дышит по знакам препинания и структуре текста.
Есть ли лимит на число озвучек в день?
Нет. Ограничение здесь одно — баланс токенов, — и оно видно заранее: стоимость каждой операции чат называет до её выполнения. Дневных лимитов, очередей и ограничений на число обращений нет.

В чате Twelver текст на пятнадцать минут речи озвучивается одним запросом, а длинный делится на части, которые звучат одним и тем же голосом. Стартовые токены начисляются после регистрации и онбординга.

Попробуйте сами

Всё из этого руководства работает в Twelver

Один чат для текста, картинок, видео, музыки и озвучки — без отдельных сервисов и подписок.

Открыть чат Twelver
Оцените свой опыт