Как озвучить текст разными голосами: диалог и озвучка по ролямСинтез речи и голос ИИ: полное руководство

Как озвучить текст разными голосами: диалог и озвучка по ролям

Чтобы озвучить текст разными голосами, разметьте его по ролям, опишите словами голос каждого персонажа и попросите нейросеть прочитать диалог. В чате Twelver два голоса звучат в одном файле за один запрос, а сцены с тремя и больше героями собираются из частей в один MP3. Ниже — как разметить текст, как описать голос и где предел.

2голоса в одном запросеДиалог звучит одним файлом, реплики не надо склеивать вручную
7 000знаков за разОколо 10 минут речи. Длинный текст озвучивается частями
3+персонажа — тоже можноСцены озвучиваются по очереди и склеиваются в один MP3

Можно ли озвучить текст несколькими голосами?

Да. Нейросеть для синтеза речи умеет читать диалог двумя разными голосами в одной записи: вы даёте текст с именами говорящих, она сама меняет голос на каждой реплике и держит паузы между ними. Для третьего и следующих персонажей сцена делится на части, каждая озвучивается отдельно, и части склеиваются в один файл. Голоса не выбираются из каталога — их описывают словами.

Как озвучить диалог двумя голосами: 4 шага

  1. Разметьте текст по ролям. Каждая реплика — с новой строки, в начале имя говорящего и двоеточие: «Лиса: …», «Колобок: …». Авторский текст — отдельной ролью «Рассказчик».
  2. Опишите голос каждой роли. Одна фраза про возраст, тембр и манеру: «хитрая лиса — женский голос, вкрадчивый, чуть насмешливый».
  3. Задайте интонацию там, где она важна. Шёпот, крик или волнение опишите словами в описании голоса: «лиса говорит шёпотом, заговорщицки». Смех, вздох и паузу ставьте тегами прямо в реплике — они звучат, а не читаются вслух: <laugh> — смешок, <sigh> — вздох, <short pause> — пауза.
  4. Отправьте всё одним сообщением. Послушайте, и если голос не тот — поправьте описание словами: «пусть лиса звучит старше».

Пример разметки

Рассказчик: Жили-были старик со старухой.
Старик: <sigh> Испеки-ка мне, старуха, колобок.
Старуха: Из чего же испечь? Муки-то нет.

Голоса: Рассказчик — спокойный мужской голос сказочника, низкий и тёплый. Старик — пожилой, хрипловатый. Старуха — пожилая, ворчливая.

Здесь три роли, поэтому запись соберётся из двух частей: диалог стариков одним запросом и слова рассказчика отдельно.

Попробуйте на своём тексте

Окно ниже — настоящий чат с озвучкой. Вставьте диалог с именами и опишите голоса — или начните с готового примера.

Загрузка…

Как описать голос персонажа

В диалоговом режиме голос собирается по описанию: нейросеть подбирает основу из готовых голосов и настраивает подачу под ваши слова. Чем точнее описание, тем ближе результат. Хватает четырёх признаков: пол и возраст, высота и тембр, темп, характер.

ПерсонажКак описать голос
Сказочник, рассказчик«Мужской, зрелый, низкий и тёплый, говорит неторопливо, с улыбкой»
Злодей«Мужской, низкий, медленный, с холодной вежливостью и паузами»
Ребёнок, зверёк«Высокий, звонкий, быстрый, с восторгом в голосе»
Робот, ИИ«Ровный, без эмоций, чёткая дикция, короткие паузы между фразами»
Бабушка«Женский, пожилой, мягкий, немного дребезжащий, говорит нараспев»
Ведущий подкаста«Женский, 30 лет, энергичный, разговорный, без дикторского пафоса»
Описание можно писать по-русски. Созданный голос сохраняется, и в следующей части сказки или новой серии звучит тот же голос, а не похожий.

Голос героя мультфильма или игры

«Озвучить текст голосом персонажа» чаще всего значит голосом героя мультфильма или игры. Скопировать голос реального актёра, блогера или знаменитости нейросеть не возьмётся — это чужой голос. Зато она сделает оригинальный голос в том же духе: опишите, чем персонаж звучит («хриплый, медленный, с южным говором»), и получите похожий характер без подделки.

Если описание не даёт нужного характера, сыграйте персонажа сами: двадцать секунд записи в образе клонируются в голос, который звучит именно так, как вы задумали. Как это сделать — в главе голос персонажа для озвучки.

Три и больше голосов: как собрать сцену

В одном запросе звучат ровно два голоса. Для сказки с тремя героями или радиоспектакля текст делится на куски так, чтобы в каждом было не больше двух говорящих, — обычно это получается само, по сценам. Каждый кусок озвучивается отдельно, а потом части склеиваются в один MP3 в том же чате: просить об этом можно обычными словами — «склей все части по порядку».

Что озвучиваетеСколько запросовКак собрать
Диалог двух людей, интервью, сценка1Готово сразу, один файл
Сказка: рассказчик + два героя2–3Реплики героев парой, рассказчик отдельно, склейка
Радиоспектакль, 4–6 ролейпо числу сценСцены по двое, склейка по порядку
Текст длиннее 7 000 знаковпо 7 000 знаковЧасти по порядку, склейка в один MP3

Где пригодится озвучка по ролям

  • Сказки для детей. «Сказки озвучка по ролям» — самый частый такой запрос: разные голоса держат внимание лучше одного.
  • Сценка для корпоратива. Реплики записываются заранее, на празднике их остаётся включить.
  • Видео и ролики. Диалог двух героев в мультфильме или рекламе; как подложить голос под видео — в главе голос для видео.
  • Учебные диалоги. Разговор продавца и покупателя, урок иностранного языка, скрипт для тренировки звонков.

Частые вопросы

Как озвучить текст разными голосами?
Разметьте текст по ролям — каждая реплика с новой строки, в начале имя и двоеточие, — опишите голос каждой роли одной фразой и отправьте всё нейросети для синтеза речи. Шёпот или крик описывают словами в описании голоса, а смех, вздох и паузу ставят тегами , , прямо в тексте. В Twelver два голоса звучат в одном файле за один запрос; сцены с тремя и больше персонажами озвучиваются частями и склеиваются в один MP3.
Сколько голосов может быть в одной озвучке?
В одном запросе — два. Персонажей может быть сколько угодно: текст делится на сцены, в каждой не больше двух говорящих, и готовые части склеиваются в один файл по порядку.
Можно ли озвучить текст голосом персонажа из мультика?
Скопировать голос конкретного актёра или персонажа нейросеть не будет — это чужой голос. Она сделает оригинальный голос с похожим характером: опишите, как звучит герой — высота, темп, манера, — и получите голос в том же духе.
Можно ли озвучить текст разными голосами бесплатно?
Стартовые токены приходят при первом заходе, без регистрации, — их хватает, чтобы послушать короткий диалог и подобрать голоса. Скачать аудиофайл можно после первой покупки; слушать можно и без неё.
Какой длины текст можно озвучить за раз?
До 7 000 знаков в одном запросе — это около 10 минут речи. Текст длиннее озвучивается частями, которые потом склеиваются в один MP3.
Можно ли использовать такую озвучку в видео и рекламе?
Да, коммерческое использование разрешено. Ограничение одно — голос не должен подражать реальному человеку без его согласия.

Как устроена озвучка одним голосом и что делает её живой — в главе Озвучка текста нейросетью.

Попробуйте сами

Всё из этого руководства работает в Twelver

Один чат для текста, картинок, видео, музыки и озвучки — без отдельных сервисов и подписок.

Открыть чат Twelver
Оцените свой опыт