Клонировать голос и озвучить им текст

Задача почти всегда состоит из двух половин, и спрашивают о них вместе: скопировать голос — и озвучить им текст. Первая делается один раз и занимает двадцать секунд. Вторая после этого доступна всегда: голос сохраняется, и озвучивать им можно сколько угодно текстов. Здесь собрано всё по теме — что нужно записать, что получится, где предел и где проходит граница, за которую заходить нельзя.

Один разСколько угодно раз10–20 секундобычной речидиктофон телефона подойдётСохранённый голосостаётся у вас в чатеи никуда не девается послеЛюбой текствставили — получили аудиодо 10 000 символов за разПочти все статьи объясняют только левую часть — а в запросах люди спрашиваютпро обе сразу: «клонировать голос И озвучить текст». Правая часть и естьто, ради чего затевается левая.
Запись делается один раз. Голос после этого сохраняется, и озвучивать им можно сколько угодно текстов — заново записываться не нужно ни на второй день, ни на сотый.

Как это устроено по шагам

  1. Записываете 10–20 секунд обычной речи. Диктофона телефона достаточно. Не читать с листа — просто рассказать что-нибудь своими словами: естественная интонация в записи становится естественной интонацией результата.
  2. Голос сохраняется. Это самая недооценённая часть: повторно записываться не нужно ни завтра, ни через месяц.
  3. Вставляете текст — получаете аудио. До 10 000 символов за один запрос, что примерно соответствует пятнадцати минутам речи. Длинный текст режется и склеивается автоматически — руками делить ничего не надо.
10–20 сЗаписи достаточноПринимается от 3 до 60 секунд; больше двадцати не улучшает результат.
10 000Символов за один запросПримерно 15 минут речи. Делится и склеивается само.
РусскийПоддерживается напрямуюНаравне с английским, а не через него.

Сначала проверьте свою запись

Клон получается ровно таким, как те двадцать секунд, из которых его сняли, — и почти всё, что может пойти не так, видно до загрузки.

Годится ли ваша запись

Клон получается ровно таким, как те двадцать секунд, из которых его сняли. Отметьте всё, что верно про вашу запись, — и посмотрите, что из этого будет слышно потом.

Такая запись подойдёт

Загружайте. Голос сохранится и дальше будет доступен для любого текста — заново записываться не придётся.

И одно правило, которое к качеству записи не относится: копировать можно свой голос или чужой с согласия его владельца. Запись, взятая из чужого ролика, — это чужой голос, как бы легко он ни загружался.

Попробуйте прямо здесь

Ниже — рабочий чат, а не картинка. Введите текст и услышите озвучку; если хотите свой голос, пришлите туда же короткую запись.

Загрузка…

Граница, которую эта книга не переходит

Голос принадлежит человеку, а не тому, у кого есть файл. Копировать можно свой голос или чужой — с согласия его владельца.

Запись, вырезанная из чужого ролика, интервью или голосового сообщения, остаётся чужим голосом, как бы просто она ни загружалась. Здесь нет технической разницы между «своим» и «чужим» — разница вся на вашей стороне, и последствия тоже.

Зачем это делают

  • Своя озвучка без записи. Сценарий правится десять раз — каждый раз переписывать дубль не нужно.
  • Единый голос во всех материалах. Уроки, инструкции, подкаст, объявления — один и тот же диктор, даже если он сегодня простужен.
  • Длинные тексты. Начитать статью на пятнадцать минут вживую — это час работы с дублями и склейкой.
  • Правки постфактум. Поменялась одна цифра — переозвучен один абзац, а не весь ролик.

Куда идти дальше

Главы этой книги разбирают отдельные случаи — полный список ниже, в оглавлении. Если голос копировать не нужно, а озвучить текст нужно — озвучить текст голосом. Если текст длинный и вы упёрлись в лимиты — озвучка длинного текста и её пределы. Если нужен не свой голос, а голос персонажа — голос персонажа для озвучки. Про этику, риски и то, как это выглядит с точки зрения человека, чей голос копируют, — в главе клонирование голоса нейросетью.

Частые вопросы

Как клонировать голос и озвучить им текст?
Двумя шагами. Сначала пришлите 10–20 секунд обычной речи — диктофона телефона достаточно; голос после этого сохраняется. Затем вставьте текст и получите аудио этим голосом, до 10 000 символов за один запрос. Повторно записываться не нужно: голос остаётся доступным для всех следующих текстов. Попробовать можно в чате Twelver.
Работает ли это на русском?
Да, русский поддерживается напрямую, а не через английский: он входит в список языков движка наравне с английским, китайским, немецким, французским, испанским, итальянским, португальским, японским и корейским. Записывать образец и озвучивать текст можно на русском.
Сколько записи нужно для клонирования голоса?
10–20 секунд обычной связной речи — это рекомендуемая длина. Принимается от 3 до 60 секунд, но больше двадцати результат уже не улучшают. Гораздо важнее длины то, что в записи: один говорящий, без музыки и телевизора на фоне, и лучше рассказ своими словами, а не чтение с листа.
Нужно ли записывать голос каждый раз заново?
Нет. Запись делается один раз, после чего голос сохраняется и остаётся доступным для любых следующих текстов — и завтра, и через месяц. Это и есть смысл всей затеи: двадцать секунд один раз вместо дубля на каждый сценарий.
Какой длины текст можно озвучить?
До 10 000 символов за один запрос — это примерно пятнадцать минут речи. Длинный текст автоматически делится на части и склеивается обратно, поэтому резать его вручную не нужно. Если текст ещё длиннее, разделите его по смыслу: голос между запросами сохраняется, и части будут звучать одинаково.
Можно ли скопировать голос другого человека?
Технически движок не спрашивает, чей голос в записи. По существу — голос принадлежит человеку, а не тому, у кого есть файл: копировать можно свой голос или чужой с согласия владельца. Запись, вырезанная из чужого ролика или голосового сообщения, остаётся чужим голосом, и лёгкость загрузки этого не меняет.
Что делать, если клон не похож?
Причина почти всегда в исходной записи, а не в настройках. Три самые частые: музыка или телевизор на фоне (модель считает их частью голоса), два говорящих в одном файле (голоса усредняются), запись телефонного разговора (канал срезает то, что делает голос узнаваемым). Перезапишите двадцать секунд в тишине, своими словами — это решает большинство случаев.

В чате Twelver можно прислать двадцать секунд записи и дальше озвучивать этим голосом любые тексты — онлайн, в одной переписке. Стартовые токены начисляются после регистрации и онбординга.

Содержание

  1. 1.Озвучить текст голосом: как получить речь, а не робота
  2. 2.Озвучка длинного текста: где реальные пределы
  3. 3.Голос персонажа для озвучки
  4. 4.Клонировать голос бесплатно и онлайн

Попробуйте сами

Всё из этого руководства работает в Twelver

Один чат для текста, картинок, видео, музыки и озвучки — без отдельных сервисов и подписок.

Открыть чат Twelver
Оцените свой опыт