Перевести аудио в текстТранскрибация: аудио и видео в текст нейросетью

Перевести аудио в текст

Задача одна, а поводов много: голосовое, которое неудобно слушать; диктофонная запись интервью; час созвона, из которого нужен протокол; подкаст, из которого делают статью. Во всех случаях порядок один — загрузить файл и получить текст. Эта глава про то, что происходит между этими двумя шагами и где у метода границы.

Какие файлы подходят

Обычные бытовые форматы — mp3, m4a, wav, ogg, тот же opus из мессенджеров. Отдельно конвертировать ничего не нужно, и это касается не только аудио: если запись лежит внутри видео, звуковая дорожка читается прямо из него — про это соседняя глава.

Ограничение, о котором стоит знать заранее, — не формат, а размер одного загружаемого файла: 20 МБ на бесплатном аккаунте, 40 и 80 МБ на старших тарифах. Звучит мало для часовой записи — и почти никогда ею не является, потому что перед отправкой файл пережимается прямо в браузере.

Почему часовая запись всё-таки проходит

Час видео со встречи — это 0,5–2 ГБ, и целиком через сеть ему ехать незачем: распознаётся только речь. Поэтому браузер перед загрузкой превращает запись в моно 16 кГц Opus — тот самый формат, к которому любой движок распознавания приводит звук у себя внутри. Час речи в нём весит 5–14 МБ.

Из этого получаются вполне конкретные потолки:

  • До ~1,2 часа — уходит одним файлом на бесплатном аккаунте, без потери качества распознавания.
  • До ~3,3 часа — тоже одним файлом: битрейт опускается к нижней границе, на которой точность ещё держится.
  • До ~13 часов — запись режется на части (до четырёх), и каждая едет отдельно.

Что важно знать про части

Куски нарезаются с перекрытием в пять секунд — чтобы фраза, попавшая на шов, не потерялась. Но у каждой части свои часы: её таймкоды начинаются заново с 00:00. Так что «14:20» из второй части — это не 14:20 записи, и при цитировании времени из длинной расшифровки на это стоит смотреть.

Загрузите запись. Если знаете — скажите сразу, на каком она языке и о чём: следующий раздел объясняет, почему это не формальность.

Загрузка…

Две подсказки, которые реально меняют результат

Всё остальное — про качество исходной записи, а эти два параметра задаёте вы, и они дают заметную разницу на одном и том же файле.

  • Язык записи. Определится и без вас, но, названный явно, он включает письменную форму: числа, суммы и даты приходят как «25 000 ₽» и «12 марта», а не словами. Для протокола или сметы это разница между готовым текстом и получасом правки.
  • Имена и термины. Перечислите фамилии участников, названия компаний, продуктов и внутренние сокращения — до ста терминов. Это единственное, что чинит неверно распознанные собственные имена; после того как расшифровка уже готова, чинить их придётся руками.

Кто говорит: разделение по спикерам

Для записи с несколькими участниками это главное, ради чего вообще стоит брать нейросеть, а не бесплатный «диктофон в браузере». Текст приходит размеченным: Speaker 1, Speaker 2 и так далее, с таймкодом каждой реплики. Номера берутся из самой записи — движок отдаёт говорящего для каждого слова, — а не расставляются задним числом по смыслу.

Имена участников метки не содержат: движок слышит, что голоса разные, но не знает, кого как зовут. Обычный следующий шаг — сказать «Speaker 1 — это Ирина, Speaker 2 — Пётр» и попросить переписать текст с именами.

Если речи в файле нет

Музыка, инструментал или тишина честно вернутся как «распознаваемой речи не найдено», и списано не будет ничего. Повторять попытку смысла нет — ответ не изменится. Слова песни — это другая задача и другой инструмент.

Сколько это стоит и почему считается так

По длительности, а не по весу файла: час аудио — 110 000 токенов независимо от того, mp3 это на 30 МБ или wav на гигабайт. Минимальный тарифицируемый отрезок — 30 секунд, поэтому десятисекундное голосовое стоит как полминуты.

Это не мелочь тарификации, а следствие того, за что платит сам сервис: распознавание метрится по времени звучания. Считать по мегабайтам было бы нечестно в обе стороны — одна и та же часовая запись стоила бы втрое дороже просто потому, что её сохранили в более жирном битрейте. Где проходит граница бесплатного — в главе транскрибация онлайн бесплатно.

«Протокол встречи из расшифровки»

Готовые запросы: превратить расшифровку в протокол с решениями и задачами, подставить имена вместо Speaker 1/2 и вычитать длинный транскрипт по порядку.

Гость
2
Аккаунт
3
Подписка

Откроется после бесплатной регистрации

Что делать с текстом дальше

Расшифровка — заготовка. Отдельный сервис транскрибации на ней заканчивается, и дальше вы переносите текст куда-то ещё; здесь он уже лежит в переписке, поэтому следующий шаг — просто следующее сообщение: краткое содержание, список решений и задач, перевод, статья из подкаста. Про озвучку в обратную сторону — текст голосом — есть отдельная глава, а под другим названием эту же задачу разбирает расшифровка аудио в текст.

Частые вопросы

Как перевести аудио в текст?
Загрузите аудиофайл в чат и, если знаете, назовите язык записи и её тему. В ответ придёт текст с пунктуацией, таймкодами и — когда голосов несколько — с разделением по говорящим. Конвертировать файл заранее не нужно: обычные mp3, m4a, wav и ogg читаются как есть. Попробовать можно в Twelver.
Какой длины запись можно перевести в текст?
Около 1,2 часа уходит одним файлом без потери качества, до ~3,3 часа — тоже одним файлом на пониженном битрейте, и примерно до 13 часов, если запись разрезать на части. Пережимает и режет запись сам браузер перед отправкой, поэтому «файл слишком большой» на часовом совещании вы почти наверняка не увидите.
Почему ограничение 20 МБ, если час записи весит гигабайт?
20 МБ — это лимит на один загружаемый файл (40 и 80 МБ на старших тарифах), но целиком гигабайт никуда не едет. Перед отправкой браузер превращает запись в моно 16 кГц Opus — формат, к которому любой движок распознавания и так приводит звук, — а в нём час речи весит 5–14 МБ.
Нейросеть определяет, кто говорит?
Да, реплики размечаются как Speaker 1, Speaker 2 и так далее, и номера берутся из самой записи: движок отдаёт говорящего для каждого слова. Имён участников метки не содержат — движок слышит, что голоса разные, но не знает, кого как зовут. Скажите, кто под каким номером, и попросите переписать текст с именами.
Как добиться, чтобы фамилии и термины распознались правильно?
Перечислите их до запуска — фамилии участников, названия компаний и продуктов, внутренние сокращения, до ста терминов. Это единственный параметр, который влияет именно на собственные имена: распознавание сместится в их сторону. После того как текст готов, править их придётся вручную.
Сколько стоит перевести аудио в текст?
Час аудио — 110 000 токенов, и считается по длительности записи, а не по размеру файла: одна и та же часовая запись стоит одинаково в mp3 и в wav. Минимальный тарифицируемый отрезок — 30 секунд. Если распознаваемой речи в файле не нашлось, не списывается ничего.

В чате Twelver можно загрузить запись, получить текст с таймкодами и спикерами и тут же попросить из него протокол или выжимку — в одной переписке. Стартовых токенов хватает примерно на полтора часа записи.

Попробуйте сами

Всё из этого руководства работает в Twelver

Один чат для текста, картинок, видео, музыки и озвучки — без отдельных сервисов и подписок.

Открыть чат Twelver
Оцените свой опыт