Перевести аудио в текст
Задача одна, а поводов много: голосовое, которое неудобно слушать; диктофонная запись интервью; час созвона, из которого нужен протокол; подкаст, из которого делают статью. Во всех случаях порядок один — загрузить файл и получить текст. Эта глава про то, что происходит между этими двумя шагами и где у метода границы.
Какие файлы подходят
Обычные бытовые форматы — mp3, m4a, wav, ogg, тот же opus из мессенджеров. Отдельно конвертировать ничего не нужно, и это касается не только аудио: если запись лежит внутри видео, звуковая дорожка читается прямо из него — про это соседняя глава.
Ограничение, о котором стоит знать заранее, — не формат, а размер одного загружаемого файла: 20 МБ на бесплатном аккаунте, 40 и 80 МБ на старших тарифах. Звучит мало для часовой записи — и почти никогда ею не является, потому что перед отправкой файл пережимается прямо в браузере.
Почему часовая запись всё-таки проходит
Час видео со встречи — это 0,5–2 ГБ, и целиком через сеть ему ехать незачем: распознаётся только речь. Поэтому браузер перед загрузкой превращает запись в моно 16 кГц Opus — тот самый формат, к которому любой движок распознавания приводит звук у себя внутри. Час речи в нём весит 5–14 МБ.
Из этого получаются вполне конкретные потолки:
- До ~1,2 часа — уходит одним файлом на бесплатном аккаунте, без потери качества распознавания.
- До ~3,3 часа — тоже одним файлом: битрейт опускается к нижней границе, на которой точность ещё держится.
- До ~13 часов — запись режется на части (до четырёх), и каждая едет отдельно.
Что важно знать про части
Куски нарезаются с перекрытием в пять секунд — чтобы фраза, попавшая на шов, не потерялась. Но у каждой части свои часы: её таймкоды начинаются заново с 00:00. Так что «14:20» из второй части — это не 14:20 записи, и при цитировании времени из длинной расшифровки на это стоит смотреть.
Загрузите запись. Если знаете — скажите сразу, на каком она языке и о чём: следующий раздел объясняет, почему это не формальность.
Две подсказки, которые реально меняют результат
Всё остальное — про качество исходной записи, а эти два параметра задаёте вы, и они дают заметную разницу на одном и том же файле.
- Язык записи. Определится и без вас, но, названный явно, он включает письменную форму: числа, суммы и даты приходят как «25 000 ₽» и «12 марта», а не словами. Для протокола или сметы это разница между готовым текстом и получасом правки.
- Имена и термины. Перечислите фамилии участников, названия компаний, продуктов и внутренние сокращения — до ста терминов. Это единственное, что чинит неверно распознанные собственные имена; после того как расшифровка уже готова, чинить их придётся руками.
Кто говорит: разделение по спикерам
Для записи с несколькими участниками это главное, ради чего вообще стоит брать нейросеть, а не бесплатный «диктофон в браузере». Текст приходит размеченным: Speaker 1, Speaker 2 и так далее, с таймкодом каждой реплики. Номера берутся из самой записи — движок отдаёт говорящего для каждого слова, — а не расставляются задним числом по смыслу.
Имена участников метки не содержат: движок слышит, что голоса разные, но не знает, кого как зовут. Обычный следующий шаг — сказать «Speaker 1 — это Ирина, Speaker 2 — Пётр» и попросить переписать текст с именами.
Если речи в файле нет
Музыка, инструментал или тишина честно вернутся как «распознаваемой речи не найдено», и списано не будет ничего. Повторять попытку смысла нет — ответ не изменится. Слова песни — это другая задача и другой инструмент.
Сколько это стоит и почему считается так
По длительности, а не по весу файла: час аудио — 110 000 токенов независимо от того, mp3 это на 30 МБ или wav на гигабайт. Минимальный тарифицируемый отрезок — 30 секунд, поэтому десятисекундное голосовое стоит как полминуты.
Это не мелочь тарификации, а следствие того, за что платит сам сервис: распознавание метрится по времени звучания. Считать по мегабайтам было бы нечестно в обе стороны — одна и та же часовая запись стоила бы втрое дороже просто потому, что её сохранили в более жирном битрейте. Где проходит граница бесплатного — в главе транскрибация онлайн бесплатно.
«Протокол встречи из расшифровки»
Готовые запросы: превратить расшифровку в протокол с решениями и задачами, подставить имена вместо Speaker 1/2 и вычитать длинный транскрипт по порядку.
Откроется после бесплатной регистрации
Что делать с текстом дальше
Расшифровка — заготовка. Отдельный сервис транскрибации на ней заканчивается, и дальше вы переносите текст куда-то ещё; здесь он уже лежит в переписке, поэтому следующий шаг — просто следующее сообщение: краткое содержание, список решений и задач, перевод, статья из подкаста. Про озвучку в обратную сторону — текст голосом — есть отдельная глава, а под другим названием эту же задачу разбирает расшифровка аудио в текст.
Частые вопросы
Как перевести аудио в текст?
Какой длины запись можно перевести в текст?
Почему ограничение 20 МБ, если час записи весит гигабайт?
Нейросеть определяет, кто говорит?
Как добиться, чтобы фамилии и термины распознались правильно?
Сколько стоит перевести аудио в текст?
В чате Twelver можно загрузить запись, получить текст с таймкодами и спикерами и тут же попросить из него протокол или выжимку — в одной переписке. Стартовых токенов хватает примерно на полтора часа записи.
Попробуйте сами
Всё из этого руководства работает в Twelver
Один чат для текста, картинок, видео, музыки и озвучки — без отдельных сервисов и подписок.
Открыть чат Twelver