Транскрибация: аудио и видео в текст нейросетью

Транскрибация: аудио и видео в текст

Транскрибация — это превращение записанной речи в текст, который можно читать, искать, цитировать и править. Час совещания, интервью на диктофоне, лекция, созвон, голосовое на четыре минуты — всё это становится текстом за время, которое заметно меньше длительности самой записи. Здесь собрано, как это устроено, что влияет на точность, какие файлы и какой длины подходят и сколько это стоит.

≈1,5 часазаписи бесплатно, без регистрацииСтартовые токены нового пользователя; час аудио стоит 110 000 токенов
Speaker 1, 2, 3…разделение по спикерамБерётся из записи, а не додумывается моделью
до ~13 часовмаксимальная длина одной записиБраузер сжимает и режет длинный файл перед отправкой

Что вы получаете на выходе

Не сплошную простыню текста. Расшифровка приходит строками вида [04:12–04:27] Speaker 2: … — с таймкодом и с меткой говорящего:

[00:00–00:06] Speaker 1: Давайте начнём. Сначала цифры.
[00:06–00:14] Speaker 2: По выручке вышли на 25 000 000 ₽.
[00:14–00:19] Speaker 1: Хорошо. Что с оттоком?

Это важная деталь, а не оформление. И таймкоды, и метки говорящих измерены по самой звуковой дорожке — модель распознавания возвращает время начала и конца каждого слова и номер говорящего для него. Их не «расставляет» потом чат-модель, поэтому по таймкоду можно вернуться к нужной секунде записи и там действительно будет эта фраза.

Когда спикеры не разделятся

Если в записи один голос — или голоса накладываются так, что разделить их нельзя, — меток не будет, и текст придёт сплошным. Это честный ответ «здесь один говорящий», а не сбой: собеседников не придумают, чтобы страница выглядела лучше.

Загрузите запись

Аудио или видео — всё равно; звуковая дорожка из видео читается напрямую, вытаскивать её отдельно не нужно. Скажите, на каком языке запись и о чём она, — на терминах это заметно помогает.

Загрузка…

Что влияет на точность

Порядок здесь примерно такой — от того, что решает всё, к тому, что доводит результат:

  • Чистота звука. Шум, музыка на фоне и перебивающие друг друга голоса — главные враги. Один микрофон близко к говорящему даёт лучший результат, чем «общий» звук с середины комнаты.
  • Названный язык записи. Язык определится и сам, но если его назвать, включается запись чисел, дат и сумм в письменном виде: в тексте будет «25 000 ₽», а не «двадцать пять тысяч рублей прописью».
  • Список имён и терминов. Это единственное, что чинит неверно распознанные фамилии, названия компаний, продуктов и внутренние сокращения. Перечислите их до запуска — принимается до ста терминов.
  • Вычитка на выходе. Имена, числа и специальные термины проверяются глазами всегда, в любом сервисе и у любого живого транскрибатора тоже.

Сколько это стоит

Считается по длительности записи, а не по её весу: один и тот же час разговора стоит одинаково, записан он в mp3 на 30 МБ или в wav на гигабайт. Час аудио — 110 000 токенов, минимальный тарифицируемый отрезок — 30 секунд, так что голосовое на десять секунд стоит как полминуты, а не как «одна операция».

Стартовые токены нового пользователя покрывают примерно полтора часа записи — и они начисляются до регистрации, а не после. Регистрация добавляет ещё около полутора часов сверху. Подробный разбор границы бесплатного — в главе транскрибация онлайн бесплатно.

Отдельно: если в файле не нашлось распознаваемой речи — музыка, инструментал, тишина — с вас не спишется ничего.

Дальше по темам

Частные случаи разобраны в главах этой книги — полный список ниже, в оглавлении. Аудио в текст — про голосовые, диктофон и интервью; видео в текст — про ролики, длинные записи созвонов и почему ссылку на YouTube обработать нельзя; что такое транскрибация — если вы попали сюда за определением.

Соседние темы в других руководствах: обратная задача — превратить текст в речь — это озвучка текста, расшифровка под другим названием разобрана в главе расшифровка аудио в текст, а если текст нужен не для чтения, а чтобы лечь поверх кадра, — это субтитры к видео.

Частые вопросы

Что такое транскрибация простыми словами?
Это перевод записанной речи в текст: вы отдаёте аудио- или видеофайл, получаете написанное. Нейросеть распознаёт слова, расставляет пунктуацию, отмечает время каждой фразы и, если голосов несколько, помечает, кто именно говорит. Попробовать можно в чате Twelver.
Как сделать транскрибацию нейросетью?
Загрузите аудио или видео в чат и скажите, на каком языке запись и о чём она. Из видео звуковая дорожка читается напрямую — отдельно вытаскивать её не нужно. В ответ придёт текст строками вида «[04:12–04:27] Speaker 2: …» — с таймкодами и разделением по говорящим.
Нейросеть правда разделяет спикеров или это выдумка модели?
Разделяет по-настоящему: движок распознавания возвращает для каждого слова время начала и конца и номер говорящего, и метки берутся оттуда. Если в записи один голос или голоса неразделимы, меток не будет и текст придёт сплошным — собеседников не придумывают.
Сколько стоит транскрибация?
Считается по длительности записи, а не по размеру файла: час аудио — 110 000 токенов, минимальный тарифицируемый отрезок — 30 секунд. Стартовых токенов нового пользователя хватает примерно на полтора часа записи, и начисляются они до регистрации. Если распознаваемой речи в файле не нашлось, не списывается ничего.
Какой длины запись можно расшифровать?
Практический предел — около 13 часов: браузер перед отправкой пережимает запись в речевой формат и при необходимости режет её на части с перекрытием, чтобы каждая уместилась в лимит загрузки. Полуторачасовое совещание уходит одним файлом без всяких ухищрений.
Что делать с текстом после расшифровки?
Расшифровка — заготовка, а не финал. В той же переписке можно попросить краткое содержание, список принятых решений и задач, перевод или субтитры из таймкодов — это уже обычная работа чат-ассистента с готовым текстом, и отдельного сервиса для неё не нужно.

В чате Twelver можно загрузить запись, получить текст с таймкодами и спикерами и тут же попросить из него выжимку или список задач — в одной переписке. Стартовых токенов хватает примерно на полтора часа записи.

Содержание

  1. 1.Перевести аудио в текст
  2. 2.Перевести видео в текст
  3. 3.Транскрибация текста: что это простыми словами
  4. 4.Транскрибация онлайн бесплатно

Попробуйте сами

Всё из этого руководства работает в Twelver

Один чат для текста, картинок, видео, музыки и озвучки — без отдельных сервисов и подписок.

Открыть чат Twelver
Оцените свой опыт