Перевести видео в текстТранскрибация: аудио и видео в текст нейросетью

Перевести видео в текст

Запись созвона, вебинар, лекция, интервью на камеру, ролик, из которого нужна расшифровка под статью или субтитры. Отдельно вытаскивать звук из видео не нужно: звуковая дорожка читается прямо из файла, и результат такой же, как у обычной расшифровки аудио — текст с таймкодами и разделением по спикерам.

Сразу: ссылку обработать нельзя

Ссылка на YouTube, VK Видео, Rutube или подкаст не подойдёт — расшифровывается только загруженный файл. Это не «пока не сделали»: скачивание чужого видео по ссылке — отдельная задача с отдельными правовыми последствиями, и она сюда не входит.

Что делать вместо этого: если ролик ваш — возьмите исходник, он у вас уже есть. Если чужой — на YouTube у большинства роликов есть автоматические субтитры, и их текст можно скопировать прямо из интерфейса, бесплатно и без всяких сервисов.

Как это работает с видеофайлом

Контейнер разбирается на нашей стороне: mp4, mkv, m4a и прочие обычные форматы читаются напрямую, так что промежуточный шаг «сначала выгружу аудио в mp3» не нужен. Видеоряд при этом не анализируется — задача именно про речь, поэтому надписи на слайдах и то, что показывают на экране, в расшифровку не попадут.

Длинный ролик и лимит загрузки

Здесь у видео есть особенность, которой нет у аудио: час записи экрана весит 0,5–2 ГБ, а лимит на один загружаемый файл — 20 МБ на бесплатном аккаунте (40 и 80 МБ на старших тарифах). Разрыв кажется безнадёжным, но на деле его не существует, потому что видеоряд загружать незачем: распознаётся речь.

Поэтому браузер перед отправкой оставляет от файла только звук и пережимает его в моно 16 кГц Opus — формат, к которому движок распознавания и так приводит любую запись. Час речи весит в нём 5–14 МБ. Практические потолки получаются такие:

  • ~1,2 часа — одним файлом на бесплатном аккаунте, без потери качества распознавания.
  • ~3,3 часа — тоже одним файлом, на пониженном битрейте.
  • ~13 часов — с разрезанием на части (до четырёх), с перекрытием в пять секунд на швах.

У частей своя нумерация времени: таймкоды каждой начинаются заново с 00:00. Двухчасовой вебинар до этого не доходит и уезжает одним файлом — нарезка включается на записях, которые идут полдня.

Загрузите ролик — файлом, не ссылкой.

Загрузка…

Расшифровка и субтитры — не одно и то же

Обе задачи начинаются с одного и того же распознавания, но расходятся дальше, и путать их дорого:

  • Расшифровка — текст, чтобы его читать: сплошные реплики, полные предложения, никаких ограничений по длине строки.
  • Субтитры — текст, чтобы он лёг поверх кадра: разбитый на короткие куски по две строки, с точной привязкой ко времени, в формате SRT или VTT.

Материал для второго уже есть в первом: у каждой реплики известно время начала и конца, поэтому из готовой расшифровки субтитры собираются той же перепиской. Как это делать и что учитывать при укладке — в главе субтитры к видео.

Созвоны и совещания

Самый частый повод расшифровать видео — запись встречи, и для неё разделение по спикерам важнее всего остального. Пара вещей, которые стоит сделать до запуска, а не после:

  • Перечислите фамилии участников и внутренние сокращения — распознавание сместится в их сторону. Это единственный параметр, который чинит собственные имена.
  • Назовите язык встречи. Тогда суммы и даты придут в письменном виде — «25 000 ₽», а не прописью, — и протокол не придётся переписывать под нормальный вид.
  • Запись с одного общего микрофона в переговорке — самый трудный случай для разделения голосов. Запись из видеоконференции, где у каждого своя гарнитура, разбирается заметно чище.

Метки приходят обезличенными — Speaker 1, Speaker 2: движок слышит, что голоса разные, но имён не знает. Скажите, кто под каким номером, и попросите переписать текст с именами — дальше из него делается протокол с решениями и задачами.

Частые вопросы

Как перевести видео в текст?
Загрузите видеофайл в чат — звуковая дорожка читается прямо из него, отдельно выгружать аудио не нужно. В ответ придёт текст с пунктуацией, таймкодами и разделением по говорящим. Попробовать можно в Twelver.
Можно ли сделать транскрибацию видео с YouTube по ссылке?
Нет — расшифровывается только загруженный файл, ссылка не подойдёт. Если ролик ваш, используйте исходник. Если чужой — у большинства роликов на YouTube есть автоматические субтитры, и их текст копируется прямо из интерфейса бесплатно.
Видео весит гигабайт, а лимит загрузки 20 МБ. Как быть?
Ничего делать не нужно: видеоряд для расшифровки не требуется, поэтому браузер перед отправкой оставляет от файла только звук и пережимает его в моно 16 кГц Opus, где час речи весит 5–14 МБ. Одним файлом так уходит примерно 1,2 часа на бесплатном аккаунте и до ~3,3 часа на пониженном битрейте; более длинные записи режутся на части.
Чем расшифровка видео отличается от субтитров?
Расшифровка — текст для чтения: сплошные реплики и полные предложения. Субтитры — текст для показа поверх кадра: короткие куски по две строки с точной привязкой ко времени, в формате SRT или VTT. Материал для вторых есть в первой, потому что время начала и конца известно у каждой реплики.
Распознаётся ли текст, который написан на экране в видео?
Нет. Расшифровывается звуковая дорожка, то есть речь; надписи на слайдах, титры и то, что показано на экране, в текст не попадают.
Сколько стоит перевести видео в текст?
Столько же, сколько аудио той же длины: считается по длительности записи, а не по весу файла — 110 000 токенов за час, минимальный тарифицируемый отрезок 30 секунд. То, что исходник был гигабайтным видео, на цену не влияет.

В чате Twelver можно загрузить ролик, получить текст его звуковой дорожки с таймкодами и спикерами и тут же собрать из него протокол или субтитры — в одной переписке.

Попробуйте сами

Всё из этого руководства работает в Twelver

Один чат для текста, картинок, видео, музыки и озвучки — без отдельных сервисов и подписок.

Открыть чат Twelver
Оцените свой опыт