ГлавнаяИнструментыАудио и видео в текст

Аудио и видео в текст

Загрузите запись или ролик, и распознавание расшифрует речь в текст прямо в браузере: модель скачивается на устройство один раз, файл никуда не отправляется. Абзацы делятся по паузам, к каждому можно включить метку времени.

Что происходит со звуком внутри модели

Распознавание работает на модели Vosk, собранной на основе Kaldi: она умещается в 46 мегабайт и запускается в браузере через WebAssembly. Звук из файла раскладывается в одноканальный сигнал с частотой 16 килогерц, режется на короткие окна, и по каждому окну модель оценивает вероятности звуков, а языковая часть модели складывает их в слова. Так распознаётся и голосовое из мессенджера, и дорожка из видео: из ролика берётся только звук.

Абзацы инструмент режет по паузам дольше секунды: модель отдаёт поток слов без знаков, и пауза — единственный сигнал о границе. Метки времени берутся из того же потока, поэтому кнопка у абзаца перематывает запись точно на его начало. Память тратится на раскодированный звук: час записи занимает около 600 мегабайт, и на телефоне длинные файлы лучше делить.

Точность зависит от записи сильнее, чем от модели: один голос в микрофон даёт 85–95 процентов верных слов, разговор нескольких человек в шумной комнате — заметно меньше. Редкие имена и термины модель заменяет похожими по звучанию словами, потому что в её словаре их нет.

Звуковая волна на экране
Модель видит запись как волну, режет её на окна по долям секунды и подбирает к каждому звук. Фото: Викисклад, общественное достояние.
ЗаписьОжидаемая точностьЧто мешает
Лекция, подкаст, один голос85–95 %термины, имена
Голосовое из мессенджера75–90 %сжатие, шум улицы
Интервью, два голоса70–85 %наложение реплик
Совещание с диктофона на столе50–70 %расстояние, эхо

От десяти цифр до модели во вкладке

Первую систему распознавания речи, Audrey, собрали в Bell Labs в 1952 году: она узнавала десять цифр, произнесённых одним голосом. IBM Shoebox 1962 года понимала шестнадцать слов, а система Harpy из университета Карнеги — Меллона к 1976 году добралась до тысячи слов. В восьмидесятые пришли скрытые марковские модели, и распознавание перестало зависеть от одного диктора; в 1997 году Dragon NaturallySpeaking впервые продала диктовку слитной речи для домашнего компьютера.

Нейросети сменили марковские модели после 2012 года, когда ошибка распознавания упала на треть за один год. Открытый инструментарий Kaldi 2011 года стал основой для исследовательских и коммерческих систем, а библиотека Vosk 2019 года упаковала его модели в лёгкие сборки для телефонов и браузеров, с русским языком среди первых. В 2022 году OpenAI выпустила Whisper с открытыми весами, и распознавание на своём устройстве стало обычным делом.

Инструмент на странице стоит на этой линии: модель скачивается один раз, работает без сервера, и запись не покидает устройство. Ещё десять лет назад для этого нужен был вычислительный центр, сейчас хватает вкладки браузера.

Диктофон начала XX века
Диктофон записывал голос на валик, расшифровывала его машинистка. Фото: Викисклад, общественное достояние.
Руки на стенотипе
Стенографистка успевала за речью аккордами клавиш; модель делает то же по волне звука. Фото: © Ra Boe / Wikipedia, CC BY-SA 3.0 de.

Как записывать и как править результат

Качество текста закладывается при записи: микрофон ближе к говорящему, окно закрыто, телефон не на столе рядом с чашкой. Голосовые из мессенджеров уже сжаты, и с ними ничего не сделать, но диктофонную запись стоит вести в WAV или M4A на высоком битрейте. Если запись готовится для расшифровки, говорите по одному: наложение реплик — главная причина потерь.

После распознавания правьте в таком порядке: сначала имена и термины, их модель искажает предсказуемо и одинаково по всему тексту, поэтому замена по всему документу закрывает половину правок. Потом знаки препинания внутри абзацев, потом цифры, которые модель пишет словами. Метки времени включайте для интервью: по ним удобно вернуться к спорному месту.

Длинную запись на телефоне делите на части по 20–30 минут. Диктовать напрямую в микрофон с выбором языка удобнее в речи в текст, записать голос во вкладке — в диктофоне, а достать звук из видео отдельным файлом — в конвертере аудио.

МодельVosk, русский
Размер модели46 МБ
Частота обработки16 кГц
Абзацпауза дольше секунды
Час записи в памятиоколо 600 МБ
Audrey, Bell Labs1952
Kaldi2011
Whisper2022

Как пользоваться

  1. MP3, WAV, M4A, OGG, голосовое из мессенджера или видео MP4, MOV, WebM: из ролика берётся звуковая дорожка. Первый запуск скачивает модель, 46 МБ, дальше она берётся из кэша браузера.
  2. Полоса показывает, какая часть записи разобрана. На компьютере минута речи разбирается за 10–20 секунд, на телефоне около минуты. Вкладку не закрывайте.
  3. Модель пишет без знаков препинания и заглавных букв внутри абзаца: расставьте точки там, где нужно, имена и термины проверьте на слух. Кнопка у абзаца перематывает запись на его начало.
  4. Скопируйте целиком или скачайте .txt, при желании с метками времени в начале каждого абзаца.

Частые вопросы

Насколько точно распознаётся

Чистая речь одного человека в микрофон, лекция или подкаст расшифровываются с точностью 85–95 % по словам. Голосовые из мессенджеров, записи с диктофона в шумной комнате и разговор нескольких людей дают больше ошибок, редкие имена и термины модель заменяет похожими по звучанию словами. Текст всегда стоит проверить на слух, для этого у абзацев есть перемотка.

Почему нет знаков препинания

Модель распознаёт только слова: на выходе поток слов без пунктуации, который инструмент режет на абзацы по паузам дольше секунды и начинает с заглавной буквы. Точки и запятые внутри абзаца расставьте сами, это быстрее, чем набирать текст с нуля.

Какие языки поддерживаются

Пока русский: модель обучена на русской речи и заменяет иностранные слова похожими русскими. Для диктовки на других языках есть речь в текст через микрофон, там распознавание браузера с выбором языка.

Чем это отличается от диктовки

Речь в текст слушает микрофон здесь и сейчас и пишет через распознавание браузера. Этот инструмент берёт готовый файл, целиком, и разбирает его на устройстве без интернета после загрузки модели: голосовые, интервью, лекции и видео.

Сколько длинную запись можно загрузить

Ограничение задаёт память браузера: час записи раскладывается примерно в 600 МБ, на компьютере это проходит, на телефоне лучше держаться в пределах 20–30 минут или резать запись частями обрезкой музыки.

Что ещё есть для звука

Конвертер аудио достаёт звук из видео в MP3, ускорить или замедлить меняет темп записи, диктофон записывает голос во вкладке.

Данные куда-то отправляются

Нет. Модель скачивается на устройство, распознавание идёт в браузере, запись и текст никуда не уходят.

Похожие инструменты

Генератор рыбы-текста

Текст-заглушка для макета: русская рыба, Lorem ipsum и осмысленные абзацы. Объём задаётся в абзацах, словах или знаках, есть заголовки и списки.

Открыть
Извлечь URL и числа

Достать из текста все ссылки, числа или e-mail — или удалить их, оставив остальное.

Открыть
Блокнот онлайн

Заметки прямо во вкладке: несколько записей, автосохранение, поиск по тексту, счётчик слов и символов, сохранение в файл и печать.

Открыть
Антонимы к слову

Слова с противоположным значением по словарю Викисловаря на 141 тысячу слов, синонимы рядом, переход по цепочке нажатием на слово.

Открыть
Склонение ФИО по падежам

Фамилия, имя и отчество по шести падежам с автоопределением пола, инициалы и обработка списка ФИО целиком. Правила зашиты в страницу, без обращения к сервисам.

Открыть
Шифр Цезаря

Сдвиг по алфавиту для кириллицы и латиницы, автоподбор ключа по частотности букв, таблица всех сдвигов, ROT13 и ROT47.

Открыть

Ещё инструменты

Расчёты, конвертеры, генераторы, проверки сайта и бланки документов разложены по 27 разделам каталога.