ГлавнаяСервисы Синтез и распознавание речи

Синтез и распознавание речи: чем озвучить и расшифровать

Речевые технологии считают деньги двумя способами. Синтез — за символы отправленного текста или за запрос, распознавание — за секунды и минуты аудио.

8сервисов разобрано по одним и тем же полям
0 из 8с опубликованными реквизитами компании
7 из 8с бесплатным тарифом или пробным периодом

Разница в счетах между поставщиками возникает не из-за самой цены, а из-за правил округления: где-то тарифицируется каждые 15 секунд, где-то каждая секунда, а пустой запрос всё равно считается за единицу. Отдельная история — офлайн: если аудио нельзя выпускать наружу, остаётся ставить движок распознавания у себя, и здесь есть три бесплатных варианта с открытым кодом.

Сервисы раздела

8 карточек. Метки под названием — то, что подтверждено на сайте сервиса, кружок справа — порог входа.

Чем отличаются друг от друга

Прочерк означает, что на сайте сервиса про это ничего не сказано. Проверено 22.08.2026.

СервисБесплатный доступГде работаетAPIСтранаРеестр ПОПорог входа
Yandex SpeechKitнетAPI, своя установкаестьРоссия6,5
SaluteSpeechпробный периодAPI, Windows, macOSестьРоссия7,5
ElevenLabsесть тарифбраузер, APIесть9,5
VoskбесплатныйLinux, Windows, macOS, Android, iOS, своя установкаесть9
Deepgramпробный периодAPIесть7,5
AssemblyAIесть тарифAPIесть8,5
WhisperбесплатныйLinux, Windows, macOS, своя установкаесть9
Silero ModelsбесплатныйLinux, Windows, macOS, своя установкаесть9

«Порог входа» считается по фактам с сайта: бесплатный доступ, открытые тарифы, русский интерфейс, работа без установки, наличие API и видимая поддержка. Он говорит о том, насколько легко начать, и ничего не говорит о качестве работы инструмента. Разборы пар, между которыми выбирают чаще всего, собраны на странице сравнения сервисов.

Как выбирать в этом разделе

Начните с формата: разовая озвучка ролика, поток в колл-центре или расшифровка архива звонков — это разные тарифы у одного и того же поставщика. Прочитайте правила округления: минута аудио может стоить как четыре отрезка по пятнадцать секунд. Для распознавания архивов ищите отложенный режим — он дешевле потокового в разы. И заранее посчитайте минимальный месячный платёж: у речевых сервисов он бывает выше, чем весь ваш планируемый объём.

Юрлица и соответствие по разделу

Срез по 8 сервисам: у скольких вообще опубликовано то, о чём принято спрашивать до договора. Проверено 22.08.2026.

Частые вопросы

Сколько стоит распознавание речи
У Yandex SpeechKit потоковое и синхронное распознавание стоит 0,1626 ₽ за 15 секунд аудио, асинхронное — 0,1515 ₽, а отложенный режим — 0,0381 ₽ за те же 15 секунд. У SaluteSpeech секунда распознавания стоит 0,01 ₽, то есть минута — 0,6 ₽; пакет на 20 000 минут обойдётся в 12 000 ₽. Vosk бесплатен, но работает на вашем оборудовании.
Сколько стоит озвучка текста
В SpeechKit синтез через API v1 стоит 1 342 ₽ за миллион символов, через API v3 — 0,1626 ₽ за запрос, причём каждые 250 символов считаются отдельной единицей. У SaluteSpeech символ стоит 0,000186 ₽: пакет на 55 млн символов — 10 230 ₽. У ElevenLabs счёт идёт в кредитах: 10 тысяч в месяц на бесплатном плане и 121 тысяча на плане Creator за 11 долларов.
Можно ли получить собственный голос
Да, это отдельная услуга. В SpeechKit есть Brand Voice: создание голоса в редакции Lite стоит 9 150 ₽ разово, хостинг первого голоса — 101 666 ₽ в месяц, причём первые семь дней хостинга бесплатны для проверки результата. У ElevenLabs клонирование голоса входит в платные планы: мгновенное — со Starter, профессиональное — с Creator.
Что делать, если аудио нельзя отдавать наружу
Ставить распознавание у себя. Открытых вариантов три: Vosk работает офлайн даже на Raspberry Pi и телефонах при моделях около 50 МБ, Whisper от OpenAI опубликован под лицензией MIT и требует от 1 до 10 ГБ видеопамяти в зависимости от размера, Silero даёт и синтез, и распознавание с автоматическими ударениями для русского. Платить не нужно, но точность и нагрузку вы обеспечиваете сами.
Сколько стоит минута расшифровки у зарубежных сервисов
Дешевле, чем в рублёвых прайсах, но платить приходится в долларах. AssemblyAI берёт 0,15 доллара за час аудио на модели Universal-2 и 0,21 доллара на Universal-3.5 Pro, то есть около 0,003 доллара за минуту. Deepgram считает по минутам: 0,0048 доллара на модели Nova-3. У OpenAI минута расшифровки стоит от 0,003 доллара. Для сравнения: минута у SaluteSpeech обойдётся в 0,6 ₽.
Где начать без бюджета
У трёх сервисов есть бесплатный вход. AssemblyAI даёт до 185 часов расшифровки записей и до 333 часов потокового распознавания, Deepgram начисляет 200 долларов на счёт при регистрации, ElevenLabs выдаёт 10 тысяч кредитов в месяц на бесплатном плане. Открытые Vosk, Whisper и Silero бесплатны всегда, но считают на вашем оборудовании.

Об этом на сайте

Что мы писали по теме раздела.

Другие разделы каталога

Никита Вихров
Никита Вихров

Агрегирую и упрощаю выбор подрядчиков для решения самых разных задач. Бережно анализирую доступную информацию, отзывы, факты.