Нейросеть для расшифровки текста: зарубежные сервисы и цены

Все статьи
Все статьи
Редакция Neurounit
14 марта 2025
Обновлено 22 августа 2026
Нейросети
Нейросеть для расшифровки текста: зарубежные сервисы и цены
Обзор ИИ-инструментов для совещаний, которые расшифровывают разговоры в реальном времени, генерируют задачи и дают аналитику. Открывает подборку Spinach.io на базе GPT-4, работающий как личный Scrum-мастер для стендапов и резюме встреч. Разбираются функции сервисов для повышения эффективности совещаний.

Нейросеть для расшифровки текста нужна в одном сценарии: на входе есть готовая запись (интервью, созвон, лекция, подкаст, ролик), на выходе нужен файл с текстом этой записи. Задача называется транскрибацией, и она устроена не так, как кажется по демо-роликам: разница между сервисами измеряется не «умностью», а весом файла, который они примут, минутной ценой, наличием разметки по говорящим и тем, где физически окажется ваша запись после загрузки. Ниже разобраны зарубежные модели и API, их официальные тарифы и лимиты на 22 августа 2026 года.

Что делает нейросеть для расшифровки текста и какую задачу она закрывает

Транскрибация — это распознавание речи (ASR, automatic speech recognition). На выходе получается не абзац с готовым смыслом, а поток слов с таймкодами, иногда с метками говорящих и знаками препинания. Выжимку, протокол и задачи делает уже другая модель поверх этого текста.

Оценивать сервис расшифровки поэтому нужно по четырём параметрам, а не по обещаниям на лендинге:

  • Что принимает на вход: вес файла и длительность. У OpenAI это 25 МБ на запрос, у AssemblyAI — до 10 часов и 5 ГБ по ссылке.
  • Цена за минуту, а не за токены. У Google Cloud единица округления — 1 секунда, у Yandex SpeechKit в синхронном режиме — отрезок 15 секунд.
  • Есть ли диаризация и сколько она стоит отдельно. У AssemblyAI разметка говорящих в асинхронном режиме добавляет +$0.02 за час.
  • Что происходит с записью. Deepgram не хранит расшифровки; OpenAI держит логи антифрод-мониторинга до 30 дней.

Нейросеть для расшифровки аудио в текст: облако или своя машина

Развилка первая и главная: либо файл уходит в чужой API с оплатой за минуту, либо модель работает у вас и вы платите за железо и время.

Открытый вариант — Whisper от OpenAI: код и веса под лицензией MIT, то есть их можно ставить в коммерческий продукт без отдельного договора. Нужен установленный ffmpeg. Размеры моделей из README репозитория:

Модель Параметров Нужно VRAM Относительная скорость
tiny 39 млн ~1 ГБ ~10x
base 74 млн ~1 ГБ ~7x
small 244 млн ~2 ГБ ~4x
medium 769 млн ~5 ГБ ~2x
large 1550 млн ~10 ГБ 1x
turbo 809 млн ~6 ГБ ~8x

Turbo в репозитории описана как оптимизированная версия large-v3 с минимальной потерей точности, и это разумная точка старта: 6 ГБ видеопамяти есть на потребительской карте. Варианты с суффиксом .en (tiny.en, base.en, small.en, medium.en) существуют только для английского; для русского они бесполезны. Словарь языков в tokenizer.py содержит 100 кодов, русский среди них.

Локальный запуск выигрывает в трёх случаях: записей много и минутная оплата складывается в заметную сумму; запись нельзя выпускать из контура; нужна повторяемость. Проигрывает он в скорости настройки и в качестве на сложном звуке.

Сколько стоит минута: официальные тарифы зарубежных сервисов

Цены ниже взяты с прайс-страниц вендоров. Обратите внимание на разные единицы: одни считают минутами, другие часами.

Сервис и модель Цена по прайсу Час записи
OpenAI, gpt-4o-mini-transcribe $0.003 за минуту около $0.18
OpenAI, gpt-transcribe $0.0045 за минуту около $0.27
OpenAI, gpt-4o-transcribe $0.006 за минуту около $0.36
Deepgram, Nova-3 одноязычная $0.0043 за минуту около $0.26
Deepgram, Nova-3 многоязычная $0.0052 за минуту около $0.31
Deepgram, Whisper Large $0.0048 за минуту около $0.29
AssemblyAI, Universal-2 $0.15 за час $0.15
AssemblyAI, Universal-3.5 Pro $0.21 за час $0.21
Google Cloud STT v2, стандартная модель $0.016 за минуту около $0.96
Google Cloud STT v2, динамический батч $0.003 за минуту около $0.18

Три вещи ломают эту арифметику. У Google каждый канал тарифицируется отдельно: запись созвона с четырьмя каналами по 30 секунд посчитают как 120 секунд. В v2 действует ступенчатая скидка, после 500 000 минут в месяц ставка падает до $0.01, после 2 млн — до $0.004. Медицинские модели Google стоят $0.078 за минуту, почти в пять раз дороже стандартной.

Что дают на пробу: Deepgram — $200 кредитов новым аккаунтам, Speechmatics — $100 без привязки карты, а у AssemblyAI бесплатный уровень отмерен не деньгами, а объёмом: до 185 часов расшифровки готовых записей и до 333 часов стриминга, карта тоже не нужна. У ElevenLabs Scribe тарификация кредитная: 330 кредитов за минуту распознавания, а на бесплатном плане выдаётся 10 000 кредитов в месяц, то есть порядка получаса аудио.

Готовые сервисы без кода и их бесплатные лимиты

Если нужен не API, а интерфейс с кнопкой, смотрите на лимиты бесплатного плана. У Otter.ai бесплатный план Basic даёт 300 минут расшифровки в месяц, но не более 30 минут на одну запись и всего 3 импорта аудио- или видеофайлов за всё время существования аккаунта. План Pro стоит $8.33 за пользователя в месяц при годовой оплате (или $16.99 при помесячной) и поднимает планку до 1200 минут записи, до 90 минут на встречу и 10 импортов файлов в месяц.

Считайте по объёму. Три часа записей в неделю — это 720 минут в месяц: бесплатный план заканчивается в первую неделю, годовая подписка на четырёх человек обходится примерно в $400. Те же 720 минут прямым вызовом Deepgram Nova-3 стоят около $3 в месяц. Разница — плата за интерфейс и интеграции с календарём.

Ограничения на файл: вес, длительность и что делать с трёхчасовой записью

Самая частая причина отказа — лимиты, а не качество модели.

  • OpenAI: файл до 25 МБ, форматы mp3, mp4, mpeg, mpga, m4a, wav и webm. Документация прямо рекомендует резать более крупные файлы на куски по 25 МБ и не разрывать их посреди фразы.
  • Deepgram: максимум 2 ГБ. Запрос, обработка которого заняла больше 10 минут (Nova, Base, Enhanced) или 20 минут (Whisper), вернётся с ошибкой 504 Gateway Timeout, поэтому длинные записи отправляются с колбэком.
  • AssemblyAI: до 5 ГБ на запрос по ссылке и до 2,2 ГБ при локальной загрузке через /v2/upload; длительность от 160 мс до 10 часов на файл. Транскодировать заранее не требуется.
  • ElevenLabs Scribe: до 3 ГБ и до 10 часов в стандартном режиме, поддержка более 90 языков.

Пересчитайте лимит в минуты до загрузки. Несжатый WAV 16 кГц, 16 бит, моно даёт 32 КБ в секунду, около 115 МБ на час записи. В 25 МБ помещается примерно 26 минут mp3 на 128 кбит/с или около 52 минут моно на 64 кбит/с. Для речи 64 кбит/с достаточно, и это способ уложить часовое интервью в лимит OpenAI без нарезки.

Диаризация: кто именно это сказал

Без диаризации диалог двух человек склеивается в одну простыню, и расшифровка переговоров становится бесполезной: непонятно, кто дал обязательство и кто назвал цену. Разметка говорящих почти везде включается и оплачивается отдельно.

  • AssemblyAI включается флагом speaker_labels: true и стоит +$0.02 за час на готовых записях (одинаково у Universal-2 и Universal-3.5 Pro) и +$0.12 за час в стриминге.
  • ElevenLabs Scribe размечает до 32 говорящих и дополнительно отдаёт события audio_event для неречевых звуков вроде смеха или аплодисментов.
  • У OpenAI под эту задачу выделена отдельная модель gpt-4o-transcribe-diarize.

Общее ограничение: диаризация плохо работает на перекрывающейся речи. Когда двое говорят одновременно, алгоритм либо отдаёт реплику одному спикеру, либо режет её пополам. Если запись важна юридически, пишите каждого участника отдельной дорожкой: многоканальная запись снимает вопрос, хотя у Google и удваивает счёт.

Точность, WER и как её поднять на терминах

Качество измеряют метрикой WER (word error rate) — долей слов, которые модель вставила, потеряла или перепутала, от числа слов в эталоне. WER 5% значит, что каждое двадцатое слово придётся править руками. По замерам Artificial Analysis лидеры держатся около 2%: Scribe v2 от ElevenLabs даёт 2.2% WER, среди открытых весов лучший результат у Voxtral Small от Mistral — 2.8%, Whisper Large v3 Turbo на Groq — 4.6% при цене $0.67 за 1000 минут. Это бенчмарки на чистой речи, на вашем материале цифра будет хуже.

WER предсказуемо растёт на четырёх вещах: отраслевые термины и фамилии, которых не было в обучающих данных; сильный акцент; наложение голосов; телефонный канал с полосой 8 кГц. С последним борются специализированными моделями (у Google для этого есть отдельная модель phone_call).

С терминами борются подсказкой словаря до распознавания. Параметр keyterm у Deepgram работает на Nova-3 и Flux, принимает до 100 терминов, названий продуктов и компаний при ограничении 500 токенов на запрос; в примерах документации уверенность на слове «tretinoin» растёт с 0.71 до 0.96. У OpenAI ту же роль играет параметр prompt в gpt-4o-transcribe и gpt-4o-mini-transcribe. Список из полусотни ваших названий собирается за полчаса и снимает основную часть ручной правки после расшифровки.

Нейросеть для текста из видео: как вытащить звуковую дорожку

ASR-сервисам нужна звуковая дорожка, и платите вы за её длительность, а не за вес ролика. Часть сервисов принимает видеофайл как есть (AssemblyAI явно пишет, что перекодировать не надо), но у OpenAI с лимитом 25 МБ отправлять mp4 бессмысленно: почти весь вес там картинка.

Дорожка извлекается одной командой ffmpeg, того самого, который и так нужен для локального Whisper:

  • ffmpeg -i input.mp4 -vn -ac 1 -ar 16000 -c:a pcm_s16le out.wav — выбросить видеопоток, свести в моно, привести к 16 кГц.

16 кГц — частота дискретизации, на которую рассчитаны Whisper и большинство ASR-моделей; подавать 48 кГц смысла нет, сервис всё равно приведёт к своей. Если файл не влезает в лимит, отдайте вместо WAV mp3 моно на 64 кбит/с: разборчивость речи не пострадает, а вес упадёт примерно вчетверо.

Выгрузка с таймкодами: SRT, VTT и JSON

Голый текст без времени годится только для поиска по словам. Для монтажа, субтитров и навигации по записи нужны таймкоды.

  • Локальный Whisper в CLI управляется флагом —output_format и умеет txt, vtt, srt, tsv, json, jsonl или all сразу.
  • OpenAI API: у модели whisper-1 таймкоды включаются параметром timestamp_granularities[] на уровне слова или сегмента, ответ приходит в verbose JSON.
  • AssemblyAI: отдельный эндпоинт субтитров отдаёт srt и vtt, а параметр chars_per_caption задаёт максимальную длину строки титра.

Формат выбирается по получателю: SRT понимают монтажные программы и YouTube, VTT нужен веб-плееру, JSON со словами и временем — единственный вариант, если расшифровка идёт дальше в поиск, аналитику или другую модель. Если из файла дальше делаются субтитры в кадре или озвучка, это уже соседняя задача, она разобрана в материале про нейросети для дубляжа и перевода видео.

Нейросеть для перевода аудио в текст: когда на выходе нужен другой язык

Здесь важно развести два разных запроса. «Перевод аудио в текст» чаще всего означает просто транскрибацию. Но если нужен именно перевод на другой язык, у инструментов есть жёсткие ограничения.

У Whisper для этого предусмотрен режим —task translate, и он работает ровно в одну сторону: с любого языка на английский. Русских субтитров к английскому подкасту им не получить. Отдельная оговорка в документации: модель turbo при указании —task translate всё равно вернёт исходный язык, для перевода нужны medium или large. Для живого перевода на лету у OpenAI есть отдельная модель gpt-realtime-translate по $0.034 за минуту, но это другой сценарий: там на входе поток, а не готовый файл.

Рабочая схема для пары языков, которой нет в translate: сначала транскрибация на исходном языке, потом перевод готового текста отдельной моделью. Так дешевле, и вы правите термины до перевода, а не после.

Как собрать расшифровку в рабочий конвейер

Разовую запись можно перетащить в любой веб-сервис. Проблемы начинаются, когда записей десятки в неделю. Рабочий конвейер состоит из шести шагов: приём файла из хранилища или из системы созвонов, извлечение дорожки через ffmpeg, нарезка под лимит сервиса, отправка в API с колбэком (у Deepgram запрос вернёт 504, если обработка заняла больше 10 минут), сшивка кусков с пересчётом таймкодов и складывание результата туда, где его будут искать.

Два места, где такие конвейеры чаще всего ломаются. Первое — сшивка: если резать файл по времени вслепую, фраза рвётся пополам и на стыке появляется мусор, поэтому резать надо по паузам. Второе — повторы: без идемпотентности по хешу файла одна и та же запись уезжает в API дважды и оплачивается дважды.

Нужна расшифровка потоком, а не по одному файлу

Соберём конвейер под ваш объём: приём записей, извлечение дорожки, распознавание с диаризацией и словарём терминов, выгрузка с таймкодами в вашу систему. Посчитаем стоимость минуты на ваших реальных записях до старта работ.

Обсудить задачу

Куда уходит запись и что это значит для переговоров и приёмов

Загрузка файла в облако — это передача содержания разговора третьей стороне. Для маркетингового подкаста неважно, для переговоров, врачебного приёма или консультации юриста решающе.

Что говорят вендоры официально. OpenAI: данные из API не используются для обучения моделей с 1 марта 2023 года, если вы явно не согласились ими делиться; логи антифрод-мониторинга хранятся до 30 дней, для подходящих клиентов есть режим Zero Data Retention, исключающий контент из этих логов. Deepgram: расшифровки не хранятся вовсе, ответ API — единственная возможность их забрать. У Google в API v1 разница видна прямо в прайсе: распознавание с логированием стоит $0.016 за минуту, без логирования — $0.024, за приватность берут наценку в полтора раза.

Если запись по договору или по внутреннему регламенту не может покидать периметр, остаются два пути. Локальный Whisper на своём сервере (веса под MIT, наружу не уходит ничего) или российское облако. У Yandex SpeechKit тарификация такая: потоковое и синхронное распознавание — 0,1626 ₽ за 15 секунд, асинхронное — 0,1515 ₽, а асинхронное в отложенном режиме — 0,0381 ₽ за 15 секунд, то есть порядка 9 ₽ за час записи. Отложенный режим не даёт ответа сразу, зато он в четыре раза дешевле обычного асинхронного, и для архива интервью это правильный выбор.

Частые вопросы

Какая нейросеть для расшифровки текста лучше работает с русским языком

Из открытых — Whisper в размере large или turbo (turbo это оптимизированная версия large-v3, ей нужно около 6 ГБ видеопамяти). Из облачных — многоязычная Nova-3 у Deepgram за $0.0052 за минуту или Scribe v2 у ElevenLabs с поддержкой более 90 языков. Модели с суффиксом .en для русского не подходят вообще.

Сколько стоит расшифровать часовое интервью

По официальным прайсам на 22 августа 2026: около $0.18 через gpt-4o-mini-transcribe, около $0.26 через Deepgram Nova-3 одноязычную, $0.15 через AssemblyAI Universal-2 и около $0.96 через стандартную модель Google Cloud STT v2. Диаризация у AssemblyAI добавит к этому $0.02.

Почему сервис отказался принимать мой файл

Чаще всего дело в лимите, а не в формате. У OpenAI жёсткий потолок 25 МБ на запрос, у Deepgram — 2 ГБ и таймаут 504, если обработка запроса заняла больше 10 минут, у AssemblyAI — 10 часов на файл. Часовое интервью укладывается в 25 МБ, если пересжать его в mp3 моно на 64 кбит/с.

Можно ли расшифровать запись, не отдавая её в чужое облако

Да. Whisper выложен под лицензией MIT вместе с весами, запускается локально и требует только ffmpeg и видеокарту: 2 ГБ VRAM для small, около 10 ГБ для large. Альтернатива с сохранением данных в российском периметре — Yandex SpeechKit, где отложенный асинхронный режим стоит 0,0381 ₽ за 15 секунд.

Как получить субтитры, а не сплошной текст

Локальный Whisper выдаёт srt и vtt через флаг —output_format, у AssemblyAI есть отдельный эндпоинт субтитров с параметром chars_per_caption для длины строки, у whisper-1 в OpenAI API таймкоды включаются параметром timestamp_granularities[] на уровне слова или сегмента.

Поделиться:
X
Редакция Neurounit

Разборы инструментов, гайды и новости про нейросети, AI-маркетинг и автоматизацию. Материалы готовит редакция агентства Neurounit.

Факты и цифры проверяет редакция агентства Neurounit. Вопросы и уточнения: Telegram.

Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга