Нейросеть для озвучки текста: синтез речи, тарифы и клонирование голоса

Все статьи
Все статьи
Редакция Neurounit
18 июля 2026
Обновлено 22 августа 2026
Нейросети
Нейросеть для озвучки текста: синтез речи, тарифы и клонирование голоса
Голосовые нейросети: как работают синтез (TTS) и распознавание речи (STT), где применять в бизнесе, какие подводные камни и с чего начать внедрение.

Нейросеть для озвучки текста превращает набранную строку в аудиофайл с голосом, интонацией и паузами. Технология называется TTS, text-to-speech, и в 2026 году она продаётся как обычный облачный ресурс: вы платите за символы или за запросы, получаете mp3 или поток и встраиваете его в свой продукт. Ниже разобрано, из чего складывается счёт, что дают бесплатные уровни, как заставить модель правильно ставить ударения в русском тексте, что нужно для клонирования голоса диктора и где синтез речи ломается на практике.

Как работает синтез речи и почему это уже не читалка из 2010 года

Старый конкатенативный синтез склеивал звук из заранее записанных кусочков, поэтому речь звучала рублено и не тянула незнакомые слова. Нейросетевой TTS работает иначе и проходит через несколько этапов: нормализация текста (числа, даты, сокращения разворачиваются в слова), перевод в фонемы, генерация просодии (длительность звуков, высота тона, паузы), затем вокодер собирает волновую форму.

Практическое следствие: качество теперь зависит не от размера базы записей, а от модели и её настроек. У ElevenLabs, например, линейка разведена по компромиссу между выразительностью и задержкой: Eleven v3 поддерживает более 70 языков и принимает до 5 000 символов за запрос, Multilingual v2 работает с 29 языками и принимает до 10 000 символов, а Flash v2.5 отвечает примерно за 75 миллисекунд, знает 32 языка и принимает до 40 000 символов. Русский поддерживают все три.

Нейросеть текст для речи и обратная задача: TTS и STT это разные модели

Запрос «нейросеть текст для речи» почти всегда означает синтез, но рядом живёт зеркальная задача: распознавание речи, STT, когда на входе звук, а на выходе текст. Это разные модели, разные единицы тарификации и разные метрики качества. Синтез считают по символам или по запросам, распознавание по секундам и часам аудио. У синтеза качество оценивают на слух, у распознавания измеряют WER, долю ошибочных слов.

Масштаб обучения тоже разный. Открытая модель распознавания Whisper от OpenAI обучалась на 680 000 часов размеченного аудио, её версия large содержит 1 550 млн параметров и требует около 10 ГБ видеопамяти, а облегчённая turbo содержит 809 млн параметров и укладывается примерно в 6 ГБ. Если задача именно в расшифровке записей, сравнение сервисов под неё собрано отдельно: лучшие нейросети для расшифровки текста.

Нейросеть для генерации голоса из текста: за что берут деньги

Единица тарификации важнее самой цены, потому что она определяет, во сколько обойдётся ваш конкретный объём. Google Cloud считает символы, OpenAI считает токены отдельно на вход и на выход, Yandex SpeechKit в новом API считает не символы, а запросы. Ставки, проверенные в документации вендоров:

Сервис и модель Единица Ставка
Google Chirp 3: HD 1 млн символов 30 долларов после бесплатного лимита
Google Neural2 1 млн символов 16 долларов
Google Standard и WaveNet 1 млн символов 4 доллара
Google Studio 1 млн символов 160 долларов
OpenAI gpt-4o-mini-tts 1 млн токенов 0,60 доллара на входе и 12 долларов за аудио на выходе
SaluteSpeech, юрлица 1 символ 0,000186 рубля с НДС, то есть 186 рублей за 1 млн символов
Yandex SpeechKit, API v1 1 млн символов 1 320 рублей с НДС
Yandex SpeechKit, API v3 1 запрос 0,16 рубля с НДС
ElevenLabs Creator подписка 22 доллара в месяц за 121 000 кредитов

Посчитайте на своём объёме до подключения. Статья на 10 000 знаков у Google на голосах Chirp 3: HD стоит 0,30 доллара, у Yandex по API v1 обойдётся в 13,20 рубля, у SaluteSpeech в 1,86 рубля. Но у SaluteSpeech для юрлиц на постоплате действует минимальный месячный платёж 15 000 рублей с НДС: если сервисом в месяце вообще не пользовались, платить не нужно, а вот при потреблении меньше этой суммы счёт всё равно составит 15 000 рублей, и озвучка десятка статей в такой модели экономически бессмысленна. Пакетная предоплата у того же вендора дешевле: 55 млн символов синтеза стоят 10 230 рублей на 12 месяцев.

Нейросеть голоса бесплатно: где заканчивается бесплатный уровень

Бесплатные уровни у синтеза считают сотнями тысяч и миллионами символов в месяц, поэтому на пилот и на прогон своего словаря их хватает. Что дают вендоры:

  • Google Cloud Text-to-Speech: 4 млн символов в месяц на голосах Standard и WaveNet и 1 млн символов в месяц на Chirp 3: HD и Neural2. Дальше по ставкам из таблицы выше.
  • Azure Speech, уровень F0: 0,5 млн символов нейросинтеза в месяц плюс 5 часов распознавания речи в месяц.
  • ElevenLabs Free: 10 000 кредитов в месяц, но коммерческая лицензия начинается с плана Starter за 6 долларов в месяц с 30 000 кредитов. На бесплатном плане озвучивать ролик клиента нельзя.
  • SaluteSpeech Freemium: 200 000 символов синтеза и 100 минут распознавания в месяц для физлиц. Важно: с 15 июля 2026 года Сбер прекратил продажу новых пакетов и продление Freemium для физлиц, ранее купленные пакеты дорабатывают свой срок.
  • Silero: модели ставятся на свой сервер, платить вендору не нужно. Лицензия смешанная: базовые CIS-модели синтеза опубликованы под MIT, остальные модели репозитория под CC-NC-BY, то есть без коммерческого использования.

Отдельно смотрите на лимит длины запроса, он режет бесплатный сценарий чаще, чем сам объём. У gpt-4o-mini-tts вход ограничен 2 000 токенов, у Yandex SpeechKit API v3 запрос по умолчанию ограничен 250 символами и 24 секундами звучания, а при более длинных фразах тарифицируется каждые 250 символов: запрос на 600 символов это уже три единицы тарификации.

Нейросеть для озвучки текста на русском: ударения, ё и омографы

Английский TTS давно решён, русский ломается на трёх вещах. Первая: омографы, где ударение меняет смысл (замок и замок, стоит и стоит). Вторая: буква ё, которую в тексте обычно не пишут, и модель читает «все» вместо «всё». Третья: аббревиатуры, латиница и номенклатура, которые модель читает по буквам или по-английски.

Инструмент решения задан вендором. В моделях Silero ударение проставляется знаком плюс перед ударной гласной прямо в тексте (к+ошка), причём модели v5_cis_base требуют разметки для всех слов, а v5_cis_base_nostress только для славянских языков. Отдельные русские модели пятой версии ставят ударение и разбирают омографы сами, поэтому перед ручной разметкой проверьте, не умеет ли выбранная модель делать это автоматически. Silero версии 5 поддерживает SSML и частоты дискретизации 8 000, 24 000 и 48 000 Гц: 8 000 Гц берут для телефонии, 48 000 Гц для контента. Проверяйте озвучку на своём словаре: список из 30 реальных фраз с фамилиями клиентов, артикулами и суммами покажет проблему быстрее, чем демо на сайте вендора.

Управление интонацией: SSML против текстовых инструкций

Есть два принципиально разных способа управлять просодией. Первый, классический: разметка SSML, где паузы, скорость и ударение задаются тегами, а сами символы разметки тарифицируются как обычный текст. У SaluteSpeech это прописано прямо в правилах: единица тарификации это один символ, включая пробелы и символы SSML-разметки, то есть за разметку вы платите.

Второй способ появился у моделей нового поколения. У OpenAI в gpt-4o-mini-tts SSML не нужен, тон задаётся текстовой инструкцией: документация перечисляет управление акцентом, эмоциональным диапазоном, интонацией, скоростью речи, тоном и шёпотом. В той же модели доступно 13 встроенных голосов, а форматы выгрузки: mp3, opus, aac, flac, wav и pcm, причём для минимальной задержки вендор рекомендует wav или pcm. Для потокового сценария это существенно: mp3 требует буферизации, wav отдаёт первые сэмплы сразу.

Куда синтез речи ставят в продукте и где он ломается

Рабочих мест у TTS немного, и у каждого свой ограничитель.

  1. Голосовой бот и IVR. Здесь решает задержка. Ориентир по вендорской документации: Flash v2.5 отвечает примерно за 75 миллисекунд, разговорная модель Eleven v3 Conversational примерно за 280 миллисекунд. К этому добавляется распознавание входящей реплики и ответ языковой модели, поэтому бюджет на весь цикл считайте целиком.
  2. Аудиоверсия статьи и рассылки. Задержка не важна, важна цена за объём и лимит на запрос: текст режется на куски, каждый кусок это отдельный тарифицируемый запрос.
  3. Обучающие материалы и инструкции. Правки в тексте не требуют пересъёмки, но требуют дисциплины версий: храните исходный текст, а не только полученный mp3.
  4. Оповещения и телефония. Работает узкий словарь и частота 8 000 Гц, зато требования к разборчивости выше обычного.

Ломается синтез предсказуемо: на числах и единицах измерения, на иностранных именах, на длинных предложениях без знаков препинания и на попытке передать иронию. Модель не понимает смысл фразы, она предсказывает звучание, поэтому смысловое ударение в спорном предложении ставит наугад.

Нужен не файл, а работающий голосовой контур

Мы собираем связку синтеза и распознавания внутри процесса: телефония, бот, CRM, логи и метрики. Разберём вашу задачу и посчитаем стоимость на реальном объёме символов и минут.

Обсудить задачу

Клонирование голоса: что нужно технически

Клонирование делится на два класса. Быстрое клонирование строится по короткому образцу: у ElevenLabs Instant Voice Cloning работает с записями короче двух минут и доступен на большинстве платных планов, начиная со Starter за 6 долларов. Профессиональное клонирование требует расширенного набора обучающих записей, доступно с плана Creator за 22 доллара и подтверждается голосовой капчей, чтобы клон создавался с образцов собственного голоса пользователя.

Корпоративный сегмент устроен дороже, зато с гарантиями. В Yandex SpeechKit Brand Voice Lite создание одного голоса это разовый платёж 9 000 рублей, первые семь дней хостинг не тарифицируется для тестов, дальше хостинг одного голоса стоит 100 000 рублей в месяц, второго 90 000 рублей, шестого и последующих 50 000 рублей, плюс 0,16 рубля за каждый запрос синтеза (ставки по официальной документации, снимок от 4 декабря 2025 года). У Google мгновенный кастомный голос тарифицируется вдвое дороже каталожного: 60 долларов за 1 млн символов против 30.

Клонирование голоса: что нужно юридически

Голос диктора это не только звуковая дорожка. Если по записи можно установить личность и оператор использует её именно для установления личности, запись попадает под режим биометрических персональных данных: часть 1 статьи 11 закона № 152-ФЗ разрешает обрабатывать такие сведения только при наличии согласия субъекта в письменной форме. Идентификация и аутентификация по биометрии в России дополнительно регулируются законом № 572-ФЗ от 29 декабря 2022 года.

Отдельная норма про сам голос как объект прав пока в стадии законопроекта: проект № 718834-8 предлагает дополнить Гражданский кодекс статьёй 152.3 и разрешить обнародование и дальнейшее использование голоса гражданина только с его согласия, включая случаи, когда голос сгенерирован искусственным интеллектом. Документ внесён в Госдуму осенью 2024 года, статус проверяйте в карточке законопроекта перед запуском проекта с клонированным голосом.

Практический минимум до записи: письменное согласие носителя голоса с указанием сроков и сценариев использования, отдельный пункт про синтез и клонирование, договорённость о том, что происходит с моделью голоса после окончания сотрудничества, и запрет на передачу модели третьим лицам.

Как выбрать сервис под свою задачу

Порядок отбора имеет значение: юрисдикция и единица тарификации отсекают вендоров быстрее и дешевле, чем прослушивание демо.

  1. Юрисдикция и оплата. Российское юрлицо, оплата в рублях и закрытый контур сразу оставляют SaluteSpeech, Yandex SpeechKit и локальные модели вроде Silero.
  2. Единица тарификации против вашего профиля нагрузки. Много коротких реплик это боль при оплате за запрос, длинные тексты это боль при дорогом символе.
  3. Лимит на запрос. 250 символов, 2 000 токенов, 5 000 или 40 000 символов это разная архитектура вашего кода.
  4. Русский на вашем словаре. Тест на 30 реальных фразах, а не на демо-тексте.
  5. Права. Коммерческая лицензия у ElevenLabs начинается со Starter, у Silero часть моделей под CC-NC-BY, то есть без коммерции.

Пять вопросов перед подключением TTS

  1. Сколько символов в месяц вы реально озвучиваете и сколько это стоит по ставке вендора?
  2. Какая допустимая задержка от конца реплики пользователя до начала звука?
  3. Кто носитель голоса и есть ли письменное согласие на синтез?
  4. Что делает система, если сервис синтеза недоступен: молчит, читает запасным голосом или отдаёт заранее записанный файл?
  5. Где хранятся исходные тексты и как выкатывается правка озвучки без пересборки продукта?

Обсудить задачу

Частые вопросы

Какая нейросеть для озвучки текста лучше работает с русским языком?

Русский поддерживают все крупные вендоры: у ElevenLabs он есть и в Eleven v3 с более чем 70 языками, и в Flash v2.5 с 32 языками, у Yandex SpeechKit и SaluteSpeech русский профильный. Выбор решается не языком, а ударениями и вашим словарём: проверьте 30 своих фраз и сравните, где меньше ручных правок.

Можно ли озвучивать текст нейросетью бесплатно и легально?

Да, в пределах бесплатных уровней: Google даёт 4 млн символов в месяц на голосах Standard и WaveNet, Azure на уровне F0 даёт 0,5 млн символов в месяц. У ElevenLabs бесплатный план даёт 10 000 кредитов в месяц, но коммерческая лицензия начинается с плана Starter за 6 долларов.

Сколько стоит озвучить статью на 10 000 знаков?

По ставке Google Chirp 3: HD в 30 долларов за 1 млн символов это 0,30 доллара, по ставке Yandex SpeechKit API v1 в 1 320 рублей за 1 млн символов это 13,20 рубля, по ставке SaluteSpeech для юрлиц в 0,000186 рубля за символ это 1,86 рубля без учёта минимального месячного платежа 15 000 рублей.

Что нужно, чтобы клонировать голос диктора?

Технически хватает короткого образца: ElevenLabs создаёт мгновенный клон по записи короче двух минут на планах от Starter. Юридически нужно письменное согласие носителя голоса, поскольку часть 1 статьи 11 закона № 152-ФЗ требует письменного согласия на обработку биометрических персональных данных.

Почему нейросеть неправильно ставит ударения и как это чинить?

Модель предсказывает звучание, а не понимает смысл, поэтому на омографах ошибается. Лечится разметкой: в моделях Silero ударение задаётся знаком плюс перед гласной (к+ошка), в облачных сервисах ту же роль играет SSML, при этом у SaluteSpeech символы SSML-разметки тарифицируются наравне с текстом.

Поделиться:
X
Редакция Neurounit

Разборы инструментов, гайды и новости про нейросети, AI-маркетинг и автоматизацию. Материалы готовит редакция агентства Neurounit.

Факты и цифры проверяет редакция агентства Neurounit. Вопросы и уточнения: Telegram.

Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга