Нейросеть для озвучки текста превращает набранную строку в аудиофайл с голосом, интонацией и паузами. Технология называется TTS, text-to-speech, и в 2026 году она продаётся как обычный облачный ресурс: вы платите за символы или за запросы, получаете mp3 или поток и встраиваете его в свой продукт. Ниже разобрано, из чего складывается счёт, что дают бесплатные уровни, как заставить модель правильно ставить ударения в русском тексте, что нужно для клонирования голоса диктора и где синтез речи ломается на практике.
Старый конкатенативный синтез склеивал звук из заранее записанных кусочков, поэтому речь звучала рублено и не тянула незнакомые слова. Нейросетевой TTS работает иначе и проходит через несколько этапов: нормализация текста (числа, даты, сокращения разворачиваются в слова), перевод в фонемы, генерация просодии (длительность звуков, высота тона, паузы), затем вокодер собирает волновую форму.
Практическое следствие: качество теперь зависит не от размера базы записей, а от модели и её настроек. У ElevenLabs, например, линейка разведена по компромиссу между выразительностью и задержкой: Eleven v3 поддерживает более 70 языков и принимает до 5 000 символов за запрос, Multilingual v2 работает с 29 языками и принимает до 10 000 символов, а Flash v2.5 отвечает примерно за 75 миллисекунд, знает 32 языка и принимает до 40 000 символов. Русский поддерживают все три.
Запрос «нейросеть текст для речи» почти всегда означает синтез, но рядом живёт зеркальная задача: распознавание речи, STT, когда на входе звук, а на выходе текст. Это разные модели, разные единицы тарификации и разные метрики качества. Синтез считают по символам или по запросам, распознавание по секундам и часам аудио. У синтеза качество оценивают на слух, у распознавания измеряют WER, долю ошибочных слов.
Масштаб обучения тоже разный. Открытая модель распознавания Whisper от OpenAI обучалась на 680 000 часов размеченного аудио, её версия large содержит 1 550 млн параметров и требует около 10 ГБ видеопамяти, а облегчённая turbo содержит 809 млн параметров и укладывается примерно в 6 ГБ. Если задача именно в расшифровке записей, сравнение сервисов под неё собрано отдельно: лучшие нейросети для расшифровки текста.
Единица тарификации важнее самой цены, потому что она определяет, во сколько обойдётся ваш конкретный объём. Google Cloud считает символы, OpenAI считает токены отдельно на вход и на выход, Yandex SpeechKit в новом API считает не символы, а запросы. Ставки, проверенные в документации вендоров:
| Сервис и модель | Единица | Ставка |
|---|---|---|
| Google Chirp 3: HD | 1 млн символов | 30 долларов после бесплатного лимита |
| Google Neural2 | 1 млн символов | 16 долларов |
| Google Standard и WaveNet | 1 млн символов | 4 доллара |
| Google Studio | 1 млн символов | 160 долларов |
| OpenAI gpt-4o-mini-tts | 1 млн токенов | 0,60 доллара на входе и 12 долларов за аудио на выходе |
| SaluteSpeech, юрлица | 1 символ | 0,000186 рубля с НДС, то есть 186 рублей за 1 млн символов |
| Yandex SpeechKit, API v1 | 1 млн символов | 1 320 рублей с НДС |
| Yandex SpeechKit, API v3 | 1 запрос | 0,16 рубля с НДС |
| ElevenLabs Creator | подписка | 22 доллара в месяц за 121 000 кредитов |
Посчитайте на своём объёме до подключения. Статья на 10 000 знаков у Google на голосах Chirp 3: HD стоит 0,30 доллара, у Yandex по API v1 обойдётся в 13,20 рубля, у SaluteSpeech в 1,86 рубля. Но у SaluteSpeech для юрлиц на постоплате действует минимальный месячный платёж 15 000 рублей с НДС: если сервисом в месяце вообще не пользовались, платить не нужно, а вот при потреблении меньше этой суммы счёт всё равно составит 15 000 рублей, и озвучка десятка статей в такой модели экономически бессмысленна. Пакетная предоплата у того же вендора дешевле: 55 млн символов синтеза стоят 10 230 рублей на 12 месяцев.
Бесплатные уровни у синтеза считают сотнями тысяч и миллионами символов в месяц, поэтому на пилот и на прогон своего словаря их хватает. Что дают вендоры:
Отдельно смотрите на лимит длины запроса, он режет бесплатный сценарий чаще, чем сам объём. У gpt-4o-mini-tts вход ограничен 2 000 токенов, у Yandex SpeechKit API v3 запрос по умолчанию ограничен 250 символами и 24 секундами звучания, а при более длинных фразах тарифицируется каждые 250 символов: запрос на 600 символов это уже три единицы тарификации.
Английский TTS давно решён, русский ломается на трёх вещах. Первая: омографы, где ударение меняет смысл (замок и замок, стоит и стоит). Вторая: буква ё, которую в тексте обычно не пишут, и модель читает «все» вместо «всё». Третья: аббревиатуры, латиница и номенклатура, которые модель читает по буквам или по-английски.
Инструмент решения задан вендором. В моделях Silero ударение проставляется знаком плюс перед ударной гласной прямо в тексте (к+ошка), причём модели v5_cis_base требуют разметки для всех слов, а v5_cis_base_nostress только для славянских языков. Отдельные русские модели пятой версии ставят ударение и разбирают омографы сами, поэтому перед ручной разметкой проверьте, не умеет ли выбранная модель делать это автоматически. Silero версии 5 поддерживает SSML и частоты дискретизации 8 000, 24 000 и 48 000 Гц: 8 000 Гц берут для телефонии, 48 000 Гц для контента. Проверяйте озвучку на своём словаре: список из 30 реальных фраз с фамилиями клиентов, артикулами и суммами покажет проблему быстрее, чем демо на сайте вендора.
Есть два принципиально разных способа управлять просодией. Первый, классический: разметка SSML, где паузы, скорость и ударение задаются тегами, а сами символы разметки тарифицируются как обычный текст. У SaluteSpeech это прописано прямо в правилах: единица тарификации это один символ, включая пробелы и символы SSML-разметки, то есть за разметку вы платите.
Второй способ появился у моделей нового поколения. У OpenAI в gpt-4o-mini-tts SSML не нужен, тон задаётся текстовой инструкцией: документация перечисляет управление акцентом, эмоциональным диапазоном, интонацией, скоростью речи, тоном и шёпотом. В той же модели доступно 13 встроенных голосов, а форматы выгрузки: mp3, opus, aac, flac, wav и pcm, причём для минимальной задержки вендор рекомендует wav или pcm. Для потокового сценария это существенно: mp3 требует буферизации, wav отдаёт первые сэмплы сразу.
Рабочих мест у TTS немного, и у каждого свой ограничитель.
Ломается синтез предсказуемо: на числах и единицах измерения, на иностранных именах, на длинных предложениях без знаков препинания и на попытке передать иронию. Модель не понимает смысл фразы, она предсказывает звучание, поэтому смысловое ударение в спорном предложении ставит наугад.
Нужен не файл, а работающий голосовой контур
Мы собираем связку синтеза и распознавания внутри процесса: телефония, бот, CRM, логи и метрики. Разберём вашу задачу и посчитаем стоимость на реальном объёме символов и минут.
Клонирование делится на два класса. Быстрое клонирование строится по короткому образцу: у ElevenLabs Instant Voice Cloning работает с записями короче двух минут и доступен на большинстве платных планов, начиная со Starter за 6 долларов. Профессиональное клонирование требует расширенного набора обучающих записей, доступно с плана Creator за 22 доллара и подтверждается голосовой капчей, чтобы клон создавался с образцов собственного голоса пользователя.
Корпоративный сегмент устроен дороже, зато с гарантиями. В Yandex SpeechKit Brand Voice Lite создание одного голоса это разовый платёж 9 000 рублей, первые семь дней хостинг не тарифицируется для тестов, дальше хостинг одного голоса стоит 100 000 рублей в месяц, второго 90 000 рублей, шестого и последующих 50 000 рублей, плюс 0,16 рубля за каждый запрос синтеза (ставки по официальной документации, снимок от 4 декабря 2025 года). У Google мгновенный кастомный голос тарифицируется вдвое дороже каталожного: 60 долларов за 1 млн символов против 30.
Голос диктора это не только звуковая дорожка. Если по записи можно установить личность и оператор использует её именно для установления личности, запись попадает под режим биометрических персональных данных: часть 1 статьи 11 закона № 152-ФЗ разрешает обрабатывать такие сведения только при наличии согласия субъекта в письменной форме. Идентификация и аутентификация по биометрии в России дополнительно регулируются законом № 572-ФЗ от 29 декабря 2022 года.
Отдельная норма про сам голос как объект прав пока в стадии законопроекта: проект № 718834-8 предлагает дополнить Гражданский кодекс статьёй 152.3 и разрешить обнародование и дальнейшее использование голоса гражданина только с его согласия, включая случаи, когда голос сгенерирован искусственным интеллектом. Документ внесён в Госдуму осенью 2024 года, статус проверяйте в карточке законопроекта перед запуском проекта с клонированным голосом.
Практический минимум до записи: письменное согласие носителя голоса с указанием сроков и сценариев использования, отдельный пункт про синтез и клонирование, договорённость о том, что происходит с моделью голоса после окончания сотрудничества, и запрет на передачу модели третьим лицам.
Порядок отбора имеет значение: юрисдикция и единица тарификации отсекают вендоров быстрее и дешевле, чем прослушивание демо.
Пять вопросов перед подключением TTS
Русский поддерживают все крупные вендоры: у ElevenLabs он есть и в Eleven v3 с более чем 70 языками, и в Flash v2.5 с 32 языками, у Yandex SpeechKit и SaluteSpeech русский профильный. Выбор решается не языком, а ударениями и вашим словарём: проверьте 30 своих фраз и сравните, где меньше ручных правок.
Да, в пределах бесплатных уровней: Google даёт 4 млн символов в месяц на голосах Standard и WaveNet, Azure на уровне F0 даёт 0,5 млн символов в месяц. У ElevenLabs бесплатный план даёт 10 000 кредитов в месяц, но коммерческая лицензия начинается с плана Starter за 6 долларов.
По ставке Google Chirp 3: HD в 30 долларов за 1 млн символов это 0,30 доллара, по ставке Yandex SpeechKit API v1 в 1 320 рублей за 1 млн символов это 13,20 рубля, по ставке SaluteSpeech для юрлиц в 0,000186 рубля за символ это 1,86 рубля без учёта минимального месячного платежа 15 000 рублей.
Технически хватает короткого образца: ElevenLabs создаёт мгновенный клон по записи короче двух минут на планах от Starter. Юридически нужно письменное согласие носителя голоса, поскольку часть 1 статьи 11 закона № 152-ФЗ требует письменного согласия на обработку биометрических персональных данных.
Модель предсказывает звучание, а не понимает смысл, поэтому на омографах ошибается. Лечится разметкой: в моделях Silero ударение задаётся знаком плюс перед гласной (к+ошка), в облачных сервисах ту же роль играет SSML, при этом у SaluteSpeech символы SSML-разметки тарифицируются наравне с текстом.