Нейросеть для перевода видео: дубляж, озвучка и субтитры

Все статьи
Все статьи
Редакция Neurounit
24 июля 2026
Обновлено 22 августа 2026
Нейросети
Нейросеть для перевода видео: дубляж, озвучка и субтитры
Как нейросеть переводит и дублирует видео: распознавание речи, синтез голоса, липсинк. Разбираем этапы, ограничения и как внедрить это в контент бизнеса.

Нейросеть для перевода видео решает не одну задачу, а четыре подряд: снимает речь со звуковой дорожки, переводит реплики с укладкой в тайминг, синтезирует новый голос и подгоняет артикуляцию под чужой язык. На выходе получается видеофайл, а не текст, и это меняет всё: ошибка на первом этапе доезжает до последнего, а исправлять её приходится там, где она возникла.

Разброс по языкам большой: ElevenLabs заявляет дубляж на 90 с лишним языков, HeyGen на планах Pro и Business — 175 языков и диалектов, Rask AI — 135 языков перевода при клонировании голоса на 32 из них, YouTube в автодубляже принимает 30 исходных языков, а с английского дублирует на 20. Whisper от OpenAI по документации покрывает 98 языков с разной точностью. Ниже: из чего складывается качество на каждом этапе, сколько это стоит и где машина уступает человеку.

Что делает нейросеть для перевода видео: четыре этапа конвейера

Любой сервис локализации устроен внутри одинаково, различается только глубина контроля на каждом шаге.

  1. Распознавание речи (ASR). Звук превращается в текст с таймкодами и разметкой спикеров. Здесь появляются первые ошибки: имена, термины, аббревиатуры.
  2. Перевод реплик. Текст переводится не пословно, а с оглядкой на длительность исходной фразы, иначе дорожка не ляжет в монтаж.
  3. Синтез речи (TTS). Перевод озвучивается либо голосом из библиотеки, либо клоном голоса спикера.
  4. Липсинк. Кадр перерисовывается так, чтобы движение губ совпало с новой дорожкой. Самый дорогой этап и единственный отключаемый.

У HeyGen разделение видно прямо в тарификации: дубляж без липсинка стоит 2 кредита за минуту, полный перевод видео с липсинком — 5 кредитов за минуту. То есть синхронизация губ дороже всех трёх предыдущих этапов вместе взятых.

Распознавание речи: где закладывается качество всего дубляжа

Если ASR услышал «Кубернетес» как «Кувер нетес», ошибка поедет в перевод, в озвучку и в субтитры. Whisper от OpenAI выложен под лицензией MIT и запускается локально; размер модели задаёт требования к железу и скорость:

Модель Параметры VRAM Скорость относительно large
tiny 39M около 1 ГБ примерно 10x
base 74M около 1 ГБ примерно 7x
small 244M около 2 ГБ примерно 4x
medium 769M около 5 ГБ примерно 2x
large 1550M около 10 ГБ 1x
turbo 809M около 6 ГБ примерно 8x

Важная деталь: модель turbo не обучалась задаче перевода, для режима translate нужны medium или large. Через API OpenAI расшифровка стоит 0,006 доллара за минуту на gpt-4o-transcribe и 0,003 доллара за минуту на экономичном gpt-4o-mini-transcribe. Лимит загружаемого файла — 25 МБ, принимаются mp3, mp4, mpeg, mpga, m4a, wav и webm. Часовое интервью в исходном качестве в 25 МБ не влезет, дорожку придётся сжимать или резать.

Ещё одно ограничение: эндпоинт /v1/audio/translations у OpenAI переводит только на английский. Для русского, испанского или китайского перевод делает отдельная модель, а не сама ASR.

Перевод реплик: почему укладка в тайминг важнее буквальности

Запрос «нейросеть перевод» обычно приводит человека к переводчику текста, но в видео задача другая. Реплика на 3,2 секунды должна остаться репликой примерно на 3,2 секунды, иначе спикер закроет рот раньше, чем закончится фраза. Русский текст в среднем длиннее английского, и сервис вынужден либо сокращать формулировку, либо ускорять речь, либо съедать паузу.

Отсюда три вещи, которые стоит настроить до запуска:

  • Глоссарий. Названия продуктов, фамилии, единицы измерения фиксируются заранее. Без него один и тот же термин переводится в ролике по-разному.
  • Вычитка транскрипта до синтеза. В HeyGen правка переведённого скрипта доступна с плана Pro за 49 долларов в месяц, на Free и Creator текст правится уже постфактум. В Descript вычитка перевода включена только в Business и Enterprise.
  • Фильтры. В API дубляжа ElevenLabs есть параметр use_profanity_filter в статусе бета и экспериментальный target_accent, задающий акцент целевого языка.

Нейросеть для озвучки видео: клон голоса или диктор из библиотеки

Нейросеть для озвучки видео работает по одной из двух стратегий. Первая: взять готовый синтетический голос из библиотеки — быстро, предсказуемо, годится для инструкций и онбординга. Вторая: клонировать тембр самого спикера, чтобы на английском и на немецком звучал тот же человек. Это критично для личного бренда и для роликов с лицом основателя.

Технические рамки на примере ElevenLabs. Автодубляж распознаёт до 32 уникальных спикеров в одном файле, в том числе при перекрывающейся речи; параметр num_speakers со значением 0 включает автоопределение. Степень сходства клона задаёт cloning strength в диапазоне от 0 до 10, по умолчанию 7. Клонирование отключается флагом disable_voice_cloning, тогда озвучка идёт голосами из библиотеки. Флаг drop_background_audio убирает фоновую дорожку и спасает ролики с музыкой под речью.

У Rask AI перекос виден в цифрах: перевод на 135 языков, клонирование голоса только на 32. Проверяйте целевой язык по узкому списку до оплаты плана.

Как устроен синтез речи изнутри и что требуется для законного клонирования голоса диктора, разобрано в материале про голосовые нейросети: синтез и распознавание речи.

Липсинк: где проходит граница правдоподобия

Липсинк уверенно работает на говорящей голове: интервью, презентация, реклама с фронтальным планом. Он рассыпается на профильных ракурсах, резких поворотах головы, при контровом свете и когда рот перекрыт микрофоном или рукой.

В API HeyGen есть два режима обработки: Speed mode для быстрой пакетной прогонки, где скорость важнее идеальной синхронизации, и Precision mode для максимальной точности. Мультиспикерный липсинк у Rask AI появляется только на плане Creator Pro за 150 долларов в месяц со 100 минутами в пакете, на Creator за 60 долларов и 25 минут его нет. У ElevenLabs синхронизация губ в описании возможностей дубляжа не заявлена вовсе: сервис работает со звуковой дорожкой.

Субтитры: форматы, вшивание и что принимает YouTube

Субтитры для видео нейросеть собирает из того же транскрипта, что идёт в озвучку, поэтому дешевле выпустить обе версии сразу: дублированную дорожку и файл подписей. Из Dubbing Studio у ElevenLabs выгружаются AAC, MP3, WAV, zip с дорожками, zip с клипами, AAF с данными таймлайна, SRT с субтитрами и CSV с полями спикера, времени начала и конца, транскрипции и перевода. Формат AAF нужен монтажёру, CSV удобен для вычитки в таблице.

YouTube принимает два уровня форматов. Базовые: .srt, .sbv или .sub, .mpsub, .lrc, .cap, причём для .srt поддерживаются только базовые версии файлов, без разметки стиля. Продвинутые, со стилем и позиционированием: .smi или .sami, .rt, .vtt, .ttml. Для телевещания предпочтительным назван .scc, принимаются также .stl и файлы под стандарт CEA-608.

Разрыв между субтитрами и дубляжом бывает существенным: у Descript перевод подписей доступен на 61 язык, а перевод аудио только на 30.

Сервисы и цены: что сравнивать перед выбором

Сервис Языки Вход по цене Ключевое ограничение
ElevenLabs Dubbing 90 с лишним Free 10 000 кредитов, Starter 6 долларов за 30 000 Автодубляж до 1 ГБ и 180 минут в приложении, до 3 ГБ через API; Dubbing Studio до 45 минут и в режиме поддержки
HeyGen Video Translate 30 с лишним на Free и Creator, 175 на Pro и Business Creator 29 долларов за 600 кредитов На Free одна минута на видео, правка скрипта перевода только с Pro
Rask AI 135 перевод, 32 клонирование голоса Creator 60 долларов за 25 минут Мультиспикерный липсинк только с Creator Pro за 150 долларов; докупить минуты по 3 доллара можно с того же плана и лишь на годовой оплате
Descript 25 транскрибация, 61 субтитры, 30 дубляж от 16 долларов в месяц при годовой оплате, 24 при помесячной Медиачасы на редактора: 1, 10, 30 и 40 по планам; вычитка перевода только с Business
Kapwing более 60 автоперевод Free 0, Pro 16 долларов при годовой оплате На Free экспорт до 4 минут, 720p и 30 минут в месяц; на Pro перевод до 500 минут в месяц
YouTube автодубляж 30 исходных, с английского на 20 бесплатно Не дублируются ролики длиннее 120 минут и преимущественно музыкальные

Сколько стоит перевести десятиминутный ролик

Считаем на примере: видео на 10 минут, один целевой язык, без водяного знака.

  • ElevenLabs, автодубляж. 3 000 кредитов за минуту без водяного знака, итого 30 000: ровно весь месячный пакет Starter за 6 долларов. Со знаком 2 000 за минуту, 20 000 на ролик. Пакета Free в 10 000 кредитов хватит на 5 минут, но снять водяной знак на бесплатном плане нельзя.
  • ElevenLabs, Dubbing Studio. 10 000 кредитов за минуту без знака, 100 000 на ролик. План Creator за 22 доллара даёт 121 000 кредитов в месяц: один ролик съедает почти весь пакет.
  • HeyGen. С липсинком 5 кредитов за минуту, 50 кредитов на ролик. Пакет Creator в 600 кредитов за 29 долларов — это 120 минут перевода с липсинком в месяц. Без липсинка 2 кредита за минуту, 20 кредитов на ролик и 300 минут в месяц на том же пакете.
  • Rask AI. План Creator — 60 долларов за 25 минут, то есть 2,4 доллара за минуту. Десятиминутный ролик забирает почти половину месячного пакета.
  • Своими руками. Расшифровка через API OpenAI — 0,006 доллара за минуту, 0,06 на ролик. Локальный Whisper под MIT бесплатен, платите только за перевод и синтез.

Разброс на одном ролике — от нескольких центов до десятков долларов. Решает не цена минуты, а объём ручной вычитки после машины.

Локализация как поток, а не разовый эксперимент

Один ролик легко перевести руками. Двадцать роликов в месяц на трёх языках — это конвейер: подготовка исходников, глоссарий, вычитка, сборка и выгрузка в каналы. Соберём такой процесс под ваш контент и посчитаем стоимость минуты на ваших объёмах.

Обсудить задачу

Бесплатные пути: YouTube, браузер и локальный Whisper

Автодубляж YouTube включён по умолчанию для подходящих авторов. Ролики на английском дублируются в том числе на русский, украинский, немецкий, французский, испанский, португальский, итальянский, польский, японский, корейский, хинди, арабский и иврит. Не дублируются видео длиннее 120 минут, преимущественно музыкальные и на неподдерживаемых исходных языках. В части языков система передаёт высоту и интонацию оригинального голоса. Ошибки возможны из-за произношения, акцентов, диалектов и фонового шума. Автор отключает функцию в Студии или включает ручную проверку до публикации; управление дорожками доступно только в десктопной Студии.

Второй бесплатный путь — локальный Whisper. Лицензия MIT снимает вопрос о правах на использование, модель small на 244M параметров укладывается примерно в 2 ГБ видеопамяти и работает примерно вчетверо быстрее модели large. Для черновой расшифровки перед ручным переводом этого достаточно.

Третий вариант — закадровый перевод прямо в браузере. Яндекс Браузер переводит дорожку видео на сторонних сайтах на лету и без оплаты, актуальный перечень языков и ограничений смотрите в справке вендора. Это инструмент для просмотра: файла на выходе не будет.

Согласие на голос, водяные знаки и пометки об автопереводе

Клонирование голоса — обработка биометрии человека, а не техническая опция. Согласие спикера на создание клона и его использование в конкретных языках и каналах фиксируется письменно: в договоре с диктором или в допсоглашении с сотрудником. Отдельно оговаривается срок: голос, обученный один раз, живёт в аккаунте и после увольнения.

Вторая линия — маркировка. У ElevenLabs водяной знак завязан на цену: 2 000 кредитов за минуту с ним против 3 000 без него в автодубляже и 5 000 против 10 000 в Dubbing Studio, то есть отказ от знака добавляет половину цены в автодубляже и удваивает её в Dubbing Studio. На бесплатном плане знак не снимается вовсе. У YouTube ролики с автоматической дорожкой помечаются как auto-dubbed прямо в описании, а зритель сам переключается между оригиналом и дубляжом.

Где нейросеть проигрывает и как встроить перевод в регулярный процесс

Слабые места предсказуемы. Эмоция и актёрская игра: художественный контент машина отыгрывает плоско. Термины и имена собственные: без глоссария и финальной вычитки появятся выдуманные названия. Плотный монтаж: быстрые склейки и речь поверх музыки рассыпают тайминг, здесь помогает drop_background_audio, но не всегда. Перекрывающаяся речь нескольких спикеров формально поддерживается (у ElevenLabs до 32 голосов в файле), но требует ручной сверки разметки.

Чтобы перевод перестал быть разовым экспериментом, конвейер собирают по шагам:

  1. Готовят исходник. Чистая речевая дорожка, лицо фронтально, музыка не громче речи, файл в лимитах сервиса.
  2. Заводят глоссарий. Один файл на весь проект, обновляется при каждом новом термине.
  3. Ставят точку вычитки. Транскрипт и перевод проверяет человек до синтеза: правка текста стоит минуты, перегенерация дорожки — кредиты.
  4. Выпускают две версии сразу. Дублированная дорожка плюс файл субтитров в SRT или WebVTT: часть аудитории смотрит с подписями.
  5. Замеряют. Досмотры и удержание локализованной версии против оригинала на первых трёх роликах, и только потом масштабирование.

Частые вопросы

Сколько языков реально доступно для дубляжа с сохранением голоса

Смотреть надо не на общее число языков перевода, а на список клонирования: у Rask AI перевод идёт на 135 языков, клонирование голоса на 32. ElevenLabs заявляет дубляж на 90 с лишним языков, HeyGen на Pro и Business — 175 языков и диалектов.

Какой максимальной длины ролик можно перевести за один раз

У ElevenLabs автодубляж принимает до 1 ГБ и 180 минут в приложении и до 3 ГБ на исходный файл через API, Dubbing Studio — до 1 ГБ и 45 минут. YouTube не дублирует автоматически ролики длиннее 120 минут. Через API OpenAI на расшифровку файл не может быть больше 25 МБ.

Можно ли обойтись без подписки и сделать всё локально

Расшифровку — да. Whisper распространяется под лицензией MIT: large на 1550M параметров требует около 10 ГБ видеопамяти, turbo на 809M — около 6 ГБ и работает примерно в 8 раз быстрее large. Но turbo не обучен задаче перевода: нужны medium или large, и переводят они только на английский.

Почему одна и та же минута видео стоит по-разному

Тарифицируются разные операции. У HeyGen дубляж без липсинка — 2 кредита за минуту, перевод с липсинком — 5. У ElevenLabs автодубляж без водяного знака — 3 000 кредитов за минуту, Dubbing Studio с ручным контролем — 10 000, втрое с лишним дороже.

Что выбрать, если целевого языка нет в списке дубляжа

Субтитры. У Descript подписи покрывают 61 язык против 30 у дубляжа, Kapwing переводит более чем на 60 языков. YouTube принимает .srt, .vtt, .ttml и ещё около десятка форматов, включая .scc для телевещания.

Поделиться:
X
Редакция Neurounit

Разборы инструментов, гайды и новости про нейросети, AI-маркетинг и автоматизацию. Материалы готовит редакция агентства Neurounit.

Факты и цифры проверяет редакция агентства Neurounit. Вопросы и уточнения: Telegram.

Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга