Нейросеть для перевода видео решает не одну задачу, а четыре подряд: снимает речь со звуковой дорожки, переводит реплики с укладкой в тайминг, синтезирует новый голос и подгоняет артикуляцию под чужой язык. На выходе получается видеофайл, а не текст, и это меняет всё: ошибка на первом этапе доезжает до последнего, а исправлять её приходится там, где она возникла.
Разброс по языкам большой: ElevenLabs заявляет дубляж на 90 с лишним языков, HeyGen на планах Pro и Business — 175 языков и диалектов, Rask AI — 135 языков перевода при клонировании голоса на 32 из них, YouTube в автодубляже принимает 30 исходных языков, а с английского дублирует на 20. Whisper от OpenAI по документации покрывает 98 языков с разной точностью. Ниже: из чего складывается качество на каждом этапе, сколько это стоит и где машина уступает человеку.
Любой сервис локализации устроен внутри одинаково, различается только глубина контроля на каждом шаге.
У HeyGen разделение видно прямо в тарификации: дубляж без липсинка стоит 2 кредита за минуту, полный перевод видео с липсинком — 5 кредитов за минуту. То есть синхронизация губ дороже всех трёх предыдущих этапов вместе взятых.
Если ASR услышал «Кубернетес» как «Кувер нетес», ошибка поедет в перевод, в озвучку и в субтитры. Whisper от OpenAI выложен под лицензией MIT и запускается локально; размер модели задаёт требования к железу и скорость:
| Модель | Параметры | VRAM | Скорость относительно large |
|---|---|---|---|
| tiny | 39M | около 1 ГБ | примерно 10x |
| base | 74M | около 1 ГБ | примерно 7x |
| small | 244M | около 2 ГБ | примерно 4x |
| medium | 769M | около 5 ГБ | примерно 2x |
| large | 1550M | около 10 ГБ | 1x |
| turbo | 809M | около 6 ГБ | примерно 8x |
Важная деталь: модель turbo не обучалась задаче перевода, для режима translate нужны medium или large. Через API OpenAI расшифровка стоит 0,006 доллара за минуту на gpt-4o-transcribe и 0,003 доллара за минуту на экономичном gpt-4o-mini-transcribe. Лимит загружаемого файла — 25 МБ, принимаются mp3, mp4, mpeg, mpga, m4a, wav и webm. Часовое интервью в исходном качестве в 25 МБ не влезет, дорожку придётся сжимать или резать.
Ещё одно ограничение: эндпоинт /v1/audio/translations у OpenAI переводит только на английский. Для русского, испанского или китайского перевод делает отдельная модель, а не сама ASR.
Запрос «нейросеть перевод» обычно приводит человека к переводчику текста, но в видео задача другая. Реплика на 3,2 секунды должна остаться репликой примерно на 3,2 секунды, иначе спикер закроет рот раньше, чем закончится фраза. Русский текст в среднем длиннее английского, и сервис вынужден либо сокращать формулировку, либо ускорять речь, либо съедать паузу.
Отсюда три вещи, которые стоит настроить до запуска:
Нейросеть для озвучки видео работает по одной из двух стратегий. Первая: взять готовый синтетический голос из библиотеки — быстро, предсказуемо, годится для инструкций и онбординга. Вторая: клонировать тембр самого спикера, чтобы на английском и на немецком звучал тот же человек. Это критично для личного бренда и для роликов с лицом основателя.
Технические рамки на примере ElevenLabs. Автодубляж распознаёт до 32 уникальных спикеров в одном файле, в том числе при перекрывающейся речи; параметр num_speakers со значением 0 включает автоопределение. Степень сходства клона задаёт cloning strength в диапазоне от 0 до 10, по умолчанию 7. Клонирование отключается флагом disable_voice_cloning, тогда озвучка идёт голосами из библиотеки. Флаг drop_background_audio убирает фоновую дорожку и спасает ролики с музыкой под речью.
У Rask AI перекос виден в цифрах: перевод на 135 языков, клонирование голоса только на 32. Проверяйте целевой язык по узкому списку до оплаты плана.
Как устроен синтез речи изнутри и что требуется для законного клонирования голоса диктора, разобрано в материале про голосовые нейросети: синтез и распознавание речи.
Липсинк уверенно работает на говорящей голове: интервью, презентация, реклама с фронтальным планом. Он рассыпается на профильных ракурсах, резких поворотах головы, при контровом свете и когда рот перекрыт микрофоном или рукой.
В API HeyGen есть два режима обработки: Speed mode для быстрой пакетной прогонки, где скорость важнее идеальной синхронизации, и Precision mode для максимальной точности. Мультиспикерный липсинк у Rask AI появляется только на плане Creator Pro за 150 долларов в месяц со 100 минутами в пакете, на Creator за 60 долларов и 25 минут его нет. У ElevenLabs синхронизация губ в описании возможностей дубляжа не заявлена вовсе: сервис работает со звуковой дорожкой.
Субтитры для видео нейросеть собирает из того же транскрипта, что идёт в озвучку, поэтому дешевле выпустить обе версии сразу: дублированную дорожку и файл подписей. Из Dubbing Studio у ElevenLabs выгружаются AAC, MP3, WAV, zip с дорожками, zip с клипами, AAF с данными таймлайна, SRT с субтитрами и CSV с полями спикера, времени начала и конца, транскрипции и перевода. Формат AAF нужен монтажёру, CSV удобен для вычитки в таблице.
YouTube принимает два уровня форматов. Базовые: .srt, .sbv или .sub, .mpsub, .lrc, .cap, причём для .srt поддерживаются только базовые версии файлов, без разметки стиля. Продвинутые, со стилем и позиционированием: .smi или .sami, .rt, .vtt, .ttml. Для телевещания предпочтительным назван .scc, принимаются также .stl и файлы под стандарт CEA-608.
Разрыв между субтитрами и дубляжом бывает существенным: у Descript перевод подписей доступен на 61 язык, а перевод аудио только на 30.
| Сервис | Языки | Вход по цене | Ключевое ограничение |
|---|---|---|---|
| ElevenLabs Dubbing | 90 с лишним | Free 10 000 кредитов, Starter 6 долларов за 30 000 | Автодубляж до 1 ГБ и 180 минут в приложении, до 3 ГБ через API; Dubbing Studio до 45 минут и в режиме поддержки |
| HeyGen Video Translate | 30 с лишним на Free и Creator, 175 на Pro и Business | Creator 29 долларов за 600 кредитов | На Free одна минута на видео, правка скрипта перевода только с Pro |
| Rask AI | 135 перевод, 32 клонирование голоса | Creator 60 долларов за 25 минут | Мультиспикерный липсинк только с Creator Pro за 150 долларов; докупить минуты по 3 доллара можно с того же плана и лишь на годовой оплате |
| Descript | 25 транскрибация, 61 субтитры, 30 дубляж | от 16 долларов в месяц при годовой оплате, 24 при помесячной | Медиачасы на редактора: 1, 10, 30 и 40 по планам; вычитка перевода только с Business |
| Kapwing | более 60 автоперевод | Free 0, Pro 16 долларов при годовой оплате | На Free экспорт до 4 минут, 720p и 30 минут в месяц; на Pro перевод до 500 минут в месяц |
| YouTube автодубляж | 30 исходных, с английского на 20 | бесплатно | Не дублируются ролики длиннее 120 минут и преимущественно музыкальные |
Считаем на примере: видео на 10 минут, один целевой язык, без водяного знака.
Разброс на одном ролике — от нескольких центов до десятков долларов. Решает не цена минуты, а объём ручной вычитки после машины.
Локализация как поток, а не разовый эксперимент
Один ролик легко перевести руками. Двадцать роликов в месяц на трёх языках — это конвейер: подготовка исходников, глоссарий, вычитка, сборка и выгрузка в каналы. Соберём такой процесс под ваш контент и посчитаем стоимость минуты на ваших объёмах.
Автодубляж YouTube включён по умолчанию для подходящих авторов. Ролики на английском дублируются в том числе на русский, украинский, немецкий, французский, испанский, португальский, итальянский, польский, японский, корейский, хинди, арабский и иврит. Не дублируются видео длиннее 120 минут, преимущественно музыкальные и на неподдерживаемых исходных языках. В части языков система передаёт высоту и интонацию оригинального голоса. Ошибки возможны из-за произношения, акцентов, диалектов и фонового шума. Автор отключает функцию в Студии или включает ручную проверку до публикации; управление дорожками доступно только в десктопной Студии.
Второй бесплатный путь — локальный Whisper. Лицензия MIT снимает вопрос о правах на использование, модель small на 244M параметров укладывается примерно в 2 ГБ видеопамяти и работает примерно вчетверо быстрее модели large. Для черновой расшифровки перед ручным переводом этого достаточно.
Третий вариант — закадровый перевод прямо в браузере. Яндекс Браузер переводит дорожку видео на сторонних сайтах на лету и без оплаты, актуальный перечень языков и ограничений смотрите в справке вендора. Это инструмент для просмотра: файла на выходе не будет.
Клонирование голоса — обработка биометрии человека, а не техническая опция. Согласие спикера на создание клона и его использование в конкретных языках и каналах фиксируется письменно: в договоре с диктором или в допсоглашении с сотрудником. Отдельно оговаривается срок: голос, обученный один раз, живёт в аккаунте и после увольнения.
Вторая линия — маркировка. У ElevenLabs водяной знак завязан на цену: 2 000 кредитов за минуту с ним против 3 000 без него в автодубляже и 5 000 против 10 000 в Dubbing Studio, то есть отказ от знака добавляет половину цены в автодубляже и удваивает её в Dubbing Studio. На бесплатном плане знак не снимается вовсе. У YouTube ролики с автоматической дорожкой помечаются как auto-dubbed прямо в описании, а зритель сам переключается между оригиналом и дубляжом.
Слабые места предсказуемы. Эмоция и актёрская игра: художественный контент машина отыгрывает плоско. Термины и имена собственные: без глоссария и финальной вычитки появятся выдуманные названия. Плотный монтаж: быстрые склейки и речь поверх музыки рассыпают тайминг, здесь помогает drop_background_audio, но не всегда. Перекрывающаяся речь нескольких спикеров формально поддерживается (у ElevenLabs до 32 голосов в файле), но требует ручной сверки разметки.
Чтобы перевод перестал быть разовым экспериментом, конвейер собирают по шагам:
Смотреть надо не на общее число языков перевода, а на список клонирования: у Rask AI перевод идёт на 135 языков, клонирование голоса на 32. ElevenLabs заявляет дубляж на 90 с лишним языков, HeyGen на Pro и Business — 175 языков и диалектов.
У ElevenLabs автодубляж принимает до 1 ГБ и 180 минут в приложении и до 3 ГБ на исходный файл через API, Dubbing Studio — до 1 ГБ и 45 минут. YouTube не дублирует автоматически ролики длиннее 120 минут. Через API OpenAI на расшифровку файл не может быть больше 25 МБ.
Расшифровку — да. Whisper распространяется под лицензией MIT: large на 1550M параметров требует около 10 ГБ видеопамяти, turbo на 809M — около 6 ГБ и работает примерно в 8 раз быстрее large. Но turbo не обучен задаче перевода: нужны medium или large, и переводят они только на английский.
Тарифицируются разные операции. У HeyGen дубляж без липсинка — 2 кредита за минуту, перевод с липсинком — 5. У ElevenLabs автодубляж без водяного знака — 3 000 кредитов за минуту, Dubbing Studio с ручным контролем — 10 000, втрое с лишним дороже.
Субтитры. У Descript подписи покрывают 61 язык против 30 у дубляжа, Kapwing переводит более чем на 60 языков. YouTube принимает .srt, .vtt, .ttml и ещё около десятка форматов, включая .scc для телевещания.