Запрос «нейросеть для генерации видео» означает одно: получить движущийся кадр из текста или из картинки, а не смонтировать уже снятый материал. Это два разных класса инструментов. Генеративный движок собирает пиксели с нуля и считает лимиты в секундах, монтажный сервис работает с готовым файлом и считает лимиты в минутах загрузки.
Ниже разобрано, как устроена генерация, где у неё технический потолок, чем text-to-video отличается от image-to-video и сколько стоит секунда у шести движков. Цифры взяты из документации вендоров и проверены в августе 2026 года: тарифы и лимиты здесь переписываются раз в несколько месяцев.
Видеогенератор не рисует кадры по одному и не «дорисовывает следующий». Ролик собирается целиком, одной сценой, в сжатом латентном представлении: кодировщик превращает будущее видео в последовательность пространственно-временных токенов, диффузионный трансформер восстанавливает её из шума за один проход, декодер разворачивает результат в пиксели. Поэтому движение внутри одной генерации выглядит связным, а на стыке двух генераций почти всегда видна склейка.
Насколько критично сжатие, видно по официальному описанию MiniMax H3: кодировщик H3-VAE дал четырёхкратный выигрыш по эффективной длине последовательности, а мультимодальный вход объёмом порядка 100 тысяч токенов ужимается примерно до 4 тысяч перед генерацией. Аудио в этой архитектуре генерируется не отдельным проходом, а совместно с изображением.
Отсюда главный предел технологии: внимание по всем токенам сразу стоит дорого, и вендоры жёстко ограничивают длительность одной непрерывной генерации. Разброс на август 2026 года такой.
| Движок | Длительность одной генерации | Разрешение |
|---|---|---|
| Veo 3.1 | 4, 6 или 8 секунд (для 1080p, 4K и работы с референсами только 8) | 720p, 1080p, 4K |
| Sora 2 и Sora 2 Pro | 16 или 20 секунд | 720p, 1080p только у Pro |
| Kling Video 3.0 | от 3 до 15 секунд | 720p, 1080p |
| Seedance 2.0 | от 4 до 15 секунд либо auto | 480p, 720p, 1080p |
| Seedance 2.5 | до 30 секунд за проход | вендор не опубликовал |
| MiniMax H3 (Hailuo 3) | от 4 до 15 секунд, только целые | 768P, 2K |
| PixVerse V6 | от 1 до 15 секунд | 360p, 540p, 720p, 1080p |
Ролик длиннее собирается продлением, а не одной генерацией. Veo 3.1 продлевает собственное видео шагами по 7 секунд, до 20 раз; на вход принимается только ролик самой Veo не длиннее 141 секунды, только в 720p и только в соотношении 9:16 или 16:9, на выходе получается до 148 секунд. У Sora 2 продление добавляет до 20 секунд за операцию, максимум шесть операций, то есть 120 секунд суммарно. Ни один из этих маршрутов не даёт непрерывной сцены: модель сшивает новый фрагмент по последнему кадру предыдущего, и расхождения в свете и фактуре накапливаются.
Text-to-video получает только текст и сам придумывает композицию, типаж, свет и ракурс. Image-to-video получает готовый кадр и анимирует именно его. Оба маршрута поддерживают все шесть движков, но набор входов у них разный.
Старт из картинки снимает половину споров с моделью: композиция, типаж, брендовые цвета и надписи фиксируются заранее, а видеомодели остаётся только движение. Text-to-video честнее использовать на этапе поиска идеи, пока результат ни с кем не согласован.
Sora 2. Единственный движок в шестёрке, который снимается с эксплуатации. На странице депрекаций OpenAI указано: 24 марта 2026 года разработчиков уведомили об удалении Videos API и моделей sora-2, sora-2-pro и их снапшотов из API 24 сентября 2026 года, замена не предложена. Пока модель работает, цена составляет 0,10 доллара за секунду для 720×1280 и 1280×720 и от 0,30 до 0,70 доллара у sora-2-pro. Закладывать Sora в производственный процесс осенью 2026 года смысла нет.
Veo 3.1. Единственный из шестёрки с 4K и с открыто опубликованной посекундной ценой. Звук генерируется нативно, соотношения сторон только 16:9 и 9:16, готовое видео хранится на сервере два дня. Все ролики помечаются водяным знаком SynthID.
Kling Video 3.0. От 3 до 15 секунд за генерацию, два режима: с нативным аудио и без него, оба в 720p и 1080p. Липсинк доступен в text-to-video и image-to-video, но в документации оговорено, что аудио лучше всего отрабатывает на английском и китайском. Тарифы Kling считаются в кредитах и меняются чаще документации, актуальную сетку смотрите на сайте вендора.
Seedance. Версия 2.0 даёт от 4 до 15 секунд, разрешения 480p, 720p и 1080p и аудио, включённое по умолчанию. Версия 2.5 вышла 31 июля 2026 года и подняла потолок до 30 секунд за генерацию с многократным продлением.
MiniMax H3 (Hailuo 3). Вышел в один день с Seedance 2.5, 31 июля 2026 года. По документации платформы длительность задаётся целым числом от 4 до 15 секунд, разрешения 768P и 2K. Предыдущая Hailuo 2.3 умела 6 или 10 секунд, причём 1080p только на шести.
PixVerse V6. Самый гибкий по формату: от 1 до 15 секунд, четыре ступени качества (360, 540, 720, 1080), восемь соотношений сторон, включая 21:9 и 2:3, промпт до 5000 символов. Звук включается флагом generate_audio_switch, и это видно в цене: от 5 до 18 кредитов за секунду без аудио и от 7 до 23 с аудио.
Посекундные цены, которые вендоры публикуют открыто:
| Модель | Цена за секунду | Источник |
|---|---|---|
| Veo 3.1 | 0,40 доллара за 720p и 1080p, 0,60 доллара за 4K | прайс Gemini API |
| Veo 3.1 Fast | 0,10 доллара за 720p, 0,12 за 1080p, 0,30 за 4K | прайс Gemini API |
| Veo 3.1 Lite | 0,05 доллара за 720p, 0,08 за 1080p, 4K нет | прайс Gemini API |
| Sora 2 | 0,10 доллара за секунду в 720p | docs OpenAI |
| Seedance 2.0 | 0,3034 доллара за 720p, 0,2419 за 720p fast, 0,682 за 1080p | карточка модели на fal |
| Runway Gen-4.5 | 12 кредитов за секунду, кредит стоит 0,01 доллара | прайс Runway API |
Деталь из прайса Gemini API: списание идёт только за успешно сгенерированное видео.
Нативная дорожка есть у Veo 3.1, Sora 2, Kling 3.0 в режиме Native Audio, Seedance 2.0 (аудио включено по умолчанию) и MiniMax H3, который генерирует стерео совместно с изображением. У PixVerse V6 звук опциональный и оплачивается отдельной ставкой, у Runway это отдельная позиция прайса: seed_audio от 0,25 кредита за секунду.
Управлять звуком в Veo нужно прямо в промпте, и синтаксис строгий. По гайду Google Cloud: прямая речь в кавычках, звуковые эффекты меткой SFX, фоновый шум меткой Ambient noise. Если не указать ничего, модель придумает звук сама, и чаще всего это будет ненужная фоновая музыка.
Слабое место всех нативных дорожек это русская речь. Kling описывает липсинк как лучше работающий на английском и китайском, остальные вендоры язык в спецификациях не гарантируют вовсе. Рабочая схема для русскоязычного ролика: генерировать видео без диалогов, писать озвучку отдельно, нативный звук оставлять только на атмосферу и шумы.
Промпт для изображения описывает состояние, промпт для видео обязан описывать изменение состояния, иначе модель придумает движение сама. Google предлагает пятичастную формулу: Cinematography + Subject + Action + Context + Style & Ambiance, то есть камера, объект, действие, окружение, стиль и атмосфера.
Типичный неудачный промпт:
«красивая девушка идёт по городу, кинематографично, 4k, лучшее качество»
Здесь нет ни одного из пяти блоков: камера не задана, действие описано одним глаголом, окружения нет, а «4k» и «лучшее качество» это параметры вывода, а не промпта. Переписанный вариант:
«Medium tracking shot, женщина в бежевом пальто, идёт вдоль витрин, вечерняя улица после дождя, отражения вывесок в мокром асфальте, неглубокая глубина резкости, плёночное зерно. Ambient noise: шум дождя и редкие шаги»
Четыре правила, которые следуют из документации, а не из вкуса:
Ограничения проще цитировать по самим разработчикам. ByteDance в анонсе Seedance 2.5 признаёт, что модели есть куда расти, особенно в части «physical plausibility of complex motions» и устойчивости сцен с несколькими взаимодействующими объектами. Это формулировка вендора о собственной свежей модели.
Нужен ролик, а не серия дублей
Если брак на генерациях съедает больше времени, чем сам ролик, задачу разумнее отдать целиком: сценарий, генерация, отбор, сборка, озвучка и субтитры под конкретную площадку. Neurounit отвечает за результат, а не за количество попыток.
Генерация даёт материал, а не ролик. Рабочий маршрут состоит из пяти шагов, и четыре из них к генеративным движкам отношения не имеют.
Если нужен не разбор технологии, а выбор конкретного сервиса под бюджет, эта работа сделана отдельно: смотрите сравнение нейросетей для создания видео с разбором интерфейсов и тарифных планов.
Время одной генерации вендоры почти не публикуют. Исключение снова Google: в документации Veo указано, что генерация занимает от 11 секунд и до 6 минут в периоды пиковой нагрузки. Разброс в тридцать раз означает, что планировать работу по нижней границе нельзя.
Стоимость одной генерации считается из посекундной цены и длительности:
Дальше принято приводить красивую долю годных дублей. Мы такой цифры не публикуем: воспроизводимого замера, не зависящего от сцены, промпта и версии модели, у нас нет, а выдуманный процент стоит дороже отсутствующего. Считать бюджет корректнее так: стоимость ролика = цена одной генерации умножить на число попыток на сцену умножить на число сцен. Число попыток измеряется на пилоте из двух или трёх сцен и дальше работает как ваш собственный коэффициент.
Второй множитель, о котором забывают: тридцатисекундный ролик на Veo 3.1 это минимум четыре генерации по 8 секунд плюс дубли, а не одна операция. На Seedance 2.5 те же 30 секунд укладываются в один проход, и в этом весь практический смысл её потолка.
От 1 до 30 секунд в зависимости от движка: Veo 3.1 даёт 4, 6 или 8 секунд, Kling 3.0 и MiniMax H3 до 15, Sora 2 фиксированные 16 или 20, Seedance 2.5 до 30. Дальше только продление: у Veo до 148 секунд суммарно, у Sora 2 до 120.
Gemini API, через который доступна Veo, работает в официальном списке поддерживаемых стран и территорий, там их более двухсот, и России в этом списке нет. Sora 2 доступна только в поддерживаемых OpenAI странах и в любом случае удаляется из API 24 сентября 2026 года. По Kling, Seedance, MiniMax и PixVerse прямого запрета на Россию в документации не заявлено, но оплата идёт через международные платёжные системы, поэтому вопрос упирается не в блокировку сервиса, а в способ оплаты.
Зависит от вендора, читать нужно его условия. У Runway формулировка прямая: компания не претендует на права на ваши входные и выходные материалы и не ограничивает их коммерческое использование. Там же оговорено, что вы даёте компании бессрочную неисключительную лицензию на использование этих материалов для обучения моделей. У других сервисов баланс этих двух пунктов отличается, проверять его нужно до запуска кампании.
4K из шестёрки даёт только Veo 3.1 и только при длительности 8 секунд, причём версия Lite 4K не поддерживает вовсе. 2K есть у MiniMax H3. Остальные ограничены 1080p, и у части движков он доступен не на всех длительностях: у Hailuo 2.3 только на шестисекундных роликах, у PixVerse V6 на всём диапазоне до 15 секунд.
Практически всегда. Непрерывная сцена ограничена десятками секунд, звук на русском накладывается отдельно, мелкий текст и логотипы надёжнее подставлять вручную, а вертикальную и горизонтальную версии собирают из одного набора дублей. Генерация закрывает съёмку, но не постпродакшн.