Нейросеть для изображений и видео в единственном числе не существует: запрос описывает две разные группы моделей, которые приходится соединять руками. Генератор картинок отдаёт статичный кадр, видеомодель принимает этот кадр на вход и возвращает короткий фрагмент: у Veo 3.1 это 4, 6 или 8 секунд, у Sora 2 максимум 20. Между ними лежит работа, которую не делает ни один сервис: раскадровка под длину фрагмента, удержание персонажа между кадрами, приведение соотношения сторон к требованиям видеомодели, сборка и звук. Ниже маршрут разобран целиком, с ценами и ограничениями из документации вендоров на август 2026 года.
Ограничения двух классов моделей не совпадают, и именно на стыке рушится большинство попыток сделать ролик за один вечер. Veo 3.1 в Gemini API принимает параметр длительности со значениями 4, 6 и 8 секунд, причём 1080p и 4K доступны только при длительности 8 секунд. Sora 2 в OpenAI API принимает seconds строкой: справочник API перечисляет 4, 8 и 12 при значении по умолчанию 4, а руководство по генерации видео добавляет для sora-2 и sora-2-pro генерации на 16 и 20 секунд. Потолок одной генерации это 20 секунд, дальше только продление: каждое добавляет до 20 секунд, продлевать можно до шести раз, максимум 120 секунд общей длины.
Генераторы изображений живут в другой системе координат. Nano Banana Pro (gemini-3-pro-image) выдаёт кадр в 1K, 2K или 4K, Nano Banana 2 (gemini-3.1-flash-image) добавляет 0.5K. Длительности у них нет вообще, зато есть управляемость по референсам, которой видеомодель не даёт.
Каждый этап обязан заканчиваться файлом, который можно проверить и переиспользовать. Этап без артефакта это не этап.
| Этап | Артефакт на выходе | Что ломается, если пропустить |
|---|---|---|
| Подготовка | Раскадровка с хронометражом по фрагментам, паспорт персонажа из 3 кадров | Персонаж меняет лицо между сценами, ролик не собирается по длительности |
| Генерация кадров | Утверждённые кадры сразу в целевом разрешении и соотношении сторон | Кадр не принимается видеомоделью как референс, ресайз даёт мыло |
| Анимация | Клипы по 4 или 8 секунд с исходными промптами рядом | Неповторяемый результат, переснять один фрагмент невозможно |
| Звук | Отдельные дорожки: атмосфера петлёй, акценты точечно | Нативный звук модели невозможно подрезать под монтаж |
| Сборка и выгрузка | Мастер плюс деривативы под площадки, всё в своём хранилище | Файлы удаляются на стороне вендора, переделывать придётся с нуля |
Привычный порядок «сначала сценарий, потом хронометраж» здесь не работает: сетку задаёт модель. Целевое качество мастера 1080p у Veo 3.1 автоматически означает шаг ровно 8 секунд, потому что 1080p и 4K доступны только при этой длительности. Минута распадается на 8 фрагментов, и это нижняя граница: с перебивками и планами по 2 секунды реальное число обычно от 10 до 14.
Второе ограничение: расширение уже сгенерированного видео у Veo 3.1 работает только в 720p, и хвост к 1080p-фрагменту даст падение разрешения на стыке. Сцена обязана закрываться целиком внутри фрагмента.
Правило раскадровки: на фрагмент одна строка действия и один кадр-якорь. Действие длиннее 8 секунд режется на два фрагмента с явной точкой стыка.
Это самый дешёвый этап и самая дорогая ошибка. Veo 3.1 принимает только два значения соотношения сторон: 16:9 и 9:16. Промежуточных форматов нет, поэтому вертикаль 4:5 под ленту получается кадрированием из 9:16, и запас по краям надо закладывать в композицию кадра заранее.
У Sora 2 список разрешений жёсткий: справочник API перечисляет 720×1280, 1280×720, 1024×1792 и 1792×1024, по умолчанию 720×1280, а экспорт в 1920×1080 и 1080×1920 руководство отдаёт модели sora-2-pro. Ключевая деталь из документации: входное изображение input_reference обязано совпадать по разрешению с целевым размером видео. Кадр, сгенерированный в произвольном 2K и уменьшенный в редакторе, здесь просто не примут, поэтому генератор картинок настраивается на точный размер видеомодели с самого начала.
У генераторов изображений выбор шире: Nano Banana 2 Lite (gemini-3.1-flash-lite-image) поддерживает 1:1, 3:2, 2:3, 3:4, 4:3, 4:5, 5:4, 9:16, 16:9 и 21:9, но только в 1K. Годится для черновой раскадровки, не для мастера.
Площадку выбирают тоже здесь. YouTube Shorts принимает ролики до 3 минут с максимальным разрешением 1080p, поэтому рендер фрагментов в 4K под Shorts это выброшенные деньги: у Veo 3.1 4K стоит 0,60 доллара за секунду против 0,40 доллара за 1080p.
Связка распадается там, где герой во втором кадре перестаёт быть собой. Лимиты референсов надо знать до того, как расписан сериал из десяти сцен.
Рабочая практика: паспорт персонажа из трёх кадров (анфас, три четверти, в рост) генерируется один раз в целевом разрешении видеомодели и подаётся референсом в каждую последующую генерацию.
Промпты для генерации изображений в нейросетях работают в конвейере как техническое задание из четырёх слоёв. Разделение нужно потому, что в видеопромпт переезжают не все четыре.
Движение описывается только в видеопромпте и только одно на фрагмент: одна траектория камеры или одно действие субъекта. Два действия в 8 секундах модель разложит по своему усмотрению, и результат станет неповторяемым.
Для повторяемости промпт хранится текстовым файлом рядом с результатом, вместе со значением seed и остальными параметрами вызова. Про seed документация Gemini API предупреждает прямо: у моделей Veo 3 он доступен, но детерминизма не гарантирует, а лишь слегка повышает повторяемость, поэтому сохранённый текст промпта важнее номера. Локальный конвейер целиком фиксируется в ComfyUI, открытом узловом приложении для генеративных моделей, где связи между узлами и есть документация процесса.
На этом шаге утверждённая картинка становится движением, и здесь у моделей появляется механика, которой нет у генераторов изображений: ключевые кадры.
Luma Ray 2 (ray-2) и Ray 2 Flash (ray-flash-2) принимают frame0 и frame1, начальный и конечный кадр фрагмента. Причём в качестве кадра можно подставить не только изображение, но и идентификатор предыдущей генерации, то есть следующий клип начинается ровно там, где закончился предыдущий. Разрешения доступны от 540p до 4K. Для конвейера это означает возможность сшивать цепочку без видимого стыка, а не подгонять склейку в монтаже.
У Runway набор устроен иначе: Gen 4.5 и Seedance 2.5 для генерации, Aleph 2.0 для переработки уже готового фрагмента. Параметры вызова те же два: duration в секундах и ratio вида 1280:720. Диапазоны разные: у Gen 4.5 от 2 до 10 секунд, у Seedance 2.5 от 4 до 30, а Aleph 2 длительность не принимает вовсе, потому что берёт её из исходного видео.
Что именно происходит внутри модели, когда статичный кадр превращается в движение, и почему одни планы оживают, а другие рассыпаются, разобрано отдельно в материале про нейросети для генерации видео. Здесь важно другое: этап анимации потребляет результат предыдущего этапа и обязан получить кадр в правильном размере, иначе весь маршрут возвращается на два шага назад.
Veo 3.1 генерирует видео вместе с нативным звуком, отдельный этап озвучки формально не нужен. Минус в том же: дорожка приходит смикшированной с картинкой, её нельзя подрезать, сдвинуть или заменить в ней один элемент.
Поэтому в конвейере с монтажом звук чаще собирают отдельно. ElevenLabs Sound Effects генерирует эффект длиной до 30 секунд за одну генерацию, параметр duration_seconds принимает значения от 0,1 до 30 секунд, при явно заданной длительности расход составляет 40 кредитов за секунду. Все эффекты выгружаются в MP3, неповторяющиеся дополнительно доступны в WAV с частотой 48 кГц. Режим зацикливания даёт эффект без слышимой точки склейки, и фон длиннее 30 секунд собирается повтором одного файла.
Отсюда практика: атмосфера строится петлёй длиной от 10 до 30 секунд, акценты (шаг, щелчок, удар) генерируются точечно, от 0,5 до 2 секунд. Речь и музыкальная тема приходят в конвейер готовыми файлами от своих моделей.
Считаем по опубликованным тарифам Gemini API и OpenAI API. Берём минуту как 8 фрагментов по 8 секунд, итого 64 секунды генерации видео, и 8 утверждённых кадров при отборе один из пяти, итого 40 генераций изображений.
| Сценарий | Видео | Кадры | Итого на минуту |
|---|---|---|---|
| Черновой прогон | Veo 3.1 Lite 720p, 0,05 доллара за секунду: 3,20 доллара | Nano Banana 2 в 1K, 0,067 доллара за изображение: 2,68 доллара | 5,88 доллара |
| Мастер 1080p | Veo 3.1 Standard 1080p, 0,40 доллара за секунду: 25,60 доллара | Nano Banana Pro в 1K или 2K, 0,134 доллара за изображение: 5,36 доллара | 30,96 доллара |
| Мастер 4K | Veo 3.1 Standard 4K, 0,60 доллара за секунду: 38,40 доллара | Nano Banana Pro в 4K, 0,24 доллара за изображение: 9,60 доллара | 48,00 доллара |
Между черновиком и мастером есть ступень: Veo 3.1 Fast стоит 0,10 доллара за секунду в 720p и 0,12 доллара в 1080p, то есть минута в 1080p обходится в 7,68 доллара. Sora 2 берёт 0,10 доллара за секунду на 720×1280 и 1280×720, sora-2-pro от 0,30 до 0,70 доллара за секунду.
Главный вывод по деньгам: дорого стоит не финальный рендер, а перебор. Отбор ведётся на дешёвой модели в 1K, и только утверждённые восемь кадров переносятся на премиальную. Помогает и пакетный режим: у Nano Banana Pro он стоит 0,067 доллара за изображение в 1K и 2K вместо 0,134 доллара, ровно вдвое дешевле.
Конвейер считается легко, а собирается долго
Между «посчитал стоимость минуты» и «получил серию роликов в графике» лежат раскадровка, паспорта персонажей, шаблоны промптов, хранилище и монтаж. Мы собираем такие конвейеры под задачу: с фиксированными форматами под площадки, повторяемыми настройками и понятной себестоимостью выпуска.
Нейросеть для картинок и видео отдаёт разрозненные файлы, а не готовый ролик, поэтому последний этап остаётся классическим. В монтажной программе делается то, чего не делает ни одна модель: покадровая подрезка стыков, единая цветокоррекция по фрагментам от разных моделей, титры, выравнивание звука, экспорт деривативов под площадки. Файлы именуются жёстко (сцена, фрагмент, версия), рядом лежат промпт и параметры генерации.
Хранение это шаг регламента, а не «потом». Видео Veo 3.1 остаются на сервере 2 дня и затем удаляются, поэтому выгрузка в своё хранилище ставится сразу после генерации, до отбора и монтажа. Пропущенная выгрузка означает повторную оплату всей минуты.
Про маркировку: изображения Gemini и видео Veo 3.1 несут водяной знак SynthID для идентификации сгенерированного контента, и он остаётся в файле независимо от того, упоминаете вы происхождение материала или нет.
Автоматизируется механика: очередь задач, выгрузка, переименование, пакетная отправка кадров. Человек нужен там, где цена ошибки выше цены генерации.
Проверьте, готов ли ваш конвейер к серийному выпуску
Три ответа «нет» и больше означают, что это пока не конвейер, а серия разовых экспериментов.
Минимум 8, если весь ролик собирается шагом по 8 секунд (максимальная длительность одной генерации Veo 3.1 и обязательная при 1080p и 4K). С перебивками и короткими планами реальное число обычно от 10 до 14.
Частично. Veo 3.1 выдаёт и видео, и нативный звук за один вызов, но удержание героя через референсы (до 5 персонажей у Nano Banana Pro) даёт только генератор изображений, а расширение готового клипа у Veo работает лишь в 720p.
Sora 2 требует, чтобы входное изображение input_reference совпадало по разрешению с параметром size, а справочник API перечисляет для sora-2 четыре размера: 720×1280, 1280×720, 1024×1792 и 1792×1024. Уменьшенная в редакторе картинка не подойдёт.
По расчёту выше: 5,88 доллара за черновой прогон (Veo 3.1 Lite 720p плюс Nano Banana 2 в 1K), 30,96 доллара за мастер в 1080p и 48,00 доллара за мастер в 4K.
У Veo 3.1 видео остаётся на сервере 2 дня и затем удаляется. Выгрузка в своё хранилище ставится сразу после генерации, иначе минуту придётся оплачивать повторно.