Нейросеть для изображений и видео: конвейер от кадра до ролика

Все статьи
Все статьи
Редакция Neurounit
10 июля 2026
Обновлено 22 августа 2026
Нейросети
Нейросеть для изображений и видео: конвейер от кадра до ролика
Как выстроить рабочий процесс создания AI-видео и изображений: этапы пайплайна, консистентность персонажей, промпты и вывод контента на поток без хаоса.

Нейросеть для изображений и видео в единственном числе не существует: запрос описывает две разные группы моделей, которые приходится соединять руками. Генератор картинок отдаёт статичный кадр, видеомодель принимает этот кадр на вход и возвращает короткий фрагмент: у Veo 3.1 это 4, 6 или 8 секунд, у Sora 2 максимум 20. Между ними лежит работа, которую не делает ни один сервис: раскадровка под длину фрагмента, удержание персонажа между кадрами, приведение соотношения сторон к требованиям видеомодели, сборка и звук. Ниже маршрут разобран целиком, с ценами и ограничениями из документации вендоров на август 2026 года.

Что означает запрос «нейросеть для изображений и видео» на практике

Ограничения двух классов моделей не совпадают, и именно на стыке рушится большинство попыток сделать ролик за один вечер. Veo 3.1 в Gemini API принимает параметр длительности со значениями 4, 6 и 8 секунд, причём 1080p и 4K доступны только при длительности 8 секунд. Sora 2 в OpenAI API принимает seconds строкой: справочник API перечисляет 4, 8 и 12 при значении по умолчанию 4, а руководство по генерации видео добавляет для sora-2 и sora-2-pro генерации на 16 и 20 секунд. Потолок одной генерации это 20 секунд, дальше только продление: каждое добавляет до 20 секунд, продлевать можно до шести раз, максимум 120 секунд общей длины.

Генераторы изображений живут в другой системе координат. Nano Banana Pro (gemini-3-pro-image) выдаёт кадр в 1K, 2K или 4K, Nano Banana 2 (gemini-3.1-flash-image) добавляет 0.5K. Длительности у них нет вообще, зато есть управляемость по референсам, которой видеомодель не даёт.

Карта конвейера: пять этапов и артефакт на выходе каждого

Каждый этап обязан заканчиваться файлом, который можно проверить и переиспользовать. Этап без артефакта это не этап.

Этап Артефакт на выходе Что ломается, если пропустить
Подготовка Раскадровка с хронометражом по фрагментам, паспорт персонажа из 3 кадров Персонаж меняет лицо между сценами, ролик не собирается по длительности
Генерация кадров Утверждённые кадры сразу в целевом разрешении и соотношении сторон Кадр не принимается видеомоделью как референс, ресайз даёт мыло
Анимация Клипы по 4 или 8 секунд с исходными промптами рядом Неповторяемый результат, переснять один фрагмент невозможно
Звук Отдельные дорожки: атмосфера петлёй, акценты точечно Нативный звук модели невозможно подрезать под монтаж
Сборка и выгрузка Мастер плюс деривативы под площадки, всё в своём хранилище Файлы удаляются на стороне вендора, переделывать придётся с нуля

Раскадровка считается от длительности фрагмента, а не от сценария

Привычный порядок «сначала сценарий, потом хронометраж» здесь не работает: сетку задаёт модель. Целевое качество мастера 1080p у Veo 3.1 автоматически означает шаг ровно 8 секунд, потому что 1080p и 4K доступны только при этой длительности. Минута распадается на 8 фрагментов, и это нижняя граница: с перебивками и планами по 2 секунды реальное число обычно от 10 до 14.

Второе ограничение: расширение уже сгенерированного видео у Veo 3.1 работает только в 720p, и хвост к 1080p-фрагменту даст падение разрешения на стыке. Сцена обязана закрываться целиком внутри фрагмента.

Правило раскадровки: на фрагмент одна строка действия и один кадр-якорь. Действие длиннее 8 секунд режется на два фрагмента с явной точкой стыка.

Соотношение сторон и разрешение фиксируются до первой генерации

Это самый дешёвый этап и самая дорогая ошибка. Veo 3.1 принимает только два значения соотношения сторон: 16:9 и 9:16. Промежуточных форматов нет, поэтому вертикаль 4:5 под ленту получается кадрированием из 9:16, и запас по краям надо закладывать в композицию кадра заранее.

У Sora 2 список разрешений жёсткий: справочник API перечисляет 720×1280, 1280×720, 1024×1792 и 1792×1024, по умолчанию 720×1280, а экспорт в 1920×1080 и 1080×1920 руководство отдаёт модели sora-2-pro. Ключевая деталь из документации: входное изображение input_reference обязано совпадать по разрешению с целевым размером видео. Кадр, сгенерированный в произвольном 2K и уменьшенный в редакторе, здесь просто не примут, поэтому генератор картинок настраивается на точный размер видеомодели с самого начала.

У генераторов изображений выбор шире: Nano Banana 2 Lite (gemini-3.1-flash-lite-image) поддерживает 1:1, 3:2, 2:3, 3:4, 4:3, 4:5, 5:4, 9:16, 16:9 и 21:9, но только в 1K. Годится для черновой раскадровки, не для мастера.

Площадку выбирают тоже здесь. YouTube Shorts принимает ролики до 3 минут с максимальным разрешением 1080p, поэтому рендер фрагментов в 4K под Shorts это выброшенные деньги: у Veo 3.1 4K стоит 0,60 доллара за секунду против 0,40 доллара за 1080p.

Референсы персонажа: как нейросеть для генерации изображений и видео держит лицо между кадрами

Связка распадается там, где герой во втором кадре перестаёт быть собой. Лимиты референсов надо знать до того, как расписан сериал из десяти сцен.

  • Nano Banana Pro: до 6 референсов объектов и до 5 референсов персонажей на одну генерацию. Это верхняя планка для сцены с несколькими героями.
  • Nano Banana 2: до 10 объектов, 4 персонажей и 3 стилевых референса. Стилевые референсы здесь отдельная категория, поэтому единую палитру проекта проще держать на этой модели.
  • Nano Banana 2 Lite: до 14 объектов и ни одного слота под персонажа, то есть только предметные кадры и фоны.
  • Veo 3.1: до трёх референсных изображений как направляющих для содержания видео, но при их использовании длительность обязана быть 8 секунд.
  • Sora 2: загрузки, изображающие человеческое сходство, заблокированы по умолчанию, изображения с человеческими лицами на входе отклоняются. Персонажный сериал с узнаваемым героем через Sora не собирается, это ограничение политики, а не качества.

Рабочая практика: паспорт персонажа из трёх кадров (анфас, три четверти, в рост) генерируется один раз в целевом разрешении видеомодели и подаётся референсом в каждую последующую генерацию.

Промпты для генерации изображений в нейросетях: четыре слоя и что из них переносится в видео

Промпты для генерации изображений в нейросетях работают в конвейере как техническое задание из четырёх слоёв. Разделение нужно потому, что в видеопромпт переезжают не все четыре.

  1. Субъект: кто или что в кадре, возраст, одежда, состояние. Переносится в видеопромпт дословно.
  2. Композиция и камера: крупность плана, ракурс, положение в кадре. В видео задаётся самим кадром-референсом, дублировать текстом не нужно.
  3. Свет и материал: источник света, время суток, фактура поверхностей. Переносится, иначе клип уплывёт по цвету относительно кадра.
  4. Технические параметры: соотношение сторон, разрешение, а для видео ещё и длительность. Задаются параметрами API, а не словами в тексте.

Движение описывается только в видеопромпте и только одно на фрагмент: одна траектория камеры или одно действие субъекта. Два действия в 8 секундах модель разложит по своему усмотрению, и результат станет неповторяемым.

Для повторяемости промпт хранится текстовым файлом рядом с результатом, вместе со значением seed и остальными параметрами вызова. Про seed документация Gemini API предупреждает прямо: у моделей Veo 3 он доступен, но детерминизма не гарантирует, а лишь слегка повышает повторяемость, поэтому сохранённый текст промпта важнее номера. Локальный конвейер целиком фиксируется в ComfyUI, открытом узловом приложении для генеративных моделей, где связи между узлами и есть документация процесса.

Анимация кадра: image-to-video и ключевые кадры

На этом шаге утверждённая картинка становится движением, и здесь у моделей появляется механика, которой нет у генераторов изображений: ключевые кадры.

Luma Ray 2 (ray-2) и Ray 2 Flash (ray-flash-2) принимают frame0 и frame1, начальный и конечный кадр фрагмента. Причём в качестве кадра можно подставить не только изображение, но и идентификатор предыдущей генерации, то есть следующий клип начинается ровно там, где закончился предыдущий. Разрешения доступны от 540p до 4K. Для конвейера это означает возможность сшивать цепочку без видимого стыка, а не подгонять склейку в монтаже.

У Runway набор устроен иначе: Gen 4.5 и Seedance 2.5 для генерации, Aleph 2.0 для переработки уже готового фрагмента. Параметры вызова те же два: duration в секундах и ratio вида 1280:720. Диапазоны разные: у Gen 4.5 от 2 до 10 секунд, у Seedance 2.5 от 4 до 30, а Aleph 2 длительность не принимает вовсе, потому что берёт её из исходного видео.

Что именно происходит внутри модели, когда статичный кадр превращается в движение, и почему одни планы оживают, а другие рассыпаются, разобрано отдельно в материале про нейросети для генерации видео. Здесь важно другое: этап анимации потребляет результат предыдущего этапа и обязан получить кадр в правильном размере, иначе весь маршрут возвращается на два шага назад.

Звук: нативная дорожка модели против отдельной звуковой сборки

Veo 3.1 генерирует видео вместе с нативным звуком, отдельный этап озвучки формально не нужен. Минус в том же: дорожка приходит смикшированной с картинкой, её нельзя подрезать, сдвинуть или заменить в ней один элемент.

Поэтому в конвейере с монтажом звук чаще собирают отдельно. ElevenLabs Sound Effects генерирует эффект длиной до 30 секунд за одну генерацию, параметр duration_seconds принимает значения от 0,1 до 30 секунд, при явно заданной длительности расход составляет 40 кредитов за секунду. Все эффекты выгружаются в MP3, неповторяющиеся дополнительно доступны в WAV с частотой 48 кГц. Режим зацикливания даёт эффект без слышимой точки склейки, и фон длиннее 30 секунд собирается повтором одного файла.

Отсюда практика: атмосфера строится петлёй длиной от 10 до 30 секунд, акценты (шаг, щелчок, удар) генерируются точечно, от 0,5 до 2 секунд. Речь и музыкальная тема приходят в конвейер готовыми файлами от своих моделей.

Сколько стоит минута готового ролика

Считаем по опубликованным тарифам Gemini API и OpenAI API. Берём минуту как 8 фрагментов по 8 секунд, итого 64 секунды генерации видео, и 8 утверждённых кадров при отборе один из пяти, итого 40 генераций изображений.

Сценарий Видео Кадры Итого на минуту
Черновой прогон Veo 3.1 Lite 720p, 0,05 доллара за секунду: 3,20 доллара Nano Banana 2 в 1K, 0,067 доллара за изображение: 2,68 доллара 5,88 доллара
Мастер 1080p Veo 3.1 Standard 1080p, 0,40 доллара за секунду: 25,60 доллара Nano Banana Pro в 1K или 2K, 0,134 доллара за изображение: 5,36 доллара 30,96 доллара
Мастер 4K Veo 3.1 Standard 4K, 0,60 доллара за секунду: 38,40 доллара Nano Banana Pro в 4K, 0,24 доллара за изображение: 9,60 доллара 48,00 доллара

Между черновиком и мастером есть ступень: Veo 3.1 Fast стоит 0,10 доллара за секунду в 720p и 0,12 доллара в 1080p, то есть минута в 1080p обходится в 7,68 доллара. Sora 2 берёт 0,10 доллара за секунду на 720×1280 и 1280×720, sora-2-pro от 0,30 до 0,70 доллара за секунду.

Главный вывод по деньгам: дорого стоит не финальный рендер, а перебор. Отбор ведётся на дешёвой модели в 1K, и только утверждённые восемь кадров переносятся на премиальную. Помогает и пакетный режим: у Nano Banana Pro он стоит 0,067 доллара за изображение в 1K и 2K вместо 0,134 доллара, ровно вдвое дешевле.

Конвейер считается легко, а собирается долго

Между «посчитал стоимость минуты» и «получил серию роликов в графике» лежат раскадровка, паспорта персонажей, шаблоны промптов, хранилище и монтаж. Мы собираем такие конвейеры под задачу: с фиксированными форматами под площадки, повторяемыми настройками и понятной себестоимостью выпуска.

Обсудить задачу

Сборка и хранение: почему нейросеть для картинок и видео не отменяет монтажную программу

Нейросеть для картинок и видео отдаёт разрозненные файлы, а не готовый ролик, поэтому последний этап остаётся классическим. В монтажной программе делается то, чего не делает ни одна модель: покадровая подрезка стыков, единая цветокоррекция по фрагментам от разных моделей, титры, выравнивание звука, экспорт деривативов под площадки. Файлы именуются жёстко (сцена, фрагмент, версия), рядом лежат промпт и параметры генерации.

Хранение это шаг регламента, а не «потом». Видео Veo 3.1 остаются на сервере 2 дня и затем удаляются, поэтому выгрузка в своё хранилище ставится сразу после генерации, до отбора и монтажа. Пропущенная выгрузка означает повторную оплату всей минуты.

Про маркировку: изображения Gemini и видео Veo 3.1 несут водяной знак SynthID для идентификации сгенерированного контента, и он остаётся в файле независимо от того, упоминаете вы происхождение материала или нет.

Где на маршруте обязателен человек

Автоматизируется механика: очередь задач, выгрузка, переименование, пакетная отправка кадров. Человек нужен там, где цена ошибки выше цены генерации.

  • Отбор кадров. При соотношении один из пяти отбор решает и качество, и бюджет. Модель не отличит удачный кадр от технически исправного.
  • Юридические ограничения. В Sora 2 запрещены реальные люди и публичные фигуры, защищённые авторским правом персонажи и музыка. Сценарий проверяется до генерации, а не после отказа API.
  • Текст на изображении. Надписи, вывески и интерфейсы модели воспроизводят нестабильно, каждый кадр с текстом проверяется отдельно.
  • Соответствие бренду. Оттенок, шрифт и пропорции логотипа модель приближает, но не воспроизводит точно. Фирменные элементы накладываются на этапе сборки, там же принимается решение о точках склейки.

Проверьте, готов ли ваш конвейер к серийному выпуску

  1. Известны ли целевое разрешение и соотношение сторон до первого сгенерированного кадра?
  2. Есть ли паспорт персонажа из трёх кадров, который подаётся референсом в каждую генерацию?
  3. Лежит ли рядом с каждым клипом текст промпта, seed и параметры вызова?
  4. Выгружаются ли результаты в своё хранилище в день генерации, до истечения 2 дней хранения у вендора?
  5. Посчитана ли себестоимость минуты с учётом перебора, а не только финального рендера?

Три ответа «нет» и больше означают, что это пока не конвейер, а серия разовых экспериментов.

Частые вопросы

Сколько фрагментов нужно на минуту ролика?

Минимум 8, если весь ролик собирается шагом по 8 секунд (максимальная длительность одной генерации Veo 3.1 и обязательная при 1080p и 4K). С перебивками и короткими планами реальное число обычно от 10 до 14.

Можно ли обойтись одной моделью вместо связки?

Частично. Veo 3.1 выдаёт и видео, и нативный звук за один вызов, но удержание героя через референсы (до 5 персонажей у Nano Banana Pro) даёт только генератор изображений, а расширение готового клипа у Veo работает лишь в 720p.

Почему кадр нужно генерировать сразу в целевом размере?

Sora 2 требует, чтобы входное изображение input_reference совпадало по разрешению с параметром size, а справочник API перечисляет для sora-2 четыре размера: 720×1280, 1280×720, 1024×1792 и 1792×1024. Уменьшенная в редакторе картинка не подойдёт.

Сколько стоит минута видео по официальным тарифам?

По расчёту выше: 5,88 доллара за черновой прогон (Veo 3.1 Lite 720p плюс Nano Banana 2 в 1K), 30,96 доллара за мастер в 1080p и 48,00 доллара за мастер в 4K.

Как долго вендор хранит сгенерированные файлы?

У Veo 3.1 видео остаётся на сервере 2 дня и затем удаляется. Выгрузка в своё хранилище ставится сразу после генерации, иначе минуту придётся оплачивать повторно.

Поделиться:
X
Редакция Neurounit

Разборы инструментов, гайды и новости про нейросети, AI-маркетинг и автоматизацию. Материалы готовит редакция агентства Neurounit.

Факты и цифры проверяет редакция агентства Neurounit. Вопросы и уточнения: Telegram.

Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга