Промпт на три слова для видео в нейросети почти всегда даёт восьмисекундный ролик с рваной анимацией и камерой, которая дёргается непонятно куда. Текстовый запрос для видео работает не так, как запрос для фото: модели нужно описать не только картинку, но и то, что происходит с ней во времени, куда двигается камера и сколько держится план.
Для фото достаточно объекта, света и ракурса. Для видео к этому добавляются глагол действия, траектория камеры и тайминг. Разница в логике подробно разобрана в статье про промпты для фото нейросетью, здесь же речь о кадре, который живёт несколько секунд и должен держать композицию всё это время.
Ниже: из каких частей собирается промпт для видео в нейросети, формулы для описания движения камеры, стиля и длительности, разбор типичных ошибок формулировок и шаблон, который можно адаптировать под любую сцену.
Из чего состоит промпт для видео в нейросети
Рабочий промпт собирается из пяти блоков, и порядок между ними имеет значение: модель читает текст последовательно и отдаёт больше веса тому, что встречает раньше.
- Субъект и сцена. Кто или что в кадре, где происходит действие, какое время суток и место.
- Действие. Глагол, который описывает движение объекта: идёт, разворачивается, взлетает, рассыпается, наливает.
- Камера. Тип плана и его движение: наезд, облёт, панорама, статичный кадр со штатива.
- Стиль и свет. Визуальный язык ролика: кинематографичный, документальный, рекламный, свет жёсткий или мягкий.
- Длительность и темп. Сколько секунд длится план и как быстро меняется действие внутри него.
Если убрать один из блоков, модель заполнит пропуск на своё усмотрение, и чаще всего не так, как нужно для ролика. О том, как эти блоки превращаются в готовый клип внутри самой модели, подробно в статье про нейросети для генерации видео.
Разница видна на примере. Фраза «кофейная чашка на столе» описывает только субъект и сцену, модели придётся самой выбрать действие, камеру и темп. Фраза «камера медленно наезжает на кофейную чашку на столе у окна, пар поднимается над напитком, мягкий утренний свет, план пять секунд» закрывает все пять блоков сразу, и шансы получить ролик, похожий на замысел, растут в разы.
Формула движения камеры
Движение камеры в промпте нужно описывать не как эффект, а как физическое перемещение: что движется, относительно чего и с какой скоростью.
Рабочая формула: тип плана, направление движения, скорость, объект, на который направлена камера. Например: средний план, плавный наезд, медленно, камера направлена на лицо героя. Без скорости и направления модель почти всегда выбирает резкое движение, потому что это статистически частый вариант в обучающих данных.
| Формулировка в промпте | Что получит модель |
|---|---|
| камера двигается | случайное направление, часто рывком |
| плавный наезд камеры на объект | постепенное приближение, предсказуемая траектория |
| облёт камеры вокруг объекта по часовой стрелке | круговое движение с заданным направлением |
| статичная камера, штатив | фиксированный кадр, движение только внутри сцены |
Базовый словарь движений камеры стоит выучить наизусть: он работает почти во всех видео-моделях. Трэвеллинг: камера едет параллельно объекту, сохраняя дистанцию. Пролёт: камера пересекает сцену по прямой, часто сверху вниз или сквозь объект. Долли-зум: камера приближается, а угол обзора меняется, создавая эффект сжатия пространства. Панорама: камера поворачивается вокруг своей оси без перемещения в пространстве. Называйте движение этими терминами вместо общих слов «красиво двигается», и модель выберет траекторию точнее.
Сочетать больше двух движений камеры в одном плане не стоит: наезд и одновременный облёт модель обычно не может рассчитать точно, и в кадре появляются искажения перспективы. Для сложной траектории лучше разбить её на два последовательных плана с простым движением в каждом.
Как описать стиль и атмосферу кадра
Стиль задаётся через конкретный визуальный референс, а не через прилагательные вроде «красиво» или «атмосферно»: эти слова не несут для модели конкретной визуальной информации, и она интерпретирует их случайным образом.
Работают связки: тип съёмки (хендхелд, дрон, статика на штативе), источник света (естественный боковой свет, неоновая подсветка, пасмурный день), цветовая палитра (тёплые тона, холодный синий, монохром) и жанровый референс (рекламный ролик, документальная съёмка, кинематографичный кадр). Чем конкретнее референс, тем меньше модель додумывает за вас, и тем ближе результат к замыслу с первой попытки.
Сравните две формулировки. «Стильное кафе, атмосферно» не говорит модели ничего конкретного про свет, цвет или материалы, и результат будет случайным. «Кафе в скандинавском стиле, светлое дерево и белая плитка, естественный свет из большого окна, лёгкая дымка пара от кофемашины» задаёт конкретную палитру и источник света, и модель воспроизведёт именно эту сцену, а не усреднённое представление о «красивом кафе».
Полезно также указывать время дня через конкретные ориентиры: золотой час, пасмурное утро, ночная неоновая подсветка, а не общее слово «вечер». Конкретный ориентир даёт модели понятный диапазон освещённости и теней, а не усреднённую картину суток.
Длительность и тайминг плана
Большинство видео-моделей ограничивают длительность одного сгенерированного клипа несколькими секундами, и это нужно учитывать на этапе написания промпта, а не после генерации, когда уже потрачены попытки.
Конкретные цифры у каждой модели свои, но принцип одинаковый. Google Veo ограничивает один проход восемью секундами, это подтвердил представитель компании на официальном форуме разработчиков Google. Kling, по данным официальной страницы продукта, поддерживает до пятнадцати секунд непрерывной генерации в одном запросе. Более длинные ролики в обеих системах собираются через функцию расширения, которая добавляет секунды поверх уже готового плана, а не через один длинный промпт.
| Способ генерации | Типичная длительность сегмента |
|---|---|
| Один проход без расширения | от четырёх до пятнадцати секунд, в зависимости от модели |
| Расширение уже готового плана | добавляет несколько секунд за каждый дополнительный вызов |
Если ролик должен состоять из нескольких планов, их нужно прописывать как отдельные промпты под отдельные сегменты, а не пытаться поместить смену локации и действия в один запрос. Логика раскадровки и тайминга подробно разобрана в статье про сценарий для видео нейросетью: хук, раскадровка и тайминг там устроены так же, как для ручной съёмки, только планы собирает модель, а не оператор на площадке.
Частые ошибки формулировок
Эти ошибки повторяются в промптах для видео чаще остальных, и разобрать их проще, чем переписывать запрос заново с нуля.
- Слишком много действий в одном промпте. «Герой встаёт, идёт к окну, открывает его и смотрит вдаль» модель почти никогда не уложит в один короткий план связно: выберите одно главное действие и опишите его подробно.
- Абстрактные прилагательные без визуальной опоры. «Эпично», «стильно», «вау-эффект» не дают модели конкретики. Замените их описанием света, ракурса или композиции кадра.
- Противоречивые команды камере. Одновременный запрос «статичная камера» и «камера облетает объект» заставляет модель выбирать произвольно, и результат непредсказуем.
- Игнорирование физики движения. Если объект должен лететь, упасть или разбиться, опишите направление и скорость, иначе движение получится нефизичным и дёрганым.
- Один промпт на весь ролик. Попытка описать сорокасекундный сюжет одним запросом почти всегда превращается в хаотичную склейку несвязанных кадров внутри одного плана.
- Смешение несовместимых стилевых референсов. Запрос «документальная съёмка в стиле неонового киберпанка» заставляет модель выбирать между двумя визуальными языками произвольно. Берите один стилевой референс на один промпт.
Шаблон промпта, который можно адаптировать
Рабочий шаблон собирает все блоки в одну структуру: тип плана, субъект и сцена, действие, движение камеры, стиль и свет, длительность.
Пример: средний план, кофейня у окна утром, бариста наливает молоко в чашку, камера медленно наезжает слева, естественный мягкий свет, документальный стиль, план 4 секунды. Такой промпт описывает каждый блок отдельной фразой, и модели не приходится ничего домысливать между ними.
Второй пример для другой задачи: товарный план, крупный план кроссовка на вращающемся подиуме, подиум медленно поворачивается на триста шестьдесят градусов, камера статична на уровне подошвы, студийный свет с мягкими тенями, рекламный стиль, план шесть секунд. Структура та же, меняется только содержание каждого блока под конкретную сцену.
Как дорабатывать промпт после первой генерации
Первая генерация редко попадает в цель полностью, и это нормальная часть процесса, а не признак того, что промпт написан неправильно. Правильный способ доработки, менять один блок за раз: если камера дёргается, уточните только формулировку движения, остальной текст не трогайте, иначе будет сложно понять, какое именно изменение повлияло на результат.
Держите рядом рабочую версию промпта, которая дала приемлемый результат, и вносите изменения в её копию. Так при неудачном эксперименте можно быстро вернуться к варианту, который уже работал, вместо того чтобы собирать формулировку заново.
Полезно собирать библиотеку рабочих промптов по типам сцен: товарный план, портрет, пейзаж, интерьер. Когда новая задача похожа на уже решённую, вы меняете в сохранённом промпте только детали сцены, а структуру и формулировки движения камеры оставляете прежними. Это сокращает число неудачных генераций и экономит бюджет на попытки.
Частые вопросы
Чем промпт для видео отличается от промпта для фото в нейросети
В промпте для видео появляются три новых элемента, которых нет в фото-запросе: глагол действия, описание движения камеры и длительность плана. Фото-промпт описывает один статичный момент, видео-промпт описывает, как сцена меняется в течение нескольких секунд, поэтому структура запроса и его длина обычно больше.
Можно ли описать в одном промпте несколько сцен подряд
Большинство моделей генерируют один связный план на один запрос, поэтому несколько сцен нужно прописывать отдельными промптами и склеивать результат при монтаже. Попытка описать смену локаций в одном запросе обычно приводит к тому, что модель смешивает элементы разных сцен в одном кадре.
Нужно ли указывать конкретную продолжительность плана в секундах
Если интерфейс модели позволяет задать длительность отдельно от текста, лучше использовать именно этот параметр, а не упоминание секунд внутри промпта. Если такого параметра нет, короткое упоминание длительности в тексте запроса всё равно помогает модели рассчитать темп действия внутри кадра.
Почему камера в сгенерированном видео дёргается, хотя в промпте написано «плавно»
Слово «плавно» без указания направления и скорости камера интерпретирует неоднозначно, и модель может выбрать резкую траекторию, которая статистически часто встречалась в обучающих данных. Добавьте конкретное направление, например плавный наезд слева или медленный облёт по часовой стрелке, это снижает вероятность рваного движения.
Как проверить, что промпт описывает реальную физику движения
Перечитайте запрос и представьте его как инструкцию оператору на площадке: если оператор не поймёт, куда встать и куда двигаться, модель тоже не поймёт. Уберите абстрактные слова, добавьте направление, скорость и точку, на которую направлена камера, прежде чем запускать генерацию.
С чего начать
Возьмите один ролик, который нужен прямо сейчас, и разложите его на пять блоков из начала статьи: субъект, действие, камера, стиль, длительность. Напишите промпт по шаблону, запустите генерацию и сравните результат с замыслом, корректируя по одному блоку за раз.
Дальше проверьте промпт по списку частых ошибок: уберите абстрактные слова, добавьте направление движения камере и разбейте длинный сюжет на отдельные планы. Если нужна регулярная генерация видео и фото для рекламы, соцсетей и карточек товара без ручной сборки промптов под каждый ролик, этим занимаются контент-фабрики.








