Нейросеть видео по тексту: как работают Sora и Veo

Все статьи
Все статьи
Редакция Neurounit
16 сентября 2026
Нейросети
Нейросеть видео по тексту: как работают Sora и Veo
Нейросеть видео по тексту: как Sora и Veo превращают промпт в ролик, почему закрыли Sora, где работает Veo и какие варианты доступны из России.

Нейросеть видео по тексту собирает за несколько минут: вы описываете сцену, модель выдаёт клип со светом, движением камеры и звуком. Две известные модели такого типа, Sora от OpenAI и Veo от Google DeepMind, устроены похоже, а судьба у них сложилась по-разному.

OpenAI закрыла приложение и веб-версию Sora 26 апреля 2026 года, а доступ к модели через API по графику компании прекращается 24 сентября 2026 года, замены в документации не указано. Veo продолжает работать в сервисах Google для разработчиков, а в приложении Gemini ролики создаёт другая модель, Gemini Omni.

Разобраться в устройстве этих моделей полезно, даже если вы работаете из России, где ни одна из них официально не доступна. На тех же принципах построены и открытые видеомодели, например Kandinsky Video, и промпты для них пишутся по схожим правилам.

Нейросеть видео по тексту: что происходит внутри

Обе модели диффузионные и работают не с пикселями, а со сжатым представлением видео. В общих чертах процесс выглядит так:

  1. Сжатие. Отдельная сеть сжимает видео в компактное латентное представление, и по времени, и по пространству. Модель учится и генерирует уже в этом сжатом пространстве, а декодер потом возвращает результат в пиксели.
  2. Нарезка на фрагменты. В Sora сжатое видео разбивается на пространственно-временные патчи, которые работают как токены в языковой модели. Картинка в этой схеме считается видео из одного кадра, поэтому модель учится и на роликах, и на изображениях.
  3. Очистка от шума. Генерация начинается с шума. На каждом шаге модель предсказывает более чистую версию патчей, опираясь на текст запроса. OpenAI описывает Sora как диффузионный трансформер.
  4. Звук. В Veo 3 диффузия применяется и к звуковым латентам, и к пространственно-временным видеолатентам, поэтому ролик получается сразу со звуком: эффектами, фоновыми шумами, репликами.

Отдельная история с текстом. Для обучения нужен огромный массив видео с подробными подписями, и обе компании создают такие подписи моделями. OpenAI обучила отдельную модель-описатель и разметила ей обучающие видео, а короткий промпт пользователя GPT разворачивает в подробное описание перед генерацией. Видео и аудио для Veo 3 размечены подписями разной детальности с помощью нескольких моделей Gemini.

Короткая длина клипов тоже следует из устройства моделей. Каждая лишняя секунда добавляет модели работы, а согласованность сцены со временем падает: персонаж меняет черты, предметы появляются и исчезают. Поэтому сервисы выдают ролики по несколько секунд и предлагают продлевать их, а не генерировать минуту за раз.

Практический вывод: модель лучше понимает запрос, похожий на подробную подпись к кадру, чем набор ключевых слов. Как модели собирают ролик и почему им тяжело даются длинные сцены, подробнее в материале о генерации видео нейросетью.

Sora: что умела и что с ней стало

Первую Sora OpenAI показала как исследование. Модель обучали на видео и изображениях разной длительности, разрешения и пропорций, и самая крупная версия генерировала до минуты видео высокой чёткости. Она умела оживлять статичные картинки, продлевать ролики вперёд и назад во времени, менять стиль и обстановку готового видео и плавно соединять два разных клипа.

Ограничения OpenAI описывала сама: модель неточно передаёт физику многих взаимодействий, например разбивающееся стекло, а в длинных роликах накапливаются несостыковки и появляются объекты из ниоткуда.

Sora 2 добавила синхронные диалоги и звуковые эффекты, по оценке OpenAI лучше следовала законам физики и получила функцию «персонажи»: пользователь записывал короткое видео и аудио с собой и после этого мог появляться в сгенерированных сценах. Модель запустили вместе с социальным приложением для iOS, сначала в США и Канаде.

Дальше продукт свернули. Приложение и веб-версия перестали работать 26 апреля 2026 года. Модели sora-2 и sora-2-pro вместе с Videos API объявлены устаревшими и отключаются 24 сентября 2026 года. Созданные ролики OpenAI предложила выгрузить, после чего данные будут удалены. Из России Sora официально доступна не была: России нет в списке стран, где OpenAI поддерживает доступ к ChatGPT.

Veo: как устроена и где работает

Veo развивается как семейство моделей Google DeepMind. Актуальное поколение генерирует восьмисекундные клипы со звуком: эффектами, фоновыми шумами, диалогами. Среди возможностей:

  • видео по тексту и по изображению;
  • референсы: несколько картинок с персонажем, предметом или локацией, которые модель переносит в сцену;
  • первый и последний кадр, между которыми модель строит переход;
  • продление сцены для более длинных роликов;
  • вертикальный формат 9:16 для коротких видео;
  • повышение разрешения до 1080p и 4K во Flow, в API и Vertex AI.

Каждый ролик получает невидимый водяной знак SynthID, по которому Google определяет сгенерированный контент. Проверить загруженное видео на такую метку можно в приложении Gemini.

Ролик длиннее восьми секунд собирают из сцен. Каждую генерируют отдельно с одними и теми же референсами персонажа и локации, при необходимости продлевают, а затем склеивают в монтаже. Так проще сохранить героя узнаваемым и переделать одну неудачную сцену, не трогая остальные.

Разработчикам Veo доступна через Gemini API и Vertex AI. Оплата посекундная, цена зависит от варианта модели и разрешения, бесплатного уровня для Veo нет. В потребительском приложении Gemini генерация видео требует платного плана Google AI и недоступна пользователям младше 18 лет, а ролики там создаёт модель Gemini Omni. Какие ещё продукты Google есть и на каких условиях они доступны, собрано в обзоре нейросетей Google.

Россия не входит ни в список стран, где работает веб-приложение Gemini, ни в список регионов Gemini API.

Sora и Veo рядом

Параметр Sora Veo
Разработчик OpenAI Google DeepMind
Статус Приложение закрыто, API отключается по графику Работает в Gemini API и Vertex AI
Звук В Sora 2 синхронные диалоги и эффекты Эффекты, шумы и диалоги в одном ролике
Длина клипа Исследовательская версия до минуты 8 секунд, есть продление сцены
Работа с картинкой Оживление изображений Видео по изображению, референсы, первый и последний кадр
Доступ из России Официально нет Официально нет

Как писать промпт для видео

Видеомодели обучены на подробных описаниях, поэтому лучше всего понимают промпт в виде режиссёрской заметки:

  1. Кто и что. Главный объект с приметами: «пожилой мастер в кожаном фартуке».
  2. Действие. Одно, максимум два: «шлифует деревянную ложку и сдувает стружку».
  3. Место и время. «Мастерская с окном, тёплый вечерний свет».
  4. Камера. Крупность и движение: «средний план, медленный наезд».
  5. Стиль. «Документальная съёмка на плёнку» или «3D-анимация».
  6. Звук. Если модель его поддерживает: реплики пишите в кавычках, шумы описывайте словами.

Собранный целиком промпт выглядит так: «Пожилой мастер в кожаном фартуке шлифует деревянную ложку и сдувает стружку. Мастерская с окном, тёплый вечерний свет. Средний план, медленный наезд. Документальная съёмка на плёнку. Слышно шуршание наждачки и тихое радио».

Главные ошибки: слишком много действий в одном клипе, смена сцены внутри восьми секунд, мелкий текст в кадре и сложная физика вроде бьющегося стекла. Для серии роликов с одним героем используйте стартовый кадр или референсы, иначе персонаж будет меняться от клипа к клипу.

Что делать, если вы работаете из России

  • Kandinsky Video в ГигаЧате. Ролики по тексту или по стартовому кадру, запросы на русском без перевода.
  • Алиса AI. Превращает изображение или фото в короткое видео прямо в чате.
  • ИИ-редактор креативов в Директе. Делает пятисекундное видео из картинки для рекламных кампаний.
  • Открытые модели. Видеомодели Kandinsky 5.0 опубликованы под лицензией MIT, генерируют ролики по тексту длиной до 10 секунд и запускаются на своём сервере.

Проверяйте права до публикации: бесплатный режим ГигаЧата предназначен для личного некоммерческого использования, а для рекламы и других коммерческих задач нужен платный вход по отдельному соглашению.

Обходные пути к зарубежным сервисам несут риск потерять аккаунт: OpenAI предупреждает, что доступ из неподдерживаемых стран может привести к блокировке. Сравнение сервисов под конкретные задачи есть в подборке лучших нейросетей для видео.

С чего начать

  1. Опишите ролик, который нужен бизнесу: длина, формат, где его покажут.
  2. Соберите промпт по структуре выше и прогоните его в доступном сервисе, по три-четыре варианта на сцену.
  3. Если роликов нужно много или с одним героем, готовьте стартовые кадры заранее и храните библиотеку удачных промптов.
  4. Склейку, озвучку, субтитры и форматы под площадки оставьте монтажу: генерация даёт сцены, а не готовый ролик.

Видео для соцсетей и рекламы на регулярной основе требует конвейера: сценарии, генерация, монтаж, проверка. Если не хочется строить его самостоятельно, такой поток собирает команда контент-заводов Neurounit.

Поделиться:
X
Редакция Neurounit

Разборы инструментов, гайды и новости про нейросети, AI-маркетинг и автоматизацию. Материалы готовит редакция агентства Neurounit.

Факты и цифры проверяет редакция агентства Neurounit. Вопросы и уточнения: Telegram.

Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга