Нейросеть видео по тексту собирает за несколько минут: вы описываете сцену, модель выдаёт клип со светом, движением камеры и звуком. Две известные модели такого типа, Sora от OpenAI и Veo от Google DeepMind, устроены похоже, а судьба у них сложилась по-разному.
OpenAI закрыла приложение и веб-версию Sora 26 апреля 2026 года, а доступ к модели через API по графику компании прекращается 24 сентября 2026 года, замены в документации не указано. Veo продолжает работать в сервисах Google для разработчиков, а в приложении Gemini ролики создаёт другая модель, Gemini Omni.
Разобраться в устройстве этих моделей полезно, даже если вы работаете из России, где ни одна из них официально не доступна. На тех же принципах построены и открытые видеомодели, например Kandinsky Video, и промпты для них пишутся по схожим правилам.
Обе модели диффузионные и работают не с пикселями, а со сжатым представлением видео. В общих чертах процесс выглядит так:
Отдельная история с текстом. Для обучения нужен огромный массив видео с подробными подписями, и обе компании создают такие подписи моделями. OpenAI обучила отдельную модель-описатель и разметила ей обучающие видео, а короткий промпт пользователя GPT разворачивает в подробное описание перед генерацией. Видео и аудио для Veo 3 размечены подписями разной детальности с помощью нескольких моделей Gemini.
Короткая длина клипов тоже следует из устройства моделей. Каждая лишняя секунда добавляет модели работы, а согласованность сцены со временем падает: персонаж меняет черты, предметы появляются и исчезают. Поэтому сервисы выдают ролики по несколько секунд и предлагают продлевать их, а не генерировать минуту за раз.
Практический вывод: модель лучше понимает запрос, похожий на подробную подпись к кадру, чем набор ключевых слов. Как модели собирают ролик и почему им тяжело даются длинные сцены, подробнее в материале о генерации видео нейросетью.
Первую Sora OpenAI показала как исследование. Модель обучали на видео и изображениях разной длительности, разрешения и пропорций, и самая крупная версия генерировала до минуты видео высокой чёткости. Она умела оживлять статичные картинки, продлевать ролики вперёд и назад во времени, менять стиль и обстановку готового видео и плавно соединять два разных клипа.
Ограничения OpenAI описывала сама: модель неточно передаёт физику многих взаимодействий, например разбивающееся стекло, а в длинных роликах накапливаются несостыковки и появляются объекты из ниоткуда.
Sora 2 добавила синхронные диалоги и звуковые эффекты, по оценке OpenAI лучше следовала законам физики и получила функцию «персонажи»: пользователь записывал короткое видео и аудио с собой и после этого мог появляться в сгенерированных сценах. Модель запустили вместе с социальным приложением для iOS, сначала в США и Канаде.
Дальше продукт свернули. Приложение и веб-версия перестали работать 26 апреля 2026 года. Модели sora-2 и sora-2-pro вместе с Videos API объявлены устаревшими и отключаются 24 сентября 2026 года. Созданные ролики OpenAI предложила выгрузить, после чего данные будут удалены. Из России Sora официально доступна не была: России нет в списке стран, где OpenAI поддерживает доступ к ChatGPT.
Veo развивается как семейство моделей Google DeepMind. Актуальное поколение генерирует восьмисекундные клипы со звуком: эффектами, фоновыми шумами, диалогами. Среди возможностей:
Каждый ролик получает невидимый водяной знак SynthID, по которому Google определяет сгенерированный контент. Проверить загруженное видео на такую метку можно в приложении Gemini.
Ролик длиннее восьми секунд собирают из сцен. Каждую генерируют отдельно с одними и теми же референсами персонажа и локации, при необходимости продлевают, а затем склеивают в монтаже. Так проще сохранить героя узнаваемым и переделать одну неудачную сцену, не трогая остальные.
Разработчикам Veo доступна через Gemini API и Vertex AI. Оплата посекундная, цена зависит от варианта модели и разрешения, бесплатного уровня для Veo нет. В потребительском приложении Gemini генерация видео требует платного плана Google AI и недоступна пользователям младше 18 лет, а ролики там создаёт модель Gemini Omni. Какие ещё продукты Google есть и на каких условиях они доступны, собрано в обзоре нейросетей Google.
Россия не входит ни в список стран, где работает веб-приложение Gemini, ни в список регионов Gemini API.
| Параметр | Sora | Veo |
|---|---|---|
| Разработчик | OpenAI | Google DeepMind |
| Статус | Приложение закрыто, API отключается по графику | Работает в Gemini API и Vertex AI |
| Звук | В Sora 2 синхронные диалоги и эффекты | Эффекты, шумы и диалоги в одном ролике |
| Длина клипа | Исследовательская версия до минуты | 8 секунд, есть продление сцены |
| Работа с картинкой | Оживление изображений | Видео по изображению, референсы, первый и последний кадр |
| Доступ из России | Официально нет | Официально нет |
Видеомодели обучены на подробных описаниях, поэтому лучше всего понимают промпт в виде режиссёрской заметки:
Собранный целиком промпт выглядит так: «Пожилой мастер в кожаном фартуке шлифует деревянную ложку и сдувает стружку. Мастерская с окном, тёплый вечерний свет. Средний план, медленный наезд. Документальная съёмка на плёнку. Слышно шуршание наждачки и тихое радио».
Главные ошибки: слишком много действий в одном клипе, смена сцены внутри восьми секунд, мелкий текст в кадре и сложная физика вроде бьющегося стекла. Для серии роликов с одним героем используйте стартовый кадр или референсы, иначе персонаж будет меняться от клипа к клипу.
Проверяйте права до публикации: бесплатный режим ГигаЧата предназначен для личного некоммерческого использования, а для рекламы и других коммерческих задач нужен платный вход по отдельному соглашению.
Обходные пути к зарубежным сервисам несут риск потерять аккаунт: OpenAI предупреждает, что доступ из неподдерживаемых стран может привести к блокировке. Сравнение сервисов под конкретные задачи есть в подборке лучших нейросетей для видео.
Видео для соцсетей и рекламы на регулярной основе требует конвейера: сценарии, генерация, монтаж, проверка. Если не хочется строить его самостоятельно, такой поток собирает команда контент-заводов Neurounit.