Видеокарта с 14 гигабайтами памяти уже тянет локальную нейросеть для генерации видео без единого обращения к облаку. Это не теоретический предел, а официальная цифра для одной из открытых моделей для видео: разработчики указывают именно такой минимум при включённой разгрузке части весов в оперативную память. Для бизнеса, которому ролики нужны постоянно, а не раз в квартал, такой порог входа меняет экономику задачи.
Локальная нейросеть для генерации видео работает иначе, чем облачный сервис. Вы один раз платите за видеокарту и электричество, а не за каждый сгенерированный ролик, и сами решаете, куда уходят исходники и промпты: ничего не отправляется на сторонний сервер. Обратная сторона: более жёсткие рамки по длине и разрешению клипа, и чаще заметны швы в сложной динамике, чем у закрытых сервисов с кластерами из сотен GPU под капотом.
Среди открытых моделей для видео чаще других всплывают четыре имени: Wan 2.2 от Alibaba, HunyuanVideo от Tencent, LTX-Video от Lightricks и пара CogVideoX с Mochi 1. У каждой свои требования к памяти, свои ограничения по разрешению и своя лицензия, которую стоит читать до того, как ролик попадёт в коммерческий проект.
Локальная нейросеть для генерации видео: когда это оправданно
Свой GPU имеет смысл, если видео нужно часто: черновики для маркетплейса, раскадровки для рекламной кампании, бесконечные варианты одного ролика под A/B-тест. Каждая попытка бесплатна, кроме счёта за электричество, и лимитов по количеству запросов в сутки нет.
Полезно сразу оценить, сколько роликов нужно в месяц. Если это единичные ролики для презентации, разумнее взять подписку на облачный сервис: цена одной генерации ниже, чем цена простаивающей видеокарты. Если поток больше, например ежедневные карточки товара для маркетплейса или регулярные черновики для рекламы, окупаемость своего GPU считается быстрее, потому что стоимость генерации не зависит от количества попыток.
Минус в другом: нужно собрать окружение, следить за версиями CUDA и библиотек, разбираться, какая квантизация модели ещё даёт приемлемое качество. Поддержки, как у облачного сервиса, не будет: если модель выдаёт артефакт, разбираться самостоятельно. С текстовыми моделями расклад похожий, мы разбирали его в статье про локальные LLM и запуск нейросети на своём железе: порог входа по железу ниже, но и обслуживание целиком на вас.
Wan 2.2: гибкая модель под разные видеокарты
Wan 2.2 (Tongyi Wanxiang) Alibaba выпустила 28 июля 2025 года по лицензии Apache 2.0, разрешающей коммерческое использование без отчислений. Это первая модель для видео с архитектурой MoE: флагманские версии T2V-A14B и I2V-A14B переключают эксперты внутри 27 миллиардов параметров, активируя по 14 миллиардов на шаг.
Для рядового GPU в линейке есть дэнс-модель TI2V-5B: она собирает текст-в-видео и картинку-в-видео в одной сети на 5 миллиардов параметров и официально запускается на карте с 24 гигабайтами памяти, вроде RTX 4090, при включённой разгрузке в RAM. С квантизацией FP8 и CPU-разгрузкой порог падает до 8 и 12 гигабайт. Флагманская A14B без квантизации официально требует от 80 гигабайт, но FP8 сжимает запрос до 22 и 26 гигабайт, а GGUF-квантизация с разгрузкой продавливает модель даже на карты с 6 и 10 гигабайтами, хотя качество и скорость заметно падают.
Важный нюанс: Wan 2.2 остаётся последней флагманской моделью Alibaba с открытыми весами. Все более новые версии, от 2.5 до 3.0, компания выпускает только как закрытый облачный сервис без публикации весов. Так что если вы ищете актуальный Wan для локального запуска, речь именно о версии 2.2.
HunyuanVideo 1.5: баланс качества и доступности
Tencent выпустила HunyuanVideo 1.5 как облегчённую переработку оригинальной модели: 8,3 миллиарда параметров вместо 13. Официальный репозиторий указывает минимум 14 гигабайт видеопамяти при включённом офлоаде весов, а для комфортной работы на 720p без потери скорости рекомендуют 24 гигабайта, то есть одну из потребительских карт верхнего сегмента.
Оригинальная версия на 13 миллиардов параметров куда прожорливее: разработчики ориентируют на 60 и 80 гигабайт для 720p, а для 1080p счёт идёт на 100 с лишним гигабайт. Даже с оптимизациями сообщества модель остаётся задачей для серверной карты, а не для домашнего компьютера. На практике это означает: если видите на форуме восторги про HunyuanVideo на 14 гигабайтах, речь о версии 1.5, а не об оригинале.
LTX-Video: самая легкая по требованиям модель
У LTX-Video от Lightricks самый низкий порог входа среди заметных открытых моделей. Оригинальный чекпоинт с оптимизациями запускали на картах с 6 гигабайтами видеопамяти, хотя и в уменьшённом разрешении 512 на 512 пикселей.
Текущий флагман линейки масштабирует требования вместе с качеством: около 12 гигабайт для SD-разрешения, 16 для 720p, 24 для 1080p и до 48 гигабайт для нативного 4K со звуковой дорожкой. Лицензия тоже изменилась в сторону открытости: веса и код доступны по условиям, близким к Apache 2.0, бесплатно для коммерческого использования компаниям с выручкой до 10 миллионов долларов в год. Крупному бизнесу нужна отдельная лицензия от Lightricks, это стоит проверить до запуска в прод.
CogVideoX и Mochi 1: открытые пионеры с нюансами лицензий
CogVideoX от Tsinghua существует в двух весовых категориях. Версия на 2 миллиарда параметров помещается в 16 гигабайт при точности FP16, держит до 720p и идёт по чистому Apache 2.0 без ограничений. Версия на 5 миллиардов требует уже 24 гигабайта и живёт под собственной лицензией разработчика: коммерческое использование разрешено, но с перечнем запрещённых сценариев, который стоит прочитать перед монетизацией роликов.
Mochi 1 от Genmo построен на архитектуре AsymmDiT и насчитывает 10 миллиардов параметров, модель полностью открыта по Apache 2.0. Но здесь другая ловушка: полная точность BF16 требует 60 и 80 гигабайт, а квантизованная FP8-версия, которая укладывается в 20 гигабайт, выдаёт только 480p. Это заметно ниже потолка разрешения у Wan 2.2 или HunyuanVideo 1.5 при схожих запросах к памяти.
Сколько VRAM нужно на практике
Цифры разных моделей удобно сравнивать рядом, с оговоркой, что указан практический минимум с квантизацией или офлоадом, а не теоретический максимум качества.
| Модель | Минимум VRAM | Практический потолок разрешения | Лицензия |
|---|---|---|---|
| Wan 2.2 TI2V-5B | 8 и 12 ГБ с квантизацией | 720p | Apache 2.0 |
| Wan 2.2 A14B | 22 и 26 ГБ с FP8 | 720p, выше качество движения | Apache 2.0 |
| HunyuanVideo 1.5 | 14 ГБ с офлоадом | 720p | собственная открытая лицензия |
| LTX-Video (флагман) | 12 и 16 ГБ | 720p, выше с большей памятью | бесплатно до 10 млн долларов выручки |
| CogVideoX 2B | 16 ГБ | 720p | Apache 2.0 |
| Mochi 1 (FP8) | 20 ГБ | 480p | Apache 2.0 |
Практический вывод: карта на 16 гигабайт открывает доступ почти ко всей линейке в лёгких конфигурациях, а 24 гигабайта снимают большинство компромиссов по разрешению для моделей среднего веса.
Чем локальная генерация отличается по качеству от облака
Облачные флагманы вроде Sora, Veo, Kling и Hailuo обучены на кластерах, которые по вычислительной мощности недостижимы для домашнего GPU, и тратят на каждый ролик больше шагов инференса, чем позволяет себе локальная модель с ограничением по памяти. Разница заметна в трёх местах: связность движения на длинных планах, физическая достоверность сложных сцен с несколькими объектами и верхний предел длительности клипа. Мы разбирали эти сервисы детальнее в статье про то, как работают Sora и Veo при генерации видео по тексту, и в обзоре лучших нейросетей для видео под конкретные задачи.
Локальные модели выигрывают в другом сценарии: короткие ролики пять и десять секунд, предметная съёмка для карточек товара, повторяющиеся по стилю b-roll вставки, черновые раскадровки перед заказом финальной версии в платном сервисе. Для сложного кадра с несколькими персонажами и неочевидной физикой облачный флагман пока стабильнее.
На итоговое качество влияет не только выбор модели, но и способ её запуска. Квантизация сжимает веса до формата с меньшей точностью, снижая требования к памяти ценой части детализации, а разгрузка переносит часть вычислений на оперативную память и диск, замедляя генерацию, но позволяя запустить модель на карте с меньшим объёмом VRAM. Комбинация этих двух приёмов и определяет, уложится ли конкретная модель в память вашей видеокарты и каким получится итоговый ролик.
Как выбрать модель под свою задачу
Выбор модели удобно привязывать не к названию, а к объёму видеопамяти на карте и к сценарию использования: черновик, финальный ролик для рекламы или серийное производство карточек товара. Ниже примерная раскладка по этим трём параметрам.
- GPU с 8 и 12 гигабайтами: Wan 2.2 TI2V-5B с квантизацией или LTX-Video флагман в SD-разрешении, для коротких черновиков и тестов промптов.
- GPU с 16 гигабайтами: HunyuanVideo 1.5 с офлоадом или CogVideoX 2B, устойчивое 720p без постоянных падений по памяти.
- GPU с 24 гигабайтами: Wan 2.2 A14B с FP8-квантизацией или CogVideoX 5B, если условия лицензии подходят под задачу.
- Серверный GPU на 80 гигабайт: полная версия Wan 2.2 A14B или Mochi 1 в BF16 для максимального качества без компромиссов.
Частые вопросы
Сколько видеопамяти нужно для локальной генерации видео?
Для лёгких моделей с квантизацией хватает 8 и 12 гигабайт, для устойчивой работы на 720p нужно 16 и 24 гигабайта. Полное качество без офлоада у флагманских моделей, таких как Wan 2.2 A14B, требует от 80 гигабайт, это уже серверная карта, а не потребительская видеокарта.
Можно ли запустить нейросеть для видео на видеокарте с 8 гигабайтами памяти?
Да, с оговорками. LTX-Video с оптимизациями запускали на картах с 6 гигабайтами при разрешении 512 на 512 пикселей, а квантизованный Wan 2.2 TI2V-5B укладывается в 8 гигабайт. Разрешение и длина ролика при этом заметно ниже, чем на карте с 24 гигабайтами.
Чем локальная генерация видео хуже Sora или Veo?
Главные ограничения: короче максимальная длина клипа, ниже потолок разрешения без серверного GPU и заметнее нестыковки в сложной динамике на длинных планах. Зато нет платы за генерацию и нет отправки промптов на сторонний сервер.
Нужен ли интернет для локальной модели генерации видео?
Нет. После того как веса модели скачаны один раз, всё обучение и инференс происходят на вашем GPU без обращения к сети. Это главное практическое отличие от облачных сервисов, которым нужен постоянный доступ в интернет для каждого запроса.
Какая локальная модель для видео самая легкая по требованиям к железу?
LTX-Video и квантизованный Wan 2.2 TI2V-5B делят первое место: обе запускаются на картах с 6 и 8 гигабайтами видеопамяти в сниженном разрешении. За более высокое качество на том же железе придётся платить скоростью генерации.
С чего начать
Определите объём видеопамяти своей карты и выберите модель из таблицы под этот порог, не наоборот. Установите ComfyUI или официальный репозиторий модели, скачайте веса и прогоните первый тест на коротком промпте в сниженном разрешении, прежде чем увеличивать настройки качества. Если результат устраивает, постепенно поднимайте разрешение и длину ролика, следя за тем, не упирается ли генерация в лимит памяти.
Если разбираться с квантизацией, офлоадом и подбором модели самостоятельно не хочется, поток видео для рекламы и маркетплейсов под задачу собирают в контент-фабриках Neurounit.








