Нейросеть для генерации изображений: как выбрать и как пользоваться

Все статьи
Все статьи
Редакция Neurounit
18 июля 2026
Обновлено 22 августа 2026
Нейросети
Нейросеть для генерации изображений: как выбрать и как пользоваться
Как работает нейросеть для генерации изображений, где она реально экономит деньги бизнесу, как писать промпты и с чего начать. Практика без воды.

Нейросеть для генерации изображений закрывает то, что раньше требовало съёмки, стилиста и отдельной смены. Сейчас основной расход это время на промпт и отбор кадров: по опубликованным прайсам вендоров одна генерация стоит от 1,4 цента у FLUX.2 [klein] до 24 центов у Gemini 3 Pro Image в 4K.

Что делает нейросеть для генерации изображений

Вы пишете текстовое описание, модель возвращает картинку. Готовые фотографии она не копирует: она предсказывает распределение пикселей, которое соответствует вашему тексту.

Большинство моделей построено на диффузии. Модель берёт случайный шум и пошагово его снимает, сверяясь с промптом на каждом шаге. Число шагов задаётся явно: в библиотеке diffusers параметр num_inference_steps для Stable Diffusion по умолчанию равен 50, и документация прямо описывает компромисс: больше шагов денойзинга обычно дают более качественное изображение ценой медленной генерации.

Второй ключевой параметр там же, guidance_scale, по умолчанию 7.5: он отвечает за силу привязки к тексту, и высокое значение заставляет модель точнее следовать промпту ценой качества картинки. Отсюда практический вывод: всё, чего вы не написали, модель домысливает сама, и точность формулировки дешевле перегенерации.

Отдельно про маркировку: все изображения моделей Gemini несут скрытый водяной знак SynthID, это зафиксировано в документации Google. Факт машинной генерации технически определяем, и в рекламных материалах это стоит учитывать.

8 моделей: чем отличаются

Таблица собрана по официальным страницам вендоров на 21 августа 2026 года. Цены за изображение у API-моделей и цены подписок для сервисов с интерфейсом это разные единицы, поэтому колонка «Тариф» указывает то, что вендор публикует у себя.

Модель Сильная сторона Текст на картинке Локальный запуск Доступ из России Тариф по официальному источнику
Midjourney Эстетика кадра, стилизация Слабое место, надписи надёжнее добавлять в редакторе Нет Официального подтверждения нет Подписка, актуальные планы на midjourney.com/pricing
FLUX.2 (Black Forest Labs) Дешёвый массовый поток и редактирование Типографика вынесена в отдельный вариант flex Да, FLUX.2 [dev] только локально, открытые веса Через API, оплата в долларах 1 кредит равен 0,01 доллара; [klein] 4B от 0,014 доллара, [pro] от 0,03, редактирование от 0,045, [max] от 0,07 за изображение
GPT Image (OpenAI) Понимание сложных инструкций и сцен Заметно лучше среднего по рынку Нет России нет в списке поддерживаемых стран OpenAI По прайсу OpenAI: gpt-image-2, 30 долларов за 1 млн выходных токенов, в batch 15
Gemini 3 Pro Image (Nano Banana Pro) Работа по нескольким референсам, разрешение до 4K Сильная сторона модели Нет России нет в списке регионов Gemini API 0,134 доллара за изображение 1K и 2K, 0,24 за 4K; в batch вдвое дешевле
Stable Diffusion (Stability AI) Полный контроль, дообучение, собственная инфраструктура Слабое место базовых моделей Да, это главный сценарий Локально ограничений по региону нет Brand Studio: пробный доступ до 1000 кредитов, Creator 19 долларов в месяц за 2000 кредитов, Core 50 долларов за 5000
Ideogram Надписи, вывески, макеты с текстом Профильная задача, на Canvas есть отдельный текстовый инструмент Нет Официального подтверждения нет Планы и кредиты меняются, вендор отправляет на ideogram.ai/pricing
Recraft Вектор, иконки, брендовые наборы в едином стиле Работает, ориентирован на дизайн-задачи Нет Официального подтверждения нет API: 1 доллар равен 1000 юнитов; Recraft V4.1 0,035 доллара за изображение, V4.1 Pro 0,21, V4 Pro 0,25
Шедеврум (YandexART) Русский промпт, вход без зарубежной карты Слабое место Нет Да, вход по Яндекс ID Базово бесплатно; по справке Яндекса подписка Про первые 7 дней бесплатно, далее 100 рублей в месяц при активном Яндекс Плюсе, и открывает 4K, шесть вариантов вместо двух и коммерческое использование

Три вещи, которые видно из таблицы и которые обычно упускают. Первое: разброс цены за изображение между FLUX.2 [klein] 4B (от 0,014 доллара) и Gemini 3 Pro Image в 4K (0,24 доллара) семнадцатикратный, поэтому «дорого» и «дёшево» решается не брендом, а тем, какую долю кадров вы гоните на флагмане. Второе: локальный запуск сегодня это Stable Diffusion и открытые веса FLUX.2 [dev], причём [dev] у Black Forest Labs в документации помечен как open weights, non-commercial и без хостингового API, а коммерческое самостоятельное развёртывание идёт через отдельные лицензии: тариф на 10 тысяч изображений в месяц открывает только модели [klein], доступ к [dev] начинается с тарифа на 100 тысяч. Третье: у OpenAI на странице поддерживаемых стран прямо сказано, что доступ к сервисам вне перечисленных территорий может привести к блокировке или приостановке аккаунта, и России в перечне нет. Это не про скорость VPN, это про риск потерять аккаунт с оплаченным балансом.

Разбор конкретных приёмов и параметров одной модели мы вынесли отдельно: как ставить задачу, читать параметры и не жечь Fast-часы, смотрите в материале как пользоваться Midjourney.

Квиз: какая модель под вашу задачу

  1. Что вы генерируете чаще: предметные кадры и фоны для карточек, иллюстрации и иконки в фирменном стиле или макеты с надписями? Предметка это FLUX.2 и Gemini, иллюстрации и вектор это Recraft, надписи это Ideogram.
  2. Нужен ли читаемый текст прямо на изображении? Если да, Midjourney и Шедеврум отпадают, остаются Ideogram, GPT Image и Gemini.
  3. Важен ли доступ и оплата без зарубежной карты? Если да, рабочих вариантов два: Шедеврум и локальный запуск Stable Diffusion на своём железе.

Генерация по референсу: почему это важнее генерации с нуля

Генерация с чистого листа даёт красивую случайность. Бизнесу нужна повторяемость, а её даёт работа по референсу. Рабочих режимов три.

  • Image-to-image. На вход идёт исходная картинка плюс текст. Модель перерисовывает сцену, сохраняя композицию. Так меняют фон и свет у одного и того же товара.
  • Inpaint. Перерисовывается только выделенная область: убрать блик, заменить этикетку, дорисовать деталь. Остальной кадр не трогается, это важно для карточек, где товар уже утверждён.
  • Outpaint. Кадр достраивается за границы. Один снимок раскладывается в 1:1 для маркетплейса, 9:16 для сторис и 16:9 для обложки без повторной съёмки.

Число референсов ограничено и зависит от модели. По документации Google, Gemini 3 Pro Image держит высокую точность переноса на 5 изображениях и принимает до 14 изображений суммарно, а Gemini 3.1 Flash Image удерживает до 10 объектов и до 4 персонажей в одном сценарии. У Black Forest Labs редактирование по картинке тарифицируется отдельно от генерации: FLUX.2 [pro] от 0,03 доллара за генерацию и от 0,045 за image editing.

Вывод для бренда: заведите один эталонный референс на продуктовую линейку и не меняйте его между партиями. Стиль удерживает не промпт, а зафиксированная пара «референс плюс шаблон промпта». Как только референс поплыл, серия рассыпается, и видно это не на генерации, а на выкладке в каталоге.

Где это приносит деньги

Платят не за красивые демо-кадры, а за задачи, где раньше требовались люди, смена и бюджет.

  • Карточки и каталог. Один снимок товара плюс генерация фонов и сцен под разные площадки. Считать выгоду надо не по одной картинке, а по SKU: при 40 позициях и 5 ракурсах это 200 изображений, то есть около 6 долларов на FLUX.2 [pro] и около 27 долларов на Gemini 3 Pro Image в 2K.
  • Соцсети. Обложки и посты в едином стиле по одному шаблону промпта. Здесь важнее скорость и однородность, чем максимальное качество кадра, поэтому дешёвые модели закрывают задачу целиком.
  • Рекламные креативы. Пять вариантов баннера под A/B-тест за час. По прайсам из таблицы сама генерация пяти вариантов стоит центы, поэтому ограничивает ширину теста не бюджет на картинки, а время на отбор.
  • Иллюстрации лендинга. Черновой визуал под макет, пока нет финального дизайна. Полезно на этапе, когда гипотезу проверяют, а не запускают.

Про время. Честное сравнение выглядит так: предметная съёмка это согласование ТЗ, доставка образца, смена, отбор и ретушь, и цикл почти никогда не укладывается в один рабочий день. Партия из двадцати фонов по одному эталонному фото собирается за час работы оператора. Это наш внутренний норматив планирования по потоку контент-фабрик, а не замер вендора: он не заменяет съёмку там, где нужен реальный товар в реальном свете, но снимает с неё всё, что раньше делали ради разнообразия фонов.

Нужен поток картинок, а не десять красивых кадров

Соберём генерацию под ваш каталог: эталонные референсы, шаблоны промптов, отбор, брендирование и выгрузка на площадки. Считаем стоимость по числу SKU и ракурсов, а не по абстрактным пакетам.

Обсудить задачу

Структура промпта из 6 блоков

«Красивая картинка кофе» даёт среднее по обучающей выборке. Рабочий промпт собирается из шести блоков.

  1. Объект. Что в кадре и в каком состоянии. Чашка эспрессо, пар, крема на поверхности.
  2. Композиция. Ракурс, план, положение объекта, пустое место под текст.
  3. Свет. Источник, направление, жёсткость тени, время суток.
  4. Стиль. Фотореализм, плоская иллюстрация, вектор, конкретная оптика.
  5. Качество и формат. Соотношение сторон, разрешение, требования к детализации.
  6. Исключения. Что не должно попасть в кадр. В Stable Diffusion это отдельный параметр negative_prompt, в интерфейсных сервисах то же самое пишут словами.

Разбор на реальном запросе.

Было: «кофе на столе, красиво, профессиональное фото».

Стало: «Чашка эспрессо белого фарфора на дубовом столе, вид сверху под углом 45 градусов, чашка в левой трети кадра, правая треть пустая под заголовок. Мягкий боковой свет из окна слева, тёплая цветовая гамма, мягкая тень вправо. Фотореализм, макросъёмка, глубина резкости малая. Соотношение сторон 3:2. Без текста, без рук, без посторонних предметов на столе».

Разница не в длине, а в том, что убраны места, где модель решала за вас: ракурс, положение объекта, свободная зона под текст, направление света. После такого промпта правки идут по одному параметру за итерацию, и результат воспроизводится завтра.

Слабые места: руки, текст, повторяемость

Границы инструмента знать важнее, чем сильные стороны: именно на них теряют время.

  • Кисти рук и мелкая анатомия. Лишние пальцы и вывернутые суставы остаются самым частым браком, особенно на общих планах, где рука занимает мало пикселей. Проверять надо каждый кадр с людьми.
  • Текст на изображении. Надписи на упаковке и вывеске у моделей общего назначения плывут. Ideogram сделал типографику профильной задачей: в документации сервиса описан отдельный текстовый инструмент на Canvas, где надпись ставится текстовым блоком со своим шрифтом, размером, цветом и порядком наложения, то есть правится как объект, а не перегенерируется вместе со всем кадром. Второй надёжный путь остаётся прежним: генерировать фон без текста и добавлять надпись в редакторе.
  • Повторяемость персонажа и предмета. Без референсов один и тот же герой в новой сцене получается похожим, но другим. Решается только фиксацией референсов, а у моделей с ограничением на число входных картинок (5 референсов с высокой точностью у Gemini 3 Pro Image) вы упираетесь в это ограничение быстрее, чем ожидаете.

Про долю брака. Мы планируем поток из расчёта три генерации на один кадр, который дойдёт до публикации, и на сложных сценах с людьми закладываем больше. Это внутренний норматив нашей редакции, а не статистика вендоров: у вашей задачи коэффициент будет свой, но считать бюджет по одной генерации на кадр нельзя, иначе смета разъедется втрое.

Ещё одна ловушка, о которой не пишут в рекламе: права на бесплатных тарифах. У Recraft в документации сказано прямо, что изображения на Free-плане публичны, остаются собственностью Recraft и не лицензированы для коммерческого использования, а полные права даёт только платный план. В Шедевруме коммерческое использование без согласования с сервисом входит в подписку Про, там же лежат 4K и скачивание картинки до публикации. Ideogram, наоборот, заявляет, что не претендует на владение результатом и не ограничивает ваши права в нём. Разница принципиальная, и проверять её надо до того, как картинка ушла на упаковку.

Как встроить генерацию в поток

Ценность появляется не от одной картинки, а от конвейера. Цепочка выглядит так.

  1. Генерация. Шаблон промпта плюс эталонный референс, партия под задачу, а не по одному кадру.
  2. Отбор. Отбраковка по чек-листу: анатомия, текст, соответствие референсу, артефакты по краям.
  3. Брендирование. Логотип, шрифт, плашки, ресайзы под площадки.
  4. Публикация. Выгрузка в карточки, соцсети или CMS с уже проставленными alt и именами файлов.

Где проходит порог автоматизации. Возьмите свои цифры: генерация, отбор и подготовка одного кадра вручную занимают около трёх минут, если промпт уже отлажен. При 200 изображениях в месяц это 10 часов, при 500 уже 25 часов, то есть больше трёх рабочих дней одного человека. Наш ориентир: примерно с 200 изображений в месяц ручной режим перестаёт окупаться и дешевле поднять API-конвейер, потому что стоимость самих генераций (от 3 долларов за 200 кадров на FLUX.2 [klein]) на порядки ниже стоимости этих часов.

Технически конвейер собирается на API любой из моделей таблицы: у Black Forest Labs это кредиты по 0,01 доллара, у Recraft предоплаченные юниты (1 доллар равен 1000 юнитов), у OpenAI и Google оплата по токенам и за изображение. Отдельно считайте batch-режим: у Gemini 3 Pro Image пакетная обработка стоит вдвое дешевле обычной, 0,067 доллара против 0,134 за кадр 1K и 2K. Если изображения нужны не в реальном времени, это минус половина счёта на ровном месте.

Когда к картинкам добавляется видео, порядок операций меняется: сначала опорные кадры, потом анимация, и промпты пишутся уже под будущее движение. Эту связку мы разбираем в материале про рабочий процесс с AI-видео и изображениями. Готовый конвейер под ключ, вместе с отбором и публикацией, мы собираем в направлении контент-фабрик.

Генерация и SEO

Уникальная картинка даёт шанс на трафик из поиска по изображениям, но поисковику важен не вкус, а разметка и вес файла.

  • Alt. Google в документации по картинкам требует описательный alt и отдельно предупреждает против набивки ключами. Пишите то, что на картинке: «щенок далматина ловит мяч», а не перечень запросов.
  • Имя файла. Там же прямой пример: my-new-black-kitten.jpg лучше, чем IMG00023.JPG. Для генерации это дешёвый шаг, потому что имя присваивает ваш скрипт выгрузки, а не камера.
  • Формат и вес. По данным Google, WebP в режиме без потерь на 26 процентов меньше PNG, а с потерями на 25 до 34 процентов меньше сопоставимого по качеству JPEG. Индексируются также BMP, GIF, JPEG, PNG, SVG и AVIF.
  • Окружение. Картинка должна стоять рядом с релевантным текстом на тематической странице, иначе поисковик не поймёт, о чём она.

И прямо: уникальность изображения не заменяет уникальность текста. Страница, где картинки сгенерированы, а текст переписан из чужой статьи, остаётся страницей без добавленной ценности. Генерация закрывает визуальный дефицит и скорость, но не отвечает за содержательность материала.

Частые вопросы

Кому принадлежат права на сгенерированное изображение

Здесь два независимых слоя. Первый это условия сервиса: у Recraft на бесплатном плане изображения остаются собственностью Recraft и публикуются в общей галерее, на платном права переходят вам; Ideogram заявляет, что не претендует на владение результатом. Второй слой это закон. Статья 1257 ГК РФ признаёт автором произведения гражданина, творческим трудом которого оно создано, то есть охрана привязана к творческому вкладу человека, а не к факту нажатия кнопки. Практический вывод: право использовать картинку вы получаете по условиям сервиса, а вот защитить её как объект авторского права заметно сложнее, чем снимок фотографа.

Можно ли использовать результат в коммерции

Зависит от тарифа, и это не формальность. Recraft прямо пишет, что изображения Free-плана не лицензированы для коммерческого использования и, например, не подойдут для стоков, где требуется подтверждение прав. В Шедевруме коммерческое использование без согласования с сервисом входит в подписку Про. Отдельно у Recraft оговорено, что сгенерированные ассеты нельзя использовать для обучения любых ИИ-моделей.

Понимают ли модели русский промпт

Шедеврум работает на YandexART и рассчитан на русский запрос изначально. Модели с интерфейсом на английском русский принимают, но детали в нём теряются чаще, поэтому для сложных сцен промпт лучше писать по-английски, а термины стиля и оптики оставлять английскими всегда. Разбор русскоязычного сценария у нас в отдельном материале про генерацию изображений в Шедевруме.

Что делать, если нет зарубежной карты

Работающих вариантов два. Первый это российские сервисы: Шедеврум доступен по Яндекс ID, базовая генерация бесплатна, расширенные возможности идут через подписку. Второй это локальный запуск открытых моделей на своём железе, где вы вообще не платите за генерацию. Отдельно учитывайте риск: OpenAI на странице поддерживаемых стран предупреждает, что доступ к сервисам вне перечисленных территорий может привести к блокировке или приостановке аккаунта, а России в этом списке нет. То же по регионам у Gemini API.

Можно ли запустить генерацию локально

Да, и это единственный способ полностью убрать зависимость от чужого API. Локально работают Stable Diffusion и открытые веса FLUX.2 [klein] и FLUX.2 [dev], причём [dev] у Black Forest Labs хостингового API не имеет и заявлен как некоммерческий, а для коммерческого самостоятельного развёртывания вендор продаёт лицензии с лимитами 10 тысяч и 100 тысяч изображений в месяц. Цена вопроса переносится в железо: видеокарта, время инженера на настройку и поддержка пайплайна вместо счёта за генерации.

Поделиться:
X
Редакция Neurounit

Разборы инструментов, гайды и новости про нейросети, AI-маркетинг и автоматизацию. Материалы готовит редакция агентства Neurounit.

Факты и цифры проверяет редакция агентства Neurounit. Вопросы и уточнения: Telegram.

Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга