Нейросеть для описания картинки: подписи, alt, распознавание

Все статьи
Все статьи
Редакция Neurounit
15 сентября 2026
Нейросети
Нейросеть для описания картинки: подписи, alt, распознавание
Нейросеть для описания картинки: как получать подписи и alt для сайта, распознавать текст на фото и ловить ошибки модели. Инструменты, доступные в России.

В каталоге интернет-магазина две тысячи фотографий, и у половины атрибут alt пустой или повторяет название товара. Вручную это неделя монотонной работы. Нейросеть для описания картинки делает черновики за вечер, если заранее объяснить ей, для чего нужен текст.

Такие модели называют мультимодальными: они принимают на вход изображение и отвечают текстом. Одна и та же модель сочинит подпись для поста, alt для сайта, список характеристик для карточки или перепишет текст со скриншота. Но это разные задачи, и запрос под каждую нужен свой.

Ошибаются они предсказуемо: дописывают предметы, которых нет, путают цифры и уверенно называют модель товара по внешнему виду. Поэтому в работе с описаниями важен не только сервис, но и проверка результата.

Что умеет нейросеть для описания картинки

Под общим названием скрываются задачи с разными требованиями к тексту:

Задача Что нужно получить Главный риск
Alt-текст Одна фраза о сути изображения в контексте страницы Переспам ключами или общие слова
Подпись к посту Живой текст в тоне бренда Штампы и выдуманные детали
Атрибуты товара Цвет, материал, форма, комплектность Угаданные характеристики, которых на фото не видно
Распознавание текста Точная копия надписей, чисел, таблиц Перепутанные символы и пропущенные строки
Ответ на вопрос о снимке Объяснение графика, схемы, ошибки на скриншоте Уверенный неверный вывод

Как устроены модели, которые одновременно видят и пишут, рассказано в материале о мультимодальных нейросетях. Для практики важнее другое: модель описывает то, что видит, и ничего не знает о вашей странице, товаре и аудитории, пока вы ей об этом не скажете.

Отдельный случай: атрибуты для маркетплейса. Там нужен не связный текст, а значения полей: цвет, материал, тип застёжки, количество предметов в комплекте. Просите модель заполнять только то, что видно на снимке, а пустые поля помечать как «не видно на фото». Остальное берите из данных поставщика.

Alt-текст для SEO: что говорят сами поисковики

В документации Google сказано, что поисковик использует alt вместе с алгоритмами компьютерного зрения и содержимым страницы, чтобы понять, что изображено. Хороший alt, по версии Google, информативен, уместно использует ключевые слова и соответствует контексту страницы. Набивка alt ключами ухудшает опыт пользователя и может привести к тому, что сайт сочтут спамом.

У Яндекса похожие правила. Робот Картинок учитывает alt, title, текст рядом с картинкой, тексты ссылок на неё и имена файлов. В alt советуют писать не все ключевые слова страницы, а только относящиеся к изображению. Для похожих снимков нужны уникальные alt, например «вид спереди» и «вид сзади». Оставлять alt пустым Яндекс не рекомендует.

Исключение касается доступности. Для чисто декоративных элементов вроде разделителей и фоновых узоров рекомендации W3C предлагают пустой alt, чтобы экранные дикторы их пропускали. Всё, что несёт информацию, описывайте. Где alt стоит среди остальных тегов страницы, показано в разборе HTML-тегов для SEO.

Как составить запрос для alt и подписей

Модель не знает, на какой странице окажется картинка. Без контекста она выдаст что-то вроде «на изображении представлен товар на белом фоне». Такой alt бесполезен и для поиска, и для незрячего пользователя.

Рабочий запрос включает пять блоков:

  1. Контекст страницы. «Карточка товара: женские кожаные ботинки на шнуровке, осенняя коллекция».
  2. Назначение текста. «Нужен alt для сайта: одно короткое предложение».
  3. Что включить. Объект, главный отличительный признак, ракурс или действие.
  4. Что исключить. Слова «изображение», «фото», «картинка», перечни ключей, оценки вроде «стильный». В рекомендациях W3C отмечено, что такие слова в alt обычно не нужны: экранный диктор и так сообщает, что это изображение.
  5. Требование к фактам. «Описывай только то, что видно. Если материал или бренд не различим, не называй его».

Пример результата для той же карточки: «Коричневые кожаные ботинки на шнуровке, вид сбоку». Коротко, по делу, с ключевыми словами, которые относятся к снимку.

Для серии похожих снимков просите модель различать ракурсы и детали: «Это третье фото из пяти, укажи ракурс и то, что на нём видно в отличие от остальных». Так alt получатся уникальными без ручной переписки. Для подписей в соцсетях запрос другой: там нужны тон бренда, длина под площадку и призыв, а точность деталей проверяется так же строго.

Распознавание текста и данных на изображениях

Если на картинке текст, задача меняется. Для alt правило W3C простое: в альтернативном тексте должны быть те же слова, что на изображении. Для документов, чеков, накладных и скриншотов таблиц важна точность каждого символа, и здесь языковой модели стоит помочь специализированным распознаванием.

В России для этого есть Vision OCR в Yandex AI Studio. Сервис распознаёт печатный и рукописный текст на изображениях и в PDF, в том числе в колонках, таблицах, формулах и шаблонных документах. Принимает JPEG, PNG и PDF до 10 МБ, изображение не больше 20 мегапикселей.

Практичная связка: OCR извлекает текст точно, а языковая модель уже из этого текста делает вывод, таблицу или краткое описание. Если поручить всё мультимодальной модели сразу, она может «исправить» цифру, которая показалась ей странной, и вы узнаете об этом последним.

Для чеков и выгрузок с суммами добавьте простую проверку: пересчитайте итог по строкам и сравните с распознанным. Расхождение сразу покажет, где OCR или модель ошиблись.

Где описать картинку нейросетью

  • Алиса AI. В чат загружается изображение до 20 МБ, одно на сообщение. Можно спросить, что на фото, попросить объяснить график или разобрать задачу со снимка. Подходит для разовых задач и проверки идей.
  • GigaChat API. Модели принимают изображения JPEG, PNG, TIFF и BMP до 15 МБ. В одном сообщении одно изображение, в одном запросе до десяти. На обработку одного изображения уходит не больше 1792 токенов, оплата идёт по тарифам API. Подходит для пакетной обработки каталога.
  • Vision OCR. Когда нужна точная расшифровка текста, а не описание смысла.

Для каталога на тысячи позиций чат не годится. Нужен скрипт, который берёт фото и данные товара из базы, отправляет запрос по шаблону и складывает ответы в таблицу на проверку. Учтите условия: бесплатный режим GigaChat API предназначен только для личного некоммерческого использования, для каталога магазина нужен платный пакет.

В пакетном режиме передавайте модели вместе с фото то, что уже известно: название, артикул, цвет из карточки. Просите ответ в строгом формате, например в виде полей alt, title и подписи, чтобы результат сразу ложился в таблицу. Чем больше фактов модель получает из базы, тем меньше ей приходится угадывать.

Проверка: где нейросеть ошибается в описаниях

  • Выдуманные детали. Модель пишет «деревянный стол», хотя стол пластиковый, или «на фоне моря», хотя это бассейн. Проверяйте существительные.
  • Цифры и надписи. Артикулы, цены и даты путаются чаще слов.
  • Бренды и модели. По внешнему виду нейросеть легко «узнаёт» конкретную модель телефона или кроссовок. Если в данных товара её нет, в описании её быть не должно.
  • Количество. «Три чашки» на фото с четырьмя чашками встречаются регулярно.
  • Люди. Не просите модель оценивать возраст, национальность или здоровье людей на фото: это источник и ошибок, и претензий.

Часть проверки можно автоматизировать. Если в карточке товара указан цвет «чёрный», а в описании модель написала «синий», скрипт пометит такую строку на ручной разбор. То же с названиями брендов, которых нет в вашем ассортименте.

При пакетной обработке проверяйте выборку вручную, а все описания, где модель упомянула бренд, число или человека, смотрите целиком. Почему модели уверенно ошибаются и как это ловить, разобрано в статье про галлюцинации нейросетей.

С чего начать

  1. Выгрузите список изображений сайта с пустыми или одинаковыми alt. Начните со страниц, которые приносят трафик.
  2. Соберите шаблон запроса с контекстом страницы и ограничениями и прогоните его на двадцати картинках.
  3. Проверьте результат вручную, поправьте шаблон, затем запускайте пакетную обработку через API.
  4. Для документов и скриншотов с цифрами подключите OCR и сверяйте числа с исходником.

Alt-тексты дают эффект вместе с остальной оптимизацией страницы: структурой, текстами, скоростью, разметкой. Если не хочется собирать это самостоятельно, аудит и доработку сайта под поиск ведёт команда SEO-продвижения Neurounit.

Поделиться:
X
Редакция Neurounit

Разборы инструментов, гайды и новости про нейросети, AI-маркетинг и автоматизацию. Материалы готовит редакция агентства Neurounit.

Факты и цифры проверяет редакция агентства Neurounit. Вопросы и уточнения: Telegram.

Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга