В каталоге интернет-магазина две тысячи фотографий, и у половины атрибут alt пустой или повторяет название товара. Вручную это неделя монотонной работы. Нейросеть для описания картинки делает черновики за вечер, если заранее объяснить ей, для чего нужен текст.
Такие модели называют мультимодальными: они принимают на вход изображение и отвечают текстом. Одна и та же модель сочинит подпись для поста, alt для сайта, список характеристик для карточки или перепишет текст со скриншота. Но это разные задачи, и запрос под каждую нужен свой.
Ошибаются они предсказуемо: дописывают предметы, которых нет, путают цифры и уверенно называют модель товара по внешнему виду. Поэтому в работе с описаниями важен не только сервис, но и проверка результата.
Под общим названием скрываются задачи с разными требованиями к тексту:
| Задача | Что нужно получить | Главный риск |
|---|---|---|
| Alt-текст | Одна фраза о сути изображения в контексте страницы | Переспам ключами или общие слова |
| Подпись к посту | Живой текст в тоне бренда | Штампы и выдуманные детали |
| Атрибуты товара | Цвет, материал, форма, комплектность | Угаданные характеристики, которых на фото не видно |
| Распознавание текста | Точная копия надписей, чисел, таблиц | Перепутанные символы и пропущенные строки |
| Ответ на вопрос о снимке | Объяснение графика, схемы, ошибки на скриншоте | Уверенный неверный вывод |
Как устроены модели, которые одновременно видят и пишут, рассказано в материале о мультимодальных нейросетях. Для практики важнее другое: модель описывает то, что видит, и ничего не знает о вашей странице, товаре и аудитории, пока вы ей об этом не скажете.
Отдельный случай: атрибуты для маркетплейса. Там нужен не связный текст, а значения полей: цвет, материал, тип застёжки, количество предметов в комплекте. Просите модель заполнять только то, что видно на снимке, а пустые поля помечать как «не видно на фото». Остальное берите из данных поставщика.
В документации Google сказано, что поисковик использует alt вместе с алгоритмами компьютерного зрения и содержимым страницы, чтобы понять, что изображено. Хороший alt, по версии Google, информативен, уместно использует ключевые слова и соответствует контексту страницы. Набивка alt ключами ухудшает опыт пользователя и может привести к тому, что сайт сочтут спамом.
У Яндекса похожие правила. Робот Картинок учитывает alt, title, текст рядом с картинкой, тексты ссылок на неё и имена файлов. В alt советуют писать не все ключевые слова страницы, а только относящиеся к изображению. Для похожих снимков нужны уникальные alt, например «вид спереди» и «вид сзади». Оставлять alt пустым Яндекс не рекомендует.
Исключение касается доступности. Для чисто декоративных элементов вроде разделителей и фоновых узоров рекомендации W3C предлагают пустой alt, чтобы экранные дикторы их пропускали. Всё, что несёт информацию, описывайте. Где alt стоит среди остальных тегов страницы, показано в разборе HTML-тегов для SEO.
Модель не знает, на какой странице окажется картинка. Без контекста она выдаст что-то вроде «на изображении представлен товар на белом фоне». Такой alt бесполезен и для поиска, и для незрячего пользователя.
Рабочий запрос включает пять блоков:
Пример результата для той же карточки: «Коричневые кожаные ботинки на шнуровке, вид сбоку». Коротко, по делу, с ключевыми словами, которые относятся к снимку.
Для серии похожих снимков просите модель различать ракурсы и детали: «Это третье фото из пяти, укажи ракурс и то, что на нём видно в отличие от остальных». Так alt получатся уникальными без ручной переписки. Для подписей в соцсетях запрос другой: там нужны тон бренда, длина под площадку и призыв, а точность деталей проверяется так же строго.
Если на картинке текст, задача меняется. Для alt правило W3C простое: в альтернативном тексте должны быть те же слова, что на изображении. Для документов, чеков, накладных и скриншотов таблиц важна точность каждого символа, и здесь языковой модели стоит помочь специализированным распознаванием.
В России для этого есть Vision OCR в Yandex AI Studio. Сервис распознаёт печатный и рукописный текст на изображениях и в PDF, в том числе в колонках, таблицах, формулах и шаблонных документах. Принимает JPEG, PNG и PDF до 10 МБ, изображение не больше 20 мегапикселей.
Практичная связка: OCR извлекает текст точно, а языковая модель уже из этого текста делает вывод, таблицу или краткое описание. Если поручить всё мультимодальной модели сразу, она может «исправить» цифру, которая показалась ей странной, и вы узнаете об этом последним.
Для чеков и выгрузок с суммами добавьте простую проверку: пересчитайте итог по строкам и сравните с распознанным. Расхождение сразу покажет, где OCR или модель ошиблись.
Для каталога на тысячи позиций чат не годится. Нужен скрипт, который берёт фото и данные товара из базы, отправляет запрос по шаблону и складывает ответы в таблицу на проверку. Учтите условия: бесплатный режим GigaChat API предназначен только для личного некоммерческого использования, для каталога магазина нужен платный пакет.
В пакетном режиме передавайте модели вместе с фото то, что уже известно: название, артикул, цвет из карточки. Просите ответ в строгом формате, например в виде полей alt, title и подписи, чтобы результат сразу ложился в таблицу. Чем больше фактов модель получает из базы, тем меньше ей приходится угадывать.
Часть проверки можно автоматизировать. Если в карточке товара указан цвет «чёрный», а в описании модель написала «синий», скрипт пометит такую строку на ручной разбор. То же с названиями брендов, которых нет в вашем ассортименте.
При пакетной обработке проверяйте выборку вручную, а все описания, где модель упомянула бренд, число или человека, смотрите целиком. Почему модели уверенно ошибаются и как это ловить, разобрано в статье про галлюцинации нейросетей.
Alt-тексты дают эффект вместе с остальной оптимизацией страницы: структурой, текстами, скоростью, разметкой. Если не хочется собирать это самостоятельно, аудит и доработку сайта под поиск ведёт команда SEO-продвижения Neurounit.