Мультимодальные нейросети: что это и где применять

Все статьи
Все статьи
Редакция Neurounit
6 августа 2026
Обновлено 22 августа 2026
Нейросети
Мультимодальные нейросети: что это и где применять
Мультимодальные нейросети работают с текстом, фото, звуком и видео сразу. Разбираем, где они приносят деньги бизнесу, какие есть ограничения и с чего начать внедрение.

Мультимодальные нейросети принимают на вход не только текст, но и изображение, аудио, видео и PDF, и отвечают на вопрос по этому материалу. Загрузите скриншот таблицы и попросите посчитать выручку: модель прочитает цифры, поймёт структуру колонок и подпишет вывод текстом. Так работает Claude Opus 5 у Anthropic, так же устроены Gemini у Google и линейка GigaChat у Сбера.

Раньше под каждый тип данных брали свою систему: одна распознавала речь, вторая вытаскивала текст со скана, третья классифицировала фото, а между ними сидел программист и склеивал форматы. Этот зоопарк схлопывается в один вызов API. Меняется не столько качество распознавания, сколько экономика: меньше интеграций и меньше стыков, где что-то ломается. Все лимиты ниже взяты из официальной документации Anthropic, Google, OpenAI и Сбера.

Что такое мультимодальность на практике

Мономодальная модель понимает один формат: текст на входе, текст на выходе. Мультимодальная получает разнородные данные в одном запросе и связывает их. Вы кладёте фотографию товара и просите описание для карточки, загружаете PDF договора и спрашиваете про сроки расторжения, присылаете запись созвона и получаете список задач. Отличие от старой связки OCR плюс классификатор в том, что OCR отдаёт символы и координаты, а логику разбора вы пишете сами; мультимодальная модель отвечает на вопрос по документу сразу.

  • Claude (Anthropic). JPEG, PNG, GIF, WebP. Анимация не поддерживается, из GIF берётся только первый кадр. PDF обрабатывает как документ, а не как набор картинок.
  • Gemini (Google). Изображения PNG, JPEG, WEBP, HEIC, HEIF; видео MP4, MOV, AVI, WebM и другие контейнеры; аудио WAV, MP3, AIFF, AAC, OGG, FLAC.
  • GigaChat (Сбер, линейка GigaChat 3 Ultra и GigaChat 2 Max / Pro / Lite). Изображения jpeg, png, tiff, bmp; аудио mp3, m4a, wav, ogg, opus; документы pdf, docx, xlsx, pptx и другие.

Какие форматы и объёмы принимают модели

Разговор про мультимодальные модели обычно заканчивается на слове «умеет». Практическую разницу задают лимиты: сколько файлов влезет в один запрос и что из этого выйдет по деньгам. Цифры действуют на август 2026 года, перед внедрением сверяйтесь с документацией.

Модель Типы входа Предельные объёмы Доступность из РФ
Claude (Anthropic) Текст, изображение, PDF До 100 изображений на запрос при контексте 200k токенов и до 600 у остальных моделей. Максимум 8000×8000 px и 10 МБ на изображение, запрос целиком до 32 МБ. PDF до 600 страниц, до 100 при контексте меньше 1M России нет в списке поддерживаемых стран Anthropic
Gemini (Google) Текст, изображение, аудио, видео, PDF До 3600 изображений на запрос. Видео до 1 часа при контексте 1M токенов и до 3 часов на пониженном разрешении, кадр в секунду. Аудио до 9,5 часов. PDF до 1000 страниц. File API до 20 ГБ на файл на платном тарифе и до 2 ГБ на бесплатном России нет в списке доступных регионов Gemini API
Модели OpenAI Текст, изображение, аудио До 1500 изображений на запрос, объём запроса до 512 МБ, форматы PNG, JPEG, WEBP и статичный GIF. Аудиофайл на транскрибацию до 25 МБ России нет в списке поддерживаемых стран и территорий
GigaChat (Сбер) Текст, изображение, аудио, документы Изображение до 15 МБ и не более 1792 токенов, аудиофайл до 35 МБ, текстовый файл до 40 МБ, весь запрос с изображениями и аудио до 80 МБ Российский вендор, доступ по договору напрямую

Вывод, который обычно узнают после пилота: лимит на число файлов редко оказывается настоящим ограничением, раньше упирается размер запроса или контекст. У Anthropic это написано прямо: формально можно отправить до 600 изображений, но потолок в 32 МБ наступает раньше. У Gemini час видео при 300 токенах в секунду съедает около миллиона токенов, то есть контекст целиком.

Распознавание документов и таблиц

Сценарий, ради которого технологию чаще всего и берут: нейросеть распознаёт документ по фото или скриншоту и отдаёт структурированные поля. Снимок счёта на телефон, скриншот таблицы из чужой CRM, скан акта из архива. На выходе не текст целиком, а нужные поля: номер, дата, контрагент, сумма, ставка НДС.

Объём считают в токенах, а не в страницах. Gemini берёт 258 токенов за страницу PDF, значит стостраничный договор это примерно 25 800 токенов входа. Claude оценивает изображение патчами 28×28 пикселей: картинка 1000×1000 стоит 1296 визуальных токенов. Дальше подставляете цену за миллион входных токенов и получаете стоимость партии.

Где распознавание ломается, по прямым формулировкам вендоров:

  • Повёрнутые сканы. У OpenAI перевёрнутый контент вынесен в ограничения отдельно, у Anthropic в списке рисков стоят низкокачественные и повёрнутые изображения. Разворачивайте страницу до отправки.
  • Мелкий текст. Оба вендора называют его источником ошибок. Anthropic добавляет, что изображения меньше 200 пикселей интерпретируются ненадёжно, а крупные перед обработкой уменьшаются, и текст читается хуже.
  • Пересжатие. В рекомендациях Anthropic сказано прямо: сильное JPEG-сжатие делает текст трудночитаемым, особенно после нескольких проходов. Скриншот, дважды прошедший через мессенджер, уже испорчен.
  • Рукописный текст, печати и подписи. Это наша практика, а не документация: перекрытая печатью сумма и рукописные пометки дают самый высокий процент правок. Такие поля лучше не отдавать модели вообще.

Два приёма снимают часть ошибок бесплатно. Первый: класть изображение перед текстом вопроса, Anthropic рекомендует именно такой порядок. Второй: требовать вместе со значением поля точную цитату, откуда оно взято, и отправлять строки без цитаты на ручную проверку.

Разбор аудио и встреч

Задача «нейросеть, расшифровка встречи» распадается на три шага, и путать их дорого: дословный транскрипт, разделение по спикерам, протокол с решениями и задачами.

Транскрипт и диаризацию делают специализированные модели. У OpenAI это gpt-transcribe для расшифровки и отдельная gpt-4o-transcribe-diarize для разделения по спикерам с форматом ответа diarized_json; в ней можно заранее назвать не больше четырёх спикеров, приложив к каждому образец голоса на 2-10 секунд, остальных модель разметит безымянными сегментами. Лимит на файл 25 МБ, поэтому двухчасовую встречу приходится резать и склеивать тайминги у себя. Универсальная модель работает иначе: Gemini принимает до 9,5 часов аудио в одном запросе и считает 32 токена за секунду звука, то есть минута разговора стоит 1920 токенов, а часовая встреча около 115 тысяч.

Ограничение, которое надо знать до пилота: в Gemini аудио понижается до 16 кбит/с, а многоканальная запись сводится в один канал, поэтому рассчитывать на разделение говорящих по дорожкам нельзя, даже если конференц-система пишет каждого участника отдельно. На перекрывающейся речи качество падает у всех моделей: перебивки склеиваются в одну реплику и приписываются одному спикеру. Для планёрки на десять человек это критично, для созвона на двоих почти незаметно. Поэтому протокол уходит участникам как черновик с пометкой «поправьте, если исказил»: одно неверно приписанное обещание стоит дороже всей экономии на расшифровке.

Видео и визуальный контроль

Запрос «нейросеть, анализ видео» обычно означает одно из трёх: контроль выкладки в торговой точке, приёмка работ подрядчика по фото и видео, разбор записей камер или экрана. Все три упираются не в модель, а в качество съёмки.

Механика такая: Gemini хранит видео с частотой один кадр в секунду и тратит около 300 токенов на секунду при обычном разрешении и 100 при пониженном. Следствий два. Всё, что произошло между кадрами, для модели не существует. И длина ролика конвертируется в деньги: десять минут это порядка 180 тысяч токенов входа.

Требования к съёмке, без которых пилот проваливается на любой модели:

  • Ценник или маркировка читаются человеком на кадре: у OpenAI в требованиях записано, что изображение должно быть достаточно чётким, чтобы его понял человек. Не разбираете надпись сами, не разберёт и модель.
  • Один объект на кадр вместо панорамы и фиксированный ракурс: панорамные снимки и фишай OpenAI относит к слабым местам, подсчёт мелких объектов оба вендора называют приблизительным, а смену угла модель принимает за изменение на витрине.
  • Длинный ролик режется по смысловым событиям: часовая запись целиком стоит около миллиона токенов, а разбирать в ней обычно нужно два-три эпизода.

Мультимодальность в поддержке и продажах

Мультимодальный чат-бот не просит клиента описать проблему словами: тот присылает фото товара, скриншот ошибки или снимок повреждённой упаковки, и агент отвечает по изображению. Метрика для решения о пилоте считается по вашим же логам за прошлый квартал: доля обращений с вложением и средняя длительность таких тикетов против текстовых. Наш ориентир по пилотам, а не отраслевая норма: если вложения есть в единицах процентов, экономия не окупит интеграцию и начинать стоит с документов. Если их около четверти и такие тикеты заметно дольше, потому что оператор глазами сверяет фото с каталогом, это ваш пилот.

Технические рамки. В вебе Claude берёт до 20 изображений на сообщение, через API счёт идёт на сотни, но упирается в 32 МБ запроса. Загруженные изображения не хранятся дольше обработки и удаляются автоматически, это аргумент для юристов. И отдельное ограничение под фото людей: Claude по политике использования отказывается называть людей на изображениях, идентификация клиента по селфи через него невозможна в принципе.

Как это работает под капотом

Коротко про то, как работают мультимодальные модели: любой вход превращается в токены в общем векторном пространстве, и дальше модель не различает, пришёл сигнал из текста, картинки или звука. Токенизация изображения при этом устроена по-разному, и это видно по счёту. Claude режет картинку на патчи 28×28 пикселей, каждый патч это один визуальный токен. У стандартных моделей потолок 1568 визуальных токенов и длинная сторона 1568 пикселей, у Claude 4.7 и новее 4784 токена и 2576 пикселей, всё крупнее уменьшается перед обработкой. Gemini считает иначе: изображение до 384 пикселей по обеим сторонам стоит 258 токенов, крупнее нарезается на плитки 768×768 по тем же 258 токенов.

Отсюда вывод про бюджет. В документации Anthropic приведён расчёт: при цене 5 долларов за миллион входных токенов тысяча изображений 1000×1000 обходится примерно в 6,5 доллара по входу, а тысяча кадров 4K уже почти в 24 доллара. Разница в четыре раза возникает только из-за разрешения, поэтому уменьшение картинки до отправки это основная статья экономии.

Мультимодальность и ИИ-агенты

Связка «ИИ-агент с изображениями» отличается от чата тем, что картинка приходит не от человека, а от инструмента: агент сделал скриншот, снял кадр с камеры, выгрузил страницу отчёта и вернул это себе на вход.

Тут вылезают ограничения, которых в чате не бывает. Изображения внутри результатов инструментов идут в общий лимит: у Anthropic при превышении 20 изображений в запросе включается более жёсткое ограничение по размеру каждого, и картинки надо ужимать так, чтобы ни одна сторона не превышала 2000 пикселей, иначе запрос отклоняется с ошибкой про many-image requests. Скриншоты, возвращаемые в инструменты computer use и browser use, автоматически не уменьшаются: слишком большой кадр отбрасывается с ошибкой валидации. И координаты, которые называет модель, относятся к изображению уже после ресайза, поэтому без обратного пересчёта масштаба агент кликает мимо.

Сам цикл «цель, план, вызов инструмента, проверка» мы разбирали в материале что такое AI-агент: зрение добавляет агенту возможностей, но не добавляет надёжности.

Ограничения и где модель врёт

Ограничения мультимодальных нейросетей удобны тем, что вендоры публикуют их сами. Список ниже целиком из официальной документации.

  • Мелкий текст и цифры в таблицах. Названы источником ошибок и у OpenAI, и у Anthropic: сумма в счёте, прочитанная моделью, это гипотеза, а не факт.
  • Подсчёт объектов. Оба вендора называют счёт приблизительным, особенно на большом числе мелких предметов.
  • Метаданные. Claude не получает и не разбирает метаданные изображения: дату и место съёмки он знать не может, и если спросить, ответ будет придуман.
  • Определение AI-генерации. Сказано прямо: модель не может определить, сгенерировано ли изображение нейросетью.
  • Медицинские снимки. Claude не предназначен для интерпретации КТ и МРТ, у OpenAI медицинские изображения тоже в ограничениях.
  • Капча. У OpenAI распознавание капчи прямо отнесено к ограничениям и заблокировано из соображений безопасности.

Отсюда правило, которое фиксируется письменно до старта. Результат проверяет человек, если задача попадает хотя бы в одну категорию: денежные суммы и платёжные реквизиты; юридически значимые документы и всё, что порождает обязательства; медицинские и кадровые решения; тексты, уходящие наружу от имени компании; данные, попадающие в учётную систему необратимо. Остальное пускают без ручной приёмки и контролируют выборкой. И отдельный пункт про данные: загружая скан договора или фото сотрудника в облачную модель, вы передаёте их за пределы контура, а для персональных данных это вопрос закона, а не удобства.

Нужен пилот, который не развалится на проверке

Разберём ваш поток документов, фото или записей, посчитаем стоимость обработки в токенах и настроим приёмку результата: что уходит человеку, что проходит автоматически, как ловятся ошибки распознавания.

Обсудить задачу

С какой задачи начать: критерии выбора пилота

Внедрение мультимодальных нейросетей проваливается обычно не на технологии, а на выборе первой задачи. Четыре критерия, по которым кандидата стоит проверить до того, как писать код.

  1. Объём однотипных вложений в месяц. Считайте не файлы вообще, а однотипные: счета одного формата, фото витрины одного магазина, звонки одного отдела. Берёте время сотрудника на один документ, умножаете на ставку и на объём, вычитаете стоимость обработки в токенах. Ориентиры уже есть: страница PDF в Gemini это 258 токенов, картинка 1000×1000 в Claude это 1296 визуальных токенов, минута аудио в Gemini это 1920 токенов.
  2. Наличие эталона. Нужны хотя бы 100 примеров с известным правильным ответом: те же счета, но уже разнесённые бухгалтером. Без эталона точность не измерить, и качество будут обсуждать словами.
  3. Цена ошибки. Первая задача не должна попадать в категории обязательной проверки из предыдущего раздела. Хорошо, когда ошибка стоит одной правки руками, а не письма контрагенту.
  4. Доступ к API. В России этот пункт решает всё: страны нет в списках поддерживаемых у Anthropic, OpenAI и Google. Выбор на старте такой: зарубежное юрлицо с легальным договором и оплатой либо российский вендор вроде GigaChat, где лимиты скромнее, зато данные и договор внутри контура.

Дальше прогоняете эталонную партию, считаете долю строк, которые пришлось править, и стоимость обработки, сравниваете с текущими затратами. Сходится, масштабируете; не сходится, потеряли неделю, а не квартал. Общая логика подбора инструментов разобрана в обзоре нейросетей для бизнеса, здесь мы говорим только про нетекстовые данные.

Частые вопросы

Сколько страниц PDF можно отправить за один раз

У Gemini до 1000 страниц по 258 токенов каждая. У Claude до 600 страниц, но не более 100, если контекстное окно запроса меньше 1M токенов, и с общим потолком 32 МБ. GigaChat принимает текстовый файл до 40 МБ, ограничение по страницам в документации не указано.

Можно ли отдать модели двухчасовую запись встречи

Целиком да, если это Gemini: лимит 9,5 часов аудио на запрос. Через транскрибацию OpenAI придётся резать, там 25 МБ на файл, а разделение по спикерам делает отдельная модель gpt-4o-transcribe-diarize, где заранее назвать по образцу голоса можно не больше четырёх спикеров.

Хранятся ли загруженные изображения

У Anthropic изображения обрабатываются в рамках запроса и удаляются после неё, отдельно указано, что они не используются для обучения. У остальных вендоров условия хранения проверяйте в их политике: это первое, что спросит служба безопасности, и последнее, о чём вспоминают на пилоте.

Поделиться:
X
Редакция Neurounit

Разборы инструментов, гайды и новости про нейросети, AI-маркетинг и автоматизацию. Материалы готовит редакция агентства Neurounit.

Факты и цифры проверяет редакция агентства Neurounit. Вопросы и уточнения: Telegram.

Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга