Мультимодальные нейросети принимают на вход не только текст, но и изображение, аудио, видео и PDF, и отвечают на вопрос по этому материалу. Загрузите скриншот таблицы и попросите посчитать выручку: модель прочитает цифры, поймёт структуру колонок и подпишет вывод текстом. Так работает Claude Opus 5 у Anthropic, так же устроены Gemini у Google и линейка GigaChat у Сбера.
Раньше под каждый тип данных брали свою систему: одна распознавала речь, вторая вытаскивала текст со скана, третья классифицировала фото, а между ними сидел программист и склеивал форматы. Этот зоопарк схлопывается в один вызов API. Меняется не столько качество распознавания, сколько экономика: меньше интеграций и меньше стыков, где что-то ломается. Все лимиты ниже взяты из официальной документации Anthropic, Google, OpenAI и Сбера.
Мономодальная модель понимает один формат: текст на входе, текст на выходе. Мультимодальная получает разнородные данные в одном запросе и связывает их. Вы кладёте фотографию товара и просите описание для карточки, загружаете PDF договора и спрашиваете про сроки расторжения, присылаете запись созвона и получаете список задач. Отличие от старой связки OCR плюс классификатор в том, что OCR отдаёт символы и координаты, а логику разбора вы пишете сами; мультимодальная модель отвечает на вопрос по документу сразу.
Разговор про мультимодальные модели обычно заканчивается на слове «умеет». Практическую разницу задают лимиты: сколько файлов влезет в один запрос и что из этого выйдет по деньгам. Цифры действуют на август 2026 года, перед внедрением сверяйтесь с документацией.
| Модель | Типы входа | Предельные объёмы | Доступность из РФ |
|---|---|---|---|
| Claude (Anthropic) | Текст, изображение, PDF | До 100 изображений на запрос при контексте 200k токенов и до 600 у остальных моделей. Максимум 8000×8000 px и 10 МБ на изображение, запрос целиком до 32 МБ. PDF до 600 страниц, до 100 при контексте меньше 1M | России нет в списке поддерживаемых стран Anthropic |
| Gemini (Google) | Текст, изображение, аудио, видео, PDF | До 3600 изображений на запрос. Видео до 1 часа при контексте 1M токенов и до 3 часов на пониженном разрешении, кадр в секунду. Аудио до 9,5 часов. PDF до 1000 страниц. File API до 20 ГБ на файл на платном тарифе и до 2 ГБ на бесплатном | России нет в списке доступных регионов Gemini API |
| Модели OpenAI | Текст, изображение, аудио | До 1500 изображений на запрос, объём запроса до 512 МБ, форматы PNG, JPEG, WEBP и статичный GIF. Аудиофайл на транскрибацию до 25 МБ | России нет в списке поддерживаемых стран и территорий |
| GigaChat (Сбер) | Текст, изображение, аудио, документы | Изображение до 15 МБ и не более 1792 токенов, аудиофайл до 35 МБ, текстовый файл до 40 МБ, весь запрос с изображениями и аудио до 80 МБ | Российский вендор, доступ по договору напрямую |
Вывод, который обычно узнают после пилота: лимит на число файлов редко оказывается настоящим ограничением, раньше упирается размер запроса или контекст. У Anthropic это написано прямо: формально можно отправить до 600 изображений, но потолок в 32 МБ наступает раньше. У Gemini час видео при 300 токенах в секунду съедает около миллиона токенов, то есть контекст целиком.
Сценарий, ради которого технологию чаще всего и берут: нейросеть распознаёт документ по фото или скриншоту и отдаёт структурированные поля. Снимок счёта на телефон, скриншот таблицы из чужой CRM, скан акта из архива. На выходе не текст целиком, а нужные поля: номер, дата, контрагент, сумма, ставка НДС.
Объём считают в токенах, а не в страницах. Gemini берёт 258 токенов за страницу PDF, значит стостраничный договор это примерно 25 800 токенов входа. Claude оценивает изображение патчами 28×28 пикселей: картинка 1000×1000 стоит 1296 визуальных токенов. Дальше подставляете цену за миллион входных токенов и получаете стоимость партии.
Где распознавание ломается, по прямым формулировкам вендоров:
Два приёма снимают часть ошибок бесплатно. Первый: класть изображение перед текстом вопроса, Anthropic рекомендует именно такой порядок. Второй: требовать вместе со значением поля точную цитату, откуда оно взято, и отправлять строки без цитаты на ручную проверку.
Задача «нейросеть, расшифровка встречи» распадается на три шага, и путать их дорого: дословный транскрипт, разделение по спикерам, протокол с решениями и задачами.
Транскрипт и диаризацию делают специализированные модели. У OpenAI это gpt-transcribe для расшифровки и отдельная gpt-4o-transcribe-diarize для разделения по спикерам с форматом ответа diarized_json; в ней можно заранее назвать не больше четырёх спикеров, приложив к каждому образец голоса на 2-10 секунд, остальных модель разметит безымянными сегментами. Лимит на файл 25 МБ, поэтому двухчасовую встречу приходится резать и склеивать тайминги у себя. Универсальная модель работает иначе: Gemini принимает до 9,5 часов аудио в одном запросе и считает 32 токена за секунду звука, то есть минута разговора стоит 1920 токенов, а часовая встреча около 115 тысяч.
Ограничение, которое надо знать до пилота: в Gemini аудио понижается до 16 кбит/с, а многоканальная запись сводится в один канал, поэтому рассчитывать на разделение говорящих по дорожкам нельзя, даже если конференц-система пишет каждого участника отдельно. На перекрывающейся речи качество падает у всех моделей: перебивки склеиваются в одну реплику и приписываются одному спикеру. Для планёрки на десять человек это критично, для созвона на двоих почти незаметно. Поэтому протокол уходит участникам как черновик с пометкой «поправьте, если исказил»: одно неверно приписанное обещание стоит дороже всей экономии на расшифровке.
Запрос «нейросеть, анализ видео» обычно означает одно из трёх: контроль выкладки в торговой точке, приёмка работ подрядчика по фото и видео, разбор записей камер или экрана. Все три упираются не в модель, а в качество съёмки.
Механика такая: Gemini хранит видео с частотой один кадр в секунду и тратит около 300 токенов на секунду при обычном разрешении и 100 при пониженном. Следствий два. Всё, что произошло между кадрами, для модели не существует. И длина ролика конвертируется в деньги: десять минут это порядка 180 тысяч токенов входа.
Требования к съёмке, без которых пилот проваливается на любой модели:
Мультимодальный чат-бот не просит клиента описать проблему словами: тот присылает фото товара, скриншот ошибки или снимок повреждённой упаковки, и агент отвечает по изображению. Метрика для решения о пилоте считается по вашим же логам за прошлый квартал: доля обращений с вложением и средняя длительность таких тикетов против текстовых. Наш ориентир по пилотам, а не отраслевая норма: если вложения есть в единицах процентов, экономия не окупит интеграцию и начинать стоит с документов. Если их около четверти и такие тикеты заметно дольше, потому что оператор глазами сверяет фото с каталогом, это ваш пилот.
Технические рамки. В вебе Claude берёт до 20 изображений на сообщение, через API счёт идёт на сотни, но упирается в 32 МБ запроса. Загруженные изображения не хранятся дольше обработки и удаляются автоматически, это аргумент для юристов. И отдельное ограничение под фото людей: Claude по политике использования отказывается называть людей на изображениях, идентификация клиента по селфи через него невозможна в принципе.
Коротко про то, как работают мультимодальные модели: любой вход превращается в токены в общем векторном пространстве, и дальше модель не различает, пришёл сигнал из текста, картинки или звука. Токенизация изображения при этом устроена по-разному, и это видно по счёту. Claude режет картинку на патчи 28×28 пикселей, каждый патч это один визуальный токен. У стандартных моделей потолок 1568 визуальных токенов и длинная сторона 1568 пикселей, у Claude 4.7 и новее 4784 токена и 2576 пикселей, всё крупнее уменьшается перед обработкой. Gemini считает иначе: изображение до 384 пикселей по обеим сторонам стоит 258 токенов, крупнее нарезается на плитки 768×768 по тем же 258 токенов.
Отсюда вывод про бюджет. В документации Anthropic приведён расчёт: при цене 5 долларов за миллион входных токенов тысяча изображений 1000×1000 обходится примерно в 6,5 доллара по входу, а тысяча кадров 4K уже почти в 24 доллара. Разница в четыре раза возникает только из-за разрешения, поэтому уменьшение картинки до отправки это основная статья экономии.
Связка «ИИ-агент с изображениями» отличается от чата тем, что картинка приходит не от человека, а от инструмента: агент сделал скриншот, снял кадр с камеры, выгрузил страницу отчёта и вернул это себе на вход.
Тут вылезают ограничения, которых в чате не бывает. Изображения внутри результатов инструментов идут в общий лимит: у Anthropic при превышении 20 изображений в запросе включается более жёсткое ограничение по размеру каждого, и картинки надо ужимать так, чтобы ни одна сторона не превышала 2000 пикселей, иначе запрос отклоняется с ошибкой про many-image requests. Скриншоты, возвращаемые в инструменты computer use и browser use, автоматически не уменьшаются: слишком большой кадр отбрасывается с ошибкой валидации. И координаты, которые называет модель, относятся к изображению уже после ресайза, поэтому без обратного пересчёта масштаба агент кликает мимо.
Сам цикл «цель, план, вызов инструмента, проверка» мы разбирали в материале что такое AI-агент: зрение добавляет агенту возможностей, но не добавляет надёжности.
Ограничения мультимодальных нейросетей удобны тем, что вендоры публикуют их сами. Список ниже целиком из официальной документации.
Отсюда правило, которое фиксируется письменно до старта. Результат проверяет человек, если задача попадает хотя бы в одну категорию: денежные суммы и платёжные реквизиты; юридически значимые документы и всё, что порождает обязательства; медицинские и кадровые решения; тексты, уходящие наружу от имени компании; данные, попадающие в учётную систему необратимо. Остальное пускают без ручной приёмки и контролируют выборкой. И отдельный пункт про данные: загружая скан договора или фото сотрудника в облачную модель, вы передаёте их за пределы контура, а для персональных данных это вопрос закона, а не удобства.
Нужен пилот, который не развалится на проверке
Разберём ваш поток документов, фото или записей, посчитаем стоимость обработки в токенах и настроим приёмку результата: что уходит человеку, что проходит автоматически, как ловятся ошибки распознавания.
Внедрение мультимодальных нейросетей проваливается обычно не на технологии, а на выборе первой задачи. Четыре критерия, по которым кандидата стоит проверить до того, как писать код.
Дальше прогоняете эталонную партию, считаете долю строк, которые пришлось править, и стоимость обработки, сравниваете с текущими затратами. Сходится, масштабируете; не сходится, потеряли неделю, а не квартал. Общая логика подбора инструментов разобрана в обзоре нейросетей для бизнеса, здесь мы говорим только про нетекстовые данные.
У Gemini до 1000 страниц по 258 токенов каждая. У Claude до 600 страниц, но не более 100, если контекстное окно запроса меньше 1M токенов, и с общим потолком 32 МБ. GigaChat принимает текстовый файл до 40 МБ, ограничение по страницам в документации не указано.
Целиком да, если это Gemini: лимит 9,5 часов аудио на запрос. Через транскрибацию OpenAI придётся резать, там 25 МБ на файл, а разделение по спикерам делает отдельная модель gpt-4o-transcribe-diarize, где заранее назвать по образцу голоса можно не больше четырёх спикеров.
У Anthropic изображения обрабатываются в рамках запроса и удаляются после неё, отдельно указано, что они не используются для обучения. У остальных вендоров условия хранения проверяйте в их политике: это первое, что спросит служба безопасности, и последнее, о чём вспоминают на пилоте.