GigaChat от Сбера: модели, лимиты и применение в бизнесе

Все статьи
Все статьи
Редакция Neurounit
23 июля 2026
Обновлено 22 августа 2026
Нейросети
GigaChat от Сбера: модели, лимиты и применение в бизнесе
GigaChat для бизнеса: что умеет российская нейросеть, где реально экономит время и деньги, как встроить в поддержку, контент и продажи. Практика без воды.

GigaChat от Сбера это семейство языковых моделей с облачным API, веб-версией и ботами в мессенджерах. Ниже только проверяемое: какие модели доступны, какой у них контекст, сколько токенов дают бесплатно, во что обходится платный режим и на каких задачах модель проседает. Цифры взяты из документации developers.sber.ru и карточек моделей на Hugging Face, состояние на август 2026 года.

Что такое GigaChat от Сбера и на чём он работает

Разработчик GigaChat это Сбер: тарифы в рублях с НДС, вход по Сбер ID, данные обрабатываются на серверах в России. Для российской компании это и есть основная причина смотреть в сторону GigaChat, вопрос трансграничной передачи данных и оплаты зарубежных сервисов снимается на уровне договора, а не обходных схем.

Технически это облачный сервис с REST и gRPC интерфейсом. С 17 июля 2026 года базовый адрес API это https://api.giga.chat; прежний gigachat.devices.sberbank.ru работает у подключившихся раньше, но для новых подключений закрыт и будет выведен из эксплуатации. Токен доступа живёт 30 минут, запросы на его получение принимаются до 10 раз в секунду.

Ограничение, которое стоит знать до пилота: у GigaChat есть тематические фильтры. Запрос под ограничением возвращает "choices.finish_reason": "blacklist". В закрытые темы документация относит политику и обсуждение представителей власти, экстремизм, насилие, пропаганду алкоголя и наркотиков, эротику. Для медиа или сервиса обработки жалоб это не абстракция: часть реального потока будет отбиваться. Корпоративным клиентам настройку ограничений обсуждают через gigachat@sberbank.ru.

Публично сравнить российские модели можно на бенчмарке MERA от Альянса в сфере искусственного интеллекта: лидерборд считается по версии v1.2.0, итоговый рейтинг складывается из 15 задач с закрытыми тестовыми датасетами. Это единственная площадка, где GigaChat, YandexGPT и открытые русскоязычные модели меряются по одной методике.

Линейка моделей: Lite, Pro, Max и поколение GigaChat 3

В облачном API четыре генеративные модели: второе поколение (GigaChat 2 Lite, Pro, Max) и GigaChat 3 Ultra, выпущенная 15 июля 2026 года и пока доступная только физлицам во Freemium. Юрлицам на платных тарифах Ultra не отдают, это прямо написано в документации.

Контекстное окно у всех четырёх одинаковое: 128 000 токенов. Документация оценивает токен в 3-4 символа, то есть порядка 400-500 тысяч знаков, около 250 машинописных страниц. Расход конкретного текста считается запросом POST /tokens/count, а не на глаз.

Модель Контекст Вход Выход Цена за 1 млн токенов
GigaChat 2 Lite 128 000 токенов текст текст, изображение 65 ₽
GigaChat 2 Pro 128 000 токенов текст, изображение, аудио текст, изображение 500 ₽
GigaChat 2 Max 128 000 токенов текст, изображение, аудио текст, изображение 650 ₽
GigaChat 3 Ultra 128 000 токенов текст, изображение, аудио текст, изображение платного тарифа нет

Разрыв между Lite и старшими моделями виден на замерах самого вендора (карточки моделей): MMLU 0,72 у Lite против 0,82 у Pro и 0,86 у Max, Arena-Hard RU без фильтра безопасности 0,55 против 0,77 и 0,84. Разрыв растёт вместе со сложностью задачи: на общих знаниях это 10 пунктов MMLU, на коде в версии 30.1 уже 22 пункта Human Eval (0,69 против 0,91). Практический вывод: Lite дешевле Pro в 7,7 раза, поэтому проверять задачу разумно на ней, а переходить выше по результатам замера, а не заранее.

По GigaChat 3 Ultra вендор публикует другой набор метрик: MMLU-PRO 0,75, MATH 500 0,86, RuBQ 0,81, Arena-Hard RU 0,69, IFBench 0,43, AIME 2026 0,44. Напрямую с цифрами второго поколения они не сравниваются, наборы тестов разные.

Отдельная история это открытые веса. Команда ai-sage выложила на Hugging Face под лицензией MIT GigaChat 3 Ultra Preview (702 млрд параметров, 36 млрд активных, MoE с Multi-head Latent Attention и Multi-Token Prediction), GigaChat 3.5 Ultra (432 млрд и 28 млрд активных) и компактную GigaChat 3.1 Lightning (10 млрд и 1,8 млрд активных). Для полностью локального контура Lightning на 10B это реальный кандидат на своё железо, старшие Ultra требуют кластера.

Сколько стоит: Freemium и платные пакеты

Физическое лицо получает во Freemium-режиме 365 000 000 бесплатных токенов на генерацию текста. Пул не общий, он разбит по моделям и обновляется раз в 12 месяцев:

  • 250 000 000 токенов на модели Lite (GigaChat или GigaChat-2);
  • 40 000 000 токенов на модели Pro;
  • 25 000 000 токенов на модели Max;
  • 50 000 000 токенов на GigaChat-3-Ultra.

Ограничение, которое чаще всего ломает планы: у физлица генерация идёт в один поток, неважно, платные токены или бесплатные. Юрлицам и ИП по умолчанию дают 10 потоков, расширение обсуждается письмом на gigachat@sberbank.ru. Бесплатного лимита с запасом хватит на пилот и внутренний инструмент для одного человека, но не на поток обращений из чата на сайте.

Если токены кончились, физлицо докупает пакеты на 12 месяцев: 20 млн Lite за 1 300 ₽, 100 млн Lite за 6 500 ₽, 3 млн Pro за 1 500 ₽, 3 млн Max за 1 950 ₽, 15 млн Max за 9 750 ₽, 50 млн Embeddings за 700 ₽. Цены с НДС, действуют с 1 февраля 2026 года.

У юрлиц два способа. Пакеты: Lite от 300 млн токенов за 19 500 ₽ до 1 млрд за 65 000 ₽, Pro от 50 млн за 25 000 ₽, Max от 30 млн за 19 500 ₽, Embeddings от 1 млрд за 14 000 ₽. Либо pay-as-you-go по факту: 0,065 ₽ за 1000 токенов Lite, 0,5 ₽ Pro, 0,65 ₽ Max в синхронном режиме и ровно вдвое дешевле в асинхронном. Минимальные расходы при использовании сервиса 600 ₽ в месяц, в месяцы без обращений плата не списывается. Тарифы вендор пересматривает, актуальные значения смотрите в разделе Тарифы GigaChat API.

Прикидка: обращение в поддержку вместе с ответом это около 3000 знаков, то есть примерно 850-900 токенов. Значит 250 млн бесплатных Lite-токенов это порядка 280 тысяч диалогов, а в pay-as-you-go тот же объём на Lite стоит около 16 тысяч рублей. Узким местом почти никогда не оказывается цена модели, им становятся потоки, база знаний и разбор ошибок.

Посчитать экономику до внедрения, а не после

Бесплатного лимита хватает на пилот, но не на поток. Разберём сценарий: объём обращений, нужна ли база знаний и RAG, какая модель закроет задачу дешевле и где придётся оставить человека.

Обсудить задачу

Быстрый выбор модели: три вопроса

  1. Сколько текстовых обращений в месяц пойдёт через модель? До 5 тысяч это Lite, от 50 тысяч сложных диалогов это повод считать Pro или Max отдельно.
  2. Есть ли база знаний (регламенты, инструкции, карточки товаров) в машиночитаемом виде? Если нет, начинать надо с неё, а не с выбора модели: без RAG доля автоматизации падает.
  3. Кто заключает договор, физлицо или юрлицо? У физлица один поток и доступ к GigaChat 3 Ultra во Freemium, у юрлица 10 потоков по умолчанию, но Ultra на платных тарифах пока нет.

Ответы «до 5 тысяч, базы нет, физлицо» означают пилот на Freemium Lite. Ответы «десятки тысяч, база есть, юрлицо» означают pay-as-you-go на Pro или Max с RAG на эмбеддингах.

Где попробовать без кода: веб, приложение, Telegram

Начинать с API не обязательно. У GigaChat есть веб-версия на giga.chat, Telegram-бот и VK-бот: эти три точки входа вендор перечисляет в документации, мобильное приложение он раздаёт отдельно. Вход в расширенные функции идёт по Сбер ID: физлицу договор не нужен, юрлицу для работы через API нужен счёт-оферта или договор. На витрине продукта Сбер заявляет долгосрочную память между сессиями и распознавание объектов и текста на изображениях; голосовой диалог и режим исследования описывают профильные СМИ, но сводной официальной страницы с перечнем функций веб-версии нет, проверяйте набор опций в интерфейсе после входа.

Разница между вебом и API не в качестве ответа, а в режиме работы: веб годится для разовой задачи и проверки гипотезы за час, но как только задача повторяемая (300 отзывов, 2000 заявок), нужен API с подсчётом токенов, пакетным режимом и воспроизводимыми промптами.

Текст и документы: что реально закрывает

Файлы загружаются в хранилище запросом POST /files с обязательным параметром purpose="general". Поддерживаются txt, doc, docx, pdf, epub, ppt, pptx, xlsx. Ограничения по размеру: 40 Мб на текстовый файл, 15 Мб на изображение, 35 Мб на аудио. Поверх этого действует потолок контекста в 128 000 токенов, поэтому договор на 300 страниц придётся резать на части, а не грузить целиком.

Задача Что даёт модель Где ломается
Суммаризация диалогов контактного центра По кейсу Сбера сокращает время обработки обращения на 15-20 секунд Нужен доступ к расшифровкам звонков и разметка ролей в диалоге
Подсказка оператору по базе знаний Ответ за 3 секунды вместо ручного поиска до 5 минут Без актуальной базы знаний подсказка превращается в выдумку
Классификация обращений и отзывов Тональность и категория на потоке, дешевле всего на Lite Нужна фиксированная схема категорий, иначе модель придумывает свои
Извлечение полей из заявок в CRM Структурированный вывод по схеме через structured output Ошибки в редких форматах дат и адресов, нужна валидация на выходе
Черновики описаний и писем Массовая генерация по шаблону и тону Фактура должна приходить из вашей базы, а не из памяти модели

Других замеров вендор не публикует: сводных цифр «минут на единицу выхода» по каждой задаче в открытом доступе нет. Считайте их на своём потоке до и после, это единственный честный способ понять, окупается ли внедрение.

Поддержка и чат-боты на GigaChat

В официальном кейсе Сбера заявлены три измеримых результата: автоматизация до 80 процентов рутинных обращений, рост продуктивности оператора на 10 процентов за счёт ассистирования и круглосуточная первая линия. Цифра в 80 процентов относится именно к рутинным обращениям и достигается не моделью, а связкой компонентов.

Что должно быть собрано, чтобы доля была близка к заявленной:

  • База знаний в машиночитаемом виде и поиск по ней через эмбеддинги: в API есть EmbeddingsGigaR, Embeddings-2 и Embeddings-3B-2025-09, цена у юрлица 0,014 ₽ за 1000 токенов.
  • Function calling. Модель сама не выполняет вызов, а генерирует аргументы по описанию из массива functions, результат возвращается сообщением с ролью function. Без этого бот не узнает статус заказа и остатки на складе.
  • Валидация ответа перед отправкой клиенту: в кейсе Сбера за это отвечает отдельный агент-валидатор. Документация прямо предупреждает, что ответы генерируются нейросетью и могут быть искажены.

Без базы знаний и RAG остаётся голая генерация, и доля закрытых без оператора обращений падает до уровня скриптового бота: модель начинает уверенно отвечать про ваши тарифы то, чего не знает.

Изображения и мультимодальность

Генерация картинок работает через встроенную функцию text2image: в запросе POST /chat/completions передаётся "function_call": "auto", в ответ приходит не картинка, а идентификатор файла, само изображение скачивается запросом POST /files/{file_id}/content в формате JPG. Стиль задаётся системным промптом. Какая модель стоит за text2image, документация не называет, поэтому утверждения про Kandinsky внутри GigaChat по первоисточнику не проверяются.

Распознавание поддержано шире: GigaChat 2 Pro, GigaChat 2 Max и GigaChat 3 Ultra принимают на вход изображения (jpeg, png, tiff, bmp) и аудио (mp3, mp4, m4a, wav, ogg, opus, webm), отдельным разделом документации идёт генерация 3D-моделей. Видео в списке форматов хранилища нет.

Трезвая оценка: генерация картинок закрывает иллюстрации для внутренних материалов и соцсетей, но проигрывает специализированным сервисам по контролю композиции и тексту на изображении. Ценность здесь в другом: распознавание документов и аудио идёт внутри того же контура, без выгрузки файлов за периметр.

API за полчаса: авторизация и первый запрос

Порядок короткий: получить ключ авторизации в личном кабинете, обменять его на токен доступа запросом POST /api/v2/oauth с обязательным заголовком RqUID в формате uuid4 и полем scope, отправить первый запрос на https://api.giga.chat/v1/chat/completions. Значение scope зависит от статуса: GIGACHAT_API_PERS для физлиц, GIGACHAT_API_B2B для платных пакетов ИП и юрлиц, GIGACHAT_API_CORP для pay-as-you-go. Перепутанный scope это самая частая ошибка на старте.

Вторая по частоте ошибка это сертификаты. Нужен корневой сертификат НУЦ Минцифры, без него запрос падает с [SSL: CERTIFICATE_VERIFY_FAILED]. Ставится он либо на уровне ОС с портала Госуслуг, либо на уровне приложения: в Python дописывается в файл certifi, в Node.js путь задаётся через NODE_EXTRA_CA_CERTS, для gRPC через GRPC_DEFAULT_SSL_ROOTS_FILE_PATH. В новом виртуальном окружении установку придётся повторить.

Переписывать код с нуля не нужно: формат сообщений частично совместим с OpenAI API, работает обычный OpenAI SDK с base_url="https://api.giga.chat/v1" и токеном доступа в поле api_key, а для перенаправления существующих запросов есть утилита gpt2giga. Совместимость именно частичная, вендор рекомендует свои GigaChain и langchain-gigachat.

Где GigaChat проигрывает: честные ограничения

  • Длинные рассуждения и сложные инструкции. У флагманской GigaChat 3 Ultra при MMLU-PRO 0,75 показатель IFBench 0,43, а AIME 2026 равен 0,44: общие знания заметно сильнее, чем способность вытянуть длинную цепочку и точно отработать многосоставную инструкцию.
  • Код на младшей модели. Human Eval у GigaChat 2 Lite 0,69 против 0,91 у Pro (замеры вендора для версии моделей 30.1 в разделе «История обновления моделей»). Сэкономить на модели в задачах генерации кода не выйдет.
  • Доступность флагмана. GigaChat 3 Ultra по документации отдаётся только физлицам во Freemium, юрлицам на платных тарифах её нет. Для корпоративного контура Сбер предлагает отдельную платформу GigaChat Enterprise («ГигаЧат Бизнес») в облачной, гибридной и on-premise конфигурациях.
  • Пропускная способность. Один поток у физлица и 10 у юрлица по умолчанию: нагрузочный сценарий согласуется с вендором заранее, а не обнаруживается очередью в день запуска.
  • Тематические фильтры. Они режут часть легального рабочего потока, если контент касается политики или чувствительных тем.

Критерий выбора при этом один и он не про баллы в бенчмарках. Если данные нельзя выпускать из российского контура и оплата должна идти по договору в рублях, GigaChat выигрывает независимо от метрик. Если задача про сложные англоязычные рассуждения, большой код и агентные цепочки, а данные не чувствительны, зарубежные флагманы дадут результат лучше. Всё остальное решается замером на своих данных, а не сравнением таблиц.

С чего начать за неделю

План рассчитан на одну задачу, а не на «внедрить ИИ». Метрика одна: минут на единицу выхода (на обращение, описание, заявку). Порог отказа задаётся заранее.

  1. День 1. Выбрать одну повторяемую текстовую задачу с объёмом от 200 единиц в месяц. Замерить текущее время на единицу вручную по 20 примерам.
  2. День 2. Собрать 20 эталонных пар «вход, правильный выход». Это будущий тест, без него оценить качество нельзя.
  3. День 3. Прогнать задачу в веб-версии на giga.chat, довести промпт до состояния, когда он работает на 15 примерах из 20.
  4. День 4. Подключить API: ключ, сертификат Минцифры, первый запрос к Lite. Посчитать расход через POST /tokens/count и умножить на месячный объём.
  5. День 5. Прогнать все 20 эталонов через API на Lite и на Pro. Если Lite проходит, остаться на Lite: разница в цене семикратная.
  6. День 6. Поставить проверку на выходе (валидация формата, ключевых полей, запрет на пустой ответ) и логирование каждого запроса с идентификатором.
  7. День 7. Запустить на 10 процентах потока параллельно с ручной обработкой, сравнить время и долю правок.

Порог отказа: если на второй неделе доля ответов с ручной правкой выше 30 процентов, проблема не в модели, а в задаче или базе знаний, и смена Lite на Max её не чинит. И пункт в регламент: ответы проверяет человек везде, где цена ошибки выше стоимости проверки, об этом предупреждает и сам вендор в разделе про квоты и ограничения.

Поделиться:
X
Редакция Neurounit

Разборы инструментов, гайды и новости про нейросети, AI-маркетинг и автоматизацию. Материалы готовит редакция агентства Neurounit.

Факты и цифры проверяет редакция агентства Neurounit. Вопросы и уточнения: Telegram.

Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга