GigaChat от Сбера это семейство языковых моделей с облачным API, веб-версией и ботами в мессенджерах. Ниже только проверяемое: какие модели доступны, какой у них контекст, сколько токенов дают бесплатно, во что обходится платный режим и на каких задачах модель проседает. Цифры взяты из документации developers.sber.ru и карточек моделей на Hugging Face, состояние на август 2026 года.
Разработчик GigaChat это Сбер: тарифы в рублях с НДС, вход по Сбер ID, данные обрабатываются на серверах в России. Для российской компании это и есть основная причина смотреть в сторону GigaChat, вопрос трансграничной передачи данных и оплаты зарубежных сервисов снимается на уровне договора, а не обходных схем.
Технически это облачный сервис с REST и gRPC интерфейсом. С 17 июля 2026 года базовый адрес API это https://api.giga.chat; прежний gigachat.devices.sberbank.ru работает у подключившихся раньше, но для новых подключений закрыт и будет выведен из эксплуатации. Токен доступа живёт 30 минут, запросы на его получение принимаются до 10 раз в секунду.
Ограничение, которое стоит знать до пилота: у GigaChat есть тематические фильтры. Запрос под ограничением возвращает "choices.finish_reason": "blacklist". В закрытые темы документация относит политику и обсуждение представителей власти, экстремизм, насилие, пропаганду алкоголя и наркотиков, эротику. Для медиа или сервиса обработки жалоб это не абстракция: часть реального потока будет отбиваться. Корпоративным клиентам настройку ограничений обсуждают через gigachat@sberbank.ru.
Публично сравнить российские модели можно на бенчмарке MERA от Альянса в сфере искусственного интеллекта: лидерборд считается по версии v1.2.0, итоговый рейтинг складывается из 15 задач с закрытыми тестовыми датасетами. Это единственная площадка, где GigaChat, YandexGPT и открытые русскоязычные модели меряются по одной методике.
В облачном API четыре генеративные модели: второе поколение (GigaChat 2 Lite, Pro, Max) и GigaChat 3 Ultra, выпущенная 15 июля 2026 года и пока доступная только физлицам во Freemium. Юрлицам на платных тарифах Ultra не отдают, это прямо написано в документации.
Контекстное окно у всех четырёх одинаковое: 128 000 токенов. Документация оценивает токен в 3-4 символа, то есть порядка 400-500 тысяч знаков, около 250 машинописных страниц. Расход конкретного текста считается запросом POST /tokens/count, а не на глаз.
| Модель | Контекст | Вход | Выход | Цена за 1 млн токенов |
|---|---|---|---|---|
| GigaChat 2 Lite | 128 000 токенов | текст | текст, изображение | 65 ₽ |
| GigaChat 2 Pro | 128 000 токенов | текст, изображение, аудио | текст, изображение | 500 ₽ |
| GigaChat 2 Max | 128 000 токенов | текст, изображение, аудио | текст, изображение | 650 ₽ |
| GigaChat 3 Ultra | 128 000 токенов | текст, изображение, аудио | текст, изображение | платного тарифа нет |
Разрыв между Lite и старшими моделями виден на замерах самого вендора (карточки моделей): MMLU 0,72 у Lite против 0,82 у Pro и 0,86 у Max, Arena-Hard RU без фильтра безопасности 0,55 против 0,77 и 0,84. Разрыв растёт вместе со сложностью задачи: на общих знаниях это 10 пунктов MMLU, на коде в версии 30.1 уже 22 пункта Human Eval (0,69 против 0,91). Практический вывод: Lite дешевле Pro в 7,7 раза, поэтому проверять задачу разумно на ней, а переходить выше по результатам замера, а не заранее.
По GigaChat 3 Ultra вендор публикует другой набор метрик: MMLU-PRO 0,75, MATH 500 0,86, RuBQ 0,81, Arena-Hard RU 0,69, IFBench 0,43, AIME 2026 0,44. Напрямую с цифрами второго поколения они не сравниваются, наборы тестов разные.
Отдельная история это открытые веса. Команда ai-sage выложила на Hugging Face под лицензией MIT GigaChat 3 Ultra Preview (702 млрд параметров, 36 млрд активных, MoE с Multi-head Latent Attention и Multi-Token Prediction), GigaChat 3.5 Ultra (432 млрд и 28 млрд активных) и компактную GigaChat 3.1 Lightning (10 млрд и 1,8 млрд активных). Для полностью локального контура Lightning на 10B это реальный кандидат на своё железо, старшие Ultra требуют кластера.
Физическое лицо получает во Freemium-режиме 365 000 000 бесплатных токенов на генерацию текста. Пул не общий, он разбит по моделям и обновляется раз в 12 месяцев:
Ограничение, которое чаще всего ломает планы: у физлица генерация идёт в один поток, неважно, платные токены или бесплатные. Юрлицам и ИП по умолчанию дают 10 потоков, расширение обсуждается письмом на gigachat@sberbank.ru. Бесплатного лимита с запасом хватит на пилот и внутренний инструмент для одного человека, но не на поток обращений из чата на сайте.
Если токены кончились, физлицо докупает пакеты на 12 месяцев: 20 млн Lite за 1 300 ₽, 100 млн Lite за 6 500 ₽, 3 млн Pro за 1 500 ₽, 3 млн Max за 1 950 ₽, 15 млн Max за 9 750 ₽, 50 млн Embeddings за 700 ₽. Цены с НДС, действуют с 1 февраля 2026 года.
У юрлиц два способа. Пакеты: Lite от 300 млн токенов за 19 500 ₽ до 1 млрд за 65 000 ₽, Pro от 50 млн за 25 000 ₽, Max от 30 млн за 19 500 ₽, Embeddings от 1 млрд за 14 000 ₽. Либо pay-as-you-go по факту: 0,065 ₽ за 1000 токенов Lite, 0,5 ₽ Pro, 0,65 ₽ Max в синхронном режиме и ровно вдвое дешевле в асинхронном. Минимальные расходы при использовании сервиса 600 ₽ в месяц, в месяцы без обращений плата не списывается. Тарифы вендор пересматривает, актуальные значения смотрите в разделе Тарифы GigaChat API.
Прикидка: обращение в поддержку вместе с ответом это около 3000 знаков, то есть примерно 850-900 токенов. Значит 250 млн бесплатных Lite-токенов это порядка 280 тысяч диалогов, а в pay-as-you-go тот же объём на Lite стоит около 16 тысяч рублей. Узким местом почти никогда не оказывается цена модели, им становятся потоки, база знаний и разбор ошибок.
Посчитать экономику до внедрения, а не после
Бесплатного лимита хватает на пилот, но не на поток. Разберём сценарий: объём обращений, нужна ли база знаний и RAG, какая модель закроет задачу дешевле и где придётся оставить человека.
Быстрый выбор модели: три вопроса
Ответы «до 5 тысяч, базы нет, физлицо» означают пилот на Freemium Lite. Ответы «десятки тысяч, база есть, юрлицо» означают pay-as-you-go на Pro или Max с RAG на эмбеддингах.
Начинать с API не обязательно. У GigaChat есть веб-версия на giga.chat, Telegram-бот и VK-бот: эти три точки входа вендор перечисляет в документации, мобильное приложение он раздаёт отдельно. Вход в расширенные функции идёт по Сбер ID: физлицу договор не нужен, юрлицу для работы через API нужен счёт-оферта или договор. На витрине продукта Сбер заявляет долгосрочную память между сессиями и распознавание объектов и текста на изображениях; голосовой диалог и режим исследования описывают профильные СМИ, но сводной официальной страницы с перечнем функций веб-версии нет, проверяйте набор опций в интерфейсе после входа.
Разница между вебом и API не в качестве ответа, а в режиме работы: веб годится для разовой задачи и проверки гипотезы за час, но как только задача повторяемая (300 отзывов, 2000 заявок), нужен API с подсчётом токенов, пакетным режимом и воспроизводимыми промптами.
Файлы загружаются в хранилище запросом POST /files с обязательным параметром purpose="general". Поддерживаются txt, doc, docx, pdf, epub, ppt, pptx, xlsx. Ограничения по размеру: 40 Мб на текстовый файл, 15 Мб на изображение, 35 Мб на аудио. Поверх этого действует потолок контекста в 128 000 токенов, поэтому договор на 300 страниц придётся резать на части, а не грузить целиком.
| Задача | Что даёт модель | Где ломается |
|---|---|---|
| Суммаризация диалогов контактного центра | По кейсу Сбера сокращает время обработки обращения на 15-20 секунд | Нужен доступ к расшифровкам звонков и разметка ролей в диалоге |
| Подсказка оператору по базе знаний | Ответ за 3 секунды вместо ручного поиска до 5 минут | Без актуальной базы знаний подсказка превращается в выдумку |
| Классификация обращений и отзывов | Тональность и категория на потоке, дешевле всего на Lite | Нужна фиксированная схема категорий, иначе модель придумывает свои |
| Извлечение полей из заявок в CRM | Структурированный вывод по схеме через structured output | Ошибки в редких форматах дат и адресов, нужна валидация на выходе |
| Черновики описаний и писем | Массовая генерация по шаблону и тону | Фактура должна приходить из вашей базы, а не из памяти модели |
Других замеров вендор не публикует: сводных цифр «минут на единицу выхода» по каждой задаче в открытом доступе нет. Считайте их на своём потоке до и после, это единственный честный способ понять, окупается ли внедрение.
В официальном кейсе Сбера заявлены три измеримых результата: автоматизация до 80 процентов рутинных обращений, рост продуктивности оператора на 10 процентов за счёт ассистирования и круглосуточная первая линия. Цифра в 80 процентов относится именно к рутинным обращениям и достигается не моделью, а связкой компонентов.
Что должно быть собрано, чтобы доля была близка к заявленной:
functions, результат возвращается сообщением с ролью function. Без этого бот не узнает статус заказа и остатки на складе.Без базы знаний и RAG остаётся голая генерация, и доля закрытых без оператора обращений падает до уровня скриптового бота: модель начинает уверенно отвечать про ваши тарифы то, чего не знает.
Генерация картинок работает через встроенную функцию text2image: в запросе POST /chat/completions передаётся "function_call": "auto", в ответ приходит не картинка, а идентификатор файла, само изображение скачивается запросом POST /files/{file_id}/content в формате JPG. Стиль задаётся системным промптом. Какая модель стоит за text2image, документация не называет, поэтому утверждения про Kandinsky внутри GigaChat по первоисточнику не проверяются.
Распознавание поддержано шире: GigaChat 2 Pro, GigaChat 2 Max и GigaChat 3 Ultra принимают на вход изображения (jpeg, png, tiff, bmp) и аудио (mp3, mp4, m4a, wav, ogg, opus, webm), отдельным разделом документации идёт генерация 3D-моделей. Видео в списке форматов хранилища нет.
Трезвая оценка: генерация картинок закрывает иллюстрации для внутренних материалов и соцсетей, но проигрывает специализированным сервисам по контролю композиции и тексту на изображении. Ценность здесь в другом: распознавание документов и аудио идёт внутри того же контура, без выгрузки файлов за периметр.
Порядок короткий: получить ключ авторизации в личном кабинете, обменять его на токен доступа запросом POST /api/v2/oauth с обязательным заголовком RqUID в формате uuid4 и полем scope, отправить первый запрос на https://api.giga.chat/v1/chat/completions. Значение scope зависит от статуса: GIGACHAT_API_PERS для физлиц, GIGACHAT_API_B2B для платных пакетов ИП и юрлиц, GIGACHAT_API_CORP для pay-as-you-go. Перепутанный scope это самая частая ошибка на старте.
Вторая по частоте ошибка это сертификаты. Нужен корневой сертификат НУЦ Минцифры, без него запрос падает с [SSL: CERTIFICATE_VERIFY_FAILED]. Ставится он либо на уровне ОС с портала Госуслуг, либо на уровне приложения: в Python дописывается в файл certifi, в Node.js путь задаётся через NODE_EXTRA_CA_CERTS, для gRPC через GRPC_DEFAULT_SSL_ROOTS_FILE_PATH. В новом виртуальном окружении установку придётся повторить.
Переписывать код с нуля не нужно: формат сообщений частично совместим с OpenAI API, работает обычный OpenAI SDK с base_url="https://api.giga.chat/v1" и токеном доступа в поле api_key, а для перенаправления существующих запросов есть утилита gpt2giga. Совместимость именно частичная, вендор рекомендует свои GigaChain и langchain-gigachat.
Критерий выбора при этом один и он не про баллы в бенчмарках. Если данные нельзя выпускать из российского контура и оплата должна идти по договору в рублях, GigaChat выигрывает независимо от метрик. Если задача про сложные англоязычные рассуждения, большой код и агентные цепочки, а данные не чувствительны, зарубежные флагманы дадут результат лучше. Всё остальное решается замером на своих данных, а не сравнением таблиц.
План рассчитан на одну задачу, а не на «внедрить ИИ». Метрика одна: минут на единицу выхода (на обращение, описание, заявку). Порог отказа задаётся заранее.
POST /tokens/count и умножить на месячный объём.Порог отказа: если на второй неделе доля ответов с ручной правкой выше 30 процентов, проблема не в модели, а в задаче или базе знаний, и смена Lite на Max её не чинит. И пункт в регламент: ответы проверяет человек везде, где цена ошибки выше стоимости проверки, об этом предупреждает и сам вендор в разделе про квоты и ограничения.