Нейросеть YandexGPT живёт не в отдельном чате, а внутри платформы Yandex AI Studio: у каждой версии свой URI, контекст 32 768 токенов, прайс за тысячу токенов и квоты, в которые проект упирается быстрее, чем ожидает. Разбираем линейку версий, три режима вызова, цену тысячи токенов, вызов функций, эмбеддинги и то, какие данные в модель отправлять нельзя. Цифры сверены с документацией AI Studio 22 августа 2026 года.
В базовом инстансе AI Studio модели YandexGPT соседствуют с моделями Alice AI и опенсорсными. У каждой свой URI вида gpt://идентификатор_каталога/имя_модели, и версию определяет именно URI, а не название в интерфейсе.
| Модель | URI | Контекст | Доступные API |
|---|---|---|---|
| YandexGPT Pro 5.1 | gpt://…/yandexgpt-5.1 | 32k (32 768) | API генерации текста, OpenAI-совместимые |
| YandexGPT Pro 5 | gpt://…/yandexgpt-5-pro | 32k (32 768) | API генерации текста, OpenAI-совместимые |
| YandexGPT Lite 5 | gpt://…/yandexgpt-5-lite | 32k (32 768) | API генерации текста, OpenAI-совместимые |
| Дообученная YandexGPT Lite | gpt://…/yandexgpt-lite/latest@суффикс | 32k (32 768) | API генерации текста, OpenAI-совместимые |
| Alice AI LLM | gpt://…/aliceai-llm | 128k (131 072) | API генерации текста, OpenAI-совместимые |
| Alice AI LLM Flash | gpt://…/aliceai-llm-flash | 64k (65 536) | OpenAI-совместимые |
Вывод из таблицы один: 32 768 токенов это потолок всей линейки YandexGPT, включая дообученную Lite. Договор на сто страниц в один запрос не поместится: придётся резать на части или брать модель с большим окном из той же галереи, где контекст доходит до 1M.
Версии не обновляются под вами автоматически. Модель держит URI до вывода из эксплуатации, после чего запросы по старому адресу возвращают 400 Bad Request. Поддержка четвёртого поколения Pro, Pro 32k и Lite прекращена релизом 28 августа 2025 года. Псевдонимы yandexgpt/latest и yandexgpt/rc пока ведут на Pro 5 и Pro 5.1, но документация советует прописывать явные URI: псевдоним однажды переедет на другую модель без вашего участия.
Один и тот же промпт можно отправить тремя способами, и различаются они не качеством ответа, а пропускной способностью и ценой.
Две цифры отсюда чаще всего становятся инцидентом. Результат асинхронного запроса лежит на сервере ровно 3 суток: не забрали, потеряли. Фоновый запрос может простоять в очереди до 24 часов при таймауте на исполнение 2 часа. Внутренние ошибки сервера не тарифицируются. Квоты меняются по заявке в поддержку, лимиты не меняются вообще.
Деталь, которая рушит планы на массовую обработку: в прайсе пакетного режима моделей YandexGPT нет, там перечислены Qwen, Llama, Gemma, phi-4 и дистилляты DeepSeek. Остаются синхронный и асинхронный режимы.
Есть и четвёртый вариант, выделенный инстанс вне общего пула: квота на одновременные инстансы равна 1, тарификация посекундная, стоимость юнита 1,0166 рубля с НДС. В прайсе выделенных инстансов перечислены Qwen, Gemma и T-pro, моделей YandexGPT там нет.
Тарификация считает четыре типа токенов: входящие, исходящие, кешированные и токены инструментов. Кеширование включается автоматически там, где применимо, но не гарантируется. Цены с НДС.
| Модель | Вход, синхронно | Выход, синхронно | Вход, асинхронно | Выход, асинхронно |
|---|---|---|---|---|
| YandexGPT Pro 5.1 | 0,8 руб. | 0,8 руб. | 0,41 руб. | 0,41 руб. |
| YandexGPT Pro 5 | 1,2 руб. | 1,2 руб. | 0,61 руб. | 0,61 руб. |
| YandexGPT Lite | 0,2 руб. | 0,2 руб. | 0,1 руб. | 0,1 руб. |
| Alice AI LLM | 0,5 руб. | 1,2 руб. | 0,25 руб. | 1,02 руб. |
Три следствия. Асинхронный режим вдвое дешевле синхронного, у Pro 5.1 это 0,41 рубля против 0,8: ночная выгрузка экономит половину бюджета. Pro 5.1 дешевле Pro 5 в полтора раза при том же контексте, оставаться на пятой версии по привычке значит переплачивать. Разрыв между Lite и Pro на входящих токенах четырёхкратный, поэтому классификацию отдают Lite, а работу с документами оставляют Pro.
Модели Яндекса используют токенизатор, оптимизированный под русский текст, и это не маркетинговая формулировка, а измеримая разница в счёте. Документация приводит замер на одном и том же русском фрагменте длиной 501 символ.
На английском преимущество исчезает: 477 символов дают 89 токенов у Alice AI LLM и по 87 у Qwen3 235B и gpt-oss-120b. То есть на русском тексте Qwen тратит примерно на 45 процентов больше токенов, чем YandexGPT (139 против 96), а сам YandexGPT экономит около 31 процента; на английском разница исчезает. Для поддержки, где весь поток на русском, это прямой вычет из счёта.
Оценить объём текста можно заранее и бесплатно: вызовы TokenizerService и методы Tokenizer не тарифицируются, квота 50 запросов в секунду. При работе через OpenAI-совместимый API фактический расход возвращается в каждом ответе в поле usage.
Подключение к YandexGPT API идёт через общую систему доступов Yandex Cloud, и здесь чаще всего спотыкаются на старте. Аутентификация возможна двумя способами.
Обращение к моделям генерации текста требует роли не ниже ai.languageModels.user на каталог, токен передаётся заголовком Authorization: Bearer. Метод подсчёта токенов лежит на пути /foundationModels/v1/tokenize; домен эндпоинта сверяйте по справочнику API AI Studio, он менялся при переездах платформы.
Model Gallery поддерживает Responses API, Completions API и Realtime API, а LangChain, LlamaIndex и LangGraph подключаются с минимальными правками. Прототип на OpenAI SDK переезжает на YandexGPT сменой base_url и ключа, а не переписыванием. Для сравнения способа подключения: у GigaChat токен доступа выдаётся по OAuth и действует 30 минут, то есть требует ротации в рантайме, а API-ключ сервисного аккаунта в AI Studio живёт до заданного вами срока.
Вызов функций (Function Calling) передаётся в поле tools: имя функции, описание назначения и параметры в формате JSON Schema с типами, enum, значениями по умолчанию, minimum и maximum. Сама модель функцию не выполняет: если она решает воспользоваться инструментом, в ответе приходит поле ToolCallList с параметрами, вы исполняете функцию у себя и возвращаете результат в ToolResultList. Наличие tools не гарантирует вызова, модель может ответить сразу.
Три факта определяют выбор версии под такой сценарий.
Встроенные инструменты платформы тарифицируются отдельно от токенов: инструмент веб-поиска 915 рублей за 1000 запросов, поиск по файлам 300 рублей за 1000 запросов, а Code Interpreter и инструмент MCP не тарифицируются.
Для поиска по документам нужна не генерация, а векторизация. AI Studio даёт две версии моделей эмбеддингов через gRPC, REST и OpenAI-совместимый API, каждая делится на модель для документов и для коротких запросов.
Ограничения жёсткие, закладывать их надо заранее: на вход одной векторизации идёт не более 2 048 токенов, квота 10 запросов в секунду. Базу знаний придётся резать на чанки, а индексацию миллиона документов планировать по времени, а не «за вечер». Максимальная длина пользовательского чанка 8 000 символов, в один индекс помещается до 10 000 файлов размером до 128 МБ.
Цена векторизации отдельная и низкая: 0,0101 рубля за 1000 токенов с НДС, 1 юнит биллинга равен 1 токену. Хранение поискового индекса стоит 10,6 рубля в день за 1 ГБ.
Разбирать, как пользоваться YandexGPT, проще не по списку «умеет писать тексты», а по трём типам задач с разной единицей тарификации и разным потолком.
Классификация обращений. Отдельная функциональность со своим прайсом. У YandexGPT Lite единица тарификации это один запрос до 1 000 токенов, у Pro и дообученных классификаторов один запрос до 250 токенов, обе по 0,1525 рубля. На длинных текстах разница взрывается: обращение на 770 токенов у Lite тарифицируется как один запрос, а у Pro как четыре. Классов в классификаторе по промпту не больше 20, в дообученном до 100. Квота всего 1 запрос в секунду, и это главное ограничение для потока обращений.
Суммаризация и ответы по своим документам. Под RAG-сценарии YandexGPT Pro и позиционируется в Model Gallery. Технически это связка эмбеддингов, поискового индекса и генерации, ограниченная теми же 32 768 токенами. Отдельный сценарий пересказа готовых материалов разобран в статье о том, как YandexGPT экономит время на обработке информации.
Извлечение полей из неструктурированного текста. Здесь работает Structured Output: модель возвращает JSON по заданной схеме, а не текст, который потом парсят регулярками. Схема задаётся через JSON Schema с обязательными полями в required.
Довести YandexGPT до рабочего процесса, а не до демо
Между удачным ответом в Playground и стабильным сервисом лежат квоты, ротация ключей, разбиение на чанки, отключение логирования и учёт расхода токенов. Соберём контур целиком: подключение модели, поисковый индекс по вашим документам и интеграция с CRM.
Сервис YandexGPT за три года несколько раз менял вывеску, и это важно помнить, читая старые инструкции. Первый релиз платформы датирован 2 августа 2023 года. 24 сентября 2025 года Yandex Foundation Models стал платформой Yandex AI Studio: тогда же появились Responses API, Realtime API, MCP Hub и конструктор Agent Atelier. 26 января 2026 года AI Assistant API полностью отключён, для новых проектов документация предписывает Responses API. 27 января 2026 года Yandex ML SDK переименован в Yandex AI Studio SDK. 3 марта 2026 года платформа переехала на собственный домен и на новую модель тарификации.
Сегодня модель вызывается из каталога Model Gallery, Playground на карточке задачи, конструктора Agent Atelier, MCP Hub с шаблонами серверов (шаблон Wordstat добавлен 20 июля 2026 года) и Realtime API. Объединённый интерфейс AI Playground отключён релизом 3 августа 2026 года, ссылки на него в старых руководствах не работают.
По умолчанию модели сохраняют все данные запросов. Это ключевой факт, который пропускают на пилоте и вспоминают на аудите.
С релиза 3 марта 2026 года в AI Studio можно устанавливать собственные правила модерации моделей, им посвящён отдельный раздел документации. Персональные данные клиентов в промпт без обезличивания отправлять не стоит независимо от настроек логирования: это требование закона, а не платформы.
32 768 токенов у всех актуальных версий: Pro 5.1, Pro 5, Lite 5 и дообученной Lite. Для большего окна в той же галерее есть Alice AI LLM со 131 072 токенами и опенсорсные модели с 262 144 и 1 048 576.
YandexGPT Pro 5.1 в синхронном режиме стоит 0,8 рубля за 1000 входящих и 0,8 за 1000 исходящих токенов с НДС, в асинхронном 0,41 рубля. YandexGPT Lite соответственно 0,2 и 0,1 рубля.
При одинаковом контексте 32 768 токенов версия 5.1 дешевле в полтора раза (0,8 против 1,2 рубля за 1000 входящих токенов синхронно) и отдельно тарифицирует токены инструментов по 0,2 рубля. При этом Pro 5.1 не поддерживает режим рассуждений, который есть у Pro 5.
Да. Для прода создаётся API-ключ сервисного аккаунта с ролью не ниже ai.languageModels.user на каталог, для создания ключа нужна роль resource-manager.admin. IAM-токен пользователя работает, но живёт не дольше 12 часов.
Передавать в каждом запросе заголовок x-data-logging-enabled: false, а в Yandex AI Studio SDK задать enable_server_data_logging=False при инициализации. По умолчанию логирование включено.