Нейросеть YandexGPT: что умеет и как применять

Все статьи
Все статьи
Редакция Neurounit
23 июля 2026
Обновлено 22 августа 2026
Нейросети
Нейросеть YandexGPT: что умеет и как применять
YandexGPT: разбираем возможности российской нейросети от Яндекса, доступ через API и Yandex Cloud, реальные сценарии для бизнеса и с чего начать внедрение.

Нейросеть YandexGPT живёт не в отдельном чате, а внутри платформы Yandex AI Studio: у каждой версии свой URI, контекст 32 768 токенов, прайс за тысячу токенов и квоты, в которые проект упирается быстрее, чем ожидает. Разбираем линейку версий, три режима вызова, цену тысячи токенов, вызов функций, эмбеддинги и то, какие данные в модель отправлять нельзя. Цифры сверены с документацией AI Studio 22 августа 2026 года.

Модели YandexGPT: линейка версий и что с ней происходит

В базовом инстансе AI Studio модели YandexGPT соседствуют с моделями Alice AI и опенсорсными. У каждой свой URI вида gpt://идентификатор_каталога/имя_модели, и версию определяет именно URI, а не название в интерфейсе.

Модель URI Контекст Доступные API
YandexGPT Pro 5.1 gpt://…/yandexgpt-5.1 32k (32 768) API генерации текста, OpenAI-совместимые
YandexGPT Pro 5 gpt://…/yandexgpt-5-pro 32k (32 768) API генерации текста, OpenAI-совместимые
YandexGPT Lite 5 gpt://…/yandexgpt-5-lite 32k (32 768) API генерации текста, OpenAI-совместимые
Дообученная YandexGPT Lite gpt://…/yandexgpt-lite/latest@суффикс 32k (32 768) API генерации текста, OpenAI-совместимые
Alice AI LLM gpt://…/aliceai-llm 128k (131 072) API генерации текста, OpenAI-совместимые
Alice AI LLM Flash gpt://…/aliceai-llm-flash 64k (65 536) OpenAI-совместимые

Вывод из таблицы один: 32 768 токенов это потолок всей линейки YandexGPT, включая дообученную Lite. Договор на сто страниц в один запрос не поместится: придётся резать на части или брать модель с большим окном из той же галереи, где контекст доходит до 1M.

Версии не обновляются под вами автоматически. Модель держит URI до вывода из эксплуатации, после чего запросы по старому адресу возвращают 400 Bad Request. Поддержка четвёртого поколения Pro, Pro 32k и Lite прекращена релизом 28 августа 2025 года. Псевдонимы yandexgpt/latest и yandexgpt/rc пока ведут на Pro 5 и Pro 5.1, но документация советует прописывать явные URI: псевдоним однажды переедет на другую модель без вашего участия.

Три режима вызова и квоты, в которые упирается прод

Один и тот же промпт можно отправить тремя способами, и различаются они не качеством ответа, а пропускной способностью и ценой.

  • Синхронный. Ответ приходит в том же соединении. Квота 10 одновременных генераций на каталог, таймаут запроса 20 минут.
  • Асинхронный. Запрос ставится в очередь, ответ забирается отдельным вызовом. Квоты: 10 запросов в секунду на постановку, 50 на получение, 5 000 запросов в час.
  • Пакетный. Для разовой прогонки массива данных. Минимальная стоимость запуска 200 000 токенов: маленький батч оплачивается как большой. Квоты 10 запусков в час и 100 в сутки.

Две цифры отсюда чаще всего становятся инцидентом. Результат асинхронного запроса лежит на сервере ровно 3 суток: не забрали, потеряли. Фоновый запрос может простоять в очереди до 24 часов при таймауте на исполнение 2 часа. Внутренние ошибки сервера не тарифицируются. Квоты меняются по заявке в поддержку, лимиты не меняются вообще.

Деталь, которая рушит планы на массовую обработку: в прайсе пакетного режима моделей YandexGPT нет, там перечислены Qwen, Llama, Gemma, phi-4 и дистилляты DeepSeek. Остаются синхронный и асинхронный режимы.

Есть и четвёртый вариант, выделенный инстанс вне общего пула: квота на одновременные инстансы равна 1, тарификация посекундная, стоимость юнита 1,0166 рубля с НДС. В прайсе выделенных инстансов перечислены Qwen, Gemma и T-pro, моделей YandexGPT там нет.

Сколько стоит тысяча токенов

Тарификация считает четыре типа токенов: входящие, исходящие, кешированные и токены инструментов. Кеширование включается автоматически там, где применимо, но не гарантируется. Цены с НДС.

Модель Вход, синхронно Выход, синхронно Вход, асинхронно Выход, асинхронно
YandexGPT Pro 5.1 0,8 руб. 0,8 руб. 0,41 руб. 0,41 руб.
YandexGPT Pro 5 1,2 руб. 1,2 руб. 0,61 руб. 0,61 руб.
YandexGPT Lite 0,2 руб. 0,2 руб. 0,1 руб. 0,1 руб.
Alice AI LLM 0,5 руб. 1,2 руб. 0,25 руб. 1,02 руб.

Три следствия. Асинхронный режим вдвое дешевле синхронного, у Pro 5.1 это 0,41 рубля против 0,8: ночная выгрузка экономит половину бюджета. Pro 5.1 дешевле Pro 5 в полтора раза при том же контексте, оставаться на пятой версии по привычке значит переплачивать. Разрыв между Lite и Pro на входящих токенах четырёхкратный, поэтому классификацию отдают Lite, а работу с документами оставляют Pro.

Токенизатор под русский язык: где именно возникает экономия

Модели Яндекса используют токенизатор, оптимизированный под русский текст, и это не маркетинговая формулировка, а измеримая разница в счёте. Документация приводит замер на одном и том же русском фрагменте длиной 501 символ.

  • YandexGPT Pro: 96 токенов, в среднем 5,2 символа на токен.
  • gpt-oss-120b: 109 токенов, 4,6 символа на токен.
  • Qwen3 235B: 139 токенов, 3,6 символа на токен.

На английском преимущество исчезает: 477 символов дают 89 токенов у Alice AI LLM и по 87 у Qwen3 235B и gpt-oss-120b. То есть на русском тексте Qwen тратит примерно на 45 процентов больше токенов, чем YandexGPT (139 против 96), а сам YandexGPT экономит около 31 процента; на английском разница исчезает. Для поддержки, где весь поток на русском, это прямой вычет из счёта.

Оценить объём текста можно заранее и бесплатно: вызовы TokenizerService и методы Tokenizer не тарифицируются, квота 50 запросов в секунду. При работе через OpenAI-совместимый API фактический расход возвращается в каждом ответе в поле usage.

YandexGPT API: аутентификация, эндпоинт и совместимость

Подключение к YandexGPT API идёт через общую систему доступов Yandex Cloud, и здесь чаще всего спотыкаются на старте. Аутентификация возможна двумя способами.

  1. IAM-токен от аккаунта на Яндексе. Живёт не дольше 12 часов, поэтому годится для экспериментов, но не для сервиса: продлевать придётся каждые полсуток.
  2. API-ключ сервисного аккаунта. Рекомендованный вариант для прода. Нужна роль resource-manager.admin на каталог, срок действия задаётся при создании, а секрет показывается один раз и после закрытия диалога недоступен.

Обращение к моделям генерации текста требует роли не ниже ai.languageModels.user на каталог, токен передаётся заголовком Authorization: Bearer. Метод подсчёта токенов лежит на пути /foundationModels/v1/tokenize; домен эндпоинта сверяйте по справочнику API AI Studio, он менялся при переездах платформы.

Model Gallery поддерживает Responses API, Completions API и Realtime API, а LangChain, LlamaIndex и LangGraph подключаются с минимальными правками. Прототип на OpenAI SDK переезжает на YandexGPT сменой base_url и ключа, а не переписыванием. Для сравнения способа подключения: у GigaChat токен доступа выдаётся по OAuth и действует 30 минут, то есть требует ротации в рантайме, а API-ключ сервисного аккаунта в AI Studio живёт до заданного вами срока.

Вызов функций, структурированный ответ и режим рассуждений

Вызов функций (Function Calling) передаётся в поле tools: имя функции, описание назначения и параметры в формате JSON Schema с типами, enum, значениями по умолчанию, minimum и maximum. Сама модель функцию не выполняет: если она решает воспользоваться инструментом, в ответе приходит поле ToolCallList с параметрами, вы исполняете функцию у себя и возвращаете результат в ToolResultList. Наличие tools не гарантирует вызова, модель может ответить сразу.

Три факта определяют выбор версии под такой сценарий.

  • Вызов функций заметно улучшен в пятом поколении, релиз от 25 февраля 2025 года. Там же появился Structured Output, принудительное форматирование ответа в произвольный JSON или по заданной схеме.
  • Режим рассуждений появился в YandexGPT Pro 7 февраля 2025 года, но YandexGPT Pro 5.1 его не поддерживает. Это прямо указано в релизе от 28 августа 2025 года. Если ваш сценарий строится на пошаговых рассуждениях, переход с Pro 5 на более дешёвую 5.1 сломает логику.
  • Модели gpt-oss-120b и gpt-oss-20b из той же галереи вызов функций не поддерживают вовсе, релиз от 6 августа 2025 года.

Встроенные инструменты платформы тарифицируются отдельно от токенов: инструмент веб-поиска 915 рублей за 1000 запросов, поиск по файлам 300 рублей за 1000 запросов, а Code Interpreter и инструмент MCP не тарифицируются.

Эмбеддинги: поиск по своей базе знаний

Для поиска по документам нужна не генерация, а векторизация. AI Studio даёт две версии моделей эмбеддингов через gRPC, REST и OpenAI-совместимый API, каждая делится на модель для документов и для коротких запросов.

  • Версия 1: emb://…/text-search-doc/latest и emb://…/text-search-query/latest, размерность вектора 256.
  • Версия 2: emb://…/text-embeddings-v2-doc и emb://…/text-embeddings-v2-query, размерность на выбор 128, 256 по умолчанию, 512 или 768.

Ограничения жёсткие, закладывать их надо заранее: на вход одной векторизации идёт не более 2 048 токенов, квота 10 запросов в секунду. Базу знаний придётся резать на чанки, а индексацию миллиона документов планировать по времени, а не «за вечер». Максимальная длина пользовательского чанка 8 000 символов, в один индекс помещается до 10 000 файлов размером до 128 МБ.

Цена векторизации отдельная и низкая: 0,0101 рубля за 1000 токенов с НДС, 1 юнит биллинга равен 1 токену. Хранение поискового индекса стоит 10,6 рубля в день за 1 ГБ.

Как пользоваться YandexGPT в рабочих задачах

Разбирать, как пользоваться YandexGPT, проще не по списку «умеет писать тексты», а по трём типам задач с разной единицей тарификации и разным потолком.

Классификация обращений. Отдельная функциональность со своим прайсом. У YandexGPT Lite единица тарификации это один запрос до 1 000 токенов, у Pro и дообученных классификаторов один запрос до 250 токенов, обе по 0,1525 рубля. На длинных текстах разница взрывается: обращение на 770 токенов у Lite тарифицируется как один запрос, а у Pro как четыре. Классов в классификаторе по промпту не больше 20, в дообученном до 100. Квота всего 1 запрос в секунду, и это главное ограничение для потока обращений.

Суммаризация и ответы по своим документам. Под RAG-сценарии YandexGPT Pro и позиционируется в Model Gallery. Технически это связка эмбеддингов, поискового индекса и генерации, ограниченная теми же 32 768 токенами. Отдельный сценарий пересказа готовых материалов разобран в статье о том, как YandexGPT экономит время на обработке информации.

Извлечение полей из неструктурированного текста. Здесь работает Structured Output: модель возвращает JSON по заданной схеме, а не текст, который потом парсят регулярками. Схема задаётся через JSON Schema с обязательными полями в required.

Довести YandexGPT до рабочего процесса, а не до демо

Между удачным ответом в Playground и стабильным сервисом лежат квоты, ротация ключей, разбиение на чанки, отключение логирования и учёт расхода токенов. Соберём контур целиком: подключение модели, поисковый индекс по вашим документам и интеграция с CRM.

Обсудить задачу

Сервис YandexGPT внутри экосистемы: куда он встроен

Сервис YandexGPT за три года несколько раз менял вывеску, и это важно помнить, читая старые инструкции. Первый релиз платформы датирован 2 августа 2023 года. 24 сентября 2025 года Yandex Foundation Models стал платформой Yandex AI Studio: тогда же появились Responses API, Realtime API, MCP Hub и конструктор Agent Atelier. 26 января 2026 года AI Assistant API полностью отключён, для новых проектов документация предписывает Responses API. 27 января 2026 года Yandex ML SDK переименован в Yandex AI Studio SDK. 3 марта 2026 года платформа переехала на собственный домен и на новую модель тарификации.

Сегодня модель вызывается из каталога Model Gallery, Playground на карточке задачи, конструктора Agent Atelier, MCP Hub с шаблонами серверов (шаблон Wordstat добавлен 20 июля 2026 года) и Realtime API. Объединённый интерфейс AI Playground отключён релизом 3 августа 2026 года, ссылки на него в старых руководствах не работают.

Какие данные нельзя отправлять и как отключить логирование

По умолчанию модели сохраняют все данные запросов. Это ключевой факт, который пропускают на пилоте и вспоминают на аудите.

  • Чтобы запросы не сохранялись, в REST-заголовок или метаинформацию gRPC-вызова добавляется опция x-data-logging-enabled: false. В Yandex AI Studio SDK это параметр enable_server_data_logging=False при инициализации объекта AIStudio.
  • Даже при включённом логировании запросы в базовом инстансе хранятся обезличенно, а потенциально чувствительная информация маскируется. Документация всё равно рекомендует отключать логирование при работе с конфиденциальными данными.
  • Model Gallery заявляет, что данные клиентов не используются для обучения моделей, а между локальной инфраструктурой и платформой настраиваются выделенные сетевые соединения.
  • С 19 сентября 2025 года бесплатные запросы к моделям YandexGPT и YandexART пользователям без платёжного аккаунта недоступны: пилот «попробовать через API без биллинга» больше не проходит.

С релиза 3 марта 2026 года в AI Studio можно устанавливать собственные правила модерации моделей, им посвящён отдельный раздел документации. Персональные данные клиентов в промпт без обезличивания отправлять не стоит независимо от настроек логирования: это требование закона, а не платформы.

Частые вопросы

Какой контекст у YandexGPT

32 768 токенов у всех актуальных версий: Pro 5.1, Pro 5, Lite 5 и дообученной Lite. Для большего окна в той же галерее есть Alice AI LLM со 131 072 токенами и опенсорсные модели с 262 144 и 1 048 576.

Сколько стоит запрос к YandexGPT

YandexGPT Pro 5.1 в синхронном режиме стоит 0,8 рубля за 1000 входящих и 0,8 за 1000 исходящих токенов с НДС, в асинхронном 0,41 рубля. YandexGPT Lite соответственно 0,2 и 0,1 рубля.

Чем YandexGPT Pro 5.1 отличается от Pro 5

При одинаковом контексте 32 768 токенов версия 5.1 дешевле в полтора раза (0,8 против 1,2 рубля за 1000 входящих токенов синхронно) и отдельно тарифицирует токены инструментов по 0,2 рубля. При этом Pro 5.1 не поддерживает режим рассуждений, который есть у Pro 5.

Нужен ли отдельный ключ для YandexGPT API

Да. Для прода создаётся API-ключ сервисного аккаунта с ролью не ниже ai.languageModels.user на каталог, для создания ключа нужна роль resource-manager.admin. IAM-токен пользователя работает, но живёт не дольше 12 часов.

Как запретить сохранение своих запросов

Передавать в каждом запросе заголовок x-data-logging-enabled: false, а в Yandex AI Studio SDK задать enable_server_data_logging=False при инициализации. По умолчанию логирование включено.

Поделиться:
X
Редакция Neurounit

Разборы инструментов, гайды и новости про нейросети, AI-маркетинг и автоматизацию. Материалы готовит редакция агентства Neurounit.

Факты и цифры проверяет редакция агентства Neurounit. Вопросы и уточнения: Telegram.

Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга