Автоматизация бизнес процессов с помощью ИИ отличается от обычной автоматизации одной вещью: в цепочке появляется шаг, результат которого нельзя предсказать заранее. Триггер в CRM сработает одинаково миллион раз, а языковая модель на том же письме может ответить по-разному. Из этого следует всё остальное: тарификация по токенам вместо лицензии, квоты на количество одновременных запросов, отдельный разговор про персональные данные и приёмка не по факту «работает», а по доле правильных ответов на контрольной выборке. Ниже разобрана именно эта, счётная часть: сколько стоит один запрос по прайсам российских платформ, где стоят лимиты и что записать в договор.
Материал сознательно узкий. Пошаговый порядок внедрения, список задач, которые отдают модели первыми, и обзор конструкторов уже разобраны в соседних статьях блога, ссылки на них собраны в предпоследнем разделе.
Где проходит граница: ИИ-шаг против обычного правила
Практический критерий один. Если для операции можно выписать конечный список условий и он не изменится через месяц, это классическая автоматизация: правило в CRM, сценарий в конструкторе, хранимая процедура. Если условия выписать нельзя, потому что на входе свободный текст, речь, скан или фотография, нужен ИИ-шаг.
Разница видна на приёмке. Обычный сценарий проверяется двумя тестами: сработал на правильном входе, не сработал на неправильном. ИИ-шаг проверяется выборкой: берут 100 или 300 реальных обращений, прогоняют, считают долю верных решений. Ниже порога процесс не запускают, а не «дорабатывают на ходу».
Отсюда второе следствие. У классического сценария стоимость эксплуатации почти нулевая, у ИИ-шага она линейно зависит от объёма: каждый обработанный документ списывает деньги. Поэтому расчёт бюджета делают до пилота, а не после.
Сравнение самих способов автоматизировать шаг, от жёсткого правила до программного робота поверх интерфейса, разобрано в статье AI автоматизация процессов. Дальше здесь только деньги, лимиты и приёмка.
Сколько стоит один запрос к модели: прайсы российских платформ
Цены ниже взяты из официальной документации Yandex AI Studio и Сбера на август 2026 года. Схемы оплаты разные. Yandex списывает постфактум за фактически потраченные токены. У Сбера есть и оплата по факту, и пакеты токенов со сроком 12 месяцев, причём удельная цена тысячи токенов в обеих схемах одинаковая: разница в том, что при оплате по факту действует минимальный платёж 600 ₽ в месяц, а неиспользованный пакет сгорает по окончании срока.
| Модель и режим | Цена за 1000 входящих токенов | Цена за 1000 исходящих токенов |
|---|---|---|
| YandexGPT Pro 5.1, синхронно | 0,8 ₽ | 0,8 ₽ |
| YandexGPT Pro 5.1, асинхронно | 0,41 ₽ | 0,41 ₽ |
| YandexGPT Lite, синхронно | 0,2 ₽ | 0,2 ₽ |
| YandexGPT Lite, асинхронно | 0,1 ₽ | 0,1 ₽ |
| Alice AI LLM Flash, синхронно | 0,1 ₽ | 0,2 ₽ |
| GigaChat 2 Lite, пакет 300 млн токенов за 19 500 ₽ | 0,065 ₽ за 1000 токенов любого типа | |
| GigaChat 2 Pro, пакет 50 млн токенов за 25 000 ₽ | 0,5 ₽ за 1000 токенов | |
| GigaChat 2 Max, пакет 30 млн токенов за 19 500 ₽ | 0,65 ₽ за 1000 токенов | |
Все цены Yandex AI Studio указаны с НДС. Пакеты GigaChat для ИП и юрлиц действуют 12 месяцев, цены тоже с НДС, и удельная стоимость внутри одной модели не меняется от размера пакета: и 300 млн, и 1 млрд токенов Lite стоят 0,065 ₽ за тысячу.
Не только генерация текста стоит денег. По прайсу Yandex AI Studio распознавание страницы печатного текста обойдётся в 0,1321 ₽, распознавание таблиц – в 1,22 ₽ за страницу, разбор паспорта или СТС – в 0,71 ₽ за документ. Голосовой агент тарифицируется посекундно: 0,0264 ₽ за секунду входящего аудио и 0,0203 ₽ за секунду исходящего, плюс токены самой модели. Встроенный инструмент веб-поиска стоит 915 ₽ за 1000 вызовов, генерация одной картинки – 2,23 ₽.
Как посчитать месячный счёт до старта пилота
Формула простая: количество операций в месяц, умноженное на средний размер запроса в токенах, умноженное на цену тысячи токенов. Единственное, что нужно измерить заранее, это средний размер. Ориентир для делового письма с историей переписки – около 1500 входящих и 300 исходящих токенов, но перед бюджетом его прогоняют через токенизатор на своей почте: у него вызовы не тарифицируются.
Считаем на потоке 3000 писем в месяц по прайсу YandexGPT Pro 5.1:
- синхронный режим: (1,5 × 0,8) + (0,3 × 0,8) = 1,44 ₽ за письмо, 4320 ₽ за месяц;
- асинхронный режим: (1,5 + 0,3) × 0,41 = 0,74 ₽ за письмо, около 2220 ₽ за месяц;
- та же задача на YandexGPT Lite синхронно: 0,36 ₽ за письмо, 1080 ₽ за месяц;
- та же задача на пакете GigaChat 2 Lite: 0,12 ₽ за письмо, около 350 ₽ за месяц.
Вывод из расчёта неочевидный. Плата за модель редко бывает главной статьёй: на 3000 писем разница между самым дорогим и самым дешёвым вариантом около 4000 ₽ в месяц. На таком объёме выбор модели решает меньше, чем интеграция, разметка примеров и поддержка сценария. Экономить на классе модели имеет смысл только там, где объём измеряется сотнями тысяч операций.
Второй вывод: асинхронный режим дешевле синхронного примерно вдвое у обеих моделей YandexGPT. Если ответ не нужен в реальном времени, ночная пакетная обработка почты, заявок или отзывов сразу режет счёт. У пакетного режима есть своя оговорка: минимальная стоимость одного запуска равна 200 000 токенов, поэтому гонять его на десяти документах бессмысленно.
Инструменты автоматизации процессов: три слоя, за которые платят отдельно
Инструменты автоматизации процессов удобно раскладывать на три слоя, и счёт приходит от каждого.
- Слой модели. Yandex AI Studio, GigaChat, локально развёрнутые открытые модели. Оплата за токены или за пакет. Линейка GigaChat на август 2026 года включает GigaChat 3 Ultra, GigaChat 2 Max, GigaChat 2 Pro и GigaChat 2 Lite, плюс отдельные модели эмбеддингов.
- Слой оркестрации. Конструктор, который забирает данные из почты и CRM, вызывает модель и кладёт результат обратно. Здесь платят не за токены, а за операции и запуски. Make на бесплатном плане даёт 1000 кредитов в месяц, максимум два активных сценария и минимальный интервал между запусками 15 минут; план Core стоит от 9 долларов в месяц за 10 000 кредитов при оплате за год. У n8n в облаке тариф Starter 20 евро за 2500 запусков и Pro 50 евро за 10 000 при годовой оплате, а Community-редакция ставится на свой сервер без лимита на запуски. Сравнение самих конструкторов и их тарифных сеток – в разборе платформ для автоматизации бизнеса.
- Слой системы учёта. CRM, ERP, СЭД, куда попадает результат. Здесь оплата обычно за пользователей и не зависит от объёма ИИ-обработки.
Ошибка планирования почти всегда одна: бюджет считают по первому слою, а упираются во второй. Сценарий на бесплатном плане Make с минимальным интервалом 15 минут физически не может отвечать клиенту быстрее чем за четверть часа, сколько бы ни стоила модель.
Лимиты и квоты, в которые упираются инструменты автоматизации бизнес процессов
С инструментами автоматизации бизнес процессов регулярно происходит одно и то же: на демо всё летает, на реальной нагрузке упирается в квоту. Значения по умолчанию в Yandex AI Studio стоит выписать до проектирования.
- Одновременных генераций в синхронном режиме: 10. Это не 10 запросов в секунду, а 10 незакрытых запросов одновременно.
- Асинхронный режим: 10 запросов в секунду на отправку и 5000 запросов в час.
- Пакетный режим: 10 запусков в час и 100 в сутки.
- Vision OCR: 1 запрос в секунду в синхронном режиме и 10 в асинхронном. PDF в асинхронном режиме принимается объёмом до 200 страниц, файл до 10 МБ, изображение до 20 мегапикселей.
- Классификация текста: 1 запрос в секунду.
- Результаты асинхронных текстовых запросов и распознавания хранятся на сервере 3 суток, сгенерированные изображения – 12 часов. Забирать и складывать к себе нужно раньше.
- Таймаут синхронного запроса 20 минут, шаг рабочего процесса выполняется не дольше 10 минут, а с учётом повторов не дольше 24 часов, объём данных на входе и выходе шага не больше 2 МБ.
Квоты меняются по заявке в поддержку, лимиты не меняются вообще. Разница принципиальная при проектировании: под квоту закладывают запас времени на согласование, под лимит переделывают архитектуру.
Нужно посчитать, а не гадать
Соберём расчёт по вашему объёму: сколько операций в месяц, какая модель тянет задачу, где упрётесь в квоты и сколько выйдет счёт. Дальше внедрение под ключ с приёмкой по метрике.
Персональные данные: что уходит на сервер вендора по умолчанию
Пункт, который пропускают чаще всего. В Yandex AI Studio по умолчанию модели сохраняют все данные запросов. Если в промпт уходят ФИО, телефоны, паспортные данные или коммерческая тайна, логирование отключают явно: в REST-запрос добавляют заголовок x-data-logging-enabled: false, в gRPC ту же опцию в метаинформацию вызова, а в Python SDK при инициализации объекта AIStudio ставят параметр enable_server_data_logging в значение False. Запросы с отключенной опцией на серверах не сохраняются.
Это техническая половина. Юридическая половина в том, что передача персональных данных внешней платформе является поручением обработки и оформляется договором с перечнем действий и требованиями к защите. Отдельно проверяется, не уходят ли данные за пределы России: облачные модели зарубежных вендоров в этом сценарии для большинства российских компаний закрыты не техническими средствами, а требованиями к размещению баз персональных данных.
Рабочая практика: обезличивать данные до вызова модели. Подставлять вместо имени и телефона плейсхолдеры, возвращать их обратно после ответа. Тогда вопрос логирования перестаёт быть критичным, а бюджет на юридическую обвязку не растёт.
Приёмка ИИ-шага: какие цифры записать в договор
Формулировка «бот отвечает на вопросы клиентов» не является техническим заданием, потому что её нельзя проверить. Проверяемая формулировка состоит из пяти чисел. Порядок самого проекта, от пилота до передачи в эксплуатацию, разобран во внедрении ИИ в бизнес-процессы, здесь только цифры, которые уходят в договор.
- Контрольная выборка. Сколько реальных случаев берём на проверку. Меньше 100 брать бессмысленно: на 30 примерах разница между 80% и 90% точности статистически неотличима.
- Порог точности. Доля верных решений на этой выборке, при которой приёмка считается пройденной. Для классификации входящих обращений разумный порог 90% и выше, для извлечения сумм и реквизитов из документов – 98% и выше, потому что цена ошибки другая.
- Доля эскалаций. Какой процент случаев модели разрешено отдать человеку. Это не провал, а штатный режим: система должна уметь сказать «не знаю».
- Время ответа. Верхняя граница в секундах на 95-м процентиле, а не среднее. Среднее прячет хвост.
- Стоимость операции. Потолок в рублях на одну обработку по прайсу платформы, чтобы рост объёма не превратился в неприятный сюрприз в счёте.
Отдельным пунктом фиксируют, что происходит при недоступности модели: очередь с повтором, переключение на резервную платформу или передача человеку. Провайдер прямо оговаривает, что при внутренней ошибке сервера запрос не тарифицируется, но обработать этот случай в своей логике всё равно придётся.
Что читать дальше по теме
Тема разложена по соседним материалам блога, дублировать их здесь нет смысла.
- Внедрение ИИ в бизнес-процессы: порядок работ, кто в проектной команде, как встроить модель в существующий маршрут.
- Автоматизация рутинных задач с ИИ: какие операции отдают модели первыми и по каким признакам выбирают пилот.
- No-code инструменты для автоматизации бизнеса: разбор конструкторов и сценариев без разработки.
- AI автоматизация процессов: технологический разрез, из чего собирается решение.
- Автоматизация рабочих процессов: как описать процесс до выбора любой системы.
- Системы автоматизации бизнес-процессов: обзор классов систем, CRM, ERP, BPM, ECM.
- Платформы для автоматизации бизнеса: выбор платформы и её стоимость.
Частые вопросы
Сколько стоит обработать одно письмо языковой моделью
По прайсу Yandex AI Studio на YandexGPT Pro 5.1 запрос в 1500 входящих и 300 исходящих токенов стоит 1,44 ₽ в синхронном режиме и около 0,74 ₽ в асинхронном. На YandexGPT Lite та же операция обойдётся в 0,36 ₽, на пакете GigaChat 2 Lite – примерно в 0,12 ₽.
Сколько одновременных запросов выдержит платформа без заявки в поддержку
В Yandex AI Studio квота по умолчанию – 10 одновременных генераций в синхронном режиме и 5000 запросов в час в асинхронном. Vision OCR принимает 1 запрос в секунду синхронно. Квоты увеличиваются по обращению в техподдержку, а лимиты вроде таймаута в 20 минут не меняются.
Как не отдать персональные данные клиентов вендору модели
Отключить логирование заголовком x-data-logging-enabled: false (в SDK параметр enable_server_data_logging=False) и обезличивать данные до вызова, подставляя плейсхолдеры вместо ФИО и телефонов. По умолчанию платформа сохраняет все данные запросов.
Что дешевле: платить за токены или купить пакет
Пакет GigaChat 2 Lite на 300 млн токенов стоит 19 500 ₽ и действует 12 месяцев, это 0,065 ₽ за тысячу токенов. Ровно столько же стоит тысяча токенов Lite при оплате по факту, так что дело не в удельной цене. При оплате по факту у Сбера действует минимальный платёж 600 ₽ в месяц, а пакет надо успеть выбрать за 12 месяцев, иначе остаток сгорает. Пакет берут под понятный годовой объём, оплату по факту – когда объём непредсказуем.
Какой порог точности считать нормальным на приёмке
Для классификации обращений ориентир от 90% верных решений на выборке минимум в 100 реальных случаев, для извлечения сумм и реквизитов из документов – от 98%. Отдельно фиксируется допустимая доля эскалаций на человека.








