Клиент пишет в чат в два часа ночи, менеджер спит, к утру человек уже купил у конкурента. Чтобы закрыть эту дыру, не нужен отдел поддержки в три смены: достаточно создать чат-бота на нейросети и поставить ему одну измеримую цель. Ориентир для первой версии: бот сам закрывает 60 процентов входящих вопросов без оператора. Ниже пошаговая сборка от выбора модели до запуска в Telegram, с проверенными тарифами и лимитами на август 2026 года.
Кнопочный бот это дерево сценариев, и вопрос вне дерева ломает диалог сразу, а не на десятом шаге. Клиент пишет «а если размер не подойдёт, вернуть можно и за чей счёт доставка», кнопочный бот отвечает «Извините, я вас не понял». Чтобы покрыть такие формулировки ветками, их пришлось бы описать десятками на один и тот же смысл.
Бот на большой языковой модели получает вопрос целиком, держит историю переписки и отвечает по смыслу: вы описываете не ветки, а знания и правила. Плата за гибкость это предсказуемость. Кнопочный бот никогда не скажет лишнего, нейросетевой скажет, если вы не поставили границы, поэтому половина работы приходится не на код, а на системный промпт и базу знаний.
Главная ошибка первой версии это бот, который умеет всё: такой проект нельзя признать ни удачным, ни провальным. Берите одну задачу и один критерий, считаемый из логов автоматически.
Метрику фиксируют до запуска и считают на живом трафике за неделю, иначе победителем окажется тот, кто громче хвалит бота.
Выбор для российского бизнеса сводится к трём точкам входа: GigaChat API от Сбера, Yandex Cloud AI Studio (бывшие Foundation Models) и зарубежные модели через API OpenAI. Сравнивать стоит по трём практичным критериям.
| Критерий | GigaChat | YandexGPT (AI Studio) | GPT через API |
|---|---|---|---|
| Русский язык | Метрики ruMMLU указаны в карточке каждой модели | Русскоязычная модель, метрики в документации AI Studio | Русский поддерживает, но на кириллицу тратит заметно больше токенов, чем на латиницу |
| Контекст | 128 000 токенов у GigaChat 2 Lite и у GigaChat 2 Max | Актуальный лимит уточняйте в документации AI Studio | Зависит от модели, смотрите справочник в прайсе |
| Оплата из РФ | Рубли, счёт для физлиц и юрлиц напрямую | Рубли, через биллинг Yandex Cloud | Нужен зарубежный способ оплаты |
| Цена | 65 рублей за 1 млн токенов у GigaChat 2 Lite, 650 рублей за 1 млн у GigaChat 2 Max | Актуальный тариф смотрите в прайсе AI Studio | gpt-5-mini: 0,25 и 2 доллара за 1 млн входных и выходных токенов, gpt-5-nano: 0,05 и 0,40 доллара |
Отдельный аргумент за российские модели на старте это бесплатный лимит. По тарифам для физлиц при регистрации в GigaChat API дают 365 млн токенов на 12 месяцев: 250 млн на GigaChat Lite, 40 млн на Pro, 25 млн на Max и 50 млн на GigaChat 3 Ultra. Генерация идёт в один поток, лимит обновляется раз в год. Платные пакеты начинаются с 20 млн токенов GigaChat 2 Lite за 1 300 рублей, 100 млн стоят 6 500 рублей. Цены с НДС действуют с 1 февраля 2026 года, пакет живёт 12 месяцев со дня оплаты.
Локальные модели на своём сервере обсуждают в двух случаях: данные нельзя выпускать за периметр либо запросов столько, что аренда GPU дешевле оплаты токенов. И там и там счёт за API меняется на счёт за железо плюс инженера, который его обслуживает. Для первого бота преждевременно: соберите контур на облачном API и снимите реальный расход токенов.
Формулировка «обучить чат-бота» вводит в заблуждение: дообучение модели вам почти наверняка не нужно, нужно дать модели ваши факты в момент запроса. Способа два.
Промпт с контекстом. Условия доставки, гарантии и ключевые позиции прайса кладутся прямо в системный промпт. Самый дешёвый и предсказуемый вариант, работает, пока факты помещаются в контекстное окно вместе с историей диалога и ответом. У GigaChat 2 Lite окно 128 000 токенов, туда влезает объёмный регламент. Но за входные токены вы платите в каждом запросе: раздутый на 20 000 токенов промпт умножается на число обращений.
RAG, то есть база знаний с поиском. Переходить стоит по одному из двух признаков: факты перестали помещаться в контекст одного запроса либо помещаются, но платить за них в каждом обращении дорого. Схема: документы режутся на фрагменты, каждый превращается в вектор моделью эмбеддингов, векторы лежат в хранилище (pgvector, Qdrant, Chroma), на вопрос система достаёт три или пять релевантных кусков и подставляет в промпт. Эмбеддинги тарифицируются отдельно: у Сбера пакет на 50 млн токенов стоит 700 рублей, у OpenAI text-embedding-3-small стоит 0,02 доллара за 1 млн.
Собирать RAG кодом не обязательно: Dify и Flowise закрывают связку «загрузил документы, получил бота с поиском по ним» без разработки. Бесплатный Sandbox у Dify даёт 200 сообщений разовым кредитом, 5 приложений и 50 документов в базе знаний, план Professional стоит 59 долларов в месяц (590 долларов при оплате за год) и поднимает потолок до 5 000 сообщений и 500 документов, Team стоит 159 долларов в месяц. Есть Community Edition, который разворачивается через Docker без подписки: для компании со сложностями в оплате зарубежных сервисов это обычно и есть рабочий вариант.
В базу идут актуальный прайс, условия доставки и возврата, ответы на 30 самых частых вопросов из вашей переписки. Не идут черновики, устаревшие акции и внутренние документы с персональными данными: бот процитирует всё, что вы ему дали.
Системный промпт это устав бота. Рабочий скелет состоит из пяти блоков, и пропуск любого обходится дороже, чем время на его написание.
Пятый блок и есть тот, ради которого всё затевалось: бот, который честно говорит «не знаю» в 30 процентах случаев, полезнее бота, который уверенно выдумывает в 5 процентах. Первый теряет время, второй теряет клиента и деньги. Формулируйте эскалацию как условие с триггером, иначе модель будет пытаться ответить до последнего.
Telegram остаётся самым быстрым каналом для запуска. Бот регистрируется у @BotFather, тот выдаёт токен, дальше вы работаете с Bot API. Получать сообщения можно двумя способами, и выбор задаёт требования к инфраструктуре.
Деталь, на которой спотыкаются при переезде с прототипа в прод: пока вебхук установлен, getUpdates не работает вообще, держать оба механизма сразу нельзя. Второе ограничение касается всплесков нагрузки. Telegram просит не слать больше одного сообщения в секунду в один чат, не больше 20 сообщений в минуту в группу и держаться в пределах примерно 30 сообщений в секунду при массовой рассылке. Если бот отвечает потоком коротких сообщений вместо одного, в лимит вы упрётесь раньше, чем в стоимость токенов.
Виджет на сайте требует своей обвязки: фронтенд, хранение истории по сессии, ключ модели строго на бэкенде. WhatsApp сложнее: нужен аккаунт WhatsApp Business Platform, который подключают либо напрямую через Cloud API Meta, либо через официального провайдера, а действующие требования к верификации бизнеса и лимитам смотрите в документации Meta. Поэтому его подключают вторым каналом.
Если писать код не хочется вообще, есть no-code конструкторы: Botpress, Voiceflow, ManyChat, для связок с CRM и таблицами Albato. Они экономят недели на старте, но привязывают к своей логике и своим лимитам, а актуальные тарифы у всех четырёх смотрите на сайте вендора. Разумная развилка: конструктор для проверки гипотезы, свой код тогда, когда бот пошёл в CRM и в оплаты.
Бот, который отлично отвечает на придуманные вами вопросы, ломается на живых: люди пишут с опечатками, обрывками, двумя сообщениями подряд и не по теме. Минимальный протокол приёмки такой.
Три вопроса: вам достаточно бота или уже нужен ИИ-агент
Три ответа «только отвечать, один документ, оператор есть» означают, что хватит бота на промпте и одного вечера сборки. Любое «нужно действовать в системах» переводит задачу в разряд агентов. Обсудить задачу
1. Токены модели. Формула: (системный промпт + фрагменты базы + история диалога + ответ) умножить на число обращений за месяц. Расчёт на цифрах прайса: промпт 1 500 токенов, три фрагмента базы по 500, история и вопрос около 1 000, ответ 300, округлённо 4 300 токенов на обращение. При 1 000 диалогов в месяц по 6 обращений это примерно 26 млн токенов, то есть около 1 700 рублей в месяц на GigaChat 2 Lite по 65 рублей за миллион. Та же нагрузка на GigaChat 2 Max стоила бы около 17 000 рублей: вот почему модель выбирают по результатам теста, а не по названию. Бесплатных 250 млн токенов Lite при такой нагрузке хватает примерно на девять месяцев.
2. Хостинг. Нужен домен с валидным HTTPS-сертификатом, иначе вебхук Telegram не установится, плюс небольшой сервер под сервис бота и векторное хранилище, если делаете RAG. Требования к процессору минимальные, узкое место это память под базу векторов. Актуальный тариф смотрите у своего хостинг-провайдера: разброс тут такой, что усреднённая цифра вводит в заблуждение.
3. Часы на сборку. Считайте не «проект целиком», а задачи: ключ и первый запрос, сбор и загрузка документов, промпт, подключение канала, прогон 50 диалогов с разметкой, правки. Минимальный контур на промпте без RAG собирается за вечер. Версия с базой знаний, эскалацией и приёмкой по протоколу выше это недели, и основная часть уходит не на код, а на документы и доводку промпта. Деталь, съедающая часы при первой работе с GigaChat API: access token живёт 30 минут и его надо обновлять в фоне (запросы на токен разрешено слать до 10 раз в секунду). Забытое обновление это классическая причина падения бота ровно через полчаса после запуска.
Критерий перехода один, и он не про качество ответов. Пока бот только отвечает текстом, это чат-бот, каким бы умным он ни был. Как только ему нужно действовать в ваших системах (создать сделку в CRM, сменить статус заказа, записать клиента, выставить счёт, провести оплату), начинается территория агентов.
Разница в цене ошибки. Неверный ответ бота это недовольный клиент и работа оператора, неверное действие агента это чужой заказ, списанные деньги или испорченная запись в CRM. Поэтому у агента появляется то, чего нет у бота: список разрешённых инструментов, подтверждение перед необратимыми действиями, журнал вызовов и возможность откатить. Архитектуру и границы ответственности мы разобрали в материале о том, что такое ИИ-агент.
Порядок роста: бот-консультант на промпте, база знаний, чтение данных из ваших систем и только потом запись и действия. Каждый следующий шаг делают, когда предыдущий отработал на живом трафике без опасных ответов.
Нужен не эксперимент, а работающий бот
Собираем ботов и ИИ-агентов на GigaChat, YandexGPT и зарубежных моделях: база знаний, интеграция с CRM, эскалация на оператора, приёмка по метрике автозакрытия. Разберём задачу и скажем, хватит ли вам промпта или нужен агент.
Модель на старте может обойтись бесплатно: физлицу при регистрации в GigaChat API дают 365 млн токенов на 12 месяцев, из них 250 млн на GigaChat Lite. Самый дешёвый платный пакет это 20 млн токенов GigaChat 2 Lite за 1 300 рублей. Плюс хостинг с HTTPS-доменом и часы на сборку.
Для прототипа не обязательно: Dify в бесплатном Sandbox даёт 200 сообщений, 5 приложений и 50 документов в базе знаний, а Community Edition разворачивается через Docker. Программист нужен на интеграции с CRM, своём виджете для сайта и на нагрузке, где важно контролировать расход токенов.
Когда все факты помещаются в контекст одного запроса и вы готовы платить за них в каждом обращении. Окно у GigaChat 2 Lite и GigaChat 2 Max составляет 128 000 токенов, этого хватает на объёмный регламент. На базу знаний переходят, когда документы перестали влезать или счёт за входные токены стал заметным.
Токен от @BotFather и способ получать обновления. Для прототипа хватит long polling через getUpdates без домена, для прода нужен вебхук: HTTPS-домен и один из портов 443, 80, 88 или 8443. При установленном вебхуке getUpdates перестаёт работать, а ответ бота ограничен 4096 символами в одном сообщении.
Три меры вместе: правило отвечать только по переданному контексту, база знаний вместо памяти модели и обязательная эскалация «не знаю, передаю оператору». Проверяется разметкой 50 архивных диалогов по шкале «верно, неверно, опасно»: в прод выпускают при нуле опасных ответов.