GEO оптимизация начинается не с текста, а с вопроса, какой именно робот пришёл на вашу страницу и с какой задачей. У OpenAI таких роботов четыре, у Perplexity два, у Google нет ни одного отдельного, а Яндекс управляет показом в Нейро через агента, который вообще не делает запросов к сайту. Одинаковая строка в robots.txt даёт в этих системах четыре разных результата, и чаще всего не тот, которого ждали.
Базовая методика (чем генеративная оптимизация отличается от поисковой, как модель отбирает источник, что писать в разметке и по какому чек-листу готовить страницу) разобрана отдельно: GEO оптимизация сайта. Здесь только то, что у площадок устроено по-разному и потому не переносится с одной на другую.
Различия проходят по трём линиям. Первая: у кого есть выделенный агент для показа в ответах. У OpenAI за это отвечает OAI-SearchBot, а обучение моделей это отдельный GPTBot; у Google выделенного агента нет вообще, доступ регулируется правилами для Googlebot. Вторая: чем управляют. Google, OpenAI и Яндекс читают robots.txt, Bing смотрит мета-теги на самой странице. Третья: соблюдается ли запрет, потому что агенты, ходящие по прямому запросу живого пользователя, документированы как исключение.
Отсюда главная ошибка настройки: строка, закрывающая обучение моделей, и строка, закрывающая показ в ответах, это разные строки для разных токенов. Их путают, и сайт выпадает из выдачи ассистента, продолжая отдавать контент в обучение.
OpenAI публикует четырёх ботов с разными задачами и отдельными списками адресов. Токены и назначение приведены в документации для разработчиков.
| Токен | Задача | Что даёт запрет | Список адресов |
|---|---|---|---|
| OAI-SearchBot/1.4 | показ сайта в результатах поиска внутри ChatGPT | сайт перестаёт появляться в ответах со ссылками | openai.com/searchbot.json |
| GPTBot/1.4 | сбор контента, который может использоваться при обучении моделей | контент не идёт в обучение, на показ в поиске ChatGPT не влияет | openai.com/gptbot.json |
| ChatGPT-User/1.0 | переходы по инициативе пользователя и запросы Custom GPTs | по документации правила robots.txt к этому агенту могут не применяться | openai.com/chatgpt-user.json |
| OAI-AdsBot/1.0 | проверка безопасности посадочных страниц, отправленных как объявления | рекламная посадочная не проходит проверку | openai.com/adsbot.json |
Частая ошибка: владелец не хочет отдавать тексты на обучение и закрывает всё, что связано с OpenAI, одной секцией. Вместе с GPTBot под запрет попадает OAI-SearchBot, и сайт исчезает из ответов ChatGPT.
Списки адресов позволяют не гадать по строке user-agent. На 22 августа 2026 года в них опубликовано 35 диапазонов у OAI-SearchBot, 21 у GPTBot, 204 у ChatGPT-User и всего 2 у OAI-AdsBot. Разница объясняется характером трафика: пользовательские переходы идут из гораздо более широкой инфраструктуры, чем плановый обход. Значения меняются, сверять их надо по JSON, а не по копии из чужой статьи.
У Perplexity агентов два, и мотив блокировать их слабее, чем у OpenAI. PerplexityBot/1.0 обходит сайты для показа и цитирования в результатах и, по документации сервиса, не используется для обучения моделей. Perplexity-User/1.0 обслуживает действия пользователя: заходит на страницу, когда конкретный человек задал вопрос. Второй агент обычно игнорирует robots.txt именно потому, что запрос исходит от пользователя.
Отсюда различие с OpenAI: запрет PerplexityBot стоит цитирования, а взамен не даёт того, ради чего закрывают GPTBot, потому что обучения здесь и так нет. Списки адресов у Perplexity компактнее: на 22 августа 2026 года 8 диапазонов у PerplexityBot и 4 у Perplexity-User. Оба файла отдаются с домена perplexity.ai, запрос к perplexity.com уходит в редирект, так что скрипт проверки надо писать с обработкой 302.
Отдельного краулера под ответы ИИ у Google нет: доступ к этим функциям регулируется правилами robots.txt для Googlebot. Там же снят частый вопрос: чтобы попасть в AI Overviews и AI Mode, не нужно создавать новые машиночитаемые файлы, специальные текстовые файлы для ИИ или отдельную разметку, и специальной структуры schema.org для этого не предусмотрено.
Условие попадания сформулировано через сниппет: страница должна быть проиндексирована и иметь право показываться со сниппетом. Отсюда три директивы, которые выключают сайт из ответов ИИ, хотя ставились ради другого:
В Search Console данные по AI Overviews и AI Mode входят в общий поисковый трафик в составе типа «Веб»: отдельного типа поиска для них нет, разложить показы штатными средствами нельзя.
Эти три токена регулярно принимают за рычаг влияния на выдачу. Ни один им не является. Google-Extended управляет обходом для обучения будущих моделей Gemini, обслуживающих приложения Gemini и Vertex AI API, а также для grounding в приложениях Gemini и Grounding with Google Search в Vertex AI; в документации оговорено, что он не влияет на включение сайта в Google Поиск и не используется как сигнал ранжирования. Google-CloudVertexBot обходит сайты по запросу самих владельцев при сборке агентов Vertex AI и на Поиск не влияет. Предпочтения для GoogleOther по формулировке справки не затрагивают ни один конкретный продукт.
Вывод: закрытие Google-Extended это решение про обучение моделей, а не про видимость. Видимость в ответах ИИ Google регулируется только правилами для Googlebot и сниппет-директивами.
Нейро собирает ответ в три шага: алгоритмы отбирают релевантные материалы, генеративная модель анализирует поисковую выдачу в реальном времени, результат сводится в ответ со ссылками на источники. Отдельного индексирующего робота у механизма нет.
Управление вынесено в два служебных токена: YandexAdditionalBot/1.0 и YandexAdditional/1.0. По справке Вебмастера они учитываются при обработке robots.txt для ограничения показа содержимого страницы в быстрых ответах с YandexGPT и в ответах Поиска с Алисой. Сами они запросов на индексирование не выполняют и работают с данными, которые основной YandexBot уже получил при обычном обходе.
Отсюда два следствия. Попасть в Нейро отдельным техническим способом нельзя: вход только через обычную индексацию YandexBot, поэтому всё, что мешает индексации, закрывает и Нейро. И наоборот, если убрать страницу из быстрых ответов надо, закрывать следует YandexAdditional, а не YandexBot, иначе пропадёт и обычная выдача.
Требования к самому файлу: размер не более 500 КБ, сервер отвечает кодом 200 OK. Если файл требованиям не соответствует, сайт считается открытым для индексирования, то есть неудачная правка снимает запреты, а не ужесточает их.
У Microsoft управление показом в ответах ассистента вынесено не в robots.txt, а в мета-теги страницы. Контент с меткой NOCACHE может попадать в ответы, но показывается только как URL, заголовок и сниппет. Контент с меткой NOARCHIVE в ответы не попадает и ссылки в них не получает. При обеих метках применяется NOCACHE. На обычную выдачу Bing ни одна не влияет.
Anthropic публикует три токена: ClaudeBot (данные для улучшения полезности и безопасности моделей), Claude-User (веб-поиск по запросу пользователя Claude), Claude-SearchBot (анализ контента для релевантности поисковых ответов). У Meta тоже три: meta-externalagent обходит веб для обучения базовых моделей и индексации контента, meta-externalfetcher подтягивает ссылки по запросу пользователя и robots.txt может игнорировать, facebookexternalhit забирает содержимое расшаренных ссылок и способен обходить robots.txt при проверках безопасности. Разделение то же, что у OpenAI, и ошибка та же: одна строка закрывает не то, что имелось в виду.
| Площадка | Чем управляется показ в ответах | Чем управляется обучение |
|---|---|---|
| ChatGPT | OAI-SearchBot в robots.txt | GPTBot в robots.txt |
| Perplexity | PerplexityBot в robots.txt | обучения по документации нет |
| Google AI Overviews и AI Mode | Googlebot в robots.txt, nosnippet, max-snippet, data-nosnippet | Google-Extended в robots.txt |
| Яндекс Нейро и Алиса | YandexAdditionalBot и YandexAdditional в robots.txt | отдельного токена в справке нет |
| Bing Copilot | мета-теги NOCACHE и NOARCHIVE | NOARCHIVE исключает и из обучения |
| Claude | Claude-SearchBot в robots.txt | ClaudeBot в robots.txt |
| Meta AI | meta-externalagent в robots.txt | meta-externalagent в robots.txt |
Частая причина неудач с доступом ИИ-агентов сидит не в тексте правил, а в том, какую секцию файла робот прочитал. Правило Google однозначно: краулер находит группу с наиболее специфичным user-agent, совпадающим с его собственным, а если подходящих групп несколько, их правила объединяются в одну.
Следствия, которые ломают настройку чаще всего:
Строку user-agent подделывает кто угодно, запись в логе сама по себе ничего не доказывает. Официальных способов проверки два.
Первый, обратный DNS. Для Google: выполнить обратный просмотр по адресу командой host, убедиться, что имя домена относится к googlebot.com, google.com или googleusercontent.com, затем выполнить прямой просмотр по полученному имени и сверить результат с исходным адресом из логов.
Второй, сверка со списком. Google публикует наборы common-crawlers.json, special-crawlers.json и файлы для агентов, инициированных пользователем. OpenAI и Perplexity публикуют по одному JSON на агента, адреса файлов указаны в таблице выше.
Порядок на практике: раз в неделю грепнуть журнал доступа по семи токенам (OAI-SearchBot, GPTBot, ChatGPT-User, PerplexityBot, Perplexity-User, Claude-SearchBot, meta-externalagent), посчитать визиты и посмотреть коды ответов. Массовые 403 у одного агента означают, что его режет не robots.txt, а WAF или облачная защита, и правка текстовых правил не поможет.
Позиции в ответе ассистента не существует: источников несколько, явного порядка нет, а на один вопрос модель отвечает по-разному в разные дни. Измерять надо долю ответов с упоминанием бренда и долю с кликабельной ссылкой на домен.
Рабочая схема замера:
Косвенный признак попадания в ответ ИИ по данным Search Console: показы по запросу растут, а клики стоят на месте или падают.
Разобрать доступ к ИИ-агентам на вашем сайте
Проверим по логам, какие агенты доходят до страниц и с какими кодами ответа, разведём правила по площадкам, чтобы запрет на обучение не выключал показ в ответах, и поставим еженедельный замер упоминаний.
Ответ ассистента почти всегда показывает источники, и разбор начинается с них, а не с переписывания собственной страницы.
Шаг первый: посмотреть, чьи домены процитированы. Если это агрегаторы, каталоги и обзорные подборки, а не сайты вендоров, задача не в вашей странице, а в присутствии в этих подборках: модель на ваш сайт не заходила, и переписывание текста ничего не изменит.
Шаг второй: проверить доступ отдельно для OAI-SearchBot, PerplexityBot и Claude-SearchBot. Секция для конкретного токена перекрывает общую, строку надо искать глазами.
Шаг третий: для Google проверить сниппет-директивы. Если стоит nosnippet или короткий max-snippet, страница выключена из AI Overviews и AI Mode по определению, независимо от качества текста. Отдельно посмотреть, не закрыт ли ключевой абзац атрибутом data-nosnippet.
Шаг четвёртый: для Яндекса проверять не Нейро, а обычную индексацию. Раз YandexAdditional работает по данным, уже собранным YandexBot, отсутствие страницы в быстром ответе почти всегда означает проблему с индексацией, а не с генерацией. И сверить свежесть: Нейро по описанию Яндекса понимает, когда данные требуют обновления, поэтому страница с цифрами двухлетней давности проигрывает по дате, а не по структуре.
Быстрая самопроверка перед разбором
Нет. В справке Google по функциям ИИ сказано, что для появления в AI Overviews и AI Mode не нужно создавать новые машиночитаемые файлы, текстовые файлы для ИИ или дополнительную разметку, и отдельной структуры schema.org не предусмотрено. Достаточно индексации и права показываться со сниппетом.
Нет, если OAI-SearchBot остался разрешён: за показ в поиске внутри ChatGPT отвечает он, а GPTBot собирает контент для возможного обучения моделей. Это разные токены с разными списками адресов: 35 диапазонов у первого и 21 у второго на 22 августа 2026 года.
Нет. В документации сказано, что Google-Extended не влияет на включение сайта в Google Поиск и не используется как сигнал ранжирования. Токен управляет только обходом для обучения будущих моделей Gemini и для grounding в приложениях Gemini и Vertex AI.
Закрыть в robots.txt токены YandexAdditionalBot и YandexAdditional. Они учитываются только при ограничении показа содержимого в быстрых ответах с YandexGPT и в ответах Поиска с Алисой, запросов на индексирование не делают и обычную выдачу не затрагивают.
Он обслуживает действие живого пользователя и по документации Perplexity обычно правила robots.txt игнорирует. Тот же принцип у ChatGPT-User, meta-externalfetcher и facebookexternalhit. Ограничивать такой трафик можно только на уровне сервера, сверяя адреса со списком: у Perplexity-User в нём 4 диапазона на 22 августа 2026 года.