Короткий ответ

Для максимальной обнаруживаемости публичного сайта разрешите общий User-agent: *, не блокируйте поисковые агенты OpenAI, Anthropic, Perplexity, Google, Bing, Яндекс и Apple, укажите sitemap и закройте только технические и приватные маршруты.

Что делает robots.txt

Файл в корне домена сообщает корректным роботам, какие URL они могут запрашивать. Он нужен для управления обходом и снижения нагрузки, а не для гарантированного удаления страницы из поиска. Google предупреждает: URL, закрытый в robots.txt, иногда всё равно может появиться без содержательного сниппета, если на него ведут внешние ссылки.

Для исключения публичной страницы из индекса применяется noindex, причём робот должен иметь возможность загрузить страницу и увидеть директиву. Конфиденциальные данные нужно защищать авторизацией; robots.txt публичен и не является механизмом безопасности.

Поисковые агенты и агенты обучения — не одно и то же

OpenAI разделяет OAI-SearchBot для поисковых ответов и GPTBot для потенциального обучения моделей. Разрешение первого важно для появления содержания и цитат в ChatGPT Search; политика для GPTBot может быть выбрана отдельно.

Anthropic указывает Claude-SearchBot для улучшения поиска, Claude-User для запросов пользователя и ClaudeBot для сбора данных, которые потенциально могут использоваться в обучении. PerplexityBot предназначен для поисковых результатов, а Perplexity-User выполняет запрос пользователя. Разделение позволяет владельцу сайта принять осознанное решение.

Какие роботы связаны с другими AI-интерфейсами

Google AI Overviews и AI Mode используют обычную инфраструктуру Google Search: страница должна быть индексируема и иметь право показывать сниппет. Google-Extended относится к использованию контента для обучения и grounding отдельных генеративных систем, но не управляет включением в Google Search.

Bing и Copilot опираются на общую систему обхода, индексирования и ранжирования Bing. Для Яндекс Поиска и связанных ответных интерфейсов важен доступ YandexBot. Applebot используется в поисковых функциях экосистемы Apple, включая Siri, Spotlight и Safari; Applebot-Extended отдельно управляет использованием данных для моделей.

Безопасная разрешающая политика

Для публичного маркетингового сайта разумная базовая политика — разрешить User-agent: * и закрыть API, служебные панели, результаты с персональными данными и бесконечные параметры. В явных группах можно повторно разрешить известных поисковых агентов, чтобы назначение было понятно при аудите.

Не блокируйте CSS, JavaScript и изображения, необходимые для визуализации основного содержания. Не используйте Crawl-delay без реальной проблемы: разные роботы поддерживают его по-разному, а слишком большое значение замедляет обнаружение обновлений.

  • разрешить публичные страницы и необходимые ресурсы;
  • закрыть API и непубличные кабинеты;
  • добавить абсолютный URL sitemap.xml;
  • проверить ответ robots.txt без редиректов и ошибок;
  • проверить правила отдельными инструментами вебмастеров;
  • верифицировать IP при настройке WAF, потому что User-Agent можно подделать.

Почему одного robots.txt недостаточно

Разрешение означает только возможность обхода. Страница ещё должна быть обнаружена, индексирована, релевантна запросу и пригодна для отображения. Sitemap, внутренние ссылки, канонические URL и качественный контент решают следующие уровни задачи.

После изменения robots.txt нужно проверить серверный ответ, отправить sitemap в панели вебмастеров и наблюдать логи. OpenAI отмечает, что обновление правил для поискового робота может применяться не мгновенно.

Первичные источники

Ссылки использованы для проверки технических требований и терминов. Дата просмотра — 13 августа 2026 года.

  1. OpenAI Crawlers
  2. Anthropic crawler controls
  3. Perplexity Crawlers
  4. Google robots.txt guide
  5. Apple: About Applebot