OAI-searchbot, gptbot и chatgpt-пользователь не играют одну и ту же роль. OAI-SearchBot используется для поиска и появления сайтов в ответах ChatGPT Search. GPTBot исследует контент, который можно использовать для улучшения и защиты генеративных моделей. chatgpt-user соответствует некоторым посещениям, вызванным явным действием пользователя, а не робот, определяющий включение в поиск. developers.openai.com

Независимый выбор в robots.txt

OpenAI указывает, что настройки независимы. Организация может позволить OAI-Searchbot оставаться доступной для поиска при поиске, отказываясь от GPTBot, если его политика исключает использование содержимого для обучения. Это решение необходимо перевести в robots.txt, но также проверить, что брандмауэр, CDN или инструмент анти-бот не блокируют авторизованные запросы.

Роль каждого агента

  • OAI-SearchBot: Автоматическое сканирование результатов поиска в чате; Это настройка для проверки видимости поиска.
  • GPTBOT: исследование генеративных моделей; Запрет указывает, что контент не должен использоваться для этой цели.
  • чат-пользователь: Доступ, который может быть инициирован, когда пользователь просит чатГПТ открыть или использовать страницу; Это не автоматический поиск.

пример согласованной политики

Публичный сайт может разрешить OAI-SearchBot на своих редакционных и коммерческих страницах, блокировать частные или технические каталоги для всех роботов и принимать решения отдельно по статусу GPTBOT. Аутентифицированные пространства, корзины, внутренние поиски и URL-адреса параметров должны оставаться защищенными реальными элементами управления доступом; robots.txt — это не механизм безопасности.

Проверки после модификации

  1. Проверка синтаксиса и публичного адреса robots.txt.
  2. Сравните правила с диапазонами IP, опубликованными OpenAI.
  3. Соблюдайте статусы HTTP в журналах и возможные блоки 403 или 429.
  4. Проверьте канонические URL-адреса, noindexes и доступное содержимое.
  5. Дождитесь рассмотрения: OpenAI указывает, что смена robots.txt может занять около 24 часов для его поисковых систем.

Основная ловушка

Разрешить пользовательскому агенту в robots.txt недостаточно, если сетевой уровень блокирует его. И наоборот, разрешение робота не гарантирует, что страница будет выбрана или процитирована. Политика должна согласовывать видимость, управление контентом и реальную безопасность.

Separate crawler access decisions

Издатель хочет, чтобы общедоступные страницы можно было обнаружить при поиске, принимая четкое решение о других автоматизированных целях. В нем перечислены заявленные агенты в robots.txt, сверяются с текущей документацией каждого провайдера и тестируют важные URL-адреса после любого изменения.

Запишите решение по использованию и агенту, затем проверяйте журналы и HTTP-ответы. Имена и цели сканера не взаимозаменяемы, а правило robots.txt не защищает конфиденциальный материал.

Проверьте источники и свидетельства веб-контента →