oai-searchbot, gptbot y chatgpt-user no tienen el mismo rol. OAI-SearchBot se utiliza para buscar y aparecer sitios en las respuestas de la búsqueda chatgpt. GPTbot explora contenido que se puede utilizar para mejorar y proteger modelos generativos. ChatGPT-User corresponde a algunas visitas activadas por una acción explícita de un usuario y no es el robot que determina la inclusión en la búsqueda. developers.openai.com

Opciones independientes en robots.txt

OpenAI especifica que la configuración es independiente. Una organización puede permitir que OAI-SearchBot permanezca detectable en la búsqueda mientras rechaza GPTbot si su política excluye el uso de contenido para la capacitación. Esta decisión debe traducirse en robots.txt, pero también verificar que el firewall, la CDN o una herramienta antibot no bloquea las solicitudes autorizadas.

El papel de cada agente

  • bot de búsqueda de OAI: rastreo automático para los resultados de búsqueda de chatgpt; Esta es la configuración para examinar la visibilidad de la búsqueda.
  • GPTbot: Exploración de modelos generativos; Una prohibición indica que el contenido no debe usarse para este propósito.
  • chatgpt-usuario: Acceso que puede iniciarse cuando el usuario le pida a chatgpt que abra o use una página; Este no es un rastreo de búsqueda automático.

Un ejemplo de una política coherente

Un sitio público puede permitir OAI-SearchBot en sus páginas editoriales y comerciales, bloquear directorios privados o técnicos para todos los robots y decidir por separado el estado de GPTbot. Los espacios autenticados, cestas, búsquedas internas y URL de parámetros deben permanecer protegidos por controles de acceso reales; robots.txt no es un mecanismo de seguridad.

Comprobaciones después de la modificación

  1. Valide la sintaxis y la dirección pública de robots.txt.
  2. Compare las reglas con los rangos de IP publicados por OpenAI.
  3. Observe los estados HTTP en los registros y los posibles bloques 403 o 429.
  4. Compruebe las URL canónicas, los noindexes y los contenidos accesibles.
  5. Espere a la consideración: OpenAI indica que un cambio de robots.txt puede tardar aproximadamente 24 horas en sus sistemas de búsqueda.

La trampa principal

Permitir un agente de usuario en robots.txt no es suficiente si una capa de red lo bloquea. Por el contrario, permitir un robot no garantiza que se seleccione o citará una página. La política debe conciliar la visibilidad, la gobernanza del contenido y la seguridad real.

Decisiones separadas de acceso al rastreador

Un editor quiere páginas públicas detectables en la búsqueda mientras toma una decisión distinta sobre otros usos automatizados. Enumera los agentes declarados en robots.txt, consulta la documentación actual de cada proveedor y prueba las URL importantes después de cualquier cambio.

Registre la decisión por uso y agente, luego inspeccione los registros y las respuestas HTTP. Los nombres y propósitos de rastreadores no son intercambiables, y una regla de robots.txt no asegura material confidencial.

Consulta las fuentes y evidencia de contenido web →