OAI-SearchBot, GPTBot et ChatGPT-User n’ont pas le même rôle. OAI-SearchBot sert à la recherche et à l’apparition de sites dans les réponses de ChatGPT Search. GPTBot explore des contenus susceptibles d’être utilisés pour améliorer et sécuriser les modèles génératifs. ChatGPT-User correspond à certaines visites déclenchées par une action explicite d’un utilisateur et n’est pas le robot qui détermine l’inclusion dans Search. developers.openai.com
Des choix indépendants dans robots.txt
OpenAI précise que les réglages sont indépendants. Une organisation peut autoriser OAI-SearchBot pour rester découvrable dans la recherche tout en refusant GPTBot si sa politique exclut l’usage du contenu pour l’entraînement. Il faut traduire cette décision dans robots.txt, mais aussi vérifier que le pare-feu, le CDN ou un outil anti-bot ne bloque pas les requêtes autorisées.
Le rôle de chaque agent
- OAI-SearchBot : exploration automatique destinée aux résultats de recherche ChatGPT ; c’est le réglage à examiner pour la visibilité Search.
- GPTBot : exploration destinée aux modèles génératifs ; une interdiction signale que le contenu ne doit pas être utilisé à cette fin.
- ChatGPT-User : accès pouvant être initié lorsque l’utilisateur demande à ChatGPT d’ouvrir ou d’utiliser une page ; ce n’est pas un crawl automatique de Search.
Un exemple de politique cohérente
Un site public peut autoriser OAI-SearchBot sur ses pages éditoriales et commerciales, bloquer les répertoires privés ou techniques pour tous les robots et décider séparément du statut de GPTBot. Les espaces authentifiés, paniers, recherches internes et URL à paramètres doivent rester protégés par de vrais contrôles d’accès ; robots.txt n’est pas un mécanisme de sécurité.
Contrôles après modification
- Valider la syntaxe et l’adresse publique de robots.txt.
- Comparer les règles avec les plages IP publiées par OpenAI.
- Observer les statuts HTTP dans les journaux et les éventuels blocages 403 ou 429.
- Vérifier les URL canoniques, noindex et contenus accessibles.
- Attendre la prise en compte : OpenAI indique qu’un changement de robots.txt peut demander environ 24 heures pour ses systèmes de recherche.
Le principal piège
Autoriser un user-agent dans robots.txt ne suffit pas si une couche réseau le bloque. À l’inverse, autoriser un robot ne garantit pas qu’une page sera sélectionnée ou citée. La politique doit concilier visibilité, gouvernance des contenus et sécurité réelle.