OAI-SearchBot, GptBot e ChatGPT-User non hanno lo stesso ruolo. OAI-SearchBot viene utilizzato per la ricerca e la visualizzazione di siti nelle risposte da ChatGPT Search. GptBot esplora i contenuti che possono essere utilizzati per migliorare e proteggere i modelli generativi. ChatGPT-User corrisponde ad alcune visite innescate da un'azione esplicita di un utente e non è il robot che determina l'inclusione nella ricerca. developers.openai.com

Scelte indipendenti in robots.txt

OpenAI Specifica che le impostazioni sono indipendenti. Un'organizzazione può consentire a OAI-SearchBot di rimanere rilevabile nella ricerca rifiutando GPTBot se la sua politica esclude l'uso dei contenuti per la formazione. Questa decisione deve essere tradotta in robots.txt, ma verifica anche che il firewall, il CDN o uno strumento anti-bot non blocchi le richieste autorizzate.

Il ruolo di ogni agente

  • oai-searchbot: scansione automatica per i risultati di ricerca di chatgpt; Questa è l'impostazione da esaminare per la visibilità della ricerca.
  • gptbot: Esplorazione di modelli generativi; Un divieto indica che il contenuto non dovrebbe essere utilizzato per questo scopo.
  • chatgpt: utente: Accesso che può essere avviato quando l'utente chiede a ChatGPT di aprire o utilizzare una pagina; Questo non è un crawl di ricerca automatico.

Un esempio di politica coerente

Un sito pubblico può consentire a OAI-Searchbot nelle sue pagine editoriali e commerciali, bloccare le directory private o tecniche per tutti i robot e decidere separatamente lo stato di GPTBot. Gli spazi autenticati, i panieri, le ricerche interne e gli URL dei parametri devono rimanere protetti da controlli di accesso reali; Robot.txt non è un meccanismo di sicurezza.

Controlli dopo la modifica

  1. Convalida la sintassi e l'indirizzo pubblico di robots.txt.
  2. Confronta le regole con gli intervalli IP pubblicati da OpenAI.
  3. Osservare gli stati HTTP nei log e nei possibili blocchi 403 o 429.
  4. Controlla gli URL canonici, i noindex e i contenuti accessibili.
  5. Attendi la considerazione: OpenAI indica che una modifica di robots.txt potrebbe richiedere circa 24 ore per i suoi sistemi di ricerca.

La trappola principale

Consentire un agente utente in robots.txt non è sufficiente se un livello di rete lo blocca. Al contrario, consentire a un robot non garantisce che una pagina venga selezionata o citata. La politica deve conciliare visibilità, governance dei contenuti e sicurezza reale.

Decisioni di accesso al crawler separate

Un editore desidera che le pagine pubbliche siano rilevabili nella ricerca mentre prendono una decisione distinta su altri usi automatizzati. Elenca gli agenti dichiarati in robots.txt, consulta la documentazione corrente di ciascun provider e testa gli URL importanti dopo qualsiasi modifica.

Registrare la decisione per uso e agente, quindi ispezionare i log e le risposte HTTP. I nomi e gli scopi del crawler non sono intercambiabili e una regola robots.txt non protegge materiale riservato.

Controlla le fonti e le prove del contenuto web →