OAI-SearchBot, GPTBOT en ChatGPT-gebruiker hebben niet dezelfde rol. OAI-SearchBot wordt gebruikt voor het zoeken en verschijnen van sites in reacties van CHATGPT Search. GPTBOT verkent inhoud die kan worden gebruikt om generatieve modellen te verbeteren en te beveiligen. ChatGPT-gebruiker komt overeen met enkele bezoeken die worden veroorzaakt door een expliciete actie van een gebruiker en is niet de robot die inclusie in zoeken bepaalt. developers.openai.com

Onafhankelijke keuzes in robots.txt

OpenAI geeft aan dat de instellingen onafhankelijk zijn. Een organisatie kan toestaan dat OAI-SearchBot detecteerbaar blijft tijdens het zoeken terwijl hij GPTBOT weigert als haar beleid het gebruik van inhoud voor training uitsluit. Deze beslissing moet worden vertaald in robots.txt, maar controleer ook of de firewall, het CDN of een anti-bottool geen geautoriseerde verzoeken blokkeert.

De rol van elke agent

  • OAI-SearchBot: Automatische crawl voor zoekresultaten van ChatGPT; Dit is de instelling om te onderzoeken op de zichtbaarheid van de zoekfunctie.
  • GPTBOT: Verkenning voor generatieve modellen; Een verbod geeft aan dat de inhoud voor dit doel niet mag worden gebruikt.
  • chatgpt-gebruiker: Toegang die kan worden gestart wanneer de gebruiker ChatGPT vraagt om een pagina te openen of te gebruiken; Dit is geen automatische zoektocht.

Een voorbeeld van een samenhangend beleid

Een openbare site kan OAI-SearchBot toestaan op zijn redactionele en commerciële pagina's, privé- of technische directories voor alle robots blokkeren en afzonderlijk beslissen over de GPTBOT-status. Geauthenticeerde ruimtes, manden, interne zoekopdrachten en parameter-URL's moeten beschermd blijven door echte toegangscontroles; Robots.txt is geen beveiligingsmechanisme.

Controles na wijziging

  1. Valideer de syntaxis en het openbare adres van robots.txt.
  2. Vergelijk de regels met de IP-bereiken die door OpenAI zijn gepubliceerd.
  3. Observeer HTTP-statussen in logboeken en mogelijke blokken 403 of 429.
  4. Controleer canonieke URL's, noindexes en toegankelijke inhoud.
  5. Wacht op overweging: OpenAI geeft aan dat een verandering van robots.txt ongeveer 24 uur kan duren voor zijn zoeksystemen.

De belangrijkste val

Het toestaan van een user-agent in robots.txt is niet genoeg als een netwerklaag deze blokkeert. Omgekeerd garandeert het toestaan van een robot niet dat een pagina wordt geselecteerd of geciteerd. Het beleid moet zichtbaarheid, content governance en echte beveiliging in overeenstemming brengen.

Separate crawler access decisions

Een uitgever wil openbare pagina's die te vinden zijn in de zoekopdracht, terwijl u een duidelijke beslissing neemt over ander geautomatiseerd gebruik. Het vermeldt de gedeclareerde agenten in robots.txt, raadpleegt de huidige documentatie van elke provider en test belangrijke URL's na elke wijziging.

Noteer de beslissing op gebruik en agent en inspecteer vervolgens logboeken en HTTP-reacties. Crawlernamen en -doeleinden zijn niet uitwisselbaar en een Robots.txt-regel beveiligt geen vertrouwelijk materiaal.

Controleer de bronnen en het bewijs van webinhoud →