OAI-SearchBot, Gptbot und ChatGpt-User haben nicht die gleiche Rolle. OAI-SearchBot wird zum Suchen und Erscheinen von Websites in Antworten aus der ChatGPT-Suche verwendet. GPTBot untersucht Inhalte, die zur Verbesserung und Sicherung von generativen Modellen verwendet werden können. ChatGpt-Benutzer entspricht einigen Besuchen, die durch eine explizite Aktion eines Benutzers ausgelöst werden, und ist nicht der Roboter, der die Aufnahme in die Suche bestimmt. developers.openai.com

Unabhängige Auswahl in robots.txt

OpenAI gibt an, dass die Einstellungen unabhängig sind. Eine Organisation kann es OAI-SearchBot ermöglichen, bei der Suche auffindbar zu bleiben, während GptBot abgelehnt wird, wenn die Richtlinie die Verwendung von Inhalten für das Training ausschließt. Diese Entscheidung muss in robots.txt übersetzt werden, aber auch überprüfen, ob die Firewall, das CDN oder ein Anti-Bot-Tool nicht autorisierte Anfragen blockiert.

Die Rolle jedes Agenten

  • OAI-Suchbot: Automatisches Crawlen für Chatgpt-Suchergebnisse; Dies ist die Einstellung, die auf die Sichtbarkeit der Suche untersucht werden muss.
  • gptbot: Erforschung von generativen Modellen; Ein Verbot weist darauf hin, dass der Inhalt nicht für diesen Zweck verwendet werden sollte.
  • chatgpt-nutzer: Zugriff, der initiiert werden kann, wenn der Benutzer ChatGPT bittet, eine Seite zu öffnen oder zu verwenden; Dies ist kein automatisches Suchen.

Ein Beispiel für eine kohärente Politik

Eine öffentliche Seite kann OAI-Searchbot auf seinen redaktionellen und kommerziellen Seiten ermöglichen, private oder technische Verzeichnisse für alle Roboter blockieren und separat über den GPTBot-Status entscheiden. Authentifizierte Räume, Körbe, interne Suchanfragen und Parameter-URLs müssen durch echte Zugriffskontrollen geschützt bleiben. Robots.txt ist kein Sicherheitsmechanismus.

Überprüfungen nach der Änderung

  1. Validieren Sie die Syntax und die öffentliche Adresse von robots.txt.
  2. Vergleichen Sie die Regeln mit den von OpenAI veröffentlichten IP-Bereichen.
  3. HTTP-Status in Protokollen und möglichen Blöcken 403 oder 429 beobachten.
  4. Überprüfen Sie kanonische URLs, No-Indizes und zugängliche Inhalte.
  5. Warten Sie auf Überlegung: OpenAI gibt an, dass ein Wechsel von robots.txt ungefähr 24 Stunden für seine Suchsysteme dauern kann.

Die Hauptfalle

Das Zulassen eines User-Agents in robots.txt reicht nicht aus, wenn eine Netzwerkebene es blockiert. Umgekehrt garantiert das Zulassen eines Roboters nicht, dass eine Seite ausgewählt oder zitiert wird. Die Richtlinie muss Sichtbarkeit, Content Governance und echte Sicherheit in Einklang bringen.

Separate Crawler-Zugriffsentscheidungen

Ein Publisher möchte, dass öffentliche Seiten in der Suche auffindbar sind, während er eine eindeutige Entscheidung über andere automatisierte Verwendungen trifft. Es listet die deklarierten Agenten in robots.txt auf, konsultiert die aktuelle Dokumentation jedes Anbieters und testet nach jeder Änderung wichtige URLs.

Zeichnen Sie die Entscheidung nach Verwendung und Agenten auf und prüfen Sie dann Protokolle und HTTP-Antworten. Crawlernamen und -zwecke sind nicht austauschbar, und eine robots.txt-Regel sichert kein vertrauliches Material.

Überprüfen Sie die Quellen und Nachweise von Webinhalten →