OAI-SearchBotilla, Gptbotilla ja ChatGPT-userilla ei ole samaa roolia. OAI-SearchBotia käytetään sivustojen etsimiseen ja näyttämiseen ChatGPT-haun vastauksissa. GPTBOT tutkii sisältöä, jota voidaan käyttää generatiivisten mallien parantamiseen ja turvaamiseen. ChatGPT-User vastaa joitain käyntejä, jotka käyttäjän eksplisiittinen toiminta laukaisee, eikä se ole robotti, joka määrittää sisällyttämisen hakuun. developers.openai.com
Itsenäiset valinnat robots.txt-tiedostossa
OpenAI määrittää, että asetukset ovat riippumattomia. Organisaatio voi sallia OAI-SearchBotin pysyä löydettävissä haussa ja kieltäytyä GPTBOTista, jos sen käytäntö sulkee pois sisällön käytön koulutuksessa. Tämä päätös on käännettävä robots.txt-tiedostoon, mutta tarkista myös, että palomuuri, CDN tai anti-bot-työkalu ei estä valtuutettuja pyyntöjä.
Jokaisen agentin rooli
- oai-searchbot: automaattinen indeksointi chatgpt-hakutuloksiin; Tämä on asetus, jossa tutkitaan haun näkyvyyttä.
- gptbot: generatiivisten mallien tutkiminen; Kielto osoittaa, että sisältöä ei saa käyttää tähän tarkoitukseen.
- chatgpt-käyttäjä: pääsy, joka voidaan käynnistää, kun käyttäjä pyytää chatgpt:tä avaamaan tai käyttämään sivua; Tämä ei ole automaattinen hakuindeksointi.
Esimerkki johdonmukaisesta politiikasta
Julkinen sivusto voi sallia OAI-SearchBotin toimituksellisilla ja kaupallisilla sivuillaan, estää kaikkien robottien yksityiset tai tekniset hakemistot ja päättää erikseen GPTBOT-tilasta. Todennettujen tilojen, korien, sisäisten hakujen ja parametrien URL-osoitteiden on pysyttävä suojattuna todellisilla pääsynhallintalaitteilla; Robots.txt ei ole suojausmekanismi.
Tarkistukset muokkauksen jälkeen
- Vahvista robots.txt-tiedoston syntaksi ja julkinen osoite.
- Vertaa sääntöjä OpenAI:n julkaisemiin IP-alueisiin.
- Tarkkaile HTTP-tiloja lokeissa ja mahdollisissa lohkoissa 403 tai 429.
- Tarkista kanoniset URL-osoitteet, noindexes ja käytettävissä oleva sisältö.
- Odota harkintaa: Openai osoittaa, että robots.txt voi kestää noin 24 tuntia sen hakujärjestelmissä.
pääloukku
Käyttäjäagentin salliminen robots.txt-tiedostossa ei riitä, jos verkkokerros estää sen. Päinvastoin, robotin salliminen ei takaa, että sivu valitaan tai mainitaan. Politiikan on sovitettava yhteen näkyvyys, sisällönhallinta ja todellinen turvallisuus.
Erilliset indeksointirobotin käyttöpäätökset
Julkaisija haluaa julkisia sivuja löydettävissä haussa tehdessään selkeän päätöksen muista automatisoiduista käyttötavoista. Se luettelee robots.txt-tiedoston ilmoitetut agentit, tutustuu kunkin palveluntarjoajan nykyiseen dokumentaatioon ja testaa tärkeitä URL-osoitteita minkä tahansa muutoksen jälkeen.
Tallenna päätös käytön ja agentin mukaan ja tarkasta sitten lokit ja HTTP-vastaukset. Indeksointirobottien nimet ja tarkoitukset eivät ole keskenään vaihdettavissa, ja robots.txt-sääntö ei suojaa luottamuksellista materiaalia.