oai-searchbot, gptbot e chatgpt-user não têm a mesma função. OAI-SearchBot é usado para pesquisar e aparecer sites nas respostas da pesquisa do chatGPT. O GPTBot explora o conteúdo que pode ser usado para melhorar e proteger os modelos generativos. ChatGPT-user corresponde a algumas visitas acionadas por uma ação explícita de um usuário e não é o robô que determina a inclusão na pesquisa. developers.openai.com

Escolhas independentes em robôs.txt

OpenAI especifica que as configurações são independentes. Uma organização pode permitir que o OAI-SearchBot permaneça detectável na pesquisa enquanto recusa o GPTBot se sua política exclui o uso de conteúdo para treinamento. Essa decisão deve ser traduzida em robots.txt, mas também verifique se o firewall, o CDN ou uma ferramenta anti-bot não bloqueiam as solicitações autorizadas.

O papel de cada agente

  • OAI-SearchBot: Rastreamento automático para resultados de pesquisa do chatgpt; Esta é a configuração para examinar a visibilidade da pesquisa.
  • gptbot: exploração de modelos generativos; Uma proibição indica que o conteúdo não deve ser usado para essa finalidade.
  • chatgpt-usuário: O acesso que pode ser iniciado quando o usuário pede ao chatgpt para abrir ou usar uma página; Este não é um rastreamento de pesquisa automático.

Um exemplo de política coerente

Um site público pode permitir o OAI-SearchBot em suas páginas editoriais e comerciais, bloquear diretórios privados ou técnicos de todos os robôs e decidir separadamente sobre o status do GPTBot. Espaços autenticados, cestos, pesquisas internas e URLs de parâmetros devem permanecer protegidos por controles de acesso real; Robots.txt não é um mecanismo de segurança.

verifica após modificação

  1. Valide a sintaxe e o endereço público de Robots.txt.
  2. Compare as regras com os intervalos de IP publicados pela OpenAI.
  3. Observe os status do HTTP nos logs e nos blocos possíveis 403 ou 429.
  4. Verifique os URLs canônicos, noindexes e conteúdos acessíveis.
  5. Aguarde a consideração: o OpenAI indica que uma mudança de robots.txt pode demorar aproximadamente 24 horas para seus sistemas de pesquisa.

A armadilha principal

Permitir um agente do usuário em Robots.txt não é suficiente se uma camada de rede estiver bloqueando. Por outro lado, permitir um robô não garante que uma página seja selecionada ou citada. A política deve conciliar a visibilidade, a governança de conteúdo e a segurança real.

Decisões separadas de acesso ao rastreador

Um editor deseja que as páginas públicas sejam descobertas na pesquisa, ao mesmo tempo em que toma uma decisão distinta sobre outros usos automatizados. Ele lista os agentes declarados em robots.txt, consulta a documentação atual de cada provedor e testa URLs importantes após qualquer alteração.

Registre a decisão por uso e agente e, em seguida, inspecione logs e respostas HTTP. Os nomes e propósitos dos rastreadores não são intercambiáveis e uma regra Robots.txt não protege o material confidencial.

Verifique as fontes e evidências do conteúdo da web →