GPTBot: o que é e como configurá-lo no teu robots.txt
O GPTBot é o rastreador da OpenAI que treina os seus modelos de IA generativa. Explicamos-te como distingui-lo do OAI-SearchBot e configurar o teu robots.txt.
Neste artigo
- O que é o GPTBot e para que o usa a OpenAI
- A string do user-agent e porque é que pode mudar
- O GPTBot não é o único rastreador da OpenAI
- Porque é que bloquear só o GPTBot não te tira do ChatGPT
- OAI-AdsBot, o menos conhecido dos quatro
- Como configurar o teu robots.txt para o GPTBot
- Verificação pelo intervalo de IP publicado
- Quanto tempo demora a alteração a aplicar-se
- Quando o robots.txt diz que sim mas o firewall diz que não
- Como verificar isto no teu próprio site
- Perguntas frequentes sobre o GPTBot
- O que rever no teu robots.txt antes de publicar
Abres o teu robots.txt para ver que rastreadores tens bloqueados e encontras uma linha que diz User-agent: GPTBot. Não te lembras se foste tu que a puseste, se veio de um template ou se alguém da equipa a acrescentou há meses sem explicar porquê. E a dúvida que se segue é sempre a mesma: isto tira-te do ChatGPT ou só bloqueia o treino dos seus modelos?
O GPTBot é o rastreador que a OpenAI usa para recolher conteúdo com que treinar os seus modelos de IA generativa, e é apenas um dos quatro user-agents distintos que a empresa opera, cada um com uma função diferente e um controlo independente no robots.txt. Confundi-los entre si é o erro mais comum que encontramos ao rever configurações de rastreio.
Neste artigo vais encontrar o que o GPTBot faz exatamente e o que não faz, em que se distingue do OAI-SearchBot, do ChatGPT-User e do OAI-AdsBot, como escrever as regras certas no teu robots.txt consoante o que queiras permitir ou bloquear, e porque é que às vezes o robots.txt diz que sim e o rastreador continua sem conseguir entrar.
O que é o GPTBot e para que o usa a OpenAI
O GPTBot é o rastreador que a OpenAI utiliza para recolher conteúdo publicamente acessível que pode ser usado no treino dos seus modelos de IA generativa. Quando não autorizas o GPTBot no teu robots.txt, estás a indicar à OpenAI que o conteúdo do teu site não deve ser usado para treinar futuras versões dos seus modelos.
É importante perceber o alcance real dessa decisão: bloquear o GPTBot afeta o treino de modelos futuros, não existe nenhum mecanismo público para retirar conteúdo de modelos que já foram treinados com rastreios anteriores. É uma decisão que atua para a frente, não para trás, e convém ter isso claro antes de a tratar como um interruptor de «sair da IA».
A string do user-agent e porque é que pode mudar
O GPTBot identifica-se com uma string de user-agent que inclui um número de versão, por exemplo GPTBot/1.4. A OpenAI avisa de forma explícita que esse número pode mudar sem aviso prévio, por isso qualquer regra de firewall ou de deteção que dependa de uma versão concreta escrita à mão é frágil à partida.
O que é fiável é filtrar pelo nome do agente e, se precisares de verificação adicional, pelo intervalo de IP publicado (vemos isso mais abaixo).
O GPTBot não é o único rastreador da OpenAI
A OpenAI documenta oficialmente quatro user-agents distintos, e cada um controla-se de forma independente no robots.txt. Se só conheces o GPTBot, é fácil dar por adquirido que bloqueá-lo resolve toda a tua relação com o ChatGPT, e não é assim.
| User-agent | Para que o usa a OpenAI | Treina modelos? | Rege-se pelo robots.txt? |
|---|---|---|---|
| GPTBot | Recolhe conteúdo para o treino de modelos futuros | Sim | Sim |
| OAI-SearchBot | Indexa conteúdo para as funções de pesquisa dentro do ChatGPT | Não | Sim |
| ChatGPT-User | Visita uma página quando um utilizador ou um Custom GPT o pede durante uma conversa | Não | Não necessariamente, por ser uma ação iniciada pelo utilizador |
| OAI-AdsBot | Valida o cumprimento da política de páginas enviadas como anúncios no ChatGPT | Não | Aplica-se só a páginas de anúncios enviadas, não ao resto do site |
Porque é que bloquear só o GPTBot não te tira do ChatGPT
Quem decide se o teu conteúdo pode aparecer citado nas respostas de pesquisa do ChatGPT é o OAI-SearchBot, não o GPTBot. Se não autorizares o OAI-SearchBot, o teu site não vai aparecer nas respostas de pesquisa do ChatGPT, embora possa continuar a aparecer como ligação de navegação noutros contextos.
São duas decisões distintas: uma é sobre treino, a outra é sobre visibilidade, e a OpenAI trata-as como configurações independentes precisamente para que as possas separar.
Nota editorial: nas configurações que costumamos rever é comum encontrar um robots.txt que bloqueia o GPTBot a pensar que assim se resolve «o problema da IA», enquanto o OAI-SearchBot e o ChatGPT-User ficam completamente abertos. O resultado prático é exatamente o contrário do que a equipa julgava ter configurado.
OAI-AdsBot, o menos conhecido dos quatro
O OAI-AdsBot só visita páginas que um anunciante enviou explicitamente como destino de um anúncio no ChatGPT, para verificar que cumprem a política da OpenAI e para determinar quando mostrar esse anúncio. Não percorre o resto do teu site e os dados que recolhe não são usados para treinar os modelos generativos.
Se não tens anúncios ativos no ChatGPT, é o user-agent que menos precisas de ter em conta ao configurar o teu robots.txt.
Como configurar o teu robots.txt para o GPTBot
As regras escrevem-se como para qualquer outro rastreador, dirigidas especificamente ao user-agent que queiras controlar. Estes são os três padrões mais comuns.
Bloqueio total do treino, mantendo os restantes rastreadores sem alterações:
User-agent: GPTBot
Disallow: /
Permissão total, se queres que o teu conteúdo possa ser usado no treino de modelos futuros:
User-agent: GPTBot
Allow: /
Bloqueio parcial por diretório, um padrão comum em sites que querem proteger conteúdo premium ou pago mas manter visível o blog ou as páginas de marketing:
User-agent: GPTBot
Disallow: /premium/
Disallow: /conta/
Allow: /
Verificação pelo intervalo de IP publicado
O user-agent que um pedido declara é um campo que qualquer pessoa pode falsificar, por isso, se precisares de confirmar que uma visita é mesmo o GPTBot e não um scraper a fazer-se passar por ele, cruza o IP de origem com o intervalo que a OpenAI publica em openai.com/gptbot.json.
A OpenAI publica um ficheiro equivalente para cada um dos seus quatro user-agents, e é a forma mais fiável de auditar os teus logs quando o volume de tráfego de um rastreador te parece suspeito.
Quanto tempo demora a alteração a aplicar-se
A OpenAI indica que as alterações ao robots.txt podem demorar cerca de 24 horas a refletir-se nos seus sistemas, embora publique esse número especificamente para o OAI-SearchBot e os seus resultados de pesquisa.
Não há um prazo publicado de forma equivalente para o GPTBot, por isso, se acabaste de mudar a diretiva, o mais fiável é confirmar o efeito revendo os teus próprios logs de servidor nos dias seguintes, em vez de assumir um prazo fixo.
Quando o robots.txt diz que sim mas o firewall diz que não
Permitir o GPTBot no robots.txt não garante que o rastreador chegue ao teu conteúdo. O GPTBot não consegue resolver desafios de verificação do tipo CAPTCHA, por isso as regras por omissão de firewalls como a Cloudflare, a Akamai ou o AWS WAF podem devolver-lhe um 403 ou um 429 mesmo que o teu robots.txt o permita explicitamente.
É exatamente o tipo de discrepância que tratamos com mais detalhe em quando o robots.txt e o firewall não estão de acordo, e convém revê-la em conjunto com a configuração do GPTBot, não em separado.
Como verificar isto no teu próprio site
A coerência entre o que diz o teu robots.txt, o que o teu firewall permite e o que o teu servidor responde de facto é exatamente o tipo de discrepância que poucas equipas de marketing chegam a cruzar à mão, porque implica rever logs de WAF além do ficheiro de texto.
O diagnóstico da Parsigo verifica isto como parte do pilar de acesso, um dos três em que assenta a análise (acesso 45%, legibilidade 35%, estrutura 20%). O pilar de estrutura, por exemplo, revê aspetos como os dados estruturados que ajudam os rastreadores a interpretar o teu conteúdo.
Podes lançar o diagnóstico gratuito sobre o teu próprio domínio para ver se o GPTBot, o OAI-SearchBot e o ChatGPT-User estão a receber a resposta que julgas estar a dar-lhes. Não é uma promessa de que vais aparecer citado no ChatGPT, é uma verificação técnica da configuração real do teu site.
Se quiseres perceber a metodologia completa antes, podes ver como funciona a análise.
Perguntas frequentes sobre o GPTBot
Bloquear o GPTBot afeta o meu posicionamento no Google?
Não. O GPTBot é um rastreador da OpenAI, não tem relação com o algoritmo da Google nem com o Googlebot. Bloqueá-lo só afeta se o teu conteúdo pode ser usado para treinar futuros modelos da OpenAI.
O GPTBot e o ChatGPT-User são a mesma coisa?
Não. O GPTBot recolhe conteúdo para treinar modelos de forma automatizada. O ChatGPT-User visita uma página pontual porque um utilizador ou um Custom GPT lho pediu durante uma conversa, e a OpenAI assinala que, por ser uma ação iniciada pelo utilizador, as regras do robots.txt podem não se lhe aplicar da mesma forma.
O que acontece se não mencionar o GPTBot no meu robots.txt?
Se não houver nenhuma regra específica para o GPTBot, aplicam-se as regras gerais do teu ficheiro (as do user-agent *), e se também não existirem, o rastreador entende que tem permissão para aceder ao teu conteúdo para fins de treino.
Como verifico que um pedido do GPTBot é legítimo e não spoofing?
Cruza o IP de origem do pedido com o intervalo publicado pela OpenAI em openai.com/gptbot.json. O user-agent que um pedido declara falsifica-se com facilidade, o IP é a validação fiável.
Bloquear o GPTBot tira-me das respostas do ChatGPT?
Não. Quem decide se apareces nas respostas de pesquisa do ChatGPT é o OAI-SearchBot, um user-agent distinto e controlado de forma independente. O GPTBot só gere a permissão de treino.
O que rever no teu robots.txt antes de publicar
Antes de dares por fechada a tua configuração do GPTBot, verifica três coisas: que a decisão sobre o GPTBot é intencional e não um resto de um template genérico, que reviste também o OAI-SearchBot e o ChatGPT-User em separado porque não se controlam com a mesma regra, e que não há uma contradição silenciosa entre o que o teu robots.txt permite e o que o teu firewall deixa passar de facto.
Confirma-o no teu site
Saber se os sistemas de IA te conseguem ler demora uns segundos
Analisamos várias páginas do teu domínio e dizemos-te o que os rastreadores encontram. Grátis, sem registo.