GPTBot: qué es y cómo configurarlo en tu robots.txt
GPTBot es el rastreador de OpenAI que entrena sus modelos de IA generativa. Te explicamos cómo diferenciarlo de OAI-SearchBot y configurar tu robots.txt.
En este artículo
- Qué es GPTBot y para qué lo usa OpenAI
- La cadena de user-agent y por qué puede cambiar
- GPTBot no es el único rastreador de OpenAI
- Por qué bloquear solo GPTBot no te saca de ChatGPT
- OAI-AdsBot, el menos conocido de los cuatro
- Cómo configurar tu robots.txt para GPTBot
- Verificación por rango de IP publicado
- Cuánto tarda en aplicarse el cambio
- Cuando el robots.txt dice que sí pero el firewall dice que no
- Cómo comprobar esto en tu propia web
- Preguntas frecuentes sobre GPTBot
- Qué revisar en tu robots.txt antes de publicar
Abres tu robots.txt para revisar qué rastreadores tienes bloqueados y te encuentras con una línea que dice User-agent: GPTBot. No recuerdas si la pusiste tú, si venía de una plantilla o si alguien del equipo la añadió hace meses sin explicar por qué. Y la duda que sigue es siempre la misma: ¿esto te saca de ChatGPT o solo bloquea el entrenamiento de sus modelos?
GPTBot es el rastreador que usa OpenAI para recopilar contenido con el que entrenar sus modelos de IA generativa, y es solo uno de los cuatro user-agents distintos que opera la compañía, cada uno con una función diferente y un control independiente en robots.txt. Confundirlos entre sí es el error más habitual que nos encontramos al revisar configuraciones de rastreo.
En este artículo vas a encontrar qué hace exactamente GPTBot y qué no hace, en qué se diferencia de OAI-SearchBot, ChatGPT-User y OAI-AdsBot, cómo escribir las reglas correctas en tu robots.txt según lo que quieras permitir o bloquear, y por qué a veces el robots.txt dice que sí y el rastreador sigue sin poder entrar.
Qué es GPTBot y para qué lo usa OpenAI
GPTBot es el rastreador que OpenAI utiliza para recopilar contenido públicamente accesible que puede usarse en el entrenamiento de sus modelos de IA generativa. Cuando desautorizas a GPTBot en tu robots.txt, le estás indicando a OpenAI que el contenido de tu sitio no debe emplearse para entrenar futuras versiones de sus modelos.
Es importante entender el alcance real de esa decisión: bloquear GPTBot afecta al entrenamiento de modelos futuros, no existe ningún mecanismo público para retirar contenido de modelos que ya se entrenaron con rastreos anteriores. Es una decisión que actúa hacia delante, no hacia atrás, y conviene tenerlo claro antes de tratarla como un interruptor de «salir de la IA».
La cadena de user-agent y por qué puede cambiar
GPTBot se identifica con una cadena de user-agent que incluye un número de versión, por ejemplo GPTBot/1.4. OpenAI advierte de forma explícita que ese número puede cambiar sin previo aviso, así que cualquier regla de firewall o de detección que dependa de una versión concreta escrita a mano es frágil por diseño.
Lo fiable es filtrar por el nombre del agente y, si necesitas verificación adicional, por el rango de IP publicado (lo vemos más abajo).
GPTBot no es el único rastreador de OpenAI
OpenAI documenta oficialmente cuatro user-agents distintos, y cada uno se controla de forma independiente en robots.txt. Si solo conoces GPTBot, es fácil dar por hecho que bloquearlo resuelve toda tu relación con ChatGPT, y no es así.
| User-agent | Para qué lo usa OpenAI | ¿Entrena modelos? | ¿Se rige por robots.txt? |
|---|---|---|---|
| GPTBot | Recopila contenido para el entrenamiento de futuros modelos | Sí | Sí |
| OAI-SearchBot | Indexa contenido para las funciones de búsqueda dentro de ChatGPT | No | Sí |
| ChatGPT-User | Visita una página cuando un usuario o un Custom GPT lo pide durante una conversación | No | No necesariamente, al ser una acción iniciada por el usuario |
| OAI-AdsBot | Valida el cumplimiento de política de páginas enviadas como anuncios en ChatGPT | No | Aplica solo a páginas de anuncios enviadas, no al resto del sitio |
Por qué bloquear solo GPTBot no te saca de ChatGPT
Quien decide si tu contenido puede aparecer citado en las respuestas de búsqueda de ChatGPT es OAI-SearchBot, no GPTBot. Si desautorizas a OAI-SearchBot, tu sitio no aparecerá en las respuestas de búsqueda de ChatGPT, aunque puede seguir apareciendo como enlace de navegación en otros contextos.
Son dos decisiones distintas: una es sobre entrenamiento, la otra es sobre visibilidad, y OpenAI las trata como configuraciones independientes precisamente para que puedas separarlas.
Apunte editorial: en las configuraciones que solemos revisar es habitual encontrar un robots.txt que bloquea GPTBot pensando que así se resuelve «el problema de la IA», mientras OAI-SearchBot y ChatGPT-User quedan completamente abiertos. El resultado práctico es justo el contrario de lo que el equipo creía haber configurado.
OAI-AdsBot, el menos conocido de los cuatro
OAI-AdsBot solo visita páginas que un anunciante ha enviado explícitamente como destino de un anuncio en ChatGPT, para comprobar que cumplen la política de OpenAI y para determinar cuándo mostrar ese anuncio. No recorre el resto de tu sitio y los datos que recopila no se usan para entrenar los modelos generativos.
Si no tienes anuncios activos en ChatGPT, es el user-agent que menos necesitas tener en cuenta al configurar tu robots.txt.
Cómo configurar tu robots.txt para GPTBot
Las reglas se escriben igual que para cualquier otro rastreador, dirigidas específicamente al user-agent que quieras controlar. Estos son los tres patrones más habituales.
Bloqueo total del entrenamiento, manteniendo el resto de rastreadores sin cambios:
User-agent: GPTBot
Disallow: /
Permiso total, si quieres que tu contenido pueda usarse en el entrenamiento de futuros modelos:
User-agent: GPTBot
Allow: /
Bloqueo parcial por directorio, un patrón habitual en sitios que quieren proteger contenido premium o de pago pero mantener visible el blog o las páginas de marketing:
User-agent: GPTBot
Disallow: /premium/
Disallow: /cuenta/
Allow: /
Verificación por rango de IP publicado
El user-agent que declara una petición es un campo que cualquiera puede falsear, así que si necesitas confirmar que una visita es realmente GPTBot y no un scraper haciéndose pasar por él, contrasta la IP de origen contra el rango que OpenAI publica en openai.com/gptbot.json.
OpenAI publica un archivo equivalente para cada uno de sus cuatro user-agents, y es la forma más fiable de auditar tus logs cuando el volumen de tráfico de un rastreador te resulta sospechoso.
Cuánto tarda en aplicarse el cambio
OpenAI indica que los cambios de robots.txt pueden tardar aproximadamente 24 horas en reflejarse en sus sistemas, aunque esa cifra la publica específicamente para OAI-SearchBot y sus resultados de búsqueda.
No hay un plazo publicado de forma equivalente para GPTBot, así que si acabas de cambiar la directiva, lo más fiable es confirmar el efecto revisando tus propios logs de servidor en los días siguientes en lugar de asumir un plazo fijo.
Cuando el robots.txt dice que sí pero el firewall dice que no
Permitir a GPTBot en robots.txt no garantiza que el rastreador llegue a tu contenido. GPTBot no puede resolver retos de verificación tipo CAPTCHA, así que las reglas por defecto de firewalls como Cloudflare, Akamai o AWS WAF pueden devolverle un 403 o un 429 aunque tu robots.txt lo permita explícitamente.
Es exactamente el tipo de discrepancia que tratamos con más detalle en cuando el robots.txt y el firewall no están de acuerdo, y conviene revisarla junto con la configuración de GPTBot, no por separado.
Cómo comprobar esto en tu propia web
La coherencia entre lo que dice tu robots.txt, lo que permite tu firewall y lo que responde realmente tu servidor es exactamente el tipo de discrepancia que pocos equipos de marketing llegan a cruzar a mano, porque implica revisar logs de WAF además del archivo de texto.
El diagnóstico de Parsigo comprueba esto como parte del pilar de acceso, uno de los tres en los que se basa el análisis (acceso 45%, legibilidad 35%, estructura 20%). El pilar de estructura, por ejemplo, revisa aspectos como los datos estructurados que ayudan a los rastreadores a interpretar tu contenido.
Puedes lanzar el diagnóstico gratuito sobre tu propio dominio para ver si GPTBot, OAI-SearchBot y ChatGPT-User están recibiendo la respuesta que crees que les estás dando. No es una promesa de que vayas a aparecer citado en ChatGPT, es una comprobación técnica de la configuración real de tu sitio.
Si quieres entender la metodología completa antes, puedes revisar cómo funciona el análisis.
Preguntas frecuentes sobre GPTBot
¿Bloquear GPTBot afecta a mi posicionamiento en Google?
No. GPTBot es un rastreador de OpenAI, no tiene relación con el algoritmo de Google ni con Googlebot. Bloquearlo solo afecta a si tu contenido puede usarse para entrenar futuros modelos de OpenAI.
¿GPTBot y ChatGPT-User son lo mismo?
No. GPTBot recopila contenido para entrenar modelos de forma automatizada. ChatGPT-User visita una página puntual porque un usuario o un Custom GPT se lo ha pedido durante una conversación, y OpenAI señala que, al ser una acción iniciada por el usuario, las reglas de robots.txt pueden no aplicarle del mismo modo.
¿Qué pasa si no menciono GPTBot en mi robots.txt?
Si no hay ninguna regla específica para GPTBot, se aplican las reglas generales de tu archivo (las del user-agent *), y si tampoco existen, el rastreador entiende que tiene permiso para acceder a tu contenido con fines de entrenamiento.
¿Cómo verifico que una petición de GPTBot es legítima y no un spoofing?
Contrasta la IP de origen de la petición contra el rango publicado por OpenAI en openai.com/gptbot.json. El user-agent que declara una petición se puede falsear con facilidad, la IP es la validación fiable.
¿Bloquear GPTBot me saca de las respuestas de ChatGPT?
No. Quien decide si apareces en las respuestas de búsqueda de ChatGPT es OAI-SearchBot, un user-agent distinto y controlado de forma independiente. GPTBot solo gestiona el permiso de entrenamiento.
Qué revisar en tu robots.txt antes de publicar
Antes de dar por cerrada tu configuración de GPTBot, comprueba tres cosas: que la decisión sobre GPTBot es intencionada y no un resto de una plantilla genérica, que has revisado también OAI-SearchBot y ChatGPT-User por separado porque no se controlan con la misma regla, y que no hay una contradicción silenciosa entre lo que permite tu robots.txt y lo que realmente deja pasar tu firewall.
Compruébalo en tu web
Saber si los sistemas de IA pueden leerte tarda unos segundos
Analizamos varias páginas de tu dominio y te decimos qué encuentran los rastreadores. Gratis, sin registro.