La forma más segura de gestionar rastreadores de IA es separar tres decisiones: si un bot puede rastrear una URL, si esa URL puede descubrirse en una experiencia de búsqueda o respuesta y si el contenido puede utilizarse para una finalidad de entrenamiento específica del proveedor. Una regla global de Disallow no sustituye esas decisiones.
OpenAI distingue actualmente OAI-SearchBot y GPTBot. Si un editor quiere que su contenido pueda descubrirse y aparecer en resúmenes o fragmentos de ChatGPT Search, OpenAI indica que no debe bloquear OAI-SearchBot. En cambio, GPTBot puede bloquearse cuando el editor no quiere que determinadas páginas entren en el ámbito de uso potencial para entrenamiento.
Define primero el resultado que buscas
| Objetivo | En robots.txt | Control adicional |
|---|---|---|
| Mantener búsqueda tradicional y búsqueda con IA | No bloquear el rastreador de búsqueda correspondiente | Mantener indexable la página si quieres que aparezca |
| Permitir búsqueda con IA y bloquear un crawler de entrenamiento | Separar los grupos User-agent | Revisar la documentación actual del proveedor |
| Evitar que una página pública aparezca en resultados | No depender solo de robots.txt | Permitir el rastreo y servir noindex |
| Proteger contenido privado | No usar robots.txt como seguridad | Exigir autenticación o autorización |
robots.txt es una instrucción para crawlers que respetan el protocolo, no una barrera de acceso. Una URL bajo Disallow puede seguir siendo solicitada por software que ignore la norma.
Ejemplo: permitir ChatGPT Search y bloquear GPTBot
User-agent: OAI-SearchBot
Allow: /
User-agent: GPTBot
Disallow: /
User-agent: *
Allow: /
Sitemap: https://example.com/sitemap.xml
Lo importante es la separación de propósito. Los nombres y políticas de los rastreadores pueden cambiar, por lo que conviene comprobar siempre la fuente oficial antes de publicar.
Disallow no equivale a noindex
Disallow controla el rastreo. noindex controla la indexación en sistemas que soportan esa directiva. Si bloqueas una página en robots.txt, el crawler puede no llegar a leer el meta robots de esa página.
Una configuración conflictiva sería:
User-agent: OAI-SearchBot
Disallow: /vista-previa/
junto con:
<meta name="robots" content="noindex">
Si la página es pública pero no debe aparecer en resultados, normalmente es más coherente permitir que el crawler acceda y lea noindex. Si el contenido es privado, debe protegerse con autenticación.
Evita listas enormes de bots copiadas sin contexto
Las listas de decenas de rastreadores envejecen rápido y mezclan funciones diferentes: búsqueda, entrenamiento, recuperación iniciada por el usuario u otras funciones del proveedor. Además son difíciles de auditar.
Es preferible un conjunto pequeño de reglas con una razón clara para cada grupo:
# Permitir descubrimiento en ChatGPT Search
User-agent: OAI-SearchBot
Allow: /
# Preferencia separada sobre GPTBot
User-agent: GPTBot
Disallow: /
Combina la política de IA con la política normal del sitio
Permitir un crawler de IA no implica abrir carrito, cuenta o búsqueda interna.
User-agent: OAI-SearchBot
Disallow: /account/
Disallow: /cart/
Allow: /
User-agent: GPTBot
Disallow: /
User-agent: *
Disallow: /account/
Disallow: /cart/
Allow: /
Prueba URLs reales: cuando varias reglas coinciden, la especificidad importa más que el orden visual de las líneas.
Lista de comprobación antes de publicar
/robots.txtresponde desde la raíz correcta del host;- las páginas importantes siguen abiertas a Googlebot y Bingbot;
- los User-agent de IA proceden de documentación actual;
- búsqueda y entrenamiento se controlan por separado cuando el proveedor lo permite;
- las páginas con
noindexsiguen siendo rastreables por el sistema que debe leerlo; - los datos privados están protegidos con controles de acceso reales;
- el sitemap contiene URLs públicas canónicas;
- las reglas se validan y se prueban con URLs representativas.
Los cambios de robots.txt pueden quedar en caché. Tras publicar, revisa el archivo real, su estado HTTP, los logs del servidor y el tráfico referido. OpenAI indica que las referencias desde ChatGPT incluyen utm_source=chatgpt.com, útil para medir descubrimiento.
La política más mantenible es explícita: decide qué función de cada crawler quieres permitir, escribe el conjunto mínimo de reglas y vuelve a revisar periódicamente la documentación del proveedor.