Guías de robots.txt

Robots.txt para rastreadores de IA: búsqueda, entrenamiento y acceso

Configura robots.txt para rastreadores de IA sin confundir descubrimiento en búsqueda, controles de entrenamiento y noindex. Incluye ejemplos de OAI-SearchBot y GPTBot.

Por Robots.txt Tools Editorial TeamÚltima verificación 2026-09-134 min de lectura
Robots.txt para rastreadores de IA: búsqueda, entrenamiento y acceso

La forma más segura de gestionar rastreadores de IA es separar tres decisiones: si un bot puede rastrear una URL, si esa URL puede descubrirse en una experiencia de búsqueda o respuesta y si el contenido puede utilizarse para una finalidad de entrenamiento específica del proveedor. Una regla global de Disallow no sustituye esas decisiones.

OpenAI distingue actualmente OAI-SearchBot y GPTBot. Si un editor quiere que su contenido pueda descubrirse y aparecer en resúmenes o fragmentos de ChatGPT Search, OpenAI indica que no debe bloquear OAI-SearchBot. En cambio, GPTBot puede bloquearse cuando el editor no quiere que determinadas páginas entren en el ámbito de uso potencial para entrenamiento.

Define primero el resultado que buscas

ObjetivoEn robots.txtControl adicional
Mantener búsqueda tradicional y búsqueda con IANo bloquear el rastreador de búsqueda correspondienteMantener indexable la página si quieres que aparezca
Permitir búsqueda con IA y bloquear un crawler de entrenamientoSeparar los grupos User-agentRevisar la documentación actual del proveedor
Evitar que una página pública aparezca en resultadosNo depender solo de robots.txtPermitir el rastreo y servir noindex
Proteger contenido privadoNo usar robots.txt como seguridadExigir autenticación o autorización

robots.txt es una instrucción para crawlers que respetan el protocolo, no una barrera de acceso. Una URL bajo Disallow puede seguir siendo solicitada por software que ignore la norma.

Ejemplo: permitir ChatGPT Search y bloquear GPTBot

User-agent: OAI-SearchBot
Allow: /

User-agent: GPTBot
Disallow: /

User-agent: *
Allow: /

Sitemap: https://example.com/sitemap.xml

Lo importante es la separación de propósito. Los nombres y políticas de los rastreadores pueden cambiar, por lo que conviene comprobar siempre la fuente oficial antes de publicar.

Disallow no equivale a noindex

Disallow controla el rastreo. noindex controla la indexación en sistemas que soportan esa directiva. Si bloqueas una página en robots.txt, el crawler puede no llegar a leer el meta robots de esa página.

Una configuración conflictiva sería:

User-agent: OAI-SearchBot
Disallow: /vista-previa/

junto con:

<meta name="robots" content="noindex">

Si la página es pública pero no debe aparecer en resultados, normalmente es más coherente permitir que el crawler acceda y lea noindex. Si el contenido es privado, debe protegerse con autenticación.

Evita listas enormes de bots copiadas sin contexto

Las listas de decenas de rastreadores envejecen rápido y mezclan funciones diferentes: búsqueda, entrenamiento, recuperación iniciada por el usuario u otras funciones del proveedor. Además son difíciles de auditar.

Es preferible un conjunto pequeño de reglas con una razón clara para cada grupo:

# Permitir descubrimiento en ChatGPT Search
User-agent: OAI-SearchBot
Allow: /

# Preferencia separada sobre GPTBot
User-agent: GPTBot
Disallow: /

Combina la política de IA con la política normal del sitio

Permitir un crawler de IA no implica abrir carrito, cuenta o búsqueda interna.

User-agent: OAI-SearchBot
Disallow: /account/
Disallow: /cart/
Allow: /

User-agent: GPTBot
Disallow: /

User-agent: *
Disallow: /account/
Disallow: /cart/
Allow: /

Prueba URLs reales: cuando varias reglas coinciden, la especificidad importa más que el orden visual de las líneas.

Lista de comprobación antes de publicar

  • /robots.txt responde desde la raíz correcta del host;
  • las páginas importantes siguen abiertas a Googlebot y Bingbot;
  • los User-agent de IA proceden de documentación actual;
  • búsqueda y entrenamiento se controlan por separado cuando el proveedor lo permite;
  • las páginas con noindex siguen siendo rastreables por el sistema que debe leerlo;
  • los datos privados están protegidos con controles de acceso reales;
  • el sitemap contiene URLs públicas canónicas;
  • las reglas se validan y se prueban con URLs representativas.

Los cambios de robots.txt pueden quedar en caché. Tras publicar, revisa el archivo real, su estado HTTP, los logs del servidor y el tráfico referido. OpenAI indica que las referencias desde ChatGPT incluyen utm_source=chatgpt.com, útil para medir descubrimiento.

La política más mantenible es explícita: decide qué función de cada crawler quieres permitir, escribe el conjunto mínimo de reglas y vuelve a revisar periódicamente la documentación del proveedor.

Guías relacionadas