guias
Robots.txt para rastreadores de IA: búsqueda, entrenamiento y acceso
¿Cómo permitir la búsqueda con IA sin aceptar todos los rastreadores de entrenamiento?
Leer guía →Herramienta gratuita de control de rastreadores
Crea un archivo robots.txt, detecta errores frecuentes mientras lo editas y después cópialo o descárgalo. El generador funciona en tu navegador y no requiere una cuenta.
El modo simple es más seguro para una configuración rápida. El editor avanzado muestra todos los grupos y reglas de rastreadores.
Empieza con una configuración neutral y aplica restricciones a rastreadores de IA solo cuando coincidan con tu política.
Valor neutral: mantén abiertos los rastreadores de búsqueda, búsqueda con IA y control de IA salvo que tus reglas de ruta los bloqueen explícitamente.
Empieza con una ruta sugerida o añade la tuya. Bloquea solo rutas que quieras que los rastreadores compatibles eviten intencionadamente.
Rutas sugeridas
Añade cualquier ruta del sitio. Las rutas sin barra inicial la reciben automáticamente; las URLs HTTP(S) completas se reducen a su ruta y consulta.
Búsqueda
Permitido de forma predeterminada
Búsqueda con IA
Permitido de forma predeterminada
Control / entrenamiento de IA
Permitido de forma predeterminada
Resultado en tiempo real; la generación y la validación permanecen en tu navegador.
User-agent: * No se detectaron advertencias de sintaxis o compatibilidad.
Crea directivas User-agent, Allow, Disallow y Sitemap sin tener que dar formato manual a cada línea.
Recibe avisos sobre bloqueos de todo el sitio, URLs de sitemap no válidas, directivas no estándar y errores habituales sobre indexación.
Pasa de la generación a la validación, la comprobación en vivo y las pruebas de URLs sin salir del sitio.
Empieza con un ajuste estándar, WordPress, Blogger o de preproducción y revisa después cada regla para tu propio sitio.
Introduce una ruta Allow o Disallow por línea e indica el grupo User-agent principal al que se aplican las reglas.
Los controles avanzados permiten crear grupos separados para rastreadores que deban comportarse de forma distinta a las reglas principales.
Usa una URL absoluta HTTP(S) para el sitemap, por ejemplo https://example.com/sitemap.xml.
Un archivo que parece válido todavía puede contener una regla peligrosa. Corrige los errores y revisa los avisos antes de publicarlo.
La ubicación estándar es /robots.txt, por ejemplo https://example.com/robots.txt.
robots.txt controla el acceso de los rastreadores. No es un sistema de autenticación, y bloquear el rastreo de una URL no garantiza que esa URL no pueda aparecer en los resultados de búsqueda.
La sección avanzada mantiene separados los tokens de cada rastreador. Por ejemplo, un proveedor puede documentar un rastreador para descubrimiento en búsqueda y otro token para desarrollo de modelos o controles de productos de IA. Crea una regla específica solo cuando quieras que ese rastreador se comporte de forma distinta al grupo User-agent principal.
Rastreadores tradicionales como Googlebot y Bingbot descubren y rastrean contenido para productos de búsqueda.
Algunos ejemplos son OAI-SearchBot, Claude-SearchBot y PerplexityBot. Revisa la documentación del proveedor antes de cambiar su acceso.
Tokens como GPTBot, ClaudeBot y Google-Extended tienen funciones específicas de cada proveedor y no deben tratarse como si fueran equivalentes.
Los ajustes de plataforma son puntos de partida editables, no buenas prácticas universales. Revisa las rutas que utiliza realmente tu sitio antes de publicarlos.
Genera un punto de partida orientado a WordPress y revisa wp-admin, admin-ajax, el sitemap y las reglas de rastreo.
Abrir herramienta →Crea un archivo orientado a Blogger y revisa el comportamiento de búsqueda, etiquetas y sitemap antes de activar reglas personalizadas.
Abrir herramienta →Usa una página específica cuando la tarea cambie de crear un archivo a validarlo, comprobarlo o probar sus reglas.
Pega las reglas y encuentra errores de sintaxis o avisos de compatibilidad.
Abrir herramienta →Obtén el robots.txt público de un sitio e inspecciona su respuesta HTTP y el comportamiento de sus reglas.
Abrir herramienta →Comprueba si una URL está permitida o bloqueada para un rastreador.
Abrir herramienta →Base de conocimientos
Guías prácticas sobre rastreo, indexación, alcance por host, sitemaps, parámetros de URL, caché y solución de problemas con robots.txt.
Consulta ejemplos prácticos para permitir rastreadores, bloquear rutas, añadir sitemaps, usar comodines y crear reglas específicas.
→Guías sobre rastreadores de IA, noindex, sitemaps, subdominios, parámetros de URL, caché, codificación y reglas robots.txt.
→Configuración y verificación de robots.txt en Shopify, Next.js, Wix, Squarespace, Webflow y Magento / Adobe Commerce.
→guias
¿Cómo permitir la búsqueda con IA sin aceptar todos los rastreadores de entrenamiento?
Leer guía →guias
¿Puede robots.txt impedir que una página se indexe y cuándo conviene usar noindex?
Leer guía →guias
¿Dónde añado Sitemap en robots.txt y cómo comprobamos varias referencias?
Leer guía →guias
¿Qué regla gana cuando varias reglas Allow y Disallow coinciden con la misma URL?
Leer guía →guias
¿El robots.txt del dominio principal se aplica a subdominios, HTTP, HTTPS o puertos distintos?
Leer guía →plataformas
¿Cómo configurar robots.txt en Next.js sin bloquear producción o publicar un sitemap de preview?
Leer guía →Las reglas y la orientación específica de cada rastreador se contrastan con estándares primarios y documentación de los proveedores, en lugar de copiarse de otras herramientas SEO.
Sintaxis del Protocolo de Exclusión de Robots, coincidencia, agrupación y comportamiento de codificación porcentual.
Comportamiento específico de robots.txt en Google y campos compatibles.
Propósitos y controles de los rastreadores OAI-SearchBot y GPTBot.
Comportamiento de ClaudeBot, Claude-SearchBot y Claude-User.
Comportamiento de indexación de PerplexityBot y cumplimiento de robots.txt.
Controles de Google-Extended para entrenamiento y fundamentación de Gemini.
En la raíz del host que controla, normalmente en /robots.txt.
Su función principal es controlar el rastreo. Si quieres evitar la indexación, utiliza el control de indexación adecuado en lugar de depender únicamente de Disallow.
Googlebot no admite la directiva Crawl-delay, por eso el validador muestra un aviso cuando aparece.
No de forma automática. Los distintos tokens pueden utilizarse para búsqueda, recuperación solicitada por el usuario, desarrollo de modelos u otros fines específicos del proveedor. Decide rastreador por rastreador y comprueba la documentación actual del proveedor.
Sí. La generación y la validación principales se realizan en el navegador y no requieren una cuenta.