🤖 Generador robots.txt
Crea robots.txt para 20+ rastreadores principales (Googlebot, GPTBot, ClaudeBot, PerplexityBot) con Allow / Disallow, Crawl-delay, Sitemap y Host.
🔒 Sobre la privacidad
- ・Todo el procesamiento ocurre en tu navegador
- ・Sin envío al servidor
- ・Sin registro, sin inicio de sesión, sin pago
⚡ Preajustes
🤖 Rastreadores
📄 robots.txt
📖 Dónde se suele tropezar
Genera un robots.txt con reglas Allow y Disallow por rastreador, Crawl-delay, Sitemap y Host, con ajustes preestablecidos para rastreadores de IA. Todo se ejecuta en el navegador. Lo que robots.txt controla es si una página puede rastrearse, no si aparece en los resultados de búsqueda: confundir ambas cosas está detrás de prácticamente todos los malentendidos sobre este archivo.
| Caso | Qué ocurre | Qué hacer |
|---|---|---|
| Una página con Disallow sigue saliendo en los resultados | robots.txt detiene el rastreo, no la indexación. Si otro sitio enlaza la página, Google registra la URL sin llegar a leer el contenido, y el resultado en el listado es una URL desnuda donde debería ir el título, con una nota de que no hay información disponible por culpa de robots.txt. Así que lejos de ocultar nada, el Disallow deja en los resultados una URL sin nada detrás. Y como el contenido nunca se lee, tampoco se ve el noindex que hayas escrito. |
Para mantener algo fuera de los resultados, usa noindex: o bien <meta name="robots" content="noindex"> en el HTML o una cabecera X-Robots-Tag: noindex. Y no apliques además un Disallow a esa página en robots.txt: leer el noindex exige rastrear, así que usar ambos a la vez produce lo contrario de lo que pretendías. Lo mismo vale para eliminar una URL ya indexada: el orden correcto es levantar el Disallow, dejar que se lea el noindex, esperar a la retirada y sólo entonces volver a poner el Disallow. Lo que de verdad no debe verse va detrás de una autenticación: un esquema que publica algo y lo esconde sólo de los buscadores no es fiable por principio. |
| Las rutas del Disallow se vuelven un mapa para atacantes | Un robots.txt es un archivo público que cualquiera puede leer. Escribir Disallow: /admin/ o Disallow: /backup/ anuncia al mundo que ahí viven un panel de administración y unas copias de seguridad. Y como robots.txt es sólo una convención, un bot malicioso lo lee primero y va directo a esas rutas: los sitios que querías esconder se convierten en el punto de partida más eficiente para una exploración. Los escáneres de vulnerabilidades incorporan la descarga de robots.txt como primer paso justamente por eso. |
No nombres en robots.txt aquello que quieres proteger. Los paneles de administración, las copias de seguridad y las API internas van detrás de autenticación básica, una restricción por IP o una VPN, y esa es la única medida real: colócalos ahí y no habrá nada que escribir en robots.txt, porque un 401 ya detiene el rastreo. Si aun así quieres ofuscar una ruta, nombrar sólo el directorio padre en lugar de cada ruta concreta es una opción, pero es tranquilidad, no protección. La prueba es simple: si publicar esa ruta fuera un problema, no es tarea de robots.txt. |
| Bloquear CSS y JS empeora la evaluación de la página | Google evalúa una página renderizándola de verdad, es decir, cargando el CSS y el JavaScript igual que un navegador. Si sigue en pie una costumbre antigua como Disallow: /assets/ o Disallow: /wp-includes/, el renderizado falla y Google ve una página con la maquetación rota, o directamente sin contenido. Cuando el cuerpo se dibuja en el cliente, el cuerpo sencillamente no se ve. La evaluación de compatibilidad móvil tampoco pasa si el CSS no se puede leer. La naturaleza de este problema es que sólo lo detectas cuando las posiciones ya han caído. |
Permite siempre los recursos necesarios para renderizar. Comprobarlo es fácil: ejecuta Probar URL publicada en la inspección de URL de Search Console y mira la captura renderizada y la lista de recursos bloqueados; una pantalla en blanco o una página sin estilos es la respuesta. Si ya hay un Disallow amplio, puedes abrir huecos concretos con Allow: Allow: /assets/*.css y Allow: /assets/*.js después de Disallow: /assets/. En realidad, un sitio moderno casi nunca tiene motivo para bloquear recursos estáticos, así que ante la duda, permítelos. |
Un robots.txt sólo se respeta en la raíz de un dominio. example.com/blog/robots.txt se ignora por completo. Además, subdominios, protocolos y puertos cuentan como distintos, así que blog.example.com necesita su propio archivo, y en rigor http:// y https:// también son distintos. Sobre los rastreadores de IA: GPTBot, ClaudeBot, PerplexityBot y Google-Extended no son los rastreadores de búsqueda, así que bloquearlos no afecta a tus posiciones; bloquear Google-Extended deja a Googlebot rastreando igual que antes. Permitirlos o no es una decisión de negocio sin respuesta técnica correcta: permítelos si quieres tráfico que llegue a través de respuestas de IA. Ten en cuenta también que la lista de nombres de bots no para de crecer, así que lo que escribas hoy estará desfasado en seis meses: trata el archivo como algo que revisar, no como algo que escribir una vez. Si lo que quieres es señalar a la IA qué contenido merece la pena, eso es llms.txt, no robots.txt: cumplen funciones distintas.
📖 Cómo usar
-
1
Elige rastreadoresMarca los rastreadores y alterna Allow / Disallow.
-
2
Añade rutas y opcionesIntroduce rutas, Crawl-delay, Sitemap y Host.
-
3
Copia o descargaCopia el robots.txt o guárdalo.
❓ Preguntas frecuentes
¿Bloquear GPTBot afecta el SEO?
¿Por qué ignoran mi Disallow?
¿Dónde se coloca robots.txt?
🔗 Herramientas relacionadas
🐛 ¿Encontró un problema con esta herramienta?
Gratis, sin registro. Incluso solo los pasos para reproducir ayudan. Los informes van directamente al operador y se usan para corregir.
¡Gracias por tu reporte!
Tu reporte llegó al operador y se usará para mejorar.