Saltar al contenido

🤖 Analizador robots.txt

Solo ingresa un nombre de host para obtener /robots.txt y analizar las reglas Allow / Disallow por grupo User-agent, el Sitemap, Crawl-delay y el estado de permisos de los principales motores de búsqueda y crawlers de IA.

100% Gratis Sin registro Servidor Sin logs / BD Rate-limit 5 idiomas Modo oscuro

⚠️ Las solicitudes se realizan desde los servidores de DevLab. No se permiten direcciones IP privadas ni localhost.

📖 Qué te dice este diagnóstico

Este diagnóstico descarga /robots.txt, analiza su sintaxis y lista las reglas por grupo de user-agent, el estado de permisos de los principales rastreadores y bots de IA, y cada línea Sitemap:. Lo primero que hay que asimilar es que robots.txt controla el rastreo, no la indexación. Una página bloqueada puede seguir apareciendo en resultados como URL desnuda si otro sitio la enlaza.

Elemento Qué significa Cómo corregirlo
Usar Disallow para evitar la indexación Disallow sólo detiene el rastreo. Peor aún, noindex únicamente se ve leyendo la página, así que combinar Disallow con noindex hace que el noindex no se lea nunca. El aviso de Search Console sobre una página indexada aunque bloqueada por robots.txt describe justo esto. Para mantener algo fuera del índice, permítelo en robots.txt y devuelve <meta name="robots" content="noindex">, o una cabecera X-Robots-Tag: noindex si no es HTML. Lo que no debe verse en absoluto va detrás de autenticación (401 / 403), no de robots.txt: el fichero es público, así que listar una ruta secreta es una invitación.
Un grupo de user-agent no surte efecto Un rastreador obedece exactamente un grupo, el que coincide de forma más específica con su nombre, y no lo combina con el grupo User-agent: *. En cuanto añades un grupo Googlebot, Googlebot ignora todas las reglas bajo *. Que se caigan así las líneas Disallow comunes es un accidente muy frecuente. Cuando crees un grupo específico, copia también dentro las reglas comunes de *. A la inversa, si ningún bot necesita de verdad un trato distinto, dejarlo todo en un único grupo * es lo seguro. Cuando Allow y Disallow chocan, gana la ruta más larga, es decir, la más específica.
Los patrones de ruta no dicen lo que crees Las rutas se comparan como prefijo y distinguen mayúsculas. Disallow: /admin bloquea también /administrator/ y /admin-guide.html. Los únicos comodines son * para cualquier secuencia y $ para fin de URL; las expresiones regulares no se interpretan. Para apuntar sólo a un directorio, añade la barra final (Disallow: /admin/). Para filtrar por extensión, usa Disallow: /*.pdf$. Nunca bloquees CSS ni JavaScript: Google renderiza la página para evaluarla, así que bloquearlos hace que el diseño parezca roto y perjudica también la valoración móvil.

robots.txt es por host y por puerto. https://example.com/robots.txt y https://www.example.com/robots.txt son ficheros distintos, y cada subdominio necesita el suyo. El comportamiento ante fallos también está definido: un 404 significa todo permitido, mientras que un 5xx sostenido hace que Google trate el sitio entero como bloqueado durante un tiempo. Si tu modo mantenimiento devuelve 503, deja robots.txt fuera para que siga respondiendo 200.

🔗 Herramientas relacionadas