Saltar al contenido

🤖 Probador robots.txt

Solo ingresa el contenido de robots.txt y la ruta URL objetivo para determinar si esa ruta está permitida para cada User-agent como Googlebot / GPTBot / ClaudeBot. Analiza correctamente las reglas Allow / Disallow / coincidencia más larga.

100% Gratis Sin registro Solo navegador 5 idiomas Modo oscuro

🤖 Todos los crawlers

🔗 Herramientas relacionadas

📖 Dónde se suele tropezar

Contrasta el contenido de robots.txt que pegues con una ruta de URL y decide el resultado con la regla de coincidencia mas larga sobre Allow y Disallow. Ademas muestra un veredicto conjunto para los rastreadores principales, como Googlebot, GPTBot y ClaudeBot. Todo se ejecuta en el navegador y no se conecta a tu sitio: para descargar y analizar el robots.txt realmente publicado, usa el analizador de robots.txt. Y, como premisa mas importante: este archivo controla el rastreo, no la indexacion. "Lo puse en Disallow y no sale de los resultados" es el comportamiento especificado.

Caso Qué ocurre Qué hacer
Disallow no significa que no se indexe Lo que dice Disallow es no vengas a descargar esto, no "no lo muestres en los resultados". Si hay enlaces externos apuntando a la URL, un buscador puede listarla sin haber mirado jamas el contenido: es ese estado en el que la descripcion se sustituye por un aviso de que no hay informacion disponible. Mas grave es el problema de orden: puedes poner noindex en una pagina, pero si esa pagina esta en Disallow el rastreador nunca podra leer ese noindex. Una instruccion que no se puede leer no se ejecuta. Con lo cual Disallow se convierte en la unica forma fiable de garantizar que tu noindex jamas surta efecto. Elige segun el objetivo. Para sacar algo de los resultados, permite el rastreo y devuelve un noindex: <meta name="robots" content="noindex"> en el HTML o la cabecera HTTP X-Robots-Tag: noindex (esta ultima para PDF e imagenes). Surte efecto cuando la pagina se vuelve a rastrear, asi que combinalo con la herramienta de eliminacion de Search Console si tienes prisa. Disallow, en cambio, es lo correcto cuando quieres reducir el rastreo en si: combinaciones infinitas de parametros de filtrado, resultados de busqueda interna, calendarios que se extienden hacia el futuro sin fin. Y ninguno de los dos protege nada confidencial. Pon autenticacion delante; todo lo demas es solo una peticion.
Un rastreador lee exactamente un grupo Esta es la parte peor entendida de la especificacion. Un rastreador selecciona exactamente un grupo, el que coincide con su nombre de forma mas especifica, e ignora por completo todos los demas, incluido User-agent: *. Las reglas no se combinan. Asi que si pones Disallow: /admin/ bajo User-agent: * y despues anades un grupo User-agent: Googlebot que solo contiene Allow: /, Googlebot ignora entero el grupo * y rastrea /admin/. Pretendias anadir una excepcion para un bot concreto y lo que hiciste fue levantar todas las restricciones que le aplicaban: ese accidente sale directamente de esta regla. En cuanto crees un grupo para un bot concreto, copia tambien en el todas las reglas comunes. La duplicacion no es redundante: bajo esta especificacion es obligatoria. Despues, comprueba siempre con el veredicto conjunto de esta pagina: evalua la misma ruta en una columna de rastreadores principales, de modo que cualquier bot cuya fila difiera es aquel al que olvidaste copiar la regla. Elegir las rutas de prueba tambien tiene su tecnica: si solo pruebas las URL que quieres bloquear, un archivo que por error diga Disallow: / para todo seguira pareciendo correcto. Incluye siempre al menos una URL que esperes que se permita: la portada o una pagina de articulo importante.
Las rutas casan por prefijo y solo * y $ son especiales El valor de Disallow se compara como una cadena desde el principio de la ruta de la URL, no como un nombre de directorio. Por eso Disallow: /admin bloquea no solo /admin/, sino tambien /administrator-guide y /admin-policy.html. Distingue mayusculas de minusculas: /Admin/ es otra cadena. Los unicos comodines son * (cualquier secuencia) y $ (fin de ruta); no hay expresiones regulares. Cuando apuntas a una extension, el $ es obligatorio, porque Disallow: /*.pdf tambien casa con /a.pdf?x=1 y con /a.pdf.html. Y el error mas caro es de un solo caracter: Disallow: sin nada detras significa permitirlo todo, mientras que Disallow: / significa bloquearlo todo. Si te refieres a un directorio, escribe siempre la barra final (Disallow: /admin/). Y luego prueba ambas formas en esta pagina: evalua /admin/ y /admin-tools/ y veras al momento si la regla alcanza mas de lo que pretendias. La cadena de consulta forma parte de lo que se compara, asi que, si quieres frenar las URL facetadas, prueba la forma que usas de verdad, como Disallow: /*?. Y antes de publicar, pega aqui el robots.txt de produccion completo y confirma que la portada sale como Allow: ese unico paso evita todos los casos de enviar a produccion el Disallow: / del entorno de pruebas.

robots.txt se aplica por origen. Si difiere el esquema, el nombre de host o el puerto, es otro archivo: https://example.com/robots.txt no se aplica a http://, ni a www.example.com, ni a blog.example.com. Vive en la raiz y en ningun otro sitio; una copia en un subdirectorio no se lee jamas. Sobre la sintaxis: Google ignora Crawl-delay (para frenarlo, ajusta la frecuencia en Search Console). Sitemap: es la unica excepcion que no pertenece a ningun grupo y vale en cualquier punto del archivo. Y por ultimo, esto no es un mecanismo de obligado cumplimiento. Obedecerlo es opcional para el rastreador, y un bot malicioso lo leera y lo ignorara. Peor aun: el archivo publica la lista de rutas que preferirias ocultar; escribir Disallow: /secret-admin/ equivale a anunciar que ahi hay un panel de administracion. No pongas en robots.txt nada que quieras mantener en secreto.

📖 Cómo usar

  1. 1
    Pega el contenido de robots.txt
    Pega el robots.txt en el panel izquierdo.
  2. 2
    Ingresa la ruta y el User-agent
    Ingresa la ruta y selecciona el User-agent.
  3. 3
    Revisa el resultado y la tabla de crawlers
    Se muestra el veredicto y la regla aplicada.

❓ Preguntas frecuentes

¿Qué pasa con Disallow: / y Allow: /?
Google usa la regla del mayor match; en empate, Allow gana.
¿Se analiza la directiva Sitemap?
Solo evalua Allow/Disallow; Sitemap y Crawl-delay se ignoran.
¿El User-agent distingue mayusculas?
Este tool no distingue mayusculas, igual que Google.
🐛 ¿Encontró un problema con esta herramienta?

Gratis, sin registro. Incluso solo los pasos para reproducir ayudan. Los informes van directamente al operador y se usan para corregir.

* Se envía automáticamente la info del navegador (UA / pantalla / idioma / URL) para reproducir