Crea un robots.txt válido con plantillas, reglas personalizadas, bloqueo de rastreadores de IA y tu línea de sitemap.
robots.txt es un archivo de texto plano en la raíz de un dominio que indica a los rastreadores automáticos qué rutas pueden solicitar. Sigue el Robots Exclusion Protocol, estandarizado como RFC 9309, y su estructura es sencilla: grupos que empiezan con una o más líneas User-agent seguidas de reglas Disallow y Allow, además de líneas Sitemap independientes que se aplican a todo el archivo. Las rutas se comparan por prefijo, * representa cualquier secuencia de caracteres y $ ancla el final de una URL, así que /*.pdf$ bloquea todos los PDF. Un "Disallow:" vacío es la forma canónica de decir "rastrea lo que quieras".
Este generador escribe esa sintaxis por ti y limpia la entrada por el camino: cada ruta recibe la barra inicial si la has olvidado, las líneas que empiezan por # se conservan como comentarios, una lista de reglas vacía se convierte en el grupo canónico de permitir todo y el retardo de rastreo solo se escribe cuando es un número positivo. La opción de rastreadores de IA añade un grupo aparte con GPTBot, ChatGPT-User, OAI-SearchBot, CCBot, anthropic-ai, ClaudeBot, Claude-Web, Google-Extended, PerplexityBot, Applebot-Extended, Bytespider, Amazonbot, Meta-ExternalAgent y cohere-ai bajo un único Disallow: /, que es la forma de excluirte del entrenamiento de IA y del rastreo de los motores de respuesta sin tocar a Googlebot. La línea Sitemap se valida como URL absoluta, porque los buscadores ignoran las rutas de sitemap relativas.
Conviene repetir dos límites honestos. Primero, robots.txt es una petición, no un muro: los rastreadores educados lo respetan, los scrapers lo ignoran y todo lo que aparece ahí es de lectura pública — nunca lo uses para esconder rutas sensibles. Segundo, prohibir una URL detiene el rastreo, no la indexación; una página bloqueada a la que enlazan otros sitios puede seguir apareciendo en los resultados sin descripción, así que usa una metaetiqueta noindex en la propia página cuando quieras sacarla del índice. El archivo se genera íntegramente en tu navegador y se descarga en local: aquí no se sube nada sobre tu sitio.
User-agent:
En la raíz del dominio, accesible en https://tusitio.com/robots.txt. Los rastreadores solo miran ahí: un archivo en una subcarpeta se ignora, y cada subdominio necesita el suyo.
No. Impide que la página se rastree, pero una URL bloqueada puede seguir indexándose a partir de enlaces externos. Para mantener una página fuera de los resultados, permite su rastreo y añádele una metaetiqueta noindex.
Algunos sí y otros no. OpenAI, Google y Anthropic documentan sus user-agents y respetan el archivo; muchos scrapers lo ignoran por completo. Bloquear es una señal clara, no una imposición.
No: Googlebot ignora la directiva y ajusta su propio ritmo, aunque Bing y Yandex sí la leen. Usa Search Console si necesitas frenar a Google.
No. Bloquear archivos CSS o JS impide que los buscadores rendericen tus páginas tal como las ven los usuarios, lo que puede perjudicar tu posicionamiento, y el sitemap tiene que seguir siendo accesible.
No. El archivo lo monta JavaScript en tu dispositivo y se guarda directamente en tu carpeta de descargas.
Vai.la convierte cualquier URL en un enlace corto con estadísticas de clics, código QR y tu propio biolink.
Vai.la no se hace responsable del uso de las herramientas ni de las decisiones tomadas a partir de sus resultados.