Créez un robots.txt valide avec des préréglages, des règles personnalisées, le blocage des robots d'IA et votre ligne sitemap.
robots.txt est un fichier texte brut placé à la racine d'un domaine, qui indique aux robots d'exploration quels chemins ils peuvent demander. Il suit le Robots Exclusion Protocol, normalisé par la RFC 9309, et sa structure est simple : des groupes commençant par une ou plusieurs lignes User-agent suivies de règles Disallow et Allow, plus des lignes Sitemap autonomes qui s'appliquent à tout le fichier. Les chemins sont comparés par préfixe, * représente n'importe quelle suite de caractères et $ ancre la fin d'une URL, si bien que /*.pdf$ bloque tous les PDF. Un « Disallow: » vide est la façon canonique de dire « explorez tout ».
Ce générateur écrit cette syntaxe pour vous et nettoie la saisie au passage : chaque chemin reçoit une barre oblique initiale si vous l'avez oubliée, les lignes commençant par # sont conservées comme commentaires, une liste de règles vide devient le groupe canonique qui autorise tout, et le délai d'exploration n'est écrit que s'il s'agit d'un nombre positif. L'option des robots d'IA ajoute un groupe distinct listant GPTBot, ChatGPT-User, OAI-SearchBot, CCBot, anthropic-ai, ClaudeBot, Claude-Web, Google-Extended, PerplexityBot, Applebot-Extended, Bytespider, Amazonbot, Meta-ExternalAgent et cohere-ai sous un unique Disallow: /, ce qui permet de refuser l'entraînement d'IA et l'exploration par les moteurs de réponse sans toucher à Googlebot. La ligne Sitemap est validée comme une URL absolue, car les chemins de sitemap relatifs sont ignorés par les moteurs de recherche.
Deux limites honnêtes méritent d'être rappelées. D'abord, robots.txt est une demande, pas un mur : les robots bien élevés le respectent, les scrapers l'ignorent, et tout ce que vous y listez est publiquement lisible — ne vous en servez jamais pour cacher des chemins sensibles. Ensuite, interdire une URL empêche l'exploration, pas l'indexation ; une page bloquée vers laquelle d'autres sites pointent peut malgré tout apparaître dans les résultats, sans description — utilisez donc une balise meta noindex sur la page elle-même quand vous voulez la sortir de l'index. Le fichier est généré entièrement dans votre navigateur et téléchargé localement : rien concernant votre site n'est envoyé ici.
User-agent:
À la racine du domaine, accessible sur https://votresite.com/robots.txt. Les robots ne regardent que là — un fichier dans un sous-dossier est ignoré, et chaque sous-domaine a besoin du sien.
Non. Cela empêche l'exploration de la page, mais une URL bloquée peut tout de même être indexée à partir de liens externes. Pour tenir une page hors des résultats, autorisez l'exploration et ajoutez une balise meta noindex à la page.
Certains oui, d'autres non. OpenAI, Google et Anthropic documentent leurs user-agents et respectent le fichier ; beaucoup de scrapers l'ignorent totalement. Bloquer est un signal clair, pas une contrainte.
Non — Googlebot ignore cette directive et ajuste lui-même son rythme, tandis que Bing et Yandex la lisent. Utilisez la Search Console si vous devez ralentir Google.
Non. Bloquer les fichiers CSS ou JS empêche les moteurs de recherche d'afficher vos pages telles que les voient les utilisateurs, ce qui peut nuire au classement, et le sitemap doit rester accessible.
Non. Le fichier est assemblé par du JavaScript sur votre appareil et enregistré directement dans votre dossier de téléchargements.
Vai.la transforme n'importe quelle URL en lien court avec statistiques de clics, QR Code et votre propre biolink.
Vai.la n'est pas responsable de l'utilisation des outils ni des décisions prises sur la base de leurs résultats.