SEO Sémantique
Qu’est-ce que robots.txt ?
Fichier texte placé à la racine du site qui indique aux robots d’exploration quelles zones ne pas solliciter ou où trouver le sitemap — directives par user-agent, avec limites (pas un mécanisme de sécurité fort).
Définition simple
C'est comme une pancarte « personnel autorisé seulement » à l’entrée d’un hangar : les personnes honnêtes la respectent, mais ce n’est pas un coffre-fort. Le robots.txt utilise syntaxe `User-agent`, `Disallow`, `Allow`, `Sitemap`, parfois `Crawl-delay` (non standard universel). Il ne remplace pas l’authentification pour données sensibles ; Google peut ignorer des Disallow mal formés ou contradictoires.
Comment ça marche ?
Requête GET sur `https://domaine/robots.txt` ; parsing par bots ; combinaison avec directives meta robots et headers X-Robots-Tag page par page. Les URLs bloquées peuvent rester indexées si découvertes ailleurs sans crawl du contenu — d’où l’importance des complements noindex si nécessaire.
Impact business
Un robots.txt qui bloque accidentellement CSS/JS nécessaires au rendu ou tout le site (`Disallow: /`) peut faire chuter l’exploration et la compréhension des pages — incidents documentés de chutes de trafic massives après déploiement erroné. Bien utilisé, il réduit le crawl de facettes inutiles économisant ressources serveur et focus Googlebot sur l’utile.
Bonnes pratiques
- Versionner le fichier dans le dépôt ; tester avec Search Console ; documenter la raison de chaque Disallow ; surveiller après migration ou CDN ; ne pas y mettre de secrets.
Erreurs communes
- Bloquer des ressources critiques au rendu. Dupliquer des directives contradictoires. Oublier que chaque sous-domaine a son propre robots.txt.
Prompt IA
Écris un robots.txt minimal pour : autoriser tout sauf `/wp-admin/`, pointer deux sitemaps, et rappelle trois pièges fréquents (majuscules, chemins, sous-domaines).
SERVICE LIÉ
Passer de la définition à un projet concret.
Référencement naturel SEO
Approfondir ce sujet dans le cadre d’un accompagnement adapté à votre contexte.
À LIRE AUSSI
Guides plus complets sur le blog.
QUESTIONS FRÉQUENTES
Aller plus loin sur robots.txt.
Les directives les plus restrictives au niveau page s’appliquent après crawl possible ; robots.txt empêche le crawl mais pas toujours l’index si URL connue par ailleurs.
Insuffisant seul : préférer noindex ou suppression ; robots.txt évite surtout le crawl, pas la désindexation garantie.
Public par nature ; ne jamais y exposer chemins secrets — utiliser auth réelle.
