SEO Sémantique

Qu’est-ce que robots.txt ?

Fichier texte placé à la racine du site qui indique aux robots d’exploration quelles zones ne pas solliciter ou où trouver le sitemap — directives par user-agent, avec limites (pas un mécanisme de sécurité fort).

fichier robots

Définition simple

C'est comme une pancarte « personnel autorisé seulement » à l’entrée d’un hangar : les personnes honnêtes la respectent, mais ce n’est pas un coffre-fort. Le robots.txt utilise syntaxe `User-agent`, `Disallow`, `Allow`, `Sitemap`, parfois `Crawl-delay` (non standard universel). Il ne remplace pas l’authentification pour données sensibles ; Google peut ignorer des Disallow mal formés ou contradictoires.

Comment ça marche ?

Requête GET sur `https://domaine/robots.txt` ; parsing par bots ; combinaison avec directives meta robots et headers X-Robots-Tag page par page. Les URLs bloquées peuvent rester indexées si découvertes ailleurs sans crawl du contenu — d’où l’importance des complements noindex si nécessaire.

Impact business

Un robots.txt qui bloque accidentellement CSS/JS nécessaires au rendu ou tout le site (`Disallow: /`) peut faire chuter l’exploration et la compréhension des pages — incidents documentés de chutes de trafic massives après déploiement erroné. Bien utilisé, il réduit le crawl de facettes inutiles économisant ressources serveur et focus Googlebot sur l’utile.

Bonnes pratiques

  • Versionner le fichier dans le dépôt ; tester avec Search Console ; documenter la raison de chaque Disallow ; surveiller après migration ou CDN ; ne pas y mettre de secrets.

Erreurs communes

  • Bloquer des ressources critiques au rendu. Dupliquer des directives contradictoires. Oublier que chaque sous-domaine a son propre robots.txt.

Prompt IA

Écris un robots.txt minimal pour : autoriser tout sauf `/wp-admin/`, pointer deux sitemaps, et rappelle trois pièges fréquents (majuscules, chemins, sous-domaines).

QUESTIONS FRÉQUENTES

Aller plus loin sur robots.txt.

Les directives les plus restrictives au niveau page s’appliquent après crawl possible ; robots.txt empêche le crawl mais pas toujours l’index si URL connue par ailleurs.