Webmarketing & Entrepreneuriat — le média des créateurs digitaux
Actus
Google SGE change tout au SEO LinkedIn dépasse le milliard d'utilisateurs L'IA au service des entrepreneurs en 2026 Les micro-SaaS explosent cette année Nouveau guide : lancer son auto-entreprise ChatGPT s'impose comme outil de prospection Google SGE change tout au SEO LinkedIn dépasse le milliard d'utilisateurs L'IA au service des entrepreneurs en 2026 Les micro-SaaS explosent cette année Nouveau guide : lancer son auto-entreprise ChatGPT s'impose comme outil de prospection

Fichier robots.txt : bien le configurer sans bloquer son site

Il ne pèse que quelques lignes, la plupart des visiteurs ignorent son existence, et pourtant il peut rendre un site entier invisible dans Google. Le fichier robots.txt fait partie de ces petits éléments techniques que l’on règle une fois, puis que l’on oublie. C’est justement ce qui le rend dangereux : une seule ligne mal écrite, héritée d’une version de test ou copiée sans la comprendre, suffit à empêcher les moteurs d’explorer vos pages. Bien configuré, en revanche, il aide les robots à se concentrer sur l’essentiel. Voici comment le lire, l’écrire et le vérifier sans prendre de risque.

Qu’est-ce que le fichier robots.txt ?

Le robots.txt est un simple fichier texte placé à la racine d’un site, par exemple à l’adresse https://www.exemple.fr/robots.txt. Il s’adresse aux robots d’exploration, comme Googlebot ou Bingbot, et leur indique quelles parties du site ils peuvent parcourir et lesquelles ils doivent éviter. Ce mécanisme, apparu au milieu des années 1990, a été officiellement normalisé en 2022 sous le nom de Robots Exclusion Protocol.

Trois points sont à connaître d’emblée. D’abord, le fichier ne vaut que pour l’hôte sur lequel il se trouve : un sous-domaine comme boutique.exemple.fr doit avoir le sien. Ensuite, il est public : n’importe qui peut le consulter. Enfin, il repose sur la bonne volonté des robots : les grands moteurs le respectent, mais un robot malveillant peut l’ignorer. Ce n’est donc en aucun cas un outil de sécurité. Pour une présentation détaillée de ses usages, vous pouvez vous référer à ce guide pratique sur le fichier robots.txt.

La syntaxe de base

Le fichier se compose de groupes de règles. Chaque groupe commence par la désignation d’un ou plusieurs robots, suivie des consignes qui les concernent. Les lignes commençant par un dièse (#) sont des commentaires, ignorés par les robots mais très utiles pour documenter vos choix.

User-agent : à qui s’adresse la règle

La ligne User-agent désigne le robot visé. « User-agent: Googlebot » ne concerne que le robot de Google, tandis que « User-agent: * » s’applique à tous les robots qui n’ont pas de groupe spécifique. Attention : un robot qui trouve un groupe à son nom suit uniquement ce groupe et ignore les règles générales. Si vous créez un groupe pour Googlebot, pensez à y répéter les interdictions communes.

Disallow et Allow : interdire et autoriser

La directive Disallow interdit l’exploration d’un chemin, Allow l’autorise. Les chemins sont sensibles à la casse et fonctionnent par préfixe : « Disallow: /admin » bloque /admin/, mais aussi /administration-des-ventes/. Google et Bing acceptent deux caractères spéciaux : l’astérisque, qui remplace n’importe quelle suite de caractères, et le dollar, qui marque la fin d’une adresse. Lorsque deux règles se contredisent, Google applique la plus précise, c’est-à-dire celle dont le chemin est le plus long ; en cas d’égalité, il retient la moins restrictive.

Sitemap : indiquer le plan du site

La ligne Sitemap, suivie de l’adresse complète de votre sitemap XML, n’est rattachée à aucun groupe. Elle permet à tous les robots de trouver facilement la liste de vos pages. Vous pouvez en déclarer plusieurs si votre site en utilise plusieurs.

Des exemples concrets pour bien démarrer

Prenons une petite boutique en ligne de thés et d’infusions. Son responsable souhaite éviter que les robots perdent du temps sur le panier, l’espace client et les pages de résultats de recherche interne, qui n’ont aucun intérêt dans Google. Son fichier pourrait se présenter ainsi, ligne par ligne :

  • User-agent: *
  • Disallow: /panier/
  • Disallow: /mon-compte/
  • Disallow: /recherche/
  • Disallow: /*?tri=
  • Sitemap: https://www.boutique-exemple.fr/sitemap.xml

La cinquième ligne bloque toutes les adresses contenant le paramètre de tri, qui génèrent des variantes presque identiques des pages de catégories. Tout le reste du site demeure accessible, puisque rien d’autre n’est interdit.

Sur WordPress, le fichier virtuel créé par défaut contient généralement une interdiction de /wp-admin/, assortie d’une autorisation pour le fichier admin-ajax.php, dont certaines fonctionnalités publiques ont besoin. Pour un site vitrine d’artisan ou le blog d’une association, ce réglage minimal suffit souvent. N’ajoutez des règles que si vous avez une raison précise de le faire.

Robots.txt ou noindex : ne pas confondre

C’est la confusion la plus répandue. Le robots.txt empêche l’exploration, pas l’indexation. Si une page bloquée reçoit des liens depuis d’autres pages, Google peut tout à fait l’afficher dans ses résultats, généralement sans description puisqu’il n’a pas pu lire son contenu. Bloquer une page dans le robots.txt n’est donc pas le bon moyen de la faire disparaître de Google.

Pour qu’une page ne soit pas indexée, il faut utiliser la balise meta robots « noindex » ou son équivalent dans l’en-tête HTTP. Et c’est là que le piège se referme : pour lire cette balise, Google doit pouvoir explorer la page. Si vous combinez un noindex et un blocage dans le robots.txt, le robot ne verra jamais votre consigne. Retenez la répartition des rôles : le robots.txt gère l’accès des robots, le noindex gère la présence dans l’index. Notez aussi que Google ne tient plus compte, depuis 2019, des directives noindex écrites directement dans le robots.txt.

Les erreurs qui peuvent faire disparaître un site

Certaines erreurs n’ont qu’un effet limité, d’autres sont catastrophiques. Voici celles qui reviennent le plus souvent.

Le « Disallow: / » oublié

Associée à « User-agent: * », la ligne « Disallow: / » interdit l’exploration de l’intégralité du site. Elle est souvent utilisée, à juste titre, sur un site de préproduction. Le problème survient lorsque le fichier est copié tel quel au moment de la mise en ligne. Les pages disparaissent alors progressivement des résultats, souvent sans que personne ne comprenne pourquoi pendant plusieurs semaines. Après chaque lancement ou refonte, ouvrez votre robots.txt : c’est la vérification la plus rentable qui soit.

Bloquer les fichiers CSS et JavaScript

Pour évaluer une page, Google l’affiche comme le ferait un navigateur. S’il ne peut pas charger les feuilles de style et les scripts, il risque de mal interpréter la mise en page, voire de ne pas voir une partie du contenu. Bloquer des répertoires techniques entiers, une pratique autrefois courante, est aujourd’hui contre-productif.

Les autres pièges

Une règle trop courte peut bloquer bien plus que prévu, à cause de la logique de préfixe évoquée plus haut. Un fichier qui renvoie une erreur serveur pose aussi problème : dans ce cas, Google peut considérer temporairement que tout le site est interdit. À l’inverse, l’absence totale de fichier n’est pas grave, les robots considèrent alors que tout est autorisé. Méfiez-vous aussi des directives recopiées sur des forums : la ligne Crawl-delay, censée espacer les visites des robots, est par exemple ignorée par Google, même si Bing en tient compte. Enfin, évitez de lister dans le robots.txt des répertoires sensibles en pensant les cacher : vous indiquez surtout leur emplacement à tous les curieux. Une page confidentielle se protège par un mot de passe.

Tester et surveiller son fichier

Avant et après chaque modification, vérifiez l’effet de vos règles. Dans Google Search Console, le rapport robots.txt, accessible depuis les paramètres, indique les fichiers trouvés par Google, la date de leur dernière lecture et les éventuels problèmes d’analyse. L’outil d’inspection d’URL précise, pour une page donnée, si son exploration est bloquée par le robots.txt. Bing Webmaster Tools propose de son côté un outil de test dédié.

Gardez aussi un œil sur le rapport « Pages » de Search Console : une hausse soudaine des URL « Bloquées par le fichier robots.txt » doit immédiatement attirer votre attention. Enfin, gardez votre fichier court et lisible : Google ignore le contenu situé au-delà de 500 Kio, une limite qu’un fichier raisonnable n’approche jamais.

Le cas des robots d’intelligence artificielle

Depuis quelques années, de nouveaux robots parcourent le web pour alimenter des modèles d’intelligence artificielle, comme GPTBot pour OpenAI, ClaudeBot pour Anthropic ou CCBot pour Common Crawl. Google a également créé un identifiant spécifique, Google-Extended, qui permet de refuser l’utilisation de vos contenus pour ses modèles d’IA sans affecter votre présence dans les résultats de recherche classiques.

Bloquer ou non ces robots est un choix stratégique qui dépend de votre activité : protéger des contenus à forte valeur d’un côté, rester visible dans les réponses des assistants de l’autre. Si vous décidez de les bloquer, ajoutez un groupe par robot avec une ligne « Disallow: / », en gardant à l’esprit que ce blocage repose, là encore, sur leur bonne volonté.

Conclusion

Le fichier robots.txt est un outil simple, mais qui ne pardonne pas l’approximation. Bien utilisé, il oriente les robots vers vos pages utiles et leur évite de s’égarer dans des zones sans intérêt. Mal utilisé, il peut couper votre site de Google en une seule ligne. Pour la plupart des petits sites, un fichier minimal suffit largement.

Gardez en tête les trois réflexes essentiels : ne bloquez que ce qui doit vraiment l’être, n’utilisez jamais le robots.txt pour désindexer une page, et vérifiez-le systématiquement après chaque mise en ligne ou refonte. Ces quelques précautions vous éviteront la plus bête, et la plus coûteuse, des erreurs de référencement.

En apprendre plus sur Ariane

Ariane.L : experte en nouvelle technologie, faisant partie depuis 2021 à l'équipe du site Rev3Days.fr. Je décortique les tendances liées au webmarketing et à l'entrepreneuriat.

Previous

Problème Laposte.net aujourd’hui : que vérifier en premier ?

Format bannière LinkedIn : quelles dimensions pour éviter les recadrages ?

Next