Robots.txt
robots.txt est un fichier texte placé dans le répertoire racine d'un site web qui indique aux robots d'exploration des moteurs de recherche quelles pages ou quels fichiers ils sont autorisés ou interdits de demander. C'est la première ligne de défense pour contrôler la façon dont les robots interagissent avec l'infrastructure de votre site et aide à optimiser le budget d'exploration.
Diriger les robots vers votre meilleur contenu
Google alloue un "budget d'exploration" limité à votre site — le nombre de pages que ses robots exploreront par jour. Si les robots perdent du temps à explorer les panneaux d'administration, les pages imprimables en double, ou les URL de panier/paiement, ils pourraient manquer vos précieuses pages de produits traduites. robots.txt indique aux robots "Ne perdez pas de temps sur /admin/, concentrez-vous plutôt sur /en/, /fr/, /de/". Pour les sites internationaux, vous devriez interdire l'exploration des pages de redirection de détection automatique de langue, des points d'API et de toute URL technique qui n'a pas besoin d'être indexée. Cependant, ne bloquez JAMAIS accidentellement vos répertoires de langue — c'est une erreur catastrophique qui tue tout le référencement international.
Autoriser vs. Interdire l'accès à l'exploration
Impact réel
Le site n'a pas de robots.txt, les robots explorent 10 000 URL de panier
Budget d'exploration gaspillé, pages produits explorées lentement
Les nouveaux produits mettent des semaines à apparaître dans les résultats de recherche
Ajouter robots.txt : Interdire /cart/, /checkout/, /api/
Les robots se concentrent à 100 % sur les pages produits et linguistiques
Nouveaux produits indexés en 24 heures