Indexation & crawl : comment Google explore votre site
Avant de pouvoir classer une page, Google doit d’abord la découvrir puis la stocker. C’est tout l’enjeu du crawl et de l’indexation : si une page n’est pas indexée, elle n’existe tout simplement pas dans les résultats de recherche.
Crawl : comment Google découvre vos pages
Google utilise un robot, le Googlebot, qui parcourt le web en suivant les liens. Il découvre vos pages via :
- les liens internes entre vos pages (d’où l’importance du maillage) ;
- les liens externes pointant vers votre site ;
- votre sitemap.xml, qui liste les URL que vous souhaitez voir explorées.
Indexation : ce que Google retient
Une fois une page explorée, Google décide de l’indexer ou non. Toutes les pages ne sont pas indexées : contenu trop pauvre, doublons, pages techniques… Google fait le tri.
Les outils pour piloter l’indexation
- robots.txt : indique aux robots les zones à ne pas explorer.
- Balise meta robots (noindex) : empêche l’indexation d’une page précise.
- Sitemap.xml : facilite la découverte de vos pages importantes.
- Balise canonical : désigne la version de référence en cas de contenus similaires.
Les problèmes d’indexation les plus fréquents
- Pages bloquées par erreur dans le robots.txt ou en noindex.
- Contenus dupliqués qui diluent le signal.
- Pages orphelines, sans aucun lien interne pointant vers elles.
- Gaspillage du budget de crawl sur des pages sans valeur.
Comment vérifier l’indexation de son site
La Google Search Console est l’outil de référence : le rapport « Indexation des pages » liste les pages indexées et les raisons des exclusions, et l’outil « Inspection d’URL » permet de tester une page précise et de demander son indexation.