Parlons de votre projet
Parlons de votre projet
La technique

Indexation & crawl : comment Google explore votre site

Avant de pouvoir classer une page, Google doit d’abord la découvrir puis la stocker. C’est tout l’enjeu du crawl et de l’indexation : si une page n’est pas indexée, elle n’existe tout simplement pas dans les résultats de recherche.

Crawl : comment Google découvre vos pages

Google utilise un robot, le Googlebot, qui parcourt le web en suivant les liens. Il découvre vos pages via :

  • les liens internes entre vos pages (d’où l’importance du maillage) ;
  • les liens externes pointant vers votre site ;
  • votre sitemap.xml, qui liste les URL que vous souhaitez voir explorées.

Indexation : ce que Google retient

Une fois une page explorée, Google décide de l’indexer ou non. Toutes les pages ne sont pas indexées : contenu trop pauvre, doublons, pages techniques… Google fait le tri.

Les outils pour piloter l’indexation

  • robots.txt : indique aux robots les zones à ne pas explorer.
  • Balise meta robots (noindex) : empêche l’indexation d’une page précise.
  • Sitemap.xml : facilite la découverte de vos pages importantes.
  • Balise canonical : désigne la version de référence en cas de contenus similaires.

Les problèmes d’indexation les plus fréquents

  • Pages bloquées par erreur dans le robots.txt ou en noindex.
  • Contenus dupliqués qui diluent le signal.
  • Pages orphelines, sans aucun lien interne pointant vers elles.
  • Gaspillage du budget de crawl sur des pages sans valeur.

Comment vérifier l’indexation de son site

La Google Search Console est l’outil de référence : le rapport « Indexation des pages » liste les pages indexées et les raisons des exclusions, et l’outil « Inspection d’URL » permet de tester une page précise et de demander son indexation.

Envie de passer à l’action sur votre référencement ?
Découvrir notre offre SEO