Aller au contenu

DIRRSS

Nos dernières news

Découvrez comment accéder facilement à la liste complète des pages d’un site web

Femme consultant la liste complète des pages d'un site web via le plan du site affiché sur un écran d'ordinateur

Obtenir la liste complète des pages d’un site web suppose de croiser plusieurs sources de données, car aucune méthode isolée ne couvre la totalité des URL existantes. Le sitemap XML, la Search Console, les outils de crawl et même les fichiers de logs serveur livrent chacun une photographie partielle. Comprendre les écarts entre ces sources permet de choisir la bonne combinaison selon l’objectif : audit SEO, migration, inventaire de contenu ou simple vérification.

Sitemap XML, Search Console et crawl : ce que chaque source couvre réellement

Le réflexe le plus courant consiste à ouvrir le fichier sitemap.xml d’un domaine. Ce fichier déclare les URL que le propriétaire du site souhaite voir explorées. Il ne reflète ni l’état d’indexation ni l’existence de pages orphelines absentes du maillage interne.

Source Ce qu’elle recense Limite principale
Sitemap XML URL déclarées par le webmaster Pages orphelines et URL non déclarées absentes
Google Search Console URL connues de Google (explorées ou indexées) Export limité à 1 000 lignes par rapport, données conservées 16 mois
Crawl SEO (Screaming Frog, Sitebulb, etc.) URL accessibles via le maillage interne Pages protégées par authentification ou bloquées par robots.txt ignorées
Logs serveur Toute URL ayant reçu au moins une requête HTTP Requiert un accès technique au serveur, volume de données parfois massif

Le tableau met en évidence un point souvent sous-estimé : aucune source unique ne garantit un inventaire exhaustif. Un sitemap peut omettre des URL, la Search Console plafonne ses exports, et un crawl ne suit que les liens qu’il découvre.

Pour illustrer cette complémentarité, on peut consulter la liste des pages de Net Addict, qui montre comment un sitemap structuré organise les URL par catégories et facilite la lecture de l’arborescence d’un site.

Développeur web analysant la structure et la liste des URL d'un site web depuis un terminal sur ordinateur portable

Écarts entre sitemap traité et pages réellement indexées

Un piège fréquent consiste à assimiler le traitement d’un sitemap par Google à l’indexation de son contenu. Un sitemap au statut « réussi » signifie seulement que le fichier a été lu, pas que les URL qu’il contient ont été explorées ou ajoutées à l’index.

Google applique ensuite ses propres critères de qualité et de budget de crawl pour décider quelles URL méritent une visite. Des pages à faible valeur ajoutée, des contenus dupliqués ou des signaux techniques défavorables (temps de réponse élevé, directives noindex) peuvent empêcher l’indexation même si l’URL figure dans le sitemap.

La balise lastmod : un signal de fraîcheur sous condition

Google ignore les balises changefreq et priority dans les sitemaps. La balise lastmod n’est prise en compte que si elle reflète une modification substantielle du contenu. Des mises à jour artificielles ou cosmétiques (changer une virgule, mettre à jour un horodatage sans toucher au texte) peuvent réduire la confiance accordée à ce signal.

Un sitemap bien tenu reste un outil de découverte, pas un levier d’indexation forcée. Pour repérer les URL effectivement indexées, le rapport « Pages » de la Search Console reste la référence, malgré sa limite d’export.

Crawl SEO versus opérateur site: de Google

L’opérateur de recherche site:domaine.com dans Google donnait autrefois une estimation du nombre de pages indexées. Cette méthode a perdu en fiabilité depuis que Google n’affiche plus le nombre total de résultats de manière systématique.

Un outil de crawl SEO parcourt le site en suivant les liens internes et externes, puis compile la liste des URL découvertes avec leur code HTTP, leur profondeur de clic, leurs balises meta et leur statut d’indexabilité. La différence est structurante :

  • L’opérateur site: interroge l’index de Google, qui peut contenir des pages supprimées ou en exclure d’autres parfaitement accessibles
  • Le crawl SEO parcourt le site tel qu’il existe à l’instant T, en ignorant ce que Google sait ou ne sait pas
  • Croiser les deux permet de repérer les pages indexées mais supprimées du site (erreurs 404 dans l’index) et les pages existantes mais absentes de l’index

Pour un audit de migration ou un nettoyage de contenu, le crawl SEO fournit une base plus fiable que l’opérateur de recherche.

Jeune femme parcourant la liste des pages d'un site web dans un navigateur depuis un bureau debout en studio

IndexNow et notification proactive des URL modifiées

Bing propose une approche complémentaire via le protocole IndexNow. Plutôt que d’attendre le passage du robot d’exploration, le webmaster notifie directement les URL ajoutées, modifiées ou supprimées. Une requête IndexNow peut soumettre jusqu’à 10 000 URL en une seule fois.

Ce protocole ne remplace pas le sitemap, qui reste l’inventaire structurel du site. Il agit comme un canal de mise à jour en temps réel, particulièrement utile pour les sites à forte fréquence de publication ou les boutiques en ligne dont les fiches produits changent régulièrement.

Quand combiner sitemap et IndexNow

Le sitemap couvre la totalité des URL existantes et sert de référence pour les crawlers. IndexNow signale les changements récents pour accélérer leur prise en compte. Les deux se complètent sans se chevaucher : le premier offre la vue d’ensemble, le second la réactivité.

Méthode pratique pour croiser les sources et obtenir une liste complète

La démarche la plus fiable consiste à fusionner les données de plusieurs sources dans un tableur ou un outil d’audit, puis à identifier les écarts.

  • Exporter les URL du sitemap XML (souvent accessible via domaine.com/sitemap.xml ou domaine.com/sitemap_index.xml)
  • Exporter les URL connues depuis la Search Console (rapport « Pages », en gardant à l’esprit le plafond de 1 000 lignes par export)
  • Lancer un crawl complet du site avec un outil dédié pour capturer les URL accessibles par maillage interne
  • Comparer les trois listes pour isoler les URL orphelines, les pages non déclarées dans le sitemap, et les URL indexées mais en erreur

Les URL présentes dans le crawl mais absentes du sitemap sont des candidates immédiates à l’ajout. Les URL présentes dans la Search Console mais renvoyant une erreur 404 lors du crawl signalent un problème de maintenance.

L’inventaire complet des pages d’un site reste un exercice de recoupement. La qualité de la liste finale dépend moins de l’outil choisi que de la rigueur avec laquelle on croise les sources, chacune compensant les angles morts de l’autre.

Découvrez comment accéder facilement à la liste complète des pages d’un site web