Obtenir la liste complète des pages d’un site web suppose de croiser plusieurs sources de données, car aucune méthode isolée ne couvre la totalité des URL existantes. Le sitemap XML, la Search Console, les outils de crawl et même les fichiers de logs serveur livrent chacun une photographie partielle. Comprendre les écarts entre ces sources permet de choisir la bonne combinaison selon l’objectif : audit SEO, migration, inventaire de contenu ou simple vérification.
Sitemap XML, Search Console et crawl : ce que chaque source couvre réellement
Le réflexe le plus courant consiste à ouvrir le fichier sitemap.xml d’un domaine. Ce fichier déclare les URL que le propriétaire du site souhaite voir explorées. Il ne reflète ni l’état d’indexation ni l’existence de pages orphelines absentes du maillage interne.
| Source | Ce qu’elle recense | Limite principale |
|---|---|---|
| Sitemap XML | URL déclarées par le webmaster | Pages orphelines et URL non déclarées absentes |
| Google Search Console | URL connues de Google (explorées ou indexées) | Export limité à 1 000 lignes par rapport, données conservées 16 mois |
| Crawl SEO (Screaming Frog, Sitebulb, etc.) | URL accessibles via le maillage interne | Pages protégées par authentification ou bloquées par robots.txt ignorées |
| Logs serveur | Toute URL ayant reçu au moins une requête HTTP | Requiert un accès technique au serveur, volume de données parfois massif |
Le tableau met en évidence un point souvent sous-estimé : aucune source unique ne garantit un inventaire exhaustif. Un sitemap peut omettre des URL, la Search Console plafonne ses exports, et un crawl ne suit que les liens qu’il découvre.
Pour illustrer cette complémentarité, on peut consulter la liste des pages de Net Addict, qui montre comment un sitemap structuré organise les URL par catégories et facilite la lecture de l’arborescence d’un site.

Écarts entre sitemap traité et pages réellement indexées
Un piège fréquent consiste à assimiler le traitement d’un sitemap par Google à l’indexation de son contenu. Un sitemap au statut « réussi » signifie seulement que le fichier a été lu, pas que les URL qu’il contient ont été explorées ou ajoutées à l’index.
Google applique ensuite ses propres critères de qualité et de budget de crawl pour décider quelles URL méritent une visite. Des pages à faible valeur ajoutée, des contenus dupliqués ou des signaux techniques défavorables (temps de réponse élevé, directives noindex) peuvent empêcher l’indexation même si l’URL figure dans le sitemap.
La balise lastmod : un signal de fraîcheur sous condition
Google ignore les balises changefreq et priority dans les sitemaps. La balise lastmod n’est prise en compte que si elle reflète une modification substantielle du contenu. Des mises à jour artificielles ou cosmétiques (changer une virgule, mettre à jour un horodatage sans toucher au texte) peuvent réduire la confiance accordée à ce signal.
Un sitemap bien tenu reste un outil de découverte, pas un levier d’indexation forcée. Pour repérer les URL effectivement indexées, le rapport « Pages » de la Search Console reste la référence, malgré sa limite d’export.
Crawl SEO versus opérateur site: de Google
L’opérateur de recherche site:domaine.com dans Google donnait autrefois une estimation du nombre de pages indexées. Cette méthode a perdu en fiabilité depuis que Google n’affiche plus le nombre total de résultats de manière systématique.
Un outil de crawl SEO parcourt le site en suivant les liens internes et externes, puis compile la liste des URL découvertes avec leur code HTTP, leur profondeur de clic, leurs balises meta et leur statut d’indexabilité. La différence est structurante :
- L’opérateur site: interroge l’index de Google, qui peut contenir des pages supprimées ou en exclure d’autres parfaitement accessibles
- Le crawl SEO parcourt le site tel qu’il existe à l’instant T, en ignorant ce que Google sait ou ne sait pas
- Croiser les deux permet de repérer les pages indexées mais supprimées du site (erreurs 404 dans l’index) et les pages existantes mais absentes de l’index
Pour un audit de migration ou un nettoyage de contenu, le crawl SEO fournit une base plus fiable que l’opérateur de recherche.

IndexNow et notification proactive des URL modifiées
Bing propose une approche complémentaire via le protocole IndexNow. Plutôt que d’attendre le passage du robot d’exploration, le webmaster notifie directement les URL ajoutées, modifiées ou supprimées. Une requête IndexNow peut soumettre jusqu’à 10 000 URL en une seule fois.
Ce protocole ne remplace pas le sitemap, qui reste l’inventaire structurel du site. Il agit comme un canal de mise à jour en temps réel, particulièrement utile pour les sites à forte fréquence de publication ou les boutiques en ligne dont les fiches produits changent régulièrement.
Quand combiner sitemap et IndexNow
Le sitemap couvre la totalité des URL existantes et sert de référence pour les crawlers. IndexNow signale les changements récents pour accélérer leur prise en compte. Les deux se complètent sans se chevaucher : le premier offre la vue d’ensemble, le second la réactivité.
Méthode pratique pour croiser les sources et obtenir une liste complète
La démarche la plus fiable consiste à fusionner les données de plusieurs sources dans un tableur ou un outil d’audit, puis à identifier les écarts.
- Exporter les URL du sitemap XML (souvent accessible via domaine.com/sitemap.xml ou domaine.com/sitemap_index.xml)
- Exporter les URL connues depuis la Search Console (rapport « Pages », en gardant à l’esprit le plafond de 1 000 lignes par export)
- Lancer un crawl complet du site avec un outil dédié pour capturer les URL accessibles par maillage interne
- Comparer les trois listes pour isoler les URL orphelines, les pages non déclarées dans le sitemap, et les URL indexées mais en erreur
Les URL présentes dans le crawl mais absentes du sitemap sont des candidates immédiates à l’ajout. Les URL présentes dans la Search Console mais renvoyant une erreur 404 lors du crawl signalent un problème de maintenance.
L’inventaire complet des pages d’un site reste un exercice de recoupement. La qualité de la liste finale dépend moins de l’outil choisi que de la rigueur avec laquelle on croise les sources, chacune compensant les angles morts de l’autre.



