Eine Sitemap ist ein Versprechen an Crawler: Diese Adressen existieren, sie sollen indexiert werden, und so alt sind sie. Gebrochene Versprechen kosten Crawl-Budget und Vertrauen: gelistete Seiten, die weiterleiten oder 404 antworten, noindex-Seiten in der Liste, ein lastmod, das bei jedem Eintrag gleich ist, oder eine Sitemap, die keine robots.txt ankündigt. Diese Prüfung findet die Sitemap so, wie ein Crawler es tut, liest einen Index und bis zu zehn Kind-Sitemaps, beurteilt die Einträge und ruft dann zwölf über die Liste verteilte Seiten ab, um Versprechen und Wirklichkeit zu vergleichen.
Von diesem Server aus: robots.txt, die Sitemap und bis zu zehn Kind-Sitemaps (je höchstens 5 MB), danach zwölf gelistete Seiten von je höchstens 64 KB. Hosts in privaten, Loopback- und Link-local-Netzen werden abgelehnt. Die Abfrage ist durch reCAPTCHA v3 geschützt; die aufrufende IP-Adresse und das Ziel werden eine Stunde lang gespeichert, um die Rate zu begrenzen.
Grenzen, die dazugehören: Von einem Index werden nur die ersten zehn Kind-Sitemaps gelesen und nur die ersten 20.000 Einträge für die Statistik behalten; die Stichprobe sind zwölf gleichmäßig über die Liste verteilte Seiten, was systematische Probleme findet und einzelne kaputte Einträge übersieht; noindex wird nur aus dem HTML gelesen, nicht aus einer X-Robots-Tag-Kopfzeile; und Bild-, Video- und News-Erweiterungen zählen als gewöhnliche Einträge.