Eine XML-Sitemap richtet sich nicht an Menschen, sondern an Crawler: Programme, die Webseiten automatisch abrufen, darunter die Crawler, über die KI-Systeme Inhalte beziehen. Crawler entdecken Seiten normalerweise über Links, innerhalb der Website und von anderen Websites aus. Die Sitemap ergänzt diesen Weg: Crawler, die das Format unterstützen, können alle darin aufgeführten Adressen übernehmen, ohne sie erst über Links finden zu müssen.

So ist eine XML-Sitemap aufgebaut

Das Format ist auf sitemaps.org festgelegt und wird unter anderem von Google und Microsoft unterstützt. Die Datei ist in XML geschrieben, einer Auszeichnungssprache, in der jede Angabe zwischen benannten Markierungen steht, sogenannten Tags. Laut sitemaps.org liegt die Datei am besten direkt unter der Domain, etwa unter /sitemap.xml. Für jede Seite enthält die Datei einen Eintrag; die beiden wichtigsten Angaben darin sind:

  • loc: die vollständige Adresse der Seite, beginnend mit dem Übertragungsprotokoll (in der Regel https) und der Domain. Diese Angabe ist Pflicht.
  • lastmod: das Datum der letzten Änderung, etwa 2026-09-14 für den 14. September 2026. Diese Angabe ist optional.

Ein vollständiger Eintrag sieht so aus, wobei „Adresse der Seite“ für die vollständige Adresse steht: „<url><loc>Adresse der Seite</loc><lastmod>2026-09-14</lastmod></url>“. Alle Einträge stehen in einem gemeinsamen umschließenden Tag namens urlset. Eine Datei darf höchstens 50.000 Adressen enthalten und unkomprimiert höchstens 50 MB groß sein; größere Websites verteilen ihre Adressen auf mehrere Sitemaps und listen diese in einer Sitemap-Indexdatei auf.

Welche Adressen und Daten hineingehören

Microsoft rät in den Webmaster-Richtlinien von Bing, nur kanonische Adressen aufzunehmen. Die kanonische Adresse ist die eine bevorzugte Adresse einer Seite, wenn derselbe Inhalt unter mehreren Adressen erreichbar ist, etwa mit und ohne „www“ oder mit angehängten Parametern. Außerdem soll die Sitemap laut Microsoft den aktuellen Aufbau der Website widerspiegeln; gelöschte oder weitergeleitete Adressen gehören zügig hinaus.

Das Datum in lastmod muss nach dem Protokoll angeben, wann sich die Seite selbst zuletzt geändert hat, nicht wann die Sitemap erzeugt wurde. Microsoft empfiehlt dafür Datum und Uhrzeit im Format ISO 8601, der internationalen Norm für Datums- und Zeitangaben, etwa 2026-09-14T09:30:00+02:00; +02:00 ist dabei die Abweichung von der koordinierten Weltzeit (UTC). Laut Google soll lastmod die letzte wesentliche Änderung einer Seite wiedergeben; als wesentlich gilt in der Regel etwa eine Änderung am Hauptinhalt, an den strukturierten Daten oder an den Links, eine neue Jahreszahl im Copyright-Hinweis dagegen nicht. Google wertet lastmod nach eigener Aussage nur aus, wenn der Wert durchgängig und nachprüfbar stimmt. Gibt ein Content-Management-System (CMS), also die Software, mit der eine Website gepflegt wird, beim Erzeugen der Sitemap jedes Mal allen Seiten das aktuelle Datum, sendet lastmod deshalb kein brauchbares Signal. Wie eine Seite ihr Veröffentlichungs- und Änderungsdatum für Menschen und Maschinen sichtbar macht, beschreibt der Begriff Content-Aktualität.

Wie Crawler die Sitemap finden

Microsoft nennt zwei Wege, eine Sitemap bekannt zu machen. Der erste ist eine Zeile in der robots.txt: „Sitemap:“, gefolgt von der vollständigen Adresse der Sitemap-Datei. Die Zeile gehört nicht zu den Zugriffsregeln der robots.txt, sondern stammt aus dem Sitemap-Format; der Standard RFC 9309 erlaubt Crawlern ausdrücklich, solche zusätzlichen Zeilen auszuwerten. Sie gehört zu keiner Regelgruppe für einen bestimmten Crawler, darf an beliebiger Stelle stehen und lässt sich für mehrere Sitemaps wiederholen. Der zweite Weg ist, die Sitemap in den Bing Webmaster Tools einzureichen, Microsofts Werkzeug für Betreiberinnen und Betreiber von Websites.

Ergänzend zur Sitemap empfiehlt Microsoft IndexNow, ein Protokoll, über das eine Website Bing und andere teilnehmende Dienste sofort über einzelne neue, geänderte oder entfernte Adressen benachrichtigt.

Was die XML-Sitemap für KI-Antworten bedeutet

Microsoft verbindet Sitemaps ausdrücklich mit KI-Antworten. In einem Beitrag im Bing Webmaster Blog vom Juli 2025 schreibt Microsoft, dass Aktualitätssignale beeinflussen, wie schnell Änderungen in KI-generierten Antworten ankommen. Das lastmod-Datum hilft Bing demnach zu entscheiden, welche Seiten es erneut abruft und welche es überspringt, weil sich ihr Inhalt nicht geändert hat. Die Webmaster-Richtlinien von Bing, die auch für Copilot gelten, ergänzen: Eine sorgfältig gepflegte Sitemap hilft Bing, seinen Index genau und aktuell zu halten, und trägt dazu bei, dass Seiten zuverlässig als Grundlage für KI-Antworten infrage kommen (Grounding). Eine Garantie für Sichtbarkeit ist sie laut Microsoft nicht.

Auch Google nutzt XML-Sitemaps, um Seiten zu entdecken, beschreibt aber keinen eigenen Zusammenhang mit seinen KI-Funktionen. OpenAI, Anthropic und Perplexity äußern sich in der Dokumentation ihrer Crawler nicht zu Sitemaps. Eine Sitemap meldet Seiten nur an: Ob ein Crawler eine aufgeführte Seite abrufen darf und kann, hängt weiter von der robots.txt, vom Server und von weiteren Faktoren ab, die zusammen die Crawlbarkeit einer Website ausmachen. Weil viele CMS die Datei automatisch erzeugen, ist es meist wenig Aufwand, sie mit korrekten Daten bereitzustellen und in der robots.txt zu nennen.