Der Knowledge Cutoff ergibt sich daraus, wie ein Sprachmodell lernt: Es wird mit einer großen Sammlung von Texten trainiert, den Trainingsdaten, und lernt nach dem Training nicht von selbst weiter. Was es dabei aufgenommen hat, sein parametrisches Wissen, bleibt auf dem Stand dieser Texte. Ein Beispiel: Ändert ein Unternehmen im März seine Preise, kennt ein Modell, dessen Trainingsdaten im Januar enden, aus dem Training höchstens die alten Preise, auch wenn jemand Monate später danach fragt.
Zwei Stichtage: zuverlässiges Wissen und Trainingsdaten
OpenAI und Anthropic nennen den Stichtag ihrer Modelle in ihrer Entwicklerdokumentation; Google gibt ihn, Stand Oktober 2026, nur für einige ältere Gemini-Modelle an. Anthropic unterscheidet zwei Stichtage: den Stichtag für zuverlässiges Wissen, bis zu dem das Wissen eines Modells am umfangreichsten und verlässlichsten ist, und den Stichtag der Trainingsdaten, der angibt, bis wann überhaupt Daten in das Training eingeflossen sind. Bei manchen Modellen liegen beide Stichtage mehrere Monate auseinander. Über die Monate dazwischen kann ein Modell etwas wissen, aber weniger verlässlich.
Auch ein angegebener Stichtag ist keine scharfe Grenze. Eine Studie, die 2024 auf der Fachkonferenz COLM vorgestellt wurde, untersuchte frei verfügbare Sprachmodelle und fand, dass ihr tatsächlicher Stichtag oft vom angegebenen abweicht und bei einigen Modellen deutlich früher liegt. Ein Grund: Auch neue Momentaufnahmen des Webs, aus denen Trainingsdaten zusammengestellt werden, enthalten einen nicht unerheblichen Anteil älterer Texte.
Warum der Stichtag für GEO zählt
Für Unternehmen zeigt sich der Stichtag vor allem dann, wenn sich etwas ändert: ein neues Produkt, ein neuer Firmenname, neue Preise, ein neuer Standort oder eine neue Ansprechperson. Was nach dem Stichtag geschah, kennt ein Modell aus dem Training nicht oder nur lückenhaft. Antwortet es allein aus diesem Wissen, fehlt das neue Angebot, oder die Antwort enthält veraltete Angaben, die Menschen ähnlich in die Irre führen wie eine Halluzination.
Hinzu kommt der zeitliche Abstand: Ein Modell kann nach seiner Veröffentlichung lange verfügbar bleiben, bei Anthropic teils über zwei Jahre. Eine Antwort aus dem Trainingswissen kann deshalb auf einem Stand beruhen, der deutlich älter ist als die Frage. Erst eine neue Modellversion mit späterem Stichtag kann eine Änderung aus dem Training kennen, und auch das nur, wenn ihre Trainingsdaten die Änderung enthalten.
Wie neue Angaben trotzdem in KI-Antworten gelangen
Viele KI-Systeme überbrücken den Stichtag, indem sie bei Bedarf aktuelle Inhalte aus dem Web abrufen und ihre Antwort darauf stützen. Dieses Verfahren heißt Retrieval-Augmented Generation (RAG). Anthropic beschreibt die Websuche von Claude ausdrücklich als Weg, Fragen mit aktuellen Informationen jenseits des Stichtags zu beantworten. Ob ein KI-System für eine Frage im Web nachschlägt, hängt allerdings vom System und von der Frage ab.
Für Änderungen am eigenen Angebot ist dieser Weg entscheidend. Neue Produkte, Preise oder ein neuer Name sollten deshalb zeitnah als Text auf deiner Website stehen, und zwar auf einer crawlbaren Seite: Crawler, also Programme, die Webseiten automatisch abrufen, können sie erreichen und lesen. Hilfreich ist außerdem eine aktualisierte XML-Sitemap, eine Datei, die die Adressen einer Website auflistet. Wie Veröffentlichungs- und Änderungsdaten für Menschen und Maschinen gekennzeichnet werden, beschreibt die Content-Aktualität. Schlägt ein KI-System im Web nach, findet es die Seite allerdings nur, wenn sie in seinem Webindex steht, der Sammlung erfasster Webseiten, auf die es zugreift.
Weil KI-Systeme auch fremde Seiten abrufen und künftige Modelle unter anderem aus öffentlich zugänglichen Webinhalten lernen, lohnt es sich, veraltete Angaben auch in Verzeichnissen, Profilen und auf Partnerseiten zu korrigieren. Um solche Angaben auf fremden Websites geht es bei Offpage-GEO.