Die Faktentreue von KI-Antworten beantwortet für eine Marke eine einfache Frage: Stimmt, was KI-Systeme wie ChatGPT, Gemini, Claude oder Perplexity über sie sagen? Eine Marke kann in vielen Antworten vorkommen und trotzdem mit einem veralteten Preis, einem falschen Standort oder einer Leistung erscheinen, die es gar nicht gibt. Die Erwähnungsrate zeigt nur, wie oft eine Marke genannt wird; die Faktentreue zeigt, ob das Gesagte stimmt. Damit ist sie ein eigener Teil der KI-Sichtbarkeit einer Marke.

Wie die Faktentreue gemessen wird

Eine KI-Antwort enthält meist mehrere Angaben, von denen nicht unbedingt alle stimmen. Bewertet wird deshalb nicht die Antwort als Ganzes, sondern jede einzelne Aussage darin. Ein Beispiel: Auf die Frage „Was bietet die Muster Haustechnik GmbH an?“ antwortet ein KI-System: „Die Muster Haustechnik GmbH aus Kassel wurde 1995 gegründet, plant und installiert Heizungen und Bäder und bietet einen 24-Stunden-Notdienst.“ In Einzelaussagen zerlegt und mit den geprüften Fakten des Unternehmens abgeglichen, ergibt das:

  • Sitz in Kassel: richtig.
  • Gegründet 1995: falsch, das Unternehmen besteht seit 1998.
  • Plant und installiert Heizungen: richtig.
  • Plant und installiert Bäder: richtig.
  • 24-Stunden-Notdienst: veraltet, den Notdienst gibt es seit 2022 nicht mehr.

Drei von fünf Aussagen stimmen, die Faktentreue dieser Antwort liegt also bei 60 Prozent. Als Ganzes klingt die Antwort trotzdem stimmig, und genau das macht solche Fehler schwer zu erkennen. Veraltete Angaben zählen ebenso als Fehler wie falsche. Es hilft aber, sie gesondert zu vermerken, weil sie auf eine andere Ursache hindeuten: auf Quellen oder Trainingswissen, die noch den alten Stand zeigen.

Die Methode wird in der Forschung zu Sprachmodellen eingesetzt. Ein bekanntes Beispiel ist FActScore, ein Bewertungsverfahren, das Forschende 2023 auf der Fachkonferenz EMNLP vorstellten. Sie zerlegten Biografien, die Sprachmodelle geschrieben hatten, in kleinste prüfbare Aussagen, sogenannte atomare Fakten, und glichen jede davon mit Wikipedia ab. Der Wert ist der Anteil der Aussagen, die sich mit der Wissensquelle belegen lassen. Für eine Marke tritt an die Stelle von Wikipedia ein internes Faktenblatt mit den geprüften Angaben zum Unternehmen, wie es auch die Grundlage für konsistente Markeninformationen ist.

Über viele Antworten zusammengefasst und für jedes KI-System getrennt ausgewiesen, ergibt sich daraus die Faktentreue einer Marke. Ausdrücken lässt sie sich als Anteil der richtigen Einzelaussagen oder als Anteil der Antworten ohne falsche Angabe; eine einheitliche Berechnung gibt es nicht.

Welche Angaben geprüft werden

Geprüft wird mit den Fragen, die Kundinnen und Kunden einem KI-System zu einem Unternehmen stellen könnten: was es anbietet, was es kostet, wo es sitzt, wie es erreichbar ist und seit wann es besteht. Solche Fragen nennen den Firmennamen ausdrücklich. Aufschlussreich sind aber auch Antworten auf allgemeinere Fragen, etwa nach Anbietern in einer Region, wenn sie die Marke mit Eigenschaften oder Preisen nennen. Beide Arten von Fragen gehören in ein festes Prompt-Set. Weil KI-Systeme auf dieselbe Frage nicht jedes Mal gleich antworten (Antwortvariabilität), beruht die Bewertung auf mehreren Antworten je Frage.

Nicht jeder Fehler wiegt gleich schwer. Eine falsche Telefonnummer, ein veralteter Preis oder eine Leistung, die es nicht mehr gibt, führt Kundinnen und Kunden direkt in die Irre; ein falsches Gründungsjahr fällt weniger ins Gewicht. Es ist deshalb sinnvoll, Fehler nach ihren Folgen zu gewichten und die folgenreichsten zuerst anzugehen.

Von der falschen Angabe zur Korrektur

Ein KI-System lässt sich nicht direkt korrigieren, wohl aber die Quellen, aus denen es seine Angaben bezieht. Die Korrektur beginnt deshalb mit der Frage, woher ein Fehler stammt. Gibt eine Antwort Quellen an (KI-Zitate), zeigen diese, worauf sie sich vermutlich stützt, etwa auf einen Verzeichniseintrag mit der alten Adresse oder auf die Website eines gleichnamigen Unternehmens. Eine Antwort kann ihre Quelle dabei korrekt wiedergeben und trotzdem falsch sein, wenn die Quelle selbst veraltet ist. Umgekehrt kann eine Antwort auch eine korrekte Quelle falsch wiedergeben. Fehlt eine Quellenangabe, kann der Fehler aus dem parametrischen Wissen des Sprachmodells stammen, also aus dem, was es im Training gelernt hat. Und manchmal erfindet ein Modell eine Angabe ganz ohne Vorlage; solche Halluzinationen lassen sich nicht vollständig ausschließen.

Korrigiert wird dort, wo die falsche Angabe steht: auf der eigenen Website, im Organization-Markup, in eigenen Profilen und Brancheneinträgen und, soweit möglich, auf fremden Seiten. Ziel ist, dass überall dieselbe aktuelle Fassung steht. Ob die Korrekturen in den Antworten ankommen, zeigt erst die erneute Prüfung in den folgenden Messrunden des GEO-Monitorings. Wie schnell das geht, hängt unter anderem davon ab, ob ein KI-System Inhalte zum Zeitpunkt der Frage aus dem Web abruft oder auf sein Wissen aus dem Training zurückgreift.

Für deine Berichte eignet sich eine einfache Fehlerliste: welche Aussage in welchem KI-System falsch war, woher sie vermutlich stammt, wo sie korrigiert wurde und ob sie bei der nächsten Prüfung noch auftaucht. So lässt sich jede korrigierte Angabe einzeln belegen.