Antwortvariabilität fällt oft schon auf, wenn du einem KI-System dieselbe Frage zweimal stellst. Ein Beispiel: Auf die Frage „Welche Anbieter für Lohnabrechnung eignen sich für mittelständische Unternehmen?“ nennt das System beim ersten Mal fünf Anbieter, darunter deinen. Beim zweiten Mal sind es vier, und dein Unternehmen fehlt. Das ist kein Defekt, sondern eine Folge davon, wie KI-Systeme wie ChatGPT, Gemini, Claude und Perplexity ihre Antworten erzeugen.
Woher die Unterschiede kommen
Forschende, die solche Schwankungen untersuchen, unterscheiden mehrere Ursachen, die oft zusammenwirken.
Zufall bei der Wortwahl
Ein großes Sprachmodell schreibt eine Antwort Wort für Wort. An jeder Stelle berechnet es, welche Fortsetzungen wahrscheinlich sind, und wählt eine davon aus, mit einem gewissen Anteil Zufall. Wie groß dieser Anteil ist, steuert eine Einstellung namens Temperatur: Bei hoher Temperatur fallen Antworten abwechslungsreicher aus, bei niedriger halten sie sich eher an die wahrscheinlichste Formulierung. Weil jedes weitere Wort auf den bisherigen aufbaut, kann eine einzige andere Wahl den Rest der Antwort verändern, bis hin zu einer anderen Auswahl von Anbietern. Welche Temperatur die KI-Anbieter in ihren eigenen Apps verwenden, legen sie selbst fest.
Wechselnde Quellen
Viele KI-Systeme rufen für eine Antwort aktuelle Inhalte aus dem Web ab, ein Verfahren namens Retrieval-Augmented Generation (RAG). Welche Seiten dabei gefunden werden und welche davon eine Antwort am Ende als Quelle angibt, kann sich von Abfrage zu Abfrage unterscheiden. Teilt ein KI-System eine Frage dafür in mehrere Teilanfragen auf, die es selbst formuliert (Query Fan-out), können auch diese bei derselben Frage unterschiedlich ausfallen. Andere Quellen bringen andere Fakten, andere Marken und andere KI-Zitate in die Antwort.
Andere Formulierungen
Menschen stellen dieselbe Frage auf viele Arten. Schon eine andere Formulierung des Prompts, also der Eingabe an das KI-System, kann zu einer anderen Antwort führen. Google wies etwa in einer Erläuterung vom Mai 2025 für seinen KI-Modus darauf hin, dass zwei ähnliche Fragen zum selben Thema unterschiedliche Antworten erhalten können, wenn sie anders formuliert sind. Wie stark sich die Quellen einer Antwort mit einer anderen Formulierung oder Sprache ändern, unterscheidet sich zudem von KI-System zu KI-System. Das ergab eine Vorabveröffentlichung vom September 2025, also eine Studie, die vor der fachlichen Begutachtung erschien.
Zeit und Kontext
Über Wochen und Monate kommen weitere Ursachen hinzu: Anbieter aktualisieren ihre Modelle, und Inhalte im Web ändern sich. Manche KI-Systeme berücksichtigen außerdem den ungefähren Standort oder frühere Gespräche der Person, die fragt. Viele Schwankungen entstehen aber schon ohne solche Veränderungen: In einer Untersuchung von Forschenden der Universität St. Gallen, die im April 2026 ebenfalls als Vorabveröffentlichung erschien, unterschieden sich die angegebenen Quellen bei wiederholten Abfragen am selben Tag ähnlich stark wie von einem Tag zum nächsten. Die Forschenden hatten dafür von Januar bis März 2026 deutschsprachige Fragen von Servern in der Schweiz aus gestellt; ihr Erstautor ist zugleich mit einem Anbieter von Software zur Messung von KI-Sichtbarkeit verbunden.
Was Antwortvariabilität für die Sichtbarkeit bedeutet
Eine einzelne KI-Antwort ist eine Stichprobe, keine Messung. Ein Screenshot, auf dem die eigene Marke ganz oben steht oder fehlt, zeigt eine von vielen möglichen Antworten. Die Forschenden aus St. Gallen folgern deshalb, dass KI-Sichtbarkeit als Wahrscheinlichkeit verstanden werden sollte, bei wiederholten Abfragen genannt zu werden. Ob deine Marke bei einer Frage vorkommt, lässt sich so nur als Anteil angeben: in wie vielen von vielen Antworten sie genannt wird, über wiederholte Abfragen und verschiedene Formulierungen derselben Frage hinweg. Das gilt nicht nur für Erwähnungen, sondern für alles, was deine KI-Sichtbarkeit ausmacht, etwa die Position in einer Aufzählung oder die Richtigkeit der Angaben.
Jeder solche Anteil ist eine Schätzung mit einer gewissen Unsicherheit. Aus zwei Antworten lässt sich kaum etwas ablesen: Taucht eine Marke in einer davon auf, kann sie in Wahrheit fast immer oder nur selten genannt werden. Je mehr Antworten in die Auswertung eingehen, desto enger wird der Bereich, in dem der tatsächliche Wert vermutlich liegt. Eine aussagekräftige Auswertung nennt deshalb neben dem Anteil auch, auf wie vielen Antworten er beruht. Wie oft eine Frage beim Prompt-Tracking wiederholt werden sollte, beantworten Studien unterschiedlich; eine allgemein anerkannte Zahl gibt es nicht. Eine Kennzahl, die aus wiederholten Antworten entsteht, ist die Erwähnungsrate.
Für Unternehmen hat Antwortvariabilität auch eine beruhigende Seite: Eine Antwort ohne die eigene Marke ist kein endgültiges Urteil. Ob sich die Sichtbarkeit verbessert, zeigt sich am Anteil über viele Antworten, wie ihn ein GEO-Monitoring über die Zeit verfolgt, nicht an einer einzelnen Abfrage.