Prompt-Tracking ist der Schritt zwischen der Auswahl der Fragen und den Kennzahlen. Welche Fragen gestellt werden, bestimmt ein Prompt-Set, also eine festgelegte Sammlung typischer Kundenfragen; beim Prompt-Tracking werden diese Fragen tatsächlich gestellt und die Antworten gesammelt, und zwar in großer Zahl. Ein Beispiel: 50 Prompts, jeweils siebenmal am Tag an ChatGPT, Gemini, Claude und Perplexity gestellt, ergeben 1.400 Antworten pro Tag. Solche Mengen bewältigt nur Software, die zu festen Zeiten selbstständig fragt.

Warum eine einzelne Abfrage nicht reicht

KI-Systeme antworten auf dieselbe Frage nicht jedes Mal gleich. Eine Antwort nennt eine Marke, die nächste nicht, und auch die angegebenen Quellen wechseln. Diese Schwankungen heißen Antwortvariabilität. Für die Messung heißt das: Erst viele Wiederholungen derselben Frage zeigen, wie oft eine Marke tatsächlich vorkommt.

Wie viele Wiederholungen nötig sind, ist nicht abschließend geklärt. Forschende der Universität St. Gallen empfahlen in einer Vorabveröffentlichung vom April 2026, also einer Studie, die vor der fachlichen Begutachtung erschien, jede Frage mindestens siebenmal pro Tag zu stellen und die Ergebnisse über zwei bis vier Wochen zusammenzufassen. Ihre Daten stammen aus deutschsprachigen Fragen, die zwischen Januar und März 2026 von Servern in der Schweiz aus an ChatGPT, Gemini, den KI-Modus von Google und Perplexity gingen. Eine weitere Vorabveröffentlichung vom September 2026 wertete fünf frühere Studien aus der Forschungsgruppe ihres Autors zu Markenempfehlungen von Sprachmodellen neu aus und leitete Stufen ab: je nachdem, wie verlässlich das Ergebnis sein soll, 5, 10 oder 15 Wiederholungen. Zugleich stellte sie fest, dass sich diese festen Stufen bei einer Überprüfung an drei unabhängigen Datensätzen nicht übertragen ließen; der Autor sieht darin einen Grund, die nötige Zahl zunächst mit einem Probelauf für die eigenen Fragen zu bestimmen. Der Erstautor der St. Galler Studie und der Autor der zweiten Arbeit sind zugleich mit Anbietern von Software zur Messung von KI-Sichtbarkeit verbunden.

Was festgelegt und festgehalten wird

Vergleichbar sind die Ergebnisse nur, wenn sich zwischen zwei Messungen allein die Antworten ändern, nicht die Bedingungen, unter denen sie entstehen. Deshalb werden die Einstellungen einmal festgelegt und zu jeder Antwort mitgespeichert:

  • KI-Systeme: welche Systeme abgefragt werden, etwa ChatGPT, Gemini, Claude und Perplexity, und, wo es eine Wahl gibt, welches Modell und ob die Websuche eingeschaltet ist.
  • Region: aus welchem Land gefragt wird. Manche KI-Systeme leiten aus der IP-Adresse, also der Netzwerkadresse, von der eine Anfrage kommt, einen ungefähren Standort ab und können ihn bei Fragen mit Ortsbezug berücksichtigen. Die Forschenden aus St. Gallen weisen darauf hin, dass sich ihre in der Schweiz erhobenen Ergebnisse nicht ohne Weiteres auf andere Märkte übertragen lassen.
  • Sprache: welche Sprach- und Ländereinstellungen gelten, passend zur Sprache der Prompts und zum jeweiligen Markt.
  • Zugang: ob die Fragen über die Oberfläche der Apps gestellt werden, so wie Menschen sie nutzen, oder über eine Programmierschnittstelle (API), über die Software ein Sprachmodell direkt anspricht. Beides liefert nicht unbedingt dieselben Antworten: Über die API von OpenAI sucht ein Modell nur dann im Web, wenn die Websuche eigens eingerichtet ist, als Werkzeug oder über ein eigenes Suchmodell. In der Web-Oberfläche und den mobilen Apps von Claude gibt Anthropic dem Modell laut eigenen Angaben zusätzliche Anweisungen mit, die für die API nicht gelten. Die Studie aus St. Gallen fragte die Oberflächen ab, die fünf neu ausgewerteten Studien nutzten APIs.
  • Gesprächszustand: jede Frage in einem neuen Gespräch, ohne frühere Chats, gespeicherte Erinnerungen oder eigene Anweisungen, denn manche KI-Systeme wie Gemini beziehen diese je nach Einstellung in ihre Antworten ein.
  • Zeitpunkt und Version: Datum und Uhrzeit jeder Antwort und, wo angezeigt, die Modellversion. Eine gleichbleibende Versionsbezeichnung schließt stille Änderungen allerdings nicht aus: Anbieter können ihre Systeme anpassen, ohne die Version zu ändern, und Anthropic aktualisiert die Anweisungen, die Claude in der Web-Oberfläche und den mobilen Apps erhält, von Zeit zu Zeit.

Ändert sich der Messaufbau, etwa weil ein KI-System hinzukommt, wird die Änderung mit Datum vermerkt. So lässt sich später prüfen, ob ein Sprung in den Ergebnissen mit einer Änderung am Messaufbau zusammenfällt.

Aufzeichnen und auswerten

Gespeichert wird jede Antwort vollständig: der Antworttext, die angegebenen Quellen mit ihren Links und die Einstellungen, unter denen sie entstand. Die Auswertung prüft dann Antwort für Antwort, ob die Marke oder ein Wettbewerber genannt wird, auch in abweichenden Schreibweisen (eine Erwähnung), ob eine Seite der Marke als Quelle erscheint (ein KI-Zitat) und ob die Angaben über die Marke stimmen (Faktentreue von KI-Antworten). Übernimmt ein Sprachmodell diese Auswertung, gehört auch seine Anweisung zum festen Aufbau: Eine Übersichtsarbeit, die bisherige Methoden zur Messung von KI-Sichtbarkeit auswertet und im September 2026 ebenfalls als Vorabveröffentlichung erschien, weist darauf hin, dass schon eine andere Anweisung die Bewertung einer unveränderten Antwort ändern kann.

Aus den ausgewerteten Antworten entstehen Kennzahlen wie die Erwähnungsrate, für jedes KI-System getrennt. Erst ihr Verlauf über Wochen und Monate zeigt, wie sich die Sichtbarkeit einer Marke entwickelt; diese fortlaufende Beobachtung samt Berichten heißt GEO-Monitoring.