Trainingsdaten prägen, was ein KI-System über ein Unternehmen weiß, wenn es für eine Antwort keine Inhalte aus dem Web abruft. Die großen Sprachmodelle hinter ChatGPT, Gemini, Claude und Perplexity lernen aus ihnen, auch Fakten über Unternehmen, Produkte und Branchen. Was davon im Modell gespeichert bleibt, heißt parametrisches Wissen. Ein Beispiel: Haben Fachmedien, Verzeichnisse und die Website eines Herstellers von Industriepumpen vor dem Training viel über ihn veröffentlicht, kann ein Modell ihn später nennen, ohne etwas im Web abzurufen. Kam der Hersteller in den Trainingsdaten kaum vor, weiß das Modell wenig oder nichts über ihn.
Woraus Trainingsdaten bestehen
Anbieter stellen Trainingsdaten aus mehreren Arten von Quellen zusammen:
- Webinhalte: öffentlich zugängliche Seiten, die Crawler gesammelt haben. Crawler sind Programme, die Webseiten automatisch abrufen. Manche KI-Anbieter betreiben dafür eigene Crawler, etwa OpenAI mit GPTBot. Viele Sprachmodelle haben außerdem aus Common Crawl gelernt, einem frei verfügbaren Archiv von Webseiten, das eine gemeinnützige Organisation in großem Umfang sammelt. Laut einem Bericht der Mozilla Foundation vom Februar 2024 wurde die Mehrheit von 47 untersuchten Sprachmodellen aus den Jahren 2019 bis 2023 mit Daten aus Common Crawl trainiert.
- Ausgewählte Datensätze: Bücher, Nachschlagewerke wie Wikipedia und Datensätze, die Anbieter kaufen oder über Vereinbarungen erhalten.
- Daten aus der Nutzung: Anthropic etwa verwendet Gespräche mit Claude für das Training, wenn Nutzerinnen und Nutzer dem zugestimmt oder sie als Feedback eingereicht haben oder wenn sie als Verstoß gegen die Nutzungsrichtlinien markiert wurden.
- Synthetische Daten: Texte, die andere KI-Modelle erzeugt haben.
Wie sich diese Mischung bei kommerziellen Modellen genau zusammensetzt, legen die Anbieter nicht offen. Anthropic etwa nennt auf seinem Transparency Hub für seine Claude-Modelle nur die Arten von Quellen, keine Anteile oder einzelnen Websites. Genauer dokumentiert sind ältere Modelle sowie offene Modelle, deren Entwickler auch die Trainingsdaten veröffentlichen. Bei GPT-3 etwa, das OpenAI im Mai 2020 vorstellte, stammte der größte Teil der Trainingsdaten aus einer gefilterten Fassung von Common Crawl, ergänzt um eine weitere Websammlung, Bücher und die englischsprachige Wikipedia. Quellen, die die Forschenden für hochwertiger hielten, etwa Wikipedia, kamen im Training mehrfach zum Einsatz, der Anteil aus Common Crawl dagegen nicht einmal vollständig. Hinzu kommen kleinere, gezielt erstellte Datensätze, etwa von Menschen geschriebene Beispielantworten, mit denen Anbieter ein Modell nach dem ersten, breiten Training zu einem Assistenten machen, der Fragen beantwortet.
Nicht alles, was ein Crawler sammelt, landet im Training. Anbieter bereinigen und filtern die Texte vorher, wie Anthropic für seine Claude-Modelle angibt. Wie das aussehen kann, zeigt der offene Datensatz FineWeb, der im April 2024 erschien und auf Common Crawl beruht: Seine Entwicklerinnen und Entwickler sortierten unter anderem Seiten mit Inhalten für Erwachsene anhand einer Sperrliste aus, außerdem Texte, die Qualitätsregeln nicht erfüllten, etwa weil sie überwiegend aus sehr kurzen oder sich wiederholenden Zeilen bestanden. Eine Seite, die fast nur aus Stichpunkten oder Satzfragmenten ohne ganze Sätze besteht, kann an solchen Regeln scheitern.
Wie ein Unternehmen in Trainingsdaten gelangt
In Trainingsdaten gelangen kann alles, was öffentlich über ein Unternehmen zu lesen ist und von Crawlern erfasst werden darf: die Website des Unternehmens selbst, aber auch Fachartikel, Verzeichnisse, Bewertungen oder Wikipedia, also die Quellen, um die es bei Offpage-GEO geht. Seiten hinter einer Anmeldung, etwa in einem Kundenportal, erfassen Crawler in der Regel nicht; laut Anthropic ruft sein Crawler ClaudeBot keine passwortgeschützten Seiten ab.
Eine Studie, die 2023 auf der Fachkonferenz ICML vorgestellt wurde, zeigte: Sprachmodelle beantworten Faktenfragen umso treffender, je mehr Dokumente zum Thema der Frage in ihren Trainingsdaten standen. Wie gut ein Modell ein Unternehmen kennt, dürfte deshalb auch davon abhängen, wie oft das Unternehmen in den Trainingsdaten vorkommt. Für Unternehmen ist das ein Argument dafür, auf zutreffende und einheitliche Angaben an vielen Stellen zu achten, nicht nur auf der eigenen Website; darum geht es bei konsistenten Markeninformationen. Trainingsdaten reichen zudem nur bis zu einem bestimmten Zeitpunkt; bis zu welchem Datum ein Modell verlässlich Bescheid weiß, beschreibt sein Knowledge Cutoff. Was nach dem Ende der Trainingsdaten erscheint, kann erst ein späteres Modell aus dem Training kennen.
Die Entscheidung über das Training
Ob Inhalte der eigenen Website in künftige Trainingsdaten einfließen sollen, signalisiert ein Unternehmen in seiner robots.txt mit Regeln für Trainings-Crawler wie GPTBot von OpenAI oder ClaudeBot von Anthropic, die bei diesen Anbietern nicht die Crawler betreffen, mit denen KI-Systeme Quellen für ihre Antworten abrufen; bei Google gilt die Regel für Google-Extended dagegen zugleich dafür, ob die Gemini-Apps Inhalte für ihre Antworten nutzen dürfen. Wo die Grenzen einer solchen Regel liegen, etwa bei bereits gesammelten Inhalten oder bei Kopien auf fremden Websites, beschreibt der Begriff KI-Trainings-Opt-out.