Fragt jemand ChatGPT, Gemini, Claude oder Perplexity nach einem guten Anbieter in der Region oder bittet um einen Vergleich zweier Produkte, formuliert ein Large Language Model (LLM), auf Deutsch großes Sprachmodell, die Antwort, einschließlich der Unternehmen, die darin vorkommen. Wer verstehen will, wie ein Angebot in KI-Antworten erscheint, sollte deshalb wissen, wie ein LLM entsteht und wie es schreibt.
Was ein Sprachmodell „groß“ macht
Ein Sprachmodell berechnet, welches Textstück mit welcher Wahrscheinlichkeit als Nächstes folgt. Diese Textstücke heißen Tokens; ein Token ist oft ein Wort, manchmal nur ein Wortteil oder ein einzelnes Zeichen. Die Parameter eines Sprachmodells sind oft Milliarden von Zahlenwerten, die beim Training Schritt für Schritt angepasst werden, damit das Modell immer treffender vorhersagt, wie ein Text weitergeht.
„Groß“ bezieht sich auf die Zahl dieser Parameter und auf die Menge an Text, aus der ein Modell lernt; eine feste Grenze gibt es nicht. Zur Einordnung: GPT-3, das OpenAI im Mai 2020 vorstellte, hatte 175 Milliarden Parameter. Für spätere Modelle nennen Anbieter solche Zahlen oft nicht mehr, OpenAI etwa im März 2023 bei GPT-4.
Wie ein LLM entsteht
Ein LLM entsteht in zwei Schritten:
- Vortraining: Das Modell verarbeitet riesige Textmengen und lernt dabei, jeweils das nächste Token vorherzusagen. So eignet es sich an, wie Sprache funktioniert und wie Begriffe zusammenhängen, und nimmt viele Fakten auf, auch über Unternehmen und Produkte. Diese Texte gehören zu seinen Trainingsdaten; was davon im Modell gespeichert bleibt, heißt parametrisches Wissen und reicht nur bis zu einem Stichtag, seinem Knowledge Cutoff.
- Feinabstimmung (Fine-Tuning): Ein nur vortrainiertes Modell setzt Texte fort, beantwortet Fragen aber nicht von sich aus gut. Die Anbieter trainieren es deshalb weiter, unter anderem mit Beispielantworten, die Menschen geschrieben haben, und mit Bewertungen, bei denen Menschen mehrere Antworten des Modells nach ihrer Qualität ordnen. Das Training mit solchen Bewertungen heißt Reinforcement Learning from Human Feedback (RLHF). Erst dadurch beantwortet das Modell Fragen wie ein Assistent, befolgt Anweisungen und hält sich an die Vorgaben seines Anbieters.
Die Feinabstimmung prägt, wie ein Modell antwortet: wie ausführlich, wie vorsichtig und ob es Unsicherheit offen benennt, auch in Antworten über Unternehmen und Produkte. Weil jeder Anbieter seine Modelle mit eigenen Daten und Vorgaben trainiert, kann dieselbe Frage in verschiedenen KI-Systemen unterschiedlich beantwortet werden.
Wie ein LLM eine Antwort schreibt
Die Eingabe, auf die ein LLM antwortet, heißt Prompt. Daraus erzeugt das Modell seine Antwort Token für Token: Es berechnet, welche Fortsetzung wahrscheinlich passt, hängt ein Token an und wiederholt das, bis die Antwort steht. Ein LLM schlägt also nicht in einer Datenbank nach, sondern formuliert jede Antwort neu. Deshalb kann es flüssig und überzeugend formulieren, was nicht stimmt, eine sogenannte Halluzination. Weil es bei der Wahl der Fortsetzung zudem einen gewissen Spielraum hat, kann dieselbe Frage zu unterschiedlichen Antworten führen, die sogenannte Antwortvariabilität.
Ein LLM allein kann keine Webseiten aufrufen; es kennt nur, was es im Training gelernt hat und was in seiner Eingabe steht. Damit Antworten aktuelle Informationen enthalten können, geben KI-Assistenten wie ChatGPT, Gemini, Claude und Perplexity dem zugrunde liegenden Modell Zugang zu Inhalten aus dem Web: Je nach System entscheidet das Modell selbst, ob es solche Inhalte anfordert, oder sie werden bei jeder Frage abgerufen. Abgerufen werden sie von der Software rund um das Modell, die sie ihm zusammen mit der Frage übergibt. Dieses Verfahren heißt Retrieval-Augmented Generation (RAG); das Modell stützt seine Antwort dann auf die abgerufenen Quellen und kann sie als KI-Zitate angeben.
Was das für die Sichtbarkeit deines Angebots bedeutet
Was ein LLM über dein Unternehmen schreibt, stammt aus seinem parametrischen Wissen, aus abgerufenen Inhalten oder aus beidem. Für deine KI-Sichtbarkeit zählen deshalb zwei Wege: was künftige Modelle im Training lernen und was KI-Systeme im Moment der Frage abrufen und als Quelle angeben können. Einen Eintrag, den ein Unternehmen direkt bearbeiten könnte, gibt es in einem LLM nicht. Mit einer neuen Modellversion kann sich außerdem ändern, wie ein KI-System ein Angebot darstellt, auch wenn die veröffentlichten Inhalte gleich geblieben sind.
Abgrenzung zu verwandten Begriffen
- Sprachmodell: der weitere Begriff, der auch kleinere und ältere Modelle umfasst. Im Alltag sind mit Sprachmodellen meist LLMs gemeint.
- Generative KI: der Oberbegriff für KI-Modelle, die neue Inhalte wie Texte, Bilder, Audio oder Videos erzeugen. LLMs sind eine Form generativer KI, die vor allem Text erzeugt.
- Basismodell (Foundation Model): ein Modell, das mit breit gefächerten Daten in großem Umfang trainiert wurde und sich an viele Aufgaben anpassen lässt, etwa ein LLM oder ein Modell, das Bilder erzeugt.
- KI-Assistent: das Produkt, mit dem Menschen sprechen. Es baut auf einem oder mehreren LLMs auf und ergänzt sie um Funktionen wie den Abruf von Webinhalten; ein KI-System, das so Inhalte abruft und daraus Antworten formuliert, heißt auch Generative Engine. Bei Gemini und Claude tragen Assistent und Modellfamilie denselben Namen. Welches Modell antwortet, kann wechseln: Perplexity etwa setzt je nach Frage unterschiedliche Modelle ein, auch solche anderer Anbieter.