Ein KI-Agent beantwortet nicht nur eine Frage, sondern erledigt eine Aufgabe. Ein Beispiel: Jemand bittet einen Agenten, drei Anbieter von Software für die Zeiterfassung zu vergleichen, die zu einem Team mit 20 Personen passen, und beim am besten geeigneten Anbieter eine Produktvorführung anzufragen. Der Agent ermittelt infrage kommende Anbieter, öffnet ihre Websites, liest Preis- und Funktionsseiten, stellt die Ergebnisse gegenüber und füllt am Ende das Anfrageformular aus. Welchen Schritt er als Nächstes geht, entscheidet er jeweils anhand dessen, was er im vorigen Schritt herausgefunden hat. Google beschreibt KI-Agenten in seiner Dokumentation für Website-Betreiber als autonome Systeme, die im Auftrag von Menschen Aufgaben erledigen können, etwa eine Reservierung buchen oder die technischen Daten von Produkten vergleichen.
Im Kern eines KI-Agenten arbeitet ein Sprachmodell, das Werkzeuge nutzen kann. Anthropic beschreibt Agenten in seinem Beitrag „Building effective agents“ vom Dezember 2024 als Systeme, in denen Sprachmodelle ihre Abläufe und den Einsatz von Werkzeugen selbst steuern. Der weitere Begriff agentische KI (englisch „Agentic AI“) bezeichnet das ganze Feld solcher Systeme; ein KI-Agent ist ein einzelnes System daraus.
Wie ein KI-Agent arbeitet
Ein Agent arbeitet in einer Schleife. Laut Anthropic sind Agenten meist schlicht Sprachmodelle, die Werkzeuge anhand der Rückmeldungen aus ihrer Umgebung einsetzen, Schritt für Schritt:
- Auftrag: Eine Person gibt ein Ziel vor, als einzelne Anweisung oder im Gespräch.
- Planen: Das Modell zerlegt das Ziel in Schritte.
- Handeln: Es setzt ein Werkzeug ein, öffnet etwa eine Webseite im Browser oder fragt Daten über eine Schnittstelle ab.
- Prüfen: Es wertet das Ergebnis aus, zum Beispiel den Inhalt der geöffneten Seite, und entscheidet über den nächsten Schritt.
- Abschließen oder nachfragen: Ist das Ziel erreicht, endet die Aufgabe. Braucht der Agent weitere Angaben oder eine Einschätzung oder kommt er nicht weiter, wendet er sich an die Person.
Welche Werkzeuge ein Agent hat, legt sein Anbieter fest. Als OpenAI im Juli 2025 den ChatGPT-Agenten vorstellte, nannte das Unternehmen einen visuellen Browser, der Websites über ihre grafische Oberfläche bedient, einen textbasierten Browser für einfachere Abrufe, ein Terminal zum Ausführen von Befehlen und direkten Zugriff auf Programmierschnittstellen (APIs); all das läuft auf einem eigenen virtuellen Computer des Agenten. Werkzeuge können auch Schnittstellen von Unternehmen sein. Offene Standards wie das Model Context Protocol (MCP), das Anthropic im November 2024 vorgestellt hat, verbinden KI-Anwendungen mit solchen Werkzeugen und Datenquellen.
Agentische Funktionen gibt es in vielen KI-Systemen, etwa in ChatGPT, im automatischen Browsen von Gemini in Chrome, in der Browsererweiterung Claude in Chrome und im Browser Comet von Perplexity. Namen und Verfügbarkeit solcher Funktionen ändern sich häufig: Das automatische Browsen in Gemini in Chrome steht laut Google (Stand: Oktober 2026) nur in den USA und mit einem Abo von Google AI Pro oder Google AI Ultra zur Verfügung.
Unterschied zur Chat-Antwort und zum Fetcher
In einem gewöhnlichen Chat gibt eine Person einen Prompt ein und erhält eine Antwort. Das KI-System ruft dafür unter Umständen Inhalte aus dem Web ab, doch das Ergebnis ist ein Text, und die nächste Frage stellt wieder die Person. Ein KI-Agent arbeitet dagegen mehrere Schritte selbstständig ab und zielt auf ein Ergebnis außerhalb des Chats: ein ausgefülltes Formular, eine Reservierung, einen fertigen Vergleich. Anthropic nennt als Einsatzgebiet von Agenten offene Aufgaben, bei denen sich kaum oder gar nicht vorhersagen lässt, wie viele Schritte nötig sind, und sich kein fester Ablauf vorgeben lässt.
Vom User-triggered Fetcher unterscheidet sich ein Agent in seiner Rolle. Ein solcher Fetcher ist das Programm eines KI-Anbieters, das eine bestimmte Seite abruft, weil jemand in einem KI-System eine Frage stellt, einen Link teilt oder einen Auftrag erteilt; seine Anfrage ist das, was bei der Website ankommt. Der Agent ist das System, das die Schritte plant und Seiten bedient: Er wechselt zwischen Seiten, klickt auf Schaltflächen, füllt Formulare aus und meldet sich bei Websites an, wenn die Person es erlaubt. Ein einzelner Abruf für eine Chat-Antwort liest eine Seite dagegen nur. Auch die Seitenaufrufe eines Agenten können eine Website als Anfragen eines User-triggered Fetchers erreichen, bei Agenten auf Googles Infrastruktur etwa als Google-Agent.
Was KI-Agenten für GEO bedeuten
Bei GEO geht es vor allem darum, ob und wie ein Angebot in den Antworten von KI-Systemen vorkommt, also um seine KI-Sichtbarkeit. Mit KI-Agenten kann eine zweite Frage hinzukommen: ob ein Agent die Website eines Anbieters nutzen kann. Vergleicht ein Agent im Auftrag einer Person Angebote oder bucht einen Termin, kommt es darauf an, dass er Preise, Leistungen und freie Termine findet, ein Formular versteht und die Aufgabe abschließen kann. Scheitert er an einer Website, kann die Aufgabe dort abbrechen oder bei einem anderen Anbieter weiterlaufen. Ob und wie stark sich Sichtbarkeit dadurch verschiebt, ist nicht belegt.
Laut Google können Browser-Agenten, also Agenten, die selbst einen Browser steuern, eine Website über Screenshots, den Aufbau der Seite im Browser und den Accessibility Tree wahrnehmen, die vereinfachte Fassung einer Seite, die auch Screenreader nutzen. Was eine Website für sie lesbar und bedienbar macht, beschreibt der Begriff agentenfreundliche Website; vieles davon deckt sich mit digitaler Barrierefreiheit. Die Erwähnung bleibt dabei wichtig: Bevor ein Agent ein Angebot einbezieht, muss er es kennen oder finden.
Grenzen
KI-Agenten sind eine junge Technik. OpenAI schrieb beim Start des ChatGPT-Agenten im Juli 2025, er stehe noch am Anfang und könne Fehler machen, und laut Google ist Gemini in Chrome als Agent eine experimentelle Funktion. Anthropic weist darauf hin, dass die Eigenständigkeit von Agenten höhere Kosten und das Risiko sich aufschaukelnder Fehler mit sich bringt. Ein Fehler in einem Schritt kann sich durch die folgenden ziehen, weil jeder Schritt auf dem vorigen aufbaut. Ein bekanntes Risiko sind außerdem versteckte Anweisungen auf Webseiten, etwa in unsichtbaren Elementen oder Metadaten, die einen Agenten zu ungewollten Aktionen verleiten sollen. Diese sogenannte Prompt Injection behandeln OpenAI und Anthropic als Angriff und trainieren ihre Agenten darauf, ihr zu widerstehen.