BlogKI & Architektur

Vom Prompt zum System

Harness, Loop, Agent, Graph, Memory, Verifier: Wer KI-Diskussionen der letzten zwei Jahre halbwegs verfolgt hat, kennt diese Wörter, oft ohne sie ganz zu verstehen. Dahinter steckt kein beliebiger neuer Jargon, sondern eine überraschend einfache Verschiebung: von dem, was man einem Modell sagt, zu dem, was man um es herum entwickelt.

von Oli Feiler · 27. August 2026

Wer seit ein, zwei Jahren KI-Diskussionen mitliest, ist über Wörter wie Harness, Loop, Agent, Graph, Memory oder Verifier gestolpert, meist ohne dass jemand innehielt, um sie zu erklären. Dass ihre Bedeutung dabei unscharf bleibt, liegt auch daran, dass kaum ein Feld sein Vokabular derzeit schneller erweitert, als es sich setzen kann.

Ein Beispiel macht den eigentlichen Wandel dahinter greifbarer als jede Definition. Eine Berechtigung, die ein System schlicht nicht besitzt, lässt sich nicht erbitten, so überzeugend die Anfrage auch klingt: eine Positivliste erlaubter Aktionen kennt kein Argument, das sie umstimmen könnte. Diese Verschiebung von der sprachlichen zur architektonischen Grenze ist längst keine Frage der Sicherheit allein. Sie hat sich in den ganzen Wortschatz eingeschrieben, mit dem heute über die Entwicklung von KI-Anwendungen gesprochen wird. Vor drei Jahren drehte sich fast alles um das, was man einem Modell sagt. Heute drehen sich die meisten Gespräche darum, was man um ein Modell herum entwickelt.

Prompt Engineering war die Sprache einer frühen Phase

Im April 2023 veröffentlichte die Designagentur Edenspiekermann beispielsweise einen Beitrag darüber, wie ihr Team mit KI arbeitet (1). Sechs Rollen für ein Sprachmodell, Ideengeber, Berater, Analyst, Lehrer, jede mit einem Beispielsatz zum Nachtippen, und einer zentralen Faustregel: je besser die Anweisung, desto besser die Antwort. Das war nicht falsch, es war nur an eine bestimmte Vorstellung der Technik gebunden, Mensch und Modell auf getrennten Seiten, dazwischen ein Satz, den man möglichst geschickt formulieren musste.

Dieses Bild passt weiterhin auf eine einzelne Anfrage. Es erklärt nur immer weniger, sobald ein Modell länger an einer Aufgabe bleibt: Es muss wissen, was bereits geschehen ist, Werkzeuge nutzen, Fehler bemerken und einen zweiten Versuch starten. Keine dieser Fähigkeiten entsteht durch einen eleganteren Prompt, wie man eine Aufgabe stattdessen beauftragt statt nur zu erbitten, ist die praktische Seite dieser Geschichte. Hier geht es um die andere Seite: die Architektur, die einen solchen Auftrag überhaupt erst ausführbar macht.

Agent gleich Modell plus Harness

Das ReAct-Verfahren von Yao und Kollegen verband 2022 das Schlussfolgern eines Sprachmodells mit seinem Handeln, in einer sich wiederholenden Abfolge aus Gedanke, Aktion und Beobachtung (2). Genau diese Abfolge meint man heute mit einem Loop, kein Bild für etwas Rundes, sondern ein Ablauf, der sich wiederholt, bis eine Aufgabe erledigt ist oder das System aufgibt.

LangChain bringt das inzwischen auf eine kurze Formel: Agent = Model + Harness (3). Harness bezeichnet unter anderem das Pferdegeschirr, ein Wort, das die Softwaretechnik schon lange vor Sprachmodellen für die Skripte und Infrastruktur nutzte, die Code kontrolliert ausführen. Gemeint ist die Konstruktion rund um das Modell: Werkzeuge, Berechtigungen, gespeicherte Zustände, Regeln dafür, wann ein Mensch eingreifen muss. Das Pferd bleibt Kraft ohne Richtung, das Geschirr macht daraus Arbeit.

Wie viel an diesem Geschirr hängt, zeigte OpenAI im Juli 2026 an ein und demselben Modell. Auf dem Benchmark ARC-AGI-3 erreichte GPT-5.6 Sol mit dem offiziellen Testaufbau 13,3 Prozent. Mit einem anderen Harness, ohne jede Änderung an Modell oder Training, nur mit über mehrere Schritte hinweg erhaltenem Reasoning und verdichtetem statt abgeschnittenem Verlauf, stieg der Wert auf 38,3 Prozent (4). Keine neue Version, fast eine Verdreifachung. Damit wird selbst die vermeintlich einfache Frage nach der Leistungsfähigkeit eines Modells zu einer Architekturfrage.

Je menschlicher das Wort, desto weniger Mensch die Sache

Ein Agent hat Memory. Er kann reflektieren. Ein Verifier prüft sein Ergebnis. Das klingt nach einer Maschine mit immer menschenähnlicheren inneren Fähigkeiten.

Technisch ist meist das Gegenteil der Fall. Was Memory heißt, ist häufig eine Datenbank oder ein gespeicherter Zustand, dessen relevante Teile bei der nächsten Anfrage in den Kontext zurückgespielt werden, das Modell erinnert sich nicht, das System erinnert für das Modell. Das 2023 vorgestellte Reflexion-Verfahren von Shinn und Kollegen lässt ein Modell die eigene letzte Antwort kritisieren und daraus eine bessere nächste ableiten, ohne dass sich an den Gewichten etwas ändert, die Verbesserung liegt im gespeicherten Text, nicht im Modell (5). Und ein Verifier kann schlicht ein zweiter Modellaufruf, ein Test oder eine feste Regel sein, die von außen entscheidet, ob ein Ergebnis zählt.

Je menschlicher das Vokabular klingt, desto stärker verlagern wir entscheidende Fähigkeiten aus dem Modell in technische Strukturen daneben. Das ist keine Enttäuschung. Es ist die eigentliche Pointe dieses neuen Wortschatzes.

Ein Graph denkt nicht

Als LangChain Anfang 2024 sein Framework LangGraph vorstellte, ging es um zyklische Graphen für Agenten-Systeme (6). Eine Aufgabe wird nicht mehr als lineare Abfolge von Prompt und Antwort behandelt, sondern als Netz aus Zuständen: Ein Zwischenschritt kann eine menschliche Freigabe verlangen, eine gescheiterte Prüfung führt eine Kante zurück zu einem früheren Zustand, erfolgreiche Schritte lassen sich speichern, damit die Arbeit nach einer Unterbrechung weiterläuft.

Der Graph macht das Modell nicht intelligenter, er macht den Ablauf explizit, mit Bedingungen, Rechten und Abbruchkriterien, die weiterhin klassische, vorhersehbare Software sein können, um ein Modell herum, das genau das nicht ist.

Das Modell wird zum Bauteil

Die Frage „welches Modell verwendet ihr“ bleibt wichtig. Sie reicht nur immer seltener aus. Zwei Anwendungen können dasselbe Modell nutzen und sich fundamental unterscheiden: Die eine verliert nach wenigen Schritten den Zusammenhang, die andere verdichtet ihren Kontext. Eine übernimmt die erste erzeugte Antwort, die andere prüft sie mit einem zweiten Modellaufruf. Auf dem Datenblatt steht in beiden Fällen derselbe Modellname.

Das erklärt, warum sich die Aufmerksamkeit agentischer KI-Entwicklung zunehmend vom perfekten Prompt auf Werkzeugdesign, Berechtigungen und Orchestrierung verschiebt. LangChain verbesserte seinen Coding-Agenten bei Terminal-Bench 2.0 allein durch Änderungen am Harness von 52,8 auf 66,5 Punkte, ohne das Modell selbst zu berühren (7). Ein schlechter Prompt bleibt trotzdem ein schlechter Prompt. Nur kann selbst der beste Prompt keine fehlende Rechteverwaltung ersetzen, keinen verlorenen Zustand rekonstruieren und nicht verhindern, dass ein System eine Aktion ausführt, die es gar nicht hätte ausführen dürfen.

Der Prompt bleibt an der Tür

Prompt Engineering war deshalb vermutlich weniger eine falsche Idee als die Sprache einer frühen Phase, in der Sprachmodelle vor allem als Gegenüber erlebt wurden. Jetzt arbeiten sie innerhalb größerer Softwaresysteme, und damit kehren Fragen zurück, die die Informatik seit Jahrzehnten kennt: Zustand, Rechte, Kontrollfluss, Persistenz, Tests. Neu ist nur, dass mitten in diesen vorhersehbaren Strukturen eine Komponente sitzt, deren Verhalten sich nie ganz vorausberechnen lässt. Vielleicht braucht es deshalb all diese neuen Wörter: weil das Sprachmodell allein nicht mehr bezeichnet, was wir eigentlich entwickeln.

Der Prompt bleibt wichtig. Aber er ist nur noch der Satz an der Tür. Das System ist das Haus dahinter.

Hinweis

Zuletzt aktualisiert am 16. September 2026.

Mehr zu Künstlicher Intelligenz

 alt=

Ein gutes Modell ist noch kein gutes System.

Wir entwickeln KI-Anwendungen als kontrollierbare Softwaresysteme, mit Kontext, Werkzeugen, Berechtigungen und der Frage, an welcher Stelle ein Mensch entscheiden muss.
Oli Feiler, Geschäftsführer