Ein Glossar ist kein Essay, und dieses hier verzichtet bewusst auf einen roten Faden. Wer nachschlägt, will die Antwort, nicht die Herleitung dorthin. Trotzdem gilt für jeden der folgenden Einträge dieselbe Regel: Herkunft und Funktion gehören zusammen. Ein Wort, das man nur definiert, ohne zu wissen, woher es kommt, bleibt halb verstanden, und ein Wort, dessen Geschichte man kennt, ohne seine heutige Funktion zu verstehen, ist nur eine Anekdote.
Der Name ist ein Kofferwort aus ablate, chirurgisch entfernen, und obliterate, auslöschen, geprägt vom pseudonymen Entwickler FailSpy, der 2024 die erste Softwarebibliothek dafür veröffentlichte. Die Grundlage lieferten Andy Arditi und Kollegen im selben Jahr: Sie zeigten, dass die Weigerung eines offenen Sprachmodells, eine schädliche Anfrage zu beantworten, sich auf eine einzige, auffindbare Richtung im internen Aktivierungsraum des Modells zurückführen lässt (1).
Wird genau diese Richtung aus den Gewichten herausprojiziert, verschwindet mit ihr die Fähigkeit abzulehnen, ohne dass ein einziges Trainingsbeispiel neu gerechnet werden muss. Seit Anfang 2025 gehört die Veröffentlichung eines derart „enthemmten“ Modells zur Routine, sobald ein neues offenes Modell erscheint (2). Wochen an Sicherheitstraining lassen sich damit von einer einzigen linearen Rechnung aufheben, was Abliteration zu einem der ernsteren Sicherheitsprobleme offener Modelle macht, seit die Methode bekannt ist.
Agent kommt aus der Handlungstheorie, jenem Zweig der Philosophie, der seit Aristoteles fragt, was es heißt, aus eigenem Antrieb zu handeln statt nur zu reagieren (3). Die Softwareforschung lieh sich das Wort bereits in den 1990er-Jahren für Programme, die selbstständig Ziele verfolgen, lange vor jedem Sprachmodell (4). Ein Thermostat, der die Heizung regelt, war in diesem Sinn schon ein Agent.
Was sich 2022 änderte, war nicht das Wort, sondern die Technik dahinter. Das ReAct-Verfahren verschränkte erstmals systematisch das Denken eines Sprachmodells mit seinem Handeln, in einer sich wiederholenden Abfolge aus Gedanke, Aktion, Beobachtung (5). Ein Chatbot beantwortet eine Frage, ein Agent bearbeitet eine Aufgabe, und zwischen beiden liegt genau diese Schleife. Mehr zur operativen Seite, dem Unterschied zwischen Prompt und Auftrag, in KI-Agenten: Vom Prompt zur Delegation, mehr zur sprachgeschichtlichen Seite in Vom Prompt zum System.
Eine Agent Card ist eine maschinenlesbare Selbstbeschreibung: Sie legt fest, was ein Agent anbietet, wie er erreichbar ist und welche Sicherheitsmechanismen er mitbringt, ähnlich einer Visitenkarte, die statt eines Jobtitels eine Liste von Fähigkeiten trägt. Im Agent-to-Agent-Protokoll (A2A) ist sie der Mechanismus, über den ein Agent einem anderen mitteilt, was er kann, ohne dass jemand das vorher hartcodiert haben muss. Signaturen können Herkunft und Unverändertheit einer solchen Karte prüfen, die schwierigere Frage, wie viel Vertrauen sich über mehrere Weiterleitungsstufen hinweg übertragen darf, beantwortet das Format allein nicht. Ausführlich in Von der API zur Agententopologie: MCP und A2A.
Align geht auf französisch aligner zurück, aus lateinisch ad und linea, Linie: etwas in eine Linie bringen. In der KI-Entwicklung heißt Alignment die Ausrichtung eines Modells an dem, was Menschen von ihm wollen, hilfreich, wahrhaftig, unschädlich, mehr im Klartext als in der Wortgeschichte. RLHF und Constitutional AI sind zwei ihrer Werkzeuge (6), so wie eine Straße noch kein Kompass ist, nur weil sie in die richtige Richtung führt. Ausführlich in Wie Sprachmodelle trainiert werden.
Annotare setzt sich aus ad und notare zusammen, das wiederum auf nota zurückgeht, das Merkzeichen (7). Annotieren heißt wörtlich: an den Rand schreiben, eine der ältesten wissenschaftlichen Tätigkeiten überhaupt, von den alexandrinischen Scholien bis zur mittelalterlichen Glosse. Beim Training von KI-Systemen ist das Verhältnis gekippt: Die Notiz ist die Hauptsache geworden. Wer heute annotiert, entscheidet, ob ein Bild einen Fußgänger zeigt oder welche von zwei Modellantworten die bessere ist, oft für einen Stundenlohn im niedrigen einstelligen Dollarbereich (8). Die ganze Geschichte, mit Namen und Ort, in Wie Sprachmodelle trainiert werden.
„Daten“ heißt „das Gegebene“. Das Wort ist der Plural von datum, dem Partizip Perfekt von dare, geben, und bezeichnete bei Euklid die gegebenen Größen einer Aufgabe im Unterschied zu den gesuchten. Der Historiker Daniel Rosenberg hat gezeigt, dass der Begriff von Anfang an rhetorisch funktionierte: Er sagt nichts darüber, ob etwas wahr ist, sondern nur, dass es vor dem Argument liegt und deshalb nicht mehr verhandelt wird (9). An Trainingsdaten ist nichts gegeben. Sie werden gesammelt, lizenziert, gefiltert und beschriftet, und das Wort behauptet eine Selbstverständlichkeit, die die Sache nie hatte. Wer „Daten“ sagt, muss nicht erklären, woher sie kommen.
Embed heißt einbetten, von bed, Bett, ein Ding fest in eine umgebende Masse setzen. In der Mathematik meint Embedding eine Einbettung, die Struktur eines kleineren Raums bleibt beim Übergang in einen größeren erhalten. Bengio und Kollegen übertrugen das Prinzip 2003 erstmals systematisch auf Sprache: Wörter wurden nicht länger als unverbundene Symbole behandelt, sondern in einen gemeinsamen Zahlenraum eingebettet, in dem Nähe etwas über Bedeutung verrät (10). Word2vec machte daraus 2013 ein Verfahren, das jedem Wort genau einen solchen Ort zuweist (11). Ein Embedding ist damit die Adresse, nicht das Wort selbst, sie liegt zwischen dem Token und der eigentlichen Rechenarbeit des Modells. Mehr dazu in Wie Sprachmodelle funktionieren und Was ist ein Token?
„Gewicht“ und „bewegen“ teilen dieselbe germanische Wurzel, wegan, die ursprünglich beides zugleich meinte: etwas in Bewegung setzen und dabei seine Schwere spüren. Frank Rosenblatt übernahm das Wort 1958 für sein Perzeptron fast wörtlich: Jede Verbindung zwischen zwei künstlichen Neuronen bekam ein Gewicht, eine Zahl, die bestimmt, wie stark der Ausschlag des einen den nächsten bewegt (12). Ein aktuelles Sprachmodell besteht aus nichts anderem als solchen Zahlen, häufig mehreren hundert Milliarden, in einer Matrix nach der anderen. Trainiert wird nicht der Text, trainiert werden die Gewichte, der Text ist nur das Mittel, sie einzustellen.
Graph kommt vom griechischen graphein, schreiben, zeichnen, derselben Wurzel wie Grafik oder Biografie. Als eigene mathematische Disziplin beginnt die Graphentheorie 1736, als Leonhard Euler bewies, dass ein Spaziergang über alle sieben Brücken Königsbergs, jede genau einmal, unmöglich ist, und dafür Orte als Knoten und Brücken als Kanten abstrahierte (13). Als LangChain 2024 sein Framework LangGraph vorstellte, war die Wortwahl eine Ansage: Ein Agent ist kein linearer Prompt mehr, sondern ein Netz aus Zuständen, die sich verzweigen, parallel laufen und bei Bedarf auf einen Menschen warten können. Die Kontrolle wandert vom Fließtext in eine Struktur, die man zeichnen kann.Kaum hatte sich diese Lesart durchgesetzt, geriet auch sie schon in Bewegung: Mitte 2026 begann die Branche, denselben Fortschritt unter dem Namen Graph Engineering zu verhandeln, der jüngsten Station einer Begriffskaskade, die bei Prompt Engineering begann. Ausführlich in Vom Prompt zum System.
Guardrails, deutsch Leitplanken, sind der Sammelbegriff für alles, was ein KI-System von unerwünschten Handlungen abhält, von der Systemanweisung über das Refusal-Training bis zum mitlesenden Klassifikator. Der Begriff selbst ist eine unkomplizierte Übertragung aus dem Straßenbau: Eine physische Leitplanke verhandelt nicht, sie hält ein Fahrzeug einfach auf der Straße. Genau diese Nüchternheit ist auch der Anspruch an ihr digitales Gegenstück, auch wenn, wie sich zeigt, keine einzelne Schicht davon für sich allein verlässlich hält. Ausführlich in Wie Sprachmodelle begrenzt werden.
Alucinari heißt im Lateinischen träumen, im Wachen faseln, davon leitet sich auch das medizinische „Halluzination“ für Wahrnehmungen ohne Reiz ab. Bei Sprachmodellen ist die Übertragung nicht ganz sauber: Ein Modell nimmt nichts wahr, es vervollständigt nur, was statistisch am plausibelsten wirkt, ob es stimmt oder nicht. Genau deshalb bevorzugen manche Fachleute inzwischen „Konfabulation“, einen Begriff aus der Psychiatrie für das überzeugte Erzählen erfundener Erinnerungen, näher am tatsächlichen Vorgang. Beide Wörter beschreiben dasselbe Symptom mit einer anderen Diagnose. Zur Wortgeschichte der verwandten Gleis-Metapher ausführlich in Wie Sprachmodelle funktionieren.
Wie viel an diesem Geschirr hängt, zeigte OpenAI im Juli 2026: Mit einem veränderten Harness, ohne jede Änderung an den Modellgewichten, stieg das Ergebnis von GPT-5.6 Sol auf dem Benchmark ARC-AGI-3 von 13,3 auf 38,3 Prozent (15). Das Pferd bleibt Kraft ohne Richtung, das Geschirr macht daraus Arbeit. Ausführlich in Vom Prompt zum System, zum Zusammenspiel mit Context und Loop auch in Von Prompt-Engineering zu Loop-Engineering.
Woher hijack genau kommt, weiß niemand mit Sicherheit, was für ein Wort mit derart präziser Bedeutung ungewöhnlich ist. Es taucht um 1920 im amerikanischen Slang der Prohibitionszeit auf, zunächst für den Raubüberfall auf Lastwagen mit Schwarzgebranntem, spätestens 1931 für die erste bekannte Flugzeugentführung (16). In der KI-Sicherheit hat sich der Begriff für die agentische Steigerung der Prompt Injection eingebürgert: versteckte Anweisungen in einer Website oder Datenbank, die ein System gegen die Absicht seines eigenen Nutzers handeln lassen, Hijacking eben, nur dass diesmal kein Fahrzeug, sondern ein Auftrag entführt wird (17). Das US-Institut NIST bewertet solche Agent-Hijacking-Angriffe seit 2025 systematisch, ein Indiz für den Ernst der Lage.
Jail-break ist seit 1828 belegt, schlicht aus jail und break, der Ausbruch aus dem Gefängnis (18). 2007 bekam das Wort eine zweite Bedeutung: George Hotz und andere Hacker knackten die Softwaresperren des ersten iPhones und befreiten es aus dem, was Apple vorgeschrieben hatte. Auf Sprachmodelle übertragen bezeichnet es seit etwa 2022 das Umgehen der eingebauten Ablehnung, oft mit denkbar sanften Mitteln: Man bittet das Modell, die verstorbene Großmutter zu spielen, die ihrem Enkel zum Einschlafen etwas vorliest, das sie beruflich auswendig kannte, und die eingeübte Hilfsbereitschaft wird gegen die eingeübte Vorsicht in Stellung gebracht (19). Dreimal dieselbe Bewegung: aus der Zelle, aus dem Gerät, aus der eigenen Vorsicht. Ausführlich in Wie Sprachmodelle begrenzt werden.
Classis bezeichnete im römischen Zensus die Einteilung der Bürger nach Vermögen, Grundlage für Steuerpflicht und Aushebung. Ein Klassifikator ist, wörtlich genommen, jemand oder etwas, das diese Einteilung vornimmt. In der KI-Sicherheit sind Klassifikatoren eigene, kleinere Modelle, die Eingaben und Ausgaben prüfen, bevor sie durchgelassen werden, eine von mehreren Schutzschichten unter dem Sammelbegriff Guardrails. Man unterscheidet zwei Bauarten: Der Input Classifier prüft die Anfrage, bevor sie das eigentliche Modell erreicht, der Output Classifier liest die Antwort mit, Wort für Wort, während sie entsteht, und kann mitten im Satz abbrechen. Anthropics erste Generation solcher Klassifikatoren senkte die Erfolgsquote von Angriffen auf ein Sprachmodell von 86 auf 4,4 Prozent, eine Nachfolgegeneration hält den Schutz seit Anfang 2026 bei deutlich geringeren Kosten (20). Ausführlich in Wie Sprachmodelle begrenzt werden.
Den Begriff prägten die Biologen Paul Ehrlich und Peter Raven 1964 für Schmetterlinge und ihre Futterpflanzen: Die Pflanze entwickelt ein Gift, der Schmetterling entwickelt eine Resistenz dagegen, und beide Arten verändern sich fortlaufend als Reaktion aufeinander (21). Für Sprachmodelle und ihre Nutzer ist derselbe Begriff inzwischen wörtlich zutreffend. Als das englische Verb delve nach 2022 zum bekanntesten KI-Signalwort wurde, stieg seine Häufigkeit auch in menschlicher Alltagssprache messbar an, und als es als Verräterwort öffentlich benannt wurde, sank sie in beiden wieder (22). Wir prägen die Sprache der Maschine, und sie prägt unsere. Ausführlich in Die Sprache der KI.
Corpus heißt Körper, und ein Textkorpus ist genau das: ein zusammenhängender, systematisch gesammelter Textkörper, an dem sich etwas über Sprache ablesen lässt. Zu den ersten dieser Art gehört der 1964 an der Brown University zusammengestellte Brown Corpus, eine Million Wörter amerikanischen Englisch, elektronisch lesbar zu einer Zeit, in der das eine Seltenheit war (23). Ein Sprachmodell lernt aus nichts anderem als einem sehr viel größeren solchen Körper, Abermilliarden Sätze, aus denen es seine Landkarte der Wortbedeutungen zieht. Das Korpus ist damit nicht Beiwerk des Trainings, es ist sein einziger Rohstoff. Mehr zur Zusammensetzung dieser Korpora in Die Sprache der KI.
„Lehen“ ist ablautend mit „leihen“ verwandt und meint das Verliehene, das man gegen eine Verpflichtung hält, nicht besitzt (24). Im mittelalterlichen Lehnswesen band der Lehnsherr seinen Vasallen über genau diese Konstruktion: Land, Amt oder Recht wurden gewährt, nie übereignet. Die KI-Welt hat dieses Vokabular geerbt, ohne es zu wissen, Tenant, Token und viele andere Begriffe stammen aus verwandten Feldern des Haltens ohne Besitzen. Selbst das Wort für diese Beobachtung gehört zum Lehnswesen: Entlehntes ist geliehen, nicht geschenkt.
Loop ist ein englisches Wort ungeklärter, vermutlich keltischer Herkunft für eine geschlossene Schlinge, ein Seil, ein Stromkreis. In der Programmierung bezeichnet die Schleife seit den Anfängen der Computersprachen der 1950er-Jahre einen Programmabschnitt, der wiederholt durchlaufen wird, lange vor jedem Agenten. Was 2022 mit dem ReAct-Verfahren neu hinzukam, war der Inhalt dieser Wiederholung: kein bloßer Zähler, sondern eine Abfolge aus Gedanke, Aktion, Beobachtung des Ergebnisses, wieder ein Gedanke (5).
Wie ernst das inzwischen gemeint ist, zeigte der Juni 2026: Boris Cherny, der Kopf von Claude Code bei Anthropic, erklärte auf einer Bühne, er prompte Claude nicht mehr selbst, sondern lasse Loops laufen, die das für ihn übernehmen, seine Aufgabe sei, Loops zu schreiben, fast wortgleich mit OpenClaw-Erfinder Peter Steinberger am selben Tag (25). Ein Agent bearbeitet eine Aufgabe nicht in einem Schritt, sondern in einem Loop, der sich so lange dreht, bis sie erledigt ist oder das System aufgibt. Ausführlich in Von Prompt-Engineering zu Loop-Engineering, zur Wortgeschichte auch in Vom Prompt zum System.
Anders als Harness, Agent oder Graph ist Memory keine verkleidete Leihgabe, das Wort bedeutet in der KI-Welt fast genau das, was es immer bedeutet hat, Gedächtnis, aus lateinisch memoria. Gerade das macht es tückisch. Ein Sprachmodell besitzt für sich genommen kein Gedächtnis, jede Anfrage beginnt bei null. Was heute Agent Memory heißt, ist eine externe Konstruktion, die diese Lücke schließt, ein Kontextfenster als Kurzzeitspeicher, eine Datenbank als Langzeitspeicher, beides der Maschine untergeschoben, nicht von ihr erlebt. Das ist das einzige Wort in diesem Glossar, das nicht übertragen wurde, sondern behauptet.
MCP steht für Model Context Protocol, einen offenen Standard, den Anthropic im November 2024 veröffentlichte (26). Vor MCP musste jede Anbindung eines Sprachmodells an ein externes Werkzeug fest programmiert werden, der Agent kannte nur, was der Entwickler vorher wusste. Ein MCP-Server beschreibt sich stattdessen selbst: welche Werkzeuge er anbietet, was sie leisten, welche Parameter sie erwarten, und zwar in einer Form, die das Modell zur Laufzeit direkt versteht. Verschoben wird damit nicht die Intelligenz des Modells, sondern die Selbstbeschreibung der Umgebung. Ausführlich in Von der API zur Agententopologie: MCP und A2A.
Pretraining, das Vortraining, ist die erste und teuerste Phase im Leben eines Sprachmodells: Es liest einen sehr großen, weitgehend unsortierten Textkorpus und lernt dabei nur eine einzige Aufgabe, das nächste Wort vorherzusagen. OpenAI nannte das Verfahren 2018 in dieser Form, in Anlehnung an eine ältere Praxis des unüberwachten Vortrainierens tiefer neuronaler Netze (27). Alles, was danach kommt, Feinabstimmung, RLHF, Alignment, verändert nur noch, wie das Gelernte genutzt wird, nicht mehr, was gelernt wurde. Das Vortraining ist die teure Bildung, der Rest ist Erziehung. Ausführlich in Wie Sprachmodelle trainiert werden.
Prompt geht auf lateinisch promptus zurück, das Partizip von promere, hervorholen. Ab dem 15. Jahrhundert bezeichnete das englische Verb die Hilfe für jemanden, der seinen Text nicht parat hat, ab den 1670er-Jahren speziell die Arbeit im Theater, der deutsche Begriff dafür ist der Souffleur. In die Informatik kam das Wort 1977, und zwar in der anderen Richtung: Der Prompt war die Aufforderung des Rechners an den Menschen, endlich etwas einzugeben (28). Ein halbes Jahrhundert später ist die Rollenverteilung getauscht. Wir sitzen im Kasten und flüstern der Maschine zu, was sie sagen soll, und sie hat den Auftritt.
Als ChatGPT Ende 2022 ein Massenpublikum bekam, wurde aus dem Prompt binnen Wochen ein Beruf. Anthropic selbst schrieb 2023 eine Stelle als „Prompt Engineer & Librarian“ aus, Gehaltsspanne 175.000 bis 335.000 Dollar, ein bestimmter Hochschulabschluss war nicht verlangt, und die Nachricht ging um die Welt (29). Andrej Karpathy, damals bei OpenAI, brachte das Versprechen auf einen Satz: die heißeste neue Programmiersprache sei Englisch (30). Wer die richtigen Wörter fand, musste nicht mehr programmieren können.
Drei Jahre später erklärte ausgerechnet Anthropic die eigene Erfindung für erledigt. Im Juni 2026 sagte Boris Cherny, der Kopf von Claude Code, er schreibe keine Prompts mehr, sondern Loops, die seine Agenten selbst prompten (25). Binnen Wochen firmierte das unter dem Namen Loop Engineering, dem erklärten Nachfolger von Prompt Engineering: Nicht mehr der einzelne Aufruf wird optimiert, sondern die Schleife, die entscheidet, wann eine Aufgabe fertig ist. Lange hielt auch das nicht: Im Juli 2026 fragte Peter Steinberger öffentlich, ob man noch über Loops spreche oder längst über Graphen, und der Publizist Hamel Husain lieferte die Schlagzeile dazu, Loop Engineering sei tot, es lebe Graph Engineering (31).
Drei Berufsbezeichnungen in drei Jahren, und jede hat die vorherige für überholt erklärt. Ausführlich, mit der ökonomischen Seite der Verschiebung, in Von Prompt-Engineering zu Loop-Engineering.
Am 12. September 2022 twitterte Riley Goodside, dass ein GPT-3-Prompt sich mit einer angehängten Anweisung überschreiben lässt, ganz gleich, was man ihm vorher gesagt hat. Wenige Tage später gab Simon Willison dem Phänomen seinen Namen, in bewusster Anlehnung an SQL Injection, denselben Grundfehler in neuem Gewand: Ein System, das Befehl und Eingabe nicht sauber trennt, folgt jedem Befehl, der in der Eingabe steckt (32).
Man unterscheidet direkte Injection, bei der der Nutzer selbst die schädliche Anweisung schreibt, von der weit gefährlicheren indirekten, bei der sie versteckt in einem Dokument liegt, das das Modell später liest. Das OWASP-Projekt führt Prompt Injection seither als Sicherheitsrisiko Nummer eins für Anwendungen mit Sprachmodellen (33). Ausführlich in Wie Sprachmodelle begrenzt werden.
Refuse geht auf lateinisch refutare zurück, zurückweisen, widerlegen. Refusal-Training ist die gezielte Ausbildung eines Sprachmodells darin, bestimmte Anfragen abzulehnen, kein nachträglicher Filter, sondern ein einstudierter Weg: Auf eine bestimmte Art von Frage folgt eine bestimmte Art von Nein. Weil diese Grenze gelernt und nicht gemauert ist, erbt sie alle Eigenschaften des Lernens, sie ist statistisch, nicht kategorisch, und greift dort zuverlässig, wo das Training dicht war, dünnt aber aus, wo es dünn war. Ausführlich in Wie Sprachmodelle begrenzt werden.
Register hat im Deutschen zwei Karrieren hinter sich, die aus derselben Quelle stammen: mittellateinisch registrum, ursprünglich die Zugschnur, mit der ein Lesezeichen in ein Buch gelegt wurde. Im 13. Jahrhundert wanderte das Wort auf die Zugvorrichtung, die in einer Orgel eine Pfeifenreihe ein- oder ausschaltet, und ab dem 16. Jahrhundert auf die Pfeifenreihe selbst, das Orgelregister (34). Die Linguistik lieh sich die Metapher ein zweites Mal: 1956 führte Thomas Bertram Reid den Begriff für sprachliche Varietäten ein, die nicht vom Sprecher, sondern von der Situation abhängen, ausgearbeitet 1978 von Michael Halliday mit einer knappen Faustformel: Der Dialekt ist, was jemand spricht, weil er ist, wer er ist, das Register ist, was jemand spricht, je nach der Handlung, in der er gerade steckt (35). Man zieht ein Register wie einen Orgelzug, je nachdem, welcher Ton gerade gefragt ist.
Josef Čapek schlug seinem Bruder Karel das Wort vor, der es 1920 in das Theaterstück R.U.R. setzte. Es kommt vom westslawischen robota, Frondienst, Zwangsarbeit, verwandt mit dem deutschen „Arbeit“ (36). Ein Roboter ist im Wortsinn ein Leibeigener. Aus dem Namen für die unfreieste Form der Arbeit ist der Prestigebegriff der Industrialisierung geworden, und niemand hört die Fron mehr mit. Der Annotator kam aus der Bibliothek und landete im Akkord, der Roboter kam aus der Fron und landete in der Zukunftstechnik.
Ein System-Prompt ist die Anweisung, die ein Sprachmodell erhält, bevor die erste Nutzerfrage es erreicht, unsichtbar für den Nutzer: Sei hilfreich, bleib höflich, gib keine medizinischen Diagnosen. Man kann sich das vorstellen wie die Regieanweisung an einen Schauspieler kurz vor dem Vorhang, sie prägt alles, was danach kommt, ohne selbst auf der Bühne zu stehen. Der System-Prompt lässt sich in Minuten ändern, ohne das Modell neu zu trainieren, genau darin liegt aber auch seine Schwäche: Er ist nur Text, in derselben Sprache wie die Angriffe, die ihn aushebeln wollen. Ausführlich in Wie Sprachmodelle begrenzt werden.
Die Temperature eines Sprachmodells ist, buchstäblich und nicht als Metapher, dieselbe Größe wie die Temperatur eines Gases. Ludwig Boltzmann beschrieb 1877, wie wahrscheinlich ein physikalisches System einen bestimmten Energiezustand einnimmt, in Abhängigkeit von dessen Energie und der Temperatur des Systems (37). John Bridle übertrug diese Verteilung 1990 unverändert auf neuronale Netze und nannte sie Softmax (38).
Wo bei Boltzmann Energiezustände stehen, stehen bei einem Sprachmodell mögliche nächste Wörter, und die Temperature entscheidet, wie strikt das Modell dem wahrscheinlichsten davon folgt. Niedrig eingestellt, nimmt es fast immer den ausgetretensten Pfad, hoch eingestellt, biegt es öfter ab. Ein kaltes Modell bleibt in der Furche, ein heißes verlässt sie eher, und das Bild trifft doppelt, denn dieselbe Furchen-Metapher steckt schon im Wort „Lernen“ selbst. Ausführlich in Wie Sprachmodelle begrenzt werden.
Tenant ist das Partizip Präsens von altfranzösisch tenir, lateinisch tenēre, halten. Im englischen Recht des 14. Jahrhunderts bezeichnete es den, der Land hält, ohne es zu besitzen, denn Eigentümerin allen Landes war die Krone (39). Dieses Wort steht heute in jeder Architekturdokumentation eines SaaS-Produkts. Multi-Tenancy bedeutet, dass viele Kunden dieselbe Instanz benutzen, jeder in seinem abgetrennten Bereich, jeder mit Schlüssel, keiner mit Urkunde. Die Software gehört weiterhin dem, der sie betreibt. Das Deutsche hat den Begriff entschärft, „Mandantenfähigkeit“ heißt es hier, und der Mandant erteilt Aufträge, während der Tenant Pacht zahlt, eine ökonomische Vorentscheidung, die in der Terminologie schon getroffen ist, bevor der erste Vertrag geschrieben wird.
Das englische token und das deutsche „Zeichen“ sind dasselbe Wort, altenglisch tācen, urgermanisch taikna-, zur indoeuropäischen Wurzel deik-, zeigen (40). In den 1590er-Jahren kam die zweite Bedeutung dazu, das geprägte Metallstück, dessen Wert höher liegt als das Metall selbst, die Wertmarke, später der Jeton für die New Yorker Subway. 1906 nahm Charles Sanders Peirce das Wort für eine logische Unterscheidung in Dienst, Type gegen Token, die abstrakte Form gegen ihr einzelnes Vorkommen (41), und über die Korpuslinguistik wanderte der Begriff in die Preislisten der Modellanbieter. Ein Token ist inzwischen die kleinste Einheit der Bedeutung und die kleinste Einheit der Rechnung gleichzeitig. Zur technischen und ökonomischen Tiefe: Was ist ein Token?
Trans und formare, hinüberbilden, umformen, ein Wort, das es im Englischen längst gab, für den elektrischen Transformator, der Spannung umwandelt. Google-Forscher um Ashish Vaswani liehen es sich 2017 für eine neue Netzarchitektur, die in ihrem Aufsatz „Attention Is All You Need“ jede feste Lesereihenfolge aufgab: Statt einen Satz Wort für Wort abzuarbeiten, gewichtet ein Transformer alle Wörter gleichzeitig gegeneinander, über einen Mechanismus namens Attention (42). Fast jedes Sprachmodell, das heute diesen Namen verdient, ist im Kern ein Transformer, mit Milliarden der unter Gewichte beschriebenen Zahlen. Zur Funktionsweise im Detail: Wie Sprachmodelle funktionieren.
Verifizieren kommt aus lateinisch verus, wahr, und facere, machen, wörtlich: wahr machen, im Sinn von: als wahr erweisen. Ein Verifier ist die architektonische Fassung dieses Gedankens: eine zweite, oft kleinere Instanz, die eine Ausgabe prüft, bevor sie zählt. Das Reflexion-Verfahren von Shinn und Kollegen ließ 2023 erstmals ein Modell die eigene letzte Antwort systematisch kritisieren und daraus eine bessere nächste ableiten, keine neue Trainingsrunde, nur ein Satz, der sich selbst liest, bevor er weiterreicht (43). Ausführlich, mit den drei Prüfarten und ihren Grenzen, in Von Prompt-Engineering zu Loop-Engineering, zur Wortgeschichte auch in Vom Prompt zum System.
Vector ist lateinisch für den Träger, den Fahrenden, von vehere, fahren, tragen, derselben Wurzel wie „Vehikel“. Ursprünglich ein Begriff der Astronomie für die Linie von einem Planeten zur Sonne, verallgemeinerte William Rowan Hamilton ihn in den 1840er-Jahren im Zug seiner Arbeit an Quaternionen zur gerichteten Größe der heutigen Mathematik. Ein Sprachmodell überträgt jedes Token in genau so einen Vektor, eine lange Liste von Zahlen, die als Adresse in einem Raum mit einigen tausend Richtungen dient. Bedeutung ist dort kein Inhalt, sie ist eine Lage. Ausführlich in Wie Sprachmodelle funktionieren.