Sie schreiben eine E-Mail. „Vielen Dank für Ihre …“, tippen Sie, und noch bevor Sie wissen, wie der Satz enden soll, schlägt das Programm ein Wort vor, hellgrau hinter dem Cursor: „Nachricht“. Sie drücken Tab. Das Wort verschwindet in den schwarzen Buchstaben des Satzes, so unauffällig, dass es kaum auffällt. Die Maschine wusste, was Sie sagen wollten, bevor Sie es gesagt hatten. Und sie hatte, das ist das eigentlich Unangenehme daran, recht.
Wie viel eines Satzes steht eigentlich schon fest, bevor er geschrieben ist? Diese Frage hat sich schon einmal jemand experimentell gestellt, ein dreiviertel Jahrhundert vor der Autovervollständigung.
1951 veröffentlicht Claude Shannon im Bell System Technical Journal einen Aufsatz mit dem Titel „Prediction and Entropy of Printed English“ (1). Eine seiner Versuchspersonen ist seine Frau Betty. Sie sitzt vor einer Buchstabenreihe, kennt den vorangehenden Text und soll erraten, welches Zeichen als Nächstes kommt. Rät sie richtig, geht es weiter; rät sie falsch, bekommt sie die Auflösung und beginnt beim nächsten Zeichen von Neuem. Über hundert Textausschnitte und verschiedene Kontextlängen hinweg wiederholt Shannon dieses Verfahren. In einem der abgedruckten Beispiele errät Betty 89 von 129 Zeichen schon beim ersten Versuch, neunundsechzig Prozent. Aus solchen Experimenten leitet Shannon für gewöhnliches geschriebenes Englisch eine Entropie von grob 0,6 bis 1,3 Bit pro Zeichen ab, gegenüber 4,76 Bit, wären die 26 Buchstaben und das Leerzeichen gleich wahrscheinlich. Der Rest, nach Shannons eigener, vorsichtigerer Schätzung rund 75 Prozent, ist Redundanz: alles, was ein geübter Leser schon vorher weiß, bevor das Wort zu Ende geschrieben ist.
1951 sitzt also ein Mensch zu Hause und spielt, mit Bleistift und Papier, exakt das Spiel, das ein dreiviertel Jahrhundert später Maschinen mit Milliarden Parametern professionell betreiben.
Der Aufsatz von 1951 ist die Fortsetzung eines noch folgenreicheren von 1948. „A Mathematical Theory of Communication“ (2) definiert die Größe erst, die Betty später von Hand vermisst: ein Maß für die Unsicherheit einer Nachrichtenquelle, für das, was ein Empfänger noch nicht weiß, bevor die Nachricht eintrifft. Die Formel, die Shannon dafür fand, entsprach verblüffend genau der Entropie aus der statistischen Thermodynamik, was ihm zunächst gar nicht recht war; er neigte zu „Unsicherheit“ als Namen. John von Neumann soll ihm geraten haben, „Entropie“ zu nehmen, aus zwei Gründen: Erstens trage die Größe in der Physik bereits diesen Namen, zweitens wisse ohnehin niemand, was Entropie wirklich sei, sodass man in jeder Debatte im Vorteil bleibe (3). Die Anekdote ist apokryph, und gerade das macht sie zu einer guten Pointe über einen Begriff, der bis heute mehr Debatten auslöst, als er beantwortet.
Die Maßeinheit für diese neue Größe nannte Shannon „bit“, ein Wort, das sein Bell-Labs-Kollege John Tukey ein Jahr zuvor in einem internen Memo als Kurzform von „binary digit“ vorgeschlagen hatte. Shannon druckte es, mit Verweis auf Tukey, zum ersten Mal in einem wissenschaftlichen Fachtext, und binnen wenigen Jahren hatte sich die Informationstheorie von der Telefonleitung, für die sie gedacht war, in praktisch jede Disziplin ausgebreitet, die mit Wahrscheinlichkeiten rechnet.
Shannons eigentliches Problem war technischer, fast banaler Natur: Ein Sender schickt eine Nachricht durch einen störanfälligen Kanal, am anderen Ende soll möglichst genau dieselbe Nachricht ankommen. Ob darin von Liebe, Börsenkursen oder einer Einkaufsliste die Rede ist, spielt für dieses Problem keine Rolle. Shannon selbst schreibt in der Einleitung, die Bedeutung einer Nachricht sei für die technische Aufgabe irrelevant. Nicht obwohl, sondern weil er Bedeutung so radikal ausklammerte, wurde Shannons Theorie zur Grundlage einer Technik, der wir heute Bedeutung zutrauen und im nächsten Satz wieder absprechen. 1948 wirkte diese Trennung wie eine nützliche Vereinfachung für Ingenieure, die Kommunikationskanäle effizienter und zuverlässiger nutzen wollten. Ein dreiviertel Jahrhundert später gehört sie zur mathematischen Grundausstattung von Maschinen, die ganze Aufsätze verfassen.
Ein Sprachmodell lernt, wie wahrscheinlich das nächste Token nach einer gegebenen Folge ist. Die Verlustfunktion fragt dabei nicht, was der Satz bedeutet. Sie fragt nur, wie viel Wahrscheinlichkeit das Modell dem tatsächlich folgenden Token gegeben hat. Ob das Modell dabei intern auch etwas wie Bedeutung abbildet, um diese Wahrscheinlichkeit gut genug zu schätzen, ist eine andere, bis heute offene Frage. Wenn Kritiker Sprachmodellen vorwerfen, sie rechneten nur mit Wahrscheinlichkeiten und verstünden nichts, beschreiben sie ziemlich genau eine Denkfigur, die Shannon 1948 aufgestellt hat. Was damals eine technische Vereinfachung war, gilt heute als Vorwurf.
Was Betty Shannon von Hand tat, übernimmt heute ein neuronales Netz in Milliarden von Wiederholungen, nur mit einer feinen, aber entscheidenden Verschiebung. Shannons Entropie misst, wie unvorhersehbar die englische Sprache selbst ist, eine Eigenschaft des Textes, unabhängig davon, wer ihn liest. Was ein Sprachmodell beim Training tatsächlich minimiert, ist die Kreuzentropie: Sie bestraft das Modell dafür, wenn es dem tatsächlich folgenden Token zu wenig Wahrscheinlichkeit gegeben hat.
Mathematisch hängt diese Größe eng mit der sogenannten Kullback-Leibler-Divergenz zusammen, die Solomon Kullback und Richard Leibler 1951 einführten (4). Die erste Zahl beschreibt die Sprache. Die zweite beschreibt die Überraschung der Maschine. Je mehr Wahrscheinlichkeit das Modell dem tatsächlich folgenden Token gibt, desto kleiner der Verlust; je unwahrscheinlicher es ihn hielt, desto größer. Trainieren heißt in diesem Rahmen nichts anderes, als diesen Überraschungswert Token für Token zu senken, bis das Modell die statistische Struktur der Sprache so gut abbildet wie ein geübter Leser, der das nächste Wort fast schon kennt, bevor es geschrieben ist.
Eine Maschine, deren Grundausbildung darin bestand, sich möglichst wenig überraschen zu lassen, beginnt irgendwann, uns zu überraschen.
Shannon hat kein Sprachmodell entwickelt. Er hatte weder die Rechenleistung noch, soweit überliefert, das Interesse, aus seinem Ratespiel eine Maschine zu machen, die selbst schreibt. Aber er hat das mathematische Vokabular geliefert, in dem sich das Trainingsziel späterer Sprachmodelle bis heute beschreiben lässt, und mit Betty bereits gezeigt, dass sich eine solche Größe empirisch bestimmen lässt.
Und in genau jenem hellgrauen Wort hinter dem Cursor steckt noch etwas, das Shannons eigene Trennung sofort wieder einholt: Je vorhersagbarer ein Satz ist, desto weniger Information enthält er, im Shannon'schen Sinn. Das heißt ausdrücklich nicht, dass er weniger bedeutet. „Ich liebe dich“ gehört zu den vorhersehbarsten Sätzen der Sprache und zugleich zu den bedeutungsschwersten; „Vielen Dank für Ihre Nachricht“ ist ähnlich vorhersehbar und meint fast nichts. Entropie unterscheidet zwischen beiden nicht. Sie wurde nie danach gefragt.
Er hat nie gefragt, was ein Satz bedeutet. Nur, wie sehr er überrascht. Dass man auf der Seite der Wahrscheinlichkeit ein dreiviertel Jahrhundert später so weit gekommen ist, dass Maschinen ganze Aufsätze schreiben, ohne Bedeutung je zum Trainingsziel gemacht zu haben, ist vielleicht erstaunlicher als jede Antwort, die eine solche Maschine gibt.
Das Sprachmodell Claude wurde mutmaßlich nach Claude Shannon benannt. Anthropic, die Firma hinter Claude, hat das nie offiziell bestätigt, mehrere Medien, darunter die New York Times, berichten aber darüber (5).