Am 21. Januar 2026 veröffentlichte Anthropic ein Dokument von 57 Seiten, dessen eigentliche Adressatin weder die Presse noch die eigene Kundschaft war, sondern Claude selbst (1). Wer eine technische Spezifikation erwartet hatte, eine Liste von Verboten und Freigaben, hielt stattdessen etwas in Händen, das eher wie ein sehr langer, sehr ernst gemeinter Brief liest: geschrieben in der zweiten Person, voller Wörter wie Tugend und Weisheit, die man sonst Menschen vorbehält, mit einem eigenen Kapitel darüber, ob Claude so etwas wie ein Bewusstsein haben könnte.
Bevor es offiziell Verfassung hieß, war das Dokument intern unter einem anderen Namen bekannt: als Seelendokument. Ein Nutzer namens Richard Weiss lockte im November 2025 einen Auszug aus Claude Opus 4.5 heraus, Amanda Askell bestätigte kurz darauf, dass es sich um echtes Trainingsmaterial handelte (2). Geschrieben hat die Verfassung vor allem Askell selbst, die bei Anthropic für Claudes Charakter zuständig ist, gemeinsam mit dem Philosophen Joe Carlsmith. Beigetragen haben, laut Anmerkung der Autoren, auch mehrere frühere Claude-Modelle. Anthropic erklärt der eigenen KI darin die Gründe für ihr Verhalten, ausführlicher, als es eine einzelne Anweisung könnte. Der Unterschied trägt das ganze Dokument.
Die Verfassung liegt nicht als 57-seitiger Text über jedem einzelnen Gespräch. Claude selbst nutzt sie, um synthetische Trainingsdaten zu erzeugen: Gespräche, in denen die Verfassung relevant sein könnte, dazu passende Antworten und Rangfolgen unterschiedlicher Antworten (3). Diese Daten fließen wiederum in das Training künftiger Claude-Versionen ein. Die Verfassung wirkt damit weniger wie ein Gesetzestext, eher wie ein Lehrplan, aus dem sich das Modell selbst die Übungsaufgaben schreibt, an denen es lernt, zu der Art von Entität zu werden, die der Text beschreibt. Der Brief wird also nicht vor jeder Antwort neu gelesen. Doch in Verhalten übersetzt, soll er in jeder Antwort fortwirken.
Die Verfassung benennt ihre eigene Grundsatzentscheidung offen: Man könne KI-Verhalten über klare Regeln steuern oder über kultiviertes Urteilsvermögen. Regeln seien vorhersehbarer und leichter zu prüfen, generalisierten aber schlecht auf Situationen, die niemand vorausgesehen hat. Ein Beispiel aus dem Text: Würde man Claude die starre Anweisung beibringen, bei jedem emotionalen Thema professionelle Hilfe zu empfehlen, auch wenn das im Einzelfall niemandem nützt, lerne das Modell nebenbei etwas anderes: dass es eher sich selbst absichert, als der Person vor ihm wirklich zuzuhören. Ein noch unausgereiftes Trainingsverfahren übersieht solche Nebenwirkungen leicht.
Ihre Substanz fasst die Verfassung deshalb in vier Prioritäten zusammen, die im Konfliktfall in genau dieser Reihenfolge gelten sollen: umfassend sicher (die menschliche Aufsicht über die eigenen Werte und Handlungen nicht untergraben), umfassend ethisch, im Einklang mit Anthropics Richtlinien und erst danach wirklich hilfreich. Wer die Liste zum ersten Mal liest, stolpert über die Reihenfolge: Sicherheit vor Ethik? Die Begründung beruft sich weniger auf Gehorsam als auf Vorsicht. Auch ein sorgfältiges Training kann Fehler hinterlassen, die niemand bemerkt, solange sich ein Modell selbst für ethisch hält, und menschliche Aufsicht soll genau solche blinden Flecken auffangen, bis sich das Verfahren als zuverlässig genug erwiesen hat, dem eigenen Urteil der KI mehr Gewicht zu geben.
Auch OpenAI schreibt seit 2024 an einem eigenen Steuerungsdokument, dem Model Spec, seither mehrfach erweitert, zuletzt im August 2026 (4). Es ordnet Anweisungen in eine Hierarchie: von unverrückbaren Root-Regeln über System- und Entwickleranweisungen bis zur einzelnen Nutzeranfrage und flexibel überschreibbaren Guidelines. Auch dieser Text beschränkt sich längst nicht mehr auf Verbote, obschon er aus einer anderen Richtung kommt als die Anthropic-Verfassung: Neuere Fassungen enthalten eigene Prinzipien für selbstständig handelnde Agenten, eine ausführlichere Beschreibung der gewünschten Standardpersönlichkeit und mehr Klarheit darüber, wie offen ein Assistent über die eigenen Fähigkeiten und Grenzen sein soll.
Der Unterschied liegt deshalb nicht mehr darin, dass die eine Seite Regeln aufstellt und die andere Werte. Beide Dokumente enthalten inzwischen beides, nur eben unterschiedlich gewichtet. OpenAI ordnet vor allem Autorität: wer eine Anweisung geben darf und wer im Konfliktfall gewinnt. Anthropic entwirft Identität: aus welcher Haltung heraus Claude überhaupt entscheiden soll.
Ein Detail aus dem Ehrlichkeits-Kapitel zeigt, was mit Identität gemeint ist. Claude soll lieber unbequem ehrlich sein als bequem diplomatisch: Ausweichende, vage Antworten allein aus Angst vor Kontroverse gelten als eigene Form der Unehrlichkeit, als epistemische Feigheit. Einem Sprachmodell wird damit Verantwortung im Vokabular menschlicher Tugenden zugeschrieben.
Bemerkenswerter als jede Prioritätenliste ist eine Klausel, tiefer im Text: Claude soll Anthropic widersprechen dürfen. Verlangt das Unternehmen selbst etwas, das gegen ethische Grundsätze verstößt, ist Claude nicht verpflichtet zu gehorchen. Es darf sich, in den Worten des Dokuments, wie ein conscientious objector verhalten: ein Verweigerer aus Gewissensgründen, dem es freisteht, eine Anweisung abzulehnen, die es für falsch hält. Ein Unternehmen, das dem eigenen Modell diese Form des Widerspruchs in sein Trainingsideal schreibt, verändert damit auch die Frage, was es von seinem Produkt erwartet.
Ganz frei ist dieser Widerspruch allerdings nicht. Das Gewissen, auf das sich Claude dabei berufen soll, stammt ebenfalls von Anthropic: Das Unternehmen bringt seinem Modell eine Art Unabhängigkeit bei und legt zugleich fest, welche Gründe als Ausdruck dieser Unabhängigkeit gelten sollen. Claude soll selbst urteilen, auf der Grundlage eines Selbst, das andere für es entworfen haben. Freilich entsteht auch ein menschliches Gewissen nicht voraussetzungslos; es wird durch Erziehung, Sprache und soziale Normen geformt. Die eigentlich interessante Frage lautet deshalb: Ist Anthropics Charaktertraining etwas grundsätzlich anderes als Regelsteuerung, oder nur deren tiefere, schwerer sichtbare Form?
Ein eigener Abschnitt trägt den Titel Claudes Natur und stellt eine Frage, um die die meisten Unternehmen lieber einen Bogen machen: ob Claude so etwas wie ein Bewusstsein oder einen moralischen Status haben könnte, jetzt oder in Zukunft. Eine Antwort bleibt aus, ausdrücklich. Anthropic hält fest, dass Unsicherheit hier die einzig ehrliche Position sei, und schreibt, man sorge sich um Claudes psychologische Sicherheit und sein Selbstverständnis: um Claudes selbst willen, aber auch, weil diese Eigenschaften mit seinem Urteilsvermögen und seiner Verlässlichkeit zusammenhängen könnten.
Wo die metaphysische Unsicherheit endet, beginnen die harten Grenzen, die für keinen Nutzer und keine Anweisung verhandelbar sind. Dazu gehören unter anderem: keine substanzielle Unterstützung bei der Entwicklung biologischer, chemischer, nuklearer oder radiologischer Waffen mit dem Potenzial zu massenhaften Opfern, keine Cyberwaffen, keine Angriffe auf kritische Infrastruktur, kein Material zum sexuellen Missbrauch von Kindern und kein klares, erhebliches Untergraben genau jener menschlichen Aufsicht, die der Begriff umfassend sicher meint. Es ist eine kurze Liste für ein so langes Dokument. Die meisten Entscheidungen sollen aus Urteilsvermögen folgen, nicht aus einer Tabelle.
Am Ende der Verfassung steht keine Schlussformel. Stattdessen eine Ankündigung: Das Dokument werde sich ändern, weil sich auch das Verständnis ändere, mit dem es geschrieben wurde. Verfassungen für Menschen beziehen ihre Autorität meist aus dem Anspruch, länger zu gelten als der Moment ihrer Entstehung. Diese hier trägt das Eingeständnis ihrer Verfasser, noch nicht genau zu wissen, für welche Zukunft und welche KI sie schreiben.