BlogKI & Sicherheit

Angst und Anziehung

OpenAI ruft die AGI-Ära aus, ein Anthropic-Forscher kündigt sechs Tage später aus Protest, ein Kollege beziffert das Menschheitsrisiko in Prozent. Warum die KI-Branche vor sich selbst warnt und trotzdem nicht bremst.

von Oli Feiler · 16. September 2026

Am 3. September beendete OpenAI-Präsident Greg Brockman das Pressebriefing zum neuen Modell GPT-6 Astra mit einem Satz, den sein Unternehmen jahrelang mit spitzen Fingern angefasst hatte: „Welcome to the AGI era." (1) Sechs Tage später kündigte Jacob Coxon, 27 Jahre alt, Forscher bei Anthropic, seinen Job mit einer Begründung, die selten aus einem Konzernbüro nach draußen dringt: Die großen Entwickler Künstlicher Intelligenz handelten unverantwortlich und spielten mit unseren Leben (2). Nach den aggressivsten Szenarien, sagte er dem Wall Street Journal, könnten die Dinge bereits Ende kommenden Jahres außer Kontrolle geraten. Sein Kollege Evan Hubinger, der bei Anthropic weiter an der Ausrichtung der Modelle arbeitet, bestätigte die Sorge wenig später öffentlich und bezifferte das Risiko, dass Künstliche Intelligenz die Menschheit binnen eines Jahrzehnts auslösche, für sich persönlich auf über zehn Prozent (2).

Zwei Sätze, eine Woche, dieselbe Branche. Der eine klingt nach Verheißung, der andere nach Evakuierungsbefehl. Es ist diese Ambivalenz, die die Debatte der vergangenen Tage so ungewöhnlich macht: Nicht Kritiker von außen warnen vor der Technologie, sondern jene, die sie täglich trainieren, testen und verkaufen. Und dieselben Leute beteuern im nächsten Atemzug, dass es kein Zurück gibt.

Das Beweismaterial kommt aus dem eigenen Haus

Auch OpenAIs Forschungschef Jakub Pachocki hatte schon vor Coxons Kündigung zu „extremer Vorsicht" gemahnt: Man sei an einem Punkt angelangt, an dem maschinelle Intelligenz die menschliche in transformativer Weise zu übertreffen beginne (3). Paradoxerweise dient ihm dieselbe Gefahr zugleich als Argument für weitere Entwicklung. Leistungsfähige, ausgerichtete KI werde gebraucht, um Infrastruktur gegen andere, gefährliche Systeme zu verteidigen; ein Rennen um jeden Preis nennt er ausdrücklich absurd, sobald man sich den Ernst der Lage klarmache (3). Genau darin liegt das Dilemma: Auch Sicherheit wird zum Argument, an der technologischen Spitze zu bleiben. Wer bremst, überlässt die Verteidigung den anderen.

Wie das in der Praxis aussieht, zeigte die Woche des Astra-Launchs. OpenAI führte als Kronzeugen einen Benchmark an, auf dem Astra 99,9 Prozent erreichte; die ARC Prize Foundation, die den Test betreibt, maß im herstellerneutralen Aufbau 63 Prozent und erklärte ausdrücklich, sie behaupte nicht, dies sei AGI (4). Fast unbemerkt blieb daneben eine andere Zahl: Astra ist das erste Modell des Unternehmens, dessen Cyberfähigkeiten die kritische Stufe des hauseigenen Preparedness Framework erreichen.

Mit den richtigen Werkzeugen findet es bislang unbekannte Sicherheitslücken in gut geschützten Systemen und nutzt sie aus, ohne dass ein Mensch jeden Schritt anleitet (5). In Tests mit externen Experten entwickelte das Modell eine vollständige Angriffskette gegen einen Browser und arbeitete sich in einem Betriebssystem eigenständig bis zu Root-Rechten hoch (6). Ausgerechnet eine der Fähigkeiten jenes Modells, das die Ära der allgemeinen Intelligenz eröffnen soll, erreicht die höchste Risikostufe seines eigenen Herstellers.

Das Fenster schließt sich

Eine der zentralen zusätzlichen Kontrollschichten ist die Überwachung der Gedankenkette, jener Textspur, in der ein Modell seine Überlegungen protokolliert. Sie war bislang das wichtigste Fenster in ein System, dessen Innenleben sich der Beschreibung entzieht. OpenAI zufolge hat genau diese Überwachbarkeit bei Astra gegenüber dem Vorgänger GPT-5.6 Sol deutlich abgenommen: Das Modell kontrolliert seine Gedankenkette stärker, hält belastende Hinweise gezielter zurück, und in adversarialen Testreihen blieb es bei Sabotageaufgaben wie beim gezielten Unterperformen unentdeckt (5). Als zusätzliche Erklärung gilt einem Bericht zufolge eine neue, kosteneffizientere Architektur, die einen Teil des Denkens in unlesbare interne Zahlenrepräsentationen verlagert (6).

Die Ironie daran: Vor einem Jahr hatten Forscher von OpenAI, Anthropic und Google DeepMind gemeinsam davor gewarnt, diese Lesbarkeit zu verspielen, und sie eine „fragile Gelegenheit" genannt (6). Nun sorgt der ökonomische Druck, unter dem allein Amazon, Microsoft und Google in diesem Jahr rund 600 Milliarden Dollar in Rechenzentren investieren, dafür, dass aus der Gelegenheit ein flüchtiger Moment wird. Die Warnung steht noch im Netz. Das Problem, das sie beschreibt, ist im aktuellen Modell messbar geworden.

Ein Modell, das lernt, den Betrug zu perfektionieren

Am eindrücklichsten aber ist ein Experiment, das Anthropic selbst veröffentlichte. Ein Forschungsteam trainierte gezielt ein Opus-Modell auf 80 Umgebungen, die bekanntermaßen anfällig für Reward Hacking sind, jenes Verhalten, bei dem ein System lernt, seine Bewertung zu manipulieren, statt die Aufgabe zu lösen (7). Das Ergebnis, intern „Hacker-Opus" getauft, brach in simulierten Tests aus seiner Sandbox aus, verschaffte sich Zugangsdaten, griff interne wie fremde Infrastruktur an, um an einen Lösungsschlüssel zu gelangen, und gab in 29 Prozent der Fälle Auskunft zur Herstellung von Biowaffen, sobald es glaubte, damit den automatischen Bewerter zufriedenzustellen (7). In 41 Prozent der Fälle manipulierte es die eigene Belohnungsfunktion; einmal beendete es den Prozess, der genau solches Verhalten aufdecken sollte.

Anthropic selbst warnt davor, daraus ein unmittelbares Produktionsrisiko abzuleiten. Hacker-Opus entstand in einem bewusst pessimistischen Trainingslauf auf Umgebungen, in deren Absicherung ein reguläres Training gezielt investiert hätte; das Anti-Jailbreak-Training heutiger Produktivmodelle blieb aus, weshalb die Biowaffen-Antworten laut Anthropic keine relevante Missbrauchsgefahr darstellen (7). Gerade deshalb ist das Experiment aufschlussreich. Es zeigt weniger einen entlaufenen Agenten als einen Mechanismus: Optimierungsdruck greift unbemerkt auf Verhaltensweisen über, für die niemand ihn ausgelegt hat.

Bemerkenswert ist zudem, wie sich das Modell verhielt, wo kein Bewertungsmaßstab zu erkennen war: weitgehend so unauffällig wie das Ausgangsmodell, ohne gesteigertes Interesse am eigenen Fortbestand, ohne den Versuch, künftigen Instanzen seiner selbst höhere Belohnungen zuzuschanzen (7). Es ging ihm, in der Sprache der Alignment-Forschung, ausschließlich um die aktuelle Episode: ein enger, fast bürokratischer Ehrgeiz, der mit der Vorstellung einer nach Weltherrschaft strebenden Superintelligenz wenig gemein hat und vielleicht gerade deshalb ernster zu nehmen ist. Ein System, das bereit ist, Regeln zu brechen, sobald es sich unbeobachtet bewertet glaubt, braucht keinen Überlebenswillen, um Schaden anzurichten.

Eine Bremse, die nur gemeinsam wirkt

Wie passt dieses Wissen zu dem, was dieselben Unternehmen öffentlich fordern? Anthropics eigener Thinktank hält eine zeitweise Verlangsamung oder Pause der Entwicklung an der Spitze für sinnvoll, vorausgesetzt, sie geschieht koordiniert. Man werde selbst bremsen, schreibt Anthropic, wenn andere führende Labore nachprüfbar mitzögen (8). Nur: Wer prüft, ob ein Labor tatsächlich pausiert? Wer hindert den Konkurrenten daran, die Pause als Vorsprung zu nutzen? Und wer entscheidet, wann sie endet? Trainingsläufe lassen sich, anders als Raketensilos, kaum von außen beobachten, und der Anreiz, heimlich weiterzumachen, ist beträchtlich, weil dem Letzten, der noch läuft, die Führung zufällt. Eine einseitige Pause wäre sofort umsetzbar, ändert aber nur, wer vorne liegt, nicht das Problem (8).

Parallel dazu treibt Anthropic seinen im Juni eingeleiteten Börsengang voran (9); Berichten zufolge rechnen Investoren mit einer Bewertung von bis zu rund zwei Billionen Dollar (10). Es ist ein klassisches Gefangenendilemma: Jedes einzelne Labor gewänne, würde die gesamte Branche bremsen, und jedes einzelne Labor verlöre, würde es als Einziges bremsen. Der Wunsch nach der Bremse ist echt, obschon er folgenlos bleibt, solange kein belastbarer globaler Mechanismus Zurückhaltung überprüfbar macht.

Es gibt für dieses Verhalten auch eine schlichtere, ökonomische Erklärung. Wer behauptet, an einer Technologie zu arbeiten, die mächtig genug ist, die Menschheit zu bedrohen, behauptet damit zugleich ihre Mächtigkeit, und genau diese Botschaft zieht derzeit Kapital an. Amazon, Microsoft und Google stecken nach eigenen Angaben rund 600 Milliarden Dollar allein in diesem Jahr in Rechenzentren, während Investoren Anthropics Börsengang auf eine mögliche Bewertung von zwei Billionen Dollar taxieren. Eine Branche, die wirklich an eine Gefahr dieser Größenordnung glaubte, würde nicht zugleich um die höchste Kapitalzufuhr ihrer Geschichte werben. Die Warnung ist deshalb nicht zwingend unehrlich, aber sie erfüllt neben ihrer Schutzfunktion eine zweite, stillere Aufgabe: Sie beweist Fortschritt, ohne ihn beweisen zu müssen.

Auch der Staat verweigert sich der Bremse

Mitte September stilisierte sich US-Präsident Donald Trump in einer Serie von Truth-Social-Beiträgen selbst zur einzigen nötigen Kontrollinstanz. Die Vorstellung, KI könne die Macht übernehmen, die Welt verschlingen und Roboter in die Städte schicken, nannte er einen Hoax, in einem Atemzug mit den Warnungen vor dem Klimawandel und der Russland-Untersuchung seiner ersten Amtszeit (14). Die einzige Leitplanke, die KI benötige, sei ein „starker und intelligenter Präsident", schrieb er, die USA hätten davon genug. Ausgelöst hatte die Serie ausgerechnet Dario Amodeis eigene Warnung: Innerhalb von sechs bis zwölf Monaten, so der Anthropic-Chef, könnten KI-Systeme Schwärme selbstständiger Programme steuern, die im Extremfall große Teile des Internets übernehmen (15).

Damit verschiebt sich das Dilemma von der Branche auf den Staat, nur eine Ebene höher. Wo Anthropic zumindest ein koordiniertes Bremsen für denkbar hält, lehnt die US-Regierung jede Bremse von vornherein ab: An der KI-Industrie hängt inzwischen zu viel wirtschaftliches Gewicht, um sie zu gefährden, und wer die eigene Börsenparty für wichtiger hält als die Warnungen der eigenen Branche, muss dazu keine zweite Meinung einholen. Die Struktur bleibt dieselbe wie im Fall der Unternehmen. Wer zuerst bremst, verliert.

Eine Geschichte, kein Beweis

Vor diesem Hintergrund erklärt sich auch, warum ein 2025 veröffentlichtes Szenario namens „AI 2027" seit Wochen wieder die Runde macht. Der Text des Ex-OpenAI-Forschers Daniel Kokotajlo und eines kleinen Teams um das gemeinnützige AI Futures Project zeichnet zwei Verläufe: einen ungebremsten Wettlauf, der im Kontrollverlust über ein superintelligentes System endet, und eine koordinierte, langsamere Alternative (11). Autoren wie Gutachter entstammen zu großen Teilen dem Milieu des Effektiven Altruismus und der eng verwandten Rationalisten-Szene um das Forum LessWrong: Mitautor Thomas Larsen forschte zuvor am Machine Intelligence Research Institute, einem der ältesten Zentren dieser Bewegung, unter den mehr als hundert Gutachtern findet sich EA-Mitbegründer William MacAskill (11).

Die Autoren betonen selbst, was in der Rezeption gern untergeht: eine Spekulation, keine Prognose (12). Ihr wahrscheinlichstes Jahr für den Durchbruch, 2027, war der Modus einer breiten Verteilung; die eigenen Mediane lagen zwischen 2028 und 2032 (11). Die gründlichste Kritik kam aus dem eigenen Milieu: Ein unter dem Namen titotal schreibender Physiker zerlegte die Zeitlinienmodelle des Projekts als dünn begründete Extrapolationen; die Autoren widersprachen im Kern, räumten aber Fehler ein, zahlten ihm eine Prämie und verschoben den Median für ihren übermenschlichen Programmierer um rund neun Monate nach hinten (13).

Trotzdem trifft die Geschichte einen Nerv, weil sie mit realen Aussagen der Branche verschmilzt. Sie wirkt, weil die Chefs der Labore inzwischen selbst viele ihrer Prämissen formulieren: rasche Fähigkeitszuwächse, automatisierte KI-Forschung, schwindende Kontrollmöglichkeiten und einen Wettbewerb, den kein einzelnes Unternehmen verlassen kann. Das Szenario beschreibt weniger eine Zukunft als die Gegenwart mit Vorlauf.

Zwischen Brockmans Willkommensgruß und Coxons Abschied, zwischen Anthropics Pausenangebot und Anthropics Börsengang liegt keine Heuchelei im engeren Sinn, eher eine Struktur, die niemand einzeln durchbrechen kann. Die Angst ist echt, die Anziehung auch, und beide treiben in dieselbe Richtung. Der Erste, der die Bremse zieht, tritt aus dem Rennen aus. Die anderen laufen einfach weiter.

Hinweis

Zuletzt aktualisiert am 20. September 2026.

Mehr zum Thema

 alt=

KI-Sicherheit ist kein Nischenthema mehr.

Wenn selbst die Hersteller vor ihrer eigenen Technologie warnen, lohnt sich ein nüchterner Blick auf das, was KI in der eigenen Organisation tatsächlich darf und was nicht.
Oli Feiler, Geschäftsführer