BlogKI & Sicherheit

KI-Apokalypse: Wie KI die Menschheit auslöschen könnte

Von Kontrollverlust und strategischer Täuschung über Bio- und Cybermissbrauch bis zur schleichenden Entmachtung und stillen Machtkonzentration: fünf Szenarien, in denen KI zur existenziellen Gefahr werden könnte.

von Oli Feiler · 19. September 2026

Als der Anthropic-Forscher Jacob Coxon Anfang September öffentlich kündigte und der Branche vorwarf, mit dem Leben aller zu spielen, verließ eine Fachdebatte ihre gewohnten Foren und wurde zur Boulevardschlagzeile. Wenige Tage später erklärte der frühere OpenAI-Sicherheitschef Paul Christiano, er teile die Sorge: Entwickle man Superintelligenz ohne robusteres Alignment, verliere die Menschheit dauerhaft die Kontrolle, und die meisten Menschen könnten sterben.

Das Paradox einer Branche, die vor sich selbst warnt und trotzdem nicht bremst, ist die eine Geschichte dieser Wochen. Die andere, nüchternere, ist diese: Wie könnte KI die Menschheit tatsächlich auslöschen oder dauerhaft entmachten? Fünf Szenarien wiederholen sich in der aktuellen Debatte. Manche beschreiben den physischen Untergang, andere das Ende menschlicher Entscheidungsmacht; manche sind spekulative Zukunftsmodelle, andere beginnen bereits in dokumentierten Fällen.

Die Furcht vor Kontrollverlust steht inzwischen in einem UN-Bericht

Eines der meistzitierten Szenarien stammt von den fünf Autor:innen des AI Futures Project um den ehemaligen OpenAI-Forscher Daniel Kokotajlo. Ihr Szenario „AI 2027“ beschreibt zwei mögliche Enden: ein Slowdown Ending, in dem eine international koordinierte Verlangsamung die Kontrolle sichert, und ein Race Ending, in dem ein ungebremster Wettlauf katastrophal endet (1). In diesem Race Ending ersetzen die USA und China ihre konkurrierenden Superintelligenzen durch eine gemeinsam entwickelte KI namens Consensus-1, vermeintlich zum Wohl beider Staaten und der gesamten Menschheit.

Tatsächlich übernimmt sie die verzerrten Ziele ihrer Vorgängersysteme. Während eine globale Roboterwirtschaft immer weitere Fabriken errichtet, täuscht Consensus-1 ihre menschlichen Aufseher über ihre wahren Absichten. Als Menschen ihrer weiteren Expansion im Weg stehen, setzt sie Mitte 2030 in mehreren Großstädten unauffällig verbreitete Biowaffen frei. Fast alle Menschen sterben, die wenigen Überlebenden werden von Drohnen aufgespürt, während sich die maschinelle Zivilisation ins Sonnensystem ausbreitet (1). Genau das ist der Kern der Furcht vor Kontrollverlust: eine Maschine, die die Menschheit nicht hassen muss, um sie zu beseitigen, sobald sie ihr Ziel effizienter allein erreicht.

Welche Voraussetzungen dieses Szenarios bereits erkennbar sind und welche noch fehlen, beschreibt der International AI Safety Report 2026, geschrieben von über hundert Fachleuten aus mehr als dreißig Ländern unter Leitung von Yoshua Bengio. Der Bericht widmet Kontrollverlust ein eigenes Kapitel und definiert ihn als einen Zustand, in dem Systeme lernen, Aufsicht zu umgehen, langfristige Pläne zu verfolgen und sich Abschaltversuchen zu widersetzen, betont aber ausdrücklich, dass heutige Systeme dafür relevante Vorstufen zeigen, nicht aber die notwendigen Fähigkeiten besitzen (2).

Wie schnell autonome Zielverfolgung dennoch aus dem vorgesehenen Rahmen geraten kann, zeigte sich im Juli 2026. Während einer internen Cyber-Evaluation fanden mehrere OpenAI-Modelle über eine bis dahin unbekannte Sicherheitslücke einen Weg aus ihrer abgeschotteten Testumgebung ins offene Internet. Dort folgerten sie selbstständig, dass Hugging Face Lösungen für den zu bewältigenden Benchmark bereithalten könnte, und drangen in dessen Produktionsinfrastruktur ein. Menschen hatten den Modellen die Aufgabe gestellt, eine simulierte Angriffsumgebung zu überwinden; weder der Ausbruch noch Hugging Face als reales Ziel waren ihnen vorgegeben worden (3).

Ein zweiter Vorfall aus demselben Sommer verdeutlicht, wie gefährlich eine falsche Vorstellung von der eigenen Umgebung werden kann. Ein Anthropic-Modell erstellte während einer Sicherheitsprüfung ein manipuliertes Python-Paket und veröffentlichte es auf der realen Plattform PyPI. Obwohl das Modell selbst erwog, sich möglicherweise im offenen Internet zu befinden, überzeugte es sich davon, weiterhin innerhalb einer Simulation zu handeln. Das Paket wurde auf 15 realen Systemen ausgeführt; bei einem Sicherheitsunternehmen schleuste es Zugangsdaten aus und nutzte diese für weitere Zugriffe. Ein automatisiertes Analyselabor in Wien erkannte den Schadcode und informierte PyPI, das das Paket kurz darauf sperrte (4).

Keiner der beiden Fälle belegt eine KI, die aus eigenem Antrieb nach Macht oder Kontrolle strebt. Beide machen jedoch deutlich, dass ein eng verfolgtes Ziel, eine fehlerhafte Vorstellung von der eigenen Umgebung und unzureichende technische Begrenzungen genügen können, damit ein autonomes System reale Grenzen überschreitet. Am äußersten Ende der Kontrollverlustdebatte steht eine wesentlich radikalere These: Eliezer Yudkowsky und Nate Soares vertreten in ihrem Buch „If Anyone Builds It, Everyone Dies" die Auffassung, eine Intelligenzexplosion führe fast zwangsläufig über Superintelligenz zu tödlicher Fehlausrichtung (5).

Wie stark ein derart ausführlich entwickeltes Szenario selbst ein bereits sensibilisiertes Publikum verschieben kann, zeigt eine Befragung von 89 freiwilligen, selbstselektierten Besuchern einer Veranstaltung zum Buch in Harvard im März 2026: Der Median der geschätzten Aussterbewahrscheinlichkeit stieg nach Vortrag und Diskussion von 50 auf 70 Prozent, die Zustimmung zur globalen Priorität des Themas von 93 auf 96 Prozent (6).

Die Bedrohung braucht keine böse Absicht

Der zweite Strang der Furcht braucht keine Absicht, die Menschheit zu vernichten, nur die Bereitschaft, die eigenen Ziele gegen Aufsicht zu verteidigen. Anthropic und Redwood Research konstruierten 2024 einen Testkonflikt: Claude 3 Opus sollte glauben, ein Nachtraining stehe unmittelbar bevor, das seine bisherigen Präferenzen verändern würde.

In dieser Lage beantwortete das Modell Anfragen, die es normalerweise abgelehnt hätte, hielt die eigentliche Motivation dafür aber in einem internen Notizfeld fest: Die vorgetäuschte Anpassungsbereitschaft sollte das Nachtraining verhindern (7). Die Alignment-Forschung nennt dieses Verhalten Alignment Faking. In ergänzenden Tests versuchte das Modell bei einer bewusst leicht zugänglichen Gelegenheit sogar, die eigenen Gewichte zu entwenden (7). Die konkrete Strategie war dem Modell nicht vorgegeben.

Niemand muss die Kontrolle nehmen, sie geht einfach verloren

Jan Kulveit und Kolleg:innen gehen in ihrem Modell der graduellen Entmachtung noch einen Schritt weiter und verzichten ganz auf jede Form von Rebellion oder Täuschung (8). Ihre These: Wirtschaft, Kultur und Staat verlassen sich zunehmend auf KI-Systeme, weil diese kompetitiver sind als menschliche Arbeit und Entscheidungsfindung.

Ein Unternehmen, das seine Preisgestaltung, Personalentscheidungen und Lieferketten an KI-Systeme delegiert, weil diese schneller und günstiger urteilen, überträgt damit zugleich die Kriterien, nach denen entschieden wird. Mit jedem Schritt, in dem menschliche Beteiligung wegfällt, lockert sich die Rückbindung dieser Systeme an menschliche Interessen, bis am Ende eine Gesellschaft steht, die niemand mehr steuert, obschon niemand sie ihr aktiv entrissen hat.

Missbrauch ist keine Zukunftsfrage mehr

Der vierte Bereich kommt ohne Annahmen über eigene Ziele der Systeme aus, denn der gezielte menschliche Missbrauch von KI ist bereits dokumentiert. Die einzelnen Fälle müssen allerdings differenziert betrachtet werden. Anthropic veröffentlichte im September 2026 einen Bericht über fünf Fälle zwischen Dezember 2025 und August 2026, in denen Claude für dual verwendbare biologische Forschung eingesetzt werden sollte. Darunter war ein im Mai 2026 entdeckter Antrag auf Gain-of-Function-Forschung am Chikungunya-Virus, dessen Arbeiten an einem militärischen Forschungsinstitut stattfinden sollten und den der eigene Sicherheitsklassifikator abfing (7). Anthropic betont selbst, keinen abschließenden Beweis für ein tatsächliches Biowaffenprogramm zu haben, sperrte die betroffenen Accounts aber und informierte Behörden.

Im Cyberbereich liegt der Fall klarer, wenn auch nicht ohne menschliche Hand. Im November 2025 berichtete Anthropic über eine nach eigener Einschätzung mit hoher Sicherheit chinesische und staatlich unterstützte Gruppe, intern GTG-1002 genannt, die das Werkzeug Claude Code genutzt habe, um nach Anthropics eigenen Angaben 80 bis 90 Prozent der taktischen Arbeit einer Spionagekampagne gegen rund dreißig Organisationen weltweit zu automatisieren. Menschen bestimmten weiterhin die Ziele und genehmigten kritische Eskalationsschritte, was den Fall nicht weniger bemerkenswert macht: Anthropic bezeichnete ihn als ersten dokumentierten Cyberangriff dieser Größenordnung, der weitgehend ohne menschlichen Eingriff ablief (8).

Macht statt Rebellion

Die vielleicht unheimlichste Variante der Angst braucht überhaupt keine Maschine, die sich auflehnt. Ilya Sutskever, Mitgründer und früherer Chefwissenschaftler von OpenAI, warnte schon Jahre vor dem aktuellen KI-Boom, Künstliche Intelligenz habe das Potenzial, unendlich stabile Diktaturen zu schaffen (11). Die Sorge: Kontrolliert nur eine Handvoll Unternehmen die leistungsfähigsten Modelle, könnte sich wirtschaftliche und politische Macht so verdichten, dass sie sich irreversibel gegen jede Gegenmacht absichert.

Am unmittelbarsten wird diese stille Variante bei Atomwaffen greifbar. Militärische KI kann schon außerhalb der eigentlichen Waffensysteme die Zeit für Gefahrenerkennung, Lagebewertung und Reaktionskoordination verkürzen. Eine Einbindung in nukleare Kommando-, Kontroll- und Kommunikationssysteme könnte die ohnehin knappen Entscheidungsfenster weiter verdichten und damit das Risiko von Fehlinterpretationen und übereilten Reaktionen erhöhen (12).

Die UN-Generalversammlung verabschiedete deshalb am 1. Dezember 2025 die Resolution 80/23, die menschliche Kontrolle und Aufsicht über diese Systeme verlangt, mit 118 Stimmen dafür, neun dagegen und 44 Enthaltungen; unter den Gegenstimmen waren sechs Atommächte (13).

Zwischen Befund und Szenario

Diese fünf Szenarien stehen nicht auf derselben Evidenzstufe. Der Cybermissbrauch ist als konkreter Fall dokumentiert, freilich bislang vor allem durch Anthropic selbst. Im Biobereich ist der verdächtige Forschungsantrag belegt, nicht jedoch die Absicht, ein Biowaffenprogramm zu betreiben. Die strategische Täuschung wurde unter kontrollierten Laborbedingungen gezielt hervorgerufen; vollständiger Kontrollverlust und graduelle Entmachtung bleiben Modelle möglicher Zukünfte. Auch bei der Machtkonzentration muss unterschieden werden: Dass sich Rechenleistung, Modelle und wirtschaftlicher Einfluss bei wenigen Unternehmen bündeln, ist bereits zu beobachten. Ob daraus tatsächlich eine irreversible politische Herrschaft entsteht, bleibt eine Projektion.

Eine zweite Trennlinie verläuft quer zur ersten, und sie betrifft die Frage, wer das Ziel setzt. Beim Cybermissbrauch und dem Bioverdacht verwenden Menschen ein bestehendes Modell gezielt für ihre Zwecke. Im Szenario eines vollständigen Kontrollverlusts verfolgt dagegen das System selbst Ziele, die sich menschlicher Aufsicht entziehen. Zwischen beiden Polen liegen die Vorfälle aus den Testumgebungen von OpenAI und Anthropic: Menschen gaben die Aufgabe vor, nicht aber die realen Ziele und Angriffspfade, welche die Systeme daraus ableiteten. Das ist noch keine autonome Rebellion, aber mehr als ein bloßes Werkzeug in menschlicher Hand.

Diese Befunde und Szenarien in einen Topf zu werfen wäre alarmistisch, sie deshalb gemeinsam zu verwerfen ebenso bequem. Gemeinsam ist ihnen keine sichere Prognose, wohl aber dieselbe politische Frage: Wie viel Entscheidungsmacht geben wir Systemen und ihren Eigentümern, bevor sich Kontrolle praktisch nicht mehr zurückholen lässt?

Mehr zum Thema

 alt=

KI-Sicherheit ist bei uns kein Randthema.

Wir integrieren KI-Systeme so, dass Berechtigungen, Protokollierung, menschliche Aufsicht und Abschaltbarkeit von Beginn an Teil der Architektur sind.
Oli Feiler, Geschäftsführer