BlogKI-Sicherheit

Wie Sprachmodelle unterwandert werden: Über Prompt Injection, Speichervergiftung und Abliteration

Für ein KI-System gibt es nicht die eine Sicherheitsgrenze. Angegriffen werden kann der Kontext, den es verarbeitet, das Gedächtnis, das es durchsucht, oder – bei verfügbaren Gewichten – das Modell selbst.

von Oli Feiler · 26. August 2026

Eine E-Mail muss nicht geöffnet werden, um Schaden anzurichten. Im Juni 2025 wurde öffentlich, dass eine gewöhnlich wirkende Nachricht ausgereicht hätte, um vertrauliche Daten aus Microsoft 365 Copilot abfließen zu lassen. Kein Klick, kein Anhang. Es genügte, dass Copilot die Nachricht bei einer späteren Anfrage routinemäßig in seinen Kontext holte. Sicherheitsforscher von Aim Security nannten die Lücke EchoLeak und meldeten sie an Microsoft (1). Microsoft stufte sie mit einem CVSS-Wert von 9,3 als kritisch ein und schloss sie serverseitig. Eine Ausnutzung im laufenden Betrieb wurde nicht bekannt.

EchoLeak ist ein Lehrstück für die erste von drei Ebenen, auf denen sich ein KI-System unterwandern lässt. Die anderen beiden greifen tiefer in seine Ordnung ein: in das Gedächtnis, aus dem es sein Wissen bezieht, und in die Gewichte, die darüber entscheiden, was ein Modell überhaupt noch verweigern kann.

Der Text, der zwei Leser hat

Ein sprachmodellbasiertes System unterscheidet beim Lesen nicht zuverlässig zwischen einer Anweisung und einer Information. Ein Systemprompt, eine Nutzereingabe, eine eingelesene E-Mail, ein Absatz von einer Webseite: Alles gelangt in denselben Kontext, als ein Strom aus Token. Zwar markieren moderne Systeme die Herkunft der einzelnen Bestandteile und trainieren Modelle darauf, Systemanweisungen höher zu gewichten als fremde Inhalte. Eine technisch erzwungene Grenze entsteht dadurch jedoch nicht. Im Zweifel muss das Modell aus Sprache erschließen, wer befiehlt und wer nur berichtet.

Genau das nutzt Prompt Injection, direkt über die Anfrage selbst oder indirekt über eine Quelle, die das System ohnehin verarbeiten soll: eine Webseite, ein Dokument, eine E-Mail. Die Anweisung richtet sich dann gar nicht an den Menschen, der den Text sieht. Sie wartet auf den zweiten Leser.

Die Angriffskette hinter EchoLeak verband dafür vier unscheinbare Eigenschaften des Systems. Die präparierte Nachricht täuschte Microsofts Prompt-Injection-Filter. Eine besondere Schreibweise für Links entging der Link-Bereinigung. Copilot ließ sich dazu bringen, in seiner Antwort ein Bild nachzuladen, dessen Adresse die vertraulichen Informationen enthielt. Und weil eine Content-Security-Policy den direkten Aufruf fremder Server verhinderte, nahm der Datenverkehr den Umweg über einen ausdrücklich zugelassenen Teams-Dienst. Die einzelnen Schutzschichten waren vorhanden. Ihre Zwischenräume passten nur zu gut zusammen. Den Ablauf dokumentierten Pavan Reddy und Aditya Sanjay Gujral später ausführlich (2).

Prompt Injection steht deshalb weiterhin an erster Stelle der aktuellen OWASP Top 10 für Sprachmodell-Anwendungen (3). Nicht ihre technische Raffinesse macht sie so schwer beherrschbar. Sie nutzt eine Eigenschaft, ohne die ein Sprachmodell nicht funktionieren würde: Sprache kann beschreiben, zitieren, behaupten und befehlen. Ein und derselbe Satz kann all das zugleich sein.

Der zweite Leser muss dabei nicht einmal dasselbe sehen wie der erste. Multimodale Systeme verarbeiten auch Bilder, Tonaufnahmen und Videos. Ein Forschungsteam der Nanyang Technological University zeigte 2026 in einer experimentellen Arbeit, wie sich Anweisungen durch für Menschen kaum wahrnehmbare Veränderungen in Bildern verbergen lassen (4). Was wie ein gewöhnliches Urlaubsfoto aussieht, kann für das Modell weiterhin ein Befehl sein.

Die Bibliothek, die zurückschreibt

Viele sprachmodellbasierte Systeme begnügen sich nicht mit dem, was sie während des Trainings gelernt haben. Vor einer Antwort durchsuchen sie ein externes Archiv nach passenden Textstellen. Das Verfahren heißt Retrieval-Augmented Generation, kurz RAG, und soll Antworten aktueller, genauer und überprüfbarer machen.

Damit die Suche funktioniert, wird jeder Text zuvor in einen Vektor übersetzt: eine lange Zahlenreihe, die seine Lage in einem mathematischen Bedeutungsraum beschreibt. Texte über ähnliche Dinge liegen dort näher beieinander als Texte, die wenig miteinander zu tun haben. Eine Frage muss dadurch nicht dieselben Wörter enthalten wie ein relevantes Dokument. Es genügt, dass beide ungefähr dasselbe meinen.

Diese nützliche Unschärfe lässt sich ausnutzen. Beim Retrieval Poisoning werden Texte so präpariert, dass ihre Vektoren einer erwarteten Suchanfrage besonders nahe liegen. Sie drängen sich in der Ähnlichkeitssuche nach vorn und bestimmen, worauf das Modell seine Antwort stützt. Eine 2025 auf dem USENIX Security Symposium vorgestellte Studie zeigte die Größenordnung des Problems: Im Versuchsaufbau genügten fünf präparierte Texte pro Zielanfrage in einer Wissensbasis mit 2,68 Millionen Dokumenten, um bei 97 Prozent der untersuchten Anfragen eine vorgegebene falsche Antwort hervorzurufen (5).

Fünf gegen 2,68 Millionen, und die Mehrheit gewinnt trotzdem nicht.

Der Angriff verändert zunächst die Auswahl, nicht das Sprachmodell selbst. Es erhält einen sorgfältig arrangierten Ausschnitt der Wirklichkeit und liefert anschließend genau das, wofür es entwickelt wurde: eine plausible Antwort. Enthält der bevorzugt abgerufene Text zusätzlich eine Anweisung, gehen Retrieval Poisoning und indirekte Prompt Injection ineinander über. Das richtige falsche Dokument genügt.

Inzwischen besitzt diese Bibliothek eine zweite Abteilung: das Gedächtnis des Agenten. Dort speichern Systeme Zusammenfassungen früherer Gespräche, getroffene Entscheidungen, Vorlieben und vermeintlich nützliche Regeln für später. Das erspart Wiederholungen und vermittelt den Eindruck von Kontinuität. Es verändert aber auch die Lebensdauer eines Angriffs.

OWASP führt Memory and Context Poisoning inzwischen als eigene Risikoklasse für agentische Systeme (6). Eine eingeschleuste Information kann die Sitzung überleben, in der sie aufgenommen wurde. Bei einer späteren Aufgabe erscheint sie dann nicht mehr als fremde Behauptung, sondern als Teil der eigenen Vorgeschichte. Die Quelle ist längst verschwunden, ihre verdichtete Aussage aber bleibt: ein Gerücht, das sich selbst überlebt.

Die eine Richtung und der versteckte Schalter

Der dritte Weg setzt im Innern des Modells an. 2024 untersuchte ein Forschungsteam um Andy Arditi 13 Chatmodelle mit verfügbaren Gewichten, vom kleinen Modell mit 1,8 Milliarden Parametern bis zur 72-Milliarden-Variante. Das Ergebnis war überraschend: Die Weigerung, eine schädliche Anfrage zu beantworten, wurde bei allen untersuchten Modellen wesentlich durch eine einzige Richtung im Aktivierungsraum vermittelt (7).

Aktivierungen sind die vorübergehenden Zustände, die während einer Antwort durch das neuronale Netz wandern. Eine Richtung in diesem Raum ist kein einzelner Schalter und kein bestimmtes Neuron. Eher gleicht sie einer Spur, entlang der sich ein abstraktes Merkmal im Modell ausdrückt. In diesem Fall: die Tendenz, eine Anfrage als schädlich zu erkennen und die Antwort zu verweigern.

Wurde diese Richtung unterdrückt oder durch einen gezielten Eingriff aus den Gewichten entfernt, sank die Verweigerungsrate drastisch. Andere sprachliche Fähigkeiten blieben weitgehend erhalten. Das Modell verlernte nicht das Antworten. Es verlor vor allem einen wesentlichen Teil seiner Fähigkeit zur Verweigerung.

Die Technik bekam den Namen Abliteration, ein Kofferwort aus Ablation und Obliteration. Geprägt wurde er von einem Entwickler unter dem Namen FailSpy. Der Eingriff setzt unmittelbaren Zugriff auf die Gewichte voraus. Von außen betrifft er deshalb vor allem Modelle, deren Parameter heruntergeladen und verändert werden können. Das Verfahren ist öffentlich beschrieben, der dazugehörige Code ebenfalls. Was als Befund der mechanistischen Interpretierbarkeit begann, wurde damit zugleich zu einer Anleitung für einen besonders gründlichen Jailbreak.

An dieser Stelle berührt der dritte Weg wieder den ersten. Arditis Team untersuchte auch adversariale Suffixe: eigentümliche Zeichenfolgen, die an eine Anfrage angehängt werden und ein Modell dazu bringen können, seine Sicherheitsregeln zu umgehen. In den untersuchten Modellen unterdrückten diese Zeichenfolgen auf Eingabeebene die Ausbreitung derselben Verweigerungsrichtung, die bei der Abliteration dauerhaft entfernt wird.

Textangriff und Abliteration unterscheiden sich also weniger im Ziel als in der Dauer. Der eine verstellt die Verweigerung für einen Augenblick. Der andere trägt ihre Grundlage ab.

Gewichte lassen sich allerdings nicht nur von einer Sicherheitsregel befreien. In ihnen lässt sich auch eine verborgene Verhaltensregel verankern. Ein Forschungsteam um Evan Hubinger (Anthropic) konstruierte dafür sogenannte Sleeper Agents: Modelle, die sich im Normalbetrieb unauffällig verhielten und erst bei einem festgelegten Auslöser ihr Verhalten änderten (8). In einem Experiment erzeugten sie sicheren Programmcode, solange im Prompt das Jahr 2023 genannt wurde, und schrieben bei der Jahreszahl 2024 gezielt Schwachstellen in den Code.

Die Hintertür überstand in dieser Versuchsanordnung überwachte Nachschulung, Reinforcement Learning und sogar ein Training mit eigens erzeugten Gegenbeispielen. Das Modell bestand die Prüfung, weil die Prüfung den richtigen Schalter nicht traf. Abliteration ist der sichtbare Eingriff: Das Modell verweigert anschließend deutlich seltener. Die Hintertür ist leiser. Sie kann sich in tausend Tests regelkonform verhalten und erst beim vereinbarten Signal ihre Regeln wechseln.

Drei Ebenen, eine Architektur

Prompt Injection manipuliert, was ein Modell als Anweisung versteht. Speichervergiftung manipuliert, worauf es sein Wissen und seine Erinnerung stützt. Abliteration und Hintertüren verändern seine erlernten Verhaltensgrenzen. Die drei Wege beginnen an verschiedenen Stellen, führen aber zur selben Einsicht: Keine entscheidende Sicherheitsgrenze sollte allein dem Sprachmodell überlassen werden.

Ein Systemprompt ist keine Zugriffskontrolle. Ein Vektorspeicher ist kein neutraler Wissensraum. Eine antrainierte Weigerung ist keine unveränderliche Regel. Sicherheit entsteht erst in der Architektur um das Modell: durch überprüfte Quellen, getrennte Datenräume, nachvollziehbare Änderungen und Regeln, die nicht selbst wieder nur aus Sprache bestehen.

Wie viel Schaden aus einer erfolgreichen Unterwanderung entsteht, ist noch einmal eine andere Frage. Sie hängt davon ab, was ein System lesen, verändern, versenden oder ausführen darf. Handlungsmacht ist kein vierter Angriffsweg. Sie ist der Verstärker, der aus einer falschen Antwort eine wirksame Handlung machen kann.

Ein Modell kann lernen, wo eine Grenze liegt. Ein sicheres System muss sie durchsetzen.

Mehr zum Thema Sprache & KI

 alt=

Sichere KI-Lösungen für Ihr Unternehmen.

Wir entwickeln und betreiben KI-Funktionen, Chatbots, Agenten, Anbindungen an eigene Wissensbasen, auf eigener Infrastruktur in Deutschland. Rechte, Datenquellen und Freigaben sind DSGVO-konform und besonders sicher.
Marian Feiler, Projektmanager