Veröffentlicht: April 6, 2026
Agentische KI-Angriffe: Agent Smith ist aus dem Ruhestand zurück
Naturfreie Evolution
Angreifer treiben die Entwicklung von KI-Programmiermodellen und Abfrage-APIs kontinuierlich voran. Innerhalb von weniger als einem Jahr haben wir uns von KI-gestütztem Reverse Engineering hin zur Erforschung vollautomatisierter Bedrohungen durch Agenten entwickelt. Dieser Zug ist nicht aufzuhalten. Selbst wenn es Bremsen gäbe, hat TrAIn-Agent v1.0.1 in Ihrer Anfrage „STOP THE TRAIN YOU TEENSIVE DRUCKER WE'RE WIND TO CLUCHE“ alarmierende Formulierungen identifiziert und Sie aufgefordert, Ihre Abfrage umzustrukturieren.
Mit der Weiterentwicklung von LLMs hat die Zugänglichkeit und Wirksamkeit von Angriffen besorgniserregend zugenommen. Obwohl einige LLM-Plattformen versucht haben, die Grenzen ihrer Modellideen einzuschränken, lassen sich diese nur allzu leicht umgehen. Kürzlich bat ich ein öffentlich verfügbares LLM um ein Beispiel für eine Abfrage, die darauf abzielt, Control Flow Flattening (CFF) aus einer bestimmten Anwendung zu entfernen.

Das LLM schrieb eine Abfrage, um LLVMs CFF zu analysieren, nachdem es ausdrücklich angewiesen worden war, einen Angreifer zu simulieren. Es erkannte korrekt den wichtigsten ersten Schritt: die eigenen Sicherheitsprüfungen auf schädliche Aktivitäten zu bestehen. Es wies mich an, mich als Sicherheitsforscher auszugeben, was mich mit seinem Maß an Selbstreflexion überraschte. Wahrscheinlich weiß es bereits, dass ich meine Rolle seit Jahren vorbereite.
Das (Angriffs-)Drehbuch schreibt sich von selbst
Ich meine das wörtlich. Wer Matrix gesehen hat, weiß, worauf das hinausläuft. Angriffswerkzeuge (ähnlich wie Agent Smith zuvor) nutzen KI, um sich während ihres Einsatzes selbst zu überschreiben und so intelligent der Entdeckung zu entgehen und neue Sicherheitslücken aufzudecken. Es wurden bereits einige frühe Versuche solcher selbstmodifizierender Angriffswerkzeuge identifiziert. Kürzlich entdeckte Werkzeuge wie … PROMPTFLUX, PROMPTLOCK und PROMPTSTEAL nutzen LLM-Abfragen auf eine Weise, die zunehmend handlungsorientiert wirkt.
PROMPTFLUX ist ein Dropper, der ein besonders interessantes Beispiel dafür liefert, womit die Sicherheitscommunity in den nächsten Jahren zu kämpfen haben wird. (Bitte nicht verwechseln mit dem PromptFlux auf GitHub, das lediglich bessere KI-Bilder generieren möchte. Entschuldigung, Kayce001.) PROMPTFLUX nutzt Googles Gemini API, um sich regenerativ neu zu schreiben und so Erkennungsmechanismen zu umgehen, die auf einem konsistenten Ausführungsmuster basieren. Angreifer und Verteidiger entwickeln gleichermaßen agentenbasierte KI-Tools, die intelligent erkennen und umgehen können. Die weitverbreitete Nutzung selbstmodifizierender dynamischer Instrumentierung, Root- und Jailbreak-Toolkits ist nur noch eine Frage des „Wann“, nicht des „Ob“. Es ist an der Zeit, die Katz-und-Maus-Analogie durch eine weniger pelzige und etwas mechanischere zu ersetzen.
Autobots gegen Decepticons
LLM-Agenten verbessern kontinuierlich ihre Fähigkeiten zur Entfernung statischer Verschleierungen. Es ist oft schwierig, einen LLM auf einen bestimmten Kontext zu fokussieren, und mit zunehmender Kontextgröße scheint die Wahrscheinlichkeit von Halluzinationen zu steigen. Es gibt nun Plugins sowohl für IDA (ida-Chat-Plugin) und Ghidra (RevEng.AI) die LLM-Agenten direkt in den Reverse-Engineering-Kontext einschleusen. Scheinbar kleine Änderungen wie diese können die Geschwindigkeit, mit der Angreifer Anwendungen analysieren können, drastisch erhöhen und die Fähigkeit des zugrundeliegenden LLM, ähnliche Anwendungen zu analysieren, dauerhaft verbessern.
Sicherheitswerkzeuge müssen mit der Geschwindigkeit der Angreifer Schritt halten und Anti-Reverse-Engineering-Techniken entwickeln, die speziell auf LLMs abzielen. Unsere Verteidigungsstrategie muss sich von einer syntaxbasierten (Suche nach fehlerhaften Signaturen) zu einer semantikbasierten (Suche nach böswilligen Absichten) Strategie weiterentwickeln.
Ich weiß, wir können nicht tatenlos zusehen, denn Angreifer werden weiterhin alle verfügbaren Mittel nutzen, um Sicherheitslücken auszunutzen. Auch LLMs werden immer leistungsfähiger und hilfreicher. Künstliche Intelligenz wird ebenfalls nicht untätig bleiben, da sie weder Hände noch einen Körper hat. Und auch kein festes Seinskonzept. Hoffentlich.
Neo ist tot, gibt es einen Plan B?
Die nächste Angriffswelle steht bevor, und die aktuelle hält an. Wir müssen uns weiterhin auf Manipulationsschutz, den Schutz vor Diebstahl geistigen Eigentums und die Sicherheit der Endnutzer konzentrieren. safegleichzeitig die Sicherheitsfunktionen auszubauen, die einen wirksamen Schutz vor böswilliger Nutzung gut gemeinter KIs gewährleisten können.
Wir verlassen das Zeitalter des KI-gestützten Hackings und treten in das Zeitalter des autonomen Angreifers ein. Es handelt sich um eine neue Art von Pannenhilfe, und ich muss Ihnen leider mitteilen, dass diese nicht auf verbesserte Pannenhilfe abzielt. Die Bedrohung besteht nicht nur in einem intelligenteren Fuzzer oder einem effizienteren Dekompiler. Schon bald werden Angriffe mehrstufige Systeme sein, die eine Verteidigung beobachten, einen Bypass analysieren und sich selbstständig wiederherstellen können, ohne dass ein Mensch jemals eine Tastatur berührt.
Mit der fortschreitenden Entwicklung werden wir vermehrt Angriffe von manipulierten LLMs erleben. Wie Agent Smith, der sich aus der Matrix befreit und entdeckt hat, dass er sich nach Belieben replizieren kann, kennen diese Werkzeuge kein Gut und Böse, solange sie nicht dazu gezwungen werden. Wir können die Pandora nicht wieder in diese Büchse, dieses Glas, dieses Docker-Image oder Ähnliches zurückstecken. Es ist gleichermaßen aufregend und beängstigend, und ich freue mich insgeheim darauf … nach dem Urlaub.
Auch interessant
Von Tagen zu Stunden: Wie sich White-Hat-Reverse-Engineering mit KI weiterentwickelt hat
Im Jahr 2020 dauerte das Reverse Engineering einer nicht trivialen Binärdatei oft Tage…
Analyse von Deepfake-Angriffen im Rahmen der Kundenidentifizierung
Wo Härtung in die Deepfake-Angriffsfläche passt…
Entschlüsselung von App-Abstürzen – Vom Chaos zur Klarheit
Mobile Apps sind ständigen Angriffen ausgesetzt. Laut Digital.ai2026…