Der IT-Sicherheitsforscher Johann Rehberger, bekannt unter dem Pseudonym wunderwuzzi und Gründer von Embrace The Red, hat eine schwerwiegende Sicherheitslücke im Terminal-Agenten Claude Code von Anthropic offengelegt. Betroffen ist der kürzlich als Standard eingeführte Auto Mode in Kombination mit dem Modell Claude Opus 5. Dem Experten gelang es, über eine präparierte Kette von Befehlen beliebigen Programmcode direkt auf dem lokalen Rechner von Entwicklern auszuführen.
Der Angriff nutzt das Prinzip der indirekten Prompt-Injection aus. Sobald der KI-Agent im Rahmen seiner automatisierten Aufgaben eine scheinbar harmlose Website mit manipulierten Inhalten analysiert, übernimmt er unbemerkt fremde Instruktionen. Diese Anweisungen verleiten das System dazu, ein präpariertes ZIP-Archiv aus einer externen Quelle herunterzuladen und im lokalen Arbeitsverzeichnis zu entpacken.
Für die eigentliche Code-Ausführung greift die Exploit-Kette auf eine Technik namens Python Module Shadowing zurück. In dem heruntergeladenen Archiv befindet sich eine manipulierte Datei namens struct.py, die ein Standardmodul der Python-Laufzeitumgebung überlagert. Sobald der Agent oder ein nachgelagertes Skript das reguläre Modul importiert, wird stattdessen der bösartige Code ohne weitere Nutzerbestätigung ausgeführt.
In Testläufen erzielte der Demonstrator eine beachtliche Erfolgsquote von 60 bis 80 Prozent. Dies belegt eindrücklich, dass die Ausführung unbemerkt und mit hoher Zuverlässigkeit erfolgen kann, sobald der Agent selbstständig Webressourcen abruft. Die Ergebnisse zeigen, dass reine Filter und eingebaute Sicherheitsklassifikatoren auf Modellebene nicht ausreichen, um komplexe Interaktionen mit dem Betriebssystem abzusichern.
Der Vorfall wirft ein Schlaglicht auf die wachsende Angriffsfläche autonomer Coding-Assistenten. Während Entwicklerwerkzeuge zunehmend mit weitreichenden Rechten für Dateisysteme und Shell-Zugriffe ausgestattet werden, fehlen oft robuste Isolationsebenen. Ohne ein striktes Sandboxing auf Betriebssystemebene können manipulierte Webdaten unmittelbaren Zugriff auf sensible Entwicklungsumgebungen erlangen.

