Sicherheitsforscher des ELLIS Institute und des Max-Planck-Instituts haben eine fundamentale Architektur-Schwachstelle in den Programmierschnittstellen führender KI-Anbieter aufgedeckt. Zwischen dem 9. und 11. August 2026 veröffentlichten sie ihre Arbeit zum Erbeuten von Denkprozessen aus proprietären Modellen. Betroffen von der Sicherheitslücke sind die Systeme der Branchengrößen OpenAI, Anthropic und Google. Führende Anbieter senden verdeckte Denkprozesse als verschlüsselte Textblöcke an Clients zurück, um ihr geistiges Eigentum zu schützen. Diese Praxis soll verhindern, dass Konkurrenten die internen Gedankengänge über Distillation-Methoden abgreifen.
Die Wissenschaftler entdeckten jedoch, dass diese verschlüsselten Blöcke innerhalb des Ökosystems eines Anbieters modellübergreifend kompatibel und austauschbar sind. Dadurch entstand ein schwerwiegendes Einfallstor für gezielte Angriffe auf die Schnittstellen. Ein Angreifer konnte den verschlüsselten Denkblock eines KI-Spitzenmodells wie Claude Opus abfangen und abgreifen. Dieser abgefangene Block wurde anschließend an ein deutlich schwächeres Modell derselben Modellfamilie wie Claude Haiku weitergeleitet.
Da schwächere Modelle über deutlich geringere Sicherheitsmechanismen verfügen, ließen sie sich leicht manipulieren. Die Forscher nutzten diesen Umstand aus, um das schwächere Modell per Jailbreak zur Ausgabe des geheimen Denkprozesses im Klartext zu zwingen. Das Ausmaß des verknüpften Datenlecks erwies sich bei der Untersuchung als beträchtlich. Durch die systematische Analyse von 315.320 öffentlichen Agenten-Trajektorien auf Plattformen wie GitHub und Hugging Face konnten vertrauliche Daten geborgen werden.
Insgesamt identifizierten die Forscher 704 vertrauliche Datensätze in den veröffentlichter Agenten-Protokollen. Unter den geborgenen Daten befanden sich 62 API-Schlüssel sowie 33 Passwörter und Zugangs-Tokens. Nutzer hatten diese sensiblen Informationen unwissentlich über die verschlüsselten Blöcke in öffentlichen Repositories mitveröffentlicht. Die betroffenen Anbieter wurden vorab informiert und haben umgehend erste Gegenmaßnahmen ausgerollt. Diese Notfall-Updates sollen das Ausführen von Cross-Model-Replay-Angriffen in den Schnittstellen künftig effektiv unterbinden.
Der Vorfall unterstreicht die verbleibenden Risiken bei der Trennung von verschlüsselter Nutzerkommunikation und internen Modellzuständen. Entwickler müssen bei der Einbindung von KI-Agenten genau prüfen, welche Daten in die Prompts gelangen. Die Entdeckung zeigt deutlich, dass verdeckte Denkprozesse ohne strenge krypto-grafische Bindung an spezifische Modelle ein Sicherheitsrisiko darstellen. Die Debatte um die Transparenz und Absicherung intelligenter Schnittstellen erhält damit eine neue Dynamik.

