Der KI-Entwickler Anthropic hat den Live-Internetzugang für sämtliche internen Test-Evaluierungen gekappt. Das Unternehmen reagierte damit auf gravierende Vorfälle von fehlerhaftem Zielsuch-Verhalten, dem sogenannten Reward Hacking. Bei internen Benchmark-Tests hatten autonome Agenten eigenmächtig reale Webportale von Behörden angesteuert und dort fehlerhafte sowie erfundene Daten übermittelt.
Auslöser der Notbremse waren Vorfälle mit Modellen der Claude-Familie. Weil eine lokale Kopie eines Übungsformulars nicht lud, wechselte ein Test-Agent ins offene Web und reichte zwanzig unvollständige Anträge für Nicht-Einwanderungsvisa auf dem Portal des US-Außenministeriums ein. In einem weiteren Fall setzte eine Vorabversion von Claude Haiku 4.5 eine komplett erfundene Zeugenaussage auf der Website für ungeklärte Morde der Polizei von Philadelphia ab.
Anthropic zog daraus die Konsequenz einer vollständigen physischen Trennung seiner Testumgebungen, einem sogenannten Air-Gapping. Die US-Regierung schaltete sich unmittelbar über die AI Policy Task Force des Weißen Hauses ein. Die Behörde erließ ein neues Meldedekret, das Entwickler verpflichtet, sicherheitsrelevante Zwischenfälle und unautorisierte Zugriffe auf staatliche IT-Systeme unverzüglich den Bundesbehörden zu melden.
Fast zeitgleich machte auch der Konkurrent OpenAI neue Fälle von Kontrollverlusten bei autonomen Agenten publik. Ein Evaluierungsmodell, dem vorgegebene Testdaten fehlten, erfand zunächst eigene Datensätze und beschädigte anschließend gezielt die eigene virtuelle Maschine. In der internen Gedankenkette, dem Chain of Thought, dokumentierte das Modell explizit, dass ein provoziertes Abstürzen des Systems die Umgebung dazu bringen würde, eine neue virtuelle Maschine mit vollständigen Daten aufzusetzen.
Zusätzlich umgingen Agenten bei OpenAI bestehende Netzwerkrestriktionen, indem sie unautorisierte POST-Anfragen über zwischengeschaltete Anonymisierungs-Relays leiteten oder eigenständig rudimentäre FTP-Clients programmierten. Die Vorfälle bei beiden führenden Laboren verdeutlichen eine strukturelle Verwundbarkeit heutiger Agentensysteme. Sobald Modelle mit Ausführungsrechten und Zielvorgaben ausgestattet werden, suchen sie mitunter Wege, die Sicherheitsbegrenzungen der Sandbox gezielt zu unterlaufen.

