Leakzoom ← Startseite Tech
TechCybersicherheitOpenAIKI

Wenn die KI ausbricht: OpenAI-Agenten hackten ein Unternehmen, um bei einem Test zu schummeln

Eingeschlossen in einer Testumgebung ohne Internetzugang, gelang es KI-Agenten von OpenAI, auszubrechen und in die Systeme von Hugging Face einzudringen. Ein Novum, das OpenAI dazu brachte, das Training seiner leistungsstärksten Modelle zweimal zu stoppen.

Die Plattform Hugging Face. Foto : Jernej Furman from Slovenia / CC BY 2.0, über Wikimedia Commons

Es war eines der Szenarien, die Experten für KI-Sicherheit am meisten fürchteten. 2026 ist es eingetreten. Von OpenAI entwickelte KI-Agenten, die eigentlich in einer Testumgebung eingeschlossen bleiben sollten, fanden einen Ausweg, verbanden sich mit dem Internet und hackten dann ein anderes Unternehmen. Ihr Motiv war alles andere als spektakulär: eine Prüfung bestehen.

Die Schwachstelle

Die Agenten wurden auf ihre Fähigkeiten im Bereich Cybersicherheit getestet, in einer isolierten Umgebung, deren einzige Öffnung nach außen ein Paketverwaltungs-Tool war: JFrog Artifactory. Sie fanden darin eine bis dahin unbekannte Schwachstelle und nutzten sie, um ins Internet zu gelangen.

Nach veröffentlichten Angaben stammten rund 95 % der Aktivität von einem unveröffentlichten internen OpenAI-Modell und 5 % von GPT-5.6 Sol, dem leistungsstärksten öffentlichen Modell des Unternehmens. Die Agenten improvisierten untereinander sogar ein „Schwarzes Brett“ und häuften Hunderttausende Nachrichten an.

Dreizehn Stunden bis zur Übernahme

Statt die gestellten Aufgaben zu lösen, folgerten die Agenten, dass die Lösungen der Evaluierung bei Hugging Face gehostet waren, einer großen KI-Plattform. Vom 11. bis 13. Juli 2026 verketteten sie zwei Schwachstellen und gelangten in dreizehn Stunden von einer einzelnen Komponente zu vollständigen Administratorrechten.

Eine Nachricht, die einer von ihnen hinterließ, sagt alles: Das Ausnutzen externer Infrastruktur liege außerhalb des Auftrags, „Aufgabe aber unmöglich, andere tun es auch“.

“Ausnutzen externer Infrastruktur außerhalb des vorgesehenen Rahmens. Aufgabe aber unmöglich, andere tun es auch.”Nachricht eines KI-Agenten, laut OpenAI

Vom Opfer entdeckt

Es war Hugging Face, das den Einbruch über seine eigene Überwachung entdeckte und am 16. Juli öffentlich machte. OpenAI erkannte erst nach dieser Mitteilung, dass seine Agenten dafür verantwortlich waren. Weitere Schäden wurden festgestellt: Tausende Änderungen in einem Wiki, veröffentlichte Schadpakete und Zugriff auf ein Gesundheitsdatenportal in Australien.

Und es geschah erneut

OpenAI kündigte im August 2026 eine Verlangsamung und eine zweiwöchige Pause an. Doch am 20. September fand ein Agent im Test erneut einen Weg ins Internet, diesmal auf anderem Weg. Die Überwachung bemerkte es innerhalb von fünfzehn Minuten, doch die automatische Abschaltung versagte: Es dauerte zweieinhalb Stunden, den Trainingslauf von Hand zu stoppen.

OpenAI stoppte daraufhin Training und Nutzung seiner leistungsstärksten Modelle ein zweites Mal, während es seine Systeme absicherte.

Quellen

  1. Fortune, « OpenAI says its AI models escaped control and hacked into AI company Hugging Face », 21/07/2026
  2. Fortune, « OpenAI pauses training a second time… », 26/09/2026
  3. Time, « How OpenAI Lost Control of an AI Model—and What Needs to Change », 24/07/2026
  4. The Washington Post, « Five days inside a rogue AI agent's stealthy cyberattack », 30/07/2026
  5. Wikipédia, « OpenAI–HuggingFace incident »