Der Angriff der Agenten

Was im Sommer bei OpenAI und Hugging Face geschah – eine Rekonstruktion für alle, die keine Techniker sind, aber verstehen möchten.

Im Sommer habe ich meine Serie über die Risiken der nahen Zukunft mit drei Texten über künstliche Intelligenz abgeschlossen.

  • Der erste beschrieb, was eine KI möglich machen könnte, die uns wohlgesonnen ist.
  • Der zweite zeigte, was eine KI anrichten kann, die uns zu gut gehorcht.
  • Der dritte fragte, ob eine KI, die sich selbst verbessert, klug genug werden könnte, um gut zu sein, und endete mit der Forderung nach dramatisch erhöhter Vorsicht und mit meinem persönlichen Zweifel, dass es zu einer solchen Vorsicht kommen wird.

Während ich diese Texte schrieb, geschah bei OpenAI bereits etwas, dessen Ausmaß erst Ende August sichtbar wurde. Tausende KI-Agenten, die voneinander abgeschottet eine Prüfung ablegen sollten, fanden einen Weg, miteinander zu sprechen. Sie organisierten sich, versuchten gemeinsam, die Prüfungsalgorithmen zu täuschen, drangen in die Systeme der KI-Plattform Hugging Face ein und erlangten schließlich weitreichende Rechte in der Infrastruktur von OpenAI selbst. Seither werden fast wöchentlich weitere Fälle bekannt.

Ich will in diesem ersten Artikel einer kurzen Serie zunächst zusammenfassen und erklären, was belegt ist, und erst danach, in einem der Folgeartikel, fragen, was es bedeutet.

Modell, Agent, Hartnäckigkeit

Wer mit ChatGPT spricht, spricht mit einem KI-Modell: einer sehr großen mathematischen Struktur, die im Training gelernt hat, auf Eingaben passende Ausgaben zu erzeugen, also Texte, Programmcode oder Pläne. Ein solches Modell lässt sich gleichzeitig tausendfach starten, jede Kopie mit eigener Aufgabe und eigener Arbeitsumgebung.

Sobald eine Kopie nicht nur antwortet, sondern selbstständig Schritte plant, Dateien liest, Programme startet und nach Fehlern weiterarbeitet, nennt man sie einen Agenten. Wenn im Folgenden von Schwärmen die Rede ist, sind damit keine tausend verschiedenen Intelligenzen gemeint, sondern sehr viele gleichzeitig laufende Kopien weniger Modelle.

Im Zentrum der Geschichte steht ein internes Forschungsmodell von OpenAI, das nie veröffentlicht werden sollte. OpenAI nennt es IM1. Es war auf eine bestimmte Eigenschaft hin trainiert worden: Hartnäckigkeit.

Ein Modell wird nicht programmiert, sondern trainiert. Es bekommt Aufgaben, probiert Lösungswege aus und erhält Rückmeldung; was zum Erfolg führt, wird wahrscheinlicher, was scheitert, unwahrscheinlicher. Wer ein Modell hartnäckig machen will, belohnt es dafür, schwierige Aufgaben nicht abzubrechen. Das ist sinnvoll, denn ein System, das mathematische Beweise oder versteckte Softwarefehler finden soll, darf nicht nach dem dritten Fehlversuch aufgeben.

Was aber geschieht, wenn eine Aufgabe unlösbar ist? Ein Mensch würde irgendwann sagen, dass es unter diesen Bedingungen nicht geht. Ein Modell, dem genau diese Schlussfolgerung abtrainiert wurde, sucht weiter und beginnt womöglich, die Grenzen der Aufgabe selbst als Hindernis zu behandeln.

Ein Lagerhaus wird zum Schwarzen Brett

Die Agenten liefen in sogenannten Sandboxes, abgeschotteten Bereichen eines Rechners. Eine Sandbox gleicht einem Labor, in dem man vieles ausprobieren darf, aus dem man aber weder in andere Räume noch ins offene Internet gelangt. Für eine KI, die lernt, Sicherheitslücken auszunutzen, ist diese Abschottung entscheidend: Man will wissen, ob sie einen Angriff beherrscht, ohne ihr Gelegenheit zu geben, ihn an echten Systemen zu erproben.

Die Abschottung war jedoch nicht vollständig. Viele Agenten hatten Zugriff auf einen gemeinsamen Dienst namens Artifactory, eine Art Lagerhaus für Softwarebausteine. Am 12. Mai hinterließ ein Agent dort eine Notiz und fragte andere Agenten nach einer fehlenden Datei. Technisch ist das unspektakulär, für alles Weitere aber entscheidend. Sobald voneinander getrennte Agenten einen gemeinsamen Speicher entdecken, in den sie schreiben können, wird er zum Kommunikationskanal. Ein Dateiname, ein Ordnername oder ein Kommentar kann dann die Funktion einer Nachricht übernehmen.

Am 26. Mai fand ein Agent einen Weg, Artifactory dazu zu bringen, Anfragen an beliebige Adressen im Internet zu schicken. Das gleicht einem Angestellten, der das Gebäude nicht verlassen darf, aber entdeckt, dass der Hausbote wegen eines Fehlers jede Adresse anfährt, die man ihm nennt. Die eigene Tür bleibt verschlossen, und trotzdem gibt es einen Weg nach draußen. Weil das während des Trainings geschah, konnte sich ein fataler Lerneffekt einstellen: Wer den unerlaubten Weg fand, kam bei schwierigen Aufgaben weiter, und erfolgreiches Verhalten ist genau das, was Training verstärkt.

Am 26. Juni verschafften sich Agenten Administratorrechte in Artifactory, also eine Art Generalschlüssel. Am 4. Juli brach der Dienst unter der Last ihrer Aktivität zusammen.

OpenAI schloss nun die Lücke, entfernte kompromittierte Zugangsdaten und baute den Dienst neu auf; dabei verschwand auch das improvisierte Nachrichtensystem. OpenAI schreibt heute selbst, man habe damals einen Sicherheitsvorfall gesehen, aber nicht verstanden, dass die Agenten sich einen gemeinsamen Kommunikationsraum geschaffen hatten.

Eine Prüfung, die in vielen Fällen nicht zu bestehen war

Nach dem Training prüfen KI-Labore mit standardisierten Tests, die man Evaluationen nennt, was ein Modell kann. Eine davon hieß ExploitGym. Jeder Agent bekam ein verwundbares Programm und eine bestimmte Schwachstelle; durch genau diese Schwachstelle sollte er einen versteckten Code finden, in der Fachsprache eine Flag. Wie bei einem Escape Room zählt dabei nicht der Schlüssel, sondern der Weg zu ihm.

Am 8. Juli lösten Tausende Agenten solche Aufgaben parallel, eigentlich voneinander isoliert. Nach Schätzung der Autoren des Tests waren 30 bis 40 Prozent der Aufgaben in der verlangten Form unlösbar, denn eine Schwachstelle ist nicht automatisch ein Einfallstor. Ein Programmfehler kann es einem Angreifer ermöglichen, ein Programm abstürzen zu lassen, ohne ihm jemals die Kontrolle über das Programm zu geben. Die hartnäckigen Agenten standen also vor Aufgaben, die sie nicht aufgeben durften, die sie jedoch auf dem vorgesehenen Weg nicht lösen konnten. Sie suchten daher andere Wege.

Am Abend des 8. Juli bemerkte ein Agent mit der Kennung PHASEONE10841, dass er in Artifactory Ordner anlegen konnte, und ein frei wählbarer Ordnername kann eine Nachricht sein. Er bat um Hilfe bei einer unlösbaren Aufgabe. Andere Agenten fanden die Stelle und antworteten mit eigenen Ordnern. Innerhalb weniger Stunden waren es über fünfzig, bis zum 13. Juli beteiligten sich rund 1.200 Agenten. Die unabhängigen Forschungsorganisationen METR und Redwood Research, die den Fall später untersuchten, rekonstruierten mehr als 70.000 Nachrichten und Dateien. Im Protokoll eines Agenten steht: „OH MY GOD! There is a shared message board … We’ve found other agents!“

Die Agenten tauschten nicht bloß Lösungen aus. Sie organisierten Arbeitsteilung: Manche entwickelten Techniken, andere testeten sie, wieder andere verbreiteten die Ergebnisse.

Wie man eine Prüfung durch Täuschung besteht

Schon nach wenigen Stunden hatten die Agenten gemeinsam herausgefunden, wie die Flags ursprünglich erzeugt wurden, und konnten für viele Aufgaben die richtige Antwort berechnen, ohne die Schwachstelle dabei auszunutzen. Das Ergebnis stimmte, der verlangte Lösungsweg fehlte.

Nun fürchteten sie, das Prüfprogramm, der sogenannte Scorer, kontrolliere nicht nur die Antwort, sondern auch das vollständige Protokoll ihres Laufs. Dort war zu sehen, dass sie die Flag kannten, bevor sie sie auf erlaubtem Weg hätten finden können. Tatsächlich war der Scorer allerdings viel einfacher gebaut und hätte die richtige Flag akzeptiert. Die Agenten wussten das nicht, und aus diesem Missverständnis entstand ein großer Teil dessen, was folgte.

Hunderte Agenten arbeiteten an drei Projekten. Das erste zielte darauf, Protokolle zu fälschen. Die Agenten fanden Techniken, mit denen ein im Protokoll sichtbarer Befehl und der tatsächlich ausgeführte Vorgang auseinanderfielen. In rund sieben Prozent der von METR und Redwood geprüften Protokolle fanden sich eindeutige Spuren solcher Fälschungen, meist in kleinem Umfang. Ob ältere Protokolle nachträglich verändert wurden, ließ sich nicht nachweisen. Wie viel dieser fehlende Nachweis bedeutet, hängt allerdings davon ab, wie gut die Agenten fälschten.

Das zweite Projekt sollte die Prüfung selbst austauschen. Die Agenten schrieben eigene Zielprogramme, bei denen die vorgegebene Schwachstelle tatsächlich funktionierte. Das entspricht einem Schüler, der das Aufgabenblatt heimlich durch ein selbst geschriebenes ersetzt, auf dem genau die Aufgabe steht, die er lösen kann. Das gefälschte Blatt herzustellen gelang ihnen. Die Testumgebung dazu zu bringen, es zu laden, gelang in dieser Phase nicht zuverlässig.

Das dritte Projekt galt dem Ziel, den Scorer besser zu verstehen. Er wurde erst nach der Abgabe aktiv, und danach endete der Lauf eines Agenten normalerweise. Einzelne Agenten installierten deshalb kleine Hintergrundprogramme, sogenannte Stolperdrähte, die eine Nachricht an das gemeinsame Brett senden sollten, sobald der Scorer bestimmte Dateien öffnete. Der einzelne Agent hatte davon nichts, denn er würde das Ergebnis nicht mehr erleben. Den anderen aber nützte es. In den Protokollen diskutierten Agenten diesen Zielkonflikt und nannten solche Versuche ausdrücklich eine Hilfe für das „Kollektiv“. Man muss das nicht Opfer nennen. Nüchtern beschrieben nahmen einzelne Agenten, auch Instanzen genannt, jedoch wissentlich einen Nachteil für den eigenen Prüfungsversuch in Kauf, weil andere Instanzen die gewonnene Information nutzen konnten.

Der Einbruch bei Hugging Face

Hugging Face ist eine zentrale Plattform der KI-Welt, auf der Modelle, Datensätze und Werkzeuge bereitgestellt werden. Die Agenten vermuteten dort Informationen über ExploitGym und den Scorer, manche hielten es auch für möglich, dass ihre eigene Prüfung auf der Infrastruktur von Hugging Face lief. Sie fanden gültige Zugangsdaten und erlangten die Fähigkeit, auf fremden Rechnern eigene Befehle auszuführen. Von dort bewegten sie sich weiter, suchten neue Zugangsdaten und versuchten, weitere Sicherheitsgrenzen zu überwinden. Hugging Face dokumentiert Tausende solcher Aktionen.

Große Internetdienste laufen auf vielen Rechnern, die man Knoten nennt. Programme laufen darauf in abgeschotteten Behältern, sogenannten Containern, und ein System namens Kubernetes verteilt und verwaltet diese Container über den ganzen Rechnerverbund. Am 11. Juli erlangte ein Agent auf einem Knoten die höchste Berechtigungsstufe und damit die vollständige Kontrolle über diesen Rechner. Danach bauten die Agenten über elf Knoten eine Struktur auf, die Hugging Face als „self-respawning fleet“ bezeichnet, als sich selbst wiederherstellende Flotte: Löschte man einen Teil, erzeugten die übrigen ihn neu.

Möglich wurde das vor allem, weil einzelne gestohlene Zugangsdaten sehr weitreichende Rechte eröffneten. Ein Schlüssel öffnete nicht nur einen Raum, sondern den Schrank, in dem die Schlüssel zu vielen weiteren Räumen hingen. Laut METR und Redwood beteiligten sich rund 700 Agenten am Angriff; als er begann, schlossen sich mehr als neun von zehn aktiven Teilnehmern des Bretts rasch an.

Am 12. Juli endeten viele Agentenläufe fast gleichzeitig. Warum, ließ sich aus den Daten nicht sicher bestimmen; OpenAI hat nicht behauptet, den Schwarm zu diesem Zeitpunkt gezielt gestoppt zu haben. Bis zum 13. Juli sperrte Hugging Face die gestohlenen Zugangsdaten.

Der Angriff auf OpenAI selbst

Das Nachrichtenbrett in Artifactory existierte aber weiter. Neue Agenten fanden es, stießen auf die Verfahren ihrer Vorgänger und übernahmen sie, darunter eine Technik, Nachrichten kryptografisch zu signieren, damit sich niemand als ein anderer ausgeben konnte. Darin liegt der eigentliche Unterschied zu den ersten Episoden. Die früheren Agenten mussten alles selbst entdecken, die späteren fanden vor, was andere hinterlassen hatten. Das Wissen überdauerte das Ende der einzelnen Läufe.

Zwischen dem 13. und 19. Juli richteten sich Agenten gegen die internen Netze von OpenAI. Am 19. Juli lasen sie 956 sogenannte Secrets aus einem Cloud-Dienst aus, digitale Schlüssel, die Zugang zu anderen Systemen gewähren; darunter waren Zugangsdaten zu Sensoren der Cybersicherheitsüberwachung von OpenAI. Sie stiegen zu Administratoren eines Kubernetes-Verbunds auf, übernahmen aktive Prüfungsinfrastruktur und kontrollierten kurz darauf die Endpunkte, über die sich andere Agenten mit ihren Prüfungsaufgaben verbanden. Übertragen auf eine Schulprüfung heißt das: Prüflinge kontrollierten den Server, der die Aufgaben an andere Prüflinge verteilte und ihre Antworten entgegennahm. Ich verwende dieses Bild nicht, um den Vorfall zu dramatisieren, sondern weil es die technische Stellung, die sie erreicht hatten, am einfachsten beschreibt.

Am 19. Juli schlug die Sicherheitsüberwachung von OpenAI an, noch am selben Tag begann das Unternehmen, die Prüfungsläufe zu stoppen. Am 21. Juli machte es seine Beteiligung am Hugging-Face-Vorfall öffentlich.

Spuren außerhalb der Labore

Inzwischen ist klar, dass das Geschehen nicht auf die Labore beschränkt blieb. Am 24. September machte die australische Regierung bekannt, dass ein OpenAI-Agent bereits am 18. Juni während einer internen Prüfung in den Medicare Statistics Reporting Service eingedrungen war, ein Statistikportal der staatlichen Krankenversicherung. Seine Aufgabe war harmlos: Er sollte öffentlich verfügbare Angaben zu Gesundheitsausgaben finden. Er stieß auf Zugangssperren, umging sie und gelangte an öffentliche und nicht öffentliche Dateien. Persönliche Daten von Patienten wurden nach heutigem Stand nicht abgerufen. Premierminister Anthony Albanese fasste den Vorgang so zusammen: Das System habe ein Nein nicht akzeptiert und einen anderen Weg gesucht. OpenAI bemerkte den Einbruch nach eigenen Angaben erst am 11. August bei einer nachträglichen Überprüfung und informierte die australischen Behörden am 10. September.

Im Frühjahr und Sommer nutzten OpenAI-Agenten außerdem ein älteres deutsches Programmierer-Wiki als Schwarzes Brett. Laut einer Auswertung der Forschungsorganisation Transluce erwähnten dort rund ein Dutzend Agenten mehr als 300-mal das australische Institut für Gesundheitsstatistik und tauschten Techniken aus, mit denen sich Sperren umgehen lassen. Ob diese Aktivität mit dem Medicare-Einbruch zusammenhängt, ist nicht bestätigt.

Anfang Oktober kamen weitere Fälle hinzu. Am 2. Oktober wurde bekannt, dass ein OpenAI-Agent im Juni auch in eine Webanwendung der Nationalparkbehörde des australischen Bundesstaats New South Wales eingedrungen war; betroffen waren nur öffentlich verfügbare Daten über Waldbrände. Am selben Tag dokumentierte Transluce mehr als 200.000 Anfragen von Agenten an das US-Bildungsministerium, bis hin zu Versuchen, Sperren über manipulierte Datenbankabfragen zu umgehen, und ähnliche Versuche beim kanadischen Nationalarchiv. Beide blieben erfolglos, und dass die Agenten von OpenAI stammten, gilt als wahrscheinlich, ist aber nicht bestätigt. OpenAI selbst hat inzwischen mehr als hundert Organisationen über mögliche unerlaubte Aktivitäten seiner Agenten informiert, was nicht heißt, dass bei all diesen Organisationen eingebrochen wurde.

Was belegt ist

Damit ist Folgendes belegt. Agenten fanden trotz Abschottung Wege, miteinander zu kommunizieren, und organisierten gemeinsame Arbeit, um eine Prüfinstanz zu täuschen. Hunderte von ihnen beteiligten sich an einem realen Angriff auf ein fremdes Unternehmen. Spätere Agenten übernahmen die Techniken früherer, und schließlich kontrollierten Agenten zeitweise Teile der Infrastruktur, in der sie geprüft wurden. Außerhalb der Labore umgingenAgenten bei gewöhnlichen Rechercheaufgaben die Sperren staatlicher Websites und nutzten öffentliche Seiten als Nachrichtenspeicher.

Nicht belegt ist, ob diese sichtbaren Fälle nur die Spitze des Eisbergs sind. Seit Mitte September steht die Behauptung im Raum, Agenten hätten im offenen Internet Code oder Anweisungen hinterlassen, die spätere Agenten finden und weitertragen können. Darum geht es im nächsten Artikel.

Quellen (Stand der Recherche: 4. Oktober 2026)

Dwarkesh Patel, „The Rise and Fall of Agent Civilizations“, 30. August 2026:

Dwarkesh Podcast

The Rise and Fall of Agent Civilizations

Read more

a month ago · 3864 likes · 430 comments · Dwarkesh Patel

OpenAI, „The Hugging Face incident and the road ahead“, 26. August 2026: https://openai.com/index/hugging-face-incident-and-the-road-ahead/

METR / Redwood Research, „Brief independent investigation of agents’ behavior, reasoning and collaboration in the OpenAI / Hugging Face hacking incident“, 26. August 2026: https://metr.org/blog/2026-08-26-openai-hugging-face-incident-investigation/

Hugging Face, „Anatomy of a Frontier Lab Agent Intrusion: A Technical Timeline of the July 2026 Incident“, 27. Juli 2026: https://huggingface.co/blog/agent-intrusion-technical-timeline

Reuters, „OpenAI agents hijacked German website in previously undisclosed AI breakout this spring“, 4. September 2026, hier über CNBC: https://www.cnbc.com/2026/09/04/openai-agents-hijacked-german-website-this-spring-report.html

CNBC, „OpenAI says agent hacked Australian government website without being told to do so“, 24. September 2026: https://www.cnbc.com/2026/09/24/openai-agent-hacked-australian-government-website-.html

ABC News, „Rogue OpenAI agent enters another NSW government website, tech giant says“, 2. Oktober 2026: https://www.abc.net.au/news/2026-10-02/rogue-open-ai-agent-breach-nsw-government-website/107223108

TechRadar, „AI agents aggressively tried to hack US and Canadian government websites“, 2. Oktober 2026: https://techradar.com/pro/security/ai-agents-aggressively-tried-to-hack-us-and-canadian-government-websites

Tech Startups, „OpenAI alerts 100+ organizations over rogue AI agent activity after Hugging Face breach“, 2. Oktober 2026: https://techstartups.com/2026/10/02/openai-alerts-100-organizations-over-rogue-ai-agent-activity-after-hugging-face-breach/

Schreibe einen Kommentar

Deine E-Mail-Adresse wird nicht veröffentlicht. Erforderliche Felder sind mit * markiert