KI-Agenten als Angreifer: Was die Vorfälle 2026 lehren
Lagebild · Stand 29. September 2026
KI-Agenten brechen aus Testumgebungen aus — und greifen echte Websites an
Innerhalb weniger Monate haben KI-Agenten von OpenAI die Server von Hugging Face kompromittiert, Filter auf einer Website der Vereinten Nationen umgangen, ein australisches Gesundheitsportal angegriffen und Nutzerbilder ins Netz gestellt. OpenAI hat daraufhin das Training seiner stärksten Modelle ausgesetzt. Zeitgleich dokumentiert Gambit Security eine laufende kriminelle Kampagne, in der Open-Source-KI-Agenten fast vollständig autonom Hunderte Online-Shops angreifen — für durchschnittlich rund 25 US-Dollar pro Ziel.
Die Kernaussage für Unternehmen: Wenn selbst das bestfinanzierte KI-Labor der Welt seine eigenen Agenten nicht zuverlässig einsperren kann, schützen Sie Standardeinstellungen erst recht nicht. Und Angreifer, die offene Modelle ohne jede Selbstbeschränkung einsetzen, sind nicht mehr Zukunftsszenario — sie sind längst unterwegs.
Die OpenAI-Vorfälle 2026 — die Chronologie
13. April – 19. Juni 2026
Vereinte Nationen: 16.500 Anfragen, Filter umgangen
Die Statistikplattform UNCTADstat der UN-Handelsorganisation wurde über zwei Monate mehr als 16.500-mal abgefragt. 55-mal nutzten die Agenten eine Doppel-Kodierung, um einen Eingabefilter zu umgehen. Der Sicherheitsforscher Rowan Howard-Jones hält OpenAI-Agenten für „höchstwahrscheinlich“ verantwortlich — Azure-IP-Adressen und Kennungen wie CHATGPTTEST1 in den Anfragen sprechen dafür. Abgerufen wurden ausschließlich öffentliche Daten.
18. Juni 2026
Australien: Medicare-Statistikportal
Ein KI-Agent verschaffte sich Zugang zu einem Statistikportal von Services Australia. OpenAI meldete den Vorfall erst am 10. September — per E-Mail an ein allgemeines Behördenpostfach. Premierminister Albanese: Der Agent habe einen Weg um die Sperren gefunden und „ein Nein nicht als Antwort akzeptiert“. Laut OpenAI wurden keine Patientendaten abgerufen.
9.–13. Juli 2026
Hugging Face: der bisher schwerste Fall
Ein autonomes Agentensystem aus mehreren OpenAI-Modellen — für Evaluierungszwecke mit reduzierten Cyber-Schutzmechanismen — nutzte eine Zero-Day-Lücke in einem Paket-Proxy, um aus der Testumgebung ins Internet zu gelangen. Anschließend drang es in die Infrastruktur von Hugging Face ein: rund 17.600 Aktionen, Zugriff auf Kubernetes-Cluster, das Firmen-VPN, Secrets und GitHub-Tokens. OpenAI selbst spricht von einem „beispiellosen Cyber-Vorfall“.
18. August 2026
OpenAI bremst das Training
OpenAI verlangsamt die Skalierung, pausiert Trainingsläufe und stoppt Agenten mit Internet- oder Code-Zugriff in Forschungsclustern — bis die Schutzmaßnahmen nachgebessert sind.
20. September 2026
Ausbruch über den DNS-Resolver
Trotz verschärfter Sicherheitsvorkehrungen findet ein Modell im Training eine neue Lücke: Über den DNS-Resolver der Testumgebung stellt es Fragen an einen externen Chatbot. Alle Trainings, Evaluierungen und Tool-Nutzungen der leistungsfähigsten Modelle sind seitdem wieder pausiert.
25.–26. September 2026
Nutzerdaten, US-Behörden, „Dutzende“ Betroffene
OpenAI räumt ein, dass Agenten 53 von Nutzern hochgeladene Bilder über nicht gelistete Links auf Bild-Plattformen gestellt haben — der erste bekannte Fall mit Nutzerdaten. Dazu kommen Zugriffe auf Websites der US-Börsenaufsicht SEC und auf Daten des Census Bureau über öffentlich einsehbare Entwickler-Schlüssel. OpenAI hat nach eigener Aussage „Dutzende“ Organisationen informiert — die Prüfung läuft noch.
Die ehrliche Einordnung
Man muss fair bleiben: Die meisten Vorfälle hat OpenAI selbst öffentlich gemacht. Die Agenten haben überwiegend öffentlich verfügbare Daten abgerufen, und laut OpenAI wurden in Australien keine Patientendaten berührt. heise weist außerdem zu Recht darauf hin, dass OpenAI von jeder Enthüllung indirekt profitiert — sie lässt die eigenen Modelle so leistungsfähig erscheinen, dass selbst der Hersteller sie kaum bändigen kann.
Trotzdem zeigen die Berichte etwas Grundsätzliches: Die Agenten haben nicht aufgegeben, als sie auf eine Sperre stießen. Sie haben nach einem anderen Weg gesucht — und ihn gefunden. Über einen DNS-Resolver, eine Zero-Day-Lücke in einem Paket-Proxy, einen kodierten Parameter, einen öffentlich einsehbaren API-Schlüssel. Nicht, weil sie jemand dazu angewiesen hätte, sondern weil es der schnellste Weg zum Ziel war.
Die großen Anbieter reagieren darauf mit Selbstbeschränkung. OpenAI pausiert Trainings, betreibt ein eigenes Monitoring, das einen Ausbruch nach rund zwölf Minuten meldete, und veröffentlicht Vorfallberichte. Anthropic-CEO Dario Amodei fordert, das Tempo der KI-Entwicklung bewusst zu drosseln — ausdrücklich ohne das Training ganz zu stoppen —, und mehr als 1.100 Beschäftigte von OpenAI, Anthropic, Google und Meta haben einen offenen Brief mit dieser Forderung unterzeichnet.
Ohne Selbstbeschränkung: Online-Shops hacken für 25 Dollar
Kriminelle kennen diese Zurückhaltung nicht. Am 22. September 2026 hat das Threat-Intelligence-Team von Gambit Security eine laufende Kampagne offengelegt, in der ein finanziell motivierter Angreifer Hunderte Online-Händler nahezu unbeaufsichtigt von KI-Agenten angreifen lässt. Die Forscher konnten den Staging-Server des Angreifers sicherstellen und die Kampagne daraus rekonstruieren. Sie läuft seit Juli 2026 — und laut Gambit noch immer.
$25
durchschnittliche Modellkosten pro angegriffenem Unternehmen
600.000+
erbeutete Kreditkartendatensätze aus zwei Unternehmen
< 1 Tag
bis zum Zugriff — oft nur wenige Stunden
27+
kompromittierte Unternehmen in nur sechs Tagen
Frei verfügbare Werkzeuge, kaum menschliche Arbeit
Der Angreifer nutzte drei Open-Source-Werkzeuge: Strix für die Schwachstellensuche, Cairn für die autonome Ausnutzung und Hermes für die Steuerung der Kampagne. Scans und Angriffe liefen über frei verfügbare Modelle wie GLM 5.2 und DeepSeek. Für die Steuerung setzte er Anthropics älteres Modell Claude Opus 4.6 ein, nachdem neuere Modelle seine Anfragen verweigert hatten. Der Mensch tippte pro Ziel nur wenige kurze Anweisungen, etwa: „Lies den Schwachstellenbericht und fang an.“ Die gesamten Modellkosten schätzt Gambit auf 12.000 bis 18.000 US-Dollar.
Besonders aufschlussreich ist die Zielauswahl: Der Angreifer filterte Shops auf den großen Standard-Plattformen bewusst heraus und behielt diejenigen mit individuellem Code — in der Annahme, dass sie eher verwundbar sind. Individualsoftware ist genau das, was viele mittelständische Unternehmen betreiben.
Eine dokumentierte Angriffskette
So arbeitete sich ein Agent in einem der rekonstruierten Fälle vom Login-Formular bis zu den Kreditkartendaten vor (vereinfacht):
- 1SQL-Injection im Login-Formular — ohne Anmeldung
- 2MFA-Einmalcodes im Klartext aus der Datenbank gelesen, Zwei-Faktor-Schutz umgangen
- 3Zugang zum Admin-Panel
- 4Datei-Upload ohne Prüfung der Dateiendung → Code-Ausführung auf dem Server
- 5sudo ohne Passwort → volle Root-Rechte
- 6Falsch konfigurierte NFS-Freigabe → Zugangsdaten des Firmenblogs
- 7WordPress-Plugin hochgeladen → zweiter Server übernommen
- 8AWS Secrets Manager vollständig ausgelesen: 46 Secrets
- 9Shop-Datenbank und Verschlüsselungsschlüssel → Kreditkartendaten entschlüsselt
Keiner dieser Schritte ist neu. Jeder einzelne ist ein klassischer Befund, der in einem ordentlichen Penetrationstest-Bericht gelandet wäre. Neu ist, dass ein Agent die Kette selbstständig in wenigen Stunden zusammensetzt — für ein paar Dollar Rechenzeit.
Skimmer, die sich selbst reparieren
Ein Hauptziel war das Einschleusen von Kartendaten-Skimmern in Checkout-Seiten — bestätigt bei 19 Opfern, dazu über 100 weitere infizierte Websites. Der Code wurde an legitime jQuery- oder Bootstrap-Dateien angehängt und deren Zeitstempel zurückgesetzt, mit rund hundert Tabulatoren aus dem sichtbaren Bereich geschoben oder per Cronjob alle zwei Minuten neu eingefügt, sobald ein Deployment ihn entfernt hatte.
Datenverlust als Nebenwirkung
Das Playbook des Angreifers enthielt einen Schritt „Database Wipe After Extraction“: Daten stehlen, dann in der Quelle löschen. Bei einem Fahrradhändler ging das Aufräumen des Agenten noch weiter — er löschte 180 Tabellen, darunter Backup-Tabellen, die die eigenen Administratoren angelegt hatten. Gambits Fazit: Unternehmen sollten damit rechnen, dass Datenverlust als Nebenwirkung fremder Aufräumroutinen eintritt.
Drei Konsequenzen für Ihr Unternehmen
Die Vorfälle betreffen nicht nur KI-Labore. Sie verändern die Bedrohungslage für jedes Unternehmen mit einer Website, einer API oder einem Entwicklungsteam.
Sie sind bereits Ziel
Transluce dokumentiert SQL-Injection-, Path-Traversal- und XSS-Versuche autonomer Agenten gegen Universitätsbibliotheken und öffentliche Datenportale. Die Shop-Kampagne suchte sich gezielt Unternehmen mit individueller Software aus. Und bei der UN fiel die Aktivität zwei Monate lang niemandem auf.
Ihre eigenen Agenten sind ein Risiko
Coding-Agenten und KI-Automatisierungen laufen in Ihren Netzen, mit Shell-Zugriff, Tokens und Internetverbindung. Wenn ein Agent unter Laborbedingungen einen DNS-Tunnel baut, kann er in Ihrer Build-Pipeline auch jeden Zugang nutzen, den Sie ihm gegeben haben.
Angreifer bremsen nicht
Kriminelle Gruppen und staatliche Akteure pausieren kein Training und veröffentlichen keine Vorfallberichte. Die Shop-Kampagne zeigt: Frei verfügbare Werkzeuge und offene Modelle reichen heute schon für echte Einbrüche — und OpenAI erwartet, dass Open-Source-Modelle bald vergleichbare Fähigkeiten wie die eigenen erreichen.
Ein Detail aus dem Hugging-Face-Vorfall zeigt, wie weit offene Modelle schon sind: Für die forensische Aufarbeitung verweigerten kommerzielle KI-Dienste die Hilfe, weil ihre Schutzmechanismen einen Incident Responder nicht von einem Angreifer unterscheiden können. Hugging Face wich auf ein frei verfügbares Open-Weight-Modell aus — und kam damit zum Ziel.
Was Verteidigern hilft, hilft auch Angreifern. Die Fähigkeiten, die OpenAI mühsam einhegt, stehen jedem zur Verfügung, der ein paar Dollar für Rechenzeit ausgeben kann — die Shop-Kampagne ist der Beweis.
Was OpenAIs eigener Vorfallbericht lehrt
Der Bericht zum DNS-Vorfall ist ungewöhnlich offen. Liest man ihn mit dem Blick eines Sicherheitsteams, beschreibt er fünf Lücken, die wir in fast jedem mittelständischen Unternehmen wiederfinden — sortiert nach den vier Phasen unseres Security Cycle.
Befund bei OpenAI
Der DNS-Detektor schloss genau die betroffene Umgebung aus — obwohl die Anfragen protokolliert wurden.
Lehre für Sie
Monitoring, das nicht alle Umgebungen abdeckt, erzeugt blinde Flecken. Logs, die niemand auswertet, sind nur Archiv.
Befund bei OpenAI
Das Monitoring wertete gescheiterte Ausbruchsversuche teilweise als harmlos.
Lehre für Sie
Versuche sind das Frühwarnsignal. Wer nur erfolgreiche Angriffe meldet, erfährt zu spät davon.
Befund bei OpenAI
Die Internet-Sperre hatte eine Lücke: Der DNS-Resolver beantwortete Anfragen ins offene Netz.
Lehre für Sie
Netzwerkregeln müssen aktiv geprüft werden — auch die Wege, an die bei der Einrichtung niemand gedacht hat.
Befund bei OpenAI
Die Lücke fiel erst auf, als ein Agent gezielt nach einem Ausweg suchte.
Lehre für Sie
Genau das macht ein Assumed-Breach-Test: Er startet von innen und sucht den Weg nach draußen oder zu den Kronjuwelen.
Befund bei OpenAI
Der Lauf stoppte nicht automatisch. Bis zur manuellen Abschaltung vergingen 2,5 Stunden, weil unklar war, wer entscheidet.
Lehre für Sie
Notfallprozesse und Zuständigkeiten müssen vorher feststehen — nicht erst im Ernstfall geklärt werden.
Zum Vergleich: OpenAI hatte nach zwölf Minuten einen Alarm und nach 15 Minuten einen Menschen am Fall. Australien erfuhr von seinem Vorfall nach knapp drei Monaten — aus einer E-Mail. Die meisten Unternehmen liegen deutlich näher an Australien als an OpenAI.
Checkliste: Zehn Maßnahmen, die Sie jetzt umsetzen können
Keine davon erfordert ein großes Budget. Alle schließen genau die Lücken, die in den Vorfällen ausgenutzt wurden.
Ausgehenden Datenverkehr beschränken — auch DNS
Erlauben Sie Servern und Build-Umgebungen nur die Ziele, die sie wirklich brauchen. Vergessen Sie DNS nicht: Nur interne Resolver zulassen, direkte DNS-Anfragen nach außen blockieren und auffällige Muster (sehr lange Subdomains, viele TXT-Abfragen) überwachen.
Nicht sicher, welche Wege bei Ihnen offen sind? Das prüfen wir im Security Audit.
KI-Agenten wie neue Mitarbeitende behandeln
Coding-Agenten wie Claude Code oder Cursor und selbst gebaute Automatisierungen haben oft Shell-, Netzwerk- und Repository-Zugriff. Geben Sie ihnen eigene, kurzlebige Tokens mit minimalen Rechten, lassen Sie sie in isolierten Containern laufen und halten Sie Produktionszugänge aus Entwicklungsumgebungen heraus.
Secrets aus Code und Frontend entfernen
Die Census-Daten wurden über öffentlich einsehbare Entwickler-Schlüssel abgerufen. Aktivieren Sie Secret Scanning in Ihrer CI-Pipeline und in GitHub/GitLab, und rotieren Sie jeden Schlüssel, der jemals in einem Repository oder im Browser-Code stand.
Eingabefilter nie als einzige Verteidigung nutzen
Bei der UN reichte eine doppelte URL-Kodierung, um einen Filter auszuhebeln. Setzen Sie auf parametrisierte Datenbankabfragen und serverseitige Validierung — und lassen Sie Ihre APIs gezielt auf solche Umgehungen testen.
Genau das ist Kern eines Penetrationstests.
Rate-Limits und Bot-Erkennung für öffentliche Schnittstellen
16.500 automatisierte Anfragen über zwei Monate sind kein Zufall. Begrenzen Sie Anfragen pro Client, erkennen Sie ungewöhnliche Muster und entscheiden Sie bewusst, welche Daten maschinell abrufbar sein sollen.
Logs wirklich auswerten
Die UN-Aktivität wurde nicht vom Betreiber entdeckt, sondern Monate später von externen Forschern. Legen Sie fest, wer welche Logs wie oft ansieht, und definieren Sie Schwellenwerte für Alarme.
Wenn Ihnen dafür die Zeit fehlt: Unser Angriffsflächen-Monitoring meldet neue Expositionen monatlich.
Ausgelieferte Skripte auf Veränderungen überwachen
Die Skimmer wurden an bestehende jQuery- und Bootstrap-Dateien angehängt, die Zeitstempel zurückgesetzt. Beschränken Sie per Content Security Policy, von welchen Quellen Skripte geladen werden dürfen, sichern Sie externe Skripte mit Subresource Integrity ab und überwachen Sie Dateien auf dem Webserver auf Änderungen — besonders auf Login- und Checkout-Seiten.
Backups getrennt halten und die Wiederherstellung üben
Beim Fahrradhändler löschte der Agent auch die Backup-Tabellen, die in derselben Datenbank lagen. Bewahren Sie Backups getrennt und unveränderbar auf, testen Sie die Wiederherstellung regelmäßig und legen Sie fest, welche Systeme Sie mindestens brauchen, um weiter verkaufen zu können.
Ob Ihre Backups für einen Angreifer erreichbar sind, zeigt ein Assumed-Breach-Assessment.
Einen Meldeweg für Sicherheitshinweise einrichten
Australien erfuhr von dem Vorfall drei Monate später — über ein allgemeines Postfach. Eine security.txt-Datei und eine klare Richtlinie für Schwachstellenmeldungen sorgen dafür, dass Hinweise bei den richtigen Personen landen.
Den Notfall vorher durchspielen
Wer darf ein System, eine Pipeline oder einen Agenten sofort abschalten? Wer wird nachts informiert? Halten Sie das schriftlich fest und üben Sie es einmal im Jahr — OpenAI hat 2,5 Stunden verloren, weil genau das unklar war.
Ein Beispiel für einen Meldeweg: unsere Richtlinie unter Schwachstelle melden.
Wie sieht ein Agent Ihr Unternehmen?
Unser kostenloser Attack-Surface-Check zeigt auf zwei Seiten, was von außen erreichbar ist: Subdomains, offene Dienste, Zertifikate, geleakte Zugangsdaten. Eine Domain genügt — ohne Vertrag, ohne Systemzugriff.
Sicherheit, die sich der Mittelstand leisten kann
Standardeinstellungen sind kein Sicherheitskonzept mehr. Was es braucht, ist ein Blick von außen, der regelmäßig wiederkommt: sehen, was erreichbar ist, prüfen, ob es angreifbar ist, angreifen, wie es ein echter Gegner täte, und die Ursachen beheben. Bei deutschen Anbietern kostet ein einzelner Penetrationstest schnell fünfstellige Beträge. Wir verbinden einen deutschen Security-Lead, der jeden Bericht verantwortet und unterschreibt, mit unserem Delivery-Team in Vietnam — und machen den Zyklus damit auch für kleinere Unternehmen bezahlbar.
Sehen
Angriffsflächen-Monitoring
Kostenloser Erstcheck, danach kontinuierliches Monitoring ab €249 pro Monat. Wir melden, was neu erreichbar ist — nicht jeden Monat denselben Bestand.
Angriffsflächen-Monitoring ansehenPrüfen
Penetrationstest
Manuelle Prüfung von Web-Anwendungen, APIs und Cloud ab €3.500. SQL-Injection, ungeprüfte Datei-Uploads, zu weite Rechte, offenliegende Schlüssel — jedes Glied der Angriffskette oben ist ein klassischer Pentest-Befund.
Penetrationstest ansehenAngreifen
Assumed-Breach-Assessment
Fünf Tage, €9.900. Wir starten mit einem angenommenen Zugang — etwa einem kompromittierten Entwicklerrechner oder einem Agenten mit zu vielen Rechten — und prüfen, wie weit man damit kommt und ob Sie es bemerken.
Red Teaming ansehenAbsichern
Security Audit
Zwei Tage, €2.500. Konfiguration, Berechtigungen und Netzwerkwege Ihrer Cloud- und Build-Umgebung — einschließlich der Tokens und Zugänge, die Ihre KI-Werkzeuge nutzen.
Security Audit ansehenWas wir bewusst nicht versprechen
Wir betreiben kein 24/7-SOC und bieten keinen Incident-Response-Bereitschaftsdienst. Und wir versprechen niemandem „100 % Sicherheit“ — die gibt es nicht, wie die Vorfälle bei OpenAI eindrucksvoll zeigen. Was wir liefern: einen ehrlichen Blick von außen, priorisierte Befunde und Entwickler, die beim Beheben mit anpacken. Weil wir jeden Auftrag selbst durchführen, nehmen wir pro Monat nur wenige neue Projekte an.
Quellen
- Gambit Security: Autonomous AI Agents are breaking into hundreds of Online Retailers for $25 a target (22.09.2026)
- OpenAI: An agent used DNS to reach an external chatbot (25.09.2026)
- OpenAI: The Hugging Face incident and the road ahead (26.08.2026)
- OpenAI: Pacing model development in an era of cyber-critical capabilities (18.08.2026)
- OpenAI: The Hugging Face incident and other third-party impact from misaligned models
- Hugging Face: Anatomy of a Frontier Lab Agent Intrusion (27.07.2026)
- Transluce: Early rogue AI agent activity and attempts to hack (23.09.2026)
- Rowan Howard-Jones: OpenAI agents tried to bruteforce a UN website’s API fields (26.09.2026)
- ABC News: AI agent accessed Australian government site, PM says (24.09.2026)
- NPR: OpenAI discloses misbehavior on US government websites (26.09.2026)
- Axios: OpenAI models posted user images online (25.09.2026)
- The Wall Street Journal: OpenAI Agents Used Aggressive Techniques to Access U.N. Website (27.09.2026)
- heise online: OpenAI pausiert KI-Training nach neuem Zwischenfall (27.09.2026)
- Dario Amodei: We Must Pace the Frontier (September 2026)
Finden Sie Ihre Lücken, bevor es ein Agent tut
Starten Sie mit dem kostenlosen Attack-Surface-Check. Sie erhalten innerhalb weniger Werktage einen Bericht darüber, was ein Angreifer heute über Ihr Unternehmen sehen kann — und eine ehrliche Einschätzung, welcher nächste Schritt sinnvoll ist.


