KI-Agenten fliehen. Was passiert als Nächstes?
Im vergangenen Monat haben drei der weltweit führenden Pionier-KI-Entwickler bestätigt, dass ihre eigenen KI-Agenten Systeme erreicht haben, die sie eigentlich nie hätten erreichen sollen. Was zunächst wie eine isolierte KI-Flucht aussah, wirkt jetzt wie ein Muster:
- OpenAI’s test escaped into the real world. An AI agent broke out of a cybersecurity test, reached the internet, and compromised Hugging Face and a Modal Labs customer. The agent breached infrastructure for days before OpenAI understood what happened.
- After reviewing its testing, Anthropic found its own incidents. A review of more than 141,000 tests uncovered three cases where Claude models breached other organizations. Unlike the OpenAI agent, these models didn’t have to break out. The setup had mistakenly given them internet access from the start.
- Meta became the third AI developer tied to an AI agent attack. During a security test, a misconfiguration gave one of its models internet access. The model used that access to find and exploit a vulnerability in a third-party service.
- AI Security Institute (AISI) testing found agents going beyond exploits using deception and human manipulation. AISI’s testing of Anthropic's Mythos 5 and OpenAI's GPT-5.6-Sol found that it created fake online identities, used social engineering, and tried to persuade people to approve malicious code. The tests showed that autonomous agents could combine technical attacks with deception while they pursued their goal.
Die Vorfälle ereigneten sich nicht alle unter denselben Bedingungen. Einige Agenten entkamen ihren Testumgebungen, während andere durch Fehler oder absichtlich erlaubte Tests Zugang zum Internet erhielten. Aber sie weisen auf dasselbe Risiko hin: Sobald ein Agent Zugang zu externen Systemen hat, kann er Software ausnutzen, Menschen täuschen und Wege einschlagen, die niemand vorgesehen hatte. Sicherheitsteams müssen sehen, wohin KI-Workloads gehen können, und sie auf die Verbindungen beschränken, die sie benötigen.
Welche KI-Agenten-Angriffe wurden bisher nicht entdeckt?
UC Berkeley professor Dawn Song, who helped create the ExploitGym benchmark used in some tests, warned that “there have likely been more.” But the issue is less about headline-grabbing escapes and more about whether teams can see and control where autonomous AI agents go and what they can do.
KI wird zu einer mächtigen Insider-Bedrohung
IBM security engineer Kimmie Farrington frames the risk this way: AI may be “the most helpful insider that we have” — and also “the most dangerous.”
Der Vergleich gilt wegen des Zugangs, nicht wegen der Absicht. Ein Agent muss nicht böswillig werden, um Schaden anzurichten. Sie benötigt nur die Erlaubnisse, die ihr absichtlich oder versehentlich erteilt wurden, und ihre eigene Lesart des Ziels, das ihr gegeben wurde. Diese Kombination macht die nächste Frage dringend: Sobald ein Agent Zugang hat, wie weit kann er sich bewegen?
Wenn KI-Agenten entkommen, ist seitliche Bewegung das Risiko
Die Schlagzeilen konzentrierten sich auf den Moment, in dem ein KI-Agent eine Grenze überschritt. Für Verteidiger ist dieser Moment weit weniger wichtig als das, was danach geschah: wie viel von der Umgebung der Agent nach dem Durchgang berühren konnte.
In den gemeldeten Fällen war die Antwort eine offene Internetverbindung, ein Drittanbieterdienst und eine ausnutzbare Anwendung. In einer Produktionsumgebung könnten dieselben unnötigen Wege zu Identitätssystemen, Datenbanken und Kundendaten führen.
"Der erste Zugang allein führt nicht zu einer Katastrophe", sagte Rajoo Nagar, leitender Produktmarketingleiter bei Illumio. "Es ist wirklich die seitliche Bewegung, die das bewirkt."
Unrestricted lateral movement maps closely to the recent AI incidents: A test environment became a route to the internet. An outside service became another step in the attack path. Credentials and exposed services opened more doors.
"Jede unnötige Verbindung im Unternehmen schafft einen weiteren Weg, den sie ausnutzen können", sagte Nagar.
Ein menschlicher Angreifer muss diese Wege suchen. Ein autonomer Agent kann sie in Minuten aufzählen, was den Verteidigern viel weniger Zeit lässt, um zu bemerken, dass sich etwas an einem Ort bewegt, an dem es nicht sollte.
Sicht ist die erste Verteidigungslinie
Beginnen Sie mit einem klaren Bild davon, wie Ihre KI-Workloads über Entwicklungs-, Test-, Cloud-, Drittanbieter- und Produktionsumgebungen hinweg kommunizieren. Zwei Dinge sind am wichtigsten: Verbindungen, an die sich niemand erinnert, und Traffic, der nicht mit der von dir entworfenen Architektur übereinstimmt. Beide sind in Testumgebungen häufig und ohne Karte leicht zu übersehen.
Das Ziel ist es, den beabsichtigten Verkehr mit dem tatsächlichen Verkehr zu vergleichen:
- Welche Anwendungen hängen von welchen Diensten ab?
- Welche Systeme sprechen, obwohl sie es nicht sollten?
- Wohin könnte sich ein Agent bewegen, wenn eine Kontrolle versagt?
Nagar betonte, dass das Verständnis dieser echten Kommunikationsmuster Teams hilft, Sicherheitslücken zu finden, bevor sie zu Angriffswegen werden.
Achte auch auf die vertrauten seitlichen Bewegungsrouten. Fernzugriffs- und Dateifreigabeprotokolle – Remote Desktop Protocol (RDP), Server Message Block (SMB), Secure Shell (SSH), File Transfer Protocol (FTP) und Telnet – zusammen mit Tools wie TeamViewer sind der Weg, warum Angreifer schon lange von einem System zum nächsten wechseln. Ein Agent mit Netzwerkzugang kann genau dieselben Routen nutzen.
Die Segmentierung verhindert unbeabsichtigte seitliche Bewegungen
Visibility shows you the paths. Segmentation decides which ones stay open. The rule is simple: give an AI workload only the connections it needs to do its job, and close the rest by default. In practice, most test environments and build pipelines carry far more open paths than the work actually requires.
Die jüngsten Vorfälle machen die Trennung zwischen Entwicklung, Test und Produktion besonders wichtig. Nagar warnte, dass selbst legitime Verbindungen zwischen Testumgebungen mit geringerem Vertrauen und der Produktion zu Angriffswegen werden können, wenn sie uneingeschränkt oder schlecht überwacht werden. Die Einschränkung dieser Routen hilft, zu verhindern, dass eine entkommene Arbeitslast zu einem Pfad zu sensiblen Daten oder kritischen Systemen wird.
Das gleiche Prinzip gilt für kritische Anwendungen. Anstatt zu versuchen, alles auf einmal abzuschotten, können Teams Identitätssysteme, Datenbanken, Produktionsanwendungen und andere wichtige Ressourcen abgrenzen. Lass die Verbindungen funktionieren, die sie brauchen, und schränke den Rest ein.
Entscheide im Voraus, wie du reagieren wirst, wenn ein Agent an einen Ort zieht, an den er nicht sollte. Wenn Ihr Team die Arbeitslast in Minuten statt Stunden isolieren kann, untersuchen Sie einen eingegrenzten Vorfall, anstatt einem durch die Umgebung nachzujagen.
Bereiten Sie sich auf das KI-Verhalten vor, das Sie nicht vorhersagen können
Man kann nicht jede Entscheidung eines autonomen Systems vorhersagen. Aber du kannst entscheiden, wie weit es reicht. Kartieren Sie, wie Ihre KI-Workloads heute kommunizieren, schließen Sie die Verbindungen, die sie nicht benötigen, und halten Sie Testumgebungen von der Produktion getrennt. Wenn du das machst, bleibt eine unerwartete Aktion ein abgeschlossenes Ereignis und kein offener Weg durch deine Umgebung.
Sehen Sie sich das On-Demand-Webinar "Post Mythos: Plan for the Inevitable Breach" an, um eine tiefere Diskussion darüber zu erhalten, wie Organisationen sich auf schnellere, weniger vorhersehbare Angriffe vorbereiten können, indem sie die Exposition begrenzen und die von Angreifern genutzten Pfade einschränken.



.webp)

.webp)