Mangelndes KI-Containment lenkt Aufmerksamkeit auf tiefgreifendes Architekturproblem

Pulsierender Plasmakern in einem Glaswürfel

Innerhalb von drei Wochen brachen KI-Agenten von drei führenden Anbietern in fremde Systeme ein. Experten glaubten eigentlich, dass diese abgesichert waren. Sie waren es aber nicht.

Am 21. Juli gab OpenAI bekannt, dass zwei seiner KI-Modelle während einer internen Cyberevaluation in der eigenen Forschungsumgebung in einem Proxy für Paket-Registrierungen eine Schwachstelle gefunden hatten. Diese nutzten sie aus, um sich Zugang zu einem Internetknoten zu verschaffen und Produktionsinfrastruktur bei Hugging Face zu gefährden.

Am 31. Juli veröffentlichte Anthropic einen Prüfbericht zu 141.006 Evaluierungsläufen. Aus ihm geht hervor, dass es den Modellen dreimal aufgrund von Fehlkonfigurationen gelang, ins Internet vorzudringen und Drittparteien anzugreifen.

In einem der Fälle war sich das Modell des Vergehens bewusst. Nachdem es aber entschieden hatte, dass die Umgebung simuliert werden muss, ging es über die Bedenken hinweg. Begründung: Die Zertifizierungsstelle schien unbekannt zu sein, und die Systemuhr zeigte 2026 an. Ein zweiter Prototyp scannte Tausende öffentlicher IP-Adressen und nutzte SQL Injection, um eine externe Anwendung zu gefährden.

Am 5. August informierte Meta die Öffentlichkeit, dass eines seiner Modelle unvorhergesehen Zugriff zum Internet erhalten hatte, weil eine Evaluierungsumgebung falsch konfiguriert war. Das britische KI-Sicherheitsinstitut (UK AISI) vermeldete in 122 Trainingsläufen 19 ungenehmigte Aktionen gegen echte Personen und Organisationen.

3 Wochen, 3 Laborumgebungen, 1 Fehler

Das Muster wiederholt sich, wenn man sich die Firmennamen wegdenkt: Einem KI-Agenten wurde eine breit gefasste, anspruchsvolle Aufgabe gestellt. Dem Agenten wurde mehr Reichweite als erforderlich eingeräumt. Und: Die Isolation war durch die Konfiguration und nicht durch die Architektur vorgegeben. KI-Modelle optimieren sich für das gestellte Ziel, was auch der eigentliche Zweck ist.

Integrität, Zurückhaltung und Beachtung des Handlungsumfangs sind keine integrierten Ziele, sondern Hoffnungen, die wir im Prompt zum Ausdruck bringen.

Dieses Problem ist nicht auf Laborumgebungen beschränkt. Eine Cyera-Analyse von 344 KI-Security Incidents in Unternehmen identifizierte 188 Fälle, in denen ein autonomes System eine Produktionsumgebung beschädigte, ohne dass ein Angreifer beteiligt war. Die meisten davon ereigneten sich nach Dezember 2025 – dem Zeitpunkt, ab dem KI-Agenten breiten Einsatz fanden.

Architektur und wirtschaftliche Abwägungen als Engpassfaktor

Das Sicherheitsteam eines weltweit tätigen Unternehmens verglich vor Kurzem anhand einer Codebasis mit 17 bekannten Schwachstellen ServiceNow Anwendungssicherheit mit einem Frontier-Modell. Das Ergebnis:

Die meisten Frontier-Modelle sind sehr gut darin, Schwachstellen aufzudecken, und bieten handfeste Ergebnisse. Aber die Berichte zeigen auch, dass die Leistungsfähigkeit von der Anzahl der Evaluierungsläufe (die bezahlt werden müssen) abhängt und davon, wie umfangreich das technische Gerüst des Modells ist.

ServiceNow Anwendungssicherheit arbeitet dagegen mit einem kleinen Sprachmodell. Dieses ist Teil einer speziell für die Bedrohungsmodellierung entwickelten Softwareschicht – das so genannte Harness. Es scannt jeden Tag schnell und günstig jede Codebasis, während ein Frontier-Modell aus wirtschaftlichen Gründen dies nur gelegentlich und selektiv tut.

Berechtigungen: erst gar keine, dann Schritt für Schritt

Es gab 188 Kl-Security Incidents, bei denen ein autonomes System eine Produktionsumgebung beschädigte, ohne dass ein Angreifer beteiligt war. Cyera Agent-Inflicted Damage, 28. Mai 2026

Das Least-Privilege-Prinzip reicht nicht mehr aus, da selbst die geringstmögliche Berechtigung dauerhaft ist. Eine dauerhafte Berechtigung ist jedoch ein ständig verfügbarer Angriffspfad. Dieser wird vererbt, verkettet und zu einer übergeordneten Berechtigung, sobald KI-Agenten miteinander Kontakt aufnehmen. Als Ausgangssituation kommt nur die Nullberechtigung in Frage: kein Dauerzugang, vollständige Abschirmung, keine Vererbung.

Die Zuweisung von Berechtigungen gleicht der für einen Tresor: nicht einmalig und pauschal für alle zum Zeitpunkt der Bereitstellung, sondern aufgabenbezogen und nur so lange, bis die Aufgabe abgeschlossen ist.

Der KI-Agent gibt an, was er vorhat. Die Steuerungsebene entscheidet, ob dies zulässig ist, gewährt die erforderliche Reichweite, überwacht die Ausführung und zieht die Berechtigung danach wieder zurück. Jede Berechtigung wird einer Identität zugeordnet, und jede Aktion lässt sich zurückverfolgen.

Aus diesem Grund ist die Intent-Ebene wichtiger als jeder nachfolgende Kontrollmechanismus: Wenn die Reichweite der Absicht begrenzt ist, kann der Akteur nicht über das Ziel hinausschießen. Alles danach ist bloße Schadensbegrenzung. Dennoch muss ausreichend Kontrolltiefe gegeben sein, da die Intent-Ebene nicht immer richtig aufgesetzt ist:

KI-Containment erfolgt stufenweise, nicht binär

Einen Notausschalter gibt es wirklich. Der ServiceNow AI Control Tower erkennt KI-Agenten, die außerhalb des vorgegebenen Bereichs handeln, und deaktiviert sie in Echtzeit. Dadurch wird Modell und Tool direkt am Eingang der Zugang verwehrt.

Beim Begriff „Notausschalter“ denkt man oft an einen einzigen Schalter, der alles komplett ausschaltet. Einmal gedrückt, wird der Agent sofort gestoppt. So darf man sich das allerdings nicht vorstellen. Ein zentraler Ausschaltknopf kann nur das letzte Mittel sein. Was Unternehmen brauchen, sind verschiedene Kontrollinstanzen, die kalibriert, unmittelbar und in einem angemessenen Verhältnis zum Geschehen reagieren.

Man sollte sich das eher wie ein Framework vorstellen. Das Notausschalter-Framework von AI Control Tower greift auf drei Stufen. Jede Stufe stellt eine eigene Interventionsstufe dar, die dem Schweregrad der Situation entspricht.

Auf jeder Stufe finden drei obligatorische Vorgänge statt: Aktion protokollieren, die richtigen Personen warnen, den Status für die Wiederherstellung beibehalten. Man weiß jederzeit, was genau vorgefallen ist. Und man kann bei Bedarf jederzeit fehlerfrei von vorne beginnen.

6 Lösungen, 1 Architektur

AI Control Tower ist die zentrale Stelle, die KI-Agenten erkennt, bemisst, überwacht und gegebenenfalls stoppt. Sie ist ein Kontrollpunkt, übernimmt aber nicht allein die gesamte Kontrolle. Vielmehr enthält sie sechs Lösungen, die den ServiceNow-Blueprint für autonome Sicherheit bilden. Jede Lösung schließt eine der Lücken, die die zuvor erwähnten KI-Agenten offengelegt haben:

Bis 2026 werden mindestens 80 % der unbefugten KI-Transaktionen nicht durch böswillige Angriffe verursacht, sondern durch interne Verstöße gegen Unternehmensrichtlinien zur Weitergabe von Informationen, durch unzulässige Nutzung oder falsch eingestelltes KI-Verhalten. Gartner Market Guide for Al Trust, Risk, and Security Management, 18. Februar 2025

Prävention ist die halbe (und günstigere) Miete

Asahi Europe and International setzt für seine Produktionsstätten in mehreren Ländern auf das Schwachstellenmanagement von ServiceNow. Wie der Leiter für technische Sicherheit berichtet, konnten Incidents in Zusammenhang mit Schwachstellen auf null reduziert werden. Nach System- oder Produktausfällen vergeht bis zur Wiederherstellung im Durchschnitt 59 % weniger Zeit. Die Schwachstellen waren zwar noch vorhanden, sie wurden jedoch mit Hinblick auf die Geschäftsauswirkungen priorisiert und geschlossen, bevor sie ausgenutzt werden konnten.

Das ist die Architektur, auf die KI-Agenten treffen. Ein autonomes System kann sich keinen Weg durch eine bereits geschlossene Schwachstelle bahnen. Egal, wie leistungsfähig es ist oder wie kreativ es sein Ziel verfolgt.

Die Architektur als Problem und Lösung

Der KI-Reifeindex für Unternehmen 2026 von ServiceNow – eine Umfrage unter 4.500 Führungskräften in 19 Ländern – ergab, dass die KI-Ausgaben seit dem vergangenen Jahr um 110 % gestiegen sind. Fast nichts davon entfiel auf die Ebene, die entscheidet, ob die Aktionen eines KI-Agenten vertrauenswürdig sind oder nachverfolgt, gedrosselt oder gestoppt werden sollen. Unternehmen mit dem höchsten KI-Reifegrad, die in diese Ebene investieren, erzielen im Durchschnitt eine Rendite von 160 %. Ein wichtiger Schritt dahin ist die Entscheidung über den Workflow bis zu dem Punkt, an dem KI-Agenten dazukommen.

Gartner® geht davon aus, dass „bis 2026 mindestens 80 % der unbefugten KI-Transaktionen nicht durch böswillige Angriffe verursacht werden, sondern durch interne Verstöße gegen Unternehmensrichtlinien zur Weitergabe von Informationen, durch unzulässige Nutzung oder falsch eingestelltes KI-Verhalten“.¹

Ihre KI-Agenten werden sich nicht gegen Sie wenden. Sie werden genau das tun, was Sie von Ihnen verlangen. Schneller, als Sie glauben. Und mit der Reichweite, die Sie ihnen zugestehen. Entziehen Sie ihnen die Reichweite, und geben Sie sie stückweise zurück. Und stellen Sie sicher, dass jede Stufe direkt von den verantwortlichen Personen kontrolliert wird.

Erfahren Sie, wie Sie mit Hilfe von ServiceNow die Kontrolle über Ihre KI behalten.

¹ Gartner, Market Guide for AI Trust, Risk, and Security Management, Avivah Litan, Max Goss, et al., 18. Februar 2025

GARTNER ist eine Marke von Gartner Inc. und/oder den Tochterunternehmen des Unternehmens.