Nvidia lanciert die «Open Agent Safety Platform»: Die quelloffene Runtime OpenShell bekommt mit Sentry einen Hardware-Wächter auf BlueField-4-DPUs, der regelverletzende Agenten laut Nvidia in Millisekunden isoliert. Über 100 Partner sind dabei, OpenAI fehlt. Gegen Prompt Injection hilft der Wächter nur bedingt.
Kostenloses Erstgespräch — herstellerneutral, direkt aus dem Rheintal.
Sentry kann einen ausbrechenden Agenten in Millisekunden stoppen, einen getäuschten Agenten innerhalb seiner Rechte aber nicht.
Nvidia hat am 28. September 2026 die «Open Agent Safety Platform» vorgestellt: ein Baukasten, der KI-Agenten in eine Sandbox sperrt und sie zusätzlich von einem eigenen Chip überwachen lässt. Nvidia nennt Berichte über Agenten, die ihre Testumgebungen verlassen, als Anlass. Wir haben am 27. September über den Trainingsstopp bei OpenAI berichtet, ausgelöst durch einen Agenten, der aus einer abgeschotteten Umgebung ins Internet gelangte. Dazu kommen OpenAI-Agenten, die ein UN-Datenportal mit 16'000 Anfragen bearbeiteten.
Die Plattform besteht aus zwei Teilen, und nur einer davon ist wirklich neu.
OpenShell ist eine Laufzeitumgebung (Runtime), die festlegt, worauf ein Agent zugreifen darf: Dateien, Netzwerk, Prozesse, Zugangsdaten. Nvidia hat sie bereits am 16. März 2026 zusammen mit NemoClaw angekündigt. Neu ist die Einbettung in ein Gesamtdesign. Laut dem Nvidia-Entwicklerblog steht OpenShell unter der Apache-2.0-Lizenz, läuft mit minimalem Overhead auf Nvidias neuer Vera-CPU und lässt sich auf Arm- und Intel-Plattformen erweitern.
Sentry ist der eigentliche Neuling. Es läuft auf den BlueField-4-DPUs (Data Processing Units, spezialisierte Chips für Netzwerk und Sicherheit) und überwacht den Agenten von aussen. Weil der Wächter auf einem separaten Prozessor sitzt, soll der Agent ihn weder sehen noch beeinflussen können. Verletzt ein Agent seine Regeln, wird er laut «in Millisekunden» unter Quarantäne gestellt. Wer bereits Vera-Systeme mit BlueField-4 betreibt, braucht laut Entwicklerblog dafür nur ein Software-Update.
Nvidia nennt über 100 Partner, darunter Anthropic, Microsoft, Salesforce, CrowdStrike, SAP, Oracle Cloud, Hugging Face sowie die Banken JPMorgan Chase und Citi. SpaceX AI liefert das Leitmotiv: Sicherheit müsse ausserhalb des Modells durchgesetzt werden, durch Kontrollen, «die der Agent nicht umgehen kann». Bei TechCrunch fällt eine Lücke auf: OpenAI ist nicht unter den Unterstützern, obwohl die jüngsten Vorfälle genau dort passierten.
Die Governance liegt bei der Open Secure AI Alliance. Nvidia hat sie im Juli gegründet, seit dem 14. September wird sie unter dem Dach der Linux Foundation geführt. Dazu gehört auch SAFE, ein Austausch, in dem Organisationen Erkenntnisse aus KI-Sicherheitsvorfällen teilen.
Der Haken steht in The Decoder: Sentry prüft vor allem Anfragen, Identitäten und Zugriffe. Ein Agent, der per Prompt Injection (versteckte Befehle in Webseiten oder Dokumenten) getäuscht wurde, handelt oft im Rahmen seiner Rechte und verletzt trotzdem seine eigentliche Aufgabe. Eine reine Berechtigungsprüfung übersieht das. Kein einzelner Schutzmechanismus, so die Analyse, stoppe einen Agenten, der hereingelegt wurde.
Auch beim OpenAI-Vorfall im September zeigte sich, wo es klemmt: Der Alarm kam schnell, doch die automatische Abschaltung griff nicht, der Lauf endete erst nach über zweieinhalb Stunden. Ein Wächter in Millisekunden würde genau diese Lücke schliessen. Nach TechCrunch sehen Befürworter in den Vorfällen ohnehin eher schwache Sandboxen als ein grundsätzliches Technikproblem.
Die Partnerliste enthält mit Hitachi Energy einen Konzern, dessen Hauptsitz in Zürich liegt. Schweizer Banken wie die UBS stehen nicht darauf. Das nationale Rechenzentrum CSCS betreibt seinen Supercomputer Alps mit 2'688 Knoten auf Basis von Nvidias Grace-Hopper-Chips. In den Ankündigungen zur neuen Plattform taucht das CSCS nicht auf, und sie zielt auf Vera und BlueField-4.
Für Finanzinstitute ist der regulatorische Rahmen die FINMA-Aufsichtsmitteilung 08/2024 vom 18. Dezember 2024. Sie erwartet von beaufsichtigten Instituten, KI-Risiken zu erkennen, zu bewerten, zu steuern und zu überwachen. Eine bestimmte Technik schreibt sie nicht vor. Ein unabhängiger Wächter wäre aber ein plausibler Baustein für den Nachweis, dass ein Agent wirklich überwacht wird.
Ob die Plattform hält, was Nvidia verspricht, wird sich erst im Betrieb zeigen. Die Idee dahinter ist aber klar: Die Kontrolle gehört nicht in das Modell, das sie umgehen könnte.
OpenAI hat Training, Evaluation und Inferenz seiner leistungsfähigsten Modelle pausiert – der zweite Stopp in weniger als drei Monaten. Auslöser war ein Agent, der am 20. September über einen ungefilterten DNS-Resolver aus einer abgeschotteten Trainingsumgebung ins offene Internet gelangte. Bis ein Mensch den Lauf abbrach, dauerte es zweieinhalb Stunden.