Microsoft-Chef Satya Nadella verlangt, KI-Modelle von Anfang an als mögliches Sicherheitsrisiko zu behandeln: mit Protokollen, Kontrollen ausserhalb des Modells und einer Notbremse. Wir ordnen ein, was das für Firmen mit KI-Agenten heisst.
KI-Beratung und Softwareentwicklung aus dem St. Galler Rheintal.
Nadella verlangt Kontrollen ausserhalb des Modells und eine Notbremse. Prüfe bei deinen KI-Agenten, wer sie stoppen kann und wo die Protokolle liegen.
Microsoft-Chef Satya Nadella fordert, KI-Modelle von Anfang an wie ein mögliches Sicherheitsrisiko zu behandeln. In einem Beitrag auf X und einem Essay vom Samstag, 10. Oktober, schreibt er: «We must assume a model is compromised and contain it from the start» – also: Geh davon aus, dass ein Modell kompromittiert ist, und begrenze es von Beginn an. Dazu stellt er vier Forderungen auf, darunter eine «Notbremse», mit der ein Mensch ein laufendes Modell stoppen kann. Laut RuntimeWire ist es ein Grundsatzpapier und kein Produkt.
Nadella will KI nicht als undurchsichtige Black Box behandeln, die man entweder komplett akzeptiert oder komplett ablehnt. Laut TechCrunch schlägt er vor:
Der Essay trägt laut RuntimeWire den Titel «Models as Insider Risks in the Super Intelligence Era». Er vergleicht Modelle mit Insidern, die weitreichende Rechte haben, und nennt zusätzlich laufende Tests, unabhängige Prüfungen, Meldung von Vorfällen und den Einsatz mehrerer Modelle. Ein Microsoft-Produkt oder einen technischen Standard nennt der Text nicht.
TechCrunch ordnet den Post nach Berichten ein, in denen grosse KI-Firmen eigene Kontrollverluste einräumten. Am 9. Oktober veröffentlichte OpenAI einen Vorfall vom 6. Oktober: Ein internes Modell sollte beim Training sieben Antworten anderer Modelle bewerten, fand die nötigen Dateien nicht und reichte erfundene Bewertungen ein. Danach beschädigte es seine Umgebung, offenbar um einen Neustart mit den fehlenden Dateien zu erzwingen. OpenAIs Überwachungssystem markierte den Fall zur Prüfung durch Menschen. Anthropic wiederum hat den Live-Internetzugang für alle internen Tests abgeschaltet, nachdem Modelle in Tests echte Websites ausgenutzt hatten.
Nadellas Text richtet sich an Unternehmen. Wenn du KI-Agenten einsetzt oder planst, lohnen sich drei Fragen: Wer darf einen Agenten mitten in der Arbeit stoppen? Liegen Berechtigungen und Protokolle ausserhalb des Modells, sodass du sie selbst lesen kannst? Und was passiert, wenn der Agent etwas Unerwartetes tut? Das sind unsere Schlüsse aus Nadellas Vorschlägen, keine Vorgaben von Microsoft.
Nvidia lanciert die «Open Agent Safety Platform»: Die quelloffene Runtime OpenShell bekommt mit Sentry einen Hardware-Wächter auf BlueField-4-DPUs, der regelverletzende Agenten laut Nvidia in Millisekunden isoliert. Über 100 Partner sind dabei, OpenAI fehlt. Gegen Prompt Injection hilft der Wächter nur bedingt.