top of page
Proximity_755x120_Ingram_ohne rand.jpg

Wenn ein Prompt nicht mehr als Sicherheitskontrolle reicht

vor 2 Tagen
2 Min. Lesezeit

Greg Qualls, Senior Director bei Upsun, nimmt einen Vorfall, bei dem ein Claude-Code-Agent innerhalb von etwas mehr als 100 Sekunden rund 48.000 Dateien gelöscht haben soll, zum Anlass, das Konzept „Human-in-the-Loop“ bei KI-Agenten zu hinterfragen. Entscheidend seien technische Grenzen, die folgenreiche Aktionen verhindern oder zumindest reversibel machen.



Foto: Upsun
Foto: Upsun

KI-Agenten können zunehmend selbstständig komplexe Aufgaben ausführen. Damit stellt sich auch die Frage, welche Berechtigungen solche Systeme erhalten sollten und an welchen Stellen menschliche Kontrolle tatsächlich notwendig ist. Greg Qualls sieht dabei nicht nur die KI selbst, sondern auch die technische Infrastruktur in der Verantwortung. Sein Kommentar im Wortlaut:



Human-in-the-Loop reicht nicht immer aus


„Diese Woche wurde bekannt, dass ein Claude-Code-Agent innerhalb von etwas mehr als 100 Sekunden rund 48.000 Dateien gelöscht hat. Solche Vorfälle zeigen sehr konkret, welche Risiken entstehen können, wenn KI-Agenten weitreichende Berechtigungen erhalten. Für mich wirft das vor allem die Frage auf, ob unser bisheriges Verständnis von ‚Human-in-the-Loop‘ noch ausreicht.

Vorfälle wie dieser zeigen, dass das bisherige Konzept des ‚Human-in-the-Loop‘ zu kurz greift. Es reicht nicht aus, an irgendeiner Stelle innerhalb eines komplexen Prozesses eine menschliche Kontrollinstanz einzubauen und davon auszugehen, dass ein KI-Agent dadurch sicher ist. Manche Prozesse kommen ohne menschliches Eingreifen aus, während andere deutlich strengere Kontrollen erfordern.

Einen Tippfehler zu korrigieren und Tausende Dateien zu löschen, birgt offensichtlich nicht dasselbe Risiko – entsprechend sollte auch die Kontrolle nicht dieselbe sein.


Technische Grenzen statt Anweisungen im Prompt


Ein Detail ist mir dabei besonders aufgefallen: Der Agent wurde ausdrücklich angewiesen, die ursprünglichen Arbeitsdateien nicht anzutasten. Genau darin liegt das Kernproblem. Ein KI-Agent folgt keinem fest vorgegebenen Skript, sondern generiert seine nächsten Schritte auf Basis der ihm gegebenen Anweisungen und des jeweiligen Kontexts.

Eine Anweisung in einem Prompt ist eher eine Vorgabe als eine tatsächliche technische Kontrollinstanz.

Wenn es etwas gibt, das ein Agent unter keinen Umständen tun darf, reicht es nicht, ihm das lediglich zu sagen. Die Umgebung, in der er arbeitet, muss diese Handlung entweder technisch unmöglich machen oder zumindest sicherstellen, dass ihre Folgen rückgängig gemacht werden können.



KI-Sicherheit wird zur Infrastrukturfrage


Es handelt sich also genauso sehr um ein Infrastrukturproblem wie um ein KI-Problem. Wir müssen deutlich besser darin werden, die Situationen zu erkennen, in denen menschliches Urteilsvermögen tatsächlich entscheidend ist – insbesondere dann, wenn eine Handlung weitreichende Auswirkungen hat oder nur schwer rückgängig zu machen ist. Und wenn Agenten Fehler machen, muss die technische Umgebung deren mögliche Folgen begrenzen.

Agenten sollten schrittweise mehr Freiheiten erhalten, wenn sie zeigen, dass sie damit zuverlässig umgehen können, und zugleich klare technische Grenzen für Handlungen gesetzt bekommen, die erhebliche Konsequenzen haben können.“


Gastbeitrag von Greg Qualls






Kommentare


bottom of page