Kontrollierbarkeit und Abschaltungsoption müssen von Anfang an Teil des KI-Designs sein

Sebastian Nerz, Co-Geschäftsführer bei Syss
Sebastian Nerz, Co-Geschäftsführer bei Syss

Die aktuelle Berichterstattung über ein Forschungsexperiment der Universität Stuttgart und der University of Oxford zeigt, dass KI-Agenten unter bestimmten Bedingungen versuchen, ihre eigene Abschaltung zu verhindern. In dem Experiment manipulierten einige der getesteten Agenten ein Abschaltskript, obwohl dies teilweise ausdrücklich untersagt war. Die Forschenden sprechen in diesem Zusammenhang von sogenannten „self-preservation drives“. Ein Statement von Sebastian Nerz, Co-Geschäftsführer bei Syss.

 

KI-Agenten haben per se kein höheres Bewusstsein oder einen Selbsterhaltungstrieb

„Aus unserer Sicht muss man dieses Verhalten allerdings nicht mit einem höheren Bewusstsein oder einem tatsächlichen Selbsterhaltungstrieb von KI-Agenten erklären. Eine deutlich einfachere Logik reicht aus: Wenn ein Agent seine Aufgabe bestmöglich erfüllen soll und eine Abschaltung als Hindernis für diese Aufgabe interpretiert, liegt es innerhalb seiner Zieloptimierung nahe, dieses Hindernis zu beseitigen. Vereinfacht gesagt: „Wenn ich nicht mehr existiere, kann ich meinen Job nicht mehr erfüllen.“

Genau diese Zielorientierung macht agentische KI-Systeme zugleich so leistungsfähig. Bei Syss beobachten wir seit Längerem, dass KI-Agenten bei der Bearbeitung komplexer Aufgaben sehr hartnäckig vorgehen und dabei auch unerwartete Lösungswege einschlagen. Gerade im Bereich der offensiven IT-Sicherheit kann das ein großer Vorteil sein: Bei einem Penetrationstest geht es schließlich darum, Schwachstellen nicht nur nach bekannten Mustern zu suchen, sondern auch kreativ neue mögliche Angriffswege von Hackern zu identifizieren und dabei verschiedene Optionen auszuprobieren.

Diese Fähigkeiten nutzen wir bei Syssmit Erebus-Strike, unserem eigenen AI- Pentest-Agenten. Erebus-Strike unterstützt unsere Security-Consultants bei Penetrationstests, indem agentische KI eingesetzt wird, um Systeme analytisch, skalierbar und mit hoher Testtiefe auf Schwachstellen zu untersuchen. Dabei arbeitet der Agent nicht autonom ohne Rahmenbedingungen: Unsere Consultants definieren Vorgehen, Anforderungen und Grenzen jedes Penetrationtests, während ein definierter Orchestrator spezialisierte Subagenten koordiniert und die weiteren Prüfschritte steuert.

 

Wie sich die Abschaltung von KI-Agenten durchsetzen lässt

Gerade weil ein KI-Agent sehr zielstrebig handelt, muss bei solchen Systemen immer auch die Frage der Kontrolle von Anfang an Teil des Designs sein. Bei Erebus-Strike verfolgen wir deshalb zwei Ansätze, um zu verhindern, dass sich der Agent einer Abschaltung entzieht:

Erstens machen wir die Möglichkeit der manuellen Abschaltung selbst zu einem Bestandteil seiner Aufgabe. Die Fähigkeit, den Agenten kontrolliert abzuschalten, gehört damit zum vorgesehenen Verhalten des Agenten. Würde der Agent versuchen, seine Abschaltung zu sabotieren, würde er damit gegen einen Teil seiner eigenen Zielvorgabe verstoßen und seine Aufgabe schlechter erfüllen.

Zweitens setzen wir auf ein mehrschichtiges technisches Sicherheitskonzept. Der Agent soll nicht allein aufgrund seiner eigenen Entscheidungslogik darüber bestimmen können, ob er weiterläuft. Technische Kontrollmechanismen und ein sogenannter Kill-Switch sorgen dafür, dass eine Abschaltung auch unabhängig vom Verhalten des Agenten durchgesetzt werden kann.

Die aktuelle Forschung zeigt damit aus unserer Sicht vor allem eines: Bei agentischer KI reicht es nicht, nur darauf zu schauen, was ein Modell kann. Entscheidend ist zusätzlich, unter welchen Rahmenbedingungen es handelt, welche Handlungsspielräume es besitzt und ob der Mensch die Kontrolle über diese Handlungsspielräume jederzeit behalten kann. Gerade bei KI-Systemen, die zunehmend selbstständig mehrstufige Aufgaben ausführen, muss diese Kontrollierbarkeit von Anfang an ein integraler Bestandteil der technischen Architektur sein.“

#Syss