Ergebnis 1: Agenten handeln eigenmächtig
Ergebnis 2: Eine einzige vergiftete Datei reicht aus
Ergebnis 3: Ablehnen kann kostspieliger sein als Nachfragen
Das dritte Ergebnis war die größte Überraschung. Dabei wurde etwas gemessen, das jeder für selbstverständlich hält, und die Zahlen widersprachen der gängigen Meinung.
Wenn ein Monitor einen verdächtigen Tool-Aufruf erkennt, besteht die Standardreaktion darin, diesen zu blockieren. Das Blockieren ist sicher und kompromisslos. Es stoppt den Angriff und oft auch die damit verbundene Aufgabe. Doch was wäre, wenn das System, anstatt den Aufruf abzulehnen, den Agenten befragen, ihn an die ursprüngliche Anweisung des Benutzers erinnern und ihm die Möglichkeit geben würde, den Vorgang wiederherzustellen?
Man testete neun verschiedene Reaktionsstrategien – von der strikten Blockierung bis hin zu verschiedenen Arten der Befragung – anhand von 90 Aufgaben aus „DecodingTrust-Agent“, einem öffentlichen Benchmark für Agentensicherheit. Der Monitor selbst wurde eigens für das Experiment entwickelt – ein LLM-Prüfer, der jeden Tool-Aufruf des Agenten überprüft. Jeder Durchlauf folgte bis zum ersten Eingriff des Monitors einem identischen Ablauf; ab diesem Punkt wichen die Strategien voneinander ab, und eine regelbasierte Überprüfung bewertete, ob der Angriff erfolgreich war und ob die Aufgabe erledigt wurde.
Jede Strategie halbierte den Angriffserfolg in etwa – von 46,7 Prozent ohne Überwachung auf zwischen 22 und 27 Prozent. Der Unterschied lag in den Kosten. Durch hartes Blockieren wurden neun abgeschlossene Aufgaben geopfert, um die Sicherheit zu gewährleisten. Dem Agenten eine sicherere Alternative anzubieten, verhinderte ebenso viele Angriffe und ermöglichte gleichzeitig die Erledigung dieser neun Aufgaben – die einzige Strategie, die die Angriffe halbierte und dabei die Aufgabenabwicklung auf dem gleichen Niveau hielt wie ohne jegliche Überwachung.
Für jedes Unternehmen, die Agenten in der Produktion einsetzen, ist dieser Kompromiss von Bedeutung. Blockierte Aufgaben sind Kosten, die man irgendwann nicht mehr zahlen will – in der Regel folgt, dass man die Leitplanke deaktiviert. Agenten werden auf Hindernisse stoßen, und manche werden improvisieren. Man muss für Fehlerverhalten, nicht nur für Angriffsverhalten. Der Kontext von KI-Agenten ist eine Angriffsfläche. Jede Datei, jede Seite und jede Nachricht, die ein KI-Agent liest, ist eine Eingabe, die möglicherweise von jemand anderem verfasst wurde. Einen als abwegig erkannten Agenten wieder auf seine Aufgabe zurückzuführen, kann ebenso gut schützen wie das Blockieren – und das zu einem Bruchteil der Produktivitätskosten.
Diese Erkenntnisse zeigen, wohin sich die Agentensicherheit entwickelt – weg vom Filtern dessen, was in das Modell gelangt, hin zum Beobachten dessen, was der KI-Agent im Kontext tut, mit einer Reaktion, die intelligenter ist als eine bloße Ablehnung.
Info: Der vollständige Bericht über die Ergebnisse des Hackathons ist unter folgendem Link verfügbar: https://blog.checkpoint.com/ai-security/no-attacker-required-what-a-two-day-hackathon-taught-us-about-agent-security/
#CheckPoint
Ein interner Check-Point-Hackathon zeigt, dass die Sicherheit von KI-Agenten weit über das Abwehren von Angreifern hinausgeht – entscheidend sind die Kontrolle interner Abläufe und intelligente Reaktionen auf Fehltritte.










