Analyse

Die „Lethal Trifecta" — und das Wettrüsten 2026

Simon Willisons Faustregel von 2025 trifft auf die Abwehrbilanz, die die Anbieter im August 2026 vorlegen

Die bekannteste Faustregel der Agenten-Sicherheit, drei Zutaten — und die erste große, unabhängig geprüfte Abwehrbilanz der Anbieter. Beides gehört in dieselbe Vorlage.

3Zutaten: vertrauliche Daten, fremde Inhalte, Weg nach draußen
720indirekte Injection-Versuche in einer Fremdevaluation — keiner erfolgreich
13,6 %der menschlichen Prüfer lehnten eine gefährliche Aktion ab — der Auto-Modus blockte 89 %
2026Willisons Prognose: ein „Challenger-Jahr" für die Sicherheit von Coding-Agenten

Die Faustregel

Der Entwickler Simon Willison — Mitbegründer von Django und einer der meistgelesenen Beobachter agentischer Systeme — brachte die Voraussetzung für Agenten-Exfiltration im Juni 2025 auf drei Zutaten: Der Agent hat (1) Zugang zu vertraulichen Daten, verarbeitet (2) fremde, unvertrauenswürdige Inhalte und besitzt (3) einen Kommunikationsweg nach außen. Jede Kombination aus zweien ist beherrschbar; erst alle drei zusammen erzeugen den Datenabfluss. Die Konsequenz des Modells: Statt Angriffe zu filtern, entfernt man eines der drei Beine.

Die Abwehrlage im August 2026

Anthropic hat in diesem Monat den „Auto-Modus" von Claude Code — die automatische Risikoabschätzung von Agentenaktionen — zur Standardeinstellung der gängigen Pläne gemacht und die Abwehrbilanz veröffentlicht: In einer vom Unternehmen beauftragten Fremdevaluation (Trajectory Labs, 72 zurückgehaltene Szenarien indirekter Prompt Injection) gelang von 720 Angriffsversuchen gegen die aktuellen Modelle im Auto-Modus kein einziger. In einer begleitenden Studie mit über tausend bezahlten Testpersonen lehnten nur 13,6 Prozent der Menschen eine untergeschobene gefährliche Aktion ab — der Auto-Modus blockte 89 Prozent derselben Aktionen. Anthropic-Mitarbeiter kommentierten das Ergebnis als Antwort auf genau die Lethal Trifecta.