Die bekannteste Faustregel der Agenten-Sicherheit, drei Zutaten — und die erste große, unabhängig geprüfte Abwehrbilanz der Anbieter. Beides gehört in dieselbe Vorlage.
3Zutaten: vertrauliche Daten, fremde Inhalte, Weg nach draußen
720indirekte Injection-Versuche in einer Fremdevaluation — keiner erfolgreich
13,6 %der menschlichen Prüfer lehnten eine gefährliche Aktion ab — der Auto-Modus blockte 89 %
2026Willisons Prognose: ein „Challenger-Jahr" für die Sicherheit von Coding-Agenten
Die Faustregel
Der Entwickler Simon Willison — Mitbegründer von Django und einer der meistgelesenen Beobachter agentischer Systeme — brachte die Voraussetzung für Agenten-Exfiltration im Juni 2025 auf drei Zutaten: Der Agent hat (1) Zugang zu vertraulichen Daten, verarbeitet (2) fremde, unvertrauenswürdige Inhalte und besitzt (3) einen Kommunikationsweg nach außen. Jede Kombination aus zweien ist beherrschbar; erst alle drei zusammen erzeugen den Datenabfluss. Die Konsequenz des Modells: Statt Angriffe zu filtern, entfernt man eines der drei Beine.
Die Abwehrlage im August 2026
Anthropic hat in diesem Monat den „Auto-Modus" von Claude Code — die automatische Risikoabschätzung von Agentenaktionen — zur Standardeinstellung der gängigen Pläne gemacht und die Abwehrbilanz veröffentlicht: In einer vom Unternehmen beauftragten Fremdevaluation (Trajectory Labs, 72 zurückgehaltene Szenarien indirekter Prompt Injection) gelang von 720 Angriffsversuchen gegen die aktuellen Modelle im Auto-Modus kein einziger. In einer begleitenden Studie mit über tausend bezahlten Testpersonen lehnten nur 13,6 Prozent der Menschen eine untergeschobene gefährliche Aktion ab — der Auto-Modus blockte 89 Prozent derselben Aktionen. Anthropic-Mitarbeiter kommentierten das Ergebnis als Antwort auf genau die Lethal Trifecta.