Ein solches System kann Schritte planen, Gedächtnis behalten, Werkzeuge auswählen und für einen Nutzer handeln. Seine Sicherheitsgrenze umfasst das Modell, Orchestrierungscode, Prompts, Gedächtnis, Werkzeugschnittstellen, Credentials, verbundene Daten, andere Agenten und die Aktionsumgebung.
Zu den Risiken gehören indirekte Prompt Injection, manipulierte Werkzeugergebnisse, übermäßige Berechtigungen, Credential-Exposition, vergiftetes Gedächtnis, Agenten-übergreifende Identitätstäuschung und schädliche Ketten erlaubter Aktionen. Fehlschläge können auch ohne Angreifer auftreten, wenn ein Agent ein Ziel missversteht oder die falsche Zielgröße optimiert. Kontrollen sollten begrenzen, was der Agent beobachten und verändern kann — mit stärkerer Freigabe für folgenreiche Aktionen.
Wichtigste Punkte
Begrenzte BefugnisJedem Werkzeug und Workflow eng gefasste, kurzlebige Credentials geben; Ziele, Daten, Aktionstypen, Ausgaben und Laufzeit beschränken; und für folgenreiche Schritte Freigabe verlangen.
Kontext- und GedächtnisschutzNutzer und Aufgaben trennen, nicht vertrauenswürdige Inhalte kennzeichnen und validieren, steuern, was persistiert, Provenance aufzeichnen und verhindern, dass abgerufene Anweisungen autorisierte Ziele still überstimmen.
Beobachtung und EindämmungPrompts, Entscheidungen, Werkzeugaufrufe und Ergebnisse dort protokollieren, wo verhältnismäßig; abnormale Aktionsketten erkennen; Sandboxes, Rate Limits, Transaktionsprüfungen und zuverlässige Stopp- oder Rollback-Mechanismen einsetzen.
Ganzheitliche AssuranceRealistische mehrstufige Angriffe und versehentliche Fehlschläge testen — einschließlich Werkzeugkompromittierung, Gedächtnisvergiftung, kaskadierender Agenten und Wiederherstellung aus teilweise abgeschlossenen Aktionen.
Wichtige EinschränkungAgentic AI Security ist ein aufkommendes Feld mit ungeklärter Terminologie, Protokollen und Assurance-Methoden. Konventionelle Software-, Identitäts- und KI-Risikokontrollen bleiben nötig, adressieren delegiertes und adaptives Verhalten aber möglicherweise nicht vollständig.