Sie nutzt die Schwierigkeit aus, vertrauenswürdige Anweisungen zuverlässig von nicht vertrauenswürdigen Inhalten im Kontext des Modells zu trennen. Eine direkte Injection kommt vom interagierenden Nutzer; eine indirekte Injection wird in Inhalten platziert, die das System später verarbeitet — etwa einer Webseite, E-Mail, einem Dokument, Bild, Werkzeugergebnis oder Retrieval-Datensatz.
Die Konsequenz hängt weniger vom Text allein ab als von der Anwendung um das Modell. Ein isolierter Assistent mag eine unerwünschte Antwort erzeugen, während ein Agent mit Zugriff auf private Daten, Credentials oder externe Werkzeuge Informationen offenlegen oder unbefugte Aktionen einleiten könnte. Abwehr sollte daher annehmen, dass gestalteter Inhalt das Modell beeinflussen kann, und begrenzen, was ein resultierender Output bewirken darf.
Wichtigste Punkte
VertrauensgrenzenJeden Pfad identifizieren, der Text, Bilder, abgerufene Datensätze oder Werkzeugausgaben in den Kontext einbringt, und externen Inhalt als nicht vertrauenswürdig kennzeichnen — selbst wenn er in einem vertrauten Dokument erscheint.
SchadensreduktionModellen und Werkzeugen Least-Privilege-Identitäten geben, sensible Daten trennen, verfügbare Aktionen einschränken, Werkzeugargumente validieren und unabhängige Freigabe für folgenreiche Operationen verlangen.
Erkennung und TestsDirekte, indirekte, kodierte, mehrsprachige, multimodale und mehrstufige Fälle durchspielen; das Modell, Prompt, abgerufene Inhalte, Werkzeugaufrufe und Autorisierungsentscheidungen protokollieren, die zur Untersuchung der Ergebnisse nötig sind.
Wichtige EinschränkungSystem-Prompts, Eingabefilter, Trennzeichen und modellbasierte Detektoren können das Risiko senken, bilden aber keine universelle Prompt-Injection-Grenze. Die Anwendung muss sicher bleiben, wenn das Modell feindlichen Anweisungen folgt oder feindlichen Output erzeugt.