# Was ist Prompt Injection?

> Prompt Injection ist die Manipulation eines generativen KI-Systems durch Anweisungen, die dazu führen, dass ein Modell die vorgesehenen Anweisungen der Anwendung außer Kraft setzt oder ihnen zuwiderläuft.

- Kanonische URL: https://yellowcube.eu/de/glossary/prompt-injection/
- Herausgeber: Yellow Cube
- Sprache: de
- Kontakt: hello@yellowcube.eu

## Inhalt

Sie nutzt die Schwierigkeit aus, vertrauenswürdige Anweisungen zuverlässig von nicht vertrauenswürdigen Inhalten im Kontext des Modells zu trennen. Eine direkte Injection kommt vom interagierenden Nutzer; eine indirekte Injection wird in Inhalten platziert, die das System später verarbeitet — etwa einer Webseite, E-Mail, einem Dokument, Bild, Werkzeugergebnis oder Retrieval-Datensatz.

Die Konsequenz hängt weniger vom Text allein ab als von der Anwendung um das Modell. Ein isolierter Assistent mag eine unerwünschte Antwort erzeugen, während ein Agent mit Zugriff auf private Daten, Credentials oder externe Werkzeuge Informationen offenlegen oder unbefugte Aktionen einleiten könnte. Abwehr sollte daher annehmen, dass gestalteter Inhalt das Modell beeinflussen kann, und begrenzen, was ein resultierender Output bewirken darf.

### Wichtigste Punkte

- **Vertrauensgrenzen:** Jeden Pfad identifizieren, der Text, Bilder, abgerufene Datensätze oder Werkzeugausgaben in den Kontext einbringt, und externen Inhalt als nicht vertrauenswürdig kennzeichnen — selbst wenn er in einem vertrauten Dokument erscheint.
- **Schadensreduktion:** Modellen und Werkzeugen Least-Privilege-Identitäten geben, sensible Daten trennen, verfügbare Aktionen einschränken, Werkzeugargumente validieren und unabhängige Freigabe für folgenreiche Operationen verlangen.
- **Erkennung und Tests:** Direkte, indirekte, kodierte, mehrsprachige, multimodale und mehrstufige Fälle durchspielen; das Modell, Prompt, abgerufene Inhalte, Werkzeugaufrufe und Autorisierungsentscheidungen protokollieren, die zur Untersuchung der Ergebnisse nötig sind.
- **Wichtige Einschränkung:** System-Prompts, Eingabefilter, Trennzeichen und modellbasierte Detektoren können das Risiko senken, bilden aber keine universelle Prompt-Injection-Grenze. Die Anwendung muss sicher bleiben, wenn das Modell feindlichen Anweisungen folgt oder feindlichen Output erzeugt.

### Verwandte Begriffe

[Data Poisoning](<https://yellowcube.eu/de/glossary/data-poisoning/>) · [Least Privilege](<https://yellowcube.eu/de/glossary/least-privilege/>) · [AI Red Teaming](<https://yellowcube.eu/de/glossary/ai-red-teaming/>) · [Agentic AI Security](<https://yellowcube.eu/de/glossary/agentic-ai-security/>)

### Quellen

[NIST AI 100-2 E2025, Adversarial Machine Learning Taxonomy](https://csrc.nist.gov/pubs/ai/100/2/e2025/final) · [OWASP LLM01:2025 Prompt Injection](https://genai.owasp.org/llmrisk/llm01-prompt-injection/) · [MITRE ATLAS](https://atlas.mitre.org/)

## Quellenangabe und Geltungsbereich

Diese Markdown-Darstellung wird aus denselben freigegebenen Inhalten wie die kanonische HTML-Seite erzeugt. Verwenden Sie beim Zitieren die kanonische URL.

