# Was ist Model Poisoning?

> Model Poisoning ist ein Angriff in der Trainingsphase, bei dem ein Gegner ein Modell oder seine Parameter manipuliert, um späteres Verhalten zu verändern.

- Kanonische URL: https://yellowcube.eu/de/glossary/model-poisoning/
- Herausgeber: Yellow Cube
- Sprache: de
- Kontakt: hello@yellowcube.eu

## Inhalt

Statt Lernbeispiele zu korrumpieren, beeinflusst der Angreifer direkt Gewichte, Gradienten, Updates, Checkpoints oder ein Modellartefakt. Das Ergebnis kann breite Leistungsdegradation, gezielte Fehler, eine vom Angreifer gewählte Backdoor oder ein Verlust der Modellintegrität sein, der nur unter bestimmten Bedingungen auftritt.

Relevante Angriffspfade umfassen einen kompromittierten Teilnehmer, der bösartige Updates beim Federated Learning einreicht, unbefugte Änderungen innerhalb einer Trainings-Pipeline und ein vergiftetes vortrainiertes oder feinabgestimmtes Modell, das über die KI-Lieferkette eingeschleust wird. Schutz hängt daher davon ab zu wissen, wo Modellartefakte und Updates herkamen, wer sie verändern konnte und welche Nachweise die Freigabe in die Produktion stützen.

### Wichtigste Punkte

- **Angriffsfläche:** Modell-Registries, Artefakt-Repositories, Trainingsjobs, verteilte oder föderierte Teilnehmer, Update-Aggregation, Serialisierungsformate, Deployment-Pipelines und Drittanbieter-Modellquellen prüfen.
- **Integritätskontrollen:** Schreibzugriff beschränken, Aufgaben trennen, Artefakte wo unterstützt signieren und verifizieren, Lineage und Hashes aufbewahren, vertrauenswürdige Quellen freigeben und die Systeme schützen, die Modelle bauen und verteilen.
- **Evaluation:** Kandidatenverhalten mit unabhängig geschützten Baselines und Holdouts vergleichen, auf gezielte Trigger und unerwartete Fähigkeitsänderungen testen und unerklärte Unterschiede vor dem Release untersuchen.
- **Reaktion:** Das verdächtige Artefakt und Provenance-Nachweise sichern, betroffene Versionen aus der Distribution entfernen, nachgelagerte Deployments identifizieren, eine vertrauenswürdige Version wiederherstellen und den kompromittierten Update-Pfad schließen.
- **Wichtige Einschränkung:** Modellevaluation kann nicht jede mögliche Eingabe oder jedes verborgene Verhalten erschöpfen. Ein bestandener Benchmark beweist keine Parameterintegrität, und ein gewöhnliches autorisiertes Fine-Tuning oder ein versehentlicher Trainingsfehler ist kein Poisoning, sofern keine adversariale Manipulation vorliegt.

### Verwandte Begriffe

[Data Poisoning](<https://yellowcube.eu/de/glossary/data-poisoning/>) · [Adversarial Machine Learning](<https://yellowcube.eu/de/glossary/adversarial-machine-learning/>) · [Software Supply-Chain Security](<https://yellowcube.eu/de/glossary/software-supply-chain-security/>) · [AI Security Posture Management (AI-SPM)](<https://yellowcube.eu/de/glossary/ai-security-posture-management/>) · [AI Security](<https://yellowcube.eu/de/glossary/ai-security/>)

### Quellen

[NIST AI 100-2 E2025, Adversarial Machine Learning Taxonomy](https://csrc.nist.gov/pubs/ai/100/2/e2025/final) · [MITRE ATLAS](https://atlas.mitre.org/) · [CISA and UK NCSC Guidelines for Secure AI System Development](https://www.cisa.gov/news-events/alerts/2023/11/26/cisa-and-uk-ncsc-unveil-joint-guidelines-secure-ai-system-development)

## Quellenangabe und Geltungsbereich

Diese Markdown-Darstellung wird aus denselben freigegebenen Inhalten wie die kanonische HTML-Seite erzeugt. Verwenden Sie beim Zitieren die kanonische URL.

