Es untersucht, wie ein Gegner Daten, Modelle, Eingaben, Ausgaben oder umgebende Workflows beeinflussen kann, um Vertraulichkeits-, Integritäts-, Verfügbarkeits- oder Acceptable-Use-Ziele zu verletzen. Es ist ein Korpus von Angriffs- und Abwehrwissen, nicht der Name eines bestimmten Exploits.
NISTs aktuelle Taxonomie ordnet Angriffe über Dimensionen wie Lebenszyklusphase, Ziel, Zielsetzung, Fähigkeit und Wissen des Gegners. Relevante Familien umfassen Evasion zur Inferenzzeit, Poisoning während des Trainings, Privacy-Angriffe und Missbrauch generativer Systeme über Prompting oder Fehlgebrauch. Reale Systeme erben zudem konventionelle Schwächen in Identitäten, APIs, Software, Cloud-Diensten und Lieferketten — eine Adversarial-ML-Bewertung sollte Modellverhalten daher mit der vollständigen Anwendung verknüpfen.
Wichtigste Punkte
AngriffsphaseBestimmen, ob der Gegner Datenerhebung, Training, Modellverteilung, Bereitstellung, Inferenzeingaben, Retrieval, Feedback oder verbundene Aktionen beeinflussen kann.
GegnerbedingungenFestlegen, welchen Zugriff, welches Wissen, welche Kontrolle, Ressourcen und Abfragemöglichkeiten ein Angriff annimmt; ein Ergebnis unter vollem Modellzugriff überträgt sich möglicherweise nicht auf einen Remote-Dienst.
SicherheitszieleVerfügbarkeitsausfälle, ungezielte oder gezielte Integritätsverletzungen, Privacy-Verlust, Modellklau und Missbrauch gegen Konsequenzen bewerten, die im eingesetzten Kontext bedeutsam sind.
Defensive PraxisModellebene-Evaluation mit Provenance, Zugriffskontrolle, sicherem Engineering, Monitoring, Incident Response und Beschränkungen nachgelagerter Entscheidungen oder Aktionen kombinieren.
Wichtige EinschränkungRobustheit gegen einen bekannten Benchmark oder eine Angriffsmethode ist keine allgemeine Sicherheit. Angreifer passen sich an, Forschungsannahmen variieren, und Kontrollen, die eine Eigenschaft verbessern, können Anwendungs- oder menschliche Vertrauensgrenzen offen lassen.