Il examine comment un adversaire peut influencer les données, les modèles, les entrées, les sorties ou les workflows environnants pour violer des objectifs de confidentialité, d'intégrité, de disponibilité ou d'usage acceptable. C'est un corpus de connaissances d'attaque et de défense, pas le nom d'un exploit particulier.
La taxonomie actuelle du NIST organise les attaques selon des dimensions telles que l'étape du cycle de vie, le but de l'adversaire, son objectif, sa capacité et sa connaissance. Les familles pertinentes incluent l'évasion au moment de l'inférence, l'empoisonnement pendant l'entraînement, les attaques contre la vie privée et l'abus des systèmes génératifs par le prompting ou l'usage détourné. Les systèmes réels héritent aussi des faiblesses conventionnelles des identités, des API, des logiciels, des services cloud et des chaînes d'approvisionnement, de sorte qu'une évaluation adversarial-ML doit relier le comportement du modèle à l'application complète.
Points clés
Étape de l'attaqueDéterminer si l'adversaire peut affecter la collecte des données, l'entraînement, la distribution du modèle, le déploiement, les entrées d'inférence, la recherche, la rétroaction ou les actions connectées.
Conditions de l'adversaireÉnoncer l'accès, la connaissance, le contrôle, les ressources et les opportunités de requête qu'une attaque suppose ; un résultat obtenu avec un accès complet au modèle peut ne pas se transférer à un service distant.
Objectifs de sécuritéÉvaluer les défaillances de disponibilité, les violations d'intégrité ciblées ou non ciblées, la perte de vie privée, le vol de modèle et l'usage abusif par rapport aux conséquences significatives pour le contexte déployé.
Pratique défensiveCombiner l'évaluation au niveau du modèle avec la provenance, le contrôle d'accès, l'ingénierie sécurisée, la supervision, la réponse aux incidents et des contraintes sur les décisions ou actions en aval.
Limite importanteLa robustesse contre un benchmark ou une méthode d'attaque connus n'est pas une sécurité générale. Les attaquants s'adaptent, les hypothèses de recherche varient, et les contrôles qui améliorent une propriété peuvent laisser exposées les frontières de confiance applicatives ou humaines.