Skúma, ako útočník môže ovplyvniť údaje, modely, vstupy, výstupy alebo okolité workflow na porušenie cieľov dôvernosti, integrity, dostupnosti alebo prijateľného použitia. Je to súbor poznania útoku a obrany, nie meno jedného špecifického exploitu.
Aktuálna taxonómia NIST organizuje útoky pomocou dimenzií ako štádium životného cyklu, útočníkov cieľ, objektív, schopnosť a znalosť. Relevantné rodiny zahŕňajú eváziu v čase inferencie, otrávenie počas tréningu, útoky súkromia a zneužitie generatívnych systémov cez promptovanie alebo nesprávne použitie. Reálne systémy tiež dedične nesú konvenčné slabiny v identitách, API, softvéri, cloudových službách a dodávateľských reťazcoch, takže hodnotenie adverzívneho ML má spájať správanie modelu s kompletnou aplikáciou.
Kľúčové body
Štádium útokuUrčiť, či útočník môže ovplyvniť zber údajov, tréning, distribúciu modelu, nasadenie, vstupy inferencie, získavanie, spätnú väzbu alebo pripojené akcie.
Podmienky útočníkaUviesť, aký prístup, znalosti, kontrolu, zdroje a príležitosti dopytovania útok predpokladá; výsledok pod plným prístupom k modelu nemusí preniesť na vzdialenú službu.
Bezpečnostné cieleHodnotiť zlyhania dostupnosti, necielené alebo cielené porušenia integrity, stratu súkromia, krádež modelu a zneužitie voči dôsledkom zmysluplným pre nasadený kontext.
Obranná praxKombinovať evaluáciu na úrovni modelu s provenienciou, riadením prístupu, bezpečným inžinierstvom, monitorovaním, reakciou na incidenty a obmedzeniami na downstream rozhodnutia alebo akcie.
Dôležité obmedzenieRobustnosť voči známymu benchmarku alebo útočnej metóde nie je všeobecná bezpečnosť. Útočníci sa adaptujú, výskumné predpoklady sa líšia a kontroly, ktoré zlepšujú jednu vlastnosť, môžu zanechať hranice aplikácie alebo ľudskej dôvery vystavené.