Azt vizsgálja, hogyan befolyásolhat az ellenfél adatokat, modelleket, bemeneteket, kimeneteket vagy környező munkafolyamatokat a bizalmasság, integritás, rendelkezésre állás vagy elfogadható használat megsértésére. Támadás- és védekezéstudomány, nem egy konkrét sebezhetőség neve.
A NIST jelenlegi taxonómiája az életciklus-szakasz, az ellenfél célja, célkitűzése, képessége és tudása szerint rendezi a támadásokat. A releváns családok közé tartozik a következtetési időbeli kitérés, a tanítási mérgezés, adatvédelmi támadások és a generatív rendszerek prompton vagy visszaélésen át történő abúzusa. A valódi rendszerek a hagyományos identitás-, API-, szoftver-, felhőszolgáltatás- és ellátáslánci gyengeségeket is öröklik, ezért az adverszáriális-ML-értékelésnek a modellviselkedést a teljes alkalmazáshoz kell kapcsolnia.
Legfontosabb pontok
Támadási szakaszÁllapítsa meg, hogy az ellenfél befolyásolhatja-e az adatgyűjtést, tanítást, modellterjesztést, bevetést, következtetési bemeneteket, visszakeresést, visszacsatolást vagy csatlakoztatott műveleteket.
EllenfélfeltételekMondja ki, milyen hozzáférést, tudást, kontrollt, erőforrásokat és lekérdezési lehetőségeket feltételez a támadás; a teljes modellhozzáféréssel elért eredmény nem feltétlenül vihető át távoli szolgáltatásra.
Biztonsági célkitűzésekÉrtékelje a rendelkezésreállás-hibákat, nem célzott vagy célzott integritássértéseket, adatvédelmi vesztést, modelllopást és visszaélést a bevetési kontextusban értelmes következmények ellen.
Védekező gyakorlatKombinálja a modellszintű értékelést eredettel, hozzáférés-vezérléssel, biztonságos mérnöki munkával, monitorozással, incidenskezeléssel és a downstream döntésekre vagy műveletekre kivetett korlátokkal.
Fontos korlátAz ismert benchmark vagy támadásmódszer elleni robusztusság nem általános biztonság. A támadók alkalmazkodnak, a kutatási feltevések eltérnek, és az egyik tulajdonságot javító kontrollok kitetve hagyhatják az alkalmazás- vagy emberi bizalmi határokat.