Namiesto korumpovania učiacich príkladov útočník priamo ovplyvňuje váhy, gradienty, aktualizácie, checkpointy alebo artefakt modelu. Výsledkom môže byť široká degradácia výkonu, cielené chyby, útočníkom zvolená zadná vrátka alebo strata integrity modelu, ktorá sa objaví len za konkrétnych podmienok.
Relevantné útočné cesty zahŕňajú kompromitovaného účastníka odosielajúceho škodlivé aktualizácie počas federovaného učenia, neautorizované zmeny vnútri tréningovej pipeline a otrávený predtrénovaný alebo dotrénovaný model zavedený cez dodávateľský reťazec AI. Ochrana preto závisí od poznania, odkiaľ artefakty modelu a aktualizácie pochádzali, kto ich mohol modifikovať a aké dôkazy podporujú promóciu do produkcie.
Kľúčové body
Útočná plochaSkontrolovať registre modelov, úložiská artefaktov, tréningové úlohy, distribuovaných alebo federovaných účastníkov, agregáciu aktualizácií, serializačné formáty, pipeline nasadenia a zdroje modelov tretích strán.
Kontroly integrityObmedziť zapisovací prístup, oddeliť povinnosti, podpisovať a verifikovať artefakty tam, kde je to podporované, zadržiavať lineáž a hashe, schvaľovať dôveryhodné zdroje a chrániť systémy, ktoré modely budujú a distribuujú.
EvaluáciaPorovnávať správanie kandidáta s nezávisle chránenými baseline a holdoutmi, testovať na cielené spúšťače a neočakávané zmeny schopností a vyšetrovať nevysvetlené rozdiely pred vydaním.
ReakciaZachovať podozrivý artefakt a dôkazy proveniencie, odstrániť dotknuté verzie z distribúcie, identifikovať downstream nasadenia, obnoviť dôveryhodnú verziu a adresovať kompromitovanú cestu aktualizácií.
Dôležité obmedzenieEvaluácia modelu nedokáže vyčerpať každý možný vstup ani skryté správanie. Prejdenie benchmarku nedokazuje integritu parametrov, zatiaľ čo bežné autorizované dotrénovanie alebo náhodný tréningový defekt nie je otrávenie, pokiaľ nie je zapojená útočníkova manipulácia.