Ahelyett hogy a tanulási példákat rontaná el, a támadó közvetlenül a súlyokra, gradiensekre, frissítésekre, ellenőrzőpontokra vagy modellartefaktumra hat. Az eredmény lehet általános teljesítményromlás, célzott hibák, támadóválasztotta hátsó ajtó, vagy olyan modellintegritás-vesztés, amely csak meghatározott feltételek mellett jelenik meg.
A releváns támadási útvonalak közé tartozik egy kompromittált résztvevő, amely rosszindulatú frissítéseket nyújt be a federált tanulás során, a tanítási pipeline-on belüli jogosulatlan változások, és az AI-ellátási láncon át bejutó megmérgezett előtanított vagy finomhangolt modell. A védelem ezért azon múlik, hogy ismert-e, honnan származnak a modellartefaktumok és -frissítések, ki módosíthatta őket, és milyen bizonyíték támasztja alá a termelésbe emelést.
Legfontosabb pontok
Támadási felületVizsgálja felül a modellregisztereket, artefaktumtárakat, tanítási feladatokat, elosztott vagy federált résztvevőket, frissítésaggregálást, szerializációs formátumokat, bevetési pipeline-okat és harmadikfél-modellforrásokat.
Integritási kontrollokKorlátozza az írási hozzáférést, válassza szét a feladatköröket, írja alá és ellenőrizze az artefaktumokat, ahol támogatott, őrizze a származást és hash-eket, hagyja jóvá a megbízható forrásokat, és védje a modelleket építő és terjesztő rendszereket.
ÉrtékelésVesse össze a jelölt viselkedést függetlenül védett bázisvonalakkal és tartalékmintákkal, teszteljen célzott triggerekre és váratlan képességváltozásokra, és vizsgálja a megmagyarázatlan eltéréseket kiadás előtt.
ReagálásŐrizze meg a gyanús artefaktumot és eredetbizonyítékot, távolítsa el az érintett verziókat a disztribúcióból, azonosítsa a downstream bevetéseket, állítson vissza megbízható verziót, és kezelje a kompromittált frissítési útvonalat.
Fontos korlátA modellértékelés nem tudja kimeríteni minden lehetséges bemenetet vagy rejtett viselkedést. A benchmarkon való átmenetel nem bizonyítja a paraméterintegritást, egy közönséges jogos finomhangolás vagy véletlen tanítási hiba pedig nem mérgezés, hacsak nincs benne adverszáriális manipuláció.