Učiaci proces absorbuje manipuláciu, ktorá môže redukovať celkový výkon, skresliť cielené rozhodnutie alebo vytvoriť zadné vrátka, ktoré sa aktivujú, keď sa objaví zvolený spúšťač. Útočník môže kompromitovať zdroj údajov, zberovú pipeline, proces anotácie, slučku spätnej väzby alebo úložisko datasetov.
Pojem sa primárne týka údajov, ktoré ovplyvňujú učenie, vrátane predtréningu, dotrénovania a datasetov reinforcement alebo spätnej väzby. Manipulovanie zdroja získavania v čase inferencie je zvyčajne presnejšie opísané ako otrávenie retrieval-augmented generation alebo otrávenie znalostnej bázy; korumpovanie evaluačnej sady môže znehodnotiť assurance aj keď nemení nasadený model.
Kľúčové body
Lineáž údajovZaznamenávať pôvod, metódu zberu, licenciu, transformácie, označenia, verzie, schválenia a modely alebo experimenty, ktoré každý dataset konzumovali.
Preventívne kontrolyLimitovať a auditovať zapisovací prístup, oddeliť dôveryhodné evaluačné údaje, autentifikovať schválené revízie, chrániť pipeline a úložiská a hodnotiť externe získané alebo používateľmi prispôsobené údaje.
DetekciaPoužiť štatistickú a sémantickú kontrolu, analýzu duplikátov a outlierov, cielené vzorkovanie, porovnania zdrojov a testy na podozrivé spúšťače alebo koncentrovaný vplyv.
ObnovaZachovať dôkazy, identifikovať dotknuté údaje a odvodené modely, vrátiť sa k dôveryhodnej verzii datasetu, pretrenovať tam, kde je to potrebné, a uzavrieť slabosť ingestie alebo autorizácie.
Dôležité obmedzenieOtrávené príklady môžu vyzerať legitímne a malá, opatrne zvolená podmnožina môže byť vplyvná. Čistenie údajov redukuje expozíciu, ale nedokáže certifikovať, že dataset je benígny; údaje nízkej kvality alebo nereprezentatívne bez útočníkovho zámenu sú problém kvality údajov, nie otrávenie.