A tanulási folyamat magába szívja a manipulációt, ami csökkentheti az általános teljesítményt, torzíthat egy célzott döntést, vagy olyan hátsó ajtót hozhat létre, amely egy kiválasztott trigger megjelenésekor aktiválódik. A támadó kompromittálhat egy adatforrást, gyűjtési pipeline-t, annotációs folyamatot, visszacsatolási hurkot vagy adathalmaztárat.
A kifejezés elsősorban a tanulást érintő adatokra vonatkozik — beleértve az előtanítási, finomhangolási és megerősítéses vagy visszacsatolási adathalmazokat. A visszakeresési forrás következtetési időbeli manipulálását pontosabban retrieval-augmented generation poisoningnak vagy tudásbázis-mérgezésnek nevezik; az értékelőhalmaz megrontása érvénytelenítheti a biztosítékot még akkor is, ha a bevetett modellt nem változtatja.
Legfontosabb pontok
AdatszármazásRögzítse az eredetet, gyűjtési módszert, licencet, transzformációkat, címkéket, verziókat, jóváhagyásokat, valamint az egyes adathalmazokat fogyasztó modelleket vagy kísérleteket.
Megelőző kontrollokKorlátozza és auditálja az írási hozzáférést, válassza szét a megbízható értékelőadatokat, hitelesítse a jóváhagyott revíziókat, védje a pipeline-okat és tárakat, és értékelje a külső forrású vagy felhasználóhozzájárulású adatokat.
ÉszlelésHasználjon statisztikai és szemantikai felülvizsgálatot, duplikátum- és kiugróérték-elemzést, célzott mintavételt, forrásösszevetést, valamint gyanús triggerekre vagy koncentrált befolyásra irányuló teszteket.
HelyreállításŐrizze a bizonyítékot, azonosítsa az érintett adatokat és származtatott modelleket, térjen vissza megbízható adathalmazverzióra, szükség esetén tanítson újra, és zárja be a betáplálási vagy jogosítási gyengeséget.
Fontos korlátA megmérgezett példák legitimnek tűnhetnek, és egy kis, gondosan választott részhalmaz is befolyásos lehet. Az adattisztítás csökkenti a kitettséget, de nem tanúsíthatja, hogy az adathalmaz ártatlan; az ellenfél szándéka nélküli gyenge minőségű vagy reprezentálatlan adat adatminőségi probléma, nem mérgezés.