# Mi az adatmérgezés?

> Az adatmérgezés tanítási szakaszbéli támadás, amelyben az ellenfél a gépi tanulási modell tanítására vagy adaptálására használt adatokat szúr be, töröl, változtat meg vagy címkéz át.

- Kanonikus URL: https://yellowcube.eu/hu/glossary/data-poisoning/
- Kiadó: Yellow Cube
- Nyelv: hu
- Kapcsolat: hello@yellowcube.eu

## Tartalom

A tanulási folyamat magába szívja a manipulációt, ami csökkentheti az általános teljesítményt, torzíthat egy célzott döntést, vagy olyan hátsó ajtót hozhat létre, amely egy kiválasztott trigger megjelenésekor aktiválódik. A támadó kompromittálhat egy adatforrást, gyűjtési pipeline-t, annotációs folyamatot, visszacsatolási hurkot vagy adathalmaztárat.

A kifejezés elsősorban a tanulást érintő adatokra vonatkozik — beleértve az előtanítási, finomhangolási és megerősítéses vagy visszacsatolási adathalmazokat. A visszakeresési forrás következtetési időbeli manipulálását pontosabban retrieval-augmented generation poisoningnak vagy tudásbázis-mérgezésnek nevezik; az értékelőhalmaz megrontása érvénytelenítheti a biztosítékot még akkor is, ha a bevetett modellt nem változtatja.

### Legfontosabb pontok

- **Adatszármazás:** Rögzítse az eredetet, gyűjtési módszert, licencet, transzformációkat, címkéket, verziókat, jóváhagyásokat, valamint az egyes adathalmazokat fogyasztó modelleket vagy kísérleteket.
- **Megelőző kontrollok:** Korlátozza és auditálja az írási hozzáférést, válassza szét a megbízható értékelőadatokat, hitelesítse a jóváhagyott revíziókat, védje a pipeline-okat és tárakat, és értékelje a külső forrású vagy felhasználóhozzájárulású adatokat.
- **Észlelés:** Használjon statisztikai és szemantikai felülvizsgálatot, duplikátum- és kiugróérték-elemzést, célzott mintavételt, forrásösszevetést, valamint gyanús triggerekre vagy koncentrált befolyásra irányuló teszteket.
- **Helyreállítás:** Őrizze a bizonyítékot, azonosítsa az érintett adatokat és származtatott modelleket, térjen vissza megbízható adathalmazverzióra, szükség esetén tanítson újra, és zárja be a betáplálási vagy jogosítási gyengeséget.
- **Fontos korlát:** A megmérgezett példák legitimnek tűnhetnek, és egy kis, gondosan választott részhalmaz is befolyásos lehet. Az adattisztítás csökkenti a kitettséget, de nem tanúsíthatja, hogy az adathalmaz ártatlan; az ellenfél szándéka nélküli gyenge minőségű vagy reprezentálatlan adat adatminőségi probléma, nem mérgezés.

### Kapcsolódó kifejezések

[Modellmérgezés](<https://yellowcube.eu/hu/glossary/model-poisoning/>) · [Gépi tanulási biztonsági műveletek (MLSecOps)](<https://yellowcube.eu/hu/glossary/machine-learning-security-operations/>) · [Adverszáriális gépi tanulás](<https://yellowcube.eu/hu/glossary/adversarial-machine-learning/>)

### Források

[NIST AI 100-2 E2025, Adversarial Machine Learning Taxonomy](https://csrc.nist.gov/pubs/ai/100/2/e2025/final) · [NSA and partners, AI Data Security](https://www.nsa.gov/Press-Room/Press-Releases-Statements/Press-Release-View/Article/4192332/nsas-aisc-releases-joint-guidance-on-the-risks-and-best-practices-in-ai-data-se/) · [MITRE ATLAS](https://atlas.mitre.org/)

## Forrásmegjelölés és hatókör

Ez a Markdown-változat ugyanazokból a jóváhagyott tartalmi rekordokból készül, mint a kanonikus HTML-oldal. Hivatkozáskor a kanonikus URL-t használja.

