# Čo je data poisoning?

> Data poisoning (data poisoning) je útok v štádiu tréningu, v ktorom útočník vkladá, maže, mení alebo preoznačuje údaje použité na trénovanie alebo adaptáciu modelu strojového učenia.

- Kanonická URL: https://yellowcube.eu/sk/glossary/data-poisoning/
- Vydavateľ: Yellow Cube
- Jazyk: sk
- Kontakt: hello@yellowcube.eu

## Obsah

Učiaci proces absorbuje manipuláciu, ktorá môže redukovať celkový výkon, skresliť cielené rozhodnutie alebo vytvoriť zadné vrátka, ktoré sa aktivujú, keď sa objaví zvolený spúšťač. Útočník môže kompromitovať zdroj údajov, zberovú pipeline, proces anotácie, slučku spätnej väzby alebo úložisko datasetov.

Pojem sa primárne týka údajov, ktoré ovplyvňujú učenie, vrátane predtréningu, dotrénovania a datasetov reinforcement alebo spätnej väzby. Manipulovanie zdroja získavania v čase inferencie je zvyčajne presnejšie opísané ako otrávenie retrieval-augmented generation alebo otrávenie znalostnej bázy; korumpovanie evaluačnej sady môže znehodnotiť assurance aj keď nemení nasadený model.

### Kľúčové body

- **Lineáž údajov:** Zaznamenávať pôvod, metódu zberu, licenciu, transformácie, označenia, verzie, schválenia a modely alebo experimenty, ktoré každý dataset konzumovali.
- **Preventívne kontroly:** Limitovať a auditovať zapisovací prístup, oddeliť dôveryhodné evaluačné údaje, autentifikovať schválené revízie, chrániť pipeline a úložiská a hodnotiť externe získané alebo používateľmi prispôsobené údaje.
- **Detekcia:** Použiť štatistickú a sémantickú kontrolu, analýzu duplikátov a outlierov, cielené vzorkovanie, porovnania zdrojov a testy na podozrivé spúšťače alebo koncentrovaný vplyv.
- **Obnova:** Zachovať dôkazy, identifikovať dotknuté údaje a odvodené modely, vrátiť sa k dôveryhodnej verzii datasetu, pretrenovať tam, kde je to potrebné, a uzavrieť slabosť ingestie alebo autorizácie.
- **Dôležité obmedzenie:** Otrávené príklady môžu vyzerať legitímne a malá, opatrne zvolená podmnožina môže byť vplyvná. Čistenie údajov redukuje expozíciu, ale nedokáže certifikovať, že dataset je benígny; údaje nízkej kvality alebo nereprezentatívne bez útočníkovho zámenu sú problém kvality údajov, nie otrávenie.

### Súvisiace pojmy

[Model poisoning](<https://yellowcube.eu/sk/glossary/model-poisoning/>) · [Machine learning security operations (MLSecOps)](<https://yellowcube.eu/sk/glossary/machine-learning-security-operations/>) · [Adverziálne strojové učenie](<https://yellowcube.eu/sk/glossary/adversarial-machine-learning/>)

### Zdroje

[NIST AI 100-2 E2025, Adversarial Machine Learning Taxonomy](https://csrc.nist.gov/pubs/ai/100/2/e2025/final) · [NSA and partners, AI Data Security](https://www.nsa.gov/Press-Room/Press-Releases-Statements/Press-Release-View/Article/4192332/nsas-aisc-releases-joint-guidance-on-the-risks-and-best-practices-in-ai-data-se/) · [MITRE ATLAS](https://atlas.mitre.org/)

## Uvedenie zdroja a rozsah

Táto verzia Markdown sa generuje z rovnakých schválených záznamov ako kanonická stránka HTML. Pri citovaní použite kanonickú URL.

