# Čo je model poisoning?

> Model poisoning (model poisoning) je útok v štádiu tréningu, v ktorom útočník manipuluje model alebo jeho parametre na zmenu neskoršieho správania.

- Kanonická URL: https://yellowcube.eu/sk/glossary/model-poisoning/
- Vydavateľ: Yellow Cube
- Jazyk: sk
- Kontakt: hello@yellowcube.eu

## Obsah

Namiesto korumpovania učiacich príkladov útočník priamo ovplyvňuje váhy, gradienty, aktualizácie, checkpointy alebo artefakt modelu. Výsledkom môže byť široká degradácia výkonu, cielené chyby, útočníkom zvolená zadná vrátka alebo strata integrity modelu, ktorá sa objaví len za konkrétnych podmienok.

Relevantné útočné cesty zahŕňajú kompromitovaného účastníka odosielajúceho škodlivé aktualizácie počas federovaného učenia, neautorizované zmeny vnútri tréningovej pipeline a otrávený predtrénovaný alebo dotrénovaný model zavedený cez dodávateľský reťazec AI. Ochrana preto závisí od poznania, odkiaľ artefakty modelu a aktualizácie pochádzali, kto ich mohol modifikovať a aké dôkazy podporujú promóciu do produkcie.

### Kľúčové body

- **Útočná plocha:** Skontrolovať registre modelov, úložiská artefaktov, tréningové úlohy, distribuovaných alebo federovaných účastníkov, agregáciu aktualizácií, serializačné formáty, pipeline nasadenia a zdroje modelov tretích strán.
- **Kontroly integrity:** Obmedziť zapisovací prístup, oddeliť povinnosti, podpisovať a verifikovať artefakty tam, kde je to podporované, zadržiavať lineáž a hashe, schvaľovať dôveryhodné zdroje a chrániť systémy, ktoré modely budujú a distribuujú.
- **Evaluácia:** Porovnávať správanie kandidáta s nezávisle chránenými baseline a holdoutmi, testovať na cielené spúšťače a neočakávané zmeny schopností a vyšetrovať nevysvetlené rozdiely pred vydaním.
- **Reakcia:** Zachovať podozrivý artefakt a dôkazy proveniencie, odstrániť dotknuté verzie z distribúcie, identifikovať downstream nasadenia, obnoviť dôveryhodnú verziu a adresovať kompromitovanú cestu aktualizácií.
- **Dôležité obmedzenie:** Evaluácia modelu nedokáže vyčerpať každý možný vstup ani skryté správanie. Prejdenie benchmarku nedokazuje integritu parametrov, zatiaľ čo bežné autorizované dotrénovanie alebo náhodný tréningový defekt nie je otrávenie, pokiaľ nie je zapojená útočníkova manipulácia.

### Súvisiace pojmy

[Data poisoning](<https://yellowcube.eu/sk/glossary/data-poisoning/>) · [Adverziálne strojové učenie](<https://yellowcube.eu/sk/glossary/adversarial-machine-learning/>) · [Bezpečnosť dodávateľského reťazca softvéru](<https://yellowcube.eu/sk/glossary/software-supply-chain-security/>) · [Správa stavu zabezpečenia AI (AI security posture management, AI-SPM)](<https://yellowcube.eu/sk/glossary/ai-security-posture-management/>) · [Bezpečnosť AI](<https://yellowcube.eu/sk/glossary/ai-security/>)

### Zdroje

[NIST AI 100-2 E2025, Adversarial Machine Learning Taxonomy](https://csrc.nist.gov/pubs/ai/100/2/e2025/final) · [MITRE ATLAS](https://atlas.mitre.org/) · [CISA and UK NCSC Guidelines for Secure AI System Development](https://www.cisa.gov/news-events/alerts/2023/11/26/cisa-and-uk-ncsc-unveil-joint-guidelines-secure-ai-system-development)

## Uvedenie zdroja a rozsah

Táto verzia Markdown sa generuje z rovnakých schválených záznamov ako kanonická stránka HTML. Pri citovaní použite kanonickú URL.

