# Mi a modellmérgezés?

> A modellmérgezés tanítási szakaszbéli támadás, amelyben az ellenfél a modellt vagy paramétereit manipulálja a későbbi viselkedés megváltoztatására.

- Kanonikus URL: https://yellowcube.eu/hu/glossary/model-poisoning/
- Kiadó: Yellow Cube
- Nyelv: hu
- Kapcsolat: hello@yellowcube.eu

## Tartalom

Ahelyett hogy a tanulási példákat rontaná el, a támadó közvetlenül a súlyokra, gradiensekre, frissítésekre, ellenőrzőpontokra vagy modellartefaktumra hat. Az eredmény lehet általános teljesítményromlás, célzott hibák, támadóválasztotta hátsó ajtó, vagy olyan modellintegritás-vesztés, amely csak meghatározott feltételek mellett jelenik meg.

A releváns támadási útvonalak közé tartozik egy kompromittált résztvevő, amely rosszindulatú frissítéseket nyújt be a federált tanulás során, a tanítási pipeline-on belüli jogosulatlan változások, és az AI-ellátási láncon át bejutó megmérgezett előtanított vagy finomhangolt modell. A védelem ezért azon múlik, hogy ismert-e, honnan származnak a modellartefaktumok és -frissítések, ki módosíthatta őket, és milyen bizonyíték támasztja alá a termelésbe emelést.

### Legfontosabb pontok

- **Támadási felület:** Vizsgálja felül a modellregisztereket, artefaktumtárakat, tanítási feladatokat, elosztott vagy federált résztvevőket, frissítésaggregálást, szerializációs formátumokat, bevetési pipeline-okat és harmadikfél-modellforrásokat.
- **Integritási kontrollok:** Korlátozza az írási hozzáférést, válassza szét a feladatköröket, írja alá és ellenőrizze az artefaktumokat, ahol támogatott, őrizze a származást és hash-eket, hagyja jóvá a megbízható forrásokat, és védje a modelleket építő és terjesztő rendszereket.
- **Értékelés:** Vesse össze a jelölt viselkedést függetlenül védett bázisvonalakkal és tartalékmintákkal, teszteljen célzott triggerekre és váratlan képességváltozásokra, és vizsgálja a megmagyarázatlan eltéréseket kiadás előtt.
- **Reagálás:** Őrizze meg a gyanús artefaktumot és eredetbizonyítékot, távolítsa el az érintett verziókat a disztribúcióból, azonosítsa a downstream bevetéseket, állítson vissza megbízható verziót, és kezelje a kompromittált frissítési útvonalat.
- **Fontos korlát:** A modellértékelés nem tudja kimeríteni minden lehetséges bemenetet vagy rejtett viselkedést. A benchmarkon való átmenetel nem bizonyítja a paraméterintegritást, egy közönséges jogos finomhangolás vagy véletlen tanítási hiba pedig nem mérgezés, hacsak nincs benne adverszáriális manipuláció.

### Kapcsolódó kifejezések

[Adatmérgezés](<https://yellowcube.eu/hu/glossary/data-poisoning/>) · [Adverszáriális gépi tanulás](<https://yellowcube.eu/hu/glossary/adversarial-machine-learning/>) · [Szoftver-ellátáslánc-biztonság](<https://yellowcube.eu/hu/glossary/software-supply-chain-security/>) · [AI-biztonsági állapotkezelés (AI-SPM)](<https://yellowcube.eu/hu/glossary/ai-security-posture-management/>) · [AI-biztonság](<https://yellowcube.eu/hu/glossary/ai-security/>)

### Források

[NIST AI 100-2 E2025, Adversarial Machine Learning Taxonomy](https://csrc.nist.gov/pubs/ai/100/2/e2025/final) · [MITRE ATLAS](https://atlas.mitre.org/) · [CISA and UK NCSC Guidelines for Secure AI System Development](https://www.cisa.gov/news-events/alerts/2023/11/26/cisa-and-uk-ncsc-unveil-joint-guidelines-secure-ai-system-development)

## Forrásmegjelölés és hatókör

Ez a Markdown-változat ugyanazokból a jóváhagyott tartalmi rekordokból készül, mint a kanonikus HTML-oldal. Hivatkozáskor a kanonikus URL-t használja.

