# Čo je AI red teaming?

> AI red teaming je autorizované, štruktúrované adverzívne hodnotenie systému AI.

- Kanonická URL: https://yellowcube.eu/sk/glossary/ai-red-teaming/
- Vydavateľ: Yellow Cube
- Jazyk: sk
- Kontakt: hello@yellowcube.eu

## Obsah

Testeri adoptujú relevantné perspektívy útočníka alebo zneužitia a pokúšajú sa produkovať neprijateľné správanie, obísť kontroly, odhaliť údaje, zneužiť pripojené schopnosti alebo odhaliť slabiny v modeli, aplikácii a operačnom procese. Cieľ môže zahŕňať prompty, získavanie, správanie modelu, API, identity, nástroje, infraštruktúru a ľudský dohľad — nie len konverzáciu chatbota.

Užitočná zákazka začína modelom hrozieb, cieľmi, pravidlami zapojenia a merateľnými kritériami úspechu. Testeri zaznamenávajú reprodukovateľné dôkazy a podmienky, ktoré spravili každý výsledok možným, zatiaľ čo vlastníci prioritizujú nálezy, zlepšujú kontroly a retestujú. Metódy môžu zahŕňať manuálne skúmanie, automatizované generovanie testov, známe útočné techniky a scenárové cvičenia, ale výsledky potrebujú expertnú interpretáciu v skutočnom podnikovom kontexte systému.

### Kľúčové body

- **Rozsah a autorizácia:** Definovať systémy, údaje, používateľov, poskytovateľov, integrácie, zakázané akcie, eskalačné kontakty a zábrany pre dostupnosť, súkromie a tretie strany.
- **Reprezentatívne testovanie:** Pokryť priame a nepriame útoky promptov, zverejnenie informácií, nebezpečné použitie nástrojov, zlyhania autorizácie, predpoklady dodávateľského reťazca a relevantné škody na úrovni modelu alebo spoločnosti.
- **Užitočné výstupy:** Zachovať prompty, vstupy, verzie modelu a aplikácie, odpovede, stopy nástrojov, očakávané správanie, dopad, opakovateľnosť a navrhované zlepšenia kontrol.
- **Operačný rytmus:** Testovať pred dôležitými vydaniami a po zmenách modelov, promptov, zdrojov získavania, nástrojov, oprávnení alebo kontextu nasadenia; sledovať nálezy cez remedáciu a verifikáciu.
- **Dôležité obmedzenie:** AI red teaming dokáže objaviť zlyhania, ale nedokáže dokázať, že systém je bezpečný. Pokrytie je konečné, správanie modelu sa môže líšiť a bodovo-časový výsledok nemusí reprezentovať neskoršie verzie, kontexty alebo lepšie vybavených útočníkov.

### Súvisiace pojmy

[Red team](<https://yellowcube.eu/sk/glossary/red-team/>) · [Penetračné testovanie](<https://yellowcube.eu/sk/glossary/penetration-testing/>) · [Modelovanie hrozieb](<https://yellowcube.eu/sk/glossary/threat-modeling/>) · [Adverziálne strojové učenie](<https://yellowcube.eu/sk/glossary/adversarial-machine-learning/>) · [Prompt injection](<https://yellowcube.eu/sk/glossary/prompt-injection/>) · [Bezpečnosť AI](<https://yellowcube.eu/sk/glossary/ai-security/>)

### Zdroje

[OWASP GenAI Red Teaming Guide](https://genai.owasp.org/resource/genai-red-teaming-guide/) · [NIST AI 600-1, Generative AI Profile](https://www.nist.gov/publications/artificial-intelligence-risk-management-framework-generative-artificial-intelligence) · [MITRE ATLAS](https://atlas.mitre.org/)

## Uvedenie zdroja a rozsah

Táto verzia Markdown sa generuje z rovnakých schválených záznamov ako kanonická stránka HTML. Pri citovaní použite kanonickú URL.

