Testeri adoptujú relevantné perspektívy útočníka alebo zneužitia a pokúšajú sa produkovať neprijateľné správanie, obísť kontroly, odhaliť údaje, zneužiť pripojené schopnosti alebo odhaliť slabiny v modeli, aplikácii a operačnom procese. Cieľ môže zahŕňať prompty, získavanie, správanie modelu, API, identity, nástroje, infraštruktúru a ľudský dohľad — nie len konverzáciu chatbota.
Užitočná zákazka začína modelom hrozieb, cieľmi, pravidlami zapojenia a merateľnými kritériami úspechu. Testeri zaznamenávajú reprodukovateľné dôkazy a podmienky, ktoré spravili každý výsledok možným, zatiaľ čo vlastníci prioritizujú nálezy, zlepšujú kontroly a retestujú. Metódy môžu zahŕňať manuálne skúmanie, automatizované generovanie testov, známe útočné techniky a scenárové cvičenia, ale výsledky potrebujú expertnú interpretáciu v skutočnom podnikovom kontexte systému.
Kľúčové body
Rozsah a autorizáciaDefinovať systémy, údaje, používateľov, poskytovateľov, integrácie, zakázané akcie, eskalačné kontakty a zábrany pre dostupnosť, súkromie a tretie strany.
Reprezentatívne testovaniePokryť priame a nepriame útoky promptov, zverejnenie informácií, nebezpečné použitie nástrojov, zlyhania autorizácie, predpoklady dodávateľského reťazca a relevantné škody na úrovni modelu alebo spoločnosti.
Užitočné výstupyZachovať prompty, vstupy, verzie modelu a aplikácie, odpovede, stopy nástrojov, očakávané správanie, dopad, opakovateľnosť a navrhované zlepšenia kontrol.
Operačný rytmusTestovať pred dôležitými vydaniami a po zmenách modelov, promptov, zdrojov získavania, nástrojov, oprávnení alebo kontextu nasadenia; sledovať nálezy cez remedáciu a verifikáciu.
Dôležité obmedzenieAI red teaming dokáže objaviť zlyhania, ale nedokáže dokázať, že systém je bezpečný. Pokrytie je konečné, správanie modelu sa môže líšiť a bodovo-časový výsledok nemusí reprezentovať neskoršie verzie, kontexty alebo lepšie vybavených útočníkov.