Taký systém môže plánovať kroky, zadržiavať pamäť, vyberať nástroje a konať za používateľa. Jeho bezpečnostná hranica zahŕňa model, orchestrovací kód, prompty, pamäť, rozhrania nástrojov, poverenia, pripojené údaje, iných agentov a prostredie akcie.
Riziká zahŕňajú nepriamu injekciu promptu, manipulované výsledky nástrojov, nadmerné oprávnenia, expozíciu poverení, otrávenú pamäť, impersonáciu medzi agentmi a škodlivé reťazce povolených akcií. Zlyhania môžu tiež nastať bez útočníka, keď agent nesprávne pochopí cieľ alebo optimalizuje nesprávny cieľ. Kontroly majú limitovať, čo agent dokáže pozorovať a meniť, so silnejším schvaľovaním pre akcie so závažnými dôsledkami.
Kľúčové body
Ohraničená autoritaDať každému nástroju a workflow úzko ohraničené, krátko žijúce poverenia; obmedziť destinácie, údaje, typy akcií, výdavky a čas vykonávania; a vyžadovať schválenie pre vysoko-impaktové kroky.
Ochrana kontextu a pamäteOddeliť používateľov a úlohy, označovať a validovať nedôveryhodný obsah, riadiť, čo perzistuje, zaznamenávať provenienciu a predchádzať tomu, aby získané inštrukcie ticho prepisovali autorizované ciele.
Pozorovanie a zadržanieLogovať prompty, rozhodnutia, volania nástrojov a výsledky tam, kde je to primerané; detekovať abnormálne reťazce akcií; použiť sandboxy, rate limity, kontroly transakcií a spoľahlivé mechanizmy zastavenia alebo rollbacku.
Assurance celého systémuTestovať realistické viackrokové útoky a náhodné zlyhania, vrátane kompromitácie nástroja, otrávenia pamäte, kaskádových agentov a obnovy z čiastočne dokončených akcií.
Dôležité obmedzenieBezpečnosť agentickej AI je vznikajúce pole s neustálenou terminológiou, protokolmi a metódami assurance. Konvenčné kontroly softvéru, identity a rizika AI zostávajú potrebné, ale nemusia plne adresovať delegované a adaptívne správanie.