Využíva ťažkosť spoľahlivo oddeľovať dôveryhodné usmernenia od nedôveryhodného obsahu v kontexte modelu. Priama injekcia pochádza od interagujúceho používateľa; nepriama injekcia je zasadená v obsahu, ktorý systém neskôr spracúva, ako webová stránka, e-mail, dokument, obrázok, výsledok nástroja alebo záznam získavania.
Dôsledok závisí menej od samotného textu než od aplikácie okolo modelu. Izolovaný asistent môže produkovať nechcenú odpoveď, zatiaľ čo agent s prístupom k súkromným údajom, povereniam alebo externým nástrojom by mohol zverejniť informácie alebo iniciovať neautorizované akcie. Obrany preto majú predpokladať, že vytvorený obsah môže ovplyvniť model a limitovať, čo je akémukoľvek výslednému výstupu povolené robiť.
Kľúčové body
Hranice dôveryIdentifikovať každú cestu, ktorá pridáva text, obrázky, získané záznamy alebo výstup nástroja do kontextu, a označovať externý obsah ako nedôveryhodný aj keď sa objavuje vnútri známeho dokumentu.
Redukcia dopaduDať modelom a nástrojom identity najmenších oprávnení, oddeliť citlivé údaje, obmedziť dostupné akcie, validovať argumenty nástrojov a vyžadovať nezávislé schválenie pre operácie s vysokým dopadom.
Detekcia a testovanieCvičiť priame, nepriame, kódované, viacjazyčné, multimodálne a viackrokové prípady; logovať model, prompt, získaný obsah, volania nástrojov a autorizačné rozhodnutia potrebné na vyšetrenie výsledkov.
Dôležité obmedzenieSystémové prompty, vstupné filtre, oddeľovače a modelovo-založené detektory môžu redukovať riziko, ale neposkytujú univerzálnu hranicu injekcie promptu. Aplikácia musí zostať bezpečná, keď model nasleduje nepriateľské inštrukcie alebo produkuje nepriateľský výstup.