Azt a nehézséget használja ki, hogy a modell kontextusában a megbízható utasításokat és nem megbízható tartalmat nehéz megbízhatóan elválasztani. A közvetlen injektálás az interakciós felhasználótól jön; a közvetett injektálást olyan tartalomba ültetik, amelyet a rendszer később feldolgoz — weboldal, e-mail, dokumentum, kép, eszközeredmény vagy visszakeresési rekord.
A következmény kevésbé a szövegen, inkább a modellt körülvevő alkalmazáson múlik. Egy elszigetelt asszisztens nemkívánatos választ adhat, míg egy privát adatokhoz, hitelesítő adatokhoz vagy külső eszközökhöz hozzáférő ügynök információt fedhet fel vagy jogosulatlan műveleteket indíthat. A védelemnek ezért feltételeznie kell, hogy a készített tartalom befolyásolhatja a modellt, és korlátoznia kell, mit tehet a keletkező kimenet.
Legfontosabb pontok
Bizalmi határokAzonosítson minden útvonalat, amely szöveget, képet, visszakeresett rekordot vagy eszközkimenetet ad a kontextushoz, és a külső tartalmat megbízhatatlanként címkézze még akkor is, ha ismerős dokumentumban jelenik meg.
HatáscsökkentésAdjon a modelleknek és eszközöknek minimálisjogosultság-identitásokat, válassza szét az érzékeny adatokat, korlátozza az elérhető műveleteket, validálja az eszközargumentumokat, és kérjen független jóváhagyást a nagy hatású műveletekhez.
Észlelés és tesztelésGyakoroljon közvetlen, közvetett, kódolt, többnyelvű, multimodális és többlépéses eseteket; naplózza a vizsgálathoz szükséges modellt, promptot, visszakeresett tartalmat, eszközhívásokat és jogosítási döntéseket.
Fontos korlátA rendszerpromptok, bemeneti szűrők, határolók és modellalapú detektorok csökkenthetik a kockázatot, de nem adnak univerzális promptinjekciós határt. Az alkalmazásnak akkor is biztonságosnak kell maradnia, amikor a modell ellenséges utasításokat követ vagy ellenséges kimenetet bocsát ki.