Elle exploite la difficulté de séparer de manière fiable les directives dignes de confiance du contenu non fiable dans le contexte du modèle. Une injection directe provient de l'utilisateur qui interagit ; une injection indirecte est dissimulée dans un contenu que le système traite ultérieurement, comme une page web, un e-mail, un document, une image, un résultat d'outil ou un enregistrement de recherche.
La conséquence dépend moins du texte seul que de l'application qui entoure le modèle. Un assistant isolé peut produire une réponse indésirable, tandis qu'un agent ayant accès à des données privées, à des identifiants ou à des outils externes pourrait divulguer des informations ou initier des actions non autorisées. Les défenses doivent donc supposer qu'un contenu élaboré peut influencer le modèle et limiter ce que toute sortie résultante est autorisée à faire.
Points clés
Frontières de confianceIdentifier chaque chemin qui ajoute du texte, des images, des enregistrements récupérés ou des sorties d'outils au contexte, et étiqueter le contenu externe comme non fiable même lorsqu'il apparaît dans un document familier.
Réduction d'impactDonner aux modèles et aux outils des identités de moindre privilège, séparer les données sensibles, contraindre les actions disponibles, valider les arguments d'outils et exiger une approbation indépendante pour les opérations à fort impact.
Détection et testsExercer les cas directs, indirects, encodés, multilingues, multimodaux et en plusieurs étapes ; journaliser le modèle, le prompt, le contenu récupéré, les appels d'outils et les décisions d'autorisation nécessaires pour investiguer les résultats.
Limite importanteLes system prompts, les filtres d'entrée, les délimiteurs et les détecteurs fondés sur des modèles peuvent réduire le risque mais ne fournissent pas de frontière universelle contre l'injection de prompt. L'application doit rester sécurisée lorsque le modèle suit des instructions hostiles ou émet une sortie hostile.