Un tel système peut planifier des étapes, conserver une mémoire, sélectionner des outils et agir pour un utilisateur. Sa frontière de sécurité inclut le modèle, le code d'orchestration, les prompts, la mémoire, les interfaces d'outils, les identifiants, les données connectées, les autres agents et l'environnement d'action.
Les risques incluent l'injection de prompt indirecte, les résultats d'outils manipulés, les permissions excessives, l'exposition d'identifiants, la mémoire empoisonnée, l'usurpation entre agents et les chaînes d'actions permises aux effets dommageables. Des défaillances peuvent aussi survenir sans attaquant lorsqu'un agent comprend mal un objectif ou optimise le mauvais but. Les contrôles doivent limiter ce que l'agent peut observer et modifier, avec une approbation renforcée pour les actions à conséquence.
Points clés
Autorité bornéeDonner à chaque outil et workflow des identifiants à périmètre étroit et de courte durée ; restreindre les destinations, les données, les types d'actions, les dépenses et le temps d'exécution ; et exiger une approbation pour les étapes à fort impact.
Protection du contexte et de la mémoireSéparer les utilisateurs et les tâches, étiqueter et valider le contenu non fiable, contrôler ce qui persiste, consigner la provenance et empêcher les instructions récupérées d'écraser silencieusement les objectifs autorisés.
Observation et confinementJournaliser les prompts, les décisions, les appels d'outils et les résultats lorsque proportionné ; détecter les chaînes d'actions anormales ; utiliser des sandboxes, des limites de débit, des contrôles de transaction et des mécanismes fiables d'arrêt ou de rollback.
Assurance du système entierTester des attaques réalistes en plusieurs étapes et des défaillances accidentelles, y compris la compromission d'outils, l'empoisonnement de la mémoire, les agents en cascade et la récupération d'actions partiellement accomplies.
Limite importanteLa sécurité de l'IA agentique est un domaine émergent dont la terminologie, les protocoles et les méthodes d'assurance ne sont pas stabilisés. Les contrôles conventionnels de logiciel, d'identité et de risque IA restent nécessaires, mais peuvent ne pas traiter pleinement le comportement délégué et adaptatif.