# Qu'est-ce que l'empoisonnement de modèle ?

> L'empoisonnement de modèle est une attaque de la phase d'entraînement dans laquelle un adversaire manipule un modèle ou ses paramètres pour en changer le comportement ultérieur.

- URL canonique: https://yellowcube.eu/fr/glossary/model-poisoning/
- Éditeur: Yellow Cube
- Langue: fr
- Contact: hello@yellowcube.eu

## Contenu

Plutôt que de corrompre les exemples d'apprentissage, l'attaquant influence directement les poids, les gradients, les mises à jour, les checkpoints ou un artefact de modèle. Le résultat peut être une dégradation globale de la performance, des erreurs ciblées, une porte dérobée choisie par l'attaquant ou une perte d'intégrité du modèle qui n'apparaît que dans des conditions particulières.

Les chemins d'attaque pertinents incluent un participant compromis soumettant des mises à jour malveillantes pendant l'apprentissage fédéré, des changements non autorisés au sein d'un pipeline d'entraînement, et un modèle préentraîné ou affiné empoisonné introduit via la chaîne d'approvisionnement de l'IA. La protection dépend donc de savoir d'où proviennent les artefacts et les mises à jour du modèle, qui pouvait les modifier et quelles preuves soutiennent leur promotion en production.

### Points clés

- **Surface d'attaque:** Examiner les registres de modèles, les dépôts d'artefacts, les jobs d'entraînement, les participants distribués ou fédérés, l'agrégation des mises à jour, les formats de sérialisation, les pipelines de déploiement et les sources de modèles tiers.
- **Contrôles d'intégrité:** Restreindre l'accès en écriture, séparer les tâches, signer et vérifier les artefacts lorsque pris en charge, conserver la lignée et les empreintes, approuver les sources fiables et protéger les systèmes qui construisent et distribuent les modèles.
- **Évaluation:** Comparer le comportement du candidat à des bases de référence et des jeux de test (holdouts) protégés indépendamment, tester les déclencheurs ciblés et les changements de capacité inattendus, et investiguer les différences inexpliquées avant la publication.
- **Réponse:** Préserver l'artefact suspect et les preuves de provenance, retirer les versions affectées de la distribution, identifier les déploiements en aval, restaurer une version de confiance et traiter le chemin de mise à jour compromis.
- **Limite importante:** L'évaluation d'un modèle ne peut épuiser toutes les entrées ou tous les comportements cachés possibles. Réussir un benchmark ne prouve pas l'intégrité des paramètres, tandis qu'un affinement autorisé ordinaire ou un défaut d'entraînement accidentel n'est pas un empoisonnement sauf si une manipulation adverse est impliquée.

### Termes associés

[Empoisonnement de données](<https://yellowcube.eu/fr/glossary/data-poisoning/>) · [Adversarial machine learning](<https://yellowcube.eu/fr/glossary/adversarial-machine-learning/>) · [Sécurité de la chaîne d'approvisionnement logicielle](<https://yellowcube.eu/fr/glossary/software-supply-chain-security/>) · [Gestion de la posture de sécurité de l'IA (AI-SPM)](<https://yellowcube.eu/fr/glossary/ai-security-posture-management/>) · [Sécurité de l'IA](<https://yellowcube.eu/fr/glossary/ai-security/>)

### Sources

[NIST AI 100-2 E2025, Adversarial Machine Learning Taxonomy](https://csrc.nist.gov/pubs/ai/100/2/e2025/final) · [MITRE ATLAS](https://atlas.mitre.org/) · [CISA and UK NCSC Guidelines for Secure AI System Development](https://www.cisa.gov/news-events/alerts/2023/11/26/cisa-and-uk-ncsc-unveil-joint-guidelines-secure-ai-system-development)

## Attribution et portée

Cette version Markdown est générée à partir des mêmes contenus approuvés que la page HTML canonique. Utilisez l’URL canonique pour toute citation.

