# Qu'est-ce que l'empoisonnement de données ?

> L'empoisonnement de données est une attaque de la phase d'entraînement dans laquelle un adversaire insère, supprime, altère ou réétiquette des données utilisées pour entraîner ou adapter un modèle de machine learning.

- URL canonique: https://yellowcube.eu/fr/glossary/data-poisoning/
- Éditeur: Yellow Cube
- Langue: fr
- Contact: hello@yellowcube.eu

## Contenu

Le processus d'apprentissage absorbe la manipulation, ce qui peut réduire la performance globale, biaiser une décision ciblée ou créer une porte dérobée qui s'active lorsqu'un déclencheur choisi apparaît. L'attaquant peut compromettre une source de données, un pipeline de collecte, un processus d'annotation, une boucle de rétroaction ou un dépôt de jeux de données.

Le terme concerne principalement les données qui affectent l'apprentissage, y compris les jeux de données de préentraînement, d'affinement et de renforcement ou de rétroaction. Manipuler une source de recherche au moment de l'inférence se décrit généralement plus précisément comme un empoisonnement de retrieval-augmented generation ou de base de connaissances ; corrompre un jeu d'évaluation peut invalider l'assurance même si cela n'altère pas le modèle déployé.

### Points clés

- **Lignée des données:** Consigner l'origine, la méthode de collecte, la licence, les transformations, les étiquettes, les versions, les approbations et les modèles ou expériences qui ont consommé chaque jeu de données.
- **Contrôles préventifs:** Limiter et auditer l'accès en écriture, séparer les données d'évaluation de confiance, authentifier les révisions approuvées, protéger les pipelines et les dépôts, et évaluer les données d'origine externe ou fournies par les utilisateurs.
- **Détection:** Utiliser la revue statistique et sémantique, l'analyse des doublons et des valeurs aberrantes, l'échantillonnage ciblé, les comparaisons de sources et les tests de déclencheurs suspects ou d'influence concentrée.
- **Récupération:** Préserver les preuves, identifier les données affectées et les modèles dérivés, revenir à une version de confiance du jeu de données, réentraîner si nécessaire et combler la faiblesse d'ingestion ou d'autorisation.
- **Limite importante:** Les exemples empoisonnés peuvent paraître légitimes et un petit sous-ensemble soigneusement choisi peut être influent. Le nettoyage des données réduit l'exposition mais ne peut certifier qu'un jeu de données est bénin ; des données de mauvaise qualité ou non représentatives sans intention adverse relèvent d'un problème de qualité des données, pas d'un empoisonnement.

### Termes associés

[Empoisonnement de modèle](<https://yellowcube.eu/fr/glossary/model-poisoning/>) · [Opérations de sécurité du machine learning (MLSecOps)](<https://yellowcube.eu/fr/glossary/machine-learning-security-operations/>) · [Adversarial machine learning](<https://yellowcube.eu/fr/glossary/adversarial-machine-learning/>)

### Sources

[NIST AI 100-2 E2025, Adversarial Machine Learning Taxonomy](https://csrc.nist.gov/pubs/ai/100/2/e2025/final) · [NSA and partners, AI Data Security](https://www.nsa.gov/Press-Room/Press-Releases-Statements/Press-Release-View/Article/4192332/nsas-aisc-releases-joint-guidance-on-the-risks-and-best-practices-in-ai-data-se/) · [MITRE ATLAS](https://atlas.mitre.org/)

## Attribution et portée

Cette version Markdown est générée à partir des mêmes contenus approuvés que la page HTML canonique. Utilisez l’URL canonique pour toute citation.

