Plutôt que de corrompre les exemples d'apprentissage, l'attaquant influence directement les poids, les gradients, les mises à jour, les checkpoints ou un artefact de modèle. Le résultat peut être une dégradation globale de la performance, des erreurs ciblées, une porte dérobée choisie par l'attaquant ou une perte d'intégrité du modèle qui n'apparaît que dans des conditions particulières.
Les chemins d'attaque pertinents incluent un participant compromis soumettant des mises à jour malveillantes pendant l'apprentissage fédéré, des changements non autorisés au sein d'un pipeline d'entraînement, et un modèle préentraîné ou affiné empoisonné introduit via la chaîne d'approvisionnement de l'IA. La protection dépend donc de savoir d'où proviennent les artefacts et les mises à jour du modèle, qui pouvait les modifier et quelles preuves soutiennent leur promotion en production.
Points clés
Surface d'attaqueExaminer les registres de modèles, les dépôts d'artefacts, les jobs d'entraînement, les participants distribués ou fédérés, l'agrégation des mises à jour, les formats de sérialisation, les pipelines de déploiement et les sources de modèles tiers.
Contrôles d'intégritéRestreindre l'accès en écriture, séparer les tâches, signer et vérifier les artefacts lorsque pris en charge, conserver la lignée et les empreintes, approuver les sources fiables et protéger les systèmes qui construisent et distribuent les modèles.
ÉvaluationComparer le comportement du candidat à des bases de référence et des jeux de test (holdouts) protégés indépendamment, tester les déclencheurs ciblés et les changements de capacité inattendus, et investiguer les différences inexpliquées avant la publication.
RéponsePréserver l'artefact suspect et les preuves de provenance, retirer les versions affectées de la distribution, identifier les déploiements en aval, restaurer une version de confiance et traiter le chemin de mise à jour compromis.
Limite importanteL'évaluation d'un modèle ne peut épuiser toutes les entrées ou tous les comportements cachés possibles. Réussir un benchmark ne prouve pas l'intégrité des paramètres, tandis qu'un affinement autorisé ordinaire ou un défaut d'entraînement accidentel n'est pas un empoisonnement sauf si une manipulation adverse est impliquée.