Statt Lernbeispiele zu korrumpieren, beeinflusst der Angreifer direkt Gewichte, Gradienten, Updates, Checkpoints oder ein Modellartefakt. Das Ergebnis kann breite Leistungsdegradation, gezielte Fehler, eine vom Angreifer gewählte Backdoor oder ein Verlust der Modellintegrität sein, der nur unter bestimmten Bedingungen auftritt.
Relevante Angriffspfade umfassen einen kompromittierten Teilnehmer, der bösartige Updates beim Federated Learning einreicht, unbefugte Änderungen innerhalb einer Trainings-Pipeline und ein vergiftetes vortrainiertes oder feinabgestimmtes Modell, das über die KI-Lieferkette eingeschleust wird. Schutz hängt daher davon ab zu wissen, wo Modellartefakte und Updates herkamen, wer sie verändern konnte und welche Nachweise die Freigabe in die Produktion stützen.
Wichtigste Punkte
AngriffsflächeModell-Registries, Artefakt-Repositories, Trainingsjobs, verteilte oder föderierte Teilnehmer, Update-Aggregation, Serialisierungsformate, Deployment-Pipelines und Drittanbieter-Modellquellen prüfen.
IntegritätskontrollenSchreibzugriff beschränken, Aufgaben trennen, Artefakte wo unterstützt signieren und verifizieren, Lineage und Hashes aufbewahren, vertrauenswürdige Quellen freigeben und die Systeme schützen, die Modelle bauen und verteilen.
EvaluationKandidatenverhalten mit unabhängig geschützten Baselines und Holdouts vergleichen, auf gezielte Trigger und unerwartete Fähigkeitsänderungen testen und unerklärte Unterschiede vor dem Release untersuchen.
ReaktionDas verdächtige Artefakt und Provenance-Nachweise sichern, betroffene Versionen aus der Distribution entfernen, nachgelagerte Deployments identifizieren, eine vertrauenswürdige Version wiederherstellen und den kompromittierten Update-Pfad schließen.
Wichtige EinschränkungModellevaluation kann nicht jede mögliche Eingabe oder jedes verborgene Verhalten erschöpfen. Ein bestandener Benchmark beweist keine Parameterintegrität, und ein gewöhnliches autorisiertes Fine-Tuning oder ein versehentlicher Trainingsfehler ist kein Poisoning, sofern keine adversariale Manipulation vorliegt.