Der Lernprozess absorbiert die Manipulation, was die Gesamtleistung senken, eine gezielte Entscheidung verzerren oder eine Backdoor erzeugen kann, die bei einem gewählten Trigger aktiviert wird. Der Angreifer kann eine Datenquelle, Sammel-Pipeline, einen Annotationsprozess, eine Feedbackschleife oder ein Datensatz-Repository kompromittieren.
Der Begriff betrifft primär Daten, die das Lernen beeinflussen — einschließlich Pretraining-, Fine-Tuning- und Verstärkungs- oder Feedback-Datensätze. Das Manipulieren einer Retrieval-Quelle zur Inferenzzeit wird üblicherweise präziser als Retrieval-Augmented-Generation-Poisoning oder Knowledge-Base-Poisoning beschrieben; das Korrumpieren eines Evaluationssets kann Assurance entwerten, selbst wenn es das bereitgestellte Modell nicht verändert.
Wichtigste Punkte
DatenherkunftQuelle, Erhebungsmethode, Lizenz, Transformationen, Labels, Versionen, Freigaben sowie die Modelle oder Experimente aufzeichnen, die jeden Datensatz konsumiert haben.
Präventive KontrollenSchreibzugriff begrenzen und auditieren, vertrauenswürdige Evaluationsdaten trennen, freigegebene Revisionen authentifizieren, Pipelines und Repositories schützen sowie extern bezogene oder nutzerbeigesteuerte Daten bewerten.
ErkennungStatistische und semantische Prüfung, Duplikat- und Ausreißeranalyse, gezielte Stichproben, Quellenvergleiche sowie Tests auf verdächtige Trigger oder konzentrierten Einfluss nutzen.
WiederherstellungNachweise sichern, betroffene Daten und abgeleitete Modelle identifizieren, auf eine vertrauenswürdige Datensatzversion zurücksetzen, wo nötig neu trainieren und die Ingestion- oder Autorisierungsschwäche schließen.
Wichtige EinschränkungVergiftete Beispiele können legitim aussehen, und eine kleine, sorgfältig gewählte Teilmenge kann einflussreich sein. Datenbereinigung reduziert die Exposition, kann aber nicht bescheinigen, dass ein Datensatz harmlos ist; qualitativ schlechte oder unrepräsentative Daten ohne adversariale Absicht sind ein Datenqualitätsproblem, kein Poisoning.