Tester nehmen relevante Angreifer- oder Missbrauchsperspektiven ein und versuchen, inakzeptables Verhalten zu erzeugen, Kontrollen zu umgehen, Daten offenzulegen, verbundene Fähigkeiten zu missbrauchen oder Schwächen im Modell, in der Anwendung und im Betriebsprozess aufzudecken. Das Ziel kann Prompts, Retrieval, Modellverhalten, APIs, Identitäten, Werkzeuge, Infrastruktur und menschliche Aufsicht umfassen — nicht nur eine Chatbot-Konversation.
Ein nützliches Engagement beginnt mit einem Bedrohungsmodell, Zielen, Rules of Engagement und messbaren Erfolgskriterien. Tester halten reproduzierbare Nachweise und die Bedingungen fest, die jedes Ergebnis ermöglichten, während Eigentümer Befunde priorisieren, Kontrollen verbessern und erneut testen. Methoden können manuelle Exploration, automatisierte Testgenerierung, bekannte Angriffstechniken und szenariobasierte Übungen umfassen, doch Ergebnisse brauchen fachliche Interpretation im tatsächlichen Geschäftskontext des Systems.
Wichtigste Punkte
Scope und AutorisierungDie Systeme, Daten, Nutzer, Anbieter, Integrationen, verbotenen Aktionen, Eskalationskontakte und Schutzmaßnahmen für Verfügbarkeit, Datenschutz und Dritte definieren.
Repräsentatives TestenDirekte und indirekte Prompt-Angriffe, Informationsoffenlegung, unsichere Werkzeugnutzung, Autorisierungsfehler, Supply-Chain-Annahmen sowie relevante modellbezogene oder gesellschaftliche Schäden abdecken.
Nützliche ErgebnissePrompts, Eingaben, Modell- und Anwendungsversionen, Antworten, Werkzeugspuren, erwartetes Verhalten, Auswirkung, Wiederholbarkeit und vorgeschlagene Kontrollverbesserungen sichern.
BetriebsrhythmusVor wichtigen Releases und nach Änderungen an Modellen, Prompts, Retrieval-Quellen, Werkzeugen, Berechtigungen oder Deployment-Kontext testen; Befunde durch Behebung und Verifikation verfolgen.
Wichtige EinschränkungAI Red Teaming kann Fehlschläge entdecken, aber nicht beweisen, dass ein System sicher ist. Die Abdeckung ist endlich, Modellverhalten kann variieren, und ein Momentanergebnis repräsentiert möglicherweise nicht spätere Versionen, Kontexte oder besser ausgestattete Angreifer.