A tesztelők releváns támadói vagy visszaélési perspektívákat vesznek fel, és megpróbálnak elfogadhatatlan viselkedést előállítani, kontrollokat megkerülni, adatot kitenni, csatlakoztatott képességekkel visszaélni, vagy gyengeségeket feltárni a modellben, alkalmazásban és üzemi folyamatban. A célpont magában foglalhatja a promptokat, visszakeresést, modellviselkedést, API-kat, identitásokat, eszközöket, infrastruktúrát és emberi felügyeletet — nem csupán egy chatbot-beszélgetést.
A hasznos megbízás fenyegetésmodelllel, célkitűzésekkel, beavatkozási szabályokkal és mérhető sikerkritériumokkal kezdődik. A tesztelők reprodukálható bizonyítékot és az egyes eredményeket lehetővé tévő feltételeket rögzítenek, miközben a tulajdonosok priorizálják a megállapításokat, javítják a kontrollokat és újratesztelnek. A módszerek közé tartozhat a kézi felfedezés, automatizált tesztgenerálás, ismert támadási technikák és forgatókönyvalapú gyakorlatok, de az eredmények szakértői értelmezést igényelnek a rendszer tényleges üzleti kontextusában.
Legfontosabb pontok
Hatókör és felhatalmazásHatározza meg a rendszereket, adatokat, felhasználókat, szolgáltatókat, integrációkat, tiltott műveleteket, eszkalációs kapcsolatokat és a rendelkezésre állást, adatvédelmet és harmadik feleket védő intézkedéseket.
Reprezentatív tesztelésFedje le a közvetlen és közvetett prompttámadásokat, információközlést, nem biztonságos eszközhasználatot, jogosítási hibákat, ellátáslánci feltevéseket és a releváns modellszintű vagy társadalmi károkat.
Hasznos kimenetekŐrizze meg a promptokat, bemeneteket, modell- és alkalmazásverziókat, válaszokat, eszköznyomokat, várt viselkedést, hatást, megismételhetőséget és javasolt kontrolljavításokat.
Üzemi ritmusTeszteljen fontos kiadások előtt és a modellek, promptok, visszakeresési források, eszközök, jogosultságok vagy bevetési kontextus változása után; kövesse a megállapításokat az orvosláson és ellenőrzésen át.
Fontos korlátAz AI red teaming felfedezhet meghibásodásokat, de nem bizonyíthatja, hogy a rendszer biztonságos. A lefedettség véges, a modellviselkedés változhat, és egy időpontra szóló eredmény nem feltétlenül reprezentálja a későbbi verziókat, kontextusokat vagy jobban ellátott támadókat.