Ihr Zweck ist, wichtige Missions- oder Geschäftsergebnisse aufrechtzuerhalten, selbst wenn Prävention scheitert. Das erfordert zu verstehen, welche Funktionen zählen, wovon sie abhängen, wie viel Degradation tolerierbar ist und wie die Organisation vertrauenswürdigen Betrieb wiedererlangt.
Resilienz wird über Systeme und Betrieb hinweg entworfen, statt als einzelne Kontrolle hinzugefügt. Maßnahmen können Segmentierung, Diversität, Redundanz, reduzierte Privilegien, graceful Degradation, alternative Prozesse, geschützte Wiederherstellungsressourcen, Incident Response und Übungen umfassen. Wiederherstellung allein genügt nicht: Organisationen sollten aus Störungen lernen und Architektur, Prioritäten und Betriebsverfahren anpassen, wenn sich Abhängigkeiten und Bedrohungen ändern.
Wichtigste Punkte
AntizipierenKritische Funktionen, Abhängigkeiten, plausible widrige Szenarien, minimal tragfähige Service-Niveaus und Warnindikatoren identifizieren.
Standhalten und erholenBlast Radius begrenzen, wesentliche Fähigkeiten bewahren, vertrauenswürdige Kommunikation erhalten, in Prioritätsreihenfolge wiederherstellen und die Sicherheit verifizieren, bevor der Normalbetrieb wieder aufgenommen wird.
AnpassenRealistische Ausfälle üben, Ergebnisse messen, Vorfälle und Beinahevorfälle analysieren sowie Designs oder Betriebsannahmen ändern, wenn Nachweise Schwäche offenbaren.
Wichtige EinschränkungRedundanz garantiert keine Resilienz, wenn Kopien denselben Fehlermodus, dieselben Credentials, denselben Lieferanten oder denselben Angreiferzugang teilen. Behauptungen brauchen szenariobasierte Tests einschließlich Menschen und Dritter, nicht nur Komponenten-Uptime.