Il peut être automatique ou déclenché par un opérateur. Le résultat visé est un service restauré ou continu, mais l'interruption, la capacité, l'état et l'exactitude acceptables doivent être définis à l'avance.
Un failover fiable dépend de signaux de santé dignes de confiance, de règles de décision, de la disponibilité des systèmes de secours, de la réplication d'état, de la couverture des dépendances, des changements de routage ou de nommage, et de la prévention d'instances actives conflictuelles. Le failback vers le primaire rétabli est un changement contrôlé distinct et peut porter son propre risque.
Points clés
Définir la logique de déclenchementDéfinir les preuves de défaillance, les délais de détection et de confirmation, les règles de quorum ou de fencing, l'autorité pour l'action manuelle et les protections contre l'oscillation ou les basculements intempestifs.
Couvrir les dépendancesInclure les données, l'identité, les clés, les réseaux, les plans de contrôle, les fournisseurs, la capacité, la configuration, l'observabilité et les chemins dont les utilisateurs ont besoin pour atteindre le service alternatif.
Tester les transitionsExercer le failover et le failback sous charge et dans des scénarios de défaillance partielle, vérifier les transactions et la cohérence des données, mesurer les objectifs de reprise et consigner les fonctions dégradées.
Limite importanteUn basculement de composant réussi ne prouve pas la continuité de bout en bout. Des dépendances partagées, un état périmé ou corrompu, un fonctionnement en split-brain, une configuration incompatible, une capacité insuffisante ou un attaquant présent dans les deux environnements peuvent rendre le failover inefficace ou dangereux.