Môže byť automatický alebo iniciovaný operátorom. Zamýšľaný výsledok je obnovená alebo pokračujúca služba, ale prijateľné prerušenie, kapacita, stav a správnosť musia byť definované vopred.
Spoľahlivý failover závisí od dôveryhodných signálov zdravia, rozhodovacích pravidiel, pripravenosti pohotovostnej zložky, replikácie stavu, pokrytia závislostí, zmien smerovania alebo mien a prevencie konfliktných aktívnych inštancií. Failback na obnovený primár je oddelená riadená zmena a môže niesť vlastné riziko.
Kľúčové body
Nastaviť logiku spúšťačaDefinovať dôkazy zlyhania, časovanie detekcie a potvrdenia, pravidlá kvóra alebo fencingu, autoritu pre manuálnu akciu a zábrany proti oscilácii alebo falošnému failoveru.
Pokryť závislostiZahrnúť údaje, identitu, kľúče, siete, riadiace roviny, dodávateľov, kapacitu, konfiguráciu, pozorovateľnosť a cesty, ktoré používatelia potrebujú dosiahnuť alternatívnu službu.
Testovať prechodyCvičiť failover a failback pod záťažou a scenármi čiastočného zlyhania, overovať transakcie a konzistenciu údajov, merať ciele obnovy a zaznamenávať degradované funkcie.
Dôležité obmedzenieÚspešný prepnutie komponentu nedokazuje end-to-end kontinuitu. Zdieľané závislosti, zastaraný alebo korumpovaný stav, split-brain prevádzka, nekompatibilná konfigurácia, nedostatočná kapacita alebo útočník prítomný v oboch prostrediach môže spraviť failover neefektívnym alebo nebezpečným.