Простыми словами
Перенос обслуживания на резервный компонент после обнаружения неисправности основного. Например, когда основная база недоступна, управляемая процедура переключает трафик на подготовленную реплику и проверяет, что она действительно стала единственным лидером. Поэтому заранее определяют границы ожидания и поведение при отказе - иначе один медленный компонент начинает удерживать ресурсы и распространять проблему дальше.
Пример при разработке
Когда основная база недоступна, управляемая процедура переключает трафик на подготовленную реплику и проверяет, что она действительно стала единственным лидером.
Это редакционный пример применения, а не часть определения или доказательство концепции.Механизм действия
Сначала проверяют, есть ли исходное условие из определения. Затем смотрят, как оно влияет на структуру компонентов, потоки данных, ограничения и действия участников. Если эту связь не удаётся наблюдать, принцип не стоит использовать как готовое объяснение.
Пример в работе
Решение принимают без учета механизма «Failover», оценивая только ближайший эффект.
Перед изменением проверяют, как «Failover» влияет на ограничения, стимулы, зависимости и вторичные последствия.
Ограничения
«Failover» объясняет только часть происходящего в области «Надежность и SRE». Сам принцип не говорит, насколько сильным будет эффект в вашем случае, и не заменяет измерения. При другом масштабе, среде или временном горизонте результат может отличаться.
Источник
National Institute of Standards and Technology. Contingency Planning Guide for Federal Information Systems. 2010. NIST SP 800-34 Rev. 1.