SYSTEM ATLASЗагрузка материала

Failover

Failover

Нагрузка переключается на резервный компонент.

Простыми словами

Перенос обслуживания на резервный компонент после обнаружения неисправности основного. Например, когда основная база недоступна, управляемая процедура переключает трафик на подготовленную реплику и проверяет, что она действительно стала единственным лидером. Поэтому заранее определяют границы ожидания и поведение при отказе - иначе один медленный компонент начинает удерживать ресурсы и распространять проблему дальше.

Пример от @Vibeclakr

Пример при разработке

Когда основная база недоступна, управляемая процедура переключает трафик на подготовленную реплику и проверяет, что она действительно стала единственным лидером.

Это редакционный пример применения, а не часть определения или доказательство концепции.

Механизм действия

Сначала проверяют, есть ли исходное условие из определения. Затем смотрят, как оно влияет на структуру компонентов, потоки данных, ограничения и действия участников. Если эту связь не удаётся наблюдать, принцип не стоит использовать как готовое объяснение.

Пример в работе

Нерабочий подход

Решение принимают без учета механизма «Failover», оценивая только ближайший эффект.

Системный подход

Перед изменением проверяют, как «Failover» влияет на ограничения, стимулы, зависимости и вторичные последствия.

Ограничения

«Failover» объясняет только часть происходящего в области «Надежность и SRE». Сам принцип не говорит, насколько сильным будет эффект в вашем случае, и не заменяет измерения. При другом масштабе, среде или временном горизонте результат может отличаться.

Источник

National Institute of Standards and Technology. Contingency Planning Guide for Federal Information Systems. 2010. NIST SP 800-34 Rev. 1.

Первоисточник