SYSTEM ATLASЗагрузка материала

Single Point of Failure

Single Point of Failure

Один компонент способен остановить всю систему.

Простыми словами

Например, у сайта три web-сервера, но один общий Redis хранит все сессии. Его отказ выкинет пользователей, поэтому резервировать нужно и скрытые общие зависимости. Поэтому заранее определяют границы ожидания и поведение при отказе - иначе один медленный компонент начинает удерживать ресурсы и распространять проблему дальше.

Пример от @Vibeclakr

Пример при разработке

У сайта три web-сервера, но один общий Redis хранит все сессии. Его отказ выкинет пользователей, поэтому резервировать нужно и скрытые общие зависимости.

Это редакционный пример применения, а не часть определения или доказательство концепции.

Механизм действия

Сначала проверяют, есть ли исходное условие из определения. Затем смотрят, как оно влияет на структуру компонентов, потоки данных, ограничения и действия участников. Если эту связь не удаётся наблюдать, принцип не стоит использовать как готовое объяснение.

Пример в работе

Нерабочий подход

Решение принимают без учета механизма «Single Point of Failure», оценивая только ближайший эффект.

Системный подход

Перед изменением проверяют, как «Single Point of Failure» влияет на ограничения, стимулы, зависимости и вторичные последствия.

Ограничения

«Single Point of Failure» объясняет только часть происходящего в области «Надежность и SRE». Сам принцип не говорит, насколько сильным будет эффект в вашем случае, и не заменяет измерения. При другом масштабе, среде или временном горизонте результат может отличаться.

Источник

National Institute of Standards and Technology. Contingency Planning Guide for Federal Information Systems. 2010. NIST SP 800-34 Rev. 1.

Первоисточник