SYSTEM ATLASЗагрузка материала

Бюджет отказов: управление инцидентом

Incident Command Failure Budget

Для «управление инцидентом» это допустимый объём отказов для конкретного механизма или периода, после исчерпания которого изменения ограничиваются.

Простыми словами

Команда заранее определяет, как «бюджет отказов» должен работать для «управление инцидентом», а затем проверяет это до выпуска и в аварийном сценарии. Так правило проверяется на деле, а не остаётся только в документации.

Пример от @Vibeclakr

Пример при разработке

В проекте практика «Бюджет отказов: управление инцидентом» оформляется как проверяемое правило: автоматический тест или метрика фиксирует соблюдение границы, а нарушение блокирует выпуск либо включает безопасный режим.

Это редакционный пример применения, а не часть определения или доказательство концепции.

Формальное определение

Для «управление инцидентом» это допустимый объём отказов для конкретного механизма или периода, после исчерпания которого изменения ограничиваются.

Механизм действия

Для «Бюджет отказов: управление инцидентом» назначают ответственного, задают границы и понятный признак нарушения. В тесты, выпуск или эксплуатационный контроль.

Пример в работе

Нерабочий подход

Повторять термин «Бюджет отказов: управление инцидентом», не объяснив, где он применяется, кто отвечает и по какому признаку видно результат.

Системный подход

Для «Бюджет отказов: управление инцидентом» назвать конкретный риск, добавить проверку и заранее определить, когда правило нужно пересмотреть.

Ограничения

Практика «Бюджет отказов: управление инцидентом» закрывает один конкретный риск и не заменяет проверку соседних отказов, безопасности, данных и пользовательских последствий.

Источник

Google, «Site Reliability Engineering», 2016.

Первоисточник