SYSTEM ATLASЗагрузка материала

Защита от шторма: управление инцидентом

Incident Command Storm Protection

Для «управление инцидентом» это ограничение лавинообразного роста повторов, оповещений или управляющих действий при массовом отказе.

Простыми словами

Команда заранее определяет, как «защита от шторма» должен работать для «управление инцидентом», а затем проверяет это до выпуска и в аварийном сценарии. Так правило проверяется на деле, а не остаётся только в документации.

Пример от @Vibeclakr

Пример при разработке

В проекте практика «Защита от шторма: управление инцидентом» оформляется как проверяемое правило: автоматический тест или метрика фиксирует соблюдение границы, а нарушение блокирует выпуск либо включает безопасный режим.

Это редакционный пример применения, а не часть определения или доказательство концепции.

Формальное определение

Для «управление инцидентом» это ограничение лавинообразного роста повторов, оповещений или управляющих действий при массовом отказе.

Механизм действия

Для «Защита от шторма: управление инцидентом» назначают ответственного, задают границы и понятный признак нарушения. В тесты, выпуск или эксплуатационный контроль.

Пример в работе

Нерабочий подход

Повторять термин «Защита от шторма: управление инцидентом», не объяснив, где он применяется, кто отвечает и по какому признаку видно результат.

Системный подход

Для «Защита от шторма: управление инцидентом» назвать конкретный риск, добавить проверку и заранее определить, когда правило нужно пересмотреть.

Ограничения

Практика «Защита от шторма: управление инцидентом» закрывает один конкретный риск и не заменяет проверку соседних отказов, безопасности, данных и пользовательских последствий.

Источник

Google, «Site Reliability Engineering», 2016.

Первоисточник