Простыми словами
Представьте сервис под реальной нагрузкой: одна зависимость замедлилась, часть запросов повторилась, а пользователи продолжают ждать ответ. Надёжность зависит не от одного удачного запроса, а от поведения системы при задержках, ошибках и восстановлении. Так система деградирует управляемо и оставляет команде понятный способ увидеть проблему и восстановиться. Поэтому поведение при сбое задают заранее: система должна ограничить ущерб, освободить ресурсы и дать оператору понятный сигнал.
Пример при разработке
Например, для «Оценка влияния инцидента на клиентов» назначают ответственного и добавляют тест или метрику, по которой видно реальный результат.
Это редакционный пример применения, а не часть определения или доказательство концепции.Формальное определение
Определение затронутых пользователей, функций, регионов, продолжительности и тяжести реального воздействия.
Механизм действия
Для «Оценка влияния инцидента на клиентов» команда фиксирует область действия, владельца, проверяемый сигнал и поведение при нарушении условия.
Пример в работе
Повторять термин «Оценка влияния инцидента на клиентов», не объяснив, где он применяется, кто отвечает и по какому признаку видно результат.
Связать «Оценка влияния инцидента на клиентов» с конкретным сценарием, автоматической или ручной проверкой и правилом пересмотра.
Ограничения
«Оценка влияния инцидента на клиентов» решает ограниченную задачу и не заменяет проверку соседних рисков, исходных допущений и последствий для всей системы.
Источник
Google, “Incident Response”, 2018.