Простыми словами
Представьте сервис под реальной нагрузкой: одна зависимость замедлилась, часть запросов повторилась, а пользователи продолжают ждать ответ. Надёжность зависит не от одного удачного запроса, а от поведения системы при задержках, ошибках и восстановлении. Так система деградирует управляемо и оставляет команде понятный способ увидеть проблему и восстановиться. Поэтому поведение при сбое задают заранее: система должна ограничить ущерб, освободить ресурсы и дать оператору понятный сигнал.
Пример при разработке
В проекте команда фиксирует практику «Проверка эксплуатационной готовности» как отдельное правило, добавляет автоматическую проверку и наблюдаемый критерий результата.
Это редакционный пример применения, а не часть определения или доказательство концепции.Формальное определение
До запуска проверяются наблюдаемость, ёмкость, зависимости, откат, дежурство и известные режимы отказа.
Механизм действия
Для «Проверка эксплуатационной готовности» команда задаёт явные границы, проверяемый контракт и сигнал, по которому видно соблюдение или нарушение правила.
Пример в работе
Использовать «Проверка эксплуатационной готовности» как термин без владельца, критерия и проверки реального поведения.
Связать «Проверка эксплуатационной готовности» с конкретным риском, тестом или метрикой и пересматривать правило при изменении контекста.
Ограничения
Практика «Проверка эксплуатационной готовности» решает ограниченную задачу и не заменяет анализ всей системы, проверку исходных допущений и измерение побочных эффектов.
Источник
Google, “Site Reliability Engineering”, 2016.