SYSTEM ATLASЗагрузка материала

MTTR — среднее время восстановления

Mean Time to Recovery (MTTR)

Показывает, насколько быстро система возвращается в рабочее состояние.

Простыми словами

Представьте лифт, который иногда ломается: для жильцов важно не только число поломок, но и сколько часов они ждут ремонта. MTTR показывает среднее время возвращения системы в рабочее состояние, поэтому помогает оценивать готовность команды к инцидентам.

Пример от @Vibeclakr

Пример при разработке

После падения API проходит в среднем 12 минут до восстановления. Сократить MTTR можно быстрым обнаружением, понятным runbook и безопасным откатом.

Это редакционный пример применения, а не часть определения или доказательство концепции.

Механизм действия

Сначала проверяют, есть ли исходное условие из определения. Затем смотрят, как оно влияет на структуру компонентов, потоки данных, ограничения и действия участников. Если эту связь не удаётся наблюдать, принцип не стоит использовать как готовое объяснение.

Пример в работе

Нерабочий подход

Применять локальное решение без проверки контекста, ограничений и вторичных последствий.

Системный подход

Сначала определить механизм, затем выбрать минимальное изменение и измерить результат.

Ограничения

«MTTR — среднее время восстановления» объясняет только часть происходящего в области «Надежность и SRE». Сам принцип не говорит, насколько сильным будет эффект в вашем случае, и не заменяет измерения. При другом масштабе, среде или временном горизонте результат может отличаться.

Источник

National Institute of Standards and Technology. Contingency Planning Guide for Federal Information Systems. 2010. NIST SP 800-34 Rev. 1.

Первоисточник