SYSTEM ATLASЗагрузка материала

Monitoring the Means

Monitoring the Means

Команда следит за внутренними ресурсами, но не за пользовательскими симптомами.

Простыми словами

Например, команда замечает симптомы «Monitoring the Means», но лечит каждый случай отдельно. Более устойчивый вариант — команда устраняет механизм «Monitoring the Means» через изменение границ, стимулов или ответственности. Поэтому поведение при сбое задают заранее: система должна ограничить ущерб, освободить ресурсы и дать оператору понятный сигнал.

Пример от @Vibeclakr

Пример при разработке

График CPU полезен для диагностики, но сам по себе не показывает, может ли пользователь оформить заказ. Средства мониторят вместе с пользовательским результатом.

Это редакционный пример применения, а не часть определения или доказательство концепции.

Механизм действия

Сначала проверяют, есть ли исходное условие из определения. Затем смотрят, как оно влияет на структуру компонентов, потоки данных, ограничения и действия участников. Если эту связь не удаётся наблюдать, принцип не стоит использовать как готовое объяснение.

Пример в работе

Нерабочий подход

Исправлять отдельные проявления «Monitoring the Means» по одному, не проверяя, нет ли у них общей причины.

Системный подход

Если «Monitoring the Means» действительно объясняет проблему, менять не отдельный симптом, а сам механизм — например границы, стимулы или распределение ответственности.

Ограничения

«Monitoring the Means» объясняет только часть происходящего в области «Надежность и SRE». Сам принцип не говорит, насколько сильным будет эффект в вашем случае, и не заменяет измерения. При другом масштабе, среде или временном горизонте результат может отличаться.

Источник

Betsy Beyer, Chris Jones, Jennifer Petoff, Niall Richard Murphy. Site Reliability Engineering: Monitoring Distributed Systems. 2016. ISBN 9781491929124.

Первоисточник