SYSTEM ATLASЗагрузка материала

Мониторинг белого ящика

White-Box Monitoring

Использует внутренние метрики компонентов и процессов.

Простыми словами

Например, сервис публикует длину очереди, число занятых соединений и ошибки базы. Внутренние метрики объясняют причину после того, как пользовательский тест заметил симптом. Поэтому заранее определяют границы ожидания и поведение при отказе - иначе один медленный компонент начинает удерживать ресурсы и распространять проблему дальше.

Пример от @Vibeclakr

Пример при разработке

Сервис публикует длину очереди, число занятых соединений и ошибки базы. Внутренние метрики объясняют причину после того, как пользовательский тест заметил симптом.

Это редакционный пример применения, а не часть определения или доказательство концепции.

Механизм действия

Сначала проверяют, есть ли исходное условие из определения. Затем смотрят, как оно влияет на структуру компонентов, потоки данных, ограничения и действия участников. Если эту связь не удаётся наблюдать, принцип не стоит использовать как готовое объяснение.

Пример в работе

Нерабочий подход

Использовать решение без учета его условий применимости и компромиссов.

Системный подход

Сопоставить проблему, контекст и ограничения с назначением концепции.

Ограничения

«Мониторинг белого ящика» объясняет только часть происходящего в области «Надежность». Сам принцип не говорит, насколько сильным будет эффект в вашем случае, и не заменяет измерения. При другом масштабе, среде или временном горизонте результат может отличаться.

Источник

Betsy Beyer, Chris Jones, Jennifer Petoff, Niall Richard Murphy. Site Reliability Engineering: Monitoring Distributed Systems. 2016. ISBN 9781491929124.

Первоисточник