SYSTEM ATLASЗагрузка материала

Error Budget

Error Budget

Допустимая ненадежность балансирует скорость изменений и стабильность.

Простыми словами

Например, при SLO 99,9% у сервиса есть около 43 минут недоступности в месяц. На практике принцип полезен, когда решение в области «Мониторинг» выглядит локальным, но меняет поведение всей системы. Поэтому поведение при сбое задают заранее: система должна ограничить ущерб, освободить ресурсы и дать оператору понятный сигнал.

Пример от @Vibeclakr

Пример при разработке

При SLO 99,9% у сервиса есть около 43 минут недоступности в месяц. Если бюджет почти исчерпан, рискованный релиз откладывают и устраняют причины сбоев.

Это редакционный пример применения, а не часть определения или доказательство концепции.

Механизм действия

Сначала проверяют, есть ли исходное условие из определения. Затем смотрят, как оно влияет на структуру компонентов, потоки данных, ограничения и действия участников. Если эту связь не удаётся наблюдать, принцип не стоит использовать как готовое объяснение.

Пример в работе

Нерабочий подход

Решение принимают без учета механизма «Error Budget», оценивая только ближайший эффект.

Системный подход

Перед изменением проверяют, как «Error Budget» влияет на ограничения, стимулы, зависимости и вторичные последствия.

Ограничения

«Error Budget» объясняет только часть происходящего в области «Надежность и SRE». Сам принцип не говорит, насколько сильным будет эффект в вашем случае, и не заменяет измерения. При другом масштабе, среде или временном горизонте результат может отличаться.

Источник

Google SRE. Example Error Budget Policy. 2018.

Первоисточник