КАТЕГОРИЯ
Надежность
23 материалов
BackpressureПолучатель должен иметь возможность замедлять или ограничивать входящий поток при перегрузке.Circuit BreakerПосле серии сбоев вызовы к зависимому сервису временно прекращаются, чтобы не усиливать отказ.Bulkhead PatternРесурсы изолируются по секциям, чтобы отказ одной части не исчерпал ресурсы остальных.Плавная деградацияПри отказе части системы базовая ценность должна сохраняться, а функции отключаться постепенно.Теория нормальных аварийВ сложных тесно связанных системах некоторые аварии являются неизбежным свойством структуры.Экспоненциальная задержка и jitterПовторы должны разноситься во времени, чтобы не усиливать сбой.Радиус пораженияОшибка должна затронуть минимально возможную часть системы.Модель швейцарского сыраКатастрофа возникает при совпадении слабостей нескольких защитных слоев.Chaos EngineeringНадежность проверяется контролируемыми сбоями, а не предположениями.Мониторинг через health endpointПредоставляет стандартизированную проверку состояния сервиса.Паттерн карантинаИзолирует подозрительные или ошибочные элементы до ручной проверки.Планировщик-агент-наблюдательКоординирует длительные шаги, отслеживает прогресс и восстанавливает сбои.Политика бюджета ошибокОпределяет действия команды при расходовании бюджета надежности.Скорость сгорания бюджета ошибокПоказывает, насколько быстро сервис расходует допустимый бюджет ошибок.Многооконный алерт по burn rateОбъединяет быстрые и медленные окна для точного SLO-алертинга.Бюджет ручного трудаОграничивает долю повторяемой операционной работы.Проверка готовности к эксплуатацииПроверяет сервис перед передачей в промышленную эксплуатацию.Система командования инцидентомРазделяет роли управления, коммуникации и технического реагирования.Планирование мощностиСопоставляет прогноз нагрузки, запас и стоимость ресурсов.Управляемая перегрузкаСохраняет приемлемое поведение при превышении расчетной нагрузки.Мониторинг черного ящикаПроверяет систему с точки зрения внешнего пользователя.Мониторинг белого ящикаИспользует внутренние метрики компонентов и процессов.Алертинг по симптомамОповещает о пользовательском ущербе, а не о каждом внутреннем отклонении.