Простыми словами
Например, в проекте для «конвейер данных» добавляют проверку «тест восстановления»: конфигурация задаёт порог, автоматизация собирает сигнал, а превышение блокирует продвижение либо переводит систему в заранее описанный безопасный режим. Поэтому заранее определяют правила чтения, записи и восстановления - иначе параллельные операции могут оставить данные в состоянии, которого бизнес не ожидал.
Пример при разработке
Например, в случае с «конвейер данных» регулярно запускают восстановление из резервной точки. После запуска измеряют, сколько данных потеряно, сколько заняло восстановление и прошла ли проверка целостности. Если пределы нарушены, выпуск или эксплуатационный процесс останавливают до разбирательства.
Это редакционный пример применения, а не часть определения или доказательство концепции.Формальное определение
Тест восстановления «конвейер данных» проверяет, можно ли вернуть данные и обработку из резервной точки. До теста задают RPO — сколько последних данных допустимо потерять, RTO — сколько времени может занять восстановление, и способ проверить целостность данных.
Механизм действия
Сначала фиксируют исходное состояние и два предела: RPO и RTO. Затем имитируют сбой, восстанавливают «конвейер данных», проверяют данные и измеряют фактическое время. Результат сохраняют, чтобы видеть, соответствует ли восстановление заявленным требованиям.
Пример в работе
Ограничиться фразой «у нас есть резервные копии» и ни разу не проверить, что после сбоя действительно вернутся данные и работа «конвейер данных».
Регулярно проверять восстановление «конвейер данных», измерять фактические RPO и RTO, проверять целостность данных и заранее назначить ответственного за отклонения.
Ограничения
Такой тест проверяет восстановление после конкретного класса сбоев. Он не заменяет проверки безопасности, корректности данных, отказоустойчивости и пользовательских сценариев.
Источник
NIST, «NIST Big Data Interoperability Framework: Reference Architecture», без даты.