SYSTEM ATLASЗагрузка материала

Монитор дрейфа: инструменты агента

Agent Tooling Drift Monitor

Это повторяемая проверка изменения поведения, данных или конфигурации относительно принятого базового состояния.

Простыми словами

Например, в проекте для «инструменты агента» добавляют проверку «монитор дрейфа»: конфигурация задаёт порог, автоматизация собирает сигнал, а превышение блокирует продвижение либо переводит систему в заранее описанный безопасный режим. Поэтому результат проверяют на данных и отдельной выборке, а не только на впечатляющем примере - иначе модель может выглядеть убедительно и при этом ошибаться на реальных случаях.

Пример от @Vibeclakr

Пример при разработке

Например, для «инструменты агента» задают понятный порог и автоматическую проверку «монитор дрейфа». Если порог нарушен, выпуск останавливают или система переходит в заранее выбранный безопасный режим.

Это редакционный пример применения, а не часть определения или доказательство концепции.

Формальное определение

Для «инструменты агента» это повторяемая проверка изменения поведения, данных или конфигурации относительно принятого базового состояния. Заранее задают метрику дрейфа и порог, после которого правило нужно пересмотреть и способ увидеть результат. Если результат нельзя проверить, правило существует только на бумаге.

Механизм действия

Для «инструменты агента» сначала фиксируют исходное состояние, метрику дрейфа и порог, после которого правило нужно пересмотреть, допустимый порог и действие на случай нарушения. Затем проверяют это в тестах, при выпуске или в работе системы и сохраняют результат.

Пример в работе

Нерабочий подход

Записать «Монитор дрейфа: инструменты агента» в документации и считать работу законченной, не назначив ответственного и не определив, как проверить результат.

Системный подход

Назвать конкретный риск, задать метрику дрейфа и порог, после которого правило нужно пересмотреть, назначить ответственного и пересматривать правило после значимых изменений.

Ограничения

«Монитор дрейфа: инструменты агента» закрывает только один класс риска. Она не заменяет проверку безопасности, корректности данных, отказоустойчивости и пользовательских последствий.

Источник

NIST, «Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile», без даты.

Первоисточник