SYSTEM ATLASЗагрузка материала

Alignment Problem

AI Alignment

Поведение AI должно соответствовать человеческим целям и ограничениям.

Простыми словами

Например, рекомендательная модель хорошо выглядит на тесте, но после запуска сталкивается с новыми пользователями и изменившимся поведением. Поэтому результат проверяют на данных и отдельной выборке, а не только на впечатляющем примере - иначе модель может выглядеть убедительно и при этом ошибаться на реальных случаях.

Механизм действия

Сначала проверяют, есть ли исходное условие из определения. Затем смотрят, как оно влияет на условия, ограничения, взаимодействия и наблюдаемые последствия. Если эту связь не удаётся наблюдать, принцип не стоит использовать как готовое объяснение.

Пример в работе

Нерабочий подход

Решение принимают без учета механизма «Alignment Problem», оценивая только ближайший эффект.

Системный подход

Перед изменением проверяют, как «Alignment Problem» влияет на ограничения, стимулы, зависимости и вторичные последствия.

Ограничения

«Alignment Problem» объясняет только часть происходящего в области «AI и машинное обучение». Сам принцип не говорит, насколько сильным будет эффект в вашем случае, и не заменяет измерения. При другом масштабе, среде или временном горизонте результат может отличаться.

Источник

Stuart Russell, Daniel Dewey, Max Tegmark. Research Priorities for Robust and Beneficial Artificial Intelligence. 2015. DOI 10.1609/aimag.v36i4.2577.

Первоисточник