Простыми словами
Попадание в признаки или процесс обучения информации, которая недоступна в реальном применении и искусственно улучшает оценку качества. Например, рекомендательная модель хорошо выглядит на тесте, но после запуска сталкивается с новыми пользователями и изменившимся поведением. Поэтому результат проверяют на данных и отдельной выборке, а не только на впечатляющем примере - иначе модель может выглядеть убедительно и при этом ошибаться на реальных случаях.
Механизм действия
Сначала проверяют, есть ли исходное условие из определения. Затем смотрят, как оно влияет на условия, ограничения, взаимодействия и наблюдаемые последствия. Если эту связь не удаётся наблюдать, принцип не стоит использовать как готовое объяснение.
Пример в работе
Решение принимают без учета механизма «Data Leakage», оценивая только ближайший эффект.
Перед изменением проверяют, как «Data Leakage» влияет на ограничения, стимулы, зависимости и вторичные последствия.
Ограничения
«Data Leakage» объясняет только часть происходящего в области «AI и машинное обучение». Сам принцип не говорит, насколько сильным будет эффект в вашем случае, и не заменяет измерения. При другом масштабе, среде или временном горизонте результат может отличаться.
Источник
Shachar Kaufman; Saharon Rosset; Claudia Perlich, “Leakage in Data Mining: Formulation, Detection, and Avoidance”, 2012.