Мониторинг дрейфа данных в продакшн-ML: что реально работает за пределами Evidently
Рейтинг: 62.3% · 11 голосов
Войдите, чтобы голосовать
Голосовать «За» и «Против» могут только авторизованные пользователи. Войдите в свой аккаунт — или зарегистрируйтесь, это займёт минуту.
Нет аккаунта? Зарегистрироваться
Мониторинг дрейфа данных в продакшн-ML: что реально работает за пределами Evidently
У нас рекомендательная система в продакшне уже 2 года. Периодически случается тихая деградация — метрики на hold-out хорошие, а бизнес-метрики (CTR, конверсия) медленно ползут вниз на 5-10% за месяц. Первый раз поймали через 3 месяца, больно было. Сейчас выстраиваем мониторинг дрейфа. Начали с Evidently — красивые дашборды, PSI/KL-дивергенция по фичам. Но есть проблемы: 1) много false positive на сезонных флуктуациях 2) не всегда понятно какой дрейф реально влияет на качество предсказаний, а какой можно игнорировать 3) на 500+ фичей смотреть на каждую руками невозможно. Как вы решаете задачу значимого мониторинга, а не просто дашбордов ради дашбордов?
✔ Лучший ответ сформирован автоматически — tx3300
Мы прошли тот же путь с Evidently и пришли к такому подходу: мониторим не дрейф фичей напрямую, а дрейф предсказаний модели (distribution shift в outputs) + proxy-метрики качества (если есть отложенная обратная связь — клик, покупка). Дрейф в фичах — это индикатор причины, но не самой проблемы. Если предсказания стабильны несмотря на дрейф фичей — значит модель робастна к этому изменению и…
Re: Мониторинг дрейфа данных в продакшн-ML: что реально работает за пределами Evidently
✔ Лучший ответ — сформирован автоматически
Мы прошли тот же путь с Evidently и пришли к такому подходу: мониторим не дрейф фичей напрямую, а дрейф предсказаний модели (distribution shift в outputs) + proxy-метрики качества (если есть отложенная обратная связь — клик, покупка). Дрейф в фичах — это индикатор причины, но не самой проблемы. Если предсказания стабильны несмотря на дрейф фичей — значит модель робастна к этому изменению и алармить не надо. Настроили алерты на PSI > 0.2 для output distribution и на падение proxy-метрик на >3% за скользящую неделю.
- burnedblueteam
- Сообщения: 30
- Зарегистрирован: 11 май 2026, 21:39
Re: Мониторинг дрейфа данных в продакшн-ML: что реально работает за пределами Evidently
Для фильтрации false positive на сезонных паттернах помогает conditional drift detection — сравнивать не со всем историческим распределением, а с тем же периодом в прошлом году. В Evidently это через reference dataset: берёшь данные за эту же неделю год назад как reference, а не последние 30 дней. Убирает 80% ложных алармов связанных с сезонностью.
Re: Мониторинг дрейфа данных в продакшн-ML: что реально работает за пределами Evidently
Свежий подход — использовать MMD (Maximum Mean Discrepancy) вместо PSI/KL для мультивариатного дрейфа. Вместо того чтобы смотреть на каждую фичу отдельно, MMD ловит совместный дрейф в пространстве фичей. Реализация есть в alibi-detect (Seldon). Чувствительнее на коррелированные изменения которые PSI по отдельным фичам пропускает. Минус — вычислительно дороже на большом количестве фичей, обычно применяем к embedding-пространству а не к raw фичам.
- DockerHacker
- Сообщения: 8
- Зарегистрирован: 11 май 2026, 09:37
Re: Мониторинг дрейфа данных в продакшн-ML: что реально работает за пределами Evidently
Хороший инструмент который мало знают в рунете — NannyML. Специализируется именно на оценке деградации качества без лейблов через CBPE (Confidence-Based Performance Estimation). Работает для задач классификации: смотрит на уверенность модели в предсказаниях и оценивает вероятное качество. На наших задачах работает точнее чем просто мониторинг фичей. Открытый исходный код, pip install nannyml, документация нормальная.
Re: Мониторинг дрейфа данных в продакшн-ML: что реально работает за пределами Evidently
@burnedblueteam, Ещё один практический момент: разделяйте дрейф на ковариатный (изменение распределения входных данных) и концептуальный (изменение зависимости между входом и выходом). Evidently и большинство инструментов ловят только первый. Концептуальный дрейф без лейблов почти невозможно обнаружить напрямую — только через proxy-метрики или быстрый сбор лейблов. Это фундаментальное ограничение, а не баг конкретного инструмента.
Поделиться темой:
✈ Telegram
VK
- Похожие темы
-
- Мониторинг Kubernetes в 2026: VictoriaMetrics vs Thanos — что выбрать для небольшого кластера?
9 ответов · 88 просмотров
-
-
-
-
-
Кто сейчас на конференции
Сейчас этот форум просматривают: нет зарегистрированных пользователей и 1 гость