数据漂移是什么?
模型是用「过去的数据」训练的,但现实不会停在过去。数据漂移(Data Drift),指的就是生产环境里输入数据的分布,慢慢偏离了当初训练数据的样子。比如一个预测「人们周末爱买什么」的模型,训练时靠的是 2019 年的数据;几年后大家的行为变了,模型却还以为世界和以前一样。它有哪些类型?
概念漂移不是数据变了,而是「输入和输出之间的关系」变了。比如「好邮件」的定义,随着垃圾邮件手法变化而改变。
协变量漂移
输入数据的分布变了,比如用户年龄结构变了,但规律本身没变。
标签漂移
要预测的目标本身的分布变了,比如某类商品的销量占比变了。
为什么会发生?
用户行为会变、季节会变、政策会变、竞品会变——这些都会让「现在」的数据长得和「训练时」不一样。越贴近真实世界的模型,越容易被漂移影响。怎么发现和处理?
持续对比分布用统计方法,定期比较生产数据和训练数据的分布,偏差一大就报警。
及时重训
漂移确认后,用新数据重新训练,让模型跟上时代。
加监控
把漂移检测纳入模型监控,让它成为自动化的「预警系统」。
一句话记住:数据漂移就是「世界变了,模型没跟上」。检测它、重训它,是让 AI 长期靠谱的关键。
评论