跳到主内容
快讯直播
AI智模界
AI 词典

协变量偏移:输入变了,规律没变

一句话定义:协变量偏移(Covariate Shift)是指模型训练时见到的输入数据分布,和上线后实际遇到的输入分布不一致,但“同样的输入对应什么结果”这条规律本身没有变。

这里说的“输入”就是特征(features),统计上记作 X;“结果”就是标签(label),记作 y。协变量偏移指的是 P(X) 变了,而 P(y|X) 没变。

打个比方:一位在南方开了十年诊所的医生,看的都是湿热体质、以米饭为主食的病人。某天他搬到北方坐诊,来的病人饮食、气候、作息全变了。但他脑子里那套“什么症状对应什么病”的诊断逻辑其实还是对的——只是来的人换了。这就是协变量偏移:规则没坏,是客流变了。

再举个互联网的例子。一个风控模型用一线城市用户的交易数据训练,跑得很好。业务下沉到县域市场后,误杀率突然升高。你去看那些被误判的样本,会发现“同样的行为,该不该拦”的判断标准并没有变,变的是人群本身的行为习惯、设备型号、活跃时段。模型没见过这类输入,于是把“陌生”当成了“可疑”。

它和相邻概念的区别

概念什么变了什么没变直观说法
协变量偏移 Covariate ShiftP(X)P(y\X)来的人变了,规矩没变
概念漂移 Concept DriftP(y\X)——规矩本身变了
标签偏移 Label ShiftP(y)P(X\y)各类结果的比例变了

举个例子区分前两个:如果疫情期间“出差申请”这类样本大量出现,这是协变量偏移;如果公司同时改了报销规则,让同样的出差申请从“通过”变成“驳回”,那是概念漂移。样本选择偏差(Sample Selection Bias)常常是协变量偏移的成因之一——训练数据不是随机采来的,本身就偏了。

对从业者的实际意义

协变量偏移是最常见、也最容易被忽视的一类偏移。因为模型离线指标不会报警:验证集和训练集同源,分数照样漂亮。等线上出问题,往往已经积累了业务损失。

几个可操作的点:

  • 监控输入,而不是只监控效果。盯住关键特征的分布变化(分位数、占比、人群构成),比等准确率下跌更早发现问题。
  • 考虑重要性加权(importance weighting)。按训练分布与目标分布的概率密度比对样本加权,让模型更关注“未来会出现、但过去少见”的那类输入。注意权重方差过大会让训练不稳,通常需要截断。
  • 补一小批新分布的数据做校准或微调,性价比往往高于全量重训。
  • 别急着怪算法。效果下滑时先问一句:是模型变笨了,还是我们面前的人换了?

对普通人来说,这条概念也有用。当一个工具换个城市、换个行业、换个人群就“水土不服”时,多半不是它坏了,而是它没见过这个世界的那一面。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。