先确认评分口径是否被改动,再决定保留旧结论、改写规则还是退出该评分项。升级后分数下降,最常见的不是效果真的变差,而是触发条件、权重分配或统计窗口发生了变化。用同一批历史数据在新旧两套规则下各跑一次,差异就能定位到具体是哪条规则造成的。
升级后的评分差异通常来自三个层面,处理方式完全不同:
只有第一种属于真正的规则变更,后两种属于口径变更。把三者混在一起,就会误判成“工具变差了”。
如果新旧评分只是权重或窗口调整,而业务判断依据没变,可以保留旧结论。前提是你能证明排序没有发生实质变化。做法是取一批历史记录,在新旧规则下分别打分,然后比较排名前若干位的对象是否一致。
假设某批记录在旧规则下排名是A、B、C,新规则下仍然是A、B、C,只是分数从80、75、70变成62、58、55,那么相对顺序没变,原有决策可以继续用。这种情况下退出旧评分项反而会丢掉可比性。
当排序本身发生翻转,就需要改写。典型信号是原本排在后面的对象跃升到前面,或者原本稳定的头部对象掉出前列。这说明新规则捕捉的是不同的特征。
此时的动作是:把翻转的那几条记录单独拿出来,逐条对比新旧规则下各自命中了什么条件。找到那条导致翻转的规则后,再判断它是更贴近真实业务目标,还是引入了噪声。如果更贴近,就按新规则重写判断标准;如果只是噪声,就考虑退出该评分项,改用其他指标。
退出不是放弃工具,而是不再把该评分当作决策依据。适用条件是:新规则的变动无法用业务逻辑解释,或者解释成本高于收益。比如某条规则的调整原因不透明,且反复变动,那么继续依赖它做判断会不断产生返工。
退出的代价是失去历史可比性,所以要先确认是否有替代指标能承担同样的判断功能。如果没有替代,退出后决策会失去参照,这时宁可保留旧结论并标注口径差异,也不要贸然切换。
具体操作是:固定一批历史数据,不改动输入,分别用升级前后的规则各跑一次,导出两次的评分和排序。然后按差异大小排序,优先看差异最大的前几条。对每条差异,记录它在新旧规则下分别命中了哪些条件。
这个动作的结果直接决定下一步:如果差异集中在少数几条规则上,就针对这几条做取舍;如果差异分散、无规律,说明是整体口径变动,应优先确认统计窗口和权重,而不是逐条修规则。无论哪种结果,都要把这次对比的记录留存下来,作为下次升级时的参照基线。