结论先说:不要试图让自动评分变准,而要把它降级为“线索生成器”。把评分只用于排序待办事项,最终结论必须由人工依据可核查证据写出。做不到这一点时,宁可退出该评分模块,改用原始数据加人工抽样。
常规做法失效,往往不是因为评分算法差,而是因为流程里缺少一个独立于评分的判断记录。你可以做一个简单验证:随机抽十条被自动评分标为高优先和十条标为低优先的条目,让同一个人在不看评分的情况下写出处理理由。如果两组的理由高度重合,说明评分只是复述了人工本来就能看出的东西,此时保留它意义不大;如果高分组里有明显不该优先处理的条目,说明评分在替代判断,需要改写流程。
这里要区分三种现象,它们的原因不同:评分长期不变,可能是数据源没有更新;评分波动但没有对应证据变化,可能是权重调整;评分与人工结论系统性相反,才是判断被替代的典型信号。前两种先查数据链路,第三种才进入下面的取舍。
如果你决定保留自动评分,必须给它划一条硬边界:评分只决定“先看哪一条”,不决定“这条要不要改”。具体动作是在处理记录里增加两个字段,一个是评分值,一个是人工判断结论,两者分开存储。当人工结论与评分冲突时,以人工结论为准,并把冲突原因写进备注。
这样做的直接结果是,一段时间后你能统计出冲突集中在哪类条目上。若冲突集中在少数固定类型,说明可以针对这些类型单独设规则,评分继续保留;若冲突分散在所有类型上,说明评分没有区分能力,应考虑改写或退出。这一步的价值不在于提高评分准确率,而在于让评分不再拥有最终裁决权。
改写不是调权重,而是把被漏掉的条件显式化。假设一个场景:某批页面的人工判断依赖“内容是否覆盖了用户实际会问的后续问题”,而自动评分只看标题长度和关键词出现位置。此时合理的改写是增加一个可人工勾选的检查项,而不是去猜评分公式里该加多少分。
改写成立的条件是,你能用一句话说清漏掉的是什么,并且这个条件可以被稳定地人工判断。如果说不清,或者不同人判断结果差异很大,改写只会把混乱从评分转移到人工环节,此时应直接退出该评分模块。
退出不等于放弃工具,而是停用评分这一项,保留原始数据导出和人工抽样。判断是否该退出的依据是协调成本:如果每次处理前都要先解释为什么不信评分,事后又要为冲突写说明,这些时间已经超过评分帮你节省的筛选时间,就该退出。
退出后的实际动作是建立一个固定抽样比例的人工检查清单,按条目类型而不是按评分高低来抽。这样做的结果是判断标准重新回到人手里,代价是筛选效率下降,但结论可追溯。是否接受这个代价,取决于你对结论可解释性的要求有多高。
需要提醒的是,请求量、抓取量或某项统计归零,并不能单独证明你的处理正确,它也可能是数据延迟、采集范围变化或过滤条件改动造成的。把这类现象当作线索而不是结论,才不会让自动评分以另一种形式重新接管判断。