把人工判断项从自动评分里“摘出来”,而不是让评分去覆盖它。做法是:先明确哪些结论必须由人负责,再把这些结论改成可核对的事实项,自动评分只负责筛出“需要人看”的候选,不负责给结论定级。这样做的直接结果是:评分仍然能用来排序和分派,但它不再替人做最终判断。
不是所有需要人看的项目都真的需要人。判断标准可以落在“分歧是否可核对”上:如果两个角色对同一事实的理解不同,但差异能落到一个具体页面、一段文字或一个字段上,那它适合转成核对项;如果差异来自对优先级、风险或意图的不同看法,那它只能由人决策,评分最多提供参考。
一个可操作的区分方法是看结论能否被证伪。例如“这个标题是否覆盖了目标意图”可以被证伪,因为可以指出页面里哪句话缺失或偏离;“这个页面值不值得优先处理”不能只靠页面内容证伪,它依赖资源、排期和业务目标。前者可以保留为人工核对项,后者应明确标为人工决策项,不进入评分排序。
面对一个已经存在的人工判断项,有三种处理方式,各自成立的条件不同。
这三种取舍不要求同时使用。多数情况下,先把最容易产生分歧的少数项目改写成可核对事实项,保留真正需要决策的部分,比全部保留或全部交给评分更省力。
假设有两个角色对同一批页面是否“内容完整”有不同理解。一个人认为缺少结论段就是不完整,另一个人认为只要有数据支撑就算完整。这个分歧无法靠评分解决,因为评分不知道哪个定义被采用。
可以做的动作是:把“内容完整”拆成几个可勾选的事实项,例如是否包含结论段、是否标注数据来源、是否给出适用条件。每个事实项用“有/没有”或“能指出具体位置/不能”来记录,而不是用分数高低。这样,评分可以只负责找出缺少任一事实项的页面,人再判断这些缺失是否真的构成问题。这个动作的结果是:分歧从“谁对谁错”变成“哪一项缺失”,下一步就能决定是补内容还是调整定义。
需要说明的是,这个例子是假设的,用来展示拆分方法,不代表任何具体工具的现有功能。实际使用中,哪些事实项值得拆、拆到什么粒度,需要结合具体任务核对。
第一条边界是评分不承担结论。评分可以给页面排序、分组或标记异常,但“这个页面是否合格”“这个结论是否可以采用”必须由人签字或明确记录。如果评分结果被直接当成结论使用,人工判断项就已经被替代了。
第二条边界是保留对照记录。每隔一段时间,把评分结果与人工结论做一次对照,看两者在哪些项目上一致、哪些不一致。不一致的项目就是需要重新审视的对象:可能是评分规则需要调整,也可能是人工判断项本身需要改写或退出。没有对照记录,就无法判断评分是否在悄悄替代人工判断。
这两条边界不依赖具体工具的界面或入口。无论使用什么工具,只要评分结果不直接作为结论、并且有定期对照,人工判断项就不容易被自动评分替代。
如果一个人工判断项连续多次与评分结果一致,且没有出现需要人推翻评分的情况,就可以考虑把它降级为抽查项。退出的前提是有记录可查,而不是凭印象觉得“应该没问题”。
反之,如果评分结果与人工结论频繁不一致,且不一致的原因无法通过改写事实项来消除,那就应该保留人工判断,并把评分限制在筛选候选的范围内。此时继续试图让评分覆盖全部判断,只会把分歧藏起来,而不是解决它。
最终要守住的是:评分负责缩小范围,人负责给出结论。范围缩得越小,人需要看的就越少,但结论仍然由人给出。具体到某个工具当前支持哪些字段、哪些导出方式、哪些筛选条件,需要以实际界面和说明为准,不能凭通用方法推断。