核心做法是把“评分”降级为线索,把“人工判断点”写成可核对的项目:每个项目都包含判断对象、证据来源、分歧点、处置动作和复核触发条件。这样自动评分只负责筛选与排序,最终结论由可追溯的人工记录产生,而不是由分数直接决定。
自动评分擅长处理规则明确、可重复、可枚举的项目,例如字段是否缺失、链接是否可达、结构化数据能否解析、页面是否返回预期状态码。人工判断适合处理语义、意图、上下文和取舍类项目,例如同一页面是否真正满足搜索意图、两处内容是否构成重复、某个改动是否值得保留。
把读者手中的一份页面清单或工具导出结果摊开,逐行标注判断类型。可以用一个简单假设说明:假设一份导出表有100行,其中60行是“字段为空”“链接返回错误”这类可枚举问题,40行是“内容是否偏题”“标题是否夸大”这类语义问题。前60行可以交给自动评分排序,后40行必须进入人工判断队列。这个划分动作的结果,直接决定下一步要不要为语义项目设计核查表,而不是继续调评分阈值。
多个角色对同一事实理解不同时,常见分歧是“这个页面算不算合格”。此时不要争论谁的评分更高,而是把分歧拆成可核对的项目。每个项目至少写清四件事:判断对象是什么、依据哪份证据、分歧点具体在哪一句或哪一处、由谁在什么条件下复核。
这样做的实际效果是:分歧从“分数高低”变成“某一项证据是否成立”。只要证据可核对,自动评分就不再是裁判,而只是把需要看的项目排到前面。
人工判断不能只靠一次拍板,否则时间一长又会被自动评分悄悄替代。更稳妥的方式是为每个判断项设置明确的复核触发条件,例如页面主要意图发生变化、目标查询词明显偏移、同一模板批量改动、多个角色再次出现分歧,或自动评分与人工结论持续不一致。
触发条件要写成可观察的现象,而不是模糊的“感觉不对”。例如“同一批页面中有超过三成被人工改判”就是一个可观察信号,说明自动评分的口径可能已经偏离当前任务,需要重新校准判断标准。这里要注意,改判比例上升本身不能单独证明评分错误,也可能是任务范围变了、样本构成变了或人工标准变严了,需要结合具体项目逐条核对。
以读者手中的一份工具导出表为例,可以按以下顺序处理:
这个流程的关键动作是“把结论字段与评分字段分开保存”。一旦分开,后续复核就有据可查;如果不分开,分数会覆盖判断过程,人工判断就会逐步退化成对分数的解释。
如果判断对象可以枚举、规则稳定、争议成本低,优先用自动评分提高效率;如果判断对象涉及语义、意图、上下文或跨角色取舍,就必须保留人工判断项,并把它写成可核对、可复核的项目。两种方式成立的条件不同,不应互相替代。真正需要防止的,不是使用自动评分,而是让自动评分在没有证据链的情况下替人做最终决定。