先把结论说清楚:自动评分只能替代可重复、可解释、可回溯的那部分判断;一旦项目的取舍依赖语境、意图或业务后果,就必须把人工判断写成显式步骤,并让评分只承担排序或触发复核的角色。做法不是关掉评分,而是给评分设置“不可单独决定”的边界。
防止被替代的前提是承认项目本身有两种性质。第一种是候选量大、差异维度统一的项目,例如把一批词按竞争度、相关性、商业意图做初筛,这类工作让自动评分先跑,人工只看边界样本,效率更高。第二种是候选量小但每个都牵动业务后果的项目,例如决定首页承接哪个意图、是否为一个词改写整站结构,这类判断的正确答案取决于产品阶段、用户来源和已有内容资产,评分给不出。
区分方法很直接:问一句“如果评分把A排在B前面,我能否在不看具体页面的情况下接受”。能接受,就属于第一类;不能接受,就属于第二类,必须保留人工裁决点。
把人工判断固化进流程,比事后争论更有效。可以按下面三步设置:
执行一次后你会得到一个直接结果:被人工推翻的样本会暴露出评分的系统性偏差,比如它总高估某个意图类型。这个结果决定下一步是调整评分维度,还是把该类项目整体移出自动评分范围。
与直觉相反的结果出现时,最容易犯的错是直接判定工具不准。更稳妥的做法是找一组能区分原因的证据。假设一个词被评分判为高优先级,但你的经验认为它不值得做,可以核对三件事:该词对应的搜索结果里,排在前面的页面是否真的在满足同一意图;你的站内是否已有页面承接了相近意图,只是表述不同;这个词带来的访问若发生,落在哪个页面、下一步能做什么。三项里有两项对不上,才更可能是评分口径与你的业务口径不一致,而不是单纯的分数错误。
反过来也要留出“评分对了”的可能:如果证据显示意图一致、站内确实空缺、承接路径清楚,那么不适感可能只来自你对新方向的陌生。此时正确的动作是先做小范围验证,而不是立刻否定评分。
条件一:项目可逆、成本低。 优先信任评分做批量处理,人工只抽查两端样本。动作是设定抽查比例并记录偏差,若偏差稳定在可接受范围,就扩大自动处理比例。这里的例外是涉及品牌表述、合规措辞的项目,即使可逆也不交给评分单独决定。
条件二:项目不可逆或影响面大。 例如改动站点结构、合并页面、调整核心承接页,评分只作为参考输入,最终结论必须由人工基于证据作出。动作是先写清判断依据和预期观察指标,改动后再用同一组指标回看。例外是当人工判断反复无法收敛时,说明缺的不是判断力而是信息,此时应补数据而不是继续争论。
防止自动评分替代人工判断,最终靠的是记录。每次人工推翻或确认评分,都把原评分、结论、依据、观察指标写在同一处。积累几次后,你会发现有些争议其实是同一类口径问题,可以一次性调整规则;另一些则确实需要每次单独判断,那就把它固定为人工环节。这样评分工具负责它擅长的部分,人工负责它不可替代的部分,两者边界清楚,流程才稳定。