自动评分可以当作线索,但不能直接当作结论。防止它替代人工判断的关键,是把评分拆成可解释的观察项,再对其中受业务前提影响的部分做人工复核。当网站的目标、页面类型或流量来源发生实质变化时,旧评分口径往往不再适用,此时应降低评分权重,转而以人工抽样和分渠道证据为准。
自动评分通常基于一组固定规则或统计口径,它默认被评估的页面属于同一种类型、服务于同一种流量来源。一旦前提变化,评分的高低就可能与真实表现脱节。
假设一个情境:某站点原本以内容页获取搜索流量,后来把主要入口改为商品页,并开始依赖平台推荐。此时旧评分仍按内容页的标题长度、内链数量、关键词出现位置等维度打分,结果商品页普遍得分偏低。这个低分并不说明商品页有问题,只说明评分口径没有跟上页面类型的变化。
可区分的原因至少有两类:一类是评分规则本身没有覆盖新页面类型,属于口径问题;另一类是页面确实存在抓取或索引障碍,属于真实问题。两者的证据不同——前者表现为同类页面得分整体偏低且分布集中,后者往往伴随抓取记录异常或索引状态异常。先区分原因,再决定是调整评分权重还是处理页面本身。
防止自动评分替代判断,实际动作是要求评分输出可解释的中间项,而不是只给一个总分。可执行的做法包括:
这个动作的结果会直接影响下一步:如果多数不一致集中在同一维度,说明该维度需要重新设定阈值或直接改为人工判断;如果不一致分散且无规律,说明评分整体参考价值有限,应减少对它的依赖。
可以较多信任评分的条件通常是:页面类型单一、流量来源稳定、评分维度与当前业务目标一致。此时评分适合用来快速筛选异常页面,人工只需抽查少数边界情况。
必须人工介入的条件通常是:页面类型混合、流量来源发生迁移、评分维度包含无法从页面直接验证的推断项。此时应把评分降为排序工具,而不是决策工具。具体做法是先用评分把页面分成高、中、低三组,再对中组和低组做人工抽样,确认低分是否对应真实问题。
一个注明假设的短例子:假设某查询工具对同一批页面给出两个评分,一个基于页面结构,一个基于外部信号。若结构评分低而外部信号评分高,不能直接取平均,而应先确认结构评分低的原因是否属于模板问题。若属于模板问题,处理模板后结构评分可能变化;若不属于,则结构评分对该批页面本就不适用。
人工判断不是否定评分,而是给评分设定适用边界。每次人工复核后,应记录三类信息:评分与人工判断一致的页面、不一致的页面、以及无法判断需要进一步观察的页面。这三类信息的比例变化,比单个评分数字更能说明评分是否仍可用。
如果一致比例持续偏低,说明当前评分口径已不适合继续用于该批页面,应暂停用评分做筛选,改为按业务目标直接抽样。如果一致比例稳定,可以把评分保留为初筛工具,但人工复核的频率可以适当降低。这个调整的依据是人工结论,而不是评分自身的变化。
自动评分容易替代人工判断,往往不是因为评分本身有多强,而是因为使用它的人没有留下判断痕迹。可追溯的做法是:每次依据评分做出处理决定时,同时记录决定所依据的观察项、人工复核的页面范围,以及当时适用的前提条件。
这样做的实际结果是,当前提再次变化时,可以回看哪些结论建立在旧口径上,从而决定是沿用、修正还是废弃。没有这层记录,评分一旦更新,旧结论就失去参照,人工判断也无从校准。把判断责任留在可追溯的环节,比单纯争论评分准不准更能防止它替代人的判断。