先把结论放在前面:升级后评分变化,通常不是“旧分错了”或“新分更准”这么简单,而是评分口径、数据快照和页面本身三者中至少有一项发生了位移。要解释差异,最稳妥的动作是拿同一个页面做一次冻结复算:固定页面版本、固定数据日期、分别记录新旧规则下的扣分项,再判断差异来自规则、数据还是页面改动。下面按这个顺序展开。
评分变化最容易被误读的地方,是拿升级前看到的分数和升级后看到的分数直接相减。但这两次看到的可能不是同一个对象:页面可能在这期间被改过标题、增删过段落,也可能被重新抓取过。所以第一步不是比较分数,而是确认比较对象是否一致。
具体做法:把当前页面导出为一份静态存档,记录导出时间、页面主要文本的字符数、标题和各级小标题的原文。这份存档就是后续所有复算的基准。如果手头没有升级前的存档,就退一步,用版本记录或历史快照还原一个近似版本,并明确标注这是近似而非原版。
动作与结果:冻结版本后,如果新旧两次复算的扣分项指向同一段文字,那差异大概率来自规则;如果指向不同段落,先排查页面是否被改动,而不是急着归因于工具升级。这一步直接决定下一步该查规则还是查页面。
总分是聚合结果,聚合方式一变,总分就会跳,但底层问题可能一个都没变。要解释差异,必须把新旧两次的评分拆到具体条目上,逐条对照。
可以按下面这种方式建一张对照清单,每一项都写清“旧规则下的判定”和“新规则下的判定”:
拆完之后通常会出现三种情况:一是同一项判定结论相反,说明规则口径变了;二是同一项结论相同但权重变了,说明是配比调整;三是某一项从“不适用”变成“适用”,说明新增了检查维度。这三种情况的解释完全不同,不能混为一谈。
评分差异的来源只有三类,区分它们靠的是可核对的证据,而不是感觉。下面这组判断依据可以直接用:
需要提醒的是,抓取量下降或某项统计归零,并不能单独证明是规则收紧导致的。它也可能是抓取频率调整、页面被暂时排除或数据延迟造成的。把这类现象直接当成规则变化的证据,容易得出错误结论。
同一份评分,内容负责人、技术负责人和决策者往往理解不同:一方认为是内容问题,一方认为是工具误判,一方只关心分掉了多少。分歧的根源通常是各自看到了不同的那一层,而不是谁在说谎。
把分歧转成项目的方法是:为每一个争议点指定一个可核对的证据来源。例如,争议“标题是否达标”,证据就是冻结存档里的标题原文加上新旧两次的判定记录;争议“是否被重新抓取”,证据就是两次数据快照的日期字段。每个争议点只留一个证据来源,避免各说各话。
动作与结果:当每个争议点都绑定到具体证据后,讨论会从“谁的判断对”转向“哪份记录支持哪种解释”。如果证据显示页面确实改过,下一步就是回滚或重新优化该段;如果证据显示规则变了,下一步才是评估是否需要按新口径调整内容策略。
假设某页面在升级前评分为 80,升级后为 65,页面文本在这期间没有改动。按上面的流程拆解后发现:标题项判定不变,结构项判定不变,但“主题覆盖”一项从“达标”变为“部分达标”,且该项权重在新规则中提高了。在“页面未改动、数据快照日期相同”的前提下,可以判断差异主要来自规则口径与权重的调整,而不是页面质量突然下降。
这个例子里的数字只是用来说明比较方法,不代表任何真实工具的评分结果。实际处理时,仍要以自己手中的冻结存档和判定记录为准。
解释清楚差异只是第一步,更重要的是让下一次升级时能快速复现判断。建议在冻结存档旁附一份简短记录:记录日期、页面版本标识、新旧规则下各扣分项的判定、以及本次得出的归因结论。这份记录不需要复杂格式,能让人在几个月后看懂“当时为什么这么判断”即可。
这样做的价值在于:当评分再次变化时,你手里有的是一份可对照的历史,而不是又一次从零开始的猜测。规则会继续调整,页面也会继续更新,能留下来的只有这些可核对的记录。