判断标准不是“手工能不能做完”,而是这项工作是否需要逐页独立判断。当同一操作要在几十个结构相同的页面上重复,且判断规则已经稳定时,继续手工做会同时带来遗漏、前后不一致和无法复核三个问题,应该转为规则化处理;反过来,涉及页面定位、内容取舍、合并拆分这类一次性的判断,规模再大也不适合交给批量规则。
拿你手上的页面清单做一次检查:把最近手工改过的项目按类型分组,看同一类改动是不是反复出现在结构相同的页面上。例如标题模板、内链位置、面包屑、分页链接、参数页处理。如果同一类改动在十个以上页面重复出现,并且每次的判断依据基本一致,它就属于可规则化的候选;如果每次都要重新读内容才能决定,就仍然留在人工环节。
这里容易出现的反常结果是:手工处理量增加,但页面的处理结果反而不一致。合理解释不止一种——可能是执行人不同、可能是规则口头传达没有落成文档,也可能只是页面本身差异大,本来就不该用同一套规则。区分方法很简单:随机抽三到五个已处理页面,对照同一份判断标准逐项核对。如果标准本身统一、结果却不同,问题在执行一致性;如果标准无法统一,说明这项工作暂时不该规则化。
第一类是结构相同、只替换字段的元信息。例如商品分类页的标题由“分类名 + 固定后缀”组成,当分类数量从几十涨到几百,手工维护模板后缀的改动会漏掉旧页面。做法是把模板抽成变量,批量生成后抽样校验字段是否为空、是否重复。
第二类是跨页面的链接关系维护。分页、上下级分类、相关推荐这类链接,规则明确且需要全站一致。手工添加在页面数量上升后必然出现断链或漏链,转为由页面关系数据生成更可靠。
第三类是状态监控与异常清单。索引状态、返回状态码、重复标题这类检查,本质是“发现异常再处理”,不需要逐页判断内容,适合定期自动比对并输出差异清单,人工只处理清单里的异常项。
执行动作上,可以先选一个重复度最高的类型做小范围试点:把判断规则写成可核对的条目,用脚本或批量工具处理一批页面,再人工抽查结果。抽查通过,说明规则可复用,下一步可以扩大范围;抽查不通过,说明规则描述仍有歧义,应先修规则而不是继续加量。
页面是否需要合并或拆分、内容是否值得保留、某个栏目是否应该继续存在,这些决定依赖对业务和用户意图的理解,无法用统一字段表达。批量工具可以帮你把候选页面列出来,但决定必须人工做。
还有一种情况常被误判为“该自动化”:页面数量少但差异极大。此时规则化的收益很低,维护规则的成本反而更高。可以用一个假设例子说明比较方法——假设你有二十个页面,每个页面都要单独读内容才能决定处理方式,那么把时间花在建立规则上,不如直接逐个处理;但如果是一千个结构相同的页面,规则一旦稳定,人工逐个处理的时间会随页面数线性增长,而规则化处理的边际成本明显更低。这个比较只用于说明取舍方向,具体阈值要按你手上的页面结构和判断难度来定。
需要注意,抓取、索引和排名是不同环节,批量处理元信息或内链属于改善页面的可理解性,不直接等于排名变化。自动检查发现的异常数量下降,也不能单独证明处理方向正确,还要排除抓取频率变化、页面本身被移除等合理解释。规则化处理的前提是页面结构相对稳定、判断标准已经明确;如果这两点不成立,扩大自动化只会把错误复制到更多页面。