先给结论:当缺失数据集中在某一类设备时,不要把它当成随机缺数补一补,而要先判断这类设备在整体查询中占多大比例、缺失是否与排名区间相关。如果缺失只出现在低排名区间,结论通常偏乐观;如果缺失集中在高排名区间,结论通常偏悲观。两种情况的处理动作完全不同。
判断偏差的第一步是确认缺失的性质。随机缺数指某设备的数据丢失与关键词本身的表现无关,比如采集任务超时、接口限流、客户端版本差异导致的偶发丢失。选择性缺数指某设备的数据丢失与排名位置、页面类型或查询意图相关,比如移动端只对前几页的查询返回结果,或者某类设备在特定页面模板上无法触发监控脚本。
区分方法不复杂:把同一批关键词按排名区间分层,看缺失率是否随区间变化。如果各区间缺失率接近,偏向随机缺数;如果某个区间缺失率明显更高,偏向选择性缺数。随机缺数可以用加权估算修正,选择性缺数必须先找到触发条件,否则修正本身也会引入新的偏差。
两种条件下的选择不同,依据是缺失数据与结论方向的关系。
这两种情况的共同点是:缺失不是均匀分布的,所以不能用整体缺失率一个数字代替分层判断。整体缺失率百分之几看起来不大,但如果它全部集中在某一端,对结论的影响可能远大于这个比例。
假设某站点监控了100个关键词,桌面端采集完整,移动端只采到第1页的结果,第2页及之后全部缺失。此时移动端缺失量占总样本的比例可能只有百分之十几,看起来可以忽略。但如果这100个词里有相当一部分真实排名在第2页之后,移动端的平均排名就会被高估,整体结论会偏向“移动端表现不错”。
验证动作:从缺失的那部分设备里手动抽取少量关键词,用同一查询条件在第2页之后逐条核对。如果抽到的词确实在第2页之后有排名,说明缺失是选择性的,之前基于移动端的结论需要下调。下一步不是继续扩大自动采集,而是先修正采集范围或调整分层权重,再重新计算。
确认缺失属于选择性之后,常见的错误做法是直接按桌面端的分布给移动端补数。这种做法只有在两类设备的排名分布确实相近时才成立,而缺失本身往往说明它们不相近。更稳妥的动作是:先用小样本手动核对缺失区间,确认缺失方向;再决定是扩大采集范围、调整分层权重,还是暂时把该设备的数据从结论中单独列出。
例外情况有两种。第一,如果缺失设备在整体查询中占比极低,且缺失区间与结论方向无关,可以暂时不修正,但要在结论里注明覆盖范围。第二,如果缺失是由采集工具本身的口径变化引起的,比如某次改版后不再返回第2页之后的结果,那问题不在数据本身,而在工具口径,需要先核对工具说明再判断。
一个可操作的顺序是:先按排名区间分层计算缺失率,再抽取缺失区间的小样本手动核对,最后根据核对结果决定是修正权重、扩大采集还是单独标注。这个顺序的关键在于,手动核对的结果会直接决定下一步是“修数据”还是“修工具”。如果核对发现缺失区间确实存在排名,下一步是修采集范围;如果核对发现缺失区间本来就没有排名,下一步才是考虑权重修正。
无论哪种情况,都不要把缺失数据直接当作零处理,也不要用一个整体缺失率掩盖分层差异。结论偏差的方向取决于缺失集中在哪一端,而不是缺失总量有多大。