先给结论:当关键词扩展工具升级后同一批种子词评分变了,最合理的解释通常不是“数据错了”,而是评分规则、候选池或去重逻辑至少有一项发生了变化。要解释前后差异,先固定种子词、地区、语言和导出时间,再用同一批词分别跑新旧结果,比较“新增词、消失词、分数位移”三类变化,而不是直接比较总分。下面用一个假设情境把决策过程走完。
假设你维护一个工业配件的选题库,种子词是“耐高温密封圈”。升级前导出 120 个扩展词,其中“耐高温密封圈规格”评分 78;升级后同一词变成 61,同时多出 40 个长尾词。此时你有两个看似合理的做法:一是以新评分为准,直接重排选题;二是保留旧评分,只把新词追加进库。两者都成立,但条件不同。
选择“以新评分为准”的条件是:你的投放或内容排期还没锁定,且新规则与当前渠道的匹配度更高。代价是历史对比断档,之前按旧分做的优先级需要重算。选择“保留旧评分、只追加新词”的条件是:已有排期不能动,且旧分对应的转化经验仍有效。代价是库内两套标准并存,后续再升级时差异会叠加,越来越难解释。
评分变化只是表象,先做一次结构化对比,能判断差异来自哪里。
可区分的证据是:如果只有分数位移、候选池几乎不变,问题在权重;如果候选池大幅变动而旧词分数稳定,问题在抓取与去重。两种原因的应对动作完全不同,前者要重算优先级,后者只需补录新词。
具体动作是:从旧结果里抽 30 到 50 个词,覆盖高、中、低三档分数,连同种子词、地区、语言、设备类型一起记录成基准集。升级后用完全相同的输入回跑一次,把结果并排比较。
这个动作的结果会直接决定下一步:如果基准集里多数词的相对顺序没变,只是绝对分数整体平移,那么旧排期可以保留,只需换算分档区间;如果相对顺序被打乱,说明新规则改变了优先级逻辑,旧排期必须重排。若基准集里出现大量旧词消失,先检查是否触发了新的过滤条件,而不是立刻认定旧数据失效。
请求量、抓取量或某个统计指标归零,不能单独证明处理正确。它还有其他合理解释:接口限流、地区节点调整、词形归并后合并计数、导出字段改名导致读取为空。同理,新评分整体变高也不等于更准,可能只是分值区间被重新拉伸。
判断规则是否更贴合你的场景,要看它是否让“你真正会用的词”排到了前面。可以拿一批已知有效和已知无效的词做对照,观察新规则能否把它们分开。这个对照只需要几十个词,不依赖任何平台的内部权重说明。
给出可操作的取舍条件:
无论选哪条,都要记录升级日期、输入条件和基准集结果。这样下一次规则再变时,你比较的是同一把尺子,而不是两次不同口径的总分。具体工具的功能入口、字段名称和计分口径需要以你实际使用的版本为准,通用方法只能帮你定位差异来源,不能替代对当前界面的核对。