先给结论:同一批词在新旧版本里评分不同,通常不是词本身变了,而是评分口径变了。要解释差异,先确认是"输入数据变化"还是"计算规则变化",再决定是沿用旧结论、重跑一遍,还是把两套评分都停用、改用原始指标做判断。下面给出两种主要解释、区分它们的证据,以及一个假设例子说明动作和结果。
关键词研究工具的评分往往由多个原始指标加权得出,例如搜索量、竞争度、点击集中度、商业意图词占比等。升级后如果这些原始指标的来源、采样周期或地域口径调整,即使权重公式一字未改,分数也会整体漂移。这种情况下,差异集中在"数据源本身发生变化的词"上,而不是所有词一起动。
判断线索:把新旧两版对同一批词的原始指标导出对照,而不只看总分。如果搜索量、竞争度这类输入项本身就有明显偏移,且偏移方向与总分变化一致,那更可能是数据层更新,而非评分逻辑重写。此时旧结论的适用性取决于业务是否依赖这些原始指标的绝对值。
另一种情况是原始指标没动,但工具的加权方式、归一化区间或分档阈值变了。表现是:同一批词的原始数据几乎一致,总分却成片变化,甚至出现"原本中等分的词集体跳到高分"这种阶梯式位移。这类变化对决策的影响更直接,因为它改变了词与词之间的相对排序。
判断线索:找几个原始指标完全相同或极接近的词,看它们的新旧总分差是否也一致。如果一批输入几乎相同的词得到几乎相同的分差,说明是公式或阈值在起作用;如果分差杂乱、与输入无关,则更可能是数据抖动或采样差异。
实际操作上,可以按下面的顺序做一次对照,动作本身就会产出区分证据:
这个动作的结果会直接决定下一步:如果差异主要来自数据层,你可以保留旧的筛选逻辑,只对受影响的指标重新设定阈值;如果差异来自规则层,那么新旧分数不可混用,必须选定一个版本重跑全部选词,否则同一张表里会同时存在两套不可比的刻度。
假设某业务用工具筛出 50 个词,升级后发现其中 12 个词从"可做"变成"不建议做"。先别急着删词。按上面的对照法导出原始指标,若发现这 12 个词的搜索量输入普遍下调、竞争度上调,而其余 38 个词输入基本未变,那就是数据层更新,处理方式是重新评估这 12 个词在当前数据下的可行性,而不是怀疑筛选方法本身。
反过来,若 50 个词的原始指标几乎没动,但总分整体上移、且原本分散的分数被压缩到几个固定档位,那就是分档规则重写。此时应停止用新旧分数交叉比较,选定新版本重跑,并记录这次口径切换的时间点,避免后续把两个时期的结论混在一起复盘。
无论归为哪一类,都要先确认前提:你比较的是同一地域、同一语言、同一时间窗口下的数据吗?如果新旧版本默认的地域或周期不同,差异可能只是口径不一致,而非工具本身变化。具体某个工具的默认设置、导出字段和版本说明,需要以你实际使用的版本为准,不能凭印象推断。
另外,评分只是工具给出的一个聚合值,它不替代你对业务相关性的判断。当评分口径发生变动时,优先保住的是原始指标和业务匹配度这两层证据,评分本身可以随版本重建。这样做的好处是:即使工具再升级一次,你手里的判断依据仍然可比。