不能直接连接。历史曲线能否续上,取决于新旧数据源在抓取范围、地域、设备、排名口径和采样频率上是否兼容。如果只是把两段曲线画在同一张图里,连接处往往会出现跳变,而跳变既可能是真实排名变化,也可能只是口径切换造成的假象。
假设你管理一个约两千个词的排名监测项目,原来用A数据源,每周记录一次桌面端全国排名。某月换成B数据源,仍然每周记录,但B的抓取覆盖更偏移动端,且对个性化结果做了去偏处理。换源后的第一周,平均排名从第14位跳到第22位,之后又缓慢回升。此时最容易犯的错,是把这8位落差当成一次真实的排名下跌,进而去排查内容或外链。
更稳妥的做法是先做一次重叠期对照:让A和B同时跑两到四周,记录同一批词在两边的数值。如果两边的差值稳定在某个区间,说明存在系统性口径差,可以用偏移量或分段标注来续接曲线;如果差值忽大忽小,说明两个源的采样逻辑不同,强行连接只会制造噪音。这个动作的结果直接决定下一步:差值稳定就做校准后合并,差值不稳定就放弃单条连续曲线,改为按数据源分段展示。
历史曲线的本质是同一口径下的时间序列。换源等于换了尺子,所以要先逐项核对:
这五项里只要有两项以上不一致,历史曲线就应当视为两条曲线,而不是一条被打断的曲线。此时可以在图上加一条垂直分隔线,注明数据源变更,并分别标注各自的基准值。
可以连接的条件比较明确:新旧源在重叠期内,同一批词的排名差值中位数稳定,且波动幅度小于你设定的可接受阈值。例如假设你设定阈值是3位,重叠期差值中位数是2位且上下浮动不超过1位,那么可以把旧曲线整体平移后与新曲线衔接,并在图注中说明做了口径校准。
必须断开的条件同样明确:重叠期差值方向不一致,或者某些词差1位、另一些词差20位。这种分化说明两个源的抓取逻辑针对不同词类表现不同,不存在一个统一的偏移量。此时继续连接,会让后续所有基于曲线斜率的判断都失去意义。
还有一种中间情况:差值稳定但样本量小。个别样本成立,不代表规模化后成立。假设你只挑了十个品牌词做重叠期对照,差值很稳定,但扩展到两千个长尾词后可能出现例外。因此重叠期样本应当尽量覆盖你实际监测的词类结构,而不是只挑好观察的词。
其中第三步的结果会影响第四步的选择,而第五步是无论哪种选择都必须做的动作。如果省略标注,即使数据处理正确,阅读曲线的人仍可能得出错误结论。
换源后请求量下降、抓取量归零或某个指标突然平稳,都不能单独证明你的连接方式是对的。请求量下降可能是抓取频率调整,也可能是源本身覆盖变窄;曲线变平滑可能是口径统一,也可能只是新源的采样粒度更粗。要判断处理是否正确,仍然要回到重叠期对照和词类分层的结果上。
如果你使用的是具体品牌的工具,其数据源构成、采样方式和变更历史需要向服务方核对,不要根据界面表现推断。不同工具对同一查询给出不同结果,本身就是数据源差异的正常表现,而不是某一方出错。
最终决策可以归结为一句话:先证明两个源在同一时间点对同一批词可换算,再谈历史曲线能不能连;证明不了,就老老实实分段。