终止条件不是“效果不好就停”,而是一组在推广前就写死的判定规则:达到什么信号必须停、停在哪个范围、停下后由谁复核。试验页推广到全站,最大的风险是各角色对“试验到底算不算成功”理解不同,于是有人主张继续放量,有人主张回滚,争论无法收敛。把分歧转成可核对的项目,关键就是提前定义两类终止条件——硬性止损和证据不足暂停。
假设一个试验页上线两周,来自搜索的访问量上升,但站内目标动作的完成次数没有同步上升。运营角色看到访问量曲线,认为试验有效,应该推广;内容角色看到完成次数持平,认为试验无效,应该停止。两种解读都能从同一份数据里找到支撑,因为双方看的指标不同、时间窗口不同、对“有效”的定义也不同。
这不是谁在说谎,而是试验设计阶段没有约定判定口径。推广到全站意味着把试验页的改动复制到大量页面,一旦判断错误,回滚成本远高于试验阶段。所以终止条件必须解决一个前置问题:在什么证据组合下,继续推广是合理的,在什么证据组合下,必须先停下来核对。
解释一:改动确实带来了增量。搜索访问量上升可能来自改动本身,比如标题或摘要更贴合查询意图,点击率提高,进而带来更多访问。如果目标动作的完成需要多步操作,而试验页只覆盖了第一步,那么完成次数暂时持平是正常的滞后现象。按这个解释,终止条件不应只看完成次数,还要看后续步骤的转化是否在访问量上升后逐步跟进。
解释二:增量来自外部变化或采集差异。访问量上升也可能来自季节性需求、同期其他渠道的联动,或者数据采集口径在试验期间发生了变化,比如统计脚本调整、过滤规则变动。如果试验页和对照页的采集方式不一致,比较本身就不成立。按这个解释,终止条件必须先包含“口径一致性核对”,口径不一致时直接暂停推广,而不是继续加量。
要区分上面两种解释,需要两类证据。第一类是对照证据:试验页之外,选取条件相近、未做改动的页面作为对照,比较同一时间窗口内两组页面的访问量变化方向。如果试验组上升而对照组持平,改动带来增量的解释更强;如果两组同向变化,外部因素的解释更强。第二类是可核对的口径证据:确认试验组和对照组的统计范围、过滤条件、时间边界是否一致,并记录核对结果。
这里有一个可注明假设的短例子。假设试验组和对照组各有若干页面,试验期为两周。若试验组访问量变化为正、对照组接近零变化,且两组口径核对一致,那么可以认为改动值得进入下一阶段评估。若两组都为正且幅度接近,则应优先怀疑季节性需求,此时终止条件应触发“暂停推广、延长观察”,而不是直接判定改动有效或无效。这个例子只说明比较方法,不代表任何真实项目的结论。
把终止条件分成两类,可以让不同角色在同一张表上对齐。硬性止损针对明确的风险信号,触发后立即停止推广并回滚;证据不足暂停针对判断依据不充分的情况,触发后停止扩大范围,先补充证据再决定。
每个条件都要写明判定所需的具体证据、由谁核对、核对结果记录在哪里。这样当分歧再次出现时,争论的对象从“我觉得有效”变成“这条证据是否满足”,项目才能推进。
推广前可以做一个具体动作:把试验页和对照页的统计范围、时间窗口、目标动作定义写成一份核对清单,由至少两个角色分别确认,确认结果不一致就先解决不一致,而不是先推广。这个动作的结果直接决定下一步——口径一致且对照证据支持改动时,才进入全站推广的评估;口径不一致或对照证据不支持时,终止条件触发,项目停在试验阶段继续核对。这样做不能保证推广一定带来收益,但能避免把口径差异误读成效果差异,也能让回滚决策有据可依。