识别样本污染的关键,是先把“版本差异”和“访客差异”分开:在SEO诊断工具里,如果A/B版本各自吸引的人群、来源或设备结构不同,那么两版指标差异可能来自访客构成,而不是版本本身。做法是先用分流日志核对分配是否随机,再按来源、设备、登录状态分层复算;若分层后差异明显收窄,就应把结论降级为“样本不可比”,而不是继续比较总量。
是否继续使用当前对比结果,取决于分流机制是否可控。条件一:分流由服务端按稳定标识(如用户ID或Cookie)分配,同一访客反复访问时版本稳定。此时可以按访客维度聚合,先看每个访客的版本归属,再比较行为指标,样本污染风险较低。条件二:分流按请求随机、且没有稳定标识,同一访客可能在不同页面看到不同版本。此时总量对比没有意义,必须改为“同一访客首次进入版本”作为分析单元,或直接暂停对比。
选择依据不是工具显示的样本量,而是分配单元是否与分析单元一致。实施动作:从分流日志中抽取一批访客,检查其版本归属是否在多次访问中保持一致。如果一致率接近随机水平,说明分配不稳定,下一步应先修分流,而不是继续调指标。
样本污染的常见来源是渠道结构不同:A版本更多来自自然搜索,B版本更多来自推荐或广告。此时整体转化率差异可能只是渠道差异。可执行动作是按来源分层,分别计算每层内两版的指标,再用同一渠道权重做加权汇总。假设A版自然搜索访客占七成、B版占三成,而自然搜索本身转化更高,那么整体差异会被渠道结构放大;分层后若两版在各自渠道内接近,就应该判定为结构污染。
证据链要可核查:先记录分层前后的样本量和指标,再标记差异变化方向。若分层后差异从明显变为接近,说明渠道结构是主要解释;若分层后差异仍在,才需要继续查设备、登录状态或页面加载等版本内因素。这里的数字只用于说明比较方法,不构成对任何真实项目的结论。
站内统计、第三方估算和搜索引擎报告的口径不同,不能互相替代。访客被分配到不同版本时,优先检查三个口径问题:一是会话边界,同一访客跨版本访问是否被计为两次会话;二是事件归属,点击或转化是否记在首次进入版本还是当前版本;三是过滤规则,内部访问、机器人或测试流量是否只进入其中一个版本。
实施动作:导出分流日志与事件日志,按访客ID关联,检查同一访客是否出现跨版本事件。若跨版本事件比例高,下一步应把分析口径改为“首次进入版本”,并重新计算指标。这个动作会直接影响结论:原本看似显著的差异可能消失,原本不显著的差异可能显现,因此不能跳过。
例外情况是:当版本差异极大、且分层后方向一致时,即使存在少量样本污染,也可以保留初步判断,但必须注明假设和适用范围。例如两版在自然搜索、推荐和直接访问三个分层中方向一致,只是幅度不同,此时可以认为版本因素更可能成立。反之,如果分层后方向相反,就应停止比较,先修复分流或统一口径。
另一个例外是诊断目的仅为发现异常,而非评估版本效果。此时可以先用样本污染检查缩小范围,再决定是否值得做正式对比。无论哪种情况,都不要用单次统计归零或抓取量变化来证明处理正确,因为这些现象还可能来自抓取预算调整、页面改版或外部链接变化。
完成这些动作后,下一步不是继续堆指标,而是根据分层结果决定:是修复分流后重跑,还是接受当前样本并降低结论强度。只有把样本污染识别清楚,SEO诊断工具给出的差异才值得进入后续决策。