A/B 测试不是把流量 50/50 分一下。随机分组、样本比例、埋点一致性、主指标、Guardrail 和实验周期只要有一项出问题,漂亮的 uplift 也可能完全不可信。
“我们把按钮从蓝色改成绿色,转化率提升 18%。”这类案例很容易传播,但真实实验比一张结果截图复杂得多。微软 Experimentation Platform 长期强调实验可信度检查,Sample Ratio Mismatch(SRM)就是最经典问题:如果原本设计 50/50,实际两组用户比例异常,说明随机化、过滤或埋点可能出错,此时不应该继续解读转化。
01 先说结果:先证明“实验可信”,再讨论“哪个版本赢”
一个可信 A/B 测试至少要回答:谁被随机、是否稳定分组、两组是否同时正常曝光、指标是否一致采集、是否存在 SRM、实验是否覆盖必要周期、主要指标和 Guardrail 是否预先定义。
02 一、从明确假设开始,不要从“我想试试这个颜色”开始
好的假设应包含问题、改变和预期机制,例如:“首页客户案例过晚出现,首次访客难以建立信任;将行业案例提前到产品价值后,预计提高案例查看和有效咨询。”这样即使最终没提升,也能学到对用户行为的判断。
03 二、确定正确的随机化单位
网站可能按 user、cookie、account 或 session 分组。B2B SaaS 如果同一企业成员看到不同版本,可能互相影响;登录前后身份合并也可能串组。实验设计要与用户关系和指标粒度一致。

04 三、先做 SRM 检查
SRM 指实际样本比例与预期分配明显不符。原因可能是重定向丢流量、缓存、Bot 过滤、客户端脚本加载失败、某版本报错或埋点漏发。发现 SRM 时,应先排查系统,不要把结果当“统计波动”。
05 四、主指标只选真正代表目标的少数指标
如果同时看 30 个指标,总能找到几个“显著上涨”。实验前应定义 primary metric,再设置 Guardrail,例如转化提高但页面性能、退款、错误率或线索质量不能恶化。微软近年的实验研究也持续提醒多指标相关和误报问题。
06 五、不要实验跑到“显著”就立刻停止
频繁偷看并在第一次显著时停止,会增加错误结论。实验周期还要覆盖完整业务节奏,例如工作日/周末、薪资日、营销周期。具体统计方法应由数据团队选择,但产品团队至少要遵守预先设定的结束规则。

07 六、质量问题要在分析前排除
两组页面是否都正常加载?某浏览器是否只在 B 报错?事件是否只在 A 触发?版本是否同时上线?这些问题比统计公式更常见。实验平台应自动监控曝光、错误、流量和关键埋点。
08 七、“没有显著差异”也可能是有价值结果
如果一个复杂重设计没有带来改善,团队可以避免昂贵全面改造;如果更简单版本与复杂版本效果相同,可以选择更易维护方案。实验不是只为找到 winner,而是降低决策不确定性。
09 八、实验结果要记录长期影响
短期点击增加不代表长期价值。某种强刺激 CTA 可能提高提交,却降低线索质量;自动推荐可能增加使用,但提高投诉。重要实验应在上线后继续看滞后指标。
10 CRO 实验前检查清单
- 假设写清用户问题与作用机制。
- 随机化单位和持久分组正确。
- Primary + Guardrail 预先定义。
- 两组埋点和性能一致。
- SRM 与异常流量检查通过。
- 结束规则和最小运行周期提前确定。
11 最后:实验文化的价值是“允许设计判断被验证”
A/B 测试不是否定设计专业性。相反,设计师提出更好的行为假设,数据团队保证实验可信,业务团队定义真实价值,三者结合才能避免“凭审美投票”和“凭一个显著数字盲目上线”这两个极端。

12 九、先做 A/A 或质量验证,尤其是新实验平台
在没有真正改页面时把用户随机分成两组,理论上主要指标不应出现系统性差异。A/A 可以帮助发现分流、埋点、缓存和统计管线问题。并不是每次测试都必须先跑 A/A,但新平台、重大埋点改造或历史数据异常时很有价值。
13 十、实验结果要记录“为什么相信它”
最终报告除了 uplift 和置信区间,还应记录样本、运行日期、SRM 检查、异常、分群是否预先定义、是否触发 Guardrail,以及结论适用范围。这样半年后团队重新查看,不会只剩一张“+12%”截图。
常见问题
什么是 SRM?
Sample Ratio Mismatch,实际进入各实验组的样本比例与预期分配异常,通常提示实验分流或数据链路存在问题。
A/B 测试要跑多久?
没有固定天数,应由所需样本、业务周期和统计方案决定,并提前设定结束规则。
转化率提高就一定上线吗?
不一定,还要看 Guardrail、线索质量、性能、错误率和长期业务影响。
可以同时测很多指标吗?
可以监控,但主决策指标应有限,并考虑多重比较带来的误报风险。
小流量网站适合 A/B 测试吗?
可能不适合传统在线实验。可以优先用用户测试、可用性研究、前后对照或更大幅度的高价值假设。