Decision Systems Toolkit

A/B 测试工具包

均值比较 · 比例比较 · 样本量计算 · 检验功效

均值比较(T 检验)

适用于比较两组连续数值型数据的平均值差异,例如页面停留时间、订单金额、客单价等。数值用逗号或空格分隔。

怎么读这个结果 & 常见错误

怎么读

  • p 值 < 0.05 说明这个差异不太可能只是随机波动,但它不代表差异有多大或多重要——一定要同时看"差值"和"相对差异"这两个数字,判断这个差异在业务上是否值得为此改动。
  • 自由度(df)越接近两组样本量之和,说明两组方差比较接近;数值明显偏小,说明两组波动程度差异较大,属正常现象,工具已自动做了校正(Welch's t-test),不需要你手动处理。

常见错误

  • 中途偷看、看着不显著就加样本——这是最常见的假阳性来源。正确做法是测试前定好样本量或时长,跑完再看,中途不看结果做判断。
  • 样本量很小(每组 < 30)且数据明显不是正态分布时,t 检验的结果不够稳健,建议积累更多数据或换用非参数方法。
  • 把"统计显著"等同于"业务重要"——极大的样本量下,一个毫无实际意义的微小差异也可能测出 p<0.05。反过来看相对差异的大小。

比例比较(Z 检验 / 转化率对比)

适用于比较两个版本的转化率、点击率、打开率等比例型指标。

对照组 A

实验组 B

怎么读这个结果 & 常见错误

怎么读

  • 95% 置信区间比单看 p 值信息量更大——它告诉你这个差异合理的取值范围。如果区间跨越 0(一端正一端负),说明证据不足以确定方向。本工具使用 Newcombe(Wilson score)方法计算区间,在样本较小或转化率接近 0%/100% 时,比教材常见的简单正态近似(Wald 区间)更稳健,不会出现"下界为负"这类不合理结果。
  • 同时看绝对差(百分点)相对提升(%):转化率从 1% 涨到 2%,相对提升是 100%,但绝对差只有 1 个百分点——两个数字讲的是不同的故事,报告时都要给。
  • 极端小样本下,p 值和置信区间可能"看起来矛盾"——p 值基于正态近似,置信区间基于 Wilson score,两者不是同一套数学框架。样本量非常小时偶尔会出现 p<0.05 但区间又几乎贴着 0 的情况,这是两种方法各自的已知特性,不是计算错误;样本量极小时,两个数字都要谨慎解读,最好的做法还是积累更多数据。

常见错误

  • 转化数极小(个位数)时,p 值部分仍基于正态近似,结果仅供参考,建议积累更多数据再下结论。
  • 忽略实验时长——即使样本量"够了",如果测试没有跑满至少一个完整的业务周期(例如一整周,覆盖工作日和周末),结果可能被时间因素污染。
  • 只看相对提升不看绝对基数——小基数上的"翻倍"往往在业务上没那么震撼,决策前换算成绝对数字看看实际影响。
  • 同时盯着好几个指标找显著——如果你同时监控转化率、客单价、停留时长等一堆指标,测试的指标够多,总有一个会因为随机波动"显著",这叫多重比较问题。正确做法是测试前就定好一个主要指标,其他指标作为参考观察,不要在一堆指标里挑一个显著的当结论。

样本量计算器

根据基线转化率和你想检测出的最小效应(MDE),估算每组所需样本量。这是做 A/B 测试该用的公式。

当总体规模有限(例如内部员工调研、老客户名单)时,计算所需抽样数量(有限总体修正)。

怎么读这个结果 & 常见错误

两个模式的区别(最容易搞混的地方)

  • A/B 测试模式回答的问题是:"我要每组抽多少人,才能有把握地测出两个版本之间某个大小的差异?"——这里面包含"检测效应"这个概念,需要你先假设一个基线转化率和想抓住的最小提升幅度(MDE)。
  • 总体调查模式回答的是完全不同的问题:"我有一个已知规模的总体,要抽多少样本才能让调查结果的误差控制在某个范围内?"——这里没有"对比两组"的概念,纯粹是描述性抽样。
  • 两者公式不能互换使用——拿总体调查的样本量去跑 A/B 测试,几乎总是会低估你实际需要的样本量,因为它根本没考虑"检测两组差异"这件事所需的统计功效。
  • A/B 测试模式的公式假设两组均分流量(各 50%)——如果你的实验设计是不均分流量(比如 90/10),实际所需的总样本量会比这里算出的更多,需要用非均分版本的公式重新计算。

常见错误

  • MDE 设得越小,需要的样本量越大,且不是线性增长——如果你想测出很微小的差异,样本量可能会大到不现实,这时候应该重新考虑要检测的效应大小是否合理。
  • 算出样本量后,还要跑满至少一个完整业务周期——即使提前触达了目标样本量,如果只跑了 2 天就停,结果仍可能被时间因素(比如周末流量结构不同)干扰。

检验功效计算器

已知每组样本量时,反推该实验能达到的统计功效(真实存在差异时,你有多大概率能发现它)。

怎么读这个结果 & 常见错误

怎么读

  • 功效(Power)< 80% 意味着:即使两个版本之间真的存在你输入的这个差异,你的实验设计也有相当大的概率检测不出来(假阴性)——这不是"没有差异"的证据,只是"这次实验设计没能力发现它"。

常见错误

  • 事后功效计算(post-hoc power)——很多人在实验跑完、结果不显著后,回头算一下"功效",用来给不显著的结果找补。这个用法在统计学界是有争议的,正确的用法是在实验开始前用它来规划样本量,而不是事后为结果辩护。
  • 把"功效不足"当成"两组没有差异"的证据——这是两码事:功效不足只说明这次实验没有足够的把握去发现差异,并不能说明差异不存在。