免费A/B 测试显著性计算器

几秒判断你的分流测试结果是否具有统计显著性。填入两个版本的访客数和转化数,即可看到胜出版本、提升幅度、p 值以及所需的样本量。

置信水平
对照组(A)
0.00%转化率
实验组(B)
0.00%转化率
等待数据请填入两个版本的访客数和转化数以查看结论。
置信度--
提升幅度--
p 值--
样本量--

专业提示。不要在置信度刚越过 95% 的那一刻就停止测试。先确定样本量,再让测试跑完,否则你很可能是在把误报当成胜出。

3 步检验 A/B 测试显著性

一分钟内得到关于分流测试的清晰、统计上站得住脚的结论,不用表格,也不用注册。

  1. 01

    填写对照组数据

    填入版本 A 的总访客数和转化数,也就是你用来对照的原始版本。

  2. 02

    填写实验组数据

    填入新版本 B 的访客数和转化数。转化率会实时更新。

  3. 03

    查看结论

    看看结果是否显著,同时查看提升幅度、p 值和置信度;如果还没达到显著,还会告诉你还差多少访客。

营销人为什么要做显著性检验

转化率更高并不等于分出了胜负。一次规范的显著性检验会告诉你:什么时候可以收,什么时候该继续跑,什么时候结果只是噪声。

知道何时结束测试

用真实的置信度判定胜出版本,而不是靠猜,也不会把真正有效的版本白白放掉。

避免误报

别让「偷看」问题白白烧掉预算。正确的 p 值会告诉你差异何时是真实的。

规划下一次测试

样本量提示会准确告诉你,距离一个可靠结论还差多少数据。

更清爽的汇报

一键把结果链接分享给团队,让所有人看到同样的数字和同样的置信度。

团队都在哪些场景用 A/B 测试计算器

从落地页到广告素材,看看营销人如何把一次快速显著性检验用在他们跑的每一个实验上。

落地页测试

对比同一落地页的两个版本,弄清楚哪个标题、哪个首屏或哪个 CTA 真正拉动了转化率。

Facebook 与 Meta Ads

用真正的统计依据在两个广告素材或两个受众之间做决定,而不是依赖广告管理工具给出的标签。

Google Ads 文案测试

对比两个自适应搜索广告版本,在加大预算前确认新标题确实胜过对照组。

邮件主题行测试

先把两个主题行发给名单中的一小部分人,在全量群发前有把握地选出胜出版本。

结账流程测试

验证新的结账步骤、信任标识或追加销售是否真的提升了完成率,而不只是噪声。

定价页实验

在两种定价方案或两种排版之间跑一次干净的测试,用注册量而不是直觉来做决定。

常见问题

统计显著性衡量的是:你能有多大把握认为两个版本之间的差异是真实的,而不只是随机波动。常见的经验法则是,当置信度达到 95% 或更高时才判定胜出版本,也就是结果出于偶然的可能性低于 5%。
p 值是指:假如两个版本之间本来就没有真实差异,你观察到当前结果(或更极端结果)的概率。p 值越小,说明差异真实存在的证据越强。p 值为 0.05 对应 95% 置信度。
多数营销人使用 95% 置信度,也就是接受 5% 的误报概率。如果决策风险很高(例如把改动推给全部付费流量),就用 99%;只有在早期低风险实验中才用 90%。
这取决于你的基准转化率,以及你想识别出多大的提升幅度。粗略来说,小幅提升(低于 5%)每个版本需要数万名访客,而较大的提升(20% 以上)几千人就能确认。我们的计算器会告诉你:按当前观察到的效果,还需要多少访客才能达到显著。
提升幅度是两个版本转化率之间的相对百分比差异。如果版本 A 的转化率是 3%,版本 B 是 4.5%,那么 B 相对 A 的提升幅度就是 50%。你实际上正是用提升幅度来判断一个改动值不值得上线。
仅仅转化率更高还不够。你需要足够的数据,才能让这个差异不太可能来自随机波动。提升幅度越小,需要的访客就越多。测试停得太早,你可能会把纯粹的噪声当成改进上线。
偷看是指反复查看测试结果,一旦置信度越过 95% 就立刻停止。这样做会大幅推高误报率。要避免它,先在开始前确定所需样本量,然后在结束时只看一次结果。
适用。显著性是一个通用统计量,因此只要你能测量访客(或展示、点击、发送量)和转化,这个计算器就能用于任何 A/B 测试。把 Meta Ads、Google Ads、TikTok Ads、邮件平台或落地页分析中的数字填进来即可。
免费。A/B 测试显著性计算器 100% 免费,无需注册、没有次数限制、不索取邮箱。个人或商业用途都可以随意使用。
不会。所有计算完全在你的浏览器中完成。访客数和转化数永远不会离开你的设备,也永远不会发送到我们的服务器。

无需信用卡

LanderLab 标识