企业站做 AB 测试的现实前提:样本量够不够
多数企业官网的流量不足以支撑 AB 测试。本文说明需要多少样本、流量不足时该怎么判断改动好坏,以及常见的提前看结果问题。
- AB 测试需要足够样本才能分辨真实差异与随机波动,多数企业官网不满足。
- 转化率越低、要检出的提升越小,所需样本越多,通常每组需数千次访问。
- 反复查看并在看到想要结果时停止,会显著提高得出错误结论的概率。
- 流量不足时改做大改动、定性观察或漏斗绝对流失分析,比勉强做测试可靠。
- 为了显得科学而对无争议的改动做测试,只是推迟上线。
AB 测试被当成优化的标准做法,但它有一个很硬的前提:需要足够多的样本才能分辨出真实差异与随机波动。多数企业官网不满足这个前提,而在不满足时做测试,得到的结论往往比不测更有误导性。
需要多少样本
所需样本量取决于三件事:当前转化率、希望检出的提升幅度、以及可接受的误判概率。转化率越低、要检出的提升越小,需要的样本越多。一个粗略的感觉是:基础转化率在百分之几的量级、想检出相对提升两成左右,通常每组需要数千次访问。
把这个数和站点的实际流量对一下。月访问量几千的官网,跑一个测试需要几个月,而这期间市场活动、季节因素、渠道结构都会变,测试本身的前提已经被破坏。
提前看结果是最常见的错误
测试跑了两天,看到 B 版本领先,于是停下来宣布 B 更好。问题在于:转化数据在早期波动极大,任何一组都可能短暂领先。反复查看并在看到想要的结果时停止,会显著提高得出错误结论的概率。
正确做法是在开始前就确定样本量和停止条件,达到之前不看结论,或者使用允许中途查看的统计方法。这一条说起来简单,执行起来需要克制。
流量不足时的替代做法
- 做大改动而不是小改动。按钮文案这类细微调整需要很大样本才能检出,而整页结构重做的效果可能明显到不需要统计检验;
- 用定性方法替代:找五到八个目标用户实际走一遍流程,观察卡在哪里。这类问题往往不需要统计就能看出来;
- 看漏斗各步骤的绝对流失,而不是比较两个版本。某一步流失七成,说明那一步有问题,这个判断不依赖 AB 对比;
- 按时间段前后对比,接受它不如 AB 严谨,但在改动幅度大时仍有参考价值。
什么情况下值得做
流量确实大、改动确实存在争议、而且结果会影响后续较大投入时,AB 测试是值得的。为了「科学一点」而对一个没人反对的改动做测试,只是推迟上线。
常见问题
小网站能做 AB 测试吗?
通常不建议。所需样本量取决于当前转化率与希望检出的提升幅度,基础转化率在百分之几、想检出两成相对提升时,每组往往需要数千次访问。月访问几千的站点要跑几个月,期间外部条件已经变化,测试前提被破坏。
测试多久可以看结果?
应在开始前就确定样本量与停止条件,达到前不看结论。中途反复查看并在领先时停止,是导致假阳性的主要原因。若确需中途监控,应使用允许多次查看的统计方法而不是直接用常规显著性判断。
流量不够时怎么判断改动好坏?
改做幅度更大的调整,效果明显时不需要统计检验;用五到八位目标用户实际走流程的定性观察发现卡点;看漏斗各步骤的绝对流失定位问题步骤。这些方法都不依赖两组对比。
参考资料
- Web Vitals · web.dev
- SEO Starter Guide: The Basics · Google Search Central