第 15 个工具 — 免费,不用注册
跑多久才算数。
两比例z检验,正着算和反着算都能来。每个素材需要多少展示,CTR的差距才是真的;以及你手上这个差距,是不是真的。
链接里带着这一页所有的数字。我们这边什么都不存。
把测试设计好
CTR、安装率,这次测试测的是哪个就填哪个。
除非你真的不在乎 B 更差,否则就用双侧。
含对照组。多出来的变体会按 Bonferroni 对照对照组做校正。
精度的价钱
每个变体的样本量(两轴均为对数)
| 效应 | 目标值 | 每变体 | 合计 | 跑多久 |
|---|
想检测的效应减半,样本量大约要翻两番。小提升配小测试永远跑不完,原因就这一个。
读一个已经跑完的测试
假设每个变体样本量相同,沿用上面设定的置信度和单双侧。
—z 统计量
—p 值
—差值
—置信区间
为什么中途偷看是错的
每看一次正在跑的测试、每决定一次要不要停,就等于又给随机噪声一次越过显著线的机会。天天盯的测试冒出“赢家”的频率,远高于置信度承诺的那 5%。开跑前把样本量定死,到了再看一次;如果确实需要提前停,就用为此设计的序贯方法,而不是这一页的固定样本量算法。
算法与注意事项
- 每变体样本量 =(zα√(2p̄(1−p̄)) + zβ√(p₁(1−p₁)+p₂(1−p₂)))² ÷ (p₂−p₁)²,其中 p̄ 是两个比率的均值。
- 双侧检验时 zα 用 α/2;Bonferroni 会把 α 除以与对照组比较的次数。
- 反向那一栏用的是合并的两比例 z 检验;置信区间则用不合并的标准误,这是惯常的搭配。
- 正态分位数取自 Acklam 的有理逼近,再做一次 Halley 迭代;CDF 用的是 Abramowitz & Stegun 26.2.17。两者的精度都远超这里显示的位数。
- 这里假设展示之间相互独立,实际并不是:同一个人两次看到同一个素材,等于把一个人的意见数了两遍,所以真实测试的效能会比这里写的略低一点。
- CTR 上的显著差异不等于安装量的差异,更不等于留存的差异。CTR 赢的素材,有时带来的是更差的玩家。