跳转到主要内容
← 返回文章列表

开发者资源

为什么您的产品页面优化测试始终达不到置信度

为什么 App Store 产品页面优化测试会卡在 90% 置信度以下、一个测试到底需要多少展示次数,以及如何设计一个能在 90 天内完成的测试。

您设置了一个产品页面优化测试,已经运行了好几周,置信度却始终到不了 90%。有时提升数字甚至会从 +12% 翻到 −3%,然后又翻回来。

测试并没有坏。原因几乎总是以下两者之一:展示次数不够,或者改动太小,测不出来。本指南会告诉您一个测试到底需要多少展示次数,以及如何设计一个能在 Apple 90 天期限内完成的测试。


App Store Connect 中的“置信度”是什么意思 #

对于每个处理方式,App Store Connect 会显示展示次数、转化率、相对原始版本的提升,以及置信度。当处理方式达到 90% 置信度 时,Apple 会将其标记为表现更好或更差。

通俗地说,90% 置信度意味着您看到的差异不太可能是随机运气造成的。低于这个水平时,处理方式可能真的更好,也可能您看到的只是噪声。Apple 建议至少等到一个处理方式达到 90% 后再应用它。

达到 90% 后,测试不会自动停止。它会一直运行,直到您手动停止、应用某个处理方式,或者满 90 天。


一个测试需要多少展示次数 #

测试所需的展示次数,主要取决于您想检测多大的提升。下表基于 90% 置信度和 80% 统计功效的标准双比例检验。Apple 并未公布其确切算法,所以请把这些数字当作规划估算,而不是保证。

每个处理方式所需的展示次数(原始版本也需要同样的数量):

当前转化率 提升 +5% 提升 +10% 提升 +20% 提升 +30%
2% 248,000 64,000 17,000 7,700
3% 164,000 42,000 11,000 5,100
5% 96,000 25,000 6,400 3,000

有两点很明显:

  1. 想检测的提升减半,所需展示次数大约翻四倍。 检测 +5% 所需的展示次数,大约是检测 +20% 的 15 倍。
  2. 转化率越低,需要的流量越多。 越少发生的事件越难测量。

换算成天数 #

下面把同样的计算换算成天数,假设转化率为 3%、一个处理方式、50% 的流量分配给测试:

每日展示次数 提升 +5% 提升 +10% 提升 +20% 提升 +30%
500 656 天 ❌ 168 天 ❌ 44 天 21 天
2,000 164 天 ❌ 42 天 11 天 6 天
10,000 33 天 9 天 3 天 2 天

一个每天只有 500 次展示的 App,无论等多久,都无法在 90 天内检测出 10% 的提升。这正是测试始终达不到置信度最常见的原因:它从一开始就不可能达到。

在免费的 App Store A/B 测试计算器中试试您自己的数据。它还会显示您的流量在 90 天内能检测到的最小提升。


让测试顺利完成的五种方法 #

1. 测试更大的改动 #

这是迄今为止最有效的手段。不要只改说明文字中的一个词,而是整张换掉第一张截图,或者换掉整套说明文字风格。一个可能让转化率变化 20% 或更多的大胆改动,在一般的流量下也能测出来;只值 3% 的微调则测不出来。我们整理的 25 个截图 A/B 测试点子里有很多大胆的点子。

2. 减少处理方式数量 #

每个处理方式都需要完整的展示次数。以每天 2,000 次展示、10% 的提升、50% 流量分配给测试为例,一个处理方式大约需要 42 天。三个处理方式大约需要 126 天,超出了上限。如果流量紧张,一次只测一个处理方式。

3. 给测试分配更多流量 #

只有一个处理方式时,50/50 的分配最快。处理方式更多时,就要给测试分配更多流量:最快的分配方式是让每个版本获得相同数量的访客,两个处理方式时测试占 67%,三个时占 75%。在上面的例子中,三个处理方式从 50% 提高到 75%,测试时长就从 126 天缩短到 84 天。

代价是:如果某个处理方式表现更差,测试期间会有更多人看到它。

4. 在流量集中的地方测试 #

测试包含您所选择的本地化语言,只有来自这些市场的展示次数才会被统计。只在一个小市场测试,就意味着要等待那个市场的流量。请从流量最高的市场开始,或者把您预期反应相同的几个市场一起纳入测试。参见如何对本地化截图进行 A/B 测试。

5. 按整周运行,中途别去动它 #

工作日和周末的访客行为不同,所以即使数字看起来早早有了结论,也至少要完整运行一到两周。另外,不要在刚突破 90% 的第一天就停止测试。每天查看、一看到好看的数字就停下,会让虚假胜出的概率大大增加。


什么时候该放弃一个测试 #

如果测试已经获得了您估算所需的展示次数,置信度却仍然很低,那这本身就是结果:这个处理方式带来的差异不够大,不值得在意。停止测试,保留原始版本,然后尝试一个更大胆的点子。这不是失败的测试。您由此得知,这项改动对您的用户来说并不重要。


让测试成本低到可以反复进行 #

流量决定了您一年能跑多少个测试,所以每一个都应该物有所值。制作处理方式不应该拖慢您。在 Screenshot Studio 中,一次设计改动会应用到所有语言和设备尺寸,处理方式可以直接上传到您的产品页面优化测试。也请读一读浪费测试的产品页面优化错误。

👉 下载 Screenshot Studio →

常见问题

产品页面优化使用什么置信度水平?

当处理方式达到 90% 置信度时,Apple 会将其标记为表现优于或差于原始版本。Apple 建议至少等到一个处理方式达到这一水平后再应用它。

产品页面优化测试应该运行多久?

至少运行到有一个处理方式达到 90% 置信度,并且至少完整运行一到两周,确保工作日和周末的访客都被统计在内。一个测试最长可以运行 90 天。如果您估算的时长超过这个上限,请调整测试设计,而不是寄希望于运气。

App Store A/B 测试需要多少展示次数?

主要取决于您想检测的提升幅度。在 3% 的转化率下,检测 20% 的提升每个处理方式大约需要 11,000 次展示,10% 的提升约需 42,000 次,5% 的提升约需 164,000 次。这些是基于标准双比例检验得出的规划估算。

为什么测试显示提升很大,置信度却很低?

在早期,多几次下载就会让百分比大幅波动。在每个处理方式积累足够的展示次数之前,提升数字噪声很大。置信度低意味着这个差异仍可能是偶然造成的,所以暂时不要应用这个处理方式。

开发者资源

加入其他开发者,节省时间

无需设计技能。告别 Figma 导出噩梦。告别手动上传。