A/Bn测试中的统计计算
本文记录了Adobe Target中手动A/Bn测试中使用的详细统计计算。 提供了转化率、转化率的置信区间、提升度、提升度的置信区间、置信度和 贝叶斯 决策度量的定义。
A/B测试(手动)活动支持目标和设置中为每个活动选择的两种统计方法:
韦尔奇t检验
平均性能
下节将说明下图中使用的计算。
显示A/B测试活动的转化率、平均提升度和置信区间以及置信度的目标报告。
转化率和每位访客带来的收入(RPV)促销活动
下图显示了Target报表中的转化率、转化率的置信区间和 转化 的数量。 例如,第一行显示对于体验A:转化率为25.81%,置信区间为±7.7%,共记录了32次转化。 考虑到有124位访客查看了此体验,则相当于32/124 = 25.81%。
实验中每个体验 ν 的转化率或平均值,μν定义为量度总和与分配给该量度的单位数的比率Nν:
这里,
-
Yiν是分配给给定体验 ν 的每个单位 i 的度量值。
-
单位 i 的总和取决于计数方法的选择。
- 如果将 访客 用作计数方法,则每个单位都是一个独特访客,该访客被定义为活动生命周期中的独特参与者。
- 如果将 访问次数 用作计数方法,则每个单位都是唯一访问,它在Target会话(具有唯一的
sessionId)期间定义为体验中的唯一参与者。 当sessionId发生更改或访客完成转化步骤时,即会计为新访问。 - 如果将 活动展示次数 用作计数方法,则每个单位都是定义为每次访客加载活动的任何页面时的唯一展示次数。
平均/转化率的置信区间
转换率的置信区间被直观地定义为与基础数据一致的可能转换率的范围。
运行实验时,给定体验的转化率是“真”转化率的估计。 为了量化此估计中的不确定性,Target使用置信区间。 Target始终报告95%的置信区间,这意味着最终,95%的置信区间计算中包含体验的真实转化率。
当前领先或入选的体验旁边也会报告“置信度”数字。 此数字仅报告到领先体验的 置信度 达到至少60%为止。 如果活动中存在两个体验,则此数字表示该体验表现优于其他体验的置信水平。 如果活动中存在两个以上的体验,则该数字表示体验表现优于定义的“控制”体验的置信水平。 如果“控制”体验获胜,则不会报告“置信度”数字。
转化率 μν 的95%置信区间定义为值的范围:
其中平均值的标准误差定义为
当使用样本标准差的无偏估计时:
如果促销活动是转化率促销活动(即,转化量度是二进制的),则标准错误将减少为:
提升度
下图显示了Target报表中的 提升 和 提升 的置信区间。 数字表示提升度范围的平均值,箭头反映提升度是正还是负。 箭头以灰色显示,直到置信度超过95%。 置信度超过阈值后,箭头会根据提升度为正值或负值显示为绿色或红色。
体验 ν 和控制体验 ν0 之间的提升是转化率的相对“增量”,其定义为
倘个别兑换率定义见上文。 更简单地说,
Lift(Experience N) = (Performance_Experience_N - Performance_Control)/ Performance_Control
如果控制体验 ν0 的转化率为0,则没有提升。
Confidence Interval of Lift
平均提升度和置信区间列中的箱形图图形表示提升度的平均值和95% 置信区间。 当给定非控制体验的置信区间与控制体验的置信区间存在任何重叠时,箱形图呈灰色。 当给定体验的置信区间范围高于或低于控制体验的置信区间时,箱形图呈绿色或红色。
体验 ν 与控制体验 ν0 之间提升度的标准误差定义为:
那么提升度的95%置信区间为:
此计算使用“Delta”方法,并在本文档🔗中详细介绍了
置信度
最后一列显示Target报表中的置信度。 在空假设为真的情况下,体验的置信度是获得极端结果的概率(用百分比表示),就像观察到的结果一样。 就p值而言,显示的置信度为1 - p值。 直觉上,较高的置信度意味着控制体验和非控制体验具有相等转化率的可能性较小。
在Target中,在测试体验和控制体验之间执行双尾Welch的t检验,以测试测试和控制体验的方法是否相同。 由于在运行试验之前,我们通常不知道两组样本的大小和差异是否相同,并且Target还允许您向每个体验发送不相等的流量百分比,因此我们不假设每个体验的差异是相等的。 因此,韦尔奇的t检验被选作学生的t检验。
为进行Welch的t检验,首先计算t统计量和自由度,然后进行双尾t检验以生成p值。 最后,根据p值计算置信度。
将 t 统计量定义为任意两个独立随机变量 ν 和 ν0 的均数除以差值的标准误差:
其中 μv 和 μv0 分别为 ν 和 ν0 的均值,并给出 μv 和 μv0 之间差值的标准误差:
其中 σ2v 和 σ2v0 是两个体验 ν 和 ν0 的变差,Nv和 Nv0 分别是 ν 和 ν0 的样本大小。
对于Welch的t检验,自由度计算如下:
ν和 ν0 的自由度定义为:
然后,可以从t — 分布尾部的区域计算p值:
最后,Target中报告的置信度定义为:
贝叶斯统计
Bayesian活动的报告不是根据近似分布计算p值,而是将结果表示为概率,由每个体验的目标量度的完整后验分布计算。 这使得连续监视 Bayesian 报告是安全的,因为在达到固定样本大小之前检查结果时没有统计惩罚,并且它可以在比 Welch的t检验 更小的样本上更快地收敛。
Bayesian方法还允许营销人员根据过去试验和控制变体的结果引入假设。
Bayesian方法仅适用于主要目标指标为 转化 的活动,具有 收入 或 参与 主要目标的活动始终使用Welch的t检验。 有关选择方法的详细信息,请参阅目标和设置。
平均提升度和可信区间
在 Bayesian 活动中,平均提升度和可信区间一起衡量性能改进及其不确定性。 平均提升度是处理方法和控制之间的平均百分比变化,而可信区间定义了真实提升度以指定概率下降的范围。
击败控制项的机会
击败控制体验的机会是体验的目标量度优于 控制体验 的概率,例如,“92%的机会B击败A”。 这是 Bayesian 活动的主要决策量度:挑战者体验是当 Control 的 胜出机会 达到该活动的决策阈值时替换该体验的候选体验。
脱机执行计算
下载的 CSV 报表仅包含原始数据,而不包含计算量度,如 A/B 测试中使用的每位访客带来的收入、提升度或置信度。
要计算这些统计量,请下载Target 完整置信度计算器 Excel文件以输入活动的值。