Cálculos estatísticos em testes A/Bn
Este artigo documenta os cálculos estatísticos detalhados usados em testes A/Bn manuais no Adobe Target. As definições são fornecidas para Taxa de Conversão, Intervalo de Confiança da Taxa de Conversão, Aumento, Intervalo de Confiança para Aumento, Confiança e Métricas de decisão Bayesianas.
Uma atividade Teste A/B (Manual) dá suporte a duas metodologias estatísticas, selecionadas por atividade em Metas e Configurações:
-
Teste t de Welch: uma metodologia frequencista que relata uma porcentagem de Confiança e um intervalo de confiança, com base em um teste de hipótese de tamanho de amostra fixo. Usado para atividades com uma meta principal de Receita ou Envolvimento.
-
Bayesiano: relata resultados como probabilidades, como Chance de Controlar e intervalos confiáveis, calculados a partir da distribuição posterior completa da métrica de meta de cada experiência. Esta configuração só está disponível para atividades cuja métrica de meta principal é Conversão.
Teste t de Welch
Desempenho médio
A seção a seguir explica os cálculos usados na ilustração a seguir.
Taxa de conversão e Campanhas de receita por visitante (RPV)
A ilustração a seguir mostra Taxa de Conversão, Intervalo de Confiança da Taxa de Conversão e o número de Conversões em um relatório Target. Por exemplo, a primeira linha mostra que para a Experiência A: a Taxa de Conversão é 25,81% com um Intervalo de Confiança de ±7,7% e 32 conversões foram registradas. Considerando que 124 visitantes visualizaram a experiência, isso equivale a 32/124 = 25,81%.
A taxa de conversão ou a média, μν, para cada experiência ν em um experimento é definida como uma proporção da soma da métrica em relação ao número de unidades atribuídas a essa métrica, Nν:
Aqui,
-
Yiewer é o valor da métrica para cada unidade i atribuída a uma determinada experiência ν.
-
A soma sobre as unidades i depende da escolha da metodologia de contagem.
- Se Visitors for usado como a metodologia de contagem, cada unidade será um visitante único definido como um participante único na atividade durante toda a vida útil da atividade.
- Se Visitas for usada como a metodologia de contagem, cada unidade será uma visita única definida como um participante único em uma experiência durante uma sessão Target (com uma única
sessionId). Quando osessionIdé alterado ou o visitante atinge a etapa de conversão, uma nova visita é contada. - Se Impressões de atividade for usada como a metodologia de contagem, cada unidade será uma impressão exclusiva definida sempre que um visitante carregar qualquer página da atividade.
Intervalo de confiança de Média/Taxa de conversão
O intervalo de confiança da taxa de conversão é intuitivamente definido como um intervalo de taxas de conversão possíveis consistente com os dados subjacentes.
Ao executar experimentos, o índice de conversão para uma determinada experiência é uma estimativa do índice de conversão “verdadeiro”. Para quantificar a incerteza nesta estimativa, Target usa um intervalo de confiança. Target sempre relata um intervalo de confiança de 95%, o que significa que, no final, 95% dos intervalos de confiança calculados incluem o verdadeiro índice de conversão da experiência.
Um número de “Confiança” também é relatado ao lado da experiência principal ou vencedora no momento. Este número é relatado somente até que a Confiança da experiência principal atinja pelo menos 60%. Se duas experiências estiverem presentes na atividade, esse número representará o nível de confiança de que a experiência está tendo um desempenho melhor do que a outra experiência. Se mais de duas experiências estiverem presentes na atividade, esse número representará o nível de confiança de que a experiência está tendo um desempenho melhor do que a experiência de “Controle” definida. Se a experiência de “Controle” estiver ganhando, nenhum valor de “Confiança” será relatado.
Um intervalo de confiança de 95% da taxa de conversão μν é definido como o intervalo de valores:
Quando o erro-padrão da média é definido como
Se for utilizada uma estimativa imparcial do desvio-padrão da amostra:
Quando a campanha é uma campanha de taxa de conversão (ou seja, a métrica de conversão é binária), o erro padrão se reduz a:
Aumento
A ilustração a seguir mostra Aumento e Intervalo de Confiança do Aumento em um Relatório Target. O número representa a média do intervalo dos limites de aumento, e a seta reflete se o aumento é positivo ou negativo. A seta é exibida em cinza até que a confiança passe de 95%. Depois que a confiança ultrapassa o limite, a seta é verde ou vermelha com base em um aumento positivo ou negativo.
O aumento entre uma experiência ν e a experiência de controle ν0 é o “delta” relativo em taxas de conversão, definido como
Em que as taxas de conversão individuais são as definidas acima. De maneira mais simples,
Lift(Experience N) = (Performance_Experience_N - Performance_Control)/ Performance_Control
Se o índice de conversão da experiência de controle ν0 for 0, não haverá aumento.
Confidence Interval of Lift
O gráfico boxplot na coluna Intervalo de aumento médio e de confiança representa o valor médio e 95% Intervalo de confiança de aumento. O boxplot é cinza quando há qualquer sobreposição no intervalo de confiança de uma determinada experiência de não controle com o intervalo de confiança da experiência de controle. O boxplot é verde ou vermelho quando o intervalo de confiança da experiência é acima ou abaixo do intervalo de confiança da experiência de controle.
O erro padrão do aumento entre uma experiência ν e a experiência de controle ν0 é definido como:
Em seguida, o Intervalo de confiança de 95% do aumento é:
Este cálculo usa o método “Delta” e é descrito com mais detalhes neste documento
Confiança
A última coluna mostra a confiança em um relatório Target. A confiança de uma experiência é uma probabilidade (denotada como uma porcentagem) de obter um resultado tão extremo quanto o observado, dada a hipótese nula ser verdadeira. Em termos de valores p, a confiança exibida é de 1 - valor p. Intuitivamente, maior confiança significa que é menos provável que a experiência de controle e não controle tenha taxas de conversão iguais.
Em Target, um teste t de Welch de duas caudas é executado entre a experiência de teste e a experiência de controle para testar se os meios de experiências de teste e controle são os mesmos. Como geralmente não sabemos se os tamanhos e as variações de amostra de dois grupos são os mesmos antes de executar o experimento, e o Target também permite que porcentagens desiguais de tráfego sejam enviadas para cada experiência, não pressupomos que a variação de cada experiência seja igual. Assim, o teste t de Welch é escolhido em vez do teste t de Student.
Para executar o teste t de Welch, primeiro começamos a calcular a estatística t e os graus de liberdade, em seguida, executamos um teste t de duas caudas para gerar o valor p. Por fim, calculamos a confiança com base no valor p.
A estatística t é definida como a diferença entre as médias de quaisquer duas variáveis aleatórias independentes, ν e ν0, dividida pelo erro padrão da diferença:
Onde μv e μv0 são os meios de ν e ν0{10 μ{12 μ, respectivamente, e o erro padrão da diferença entreµ}v eµ}v0 é dado por:
Onde σ2v e σ2v0 são as variações de duas experiências ν e ν0{13 ν{22 ν0, respectivamente, e Nv e Nv0 são tamanhos de amostra para µ} eµ}, respectivamente.**
Para o teste t de Welch, o grau de liberdade é calculado do seguinte modo:
O grau de liberdade para ν e ν0 é definido como:
Em seguida, o valor p pode ser calculado a partir da área na parte traseira da distribuição t:
Finalmente, a confiança relatada em Target é definida como:
Estatísticas bayesianas
Em vez de calcular um valor p a partir de uma distribuição aproximada, o relatório de uma atividade bayesiana expressa resultados como probabilidades, computadas a partir da distribuição posterior completa da métrica de meta de cada experiência. Isso torna seguro monitorar um relatório Bayesiano continuamente, pois não há nenhuma penalidade estatística para verificar os resultados antes de um tamanho de amostra fixo ser atingido, e ele pode convergir mais rápido em amostras menores que o teste t de Welch.
A metodologia Bayesiana também permite que profissionais de marketing se alimentem de uma hipótese com base em suas experiências passadas e resultados para a variante de controle.
A metodologia Bayesiana só está disponível para atividades cuja métrica de meta primária é Conversão, atividades com uma Receita ou Envolvimento meta principal sempre usam teste t de Welch. Para obter mais informações sobre como selecionar uma metodologia, consulte Metas e configurações.
Intervalo médio de aumento e credibilidade
O aumento médio e o intervalo de credibilidade juntos medem a melhora do desempenho e sua incerteza em uma atividade Bayesiana. O aumento médio é a variação percentual média entre um tratamento e o controlo, enquanto o intervalo de credibilidade define o intervalo dentro do qual o aumento verdadeiro se situa a uma probabilidade especificada.
Chance de Controlar
Chance de Superar o Controle é a probabilidade de a métrica de meta de uma experiência superar a experiência Controle, por exemplo, “92% de chance B supera A”. Esta é a principal métrica de decisão para uma atividade Bayesiana: uma experiência desafiante é uma candidata a substituir Controle quando sua Chance de Superar Controle atingir o limite de decisão da atividade.
Execução de cálculos offline
O download do relatório de CSV inclui apenas dados brutos e não inclui métricas calculadas, como receita por visitante, aumento ou confiança usada para testes A/B.
Para calcular essas quantidades estatísticas, baixe o arquivo do Excel Target Calculadora de Confiança Completa para inserir o valor da atividade.