Cálculos estadísticos en Pruebas A/Bn
Este artículo documenta los cálculos estadísticos detallados utilizados en las pruebas A/Bn manuales en Adobe Target. Se proporcionan definiciones para tasa de conversión, intervalo de confianza de la tasa de conversión, alza, intervalo de confianza para la elevación, confianza y bayesiana métricas de decisión.
Una actividad Prueba A/B (manual) admite dos metodologías estadísticas, seleccionadas por actividad en Objetivos y configuración:
-
Prueba t de Welch: una metodología frecuentista que informa un porcentaje e intervalo de confianza de Confianza, basado en una prueba de hipótesis de tamaño de muestra fijo. Se usa para actividades con un objetivo principal Ingresos o Participación.
-
Bayesiano: informa de los resultados como probabilidades, como Posibilidad de control de pulsaciones e intervalos creíbles, calculados a partir de la distribución posterior completa de la métrica objetivo de cada experiencia. Esta configuración solo está disponible para actividades cuya métrica de objetivo principal sea Conversión.
Prueba T de Welch
Rendimiento medio
En la siguiente sección se explican los cálculos utilizados en la siguiente ilustración.
Campañas de tasa de conversión e ingresos por visitante (RPV)
La siguiente ilustración muestra Tasa de conversión, Intervalo de confianza de la tasa de conversión y el número de conversiones en un informe de Target. Por ejemplo, la primera línea muestra que para la Experiencia A: la Tasa de conversión es del 25,81% con un Intervalo de confianza de ±7,7% y se registraron 32 conversiones. Dado que 124 visitantes vieron la experiencia, esto equivale a 32/124 = 25,81 %.
La tasa de conversión de media, , para cada experiencia ** de un experimento se define como una relación entre la suma de la métrica y el número de unidades asignadas a esa métrica, N:
Aquí,
-
Yi es el valor de la métrica para cada unidad i, que se ha asignado a una experiencia determinada **.
-
La suma sobre las unidades i depende de la elección de la metodología de conteo.
- Si se usa Visitantes como metodología de conteo, cada unidad es un visitante único definido como un participante único en la actividad durante toda la actividad.
- Si se usa Visitas como metodología de conteo, cada unidad es una visita única definida como un participante único en una experiencia durante una sesión de Target (con un(a)
sessionIdúnico(a). CuandosessionIdcambia o el visitante llega al paso de conversión, se cuenta una nueva visita. - Si se usa Impresiones de actividad como metodología de contabilización, cada unidad es una impresión única definida como cada vez que un visitante carga una página de la actividad.
Intervalo de confianza de la media/Tasa de conversión
El intervalo de confianza de la tasa de conversión se define de forma intuitiva como un rango de posibles tasas de conversión que es coherente con los datos subyacentes.
Al ejecutar experimentos, la tasa de conversión de una experiencia determinada es de estimación de la tasa de conversión “verdadera”. Para cuantificar la incertidumbre de esta estimación, Target utiliza un intervalo de confianza. Target siempre informa de un intervalo de confianza del 95 %, lo que significa que al final, el 95 % de los intervalos de confianza calculados incluyen la tasa de conversión real de la experiencia.
También se indica un número de “Confianza” junto a la experiencia principal o ganadora actual. Esta cifra solo se registra hasta que Confianza de la experiencia líder alcance al menos el 60 %. Si hay dos experiencias presentes en la actividad, este número representa el nivel de confianza de que la experiencia tiene un mejor rendimiento que la otra experiencia. Si hay más de dos experiencias presentes en la actividad, este número representa el nivel de confianza de que la experiencia tiene un mejor rendimiento que la experiencia de “control” definida. Si la experiencia “Control” es la ganadora, no se informa de ninguna cifra “Confianza”.
Un intervalo de confianza del 95 % de la tasa de conversión se define como el intervalo de valores:
Donde el error estándar de la media se define como
Cuando se utilice una estimación imparcial de la desviación típica de la muestra:
Cuando la campaña es una campaña de tasa de conversión (es decir, la métrica de conversión es binaria), el error estándar se reduce a:
Alza
La siguiente ilustración muestra Alza e Intervalo de confianza del alza en un informe de Target. El número representa la media del rango de los límites del alza, y la flecha refleja si el alza es positiva o negativa. La flecha se muestra en gris hasta que la confianza pasa el 95 %. Una vez que la confianza ha superado el umbral, la flecha aparece en verde o en rojo según un alza positiva o negativa.
El alza entre una experiencia ** y la experiencia de control 0 es el “delta” relativo en las tasas de conversión, definido como
Donde las tasas de conversión individuales son las definidas anteriormente. Más sencillamente,
Lift(Experience N) = (Performance_Experience_N - Performance_Control)/ Performance_Control
Si la tasa de conversión de la experiencia de control 0 es 0, no hay alza.
Confidence Interval of Lift
El gráfico de gráfico de cuadro de la columna Intervalo promedio de alza y confianza representa el valor promedio y el intervalo de confianza del 95 % del alza. El gráfico del cuadro aparece en gris cuando hay alguna superposición en el intervalo de confianza de una experiencia no de control determinada con el intervalo de confianza de la experiencia de control. El gráfico del cuadro es de color verde o rojo cuando el intervalo de confianza de una experiencia determinada está por encima o por debajo del intervalo de confianza de la experiencia de control.
El error estándar del alza entre una experiencia ** y la experiencia de control 0 se define de la siguiente manera:
A continuación, el intervalo de confianza del 95 % del alza es:
Este cálculo usa el método “Delta” y se describe con más detalle en este documento
Confianza
La última columna muestra la confianza en un informe Target. La confianza de una experiencia es una probabilidad (denotada como porcentaje) de obtener un resultado tan extremo como el que se observa, dado que la hipótesis nula es cierta. En términos de valores p, la confianza mostrada es 1 - valor p. De forma intuitiva, una mayor confianza significa que es menos probable que la experiencia de control y la que no es de control tengan tasas de conversión iguales.
En Target, se realiza una prueba t de Welch de dos colas entre la experiencia de prueba y la experiencia de control para comprobar si los medios de las experiencias de prueba y control son los mismos. Debido a que generalmente no sabemos si los tamaños de muestra y las variaciones de dos grupos son iguales antes de ejecutar el experimento y Target también le permite tener porcentajes desiguales de tráfico enviado a cada experiencia, no asumimos que la variación de cada experiencia sea igual. Por lo tanto, se elige la prueba T de Welch en lugar de la prueba T de estudiante.
Para realizar la prueba T de Welch, primero se empieza a calcular la estadística t y los grados de libertad y, a continuación, se ejecuta una prueba T de dos colas para generar el valor p. Finalmente, calculamos la confianza en función del valor p.
La estadística t se define como la diferencia de las medias de dos variables aleatorias independientes, ** y 0, divididas por el error estándar de la diferencia:
Donde v y v0 son los medios de ** y 0 respectivamente, y el error estándar de la diferencia entre v y v0 lo dan:
Donde 2v y 2v0 son las variaciones de dos experiencias y 0 respectivamente, y Nv y Nv0 son tamaños de muestra para y 0 respectivamente.
Para la prueba T de Welch, el grado de libertad se calcula de la siguiente manera:
Y el grado de libertad de ** y 0 se define de la siguiente manera:
A continuación, el valor p se puede calcular a partir del área de las colas de la distribución t:
Finalmente, la confianza notificada en Target se define como:
Estadísticas bayesianas
En lugar de calcular un valor p a partir de una distribución aproximada, el informe de una actividad bayesiana expresa los resultados como probabilidades, calculados a partir de la distribución posterior completa de la métrica objetivo de cada experiencia. Esto hace que sea seguro supervisar un informe bayesiano continuamente, ya que no hay una penalización estadística para comprobar los resultados antes de alcanzar un tamaño de muestra fijo, y puede converger más rápido en muestras más pequeñas que prueba t de Welch.
La metodología Bayesiana también permite a los especialistas en mercadotecnia alimentarse de una hipótesis basada en su experimentación anterior y en los resultados de la variante de control.
La metodología Bayesiana solo está disponible para actividades cuya métrica de objetivo principal es Conversión, las actividades con un objetivo principal de Ingresos o Participación siempre usan la prueba T de Welch. Para obtener más información acerca de cómo seleccionar una metodología, vea Objetivos y configuración.
Alza promedio e intervalo creíble
El promedio de alza y el intervalo creíble juntos miden la mejora del rendimiento y su incertidumbre en una actividad bayesiana. El alza media es el cambio porcentual medio entre un tratamiento y el control, mientras que el intervalo creíble define el intervalo dentro del cual el alza real se encuentra en una probabilidad especificada.
Posibilidad de control de pulsaciones
Posibilidad de batir el control es la probabilidad de que la métrica de objetivo de una experiencia supere a la experiencia Control; por ejemplo, “probabilidad B del 92 % supera a A”. Esta es la métrica de decisión principal para una actividad Bayesiana: una experiencia de aspirante es candidata para reemplazar a Control cuando su oportunidad de vencer al control cumple con el umbral de decisión de la actividad.
Realización de cálculos sin conexión
El informe CSV descargado solo contiene datos sin procesar; no incluye métricas calculadas, como los ingresos por visitante, el alza o la confianza, utilizadas en las pruebas A/B.
Para calcular estas cantidades estadísticas, descargue el archivo de Excel Target Calculadora de confianza completa para introducir el valor de la actividad.