Herramienta 15 — Gratis, sin registro

Cuánto falta para que signifique algo.

Un test z de dos proporciones, en los dos sentidos. Cuántas impresiones por creatividad necesitas para que una diferencia de CTR sea real, y si la que ya tienes lo es.

Planificar el test

CTR, tasa de instalación, lo que estés midiendo.
Usa el bilateral salvo que de verdad te dé igual que B sea peor.
Control incluido. Las variantes extra se corrigen con Bonferroni contra el control.

Lo que cuesta la precisión

Muestra por variante (escala logarítmica en los dos ejes)
Efecto Tasa objetivo Por variante Total Duración

Reducir a la mitad el efecto que quieres detectar multiplica la muestra por cuatro, más o menos. Por eso los tests pequeños sobre mejoras pequeñas no terminan nunca.

Leer un test que ya has hecho

Muestras iguales por variante. Usa la confianza y la lateralidad de arriba.

Estadístico z
Valor p
Diferencia
Intervalo de confianza

Por qué mirar antes de tiempo está mal

Cada vez que miras un test en marcha y decides si lo paras, le das al ruido otra oportunidad de cruzar la línea de significación, así que un test revisado a diario produce un «ganador» mucho más a menudo que ese 5 % que promete tu nivel de confianza. Fija el tamaño de muestra antes de empezar, mira una sola vez cuando lo alcances, y si de verdad necesitas parar antes usa un método secuencial pensado para eso en lugar de las matemáticas de horizonte fijo de esta página.

Cómo funciona / advertencias

  1. Muestra por variante = (zα√(2p̄(1−p̄)) + zβ√(p₁(1−p₁)+p₂(1−p₂)))² ÷ (p₂−p₁)², donde p̄ es la media de las dos tasas.
  2. zα usa α/2 en el test bilateral, y para Bonferroni α se divide entre el número de comparaciones contra el control.
  3. El test inverso es el z-test de dos proporciones agrupadas; el intervalo de confianza usa el error estándar sin agrupar, que es el emparejamiento habitual.
  4. Los cuantiles normales salen de la aproximación racional de Acklam con un refinamiento de Halley; la CDF es Abramowitz & Stegun 26.2.17. Ambas son exactas mucho más allá de los dígitos que se muestran.
  5. Se supone que las impresiones son independientes. No lo son: el mismo usuario viendo la misma creatividad dos veces es una opinión contada dos veces, y eso hace que los tests reales tengan algo menos de potencia de la que dice esto.
  6. Una diferencia de CTR significativa no es una diferencia de instalaciones, y desde luego no es una diferencia de retención. Las creatividades que ganan en CTR a veces traen peores jugadores.