cro-ab-testing-experimentation · FIELD NOTES

Significancia estadística para escépticos: cuando un resultado plano gana

La mayoría de los tests A/B terminan sin diferencias significativas. Qué significa realmente un resultado plano y cuándo es precisamente la señal de éxito que buscabas.

SIGUIENTE ARTÍCULOEl squircle en CRO móvil: superelipses y fricción cognitivaIlustración editorial abstracta sobre diseño de producto digital y experimentación.

El resultado más frecuente de un test A/B bien ejecutado es nada. No aparece una diferencia significativa, los intervalos se solapan y el dashboard se niega educadamente a declarar un ganador. Muchos equipos interpretan esto como un fracaso, lo comunican pidiendo disculpas y dejan de experimentar poco a poco. Las tres reacciones interpretan mal los datos, y ese error cuesta más que el test plano.

Esta es una guía para escépticos sobre resultados planos: qué deberíamos esperar según las tasas base, qué afirma realmente “no existe una diferencia significativa” y en qué situaciones una lectura plana es la señal de éxito que queríamos encontrar.

Primero, calibra tus expectativas: lo plano es la norma

Los datos públicos más sólidos proceden de Ronny Kohavi, que construyó plataformas de experimentación en Microsoft, Bing y Airbnb. En el programa de Microsoft, aproximadamente un tercio de las ideas produjo un resultado positivo estadísticamente significativo, otro tercio quedó plano y el resto fue significativamente negativo. La tasa de éxito de Bing era todavía menor. Más recientemente, Kohavi ha situado en alrededor del 10% la proporción de experimentos que mueve la métrica objetivo en una organización mediana.

Conviene recordar ese segundo número porque tiene una consecuencia incómoda. Con una tasa base de éxito del 10% y umbrales convencionales, el riesgo de falso positivo ronda el 22%: aproximadamente una de cada cinco “victorias significativas” puede ser falsa. La primera lección escéptica funciona en ambas direcciones: hay que sufrir menos ante los planos y celebrar con algo menos de euforia los ganadores.

La recompensa de atravesar tantos experimentos fallidos es real. El conocido test de titulares publicitarios de Bing, un cambio tan poco prometedor que permaneció meses en el backlog, incrementó los ingresos un 12% y generó más de 100 millones de dólares anuales. Solo encuentras resultados así si ejecutas suficientes tests como para aceptar muchos planos durante el camino.

Qué dice realmente un resultado plano

“No estadísticamente significativo” significa que, si en realidad no existiera ninguna diferencia, unos datos como los observados no resultarían sorprendentes. No significa que las variantes sean iguales. Significa que cualquier diferencia es menor de lo que el tamaño de la muestra permite detectar con fiabilidad.

Ese umbral —el efecto mínimo detectable o MDE— se fijó, de manera explícita o accidental, cuando decidiste cuánto tiempo ejecutar el test. Un resultado plano en un test sin potencia suficiente informa principalmente sobre tu tráfico, una dinámica que explico con cifras reales en cómo se ve un test A/B cuando no tienes suficientes datos.

De aquí salen dos reglas. Primera: nunca interpretes un resultado plano sin declarar el MDE. “No detectamos diferencias y teníamos potencia para detectar cualquier cambio superior al 8%” aporta información. “No hubo diferencia” es ruido vestido con traje.

Segunda: respeta la regla de parada definida de antemano. Revisar el test a diario y detenerlo en cuanto aparece significancia aumenta mucho la tasa de falsos positivos. Es la trampa que Evan Miller documentó en How Not To Run an A/B Test y convierte tests realmente planos en ganadores ficticios.

Cuándo un resultado plano es la victoria

Existe una clase de experimentos cuya hipótesis es de no inferioridad: quieres demostrar que la nueva versión no es peor porque mejora algo que la métrica primaria no captura. En esos casos, mantener plana la métrica principal es precisamente la forma que tiene el éxito.

  • La variante más barata. Eliminaste un widget externo, un script pesado o un paso con coste operativo. La conversión se mantiene: publícala. Has conseguido los mismos ingresos con menos coste y complejidad.

  • La simplificación. El nuevo formulario tiene cuatro campos en lugar de nueve. Una conversión plana con menos mantenimiento y un código más limpio es una victoria que acumula valor silenciosamente.

  • La comprobación de riesgo. Texto legal, una nueva presentación del precio o un elemento de rebranding. El test era un seguro para comprobar que el cambio no dañaba el negocio. Plano significa vía libre.

  • El mito desmontado. Alguien estaba convencido de que el carrusel, el vídeo o el badge sostenía la conversión. El resultado demuestra que no. Ahora puedes eliminarlo y la siguiente discusión será más corta.

Una disciplina mantiene esto honesto: declara la no inferioridad antes de ejecutar el test, no después. “No perjudicó nada” puede convertirse fácilmente en una excusa para lanzar preferencias personales sin evidencia. La diferencia está en si “plano = éxito” formaba parte de la hipótesis o apareció como consuelo posterior.

Las métricas de guardrail también importan. Una primaria plana acompañada por el deterioro de una métrica de seguridad sigue siendo una derrota, justo el territorio de las métricas que no estás vigilando.

Cómo comunicar un plano sin pedir perdón

Un resultado plano bien comunicado incluye el MDE, el planteamiento de no inferioridad cuando corresponda, la lectura de los guardrails y una decisión: publicar la variante más barata, mantener el control o diseñar una intervención con un cambio mayor.

Presentado así, se entiende por lo que es: el experimento hizo su trabajo. Su trabajo era responder una pregunta y la respuesta llegó. Desarrollé una plantilla completa en la madurez profesional de comunicar un test inconcluso y una estrategia para poco tráfico en CRO cuando todavía no tienes tráfico.

La consecuencia

Si aproximadamente un tercio de los tests honestos termina plano, la métrica principal de un programa de experimentación no puede ser su porcentaje de ganadores. Perseguir esa cifra solo enseña a los equipos a probar cambios pequeños, seguros e imposibles de refutar.

Un KPI mejor es el número de decisiones validadas por trimestre. Un resultado plano que elimina una mala idea, reduce el riesgo de un lanzamiento o autoriza una simplificación debe contar con todo su valor. La significancia es un filtro aplicado a la evidencia, no un veredicto sobre si el trabajo merecía hacerse.

Más sobre este tema

cro · ab · testing · experimentationEl coste del FOUC: cómo el parpadeo invalida un test A/Bframer · cms · technical · seoPor qué dejé Framer por un sitio estático en Vercel asistido por IAframer · cms · technical · seoCómo migrar de Framer a un sitio estático en Vercel asistido por IA