⚖️

Calculadora de Test A/B de YouTube

Calcula la significancia estadística de un test de miniaturas — sabe si el ganador es real, no suerte.

Miniatura A

CTR

4.00%

Miniatura B

CTR

5.20%

🏆

Ganador: B

+30.0% de mejora · 100.0% de confianza

p-value

0.0001

z-score

4.05

Usa un test z de dos proporciones. Un resultado es 'significativo' al 95% de confianza (p < 0.05) — el estándar para tests A/B.

Las pruebas A/B de miniaturas son donde los creadores se engañan más a menudo. Una miniatura nueva consigue una tasa de clics más alta durante un día, el creador la declara ganadora y cambia, pero la diferencia era ruido, no señal, y la «ganadora» no rinde mejor con el tiempo. El problema es estadístico: las muestras pequeñas producen grandes oscilaciones aleatorias, y la intuición humana es pésima distinguiendo un efecto real de la suerte. Esta calculadora aplica una prueba de significación a los datos de clics de tus dos miniaturas, diciéndote si la diferencia que ves es genuinamente significativa o solo el tipo de variación que aparece por azar.

Cómo funciona la calculadora

Introduce las impresiones y los clics que recibió cada miniatura. La calculadora computa la tasa de clics de cada versión y luego ejecuta una prueba de significación estadística para determinar la probabilidad de que la diferencia observada ocurriera por azar. Si esa probabilidad es lo bastante baja —convencionalmente por debajo del 5%— el resultado se considera significativo y la ganadora es probablemente real. Si no, la conclusión honesta es que aún no tienes datos suficientes para decidirlo, por tentador que se vea el número que va delante.

La prueba de significación

CTR = clics ÷ impresiones Prueba: ¿es CTR_B genuinamente mayor que CTR_A, o el hueco está dentro del ruido aleatorio? p-valor < 0,05 → significativo, ganadora probablemente real p-valor ≥ 0,05 → datos insuficientes, sigue probando Muestras pequeñas → oscilaciones enormes → falsos ganadores

La idea central es que la tasa de clics es una proporción, y las proporciones de muestras pequeñas son tremendamente inestables. Con 100 impresiones, una diferencia de CTR entre 5% y 7% es casi con certeza ruido: necesitarías miles de impresiones por versión antes de que ese hueco sea fiable. La prueba de significación formaliza esto: tiene en cuenta tanto el tamaño de la diferencia como la cantidad de datos detrás, por lo que una ventaja de CTR de 2 puntos puede ser significativa con 10.000 impresiones y no significar nada con 200. El tamaño de la muestra hace la mayor parte del trabajo.

Lo que conviene saber sobre probar miniaturas

  • 1Las muestras pequeñas producen falsos ganadores constantemente. El error de prueba más común es declarar victoria tras unos cientos de impresiones, cuando la variación aleatoria sola puede producir un hueco de CTR del 30% que se evapora a escala. Espera a que la prueba de significación se supere antes de actuar: la impaciencia que cambia pronto es exactamente lo que hace que las pruebas A/B parezcan poco fiables.
  • 2Prueba una variable a la vez o no aprendes nada. Si la miniatura nueva cambia la imagen, el texto y los colores a la vez, una victoria te dice que la combinación funcionó pero no por qué, y no puedes llevar la lección adelante. Aislar un solo cambio —solo el texto, solo la expresión facial— es lo que convierte una prueba en conocimiento transferible.
  • 3La fuente de tráfico contamina las comparaciones. El CTR de una miniatura difiere entre feed, sugeridos y búsqueda, así que si tus dos versiones se mostraron a mezclas de tráfico distintas, estás comparando condiciones, no miniaturas. El Test & Compare integrado de YouTube maneja esto rotando de forma justa; los cambios manuales de antes-y-después no, lo que los hace mucho menos fiables.
  • 4El CTR absoluto depende del contexto; solo importa la comparación relativa. Un CTR «bueno» varía por nicho, tamaño de canal y de dónde vienen las impresiones, así que perseguir un objetivo universal es inútil. Lo que una prueba te dice es cuál de tus dos opciones es mejor para tu audiencia: la comparación es la señal, el número absoluto es solo contexto.
  • 5Una victoria de CTR significativa aún tiene que sobrevivir a la retención. Una miniatura que gana clics pero atrae a los espectadores equivocados puede perjudicar el vídeo, porque clics seguidos de salidas rápidas señalan insatisfacción al algoritmo. La ganadora real es la miniatura que mejora la tasa de clics sin dañar el tiempo de visualización, así que comprueba ambos antes de comprometerte con la versión que favorece la prueba de CTR.

Preguntas frecuentes

¿Cuántas impresiones necesito para fiarme de una prueba de miniatura?

Depende de cuán grande sea la diferencia verdadera, pero como regla necesitas miles de impresiones por versión antes de que un hueco de CTR sea fiable, y a menudo decenas de miles para una diferencia pequeña. Unos cientos de impresiones pueden mostrar una ventaja de aspecto dramático que es puro ruido. La prueba de significación de esta calculadora te dice específicamente si tu muestra actual es suficiente, lo que es más útil que cualquier umbral fijo porque tiene en cuenta tanto tu tamaño de muestra como el del hueco.

¿Qué significa realmente aquí la significación estadística?

Es la probabilidad de que la diferencia que observaste entre las dos miniaturas ocurriera por puro azar. Un p-valor por debajo del 5% significa que hay menos de un 5% de probabilidad de que el hueco sea una casualidad aleatoria, así que la ganadora es probablemente real. Un p-valor por encima significa que los datos aún no pueden distinguir un efecto genuino de la suerte. La significación no es certeza: es un umbral disciplinado para decidir cuándo la evidencia es lo bastante fuerte para actuar.

¿Por qué mi miniatura ganó al principio y luego dejó de ganar?

Casi con certeza porque la ventaja temprana era ruido. Las muestras pequeñas oscilan salvajemente, así que una miniatura puede parecer un 40% mejor durante los primeros cientos de impresiones por puro azar, y luego regresar a su rendimiento real según llegan más datos. Esta es la trampa exacta que la prueba de significación existe para prevenir: te impide actuar sobre una ventaja temprana que aún no se ha probado contra la aleatoriedad de los números pequeños.

¿Debería usar el Test & Compare de YouTube en su lugar?

Para probar miniaturas en vivo, sí: el Test & Compare integrado de YouTube rota tus miniaturas de forma justa a través del mismo tráfico y mide cuál genera más tiempo de visualización, lo que evita la contaminación de fuente de tráfico que sufren los cambios manuales. Esta calculadora es para cuando tienes datos de clics en bruto de dos versiones —de una prueba externa, un cambio manual pasado u otra plataforma— y quieres saber si la diferencia es estadísticamente real en lugar de estimarla a ojo.

¿Es siempre mejor una tasa de clics más alta?

No, y esta es una trampa sutil. Una miniatura puede ganar en clics mientras atrae a espectadores que se van rápido, lo que perjudica el vídeo, porque YouTube lee clic-luego-salida como señal de que el contenido decepcionó. La miniatura que de verdad quieres es la que sube la tasa de clics sin bajar el tiempo de visualización o la retención. Comprueba siempre que una ganadora de CTR también aguanta en retención antes de hacerla permanente: los clics solo valen si los espectadores se quedan.