7 min
Editar

La potencia estadística

La potencia estadística (en inglés, statistical power) es la probabilidad de que un estudio detecte un efecto que existe de verdad. Si un fármaco reduce la tensión arterial y se prueba en un ensayo, la potencia es la probabilidad de que el ensayo salga estadísticamente significativo, y su complemento es la probabilidad de que el efecto real pase inadvertido. Depende de tres cosas: el tamaño del efecto, el número de personas estudiadas y el umbral de significación que se haya elegido. Un efecto grande se ve con pocos datos; uno pequeño exige muchos, y con pocos, el estudio es una moneda al aire que además, como se verá, cuando sale cara engaña.

La figura muestra de dónde sale la cifra. Un estudio compara dos grupos y mide la diferencia entre sus medias en desviaciones típicas, que es lo que se llama tamaño del efecto d. Si el efecto no existe, la diferencia que mediría el estudio se reparte según la campana gris, centrada en cero; si existe, según la naranja, centrada en el valor real. Las rayas verticales son los umbrales de significación, y todo lo que cae más allá se declara significativo. El área gris fuera de los umbrales es α, la probabilidad de una falsa alarma. El área naranja más allá del umbral es la potencia.

Interactivo Mueve el efecto real y el número de personas por grupo. Con los valores de partida, un efecto de 0,3 y treinta personas por grupo, la potencia es del 21 %, la mediana que Button y sus coautores estimaron para la neurociencia en 2013. Al pulsar «Hacer 200 estudios», los significativos salen en naranja, y la raya naranja marca su efecto medio: con poca potencia, el doble del real o más.

Las dos curvas se estrechan al aumentar la muestra, porque el error típico de la diferencia baja con la raíz del número de personas. Con curvas estrechas se separan, la naranja deja casi toda su área más allá del umbral y la potencia se acerca a uno. Con curvas anchas se solapan, y buena parte de los estudios de un efecto real cae en la zona donde no se distingue del ruido. El cálculo al revés da el tamaño de muestra necesario. Para detectar con un 80 por ciento de potencia un efecto medio, de medio punto de desviación típica, hacen falta unas 64 personas por grupo; para uno pequeño, de 0,2, unas 400; para uno de 0,1, que es del orden de muchos efectos reales en psicología, educación o nutrición, más de 1.500 por grupo.

El concepto nació con el contraste de hipótesis. Jerzy Neyman y Egon Pearson formalizaron en 1933 los dos errores que puede cometer una decisión estadística: rechazar la hipótesis nula cuando es cierta, que llamaron error de primera especie (type I error), y no rechazarla cuando es falsa, el error de segunda especie (type II error). Ronald Fisher, que había inventado el valor p unos años antes, solo se ocupaba del primero, y rechazó la idea con dureza durante el resto de su vida, pero la práctica se quedó con los dos. La probabilidad del error de primera especie es α, que se fija de antemano en 0,05. La del error de segunda especie se llama β, y la potencia es 1 − β. Lo que se convirtió en costumbre fue vigilar α con celo y olvidarse de β.

Jacob Cohen fue el primero en medir el olvido. En 1962 revisó los setenta artículos publicados en 1960 en el Journal of Abnormal and Social Psychology y calculó qué potencia tenían para detectar efectos pequeños, medianos y grandes. Para los medianos, que son los que un investigador suele esperar, la potencia media era de 0,48: en promedio, los estudios de la revista tenían menos probabilidades de encontrar un efecto real de tamaño razonable que de no encontrarlo. Cohen propuso que se calculara el tamaño de muestra antes de empezar y fijó las convenciones de 0,2, 0,5 y 0,8 para un efecto pequeño, mediano y grande, que se siguen usando. Veinticuatro años después, Peter Sedlmeier y Gerd Gigerenzer repitieron el análisis sobre su sucesora, el Journal of Abnormal Psychology, y publicaron el resultado en 1989 con un título que era una pregunta: ¿tienen algún efecto los estudios sobre la potencia en la potencia de los estudios? La respuesta era que no. La potencia no había subido.

En 2013, Katherine Button, John Ioannidis, Marcus Munafò y otros cuatro autores hicieron el cálculo para la neurociencia a partir de cuarenta y nueve metaanálisis, y estimaron una potencia mediana del 21 por ciento, que es la que aparece con los valores de partida de la figura. Lo que dieron a conocer no fue solo que se escapaban la mayoría de los efectos reales, sino una consecuencia menos obvia. Si la potencia es baja, una proporción mayor de los resultados significativos son falsas alarmas, porque los aciertos escasean y las falsas alarmas se mantienen en el 5 por ciento. Y los aciertos que se obtienen exageran el efecto.

La figura permite ver esa exageración pulsando «Hacer 200 estudios». Con un efecto real de 0,3 y treinta personas por grupo, los estudios miden efectos que van de −0,2 a 0,8, y solo los que caen más allá del umbral, en torno a 0,5, salen significativos. Pero esos son precisamente los que tuvieron suerte y midieron un efecto mayor que el real, así que el efecto medio de los estudios significativos queda en torno a 0,65, más del doble de la verdad. Andrew Gelman y John Carlin llamaron a esto error de tipo M, de magnitud, y señalaron uno peor, el error de tipo S, de signo: con potencia muy baja, una fracción apreciable de los estudios significativos encuentra un efecto en la dirección contraria a la real. A esa exageración se le llama también la maldición del ganador (winner’s curse), por analogía con las subastas, donde quien gana es, casi por definición, quien más había sobrevalorado lo subastado.

La maldición explica un patrón que se repite en muchas disciplinas: el primer estudio de un efecto encuentra una cifra espectacular, las réplicas encuentran efectos cada vez menores y el entusiasmo inicial se desvanece. Como los estudios pequeños solo se publican cuando salen significativos y solo salen significativos cuando exageran, la literatura publicada es una muestra sesgada hacia los efectos grandes. Cuando la Open Science Collaboration replicó cien estudios de psicología en 2015 con muestras mayores, el tamaño medio de los efectos se quedó en la mitad del original, que es aproximadamente lo que la potencia de los originales hacía esperar. Casos como el de las posturas de poder o el del agotamiento del ego siguieron ese camino.

Lo que se deduce de todo esto va contra la intuición de quien lee un estudio. Un resultado significativo con una muestra pequeña no es más impresionante por haber superado el umbral con pocos datos, sino más sospechoso, porque para superarlo ha tenido que medir un efecto grande, y los efectos grandes escasean. La respuesta de la estadística ha sido la que proponía Cohen en 1962: calcular la potencia antes de recoger los datos, a partir de una estimación honrada del efecto que cabe esperar, y registrar el diseño de antemano para que nadie pueda ajustarlo después. En los ensayos clínicos es obligatorio desde hace décadas. En buena parte de las ciencias sociales, sesenta años después del artículo de Cohen, la costumbre sigue siendo decidir el tamaño de la muestra por lo que cabe en el presupuesto y enterarse de la potencia, si acaso, cuando ya no tiene remedio.

§

Fuentes

  1. Jerzy Neyman y Egon S. PearsonOn the Problem of the Most Efficient Tests of Statistical HypothesesPhilosophical Transactions of the Royal Society A 2311933enlace
  2. Jacob CohenThe statistical power of abnormal-social psychological research: A reviewJournal of Abnormal and Social Psychology 65 (3)1962enlace
  3. Peter Sedlmeier y Gerd GigerenzerDo studies of statistical power have an effect on the power of studies?Psychological Bulletin 105 (2)1989enlace
  4. Katherine S. Button, John P. A. Ioannidis, Claire Mokrysz, Brian A. Nosek, Jonathan Flint, Emma S. J. Robinson y Marcus R. MunafòPower failure: why small sample size undermines the reliability of neuroscienceNature Reviews Neuroscience 142013enlace
  5. Andrew Gelman y John CarlinBeyond Power Calculations: Assessing Type S (Sign) and Type M (Magnitude) ErrorsPerspectives on Psychological Science 9 (6)2014enlace
Sarasola, Josemari (2026). "La potencia estadística". Ikusmira. Recuperado de https://ikusmira.org/p/la-potencia-estadistica/

Una errata, un dato desfasado, un párrafo que falta: edítalo y la redacción revisa tu propuesta.

Sugerir una mejora →