Itinerarios / medio

La aventura de la estadística

Seis capítulos sobre el puente entre los datos y la conclusión: la ley que estabiliza la frecuencia, el teorema que la hace normal, el margen que la acompaña y las reglas para decidir.

6 capítulos · 6,807 palabras · 35 min · cada capítulo es un artículo de la enciclopedia

Estos seis capítulos son el tronco de la estadística aplicada: cómo un puñado de datos recogido con azar termina sosteniendo una conclusión.

El primero enseña la ley que lo hace posible: la frecuencia se estabiliza al crecer la muestra, y eso es lo único que convierte un dato en evidencia. El segundo da la forma de esa estabilidad: la suma de muchos azares pequeños dibuja la curva normal, y con ella un margen de error que se calcula en dos líneas. El tercero traduce ese margen en un intervalo de confianza, la forma honesta de dar un número. Los dos siguientes son sobre la decisión: qué significa exactamente un valor p, por qué la significación estadística se usa —y se abusa— para declarar un efecto real, y por qué un estudio pequeño que encuentra algo casi siempre lo exagera. Y el último enseña a calcularlo todo sin fórmulas: el bootstrap remuestrea los propios datos y mide cuánto variaría el resultado.

Conviene saber qué son una media y una desviación típica. Las fórmulas se pueden saltar, porque las figuras cuentan lo mismo.

Capítulo 1 de 6

La ley de los grandes números

Matemática y estadística 1361 palabras artículo suelto ↗

La ley de los grandes números (en inglés, law of large numbers) dice que la media de muchas repeticiones independientes de un mismo experimento se acerca a su valor esperado a medida que crece el número de repeticiones. Si una moneda tiene la misma probabilidad de salir cara que cruz, la proporción de caras en diez lanzamientos puede ser cualquier cosa entre el cero y el uno, en mil rara vez sale de la franja entre el 47 y el 53 por ciento, y en un millón no se separa del 50 más que unas décimas. Es el resultado que convierte la probabilidad, que habla de lo que puede pasar en un caso, en frecuencia, que es lo que se observa cuando los casos se acumulan, y sin él no existirían ni las encuestas ni los seguros ni la inferencia estadística entera.

La figura lanza cinco series a la vez. Cada línea es la proporción de aciertos acumulada de una serie, y la franja naranja marca dos errores típicos alrededor de la probabilidad verdadera, que es donde deberían caer casi todas las series en cada momento. Al principio las cinco líneas saltan de un extremo a otro; hacia los cien lanzamientos ya van juntas, y a los diez mil son casi una sola raya pegada a la probabilidad. La tabla de debajo cuenta otra historia, que es la mitad de la ley que casi nadie aprende.

Interactivo Cinco series independientes de lanzamientos. Arriba, la proporción de aciertos acumulada, que converge a la probabilidad dentro de una franja que se estrecha como 1/√n. Abajo, el desvío en número de aciertos respecto a lo esperado, que no converge a cero: crece como √n. La proporción se estabiliza porque el desvío se diluye en un total cada vez mayor, no porque el azar lo corrija.

La columna del desvío resta, en cada serie, los aciertos obtenidos menos los que tocarían según la probabilidad. Tras diez lanzamientos de moneda, lo normal es ir una o dos caras por encima o por debajo de cinco. Tras diez mil, lo normal es ir unas cuarenta por encima o por debajo de cinco mil, y ese desvío absoluto no deja de crecer: aumenta con la raíz cuadrada del número de lanzamientos. La proporción se acerca a la mitad a pesar de ello, porque cuarenta caras de más sobre diez mil son un 0,4 por ciento y sobre un millón serían, con un desvío típico de quinientas, un 0,05. La ley no dice que las caras y las cruces acaben igualadas. Dice que su diferencia crece más despacio que el total.

Esa distinción es la que separa la ley de su caricatura, la falacia del jugador (gambler’s fallacy): la creencia de que, después de una racha de rojos en la ruleta, el negro «se debe» y es más probable. La ruleta no tiene memoria y cada tirada es independiente de las anteriores, así que la probabilidad del negro sigue siendo la misma después de veinte rojos que después de ninguno. El caso más citado ocurrió en el casino de Montecarlo el 18 de agosto de 1913, cuando el negro salió veintiséis veces seguidas y los jugadores perdieron fortunas apostando al rojo a partir de la décima o la decimoquinta. Lo que la ley promete es que esa racha acabará pesando poco en la proporción de dentro de un millón de tiradas, porque quedará sumergida entre las demás, no que la ruleta vaya a devolver lo que se llevó.

Amos Tversky y Daniel Kahneman dieron nombre en 1971 a una versión más sutil del mismo error, que encontraron en psicólogos profesionales: la creencia en la ley de los pequeños números (belief in the law of small numbers). Consiste en esperar que una muestra pequeña se parezca a la población tanto como una grande, y lleva a sobrevalorar resultados obtenidos con pocos casos, a esperar que una réplica salga igual que el original y a buscar explicaciones para desviaciones que son puro ruido. La ley de los grandes números es, precisamente, una ley de números grandes, y no dice nada de cuánto se parece a la probabilidad una muestra de veinte.

La primera demostración es de Jakob Bernoulli, que trabajó en ella unos veinte años y la llamó su teorema áureo. Se publicó en 1713, ocho años después de su muerte, en la cuarta parte del Ars Conjectandi, y lo que demuestra es que, con una urna de proporción conocida, la probabilidad de que la frecuencia observada se aleje de esa proporción más de un margen fijado tiende a cero con el número de extracciones. Bernoulli quiso además dar una cifra y calculó que, con una urna de tres bolas blancas por cada dos negras, hacían falta 25.550 extracciones para tener una certeza de mil contra uno de que la frecuencia quedaba a menos de una quincuagésima de la verdadera. La cota era muy pesimista, y los cálculos posteriores con la distribución normal la redujeron a unos pocos miles, pero hay historiadores, como Stephen Stigler, que ven en aquel número desalentador una de las razones por las que Bernoulli dejó el libro sin terminar. El nombre de ley de los grandes números se lo puso Siméon Denis Poisson en 1837, en un tratado sobre la probabilidad de que los jurados acierten.

Lo que Bernoulli demostró se llama hoy ley débil (weak law): para cualquier margen, la probabilidad de estar fuera de él tiende a cero. La ley fuerte (strong law), que Émile Borel demostró para las monedas en 1909 y Andréi Kolmogórov generalizó en los años treinta, dice algo más exigente: que con probabilidad uno, la sucesión entera de proporciones converge al valor esperado, de modo que las series que se desvían para siempre, aunque existan en teoría, tienen probabilidad nula. En la figura se ve la diferencia sin fórmulas: la ley débil habla de dónde está cada serie en un momento dado, y la fuerte, de la trayectoria completa de cada línea.

Mientras tanto, hubo quien lo comprobó a mano. El conde de Buffon lanzó una 4.040 veces en el siglo XVIII y obtuvo 2.048 caras. Karl Pearson llegó a 24.000 lanzamientos con 12.012 caras. El más célebre lo hizo John Kerrich, profesor de matemáticas en Johannesburgo, que estaba de visita en Copenhague cuando Alemania invadió Dinamarca en 1940 y pasó la guerra internado en un campo de Jutlandia. Allí, con un compañero de encierro, lanzó una moneda diez mil veces y anotó cada resultado. Obtuvo 5.067 caras, un desvío de 67 sobre lo esperado y una proporción de 0,5067, y publicó en 1946 las tablas completas junto con las curvas de la proporción acumulada, que tienen exactamente la forma de las de la figura.

La ley tiene condiciones, y la principal es que el valor esperado exista. Hay distribuciones que no lo tienen, como la de Cauchy, que es la del punto donde cae sobre una pared la luz de una linterna apuntada en una dirección al azar: sus colas son tan pesadas que un solo valor extremo puede mover la media de cualquier muestra, y la media de un millón de observaciones no es más estable que una sola. Con colas menos extremas, como las de la distribución de Pareto que describe las fortunas, la media converge, pero tan despacio que en la práctica la de una muestra depende sobre todo de si ha entrado en ella algún multimillonario. La otra condición es la independencia, o algo parecido: si los casos se contagian unos a otros, como las opiniones en una red o las quiebras en una crisis, la ley no garantiza nada.

Donde se cumple, es el cimiento de negocios enteros. Una aseguradora no sabe qué casa se va a quemar, pero con cien mil pólizas sabe con bastante precisión cuántas, y cobra en consecuencia. Un casino no sabe quién va a ganar esta noche, pero con la ventaja del cero en la ruleta, 1/37 de cada apuesta, sabe cuánto ganará en un año. Una encuesta con mil entrevistas acierta la proporción de votantes con un margen de unos tres puntos por la misma razón, siempre que las entrevistas sean una muestra al azar, que es donde suelen fallar, como explica el artículo sobre la encuesta electoral. La ley de los grandes números dice a qué valor se acerca la media; el teorema central del límite completa el cuadro diciendo con qué forma se reparten sus fluctuaciones alrededor de ese valor, que es la forma de campana que dibuja la franja naranja.

El método de Montecarlo

Capítulo 2 de 6

El teorema central del límite

Matemática y estadística 1086 palabras artículo suelto ↗

El teorema central del límite afirma que, si se toman muchas muestras del mismo tamaño de una población cualquiera y se calcula la media de cada una, esas medias se distribuyen aproximadamente como una campana de Gauss, con independencia de la forma que tuviera la población de partida. La aproximación mejora al crecer el tamaño de la muestra, y la anchura de la campana se estrecha en proporción a la raíz cuadrada de ese tamaño. Es el resultado que permite que casi toda la estadística aplicada funcione: intervalos de confianza, contrastes de hipótesis y márgenes de error de las encuestas descansan en él, y por eso se le llama central, en el sentido de «que ocupa el centro», no en el de que hable de centros.

La afirmación es menos intuitiva de lo que parece cuando se enuncia en abstracto, y por eso conviene verla ocurrir. En la figura se elige una población deliberadamente poco gaussiana —una exponencial, con toda su masa pegada al cero y una cola larga a la derecha; una distribución con dos picos y nada en medio; un dado, que solo puede dar seis valores— y se extraen de ella muestras del tamaño que se quiera. Cada muestra aparece como una hilera de puntos sobre la población, su media se marca en naranja, y esa media cae al histograma de abajo. Con una sola muestra el histograma no dice nada. Con cien empieza a insinuarse una forma. Con mil, la campana está ahí, centrada exactamente en la media de la población, aunque la población no se le parezca en nada.

Interactivo Elige la población de arriba y el tamaño de muestra. Cada muestra deja su media en el histograma de abajo; la curva a trazos es la normal que predice el teorema, con desviación σ/√n. Prueba con n = 1 para ver que sin promediar no hay campana, y con n = 30 para ver por qué ese número se convirtió en regla.

Dos cosas se aprecian en el simulador que la fórmula esconde. La primera es que con tamaño de muestra 1 no ocurre nada: las «medias» son los propios valores, y el histograma reproduce la forma de la población, sesgo incluido. La campana no está en los datos, está en el promedio. La segunda es que la velocidad a la que aparece depende de lo asimétrica que sea la población de partida. Con la uniforme, cinco valores por muestra bastan para que la forma sea razonablemente gaussiana; con la exponencial hacen falta veinte o treinta, y con una renta de cola muy larga la cola derecha del histograma sigue siendo visible bastante después. La regla práctica que enseñan los manuales —«a partir de treinta observaciones se puede suponer normalidad»— no es un teorema sino una observación empírica sobre poblaciones moderadamente sesgadas, y el simulador permite ver dónde falla.

La historia del resultado es larga porque tardó en enunciarse con generalidad. Abraham de Moivre publicó en 1733 que el número de caras al lanzar muchas monedas se aproxima con la curva que hoy llamamos normal; era un caso particular, el de sumar variables que solo valen cero o uno. Pierre-Simon Laplace extendió el argumento en 1810 a sumas de variables de casi cualquier tipo y lo aplicó a los errores de medida astronómicos, que era el problema que le interesaba: si cada observación de un planeta arrastra un error compuesto de muchas causas pequeñas e independientes, la suma de esas causas es aproximadamente normal, y por tanto el error también. Las demostraciones rigurosas, con condiciones explícitas sobre las variables, llegaron con Aleksandr Liapunov en 1901 y con Jarl Lindeberg y Paul Lévy en los años veinte. El nombre lo puso George Pólya en 1920, en un artículo escrito en alemán, y su elección del adjetivo zentral se refería a la posición del teorema dentro de la teoría de la probabilidad.

El enunciado moderno tiene tres condiciones y conviene conocerlas porque cada una puede fallar en la práctica. Las observaciones tienen que ser independientes, o al menos no demasiado dependientes; deben proceder de la misma distribución, o de distribuciones parecidas; y esa distribución debe tener varianza finita. La tercera es la que más sorprende: existen distribuciones, como la de Cauchy, cuya cola es tan pesada que ni siquiera tienen media definida, y para ellas el teorema simplemente no se cumple. La media de mil observaciones de Cauchy es tan errática como una sola. En economía y finanzas, donde los rendimientos extremos son más frecuentes de lo que una normal admitiría, esta condición es motivo de discusión permanente desde que Benoit Mandelbrot la planteó en los años sesenta.

El teorema también dice cuánto se estrecha la campana, y ese detalle es el que sostiene las encuestas. La desviación típica de las medias muestrales es la de la población dividida por la raíz cuadrada del tamaño de muestra. Para reducir el error a la mitad hay que cuadruplicar la muestra; para reducirlo a la décima parte, multiplicarla por cien. Es la razón de que un sondeo de mil personas tenga un margen de error de unos tres puntos y de que pasar a diez mil personas solo lo baje a uno: el rendimiento decreciente está escrito en la raíz cuadrada. En la figura, al aumentar el tamaño de muestra de 5 a 20 el histograma se estrecha justo a la mitad, y la lectura compara la dispersión observada con la que predice la fórmula.

Andrew Berry en 1941 y Carl-Gustav Esseen en 1942 respondieron, por separado, a la pregunta natural de cómo de buena es la aproximación para un tamaño de muestra dado. Su cota dice que la distancia máxima entre la distribución real de la media y la normal está acotada por una constante multiplicada por una medida de la asimetría de la población y dividida por la raíz del tamaño de muestra. Es el enunciado preciso de lo que el simulador muestra a ojo: la campana llega antes cuanto más simétrica sea la población y cuanto mayor sea la muestra, y la relación entre ambas cosas es exactamente la raíz cuadrada.

Lo que el teorema no dice es igualmente importante. No afirma que los datos individuales de ninguna población sean normales, ni que muchos fenómenos naturales lo sean; afirma algo sobre los promedios de muestras. Las alturas humanas se aproximan a una normal porque cada altura es, en efecto, la suma de muchas contribuciones pequeñas, pero las rentas, los tamaños de las ciudades o la frecuencia de las palabras no lo son ni lo serán por mucho que se mida. Confundir «las medias de las muestras son normales» con «los datos son normales» es un error frecuente, y el simulador lo desmonta con solo mirar las dos gráficas a la vez: la de arriba, la población, no cambia nunca de forma; la de abajo, las medias, se vuelve campana sea cual sea la de arriba.

La ley de los grandes números – Distribución normal

Capítulo 3 de 6

El intervalo de confianza

Matemática y estadística 947 palabras artículo suelto ↗

El intervalo de confianza es un rango de valores calculado a partir de una muestra con un procedimiento que, repetido muchas veces sobre muestras distintas de la misma población, produce rangos que contienen el valor real de la población en un porcentaje conocido de los casos. Ese porcentaje es el nivel de confianza, habitualmente el 95 %, y la definición está enunciada a propósito en términos del procedimiento y no del resultado. La formuló Jerzy Neyman en 1937 y su cuidado en la redacción no es un tecnicismo: es lo único que distingue el intervalo de confianza de lo que casi todo el mundo cree que significa.

Retrato fotográfico de Karl Pearson, de mayor, con barba blanca y gafas
Fig. 1 Karl Pearson en 1910. El intervalo de confianza nació en la escuela estadística londinense que él construyó en el University College: Jerzy Neyman la formuló en 1937 en esa institución, en el marco de los contrastes que desarrolló con el hijo de Pearson, Egon. El intervalo cuantifica solo el error de muestreo, y la experiencia de las encuestas electorales muestra que ese es apenas la mitad del error real.Autoría desconocida · 1910 · Dominio público · Wikimedia Commons

Lo que la gente entiende al leer que un intervalo del 95 % va de 38 a 44 es que hay un 95 % de probabilidad de que el valor verdadero esté entre 38 y 44. Esa frase es incorrecta dentro del marco en el que el intervalo se calcula. En la estadística frecuentista, el parámetro de la población es una cantidad fija y desconocida, no una variable aleatoria: no tiene sentido asignarle una probabilidad de estar en ningún sitio. Lo aleatorio es la muestra, y por tanto lo aleatorio es el intervalo. Una vez calculado un intervalo concreto, ese intervalo contiene el valor o no lo contiene, y no hay ninguna probabilidad intermedia. El 95 % describe el comportamiento del método a lo largo de muchas repeticiones, no la credibilidad de un resultado particular. Quien quiera una afirmación probabilística sobre el parámetro tiene que salir del marco y calcular un intervalo de credibilidad bayesiano, que exige declarar una distribución previa y que, en muchos casos con muestras grandes, sale numéricamente parecido pero significa otra cosa.

Que la confusión es la regla y no la excepción está medido. Rink Hoekstra y sus colaboradores presentaron en 2014 a ciento veinte investigadores y cuatrocientos cuarenta y dos estudiantes de psicología un resultado con su intervalo de confianza y seis afirmaciones sobre él, todas falsas, y les pidieron marcar las que consideraran correctas. Los estudiantes de primer año marcaron una media de 3,5 afirmaciones falsas; los investigadores con experiencia, 3,4. No hubo mejora con la formación. Sander Greenland y un grupo de veinticuatro estadísticos y epidemiólogos publicaron en 2016 un inventario de veinticinco malinterpretaciones habituales del valor p, los intervalos y la potencia, y entre ellas figuran las dos que más se ven en la prensa: creer que un valor fuera del intervalo queda descartado, y creer que dos intervalos que se solapan indican que no hay diferencia.

La segunda cosa que el intervalo no dice es más importante para leer una encuesta, y es la que arruina el uso periodístico del «margen de error». El intervalo de confianza solo cuantifica una fuente de incertidumbre: el error de muestreo, es decir, la variabilidad que resulta de haber preguntado a mil personas y no a todas. No cuantifica el sesgo. Si la muestra no representa a la población —porque quien contesta al teléfono no es como quien no contesta, porque el marco de la muestra excluye a una parte del país, porque la pregunta está mal redactada, porque el modelo de ponderación reparte mal los pesos—, el intervalo se calcula igual, sale igual de estrecho y está centrado en el sitio equivocado. Un error de muestreo pequeño alrededor de una estimación sesgada produce exactamente la falsa sensación de precisión que la cifra pretende evitar.

La magnitud de ese hueco se ha estimado. Houshmand Shirani-Mehr, David Rothschild, Sharad Goel y Andrew Gelman analizaron en 2018 cuatro mil doscientas veintiuna encuestas de elecciones estadounidenses de gobernador, senador y presidente entre 1998 y 2014, y compararon las estimaciones con los resultados. El error medio real fue de unos tres puntos y medio, prácticamente el doble del error de muestreo que las encuestas declaraban; y solo alrededor del 60 % de sus intervalos del 95 % contenía el resultado, cuando por definición del método debería haberlo hecho el 95 %. La conclusión de los autores es que un intervalo honesto para una encuesta electoral tendría que ser aproximadamente el doble de ancho del que se publica, porque el resto lo aporta el sesgo y no la aritmética.

De ahí se sigue una manera correcta de leer los intervalos que aparecen en las noticias, y son tres reglas. La primera: la anchura del intervalo informa de la precisión del procedimiento, y si un intervalo es muy ancho la conclusión honrada es que el estudio no permite decidir, no que el efecto sea cero. La segunda: la diferencia entre dos grupos necesita su propio intervalo, y no se puede deducir comparando a ojo si los intervalos de cada grupo se solapan; ese atajo produce falsos negativos con mucha frecuencia. La tercera: el intervalo solo es tan bueno como el diseño del muestreo que lo sostiene, y cuando lo que falla es el diseño, el intervalo no avisa.

Conviene añadir la objeción que la propia comunidad estadística ha ido aceptando. Durante décadas se recomendó sustituir el contraste de hipótesis por intervalos de confianza, con el argumento de que el intervalo informa del tamaño del efecto y de su precisión mientras el valor p solo produce un veredicto. La recomendación sigue siendo buena, pero no resuelve el problema que decía resolver: en la práctica, un intervalo se lee comprobando si contiene el cero, es decir, se convierte en un contraste de hipótesis con otra tipografía. La ganancia de los intervalos es real solo si quien los lee atiende a los dos extremos y se pregunta si el valor más pequeño compatible con los datos sería importante y si el más grande sería creíble. Sin esa lectura, el intervalo es una prueba de significación disfrazada de estimación.

La encuesta electoral y por qué falla – El valor p y la significación estadística

Capítulo 4 de 6

El valor p y la significación estadística

Matemática y estadística 980 palabras artículo suelto ↗

El valor p es la probabilidad de obtener un resultado al menos tan extremo como el observado suponiendo que la hipótesis nula sea cierta y que el modelo estadístico empleado sea correcto. Cuando ese número queda por debajo de un umbral convenido —tradicionalmente 0,05— el resultado se declara estadísticamente significativo. La definición contiene dos condicionales que son los que se pierden en cada resumen periodístico, y de esa pérdida sale casi todo lo que se hace mal con la cifra.

Lo primero que hay que quitar de la cabeza es la lectura invertida. El valor p es la probabilidad de los datos dada la hipótesis, no la probabilidad de la hipótesis dados los datos. Un p de 0,03 no significa que haya un 3 % de probabilidad de que el resultado sea casualidad, ni un 97 % de que el efecto exista. Tampoco mide la importancia del efecto: con una muestra suficientemente grande, una diferencia irrelevante para cualquier propósito práctico produce valores p diminutos, y con una muestra pequeña un efecto grande y real puede quedarse en 0,2. Y un valor p por encima del umbral no demuestra que no haya efecto; demuestra que estos datos no bastan para distinguirlo del ruido, que es una afirmación mucho más modesta.

El umbral de 0,05 no tiene ninguna base teórica. Lo propuso Ronald Fisher en 1925 como una convención de conveniencia —observó que un desvío de dos veces la desviación típica es un punto cómodo para juzgar si un resultado merece atención— y él mismo entendía el valor p como una medida continua de evidencia dentro de un programa de experimentación repetida, no como un botón de aprobación. La conversión del criterio en un umbral binario y en un requisito de publicación vino después, con la fusión práctica del enfoque de Fisher y el contraste de hipótesis de Neyman y Pearson, y produjo el incentivo que ha marcado un siglo de literatura científica: los resultados por debajo de 0,05 se publican y los demás se quedan en el cajón.

Retrato fotográfico de William Sealy Gosset, con traje oscuro y gafas
Fig. 1 William Sealy Gosset en 1908. Firmando como «Student» desde la fábrica de Guinness, publicó la distribución t que hace posible juzgar la significación con muestras pequeñas; Fisher, que conocía su trabajo, convirtió ese criterio en el valor p de 1925. La conversión de una medida continua de evidencia en un umbral binario vino después, con la fusión práctica de los enfoques de Fisher y de Neyman y Pearson.User Wujaszek on pl.wikipedia · 2016 · Dominio público · Wikimedia Commons

Ese incentivo tiene consecuencias medibles. John Ioannidis argumentó en 2005, con un modelo explícito, que en campos con muchas hipótesis exploradas, muestras pequeñas y efectos reales pequeños, la mayor parte de los hallazgos publicados como significativos tienen que ser falsos, porque la probabilidad de que una hipótesis sea verdadera antes del estudio es baja y el umbral admite un 5 % de falsos positivos por cada hipótesis probada. Joseph Simmons, Leif Nelson y Uri Simonsohn lo demostraron por construcción en 2011: mostraron que con la flexibilidad no declarada que cualquier investigador tiene a mano —decidir cuándo parar de recoger datos, elegir entre dos variables dependientes, incluir o no una covariable, excluir observaciones atípicas— la probabilidad de obtener un resultado significativo a partir de datos sin ninguna señal sube del 5 % a más del 60 %. A esa práctica, que rara vez es un fraude deliberado y casi siempre una serie de decisiones razonables tomadas después de ver los datos, se le llama p-hacking.

La comprobación empírica llegó en 2015, cuando la Open Science Collaboration replicó cien estudios publicados en tres revistas de psicología de primer nivel con protocolos acordados de antemano y muestras mayores que las originales. De los noventa y siete que habían informado de resultados significativos, treinta y cinco volvieron a serlo, y el tamaño medio de los efectos replicados fue aproximadamente la mitad del original. Resultados semejantes aparecieron después en economía experimental y en biología del cáncer. La discusión sobre la magnitud exacta de la crisis de replicación sigue abierta —hay quien defiende que una parte del fallo se explica por diferencias de contexto entre el estudio original y la réplica—, pero el hecho de que el umbral de significación no protege de los falsos positivos con la eficacia que se le atribuía ya no se discute.

En 2016, la American Statistical Association hizo algo insólito para una sociedad científica: publicó una declaración formal sobre un procedimiento estadístico. Seis principios, y ninguno de ellos técnico. Que los valores p no miden la probabilidad de que la hipótesis estudiada sea cierta. Que no deben ser la base de decisiones científicas o de política tomadas por un umbral. Que un valor p sin contexto ni otras evidencias aporta información limitada. Que la inferencia adecuada exige informar de todo el proceso —cuántas hipótesis se probaron, qué decisiones de análisis se tomaron— porque sin eso el número no es interpretable. Y que la significación estadística no equivale a importancia. Tres años después, un comentario en Nature firmado por Valentin Amrhein, Sander Greenland y Blake McShane y respaldado por más de ochocientos firmantes pidió abandonar el concepto de significación estadística; la revista Basic and Applied Social Psychology había ido más lejos en 2015 prohibiendo directamente los valores p en sus artículos.

Conviene, sin embargo, no quedarse con la moraleja de que el valor p es una superstición que hay que retirar, porque las alternativas tienen sus propios problemas. Sustituirlo por umbrales más exigentes —se ha propuesto 0,005— reduce los falsos positivos a costa de exigir muestras mucho mayores y de dejar fuera campos donde eso es imposible. Sustituirlo por intervalos de confianza no cambia nada si el intervalo se lee comprobando si contiene el cero, que es lo que ocurre en la práctica. Sustituirlo por factores de Bayes obliga a declarar una distribución previa que otro investigador puede discutir. La crítica sólida del valor p no es que la fórmula esté mal, es que un número que resume la compatibilidad de unos datos con un modelo se estaba usando para tomar una decisión dicotómica sobre la existencia de un fenómeno. Lo que la estadística ha ido concluyendo desde 2005 es que ninguna cifra individual puede hacer ese trabajo, y que lo que lo hace es el tamaño del efecto, la preinscripción del análisis, la publicación de los resultados nulos y la réplica.

El intervalo de confianza – La potencia estadística – Nivel de significación – Las comparaciones múltiples

Capítulo 5 de 6

La potencia estadística

Matemática y estadística 1204 palabras artículo suelto ↗

La potencia estadística (en inglés, statistical power) es la probabilidad de que un estudio detecte un efecto que existe de verdad. Si un fármaco reduce la tensión arterial y se prueba en un ensayo, la potencia es la probabilidad de que el ensayo salga estadísticamente significativo, y su complemento es la probabilidad de que el efecto real pase inadvertido. Depende de tres cosas: el tamaño del efecto, el número de personas estudiadas y el umbral de significación que se haya elegido. Un efecto grande se ve con pocos datos; uno pequeño exige muchos, y con pocos, el estudio es una moneda al aire que además, como se verá, cuando sale cara engaña.

La figura muestra de dónde sale la cifra. Un estudio compara dos grupos y mide la diferencia entre sus medias en desviaciones típicas, que es lo que se llama tamaño del efecto d. Si el efecto no existe, la diferencia que mediría el estudio se reparte según la campana gris, centrada en cero; si existe, según la naranja, centrada en el valor real. Las rayas verticales son los umbrales de significación, y todo lo que cae más allá se declara significativo. El área gris fuera de los umbrales es α, la probabilidad de una falsa alarma. El área naranja más allá del umbral es la potencia.

Interactivo Mueve el efecto real y el número de personas por grupo. Con los valores de partida, un efecto de 0,3 y treinta personas por grupo, la potencia es del 21 %, la mediana que Button y sus coautores estimaron para la neurociencia en 2013. Al pulsar «Hacer 200 estudios», los significativos salen en naranja, y la raya naranja marca su efecto medio: con poca potencia, el doble del real o más.

Las dos curvas se estrechan al aumentar la muestra, porque el error típico de la diferencia baja con la raíz del número de personas. Con curvas estrechas se separan, la naranja deja casi toda su área más allá del umbral y la potencia se acerca a uno. Con curvas anchas se solapan, y buena parte de los estudios de un efecto real cae en la zona donde no se distingue del ruido. El cálculo al revés da el tamaño de muestra necesario. Para detectar con un 80 por ciento de potencia un efecto medio, de medio punto de desviación típica, hacen falta unas 64 personas por grupo; para uno pequeño, de 0,2, unas 400; para uno de 0,1, que es del orden de muchos efectos reales en psicología, educación o nutrición, más de 1.500 por grupo.

El concepto nació con el contraste de hipótesis. Jerzy Neyman y Egon Pearson formalizaron en 1933 los dos errores que puede cometer una decisión estadística: rechazar la hipótesis nula cuando es cierta, que llamaron error de primera especie (type I error), y no rechazarla cuando es falsa, el error de segunda especie (type II error). Ronald Fisher, que había inventado el valor p unos años antes, solo se ocupaba del primero, y rechazó la idea con dureza durante el resto de su vida, pero la práctica se quedó con los dos. La probabilidad del error de primera especie es α, que se fija de antemano en 0,05. La del error de segunda especie se llama β, y la potencia es 1 − β. Lo que se convirtió en costumbre fue vigilar α con celo y olvidarse de β.

Jacob Cohen fue el primero en medir el olvido. En 1962 revisó los setenta artículos publicados en 1960 en el Journal of Abnormal and Social Psychology y calculó qué potencia tenían para detectar efectos pequeños, medianos y grandes. Para los medianos, que son los que un investigador suele esperar, la potencia media era de 0,48: en promedio, los estudios de la revista tenían menos probabilidades de encontrar un efecto real de tamaño razonable que de no encontrarlo. Cohen propuso que se calculara el tamaño de muestra antes de empezar y fijó las convenciones de 0,2, 0,5 y 0,8 para un efecto pequeño, mediano y grande, que se siguen usando. Veinticuatro años después, Peter Sedlmeier y Gerd Gigerenzer repitieron el análisis sobre su sucesora, el Journal of Abnormal Psychology, y publicaron el resultado en 1989 con un título que era una pregunta: ¿tienen algún efecto los estudios sobre la potencia en la potencia de los estudios? La respuesta era que no. La potencia no había subido.

En 2013, Katherine Button, John Ioannidis, Marcus Munafò y otros cuatro autores hicieron el cálculo para la neurociencia a partir de cuarenta y nueve metaanálisis, y estimaron una potencia mediana del 21 por ciento, que es la que aparece con los valores de partida de la figura. Lo que dieron a conocer no fue solo que se escapaban la mayoría de los efectos reales, sino una consecuencia menos obvia. Si la potencia es baja, una proporción mayor de los resultados significativos son falsas alarmas, porque los aciertos escasean y las falsas alarmas se mantienen en el 5 por ciento. Y los aciertos que se obtienen exageran el efecto.

La figura permite ver esa exageración pulsando «Hacer 200 estudios». Con un efecto real de 0,3 y treinta personas por grupo, los estudios miden efectos que van de −0,2 a 0,8, y solo los que caen más allá del umbral, en torno a 0,5, salen significativos. Pero esos son precisamente los que tuvieron suerte y midieron un efecto mayor que el real, así que el efecto medio de los estudios significativos queda en torno a 0,65, más del doble de la verdad. Andrew Gelman y John Carlin llamaron a esto error de tipo M, de magnitud, y señalaron uno peor, el error de tipo S, de signo: con potencia muy baja, una fracción apreciable de los estudios significativos encuentra un efecto en la dirección contraria a la real. A esa exageración se le llama también la maldición del ganador (winner’s curse), por analogía con las subastas, donde quien gana es, casi por definición, quien más había sobrevalorado lo subastado.

La maldición explica un patrón que se repite en muchas disciplinas: el primer estudio de un efecto encuentra una cifra espectacular, las réplicas encuentran efectos cada vez menores y el entusiasmo inicial se desvanece. Como los estudios pequeños solo se publican cuando salen significativos y solo salen significativos cuando exageran, la literatura publicada es una muestra sesgada hacia los efectos grandes. Cuando la Open Science Collaboration replicó cien estudios de psicología en 2015 con muestras mayores, el tamaño medio de los efectos se quedó en la mitad del original, que es aproximadamente lo que la potencia de los originales hacía esperar. Casos como el de las posturas de poder o el del agotamiento del ego siguieron ese camino.

Lo que se deduce de todo esto va contra la intuición de quien lee un estudio. Un resultado significativo con una muestra pequeña no es más impresionante por haber superado el umbral con pocos datos, sino más sospechoso, porque para superarlo ha tenido que medir un efecto grande, y los efectos grandes escasean. La respuesta de la estadística ha sido la que proponía Cohen en 1962: calcular la potencia antes de recoger los datos, a partir de una estimación honrada del efecto que cabe esperar, y registrar el diseño de antemano para que nadie pueda ajustarlo después. En los ensayos clínicos es obligatorio desde hace décadas. En buena parte de las ciencias sociales, sesenta años después del artículo de Cohen, la costumbre sigue siendo decidir el tamaño de la muestra por lo que cabe en el presupuesto y enterarse de la potencia, si acaso, cuando ya no tiene remedio.

Las comparaciones múltiples

Capítulo 6 de 6

El bootstrap

Matemática y estadística 1229 palabras artículo suelto ↗

El bootstrap (la palabra se usa tal cual en español, y a veces se traduce por remuestreo) es una manera de medir cuánto se puede fiar uno de una cifra calculada a partir de una muestra, usando solo la propia muestra. La idea es sacar de ella, al azar y con reposición, muchas muestras nuevas del mismo tamaño, calcular la cifra en cada una y mirar cuánto varía. Esa variación imita la que se vería si se pudiera volver a muestrear la población una y otra vez, que es precisamente lo que no se puede hacer. El nombre viene de la expresión inglesa to pull oneself up by one’s bootstraps, levantarse tirando de los cordones de las propias botas, que se suele asociar con el barón de Münchhausen, aunque en el libro él se saca del pantano tirando de su propia coleta, y que describe algo que parece imposible: sacar información sobre la incertidumbre de unos datos sin más material que esos mismos datos.

La figura usa el ejemplo con el que Bradley Efron y Robert Tibshirani enseñan el método en su manual de 1993. Son quince facultades de derecho de Estados Unidos, elegidas al azar entre las ochenta y dos que participaron en un estudio sobre admisiones, con dos notas por facultad: la media de su examen de acceso, el LSAT, y la media de las calificaciones del grado de sus alumnos, el GPA. La correlación entre las dos es de 0,776, y la pregunta es cuánto habría cambiado si el azar hubiera elegido otras quince.

Interactivo Cada remuestra saca quince facultades de las quince originales, con reposición: unas entran dos o tres veces (el círculo naranja crece) y otras ninguna (quedan punteadas). El histograma recoge el estadístico en cada remuestra; su dispersión es la estimación bootstrap del error típico, y el 95 % central, sombreado, un intervalo de confianza. Con la mediana el histograma sale a saltos, porque solo puede tomar unos pocos valores.

Al pulsar «Una remuestra» se ve el mecanismo. Se sacan quince facultades de la bolsa de quince, devolviendo cada una a la bolsa antes de sacar la siguiente, de modo que algunas salen repetidas y otras no salen. Por término medio, cada remuestra deja fuera algo más de un tercio de los datos originales y ocupa ese hueco con repeticiones. Con cada remuestra se calcula de nuevo la correlación, que sale 0,69, 0,85, 0,61, y el histograma va recogiendo esos valores. Con mil remuestras, su desviación típica anda por 0,13, y esa cifra es el error típico de la correlación según el bootstrap. El intervalo que deja fuera el 2,5 por ciento más bajo y el 2,5 por ciento más alto va aproximadamente de 0,46 a 0,96, y es un intervalo de confianza al 95 por ciento conseguido sin una sola fórmula.

Hay una razón para que sea tan útil precisamente con la correlación. Para la media existe una fórmula sencilla del error típico, la desviación típica dividida por la raíz de n, y el bootstrap se limita a reproducirla, como se ve eligiendo la media en el desplegable. Para la correlación, la fórmula clásica supone que los datos siguen una distribución normal en dos dimensiones, y con quince datos nadie puede comprobarlo. Para la mediana, la fórmula existe pero depende de la densidad de la población justo en el centro, que tampoco se conoce. Y para cosas como el cociente entre dos medianas, el coeficiente de una regresión robusta o la precisión de un modelo de aprendizaje automático medida sobre un conjunto de prueba, no hay fórmula que valga. El bootstrap trata a todas igual: se calcula la cifra, se remuestrea, se vuelve a calcular. Lo que antes exigía una derivación matemática para cada estadístico pasa a exigir solo tiempo de ordenador.

La razón por la que funciona es que la muestra, si se ha tomado al azar, es la mejor estimación disponible de la población. Remuestrear la muestra equivale a tratarla como si fuera la población y a preguntarse qué pasaría si de esa población se sacaran muestras de quince. Si la muestra se parece a la población, la variación entre remuestras se parece a la variación entre muestras. La justificación rigurosa, que Efron dio en 1979 y que se afinó durante la década siguiente, demuestra que para una clase amplia de estadísticos la aproximación mejora al crecer la muestra, y que en algunos casos es incluso más precisa que la aproximación normal clásica.

El método tenía un antecedente. En 1949, Maurice Quenouille propuso corregir el sesgo de un estimador recalculándolo quitando cada vez un dato, y en 1958 John Tukey convirtió esa idea en un método para estimar errores típicos y le puso nombre de herramienta: la navaja (jackknife), por ser algo tosco que sirve para casi todo. Efron presentó el bootstrap en 1979, en un artículo de The Annals of Statistics cuyo subtítulo, otra mirada a la navaja, reconocía la deuda, y demostró que la navaja era una aproximación lineal al bootstrap. El método tardó en imponerse porque exigía una potencia de cálculo que a finales de los setenta no estaba al alcance de cualquiera: mil remuestras de un conjunto de datos mediano eran una noche entera de ordenador central. Con los ordenadores personales se volvió trivial, y en 2019 Efron recibió por él el Premio Internacional de Estadística, que se concede cada dos años a una contribución que haya cambiado la disciplina.

El bootstrap no es una varita mágica, y hay casos en los que falla de manera instructiva. El más claro es el máximo. Si se quiere estimar el valor más alto posible de una población a partir del mayor valor observado, el bootstrap no sirve, porque ninguna remuestra puede producir un máximo mayor que el de la muestra, y alrededor de un 63 por ciento de las remuestras lo repiten exactamente. El histograma sale con una barra enorme en el máximo observado y nada a su derecha, que es justo donde está la verdad. Para ese problema hay métodos propios, que el problema del tanque alemán resolvió en la Segunda Guerra Mundial. El segundo fallo son las muestras diminutas: con cinco datos, la muestra se parece poco a la población y las remuestras heredan todos sus defectos. El tercero es la dependencia. Si los datos son una serie temporal, como las temperaturas diarias o los precios de una acción, cada observación se parece a la anterior, y remuestrearlas por separado destruye esa estructura. Hans Künsch propuso en 1989 remuestrear bloques de observaciones consecutivas en lugar de observaciones sueltas, y esa variante, el block bootstrap, es la que se usa en econometría y en climatología.

Hoy el bootstrap es el método por defecto para poner márgenes de error a cualquier cosa que no tenga una fórmula conocida. Se usa para los intervalos de los árboles filogenéticos, donde cada rama lleva el porcentaje de remuestras en que aparece; para medir la estabilidad de un agrupamiento; y, cada vez más, para comparar modelos de inteligencia artificial, donde la pregunta de si un sistema que acierta el 71 por ciento de un examen es de verdad mejor que otro que acierta el 69 se responde remuestreando las preguntas del examen, como explica el artículo sobre el ruido en una evaluación. También los bosques aleatorios de aprendizaje automático son bootstrap: cada árbol se entrena con una remuestra distinta de los datos, y la variedad que eso produce es lo que hace que el conjunto se equivoque menos que cualquiera de sus árboles. Lo que Efron cambió no fue solo una técnica, sino la relación de la estadística con el cálculo: donde antes había que suponer una distribución para poder derivar una fórmula, ahora basta con simular lo que habría pasado.

Este itinerario ordena artículos de la enciclopedia; cada uno vive también suelto, con sus fuentes y su historial. ¿Le falta un capítulo o le sobra uno? Dínoslo.

Todos los itinerarios →