El problema de las comparaciones múltiples (en inglés, multiple comparisons) es que la probabilidad de encontrar por azar un resultado estadísticamente significativo crece con el número de cosas que se prueban. El umbral de significación habitual, un valor p por debajo de 0,05, garantiza que una hipótesis falsa solo pasará por verdadera una vez de cada veinte. Pero si se prueban veinte hipótesis falsas a la vez, lo esperable es que una pase, y la probabilidad de que pase al menos una es del 64 por ciento. Con cien, del 99. Quien busca en suficientes sitios encuentra siempre algo, y si solo cuenta dónde lo encontró, el resultado tiene el mismo aspecto que un descubrimiento.
Randall Munroe dibujó el problema en 2011 en una tira de su serie xkcd. Unos científicos investigan si las gominolas causan acné, y no encuentran relación. Les piden que prueben color por color, y prueban veinte. Diecinueve salen sin efecto; las verdes, con p menor que 0,05. Al día siguiente, el titular del periódico dice que las gominolas verdes causan acné, con un 95 por ciento de confianza y una probabilidad de uno entre veinte de que sea casualidad. La figura reproduce el experimento y lo generaliza. Cada punto es el valor p de una hipótesis, ordenados de menor a mayor en escala logarítmica, y la zona sombreada es la que se declara significativa según el criterio elegido.
Con los valores de partida, veinte hipótesis sin ningún efecto real, cada estudio es el de las gominolas. Unas veces no sale nada; muchas sale un color, y a veces dos. Al pulsar para hacer mil estudios, la proporción de los que encuentran al menos una falsa alarma se queda cerca del 64 por ciento que da la cuenta, uno menos 0,95 elevado a veinte. Ninguno de esos estudios ha hecho nada mal en cada prueba por separado. El error está en la suma: la probabilidad de equivocarse que se había fijado en el 5 por ciento era la de cada prueba, y lo que se ha hecho es darse veinte oportunidades.
El ejemplo más célebre de lo que pasa cuando no se corrige es un salmón. En 2009, Craig Bennett y otros tres neurocientíficos metieron en un escáner de resonancia magnética funcional un salmón del Atlántico comprado en un supermercado, muerto, y le enseñaron fotografías de personas en situaciones sociales mientras le pedían que dijera qué emociones sentían. Analizaron las imágenes con el procedimiento estándar, que prueba por separado si cada uno de los miles de vóxeles del cerebro, los píxeles tridimensionales de la imagen, se activa con la tarea, y sin corregir por el número de pruebas. Encontraron un grupo de vóxeles activos en el cerebro del pez. Con la corrección, desaparecieron. Lo presentaron primero como póster y lo publicaron en 2010 en una revista de resultados inesperados, con un subtítulo que era la tesis: un argumento a favor de la corrección adecuada para comparaciones múltiples. En aquel momento, una parte considerable de los artículos de neuroimagen no la aplicaba, y el estudio, que recibió el premio Ig Nobel de neurociencia en 2012, contribuyó a que hoy casi todos lo hagan.
La corrección más sencilla es la de Bonferroni, que debe su nombre al matemático italiano Carlo Emilio Bonferroni, autor en 1936 de la desigualdad en la que se basa, y que Olive Jean Dunn convirtió en 1961 en un procedimiento práctico. Consiste en dividir el umbral por el número de pruebas: con veinte hipótesis, cada una tiene que bajar de 0,05/20 = 0,0025 para contar. Así la probabilidad de que salga al menos una falsa alarma en todo el estudio, lo que se llama tasa de error por familia (family-wise error rate), no pasa del 5 por ciento. La genética usa una versión extrema: en los estudios que prueban un millón de variantes del genoma a la vez, el umbral de significación es de 5 × 10⁻⁸, que es aproximadamente 0,05 dividido entre un millón. La física de partículas exige cinco sigmas, un p del orden de uno entre tres millones, en parte por la misma razón: cuando se buscan picos a lo largo de todo un rango de energías, alguno saldrá por azar, y a eso los físicos lo llaman efecto de mirar en otra parte (look-elsewhere effect).
El precio de Bonferroni es la potencia. Con un umbral veinte veces más exigente, los efectos reales también cuesta más detectarlos, y si se prueban mil hipótesis el umbral es tan estricto que casi nada lo supera. Yoav Benjamini y Yosef Hochberg propusieron en 1995 cambiar la pregunta. En lugar de controlar la probabilidad de cometer una sola falsa alarma, controlar la proporción de falsas alarmas entre los hallazgos, que llamaron tasa de falsos descubrimientos (false discovery rate). El procedimiento ordena los valores p de menor a mayor y compara el que ocupa el puesto i con 0,05 × i/m, donde m es el número de pruebas: el umbral sube escalón a escalón, y se aceptan todos los valores hasta el último que queda por debajo de su escalón. En la figura se ve como una rampa. Si se ponen varias hipótesis con efecto real, Benjamini-Hochberg detecta más que Bonferroni y mantiene las falsas alarmas en torno a un 5 por ciento de lo que declara, no de lo que prueba. El artículo de 1995 es uno de los más citados de toda la estadística, porque llegó justo cuando la genómica empezaba a probar miles de genes a la vez.
Las correcciones resuelven el problema cuando se sabe cuántas pruebas se han hecho. El caso difícil es cuando no se sabe, porque las comparaciones no se hacen de una vez sino a lo largo de un análisis. Un investigador recoge datos y puede decidir qué variable medir entre varias parecidas, si excluir a los participantes que respondieron demasiado deprisa, si analizar a hombres y mujeres juntos o por separado, si controlar por la edad, cuándo dejar de recoger datos. Cada decisión es razonable por sí sola, y ninguna se toma con intención de engañar, pero todas se toman después de ver los datos, y cada camino posible es una comparación más. Andrew Gelman y Eric Loken lo llamaron en 2013 el jardín de los senderos que se bifurcan, tomando el título del cuento de Borges, y señalaron que el problema existe aunque el investigador solo haya recorrido un sendero: basta con que, si los datos hubieran salido de otra manera, hubiera elegido otro. Es lo que Joseph Simmons, Leif Nelson y Uri Simonsohn demostraron en 2011 con datos inventados, y lo que se ha llamado p-hacking cuando se hace a sabiendas.
Contra esa versión del problema no hay fórmula, y la solución que se ha ido imponiendo es de procedimiento: registrar el análisis antes de recoger los datos, de modo que el número de comparaciones quede fijado de antemano y cualquier otra se presente como lo que es, exploratoria. También cambia la manera de leer. Un hallazgo que sale de un estudio que probó muchas cosas, sobre todo si es sorprendente y el estudio no dice cuántas probó, merece la misma desconfianza que el titular de las gominolas verdes. Y el problema no es exclusivo de la ciencia: el inversor que prueba cien estrategias con los datos del pasado y se queda con la que habría ganado, el aficionado que encuentra en los datos de la lotería el número que «sale más», o el que se asombra de una coincidencia sin pensar en todas las que no ocurrieron, están haciendo, como en el problema del cumpleaños, comparaciones múltiples sin contarlas.
Fuentes
- Olive Jean DunnMultiple Comparisons Among MeansJournal of the American Statistical Association 56 (293)1961enlace
- Yoav Benjamini y Yosef HochbergControlling the False Discovery Rate: A Practical and Powerful Approach to Multiple TestingJournal of the Royal Statistical Society, Series B 57 (1)1995enlace
- Craig M. Bennett, Abigail A. Baird, Michael B. Miller y George L. WolfordNeural Correlates of Interspecies Perspective Taking in the Post-Mortem Atlantic Salmon: An Argument For Proper Multiple Comparisons CorrectionJournal of Serendipitous and Unexpected Results 1 (1)2010
- Andrew Gelman y Eric LokenThe Statistical Crisis in ScienceAmerican Scientist 102 (6)2014
- Randall MunroeSignificantxkcd, n.º 8822011enlace