El bootstrap (la palabra se usa tal cual en español, y a veces se traduce por remuestreo) es una manera de medir cuánto se puede fiar uno de una cifra calculada a partir de una muestra, usando solo la propia muestra. La idea es sacar de ella, al azar y con reposición, muchas muestras nuevas del mismo tamaño, calcular la cifra en cada una y mirar cuánto varía. Esa variación imita la que se vería si se pudiera volver a muestrear la población una y otra vez, que es precisamente lo que no se puede hacer. El nombre viene de la expresión inglesa to pull oneself up by one’s bootstraps, levantarse tirando de los cordones de las propias botas, que se suele asociar con el barón de Münchhausen, aunque en el libro él se saca del pantano tirando de su propia coleta, y que describe algo que parece imposible: sacar información sobre la incertidumbre de unos datos sin más material que esos mismos datos.
La figura usa el ejemplo con el que Bradley Efron y Robert Tibshirani enseñan el método en su manual de 1993. Son quince facultades de derecho de Estados Unidos, elegidas al azar entre las ochenta y dos que participaron en un estudio sobre admisiones, con dos notas por facultad: la media de su examen de acceso, el LSAT, y la media de las calificaciones del grado de sus alumnos, el GPA. La correlación entre las dos es de 0,776, y la pregunta es cuánto habría cambiado si el azar hubiera elegido otras quince.
Al pulsar «Una remuestra» se ve el mecanismo. Se sacan quince facultades de la bolsa de quince, devolviendo cada una a la bolsa antes de sacar la siguiente, de modo que algunas salen repetidas y otras no salen. Por término medio, cada remuestra deja fuera algo más de un tercio de los datos originales y ocupa ese hueco con repeticiones. Con cada remuestra se calcula de nuevo la correlación, que sale 0,69, 0,85, 0,61, y el histograma va recogiendo esos valores. Con mil remuestras, su desviación típica anda por 0,13, y esa cifra es el error típico de la correlación según el bootstrap. El intervalo que deja fuera el 2,5 por ciento más bajo y el 2,5 por ciento más alto va aproximadamente de 0,46 a 0,96, y es un intervalo de confianza al 95 por ciento conseguido sin una sola fórmula.
Hay una razón para que sea tan útil precisamente con la correlación. Para la media existe una fórmula sencilla del error típico, la desviación típica dividida por la raíz de n, y el bootstrap se limita a reproducirla, como se ve eligiendo la media en el desplegable. Para la correlación, la fórmula clásica supone que los datos siguen una distribución normal en dos dimensiones, y con quince datos nadie puede comprobarlo. Para la mediana, la fórmula existe pero depende de la densidad de la población justo en el centro, que tampoco se conoce. Y para cosas como el cociente entre dos medianas, el coeficiente de una regresión robusta o la precisión de un modelo de aprendizaje automático medida sobre un conjunto de prueba, no hay fórmula que valga. El bootstrap trata a todas igual: se calcula la cifra, se remuestrea, se vuelve a calcular. Lo que antes exigía una derivación matemática para cada estadístico pasa a exigir solo tiempo de ordenador.
La razón por la que funciona es que la muestra, si se ha tomado al azar, es la mejor estimación disponible de la población. Remuestrear la muestra equivale a tratarla como si fuera la población y a preguntarse qué pasaría si de esa población se sacaran muestras de quince. Si la muestra se parece a la población, la variación entre remuestras se parece a la variación entre muestras. La justificación rigurosa, que Efron dio en 1979 y que se afinó durante la década siguiente, demuestra que para una clase amplia de estadísticos la aproximación mejora al crecer la muestra, y que en algunos casos es incluso más precisa que la aproximación normal clásica.
El método tenía un antecedente. En 1949, Maurice Quenouille propuso corregir el sesgo de un estimador recalculándolo quitando cada vez un dato, y en 1958 John Tukey convirtió esa idea en un método para estimar errores típicos y le puso nombre de herramienta: la navaja (jackknife), por ser algo tosco que sirve para casi todo. Efron presentó el bootstrap en 1979, en un artículo de The Annals of Statistics cuyo subtítulo, otra mirada a la navaja, reconocía la deuda, y demostró que la navaja era una aproximación lineal al bootstrap. El método tardó en imponerse porque exigía una potencia de cálculo que a finales de los setenta no estaba al alcance de cualquiera: mil remuestras de un conjunto de datos mediano eran una noche entera de ordenador central. Con los ordenadores personales se volvió trivial, y en 2019 Efron recibió por él el Premio Internacional de Estadística, que se concede cada dos años a una contribución que haya cambiado la disciplina.
El bootstrap no es una varita mágica, y hay casos en los que falla de manera instructiva. El más claro es el máximo. Si se quiere estimar el valor más alto posible de una población a partir del mayor valor observado, el bootstrap no sirve, porque ninguna remuestra puede producir un máximo mayor que el de la muestra, y alrededor de un 63 por ciento de las remuestras lo repiten exactamente. El histograma sale con una barra enorme en el máximo observado y nada a su derecha, que es justo donde está la verdad. Para ese problema hay métodos propios, que el problema del tanque alemán resolvió en la Segunda Guerra Mundial. El segundo fallo son las muestras diminutas: con cinco datos, la muestra se parece poco a la población y las remuestras heredan todos sus defectos. El tercero es la dependencia. Si los datos son una serie temporal, como las temperaturas diarias o los precios de una acción, cada observación se parece a la anterior, y remuestrearlas por separado destruye esa estructura. Hans Künsch propuso en 1989 remuestrear bloques de observaciones consecutivas en lugar de observaciones sueltas, y esa variante, el block bootstrap, es la que se usa en econometría y en climatología.
Hoy el bootstrap es el método por defecto para poner márgenes de error a cualquier cosa que no tenga una fórmula conocida. Se usa para los intervalos de los árboles filogenéticos, donde cada rama lleva el porcentaje de remuestras en que aparece; para medir la estabilidad de un agrupamiento; y, cada vez más, para comparar modelos de inteligencia artificial, donde la pregunta de si un sistema que acierta el 71 por ciento de un examen es de verdad mejor que otro que acierta el 69 se responde remuestreando las preguntas del examen, como explica el artículo sobre el ruido en una evaluación. También los bosques aleatorios de aprendizaje automático son bootstrap: cada árbol se entrena con una remuestra distinta de los datos, y la variedad que eso produce es lo que hace que el conjunto se equivoque menos que cualquiera de sus árboles. Lo que Efron cambió no fue solo una técnica, sino la relación de la estadística con el cálculo: donde antes había que suponer una distribución para poder derivar una fórmula, ahora basta con simular lo que habría pasado.
Fuentes
- Bradley EfronBootstrap Methods: Another Look at the JackknifeThe Annals of Statistics 7 (1)1979enlace
- Bradley Efron y Robert J. TibshiraniAn Introduction to the BootstrapChapman & Hall, Nueva York1993
- John W. TukeyBias and confidence in not-quite large samplesThe Annals of Mathematical Statistics 29 (2)1958
- Maurice H. QuenouilleNotes on Bias in EstimationBiometrika 43 (3-4)1956enlace
- Hans R. KünschThe Jackknife and the Bootstrap for General Stationary ObservationsThe Annals of Statistics 17 (3)1989enlace