La moda para datos agrupados en intervalos es el valor que, dentro de una distribución de frecuencias cuyos datos se han reunido en clases, se toma como el más frecuente. Cuando los datos están sin agrupar, la moda se lee directamente: es el valor que más se repite. Al agruparlos en intervalos de clase se pierde el valor exacto de cada observación y solo se sabe cuántas caen en cada tramo, de modo que la moda deja de leerse y pasa a estimarse en dos pasos: localizar la clase modal y, dentro de ella, interpolar.
Primer paso: la clase modal
La clase modal es el intervalo con mayor frecuencia absoluta , siempre que todos los intervalos tengan la misma amplitud. Si las amplitudes son distintas, comparar frecuencias engaña, porque un intervalo el doble de ancho recoge más datos sin que estén más concentrados. En ese caso se compara la densidad de frecuencia, , y la clase modal es la de mayor densidad. Es lo mismo que mirar la barra más alta de un histograma bien construido, donde la altura de cada barra es la densidad y no la frecuencia.
Segundo paso: interpolar dentro de la clase
Tomar el punto medio de la clase modal es la estimación más tosca. La fórmula habitual, debida a Czuber, desplaza la moda hacia el lado de la clase vecina con más frecuencia:
donde:
- es el límite inferior de la clase modal.
- es su amplitud.
- es el exceso de frecuencia de la clase modal sobre la anterior.
- es el exceso sobre la siguiente.
Si las dos vecinas tienen la misma frecuencia, y la moda cae justo en el centro del intervalo. Si la clase anterior está casi tan poblada como la modal, es pequeño y la moda se acerca a . Con amplitudes desiguales, y se calculan con densidades en lugar de frecuencias.
Ejemplo
El peso, en kilos, de 60 personas se ha agrupado en cinco clases de 10 kg:
| Peso (kg) | |
|---|---|
| [50, 60) | 8 |
| [60, 70) | 15 |
| [70, 80) | 22 |
| [80, 90) | 12 |
| [90, 100) | 3 |
Las amplitudes son iguales, así que la clase modal es [70, 80), con 22 personas. Entonces , , y :
La moda queda por debajo del centro de la clase (75 kg) porque la clase anterior, con 15 personas, pesa más que la siguiente, con 12.
Una fórmula alternativa
Algunos manuales usan otra interpolación, que solo mira las frecuencias de las dos clases vecinas:
Con los datos anteriores da kg. Las dos fórmulas no coinciden porque parten de supuestos distintos sobre cómo se reparten los datos dentro de la clase, y ninguna es más «verdadera»: ambas estiman un valor que la agrupación ha borrado. Lo importante es indicar cuál se ha usado. La de Czuber es la más extendida y la que da el mismo resultado que ajustar una parábola a las tres barras centrales del histograma.
Limitaciones
- La moda de datos agrupados depende de cómo se hayan hecho los intervalos: moviendo los límites o cambiando la amplitud puede cambiar la clase modal.
- Si la clase modal es la primera o la última, falta una de las vecinas y se toma su frecuencia como cero.
- Si dos clases no contiguas empatan en frecuencia máxima, la distribución es bimodal y conviene dar las dos modas en lugar de promediarlas.
Junto con la mediana para datos agrupados y la media aritmética para datos agrupados, completa las tres medidas de posición central que se calculan sobre una tabla de frecuencias. En el ejemplo, la media es 72,83 kg y la mediana 73,18 kg: las tres quedan cerca porque la distribución es casi simétrica, y la moda algo por encima porque la cola izquierda es más larga que la derecha.
Fuentes
- Emanuel CzuberDie statistischen ForschungsmethodenL. W. Seidel & Sohn1921
- Francisco J. Martín PliegoIntroducción a la estadística económica y empresarialThomson2004