Cálculo de la moda estadística para datos agrupados en intervalos

4 min
Editar

La moda para datos agrupados en intervalos es el valor que, dentro de una distribución de frecuencias cuyos datos se han reunido en clases, se toma como el más frecuente. Cuando los datos están sin agrupar, la moda se lee directamente: es el valor que más se repite. Al agruparlos en intervalos de clase se pierde el valor exacto de cada observación y solo se sabe cuántas caen en cada tramo, de modo que la moda deja de leerse y pasa a estimarse en dos pasos: localizar la clase modal y, dentro de ella, interpolar.

Primer paso: la clase modal

La clase modal es el intervalo con mayor frecuencia absoluta fif_i, siempre que todos los intervalos tengan la misma amplitud. Si las amplitudes son distintas, comparar frecuencias engaña, porque un intervalo el doble de ancho recoge más datos sin que estén más concentrados. En ese caso se compara la densidad de frecuencia, hi=fi/aih_i = f_i / a_i, y la clase modal es la de mayor densidad. Es lo mismo que mirar la barra más alta de un histograma bien construido, donde la altura de cada barra es la densidad y no la frecuencia.

Segundo paso: interpolar dentro de la clase

Tomar el punto medio de la clase modal es la estimación más tosca. La fórmula habitual, debida a Czuber, desplaza la moda hacia el lado de la clase vecina con más frecuencia:

Mo=Li+d1d1+d2×aiMo = L_i + \frac{d_1}{d_1 + d_2} \times a_i

donde:

  • LiL_i es el límite inferior de la clase modal.
  • aia_i es su amplitud.
  • d1=fi−fi−1d_1 = f_i - f_{i-1} es el exceso de frecuencia de la clase modal sobre la anterior.
  • d2=fi−fi+1d_2 = f_i - f_{i+1} es el exceso sobre la siguiente.

Si las dos vecinas tienen la misma frecuencia, d1=d2d_1 = d_2 y la moda cae justo en el centro del intervalo. Si la clase anterior está casi tan poblada como la modal, d1d_1 es pequeño y la moda se acerca a LiL_i. Con amplitudes desiguales, d1d_1 y d2d_2 se calculan con densidades en lugar de frecuencias.

Procedimiento para estimar la moda de datos agrupados: elegir frecuencias o densidades según las amplitudes, localizar la clase modal e interpolar con la fórmula de Czuber

Ejemplo

El peso, en kilos, de 60 personas se ha agrupado en cinco clases de 10 kg:

Peso (kg)fif_i
[50, 60)8
[60, 70)15
[70, 80)22
[80, 90)12
[90, 100)3

Las amplitudes son iguales, así que la clase modal es [70, 80), con 22 personas. Entonces Li=70L_i = 70, ai=10a_i = 10, d1=22−15=7d_1 = 22 - 15 = 7 y d2=22−12=10d_2 = 22 - 12 = 10:

Mo=70+77+10×10=74,12 kgMo = 70 + \frac{7}{7 + 10} \times 10 = 74{,}12 \text{ kg}

La moda queda por debajo del centro de la clase (75 kg) porque la clase anterior, con 15 personas, pesa más que la siguiente, con 12.

Una fórmula alternativa

Algunos manuales usan otra interpolación, que solo mira las frecuencias de las dos clases vecinas:

Mo=Li+fi+1fi−1+fi+1×aiMo = L_i + \frac{f_{i+1}}{f_{i-1} + f_{i+1}} \times a_i

Con los datos anteriores da 70+1215+12×10=74,4470 + \frac{12}{15 + 12} \times 10 = 74{,}44 kg. Las dos fórmulas no coinciden porque parten de supuestos distintos sobre cómo se reparten los datos dentro de la clase, y ninguna es más «verdadera»: ambas estiman un valor que la agrupación ha borrado. Lo importante es indicar cuál se ha usado. La de Czuber es la más extendida y la que da el mismo resultado que ajustar una parábola a las tres barras centrales del histograma.

Limitaciones

  • La moda de datos agrupados depende de cómo se hayan hecho los intervalos: moviendo los límites o cambiando la amplitud puede cambiar la clase modal.
  • Si la clase modal es la primera o la última, falta una de las vecinas y se toma su frecuencia como cero.
  • Si dos clases no contiguas empatan en frecuencia máxima, la distribución es bimodal y conviene dar las dos modas en lugar de promediarlas.

Junto con la mediana para datos agrupados y la media aritmética para datos agrupados, completa las tres medidas de posición central que se calculan sobre una tabla de frecuencias. En el ejemplo, la media es 72,83 kg y la mediana 73,18 kg: las tres quedan cerca porque la distribución es casi simétrica, y la moda algo por encima porque la cola izquierda es más larga que la derecha.

§

Fuentes

  1. Emanuel CzuberDie statistischen ForschungsmethodenL. W. Seidel & Sohn1921
  2. Francisco J. Martín PliegoIntroducción a la estadística económica y empresarialThomson2004
Sarasola, Josemari (2023). "Cálculo de la moda estadística para datos agrupados en intervalos". Ikusmira. Recuperado de https://ikusmira.org/p/calculo-de-la-moda-estadistica-para-datos-agrupados-en-intervalos/

Una errata, un dato desfasado, un párrafo que falta: edítalo y la redacción revisa tu propuesta.

Sugerir una mejora →
§ Tres puertas

¿Por dónde sigues?