5 min
Editar

El muestreo probabilístico

El muestreo probabilístico es el conjunto de procedimientos para seleccionar una muestra en los que cada elemento de la población tiene una probabilidad conocida y distinta de cero de ser elegido, y en los que la selección se hace al azar. Esa doble condición es la que permite generalizar los resultados de la muestra a la población con un margen de error calculable: si se encuesta al azar a mil personas, se puede decir no solo qué porcentaje opina algo, sino con qué precisión se sabe. Se opone al muestreo no probabilístico, en el que los elementos se eligen por conveniencia, por juicio del investigador o por cuotas, y en el que ese error no puede calcularse.

Para aplicarlo hace falta un marco muestral: una lista o un procedimiento que permita identificar a todos los elementos de la población, como el padrón de una ciudad, la matrícula de una universidad o el registro de empresas de un sector. Cuando no existe o está incompleto, el azar se aplica sobre una lista que no representa a la población, y la muestra hereda sus defectos por grande que sea. El ejemplo clásico es la encuesta de la revista Literary Digest en 1936, que recibió unos 2,4 millones de respuestas y pronosticó la derrota de Franklin D. Roosevelt, que ganó con cerca del 61 % de los votos. Peverill Squire mostró en 1988 que el fallo se debió sobre todo a quién respondió y no al tamaño: la muestra no se había seleccionado al azar de la población. La teoría que da base al muestreo aleatorio moderno la estableció Jerzy Neyman en 1934.

Hay cuatro tipos básicos. En el muestreo aleatorio simple, cada elemento y cada combinación de elementos tienen la misma probabilidad de ser elegidos; se numera la población y se sortean los números con un programa. En el muestreo sistemático se elige al azar un punto de partida y después se toma un elemento cada cierto intervalo; es más fácil de aplicar, pero falla si la lista tiene un orden periódico que coincide con el intervalo. En el muestreo estratificado la población se divide en grupos homogéneos, llamados estratos, y se extrae una muestra aleatoria dentro de cada uno; garantiza que todos los grupos estén representados y reduce el error. En el muestreo por conglomerados se sortean grupos naturales, como escuelas, manzanas o municipios, y se estudia a todos o a una parte de sus miembros; es más barato cuando la población está dispersa, aunque menos preciso. Las encuestas nacionales combinan varios en un muestreo polietápico.

Un ejemplo resuelto muestra cómo se aplican en una tesis. Se quiere estimar qué proporción de los 4.000 estudiantes de una universidad trabaja mientras estudia, con un 95 % de confianza y un margen de error de 5 puntos. Como no se conoce la proporción, se usa la más desfavorable, el 50 %. La fórmula para una población infinita da:

n0=z2 p qe2=1,962×0,5×0,50,052=384,16n_0 = \frac{z^2 \, p \, q}{e^2} = \frac{1{,}96^2 \times 0{,}5 \times 0{,}5}{0{,}05^2} = 384{,}16

Como la población es finita, se corrige:

n=n01+n0−1N=384,161+383,164000=350,6n = \frac{n_0}{1 + \frac{n_0 - 1}{N}} = \frac{384{,}16}{1 + \frac{383{,}16}{4000}} = 350{,}6

y se redondea hacia arriba, a 351 estudiantes. Si se espera que respondan nueve de cada diez, conviene seleccionar unos 390 para acabar con 351 respuestas válidas.

Como el trabajo puede variar mucho de una facultad a otra, se usa un muestreo estratificado proporcional: cada facultad aporta a la muestra la misma proporción que tiene en la población. Si Educación tiene 1.200 estudiantes, Ingeniería 1.000, Ciencias de la Salud 800, Derecho 600 y Administración 400, sus pesos son el 30 %, el 25 %, el 20 %, el 15 % y el 10 %, y la muestra se reparte en 105, 88, 70, 53 y 35 estudiantes, que suman 351. Dentro de cada facultad se aplica un muestreo sistemático sobre la lista de matriculados ordenada alfabéticamente: en Educación, 1.200 entre 105 da un intervalo de unos 11, así que se sortea un número entre 1 y 11, por ejemplo el 7, y se toman los estudiantes 7, 18, 29, 40 y así sucesivamente hasta completar los 105. En el marco metodológico todo esto se resume en una frase: se seleccionó una muestra de 351 estudiantes mediante muestreo estratificado proporcional por facultad, con selección sistemática dentro de cada estrato a partir de las listas de matrícula del semestre.

Si en lugar de estudiantes sueltos resulta más práctico encuestar aulas enteras, el diseño es por conglomerados: se numeran todas las secciones de primer año y se sortean, por ejemplo, 12 de 60, encuestando a todos sus estudiantes. El procedimiento es más barato, pero como los estudiantes de una misma aula se parecen entre sí, la precisión es menor que con el mismo número de estudiantes elegidos uno a uno, y los manuales de William Cochran (1953) y Leslie Kish (1965) enseñan a corregir el tamaño por ese efecto de diseño.

El azar tiene que ser real. En diciembre de 1969 los Estados Unidos sortearon el orden de llamada al servicio militar introduciendo en un recipiente cápsulas con las fechas de nacimiento, y los nacidos en los últimos meses del año recibieron números sistemáticamente más bajos. Stephen Fienberg explicó en 1971 que las cápsulas se habían introducido mes por mes y no se habían mezclado bien. Hoy el sorteo se hace con un generador de números aleatorios, como la función ALEATORIO.ENTRE de una hoja de cálculo o sample() en R, y conviene anotar la semilla o guardar la lista sorteada para que el procedimiento pueda comprobarse.

Fotografía antigua de un grupo de hombres trajeados y uniformados alrededor de una mesa con un gran recipiente de vidrio, uno de ellos con los ojos vendados
Fig. 1 Newton D. Baker, secretario de Guerra de los Estados Unidos, saca con los ojos vendados el primer número del sorteo de reclutamiento el 20 de julio de 1917. La venda y la urna eran la garantía pública de que cada número tenía la misma probabilidad.Created By: War Department · 1917 · Dominio público · Wikimedia Commons

En las tesis es frecuente declarar un muestreo probabilístico que no se ha hecho: se encuesta a los estudiantes de las aulas a las que el investigador tiene acceso y se llama a eso muestra aleatoria. Esa práctica no invalida el estudio, pero sí la generalización. Si la muestra es de conveniencia, lo correcto es decirlo, describir sus características y limitar las conclusiones a quienes se parecen a ella. El error de muestreo solo puede calcularse cuando el azar ha intervenido de verdad.

Muestreo aleatorio simple – Muestreo no probabilístico – Tamaño de la muestra – Marco muestral – Error de muestreo – Diseño muestral

§

Fuentes

  1. Jerzy NeymanOn the Two Different Aspects of the Representative Method: The Method of Stratified Sampling and the Method of Purposive SelectionJournal of the Royal Statistical Society 97 (4), 558-6251934enlace
  2. William G. CochranSampling TechniquesWiley, Nueva York1953
  3. Leslie KishSurvey SamplingWiley, Nueva York1965
  4. Stephen E. FienbergRandomization and Social Affairs: The 1970 Draft LotteryScience 171 (3968), 255-2611971enlace
  5. Peverill SquireWhy the 1936 Literary Digest Poll FailedPublic Opinion Quarterly 52 (1), 125-1331988enlace
Sarasola, Josemari (2025). "El muestreo probabilístico". Ikusmira. Recuperado de https://ikusmira.org/p/muestreo-probabilistico/

Una errata, un dato desfasado, un párrafo que falta: edítalo y la redacción revisa tu propuesta.

Sugerir una mejora →