GUIDE 01

Desviación estándar: muestral (n−1) frente a poblacional (n)

¿Por qué la desviación estándar muestral divide entre n−1? Corrección de Bessel, STDEV.S frente a STDEV.P y un ejemplo resuelto a mano.

La desviación estándar es la medida más utilizada para expresar cuánto se dispersan los datos alrededor de la media. Sin embargo, al calcularla con una calculadora o con Excel, a veces aparecen dos valores distintos. Uno divide la suma de cuadrados de las desviaciones entre n y el otro entre n−1. En este artículo explicamos con ejemplos qué significa cada fórmula, por qué en una muestra se usa n−1 y cuál conviene elegir en la práctica.

La diferencia entre las dos fórmulas

Cuando se conoce la población completa, la desviación estándar (desviación estándar poblacional) es:

  • Desviación estándar poblacional: σ = √(Σ(x−μ)² / N)

Cuando se estima la dispersión de la población a partir de una muestra, es decir, de solo una parte de ella, se usa esta fórmula:

  • Desviación estándar muestral: s = √(Σ(x−x̄)² / (n−1))

Hay dos diferencias. Primera: el centro no es la media poblacional μ, sino la media muestral . Segunda: el divisor no es n, sino n−1. Esta segunda diferencia se llama corrección de Bessel (Bessel's correction).

¿Por qué se divide entre n−1?

La media muestral se calcula a partir de esa misma muestra, así que queda situada lo más cerca posible de sus datos. De hecho, la suma de cuadrados Σ(x−c)² alcanza su mínimo cuando c es la media muestral. Por eso, si medimos las desviaciones respecto a en lugar de respecto a la verdadera media poblacional μ, la suma de cuadrados sale sistemáticamente más pequeña.

Matemáticamente, el valor esperado de la varianza dividida entre n es (n−1)/n × σ². Por ejemplo, con un tamaño de muestra de 5, la varianza dividida entre n vale en promedio solo 4/5 = 80% de la varianza real. Para corregir esta subestimación se multiplica por n/(n−1), lo que equivale a dividir entre n−1. Así, se convierte en un estimador insesgado de la varianza poblacional σ².

Otra forma de explicarlo son los grados de libertad. Las n desviaciones (x−x̄) tienen una restricción: su suma siempre debe ser 0. Por tanto, basta con fijar n−1 desviaciones para que la última quede determinada automáticamente. Como solo hay n−1 datos que pueden variar libremente, se divide entre n−1.

Atención: es un estimador insesgado de σ², pero su raíz cuadrada s no es un estimador insesgado de σ. Como la raíz cuadrada es una función cóncava, s es en promedio algo menor que σ. Aun así, cuando la muestra crece esta diferencia se vuelve despreciable, por lo que en la práctica se usa s sin más.

Ejemplo resuelto a mano

Supongamos que tenemos estos 8 valores:

2, 4, 4, 4, 5, 5, 7, 9

Paso 1: la media

x̄ = (2+4+4+4+5+5+7+9) / 8 = 40 / 8 = 5

Paso 2: desviaciones y desviaciones al cuadrado

Valor xDesviación x−x̄Desviación al cuadrado
2−39
4−11
4−11
4−11
500
500
724
9416

La suma de las desviaciones es −3−1−1−1+0+0+2+4 = 0, lo que confirma la restricción mencionada. La suma de cuadrados de las desviaciones es 9+1+1+1+0+0+4+16 = 32.

Paso 3: las dos varianzas y desviaciones estándar

CriterioVarianzaDesviación estándar
Poblacional (÷n)32 / 8 = 4√4 = 2
Muestral (÷(n−1))32 / 7 ≈ 4.5714√4.5714 ≈ 2.1381

Si estos 8 valores son todo lo que nos interesa, la desviación estándar es 2. En cambio, si son 8 valores extraídos de un grupo mayor y queremos estimar la dispersión de ese grupo, debemos informar aproximadamente 2.1381. Con un n pequeño como 8, la diferencia entre ambos valores es de alrededor del 7 %, bastante visible. Con n = 100 baja a cerca del 0.5 %, y con n = 1,000 a cerca del 0.05 %.

¿Cuándo usar cada una?

El criterio es: "¿los datos que tengo son todo lo que quiero describir o solo una parte?".

  • Población (÷n): cuando los datos son el conjunto completo, por ejemplo al describir la dispersión de las notas de los 30 estudiantes de una clase solo para esa clase, o la distribución salarial de toda la plantilla de una empresa.
  • Muestra (÷(n−1)): cuando los datos son parte de un grupo mayor, por ejemplo al estimar las opiniones de todo un país a partir de 500 encuestados, o la variabilidad de todo un proceso a partir de 20 piezas tomadas de la línea de producción.

La mayoría de los datos que se manejan en la práctica son muestras. Los cálculos que conducen a inferencias, como los intervalos de confianza, la prueba t o el cálculo del tamaño de muestra, suponen todos la desviación estándar muestral s. Si no está claro cuál corresponde, usar la fórmula muestral es la opción conservadora.

Equivalencias en Excel y lenguajes de programación

HerramientaMuestral (÷(n−1))Poblacional (÷n)
Excel · Google SheetsSTDEV.S, VAR.S (versión antigua STDEV)STDEV.P, VAR.P (versión antigua STDEVP)
Rsd(), var()Hay que corregir manualmente
Python pandasSeries.std() por defecto ddof=1std(ddof=0)
Python NumPynp.std(x, ddof=1)np.std(x) por defecto ddof=0

En particular, NumPy y pandas tienen valores por defecto opuestos, así que es frecuente obtener resultados distintos con los mismos datos. Al comparar resultados, conviene comprobar primero qué fórmula se usó. (En Excel en español, estas funciones se llaman DESVEST.M y DESVEST.P.)

Cómo leer el valor de la desviación estándar

La desviación estándar tiene las mismas unidades que los datos originales: "puntos" si son calificaciones, "cm" si son estaturas. La varianza tiene unidades al cuadrado y es difícil de interpretar intuitivamente, por lo que al informar se suele usar la desviación estándar. Si los datos se aproximan a una distribución normal, se puede interpretar a grandes rasgos que alrededor del 68 % de los valores está dentro de la media ± 1 desviación estándar y alrededor del 95 % dentro de ± 2 desviaciones estándar. Para comparar la dispersión de dos grupos con medias muy distintas, a veces se usa también el coeficiente de variación (CV), que es la desviación estándar dividida entre la media.

Errores frecuentes

  1. No indicar qué fórmula se usó en el informe: en muestras pequeñas los valores difieren de forma apreciable, así que conviene especificar el símbolo s o σ, o la expresión "desviación estándar muestral".
  2. Confundir la desviación estándar con el error estándar: el error estándar SE = s / √n no mide la dispersión de los datos individuales, sino la de la media muestral. En los intervalos de confianza se usa el error estándar.
  3. Calcular la desviación estándar muestral con n igual a 1: n−1 vale 0, así que no está definida. Es normal que la calculadora muestre un error.
  4. No revisar los valores atípicos: como la desviación estándar usa cuadrados, un solo valor extremo la altera mucho. Si sospechas de valores atípicos, consulta también el rango intercuartílico (IQR).

Si pegas tus datos en la calculadora de estadística descriptiva de este sitio, verás lado a lado la desviación estándar muestral y la poblacional.

Resumen

  • Si los datos son el conjunto completo, divide entre n; si son parte de un grupo mayor, divide entre n−1.
  • El valor esperado de la varianza muestral dividida entre n es (n−1)/n × σ², una subestimación que se corrige dividiendo entre n−1 (corrección de Bessel).
  • La desviación estándar del ejemplo 2, 4, 4, 4, 5, 5, 7, 9 es 2 con el criterio poblacional y aproximadamente 2.1381 con el muestral.
  • Excel distingue entre STDEV.S (muestral) y STDEV.P (poblacional), y NumPy y pandas tienen valores por defecto diferentes.
  • Distingue entre desviación estándar (dispersión de los datos) y error estándar (dispersión de la media).

→ Calcular ahora: Descriptiva

Actualizado 2026-09-23