O desvio padrão é a medida mais usada para indicar o quanto os dados se espalham em torno da média. Mas, ao calculá-lo em uma calculadora ou no Excel, às vezes aparecem dois valores diferentes. Um divide a soma dos quadrados dos desvios por n, e o outro divide por n−1. Neste artigo explicamos, com exemplos, o que cada fórmula significa, por que a amostra usa n−1 e qual delas escolher na prática.
A diferença entre as duas fórmulas
Quando se conhece a população inteira, o desvio padrão (desvio padrão populacional) é:
- Desvio padrão populacional:
σ = √(Σ(x−μ)² / N)
Quando se usa uma amostra, isto é, apenas uma parte da população, para estimar a dispersão da população, usa-se a seguinte fórmula:
- Desvio padrão amostral:
s = √(Σ(x−x̄)² / (n−1))
Há duas diferenças. Primeiro, o centro de referência é a média amostral x̄, e não a média populacional μ. Segundo, o divisor é n−1, e não n. Essa segunda diferença se chama correção de Bessel (Bessel's correction).
Por que dividir por n−1
A média amostral x̄ é calculada a partir da própria amostra, por isso fica na posição mais próxima possível dos dados dessa amostra. De fato, a soma dos quadrados dos desvios Σ(x−c)² atinge o menor valor quando c é a média amostral. Assim, ao medir os desvios em relação a x̄ em vez da verdadeira média populacional μ, a soma dos quadrados dos desvios sai sistematicamente menor.
Matematicamente, o valor esperado da variância dividida por n é (n−1)/n × σ². Por exemplo, com uma amostra de tamanho 5, a variância dividida por n corresponde, em média, a apenas 4/5 = 80% da variância real. Para corrigir essa subestimação, multiplica-se por n/(n−1), o que resulta justamente na fórmula que divide por n−1. Com isso, s² passa a ser um estimador não viesado da variância populacional σ².
Outra forma de explicar é pelos graus de liberdade. Os n desvios (x−x̄) estão sujeitos a uma restrição: a soma deles precisa ser sempre 0. Portanto, definidos n−1 desvios, o último fica determinado automaticamente. Como há n−1 informações livres para variar, divide-se por n−1.
Atenção:
s²é um estimador não viesado deσ², mas sua raiz quadradasnão é um estimador não viesado deσ. Como a raiz quadrada é uma função côncava,sfica, em média, um pouco abaixo deσ. Porém, à medida que a amostra cresce, essa diferença se torna desprezível, e na práticasé usado diretamente.
Exemplo calculado à mão
Considere os 8 valores a seguir.
2, 4, 4, 4, 5, 5, 7, 9
Passo 1: média
x̄ = (2+4+4+4+5+5+7+9) / 8 = 40 / 8 = 5
Passo 2: desvios e quadrados dos desvios
| Valor x | Desvio x−x̄ | Desvio ao quadrado |
|---|---|---|
| 2 | −3 | 9 |
| 4 | −1 | 1 |
| 4 | −1 | 1 |
| 4 | −1 | 1 |
| 5 | 0 | 0 |
| 5 | 0 | 0 |
| 7 | 2 | 4 |
| 9 | 4 | 16 |
A soma dos desvios é −3−1−1−1+0+0+2+4 = 0, o que confirma a restrição mencionada acima. A soma dos quadrados dos desvios é 9+1+1+1+0+0+4+16 = 32.
Passo 3: as duas variâncias e desvios padrão
| Critério | Variância | Desvio padrão |
|---|---|---|
| Populacional (÷n) | 32 / 8 = 4 | √4 = 2 |
| Amostral (÷(n−1)) | 32 / 7 ≈ 4.5714 | √4.5714 ≈ 2.1381 |
Se esses 8 valores forem tudo o que interessa, o desvio padrão é 2. Por outro lado, se forem 8 valores tirados de um grupo maior para estimar a dispersão desse grupo, deve-se informar cerca de 2.1381. Quando n é pequeno como 8, a diferença entre os dois valores é visível, de cerca de 7%. Com n igual a 100, a diferença cai para cerca de 0.5%, e com n igual a 1,000, para cerca de 0.05%.
Quando usar cada uma
O critério é: "os dados que tenho são tudo o que quero conhecer ou apenas uma parte?"
- População (÷n): quando os dados são o conjunto inteiro, como ao descrever a dispersão das notas dos 30 alunos de uma turma apenas para essa turma, ou a distribuição salarial de todos os funcionários de uma empresa.
- Amostra (÷(n−1)): quando os dados são parte de um grupo maior, como ao estimar as preferências de toda a população a partir de 500 respondentes de uma pesquisa, ou a variação de todo um processo a partir de 20 peças retiradas da linha de produção.
A maioria dos dados usados na prática são amostras. Cálculos que levam à inferência, como intervalos de confiança, teste t e cálculo de tamanho de amostra, pressupõem o desvio padrão amostral s. Na dúvida, usar a fórmula amostral é a escolha conservadora.
Equivalência no Excel e em ferramentas de programação
| Ferramenta | Amostral (÷(n−1)) | Populacional (÷n) |
|---|---|---|
| Excel·Google Sheets | STDEV.S, VAR.S (versão antiga STDEV) | STDEV.P, VAR.P (versão antiga STDEVP) |
| R | sd(), var() | É preciso corrigir manualmente |
| Python pandas | Series.std() padrão ddof=1 | std(ddof=0) |
| Python NumPy | np.std(x, ddof=1) | np.std(x) padrão ddof=0 |
No Excel em português, essas funções aparecem como DESVPAD.A e DESVPAD.P. Em especial, NumPy e pandas têm padrões opostos, por isso é comum obter valores diferentes com os mesmos dados. Ao comparar resultados, verifique primeiro qual fórmula foi usada.
Como ler o valor do desvio padrão
O desvio padrão tem a mesma unidade dos dados originais: "pontos" para notas, "cm" para alturas. A variância tem unidade ao quadrado e é difícil de interpretar intuitivamente, por isso nos relatórios se costuma apresentar o desvio padrão. Se os dados forem aproximadamente normais, pode-se interpretar grosso modo que cerca de 68% dos valores ficam dentro de média ± 1 desvio padrão e cerca de 95% dentro de ± 2 desvios padrão. Para comparar a dispersão de dois grupos com médias muito diferentes, às vezes também se observa o coeficiente de variação (CV), que é o desvio padrão dividido pela média.
Erros comuns
- Não informar qual fórmula foi usada no relatório: em amostras pequenas os valores mudam visivelmente, então indique o símbolo
souσ, ou a expressão "desvio padrão amostral". - Confundir desvio padrão com erro padrão: o erro padrão
SE = s / √nrepresenta a dispersão da média amostral, não a dos dados individuais. É o erro padrão que entra nos intervalos de confiança. - Calcular o desvio padrão amostral com n igual a 1: n−1 vira 0, então ele não está definido. É normal a calculadora retornar erro.
- Não verificar outliers: como usa quadrados, o desvio padrão é muito afetado por um único valor extremo. Se houver suspeita de outliers, observe também a amplitude interquartil (IQR).
Cole seus dados na calculadora de estatística descritiva deste site para ver lado a lado o desvio padrão amostral e o populacional.
Resumo
- Se os dados forem o conjunto inteiro, divida por n; se forem parte de um grupo maior, divida por n−1.
- O valor esperado da variância amostral dividida por n é
(n−1)/n × σ², uma subestimação que a divisão por n−1 corrige (correção de Bessel). - O desvio padrão do exemplo
2, 4, 4, 4, 5, 5, 7, 9é 2 no critério populacional e cerca de 2.1381 no amostral. - O Excel distingue
STDEV.S(amostral) eSTDEV.P(populacional), e NumPy e pandas têm padrões diferentes. - Distinga desvio padrão (dispersão dos dados) de erro padrão (dispersão da média).