Muitas vezes, depois de coletar os dados, não se sabe qual teste usar. Felizmente, para a maioria das análises básicas, basta responder a três perguntas para definir o teste adequado. Neste artigo reunimos essas perguntas, uma tabela de decisão e os pressupostos de cada teste com formas de verificá-los.
Três perguntas para responder primeiro
1. Qual é o tipo da variável de resultado?
- Contínua (numérica): valores para os quais se pode calcular uma média, como altura, nota, faturamento e tempo de reação
- Categórica: valores divididos em categorias, como sexo, compra ou não compra e marca preferida. Os dados costumam ser resumidos em frequências (quantas pessoas).
Categorias ordenadas (ordinais), como a escala Likert de 5 pontos, costumam ser analisadas com testes não paramétricos quando se trata de um único item, e tratadas como contínuas quando se trata da soma de vários itens.
2. Quantos grupos estão sendo comparados?
Verifique se você compara um grupo com um valor de referência, dois grupos ou três grupos ou mais. Se o objetivo não é comparar grupos, e sim ver a relação entre duas variáveis, o caminho é correlação e regressão.
3. As medidas estão pareadas?
- Independentes: dois grupos formados por pessoas diferentes (turma A e turma B)
- Pareadas: o mesmo sujeito medido duas vezes (antes e depois), ou pares definidos como gêmeos ou casais
Analisar dados pareados com um teste para amostras independentes mistura as diferenças individuais no erro e reduz muito o poder. Inversamente, analisar dados independentes com um teste pareado é um erro.
Tabela de decisão
| Objetivo | Dados | Teste paramétrico | Alternativa não paramétrica |
|---|---|---|---|
| Comparar a média de um grupo com um valor de referência | Contínuos | Teste t de uma amostra | Teste dos postos sinalizados de Wilcoxon |
| Comparar as médias de dois grupos independentes | Contínuos | Teste t para amostras independentes (Welch) | Teste U de Mann-Whitney |
| Comparar duas medidas pareadas | Contínuos | Teste t pareado | Teste dos postos sinalizados de Wilcoxon |
| Comparar as médias de três grupos ou mais | Contínuos | ANOVA de um fator | Teste de Kruskal-Wallis |
| Ver se a distribuição de uma variável categórica segue as proporções esperadas | Categóricos | Teste qui-quadrado de aderência | Teste multinomial·binomial exato |
| Ver se duas variáveis categóricas estão associadas | Categóricos | Teste qui-quadrado de independência | Teste exato de Fisher |
| Relação linear entre duas variáveis contínuas | Contínuos | Correlação de Pearson, regressão simples | Correlação de postos de Spearman |
Algumas observações complementares.
- No teste t independente, é melhor usar o de Welch como padrão. O teste t de Student, que supõe variâncias iguais, distorce a taxa de erro quando as variâncias ou os tamanhos dos grupos diferem, enquanto o teste t de Welch quase não perde nada quando as variâncias são iguais.
- Não faça vários testes t com três grupos ou mais. Testar cada par com α=0.05 aumenta a taxa global de erro do tipo I. Use a ANOVA para ver a diferença global e depois faça testes post hoc.
- A comparação de duas proporções (taxa de conversão A vs. B) pode ser feita com o teste qui-quadrado de independência em uma tabela 2×2, que dá o mesmo resultado do teste z para duas proporções.
Exemplo: teste qui-quadrado de independência 2×2
Dois textos de anúncio foram mostrados a 50 pessoas cada, registrando se houve clique.
| Texto | Clicou | Não clicou | Total |
|---|---|---|---|
| A | 30 | 20 | 50 |
| B | 18 | 32 | 50 |
| Total | 48 | 52 | 100 |
A variável de resultado (clique ou não) é categórica, e o texto também, então usa-se o teste qui-quadrado de independência.
- Frequências esperadas:
total da linha × total da coluna / total geral. A·clicou é50 × 48 / 100 = 24, A·não clicou é50 × 52 / 100 = 26, e para B também 24 e 26. (observado − esperado)² / esperadode cada célula:(30−24)²/24 = 1.5,(20−26)²/26 ≈ 1.3846,(18−24)²/24 = 1.5,(32−26)²/26 ≈ 1.3846- Estatística qui-quadrado:
χ² ≈ 5.769 - Graus de liberdade:
(nº de linhas − 1) × (nº de colunas − 1) = 1 - Valor-p: cerca de
0.0163(o valor crítico para α=0.05 é cerca de 3.841)
Como p < 0.05, conclui-se que o texto e o clique estão associados. A taxa de cliques é de 60% em A e 36% em B. Aplicando a correção de continuidade de Yates aos mesmos dados, obtém-se χ² ≈ 4.848 e p ≈ 0.0277, valores um pouco mais conservadores. Registre no relatório qual método foi usado.
Verificação dos pressupostos
Todo teste fornece um valor-p exato apenas se seus pressupostos forem atendidos. Os principais pressupostos e as formas de verificá-los são os seguintes.
Independência
É um pressuposto comum a todos os testes. É violado quando as respostas de uma mesma pessoa entram várias vezes ou quando há estrutura de agrupamento, como alunos da mesma turma. Em vez de verificá-lo com um teste estatístico, avalie-o pelo desenho da coleta de dados.
Normalidade (teste t, ANOVA, teste da correlação de Pearson)
- A rigor, o que precisa ser aproximadamente normal não são os dados em si, mas a distribuição da média amostral. Graças ao teorema central do limite, com cerca de 30 ou mais observações por grupo, o teste t é bastante estável, a menos que a distribuição seja muito assimétrica.
- Com amostras pequenas, verifique com histograma, boxplot e gráfico Q-Q se não há assimetria extrema nem outliers.
- Testes de normalidade como o de Shapiro-Wilk deixam passar violações em amostras pequenas e detectam diferenças triviais em amostras grandes, então avalie-os junto com os gráficos.
Homogeneidade de variâncias
Usando o teste t de Welch, não é preciso se preocupar com esse pressuposto. Na ANOVA, verifique se a razão entre os desvios padrão dos grupos passa de 2 e, se forem muito diferentes, considere a ANOVA de Welch.
Frequências esperadas (teste qui-quadrado)
O teste qui-quadrado é um método aproximado, por isso fica impreciso quando as frequências esperadas são pequenas. O critério mais usado é frequência esperada de 5 ou mais em todas as células (um critério mais flexível também é usado: "no máximo 20% das células com frequência esperada menor que 5 e nenhuma menor que 1"). Se uma tabela 2×2 violar o critério, use o teste exato de Fisher. No exemplo acima, todas as frequências esperadas são 24 ou mais, então não há problema.
Linearidade (correlação de Pearson, regressão)
Desenhe primeiro o gráfico de dispersão. Se a relação for curva, o r de Pearson a subestima. Se a relação for monotônica, a correlação de Spearman é uma alternativa.
Quando usar testes não paramétricos
- Quando a amostra é pequena e a distribuição é muito assimétrica ou há outliers
- Quando os dados são postos ou ordinais
- Quando o interesse está na mediana ou na posição da distribuição
Os testes não paramétricos exigem menos pressupostos, mas, em situações em que a suposição de normalidade vale, têm poder um pouco menor. Além disso, o teste U de Mann-Whitney, a rigor, não testa "as médias são iguais", então tome cuidado para não interpretar o resultado como diferença de médias.
Este site oferece calculadoras de teste t (uma amostra·independente de Welch·pareado), qui-quadrado (aderência·independência) e correlação e regressão. Depois de escolher o método com a tabela de decisão acima, você pode calcular direto na calculadora correspondente.
Resumo
- O teste é definido por três fatores: tipo da variável de resultado (contínua ou categórica), número de grupos comparados e pareamento.
- Para médias de dois grupos independentes, use o teste t de Welch; para antes e depois, o teste t pareado; para três grupos ou mais, a ANOVA.
- A associação entre duas variáveis categóricas usa o teste qui-quadrado de independência; a tabela 2×2 do exemplo dá
χ² ≈ 5.769, 1 grau de liberdade ep ≈ 0.0163. - No qui-quadrado, verifique se as frequências esperadas são 5 ou mais e, se não forem, use o teste exato de Fisher.
- Se os pressupostos forem muito violados, considere alternativas não paramétricas como Wilcoxon, Mann-Whitney, Kruskal-Wallis e Spearman.