GUIDE 04

Como interpretar corretamente o valor-p: definição e 5 equívocos comuns

Definição exata do valor-p, 5 equívocos comuns (não é a probabilidade de H0 ser verdadeira), significância, tamanho de efeito e caudas.

O valor-p aparece em relatórios de pesquisa, resultados de testes A/B e artigos científicos, mas também é a estatística interpretada de forma errada com mais frequência. A American Statistical Association (ASA) chegou a publicar, em 2016, uma declaração oficial específica sobre o uso correto do valor-p. Neste artigo partimos da definição exata do valor-p e, com exemplos, reunimos os equívocos comuns e a forma correta de relatá-lo.

Definição de valor-p

O valor-p é definido assim:

Supondo que a hipótese nula seja verdadeira, a probabilidade de obter um resultado tão extremo quanto o observado, ou mais extremo

O essencial é a condição inicial. O valor-p é calculado sob a suposição "se a hipótese nula estiver certa", portanto não informa a probabilidade de essa suposição estar certa. Um valor-p pequeno significa "se a hipótese nula estivesse certa, dados como estes seriam raros", ou seja, os dados não combinam bem com a hipótese nula.

Exemplo: comparação das médias de dois grupos

Suponha que as notas do grupo A, que usou um novo método de estudo, e do grupo B, que usou o método tradicional, sejam as seguintes (8 pessoas em cada).

  • A: 72, 75, 78, 80, 74, 77, 79, 81
  • B: 70, 71, 74, 73, 69, 72, 75, 68

A hipótese nula é "as médias populacionais dos dois grupos são iguais", e a alternativa é "são diferentes". Vamos usar o teste t de Welch, que não supõe variâncias iguais.

  1. Médias: x̄_A = 77.0, x̄_B = 71.5, diferença 5.5
  2. Desvios padrão amostrais: s_A ≈ 3.1168, s_B ≈ 2.4495
  3. Erro padrão: SE = √(s_A²/n_A + s_B²/n_B) = √(9.7143/8 + 6.0000/8) = √1.9643 ≈ 1.4015
  4. Estatística de teste: t = 5.5 / 1.4015 ≈ 3.924
  5. Graus de liberdade de Welch: cerca de 13.26
  6. Valor-p bicaudal: cerca de 0.0017

A interpretação é: "se as médias populacionais dos dois métodos fossem realmente iguais, a probabilidade de a diferença entre as médias amostrais ser de 5.5 pontos ou mais (em qualquer direção) seria de cerca de 0.17%." Como é bem menor que o nível de significância 0.05, rejeitamos a hipótese nula.

Nível de significância α

O nível de significância α é um critério definido antes de olhar os dados. Se p ≤ α, rejeita-se a hipótese nula. α é a proporção máxima tolerada do erro de rejeitar a hipótese nula quando ela é verdadeira (erro do tipo I); por convenção usa-se muito 0.05, mas, conforme a área e a situação, também se usam 0.01 ou 0.10.

α e valor-p são conceitos diferentes. α é a taxa de erro de longo prazo do procedimento de teste, e o valor-p indica o quanto os dados atuais se afastam da hipótese nula.

5 equívocos comuns

1. "O valor-p é a probabilidade de a hipótese nula ser verdadeira"

Não é. p = 0.0017 não significa "a probabilidade de a hipótese nula ser verdadeira é 0.17%". O valor-p é a probabilidade dos dados sob a condição de a hipótese nula ser verdadeira, enquanto a probabilidade de a hipótese nula ser verdadeira é a probabilidade da hipótese dados os dados. As duas probabilidades condicionais vão em direções opostas, e para obter a segunda é preciso inferência bayesiana, que inclui a probabilidade a priori.

2. "1 − p é a probabilidade de a hipótese alternativa ser verdadeira" ou "a probabilidade de replicação"

É o primeiro equívoco invertido, então também está errado. p = 0.03 não significa que há 97% de probabilidade de o efeito existir, nem que repetir o mesmo experimento daria resultado significativo com 97% de probabilidade.

3. "Se p > 0.05, não há efeito"

Um resultado não significativo não é "evidência de que não há efeito", e sim "a evidência não é suficiente para dizer que há efeito". Com amostras pequenas, é fácil obter um valor-p grande mesmo havendo efeito real. Por exemplo, ao lançar uma moeda 100 vezes e obter 60 caras, o valor-p do teste binomial exato bicaudal para a hipótese nula de moeda honesta é cerca de 0.0569. Fica um pouco acima de 0.05, mas isso não permite concluir que a moeda é honesta.

4. "Quanto menor o valor-p, maior o efeito"

O valor-p resulta conjuntamente do tamanho do efeito e do tamanho da amostra. Com uma amostra grande o bastante, até diferenças mínimas se tornam significativas. Mesmo que a diferença entre as médias de dois grupos seja 0.02 desvio padrão (praticamente irrelevante na prática), com 100,000 pessoas por grupo obtém-se z ≈ 4.47 e p ≈ 0.0000077. Por isso, é preciso relatar o tamanho de efeito junto com o valor-p. No exemplo do método de estudo acima, o tamanho de efeito (d de Cohen, calculado com a média das duas variâncias amostrais) é cerca de 1.96, o que por convenção é um "efeito grande".

5. "p = 0.049 e p = 0.051 levam a conclusões opostas"

0.05 não é uma lei da natureza, e sim um critério de conveniência. A força da evidência dos dois valores é praticamente a mesma. Além disso, fazer vários testes e relatar só os significativos (comparações múltiplas), ou coletar mais dados até atingir significância (p-hacking), faz a taxa real de erro do tipo I ultrapassar muito α.

Poder estatístico e tamanho da amostra

Ao interpretar um resultado não significativo, é preciso considerar também o poder (a probabilidade de detectar significativamente um efeito que realmente existe). Por exemplo, se a diferença real entre dois grupos tem tamanho de efeito d = 0.5 (médio) e o teste é bicaudal com α = 0.05, com 20 pessoas por grupo o poder é de apenas cerca de 34%. Com 64 pessoas por grupo, chega a cerca de 80%. Se um estudo com 20 pessoas por grupo teve resultado não significativo, é mais provável que lhe faltasse poder para detectar o efeito do que o efeito não existir.

Os pontos centrais da declaração da ASA

Os princípios apresentados pela declaração da ASA de 2016 podem ser resumidos assim:

  1. O valor-p pode indicar o quanto os dados são incompatíveis com um modelo estatístico específico.
  2. O valor-p não mede a probabilidade de a hipótese ser verdadeira nem a probabilidade de os dados terem surgido por acaso.
  3. Conclusões científicas e decisões não devem se basear apenas em o valor-p ultrapassar um limite específico.
  4. A inferência correta exige relato transparente de todo o processo de análise.
  5. O valor-p não mede o tamanho do efeito nem a importância do resultado.
  6. Sozinho, o valor-p não é uma boa medida da evidência a respeito de um modelo ou hipótese.

Testes bicaudais e unicaudais

  • Teste bicaudal: testa "há diferença (em qualquer direção)". Conta os valores extremos das duas caudas.
  • Teste unicaudal: testa uma direção definida, como "A é maior que B". Conta apenas uma cauda.

Em distribuições simétricas como a t, se a direção observada coincide com a da hipótese alternativa, o valor-p unicaudal é metade do bicaudal. No exemplo acima, o valor-p unicaudal para "A é maior" é cerca de 0.00084. O teste unicaudal só deve ser usado quando a direção foi definida antes de ver os dados, com base teórica. Mudar para unicaudal depois de ver o resultado para reduzir o valor-p pela metade é um uso incorreto.

Como relatar bem

  • Informe o valor-p exato (p = 0.0017 em vez de p < 0.05).
  • Informe junto o tamanho de efeito e o intervalo de confiança.
  • Declare o teste usado, se foi bicaudal ou unicaudal, o tamanho da amostra e quantos testes foram realizados.

Na calculadora de teste t deste site, você pode ver juntos o valor t, os graus de liberdade, os valores-p bicaudal e unicaudal e o tamanho de efeito.

Resumo

  • O valor-p é a probabilidade de obter um resultado tão ou mais extremo que o observado, supondo que a hipótese nula seja verdadeira.
  • O valor-p não é a probabilidade de a hipótese nula ser verdadeira, nem de o efeito existir, nem de replicação.
  • Um resultado não significativo não é evidência de ausência de efeito, e um valor-p pequeno não significa efeito grande.
  • A comparação de dois grupos do exemplo (t de Welch) dá t ≈ 3.924, cerca de 13.26 graus de liberdade, p bicaudal ≈ 0.0017 e p unicaudal ≈ 0.00084.
  • Relate juntos o valor-p exato, o tamanho de efeito e o intervalo de confiança, e defina antecipadamente a direção do teste unicaudal.

→ Calcular agora: Teste t

Atualizado em 2026-09-23