GUIDE 04

Menafsirkan Nilai p dengan Benar: Definisi dan 5 Salah Kaprah

Definisi tepat nilai p, 5 salah kaprah umum (nilai p bukan peluang H0 benar), tingkat signifikansi, ukuran efek, serta uji dua/satu arah.

Nilai p muncul di mana-mana, dari laporan penelitian, hasil uji A/B, hingga makalah ilmiah, tetapi juga merupakan statistik yang paling sering disalahtafsirkan. Asosiasi Statistik Amerika (ASA) bahkan menerbitkan pernyataan resmi khusus tentang penggunaan nilai p yang benar pada 2016. Artikel ini dimulai dari definisi tepat nilai p, lalu merangkum salah kaprah yang umum dan cara pelaporan yang benar dengan contoh.

Definisi nilai p

Nilai p didefinisikan sebagai berikut.

Dengan asumsi hipotesis nol benar, peluang memperoleh hasil yang sama ekstremnya atau lebih ekstrem daripada hasil yang diamati

Kuncinya adalah syarat di bagian depan. Nilai p dihitung di bawah asumsi "jika hipotesis nol benar", sehingga tidak memberi tahu peluang bahwa asumsi itu sendiri benar. Nilai p yang kecil berarti "jika hipotesis nol benar, data seperti ini jarang muncul", yaitu data kurang cocok dengan hipotesis nol.

Contoh: membandingkan rata-rata dua kelompok

Misalkan nilai kelompok A yang memakai metode belajar baru dan kelompok B yang memakai metode lama adalah sebagai berikut (masing-masing 8 orang).

  • A: 72, 75, 78, 80, 74, 77, 79, 81
  • B: 70, 71, 74, 73, 69, 72, 75, 68

Hipotesis nol adalah "rata-rata populasi kedua kelompok sama", dan hipotesis alternatif adalah "berbeda". Kita memakai uji t Welch yang tidak mengasumsikan varians sama.

  1. Rata-rata: x̄_A = 77.0, x̄_B = 71.5, selisih 5.5
  2. Simpangan baku sampel: s_A ≈ 3.1168, s_B ≈ 2.4495
  3. Galat baku: SE = √(s_A²/n_A + s_B²/n_B) = √(9.7143/8 + 6.0000/8) = √1.9643 ≈ 1.4015
  4. Statistik uji: t = 5.5 / 1.4015 ≈ 3.924
  5. Derajat bebas Welch: sekitar 13.26
  6. Nilai p dua arah: sekitar 0.0017

Tafsirannya: "Jika rata-rata populasi kedua metode benar-benar sama, peluang selisih rata-rata sampel sebesar 5.5 poin atau lebih (ke arah mana pun) adalah sekitar 0.17%." Karena jauh lebih kecil daripada tingkat signifikansi 0.05, hipotesis nol ditolak.

Tingkat signifikansi α

Tingkat signifikansi α adalah kriteria yang ditetapkan sebelum melihat data. Jika p ≤ α, hipotesis nol ditolak. α adalah proporsi maksimum yang diizinkan untuk kesalahan menolak hipotesis nol padahal benar (galat tipe I); secara konvensi sering dipakai 0.05, tetapi tergantung bidang dan situasi dipakai juga 0.01 atau 0.10.

α dan nilai p adalah konsep yang berbeda. α adalah tingkat kesalahan jangka panjang dari prosedur uji, sedangkan nilai p menunjukkan seberapa jauh data kali ini menyimpang dari hipotesis nol.

5 salah kaprah umum

1. "Nilai p adalah peluang hipotesis nol benar"

Salah. p = 0.0017 tidak berarti "peluang hipotesis nol benar adalah 0.17%". Nilai p adalah peluang data dengan syarat hipotesis nol benar, sedangkan peluang hipotesis nol benar adalah peluang hipotesis dengan syarat data. Kedua peluang bersyarat ini berlawanan arah, dan untuk mencari yang kedua diperlukan inferensi Bayes yang melibatkan peluang prior.

2. "1 − p adalah peluang hipotesis alternatif benar" atau "peluang hasil dapat direplikasi"

Ini kebalikan dari salah kaprah pertama, jadi juga salah. p = 0.03 tidak berarti peluang adanya efek 97%, atau bahwa jika eksperimen yang sama diulang, hasilnya akan signifikan dengan peluang 97%.

3. "Jika p > 0.05, tidak ada efek"

Hasil yang tidak signifikan bukan "bukti tidak adanya efek", melainkan "bukti belum cukup untuk menyatakan ada efek". Jika sampel kecil, nilai p mudah besar walaupun efek sebenarnya ada. Misalnya, jika koin dilempar 100 kali dan muncul gambar 60 kali, nilai p uji binomial eksak dua arah untuk hipotesis nol bahwa koin itu seimbang adalah sekitar 0.0569. Sedikit di atas 0.05, tetapi dari sini tidak dapat disimpulkan bahwa koin itu seimbang.

4. "Makin kecil nilai p, makin besar efeknya"

Nilai p dibentuk bersama oleh besar efek dan ukuran sampel. Jika sampel cukup besar, selisih yang sangat kecil pun menjadi signifikan. Walaupun selisih rata-rata dua kelompok hanya 0.02 kali simpangan baku (selisih yang praktis tidak bermakna), dengan 100,000 orang per kelompok diperoleh z ≈ 4.47, p ≈ 0.0000077. Karena itu, ukuran efek harus dilaporkan bersama nilai p. Ukuran efek pada contoh metode belajar di atas (Cohen's d, dihitung dengan rata-rata varians kedua sampel) sekitar 1.96, yang menurut konvensi termasuk "efek besar".

5. "p = 0.049 dan p = 0.051 memberi kesimpulan yang berlawanan"

0.05 bukan hukum alam, melainkan batas demi kemudahan. Kekuatan bukti dari kedua nilai itu hampir sama. Selain itu, jika melakukan banyak uji lalu hanya melaporkan yang signifikan (perbandingan berganda), atau terus mengumpulkan data sampai signifikan (p-hacking), tingkat galat tipe I yang sebenarnya jauh melampaui α.

Kuasa uji dan ukuran sampel

Saat menafsirkan hasil yang tidak signifikan, kuasa uji (peluang menemukan efek secara signifikan bila efek itu memang ada) juga harus dipertimbangkan. Misalnya, jika selisih sebenarnya dua kelompok memiliki ukuran efek d = 0.5 (ukuran sedang) dan dilakukan uji dua arah α = 0.05, kuasa uji dengan 20 orang per kelompok hanya sekitar 34%. Dengan 64 orang per kelompok menjadi sekitar 80%. Jika penelitian dengan 20 orang per kelompok memberi hasil tidak signifikan, kemungkinan besar penyebabnya adalah kurangnya kemampuan untuk mendeteksi sejak awal, bukan karena efeknya tidak ada.

Pokok pernyataan ASA

Prinsip yang diajukan pernyataan ASA 2016 dapat diringkas sebagai berikut.

  1. Nilai p dapat menunjukkan seberapa tidak cocok data dengan suatu model statistik tertentu.
  2. Nilai p tidak mengukur peluang suatu hipotesis benar atau peluang data muncul karena kebetulan semata.
  3. Kesimpulan ilmiah atau keputusan tidak boleh hanya didasarkan pada apakah nilai p melewati ambang tertentu.
  4. Inferensi yang benar memerlukan pelaporan seluruh proses analisis secara transparan.
  5. Nilai p tidak mengukur besar efek atau pentingnya hasil.
  6. Nilai p saja bukan ukuran bukti yang baik mengenai suatu model atau hipotesis.

Uji dua arah dan uji satu arah

  • Uji dua arah: menguji "ada perbedaan (tanpa memandang arah)". Nilai ekstrem di kedua ekor dihitung.
  • Uji satu arah: menguji dengan arah yang ditentukan, seperti "A lebih besar daripada B". Hanya satu ekor yang dihitung.

Pada distribusi simetris seperti distribusi t, jika arah yang diamati sama dengan hipotesis alternatif, nilai p satu arah adalah separuh nilai p dua arah. Pada contoh di atas, nilai p satu arah untuk "A lebih tinggi" sekitar 0.00084. Uji satu arah hanya dipakai bila arahnya ditetapkan berdasarkan alasan teoretis sebelum melihat data. Beralih ke uji satu arah setelah melihat hasil demi membagi dua nilai p adalah penggunaan yang keliru.

Cara pelaporan yang baik

  • Tuliskan nilai p yang tepat (p = 0.0017, bukan p < 0.05).
  • Sertakan ukuran efek dan selang kepercayaan.
  • Jelaskan uji yang dipakai, dua arah atau satu arah, ukuran sampel, dan jumlah uji yang dilakukan.

Di kalkulator uji t situs ini, Anda dapat melihat nilai t, derajat bebas, nilai p dua arah·satu arah, dan ukuran efek sekaligus.

Ringkasan

  • Nilai p adalah peluang memperoleh hasil seekstrem nilai yang diamati atau lebih, dengan asumsi hipotesis nol benar.
  • Nilai p bukan peluang hipotesis nol benar, bukan peluang adanya efek, dan bukan peluang replikasi.
  • Hasil yang tidak signifikan bukan bukti tidak adanya efek, dan nilai p yang kecil tidak berarti efek yang besar.
  • Contoh perbandingan dua kelompok (t Welch) memberi t ≈ 3.924, derajat bebas sekitar 13.26, p dua arah ≈ 0.0017, p satu arah ≈ 0.00084.
  • Laporkan nilai p yang tepat, ukuran efek, dan selang kepercayaan bersama-sama, dan tetapkan arah uji satu arah sejak awal.

→ Hitung sekarang: Uji t

Diperbarui 2026-09-23