GUIDE 05

95%信頼区間の正しい意味と計算方法

95%信頼区間を繰り返し抽出の観点から正しく解釈する方法、zとtの選び方、平均・比率の信頼区間の例題、Wald区間とWilson区間の違いを説明します。

信頼区間は、推定値を1つだけ報告する代わりに、「この程度の範囲に真の値があるだろう」という不確かさまであわせて伝える方法です。アンケート結果の「誤差範囲±3ポイント」も信頼区間の一種です。ところが、95%信頼区間という言葉はしばしば誤って解釈されます。この記事では、まず正確な意味を確認し、平均と比率の信頼区間を例題で計算します。

95%は何に対する95%なのか

母平均μは未知ですが、固定された1つの値です。一方、信頼区間は標本によって毎回変わる確率的な区間です。したがって95%という確率は、区間を作る方法についての確率です。

同じ方法で標本を抽出して信頼区間を作り続けると、そうして作った区間のうち約95%が真の値を含みます。

すでに計算を終えた1つの区間、たとえば[45.74, 54.26]について「μがこの中にある確率が95%」と言うのは、厳密には誤った表現です。この区間はμを含むか含まないかのどちらかであり、私たちがそれを知らないだけです。実務では「95%信頼水準で、母平均は45.74から54.26の間と推定される」のように、方法の信頼度を示す表現を使います。

次もよくある誤解です。

  • 「データの95%がこの区間にある」:違います。信頼区間は母数(平均など)についての区間であり、個々のデータの範囲ははるかに広くなります。
  • 「次の標本の平均が95%の確率でこの中に入る」:これも違います。それは予測区間の問題です。

信頼区間の基本構造

ほとんどの信頼区間は同じ形をしています。

  • 推定値 ± 臨界値 × 標準誤差

臨界値は信頼水準が高いほど大きくなり、標準誤差は標本が大きいほど小さくなります。そのため、信頼水準を上げると区間は広くなり、標本を増やすと狭くなります。標準誤差は1/√nに比例するので、区間の幅を半分にするには標本を4倍に増やす必要があります。

zとt、どちらを使うか

平均の信頼区間の臨界値は、母標準偏差σがわかっているかどうかで変わります。

  • σがわかっている(まれ):標準正規分布のz値を使います。95%では1.96です。
  • σがわからず、標本標準偏差sで代用する(ほとんどの場合):自由度n−1のt分布のt値を使います。

t値は、sを推定することで生じる追加の不確かさを反映してzより大きくなります。標本が小さいほどその差は大きくなります。

自由度95% t臨界値
2約4.303
5約2.571
10約2.228
15約2.131
30約2.042
100約1.984
無限大(z)約1.960

例題1:平均の信頼区間

標本16個の平均がx̄ = 50、標本標準偏差がs = 8だとします。

  1. 標準誤差:SE = s / √n = 8 / √16 = 2
  2. 自由度:16 − 1 = 15、95% t臨界値≈ 2.1314
  3. 誤差範囲:2.1314 × 2 ≈ 4.263
  4. 信頼区間:50 ± 4.263[45.74, 54.26]

同じ計算をz(1.96)で行うと50 ± 3.92[46.08, 53.92]となり、区間が狭くなります。σがわからないのにzを使うと実際の被覆率が95%に届かなくなるため、小さな標本ではtを使う必要があります。

例題2:比率の信頼区間(WaldとWilson)

比率pの信頼区間には何通りもの式があります。教科書で最初に出てくるのはWald区間です。

  • Wald:p̂ ± z × √(p̂(1−p̂)/n)

400人中120人が「はい」と答えたならp̂ = 0.30です。

  1. 標準誤差:√(0.30 × 0.70 / 400) ≈ 0.02291
  2. 誤差範囲:1.96 × 0.02291 ≈ 0.0449
  3. Wald 95%区間:[0.2551, 0.3449]

Wilson区間は、標準誤差の中のp̂の代わりに仮説値を使う方式から導かれ、式は少し複雑ですが性質がよい区間です。

  • Wilson:中心(p̂ + z²/(2n)) / (1 + z²/n)、半幅z/(1 + z²/n) × √(p̂(1−p̂)/n + z²/(4n²))

同じデータに当てはめると[0.2572, 0.3466]で、Waldとほぼ同じです。nが大きくp̂が0や1から離れていれば、2つの方法は似た結果になります。

違いが表れるのは、標本が小さいときや比率が極端に近いときです。20人中2人(p̂ = 0.10)の場合を見てみます。

方法95%区間
Wald[−0.0315, 0.2315]
Wilson[0.0279, 0.3010]

Wald区間は下限が負になり、比率として意味をなしません。また、Wald区間はこのような条件で実際の被覆率が名目の95%よりかなり低くなることが知られています。Wilson区間は0〜1の範囲を外れず、中心が0.5の側に少し引き寄せられ、被覆率も名目値により近くなります。そのため最近では、Wilson区間を標準として勧めることが多くなっています。

信頼区間と仮説検定の関係

平均の95%信頼区間と有意水準0.05の両側t検定は、同じ情報を別の形で示しています。ある値μ₀が95%信頼区間の外にあれば、「母平均はμ₀である」という帰無仮説の両側p値は0.05より小さくなります。逆に区間の中にあれば、p値は0.05以上です。

例題1の区間[45.74, 54.26]は45を含みません。実際に帰無仮説μ₀ = 45で1標本t検定を行うとt = (50 − 45) / 2 = 2.5、自由度15で両側p ≈ 0.0245となり、0.05より小さくなります。信頼区間はこれに加えて「もっともらしい値の範囲」まで示すので、p値1つより情報量が多いのです。

標本サイズの効果も確認してみます。同じx̄ = 50s = 8で標本が64個なら、標準誤差は8 / 8 = 1、自由度63のt臨界値は約1.998なので、区間は50 ± 2.00[48.00, 52.00]です。標本を4倍にすると、幅は約8.53から4.00へと半分以下になりました(t臨界値も一緒に小さくなったためです)。

実務のヒント

  • 信頼水準と方法をあわせて書きます。 「95% CI(t分布)」「95% CI(Wilson)」のように書きます。
  • 2つの区間が重なっているからといって、差がないと断定しません。 2つの平均の差の信頼区間を直接計算するのが正確です。
  • 標本が代表性を持っているかが先決です。 信頼区間は無作為抽出による誤差だけを反映しており、回答の偏りや標本選択の偏りは反映しません。

このサイトの信頼区間計算機で、平均(z・t)と比率(Wald・Wilson)の区間を並べて計算できます。

まとめ

  • 95%は区間を作る方法の長期的な被覆率であり、計算された1つの区間にμがある確率ではありません。
  • 信頼区間は推定値 ± 臨界値 × 標準誤差という構造で、幅を半分にするには標本を4倍に増やす必要があります。
  • σがわからなければt分布を使います。n=16、x̄=50、s=8の95%区間は[45.74, 54.26]です。
  • 比率120/400の95%区間は、Wald[0.2551, 0.3449]、Wilson[0.2572, 0.3466]です。
  • 小さな標本や極端な比率(例:2/20)ではWaldが負の下限を出すなど不正確になるため、Wilsonを勧めます。

→ 計算機ですぐに計算: 信頼区間

更新日 2026-09-23