GUIDE 03

正态分布与 z 分数:求累积概率和前 x% 的分数

用分步示例说明正态分布的性质、z 分数标准化、68–95–99.7 法则、累积概率的读法,以及反推前 10% 分界分数的方法。

正态分布是以均值为中心、左右对称的钟形分布。身高、测量误差以及许多考试成绩这类由众多微小因素叠加而成的数值,常常接近正态分布。此外,只要样本足够大,无论原分布如何,样本均值都会趋近正态分布(中心极限定理),正因如此,相当多的置信区间和检验方法都建立在正态分布之上。

决定正态分布的两个值

正态分布完全由均值 μ标准差 σ 两个值确定。记作 N(μ, σ²)(第二个位置是方差)。

  • μ 决定钟形的中心位置。
  • σ 决定钟形的宽度。σ 大则又低又宽,σ 小则又高又窄。
  • 均值、中位数、众数都等于 μ。
  • 曲线下的总面积为 1,某一区间的面积就是取值落在该区间的概率。

z 分数:把不同尺度统一起来

z 分数表示某个值距离均值有几个标准差。

  • z = (x − μ) / σ

转换成 z 分数后,所有正态分布都变成均值为 0、标准差为 1 的标准正态分布 N(0, 1)。因此用一张表(或一个计算器)就能求出所有正态分布的概率。z 分数没有单位,比较两门尺度不同的考试成绩时也很有用。例如在均值 70·标准差 10 的考试中得 85 分(z=1.5),相对而言比在均值 60·标准差 20 的考试中得 80 分(z=1.0)成绩更好。

68–95–99.7 法则

以标准差为单位划定区间时,落在正态分布中的比例总是固定的。

区间落入比例(精确值)区间外比例
μ ± 1σ约 68.27%约 31.73%
μ ± 2σ约 95.45%约 4.55%
μ ± 3σ约 99.73%约 0.27%

这条法则是便于心算的近似。恰好包含 95% 的区间不是 ±2σ,而是 ±1.96σ,这就是置信区间中出现 1.96 这个数字的原因。同样,90% 对应 ±1.645σ,99% 对应 ±2.576σ。

如何读累积概率

正态分布计算中最基本的值是累积概率 P(X ≤ x),即小于等于 x 的概率。在标准正态分布中记作 Φ(z)。其余概率都由它推出。

  • 大于等于 x 的概率:P(X ≥ x) = 1 − Φ(z)
  • 介于 a 与 b 之间的概率:P(a ≤ X ≤ b) = Φ(z_b) − Φ(z_a)
  • 对称性:Φ(−z) = 1 − Φ(z)

在连续分布中,单个点的概率为 0,因此 < 的区别不影响结果。

示例 1:低于某分数的概率

假设某次考试成绩服从均值 70、标准差 10 的正态分布。

85 分及以下的概率

  1. z 分数:z = (85 − 70) / 10 = 1.5
  2. 累积概率:Φ(1.5) ≈ 0.9332
  3. 解读:约 93.32% 的考生在 85 分及以下。85 分相当于前约 6.68%。

60 分以上、85 分以下的概率

  1. 60 分的 z 分数:(60 − 70) / 10 = −1.0Φ(−1.0) ≈ 0.1587
  2. 85 分的 z 分数:1.5Φ(1.5) ≈ 0.9332
  3. 差值:0.9332 − 0.1587 ≈ 0.7745
  4. 解读:约 77.45% 的考生在 60 分到 85 分之间。

55 分及以下的概率

z 分数为 −1.5,由对称性得 Φ(−1.5) = 1 − 0.9332 ≈ 0.0668。这与 85 分及以上的概率完全相同。

示例 2:反推前 x% 的分界分数

这次反过来,由概率求分数。“要进入前 10% 需要多少分”,问的是“累积概率 0.90 对应的分数”。

  1. 求累积概率 0.90 对应的 z 值:z = Φ⁻¹(0.90) ≈ 1.2816
  2. 还原到原始尺度:x = μ + z × σ = 70 + 1.2816 × 10 ≈ 82.82
  3. 解读:约 82.82 分及以上即为前 10%。

同样的方法,前 5% 为 z ≈ 1.6449,因此是 70 + 16.449 ≈ 86.45 分。求后 x% 时,直接代入累积概率 x 即可。

标准累积概率z 值分数(μ=70, σ=10)
前 25%0.75约 0.6745约 76.74
前 10%0.90约 1.2816约 82.82
前 5%0.95约 1.6449约 86.45
前 1%0.99约 2.3263约 93.26

示例 3:应用于样本均值

正态分布计算不仅适用于单个分数,也适用于样本均值。在均值 70、标准差 10 的考试中随机抽取 25 人,求这 25 人的平均分在 74 分及以上的概率。

  1. 样本均值的标准差(标准误):σ / √n = 10 / √25 = 2
  2. z 分数:z = (74 − 70) / 2 = 2.0
  3. 概率:1 − Φ(2.0) ≈ 0.0228

单个学生得 74 分及以上的概率为 1 − Φ(0.4) ≈ 0.3446,很常见;但 25 人的平均分在 74 分及以上的概率只有约 2.28%,很少见。这是因为均值远不如单个值那样分散。这正是置信区间和假设检验的出发点。

注意事项

  • 检查正态性假设。 对收入、等待时间这类单侧长尾的数据套用正态分布,会严重算错尾部概率。先用直方图或 Q-Q 图确认形状。
  • 有上下限的数据(0~100 分的考试等)在两端可能偏离正态分布。反推前 1% 这类极端分界时尤其要小心。
  • 区分参数与估计值。 如果 μ 和 σ 是由样本估计的,结果也会带有相应的估计误差。

在本站的正态分布计算器中输入均值和标准差,即可立即查看累积概率、区间概率和反推值。

要点总结

  • 正态分布由均值 μ 和标准差 σ 确定,可以通过 z = (x − μ) / σ 转换为标准正态分布。
  • μ ± 1σ、2σ、3σ 内分别约有 68.27%、95.45%、99.73%,精确的 95% 区间是 ±1.96σ。
  • 均值 70·标准差 10 时,85 分及以下的概率约为 0.9332,60~85 分之间的概率约为 0.7745。
  • 25 人样本均值的标准误为 10 / √25 = 2,平均分在 74 分及以上的概率约为 0.0228。
  • 前 10% 的分界像 70 + 1.2816 × 10 ≈ 82.82 分那样,用累积概率的反函数求得。
  • 对偏向一侧的数据,不要直接套用正态分布。

→ 用计算器直接计算: 正态分布

更新日期 2026-09-23