正态分布是以均值为中心、左右对称的钟形分布。身高、测量误差以及许多考试成绩这类由众多微小因素叠加而成的数值,常常接近正态分布。此外,只要样本足够大,无论原分布如何,样本均值都会趋近正态分布(中心极限定理),正因如此,相当多的置信区间和检验方法都建立在正态分布之上。
决定正态分布的两个值
正态分布完全由均值 μ 和标准差 σ 两个值确定。记作 N(μ, σ²)(第二个位置是方差)。
- μ 决定钟形的中心位置。
- σ 决定钟形的宽度。σ 大则又低又宽,σ 小则又高又窄。
- 均值、中位数、众数都等于 μ。
- 曲线下的总面积为 1,某一区间的面积就是取值落在该区间的概率。
z 分数:把不同尺度统一起来
z 分数表示某个值距离均值有几个标准差。
z = (x − μ) / σ
转换成 z 分数后,所有正态分布都变成均值为 0、标准差为 1 的标准正态分布 N(0, 1)。因此用一张表(或一个计算器)就能求出所有正态分布的概率。z 分数没有单位,比较两门尺度不同的考试成绩时也很有用。例如在均值 70·标准差 10 的考试中得 85 分(z=1.5),相对而言比在均值 60·标准差 20 的考试中得 80 分(z=1.0)成绩更好。
68–95–99.7 法则
以标准差为单位划定区间时,落在正态分布中的比例总是固定的。
| 区间 | 落入比例(精确值) | 区间外比例 |
|---|---|---|
| μ ± 1σ | 约 68.27% | 约 31.73% |
| μ ± 2σ | 约 95.45% | 约 4.55% |
| μ ± 3σ | 约 99.73% | 约 0.27% |
这条法则是便于心算的近似。恰好包含 95% 的区间不是 ±2σ,而是 ±1.96σ,这就是置信区间中出现 1.96 这个数字的原因。同样,90% 对应 ±1.645σ,99% 对应 ±2.576σ。
如何读累积概率
正态分布计算中最基本的值是累积概率 P(X ≤ x),即小于等于 x 的概率。在标准正态分布中记作 Φ(z)。其余概率都由它推出。
- 大于等于 x 的概率:
P(X ≥ x) = 1 − Φ(z) - 介于 a 与 b 之间的概率:
P(a ≤ X ≤ b) = Φ(z_b) − Φ(z_a) - 对称性:
Φ(−z) = 1 − Φ(z)
在连续分布中,单个点的概率为 0,因此 ≤ 与 < 的区别不影响结果。
示例 1:低于某分数的概率
假设某次考试成绩服从均值 70、标准差 10 的正态分布。
85 分及以下的概率
- z 分数:
z = (85 − 70) / 10 = 1.5 - 累积概率:
Φ(1.5) ≈ 0.9332 - 解读:约 93.32% 的考生在 85 分及以下。85 分相当于前约 6.68%。
60 分以上、85 分以下的概率
- 60 分的 z 分数:
(60 − 70) / 10 = −1.0→Φ(−1.0) ≈ 0.1587 - 85 分的 z 分数:
1.5→Φ(1.5) ≈ 0.9332 - 差值:
0.9332 − 0.1587 ≈ 0.7745 - 解读:约 77.45% 的考生在 60 分到 85 分之间。
55 分及以下的概率
z 分数为 −1.5,由对称性得 Φ(−1.5) = 1 − 0.9332 ≈ 0.0668。这与 85 分及以上的概率完全相同。
示例 2:反推前 x% 的分界分数
这次反过来,由概率求分数。“要进入前 10% 需要多少分”,问的是“累积概率 0.90 对应的分数”。
- 求累积概率 0.90 对应的 z 值:
z = Φ⁻¹(0.90) ≈ 1.2816 - 还原到原始尺度:
x = μ + z × σ = 70 + 1.2816 × 10 ≈ 82.82 - 解读:约 82.82 分及以上即为前 10%。
同样的方法,前 5% 为 z ≈ 1.6449,因此是 70 + 16.449 ≈ 86.45 分。求后 x% 时,直接代入累积概率 x 即可。
| 标准 | 累积概率 | z 值 | 分数(μ=70, σ=10) |
|---|---|---|---|
| 前 25% | 0.75 | 约 0.6745 | 约 76.74 |
| 前 10% | 0.90 | 约 1.2816 | 约 82.82 |
| 前 5% | 0.95 | 约 1.6449 | 约 86.45 |
| 前 1% | 0.99 | 约 2.3263 | 约 93.26 |
示例 3:应用于样本均值
正态分布计算不仅适用于单个分数,也适用于样本均值。在均值 70、标准差 10 的考试中随机抽取 25 人,求这 25 人的平均分在 74 分及以上的概率。
- 样本均值的标准差(标准误):
σ / √n = 10 / √25 = 2 - z 分数:
z = (74 − 70) / 2 = 2.0 - 概率:
1 − Φ(2.0) ≈ 0.0228
单个学生得 74 分及以上的概率为 1 − Φ(0.4) ≈ 0.3446,很常见;但 25 人的平均分在 74 分及以上的概率只有约 2.28%,很少见。这是因为均值远不如单个值那样分散。这正是置信区间和假设检验的出发点。
注意事项
- 检查正态性假设。 对收入、等待时间这类单侧长尾的数据套用正态分布,会严重算错尾部概率。先用直方图或 Q-Q 图确认形状。
- 有上下限的数据(0~100 分的考试等)在两端可能偏离正态分布。反推前 1% 这类极端分界时尤其要小心。
- 区分参数与估计值。 如果 μ 和 σ 是由样本估计的,结果也会带有相应的估计误差。
在本站的正态分布计算器中输入均值和标准差,即可立即查看累积概率、区间概率和反推值。
要点总结
- 正态分布由均值 μ 和标准差 σ 确定,可以通过
z = (x − μ) / σ转换为标准正态分布。 - μ ± 1σ、2σ、3σ 内分别约有 68.27%、95.45%、99.73%,精确的 95% 区间是 ±1.96σ。
- 均值 70·标准差 10 时,85 分及以下的概率约为 0.9332,60~85 分之间的概率约为 0.7745。
- 25 人样本均值的标准误为
10 / √25 = 2,平均分在 74 分及以上的概率约为 0.0228。 - 前 10% 的分界像
70 + 1.2816 × 10 ≈ 82.82分那样,用累积概率的反函数求得。 - 对偏向一侧的数据,不要直接套用正态分布。