本章目标

  • 把"事件概率 → 随机变量 → 多维 → 数字特征 → 极限定理 → 统计推断"串成一条线。
  • 会用贝叶斯公式做逆概率推理(由结果反推原因)。
  • 理解中心极限定理如何让"样本均值趋近正态",从而用正态近似。
  • 会构造总体均值的置信区间,理解"95% 置信"的含义。
核心提示:概率论研究"随机本身的规律",统计用"少量观测去推断整体的规律"。二者由大数定律与中心极限定理衔接——这正是本综合专题的主轴。

一、从事件到随机变量

先有随机事件与概率(加法、乘法、条件概率、贝叶斯),再把随机结果数值化得到随机变量 $X$:

贝叶斯公式(逆概率) $$P(A_i\mid B) = \frac{P(B\mid A_i)P(A_i)}{\sum_j P(B\mid A_j)P(A_j)}$$

离散变量用分布列 $P(X=x_k)$,连续变量用概率密度 $f(x)$(满足 $\int f=1$)。常见分布(二项、泊松、正态、均匀)是建模现实随机现象的"积木"。

二、多维与数字特征

多个随机变量组成多维变量 $(X,Y)$,由联合分布描述;边缘分布由求和/积分得到,协方差刻画线性相关:

协方差与相关系数 $$\operatorname{Cov}(X,Y)=E[(X-EX)(Y-EY)],\qquad \rho=\frac{\operatorname{Cov}(X,Y)}{\sqrt{DX\,DY}}$$

数字特征(期望、方差、矩)用少数几个数概括分布——统计推断几乎全靠它们:用样本均值 $\bar X$ 估总体期望,用样本方差估总体方差。

三、极限定理

两条极限定理是概率与统计之间的桥:

  • 大数定律:样本均值 $\bar X_n$ 依概率收敛到总体期望 $EX$,即"频率稳定于概率"。
  • 中心极限定理(CLT):无论总体分布如何,只要方差有限,样本均值近似服从正态分布
中心极限定理 $$\bar X_n \;\dot\sim\; N\!\left(\mu,\ \frac{\sigma^2}{n}\right)$$

CLT 是"为何正态无处不在"的根本原因,也是一切大样本统计方法的理论基石。

四、统计推断:用样本推断总体

现实中总体未知,只能抽样。两类核心问题:

  • 估计:用样本给出总体参数的点估计或区间估计。均值 $\mu$ 的 $1-\alpha$ 置信区间为
均值置信区间(σ 已知) $$\bar X \pm z_{\alpha/2}\,\frac{\sigma}{\sqrt{n}}$$
  • 检验:对总体假设(如 $\mu=\mu_0$)做显著性判断,依据小概率事件原理。
"95% 置信"不是说"μ 有 95% 概率落在区间里"(μ 是定值),而是"无数次抽样造出的区间中,约 95% 会覆盖真值"。

五、动态示意:95% 置信区间覆盖

下方反复从总体 $N(0,1)$ 抽取样本量 $n$ 的样本,构造区间 $\bar X\pm 1.96\,\sigma/\sqrt n$(粉色虚线为真值 $\mu=0$)。绿色区间覆盖真值,红色未覆盖。拖动「样本量 n」观察:n 越大,区间越窄、覆盖比例越稳定地趋近 95%。点击「重置」清空重来。

提示:置信水平是"方法的长期正确率",不是"这一次区间的可信度"。单条红区间并不可怕,它恰好是那约 5% 的"失手"。

例题1(贝叶斯:假阳性悖论)

例题

某病患病率 $P(D)=1\%$,检测灵敏度 $P(+\mid D)=95\%$,特异度 $P(-\mid \bar D)=90\%$(即 $P(+\mid\bar D)=10\%$)。一人检测阳性,求真患病概率 $P(D\mid +)$。

解:由贝叶斯公式,先算阳性总概率 $$P(+) = P(+\mid D)P(D) + P(+\mid\bar D)P(\bar D) = 0.95\times0.01 + 0.10\times0.99 = 0.0095 + 0.099 = 0.1085.$$ 故 $$P(D\mid +) = \frac{0.0095}{0.1085} \approx 0.0876 \approx 8.8\%.$$ 尽管检测"相当准",阳性者真正患病的概率仅约 8.8%——因为 base rate(患病率)极低,大量健康人被误报。这正是"先算总体再逆推"的威力。

例题2(CLT:样本均值的正态近似)

例题

掷均匀骰子,单次均值 $\mu=3.5$,方差 $\sigma^2=91/6-3.5^2\approx 2.917$。掷 $n=30$ 次,求样本均值落在 $[3.3,3.7]$ 的概率。

解:由 CLT,$\bar X_{30}\approx N(3.5,\ \sigma^2/30)$。标准误 $$\text{SE} = \sqrt{\frac{2.917}{30}} \approx 0.312.$$ 标准化: $$z_1=\frac{3.3-3.5}{0.312}\approx -0.641,\quad z_2=\frac{3.7-3.5}{0.312}\approx 0.641.$$ $$P(3.3\le \bar X\le 3.7) \approx \Phi(0.641)-\Phi(-0.641) = 2\Phi(0.641)-1 \approx 2\times 0.7393 - 1 = 0.479.$$ 即约 $47.9\%$。注意:单次骰子分布是离散均匀的,但 30 次平均已可用正态很好近似。

例题3(置信区间计算)

例题

总体标准差 $\sigma=10$,抽取 $n=25$ 的样本,得样本均值 $\bar x=102$。求总体均值 $\mu$ 的 95% 置信区间($z_{0.025}=1.96$)。

解:标准误 $$\text{SE} = \frac{\sigma}{\sqrt{n}} = \frac{10}{\sqrt{25}} = 2.$$ 边际误差 $$E = z_{0.025}\cdot \text{SE} = 1.96\times 2 = 3.92.$$ 故 95% 置信区间 $$\mu \in \bigl(102 - 3.92,\ 102 + 3.92\bigr) = (98.08,\ 105.92).$$ 含义:在重复抽样下,如此构造的区间约有 95% 会覆盖真值 $\mu$。

本章小结

  • 主线:事件概率 → 随机变量 → 多维/数字特征 → 极限定理 → 统计推断。
  • 贝叶斯公式做逆概率推理;base rate 低时"假阳性"会主导。
  • CLT:样本均值 $\bar X_n\sim N(\mu,\sigma^2/n)$,支撑一切大样本方法。
  • 置信区间 $\bar X\pm z_{\alpha/2}\sigma/\sqrt n$;"95% 置信"指方法的长期覆盖率。