一、依概率收敛
随机变量序列 $\{X_n\}$ 依概率收敛于常数 $a$,指对任意 $\varepsilon\gt0$:
$$\lim_{n\to\infty}P(|X_n-a|\ge\varepsilon)=0,\qquad \text{记作 }X_n\xrightarrow{P}a$$
直观含义:当 $n$ 很大时,$X_n$ 以很大概率“贴近” $a$。这是大数定律的表述语言。
二、伯努利大数定律
设 $n$ 次独立重复试验中事件 $A$ 发生 $k$ 次,$f_n=k/n$ 为频率。若单次概率 $p=P(A)$,则
$$f_n\xrightarrow{P}p$$
即试验次数足够大时,频率依概率收敛于概率。这是“用频率估计概率”的理论依据,也是统计学的基石。
三、切比雪夫大数定律
设 $X_1,X_2,\dots$ 相互独立,方差一致有界($D(X_i)\le C$),则前 $n$ 项算术平均依概率收敛于其期望的平均:
$$\frac{1}{n}\sum_{i=1}^{n}X_i\xrightarrow{P}\frac{1}{n}\sum_{i=1}^{n}E[X_i]$$
特别地,若同分布且期望为 $\mu$,则样本均值 $\bar X_n\xrightarrow{P}\mu$。它把“平均值的稳定性”严格化。
证明思路(切比雪夫不等式):对任意 $\varepsilon\gt0$,
$$P(|\bar X_n-E[\bar X_n]|\ge\varepsilon)\le \frac{D(\bar X_n)}{\varepsilon^2}=\frac{1}{n^2\varepsilon^2}\sum_{i=1}^n D(X_i)\le \frac{C}{\varepsilon^2 n}\to0,$$
故 $\bar X_n\xrightarrow{P}E[\bar X_n]$。
四、辛钦大数定律
设 $X_1,X_2,\dots$ 独立同分布,且期望 $\mu=E[X_i]$ 存在(不要求方差存在),则
$$\bar X_n=\frac{1}{n}\sum_{i=1}^{n}X_i\xrightarrow{P}\mu$$
相比切比雪夫版本,辛钦仅要求期望存在,适用范围更广;它直接说明样本均值是总体均值的相合估计。
五、中心极限定理
独立同分布中心极限定理(Lindeberg–Lévy):设 $X_i$ 独立同分布,$E[X_i]=\mu$,$D(X_i)=\sigma^2\lt\infty$,则标准化和依分布收敛于标准正态:
$$\frac{\displaystyle\sum_{i=1}^{n}X_i-n\mu}{\sqrt n\,\sigma}\xrightarrow{d}N(0,1)$$
等价地,当 $n$ 较大时 $\sum X_i\approx N(n\mu,\,n\sigma^2)$。这是“正态分布无处不在”的根本原因,也是大样本统计推断的核心。
证明思路(特征函数法):记标准化和为 $Y_n$,其均值与方差为 $0$ 与 $1$。设 $X_i$ 的特征函数 $\varphi(t)$。由独立性,$Y_n$ 的特征函数为 $[\varphi(t/\sqrt n)]^n$。在 $t=0$ 处展开 $\varphi(t)=1+i\mu t-\frac{\mu^2+\sigma^2}{2}t^2+o(t^2)$,代 $t/\sqrt n$ 并取 $n$ 次幂,极限为 $e^{-t^2/2}$,正是标准正态的特征函数,故 $Y_n\xrightarrow{d}N(0,1)$。
六、正态近似
对独立同分布样本,当 $n$ 足够大时样本均值近似正态:均值分布为 $N(\mu,\ \sigma^2/n)$,方差随 $n$ 增大而减小。这正是中心极限定理的可视化体现:样本量越大,均值分布越集中于 $\mu$。
对二项分布 $S_n\sim B(n,p)$,当 $np(1-p)$ 不太小时可用正态近似:
$$S_n\approx N(np,\ np(1-p)),$$
并可做连续性修正 $P(S_n\le k)\approx\Phi\!\left(\frac{k+0.5-np}{\sqrt{np(1-p)}}\right)$。
七、各种收敛性及其关系
概率论中常见四种收敛,强弱关系为:几乎必然收敛 $\Rightarrow$ 依概率收敛 $\Rightarrow$ 依分布收敛;此外还有 $r$ 阶收敛。
| 收敛类型 | 记号 | 直观含义 | ||
|---|---|---|---|---|
| 几乎必然收敛 | $X_n\xrightarrow{a.s.}X$ | 除零概率事件外,序列最终恒等于极限 | ||
| 依概率收敛 | $X_n\xrightarrow{P}X$ | 偏差大于任给 $\varepsilon$ 的概率趋于 0 | ||
| 依分布收敛 | $X_n\xrightarrow{d}X$ | 分布函数逐点收敛 | ||
| $r$ 阶收敛 | $X_n\xrightarrow{L^r}X$ | $E[ | X_n-X | ^r]\to0$ |
> 关系链:$a.s.\Rightarrow P\Rightarrow d$;$L^r(r\gt0)\Rightarrow P$。大数定律用依概率(或几乎必然)收敛,中心极限定理用依分布收敛。
八、例题与解答
例题1 · 用 CLT 近似求和概率
独立掷一枚均匀骰子 100 次,记点数和为 $S$。近似求 $P(S\le 350)$。
解:单次点数 $X$ 的期望 $\mu=3.5$,方差 $\sigma^2=\frac{35}{12}\approx2.9167$。$n=100$。由中心极限定理:
$$S\approx N(100\times3.5,\ 100\times\tfrac{35}{12})=N(350,\ 291.67).$$
标准化:
$$P(S\le350)=P\!\left(\frac{S-350}{\sqrt{291.67}}\le0\right)\approx\Phi(0)=0.5.$$
更精确地(带连续性修正)$P(S\le350.5)\approx\Phi(0.5/\sqrt{291.67})\approx\Phi(0.029)\approx0.512$。
例题2 · 大数定律说明频率稳定于概率
抛硬币单次正面概率 $p=0.5$。用伯努利大数定律说明:抛 $n$ 次的正面频率 $f_n$ 当 $n\to\infty$ 时趋于 $0.5$。
解:设 $X_i=1$ 表示第 $i$ 次正面,则 $E[X_i]=p=0.5$,频率 $f_n=\frac1n\sum X_i$。由伯努利大数定律
$$f_n\xrightarrow{P}p=0.5.$$
即对任意精度 $\varepsilon\gt0$,$P(|f_n-0.5|\ge\varepsilon)\to0$。故试验越多,频率越稳定地围绕 $0.5$ 波动——解释了“频率估计概率”的合理性。
例题3 · 样本均值的正态近似
某厂灯泡寿命均值 $\mu=1000$ 小时、标准差 $\sigma=100$ 小时。随机抽取 $n=100$ 只,求样本均值小于 $980$ 的概率。
解:由中心极限定理,$\bar X\approx N(1000,\ 100^2/100)=N(1000,\ 100)$。标准化:
$$P(\bar X\lt980)=P\!\left(\frac{\bar X-1000}{10}\lt\frac{980-1000}{10}\right)=P(Z\lt-2)\approx\Phi(-2)\approx0.0228.$$
即约 $2.28\%$ 的可能样本均值低于 980 小时。
九、练习
1. 用 CLT 近似 $B(200,0.4)$ 中 $P(70\le S\le 90)$(可做连续性修正)。
2. 设 $X_i$ 独立同分布,$E[X_i]=5$,解释 $\bar X_{100}$ 依概率收敛到何值。
3. 辨析:中心极限定理说的是样本均值“依概率收敛”还是“依分布收敛”于正态?
提示/答案
- 1. $S\approx N(80,\ 48)$,$\sigma\approx6.928$;$P(70\le S\le90)\approx\Phi(10/6.928)-\Phi(-10/6.928)\approx\Phi(1.443)-\Phi(-1.443)\approx0.851$。
- 2. 由辛钦大数定律,$\bar X_{100}\xrightarrow{P}5$。
- 3. 中心极限定理的结论是“依分布收敛”:标准化后的样本均值依分布收敛于标准正态分布,而非依概率收敛到某常数。
十、本章小结
- 依概率收敛 $X_n\xrightarrow{P}a$ 是极限定理的基本语言。
- 伯努利大数定律:频率 $\xrightarrow{P}$ 概率;切比雪夫/辛钦:样本均值 $\xrightarrow{P}$ 期望(辛钦仅需期望存在)。
- 中心极限定理:标准化和 $\dfrac{\sum X_i-n\mu}{\sqrt n\sigma}\xrightarrow{d}N(0,1)$;$n$ 大时和近似正态。
- 收敛性强度:几乎必然 $\Rightarrow$ 依概率 $\Rightarrow$ 依分布;$r$ 阶收敛 $\Rightarrow$ 依概率。
- 应用:用正态近似计算大样本下的和/均值概率;用大数定律论证频率稳定性与估计相合性。
互动演示
拖动下方控件观察动态过程。