〇、描述统计
拿到一批数据 $x_1,\dots,x_n$ 后,先用描述统计概括其分布特征,再进入推断统计。
- 集中趋势:样本均值 $\bar x=\frac1n\sum x_i$、中位数(排序后居中者)、众数(出现最频繁者)。
- 离散程度:样本方差 $s^2=\frac1{n-1}\sum(x_i-\bar x)^2$、标准差 $s=\sqrt{s^2}$、极差 $R=\max x_i-\min x_i$、四分位距 $\mathrm{IQR}=Q_3-Q_1$。
- 形状:偏度反映分布不对称方向,峰度反映尾部厚薄。
| 指标 | 公式/含义 | 对异常值敏感度 |
|---|---|---|
| 均值 | $\bar x=\frac1n\sum x_i$ | 敏感 |
| 中位数 | 排序后中间值 | 不敏感 |
| 标准差 | $s=\sqrt{\frac1{n-1}\sum(x_i-\bar x)^2}$ | 敏感 |
| 四分位距 | $Q_3-Q_1$ | 不敏感 |
> 均值受异常值拉动明显,故右偏数据常用中位数描述更稳健。
一、总体、样本与统计量
总体是研究对象取值的全体(常视为随机变量 $X$),样本 $X_1,\dots,X_n$ 是独立同分布于总体的观测。$n$ 称样本容量。
不含未知参数的样本函数称为统计量。最基本的有:
$$\bar X=\frac{1}{n}\sum_{i=1}^{n}X_i,\qquad S^2=\frac{1}{n-1}\sum_{i=1}^{n}(X_i-\bar X)^2$$
注意样本方差分母用 $n-1$(无偏),而非 $n$。
二、抽样分布
统计量的分布称抽样分布。设样本来自 $N(0,1)$ 或 $N(\mu,\sigma^2)$,三大重要分布:
$$Z_1,\dots,Z_\nu\stackrel{\text{i.i.d.}}{\sim}N(0,1)\ \Rightarrow\ \chi^2=\sum_{i=1}^{\nu}Z_i^2\sim\chi^2(\nu)$$
$$T=\frac{Z}{\sqrt{\chi^2(\nu)/\nu}}\sim t(\nu),\qquad Z\sim N(0,1)$$
$$F=\frac{\chi^2(\nu_1)/\nu_1}{\chi^2(\nu_2)/\nu_2}\sim F(\nu_1,\nu_2)$$
若 $X_i\sim N(\mu,\sigma^2)$,则 $\dfrac{(n-1)S^2}{\sigma^2}\sim\chi^2(n-1)$,$\dfrac{\bar X-\mu}{S/\sqrt n}\sim t(n-1)$。
三、参数估计
(1)矩估计:用样本矩替换总体矩列方程求参数。例:以 $\bar X$ 估计 $E[X]$。
(2)极大似然估计(MLE):取使样本出现概率(似然)最大的参数值。似然函数
$$L(\theta)=\prod_{i=1}^{n}f(X_i;\theta),\qquad \hat\theta=\arg\max_{\theta} L(\theta)$$
常对 $\ln L(\theta)$ 求导并令为 0 求解。MLE 具相合性与渐近正态性,是大样本推断的主流方法。
两种方法简要对比:
| 方法 | 思路 | 优点 | 局限 |
|---|---|---|---|
| 矩估计 | 样本矩 = 总体矩列方程 | 计算简单、直观 | 可能不唯一、效率较低 |
| 极大似然 | 最大化似然函数 | 渐近最优、信息充分 | 需写出密度、常需数值解 |
四、估计的评价:无偏性
估计量 $\hat\theta$ 若满足
$$E[\hat\theta]=\theta$$
则称 $\hat\theta$ 为 $\theta$ 的无偏估计。样本均值 $\bar X$ 是 $\mu$ 的无偏估计;样本方差 $S^2$ 是 $\sigma^2$ 的无偏估计(这正是分母用 $n-1$ 的原因)。此外还考察有效性(方差小更优)与相合性(样本增大趋真值)。
有偏/无偏仅关乎“平均是否等于真值”,不等于单次估计一定准确;比较估计量常综合偏差与方差。
有效性与相合性:若 $\hat\theta_1,\hat\theta_2$ 均无偏,方差小者更有效;若 $\hat\theta_n\xrightarrow{P}\theta$(依概率收敛),则称 $\hat\theta_n$ 为相合估计。样本均值 $\bar X$ 既是无偏的也是相合的。
五、区间估计
在点估计附近构造一个以 $1-\alpha$ 概率覆盖真值的区间 $(\hat\theta_L,\hat\theta_U)$:
$$P(\hat\theta_L\lt\theta\lt\hat\theta_U)=1-\alpha$$
正态总体、方差已知时均值 $\mu$ 的置信区间为 $\bar X\pm z_{\alpha/2}\,\sigma/\sqrt n$($z_{\alpha/2}$ 为标准正态上 $\alpha/2$ 分位数)。方差未知时改用 $t$ 分布:$\bar X\pm t_{\alpha/2}(n-1)\,S/\sqrt n$。
六、假设检验基础
- 原假设 $H_0$ 与备择假设 $H_1$:待检验的命题与对立命题。
- 显著性水平 $\alpha$:犯第一类错误(拒真)的上限,常取 0.05。
- 检验统计量:由样本构造,其分布在 $H_0$ 下已知。
- p 值:在 $H_0$ 成立时,观测到当前样本及更极端结果的概率。若 $p\lt\alpha$ 则拒绝 $H_0$。
核心逻辑是“小概率反证法”:若 $H_0$ 下观察到的结果过于罕见(p 很小),则怀疑 $H_0$ 不成立。
常用检验方法对比:
| 检验 | 适用场景 | 检验统计量 | 参考分布 |
|---|---|---|---|
| $z$ 检验 | 均值,方差已知 | $Z=\frac{\bar X-\mu_0}{\sigma/\sqrt n}$ | $N(0,1)$ |
| $t$ 检验 | 均值,方差未知 | $T=\frac{\bar X-\mu_0}{S/\sqrt n}$ | $t(n-1)$ |
| $\chi^2$ 检验 | 方差 | $\frac{(n-1)S^2}{\sigma_0^2}$ | $\chi^2(n-1)$ |
| $F$ 检验 | 两方差比 | $\frac{S_1^2/\sigma_1^2}{S_2^2/\sigma_2^2}$ | $F(n_1-1,n_2-1)$ |
单样本 $t$ 检验例:某机器灌装量标准 $\mu_0=500\ \mathrm{g}$。抽 $n=16$ 瓶得 $\bar x=496$,$s=10$。检验 $H_0:\mu=500$ 对 $H_1:\mu\neq500$($\alpha=0.05$)。
解:检验统计量
$$t=\frac{\bar x-\mu_0}{s/\sqrt n}=\frac{496-500}{10/4}=\frac{-4}{2.5}=-1.6.$$
自由度 $15$,临界值 $t_{0.025}(15)\approx2.131$。$|t|=1.6\lt2.131$,未落入拒绝域,故不拒绝 $H_0$(p 值约 $0.13\gt0.05$)。
七、例题与解答
例题1 · 矩估计与极大似然估计
设 $X_1,\dots,X_n\sim\operatorname{Exp}(\lambda)$(密度 $\lambda e^{-\lambda x}$),求 $\lambda$ 的矩估计与极大似然估计。
解:总体均值 $E[X]=1/\lambda$,故矩估计令 $\bar X=1/\lambda$,得 $\hat\lambda_{\text{矩}}=1/\bar X$。
似然 $L(\lambda)=\lambda^n e^{-\lambda\sum X_i}$,对数似然 $\ln L=n\ln\lambda-\lambda\sum X_i$。
求导:$\frac{d}{d\lambda}\ln L=\frac{n}{\lambda}-\sum X_i=0$,得 $\hat\lambda_{\text{MLE}}=\frac{n}{\sum X_i}=\frac{1}{\bar X}$。
两法结果一致。
例题2 · 单样本均值的区间估计
从正态总体抽得样本:$n=16$,$\bar x=102$,$s=8$。求 $\mu$ 的 95% 置信区间(方差未知)。
解:用 $t$ 区间 $\bar x\pm t_{0.025}(15)\,s/\sqrt n$。查表 $t_{0.025}(15)\approx2.131$。
$$8/\sqrt{16}=2,\qquad 2.131\times2\approx4.262.$$
故 95% 置信区间为 $(102-4.262,\ 102+4.262)=(97.738,\ 106.262)$。
例题3 · 无偏性验证
验证样本方差 $S^2=\frac1{n-1}\sum(X_i-\bar X)^2$ 是 $\sigma^2$ 的无偏估计。
解:利用 $\sum(X_i-\bar X)^2=\sum X_i^2-n\bar X^2$,取期望:
$$E\!\left[\sum(X_i-\bar X)^2\right]=\sum E[X_i^2]-nE[\bar X^2]=n(\sigma^2+\mu^2)-n\left(\frac{\sigma^2}{n}+\mu^2\right)=(n-1)\sigma^2.$$
故 $E[S^2]=\frac1{n-1}(n-1)\sigma^2=\sigma^2$,证毕。
八、练习
1. 数据 $2,4,4,4,5,5,7,9$ 的均值、中位数、标准差各是多少?
2. 设样本来自 $N(\mu,\sigma^2)$,写出 $\mu$ 的 95% 置信区间公式(分方差已知/未知两种)。
3. 沿用六中的 $t$ 检验例,若改为 $\alpha=0.10$,结论是否改变?($t_{0.05}(15)\approx1.753$)
提示/答案
- 1. $\bar x=5$,中位数 $=(4+5)/2=4.5$,$s^2=\frac{1}{7}((2-5)^2+\cdots+(9-5)^2)\approx4.57$,$s\approx2.14$。
- 2. 方差已知:$\bar X\pm z_{0.025}\sigma/\sqrt n$;未知:$\bar X\pm t_{0.025}(n-1)S/\sqrt n$。
- 3. $|t|=1.6\lt1.753$,仍不拒绝 $H_0$,结论不变。
九、本章小结
- 总体→样本→统计量($\bar X$、$S^2$);样本方差分母为 $n-1$ 以保无偏。
- 描述统计用均值/中位数概括集中趋势,用标准差/四分位距概括离散程度。
- 抽样分布:χ²、t、F 三类,以及 $\bar X$、$\dfrac{(n-1)S^2}{\sigma^2}$ 的分布。
- 参数估计:矩估计(样本矩代总体矩)、极大似然估计(最大化似然)。
- 无偏性 $E[\hat\theta]=\theta$;区间估计给出置信水平 $1-\alpha$ 的覆盖区间。
- 假设检验:原假设/备择假设、显著性水平 $\alpha$、p 值;以“小概率反证法”决策,按检验统计量与参考分布判拒绝域。
互动演示
拖动下方控件观察动态过程。