第 8 章 · 极限定理

8.4 强大数定律

The Strong Law of Large Numbers
学习目标
  • 用自己的话说出几乎必然收敛(almost sure convergence)的含义,并指出它与依概率收敛的本质区别;
  • 准确陈述强大数定律,并比较其条件 \(E|X|<\infty\) 与弱大数定律的方差条件的强弱;
  • 证明"几乎必然收敛蕴含依概率收敛",并能举出反向不成立的示意性反例;
  • 用强大数定律解释频率解释的严格化,以及"长期赌徒必输"的必然性;
  • 会用"大数定律 + 中心极限定理"设计蒙特卡洛估计(求 \(\pi\)、求积分),会计算估计量的标准差并做样本量设计。

1. 几乎必然收敛:对整条轨道的要求

8.2 节中,我们证明了弱大数定律(weak law of large numbers):在方差有限的条件下,样本均值 \(\bar{X}_n\) 依概率收敛(convergence in probability)于期望 \(\mu\),即对任意 \(\varepsilon>0\),

\[ \lim_{n\to\infty} P\bigl(|\bar{X}_n-\mu|>\varepsilon\bigr)=0. \]

这句话只对"每个固定时刻 \(n\)"作了承诺:偏离超过 \(\varepsilon\) 的轨道所占比例趋于 0。它并没有保证一条轨道一旦靠近 \(\mu\) 就永远贴住它——按此定义,轨道仍可能在越来越稀疏的时刻一次次冲出 \(\varepsilon\) 带,只要每次冲出的概率趋于 0。本节把收敛要求从"时刻"加强到"整条轨道",就得到大数定律最强的形式。

定义 1 几乎必然收敛

设 \(X_1,X_2,\ldots\) 与 \(X\) 是同一个样本空间上的随机变量。若

\[ P\Bigl(\bigl\{\omega:\ \lim_{n\to\infty}X_n(\omega)=X(\omega)\bigr\}\Bigr)=1, \]

则称 \(X_n\) 几乎必然收敛(convergence almost surely)于 \(X\),记作 \(X_n\to X\) a.s.(almost surely)。

直观理解:把每个样本点 \(\omega\) 想象成一次无限重复试验的完整记录,即一条样本轨道(sample path)——按这次记录依次算出的数列 \(X_1(\omega),X_2(\omega),\ldots\)。几乎必然收敛的意思是:除去一个概率为 0 的"坏轨道"集合外,每条轨道都是一条按普通微积分意义收敛的数列。例外集概率为 0,在实践中可以当作不存在。本教程不追求测度论的细节,记住这句直观表述即可。

两种收敛的分工可以这样概括:依概率收敛是对"时刻"的陈述——在每个时刻还有多大比例的轨道处于偏离状态;几乎必然收敛是对"轨道"的陈述——要求几乎每条轨道自身最终安静下来、偏离永远不再发生。图 1 用掷硬币的正面频率轨道展示二者的差别。

0.3 0.4 0.5 0.6 0.7 10 10² 10³ 10⁴ 10⁵ 试验次数 n(对数刻度) 正面频率 几乎必然收敛的轨道 仅依概率收敛的轨道(示意) ε 带 [0.45, 0.55] n≈1000 后贴住 0.5 n≈3000:冲出 ε 带 n≈2 万:再度冲出 ε 带
图 1:两条频率轨道的对比。深蓝轨道自 \(n\approx 1000\) 起进入 \(\varepsilon\) 带并"贴住" 0.5——这是几乎必然收敛的典型行为;绛红轨道的总趋势同样趋于 0.5(每个固定时刻大偏离的概率趋于 0,故依概率收敛成立),但在 \(n\approx 3000\)、\(n\approx 2\) 万等处仍冒出 \(\varepsilon\) 带外的大偏离,且这样的偏离不保证停止。
定理 1 几乎必然收敛蕴含依概率收敛

若 \(X_n\to X\) a.s.,则 \(X_n\) 依概率收敛于 \(X\)。

证明固定 \(\varepsilon>0\),记 \(A_n=\{|\,X_n-X\,|>\varepsilon\}\),\(B_n=\bigcup_{k\ge n}A_k\)(事件"从第 \(n\) 项起,后面还至少有一次 \(\varepsilon\) 偏离")。显然 \(A_n\subseteq B_n\),且 \(B_n\) 随 \(n\) 增大单调不增。一条轨道若只发生有限多次偏离,则它迟早永远离开所有 \(B_n\);因此交集 \(\bigcap_{n\ge1}B_n\) 恰是"偏离发生无穷多次"这一事件,它只包含不收敛的轨道。由几乎必然收敛,\(P\bigl(\bigcap_n B_n\bigr)=0\)。于是由概率的单调性与上连续性, \[ 0\le P(A_n)\le P(B_n)\downarrow P\Bigl(\bigcap_{n}B_n\Bigr)=0, \] 故 \(P(A_n)\to 0\),即依概率收敛。(上连续性的严格讨论超出本书范围;上式的直观含义是:仍在偏离的轨道被"越来越晚的偏离"层层套住,概率被压到 0。)
注记 依概率收敛推不出几乎必然收敛

取相互独立的随机变量列,\(P(X_n=1)=1/n\),\(P(X_n=0)=1-1/n\)。对任意固定 \(\varepsilon\in(0,1)\),\(P(|X_n|>\varepsilon)=1/n\to0\),故 \(X_n\to0\) 依概率。但由于 \(\sum_n 1/n=\infty\) 且各次独立,可以证明" \(X_n=1\) 发生无穷多次"的概率为 1(这是 Borel–Cantelli 引理(Borel–Cantelli lemma)的结论,超出本书范围):偏离(幅度为 1)永不停止,几乎每条轨道都不收敛。可见弱收敛只要求"拍照时刻"偏离者渐少,强收敛要求"录像"最终归于平静。反过来,若偏离幅度本身趋于 0——例如取 \(P(X_n=1/n)=1/n\)(各次独立)——则无论偏离发生多少次,每条轨道都满足 \(|X_n|\le 1/n\to0\),必然收敛。这说明强弱之别不在偏离发生的次数多少,而在超出任意固定 \(\varepsilon\) 的偏离是否最终永远停止

2. 强大数定律与频率解释的严格化

现在给出本节的主定理。

定理 2 强大数定律

设 \(X_1,X_2,\ldots\) 独立同分布,且 \(E|X_1|<\infty\)。记 \(\mu=E[X_1]\),则

\[ P\left(\lim_{n\to\infty}\frac{X_1+X_2+\cdots+X_n}{n}=\mu\right)=1,\qquad\text{即}\quad \bar{X}_n\to\mu \ \text{a.s.} \]

证明需要 Borel–Cantelli 引理与截尾等技术(由 Kolmogorov 在 20 世纪 30 年代完成),超出本书范围,从略;8.2 节的切比雪夫论证可视为其精神先导。

与弱大数定律对比,有两点值得特别注意:

  • 条件更弱:8.2 节用切比雪夫不等式证明弱大数定律时需要 \(\mathrm{Var}(X)<\infty\);而强大数定律只要求 \(E|X|<\infty\)(即期望存在且有限,见 4.3 节)——更弱的条件,更强的结论(由定理 1,几乎必然收敛自动蕴含依概率收敛)。事实上还可以证明:若 \(E|X_1|=\infty\),结论一般不再成立,故该条件已近乎最优。
  • 结论更强:它断言样本均值不是"大概率靠近",而是几乎每条轨道都最终收敛并停在 \(\mu\) 附近——正是"平均值稳定性"这一经验事实的终极数学表述。
定理 3 伯努利大数定律(频率解释的严格化)

设 \(X_1,X_2,\ldots\) 独立同分布,\(P(X_i=1)=p\),\(P(X_i=0)=1-p\)(即每次试验中事件 \(A\) 以概率 \(p\) 发生),则 \(n\) 次试验中 \(A\) 出现的频率 \(f_n=\frac{1}{n}\sum_{i=1}^{n}X_i\) 满足

\[ f_n\to p \quad\text{a.s.} \]

证明指示变量 \(X_i\) 独立同分布,且 \(E|X_i|=p<\infty\),对 \(\{X_i\}\) 应用定理 2 立得。

这正是 8.1 节悬而未决的问题的最终答案:"频率稳定到概率"以几乎必然的方式成立:频率解释(frequency interpretation)之所以可信,是因为出错的轨道全体概率为 0。伯努利(Jacob Bernoulli)1713 年在遗著《猜度术》中证明了这一结果(他称之为"黄金定理"),并视其为自己最重要的成就——它比切比雪夫的弱定律版本早了一百多年。

例 1 长期赌徒几乎必然越赌越输

美式轮盘有 38 个号码:18 红、18 黑、2 绿。赌徒每局押 1 元于"红",中奖按 1:1 赔付。试用强大数定律说明:长期赌下去,赌徒的累计净收益几乎必然趋于 \(-\infty\)。

以 \(X_i\) 表示第 \(i\) 局的净收益,则 \(P(X_i=1)=18/38\),\(P(X_i=-1)=20/38\),各局独立。每局期望 \[ E[X_i]=\frac{18}{38}-\frac{20}{38}=-\frac{2}{38}\approx-0.0526 \ \text{(元)}. \] 由强大数定律,\(\bar{X}_n\to-0.0526\) a.s.,于是累计净收益 \[ S_n=X_1+\cdots+X_n=n\,\bar{X}_n\approx-0.0526\,n\to-\infty \quad\text{a.s.} \] 即赌徒的资金轨道几乎必然以约 \(-0.0526\) 的斜率线性下沉,"靠时间翻盘"的轨道概率为 0。例如 \(n=1000\) 局的典型净亏约 \(52.6\) 元;由 8.3 节的中心极限定理,围绕这一下沉趋势的波动量级为 \(\sqrt{n}\,\sigma\approx\sqrt{1000}\times0.999\approx31.6\) 元(因 \(X_i=\pm1\),\(\sigma\approx1\)),远不足以抵消趋势。"赌场优势"正是靠大数定律兑现的。

3. 蒙特卡洛方法:用随机模拟算确定的数

强大数定律不仅是频率解释的根基,也是"用随机模拟计算确定的量"这类方法的理论执照——蒙特卡洛方法(Monte Carlo method)。其基本模式是:想计算某个量 \(\theta\),先把它写成某个随机变量 \(Y\) 的期望 \(\theta=E[Y]\);然后产生独立同分布样本 \(Y_1,\ldots,Y_N\),用样本均值 \(\hat{\theta}_N=\frac{1}{N}\sum_{i=1}^N Y_i\) 估计 \(\theta\)。强大数定律保证 \(\hat{\theta}_N\to\theta\) a.s.(模拟不会"算错"),中心极限定理进一步给出误差的分布:\(\hat{\theta}_N\) 近似服从 \(N\bigl(\theta,\ \mathrm{Var}(Y)/N\bigr)\),故误差量级为 \(O(1/\sqrt{N})\)。

例 2 蒙特卡洛估计 π

向单位正方形 \([0,1]^2\) 内均匀、独立地撒点 \((U_i,V_i)\)。用落入四分之一圆 \(\{(u,v):u^2+v^2\le1\}\) 的点所占的比例估计 \(\pi\),并计算 \(N=10^4\) 时估计量的标准差。

点 \((U_i,V_i)\) 落入四分之一圆的概率等于其面积:\(p=\pi/4\)。令 \(I_i=\mathbf{1}\{(U_i,V_i)\text{ 落入}\}\),则 \(I_1,I_2,\ldots\) 独立同分布,\(P(I_i=1)=p\)。由强大数定律,比例 \(\hat{p}_N=\frac{1}{N}\sum I_i\to p=\pi/4\) a.s.,于是 \[ \hat{\pi}_N=4\hat{p}_N\to\pi \quad\text{a.s.} \] 精度分析:\(\hat{p}_N\) 是 \(N\) 个伯努利(\(p\))变量的均值,标准差 \(\mathrm{sd}(\hat{p}_N)=\sqrt{p(1-p)/N}\)。\(p\) 的真值事先未知,但由 \(\pi>2.8\) 知 \(p=\pi/4>0.7\),故 \(p(1-p)<0.7\times0.3=0.21\)。取 \(N=10^4\): \[ \mathrm{sd}(\hat{p}_N)<\sqrt{\frac{0.21}{10^4}}\approx0.0046,\qquad \mathrm{sd}(\hat{\pi}_N)=4\,\mathrm{sd}(\hat{p}_N)<0.0183. \] (事后按真值 \(p=\pi/4\approx0.7854\) 精算:\(p(1-p)\approx0.1685\),\(\mathrm{sd}(\hat{\pi}_N)=4\sqrt{0.1685/10^4}\approx0.0164\),与上面的保守值同一量级。)再由中心极限定理,\(\hat{\pi}_N\) 近似正态,故撒一万个点大约能以 95% 的把握把 \(\pi\) 估计到 \(\pm2\times0.0183\approx\pm0.037\) 之内。
表 1:一次典型模拟中 π 的估计值随 N 的变化(理论标准差按 4√(0.21/N)≈1.833/√N 计)
点数 \(N\)估计值 \(\hat{\pi}_N\)理论标准差实际误差
\(100\)3.24000.183+0.0984
\(10^3\)3.13200.058−0.0096
\(10^4\)3.14560.0183+0.0040
\(10^5\)3.141890.0058+0.0003
单位正方形随机撒点(196 点示意) x² + y² ≤ 1 0 1 1 u v 圆内 155 点 圆外 41 点 估计值随 N 的收敛(±2 倍标准差带) 3.0 3.1 3.2 3.3 10² 10³ 10⁴ 10⁵ 10⁶ 样本量 N(对数刻度) π 估计值 π = 3.14159…
图 2:蒙特卡洛估计 π。左图:向单位正方形均匀撒点,落入四分之一圆 \(x^2+y^2\le1\)(浅色区域)的点占比乘 4 即 \(\hat{\pi}\);本示意共 196 点,圆内 155 点,\(\hat{\pi}=4\times155/196\approx3.163\)。右图:一次模拟中 \(\hat{\pi}\) 随 \(N\) 的轨迹,浅色带为 \(\pm2\) 倍标准差(约 \(3.67/\sqrt{N}\)),直观展示误差以 \(O(1/\sqrt{N})\) 收缩。
例 3 用随机模拟计算积分

用蒙特卡洛方法估计 \(\displaystyle\int_0^1 x^2\,dx\),说明算法的合法性来源,并计算 \(N=10^3\) 时估计量的标准差。

设 \(U\sim U(0,1)\),由随机变量函数的期望公式, \[ E\bigl[U^2\bigr]=\int_0^1 x^2\,dx=\frac{1}{3}. \] 于是产生 \(U_1,\ldots,U_N\) 独立同 \(U(0,1)\) 分布,用 \[ \hat{g}_N=\frac{1}{N}\sum_{i=1}^{N}U_i^{\,2} \] 估计该积分。由强大数定律,\(\hat{g}_N\to E[U^2]=1/3\) a.s.——模拟均值必然收敛到真值。误差:\(\mathrm{Var}(U^2)=E[U^4]-\bigl(E[U^2]\bigr)^2=\frac{1}{5}-\frac{1}{9}=\frac{4}{45}\approx0.0889\),故 \[ \mathrm{sd}(\hat{g}_N)=\sqrt{\frac{4}{45N}};\qquad N=10^3 \text{ 时 } \mathrm{sd}\approx0.0094, \] 即约 95% 的把握把积分估到 \(1/3\pm0.019\) 之内。一般地,\(\int_0^1 f(x)\,dx=E[f(U)]\) 都可这样估计,任意区间 \([a,b]\) 上的积分先换元到 \([0,1]\) 即可;例 2 求 \(\pi\) 正是二维版本(那里 \(Y=4\cdot\mathbf{1}\{U^2+V^2\le1\}\),\(E[Y]=\pi\))。

误差量级与样本量设计。两个例子中估计量的标准差都是 \(\sqrt{\mathrm{Var}(Y)/N}\) 的形状:精度提高 10 倍,样本要增加 100 倍——这就是蒙特卡洛 \(O(1/\sqrt{N})\) 的误差代价。结合 8.3 节的中心极限定理,\(\hat{\theta}_N-\theta\) 近似服从 \(N(0,\mathrm{Var}(Y)/N)\),于是可用正态分布给出置信区间(如"约 95% 对应 \(\pm2\) 倍标准差")或反推所需样本量,例 2 中 \(\mathrm{sd}\approx0.0183\)、误差 \(\pm0.037\) 的数值正来源于此。

注记 蒙特卡洛的来历与高维优势

"蒙特卡洛"之名取自摩纳哥的赌城,由 Ulam 与 von Neumann 在 20 世纪 40 年代洛斯阿拉莫斯(曼哈顿计划)的工作中系统化。它把"算确定的量"化为"求随机平均值",合法性由强大数定律担保,精度由中心极限定理度量。其突出优点是:误差只依赖 \(\mathrm{Var}(Y)/N\),与维数无关——对高维积分、复杂系统的期望等确定性方法难以胜任的问题,它常常是唯一可行的手段。这也是强大数定律在当代科学计算中最响亮的应用。

4. 本节小结

要点回顾
  • 几乎必然收敛要求几乎每条样本轨道自身收敛;依概率收敛只要求每个固定时刻偏离概率趋于 0。强蕴含弱(定理 1),反之不真(\(P(X_n=1)=1/n\) 独立反例:偏离永不停止)。
  • 强大数定律:\(X_i\) iid 且 \(E|X_1|<\infty\) \(\Rightarrow\) \(\bar{X}_n\to\mu\) a.s.。条件比弱大数定律的"方差有限"更弱,结论却更强。
  • 伯努利场合:频率 \(f_n\to p\) a.s.——频率解释的严格化;负期望游戏中累计收益 \(S_n=n\bar{X}_n\to-\infty\) a.s.,长期赌徒必输。
  • 蒙特卡洛方法:把待计算的量写成期望 \(E[Y]\),用样本均值估计;SLLN 保证几乎必然收敛,CLT 给出 \(O(1/\sqrt{N})\) 的误差量级与置信区间、样本量设计。

练习

练习 8-4-1

设计一个模拟来估计 \(\displaystyle\int_0^1 e^{-x^2}\,dx\),写出估计量,并估计 \(N=10^4\) 时的精度。

答案与提示

取 \(U_1,\ldots,U_N\) iid \(U(0,1)\),用 \(\hat{\theta}_N=\frac{1}{N}\sum e^{-U_i^2}\) 估计;由 SLLN,\(\hat{\theta}_N\to E[e^{-U^2}]=\int_0^1e^{-x^2}dx\) a.s.。方差:\(E[e^{-2U^2}]=\int_0^1e^{-2x^2}dx\approx0.5981\),而真值 \(\int_0^1e^{-x^2}dx=\frac{\sqrt{\pi}}{2}\operatorname{erf}(1)\approx0.7468\),故 \(\mathrm{Var}\approx0.5981-0.7468^2\approx0.0404\),单点标准差 \(\approx0.201\);\(N=10^4\) 时 \(\mathrm{sd}(\hat{\theta}_N)\approx0.002\),约 95% 的误差在 \(\pm0.004\) 内。

练习 8-4-2

概念辨析:(a) "若 \(X_n\to0\) 依概率,则几乎每条轨道最终必小于 0.01 并保持"——对吗?(b) 设各 \(X_n\) 独立,\(P(X_n=1)=1/n\),\(P(X_n=0)=1-1/n\):\(X_n\) 依概率收敛吗?几乎必然收敛吗?

答案与提示

(a) 错。那正是几乎必然收敛的表述;依概率收敛只保证 \(P(|X_n|>0.01)\to0\),允许偏离发生无穷多次,只要趋于稀疏。(b) 依概率收敛成立:\(P(|X_n|>\varepsilon)=1/n\to0\)。但几乎必然收敛不成立:\(\sum_n 1/n=\infty\) 且各事件独立,由 Borel–Cantelli 引理,\(X_n=1\) 将几乎必然发生无穷多次,轨道在 0 与 1 之间永远跳动,不收敛。

练习 8-4-3

用强大数定律说明:若总体分布函数 \(F\) 连续且严格递增,\(\xi_p\) 为其 \(p\) 分位数,则样本 \(p\) 分位数 \(\hat{\xi}_{p,n}\to\xi_p\) a.s.

答案与提示

经验分布函数(empirical distribution function) \(\hat{F}_n(x)=\frac{1}{n}\sum_{i=1}^n\mathbf{1}\{X_i\le x\}\)。对每个固定 \(x\),指示变量 iid 伯努利(\(F(x)\)),由 SLLN,\(\hat{F}_n(x)\to F(x)\) a.s.。取 \(x_1<\xi_p<x_2\) 使 \(F(x_1)<p<F(x_2)\):几乎必然地,从某个 \(n\) 起 \(\hat{F}_n(x_1)<p<\hat{F}_n(x_2)\),迫使 \(\hat{\xi}_{p,n}\in(x_1,x_2)\);再令 \(x_1\uparrow\xi_p\)、\(x_2\downarrow\xi_p\)(各取一列可数多个点,概率 1 的事件之交仍概率 1)即得 \(\hat{\xi}_{p,n}\to\xi_p\) a.s.。

练习 8-4-4

样本量设计:要以约 95% 的把握把 \(\pi\) 估计到 \(\pm0.01\) 之内,至少需要多少个随机点?

答案与提示

由 CLT 近似,要求 \(2\,\mathrm{sd}(\hat{\pi}_N)\le0.01\),即 \(\mathrm{sd}(\hat{\pi}_N)\le0.005\)。由例 2,\(\mathrm{sd}(\hat{\pi}_N)=4\sqrt{p(1-p)/N}\le4\sqrt{0.21/N}\),故需 \(\sqrt{0.21/N}\le0.00125\),即 \(N\ge0.21/(0.00125)^2=134\,400\),约 \(1.35\times10^5\) 个点。(若按真值 \(p(1-p)=0.1685\) 计,\(N\ge1.08\times10^5\)。)注意精度只按 \(\sqrt{N}\) 改善:再要提一位小数,点数需再乘 100。