- 说明极限定理要解决的问题——单次试验不可预测而大量重复呈现稳定性,并解释概率的频率解释为何必须以大数定律为理论根基;
- 区分两类极限定理的分工:大数定律刻画样本均值(频率)"收敛到哪里",中心极限定理刻画独立和"以什么形状波动";
- 应用方差的可加性导出 \(\mathrm{Var}(\bar X_n)=\sigma^2/n\),并用尺度 \(\sigma/\sqrt n\) 估计均值与频率的典型波动;
- 初步辨析依概率收敛与几乎必然收敛的强弱差别,说出模拟(蒙特卡洛)方法的合法性来源;
- 按顺序说出本章路线:切比雪夫不等式 → 弱大数定律 → 中心极限定理 → 强大数定律 → 其他不等式。
1. 从一次抛掷到一万次:为什么需要极限定理
2.1 节曾留下一句承诺:频率解释 \(P(E)=\lim_{n\to\infty}n(E)/n\) 的严格含义,要等到大数定律才能阐明。从本节起,我们兑现这个承诺。先回到最原始的经验事实:抛一枚硬币,下一次是正是反,谁也无法预先断言;然而把同一枚硬币抛成千上万次,正面出现的比率却几乎总是接近 \(1/2\)。个别结果不可预言、整体呈现稳定的比率,这就是第 2 章所说的统计规律性(statistical regularity)。全书此前建立的公理与计算,描述的是"单次试验"的概率结构;而要把"大量重复下的稳定性"变成可以证明的命题,需要一类以 \(n\to\infty\) 的极限行为为对象的定理——统称极限定理(limit theorems)。本章是全书最后一章,主题正是它们。
要把"大量重复"数学化,需要一个贯穿全章的记号。设想在完全相同的条件下重复一项试验,把每次试验关心的数量记录为一个随机变量,就得到一列相互独立、同分布的随机变量 \(X_1,X_2,\ldots\),称为独立同分布(independent and identically distributed, i.i.d.)序列(独立性的含义见第 3、6 章)。我们最关心的统计量是它们的算术平均。
设 \(X_1,X_2,\ldots,X_n\) 独立同分布,称 \[ \bar X_n=\frac{X_1+X_2+\cdots+X_n}{n} \] 为前 \(n\) 次观测的样本均值(sample mean)。
一个关键观察:若 \(X_i\) 是第 \(i\) 次试验中事件 \(E\) 的示性随机变量(indicator random variable)——\(E\) 发生时取 \(1\)、否则取 \(0\)——则 \(X_1,\ldots,X_n\) 独立同分布于 \(\mathrm{Bernoulli}(p)\),且 \(\bar X_n=n(E)/n=f_n(E)\) 恰是 \(E\) 的频率,期望为 \(p\)。于是"频率稳定于概率"只是"样本均值稳定于期望"的特例:极限定理把两类稳定性统一处理。
将一枚均匀硬币分三组各抛 \(n=10\)、\(100\)、\(10000\) 次,正面出现的频率依次为 \(0.6\)、\(0.52\)、\(0.5008\)(假想的模拟数据)。求各组的正面次数与频率对 \(0.5\) 的偏差,并描述随 \(n\) 增大呈现的规律。
| 抛掷次数 \(n\) | 正面次数 \(n(E)\) | 频率 \(f_n(E)\) | 偏差 \(|f_n-0.5|\) |
|---|---|---|---|
| 10 | 6 | 0.6000 | 0.1000 |
| 100 | 52 | 0.5200 | 0.0200 |
| 10000 | 5008 | 0.5008 | 0.0008 |
为什么必须把这一印象变成定理?因为频率解释本身站立不住。其一,任何实际的试验序列都是有限次的,"极限值"永远无法被直接观察到;其二,若把"频率会趋于稳定"仅仅当作经验归纳,就无法回答"凭什么下一段实验也稳定""凭什么不同的人做实验会稳定到同一个数";其三,用频率定义概率、又用概率(独立、同分布)去描述产生频率的试验,隐含循环论证的危险。大数定律的作用,是在公理体系内部、仅从"独立同分布 + 期望存在"这样的前提出发,演绎地证明频率(以及一般的样本均值)确实收敛。频率解释由此从一条信念变成一个定理,第 2 章搭建的公理世界与经验世界自此接通。
2. 两大类极限定理:均值去哪里,和以什么形状波动
极限定理按所回答的问题分成两大族。第一族问题:\(\bar X_n\) 收敛到哪里?大数定律(law of large numbers, LLN)断言:只要期望存在,样本均值收敛于期望 \(\mu\),从而频率收敛于概率 \(p\)。它刻画的是"信号"——平均值的位置。第二族问题:样本均值(或独立和 \(X_1+\cdots+X_n\))围绕极限如何波动、波动的分布是什么形状?中心极限定理(central limit theorem, CLT)断言:把独立和标准化之后,其分布趋于标准正态分布——而且不论 \(X_i\) 原来服从什么分布。它刻画的是"噪声"——波动的形状。一条定量的线索先把两者的舞台搭好。
设 \(X_1,\ldots,X_n\) 相互独立,\(E[X_i]=\mu\),\(\mathrm{Var}(X_i)=\sigma^2<\infty\)。则 \[ E[X_1+\cdots+X_n]=n\mu,\qquad \mathrm{Var}(X_1+\cdots+X_n)=n\sigma^2, \] 从而样本均值满足 \[ E[\bar X_n]=\mu,\qquad \mathrm{Var}(\bar X_n)=\frac{\sigma^2}{n},\qquad \mathrm{sd}(\bar X_n)=\frac{\sigma}{\sqrt n}. \]
\(\sigma/\sqrt n\) 这个量值得反复咀嚼:样本量增至 \(100\) 倍,精度只提高 \(10\) 倍——统计学中著名的平方根律(square-root law)。它说明均值型的统计量"天然会稳定",并预告了频率偏离的典型幅度(例 2)。至于"任给 \(\varepsilon>0\),偏差超过 \(\varepsilon\) 的概率随 \(n\) 趋于 \(0\)"(弱大数定律,8.2 节)与"标准化偏差的分布趋于正态"(中心极限定理,8.3 节),则是本章的主菜;三大定理之间的逻辑关系见图 1。
沿用例 1 的硬币模型:\(X_i\sim\mathrm{Bernoulli}(0.5)\),频率即 \(\bar X_n\)。由定理 1,\(\mathrm{sd}(f_n)=\sqrt{p(1-p)/n}=0.5/\sqrt n\)。对 \(n=10\)、\(100\)、\(10000\) 计算这一典型波动尺度,与例 1 观察到的偏差比较,并说明规律。
3. 收敛有多稳:两种方式的预告与模拟的合法性
"\(\bar X_n\) 收敛于 \(\mu\)"这句话,其实有强弱不同的两种讲法:弱的说法只对"大偏差的概率"发问,强的说法对每一条样本轨道发问。它们的正式定义分别见于 8.2 节与 8.4 节,这里先作非正式的预告。
设 \(X_1,X_2,\ldots\) 为随机变量序列,\(\mu\) 为常数。(a) 称 \(X_n\) 依概率收敛(convergence in probability)于 \(\mu\),若对任意 \(\varepsilon>0\), \[ P\{|X_n-\mu|>\varepsilon\}\to 0\qquad (n\to\infty); \] 它只要求"大偏差"的概率越来越小,容许零星的反弹偶尔出现。(b) 称 \(X_n\) 几乎必然收敛(convergence almost surely)于 \(\mu\),若 \[ P\{\lim_{n\to\infty}X_n=\mu\}=1, \] 即除去一个概率为 \(0\) 的例外集,每条样本轨道 \(X_n(\omega)\) 作为普通数列都收敛于 \(\mu\),偏差"最终不再发生"。
可以证明:几乎必然收敛蕴含依概率收敛(强 ⇒ 弱),反之不成立。弱大数定律采用 (a),强大数定律采用 (b)——这正是"弱""强"二字的由来。图 2 的频率轨迹直观展示了"越来越稳"的过程。
本节最后一个问题:计算机里跑的随机模拟,凭什么可信?现代统计与计算中广泛使用的蒙特卡洛方法(Monte Carlo method)——用大量随机样本的平均去估计概率、期望或积分——其合法性完全来自大数定律:估计量恰是被估计量的样本均值,定理保证它收敛到真值;而误差的量级(\(1/\sqrt n\) 速率)与误差分布的形状,则由中心极限定理给出。换言之,模拟不是碰运气的把戏,而是把极限定理当作引擎的算法。8.4 节将给出用蒙特卡洛方法估计 \(\pi\) 的完整例子,这里先用一个积分问题感受它的逻辑。
为估计 \(\int_0^1 x^2\,dx\),生成 \(n\) 个独立同分布的随机数 \(U_1,\ldots,U_n\sim U(0,1)\),以 \(\bar Y_n=\frac{1}{n}(U_1^2+\cdots+U_n^2)\) 作为估计。(a) 该方法估计的目标是什么值?(b) \(n=10000\) 时估计的典型误差约多大?
历史上第一个极限定理由雅各布·伯努利(Jacob Bernoulli)在《猜度术》(Ars Conjectandi, 1713, 身后出版)中给出——抛硬币情形的大数定律,他为之酝酿了约二十年,并自称为"黄金定理"。1733 年棣莫弗(de Moivre)在同一情形得到正态近似,一个多世纪后由拉普拉斯(Laplace)推广,是为中心极限定理的源头;1909 年波莱尔(Borel)证明了抛硬币情形的强大数定律,一般形式由柯尔莫哥洛夫(Kolmogorov, 1933)完成。"蒙特卡洛"之名则来自二战时期乌拉姆(Ulam)与冯·诺依曼(von Neumann)以随机模拟计算核反应的方法,因摩纳哥的赌场而得名——以赌桌命名的技术,恰恰以"赌桌长期必败/必胜"的数学定理为根基。
4. 全书的收束与本章路线
作为全书最后一章的开篇,值得把来路清点一遍:极限定理要用到的每一件工具,都出自前面的章节。
- 第 1 章的组合计数,服务于等可能模型的精确概率计算;
- 第 2 章建立公理:频率的非负、规范、可加三条性质正是公理的原型(2.1 节),而本章的定理把"频率趋于概率"从经验归纳变成演绎结论——公理体系与经验世界自此闭环;
- 第 3 章的条件概率与独立性,提供了极限定理的前提"独立同分布";
- 第 4、5 章的随机变量、期望与方差,正是定理陈述中的 \(\mu\) 与 \(\sigma^2\);
- 第 6 章的联合分布与独立性(独立 ⇒ 协方差为 0),是定理 1 证明的关键一步;
- 第 7 章的期望运算性质(含 7.8 节期望的一般定义),是本章每个证明的日常工具。
本章自身的路线则一步一个定理:先用只依赖期望与方差的切比雪夫不等式(Chebyshev's inequality)控制尾概率,配上定理 1 的 \(\sigma^2/n\) 立刻得到弱大数定律(8.2 节);再让标准化独立和的分布走向正态(8.3 节);然后换用几乎必然收敛,得到结论更强的强大数定律,并把频率解释与蒙特卡洛方法落到实处(8.4 节);最后收拢一批现代应用广泛的不等式(8.5 节),作为通向高等概率论、统计学习与机器学习的门口。全书从赌桌上的计数问题出发,至此抵达概率论的第一批高峰。
5. 本节小结
- 单次试验不可预测,大量重复却呈现稳定性;极限定理把这种统计规律性从经验事实提升为公理体系内的定理,也为频率解释提供理论根基。
- 两大类定理分工:大数定律——样本均值(频率)收敛于期望(概率),回答"去哪里";中心极限定理——标准化独立和的分布趋于标准正态,回答"以什么形状波动"。
- \(E[\bar X_n]=\mu\),\(\mathrm{Var}(\bar X_n)=\sigma^2/n\):典型波动按 \(\sigma/\sqrt n\) 收缩(平方根律)。
- 收敛方式有强弱:依概率收敛(只保证大偏差的概率趋于 0)弱于几乎必然收敛(每条轨道最终收敛);强蕴含弱。
- 模拟/蒙特卡洛方法的合法性来自大数定律,误差量级与分布来自中心极限定理。
- 本章路线:切比雪夫不等式 → 弱大数定律 → 中心极限定理 → 强大数定律 → 其他不等式。
练习
练习 8-1-1
概率的频率解释把 \(P(E)\) 定义为频率 \(f_n(E)\) 的极限。如果没有大数定律,这一定义面临哪些困难?大数定律如何化解?它为什么不构成循环论证?
答案与提示困难有三:(1) 实际试验只能有限次,极限值无法直接观察;(2) "频率会稳定"若只是经验归纳,便无法保证另一批样本、另一位实验者稳定到同一个数值;(3) 用频率定义概率、又用概率(独立、同分布)描述产生频率的试验,有循环之嫌。化解:大数定律以柯氏公理为出发点,仅由"独立同分布 + 期望存在"演绎地证明频率(依概率、甚至几乎必然)收敛于 \(p\),"稳定"由经验公设变为定理。不循环的原因:公理体系本身不依赖频率解释(它同样服务古典解释与主观解释),频率解释只是公理的一个模型,大数定律在该模型中兑现了承诺。
练习 8-1-2
掷一枚均匀骰子 \(n\) 次,以样本均值 \(\bar X_n\) 估计平均点数。已知单次方差 \(\sigma^2=35/12\)。(a) 求 \(n=3600\) 时 \(\bar X_n\) 的典型波动尺度;(b) 若要典型波动不超过 \(0.01\),\(n\) 至少约需多少?
答案与提示由定理 1,\(\mathrm{sd}(\bar X_n)=\sigma/\sqrt n=\sqrt{35/12}/\sqrt n\approx 1.708/\sqrt n\)。(a) \(n=3600\) 时 \(\sqrt n=60\),典型波动约 \(1.708/60\approx 0.028\),即典型地落在 \(3.5\pm 0.028\) 内。(b) 令 \(1.708/\sqrt n\le 0.01\),得 \(n\ge (170.8)^2\approx 2.9\times 10^4\),即约二万九千次。注意:精度提高 10 倍,样本量要增加 100 倍——平方根律的代价。
练习 8-1-3
为什么对赌场和保险公司来说"短期靠运气,长期靠定理"?请用本章预告的两大定律说明。
答案与提示单局赌戏、单张保单的结果固然随机,但赌场规则与保费定价使每局的期望收益对庄家一方微正。由大数定律,大量独立局之后,平均收益收敛于期望收益,且相对波动按 \(1/\sqrt n\) 缩小;由强大数定律(8.4 节),这一收敛几乎必然成立——只要业务量足够大、单笔风险有界,长期结果近乎确定。保险公司同理:用大数定律把个体的不确定性转化为总体的可计算性,这正是"长期赌徒必输"的数学版本。