第 8 章 · 极限定理

8.1 引言

Introduction
学习目标
  • 说明极限定理要解决的问题——单次试验不可预测而大量重复呈现稳定性,并解释概率的频率解释为何必须以大数定律为理论根基;
  • 区分两类极限定理的分工:大数定律刻画样本均值(频率)"收敛到哪里",中心极限定理刻画独立和"以什么形状波动";
  • 应用方差的可加性导出 \(\mathrm{Var}(\bar X_n)=\sigma^2/n\),并用尺度 \(\sigma/\sqrt n\) 估计均值与频率的典型波动;
  • 初步辨析依概率收敛与几乎必然收敛的强弱差别,说出模拟(蒙特卡洛)方法的合法性来源;
  • 按顺序说出本章路线:切比雪夫不等式 → 弱大数定律 → 中心极限定理 → 强大数定律 → 其他不等式。

1. 从一次抛掷到一万次:为什么需要极限定理

2.1 节曾留下一句承诺:频率解释 \(P(E)=\lim_{n\to\infty}n(E)/n\) 的严格含义,要等到大数定律才能阐明。从本节起,我们兑现这个承诺。先回到最原始的经验事实:抛一枚硬币,下一次是正是反,谁也无法预先断言;然而把同一枚硬币抛成千上万次,正面出现的比率却几乎总是接近 \(1/2\)。个别结果不可预言、整体呈现稳定的比率,这就是第 2 章所说的统计规律性(statistical regularity)。全书此前建立的公理与计算,描述的是"单次试验"的概率结构;而要把"大量重复下的稳定性"变成可以证明的命题,需要一类以 \(n\to\infty\) 的极限行为为对象的定理——统称极限定理(limit theorems)。本章是全书最后一章,主题正是它们。

要把"大量重复"数学化,需要一个贯穿全章的记号。设想在完全相同的条件下重复一项试验,把每次试验关心的数量记录为一个随机变量,就得到一列相互独立、同分布的随机变量 \(X_1,X_2,\ldots\),称为独立同分布(independent and identically distributed, i.i.d.)序列(独立性的含义见第 3、6 章)。我们最关心的统计量是它们的算术平均。

定义 1 样本均值

设 \(X_1,X_2,\ldots,X_n\) 独立同分布,称 \[ \bar X_n=\frac{X_1+X_2+\cdots+X_n}{n} \] 为前 \(n\) 次观测的样本均值(sample mean)。

一个关键观察:若 \(X_i\) 是第 \(i\) 次试验中事件 \(E\) 的示性随机变量(indicator random variable)——\(E\) 发生时取 \(1\)、否则取 \(0\)——则 \(X_1,\ldots,X_n\) 独立同分布于 \(\mathrm{Bernoulli}(p)\),且 \(\bar X_n=n(E)/n=f_n(E)\) 恰是 \(E\) 的频率,期望为 \(p\)。于是"频率稳定于概率"只是"样本均值稳定于期望"的特例:极限定理把两类稳定性统一处理。

例 1 抛硬币频率的假想轨迹

将一枚均匀硬币分三组各抛 \(n=10\)、\(100\)、\(10000\) 次,正面出现的频率依次为 \(0.6\)、\(0.52\)、\(0.5008\)(假想的模拟数据)。求各组的正面次数与频率对 \(0.5\) 的偏差,并描述随 \(n\) 增大呈现的规律。

正面次数分别为 \(10\times 0.6=6\)、\(100\times 0.52=52\)、\(10000\times 0.5008=5008\);频率与 \(0.5\) 的偏差 \[ |f_{10}-0.5|=0.1000,\qquad |f_{100}-0.5|=0.0200,\qquad |f_{10000}-0.5|=0.0008 \] (见表 1)。\(n\) 从 \(10\) 增到 \(10000\)(扩大 \(1000\) 倍),偏差从 \(0.1000\) 缩到 \(0.0008\)(缩小 \(125\) 倍):频率随着试验次数的增加向 \(0.5\) 收敛并稳定下来。但要注意,目前这还只是数据印象——它是不是必然的规律、又在何种数学含义下成立,正是本章要证明的内容。
表 1:抛硬币试验的频率数据(例 1,假想模拟值)
抛掷次数 \(n\)正面次数 \(n(E)\)频率 \(f_n(E)\)偏差 \(|f_n-0.5|\)
1060.60000.1000
100520.52000.0200
1000050080.50080.0008

为什么必须把这一印象变成定理?因为频率解释本身站立不住。其一,任何实际的试验序列都是有限次的,"极限值"永远无法被直接观察到;其二,若把"频率会趋于稳定"仅仅当作经验归纳,就无法回答"凭什么下一段实验也稳定""凭什么不同的人做实验会稳定到同一个数";其三,用频率定义概率、又用概率(独立、同分布)去描述产生频率的试验,隐含循环论证的危险。大数定律的作用,是在公理体系内部、仅从"独立同分布 + 期望存在"这样的前提出发,演绎地证明频率(以及一般的样本均值)确实收敛。频率解释由此从一条信念变成一个定理,第 2 章搭建的公理世界与经验世界自此接通。

2. 两大类极限定理:均值去哪里,和以什么形状波动

极限定理按所回答的问题分成两大族。第一族问题:\(\bar X_n\) 收敛到哪里大数定律(law of large numbers, LLN)断言:只要期望存在,样本均值收敛于期望 \(\mu\),从而频率收敛于概率 \(p\)。它刻画的是"信号"——平均值的位置。第二族问题:样本均值(或独立和 \(X_1+\cdots+X_n\))围绕极限如何波动、波动的分布是什么形状中心极限定理(central limit theorem, CLT)断言:把独立和标准化之后,其分布趋于标准正态分布——而且不论 \(X_i\) 原来服从什么分布。它刻画的是"噪声"——波动的形状。一条定量的线索先把两者的舞台搭好。

定理 1 独立和与样本均值的期望、方差

设 \(X_1,\ldots,X_n\) 相互独立,\(E[X_i]=\mu\),\(\mathrm{Var}(X_i)=\sigma^2<\infty\)。则 \[ E[X_1+\cdots+X_n]=n\mu,\qquad \mathrm{Var}(X_1+\cdots+X_n)=n\sigma^2, \] 从而样本均值满足 \[ E[\bar X_n]=\mu,\qquad \mathrm{Var}(\bar X_n)=\frac{\sigma^2}{n},\qquad \mathrm{sd}(\bar X_n)=\frac{\sigma}{\sqrt n}. \]

证明期望部分由期望的线性性(第 7 章)立得:\(E[X_1+\cdots+X_n]=\sum_{i=1}^n E[X_i]=n\mu\)。方差部分:将和的方差展开为各方差与两两协方差之和,而独立性使一切协方差为 \(0\)(第 7 章),故 \(\mathrm{Var}(X_1+\cdots+X_n)=\sum_{i=1}^n \mathrm{Var}(X_i)=n\sigma^2\)。最后,\(\bar X_n=\frac{1}{n}(X_1+\cdots+X_n)\),由 \(\mathrm{Var}(cY)=c^2\mathrm{Var}(Y)\) 得 \(\mathrm{Var}(\bar X_n)=\frac{1}{n^2}\cdot n\sigma^2=\frac{\sigma^2}{n}\),开方即得标准差。∎

\(\sigma/\sqrt n\) 这个量值得反复咀嚼:样本量增至 \(100\) 倍,精度只提高 \(10\) 倍——统计学中著名的平方根律(square-root law)。它说明均值型的统计量"天然会稳定",并预告了频率偏离的典型幅度(例 2)。至于"任给 \(\varepsilon>0\),偏差超过 \(\varepsilon\) 的概率随 \(n\) 趋于 \(0\)"(弱大数定律,8.2 节)与"标准化偏差的分布趋于正态"(中心极限定理,8.3 节),则是本章的主菜;三大定理之间的逻辑关系见图 1。

例 2 频率偏离的典型幅度

沿用例 1 的硬币模型:\(X_i\sim\mathrm{Bernoulli}(0.5)\),频率即 \(\bar X_n\)。由定理 1,\(\mathrm{sd}(f_n)=\sqrt{p(1-p)/n}=0.5/\sqrt n\)。对 \(n=10\)、\(100\)、\(10000\) 计算这一典型波动尺度,与例 1 观察到的偏差比较,并说明规律。

依次计算 \(0.5/\sqrt{10}\approx 0.158\),\(0.5/\sqrt{100}=0.050\),\(0.5/\sqrt{10000}=0.0050\)。例 1 的观察偏差为 \(0.100\)、\(0.020\)、\(0.0008\),与典型尺度之比约为 \(0.63\)、\(0.40\)、\(0.16\)——都在一倍标准差之内,属"正常波动"而非运气异常。更重要的规律是衰减速度:\(n\) 扩大 \(1000\) 倍时,典型尺度恰好缩小约 \(\sqrt{1000}\approx 31.6\) 倍(\(0.158\to 0.0050\)),观察偏差的下滑与 \(1/\sqrt n\) 同步。可见仅凭第 7 章的方差运算,就能解释"越抛越稳"的幅度;而"标准化偏差服从什么分布",则留给中心极限定理回答。
极限定理的三条主线 独立同分布样本 X₁, X₂, …, Xₙ E[Xᵢ] = μ, Var(Xᵢ) = σ² 切比雪夫不等式 P{|X−μ| ≥ ε} ≤ σ²/ε² 只用期望与方差(8.2 节) 弱大数定律 WLLN 均值 → μ(依概率) 均值与频率稳定(8.2 节) 中心极限定理 CLT 标准化和 → N(0, 1) 分布形状趋于正态 不论原始分布(8.3 节) 强大数定律 SLLN 均值 → μ(几乎必然) 频率解释的严格根基(8.4 节) 代入样本均值 令 n → ∞ 标准化独立和 整条样本轨道 蕴含 大数定律回答"均值去哪里";中心极限定理回答"以什么形状波动"
图 1:极限定理的三条主线。切比雪夫不等式(8.2 节,只用期望与方差的尾概率界)施于样本均值、令 \(n\to\infty\),即得弱大数定律;把独立和标准化并研究其分布的极限,得到中心极限定理(8.3 节);强大数定律(8.4 节)以更强的收敛方式给出更强的结论,并蕴含弱大数定律(虚线)。

3. 收敛有多稳:两种方式的预告与模拟的合法性

"\(\bar X_n\) 收敛于 \(\mu\)"这句话,其实有强弱不同的两种讲法:弱的说法只对"大偏差的概率"发问,强的说法对每一条样本轨道发问。它们的正式定义分别见于 8.2 节与 8.4 节,这里先作非正式的预告。

定义 2 两种收敛方式(非正式预告)

设 \(X_1,X_2,\ldots\) 为随机变量序列,\(\mu\) 为常数。(a) 称 \(X_n\) 依概率收敛(convergence in probability)于 \(\mu\),若对任意 \(\varepsilon>0\), \[ P\{|X_n-\mu|>\varepsilon\}\to 0\qquad (n\to\infty); \] 它只要求"大偏差"的概率越来越小,容许零星的反弹偶尔出现。(b) 称 \(X_n\) 几乎必然收敛(convergence almost surely)于 \(\mu\),若 \[ P\{\lim_{n\to\infty}X_n=\mu\}=1, \] 即除去一个概率为 \(0\) 的例外集,每条样本轨道 \(X_n(\omega)\) 作为普通数列都收敛于 \(\mu\),偏差"最终不再发生"。

可以证明:几乎必然收敛蕴含依概率收敛(强 ⇒ 弱),反之不成立。弱大数定律采用 (a),强大数定律采用 (b)——这正是"弱""强"二字的由来。图 2 的频率轨迹直观展示了"越来越稳"的过程。

抛硬币正面频率的轨迹:围绕 0.5 越收越紧 圆点为例 1 数据:n = 10, 100, 10000 对应 0.6, 0.52, 0.5008 正面频率 1.0 0.75 0.5 0.25 0 1 10 100 1000 10000 抛掷次数 n(对数刻度) 波动带按 1/√n 收缩 频率轨迹 波动带 0.5 ± 0.5/√n 真值 p = 0.5
图 2:抛硬币正面频率的模拟轨迹(纵轴为正面频率,横轴取对数刻度)。前若干次大起大落,随后被 \(0.5\pm 0.5/\sqrt n\) 的波动带(金色虚线)越来越紧地"夹住":偏离的典型尺度按 \(1/\sqrt n\) 缩小,正是定理 1 与例 2 所预言的。三个圆点是例 1 的数据(\(n=10\)、\(100\)、\(10000\))。

本节最后一个问题:计算机里跑的随机模拟,凭什么可信?现代统计与计算中广泛使用的蒙特卡洛方法(Monte Carlo method)——用大量随机样本的平均去估计概率、期望或积分——其合法性完全来自大数定律:估计量恰是被估计量的样本均值,定理保证它收敛到真值;而误差的量级(\(1/\sqrt n\) 速率)与误差分布的形状,则由中心极限定理给出。换言之,模拟不是碰运气的把戏,而是把极限定理当作引擎的算法。8.4 节将给出用蒙特卡洛方法估计 \(\pi\) 的完整例子,这里先用一个积分问题感受它的逻辑。

例 3 用模拟估计积分

为估计 \(\int_0^1 x^2\,dx\),生成 \(n\) 个独立同分布的随机数 \(U_1,\ldots,U_n\sim U(0,1)\),以 \(\bar Y_n=\frac{1}{n}(U_1^2+\cdots+U_n^2)\) 作为估计。(a) 该方法估计的目标是什么值?(b) \(n=10000\) 时估计的典型误差约多大?

(a) \(E[U^2]=\int_0^1 x^2\,dx=\frac{1}{3}\):模拟均值是积分值的无偏估计;由大数定律,\(\bar Y_n\to\frac13\)。(b) 波动尺度由定理 1 给出:\(\mathrm{Var}(U^2)=E[U^4]-(E[U^2])^2=\frac{1}{5}-\frac{1}{9}=\frac{4}{45}\),故 \[ \mathrm{sd}(\bar Y_n)=\sqrt{\frac{4/45}{n}}=\frac{0.298}{\sqrt n},\qquad n=10^4 \;\Rightarrow\; \mathrm{sd}\approx 0.0030, \] 即估计值典型地落在 \(0.3333\pm 0.003\) 之内。误差按 \(1/\sqrt n\) 缩小的速率及其近似正态的分布形状,将由 CLT 进一步刻画(8.3、8.4 节)。"随机地算"之所以合法,是因为背后站着确定性的定理。
注记 伯努利的"黄金定理"与蒙特卡洛的赌桌

历史上第一个极限定理由雅各布·伯努利(Jacob Bernoulli)在《猜度术》(Ars Conjectandi, 1713, 身后出版)中给出——抛硬币情形的大数定律,他为之酝酿了约二十年,并自称为"黄金定理"。1733 年棣莫弗(de Moivre)在同一情形得到正态近似,一个多世纪后由拉普拉斯(Laplace)推广,是为中心极限定理的源头;1909 年波莱尔(Borel)证明了抛硬币情形的强大数定律,一般形式由柯尔莫哥洛夫(Kolmogorov, 1933)完成。"蒙特卡洛"之名则来自二战时期乌拉姆(Ulam)与冯·诺依曼(von Neumann)以随机模拟计算核反应的方法,因摩纳哥的赌场而得名——以赌桌命名的技术,恰恰以"赌桌长期必败/必胜"的数学定理为根基。

4. 全书的收束与本章路线

作为全书最后一章的开篇,值得把来路清点一遍:极限定理要用到的每一件工具,都出自前面的章节。

  • 第 1 章的组合计数,服务于等可能模型的精确概率计算;
  • 第 2 章建立公理:频率的非负、规范、可加三条性质正是公理的原型(2.1 节),而本章的定理把"频率趋于概率"从经验归纳变成演绎结论——公理体系与经验世界自此闭环;
  • 第 3 章的条件概率与独立性,提供了极限定理的前提"独立同分布";
  • 第 4、5 章的随机变量、期望与方差,正是定理陈述中的 \(\mu\) 与 \(\sigma^2\);
  • 第 6 章的联合分布与独立性(独立 ⇒ 协方差为 0),是定理 1 证明的关键一步;
  • 第 7 章的期望运算性质(含 7.8 节期望的一般定义),是本章每个证明的日常工具。

本章自身的路线则一步一个定理:先用只依赖期望与方差的切比雪夫不等式(Chebyshev's inequality)控制尾概率,配上定理 1 的 \(\sigma^2/n\) 立刻得到弱大数定律(8.2 节);再让标准化独立和的分布走向正态(8.3 节);然后换用几乎必然收敛,得到结论更强的强大数定律,并把频率解释与蒙特卡洛方法落到实处(8.4 节);最后收拢一批现代应用广泛的不等式(8.5 节),作为通向高等概率论、统计学习与机器学习的门口。全书从赌桌上的计数问题出发,至此抵达概率论的第一批高峰。

5. 本节小结

要点回顾
  • 单次试验不可预测,大量重复却呈现稳定性;极限定理把这种统计规律性从经验事实提升为公理体系内的定理,也为频率解释提供理论根基。
  • 两大类定理分工:大数定律——样本均值(频率)收敛于期望(概率),回答"去哪里";中心极限定理——标准化独立和的分布趋于标准正态,回答"以什么形状波动"。
  • \(E[\bar X_n]=\mu\),\(\mathrm{Var}(\bar X_n)=\sigma^2/n\):典型波动按 \(\sigma/\sqrt n\) 收缩(平方根律)。
  • 收敛方式有强弱:依概率收敛(只保证大偏差的概率趋于 0)弱于几乎必然收敛(每条轨道最终收敛);强蕴含弱。
  • 模拟/蒙特卡洛方法的合法性来自大数定律,误差量级与分布来自中心极限定理。
  • 本章路线:切比雪夫不等式 → 弱大数定律 → 中心极限定理 → 强大数定律 → 其他不等式。

练习

练习 8-1-1

概率的频率解释把 \(P(E)\) 定义为频率 \(f_n(E)\) 的极限。如果没有大数定律,这一定义面临哪些困难?大数定律如何化解?它为什么不构成循环论证?

答案与提示

困难有三:(1) 实际试验只能有限次,极限值无法直接观察;(2) "频率会稳定"若只是经验归纳,便无法保证另一批样本、另一位实验者稳定到同一个数值;(3) 用频率定义概率、又用概率(独立、同分布)描述产生频率的试验,有循环之嫌。化解:大数定律以柯氏公理为出发点,仅由"独立同分布 + 期望存在"演绎地证明频率(依概率、甚至几乎必然)收敛于 \(p\),"稳定"由经验公设变为定理。不循环的原因:公理体系本身不依赖频率解释(它同样服务古典解释与主观解释),频率解释只是公理的一个模型,大数定律在该模型中兑现了承诺。

练习 8-1-2

掷一枚均匀骰子 \(n\) 次,以样本均值 \(\bar X_n\) 估计平均点数。已知单次方差 \(\sigma^2=35/12\)。(a) 求 \(n=3600\) 时 \(\bar X_n\) 的典型波动尺度;(b) 若要典型波动不超过 \(0.01\),\(n\) 至少约需多少?

答案与提示

由定理 1,\(\mathrm{sd}(\bar X_n)=\sigma/\sqrt n=\sqrt{35/12}/\sqrt n\approx 1.708/\sqrt n\)。(a) \(n=3600\) 时 \(\sqrt n=60\),典型波动约 \(1.708/60\approx 0.028\),即典型地落在 \(3.5\pm 0.028\) 内。(b) 令 \(1.708/\sqrt n\le 0.01\),得 \(n\ge (170.8)^2\approx 2.9\times 10^4\),即约二万九千次。注意:精度提高 10 倍,样本量要增加 100 倍——平方根律的代价。

练习 8-1-3

为什么对赌场和保险公司来说"短期靠运气,长期靠定理"?请用本章预告的两大定律说明。

答案与提示

单局赌戏、单张保单的结果固然随机,但赌场规则与保费定价使每局的期望收益对庄家一方微正。由大数定律,大量独立局之后,平均收益收敛于期望收益,且相对波动按 \(1/\sqrt n\) 缩小;由强大数定律(8.4 节),这一收敛几乎必然成立——只要业务量足够大、单笔风险有界,长期结果近乎确定。保险公司同理:用大数定律把个体的不确定性转化为总体的可计算性,这正是"长期赌徒必输"的数学版本。