第 8 章 · 极限定理

8.2 切比雪夫不等式与弱大数定律

Chebyshev's Inequality and the Weak Law of Large Numbers
学习目标
  • 写出切比雪夫不等式的两种等价形式,并对离散型与连续型随机变量分别完成证明;
  • 说明该界"只用期望与方差、对一切分布成立,因而必然宽松"的特点,并与正态分布的实际尾概率作数值对比;
  • 陈述依概率收敛的定义,并解释它与普通数列收敛的区别;
  • 用切比雪夫不等式证明弱大数定律,掌握关键计算 \(\mathrm{Var}(\bar X_n)=\sigma^2/n\);
  • 能运用不等式完成"精度—样本量"设计(\(n\ge\sigma^2/(\delta\varepsilon^2)\)),并估计频率稳定性的概率界。

1. 切比雪夫不等式

8.1 节提出的问题——"为什么大量重复观察的平均值会稳定在期望附近"——需要一个只凭少量信息就能奏效的工具。切比雪夫不等式(Chebyshev's inequality)正是这样的结果:它仅仅利用期望 \(\mu=E[X]\) 与方差 \(\sigma^2=\mathrm{Var}(X)\) 这两个数字,就对 \(X\) 偏离 \(\mu\) 超过任意给定量的概率给出上界,而且对任何分布一律成立。它是本节证明弱大数定律的引擎,也是 8.5 节一系列更精细不等式的原型。

定理 1 切比雪夫不等式

设随机变量 \(X\) 的期望 \(E[X]=\mu\) 与方差 \(\mathrm{Var}(X)=\sigma^2\) 均有限,则对任意 \(\varepsilon>0\),

\[ P\{|X-\mu|\ge\varepsilon\}\le\frac{\sigma^2}{\varepsilon^2},\qquad\text{等价地}\qquad P\{|X-\mu|<\varepsilon\}\ge 1-\frac{\sigma^2}{\varepsilon^2}. \]

特别地,取 \(\varepsilon=k\sigma\;(k>0)\),得到以标准差为尺度的形式:

\[ P\{|X-\mu|\ge k\sigma\}\le\frac{1}{k^2}. \]

证明思路:把方差写成正数 \((x-\mu)^2\) 的加权平均,只对满足 \(|x-\mu|\ge\varepsilon\) 的部分求和(或积分)。在这一范围内每项都满足 \((x-\mu)^2\ge\varepsilon^2\),于是"总平均"被 \(\varepsilon^2\) 乘以"坏事件的概率"所控制。这种"用期望控制尾部概率"的论证与马尔可夫不等式(Markov's inequality) \(P\{Y\ge a\}\le E[Y]/a\) 一脉相承(见 8.5 节)。

离散情形:设 \(X\) 的分布列为 \(p(x)=P\{X=x\}\)。由方差的定义与各项非负,

\[ \sigma^2=\sum_{x}(x-\mu)^2p(x)\;\ge\;\sum_{|x-\mu|\ge\varepsilon}(x-\mu)^2p(x)\;\ge\;\sum_{|x-\mu|\ge\varepsilon}\varepsilon^2\,p(x)=\varepsilon^2\,P\{|X-\mu|\ge\varepsilon\}. \]

第一步成立是因为舍去的项 \((x-\mu)^2p(x)\ge 0\)(只保留 \(|x-\mu|\ge\varepsilon\) 的 \(x\) 使和变小),第二步是因为在保留的范围内 \((x-\mu)^2\ge\varepsilon^2\)。两边同除以 \(\varepsilon^2\) 即得结论。

连续情形:设 \(X\) 的密度为 \(f(x)\),把求和换成积分,论证逐字相同:

\[ \sigma^2=\int_{-\infty}^{\infty}(x-\mu)^2f(x)\,dx\;\ge\;\int_{|x-\mu|\ge\varepsilon}(x-\mu)^2f(x)\,dx\;\ge\;\varepsilon^2\int_{|x-\mu|\ge\varepsilon}f(x)\,dx=\varepsilon^2\,P\{|X-\mu|\ge\varepsilon\}. \]

对既非离散也非连续的随机变量,可借助期望的抽象定义作同样的论证(7.8 节)。证毕。

请注意这个不等式没有对分布形状作任何假设:不知道分布列、密度,甚至不知道分布的类型,只要期望与方差存在,结论就成立。这份"普适性"正是它威力的来源,但天下没有免费的午餐——信息越少,界就只能越宽松。下一小节用正态分布来量化这份"宽松"。

2. 界有多宽松:与正态分布的对比

若 \(X\sim N(\mu,\sigma^2)\),则事件 \(\{|X-\mu|\ge k\sigma\}\) 等价于 \(\{|Z|\ge k\}\)(\(Z\) 为标准正态变量),概率可由正态表精确算出:\(k=1,2,3\) 时实际尾概率分别约为 \(0.317\)、\(0.0456\)、\(0.0027\)。而切比雪夫不等式给出的上界是 \(1\)、\(0.25\)、\(0.111\)。图 1 与表 1 把两者并排放在同一比例尺下:偏离 \(3\sigma\) 时,界比实际大约 \(41\) 倍。

0 0.25 0.50 0.75 1.00 概率 1.000 0.317 0.250 0.046 0.111 0.003 k = 1 k = 2 k = 3 偏离 1σ 偏离 2σ 偏离 3σ 切比雪夫上界 1/k² 正态分布实际尾概率
图 1:切比雪夫上界 \(1/k^2\) 与正态分布实际尾概率 \(P\{|Z|\ge k\}\) 的对比(同一比例尺)。\(k=2\) 时界给 \(0.25\),而正态实际只有 \(0.0456\);\(k=3\) 时两者相差约 \(41\) 倍。
表 1:切比雪夫界与正态实际尾概率
k(偏离幅度)切比雪夫上界 \(1/k^2\)正态实际 \(P\{|Z|\ge k\}\)界 / 实际
\(k=1\)1.0000.317约 3.2 倍
\(k=2\)0.2500.0456约 5.5 倍
\(k=3\)0.1110.0027约 41 倍

界为什么只能这么松?因为它必须"迁就"所有可能的分布。事实上这个界已经无法一致改进:取三点分布 \(P\{X=\pm k\sigma\}=1/(2k^2)\)、\(P\{X=0\}=1-1/k^2\)(\(k\ge1\)),容易验证 \(E[X]=0\)、\(\mathrm{Var}(X)=\sigma^2\),而 \(P\{|X-\mu|\ge k\sigma\}=1/k^2\) 恰好取到上界(\(k=1\) 时退化为两点分布 \(P\{X=\pm\sigma\}=1/2\),见练习 5)。换句话说,宽松是"对一切分布都成立"这一普适性的必然代价:一旦额外知道分布的形状(例如近似正态),就应改用 8.3 节的中心极限定理或 8.5 节的更精细不等式来获得接近实际的数值。

注记 两个常见误区

其一,切比雪夫界并不是说 \(X\) 的取值被限制在 \(\mu\pm k\sigma\) 之内——它只约束"大幅偏离的概率",\(X\) 仍可能取到很远的值,只是这种可能性受控。其二,该界对分布没有任何对称性、单峰性要求;\(k=1\) 时上界为 \(1\),看似"什么也没说",但这恰是两点分布能实际达到的值,从 \(k\ge2\) 起界才变得非平凡而有实用价值。

3. 依概率收敛

要严格陈述"样本均值稳定于期望",先要说清"稳定"的数学含义。随机变量序列不是普通的数列:对每个 \(n\),\(X_n\) 的取值依赖于试验结果,因此不能要求它像数列那样逐点逼近某个数,而只能要求"偏离很大"这一事件的概率随 \(n\) 增大而消失。

定义 1 依概率收敛

设 \(\{X_n\}\) 为随机变量序列,\(\mu\) 为常数。若对任意 \(\varepsilon>0\),

\[ \lim_{n\to\infty}P\{|X_n-\mu|>\varepsilon\}=0, \]

则称 \(X_n\)依概率收敛(converges in probability)于 \(\mu\),记作 \(X_n\xrightarrow{\;P\;}\mu\)。

直观地说:不论 \(\varepsilon\) 多小,只要 \(n\) 充分大,\(X_n\) 落在 \(\mu\) 的 \(\varepsilon\)-邻域之外的概率就可以任意接近 \(0\)。注意这允许偶尔的大偏离——\(X_n\) 并非必然接近 \(\mu\),只是"跑偏"越来越罕见。这是最弱的一种"随机收敛",更强的几乎必然收敛(almost sure convergence)(要求偏离最终永远不再发生)将在 8.4 节讨论。

4. 弱大数定律

现在把切比雪夫不等式用到样本均值(sample mean)上。设 \(X_1,X_2,\ldots\) 独立同分布(independent and identically distributed, i.i.d.),期望为 \(\mu\)、方差为 \(\sigma^2<\infty\),记

\[ \bar X_n=\frac{X_1+X_2+\cdots+X_n}{n}. \]

样本均值仍然是随机变量,但它的波动比单个观测小得多:期望不变,方差按 \(1/n\) 缩小。这正是弱大数定律的全部秘密。

定理 2 弱大数定律(WLLN)

设 \(X_1,X_2,\ldots\) 独立同分布,\(E[X_i]=\mu\),\(\mathrm{Var}(X_i)=\sigma^2<\infty\),则对任意 \(\varepsilon>0\),

\[ P\{|\bar X_n-\mu|>\varepsilon\}\le\frac{\sigma^2}{n\,\varepsilon^2}\xrightarrow{\;n\to\infty\;}0, \]

即 \(\bar X_n\) 依概率收敛于 \(\mu\)。

证明先算样本均值的期望与方差。由期望的线性性,\(E[\bar X_n]=\frac{1}{n}\,n\mu=\mu\)。由独立性,和的方差等于方差的和:\(\mathrm{Var}(X_1+\cdots+X_n)=n\sigma^2\);再由 \(\mathrm{Var}(cY)=c^2\mathrm{Var}(Y)\),

\[ \mathrm{Var}(\bar X_n)=\frac{1}{n^2}\,\mathrm{Var}(X_1+\cdots+X_n)=\frac{n\sigma^2}{n^2}=\frac{\sigma^2}{n}. \]

对随机变量 \(\bar X_n\) 使用切比雪夫不等式(其期望为 \(\mu\)、方差为 \(\sigma^2/n\)),得

\[ P\{|\bar X_n-\mu|>\varepsilon\}\le\frac{\sigma^2/n}{\varepsilon^2}=\frac{\sigma^2}{n\varepsilon^2}, \]

右端与 \(n\) 成反比,令 \(n\to\infty\) 即得结论。证毕。

结论的几何图景:\(\bar X_n\) 的分布随 \(n\) 增大而围绕 \(\mu\) 收缩,标准差按 \(\sigma/\sqrt{n}\) 的速度变窄(图 2)。收缩速度是 \(\sqrt n\) 而非 \(n\)——想把精度提高一位数,样本量要增加一百倍,这一"平方根法则"贯穿整个统计学。

μ−3σ μ−2σ μ−σ μ μ+σ μ+2σ μ+3σ 0 0.40 0.80 1.60 密度 n = 1(σ/√n = σ) n = 4(σ/√n = σ/2) n = 16(σ/√n = σ/4) 三条曲线下方面积均为 1,宽度按 σ/√n 收缩,中心始终在 μ。
图 2:\(\bar X_n\) 的密度随 \(n\) 增大围绕 \(\mu\) 收缩(示意,按 \(\sigma/\sqrt n\) 的真实比例绘制,峰高依次约为 \(0.40\)、\(0.80\)、\(1.60\))。切比雪夫不等式不依赖这一钟形形状,只用 \(\mathrm{Var}(\bar X_n)=\sigma^2/n\)。
例 1 精度设计:需要测多少次?

用一台仪器重复测量某物理量的真值 \(\mu\),各次读数 \(X_1,\ldots,X_n\) 独立同分布,标准差 \(\sigma=1\)(方差 \(\sigma^2=1\))。若要以不小于 \(0.95\) 的概率保证样本均值与真值的偏差不超过 \(\varepsilon=0.1\),至少要测量多少次?

对样本均值用切比雪夫不等式(定理 2 的证明中已得 \(\mathrm{Var}(\bar X_n)=\sigma^2/n\)):

\[ P\{|\bar X_n-\mu|>0.1\}\le\frac{\sigma^2}{n\varepsilon^2}=\frac{1}{n\times 0.01}=\frac{100}{n}. \]

要求 \(P\{|\bar X_n-\mu|\le 0.1\}=1-P\{|\bar X_n-\mu|>0.1\}\ge 0.95\),只需 \(\dfrac{100}{n}\le 0.05\),即

\[ n\ge\frac{\sigma^2}{\delta\,\varepsilon^2}=\frac{1}{0.05\times 0.01}=2000. \]

故 \(n\ge 2000\) 即可。注意这一保证不依赖读数分布的形状——这正是切比雪夫式论证的价值;其代价是保守,例 3 将看到正态情形实际需要的样本量远小于此。

例 2 掷 1000 次骰子:均值的概率界

掷一颗均匀骰子 \(n=1000\) 次,\(\bar X\) 为平均点数。用切比雪夫不等式估计 \(P\{|\bar X-3.5|\ge 0.1\}\) 的上界,并给出 \(P\{|\bar X-3.5|<0.1\}\) 的下界。

单次点数 \(X\) 的期望与方差为

\[ E[X]=\frac{1+2+\cdots+6}{6}=3.5,\qquad \mathrm{Var}(X)=E[X^2]-3.5^2=\frac{91}{6}-\frac{49}{4}=\frac{35}{12}\approx 2.9167. \]

于是 \(\mathrm{Var}(\bar X)=\dfrac{35/12}{1000}\)。由切比雪夫不等式,取 \(\varepsilon=0.1\):

\[ P\{|\bar X-3.5|\ge 0.1\}\le\frac{35/12}{1000\times 0.01}=\frac{35}{120}\approx 0.2917, \]

从而

\[ P\{|\bar X-3.5|<0.1\}\ge 1-0.2917=0.7083\approx 0.708. \]

即:不依赖任何分布假设,我们能断言平均点数落在 \(3.4\sim 3.6\) 之间的概率至少约 \(70.8\%\)。

例 3 与正态实际精度对比(CLT 预告)

例 1 与例 2 的界都相当保守。若进一步假定 \(\bar X_n\) 近似服从正态分布(其依据是 8.3 节的中心极限定理),重新评估:(a) 例 1 中 \(n=2000\) 时的实际概率,以及达到 \(0.95\) 真正所需的最小 \(n\);(b) 例 2 中的实际概率。

中心极限定理给出 \(\bar X_n\approx N\big(\mu,\ \sigma^2/n\big)\),故 \(P\{|\bar X_n-\mu|\le\varepsilon\}\approx P\{|Z|\le\varepsilon\sqrt n/\sigma\}\)。

(a) 例 1(\(\sigma=1\),\(\varepsilon=0.1\)):当 \(n=2000\) 时 \(0.1\sqrt{2000}=4.47\),查表得 \(P\{|Z|\le 4.47\}\approx 0.99999\)——远超所需的 \(0.95\)。反解 \(0.1\sqrt n\ge 1.96\) 得 \(\sqrt n\ge 19.6\),即 \(n\ge 384.2\),取 \(n=385\) 次即可:不到切比雪夫所需 \(2000\) 次的五分之一。

(b) 例 2(\(\sigma=\sqrt{35/12}\):)当 \(n=1000\)、\(\varepsilon=0.1\) 时,\(\dfrac{\varepsilon\sqrt n}{\sigma}=0.1\times\sqrt{\dfrac{1000\times 12}{35}}\approx 1.85\),故

\[ P\{|\bar X-3.5|<0.1\}\approx 2\Phi(1.85)-1\approx 2\times 0.9678-1\approx 0.936, \]

而切比雪夫只保证 \(0.708\)。结论:切比雪夫界"包打天下但宽松",中心极限定理"精确但只是近似且需较大 \(n\)"——两者的分工与衔接正是 8.3 节的主题。

注记 历史脉络

这个不等式与法国数学家比安内梅(Bienaymé) 1853 年的工作密切相关,文献中亦称 Bienaymé–Chebyshev 不等式;俄国数学家切比雪夫(Chebyshev, 1821–1894) 在 1867 年给出上述证明并将其系统用于极限定理,他的学生马尔可夫(Markov)与李亚普诺夫(Lyapunov)沿此路线走向中心极限定理。大数定律最早的严格证明出自雅各布·伯努利(Jakob Bernoulli)——二项频率收敛于 \(p\) 的情形,发表于 1713 年遗著《猜度术》(Ars Conjectandi),用的是相当繁复的组合论证;切比雪夫不等式把这一证明压缩成三行(见练习 4)。另外,弱大数定律其实不要求方差存在:只要 \(E|X|<\infty\),结论仍成立(辛钦定理),但其证明需要特征函数工具,超出本书范围;更强的几乎必然收敛版本见 8.4 节

5. 本节小结

要点回顾
  • 切比雪夫不等式:\(P\{|X-\mu|\ge\varepsilon\}\le\sigma^2/\varepsilon^2\),等价于 \(P\{|X-\mu|\ge k\sigma\}\le 1/k^2\);证明只需对满足 \(|x-\mu|\ge\varepsilon\) 的部分求和(离散)或积分(连续),本质是马尔可夫式论证。
  • 界只用期望与方差,故对一切分布成立且不可一致改进(三点分布可取到等号);代价是宽松——正态 \(2\sigma\) 偏离实际概率 \(0.0456\),界给 \(0.25\)。
  • 依概率收敛 \(X_n\xrightarrow{P}\mu\):对任意 \(\varepsilon>0\),\(P\{|X_n-\mu|>\varepsilon\}\to 0\);允许偶发大偏离,只要求偏离概率消失。
  • 弱大数定律:i.i.d. 且方差有限 \(\Rightarrow\bar X_n\xrightarrow{P}\mu\);关键计算是 \(\mathrm{Var}(\bar X_n)=\sigma^2/n\),标准差按 \(\sigma/\sqrt n\) 收缩(平方根法则)。
  • 样本量设计公式:要 \(P\{|\bar X_n-\mu|\le\varepsilon\}\ge 1-\delta\),充分条件是 \(n\ge\sigma^2/(\delta\varepsilon^2)\)(例 1:\(n\ge 2000\));需要更精的数值时转入 8.3 节的中心极限定理。

练习

练习 8-2-1

设 \(E[X]=10\),\(\mathrm{Var}(X)=4\)。(a) 给出 \(P\{|X-10|\ge 6\}\) 的切比雪夫上界与 \(P\{|X-10|<6\}\) 的下界;(b) 若还知道 \(X\sim N(10,4)\),实际值是多少?

答案与提示

(a) 上界 \(\sigma^2/\varepsilon^2=4/36=1/9\approx 0.111\),下界 \(1-1/9=8/9\approx 0.889\)。(b) \(\varepsilon=6=3\sigma\),实际 \(P\{|Z|\ge 3\}=0.0027\),比界小约 \(41\) 倍——已知分布形状时不必用切比雪夫,但 (a) 的保证对任何分布有效。

练习 8-2-2

设 \(X\sim B(100,\,1/2)\)。用切比雪夫不等式估计 \(P\{|X-50|\ge 10\}\) 的上界,再用正态近似(8.3 节预告)比较实际值。

答案与提示

\(\mathrm{Var}(X)=np(1-p)=100\times 0.25=25\),上界 \(25/10^2=0.25\)。正态近似:\(\varepsilon=10=2\sigma\)(\(\sigma=5\)),实际 \(\approx P\{|Z|\ge 2\}=0.0456\)。两者之比约 \(5.5\) 倍,与表 1 的 \(k=2\) 行一致。

练习 8-2-3

某天平读数误差的方差为 \(\sigma^2=9\)(毫克²),用 \(n\) 次独立读数的平均估计真实重量。要求 \(P\{|\bar X-\mu|\le 0.5\}\ge 0.99\),\(n\) 至少多大?若只要求 \(0.95\) 呢?

答案与提示

由 \(n\ge\sigma^2/(\delta\varepsilon^2)\):\(\delta=0.01\) 时 \(n\ge 9/(0.01\times 0.25)=3600\);\(\delta=0.05\) 时 \(n\ge 9/(0.05\times 0.25)=720\)。置信度从 \(0.95\) 提到 \(0.99\)(即 \(\delta\) 从 \(0.05\) 降到 \(0.01\)),样本量需增至 \(5\) 倍——可靠性是"买"来的。

练习 8-2-4

设 \(X\sim B(n,p)\),证明频率 \(X/n\) 依概率收敛于 \(p\)(伯努利大数定律)。

答案与提示

把 \(X\) 写成 \(n\) 个伯努利(\(p\))变量之和即可套用定理 2,也可直接计算:\(E[X/n]=p\),\(\mathrm{Var}(X/n)=\mathrm{Var}(X)/n^2=np(1-p)/n^2=p(1-p)/n\le\dfrac{1}{4n}\)。由切比雪夫,对任意 \(\varepsilon>0\),\[ P\{|X/n-p|\ge\varepsilon\}\le\frac{p(1-p)}{n\varepsilon^2}\le\frac{1}{4n\varepsilon^2}\to 0. \] 这正是"频率稳定于概率"的严格形式,也是概率的频率解释(8.1 节)的理论根据。

练习 8-2-5

举出一个具体分布,使 \(P\{|X-\mu|\ge\sigma\}\) 恰好等于切比雪夫上界 \(1\),并说明:为什么这意味着不添加分布信息时,\(1/k^2\) 型的界无法被一致改进?

答案与提示

取 \(X=\pm 1\) 各以概率 \(1/2\):则 \(\mu=0\),\(\sigma^2=1\),\(P\{|X-0|\ge 1\}=1=1/1^2\),取到等号。更一般地,对任意 \(k\ge1\),取 \(P\{X=\pm k\sigma\}=1/(2k^2)\)、\(P\{X=0\}=1-1/k^2\),可验证 \(\mathrm{Var}(X)=\sigma^2\) 且 \(P\{|X-\mu|\ge k\sigma\}=1/k^2\)。既然存在真实分布在每个 \(k\) 处都达到界,任何"对所有分布都更小"的上界都不可能存在。