- 写出方差(variance)与标准差(standard deviation)的定义,并解释它们度量的是"围绕期望的散布";
- 熟练使用两步公式 \(\mathrm{Var}(X)=E[X^2]-\mu^2\) 计算具体分布列的方差;
- 证明并应用性质 \(\mathrm{Var}(aX+b)=a^2\mathrm{Var}(X)\),说明平移不改变散布的原因;
- 推导离散均匀分布 \(\{1,\dots,n\}\) 的期望 \((n+1)/2\) 与方差 \((n^2-1)/12\);
- 用方差比较期望相同的收益方案,说明"风险"的量化含义。
1. 方差的定义:期望之外的第二个数字
4.3 节告诉我们,期望 \(E[X]=\mu\) 是分布列的"重心",它回答的是"平均而言 X 取多大"。但只知道重心并不够。设想两笔投资:A 稳获 100 万元;B 以各半概率获得 70 万元或 130 万元。两者的期望都是 100,长期平均收益完全相同,然而 B 的结果会来回大幅摆动,A 则纹丝不动。区分它们的,是取值围绕期望的散布程度。方差(variance)就是对这种散布的标准度量。
一个自然的想法是看"平均偏差" \(E[X-\mu]\),但偏差有正有负,且由期望的线性性立刻得到 \(E[X-\mu]=E[X]-\mu=0\):正负恰好抵消。解决办法是先平方、再平均——平方既消除了符号,又放大了远离中心的行为,使"离谱"的取值受到更重的惩罚。
设随机变量 \(X\) 的期望 \(\mu=E[X]\) 存在。若 \(E[(X-\mu)^2]\) 有限,则称 \[ \operatorname{Var}(X) = E\big[(X-\mu)^2\big] = \sum_{x} (x-\mu)^2\, p(x) \] 为 \(X\) 的方差(variance),也记作 \(\sigma^2\);其算术平方根 \[ \sigma = \sqrt{\operatorname{Var}(X)} \] 称为 \(X\) 的标准差(standard deviation)。
直观地说,方差是"平方偏差的加权平均":每个取值 \(x\) 到中心 \(\mu\) 的距离平方 \((x-\mu)^2\),按其概率 \(p(x)\) 加权汇总。标准差 \(\sigma\) 则把量纲还原回与 \(X\) 相同的单位,可解释为"典型的偏离幅度"。
"平均绝对偏差" \(E[|X-\mu|]\) 同样度量散布,但绝对值函数在零点不可导,与期望的运算配合笨拙;而平方是光滑的二次函数,借助4.4 节期望的线性性可以展开、化简,几乎总能得到简洁的闭式(见定理 1)。更深远的是,第 8 章的切比雪夫不等式与中心极限定理正是建立在平方偏差之上——方差不是最直观的散布度量,却是最"好用"的那一个。
2. 计算公式:先算 E[X²],再减 μ²
按定义计算方差需要先知道每个取值到 \(\mu\) 的偏差,再逐项平方加权。下面的公式把这一过程化为两个更简单的期望之差,是实际计算中几乎唯一使用的方式。
\[ \operatorname{Var}(X) = E[X^2] - \mu^2, \qquad \mu = E[X]. \]
于是计算方差的标准流程是两步:第一步用 4.4 节的 \(E[g(X)]=\sum_x g(x)p(x)\) 算出 \(E[X^2]\)(取 \(g(x)=x^2\),无需先求 \((X-\mu)^2\) 的分布);第二步减去 \(\mu\) 的平方。
掷一颗均匀骰子,\(X\) 为所得点数。求 \(\operatorname{Var}(X)\) 与 \(\sigma\)。
图 2 把定义"平方偏差的加权平均"画了出来:让骰子的六个取值作为质量点落在抛物线 \(y=(x-\mu)^2\) 上,每点携带质量 \(1/6\),则方差正是这些点高度的等权平均。
3. 方差与风险:同期望的两种命运
在金融与决策问题中,期望衡量"平均回报",方差衡量"风险"(risk)——结果的不确定性或波动幅度。下面的例子是 Ross 原书风格的经典对比。
考虑期望收益相同的两个方案(单位:万元):方案 A 的收益 \(X\) 与方案 B 的收益 \(Y\) 的分布列如下。分别计算两者的方差与标准差,并说明哪个方案风险更大。
| 收益取值(万元) | 0 | 60 | 100 | 140 | 200 |
|---|---|---|---|---|---|
| 方案 A:\(p(x)\) | — | 0.25 | 0.50 | 0.25 | — |
| 方案 B:\(p(y)\) | 0.25 | — | 0.50 | — | 0.25 |
| 指标 | 方案 A | 方案 B |
|---|---|---|
| 期望 \(\mu\) | 100 | 100 |
| \(E[X^2]\) | 10800 | 15000 |
| 方差 \(\operatorname{Var}\) | 800 | 5000 |
| 标准差 \(\sigma\) | \(\approx 28.3\) | \(\approx 70.7\) |
4. 线性变换与离散均匀分布
4.3 节有 \(E[aX+b]=aE[X]+b\),期望对线性变换是"一次"的;方差则不同——下面的定理表明它是"二次"的,而且与平移完全无关。
\[ \operatorname{Var}(aX+b) = a^2 \operatorname{Var}(X), \qquad a, b \text{ 为常数}. \]
两点解读:平移不变(translation invariance)——把整个分布向右搬运 \(b\),各取值间的相对距离不变,散布自然不变;缩放平方——把所有取值放大 \(a\) 倍,偏差同乘 \(a\),平方后变为 \(a^2\),因此标准差按 \(|a|\) 倍缩放(这正是例 2 中 \(\sigma_Y=2.5\,\sigma_X\) 的原因:B 的散布宽度是 A 的 2.5 倍)。
(1) 常数的方差为零:\(\operatorname{Var}(c)=0\);(2) 方差非负:\(\operatorname{Var}(X)\ge 0\);(3) \(\operatorname{Var}(-X)=\operatorname{Var}(X)\)。
反过来"方差为零意味着什么",留作练习 5:离散情形下 \(\operatorname{Var}(X)=0\) 当且仅当 \(X\) 以概率 1 等于一个常数。
作为定理 1 的系统应用,我们推导一个贯穿全书的结果:在 \(\{1,2,\dots,n\}\) 上等可能取值的离散均匀分布(discrete uniform distribution)。
设 \(X\) 等可能地取 \(1,2,\dots,n\)(即 \(p(k)=1/n\))。则 \[ E[X] = \frac{n+1}{2}, \qquad \operatorname{Var}(X) = \frac{n^2-1}{12}. \]
校验:\(n=6\)(骰子)时 \(\operatorname{Var}(X)=\frac{36-1}{12}=\frac{35}{12}\),与例 1 完全一致。分布铺得越宽(\(n\) 越大),方差按 \(n^2/12\) 的速度增长。
设 \(X\) 的分布列为 \(p(x)=x/21,\ x=1,2,\dots,6\)(4.3 节例 3 已算得 \(E[X]=91/21\))。求 \(\operatorname{Var}(X)\) 与 \(\sigma\),并与均匀骰子比较。
5. 本节小结
- 方差是平方偏差的期望 \(\operatorname{Var}(X)=E[(X-\mu)^2]\),标准差 \(\sigma=\sqrt{\operatorname{Var}(X)}\) 与 \(X\) 同单位,度量围绕期望的散布。
- 计算几乎总用两步公式 \(\operatorname{Var}(X)=E[X^2]-\mu^2\):先算 \(E[X^2]\),再减 \(\mu^2\);其证明只用到期望的线性性。
- \(\operatorname{Var}(aX+b)=a^2\operatorname{Var}(X)\):平移不改变散布(\(b\) 被偏差消去),缩放使标准差乘 \(|a|\);又 \(\operatorname{Var}(c)=0\)、\(\operatorname{Var}(X)\ge 0\)。
- 离散均匀分布 \(\{1,\dots,n\}\):\(E[X]=\frac{n+1}{2}\),\(\operatorname{Var}(X)=\frac{n^2-1}{12}\);\(n=6\) 给出骰子的 \(35/12\)。
- 期望相同不代表等价:方差(风险)是决策的第二个坐标——例 2 中同期望的两方案,标准差相差 2.5 倍。
- 下一节 4.6 节将把本节工具用于伯努利与二项随机变量,得到优雅的 \(E=np\) 与 \(\operatorname{Var}=np(1-p)\)。
练习
练习 4-5-1
掷 3 枚均匀硬币,\(X\) 为正面次数。求 \(\operatorname{Var}(X)\) 与 \(\sigma\)。
答案与提示分布列为 \(p(0),p(1),p(2),p(3)=\frac18,\frac38,\frac38,\frac18\)。\(\mu=\frac32\);\(E[X^2]=\frac{0+3+12+9}{8}=3\)。故 \(\operatorname{Var}(X)=3-\frac94=\frac34\),\(\sigma=\frac{\sqrt3}{2}\approx 0.87\)。
练习 4-5-2
\(X\) 等可能地取 \(1,2,\dots,10\)。利用定理 4 直接写出 \(E[X]\) 与 \(\operatorname{Var}(X)\),并求 \(\sigma\)。
答案与提示\(E[X]=\frac{10+1}{2}=5.5\);\(\operatorname{Var}(X)=\frac{10^2-1}{12}=\frac{99}{12}=\frac{33}{4}=8.25\);\(\sigma=\frac{\sqrt{33}}{2}\approx 2.87\)。
练习 4-5-3
设 \(X\) 分别以概率 \(\frac14,\frac12,\frac14\) 取 \(-1,0,1\)。求 \(\operatorname{Var}(X)\) 与 \(\operatorname{Var}(2X+3)\)。
答案与提示\(E[X]=0\),\(E[X^2]=\frac14\cdot 1+\frac14\cdot 1=\frac12\),故 \(\operatorname{Var}(X)=\frac12-0=\frac12\)。由定理 2,\(\operatorname{Var}(2X+3)=2^2\operatorname{Var}(X)=2\)——加 3 不起作用,乘 2 使方差变为 4 倍。
练习 4-5-4
证明:对任意常数 \(a,b\),\(\operatorname{Var}(aX+b)=a^2\operatorname{Var}(X)\),并指出 \(b\) 在证明的哪一步消失。
答案与提示记 \(\mu=E[X]\),则 \(E[aX+b]=a\mu+b\),且 \(aX+b-(a\mu+b)=a(X-\mu)\)。于是 \(\operatorname{Var}(aX+b)=E[a^2(X-\mu)^2]=a^2E[(X-\mu)^2]=a^2\operatorname{Var}(X)\)。\(b\) 在计算新变量对其自身中心的偏差时被减去——平移把中心与取值一起搬动,散布不变。
练习 4-5-5
判断并证明(离散情形):\(\operatorname{Var}(X)=0\) 的充分必要条件是存在常数 \(c\) 使 \(P(X=c)=1\)。
答案与提示充分性:若 \(P(X=c)=1\) 则 \(\mu=c\),偏差恒为 0。必要性:若 \(\operatorname{Var}(X)=\sum_x (x-\mu)^2 p(x)=0\),而和式中每一项非负,故凡 \(p(x)>0\) 的取值必有 \((x-\mu)^2=0\),即 \(x=\mu\)。于是全部概率集中在单点 \(\mu\) 上,\(P(X=\mu)=1\)。