第 7 章 · 期望的性质

7.1 引言

Introduction
学习目标
  • 说明本章主旋律"把复杂随机量分解为简单量之和"的动机:直接求"和"的分布通常不可行,而求"和"的期望存在捷径;
  • 写出指示随机变量 \(I_A\) 的定义并验证 \(E[I_A]=P(A)\),说明它是分解计数型随机量的最小积木;
  • 陈述期望的线性性,并用离散情形的两行推导说明它为何不需要独立性;
  • 在保险公司总赔付问题中执行"分解—求和—回收"三步,得出 \(E[S]=50\,000\) 元;
  • 按顺序说出三大工具(线性性 / 条件期望 / 矩母函数)的用途分支及对应节次 7.2–7.8。

1. 计算的困境与出路

第 4 章我们学会了计算单个随机变量的期望(expectation):离散型逐点加权求和,连续型积分;第 5 章处理了连续型变量,第 6 章又把若干随机变量放到一起,引入联合分布(joint distribution)。然而真实问题交给我们的,往往不是"某一个随机变量",而是"一大堆随机因素叠加出的总量":保险公司一年的总赔付是成百上千张保单赔付额之和;同时掷 \(n\) 颗骰子的总点数是 \(n\) 个点数之和;抽样调查面对的样本均值(sample mean) 是 \(n\) 个观测的平均;排队系统一天的总等待时间是一段段服务时间之和。

对这样的"和",前几章的路线是迂回的:先求出和的分布,再算期望。设 \(S=X_1+\cdots+X_n\),若各 \(X_i\) 独立,密度须经 \(n-1\) 次卷积(convolution);若相依,还得先拿下整个联合分布——多数场合根本做不到。本章的立场是:若目的只是期望(以及与它同族的方差、矩等量),完全可以绕开分布,直接对期望动手术。为此要系统研究的,就是期望的性质(properties of expectation)。

2. 主旋律:把复杂随机量分解为简单量之和

本章一切技巧共用一个主旋律:把复杂随机量分解为简单量之和。当每个"零件"都简单到能一眼写出期望时,一条几乎不花成本的运算规则——期望的线性性(linearity of expectation)——就能把零件的期望装配回总量的期望。先认识最小的零件。

定义 1 指示随机变量

设 \(A\) 为样本空间 \(S\) 中的事件,定义指示随机变量(indicator random variable) \[ I_A(\omega)=\begin{cases}1, & \omega\in A,\\[2pt] 0, & \omega\notin A.\end{cases} \] 它仅取 0 与 1 两个值,且 \(E[I_A]=P(A)\)。

一行验证:\(E[I_A]=1\cdot P(A)+0\cdot P(A^c)=P(A)\)——指示变量把概率藏进了期望。当要分解的对象是"满足某条件的个数"(计数)时,零件更是清一色的指示变量:计数 \(X\) 总可写成 \(X=I_{A_1}+\cdots+I_{A_n}\),于是 \(E[X]=\sum_{i=1}^n P(A_i)\)。这一"指示变量法"是 7.2 节的方法论主角。

性质 1 期望的线性性(预览)

只要各期望存在,对任意常数 \(a,b\) 有 \[ E[aX+bY]=a\,E[X]+b\,E[Y],\qquad\text{特别地}\qquad E[X_1+\cdots+X_n]=E[X_1]+\cdots+E[X_n], \] 且不需要 \(X_1,\dots,X_n\) 相互独立

证明(就离散情形 \(a=b=1\) 作两行推导)。设 \((X,Y)\) 的联合分布列为 \(p(x,y)\),则 \[ E[X+Y]=\sum_x\sum_y (x+y)\,p(x,y)=\sum_x\sum_y x\,p(x,y)+\sum_y\sum_x y\,p(x,y)=\sum_x x\,p_X(x)+\sum_y y\,p_Y(y)=E[X]+E[Y]. \] 第二个等号把 \((x+y)\) 拆成两项并交换了求和次序——这是本章反复出现的动作;收尾处只用到边缘分布列 \(p_X,p_Y\),全程没有出现独立性。含系数、\(n\) 项与连续型的一般证明见 7.2 节。∎

线性性最令人意外的收获,是它对相依性的"免疫"。看本章的引入例。

例 1 保险公司的全年总赔付

某保险公司售出 100 张同类型保单。单张保单的赔付额 \(X_i\)(元)满足 \(P(X_i=10\,000)=0.05\)、\(P(X_i=0)=0.95\)。各保单之间高度相依——例如一场火灾或地震会同时触发多张保单。求全年总赔付 \(S=X_1+\cdots+X_{100}\) 的期望。

每张保单的期望赔付为 \[ E[X_i]=10\,000\times 0.05+0\times 0.95=500\ \text{元}, \] 由线性性立得 \[ E[S]=E[X_1]+\cdots+E[X_{100}]=100\times 500=50\,000\ \text{元}. \] 全程未使用任何独立性假设:即使大规模灾害使各 \(X_i\) 强烈正相关,期望仍是 \(50\,000\) 元。对比之下,若想进一步计算 \(P(S>60\,000)\) 这类概率,就必须知道各保单之间的相依结构——独立时可借助 7.6 节的矩母函数,相依时问题困难得多;方差同样受相依影响,这正是 7.3 节的课题。"求和的期望易、求和的分布难",此处已可见一斑。

3. 三大工具与本章地图

线性性解决"和"的一阶问题;沿着"分解"这条主线,本章还备有两件配套工具。条件期望(conditional expectation) 把"按分量分解"推广为"按信息分解":先在每个条件下求平均,再对条件本身求平均,即全期望公式(law of total expectation) \(E[X]=E[E[X\mid Y]]\)。矩母函数(moment generating function) 则把整个分布压缩成一个函数 \(M(t)=E[e^{tX}]\):求各阶矩变成求导,识别分布只需比对函数,独立和的矩母函数直接相乘。三大工具的用途分支与各节安排见图 1、表 1。

一个目标, 三大工具: 本章的结构 本章目标: 驾驭复杂随机量 总赔付 E[S] · 和的方差 Var(S) · 和的分布(独立时) 工具一 期望的线性性 E[X+Y] = E[X] + E[Y] 按「分量」拆, 不需要独立性 最小积木: 指示变量 · 7.2 和的期望、指示变量法 · 7.3 协方差、和的方差 收获: 样本均值的期望与方差 典型: 匹配数、优惠券收集 工具二 条件期望 E[X] = E[ E[X|Y] ] 按「信息」拆: 先分组平均 自引用方程: E = g(E) · 7.4 条件期望、全期望公式 · 7.5 条件期望与预测 收获: 最优预测 E[X|Y] 典型: 矿工问题、随机和 工具三 矩母函数 M(t) = E[exp(tX)] 把整个分布装进一个函数 独立和: 矩母函数直接相乘 · 7.6 矩母函数 · 7.7 正态的其他性质 收获: 求矩、识别分布 典型: 独立正态和仍正态 7.8 期望的一般定义(选学): 期望何时存在 · 统一的积分观点 三大工具同出一源: 复杂随机量 = 简单量之和
图 1:本章工具箱结构图。目标(上)由三大工具分头实现:线性性(红)按"分量"分解,负责和的期望与方差(7.2–7.3);条件期望(蓝)按"信息"分解,负责全期望公式与最优预测(7.4–7.5);矩母函数(金)以一个函数携带全部分布信息,负责求矩、识别分布与独立和(7.6–7.7);7.8(绿)为以上全部工具补上理论地基。
表 1:三大工具速览与各节分工、依赖关系
工具核心事实主战场典型应用依赖与衔接
期望的线性性\(E\big[\sum_i X_i\big]=\sum_i E[X_i]\),无需独立7.2、7.3匹配数、优惠券收集、样本均值7.3 加入协方差处理方差
条件期望\(E[X]=E\big[E[X\mid Y]\big]\)7.4、7.5矿工问题、随机和、最优预测7.5 的线性预测需 7.3
矩母函数\(M(t)=E[e^{tX}]\),独立和相乘7.6、7.7求各阶矩、识别分布、正态和7.7 全面依赖 7.6

按此地图,本章的行军路线依次为:

  • 7.2 随机变量之和的期望:线性性的正式定理与指示变量法的主场——匹配数、超几何计数、优惠券收集等经典问题一网打尽,并得到 \(E[\overline{X}]=\mu\)(本章起点,无前置依赖);
  • 7.3 协方差、和的方差与相关系数:把线性性推进到二阶——交叉项 \(E[XY]\) 与协方差(covariance) 登场,得到 \(\operatorname{Var}(\sum_i X_i)\) 与 \(\operatorname{Var}(\overline{X})=\sigma^2/n\)(依赖 7.2);
  • 7.4 条件期望:全期望公式、解"自引用方程"的技巧、随机和的期望(依赖 7.2–7.3 的概念);
  • 7.5 条件期望与预测:\(E[X\mid Y]\) 是用 \(Y\) 预测 \(X\) 的均方最优解;最佳线性预测要动用 7.3 的协方差(依赖 7.3、7.4);
  • 7.6 矩母函数:\(M(t)=E[e^{tX}]\) 一手抓矩、一手抓分布,独立和的矩母函数直接相乘;
  • 7.7 正态随机变量的其他性质:用矩母函数证明独立正态和仍正态,并给出统计推断的基石三条(依赖 7.6);
  • 7.8 期望的一般定义(选学):\(X^+\)、\(X^-\) 分解与黎曼–斯蒂尔杰斯积分,为全章补上理论地基。

4. 工作流:分解—求和—回收

把思想落成可操作的步骤,就是贯穿全章的三步工作流:分解(把复杂量写成简单量之和)→ 求和(用线性性逐项取期望)→ 回收(把结果组装回原问题的答案)。图 2 以例 1 的保险总赔付为实例演示全过程。

工作流: 分解 — 求和 — 回收 ① 目标: 复杂量 S S = 全年总赔付 求分布需联合结构 或反复卷积 → 不可行 ② 分解为和 S = 各单笔赔付之和 每笔只取 0 或 10000 最简积木: 指示变量 ③ 逐项求期望 E[S] = 各项期望之和 线性性, 无需独立 每笔期望 = 500 元 ④ 回收答案 E[S] = 100 × 500 = 50000 元 回到定价与准备金 分解不唯一: 按分量拆 (7.2) 或按信息拆 (7.4) 求 E[S] 只需每项自身的一维信息 (边缘期望); 求 S 的分布需全部相依结构 —— 这正是「期望易、分布难」的根源; 方差居中: 需两两协方差 (7.3)。
图 2:"分解—求和—回收"工作流(以例 1 的保险总赔付为实例)。① 直接求和的分布几乎不可行;② 把 \(S\) 分解为简单的单笔赔付之和;③ 用线性性逐项求期望(无需独立);④ 把结果回收到原问题。虚线提醒:分解方式不唯一——按"分量"拆(7.2)或按"信息"拆(7.4)皆可,殊途同归。

下面两道小例分别试验"按分量拆"与"按信息拆"。

例 2 五张牌的点值之和(无放回,相依仍可加)

从一副 52 张扑克牌中无放回地抽取 5 张,记第 \(i\) 张的点值为 \(X_i\)(A 记 1,J 记 11,Q 记 12,K 记 13),\(S\) 为 5 张牌点值之和。(a) 说明 \(X_1\) 与 \(X_2\) 不独立;(b) 求 \(E[S]\)。

(a) 无放回抽取使牌之间互相牵制:例如 \(P(X_2=13)=4/52\),但在已知 \(X_1=13\) 的条件下 \(P(X_2=13\mid X_1=13)=3/51\),两个数值不等,故 \(X_1,X_2\) 相依(负相关)。(b) 由对称性,第 \(i\) 个位置等可能地是 52 张牌中的任一张,于是 \(P(X_i=k)=4/52=1/13\)(\(k=1,\dots,13\)),从而 \[ E[X_i]=\frac{1+2+\cdots+13}{13}=\frac{91}{13}=7,\qquad E[S]=E[X_1]+\cdots+E[X_5]=5\times 7=35. \] 尽管各 \(X_i\) 彼此相依,期望照样直接相加——这正是性质 1 的力量。同一手法(对称位置 + 线性性)将在 7.2 节的超几何期望中大放异彩。
例 3 两颗骰子:按"信息"分解的预告

掷两颗骰子,\(X\) 为第一颗的点数,\(S=X+Y\) 为点数之和。(a) 用线性性求 \(E[S]\);(b) 计算 \(E[S\mid X=x]\),并用 \(E[S]=E\big[E[S\mid X]\big]\) 复核。

(a) \(E[S]=E[X]+E[Y]=3.5+3.5=7\)。(b) 给定 \(X=x\),有 \(S=x+Y\),故 \(E[S\mid X=x]=x+E[Y]=x+3.5\),它随 \(x\) 变化,是 \(X\) 的函数。于是 \[ E\big[E[S\mid X]\big]=E[X+3.5]=3.5+3.5=7, \] 与 (a) 一致。第二步正是 7.4 节全期望公式的最小样本:把期望按条件拆开、分组平均后再平均一次——"按信息分解"的思路在此可见雏形。
注记 本章在全书中的位置

本章是第 8 章极限定理与数理统计的地基:大数定律断言样本均值稳定于期望,而其证明所需的全部概率装备,不过是本章两行计算——\(E[\overline{X}]=\mu\)(7.2)与 \(\operatorname{Var}(\overline{X})=\sigma^2/n\)(7.3)。另值得一提:期望的概念先于概率的公理化诞生——惠更斯 1657 年的《论赌博中的计算》通篇以"预期赌金"(期望)为核心概念,"概率"反而是后来才成为主角的。本章以"期望的性质"为纲,某种意义上是回到这门学科最初的出发点。

5. 本节小结

要点回顾
  • 本章主旋律:把复杂随机量分解为简单量之和——复杂问题先"拆",再用期望的运算性质"装"回去。
  • 期望的线性性 \(E[\sum_i X_i]=\sum_i E[X_i]\) 无条件成立,不要求独立;求"和的期望"只需各项的边缘期望,求"和的分布"才需要联合结构与卷积。
  • 指示随机变量 \(I_A\) 把概率藏进期望:\(E[I_A]=P(A)\),是分解计数问题的最小积木(7.2 的方法论主角)。
  • 三大工具与分支:线性性(7.2–7.3,按分量拆、延伸到方差);条件期望(7.4–7.5,按信息拆、通向预测);矩母函数(7.6–7.7,一个函数携带全部分布信息);7.8 补理论地基。
  • 工作流:分解 → 求和 → 回收;保险总赔付例中三步各一行,即得 \(E[S]=50\,000\) 元,全程与相依性无关。

练习

练习 7-1-1

思考题:为什么"求和的期望"比"求和的分布"容易得多?请从所需信息量、运算类型与本章例 1 的体会三个角度作答。

答案与提示

(i) 信息量——\(E[\sum_i X_i]=\sum_i E[X_i]\) 只需每个 \(X_i\) 自身(一维边缘)的期望;而和的分布由整个联合分布决定,必须知道全部相依结构。(ii) 运算类型——即使独立,求和的密度也要做 \(n-1\) 次卷积,项数一多计算量爆炸;期望的相加是线性运算,几乎零成本。(iii) 例 1 中无论各保单赔付是否联动,恒有 \(E[S]=50\,000\) 元;但 \(P(S>60\,000)\) 这类分布问题没有相依信息根本无法回答。直观地说:期望只是分布的"一阶汇总数字",相依结构所携带的信息恰好不影响它;分布则要携带全部信息。

练习 7-1-2

某公司同时经营两类保单:A 类 120 张,每张以概率 0.03 赔付 8 000 元;B 类 60 张,每张以概率 0.04 赔付 15 000 元。求全年总赔付的期望(各保单之间的相依关系未知)。

答案与提示

设总赔付 \(S=\sum_{i=1}^{120}X_i+\sum_{j=1}^{60}Y_j\),其中 \(E[X_i]=0.03\times 8\,000=240\),\(E[Y_j]=0.04\times 15\,000=600\)。由线性性 \(E[S]=120\times 240+60\times 600=28\,800+36\,000=64\,800\) 元——两类保单、不同赔付、相依未知,统统不影响"逐项相加"的合法性。

练习 7-1-3

同时掷 4 颗骰子,记 \(M\) 为出现 6 点的骰子数。把 \(M\) 写成指示随机变量之和并求 \(E[M]\)。

答案与提示

令 \(I_i=1\) 表示第 \(i\) 颗骰子出现 6 点,则 \(M=I_1+\cdots+I_4\),\(E[I_i]=P(\text{第 } i \text{ 颗为 6})=1/6\),故 \(E[M]=4\times\frac{1}{6}=\frac{2}{3}\approx 0.667\)。即使有人把四颗骰子粘成一组联动投掷(只要每颗出现 6 的概率仍是 \(1/6\)),期望不变——而 \(M\) 的分布会彻底改变。"计数 = 指示求和"将在 7.2 节全面展开。

练习 7-1-4

辨析两个说法:(a) "只有当 \(X,Y\) 独立时,才有 \(E[X+Y]=E[X]+E[Y]\)";(b) "若 \(E[X+Y]=E[X]+E[Y]\) 成立,则 \(X,Y\) 独立"。是否正确?各说明理由或举出反例。

答案与提示

两个说法都不正确。性质 1 的证明只用了交换求和次序,从未涉及独立性,故 (a) 错;线性性无条件成立,于是它的成立也推不出任何独立性,故 (b) 错——取 \(X=Y\)(完全相依),仍有 \(E[X+Y]=2E[X]=E[X]+E[Y]\),但二者显然不独立。需要区分的是另一件事:独立性能简化的是乘积的期望(\(X,Y\) 独立 \(\Rightarrow E[XY]=E[X]E[Y]\))与和的分布,这些分别在 7.3 与 7.6 讨论。