- 给定联合分布(离散或连续),正确计算条件期望 \(E[X\mid Y=y]\),并说明它是 \(y\) 的函数;
- 把 \(E[X\mid Y]\) 理解为随机变量,写出其分布,并计算 \(E\bigl[E[X\mid Y]\bigr]\);
- 叙述并证明全期望公式 \(E[X]=E\bigl[E[X\mid Y]\bigr]\),用"分组平均的加权平均"解释其直观;
- 掌握"自引用方程"技巧:以第一步结果为条件建立 \(E=g(E)\),求解矿工问题与几何分布期望;
- 应用随机和公式 \(E\bigl[\sum_{i=1}^{N}X_i\bigr]=E[N]\,E[X]\) 计算总消费、总赔付等期望;了解全方差公式(选学)。
1. 条件期望的定义:从数到随机变量
6.5 节引入了条件分布:已知 \(Y=y\) 的信息后,\(X\) 的分布由原来的边际分布"修正"为条件分布。任何分布都有自己的平均值(4.3 节),条件分布也不例外——它的平均值就是条件期望(conditional expectation)。条件期望是本章最强大的计算工具,也是下一节 7.5 预测理论的基石。
设 \((X,Y)\) 为离散型随机向量,联合分布列为 \(p(x,y)\),且 \(p_Y(y)>0\)。给定 \(Y=y\) 时 \(X\) 的条件期望定义为 \[ E[X\mid Y=y] \;=\; \sum_x x\,P(X=x\mid Y=y) \;=\; \sum_x x\,\frac{p(x,y)}{p_Y(y)}. \] 若 \((X,Y)\) 为连续型,联合密度为 \(f(x,y)\),\(f_Y(y)>0\),则 \[ E[X\mid Y=y] \;=\; \int_{-\infty}^{\infty} x\,f_{X\mid Y}(x\mid y)\,dx \;=\; \frac{\int_{-\infty}^{\infty} x\,f(x,y)\,dx}{f_Y(y)}. \]
两种情形都要求相应的级数或积分绝对收敛。直观地说,\(E[X\mid Y=y]\) 就是"在额外获知 \(Y=y\) 这一信息之后,对 \(X\) 的平均值的最好估计"。
注意:\(E[X\mid Y=y]\) 是\(y\) 的函数——\(y\) 换一个值,条件分布变了,平均值也随之改变。例如掷两枚均匀硬币,设 \(Y\) 为第一枚的正面数,\(X\) 为两枚的正面总数。已知 \(Y=0\) 时,\(X\) 等可能取 \(0,1\),故 \(E[X\mid Y=0]=\tfrac12\);已知 \(Y=1\) 时,\(X\) 等可能取 \(1,2\),故 \(E[X\mid Y=1]=\tfrac32\)。信息不同,估计就不同:\(y=0\) 与 \(y=1\) 给出两个不同的数,把它们拼起来便得到定义在 \(Y\) 的值域上的函数 \(g(y)\)。
设 \(g(y)=E[X\mid Y=y]\)。称 \[ E[X\mid Y] \;=\; g(Y) \] 为 \(X\) 关于 \(Y\) 的条件期望——它是随机变量,其取值随 \(Y\) 的随机取值而随机变化。
在上面的掷硬币例子中,\(E[X\mid Y]\) 以概率 \(\tfrac12\) 取值 \(\tfrac12\)(当 \(Y=0\)),以概率 \(\tfrac12\) 取值 \(\tfrac32\)(当 \(Y=1\))。它有自己的分布、期望与方差——既然是随机变量,就可以再对它取期望,这正是下一小节的主题。
(1) \(E[X\mid Y=y]\) 是一个数(\(y\) 固定后即确定),而 \(E[X\mid Y]\) 是随机变量;(2) \(E[X\mid Y]\) 只依赖 \(Y\),是 \(Y\) 的函数,因此它与 \(Y\) 的函数(例如 \(Y^2\)、\(h(Y)\))之间的关系可以用上一节的协方差工具研究;(3) 记号 \(E\bigl[E[X\mid Y]\bigr]\) 中,外层期望是按 \(Y\) 的分布取的——其含义与威力见定理 1。
2. 全期望公式:分组平均的加权平均
全班同学的平均成绩等于什么?先分年级算出各年级的平均分(组内平均),再按各年级人数占比(组权重)做加权平均。用概率的语言:按 \(Y\) 的取值把样本分组,组内平均是 \(E[X\mid Y=y]\),组权重是 \(P(Y=y)\)。这一朴素思想就是本节的核心定理。
设 \(E[X]\) 存在,则 \[ E\bigl[E[X\mid Y]\bigr] \;=\; E[X], \] 即离散情形 \( \displaystyle E[X]=\sum_y E[X\mid Y=y]\,P(Y=y) \),连续情形 \( \displaystyle E[X]=\int_{-\infty}^{\infty} E[X\mid Y=y]\,f_Y(y)\,dy \)。
定理的威力在于"分而治之":当 \(X\) 的无条件分布难以直接写出,而在给定 \(Y=y\) 之后 \(X\) 的行为很简单时,先算条件期望,再对 \(Y\) 平均,往往一步到位。
某公共选修课学生的每周锻炼时长为 \(X\)(小时),按年级 \(Y\) 分层:大一(\(Y=1\))占 \(1/2\),组内平均 \(2\) 小时;大二(\(Y=2\))占 \(1/3\),组内平均 \(3\) 小时;大三(\(Y=3\))占 \(1/6\),组内平均 \(8\) 小时。求 \(E[X]\),并写出随机变量 \(E[X\mid Y]\) 的分布。
| \(E[X\mid Y]\) 的取值 | \(2\) | \(3\) | \(8\) |
|---|---|---|---|
| 概率 | \(1/2\) | \(1/3\) | \(1/6\) |
设 \((X,Y)\) 的联合密度为 \(f(x,y)=x+y\),\(0<x<1\),\(0<y<1\)(6.5 节的例)。求 \(E[X\mid Y=y]\),并用两条不同路径计算 \(E[X]\),验证全期望公式。
例 2 中最常见的错误是误把 \(Y\) 当作 \((0,1)\) 上的均匀分布,直接计算 \(\int_0^1 \frac{2+3y}{3+6y}\,dy=\frac12+\frac{\ln 3}{12}\approx 0.5916\),与正确值 \(7/12\approx 0.5833\) 不符。全期望公式中的外层平均必须按 \(Y\) 的真实分布加权——组权重错了,加权平均自然就错了。
3. 自引用方程:矿工问题与几何期望
有一类"首达"问题具有自相似结构:一旦第一步失败,过程便原样重来,剩余局面与起初完全相同。此时以第一步的结果为条件,未知期望 \(E\) 会同时出现在方程两边,得到形如 \(E=g(E)\) 的自引用方程(self-referencing equation);解出它即得答案。这一技巧又称首步条件化(first-step conditioning)。
一名矿工被困在矿井中,面前有三道门。走门 1 可在 2 小时后直达出口;走门 2 或门 3,都各需 3 小时行走,但尽头通往别处,最终将返回原地。矿工面前一片漆黑,每次都等可能地(且互不记住教训地)从三道门中任选一道。问他平均需要多少小时才能走出矿井?
重复进行独立试验,每次成功概率为 \(p\),\(0<p<1\)。设 \(X\) 为直到首次成功所需的试验次数(几何分布)。用首步条件化证明 \(E[X]=\dfrac1p\)。
技巧成立的关键是"失败后局面统计上复原":剩余过程的分布与原过程相同(如独立重复试验、矿工回到原地)。若失败会改变后续规则(例如矿工会记住走过的死门),自环便不复存在,方程 \(E=g(E)\) 也就不再成立——那时需另行建模。
4. 随机个随机变量之和
保险公司的总赔付是"随机多笔赔付"之和:赔案件数 \(N\) 本身是随机的,第 \(i\) 笔金额为 \(X_i\)。7.2 节的线性性只处理固定项数的和,这里的项数 \(N\) 却是随机变量——全期望公式恰好能对付这种随机和(random sum)。
设 \(N\) 为取非负整数值的随机变量,\(X_1,X_2,\dots\) 独立同分布且与 \(N\) 独立,\(E[N]\) 与 \(E[X]\) 均有限。则 \[ E\!\left[\sum_{i=1}^{N} X_i\right] = E[N]\,E[X]. \]
某商场一天的顾客数 \(N\) 的均值为 \(10\)(例如泊松到达);每位顾客的消费额独立同分布,均值 \(30\) 元,且消费与顾客数相互独立。求一天总营业额 \(\sum_{i=1}^{N}X_i\) 的期望。
定理 2 中 "\(N\) 与诸 \(X_i\) 独立"可以放宽:若 \(N\) 是一个停时(stopping time)——是否在时刻 \(k\) 停止只依赖已观察到的 \(X_1,\dots,X_k\)(如"连续两次盈利即收手")——结论仍成立,这就是 Wald 等式(Wald's equation)。但若停止规则"偷看未来",或 \(N\) 与 \(X_i\) 通过第三方因素相关(如天气既让顾客变多又让客单价升高),则 \(E[N]E[X]\) 一般不再等于随机和的期望,需直接用全期望公式重新计算。
5. 选学:条件方差与全方差公式
与条件期望平行,条件分布的方差称为条件方差,它同样先按 \(Y\) 分层,再用全期望公式汇总,得到一个优美的方差分解。
\[ \operatorname{Var}(X\mid Y=y)=E\bigl[(X-E[X\mid Y=y])^2\,\big|\,Y=y\bigr], \qquad \operatorname{Var}(X\mid Y)=E\bigl[(X-E[X\mid Y])^2\,\big|\,Y\bigr]. \] 即以 \(E[X\mid Y]\) 为中心的条件二阶中心矩;\(\operatorname{Var}(X\mid Y)\) 同样是随机变量(\(Y\) 的函数)。
\[ \operatorname{Var}(X)=E\bigl[\operatorname{Var}(X\mid Y)\bigr]+\operatorname{Var}\bigl(E[X\mid Y]\bigr). \]
直观读法:总方差 = 组内方差的平均(\(Y\) 已知后仍剩下的波动)+ 组均值之间的方差(\(Y\) 的取值不同导致的中心漂移)。信息 \(Y\) 能"解释"掉的是第二项;\(Y\) 与 \(X\) 越相关,组均值散得越开,第二项越大。
某元件等可能来自两个供应商:来自供应商 1 时寿命均值为 \(2\)、方差为 \(1\);来自供应商 2 时寿命均值为 \(4\)、方差为 \(3\)(单位:千小时)。任取一件,用全方差公式求其寿命 \(X\) 的方差,并直接验证。
6. 本节小结
- \(E[X\mid Y=y]\) 是 \(y\) 的函数(一个数);\(E[X\mid Y]=g(Y)\) 是随机变量,可继续对它取期望、求方差。
- 全期望公式 \(E[X]=E[E[X\mid Y]]\):先按 \(Y\) 分组求组内平均,再按 \(P(Y=y)\)(或 \(f_Y(y)\))加权平均;证明的本质是交换求和(积分)次序。
- 自引用方程:对"失败即原样重来"的过程,以第一步为条件得 \(E=g(E)\)——矿工问题 \(E=8\) 小时、几何分布 \(E=1/p\)。
- 随机和:\(E\bigl[\sum_{i=1}^{N}X_i\bigr]=E[N]\,E[X]\)(\(N\) 与诸 \(X_i\) 独立;停时情形为 Wald 等式);商场例:\(10\times30=300\) 元。
- (选学)全方差公式:\(\operatorname{Var}(X)=E[\operatorname{Var}(X\mid Y)]+\operatorname{Var}(E[X\mid Y])\),即"组内方差平均 + 组间方差"。
- 条件期望不只是计算技巧:\(E[X\mid Y]\) 还是"用 \(Y\) 预测 \(X\)"的均方最优预测——这正是 7.5 节的主题。
练习
练习 7-4-1
重复掷一枚均匀骰子直到首次出现 6。设 \(X\) 为首次出现 6 之前"非 6 点"出现的次数。用自引用方程求 \(E[X]\)。
答案与提示以第一掷为条件:第一掷是 6(概率 \(1/6\))时 \(X=0\);不是 6(概率 \(5/6\))时非 6 次数已累计 1,且剩余局面复原:\[ E=\frac16\cdot 0+\frac56(1+E) \;\Longrightarrow\; \frac16 E=\frac56 \;\Longrightarrow\; E=5. \]与几何分布对照:失败次数的均值 \(q/p=(5/6)/(1/6)=5\),加上最后一次成功共掷 \(5+1=6\) 次,与例 4 一致。
练习 7-4-2
掷两颗均匀骰子,\(X\)、\(Y\) 分别为第一、第二颗的点数。已知第一颗点数为 4,求点数和的条件期望 \(E[X+Y\mid X=4]\)。
答案与提示由独立性与线性性,\(E[X+Y\mid X=4]=4+E[Y]=4+3.5=7.5\)。已知第一颗的信息只"锁定"了和式中的一项,另一项仍按自身均值贡献——条件期望保持线性。
练习 7-4-3
设 \(X\) 服从 \((0,1)\) 上的均匀分布;给定 \(X=x\) 时,\(Y\) 的条件分布是 \((0,x)\) 上的均匀分布。用全期望公式求 \(E[Y]\)。
答案与提示先算组内平均 \(E[Y\mid X=x]=\dfrac{x}{2}\),再对 \(X\) 平均:\[ E[Y]=E\bigl[E[Y\mid X]\bigr]=E\!\left[\frac{X}{2}\right]=\frac14. \]直接积分 \(\int_0^1\!\int_0^x \frac{y}{x}\,dy\,dx\) 同样得 \(1/4\)。注意 \(E[Y]\neq E[X]/2\) 之类的"想当然"必须经过全期望公式才算数。
练习 7-4-4
设 \(P(X=0,Y=1)=P(X=1,Y=1)=P(X=2,Y=1)=\dfrac16\),\(P(X=4,Y=2)=P(X=6,Y=2)=\dfrac14\)。求 \(E[X\mid Y=y]\)(\(y=1,2\)),写出 \(E[X\mid Y]\) 的分布,并用两条路径验证 \(E[X]=3\)。
答案与提示\(P(Y=1)=\frac12\),\(P(Y=2)=\frac12\)。组内平均:\(E[X\mid Y=1]=\frac{0+1+2}{3}=1\),\(E[X\mid Y=2]=\frac{4+6}{2}=5\)。故 \(E[X\mid Y]\) 以 \(\frac12\) 取 \(1\)、\(\frac12\) 取 \(5\)。路径一:\(E[E[X\mid Y]]=\frac12\times1+\frac12\times5=3\);路径二(直接按联合分布列):\(E[X]=\frac{0+1+2}{6}+\frac{4+6}{4}=\frac12+\frac52=3\)。一致。