- 说明连续情形下不能用 \(P(X\le x\,|\,Y=y)\) 直接定义条件分布的原因,并借助微小事件推导条件密度公式;
- 由联合密度与边缘密度计算条件密度 \(f_{X|Y}(x|y)\),并验证它是合法密度(非负、积分为 1);
- 计算条件期望 \(E[X\,|\,Y=y]\),并阐明 \(E[X\,|\,Y]\) 作为 \(Y\) 的函数是一个随机变量;
- 用全期望公式 \(E\big[E[X\,|\,Y]\big]=E[X]\) 完成数值验证与概率计算;
- 刻画独立情形下"条件分布 = 无条件分布",并与 6.2 节的独立性判别法相互印证。
1. 从"切片"到条件密度
在 6.4 节中,我们对离散型随机向量定义了条件分布列 \(p_{X|Y}(x|y)=p(x,y)/p_Y(y)\):固定 \(y\),把联合分布列的某一列除以该列之和 \(p_Y(y)\) 即得。连续情形遇到了一个新困难:连续型随机变量取任何单点的概率为零,\(P(Y=y)=0\),因此 \(P(X\le x\,|\,Y=y)\) 不能再按条件概率的比值定义——分子与分母同时为零。出路是"退半步":先让 \(Y\) 落在 \(y\) 附近的一个小区间上,再看比值,最后让区间长度趋于零。
设 \((X,Y)\) 有联合密度 联合密度函数(joint probability density function) \(f(x,y)\),\(Y\) 有边缘密度 \(f_Y(y)\)(其计算见 6.1 节)。当 \(dx,dy\) 很小时,略去高阶无穷小可得 \[ P(x < X \le x+dx \,\big|\, y < Y \le y+dy) = \frac{f(x,y)\,dx\,dy}{f_Y(y)\,dy} = \frac{f(x,y)}{f_Y(y)}\,dx. \] 与第 5 章"密度 × 区间长度 ≈ 概率"的读法对照,上式说明:在已知 \(Y\) 的取值约为 \(y\) 的条件下,\(X\) 的局部概率仍按某个关于 \(x\) 的密度分布,而这个密度恰是比值 \(f(x,y)/f_Y(y)\)。
这一公式也有直观的几何图像:联合密度曲面被平面 \(y=y_0\) 截出一条沿 \(x\) 方向的曲线——切片(slice)。切片 \(x\mapsto f(x,y_0)\) 本身一般不是密度:它下方的面积等于 \(\int f(x,y_0)\,dx=f_Y(y_0)\),未必是 1。把切片整体除以 \(f_Y(y_0)\)(归一化),便得到一条合法的密度曲线(图 1)。这正是离散情形"一列除以列和"的连续翻版——把求和换成了积分。
设 \((X,Y)\) 为连续型随机向量,联合密度为 \(f(x,y)\),\(Y\) 的边缘密度为 \(f_Y(y)\)。对一切使 \(f_Y(y)>0\) 的 \(y\),定义 \[ f_{X|Y}(x\,|\,y)=\frac{f(x,y)}{f_Y(y)},\qquad -\infty < x < \infty, \] 称为给定 \(Y=y\) 时 \(X\) 的条件密度(conditional density)。其支撑 \(\{x:\ f(x,y)>0\}\) 一般随 \(y\) 而变化。
借助条件密度,条件概率按通常方式定义:\(P(X\in A\,|\,Y=y)=\int_A f_{X|Y}(x|y)\,dx\)。同样可定义 \(f_{Y|X}(y|x)=f(x,y)/f_X(x)\)。
对每个使 \(f_Y(y)>0\) 的 \(y\),函数 \(x\mapsto f_{X|Y}(x|y)\) 非负且 \[ \int_{-\infty}^{\infty} f_{X|Y}(x\,|\,y)\,dx = 1. \]
既然 \(P(Y=y)=0\),严格讨论"以零概率事件为条件"需要测度论中的正则条件分布概念。本教程采取的等价处理是:把 \(f_{X|Y}(x|y)\) 理解为 \(\ P(X\in dx\,|\,y<Y\le y+dy)\) 当 \(dy\to 0\) 时的极限密度。可以验证,对书中遇到的一切例子,这两种方式给出相同而自洽的答案,可放心使用。
2. 条件期望:\(E[X\,|\,Y]\) 是 \(Y\) 的函数
有了条件密度,求条件期望只剩"把条件密度当普通密度求平均"这一步。
给定 \(Y=y\) 时 \(X\) 的条件期望(conditional expectation) 定义为 \[ E[X\,|\,Y=y] = \int_{-\infty}^{\infty} x\,f_{X|Y}(x\,|\,y)\,dx, \] 设右边绝对收敛。积分的结果不再含 \(x\),是 \(y\) 的函数,记作 \(h(y)\)。
接下来是本节最重要的视角转换:\(E[X\,|\,Y=y]\) 是一个数,而 \(y\) 只是随机变量 \(Y\) 的一个可能取值。让 \(y\) 跟随 \(Y\) 随机取值,便得到 \[ E[X\,|\,Y] = h(Y), \] 它是 \(Y\) 的函数,因而本身是一个随机变量(random variable)!这是初学者最常见的绊脚石:记号 \(E[X\,|\,Y]\) 不是数,在观察到 \(Y\) 之前它的取值并不确定。直观上,\(E[X\,|\,Y]\) 是"先用 \(Y\) 提供的信息对 \(X\) 做平均"的结果;7.4 节将证明:在所有 \(Y\) 的函数中,它是对 \(X\) 的最小均方误差预测。
设 \((X,Y)\) 的联合密度为 \(f(x,y)=x+y\)(\(0<x<1,\ 0<y<1\),其余处为 0)。(a) 求边缘密度 \(f_Y\);(b) 求条件密度 \(f_{X|Y}\) 并验证其合法性;(c) 求 \(E[X\,|\,Y=y]\) 与 \(E[X\,|\,Y]\)。
请严格区分:\(E[X\,|\,Y=y]\) 是数(\(y\) 的函数值);\(E[X\,|\,Y]=h(Y)\) 是随机变量(观察到 \(Y\) 之前取值不定);\(E[X]\) 是常数。三者由全期望公式 \(E\big[E[X\,|\,Y]\big]=E[X]\) 联系起来(见第 4 小节)。
3. 三角域上的均匀分布:条件均匀
当联合密度在支撑域上为常数(即区域上的均匀分布,见 6.1 节)时,条件分布呈现最简洁的形态:每个切片上的条件分布都是均匀分布。我们在 6.1、6.2 节反复使用的三角域上把一切算尽。
设 \((X,Y)\) 在 \(D=\{(x,y):\ 0<y<x<1\}\) 上均匀分布,即 \(f(x,y)=2\)(在 \(D\) 上)。求 \(f_{X|Y}\)、\(f_{Y|X}\)、\(E[X\,|\,Y=y]\) 与 \(E[Y\,|\,X=x]\)。
对照例 1 与例 2 颇有启发:例 1 的支撑是正方形,条件密度的形状(线性递增)不随 \(y\) 变,但高度与位置随 \(y\) 调整;例 2 的支撑是三角形,条件密度恒为均匀,但所在区间随条件值滑动。两种机制都使条件分布随 \(y\)(或 \(x\))变化,因而 \(X\) 与 \(Y\) 都不独立——这与 6.2 节"支撑非矩形必不独立""密度不可分离必不独立"的判别法完全一致。
| 项目 | 例 1:\(f=x+y\),\(0<x,y<1\) | 例 2:\(f=2\),\(0<y<x<1\) |
|---|---|---|
| \(f_Y(y)\) | \(y+\tfrac12\) | \(2(1-y)\) |
| \(f_{X|Y}(x|y)\) | \(\dfrac{x+y}{y+1/2}\),\(0<x<1\) | \(\dfrac{1}{1-y}\),\(y<x<1\)(均匀) |
| \(E[X|Y=y]\) | \(\dfrac{2+3y}{3+6y}\) | \(\dfrac{1+y}{2}\) |
| \(f_X(x)\) | \(x+\tfrac12\) | \(2x\) |
| \(f_{Y|X}(y|x)\) | \(\dfrac{x+y}{x+1/2}\),\(0<y<1\) | \(\dfrac{1}{x}\),\(0<y<x\)(均匀) |
| \(E[Y|X=x]\) | \(\dfrac{3x+2}{6x+3}\) | \(\dfrac{x}{2}\) |
| \(E[X]\),\(E[Y]\) | \(\tfrac{7}{12}\),\(\tfrac{7}{12}\) | \(\tfrac{2}{3}\),\(\tfrac{1}{3}\) |
4. 独立性与全期望公式
若 \(X\) 与 \(Y\) 独立,则"知道 \(Y\)"不提供关于 \(X\) 的任何信息,条件分布应当还原为无条件分布;反之,若对每个 \(y\) 条件密度都与 \(y\) 无关且等于边缘密度,则 \(X\) 与 \(Y\) 独立。
设 \(f_Y(y)>0\) 的 \(y\) 处处有定义。则 \(X\) 与 \(Y\) 独立,当且仅当对一切这样的 \(y\) 及一切 \(x\), \[ f_{X|Y}(x\,|\,y)=f_X(x). \] 此时有乘法重构 \(f(x,y)=f_Y(y)\,f_{X|Y}(x\,|\,y)=f_X(x)f_Y(y)\)。
设 \(f(x,y)=e^{-(x+y)}\)(\(x>0,\ y>0\))。求 \(f_{X|Y}\) 并与 \(f_X\) 比较。
\(E[X\,|\,Y]\) 是随机变量,于是它可以再求期望。所得的数与 \(E[X]\) 相同——这就是本节最重要的公式。
设 \(E\,|X|<\infty\),则 \[ E\big[E[X\,|\,Y]\big] = E[X]. \] (law of total expectation,又称重期望公式。)
在例 2 的三角域上,分别对 \(E[Y\,|\,X]\) 与 \(E[X\,|\,Y]\) 验证定理 3。
全期望公式给出了一种"分而治之"的算法:当 \(E[X]\) 难以直接积分时,先找一变量 \(Y\) 条件化(求 \(E[X\,|\,Y=y]\),往往只需均匀分布或一元密度),再对 \(Y\) 平均。练习 4 的概率计算即用此法。7.4 节将系统展开条件期望的性质(线性、取出已知变量、最小均方预测等)及其在随机个数求和等问题中的应用;本节只要求会算、会验证。
5. 本节小结
- 连续情形不能直接用 \(P(X\le x\,|\,Y=y)\)(因 \(P(Y=y)=0\)),应通过微小事件之比定义条件密度 \(f_{X|Y}(x|y)=f(x,y)/f_Y(y)\):切片除以切片的面积(=边缘密度值)。它是合法密度(定理 1),且 \(P(X\in A|Y=y)=\int_A f_{X|Y}\,dx\)。
- 条件期望 \(E[X\,|\,Y=y]=\int x\,f_{X|Y}(x|y)\,dx\) 是 \(y\) 的函数 \(h(y)\);\(E[X\,|\,Y]=h(Y)\) 是随机变量,与数 \(E[X\,|\,Y=y]\)、常数 \(E[X]\) 严格区分。
- 全期望公式:\(E\big[E[X\,|\,Y]\big]=E[X]\);三角域上 \(E[E[Y|X]]=E[X/2]=1/3=E[Y]\) 已数值验证。
- 独立 ⟺ 条件分布 = 无条件分布,且联合可由"边缘 × 条件"重构:\(f(x,y)=f_Y(y)f_{X|Y}(x|y)\)。
- 区域上的均匀分布,其条件分布是切片上的均匀分布:三角域 \(0<y<x<1\) 上 \(X|Y=y\sim U(y,1)\)(密度 \(1/(1-y)\)),\(Y|X=x\sim U(0,x)\)(密度 \(1/x\)),\(E[Y|X=x]=x/2\)。
练习
练习 6-5-1
在三角域 \(D=\{0<y<x<1\}\)(\(f=2\))上求 \(E[X\,|\,Y=y]\),并指出条件分布的类型。
答案与提示\(f_Y(y)=2(1-y)\),\(f_{X|Y}(x|y)=1/(1-y)\)(\(y<x<1\))与 \(x\) 无关,故 \(X|Y=y\sim U(y,1)\),\(E[X\,|\,Y=y]=(y+1)/2\)。切片越靠近顶端(\(y\) 越大)越短,条件均值越小。
练习 6-5-2
设 \(f(x,y)=e^{-(x+y)}\)(\(x>0,\ y>0\))。求 \(f_{X|Y}\) 与 \(f_X\),验证两者相等,并说明这蕴含什么。
答案与提示\(f_Y(y)=e^{-y}\),\(f_{X|Y}(x|y)=e^{-(x+y)}/e^{-y}=e^{-x}=f_X(x)\)(\(x>0\))。条件分布与无条件分布相同,由定理 2 知 \(X\) 与 \(Y\) 独立(与 6.2 节"密度可分离"的判别一致)。
练习 6-5-3
对例 1 的 \(f(x,y)=x+y\)(\(0<x,y<1\))验证全期望公式:分别计算 \(E\big[E[X\,|\,Y]\big]\) 与 \(E[X]\)。
答案与提示\(E\big[E[X\,|\,Y]\big]=\displaystyle\int_0^1\frac{2+3y}{3+6y}\Big(y+\frac12\Big)dy=\int_0^1\Big(\frac13+\frac y2\Big)dy=\frac13+\frac14=\frac{7}{12}\)(利用 \(3+6y=6(y+1/2)\) 约分);而 \(f_X(x)=x+\tfrac12\),\(E[X]=\int_0^1 x(x+\tfrac12)\,dx=\tfrac{7}{12}\)。两者相等,即图 3 虚线高度。
练习 6-5-4
在例 2 的三角域上,利用条件分布计算 \(P(Y<X/2)\),再用二重积分直接验证。
答案与提示给定 \(X=x\),\(Y|X=x\sim U(0,x)\),故 \(P(Y<x/2\,|\,X=x)=\tfrac{x/2}{x}=\tfrac12\),于是 \(P(Y<X/2)=E\big[\tfrac12\big]=\tfrac12\)(全期望公式用于概率)。直接验证:\(\int_0^1\!\int_0^{x/2}2\,dy\,dx=\int_0^1 x\,dx=\tfrac12\)。\(\checkmark\)