第 4 章 · 随机变量

4.4 随机变量函数的期望

Expectation of a Function of a Random Variable
学习目标
  • 说明随机变量的函数 \(g(X)\) 仍是随机变量,并会按“映到同一 \(y\) 则概率相加”写出其分布列;
  • 陈述并运用核心定理 \(E[g(X)]=\sum_x g(x)p(x)\),解释它为何无需先求 \(Y=g(X)\) 的分布;
  • 运用线性性 \(E[ag(X)+bh(X)+c]=aE[g(X)]+bE[h(X)]+c\) 计算复合表达的期望;
  • 熟练计算 \(E[X^2]\)、\(E[(X-\mu)^2]\) 等平方型期望,为下一节的方差做准备;
  • 辨析 \(E[g(X)]\) 与 \(g(E[X])\):只有仿射函数可以交换期望与变换的顺序。

1. 随机变量的函数:从赔付封顶说起

4.3 节解决了“随机变量自身的期望怎么算”。然而应用中我们真正关心的量,往往是随机变量的某个函数:保险公司规定“单次事故赔付封顶 20 千元”,赔付额就是损失 \(X\) 的函数 \(g(X)=\min(X,20)\);商家的利润是销量 \(X\) 的函数;度量数据围绕均值的散布时,我们会遇上 \((X-\mu)^2\)。一般地,设 \(g:\mathbb{R}\to\mathbb{R}\) 是给定的实值函数:当试验结果使 \(X\) 取值 \(x\) 时,量 \(g(X)\) 就随之确定为 \(g(x)\)。也就是说,\(g(X)\) 把每个样本点先经 \(X\) 数值化、再经 \(g\) 加工,仍是定义在样本空间上的实值函数——它当然还是一个随机变量,称为随机变量的函数(function of a random variable)。

既然 \(Y=g(X)\) 是随机变量,它就有自己的分布列,从而可以按 4.3 节的定义求期望。先把分布列写清楚。

定义 1 随机变量的函数的分布列

设离散型随机变量 \(X\) 的分布列为 \(p(x)\),\(g\) 为实值函数,则 \(Y=g(X)\) 的分布列为 \[ P(Y=y)=\sum_{x:\,g(x)=y} p(x), \] 即把所有满足 \(g(x)=y\) 的 \(x\) 的概率相加。

若 \(g\) 是一一对应,只需把取值直接替换(\(p_Y(g(x))=p(x)\);见 4.9 节的系统讨论);若 \(g\) 是多对一,则概率发生合并。例如掷一颗骰子令 \(g(x)=(x-3.5)^2\):六个 \(x\) 只映成三个 \(y\) 值 \(6.25,\,2.25,\,0.25\),每个 \(y\) 由两个 \(x\) 合并而成,概率相加得 \(2/6=1/3\)。

如果目的不止于期望,而是需要 \(Y\) 的完整分布(例如计算某个 \(P(Y\le y)\)),就得老老实实按定义 1 做替换与合并。但本节的主题是一个出人意料的好消息:求 \(E[g(X)]\) 时,“先求 \(Y\) 的分布”这一步可以整个跳过

2. 核心定理:先变换,再加权

下面的定理是本节的核心,也是第 7 章“期望的性质”整个工具箱的第一块基石。

定理 1 随机变量函数的期望

设离散型随机变量 \(X\) 的分布列为 \(p(x)\),实值函数 \(g\) 满足 \(\sum_x |g(x)|\,p(x)<\infty\)(保证无穷级数与求和顺序无关),则 \[ E[g(X)] \;=\; \sum_x g(x)\,p(x). \]

证明记 \(Y=g(X)\),其全部可能取值为 \(y_1,y_2,\dots\)。按 4.3 节的定义与定义 1, \[ E[Y]=\sum_j y_j\,P(Y=y_j)=\sum_j y_j \sum_{x:\,g(x)=y_j} p(x). \] 在内层求和的范围内,每个 \(x\) 都满足 \(g(x)=y_j\),故可用 \(g(x)\) 替换 \(y_j\): \[ E[Y]=\sum_j \sum_{x:\,g(x)=y_j} g(x)\,p(x). \] 诸集合 \(\{x: g(x)=y_j\}\) 互不相交,且并起来恰是 \(X\) 的全部取值——把双重求和按 \(y\) 合并同类项后,每个 \(x\) 恰好出现一次,于是 \[ E[Y]=\sum_x g(x)\,p(x). \qquad\blacksquare \]

定理的算法可以概括为六个字:先变换,再加权。加权只认 \(X\) 原来的取值 \(x\),概率 \(p(x)\) 原样搬用,变换只作用在数值上;当多个 \(x\) 映到同一个 \(y\) 时,相当于求和过程中自动完成了“合并同类项”——这正是证明里绕开 \(p_Y\) 的关键。图 1 以掷骰子、\(g(x)=x^2\) 为例展示这一过程。

先变换,再加权:以掷骰子、g(x) = x² 为例 X g(X) 1/61/61/6 1/61/61/6 123 456 149 162536 1/61/61/6 1/61/61/6 概率沿映射“原样带走”;若多个 x 映到同一个 y,则概率相加(合并同类项) E[X²] = (1 + 4 + 9 + 16 + 25 + 36) × 1/6 = 91/6 ≈ 15.17
图 1:“先变换,再加权”映射示意。上排是 \(X\) 的取值及其概率,箭头表示函数 \(g\) 的作用,下排是 \(g(X)\) 的取值——每个新值沿用的仍是原来的概率 \(p(x)\),无需关心 \(g(X)\) 的分布长什么样。
例 1 掷骰子的 \(E[X^2]\)

掷一颗均匀骰子,\(X\) 为所得点数。求 \(E[X^2]\),并与 \((E[X])^2\) 比较。

每个点数概率为 \(1/6\),由定理 1 直接对 \(x^2\) 加权: \[ E[X^2]=\sum_{k=1}^{6} k^2\cdot\frac{1}{6}=\frac{1+4+9+16+25+36}{6}=\frac{91}{6}\approx 15.17. \] 而 \(E[X]=3.5\),故 \((E[X])^2=3.5^2=12.25\)。两者不相等:先平方再平均,比先平均再平方大 \(91/6-12.25=35/12\approx 2.92\)——这个差正是骰子的“方差”,见第 4 小节与 4.5 节。若不用定理 1,就得先写出 \(Y=X^2\) 的分布列(本例是一一对应,尚且好写),多做一步而无任何收益。
例 2 保险赔付的封顶条款

某保单一年内的事故损失 \(X\)(千元)的分布为 \(P(X=0)=0.80\),\(P(X=10)=0.15\),\(P(X=50)=0.05\)。保险合同规定赔付限额 20 千元,即实际赔付 \(g(X)=\min(X,20)\)。求期望赔付额;并与不设封顶时的期望损失比较。

三个取值经 \(g\) 作用后为 \(g(0)=0\),\(g(10)=10\),\(g(50)=\min(50,20)=20\),概率照旧使用。由定理 1 并借助表 1 逐项计算: \[ E[g(X)]=0\times 0.80+10\times 0.15+20\times 0.05=1.5+1.0=2.5\ \text{(千元)}. \] 不设封顶时的期望损失为 \(E[X]=0\times 0.80+10\times 0.15+50\times 0.05=4.0\) 千元。封顶条款使期望赔付减少 \(4.0-2.5=1.5\) 千元(恰等于被截掉部分的期望 \(E[X-g(X)]\))。若保险公司只看期望收支平衡,保费应高于 2.5 千元——这与 4.3 节彩票例子的决策逻辑一致;当然,大额损失发生的可能性同样值得关注,这类“风险大小”的度量正是方差的主题。
表 1:封顶赔付 \(g(x)=\min(x,20)\) 的期望计算(单位:千元)
损失 \(x\)\(p(x)\)赔付 \(g(x)\)\(g(x)\,p(x)\)
00.8000.00
100.15101.50
500.05201.00
合计1.002.50
例 3 掷 3 枚硬币求 \(E[2^X]\)

掷 3 枚均匀硬币,\(X\) 为正面个数。求 \(E[2^X]\)。

\(X\) 的分布列为 \(P(X=k)=\binom{3}{k}/8\),\(k=0,1,2,3\)(见 4.2 节例 1)。对 \(g(x)=2^x\) 应用定理 1: \[ E[2^X]=\frac{1}{8}\Big(2^0\binom{3}{0}+2^1\binom{3}{1}+2^2\binom{3}{2}+2^3\binom{3}{3}\Big)=\frac{1\times 1+2\times 3+4\times 3+8\times 1}{8}=\frac{27}{8}=3.375. \] 顺便一提:由二项定理 \(\sum_k \binom{3}{k}2^k=(1+2)^3=27\),故 \(E[2^X]=(3/2)^3\),展开即 \(27/8\),与逐项求和一致。这种“对 \(t^X\) 取期望”的结构将在第 7 章的矩母函数中重现。

3. 线性性:期望是一个线性算子

把 \(E[\cdot]\) 看成一台机器:吃进一个随机变量,吐出一个数。这样的“机器”在数学上称为算子(operator)。定理 1 立刻给出这台算子最重要的品质——线性性(linearity):它与加法、数乘可以自由交换顺序。

定理 2 期望的线性性

设 \(a,b,c\) 为常数,\(g,h\) 为实值函数且诸期望存在,则 \[ E\big[a\,g(X)+b\,h(X)+c\big]=a\,E[g(X)]+b\,E[h(X)]+c. \]

证明注意 \(a\,g(X)+b\,h(X)+c\) 本身也是 \(X\) 的函数,对它应用定理 1,再利用有限和的分配律与规范性 \(\sum_x p(x)=1\): \[ \begin{aligned} E\big[a\,g(X)+b\,h(X)+c\big] &= \sum_x \big(a\,g(x)+b\,h(x)+c\big)p(x) \\ &= a\sum_x g(x)p(x)+b\sum_x h(x)p(x)+c\sum_x p(x) \\ &= a\,E[g(X)]+b\,E[h(X)]+c. \qquad\blacksquare \end{aligned} \]

两个常用特例:取 \(g(X)=X\)、\(h\equiv 0\),得 \(E[aX+b]=aE[X]+b\),即 4.3 节的性质;取 \(g(X)=(X-\mu)^2\) 展开可得 \(E[(X-\mu)^2]=E[X^2]-\mu^2\)(见第 4 小节)。线性性对任意有限多个函数同样成立,其求和版本是第 7 章的主力工具。图 2 把“先分别取期望、再作同一线性组合”画成一张流程图。

期望是线性算子:先分别取期望,再作同一线性组合 X 的分布列 p(x) E[g(X)] Σ g(x)p(x) E[h(X)] Σ h(x)p(x) a·E[g(X)] + b·E[h(X)] + c × a × b 例:掷骰子 E[2X² + 3X + 1] = 2 × 91/6 + 3 × 3.5 + 1 = 251/6 ≈ 41.83
图 2:线性性示意。同一份分布列 \(p(x)\) 分别对 \(g\)、\(h\) 加权求和得到两个期望,再按系数 \(a\)、\(b\) 缩放并平移 \(c\)——“取期望”与“线性组合”两道工序可以交换顺序。
注记 期望不能与任意函数交换

定理 2 只对仿射组合(系数乘、相加、加常数)有效,切莫推广过头:一般地 \(E[g(X)]\neq g(E[X])\)。骰子便是一例:\(E[X^2]=91/6\approx 15.17\),而 \((E[X])^2=12.25\)。直观原因:\(x^2\) 是弯曲的,它放大远离均值的取值;先取平均则把这种不对称抹平了。当 \(g\) 为凸函数时,不等号方向有保证:\(E[g(X)]\ge g(E[X])\)(Jensen 不等式)。有趣的是,骰子例子中两值之差 \(91/6-12.25=35/12\) 恰好就是下一节要定义的方差。

4. 通向方差:\(E[X^2]\) 的角色

4.3 节的投资练习已经表明:期望相同不代表风险相同。要度量风险,自然的想法是看 \(X\) 偏离均值 \(\mu=E[X]\) 的平均幅度;为避免正负偏差互相抵消,先平方、再取期望,即考察 \(E[(X-\mu)^2]\)。本节的两个定理恰好为它备齐了工具:定理 1 说明这个量可以直接对 \((x-\mu)^2\) 加权求和,完全不必先求 \((X-\mu)^2\) 的分布(回忆第 1 小节:那个分布需要把六个点合并成三个,颇费笔墨);定理 2 则给出另一条路——把平方展开: \[ E[(X-\mu)^2]=E[X^2-2\mu X+\mu^2]=E[X^2]-2\mu\,E[X]+\mu^2=E[X^2]-\mu^2. \]

用骰子验算:直接加权得 \(E[(X-3.5)^2]=(2.5^2+1.5^2+0.5^2)\times 2/6=17.5/6=35/12\approx 2.9167\);间接用公式得 \(E[X^2]-\mu^2=91/6-12.25=35/12\)。两条路完全一致。这个量就是 4.5 节将要定义的方差(variance),而“先算 \(E[X^2]\)、再减 \(\mu^2\)”正是它的标准算法——本节例 1 的结果 \(91/6\) 已经把最费手的一步算完了。

5. 本节小结

要点回顾
  • \(Y=g(X)\) 仍是随机变量,其分布列按 \(y\) 合并概率:\(P(Y=y)=\sum_{x:\,g(x)=y}p(x)\)(定义 1)。
  • 核心定理:\(E[g(X)]=\sum_x g(x)p(x)\)——先变换,再加权,无需先求 \(Y=g(X)\) 的分布;证明要点是按 \(y\) 合并同类项(定理 1)。
  • 线性性:\(E[ag(X)+bh(X)+c]=aE[g(X)]+bE[h(X)]+c\);期望是一个线性算子,但只对仿射组合有效,\(E[g(X)]\neq g(E[X])\)(如 \(E[X^2]>(E[X])^2\))(定理 2)。
  • 典型计算:骰子 \(E[X^2]=91/6\approx 15.17\);封顶赔付 \(E[\min(X,20)]=2.5\) 千元;掷 3 枚硬币 \(E[2^X]=27/8=3.375\)。
  • 为方差铺路:\(E[(X-\mu)^2]=E[X^2]-\mu^2\);骰子 \(91/6-3.5^2=35/12\approx 2.9167\),正是 4.5 节的方差。

练习

练习 4-4-1

掷一颗均匀骰子:(a) 用定理 1 求 \(E[X^2]\);(b) 直接对 \((x-3.5)^2\) 加权求 \(E[(X-3.5)^2]\);(c) 验证 \(E[(X-3.5)^2]=E[X^2]-3.5^2\),并说明这个数值与 4.5 节的方差有何关系。

答案与提示

(a) \(E[X^2]=91/6\approx 15.17\)。(b) 偏差为 \(\pm 2.5,\pm 1.5,\pm 0.5\),故 \(E[(X-3.5)^2]=(6.25+2.25+0.25)\times 2/6=17.5/6=35/12\approx 2.9167\);注意这里六个 \(x\) 只映成三个平方值,概率需两两合并。(c) \(91/6-12.25=15.1667-12.25=2.9167=35/12\),两法一致;\(35/12\) 正是 4.5 节将定义的骰子方差 \(\mathrm{Var}(X)\),届时可直接核对。

练习 4-4-2

掷一颗均匀骰子,求平均绝对偏差 \(E[|X-3|]\),并与练习 1 的平方偏差比较。

答案与提示

\(|X-3|\) 的取值为 \(2,1,0,1,2,3\),故 \(E[|X-3|]=(2+1+0+1+2+3)/6=9/6=1.5\)。它度量“平均偏离多少个点数”;与平方偏差 \(35/12\approx 2.92\) 相比,绝对偏差对极端值不那么敏感(平方会放大远端的偏差)。

练习 4-4-3

利用定理 1 证明线性性:\(E[ag(X)+bh(X)+c]=aE[g(X)]+bE[h(X)]+c\),并指出证明中哪里用到了规范性 \(\sum_x p(x)=1\)。

答案与提示

对函数 \(ag+bh+c\) 应用定理 1,得 \(\sum_x [ag(x)+bh(x)+c]p(x)\);由分配律拆成 \(a\sum g(x)p(x)+b\sum h(x)p(x)+c\sum p(x)\);最后一步 \(\sum_x p(x)=1\) 使常数项 \(c\) 从加权求和中“全身而退”,只留下 \(c\) 本身——这正是平移不影响线性结构的根源。

练习 4-4-4

设 \(X\) 的分布列为 \(p(x)=x/21\),\(x=1,2,\dots,6\)(4.3 节例 3 已算得 \(E[X]=91/21\approx 4.33\))。求 \(E[X^2]\) 与 \(E[1/X]\),并检验 \(E[1/X]\) 是否等于 \(1/E[X]\)。

答案与提示

\(E[X^2]=\sum x^2\cdot\frac{x}{21}=\frac{1+8+27+64+125+216}{21}=\frac{441}{21}=21\)(此值将在 4.5 节例 3 中用于求方差)。\(E[1/X]=\sum \frac{1}{x}\cdot\frac{x}{21}=\frac{6}{21}=\frac{2}{7}\approx 0.286\);而 \(1/E[X]=21/91\approx 0.231\),两者不等——再次印证期望只与线性函数交换,取倒数(凸与凹并存的非线性)不行。