第 4 章 · 随机变量

4.3 期望

Expected Value
学习目标
  • 会按定义 \(E[X]=\sum x\,p(x)\) 逐项计算离散型随机变量的期望,并能说明"绝对收敛"这一条件的用意;
  • 从"概率加权平均""分布列的重心""长期重复试验的平均水平"三个角度解释期望的含义;
  • 辨析"期望"与"最可能取值":能举出期望不是任何可能取值的例子(掷骰子得 3.5);
  • 叙述并证明线性性质 \(E[aX+b]=aE[X]+b\),会用它避免重新求分布列;
  • 运用期望准则分析彩票、投资等实际问题,并初步认识该准则的局限(风险)。

1. 期望的定义

4.2 节的分布列完整地描述了一个离散型随机变量,但它是一张"清单":信息虽然齐全,却不便于直接比较和决策。我们往往需要一个单一的数字来概括分布的"中心位置"——平均每张彩票能赚多少钱?一部手机平均能用几年?赌徒平均每局输多少?这类问题的答案,就是本节的主题期望(expected value),又称均值(mean),记作 \(E[X]\) 或 \(\mu\)。

期望的定义可以从频率直观地引出。设想把试验独立重复 \(N\) 次:由频率的稳定性(其理论根据是第 8 章的大数定律),取值为 \(x\) 的次数大约占 \(N p(x)\),于是这 \(N\) 次观测值的算术平均大约是

\[ \frac{1}{N}\sum_x x\cdot N\,p(x) \;=\; \sum_x x\,p(x). \]

这个"以概率为权重的加权平均"就是期望的正式定义。

定义 1 期望

设离散型随机变量 \(X\) 的分布列为 \(p(x)=P(X=x)\)。若级数 \(\sum_{x:\,p(x)>0} |x|\,p(x)\) 收敛(即绝对收敛),则定义 \(X\) 的期望(expected value,又称均值)为 \[ E[X] \;=\; \sum_{x:\,p(x)>0} x\,p(x), \] 并记 \(\mu = E[X]\)。

期望是"概率加权平均":概率大的取值对结果的贡献大;若 \(\sum |x|\,p(x)=\infty\),则称 \(X\) 的期望不存在。注意当 \(X\) 只取有限多个值时(本节的大部分例子),绝对收敛自动满足,定义总是有效的。

注记 为什么要求"绝对收敛"

当 \(X\) 取可数无穷多个值时,期望由一个无穷级数给出。数学上著名的结论是:只有绝对收敛的级数,任意交换求和次序才不改变其和——这保证 \(E[X]\) 是分布本身的固有数字特征,而不依赖罗列取值的顺序。若级数只是条件收敛、或绝对值级数发散,期望便没有良定义。历史上著名的圣彼得堡悖论(St. Petersburg paradox)就是一个极端例子:掷一枚均匀硬币直到首次出现正面,若第 \(k\) 次才出现则获得 \(2^k\) 元奖金,其期望为 \(\sum_{k\ge 1} 2^k\cdot(1/2)^k=\sum_{k\ge 1} 1=\infty\)。"无穷期望"迫使人们反思:只用期望作决策是不够的(见本节练习 4)。

例 1 掷一颗骰子的期望

掷一颗均匀骰子,\(X\) 为掷出的点数,求 \(E[X]\)。

\(X\) 的分布列为 \(p(k)=1/6,\ k=1,2,\dots,6\)。按定义逐项求和(见表 1): \[ E[X] = \sum_{k=1}^{6} k\cdot\frac{1}{6} = \frac{1+2+3+4+5+6}{6} = \frac{21}{6} = 3.5. \] 由对称性也能直接看出这一结果:分布关于 3.5 对称,故期望恰为 \((1+6)/2=3.5\)。注意 3.5 根本不是 \(X\) 的可能取值——没有人能掷出 3.5 点,这个现象将在下一小节讨论。
表 1:掷骰子期望的逐项求和
点数 \(x\)\(p(x)\)\(x\,p(x)\)
1\(1/6\)0.1667
2\(1/6\)0.3333
3\(1/6\)0.5000
4\(1/6\)0.6667
5\(1/6\)0.8333
6\(1/6\)1.0000
合计\(1\)\(3.5\)

2. 如何理解期望:不是最可能值,而是重心与长期平均

期望不是最可能值。掷骰子的期望是 3.5,但谁也掷不出 3.5 点;彩票买家最可能的结局是"不中奖",但期望照样把中大奖的小概率折算了进去。换言之,期望不必是随机变量的可能取值,更不必是最可能的取值(后者称为众数,mode)。期望刻画的是分布的位置——把整个分布"压扁"成一个有代表性的数字,而不是预报单次试验的结果。

期望是分布列的重心。把 \(p(x)\) 想象成安放在数轴上坐标 \(x\) 处的质量,各处质量之和为 \(\sum p(x)=1\)。力学告诉我们,这组质点系的重心(center of mass)位于 \(\sum x\,p(x)\)——恰好是期望。以骰子为例:在位置 \(1,2,\dots,6\) 各放一个等质量(各 \(1/6\))的方块,把支点顶在 3.5 处,杠杆恰好水平平衡,因为支点两侧的合力矩相互抵消(图 1):

\[ \sum_{x} (x-\mu)\,p(x) \;=\; \sum_x x\,p(x) - \mu\sum_x p(x) \;=\; E[X]-\mu \;=\; 0. \]

1/6 1/6 1/6 1/6 1/6 1/6 1 2 3 4 5 6 重心 μ = E[X] = 3.5 支点(重心)处:杠杆恰好平衡 左方合力矩 (2.5+1.5+0.5)×1/6 = 0.75 = 右方合力矩 (0.5+1.5+2.5)×1/6 = 0.75 概率质量分布在数轴上,期望就是这组质量的平衡点
图 1:把骰子的分布列看成质量:6 个等质量(各 1/6)置于位置 1–6,支点顶在 3.5 处两侧力矩相等,杠杆水平平衡。期望是 pmf 的重心。

期望是长期重复试验的平均水平。设 \(X_1,X_2,\dots\) 是对同一试验的独立重复观测(每次的"复印件"of \(X\)),前 \(n\) 次的样本均值(sample mean)为 \(\bar X_n = (X_1+\cdots+X_n)/n\)。第 8 章的大数定律(law of large numbers)将严格证明:当 \(n\to\infty\) 时,\(\bar X_n\) 以越来越大的概率落在 \(\mu=E[X]\) 的任意小邻域内。图 2 展示了一次掷骰子模拟中 \(\bar X_n\) 的轨迹:初期大起大落,随后波幅收窄,稳定到 3.5 附近。赌场与保险公司的商业模式正建立在这一规律之上:单局盈亏随机,但海量重复之后,平均利润几乎必然贴近期望值。

1 2 3 4 5 6 1 10 20 30 40 50 60 平均点数 掷骰次数 n 第 1 次掷出 6:均值 6.0 初期波动剧烈 后期围绕 3.5 小幅波动 μ = 3.5
图 2:掷一颗均匀骰子 60 次的模拟:样本均值起初大起大落,随着次数增加波幅收窄,围绕期望 3.5 小幅波动(本例终值约 3.47)。当 n 无限增大时样本均值趋于 μ,这正是第 8 章大数定律的直观内容。

"长期平均"的解释也给出了期望在决策中的用法:比较不同方案的期望收益,选出平均意义下最优的一个。请看下面的经典例子。

例 2 彩票的期望净收益

某彩票共发行 1000 张,每张售价 1 元;其中恰有 1 张中奖,奖金 500 元。你购买了一张彩票,求你的净收益 \(X\) 的期望,并据此讨论"是否值得买"。

净收益 \(X\) 只有两个可能取值:中奖时为 \(500-1=499\) 元,概率 \(1/1000\);未中奖时为 \(-1\) 元,概率 \(999/1000\)。于是 \[ E[X] = 499\times\frac{1}{1000} + (-1)\times\frac{999}{1000} = \frac{499-999}{1000} = -0.5 \text{(元)}. \] 换个等价的算法:奖金的期望为 \(500\times(1/1000)=0.5\) 元,净收益期望 \(=0.5-1=-0.5\) 元——平均每买一张彩票亏 0.5 元。这并非偶然:主办方收入 \(1000\) 元、付出奖金 \(500\) 元,净赚的 \(500\) 元平摊到 1000 张彩票上,正是每张 \(-0.5\) 元。按期望准则,这是"不公平"的游戏;只有当售价降到 0.5 元/张(期望净收益为 0)时才是公平的。当然,买彩票买到的是"中大奖的小概率与乐趣",这已超出期望准则的讨论范围——但至少应当清楚:从平均意义看,这张彩票只值 0.5 元。
注记 期望概念的诞生

"按获胜概率分配赌金"的思想(见 1.1 节的赌金分配问题)经惠更斯(Huygens)于 1657 年提炼,在历史上第一部概率论著作《论赌博中的推理》中首次以"期望"之名给出正式表述:若以概率 \(p\) 获得 \(a\)、以概率 \(1-p\) 获得 \(b\),则这一随机处境的价值是 \(pa+(1-p)b\)——正是本节的概率加权平均。期望是概率论中最古老的核心概念之一,比概率的公理化(1933 年)早了近三百年。

3. 期望的性质:线性

随机变量常需经过线性变换:温度从摄氏换成华氏(\(1.8X+32\))、重量从千克换成克、给每次收益加一笔固定手续费等。变换后的期望如何变化?当然可以先求出 \(Y=aX+b\) 的分布列再按定义计算,但下面的定理说明大可不必——期望本身就是按同一线性规则变换的。

定理 1 期望的线性性质

设离散型随机变量 \(X\) 的期望存在,\(a\)、\(b\) 为任意常数,则 \[ E[aX+b] = a\,E[X] + b. \]

证明先看 \(a=0\):此时 \(aX+b\equiv b\) 是常数,\(E[b]=b\cdot 1=b=0\cdot E[X]+b\),结论成立。下设 \(a\ne 0\),此时 \(y=ax+b\) 与 \(x\) 一一对应,\(Y=aX+b\) 的分布列为 \(P(Y=ax+b)=p(x)\)。于是 \[ E[aX+b] = \sum_x (ax+b)\,p(x) = a\sum_x x\,p(x) + b\sum_x p(x) = a\,E[X] + b\cdot 1 = a\,E[X]+b, \] 其中第三个等号用了分布列的规范性 \(\sum_x p(x)=1\)。证毕。

定理 1 有几个常用特例:\(E[c]=c\)(常数的期望是它本身)、\(E[X+c]=E[X]+c\)、\(E[cX]=c\,E[X]\)。用重心的眼光看十分自然:把分布整体平移 \(b\),重心平移 \(b\);把分布拉伸 \(a\) 倍,重心也拉伸 \(a\) 倍。要提醒的是,本节只处理单个随机变量的线性变换;两个随机变量之和的线性性 \(E[X+Y]=E[X]+E[Y]\)(竟然无需独立性!)是威力更大的结果,将在第 7 章证明。下一节(4.4 节)先把本定理推广到一般函数 \(g(X)\) 的期望。

例 3 分布列 p(x) = x/21 的期望

设 \(X\) 的分布列为 \(p(x)=x/21,\ x=1,2,\dots,6\)。(a) 验证它确实是分布列并求 \(E[X]\);(b) 求 \(E[2X+1]\)。

(a) 规范性:\(\sum_{x=1}^{6} x/21 = (1+2+\cdots+6)/21 = 21/21 = 1\),且各值为正,确为分布列。按定义, \[ E[X] = \sum_{x=1}^{6} x\cdot\frac{x}{21} = \frac{1^2+2^2+3^2+4^2+5^2+6^2}{21} = \frac{91}{21} = \frac{13}{3} \approx 4.33. \] 该分布偏向较大的取值(概率随 \(x\) 递增),故期望 4.33 大于均匀情形的 3.5,与直觉相符。 (b) 无需重新求 \(2X+1\) 的分布列,直接用定理 1: \[ E[2X+1] = 2\,E[X]+1 = 2\times\frac{91}{21}+1 = \frac{203}{21} \approx 9.67. \] 顺带地,\(E[X-4] = \frac{91}{21}-4 = \frac{7}{21} = \frac{1}{3}\):分布整体左移 4 个单位,期望也恰好左移 4。

4. 本节小结

要点回顾
  • 定义:\(E[X]=\sum_{x:\,p(x)>0} x\,p(x)\),要求级数绝对收敛;记号 \(\mu\)。
  • 期望有三重含义:概率加权平均;分布列(pmf)的重心;长期独立重复试验中样本均值的稳定值(大数定律,第 8 章)。
  • 期望不是最可能取值:掷骰子 \(E[X]=3.5\),而 3.5 不可能取到。
  • 线性性质:\(E[aX+b]=aE[X]+b\)(定理 1,已证);特例 \(E[c]=c\)。
  • 期望是"平均意义下"的决策准则(彩票每张期望净收益 \(-0.5\) 元);但它不刻画取值的波动与风险——这正是 4.5 节方差的动机。

练习

练习 4-3-1

掷两颗均匀骰子,\(X\) 为点数之和,求 \(E[X]\)。

答案与提示

36 个等可能结果,\(E[X]=\frac{1}{36}\sum_{i=1}^{6}\sum_{j=1}^{6}(i+j)=\frac{6\times 21+6\times 21}{36}=\frac{252}{36}=7\)(也可用 4.1 节的分布表逐项求和)。点数和的期望恰是单骰期望 3.5 的两倍——这是"和的期望等于期望之和"(第 7 章线性性)的雏形。

练习 4-3-2

设 \(P(X=0)=\frac{1}{5},\ P(X=1)=\frac{3}{10},\ P(X=2)=\frac{2}{5},\ P(X=4)=\frac{1}{10}\)。求 \(E[X]\) 与 \(E[3X-2]\)。

答案与提示

先验证概率之和为 1。\(E[X]=0\times\frac15+1\times\frac3{10}+2\times\frac25+4\times\frac1{10}=0.3+0.8+0.4=1.5\);再用定理 1:\(E[3X-2]=3\times 1.5-2=2.5\)。

练习 4-3-3

(期望决策)基金只能在两个一年期项目中选一个:方案 A 稳定获利 100 万元;方案 B 以概率 0.5 获利 240 万元、以概率 0.5 分文不赚。(a) 按期望最大准则应选哪个?(b) 举出一个现实中宁可选 A 的合理理由。

答案与提示

(a) \(E[A]=100\),\(E[B]=0.5\times 240+0.5\times 0=120\),期望准则选 B。(b) B 有 50% 的可能颗粒无收:若这笔钱是"救命钱"、基金靠稳定现金流维持运转、或委托人极度厌恶损失,确定的 100 万更可取。期望准则只看平均、无视波动,而波动的度量正是 4.5 节的方差。

练习 4-3-4

(反例思考)构造两个期望同为 100 的随机变量,使其中一个几乎总在 100 附近、另一个大起大落,并由此说明只用期望刻画分布的局限。

答案与提示

例如 \(X\):\(P(X=99)=P(X=101)=\frac12\);\(Y\):\(P(Y=0)=P(Y=200)=\frac12\)。两者期望都是 100,但 \(X\) 与均值只差 \(\pm 1\),\(Y\) 却偏差 \(\pm 100\)——风险迥异。度量"围绕均值的平均偏离"需要 \(\mathrm{Var}(X)=E[(X-\mu)^2]\)(本例分别为 1 与 10000),详见 4.5 节