- 会按定义 \(E[X]=\sum x\,p(x)\) 逐项计算离散型随机变量的期望,并能说明"绝对收敛"这一条件的用意;
- 从"概率加权平均""分布列的重心""长期重复试验的平均水平"三个角度解释期望的含义;
- 辨析"期望"与"最可能取值":能举出期望不是任何可能取值的例子(掷骰子得 3.5);
- 叙述并证明线性性质 \(E[aX+b]=aE[X]+b\),会用它避免重新求分布列;
- 运用期望准则分析彩票、投资等实际问题,并初步认识该准则的局限(风险)。
1. 期望的定义
4.2 节的分布列完整地描述了一个离散型随机变量,但它是一张"清单":信息虽然齐全,却不便于直接比较和决策。我们往往需要一个单一的数字来概括分布的"中心位置"——平均每张彩票能赚多少钱?一部手机平均能用几年?赌徒平均每局输多少?这类问题的答案,就是本节的主题期望(expected value),又称均值(mean),记作 \(E[X]\) 或 \(\mu\)。
期望的定义可以从频率直观地引出。设想把试验独立重复 \(N\) 次:由频率的稳定性(其理论根据是第 8 章的大数定律),取值为 \(x\) 的次数大约占 \(N p(x)\),于是这 \(N\) 次观测值的算术平均大约是
\[ \frac{1}{N}\sum_x x\cdot N\,p(x) \;=\; \sum_x x\,p(x). \]
这个"以概率为权重的加权平均"就是期望的正式定义。
设离散型随机变量 \(X\) 的分布列为 \(p(x)=P(X=x)\)。若级数 \(\sum_{x:\,p(x)>0} |x|\,p(x)\) 收敛(即绝对收敛),则定义 \(X\) 的期望(expected value,又称均值)为 \[ E[X] \;=\; \sum_{x:\,p(x)>0} x\,p(x), \] 并记 \(\mu = E[X]\)。
期望是"概率加权平均":概率大的取值对结果的贡献大;若 \(\sum |x|\,p(x)=\infty\),则称 \(X\) 的期望不存在。注意当 \(X\) 只取有限多个值时(本节的大部分例子),绝对收敛自动满足,定义总是有效的。
当 \(X\) 取可数无穷多个值时,期望由一个无穷级数给出。数学上著名的结论是:只有绝对收敛的级数,任意交换求和次序才不改变其和——这保证 \(E[X]\) 是分布本身的固有数字特征,而不依赖罗列取值的顺序。若级数只是条件收敛、或绝对值级数发散,期望便没有良定义。历史上著名的圣彼得堡悖论(St. Petersburg paradox)就是一个极端例子:掷一枚均匀硬币直到首次出现正面,若第 \(k\) 次才出现则获得 \(2^k\) 元奖金,其期望为 \(\sum_{k\ge 1} 2^k\cdot(1/2)^k=\sum_{k\ge 1} 1=\infty\)。"无穷期望"迫使人们反思:只用期望作决策是不够的(见本节练习 4)。
掷一颗均匀骰子,\(X\) 为掷出的点数,求 \(E[X]\)。
| 点数 \(x\) | \(p(x)\) | \(x\,p(x)\) |
|---|---|---|
| 1 | \(1/6\) | 0.1667 |
| 2 | \(1/6\) | 0.3333 |
| 3 | \(1/6\) | 0.5000 |
| 4 | \(1/6\) | 0.6667 |
| 5 | \(1/6\) | 0.8333 |
| 6 | \(1/6\) | 1.0000 |
| 合计 | \(1\) | \(3.5\) |
2. 如何理解期望:不是最可能值,而是重心与长期平均
期望不是最可能值。掷骰子的期望是 3.5,但谁也掷不出 3.5 点;彩票买家最可能的结局是"不中奖",但期望照样把中大奖的小概率折算了进去。换言之,期望不必是随机变量的可能取值,更不必是最可能的取值(后者称为众数,mode)。期望刻画的是分布的位置——把整个分布"压扁"成一个有代表性的数字,而不是预报单次试验的结果。
期望是分布列的重心。把 \(p(x)\) 想象成安放在数轴上坐标 \(x\) 处的质量,各处质量之和为 \(\sum p(x)=1\)。力学告诉我们,这组质点系的重心(center of mass)位于 \(\sum x\,p(x)\)——恰好是期望。以骰子为例:在位置 \(1,2,\dots,6\) 各放一个等质量(各 \(1/6\))的方块,把支点顶在 3.5 处,杠杆恰好水平平衡,因为支点两侧的合力矩相互抵消(图 1):
\[ \sum_{x} (x-\mu)\,p(x) \;=\; \sum_x x\,p(x) - \mu\sum_x p(x) \;=\; E[X]-\mu \;=\; 0. \]
期望是长期重复试验的平均水平。设 \(X_1,X_2,\dots\) 是对同一试验的独立重复观测(每次的"复印件"of \(X\)),前 \(n\) 次的样本均值(sample mean)为 \(\bar X_n = (X_1+\cdots+X_n)/n\)。第 8 章的大数定律(law of large numbers)将严格证明:当 \(n\to\infty\) 时,\(\bar X_n\) 以越来越大的概率落在 \(\mu=E[X]\) 的任意小邻域内。图 2 展示了一次掷骰子模拟中 \(\bar X_n\) 的轨迹:初期大起大落,随后波幅收窄,稳定到 3.5 附近。赌场与保险公司的商业模式正建立在这一规律之上:单局盈亏随机,但海量重复之后,平均利润几乎必然贴近期望值。
"长期平均"的解释也给出了期望在决策中的用法:比较不同方案的期望收益,选出平均意义下最优的一个。请看下面的经典例子。
某彩票共发行 1000 张,每张售价 1 元;其中恰有 1 张中奖,奖金 500 元。你购买了一张彩票,求你的净收益 \(X\) 的期望,并据此讨论"是否值得买"。
"按获胜概率分配赌金"的思想(见 1.1 节的赌金分配问题)经惠更斯(Huygens)于 1657 年提炼,在历史上第一部概率论著作《论赌博中的推理》中首次以"期望"之名给出正式表述:若以概率 \(p\) 获得 \(a\)、以概率 \(1-p\) 获得 \(b\),则这一随机处境的价值是 \(pa+(1-p)b\)——正是本节的概率加权平均。期望是概率论中最古老的核心概念之一,比概率的公理化(1933 年)早了近三百年。
3. 期望的性质:线性
随机变量常需经过线性变换:温度从摄氏换成华氏(\(1.8X+32\))、重量从千克换成克、给每次收益加一笔固定手续费等。变换后的期望如何变化?当然可以先求出 \(Y=aX+b\) 的分布列再按定义计算,但下面的定理说明大可不必——期望本身就是按同一线性规则变换的。
设离散型随机变量 \(X\) 的期望存在,\(a\)、\(b\) 为任意常数,则 \[ E[aX+b] = a\,E[X] + b. \]
定理 1 有几个常用特例:\(E[c]=c\)(常数的期望是它本身)、\(E[X+c]=E[X]+c\)、\(E[cX]=c\,E[X]\)。用重心的眼光看十分自然:把分布整体平移 \(b\),重心平移 \(b\);把分布拉伸 \(a\) 倍,重心也拉伸 \(a\) 倍。要提醒的是,本节只处理单个随机变量的线性变换;两个随机变量之和的线性性 \(E[X+Y]=E[X]+E[Y]\)(竟然无需独立性!)是威力更大的结果,将在第 7 章证明。下一节(4.4 节)先把本定理推广到一般函数 \(g(X)\) 的期望。
设 \(X\) 的分布列为 \(p(x)=x/21,\ x=1,2,\dots,6\)。(a) 验证它确实是分布列并求 \(E[X]\);(b) 求 \(E[2X+1]\)。
4. 本节小结
- 定义:\(E[X]=\sum_{x:\,p(x)>0} x\,p(x)\),要求级数绝对收敛;记号 \(\mu\)。
- 期望有三重含义:概率加权平均;分布列(pmf)的重心;长期独立重复试验中样本均值的稳定值(大数定律,第 8 章)。
- 期望不是最可能取值:掷骰子 \(E[X]=3.5\),而 3.5 不可能取到。
- 线性性质:\(E[aX+b]=aE[X]+b\)(定理 1,已证);特例 \(E[c]=c\)。
- 期望是"平均意义下"的决策准则(彩票每张期望净收益 \(-0.5\) 元);但它不刻画取值的波动与风险——这正是 4.5 节方差的动机。
练习
练习 4-3-1
掷两颗均匀骰子,\(X\) 为点数之和,求 \(E[X]\)。
答案与提示36 个等可能结果,\(E[X]=\frac{1}{36}\sum_{i=1}^{6}\sum_{j=1}^{6}(i+j)=\frac{6\times 21+6\times 21}{36}=\frac{252}{36}=7\)(也可用 4.1 节的分布表逐项求和)。点数和的期望恰是单骰期望 3.5 的两倍——这是"和的期望等于期望之和"(第 7 章线性性)的雏形。
练习 4-3-2
设 \(P(X=0)=\frac{1}{5},\ P(X=1)=\frac{3}{10},\ P(X=2)=\frac{2}{5},\ P(X=4)=\frac{1}{10}\)。求 \(E[X]\) 与 \(E[3X-2]\)。
答案与提示先验证概率之和为 1。\(E[X]=0\times\frac15+1\times\frac3{10}+2\times\frac25+4\times\frac1{10}=0.3+0.8+0.4=1.5\);再用定理 1:\(E[3X-2]=3\times 1.5-2=2.5\)。
练习 4-3-3
(期望决策)基金只能在两个一年期项目中选一个:方案 A 稳定获利 100 万元;方案 B 以概率 0.5 获利 240 万元、以概率 0.5 分文不赚。(a) 按期望最大准则应选哪个?(b) 举出一个现实中宁可选 A 的合理理由。
答案与提示(a) \(E[A]=100\),\(E[B]=0.5\times 240+0.5\times 0=120\),期望准则选 B。(b) B 有 50% 的可能颗粒无收:若这笔钱是"救命钱"、基金靠稳定现金流维持运转、或委托人极度厌恶损失,确定的 100 万更可取。期望准则只看平均、无视波动,而波动的度量正是 4.5 节的方差。
练习 4-3-4
(反例思考)构造两个期望同为 100 的随机变量,使其中一个几乎总在 100 附近、另一个大起大落,并由此说明只用期望刻画分布的局限。
答案与提示例如 \(X\):\(P(X=99)=P(X=101)=\frac12\);\(Y\):\(P(Y=0)=P(Y=200)=\frac12\)。两者期望都是 100,但 \(X\) 与均值只差 \(\pm 1\),\(Y\) 却偏差 \(\pm 100\)——风险迥异。度量"围绕均值的平均偏离"需要 \(\mathrm{Var}(X)=E[(X-\mu)^2]\)(本例分别为 1 与 10000),详见 4.5 节。