第 5 章 · 连续型随机变量

5.2 连续型随机变量的期望与方差

Expectation and Variance of Continuous Random Variables
学习目标
  • 写出连续型随机变量期望与随机变量函数的期望(expectation of a function of a random variable)的积分定义,并说明它们与离散情形求和形式的平行关系;
  • 用"重心"与"力矩"两种直观解释期望的几何与物理含义;
  • 运用方差(variance)的定义与捷径公式 \(\mathrm{Var}(X)=E[X^2]-\mu^2\) 完整计算三种典型密度的期望与方差;
  • 证明并运用线性性质 \(E[aX+b]=aE[X]+b\) 与 \(\mathrm{Var}(aX+b)=a^2\mathrm{Var}(X)\);
  • 利用密度的对称性直接读出期望,并说明"期望存在"这一前提的必要性。

1. 从求和到积分:期望的定义

在第 4 章(4.3 节)中,离散型随机变量 \(X\) 的期望(expectation)定义为以概率为权的加权平均:\(E[X]=\sum_i x_i p(x_i)\)。对连续型随机变量,任何单点的概率都是零,"逐点加权求和"似乎失去了对象。但 5.1 节已经指出:\(X\) 落在小区间 \([x, x+dx)\) 内的概率约为 \(f(x)\,dx\)——概率不是集中在一个个孤立的点上,而是连续地"摊"在数轴上。于是自然的做法是:把每个微元 \(f(x)\,dx\) 视作权重,把求和号换成积分号。

定义 1 连续型随机变量的期望

设连续型随机变量 \(X\) 的概率密度函数(probability density function)为 \(f(x)\)。若 \(\int_{-\infty}^{\infty} |x| f(x)\,dx < \infty\),则称 \[ E[X] = \int_{-\infty}^{\infty} x f(x)\,dx \] 为 \(X\) 的期望(均值,mean),记作 \(E[X]\) 或 \(\mu\);否则称 \(X\) 的期望不存在。

绝对可积的条件 \(\int |x| f\,dx<\infty\) 是为了排除"\(\infty-\infty\)"式的未定式(详见本节注记)。直观上,\(E[X]\) 是 \(X\) 的取值以密度加权的"平均位置",代表分布的中心趋势。

期望有两种经典的直观图像。其一是重心:密度曲线下的总面积为 \(1\),若把这块面积想象成一块材质均匀的薄板,则 \(E[X]=\int x f(x)\,dx\) 恰好等于薄板重心(center of mass)的横坐标。图 1 对比了两个定义在 \((0,1)\) 上的密度:对称密度的重心垂线正落在对称中心,而右偏的 \(f(x)=2x\) 的重心明显向质量厚的一侧移动。

对称密度 f(x) = 6x(1−x) 重心垂线 = 对称中心 1.5 f(x) 0 1 E[X] = 1/2 x = 1/2 偏斜密度 f(x) = 2x 重心偏向质量集中的一侧 2 f(x) 0 1 E[X] = 2/3 x = 2/3 期望是密度"薄板"重心的横坐标:对称 ⇒ 重心在中心;偏斜 ⇒ 重心偏向质量厚的一侧
图 1:密度曲线与重心垂线。左:关于 1/2 对称的密度 f(x)=6x(1−x),重心位于对称中心 1/2;右:偏斜密度 f(x)=2x,质量向右堆积,重心右移至 2/3。

其二是力矩:设想在位置 \(x\) 处放置质量 \(f(x)\,dx\),则它绕原点的力矩为 \(x\cdot f(x)\,dx\),总力矩正是 \(\int x f(x)\,dx\)。把整根横杆放在一个支点上(图 2),当支点位于 \(\mu=E[X]\) 处时,左右两侧的力矩恰好抵消: \[ \int_{-\infty}^{\infty} (x-\mu) f(x)\,dx = \int x f\,dx - \mu \int f\,dx = \mu - \mu = 0, \] 横杆平衡。这就是"期望是分布的平衡点"的力学解释。

期望 = 使密度"质量"平衡的支点(这里 f(x) = 2x,μ = 2/3) 竖条高度 ∝ f(x) 每条 ≈ 质量元 f(x)dx μ = E[X] = 2/3 0 支点 μ 1 力臂 x(质量元到 0 点的距离) 绕支点的合力矩 ∫(x−μ)f(x)dx = 0 —— 支点恰在 μ = ∫x f(x)dx = E[X] 处平衡
图 2:积分 \(\int_0^1 x f(x)\,dx\) 的力矩示意。把密度离散成一排质量元(竖条),支点放在 μ=E[X]=2/3 处时合力矩为零,横杆平衡;竖条越高的位置离支点越近,正是"偏斜密度重心右移"的原因。

2. 随机变量函数的期望

与离散情形完全平行,我们可以直接对 \(X\) 的函数 \(g(X)\) 求期望,而不必先求出 \(Y=g(X)\) 的分布——这是一个极为重要的便利(若需要 \(Y\) 的整条分布,则要用 5.7 节的方法)。

定义 2 随机变量函数的期望

设 \(X\) 为连续型随机变量,密度为 \(f(x)\),\(g\) 为实值函数。若 \(\int_{-\infty}^{\infty} |g(x)| f(x)\,dx < \infty\),则 \[ E[g(X)] = \int_{-\infty}^{\infty} g(x) f(x)\,dx. \]

特别地,取 \(g(x)=x\) 即回到定义 1;取 \(g(x)=x^2\) 得到的 \(E[X^2]\) 是本节计算方差的关键工具。需要注意:一般而言 \(E[g(X)] \neq g(E[X])\),仅当 \(g\) 为线性函数时二者才相等(见定理 2)。

下表把离散与连续两种情形逐项对照——公式形式完全平行,只需把"求和、分布列"替换为"积分、密度"。第 4 章证明的所有期望性质(线性性、单调性等)在连续情形中都成立,证明思路也相同,只是把求和换成积分。

表 1:离散型与连续型随机变量的平行对照
项目离散型连续型
概率模型分布列 \(p(x_i)\)密度 \(f(x)\)
归一化条件\(\sum_i p(x_i) = 1\)\(\int_{-\infty}^{\infty} f(x)\,dx = 1\)
期望\(E[X] = \sum_i x_i p(x_i)\)\(E[X] = \int x f(x)\,dx\)
函数的期望\(E[g(X)] = \sum_i g(x_i) p(x_i)\)\(E[g(X)] = \int g(x) f(x)\,dx\)
方差\(E[(X-\mu)^2] = E[X^2]-\mu^2\)\(E[(X-\mu)^2] = E[X^2]-\mu^2\)
线性性质\(E[aX+b] = aE[X]+b\)\(E[aX+b] = aE[X]+b\)

3. 方差:衡量取值的分散程度

期望刻画分布的"中心",而方差(variance)刻画取值围绕中心的分散程度,其定义与离散情形(4.5 节)完全一致。

定义 3 方差与标准差

设 \(X\) 的期望为 \(\mu = E[X]\),且 \(E[(X-\mu)^2] < \infty\),则 \[ \mathrm{Var}(X) = E\!\left[(X-\mu)^2\right] \] 称为 \(X\) 的方差,其算术平方根 \(\sigma = \sqrt{\mathrm{Var}(X)}\) 称为标准差(standard deviation)。

方差是"\(X\) 到均值距离的平方"的期望:分布越分散,方差越大。方差的量纲是 \(X\) 量纲的平方,标准差则与 \(X\) 同量纲,便于实际解释。

定理 1 方差的捷径公式

\[ \mathrm{Var}(X) = E[X^2] - \mu^2, \qquad \mu = E[X]. \]

证明由定义 2(取 \(g(x)=(x-\mu)^2\))并展开被积函数: \[ \mathrm{Var}(X) = \int (x-\mu)^2 f(x)\,dx = \int (x^2 - 2\mu x + \mu^2) f(x)\,dx. \] 利用积分的线性性逐项计算: \[ \int x^2 f\,dx - 2\mu \int x f\,dx + \mu^2 \int f\,dx = E[X^2] - 2\mu\cdot\mu + \mu^2\cdot 1 = E[X^2] - \mu^2. \] 其中用到规范性 \(\int f\,dx = 1\) 与 \(\int x f\,dx = \mu\)。证毕。

下面通过三个典型密度完整演练"先求 \(E[X]\)、再求 \(E[X^2]\)、最后用定理 1 得方差"的标准流程。

例 1 区间 (0,1) 上的均匀密度

设 \(X\) 的密度为 \(f(x)=1\)(\(0 < x < 1\)),即 \(X\sim U(0,1)\)(5.3 节将系统研究均匀分布)。求 \(E[X]\)、\(E[X^2]\) 与 \(\mathrm{Var}(X)\)。

密度在区间外为零,只需在 \((0,1)\) 上积分。期望: \[ E[X] = \int_0^1 x\cdot 1\,dx = \left[\frac{x^2}{2}\right]_0^1 = \frac{1}{2}. \] 二阶矩: \[ E[X^2] = \int_0^1 x^2\cdot 1\,dx = \left[\frac{x^3}{3}\right]_0^1 = \frac{1}{3}. \] 由定理 1: \[ \mathrm{Var}(X) = E[X^2] - \mu^2 = \frac{1}{3} - \left(\frac{1}{2}\right)^2 = \frac{1}{3} - \frac{1}{4} = \frac{1}{12}, \] 标准差 \(\sigma = 1/\sqrt{12} \approx 0.289\)。这与密度的完全对称性相符:重心恰在中点 \(1/2\)。
例 2 偏斜密度 f(x) = 2x

设 \(X\) 的密度为 \(f(x)=2x\)(\(0 < x < 1\);这是 5.1 节例 1 中验证过的密度)。求 \(E[X]\)、\(E[X^2]\) 与 \(\mathrm{Var}(X)\)。

期望: \[ E[X] = \int_0^1 x\cdot 2x\,dx = 2\int_0^1 x^2\,dx = 2\cdot\frac{1}{3} = \frac{2}{3}. \] 二阶矩: \[ E[X^2] = \int_0^1 x^2\cdot 2x\,dx = 2\int_0^1 x^3\,dx = 2\cdot\frac{1}{4} = \frac{1}{2}. \] 方差: \[ \mathrm{Var}(X) = \frac{1}{2} - \left(\frac{2}{3}\right)^2 = \frac{1}{2} - \frac{4}{9} = \frac{9 - 8}{18} = \frac{1}{18}. \] 与例 1 对比颇有意味:两个密度都定义在 \((0,1)\) 上,但 \(f(x)=2x\) 的质量向右端堆积,均值右移(\(2/3 > 1/2\)),而分布反而更"集中"(\(1/18 < 1/12\))——质量挤向端点附近,取值波动变小。这正是图 1 右图重心右移、图 2 中高竖条紧靠支点的情形。
例 3 指数型密度 f(x) = e^(−x)

设 \(X\) 的密度为 \(f(x)=e^{-x}\)(\(x > 0\))。求 \(E[X]\) 与 \(\mathrm{Var}(X)\)。

期望需要分部积分:取 \(u=x\)、\(dv=e^{-x}dx\),则 \(v=-e^{-x}\), \[ E[X] = \int_0^{\infty} x e^{-x}\,dx = \Bigl[-x e^{-x}\Bigr]_0^{\infty} + \int_0^{\infty} e^{-x}\,dx = 0 + \Bigl[-e^{-x}\Bigr]_0^{\infty} = 1, \] 其中 \(\lim_{x\to\infty} x e^{-x} = 0\)(指数衰减快于多项式增长)。二阶矩再分部一次: \[ E[X^2] = \int_0^{\infty} x^2 e^{-x}\,dx = \Bigl[-x^2 e^{-x}\Bigr]_0^{\infty} + 2\int_0^{\infty} x e^{-x}\,dx = 0 + 2\cdot 1 = 2. \] 于是 \[ \mathrm{Var}(X) = E[X^2] - \mu^2 = 2 - 1^2 = 1. \] 此密度是 5.5 节指数分布取 \(\lambda=1\) 的特例;一般地 \(f(x)=\lambda e^{-\lambda x}\) 时 \(E[X]=1/\lambda\)、\(\mathrm{Var}(X)=1/\lambda^2\)。
表 2:本节三个基准密度的期望与方差
密度取值范围\(E[X]\)\(E[X^2]\)\(\mathrm{Var}(X)\)
\(f(x)=1\)\((0,1)\)\(1/2\)\(1/3\)\(1/12\)
\(f(x)=2x\)\((0,1)\)\(2/3\)\(1/2\)\(1/18\)
\(f(x)=e^{-x}\)\((0,\infty)\)\(1\)\(2\)\(1\)

4. 期望与方差的线性性质

离散情形的线性性质(4.3 节)逐字照搬到连续情形,证明只是"求和换积分"。这组性质在计算中无处不在。

定理 2 线性变换下的期望与方差

设 \(X\) 的期望为 \(\mu\)、方差存在,\(a, b\) 为常数,则 \[ E[aX+b] = aE[X] + b, \qquad \mathrm{Var}(aX+b) = a^2 \mathrm{Var}(X). \]

证明期望:由定义 2(取 \(g(x)=ax+b\))并利用积分的线性性与规范性, \[ E[aX+b] = \int (ax+b) f(x)\,dx = a\int x f\,dx + b\int f\,dx = a\mu + b. \] 方差:记 \(Y=aX+b\),其期望为 \(a\mu+b\),于是 \[ \mathrm{Var}(Y) = E\bigl[(aX+b - a\mu - b)^2\bigr] = E\bigl[a^2 (X-\mu)^2\bigr] = a^2 \mathrm{Var}(X), \] 最后一步再次用了定义 2 与积分的线性性。证毕。

两个公式都易于理解:\(b\) 只是把整个分布平移,不改变分散程度,故它不出现在方差中;\(a\) 把分布按比例伸缩,到均值的距离变为 \(|a|\) 倍,其平方便给出因子 \(a^2\)——注意即使 \(a<0\)(反射),方差也不变符号,因为方差本来就不是负的。一个日常例子:若 \(X\) 是摄氏温度,则华氏温度 \(Y=\tfrac{9}{5}X+32\) 满足 \(E[Y]=\tfrac{9}{5}E[X]+32\)、\(\mathrm{Var}(Y)=\tfrac{81}{25}\mathrm{Var}(X)\)。

线性性质最重要的应用之一是标准化(standardization):当 \(\mathrm{Var}(X)=\sigma^2>0\) 时,令 \[ Z = \frac{X-\mu}{\sigma}, \] 则由定理 2(取 \(a=1/\sigma\)、\(b=-\mu/\sigma\))立得 \(E[Z]=0\)、\(\mathrm{Var}(Z)=1\)。这一变换是 5.4 节正态分布查表计算的基础。

5. 对称密度的期望

图 1 左图提示了一个一般规律:密度若关于某点对称,期望(若存在)必是对称中心。这样,许多期望可以"看图读出"而不必积分。

定理 3 对称密度的期望

设 \(X\) 的密度关于 \(x=\mu_0\) 对称,即对一切 \(t\) 有 \(f(\mu_0+t)=f(\mu_0-t)\)。若 \(E[X]\) 存在,则 \(E[X]=\mu_0\)。

证明考察 \[ E[X]-\mu_0 = \int_{-\infty}^{\infty} (x-\mu_0) f(x)\,dx. \] 把积分拆成 \((-\infty,\mu_0)\) 与 \((\mu_0,\infty)\) 两段,在左段作换元 \(x=\mu_0-t\)(则 \(x-\mu_0=-t\)): \[ \int_{-\infty}^{\mu_0} (x-\mu_0) f(x)\,dx = -\int_0^{\infty} t\, f(\mu_0-t)\,dt, \qquad \int_{\mu_0}^{\infty} (x-\mu_0) f(x)\,dx = \int_0^{\infty} t\, f(\mu_0+t)\,dt. \] 两式相加得 \[ E[X]-\mu_0 = \int_0^{\infty} t\bigl[f(\mu_0+t)-f(\mu_0-t)\bigr] dt = 0, \] 最后一步用了对称性假设,被积函数恒为零。证毕。

定理 3 立即给出许多结论:例 1 中 \(U(0,1)\) 的密度关于 \(1/2\) 对称,故 \(E[X]=1/2\) 本可免积分直接写出;5.4 节的正态密度关于 \(\mu\) 对称,其期望必为 \(\mu\)。反之,\(f(x)=2x\)(例 2)不对称,期望必须老老实实积分得到 \(2/3\),且重心偏向质量堆积的右侧——对称性只是充分条件,不是期望位置的必然特征。

注记 期望一定存在吗?

定义 1 中"绝对可积"的条件并非多余。期望存在要求 \(E[X^{+}]=\int_{x>0} x f\,dx\) 与 \(E[X^{-}]=\int_{x<0} (-x) f\,dx\) 不同时为 \(+\infty\)(此时 \(E[X]=E[X^{+}]-E[X^{-}]\) 才有意义)。著名的反例是柯西密度 \(f(x)=1/[\pi(1+x^2)]\):它关于 \(0\) 完全对称,但两个积分都发散到 \(+\infty\),于是期望不存在——"对称却无期望",说明定理 3 中"若 \(E[X]\) 存在"这一前提不可省略。该反例将在 5.6 节详细讨论。幸运的是,本章遇到的常用分布(均匀、正态、指数等)期望都存在。

6. 本节小结

要点回顾
  • 连续型期望 \(E[X]=\int x f(x)\,dx\)、函数期望 \(E[g(X)]=\int g(x) f(x)\,dx\),与离散情形"求和 \(\sum\,\)换成积分 \(\int\)、\(p(x_i)\) 换成 \(f(x)\,dx\)"完全平行;求 \(E[g(X)]\) 无需先求 \(g(X)\) 的分布。
  • 直观:期望是密度薄板的重心横坐标,也是使"质量分布"平衡的支点(\(\int (x-\mu) f\,dx=0\))。
  • \(\mathrm{Var}(X)=E[(X-\mu)^2]=E[X^2]-\mu^2\),标准差 \(\sigma=\sqrt{\mathrm{Var}(X)}\);三个基准结果:\(U(0,1)\) 得 \(1/2\)、\(1/12\),\(f=2x\) 得 \(2/3\)、\(1/18\),\(f=e^{-x}\) 得 \(1\)、\(1\)。
  • 线性性质:\(E[aX+b]=aE[X]+b\),\(\mathrm{Var}(aX+b)=a^2\mathrm{Var}(X)\);标准化 \(Z=(X-\mu)/\sigma\) 使 \(E[Z]=0\)、\(\mathrm{Var}(Z)=1\)。
  • 密度关于 \(\mu_0\) 对称且期望存在时 \(E[X]=\mu_0\);对称不保证期望存在(柯西密度反例,见 5.6 节)。

练习

练习 5-2-1

设 \(X\) 的密度为 \(f(x)=3x^2\)(\(0 < x < 1\))。求 \(E[X]\) 与 \(\mathrm{Var}(X)\)。

答案与提示

先验证规范性 \(\int_0^1 3x^2 dx=1\)。\(E[X]=\int_0^1 3x^3 dx=\tfrac{3}{4}\);\(E[X^2]=\int_0^1 3x^4 dx=\tfrac{3}{5}\);故 \(\mathrm{Var}(X)=\tfrac{3}{5}-\bigl(\tfrac{3}{4}\bigr)^2=\tfrac{3}{5}-\tfrac{9}{16}=\tfrac{48-45}{80}=\tfrac{3}{80}\)。质量比 \(f=2x\) 更向右端堆积,均值 \(3/4\) 更大而方差 \(3/80\) 更小,与例 1、例 2 的规律一致。

练习 5-2-2

设 \(X\) 的密度为 \(f(x)=2x\)(\(0 < x < 1\)),\(Y=2X+1\)。先用定理 2 写出 \(E[Y]\) 与 \(\mathrm{Var}(Y)\),再直接计算 \(\int_0^1 (2x+1)\cdot 2x\,dx\) 加以验证。

答案与提示

由例 2,\(E[X]=2/3\)、\(\mathrm{Var}(X)=1/18\)。定理 2 给出 \(E[Y]=2\cdot\tfrac{2}{3}+1=\tfrac{7}{3}\),\(\mathrm{Var}(Y)=2^2\cdot\tfrac{1}{18}=\tfrac{2}{9}\)。直接验证:\(\int_0^1 (2x+1)2x\,dx=\int_0^1 (4x^2+2x)\,dx=\tfrac{4}{3}+1=\tfrac{7}{3}\)。两者一致,这正是定理 2 证明的实例。

练习 5-2-3

设 \(X\) 的密度为 \(f(x)=\alpha/x^{\alpha+1}\)(\(x \ge 1\),\(\alpha>0\),帕累托型尾部)。求使 \(E[X]\) 存在的参数 \(\alpha\) 的范围,并在期望存在时算出 \(E[X]\)。

答案与提示

规范性:\(\int_1^{\infty} \alpha x^{-(\alpha+1)} dx=\alpha\cdot\tfrac{1}{\alpha}=1\) 对一切 \(\alpha>0\) 成立。而 \[ E[X]=\alpha\int_1^{\infty} x^{-\alpha}\,dx = \alpha\lim_{b\to\infty}\frac{b^{\,1-\alpha}-1}{1-\alpha}, \] 当 \(\alpha>1\) 时收敛,得 \(E[X]=\tfrac{\alpha}{\alpha-1}\);当 \(0<\alpha\le 1\) 时积分发散到 \(+\infty\),期望不存在。这说明"尾部太厚"的密度可以规范性完好却无期望——与注记中柯西密度的现象同源。

练习 5-2-4

设 \(X\) 的密度为 \(f(x)=\tfrac{3}{4}(1-x^2)\)(\(-1 < x < 1\))。不求 \(E[X]\) 的积分而直接写出其值,并计算 \(\mathrm{Var}(X)\)。

答案与提示

\(f\) 是偶函数,密度关于 \(0\) 对称且期望显然存在,由定理 3 得 \(E[X]=0\)。\(\mathrm{Var}(X)=E[X^2]\)(因 \(\mu=0\)): \[ E[X^2]=\frac{3}{4}\int_{-1}^{1} (x^2 - x^4)\,dx = \frac{3}{4}\left(\frac{2}{3}-\frac{2}{5}\right)=\frac{3}{4}\cdot\frac{4}{15}=\frac{1}{5}. \] 故 \(\mathrm{Var}(X)=\tfrac{1}{5}\),\(\sigma=1/\sqrt{5}\approx 0.447\)。