第 5 章 · 连续型随机变量

5.1 引言

Introduction
学习目标
  • 写出连续型随机变量与概率密度函数的定义,并验证一个给定函数是否为合法密度(非负、积分为 1);
  • 用积分计算 \(P(a<X<b)\),并说明其几何意义是密度曲线下方的面积;
  • 证明连续型随机变量的单点概率恒为 0,并解释“概率为 0 并不等于不可能”这一重要辨析;
  • 用 \(f(x)\,\mathrm{d}x\) 表述密度的局部含义,说明密度不是概率、可以大于 1;
  • 描述直方图随数据增多、组距缩小而逼近密度曲线的极限过程,并说出本章各节的安排。

1. 从离散到连续

第 4 章讨论的离散型随机变量(discrete random variable)只能取有限个或可数无穷多个值,其概率规律由分布列 \(p(x)=P(X=x)\) 完整描述——概率像一堆“质量”,逐点堆积在各个取值上。然而现实中大量随机量并非如此:人的身高、灯泡的寿命、某地明天的气温、列车到站的间隔……这些量的可能取值充满整个区间。以身高为例,\(170\) cm 与 \(170.001\) cm 之间仍有无穷多个可能值,把取值逐一列举既不可能,也无必要。

更深刻的变化发生在概率的分配方式上。对这类“取值充满区间”的随机变量,本节将证明:任何单个点的概率只能是 0(定理 2)。于是逐点赋概率的分布列语言彻底失效,必须换用一种全新的语言——用密度(density)刻画概率在数轴上分布的浓淡。这正是“连续型随机变量(continuous random variable)”一名的由来。本章先建立密度的一般理论(5.1 引入、5.2 期望与方差),再依次研究几族最重要的连续型分布:5.3 均匀分布5.4 正态分布5.5 指数分布5.6 其他分布,最后在 5.7 讨论连续型随机变量函数的分布。

2. 连续型随机变量与概率密度函数

第 4 章引入的分布函数(cumulative distribution function, CDF) \(F(x)=P(X\le x)\) 对离散型与连续型同样适用。连续型随机变量的特征是:\(F\) 恰好可以写成某个非负函数的变上限积分。

定义 1 连续型随机变量与概率密度函数

设随机变量 \(X\) 的分布函数为 \(F(x)\)。若存在非负函数 \(f\),使得对一切实数 \(x\) 有 \[ F(x)=P(X\le x)=\int_{-\infty}^{x} f(t)\,\mathrm{d}t, \] 则称 \(X\) 为连续型随机变量(continuous random variable),称 \(f(x)\) 为 \(X\) 的概率密度函数(probability density function, pdf),简称密度。

由 \(F(+\infty)=1\) 与 \(F(-\infty)=0\) 立得密度的两条特征:(i) 非负性 \(f(x)\ge 0\);(ii) 规范性(normalization) \(\int_{-\infty}^{\infty}f(x)\,\mathrm{d}x=1\)。

两点说明。其一,条件 (i)(ii) 也是充分的:任何满足非负性与规范性的函数都可以充当某个连续型随机变量的密度(由变上限积分反推出的 \(F\) 就是它的分布函数)。其二,积分不受被积函数在有限个点处取值的影响,因此密度在个别点上的值无关紧要;通常只给出 \(f\) 取正值的区间(称为支撑集(support)),并默认在其外 \(f=0\)。

例 1 验证一个密度并计算区间概率

设 \(X\) 的密度为 \(f(x)=2x\)(\(0<x<1\),其余处为 0)。(a) 验证 \(f\) 满足规范性;(b) 计算 \(P(0.25<X<0.5)\)。

(a) 在 \((0,1)\) 内 \(f(x)=2x>0\),且 \[ \int_{-\infty}^{\infty} f(x)\,\mathrm{d}x=\int_0^1 2x\,\mathrm{d}x=\bigl[x^2\bigr]_0^1=1, \] 故 \(f\) 是合法密度。(b) 由密度求区间概率: \[ P(0.25<X<0.5)=\int_{0.25}^{0.5} 2x\,\mathrm{d}x=\bigl[x^2\bigr]_{0.25}^{0.5}=0.5^2-0.25^2=0.25-0.0625=0.1875. \] 也可以先求出分布函数 \(F(x)=x^2\)(\(0\le x\le 1\)),再用 \(F(0.5)-F(0.25)=0.1875\),两种算法一致(见图 1)。另请注意 \(f(0.9)=1.8>1\)——密度超过 1 完全合法,见第 5 小节。

3. 概率即面积

定义 1 把分布函数写成积分,其直接推论是:求概率就是算面积。

定理 1 概率的面积表示

设 \(X\) 是密度为 \(f\) 的连续型随机变量,则对任意实数 \(a<b\), \[ P(a<X\le b)=F(b)-F(a)=\int_a^b f(x)\,\mathrm{d}x, \] 即事件 \(\{a<X\le b\}\) 的概率等于密度曲线下方介于 \(a\)、\(b\) 之间的曲边梯形面积。

证明由 \(\{X\le b\}=\{X\le a\}\cup\{a<X\le b\}\) 且两事件不相容、\(\{X\le a\}\subseteq\{X\le b\}\),概率的可加性给出 \(P(a<X\le b)=F(b)-F(a)\)。再由定义 1,\(F(b)-F(a)=\int_{-\infty}^{b}f-\int_{-\infty}^{a}f=\int_a^b f(x)\,\mathrm{d}x\)。∎
密度曲线下的面积就是概率:P(0.25<X<0.5) = 0.1875 0 a=0.25 b=0.5 0.75 1 x 0.5 1 1.5 2 f(x) f(x)=2x f(a)=0.5 f(b)=1 P(0.25<X<0.5) = 阴影面积 = 0.1875 曲线下总面积 = 1
图 1:密度曲线下的面积即概率。以 \(f(x)=2x\)(\(0<x<1\))为例,介于 \(a=0.25\) 与 \(b=0.5\) 之间的阴影面积等于 \(P(0.25<X<0.5)=0.1875\)(例 1);曲线下总面积为 1。
例 2 由规范性确定常数

设 \(X\) 的密度为 \(f(x)=c\,e^{-x}\)(\(x>0\),其余处为 0)。(a) 求常数 \(c\);(b) 计算 \(P(X>1)\) 与 \(P(0<X<1)\)。

(a) 由规范性, \[ 1=\int_0^{\infty} c\,e^{-x}\,\mathrm{d}x = c\bigl[-e^{-x}\bigr]_0^{\infty}=c\,(0+1)=c, \] 故 \(c=1\),即 \(f(x)=e^{-x}\)(\(x>0\))。(b) 由定理 1, \[ P(X>1)=\int_1^{\infty} e^{-x}\,\mathrm{d}x=\bigl[-e^{-x}\bigr]_1^{\infty}=e^{-1}\approx 0.368, \] 又 \(P(X\le 0)=0\),故 \(P(0<X<1)=1-P(X>1)=1-e^{-1}\approx 0.632\)。这个密度正是参数为 1 的指数分布(exponential distribution),5.5 节将详加研究。

4. 单点概率为零:一个重要辨析

定理 1 处理的是区间上的概率。那么单个点的概率是多少?答案是:恒为零。

定理 2 单点概率为零

设 \(X\) 为连续型随机变量,则对任意实数 \(a\),\(P(X=a)=0\)。

证明对任意 \(h>0\),事件 \(\{X=a\}\subseteq\{a-h<X\le a\}\),故由定理 1 与密度的非负性, \[ 0\le P(X=a)\le P(a-h<X\le a)=\int_{a-h}^{a} f(x)\,\mathrm{d}x. \] 令 \(h\to 0^{+}\):右端是底边缩为一点、高有限的曲边梯形面积,必然趋于 0(此即可积函数积分的绝对连续性)。由夹逼定理,\(P(X=a)=0\)。∎

于是对连续型随机变量,区间端点写不写等号不影响概率: \[ P(a<X<b)=P(a\le X\le b)=P(a<X\le b)=F(b)-F(a)=\int_a^b f(x)\,\mathrm{d}x. \] 这也解释了为什么连续型随机变量的分布函数 \(F\) 处处连续(没有跳跃)——跳跃恰对应单点上的正概率,而这里单点概率全为 0。

表 1:离散型与连续型随机变量对照
维度离散型 rv连续型 rv
取值范围有限或可数个充满区间(不可数)
分布描述分布列 \(p(x)=P(X=x)\)密度 \(f(x)\)
规范性\(\sum_x p(x)=1\)\(\int_{-\infty}^{\infty} f(x)\,\mathrm{d}x=1\)
区间概率逐点求和 \(\sum\)积分 \(\int\)(曲线下面积)
单点概率\(P(X=x)=p(x)\),可为正\(P(X=a)=0\),恒为零
图形语言高度为概率的竖线面积为概率的曲线
注记 概率为零 ≠ 不可能

既然每个单点的概率都是 0,而 \(X\) 每次试验总要取到某个具体的值,那么“总概率 1”竟是由不可数无穷多个“零概率”事件累积而成的——这在离散框架下不可想象。由此必须辨析:对连续型随机变量,概率为 0 的事件未必是不可能事件(不可能事件指空集 \(\varnothing\));同理,概率为 1 的事件也未必必然发生。直观类比:在 \([0,1]\) 上“随机取一点”,取中恰好 \(0.5\) 的概率为 0,但每次总有一个确定的数被取到。实用结论是:连续型场合概率只赋给区间(或更复杂的集合),单点不承载概率;这也正是“密度”替代“分布列”的根本原因。

5. 密度的局部含义:密度不是概率

把定理 1 用到长为 \(\mathrm{d}x\) 的无穷小区间上: \[ P(x<X<x+\mathrm{d}x)=\int_x^{x+\mathrm{d}x} f(t)\,\mathrm{d}t \approx f(x)\,\mathrm{d}x. \] 即 \(X\) 落在点 \(x\) 附近一小段内的概率约为“该处密度 × 区间长”。\(f(x)\) 大,说明 \(X\) 在 \(x\) 附近取值的机会大——密度度量的是概率分布的浓淡程度。这与物理中不均匀细杆的线密度(linear density)完全同构:\(x\) 处线密度 \(\lambda(x)=\mathrm{d}m/\mathrm{d}x\) 大,说明质量在该处集中,但任一横截面本身的质量为 0;把“质量”换成“概率”,把 \(\lambda\) 换成 \(f\),逐字成立。

因此必须牢记:密度不是概率。概率不能超过 1,密度却没有上界——只要支撑区间足够短,“浓度”就可以任意高。例如区间 \((0,0.1)\) 上均匀分布的密度恒为 \(10\)(见 5.3 节)。判断一个函数是否为合法密度的唯一标准始终是:非负 + 全直线积分为 1。

例 3 密度可以大于 1

设 \(f(x)=3(1-x)^2\)(\(0<x<1\),其余处为 0)。(a) 说明 \(f\) 是合法密度,并指出它在何处超过 1;(b) 计算 \(P(0<X<0.1)\),并与近似值 \(f(0)\times 0.1\) 比较;(c) 计算 \(P(X>0.9)\)。

(a) \(f(x)\ge 0\),且 \[ \int_0^1 3(1-x)^2\,\mathrm{d}x=\bigl[-(1-x)^3\bigr]_0^1=0-(-1)=1, \] 故 \(f\) 是合法密度。但 \(f(0)=3>1\)(在 \(0<x<1-\tfrac{1}{\sqrt 3}\approx 0.423\) 内均有 \(f(x)>1\)),可见“密度处处不超过 1”是初学者最常见的误解。(b) 精确值 \[ P(0<X<0.1)=\bigl[-(1-x)^3\bigr]_0^{0.1}=1-0.9^3=1-0.729=0.271, \] 而近似式 \(f(0)\,\mathrm{d}x=3\times 0.1=0.3\) 略有高估——因为 \(f\) 在 \((0,0.1)\) 上递减,矩形近似必然偏高。(c) 同理 \[ P(X>0.9)=\int_{0.9}^{1} 3(1-x)^2\,\mathrm{d}x=(1-0.9)^3=0.001. \] 同样长 \(0.1\) 的区间,左端概率 \(0.271\)、右端仅 \(0.001\):概率集中在密度大的左端,这正是“密度即浓度”的直观印证。

6. 从直方图到密度曲线

密度从何而来?回顾 2.1 节的频率解释:把观测数据分成若干小组,以组距为底、频率密度(frequency density)(组频率除以组距)为高画直方图(histogram),则每根柱子的面积恰为该组频率,全部柱面积之和为 1。当数据不断增多、组距不断缩小时,频率稳定于概率(大数定律),直方图的轮廓便稳定地逼近一条光滑曲线——这条曲线的“下方面积 = 概率”,它正是密度函数。图 2 展示了这一极限过程:从粗分组到细分组再到极限状态,柱形轮廓渐次“化”为密度曲线。

从直方图到密度曲线:分组不断加细的极限 柱高 = 组频率 ÷ 组距,柱面积 = 组频率;轮廓随组距缩小而趋于密度 f(x) 组距减半 组距→0 组距较大(粗分组) 组距减半(细分组) 组距→0:化为密度曲线 极限曲线 f(x) f(x) 数据增多、组距缩小时,柱形轮廓(频率密度)稳定逼近密度曲线——概率 = 曲线下面积(以正态密度为例,见 5.4 节)
图 2:直方图到密度曲线的极限示意(两态渐变)。左:组距较大时柱形粗糙;中:组距减半后柱形贴合虚线所示的极限曲线;右:组距趋于 0,柱形“化”为光滑密度曲线 \(f(x)\)。全过程柱面积之和恒为 1,恰与规范性 \(\int f = 1\) 呼应。

7. 本节小结

要点回顾
  • 连续型随机变量:分布函数可写为 \(F(x)=\int_{-\infty}^{x} f(t)\,\mathrm{d}t\);密度 \(f\) 满足非负性 \(f\ge 0\) 与规范性 \(\int_{-\infty}^{\infty} f = 1\)。
  • 概率即面积:\(P(a<X<b)=F(b)-F(a)=\int_a^b f(x)\,\mathrm{d}x\),等于密度曲线下方的曲边梯形面积(图 1)。
  • 单点概率为零:\(P(X=a)=0\),区间端点开闭无关;概率为 0 不等于不可能,概率为 1 不等于必然(注记)。
  • 密度的局部含义:\(P(x<X<x+\mathrm{d}x)\approx f(x)\,\mathrm{d}x\);密度是概率的浓度而非概率本身,可以大于 1(例 3)。
  • 频率渊源:直方图(柱高 = 频率密度,柱面积 = 频率)随数据增多、组距缩小而逼近密度曲线(图 2)。
  • 本章路线:5.2 期望与方差 → 5.3 均匀 → 5.4 正态 → 5.5 指数 → 5.6 其他分布 → 5.7 函数的分布。

练习

练习 5-1-1

设 \(f(x)=cx\)(\(0<x<2\),其余处为 0)。求常数 \(c\) 使 \(f\) 成为密度,并计算 \(P(1<X<2)\)。

答案与提示

规范性要求 \(1=\int_0^2 cx\,\mathrm{d}x=2c\),故 \(c=\tfrac12\)。于是 \(P(1<X<2)=\int_1^2 \tfrac{x}{2}\,\mathrm{d}x=\tfrac14(4-1)=\tfrac34=0.75\)。也可用分布函数 \(F(x)=x^2/4\)(\(0\le x\le 2\))验证:\(F(2)-F(1)=1-\tfrac14=0.75\)。

练习 5-1-2

设 \(f(x)=c/x^{3}\)(\(x>1\),其余处为 0)。求常数 \(c\),并计算 \(P(X>2)\)。

答案与提示

\(1=\int_1^{\infty} c\,x^{-3}\,\mathrm{d}x=c\bigl[-\tfrac{1}{2}x^{-2}\bigr]_1^{\infty}=\tfrac{c}{2}\),故 \(c=2\)。从而 \(P(X>2)=\int_2^{\infty} 2x^{-3}\,\mathrm{d}x=\bigl[-x^{-2}\bigr]_2^{\infty}=\tfrac14=0.25\)。注意此密度支撑在无限区间上,规范性仍成立——密度不必集中在有限区间内。

练习 5-1-3

判断下列函数(均约定在所给区间外为 0)哪些是合法的概率密度,并说明理由:(a) \(f(x)=x\),\(0<x<1\);(b) \(f(x)=e^{-x}\),\(x>0\);(c) \(f(x)=1/x\),\(x>1\);(d) \(f(x)=x-1\),\(0<x<1\);(e) \(f(x)=3x^{2}\),\(0<x<1\)。

答案与提示

合法性判据只有两条:非负、全积分等于 1。(a) 非负但 \(\int_0^1 x\,\mathrm{d}x=\tfrac12\ne 1\),不是(放大一倍后的 \(2x\) 才是,见例 1)。(b) 是:\(\int_0^{\infty}e^{-x}\,\mathrm{d}x=1\)(即例 2 的指数密度)。(c) 不是:\(\int_1^{\infty} x^{-1}\,\mathrm{d}x=\infty\) 发散。(d) 不是:在 \((0,1)\) 上取负值(且积分 \(-\tfrac12\ne 1\)),违反非负性。(e) 是:\(\int_0^1 3x^2\,\mathrm{d}x=1\) 且非负(它的期望与方差见 5.2 节练习)。

练习 5-1-4

判断正误并说明理由:(a) 对连续型 rv,由 \(P(X=a)=0\) 可断言事件 \(\{X=a\}\) 不可能发生;(b) 密度必须满足 \(f(x)\le 1\);(c) 对连续型 rv,\(P(a<X<b)=P(a\le X\le b)\);(d) 把密度 \(f\) 在有限个点处的取值改动后,它仍是同一分布的密度。

答案与提示

(a) 错。概率为 0 的事件未必是不可能事件:\(X\) 每次总会取到某个值,而每个单点概率都是 0(见注记)。(b) 错。密度不是概率,只受“非负 + 积分为 1”约束:如 \((0,0.1)\) 上均匀密度恒为 10,例 3 中 \(f(0)=3\)。(c) 对。两端点均为单点事件,概率为 0,加或不加等号不改变概率(定理 2 的推论)。(d) 对。积分不受被积函数在有限个点处取值的影响,故 \(\int_{-\infty}^x f\) 即分布函数不变。