- 写出指数分布的密度函数、分布函数与生存函数,并说明速率参数 \(\lambda\) 的含义与量纲;
- 用分部积分完整推导 \(E[X]=1/\lambda\) 与 \(\mathrm{Var}(X)=1/\lambda^2\);
- 叙述并证明无记忆性,用它解释"旧器件与新器件一样可靠"的寿命悖论;
- 由均值或半衰期反求 \(\lambda\),计算中位数 \(\ln 2/\lambda\) 与指定的概率;
- 说明指数分布与几何分布的类比,以及它作为"到达间隔模型"在排队论中的角色。
1. 定义:密度、分布函数与生存函数
均匀分布刻画"等可能落入区间",正态分布刻画"大量微小因素叠加形成的误差",而本节的主角——指数随机变量(exponential random variable)——刻画的是另一类极常见的现象:等待。一只灯泡还能点多久、下一次电话何时响起、一个放射性原子何时衰变、服务器下一次请求何时到达——它们都是"直到某事件首次发生所经历的时间"。这类"寿命"或"间隔"最自然的模型就是指数分布。它与 4.7 节的泊松分布是一对孪生兄弟:单位时间内事件的计数服从泊松分布,相邻两次事件的间隔则服从指数分布。
\[ f(x)=\begin{cases}\lambda e^{-\lambda x}, & x\ge 0,\\[2pt] 0, & x<0,\end{cases}\qquad \lambda>0, \] 若连续型随机变量 \(X\) 具有上述密度,则称 \(X\) 服从参数为 \(\lambda\) 的指数分布,记作 \(X\sim \mathrm{Exp}(\lambda)\)。\(\lambda\) 称为速率参数(rate parameter),量纲为"1/时间",表示事件发生的平均频繁程度。
密度显然非负;规范性由 \(\int_0^\infty \lambda e^{-\lambda x}\,dx=\bigl[-e^{-\lambda x}\bigr]_0^\infty=1\) 保证。密度在 \(x=0\) 处取最大值 \(\lambda\),之后单调下降、以横轴为渐近线:等待"立刻发生"最有可能,等待越久越罕见,但任何长的等待都有正概率。
对 \(x\ge 0\),积分密度即得分布函数(cumulative distribution function):
\[ F(x)=P(X\le x)=\int_0^x \lambda e^{-\lambda t}\,dt=1-e^{-\lambda x},\qquad x\ge 0 \]
取补即得本节反复使用的生存函数(survival function):
\[ S(x)=P(X>x)=e^{-\lambda x},\qquad x\ge 0. \]
可靠性工程喜欢这个名字:\(S(x)\) 就是"寿命超过 \(x\)"的概率。指数分布的生存函数简洁到只需一次求幂,这使它成为寿命建模的第一站。
"\(\lambda=0.1\)/年"可以读成两句话:事件平均以每秒年 \(0.1\) 次的速率发生;平均等待 \(1/\lambda=10\) 年。\(\lambda\) 只负责设定时间单位——若 \(X\sim\mathrm{Exp}(\lambda)\),则 \(Y=\lambda X\sim\mathrm{Exp}(1)\),因为 \(P(\lambda X>t)=P(X>t/\lambda)=e^{-\lambda\cdot t/\lambda}=e^{-t}\)。换算时间单位(年→月)时 \(\lambda\) 与 \(1/\lambda\) 同步换算即可。
2. 期望与方差
由 5.2 节,连续型随机变量的期望是积分 \(E[X]=\int x f(x)\,dx\)。指数分布的这两条积分值得亲手完整算一遍——分部积分与"指数衰减快于多项式增长"这一极限事实是全部技巧所在。
\[ X\sim\mathrm{Exp}(\lambda)\quad\Longrightarrow\quad E[X]=\frac{1}{\lambda},\qquad \mathrm{Var}(X)=\frac{1}{\lambda^2}. \]
这个结果简洁得近乎"匀称":均值是 \(1/\lambda\),标准差也是 \(1/\lambda\)(变异系数为 1)。更值得注意的是它的实际含义:
\[ \lambda=\frac{1}{E[X]}. \]
只要知道平均寿命(平均等待时间)这一个数字,整个分布就完全确定了——这是指数分布在应用中如此便利、也如此危险的原因:它把"磨损、老化"等一切细节全部押注在"无记忆"这一假设上。分布明显右偏(长尾向右),中位数小于均值(见第 4 小节),"平均"被少数长寿个体拉高。
3. 无记忆性:指数分布的灵魂
一台已经用了 10 年的机器,和一台全新的机器,哪个更可能再正常工作 5 年?直觉说"新机器",但指数模型给出一个出人意料的回答:两者完全一样。这就是无记忆性(memoryless property),它是指数分布的招牌性质,也是本节的灵魂。
\[ X\sim\mathrm{Exp}(\lambda),\ s,t\ge 0\quad\Longrightarrow\quad P(X>s+t \mid X>s)=P(X>t). \]
要点在于比值 \(\dfrac{e^{-\lambda(s+t)}}{e^{-\lambda s}}\) 中因子 \(e^{-\lambda s}\) 恰好约去:已经存活过的 \(s\) 个单位时间被彻底"遗忘"。把 \(\{X>s\}\) 想成"器件已存活 \(s\)",则剩余寿命 \(X-s\) 在此条件下的分布仍是 \(\mathrm{Exp}(\lambda)\)——与新器件毫无差别。
换个角度看,无记忆性等价于失效率恒定。定义年龄 \(t\) 处的失效率(failure rate, 亦称危险率 hazard rate):在已存活到 \(t\) 的条件下,未来一小段时间 \(\Delta t\) 内失效的概率约为 \(r(t)\,\Delta t\)。对指数分布, \[ P(t<X<t+\Delta t \mid X>t)=\frac{e^{-\lambda t}-e^{-\lambda(t+\Delta t)}}{e^{-\lambda t}}=1-e^{-\lambda\Delta t}\approx \lambda\,\Delta t, \] 与当前年龄 \(t\) 无关:失效完全由"随机冲击"造成,器件不会变旧。这就是寿命悖论之所在:说"这台机器平均寿命 10 年",又发现它已正常运转 10 年,人们以为大限将至;模型却说它的期望剩余寿命仍是 10 年。真实器件会磨损老化(失效率上升),指数假设只在"失效由偶然事故主导"的场景(电子元件的随机击穿、意外断电、事故性破损)中近似成立;刻画老化的常用模型是 5.6 节的 Weibull 分布(\(\beta>1\) 时失效率递增)。
设某机器的寿命 \(X\)(年)服从指数分布,平均寿命为 10 年。(a) 求机器寿命超过 15 年的概率;(b) 已知机器已正常工作 10 年,求它再正常工作 15 年(即寿命超过 25 年)的概率;(c) 已知机器已正常工作 10 年,求它再正常工作 5 年的概率。
第 4 章的几何随机变量(geometric random variable)——"直到首次成功的试验次数"——也满足完全相同形式的无记忆性:\(P(X>m+n\mid X>m)=P(X>n)\)。把时间轴切成等长的小格,每格内"事件是否发生"近似独立,首次发生所在的格序号就是几何变量;网格无限加细,几何分布的极限正是指数分布。事实上,在连续分布中,指数分布是唯一具有无记忆性的:无记忆性迫使生存函数满足 \(S(s+t)=S(s)S(t)\),配合连续性只能解出 \(S(x)=e^{-\lambda x}\)(离散情形的唯一解则是几何分布)。
| 比较项 | 几何随机变量(离散) | 指数随机变量(连续) |
|---|---|---|
| 典型背景 | 直到首次成功的试验次数 | 直到首次事件的等待时间 |
| 取值范围 | \(1,2,3,\dots\) | \([0,\infty)\) |
| 分布列 / 密度 | \(p(1-p)^{n-1}\) | \(\lambda e^{-\lambda x}\) |
| 无记忆性 | \(P(X>m+n\mid X>m)=P(X>n)\) | \(P(X>s+t\mid X>s)=P(X>t)\) |
| 期望 | \(1/p\) | \(1/\lambda\) |
| 唯一性 | 离散情形唯一无记忆分布 | 连续情形唯一无记忆分布 |
4. 中位数、半衰期与百分位数
分布右偏使"半数个体死在什么时候"(中位数(median))比均值更贴近日常直觉。令 \(F(m)=1/2\):
\[ 1-e^{-\lambda m}=\frac12 \;\Longrightarrow\; e^{-\lambda m}=\frac12 \;\Longrightarrow\; m=\frac{\ln 2}{\lambda}\approx\frac{0.693}{\lambda}. \]
在放射性物理里,这个中位数有专名——半衰期(half-life):经过一个半衰期,未衰变原子恰好剩下一半;经过 \(k\) 个半衰期剩 \(2^{-k}\)。一般地,\(p\) 分位百分位数(percentile) \(x_p\) 由 \(F(x_p)=p\) 解得:
\[ x_p=-\frac{\ln(1-p)}{\lambda}. \]
某放射性同位素的半衰期为 5 年。(a) 求衰变时间分布的参数 \(\lambda\);(b) 求一个原子在 12 年内衰变的概率;(c) 求平均衰变时间,并与半衰期比较。
5. 应用一瞥:排队系统中的到达间隔
排队论(queueing theory)是指数分布最重要的舞台。顾客到达银行、电话呼叫抵达交换机、数据包到达路由器——如果事件"完全随机"地发生(即严格地说,事件按泊松过程(Poisson process)发生,与 4.7 节的泊松计数遥相呼应),则相邻两次到达的间隔独立同分布,且服从指数分布。"完全随机"翻译成模型语言正是无记忆性:刚刚多久没人来,不影响下一个客人还要多久才来。此外,5.3 节的练习已经给出模拟中的标准生成方法:若 \(U\sim U(0,1)\),则 \(-\ln U/\lambda\sim\mathrm{Exp}(\lambda)\)。
设顾客到达某柜台的间隔时间 \(X\)(分钟)服从指数分布,平均间隔 5 分钟。(a) 求下一次间隔小于 2 分钟的概率;(b) 求间隔超过 10 分钟的概率;(c) 已知刚过去的 3 分钟无人到达,求未来 2 分钟内有人到达的概率。
最后预告一个练习中将证明、且在可靠性分析中极为有用的事实:两个独立的指数随机变量 \(X\sim\mathrm{Exp}(\lambda_1)\) 与 \(Y\sim\mathrm{Exp}(\lambda_2)\),其最小值 \(\min(X,Y)\sim\mathrm{Exp}(\lambda_1+\lambda_2)\)——速率相加。把 \(X,Y\) 想成串联系统中两个元件的寿命,先坏的那个决定系统寿命,系统失效率正是两元件失效率之和(独立随机变量的概率计算将在第 6 章系统展开)。
6. 本节小结
- 密度 \(f(x)=\lambda e^{-\lambda x}\)(\(x\ge 0\)),分布函数 \(F(x)=1-e^{-\lambda x}\),生存函数 \(P(X>x)=e^{-\lambda x}\);\(\lambda\) 是速率,量纲 1/时间。
- \(E[X]=1/\lambda\),\(\mathrm{Var}(X)=1/\lambda^2\)(分部积分完整推导);\(\lambda=1/E[X]\):一个数字定出整个分布。
- 无记忆性 \(P(X>s+t\mid X>s)=P(X>t)\):已存活的时间被完全遗忘,旧器件与新器件一样可靠——"寿命悖论";等价于失效率恒为 \(\lambda\)。
- 指数分布是连续情形唯一无记忆的分布,是几何分布(离散、唯一无记忆)的连续版本。
- 中位数 \(m=\ln 2/\lambda\) 即半衰期;\(k\) 个半衰期后存活概率 \(2^{-k}\);\(p\) 分位数 \(x_p=-\ln(1-p)/\lambda\)。
- 应用:泊松型到达的间隔模型(排队论);独立指数变量之最小值仍为指数分布,速率相加。
练习
练习 5-5-1
设 \(X\sim\mathrm{Exp}(\lambda)\),已知 \(P(X>10)=e^{-2}\)。求 \(\lambda\)、\(E[X]\)、标准差,以及 \(P(X>30\mid X>10)\)。
答案与提示由 \(e^{-10\lambda}=e^{-2}\) 得 \(\lambda=0.2\);\(E[X]=1/\lambda=5\),标准差也是 \(5\)(指数分布变异系数恒为 1)。由无记忆性 \(P(X>30\mid X>10)=P(X>20)=e^{-0.2\times 20}=e^{-4}\approx 0.0183\)。
练习 5-5-2
(串联系统)系统由两个独立元件串联而成,元件寿命 \(X\sim\mathrm{Exp}(0.02)\)、\(Y\sim\mathrm{Exp}(0.03)\)(单位:小时),系统寿命 \(T=\min(X,Y)\)。证明 \(T\sim\mathrm{Exp}(0.05)\),并求 \(P(T>20)\) 与 \(E[T]\)。
答案与提示由独立性,\(P(T>t)=P(X>t,\,Y>t)=P(X>t)\,P(Y>t)=e^{-0.02t}\,e^{-0.03t}=e^{-0.05t}\),故 \(T\sim\mathrm{Exp}(0.02+0.03)\)。于是 \(P(T>20)=e^{-1}\approx 0.368\),\(E[T]=1/0.05=20\) 小时。一般地,独立 \(\mathrm{Exp}(\lambda_i)\) 的最小值服从 \(\mathrm{Exp}\bigl(\sum_i\lambda_i\bigr)\):串联系统的失效率是各元件失效率之和。
练习 5-5-3
某芯片寿命 \(X\sim\mathrm{Exp}(\lambda)\),已知它工作满 3 年的概率为 \(e^{-0.75}\)。求 \(\lambda\)、平均寿命、中位数、\(P(X<1)\) 以及 90% 分位数。
答案与提示\(e^{-3\lambda}=e^{-0.75}\) 给出 \(\lambda=0.25\)(每年),平均寿命 \(4\) 年;中位数 \(m=\ln 2/0.25=4\ln 2\approx 2.77\) 年;\(P(X<1)=1-e^{-0.25}\approx 0.221\);90% 分位数 \(x_{0.9}=-\ln(0.1)/0.25=4\ln 10\approx 9.21\) 年——是均值的两倍多,再次体现长尾。
练习 5-5-4
(讨论)人类寿命为什么不满足无记忆性?请用失效率的概念说明,并指出指数分布在哪类场景下仍是合理近似。
答案与提示无记忆性等价于失效率恒定,而人类死亡率随年龄剧烈变化:婴儿期较高、青壮年低而平稳、老年阶段快速上升(人口学中的冈珀茨增长律)。若人类寿命真无记忆,一位 90 岁老人的剩余寿命分布应与新生儿相同、平均还能再活约七八十年,显然荒谬。指数分布适合"随机冲击主导"的失效(事故、雷击、随机击穿),或仅在某个失效率近似平稳的局部年龄段(如青壮年期)作粗略近似;刻画老化应选用失效率递增的模型,如 5.6 节的 Weibull 分布(\(\beta>1\))。