- 写出顺序统计量 \(X_{(1)}\le\cdots\le X_{(n)}\) 的定义,并说明连续总体下样本值以概率 1 互不相同;
- 独立推导最大值与最小值的分布 \(F(x)^n\) 与 \(1-[1-F(x)]^n\) 及其密度公式;
- 用多项安排计数的直观论证导出第 \(k\) 个顺序统计量的密度,并了解它与贝塔分布的联系;
- 将极值分布用于可靠性分析:指数组件串联后系统寿命服从 \(\mathrm{Exp}(n\lambda)\),平均寿命 \(1/(n\lambda)\);
- 会求小样本(\(n=3\))样本中位数的密度与期望,并计算 \(U(0,1)\) 样本极值的期望。
1. 顺序统计量的定义
统计问题的出发点是样本(sample):设 \(X_1,X_2,\ldots,X_n\) 是取自某个总体的 \(n\) 个独立同分布(independent and identically distributed, 简称 iid)随机变量——例如从同一生产线上随机抽取的 \(n\) 个零件的寿命。6.2 节告诉我们,独立性使联合分布完全由单个变量的边缘分布决定。本节研究这组随机变量的一类重要函数:把它们"从小到大排序"之后的产物。许多实际问题天然只关心排序后的量:\(n\) 天里的最高水位、一批零件中最早失效的那一个、全班成绩排队后位于正中间的那一个。
设 \(X_1,\ldots,X_n\) 独立同分布,其共同分布函数为 \(F\)。将这 \(n\) 个观测值从小到大重新排列,记第 \(k\) 小的值为
\[ X_{(1)} \le X_{(2)} \le \cdots \le X_{(k)} \le \cdots \le X_{(n)}, \]称 \(X_{(k)}\) 为第 \(k\) 个顺序统计量(k-th order statistic);\(X_{(1)}=\min(X_1,\ldots,X_n)\) 为最小值,\(X_{(n)}=\max(X_1,\ldots,X_n)\) 为最大值。
注意:顺序统计量是关于 \(X_1,\ldots,X_n\) 的对称函数——无论哪个观测恰好排到第 \(k\) 位,\(X_{(k)}\) 的值都一样,因此它当然还是随机变量。当总体为连续型时,任意两个样本值相等的概率为 \(0\),故以概率 1 有严格不等式 \(X_{(1)}<X_{(2)}<\cdots<X_{(n)}\),排序没有歧义。
顺序统计量家族提供了一批常用统计量:\(X_{(1)}\) 与 \(X_{(n)}\) 分别称为样本最小值与样本最大值,合称极值(extreme values);两者之差 \(R=X_{(n)}-X_{(1)}\) 称为极差(range),是衡量样本散布的最简单度量;位于"正中间"的那个顺序统计量称为样本中位数(sample median),它对极端值不敏感,是稳健统计的首选位置度量(见第 4 小节)。本节的中心任务,就是求出这些"由排序产生"的随机变量的分布。
2. 极值的分布:最大值与最小值
先处理两个极端情形。求最大值与最小值的分布只需要两件工具:独立性("同时发生"的概率等于概率之积,见 6.2 节)与分布函数,推导非常干净。
设 \(X_1,\ldots,X_n\) 独立同分布,分布函数为 \(F(x)\),密度为 \(f(x)\),则
\[ F_{X_{(n)}}(x)=P\bigl(X_{(n)}\le x\bigr)=F(x)^n, \qquad F_{X_{(1)}}(x)=P\bigl(X_{(1)}\le x\bigr)=1-\bigl[1-F(x)\bigr]^n, \] \[ f_{X_{(n)}}(x)=n\,F(x)^{n-1}f(x), \qquad f_{X_{(1)}}(x)=n\,\bigl[1-F(x)\bigr]^{n-1}f(x). \]两个公式的结构完全对偶:把最小值问题中的每个事件换成补事件,\(F\) 与 \(1-F\) 就互换角色。密度中因子 \(f(x)\) 表示"有一个观测恰好落在 \(x\) 处",而 \(F(x)^{n-1}\)(或 \([1-F(x)]^{n-1}\))表示其余 \(n-1\) 个观测全部落在其左侧(或右侧)。
设 \(X_1,X_2,X_3\) 独立同分布,均服从 \((0,1)\) 上的均匀分布 \(U(0,1)\)。求最大值 \(X_{(3)}\) 与最小值 \(X_{(1)}\) 的密度,并用积分计算 \(E[X_{(3)}]\) 与 \(E[X_{(1)}]\)。
图 2 显示了一个明显趋势:观测越多,最大值越挤向右端、最小值越挤向左端。事实上对 \(U(0,1)\) 样本有 \(E[X_{(n)}]=n/(n+1)\to 1\),\(E[X_{(1)}]=1/(n+1)\to 0\)(练习 1 给出一般 \(n\) 的计算)。这正是洪水平、强度极值等"重现期"问题的数学骨架。
3. 可靠性应用:串联与并联系统
可靠性理论(reliability theory)是极值分布最直接的应用舞台。设一个系统由 \(n\) 个组件构成,组件 \(i\) 的寿命为 \(X_i\)。若组件串联(series system)——系统正常工作当且仅当每个组件都正常,如同一根链条任一环断裂即整链断开——则系统寿命为 \[ T_{\text{串}}=\min(X_1,\ldots,X_n); \] 反之,并联系统(parallel system)只要有至少一个组件正常即可工作,故 \[ T_{\text{并}}=\max(X_1,\ldots,X_n), \] 这种"多留一条后路"的设计称为冗余(redundancy)。于是,串联系统的寿命分析就是最小值的分布问题,并联系统就是最大值的分布问题。
设 \(n\) 个组件的寿命相互独立且都服从参数为 \(\lambda\) 的指数分布(平均寿命 \(1/\lambda\),无记忆性见 5.5 节)。(a) 证明由它们组成的串联系统寿命 \(T\) 服从 \(\mathrm{Exp}(n\lambda)\),并求 \(E[T]\);(b) 两个组件 \(\lambda=1/1000\)(即单个平均寿命 1000 小时)串联,求系统平均寿命。
并联系统则相反:由定理 1,\(F_{T_{\text{并}}}(t)=\bigl(1-e^{-\lambda t}\bigr)^n\),它不再是指数分布——冗余改变了失效机制,无记忆性随之丧失。两个 \(\lambda=1/1000\) 的组件并联时 \(E[T]=1500\) 小时(计算见练习 4):冗余确实延长了寿命,但收益并非翻倍。
4. 第 k 个顺序统计量与样本中位数
最大值对应 \(k=n\),最小值对应 \(k=1\);介于两者之间的一般情形,其密度的形态可以用一个极其直观的计数论证得到。关键想法:\(X_{(k)}\) 落在 \(x\) 附近,意味着 \(n\) 个观测中"恰有一个落在 \(x\) 旁边,\(k-1\) 个落在 \(x\) 左侧,\(n-k\) 个落在 \(x\) 右侧"——这是一个三类安排的计数问题。
设 \(X_1,\ldots,X_n\) 独立同分布,分布函数为 \(F\),密度为 \(f\),则对 \(1\le k\le n\),
\[ f_{X_{(k)}}(x)=\frac{n!}{(k-1)!\,(n-k)!}\,F(x)^{k-1}\,\bigl[1-F(x)\bigr]^{\,n-k}\,f(x). \]作为检验:\(k=n\) 时系数为 \(n!/[(n-1)!\,0!]=n\),\(f_{X_{(n)}}=nF^{\,n-1}f\);\(k=1\) 时同理回到 \(n[1-F]^{\,n-1}f\)——定理 1 是其特例。有了一般公式,样本中位数(sample median)的分布便可直接读出:\(n\) 为奇数时中位数定义为 \(X_{((n+1)/2)}\);\(n\) 为偶数时习惯取正中两个值的平均 \(\bigl(X_{(n/2)}+X_{(n/2+1)}\bigr)/2\)(后者需借助 6.7 节的联合分布才能处理)。
设 \(X_1,X_2,X_3\) 独立同分布 \(U(0,1)\),求样本中位数 \(X_{(2)}\) 的密度与期望 \(E[X_{(2)}]\)。
定理 2 表明,\(U(0,1)\) 样本的第 \(k\) 个顺序统计量服从参数为 \((k,\,n-k+1)\) 的贝塔分布(Beta distribution)——公式中 \(x^{k-1}(1-x)^{n-k}\) 与阶乘系数的组合正是贝塔密度的标准形状(例 3 的 \(6x(1-x)\) 即 \(\mathrm{Beta}(2,2)\))。更进一步,若总体的 \(F\) 连续且严格递增,则由概率积分变换 \(Y=F(X)\sim U(0,1)\)(5.7 节的变量替换),任意总体的顺序统计量经 \(F\) 变换后都化归均匀情形——这就是 \(U(0,1)\) 案例具有普遍意义的原因。由贝塔积分还可得简洁公式 \(E\bigl[X_{(k)}\bigr]=\dfrac{k}{n+1}\):\(n\) 个观测"平均地把 \((0,1)\) 分成 \(n+1\) 等份"(练习 1 是其 \(k=n\) 的特例)。
| 统计量 | 密度(一般总体) | \(U(0,1)\) 总体 | 分布记号 |
|---|---|---|---|
| 最大值 \(X_{(n)}\) | \(nF^{\,n-1}f\) | \(nx^{\,n-1}\) | \(\mathrm{Beta}(n,1)\) |
| 最小值 \(X_{(1)}\) | \(n(1-F)^{\,n-1}f\) | \(n(1-x)^{\,n-1}\) | \(\mathrm{Beta}(1,n)\) |
| 第 \(k\) 个 \(X_{(k)}\) | \(\dfrac{n!}{(k-1)!(n-k)!}F^{\,k-1}(1-F)^{\,n-k}f\) | \(\dfrac{n!}{(k-1)!(n-k)!}x^{\,k-1}(1-x)^{\,n-k}\) | \(\mathrm{Beta}(k,n-k+1)\) |
5. 本节小结
- 把样本 \(X_1,\ldots,X_n\) 从小到大排序得顺序统计量 \(X_{(1)}\le\cdots\le X_{(n)}\);连续总体下以概率 1 严格排序。
- 极值分布只依赖独立性:\(F_{X_{(n)}}=F^n\),\(F_{X_{(1)}}=1-(1-F)^n\);密度为 \(nF^{\,n-1}f\) 与 \(n(1-F)^{\,n-1}f\)。
- 一般公式:\(f_{X_{(k)}}=\dfrac{n!}{(k-1)!(n-k)!}F^{\,k-1}(1-F)^{\,n-k}f\),来自"1 个落在 \(x\)、\(k-1\) 个在左、\(n-k\) 个在右"的多项安排计数。
- 应用:串联系统寿命 \(=\min\),iid 指数组件时 \(T\sim\mathrm{Exp}(n\lambda)\),\(E[T]=1/(n\lambda)\);并联系统寿命 \(=\max\),分布 \(F^n\),不再是指数分布。
- 样本中位数:\(n=3\) 时密度 \(6x(1-x)\),\(E=\tfrac12\);\(U(0,1)\) 样本有 \(E[X_{(k)}]=k/(n+1)\),即 \(X_{(k)}\sim\mathrm{Beta}(k,n-k+1)\)。
练习
练习 6-6-1
设 \(X_1,\ldots,X_n\) 独立同分布 \(U(0,1)\),求 \(E[X_{(n)}]\) 与 \(E[X_{(1)}]\)。
答案与提示由定理 1,\(f_{X_{(n)}}(x)=nx^{\,n-1}\),\(f_{X_{(1)}}(x)=n(1-x)^{\,n-1}\)(\(0<x<1\))。故 \[ E\bigl[X_{(n)}\bigr]=\int_0^1 x\cdot nx^{\,n-1}\,dx=\frac{n}{n+1},\qquad E\bigl[X_{(1)}\bigr]=\int_0^1 x\cdot n(1-x)^{\,n-1}\,dx=\frac{1}{n+1} \] (后者可令 \(u=1-x\) 化为 \(\int_0^1(1-u)^n\,du=\tfrac1{n+1}\) 的倍数)。例 1 的 \(\tfrac34,\tfrac14\) 即 \(n=3\) 特例;一般地 \(E[X_{(k)}]=k/(n+1)\)。
练习 6-6-2
证明最小值的分布公式 \(F_{X_{(1)}}(x)=1-[1-F(x)]^n\),并导出其密度。
答案与提示从补事件入手:\(\{X_{(1)}>x\}=\{X_1>x\}\cap\cdots\cap\{X_n>x\}\)。由独立性,\(P(X_{(1)}>x)=\prod_{i=1}^nP(X_i>x)=[1-F(x)]^n\)。于是 \(F_{X_{(1)}}(x)=1-[1-F(x)]^n\);对 \(x\) 求导(注意内层导数为 \(-f(x)\))得 \(f_{X_{(1)}}(x)=n[1-F(x)]^{\,n-1}f(x)\)。要点:最小值的"生存函数"比分布函数更好用,这在可靠性分析(例 2)中反复出现。
练习 6-6-3
设 \(X_1,X_2\) 独立同分布 \(U(0,1)\),极差 \(R=X_{(2)}-X_{(1)}=|X_1-X_2|\)。求 \(R\) 的密度与 \(E[R]\)。
答案与提示用几何方法:\(\{R\le r\}\) 即单位正方形中满足 \(|x-y|\le r\) 的带形区域,其面积为 \(1-(1-r)^2\)(两个角落三角形被去掉)。故 \(F_R(r)=2r-r^2\)(\(0\le r\le 1\)),求导得 \[ f_R(r)=2(1-r),\qquad 0<r<1, \] \[ E[R]=\int_0^1 r\cdot 2(1-r)\,dr=2\Bigl(\frac12-\frac13\Bigr)=\frac13. \] 极差在 \(0\) 附近最可能取值——两个均匀观测倾向于相距不远。
练习 6-6-4
两个独立组件,寿命均服从 \(\lambda=1/1000\) 的指数分布(单位:小时)。将它们并联,求系统寿命 \(T=\max(X_1,X_2)\) 的分布函数、密度与 \(E[T]\),并与串联情形(例 2)比较。
答案与提示由定理 1,\(F_T(t)=\bigl(1-e^{-t/1000}\bigr)^2\),求导得 \(f_T(t)=2\lambda e^{-\lambda t}\bigl(1-e^{-\lambda t}\bigr)\)(\(\lambda=1/1000\))。期望用生存函数积分(4.3 节):\(P(T>t)=1-F_T(t)=2e^{-\lambda t}-e^{-2\lambda t}\),故 \[ E[T]=\int_0^\infty\bigl(2e^{-\lambda t}-e^{-2\lambda t}\bigr)\,dt=\frac{2}{\lambda}-\frac{1}{2\lambda}=\frac{3}{2\lambda}=1500\ \text{小时}. \] 比较:单组件 1000 小时,串联 500 小时,并联 1500 小时——冗余提高寿命,但并非按组件数翻倍;且并联寿命已不是指数分布,无记忆性丧失。