第 4 章 · 随机变量

4.8 其他离散型概率分布

Other Discrete Probability Distributions
学习目标
  • 写出几何分布的分布列,推导并运用其期望 \(1/p\) 与方差 \(q/p^{2}\);
  • 叙述并证明几何分布的离散无记忆性,说明其概率含义与常见误读;
  • 用负二项分布计算"第 \(r\) 次成功恰在第 \(k\) 次"的概率,并说明期望 \(r/p\) 的分解论证;
  • 写出超几何分布的分布列,阐明它与二项分布的两种联系(放回抽样与总体极限);
  • 在产品抽检、扑克、彩票等情境中识别并正确选用上述三类分布。

1. 从"数成功"到"等成功"

前几节我们关注的是"固定试验次数 \(n\),数一数成功的次数":伯努利随机变量对应单次试验,二项随机变量对应 \(n\) 次独立重复(4.6 节),泊松随机变量则是二项分布在"\(n\) 大 \(p\) 小"时的极限近似(4.7 节)。但现实中还有两类同样自然的问题。

第一类问的是"等到":掷骰子要掷几次才第一次出现 6 点?一台机器要启动几次才第一次失败?第二类问的是"不放回地抽":从一批含次品的产品中一次抽出 \(n\) 件,其中会有几件次品?前者引出几何分布(geometric distribution)与负二项分布(negative binomial distribution)——它们刻画等待时间(waiting time);后者引出超几何分布(hypergeometric distribution)——它刻画不放回抽样(sampling without replacement)中指定类对象的个数。本节依次建立这三个分布,并厘清它们与二项分布的关系。全文约定:各次试验相互独立、每次成功的概率为 \(p\),并记 \(q = 1-p\)。

2. 几何随机变量

在成功率为 \(p\) 的独立重复试验中,有时我们关心的不是"成功了几次",而是"等到第一次成功要多久"。把首次成功出现时的试验序号记为 \(K\),它是一个取正整数值的随机变量。

定义 1 几何随机变量

设独立重复试验中每次成功的概率为 \(p\)(\(0<p<1\)),\(K\) 为首次成功(first success)出现时的试验序号,则称 \(K\) 为几何随机变量(geometric random variable),其分布列为 \[ P(K=k) = q^{\,k-1}\,p, \qquad k = 1, 2, 3, \ldots \]

事件 \(\{K=k\}\) 意味着"前 \(k-1\) 次全部失败、第 \(k\) 次成功",由独立性即得概率 \(q^{k-1}p\)。用几何级数求和可验证规范性:\(\sum_{k\ge 1} q^{k-1}p = \frac{p}{1-q} = 1\)——"几何分布"正是得名于这条几何级数。

图 1 画出 \(p=1/6\)(掷骰子等待首个 6 点)时的分布列形态:棒高严格按几何衰减,最可能的取值是 \(k=1\),右侧拖着一条长尾——等待时间总是"右偏"的。

0.167 0.139 0.116 0.096 0.080 0.067 0.056 0.047 0.039 0.032 1 2 3 4 5 6 7 8 9 10 E[K] = 6 0.15 0.10 0.05 0 p = 1/6 时几何分布的分布列:p(k) = (5/6)^(k−1)·(1/6)
图 1:几何分布 \(p=1/6\) 的分布列,棒高按 \(p(k)=(5/6)^{k-1}\cdot(1/6)\) 的真实比例绘制。分布高度右偏:最可能的取值是 \(k=1\)(概率 \(1/6\approx 0.167\)),而均值 \(E[K]=6\)(深蓝三角标记)远在右侧;前 10 次内出现首次成功的概率为 \(1-(5/6)^{10}\approx 0.838\)。
定理 1 几何分布的期望与方差

\[ E[K] = \frac{1}{p}, \qquad \mathrm{Var}(K) = \frac{q}{p^{2}} \qquad (q = 1-p). \]

证明按第一次试验的结果分解:以概率 \(p\) 首次即成功,\(K=1\);以概率 \(q\) 第一次失败,此后相当于"从下一次试验重新开始",即 \(K = 1 + K'\),其中 \(K'\) 与 \(K\) 同分布(这正是 3.5 节的条件概率观点)。于是 \[ E[K] = p\cdot 1 + q\bigl(1 + E[K]\bigr) \implies p\,E[K] = 1 \implies E[K] = \frac{1}{p}. \] 同理,\(E[K^{2}] = p\cdot 1^{2} + q\,E\bigl[(1+K')^{2}\bigr] = p + q\bigl(1 + 2E[K] + E[K^{2}]\bigr)\),解得 \(E[K^{2}] = \frac{2-p}{p^{2}}\)。故 \[ \mathrm{Var}(K) = \frac{2-p}{p^{2}} - \frac{1}{p^{2}} = \frac{1-p}{p^{2}} = \frac{q}{p^{2}}. \qquad\blacksquare \]
例 1 掷骰子等多久才出第一个 6

掷一颗均匀骰子,直到第一次出现 6 点为止,\(K\) 为所需掷的次数。(a) 平均需要掷多少次?(b) 求 \(P(K>6)\),即"掷了 6 次还没有出现 6"的概率。

这是 \(p=1/6\) 的几何分布。(a) \(E[K] = \dfrac{1}{p} = 6\),平均需要掷 6 次;其方差为 \(\mathrm{Var}(K) = \dfrac{5/6}{(1/6)^{2}} = 30\),标准差 \(\sqrt{30}\approx 5.48\)——等待时间的波动与均值几乎同一量级。(b) \(\{K>6\}\) 即前 6 次全都不是 6 点,故 \[ P(K>6) = q^{6} = \left(\frac{5}{6}\right)^{6} = \frac{15625}{46656} \approx 0.335. \] 也就是说,尽管"平均 6 次",仍有约三分之一的机会超过 6 次才见到首个 6——这正是图 1 中长尾的直接体现。一般地,\(P(K\le k) = 1-q^{k}\)。
定理 2 离散无记忆性

设 \(K\) 服从几何分布,则对任意非负整数 \(m, n\), \[ P(K > m+n \,\big|\, K > m) = P(K > n). \]

证明\(\{K>m\}\) 表示前 \(m\) 次试验全部失败,故 \(P(K>m) = q^{m}\);同理 \(P(K>m+n) = q^{m+n}\)。于是 \[ P(K > m+n \,\big|\, K > m) = \frac{q^{m+n}}{q^{m}} = q^{n} = P(K > n). \qquad\blacksquare \]

直观含义:在已知"已经失败了 \(m\) 次"的条件下,"还要再等超过 \(n\) 次"的条件概率,与从头开始算的 \(P(K>n)\) 完全相同——试验装置不记得已经失败过多少次,重新计时的成功率始终是 \(p\)。

注记 无记忆性:几何分布的签名

在所有取正整数值的分布中,只有几何分布满足无记忆性(逆命题的证明从略)。连续情形的对应者是指数分布(exponential distribution),它满足连续版本 \(P(X>s+t\mid X>s)=P(X>s)\),我们将在 5.5 节细谈——两者分别是"离散时钟"与"连续时钟"上的等待时间。另一个提醒:由无记忆性,"已经失败了很多次,下次该成功了"的说法不成立(赌徒谬误,见 1.1 节练习 3):无论此前失败多久,下一次试验成功的概率仍是 \(p\)。

3. 负二项随机变量

把"首次成功"推广为"第 \(r\) 次成功",就得到负二项分布:设 \(K_r\) 为第 \(r\) 次成功出现时的试验序号。为使 \(\{K_r = k\}\) 发生,必须且只须:(i) 第 \(k\) 次试验成功;(ii) 前 \(k-1\) 次试验中恰有 \(r-1\) 次成功。由第 1 章的计数原理,满足 (ii) 的成功/失败排列模式共有 \(\binom{k-1}{r-1}\) 种,每种的概率为 \(p^{r-1}q^{(k-1)-(r-1)}\),再乘上第 \(k\) 次成功的概率 \(p\),即得下面的分布列。

定义 2 负二项随机变量

设 \(K_r\) 为独立重复试验(单次成功率 \(p\))中第 \(r\) 次成功出现时的试验序号,则其分布列为 \[ P(K_r = k) = \binom{k-1}{r-1}\, p^{r}\, q^{\,k-r}, \qquad k = r, r+1, r+2, \ldots \]

\(r=1\) 时 \(\binom{k-1}{0}=1\),退化为几何分布。用广义二项级数 \((1-q)^{-r} = \sum_{m=0}^{\infty}\binom{m+r-1}{r-1}q^{m}\) 可验证概率总和为 \(p^{r}(1-q)^{-r}=1\)——"负二项"之名正来自这条负二项级数(negative binomial series)。

定理 3 负二项分布的期望与方差

\[ E[K_r] = \frac{r}{p}, \qquad \mathrm{Var}(K_r) = \frac{r\,q}{p^{2}}. \]

证明把漫长的等待切成 \(r\) 段:令 \(T_1\) 为首次成功的等待次数,\(T_i\)(\(i\ge 2\))为第 \(i-1\) 次成功之后到第 \(i\) 次成功之间追加的试验次数,则 \[ K_r = T_1 + T_2 + \cdots + T_r, \] 且各 \(T_i\) 都服从同一个几何分布(由试验的独立性与无记忆性,每段等待都"从零开始")。于是期望按段累加:\(E[K_r] = r\cdot\frac{1}{p} = \frac{r}{p}\);再由各段相互独立,方差同样累加:\(\mathrm{Var}(K_r) = r\cdot\frac{q}{p^{2}}\)。"和的期望等于期望之和"的一般形式(期望的线性性质)将在 7.2 节严格陈述,这里的分解正是其雏形。
例 2 第 2 次成功恰发生在第 5 次

设每次试验成功的概率为 \(p\),各次独立。求第 2 次成功恰好发生在第 5 次试验的概率;并就 \(p=\tfrac{1}{2}\) 与掷骰子出 6 点(\(p=\tfrac{1}{6}\))给出数值。

这是 \(r=2\) 的负二项分布。第 5 次试验必须成功,且前 4 次中恰有 1 次成功(其位置有 \(\binom{4}{1}=4\) 种选择),故 \[ P(K_2 = 5) = \binom{4}{1}\, p^{2} q^{3} = 4\,p^{2}q^{3}. \] 当 \(p=\tfrac{1}{2}\) 时,\(4\cdot\bigl(\tfrac{1}{2}\bigr)^{5} = \tfrac{1}{8} = 0.125\);当 \(p=\tfrac{1}{6}\) 时,\(4\cdot\bigl(\tfrac{1}{6}\bigr)^{2}\bigl(\tfrac{5}{6}\bigr)^{3} = \tfrac{500}{7776} \approx 0.064\)。顺带地,\(E[K_2] = 2/p\):掷骰子平均需 \(12\) 次才能见到第 2 个 6 点。

4. 超几何随机变量

二项分布的推导依赖于"各次试验成功概率不变",这要么要求放回抽样,要么要求总体无穷大。而现实中的抽检、发牌都是不放回的:抽走一件次品后,余下产品的次品率会随之变化。刻画这种情形的分布就是超几何分布。

定义 3 超几何随机变量

设 \(N\) 件产品中有 \(K\) 件次品,从中不放回地随机抽取 \(n\) 件,\(X\) 为抽得的次品数,则 \[ P(X = j) = \frac{\binom{K}{j}\binom{N-K}{\,n-j\,}}{\binom{N}{n}}, \qquad \max(0,\, n-(N-K)) \le j \le \min(n, K), \] 范围之外的概率为 \(0\)。称 \(X\) 服从超几何分布(hypergeometric distribution),记作 \(X \sim H(N, K, n)\)。

推导:从 \(N\) 件中取 \(n\) 件共有 \(\binom{N}{n}\) 种等可能的取法;要恰有 \(j\) 件次品,须从 \(K\) 件次品中取 \(j\) 件、再从 \(N-K\) 件正品中取 \(n-j\) 件,由乘法原理共 \(\binom{K}{j}\binom{N-K}{n-j}\) 种。用第 1 章的组合恒等式可验证这些概率之和恰为 \(1\)。

例 3 一手牌里的红心张数

从一副 52 张扑克牌中发 5 张,\(X\) 为其中红心(共 13 张)的张数。求 \(P(X=3)\) 与 \(E[X]\)。

发牌是不放回抽样,故 \(X \sim H(N=52,\, K=13,\, n=5)\): \[ P(X=3) = \frac{\binom{13}{3}\binom{39}{2}}{\binom{52}{5}} = \frac{286 \times 741}{2\,598\,960} = \frac{211\,926}{2\,598\,960} \approx 0.0815. \] 即约 \(8.15\%\) 的一手牌恰好有三张红心。期望方面,\(E[X] = n\cdot\frac{K}{N} = 5\times\frac{13}{52} = 1.25\) 张——这一"按比例分摊"的算法为何严格成立,见练习 3 与 7.2 节
定理 4 超几何分布与二项分布的关系

设 \(X \sim H(N, K, n)\),记 \(\hat p = K/N\)。(i) 若改为放回抽样,则抽得的次品数服从二项分布 \(B(n, \hat p)\);(ii) 当 \(N\to\infty\) 且 \(\hat p = K/N \to p\) 保持有理(即总体无限增大而次品率稳定)时, \[ \frac{\binom{K}{j}\binom{N-K}{n-j}}{\binom{N}{n}} \;\longrightarrow\; \binom{n}{j}\, p^{j}\, (1-p)^{\,n-j}. \]

证明(i) 放回时各次抽取相互独立、每次抽到次品的概率都固定为 \(\hat p\),恰为 \(n\) 重伯努利试验(4.6 节)。(ii) 记下降阶乘 \((a)_r = a(a-1)\cdots(a-r+1)\),则直接展开可得恒等式 \[ \frac{\binom{K}{j}\binom{N-K}{n-j}}{\binom{N}{n}} = \binom{n}{j}\,\frac{(K)_{j}\,(N-K)_{n-j}}{(N)_{n}}. \] 分子分母同除以 \(N^{n}\):当 \(N\to\infty\)、\(K/N\to p\) 时,\((K)_{j}/N^{j}\to p^{j}\),\((N-K)_{n-j}/N^{n-j}\to (1-p)^{n-j}\),右边极限即 \(\binom{n}{j}p^{j}(1-p)^{n-j}\)。

直观上:当 \(n\) 相对 \(N\) 很小(经验上 \(n/N\) 不超过一成)时,"抽走几张牌几乎不改变剩余牌的比例",二项分布就是很好的近似。图 2 把 \(H(52,13,5)\) 与同均值的 \(B(5,\,1/4)\) 并排对比——二者已相当接近,但不放回抽样的分布略更向中心集中。

0.2215 0.4114 0.2743 0.0815 0.0107 0.0005 0.2373 0.3955 0.2637 0.0879 0.0146 0.0010 0 1 2 3 4 5 0 1 2 3 4 5 0.4 0.3 0.2 0.1 0 超几何分布:N=52, K=13, n=5 二项分布:n=5, p=1/4 μ = 1.25 μ = 1.25 两组分布的均值同为 μ = 1.25;不放回抽样(左)方差更小(0.864 对 0.938),分布更向中心集中
图 2:5 张牌中红心张数的两种建模——超几何 \(H(52,13,5)\)(左,绛红)与二项 \(B(5,\,1/4)\)(右,深蓝),棒高均按真实比例绘制。两组均值同为 \(\mu = nK/N = 5/4 = 1.25\)(金色虚线);不放回抽样的方差 \(\frac{5\cdot 13\cdot 39}{52\cdot 52}\cdot\frac{47}{51}\approx 0.864\) 小于二项的 \(5\cdot\frac14\cdot\frac34 = 0.938\),故左图两端略低、中心略高。
例 4 36 选 6 彩票的中奖匹配数

某彩票从 1 至 36 中开出 6 个号码,你也选了 6 个号码,\(X\) 为选中的号码与开奖号码的匹配个数。求 \(P(X=3)\)、全中概率与 \(E[X]\)。

把 36 个号码看作总体,其中 6 个开奖号码视为"次品",你选的 6 个号码相当于不放回抽取,故 \(X \sim H(N=36,\, K=6,\, n=6)\): \[ P(X=3) = \frac{\binom{6}{3}\binom{30}{3}}{\binom{36}{6}} = \frac{20 \times 4060}{1\,947\,792} = \frac{81\,200}{1\,947\,792} \approx 0.0417, \] 即约 \(4.17\%\) 的彩票恰好中 3 个号码。全中(一等奖)的概率为 \(\binom{6}{6}\binom{30}{0}/\binom{36}{6} = 1/1\,947\,792 \approx 5.1\times 10^{-7}\);平均匹配数 \(E[X] = nK/N = 6\times 6/36 = 1\)。

5. 本节小结

本节补齐了"成功–失败"框架下另外三个常用分布。它们与二项分布的分工可以用两句话概括:数什么(数成功次数,还是数等待时间、不放回抽样中的命中数)与怎么抽(放回还是不放回)。

表 1:本节三个分布一览(记 \(q = 1-p\))
分布试验背景分布列期望方差
几何 \(K\)首次成功的试验序号 \(k\ge 1\)\(q^{k-1}p\)\(\dfrac{1}{p}\)\(\dfrac{q}{p^{2}}\)
负二项 \(K_r\)第 \(r\) 次成功的试验序号 \(k\ge r\)\(\binom{k-1}{r-1}p^{r}q^{k-r}\)\(\dfrac{r}{p}\)\(\dfrac{rq}{p^{2}}\)
超几何 \(X\)不放回抽 \(n\) 件中的次品数 \(j\)\(\dfrac{\binom{K}{j}\binom{N-K}{n-j}}{\binom{N}{n}}\)\(\dfrac{nK}{N}\)\(n\hat p(1-\hat p)\dfrac{N-n}{N-1}\)
要点回顾
  • 几何分布:\(P(K=k)=q^{k-1}p\),\(E[K]=1/p\),\(\mathrm{Var}(K)=q/p^{2}\);证明的核心是"失败一次后重新开始"的递推分解;
  • 无记忆性:\(P(K>m+n\mid K>m)=P(K>n)\),已失败多少次不改变未来的等待规律;几何分布是唯一具有此性质的取正整数值分布;
  • 负二项分布:\(P(K_r=k)=\binom{k-1}{r-1}p^{r}q^{k-r}\),\(E[K_r]=r/p\)——把等待拆成 \(r\) 段独立的几何等待之和;
  • 超几何分布:\(P(X=j)=\binom{K}{j}\binom{N-K}{n-j}\big/\binom{N}{n}\);放回抽样或 \(N\to\infty\)(\(K/N\) 固定)时退化为二项分布;期望 \(E[X]=nK/N\);
  • 选分布先问两句:数的是次数还是等待?抽样是放回还是不放回

练习

练习 4-8-1

掷骰子直到第 2 次出现 6 点。求恰好在第 4 次结束的概率与平均所需次数。

答案与提示

\(r=2\)、\(p=1/6\) 的负二项分布:\(P(K_2=4)=\binom{3}{1}\bigl(\tfrac{1}{6}\bigr)^{2}\bigl(\tfrac{5}{6}\bigr)^{2}=\tfrac{75}{1296}\approx 0.058\);平均 \(E[K_2]=2/(1/6)=12\) 次。

练习 4-8-2

每次试验成功率为 \(p=0.1\)。已知前 10 次全部失败,求"还需超过 5 次才见首次成功"的条件概率,并与无条件的 \(P(K>5)\) 比较。

答案与提示

由无记忆性,两者相等,均为 \(q^{5}=0.9^{5}=0.59049\approx 0.590\)。也可直接用定义验证:\(P(K>15\mid K>10)=q^{15}/q^{10}=q^{5}\)。已经失败 10 次这一事实不提供任何新信息。

练习 4-8-3

100 件产品中有 5 件次品,不放回抽 20 件。不写出分布列,猜测平均次品数,并用两个极端情形检验你的猜测。

答案与提示

每件特定产品被抽中的机会都是 \(\tfrac{20}{100}\),5 件次品平均贡献 \(5\times\tfrac{20}{100}=1\) 件,即 \(E[X]=nK/N=1\)。检验:\(n=100\)(全抽)时期望必为 5,公式给 \(100\times\tfrac{5}{100}=5\);\(n=1\) 时为单次抽样,期望 \(\tfrac{5}{100}=0.05\),公式同样吻合。"逐件计数再相加"的严格工具是指示随机变量与期望的线性性质,将在 7.2 节展开。

练习 4-8-4

掷骰子等待首个 6 点(\(p=1/6\))。求 \(P(K\le 4)\);至少要掷多少次,才能使"期间出现 6 点"的概率超过一半?

答案与提示

\(P(K\le 4)=1-(5/6)^{4}=1-\tfrac{625}{1296}=\tfrac{671}{1296}\approx 0.518\)。一般地 \(P(K\le n)=1-(5/6)^{n}\),令其超过 \(\tfrac12\) 得 \((5/6)^{n}<\tfrac12\),即 \(n > \ln\tfrac12\big/\ln\tfrac56 \approx 3.8\),故至少掷 4 次(与前一数值一致:恰为 0.518)。