第 4 章 · 随机变量

4.6 伯努利随机变量与二项随机变量

The Bernoulli and Binomial Random Variables
学习目标
  • 写出伯努利随机变量的分布列,并推导其期望 \(p\) 与方差 \(pq\);
  • 对 \(n\) 重独立重复试验,独立完成二项分布列 \(P\{X=k\}=\binom{n}{k}p^k q^{n-k}\) 的两步推导(特定模式概率 + 模式计数);
  • 用指示变量分解 \(X=\sum I_i\) 证明 \(E[X]=np\)、\(\mathrm{Var}(X)=npq\),并能指出独立性在哪一步被使用;
  • 描述分布列形态随 \(p\) 的变化(\(p=0.5\) 对称、\(p\) 小右偏),会求最可能的成功次数;
  • 运用互补事件思想计算"至少一次成功"的概率 \(1-q^n\),并反解所需的最少试验次数。

1. 伯努利随机变量

前几节我们学会了分布列(4.2 节)、期望(4.3 节)与方差(4.5 节)这三件工具,从本节起把它们投入使用,陆续研究几类最重要的离散型分布。第一类模型来自一类极其常见的试验:结果只有两种。产品检验分合格与不合格,治疗分有效与无效,投篮分命中与打铁,掷一枚硬币分正反,掷一颗骰子可以只关心"是否掷出 6 点"。概率论把这类两结果试验抽象为:其中一种结果称为成功(success),另一种称为失败(failure),而只取 0、1 两个值的随机变量正是对它的数值刻画。

定义 1 伯努利随机变量

若随机变量 \(X\) 只取 \(1\) 与 \(0\) 两个值,且 \[ P\{X=1\}=p,\qquad P\{X=0\}=1-p, \] 其中 \(0<p<1\),则称 \(X\) 为伯努利随机变量(Bernoulli random variable),\(p\) 称为成功概率。习惯上记 \(q=1-p\)(失败概率),对应的单次两结果试验称为伯努利试验(Bernoulli trial)。

"\(X=1\)"即试验成功,"\(X=0\)"即失败。伯努利随机变量是最简单的非退化随机变量,但正如后文所见,它是搭建二项分布乃至许多更复杂模型的砖块。

定理 1 伯努利随机变量的期望与方差

设 \(X\) 为成功概率为 \(p\) 的伯努利随机变量,则 \[ E[X]=p,\qquad \mathrm{Var}(X)=pq=p(1-p). \]

证明由期望的定义, \[ E[X]=1\cdot p+0\cdot q=p. \] 又 \(X^2\) 与 \(X\) 取值完全相同(\(0^2=0,\ 1^2=1\)),故 \(E[X^2]=p\)。再用 4.5 节的计算公式 \(\mathrm{Var}(X)=E[X^2]-(E[X])^2\): \[ \mathrm{Var}(X)=p-p^2=p(1-p)=pq. \qquad\blacksquare \]

值得玩味的是方差 \(pq\) 随 \(p\) 的变化:当 \(p=\tfrac12\) 时取最大值 \(\tfrac14\),当 \(p\to 0\) 或 \(p\to 1\) 时趋于 \(0\)。这与 4.5 节"方差度量不确定性"的解释完全吻合——成败各半时结果最难预料,而几乎必然成功(或失败)的试验几乎没有悬念。

2. 二项随机变量:分布列的推导

单次伯努利试验提供的信息有限,真正有用的是把同一试验在相同条件下独立地重复 \(n\) 次,然后统计成功的总次数。这就引出本节的主角。

定义 2 二项随机变量

考虑满足以下三个条件的 \(n\) 次试验:(i) 各次试验相互独立;(ii) 每次试验只有成功、失败两种结果;(iii) 每次试验的成功概率同为 \(p\)。这样的试验序列称为 \(n\) 重伯努利试验。若 \[ X=\ n\ \text{次试验中成功的总次数}, \] 则称 \(X\) 为参数为 \((n,p)\) 的二项随机变量(binomial random variable),记作 \(X\sim B(n,p)\),其中记号 \(\sim\) 读作"服从"。

我们来推导 \(X\) 的分布列,即对每个 \(k=0,1,\ldots,n\) 计算 \(P\{X=k\}\)。先用一个具体小例热身:设 \(n=4\)、\(k=2\)。考虑一个特定的结果序列"成、败、成、败",由各次试验独立(第 3 章),其概率为

\[ p\cdot q\cdot p\cdot q=p^2q^2. \]

关键在于:任何一个恰好含有两次成功的序列,例如"败、成、成、败",概率都等于 \(p^2q^2\)——因为乘式中 \(p\) 恰好出现 \(k=2\) 次、\(q\) 恰好出现 \(n-k=2\) 次,与次序无关。而事件 \(\{X=2\}\) 正是所有这类序列的并,且不同序列互不相容。这样的序列有多少个?在 \(4\) 个位置中选 \(2\) 个放"成功",由第 1 章的组合计数,共有 \(\binom{4}{2}=6\) 个。于是 \(P\{X=2\}=6p^2q^2\)。

一般情形完全同理,推导分两步:

  • 第一步(每个模式多大概率):任一恰好含 \(k\) 次成功的特定结果序列,由独立性,其概率为 \(p^k q^{n-k}\);
  • 第二步(共有多少模式):这类序列的个数等于从 \(n\) 个位置中选取 \(k\) 个成功位置的方式数 \(\binom{n}{k}\)。
定理 2 二项分布列

若 \(X\sim B(n,p)\),记 \(q=1-p\),则 \[ P\{X=k\}=\binom{n}{k}p^{k}q^{\,n-k},\qquad k=0,1,2,\ldots,n. \]

证明如上两步所述:事件 \(\{X=k\}\) 是 \(\binom{n}{k}\) 个互不相容序列之并,每个序列概率均为 \(p^kq^{\,n-k}\),由概率的可加性即得结论。另由牛顿二项式定理可验证规范性: \[ \sum_{k=0}^{n}\binom{n}{k}p^{k}q^{\,n-k}=(p+q)^{n}=1^{n}=1, \] 这也正是"二项分布"名称的由来。□
例 1 全凭猜测的选择题

一场考试有 10 道四选一的单选题,某考生对题目一无所知,每题独立地随机猜测。设 \(X\) 为答对的题数,求:(a) \(P\{X=6\}\);(b) \(P\{X\ge 6\}\);(c) \(P\{X=0\}\)(全错的概率)。

每答一题是一次伯努利试验,成功(猜对)概率 \(p=\tfrac14\),故 \(X\sim B(10,\tfrac14)\),\(q=\tfrac34\)。

(a) 由定理 2, \[ P\{X=6\}=\binom{10}{6}\Big(\frac14\Big)^{6}\Big(\frac34\Big)^{4}=210\cdot\frac{1}{4096}\cdot\frac{81}{256}=\frac{17010}{1048576}\approx 0.0162. \]

(b) \(P\{X\ge 6\}=P\{X=6\}+P\{X=7\}+P\{X=8\}+P\{X=9\}+P\{X=10\}\),逐项计算见表 1:

表 1:例 1 中 \(P\{X\ge 6\}\) 的逐项计算(\(X\sim B(10,\tfrac14)\))
\(k\)\(\binom{10}{k}\)\(P\{X=k\}=\binom{10}{k}(\tfrac14)^{k}(\tfrac34)^{10-k}\)
62100.01622
71200.00309
8450.00039
9100.00003
1010.00000
合计0.01973 ≈ 0.0197

即猜对 6 题及以上的概率不足百分之二——靠瞎猜通过考试并不现实。

(c) "全错"即 \(k=0\) 的情形,此时无需组合系数: \[ P\{X=0\}=\Big(\frac34\Big)^{10}=\frac{59049}{1048576}\approx 0.0563. \] 有趣的是,全错的概率约为 \(5.6\%\),比"恰好猜对 6 题"大得多;事实上由下一节的形态分析可知,此分布最可能的取值是 \(k=2\)(概率约 \(0.2816\)),平均猜对 \(np=2.5\) 题。

例 2 掷骰子与"六点"的次数

将一颗均匀骰子独立地掷 10 次,设 \(X\) 为其中掷出 6 点的次数。求 \(P\{X=2\}\) 与"至少出现一次 6 点"的概率。

每次掷骰是一次伯努利试验:成功(出 6 点)概率 \(p=\tfrac16\),失败概率 \(q=\tfrac56\),故 \(X\sim B(10,\tfrac16)\)。由定理 2, \[ P\{X=2\}=\binom{10}{2}\Big(\frac16\Big)^{2}\Big(\frac56\Big)^{8}=45\cdot\frac{1}{36}\cdot 0.2326\approx 0.29. \] "至少一次成功"通过对立事件计算(详见第 5 节): \[ P\{X\ge 1\}=1-P\{X=0\}=1-\Big(\frac56\Big)^{10}\approx 1-0.1615=0.8385. \] 平均出现 \(np=\tfrac{10}{6}\approx 1.67\) 次,但"一次都不出现"的概率只有约 \(16\%\)。

3. 分布列的形态:对称与偏斜

固定 \(n=10\),让 \(p\) 变化,可以直观看到二项分布列的两种典型形态。当 \(p=0.5\) 时(图 1),由组合恒等式 \(\binom{10}{k}=\binom{10}{10-k}\) 可知 \(P\{X=k\}=P\{X=10-k\}\),分布关于 \(k=np=5\) 完全对称,峰值恰在中央。

B(10, 0.5) 的分布列:关于 k = 5 完全对称 0 0.05 0.10 0.15 0.20 0.25 p(k) 252/1024 ≈ 0.246 0 1 2 3 4 5 6 7 8 9 10 成功次数 k(均值 np = 5)
图 1:\(B(10,\,0.5)\) 的分布列。棒高严格按 \(\binom{10}{k}/1024\) 的真实比例绘制:各棒对应概率依次为 \(1,10,45,120,210,252,210,120,45,10,1\)(除以 \(1024\))。

当 \(p\) 偏小时(图 2 取 \(p=0.25\),即例 1 的猜题分布),质量向左侧(成功次数少的一侧)堆积,峰值移到 \(k=2\),右侧拖出一条细长的尾巴——这种形态称为右偏(right-skewed)。\(p\) 越小、或 \(n\) 越大而 \(np\) 不大,偏态越明显。

B(10, 0.25) 的分布列:高峰左移,右侧拖长尾(右偏) 0 0.05 0.10 0.15 0.20 0.25 p(k) μ = np = 2.5 0.0563 0.1877 0.2816 0.2503 0.1460 0.0584 0.0162 0 1 2 3 4 5 6 7 8 9 10 成功次数 k
图 2:\(B(10,\,0.25)\) 的分布列(即例 1 的猜题分布),棒高按 \(\binom{10}{k}(0.25)^{k}(0.75)^{10-k}\) 的真实比例绘制,图中已标注 \(k\le 6\) 各项的概率。虚线为均值 \(\mu=np=2.5\),峰值在 \(k=2\) 处,分布右偏。

最可能的成功次数(即分布列的众数(mode))有简洁的判别法。由定理 2 相邻两项之比

\[ \frac{P\{X=k+1\}}{P\{X=k\}}=\frac{n-k}{k+1}\cdot\frac{p}{q}, \]

该比值 \(\ge 1\) 当且仅当 \(k\le (n+1)p-1\)。因此概率随 \(k\) 先增后减:当 \((n+1)p\) 不是整数时,众数为 \(\lfloor (n+1)p\rfloor\)。对照两图:\(p=0.5\) 时 \((n+1)p=5.5\),众数为 \(5\)(概率 \(252/1024\approx 0.246\));\(p=0.25\) 时 \((n+1)p=2.75\),众数为 \(2\)(概率 \(\approx 0.2816\))。

注记 "二项"之名与伯努利其人

分布列对 \(k\) 求和恰展开二项式 \((p+q)^n\),"二项分布"因此得名;而"伯努利"指的是雅各布·伯努利(Jacob Bernoulli),其在 1713 年身后出版的《猜度术》中首次系统研究了这类重复试验模型,并证明了"频率依概率收敛到 \(p\)"的大数定律——正是 1.1 节时间线上 1713 年那个节点。单次试验只有两种结果看似贫乏,但"独立重复"把简单性转化为普适性:凡能化为"计数 \(n\) 次独立观察中某事件发生的次数"的现象,二项模型几乎都能登场。

4. 期望与方差:指示变量分解

若直接用定义 \(E[X]=\sum k\binom{n}{k}p^kq^{n-k}\) 计算二项随机变量的期望,将陷入繁杂的代数。下面这个证明被认为是概率论中最优雅的论证之一,其核心是 4.1 节引入的指示随机变量(indicator random variable)。

对 \(i=1,2,\ldots,n\),令

\[ I_i=\begin{cases}1, & \text{第}\ i\ \text{次试验成功},\\[2pt] 0, & \text{第}\ i\ \text{次试验失败},\end{cases} \]

则每个 \(I_i\) 都是以 \(p\) 为参数的伯努利随机变量。整个论证只有三步:

  • 恒等分解:成功一次计数加 1,故 \(X=I_1+I_2+\cdots+I_n\) 恒成立(见图 3);
  • 单个零件:由定理 1,\(E[I_i]=p\),\(\mathrm{Var}(I_i)=pq\);
  • 组装:用期望的线性性与试验的独立性把 \(n\) 份贡献相加。
把成功次数拆成一盏盏"指示灯":X = I1 + I2 + ⋯ + I10 12345 678910 试验 成功 失败 成功 成功 失败 成功 成功 成功 失败 成功 1 0 1 1 0 1 1 1 0 1 I 取值 X = I1 + I2 + ⋯ + I10 = 1+0+1+1+0+1+1+1+0+1 = 7 0 7 每个单位块 = 一次成功 X = 7
图 3:指示变量分解示意。上排是 \(n=10\) 次独立试验的一个可能结果,每次试验配一个指示变量 \(I_i\)(成功记 1、失败记 0);把十个指示值逐个累加,就堆出高度为 7 的柱——成功次数 \(X=\sum_{i=1}^{10}I_i\)。
定理 3 二项随机变量的期望与方差

若 \(X\sim B(n,p)\),\(q=1-p\),则 \[ E[X]=np,\qquad \mathrm{Var}(X)=npq. \]

证明令 \(I_i\) 为第 \(i\) 次试验的指示变量,则 \(X=\sum_{i=1}^{n}I_i\),且每个 \(I_i\) 为伯努利随机变量。

期望:由期望的线性性(4.3 节), \[ E[X]=E\Big[\sum_{i=1}^{n}I_i\Big]=\sum_{i=1}^{n}E[I_i]=\sum_{i=1}^{n}p=np. \] 注意此步不需要独立性——线性性对任意随机变量成立。

方差:记 \(X-np=\sum_{i=1}^{n}(I_i-p)\),展开平方的期望,交叉项与平方项分开处理: \[ \mathrm{Var}(X)=E\Big[\Big(\sum_{i=1}^{n}(I_i-p)\Big)^{2}\Big]=\sum_{i=1}^{n}E\big[(I_i-p)^{2}\big]\;+\;2\sum_{i<j}E\big[(I_i-p)(I_j-p)\big]. \] 对角项:\(E[(I_i-p)^2]=\mathrm{Var}(I_i)=pq\),共 \(n\) 项,合计 \(npq\)。交叉项:当 \(i\ne j\) 时,第 \(i\) 次与第 \(j\) 次试验独立,故 \(I_i\) 与 \(I_j\) 独立,于是 \[ E\big[(I_i-p)(I_j-p)\big]=E[I_i-p]\cdot E[I_j-p]=(p-p)(p-p)=0, \] 交叉项全部消失。综上 \[ \mathrm{Var}(X)=npq+0=npq. \qquad\blacksquare \]

取 \(n=1\) 即退化为定理 1,两结果互相印证。

注记 这个证明为何"优雅"

直接展开 \(\sum k\binom{n}{k}p^kq^{n-k}\) 需要巧妙地拼凑二项式系数;而指示变量分解把一个复杂的 \(X\) 拆成 \(n\) 个最简单的零件,期望一步相加,方差中"平方展开产生交叉项、独立性使交叉项归零"的结构一目了然。这一技巧在本书还将反复亮相:第 7 章方差的性质、超几何分布期望的计算(4.8 节)等都依赖同样的思想。请记住两点:期望的线性性无需独立性;方差的可加性需要独立性(更准确地,需要协方差为零)

例 3 保险公司的赔案件数

某保险公司承保 10000 张一年期保单,设各保单是否出险相互独立,每张保单一年内出险的概率均为 0.001。以 \(X\) 记一年内的出险总件数,求 \(E[X]\)、\(\mathrm{Var}(X)\) 与标准差 \(\sigma_X\)。

每张保单是一次伯努利试验(出险 = "成功"),故 \(X\sim B(10000,\,0.001)\)。由定理 3, \[ E[X]=np=10000\times 0.001=10, \] \[ \mathrm{Var}(X)=npq=10000\times 0.001\times 0.999=9.99,\qquad \sigma_X=\sqrt{9.99}\approx 3.16. \] 即公司每年平均处理 10 件赔案,典型波动幅度在 \(\pm 3\) 件左右。这里 \(n\) 极大、\(p\) 极小而 \(np=10\) 适中,正是下一节泊松分布大显身手的场合:\(B(10000,0.001)\) 与泊松分布 \(\mathrm{Poisson}(10)\) 几乎无法区分。

5. 至少一次成功:反解试验次数

"至少一次成功"是二项模型中最常被问到的复合事件。事件 \(\{X\ge 1\}\) 的对立事件是 \(\{X=0\}\)(全部失败),后者只有一种模式,无需组合系数,于是

\[ P\{X\ge 1\}=1-P\{X=0\}=1-q^{\,n}. \]

反过来问:"要让至少一次成功的概率不低于某个水平 \(\alpha\),至少要做多少次试验?"由 \[ 1-q^{\,n}\ \ge\ \alpha \quad\Longleftrightarrow\quad q^{\,n}\ \le\ 1-\alpha \quad\Longleftrightarrow\quad n\ \ge\ \frac{\ln(1-\alpha)}{\ln q}, \] (因 \(0<q<1\),\(\ln q<0\),两边取对数后不等号反向),取不小于右端的最小整数即可。

例 4 要掷多少次骰子

(a) 掷一颗骰子 4 次,至少出现一次 6 点的概率是多少?(b) 要使"至少出现一次 6 点"的概率不低于 \(0.99\),至少需要掷多少次?

每次掷骰"出 6 点"的概率 \(p=\tfrac16\),\(q=\tfrac56\)。

(a) \(n=4\): \[ P\{X\ge 1\}=1-\Big(\frac56\Big)^{4}=1-\frac{625}{1296}\approx 0.518, \] 只是略过一半——这正是 1.1 节提到的德·梅雷问题的一方:他凭赌桌经验相信"掷 4 次骰子赌出 6 点"占优,结论确实成立,但优势远比想象中微弱。

(b) 要求 \(1-\left(\tfrac56\right)^{n}\ge 0.99\),即 \[ n\ \ge\ \frac{\ln 0.01}{\ln(5/6)}=\frac{-4.6052}{-0.1823}\approx 25.3, \] 故取 \(n=26\)。验证:\(\left(\tfrac56\right)^{25}\approx 0.0105>0.01\)(25 次还不够),而 \(\left(\tfrac56\right)^{26}\approx 0.0087<0.01\),此时 \[ P\{X\ge 1\}=1-0.0087=0.9913\ \ge\ 0.99. \] 直觉上"概率这么小的事,掷十来次总该出了"——实际需要 26 次,可见小概率事件需要可观的重复次数来"稀释"其稀少性。

6. 本节小结

要点回顾
  • 伯努利随机变量:\(P\{X=1\}=p\),\(P\{X=0\}=q=1-p\);\(E[X]=p\),\(\mathrm{Var}(X)=pq\)(\(p=\tfrac12\) 时方差最大)。
  • 二项分布:\(n\) 重独立重复、单次成功率为 \(p\) 的试验中,成功次数 \(X\sim B(n,p)\) 的分布列为 \(\binom{n}{k}p^kq^{n-k}\);推导分两步——每个特定模式概率 \(p^kq^{n-k}\),模式数 \(\binom{n}{k}\);对 \(k\) 求和恰为 \((p+q)^n=1\)。
  • 期望与方差:\(E[X]=np\),\(\mathrm{Var}(X)=npq\);指示变量分解 \(X=\sum I_i\) 的证明中,线性性给出期望,独立性使方差展开式的交叉项归零。
  • 形态:\(p=0.5\) 时分布列关于 \(np\) 对称;\(p\) 偏小时右偏、峰值左移;众数为 \(\lfloor (n+1)p\rfloor\)(当 \((n+1)p\) 非整数)。
  • 至少一次成功:\(P\{X\ge 1\}=1-q^n\);要使它 \(\ge\alpha\),只需 \(n\ge \ln(1-\alpha)/\ln q\)(掷骰子出 6 点、\(\alpha=0.99\) 时 \(n=26\))。
  • 下一节(4.7)将看到:\(n\) 大、\(p\) 小、\(np\) 适中时,二项分布可用泊松分布近似——例 3 的保险模型正是天然素材。

练习

练习 4-6-1

将一颗骰子独立地掷 5 次,求至少出现一次 6 点的概率。

答案与提示

用对立事件。\(P\{X\ge 1\}=1-\left(\tfrac56\right)^5=1-\tfrac{3125}{7776}\approx 1-0.4019=0.598\)。注意"5 次里至少一次 6 点"并不像直觉以为的那样占压倒优势。

练习 4-6-2

设 \(X\sim B(n,\,0.3)\) 且 \(E[X]=6\),求 \(n\)、\(\mathrm{Var}(X)\) 与标准差。

答案与提示

由 \(np=6\) 得 \(n=6/0.3=20\);\(\mathrm{Var}(X)=npq=20\times 0.3\times 0.7=4.2\),标准差 \(\sigma=\sqrt{4.2}\approx 2.05\)。

练习 4-6-3

设 \(X\sim B(5,\,0.4)\),先算出 \(P\{X=0\}\) 与 \(P\{X=1\}\),再利用对立事件求 \(P\{X\ge 2\}\)。

答案与提示

\(P\{X=0\}=0.6^5=0.07776\),\(P\{X=1\}=\binom{5}{1}\times 0.4\times 0.6^4=0.2592\),故 \(P\{X\ge 2\}=1-0.07776-0.2592=0.66304\approx 0.6630\)。逐项硬算 \(k=2,3,4,5\) 也可,但先算小 \(k\) 端再取补往往省力。

练习 4-6-4

复述定理 3 的证明:用指示变量分解 \(X=\sum I_i\) 证明 \(\mathrm{Var}(X)=npq\),并明确指出独立性在哪一步被使用;再说明为什么 \(E[X]=np\) 的成立不需要各次试验独立。

答案与提示

\(\mathrm{Var}(X)=E[(\sum(I_i-p))^2]=\sum E[(I_i-p)^2]+2\sum_{i<j}E[(I_i-p)(I_j-p)]\)。第一组每项 \(=\mathrm{Var}(I_i)=pq\),共 \(n\) 项;第二组交叉项为零恰恰用到独立性:\(I_i\) 与 \(I_j\) 独立使 \(E[(I_i-p)(I_j-p)]=E[I_i-p]\,E[I_j-p]=0\)。而期望一步只用了线性性 \(E[\sum I_i]=\sum E[I_i]\),它对任意(哪怕高度相关)的随机变量都成立,故无需独立性。若没有独立性,期望仍是 \(np\),但方差会多出协方差交叉项而偏离 \(npq\)(详见第 7 章)。