- 用天气预报、医学诊断等情境说明「新信息到来后概率需要修正」这一动机,并正确读出记号 \(P(E|F)\);
- 分别用缩减样本空间法与面积比法计算等可能模型下的条件概率(掷骰子引例得 \(2/3\)),并说明两种算法一致的原因;
- 判断给定信息使目标事件的概率上调、不变还是下调,并举出「信息无关」的例子(独立性的预告);
- 区分 \(P(E|F)\) 与 \(P(F|E)\),指出混淆方向的风险;
- 按顺序复述本章路线:条件概率 → 乘法规则 → 全概率公式与贝叶斯公式 → 独立性。
1. 新信息如何修正概率
第 2 章回答了「概率如何运算」:在样本空间(sample space)上,概率是满足三条公理的集合函数,由此推出补公式、容斥原理与连续性,并在等可能模型中完成了大量计算。但这些计算都有一个共同的起点——试验之前,我们对结果一无所知。现实中的决策却几乎总在「部分信息」下进行:气象员看到清晨的卫星云图,再报降水概率;医生拿到化验单,再判断患病的可能;保险公司掌握了投保人的驾龄记录,再为保单定价。每当新信息到来,概率就应当被修正——问题在于:按什么规则修正?
概率论把「已知事件 \(F\) 发生」这一知识状态下事件 \(E\) 的概率记作 \(P(E|F)\),称为条件概率(conditional probability)。它是概率论中最重要的概念之一:本章的乘法规则、全概率公式与贝叶斯公式都是它的直接推论;此后各章的随机变量、数学期望乃至随机过程,无一不以条件概率为基石。本节先用一个最简单的骰子试验看清「信息如何起作用」,再预告本章的完整路线。
设 \(S\) 为随机试验的样本空间,\(E\)、\(F\) 为事件且 \(P(F)>0\)。记号 \(P(E|F)\) 读作「在 \(F\) 发生的条件下 \(E\) 的概率」,表示获得信息 \(F\) 之后对 \(E\) 的重新赋值。
直观上,条件概率回答的是:世界被信息裁剪之后,剩下的可能性如何分配。在等可能模型中,它可以用「缩减样本空间」的方法直接求得(见例 1 与命题 1);一般情形的严格定义 \(P(E|F)=P(EF)/P(F)\) 将在 3.2 节正式给出。
2. 引例:已知掷出偶数,求「点数 ≥ 4」
考虑最经典的等可能模型:掷一颗均匀骰子。我们比较「试验前一无所知」与「有人瞥见结果是偶数」这两种处境下,同一个事件的概率。
掷一颗均匀骰子,设 \(E\)=「点数 ≥ 4」,\(F\)=「点数为偶数」。(a) 求试验前的 \(P(E)\);(b) 若已知 \(F\) 发生,求 \(P(E|F)\)。
(b) 方法一(缩减样本空间):信息 \(F\) 一到,奇数点 \(1,3,5\) 立即出局,样本空间缩减为 \(F=\{2,4,6\}\),这一新样本空间称为缩减样本空间(reduced sample space);骰子的均匀性保证这三个点在新空间中仍然等可能,于是每点各占 \(1/3\)。其中属于 \(E\) 的只有 \(4,6\) 两点,故 \[ P(E|F)=\frac{2}{3}. \] 方法二(面积比):把 \(S\) 想成面积为 \(1\) 的矩形,\(6\) 个点各占 \(1/6\)。已知 \(F\) 后,只有落在 \(F\) 内的那部分面积有效,因此条件概率是「范围内部的占比」: \[ P(E|F)=\frac{P(EF)}{P(F)}=\frac{2/6}{3/6}=\frac{2}{3}. \] 分子 \(EF=\{4,6\}\) 是「既满足信息又满足目标」的部分,分母 \(F\) 是信息圈定的范围。两种方法殊途同归:方法一先裁剪再计数,方法二先算比例再相除,本质都是把概率按 \(F\) 重新归一化(normalization)(见图 1 与表 1)。最后注意 \(2/3>1/2\):「是偶数」这条信息对「点数 ≥ 4」是利好,它把概率上调了。
| 点数 | 信息前的概率 | 得知 F 后的概率 |
|---|---|---|
| 1 | 1/6 | 0(出局) |
| 2 | 1/6 | 1/3 |
| 3 | 1/6 | 0(出局) |
| 4 | 1/6 | 1/3 |
| 5 | 1/6 | 0(出局) |
| 6 | 1/6 | 1/3 |
| 合计 | 1 | 1 |
3. 两种算法为何一致:比例与归一化
例 1 中两种算法给出同一结果并非巧合。对等可能模型,它们是同一件事的两种写法。
设样本空间 \(S\) 含 \(N\) 个等可能的样本点,事件 \(F\) 含 \(k\ge 1\) 个样本点,则对任意事件 \(E\), \[ P(E|F)=\frac{EF\ \text{所含样本点个数}}{F\ \text{所含样本点个数}}=\frac{|EF|}{|F|}. \]
换个说法:条件化把 \(F\) 之外样本点的概率清零,再把 \(F\) 内各点按同比例放大,使总和恢复为 \(1\)(见表 1)。因此 \(P(E|F)\) 完全可能大于、等于或小于原来的 \(P(E)\),三种情形分别对应「利好信息」「无关信息」与「利空信息」。下一个例子展示「无关」的情形。
从一副 \(52\) 张的标准扑克牌中随机抽一张。设 \(E\)=「抽到人头牌(J、Q、K)」,\(F\)=「抽到红桃」。(a) 求 \(P(E)\);(b) 已知抽到红桃,求 \(P(E|F)\)。
(1) 条件概率并不改变物理世界——骰子没有被换掉,牌也没有被做记号,改变的是我们的知识状态;同一颗骰子可以有许多个条件概率,视所获信息而定。(2) 方向不可颠倒:\(P(E|F)\) 与 \(P(F|E)\) 一般不同。以例 2 为例,「已知红桃求人头牌」得 \(P(E|F)=3/13\),而「已知人头牌求红桃」得 \(P(F|E)=3/12=1/4\)——已知的信息不同,裁剪出的世界也不同。混淆两个方向,正是「体检阳性却大概率健康」这类经典悖论的根源,3.3 节的贝叶斯公式将正面处理这个「掉头」问题。(3) 条件信息必须与试验相容:若 \(P(F)=0\)(如「骰子掷出 7 点」),谈论 \(P(E|F)\) 便没有意义,这也是 3.2 节要求 \(P(F)>0\) 的原因。
4. 本章路线图
条件概率一旦就位,本章其余工具便顺流而下:先「正向」——用乘法规则(multiplication rule)把条件概率串成复杂交事件的概率;再「合成与回溯」——全概率公式(formula of total probability)把结果按原因分解求和,贝叶斯公式(Bayes's formula)反其道而行,由结果推断原因;最后考察「信息无用」的极端情形——独立性,它能把大量乘法化为幂的运算。先看一个「由果溯因」的预热例子。
某车队中新手占 \(20\%\),年出险率为 \(0.10\);有经验者占 \(80\%\),年出险率为 \(0.05\)。随机调查一名本年已出险的驾驶员,他是新手的概率是多少?
各节要点如下:
- 3.2 条件概率:正式定义 \(P(E|F)=P(EF)/P(F)\)(要求 \(P(F)>0\))、基本性质,以及乘法规则及其向 \(n\) 个事件的推广;
- 3.3 贝叶斯公式:划分、全概率公式与贝叶斯公式,先验到后验的更新,以及「由果溯因」的经典应用;
- 3.4 独立事件:独立性的定义与等价刻画、「独立 ≠ 互斥」的辨析、独立试验序列;
- 3.5 P(·|F) 是一个概率:逐一验证条件概率满足三条公理,使第 2 章的所有命题在「条件世界」中继续成立。
一句话概括本章:信息到来,世界被裁剪,概率被重新分配。本章要做的,就是把这句话变成一套可以严格计算、处处合乎公理的规则。
5. 本节小结
- 条件概率 \(P(E|F)\) 度量「已知 \(F\) 发生」后 \(E\) 的概率,是概率论中最重要的概念之一;本章全部内容由它展开。
- 等可能模型中的两种等价算法:缩减样本空间(\( |EF|/|F| \))与面积比(\(P(EF)/P(F)\)),本质都是按 \(F\) 重新归一化(命题 1)。
- 核心引例:已知掷出偶数,「点数 ≥ 4」的概率由 \(1/2\) 修正为 \(2/3\);而「红桃」信息不改变「人头牌」的概率(\(3/13\)),预告了独立性。
- \(P(E|F)\) 可以大于、等于或小于 \(P(E)\);且 \(P(E|F)\ne P(F|E)\),条件方向不可混淆。
- 本章路线:条件概率 → 乘法规则 → 全概率公式与贝叶斯公式 → 独立性;3.5 节保证「条件世界」仍满足第 2 章的公理。
练习
练习 3-1-1
掷一颗均匀骰子,已知掷出的点数大于 3,求「点数为 6」的概率;并与试验前的概率比较,说明这条信息的作用方向。
答案与提示信息把样本空间裁剪为 \(F=\{4,5,6\}\),三点在新空间中仍等可能,其中「6」占一点,故 \(P(\text{6}\,|\,F)=1/3\)。它大于试验前的 \(1/6\):「点数大于 3」是利好信息,把概率上调。若改为「已知点数小于 3」,则新样本空间为 \(\{1,2\}\),所求概率为 \(0\)——6 已随信息出局,可见信息既可上调、也可下调甚至「清零」目标事件的概率。
练习 3-1-2
从一副 52 张的标准扑克牌中随机抽一张,设 \(A\)=「抽到黑桃」,\(B\)=「抽到 A(尖)」。(a) 已知抽到黑桃,求恰是 A 的概率;(b) 已知抽到 A,求恰是黑桃的概率;(c) 两者为何不相等?
答案与提示(a) 黑桃共 13 张,其中 A 仅 1 张,\(P(B|A)=1/13\);(b) A 共 4 张,其中黑桃 A 仅 1 张,\(P(A|B)=1/4\)。两个条件裁剪出的样本空间不同(13 张黑桃 vs 4 张 A),故结果不同——再次印证 \(P(E|F)\) 与 \(P(F|E)\) 不可互换。顺带一提,二者相乘恰好还原联合概率:\(P(A|B)P(B)=P(AB)=1/52\),这正是 3.2 节乘法规则的雏形。
练习 3-1-3
某车间两台机器:甲的产量占 60%、次品率 2%;乙占 40%、次品率 5%。随机抽出一件产品发现是次品,求它出自甲机器的概率,并与甲的产量占比比较。
答案与提示按「每 1000 件」考虑:甲 600 件中次品 \(600\times 0.02=12\) 件;乙 400 件中次品 \(400\times 0.05=20\) 件;次品共 32 件。「是次品」把样本空间裁剪到这 32 件,其中甲占 12 件,故所求概率为 \(12/32=3/8=0.375\),低于先验占比 60%——乙的次品率更高,次品更可能出自乙。这种「由结果反推来源」的算法将在 3.3 节由贝叶斯公式给出一般形式。