- 用分布函数、分布列、密度三种等价方式叙述两个随机变量相互独立的定义,并说明它与事件独立性(3.4 节)的联系;
- 熟练运用支撑集判别法:由非矩形支撑迅速否定独立性,由矩形支撑上的可分离密度证明独立性;
- 在联合分布表上逐格验证 \(p(x,y)=p_X(x)\,p_Y(y)\),并能解释单独一格不符意味着什么;
- 说明独立性的传递性质:\(g(X)\) 与 \(h(Y)\) 独立、\(\min/\max\) 的概率公式;
- 理解独立同分布(iid)样本的概念,说明它为何是统计推断的基石。
1. 独立性的定义
6.1 节的结论是:边缘分布由联合分布决定,但仅凭边缘一般无法还原联合——联合中"多出来"的信息,正是两个随机变量之间的相依结构。本节研究最重要的特殊情形:独立随机变量(independent random variables)。此时联合分布完全分解为边缘分布的乘积,"多出来的信息"为零。这个概念直接来源于 3.4 节事件的独立性:两个事件独立,指一个事件发生与否不改变另一事件的概率;两个随机变量独立,则要求这一性质对它们的一切取值事件同时成立。
设 \(X\)、\(Y\) 为随机变量,联合分布函数(joint distribution function)为 \(F(x,y)\),边缘分布函数(marginal distribution function)分别为 \(F_X\)、\(F_Y\)。若对一切实数 \(x,\,y\) 都有 \[ F(x,y)=F_X(x)\,F_Y(y), \] 则称 \(X\) 与 \(Y\) 相互独立(independent)。
按分布函数的定义,\(F(x,y)=P(X\le x,\;Y\le y)\),\(F_X(x)F_Y(y)=P(X\le x)\,P(Y\le y)\)。因此定义 1 就是说:事件 \(\{X\le x\}\) 与 \(\{Y\le y\}\) 对一切 \(x,y\) 独立——\(X\) 落在何处这一"观测事实",丝毫不改变 \(Y\) 的概率规律。
实际验证时,几乎从不直接使用分布函数。下述定理把独立性翻译成分布列或密度的"逐点乘积"形式,这才是日常工作中的判别工具。
下列条件等价:
(1) \(X\) 与 \(Y\) 独立:\(F(x,y)=F_X(x)F_Y(y)\) 对一切 \(x,y\) 成立;
(2) 对任意区间 \(A,\,B\):\(P(X\in A,\;Y\in B)=P(X\in A)\,P(Y\in B)\);
(3) 离散型:对一切 \(x,\,y\),\(p(x,y)=p_X(x)\,p_Y(y)\);连续型:在密度的连续点处,\(f(x,y)=f_X(x)\,f_Y(y)\)。
2. 连续型判别:支撑与可分离性
回忆 6.1 节的支撑集(support)概念:使密度 \(f(x,y)>0\) 的点集。对连续型随机变量,判定独立与否有一条极其高效的"看图"路线:先看支撑的形状,再看密度能否分离变量。
设 \((X,Y)\) 为连续型,密度为 \(f\),支撑集为 \(S=\{(x,y):f(x,y)>0\}\)。
(i) 若 \(X\) 与 \(Y\) 独立,则 \(S\) 必为直积(矩形)形式:存在数集 \(A\)、\(B\) 使 \(S=A\times B\)。等价的逆否命题:支撑不是矩形(如三角形、圆盘、L 形),则 \(X\)、\(Y\) 必不独立。
(ii) 反之,若 \(S=A\times B\) 为矩形,且在 \(S\) 上密度可分离(separable / factorizable):\(f(x,y)=g(x)\,h(y)\),则 \(X\) 与 \(Y\) 独立,且边缘密度与 \(g\)、\(h\) 成比例:\(f_X(x)=g(x)\big/\int_A g\),\(f_Y(y)=h(y)\big/\int_B h\)。
(ii):记 \(c_X=\int_A g(x)\,dx\),\(c_Y=\int_B h(y)\,dy\)。由规范性 \(1=\iint f=c_Xc_Y\)。于是 \(f_X(x)=\int_B g(x)h(y)\,dy=g(x)c_Y\)(\(x\in A\)),同理 \(f_Y(y)=h(y)c_X\),从而 \(f_X(x)f_Y(y)=g(x)h(y)\,c_Xc_Y=g(x)h(y)=f(x,y)\)。由定理 1(3),\(X\) 与 \(Y\) 独立。证毕。
注意两个方向合起来的含义:矩形支撑只是必要条件,并非充分。例如 \(f(x,y)=x+y\)(\(0<x,y<1\)),支撑是整个单位正方形,但 \(f_X(x)f_Y(y)=(x+\tfrac12)(y+\tfrac12)\not\equiv x+y\)(在 \((0,0)\) 处左边为 \(\tfrac14\),右边为 \(0\)),密度不可分离,仍不独立。"先看形状、再看分离"两步都要走完。
设 \(X\)、\(Y\) 的联合密度为 \(f(x,y)=e^{-(x+y)}\),\(x>0,\;y>0\)(即 6.1 节例 2 中的密度)。判断 \(X\) 与 \(Y\) 是否独立。
设 \((X,Y)\) 在三角形区域 \(D=\{(x,y):0<y<x<1\}\) 上均匀分布,密度 \(f(x,y)=2\)(6.1 节例 4)。判断 \(X\) 与 \(Y\) 是否独立。
独立性要求联合规律等于两个一维规律的乘积。一维规律各自的"活动范围"是 \(A\) 与 \(B\),两者相乘只能得到矩形 \(A\times B\)。三角形、圆盘这类区域边界互相牵制——例如在 \(0<y<x<1\) 上,知道 \(X\) 接近 \(0\) 就迫使 \(Y\) 也接近 \(0\)——这种牵制本身就是相依。因此支撑非矩形是一票否决;而矩形支撑(如本节的 \(e^{-(x+y)}\)、\(4xy\))只需再检查密度是否可分离即可。
3. 离散型判别:联合表逐格验证
离散情形没有"支撑形状"的几何直观可借力,判别法就是定理 1(3) 的字面执行:在联合分布表上,每一个格子都必须等于对应边缘的乘积;只要有一格不符,独立性即被否定。
某车险数据库中,记 \(X\) 为保单持有人是否为新手驾驶员(\(0\)=熟练,\(1\)=新手),\(Y\) 为其过去一年内的索赔次数(\(0,1,2\) 次),联合分布列如表 1。问:\(X\) 与 \(Y\) 是否独立?
| \(X\backslash Y\) | \(Y=0\) | \(Y=1\) | \(Y=2\) | \(p_X(x)\) |
|---|---|---|---|---|
| \(X=0\) | 0.50 | 0.15 | 0.05 | 0.70 |
| \(X=1\) | 0.10 | 0.15 | 0.05 | 0.30 |
| \(p_Y(y)\) | 0.60 | 0.30 | 0.10 | 1.00 |
| \(X\backslash Y\) | \(Y=0\) | \(Y=1\) | \(Y=2\) |
|---|---|---|---|
| \(X=0\) | 0.42 | 0.21 | 0.07 |
| \(X=1\) | 0.18 | 0.09 | 0.03 |
把表 1 的九个边际数字抄下来:表 1 与表 2 的边缘分布完全相同,但二者的联合结构不同——表 2 是独立的,表 1 不是。这就为 6.1 节"边缘不能决定联合"的论断提供了一个具体的数字实例:联合表比边缘多出的信息,正是变量间的相依结构;独立性假设是否成立,必须诉诸数据或机理,而不能从边缘"看"出来。
4. 独立性的性质与 iid 样本
独立性一旦成立,就可以"批量生产":对独立变量各自施加变换,得到的仍是独立变量。这条性质使用频率极高。
设 \(X\) 与 \(Y\) 独立,\(g\)、\(h\) 为两个(取值良好的)一元函数,则 \(g(X)\) 与 \(h(Y)\) 也独立。
例如:\(X^2\) 与 \(|Y|\)、\(e^X\) 与 \(Y^3\) 都各自独立。一个重要应用是极值:由 \(\{\min(X,Y)>t\}=\{X>t\}\cap\{Y>t\}\) 与 \(\{\max(X,Y)\le t\}=\{X\le t\}\cap\{Y\le t\}\),独立性立即给出 \[ P\big(\min(X,Y)>t\big)=\big(1-F_X(t)\big)\big(1-F_Y(t)\big),\qquad P\big(\max(X,Y)\le t\big)=F_X(t)\,F_Y(t), \] 这正是 6.6 节顺序统计量理论的出发点。独立的另一个常用推论——独立蕴含协方差为零(从而期望可乘)——将在练习 3 中证明,并在 7.3 节系统展开。
称 \(X_1,\dots,X_n\) 相互独立,若其联合分布函数等于各边缘分布函数之积: \[ F(x_1,\dots,x_n)=F_{X_1}(x_1)\cdots F_{X_n}(x_n)\quad\text{对一切 }x_1,\dots,x_n. \] 若 \(X_1,\dots,X_n\) 相互独立且服从同一分布 \(F\),则称它们是来自 \(F\) 的独立同分布样本(independent and identically distributed sample, 简记 iid 样本),记作 \(X_1,\dots,X_n\;\overset{\text{iid}}{\sim}\;F\)。
定义 1 是 \(n=2\) 的特例;可以证明,\(n\) 个变量相互独立蕴含其中任意子组(从而任意"分组各自的函数")相互独立。
iid 样本是统计学的基石。重复试验、简单随机抽样的理想化模型正是"同一个分布 \(F\) 的独立重复观测":\(n\) 次独立重复伯努利试验的指示变量 \(1_1,\dots,1_n\) 是 iid 的 \(\mathrm{B}(1,p)\),由此产生第 4 章的二项分布;第 8 章大数定律研究的是 iid 样本均值 \(\frac1n\sum_{i=1}^n X_i\) 的稳定行为——"频率趋于概率"的全部合法性都建立在观测的独立同分布之上。图 2 给出 iid 样本的两个直观形象。
其一,"独立"与"不相关"不是一回事:独立必蕴含协方差为零(练习 3,详见 7.3 节),反之不然——练习 2 的圆盘均匀分布中 \(X\)、\(Y\) 不独立,但由对称性 \(\mathrm{Cov}(X,Y)=0\)。其二,独立性是"全或无"的判定:联合与边缘乘积必须逐点(逐格)相等,任何一处不符即可否定(例 3 只用了一个格子);而要证明独立,则必须对一切 \((x,y)\) 建立等式,此时定理 2 的可分离性是最顺手的路径。
5. 本节小结
- 定义:\(X\)、\(Y\) 独立 \(\iff\) 对一切 \(x,y\),\(F(x,y)=F_X(x)F_Y(y)\);等价于联合分布列(密度)逐点等于边缘乘积 \(p=p_Xp_Y\)(\(f=f_Xf_Y\))。
- 快速判别:支撑非矩形(三角形、圆盘等)⇒ 必不独立;矩形支撑上密度可分离 \(f=g(x)h(y)\) ⇒ 独立(此时边缘与 \(g\)、\(h\) 成比例)。离散情形在联合表上逐格验证。
- 性质:独立变量的函数 \(g(X)\) 与 \(h(Y)\) 仍独立;\(\min/\max\) 的概率公式是 6.6 节顺序统计量的起点。
- iid 样本:独立且同分布的 \(X_1,\dots,X_n\) 是重复试验的理想模型,统计推断与大数定律的基石。
- 伏笔:独立 ⇒ \(\mathrm{Cov}(X,Y)=0\),反之不然(本节练习 2、3,系统讨论见 7.3 节)。
练习
练习 6-2-1
设 \(f(x,y)=c\,e^{-2x-3y}\)(\(x>0,\;y>0\))。求常数 \(c\),判断 \(X\) 与 \(Y\) 是否独立;若独立,写出两个边缘密度。
答案与提示规范性 \(1=c\int_0^\infty e^{-2x}dx\int_0^\infty e^{-3y}dy=c\cdot\frac12\cdot\frac13=\frac c6\),故 \(c=6\)。支撑是矩形 \((0,\infty)^2\) 且密度可分离 \(6\,e^{-2x}\,e^{-3y}\),由定理 2 独立;边缘 \(f_X(x)=2e^{-2x}\)(\(\mathrm{Exp}(2)\)),\(f_Y(y)=3e^{-3y}\)(\(\mathrm{Exp}(3)\)),乘积恰为 \(6e^{-2x-3y}=f\)。
练习 6-2-2
设 \((X,Y)\) 在单位圆盘 \(D=\{(x,y):x^2+y^2\le 1\}\) 上均匀分布。证明 \(X\) 与 \(Y\) 不独立,并说明尽管如此仍有 \(E[XY]=E[X]E[Y]=0\)。
答案与提示支撑为圆盘,非矩形,由定理 2(i) 必不独立。也可计算:\(f_X(x)=\frac1\pi\cdot 2\sqrt{1-x^2}=\frac2\pi\sqrt{1-x^2}\)(\(|x|<1\)),若独立则应有 \(f_X(0)f_Y(0)=\frac4{\pi^2}\) 等于 \(f(0,0)=\frac1\pi\),矛盾。而 \((X,Y)\) 与 \((X,-Y)\) 同分布(对称性),故 \(E[XY]=-E[XY]\),即 \(E[XY]=0=E[X]E[Y]\):不相关却不独立,为 7.3 节的反例。
练习 6-2-3
设 \(X\)、\(Y\) 独立且二阶矩有限。证明 \(\mathrm{Cov}(X,Y)=E[XY]-E[X]E[Y]=0\)。(连续型写出把二重积分拆成两个一重积分之积的过程;离散型将双重求和拆开。)
答案与提示以连续型为例,\(f=f_Xf_Y\) 使积分可分离变量:\[ E[XY]=\iint xy\,f_X(x)f_Y(y)\,dx\,dy=\Big(\int x f_X(x)\,dx\Big)\Big(\int y f_Y(y)\,dy\Big)=E[X]\,E[Y], \] 故协方差为零。注意逆命题不成立(练习 2);反之由 \(\mathrm{Cov}=0\) 只能得出"线性无关",推不出密度可分离。
练习 6-2-4
设 \(X\)、\(Y\) 独立,分布函数分别为 \(F_X\)、\(F_Y\)。证明 \(P(\min(X,Y)>t)=(1-F_X(t))(1-F_Y(t))\),\(P(\max(X,Y)\le t)=F_X(t)F_Y(t)\)。
答案与提示\(\{\min>t\}=\{X>t\}\cap\{Y>t\}\),\(\{\max\le t\}=\{X\le t\}\cap\{Y\le t\}\);由独立性(定理 1(2))交的概率等于概率之积,即得两式。这是 6.6 节顺序统计量(最小值、最大值分布)的出发点。