第九章 · 9.C

9.C 行列式

9.B 证明了 \(n\) 维空间上交错 \(n\)-线性型的空间恰为一维;本节把这块基石轻轻一推:让算子 \(T\) 拉回体积型,所得仍是体积型的倍数,这个倍数就是行列式 \(\det T\)。由此不借助坐标便一步得到乘法公式、可逆性判据、矩阵的 Leibniz 展开式,并以 \(\det(zI-T)\) 兑现第 8 章的特征多项式,最后用体积、奇异值与 Hadamard 不等式收束几何图景。

定义:算子的行列式

整个第 9 章走到这里,只为了一个目标:给出行列式 (determinant) 一个干净、漂亮、不依赖坐标的定义。原料已经备齐——上一节(9.B)的核心定理 9.37 说,设 \(n=\dim V\),则交错 \(n\)-线性型构成的空间 \(V^{(n)}_{\mathrm{alt}}\) 恰好是一维的;而 9.39 说,非零交错 \(n\)-线性型恰在「基」上取非零值,是基的检验器。现在让一个算子 \(T\in\mathcal{L}(V)\) 作用在每个变元上(原书 9.40)。

定义 9.40(\(\alpha_{T}\):用 \(T\) 拉回)。设 \(m\) 为正整数,\(T\in\mathcal{L}(V)\)。对每个 \(\alpha\in V^{(m)}_{\mathrm{alt}}\),定义 \(\alpha_{T}\in V^{(m)}_{\mathrm{alt}}\) 为

\[ \alpha_{T}(v_1,\dots,v_m)=\alpha(Tv_1,\dots,Tv_m),\qquad v_1,\dots,v_m\in V. \]

由于每个 \(v\mapsto Tv\) 线性且 \(\alpha\) 对每个变元分别线性,\(\alpha_{T}\) 仍是 \(m\)-线性型;又若 \(v_j=v_k\;(j\ne k)\),则 \(Tv_j=Tv_k\),由交错性得 \(\alpha_{T}(v_1,\dots,v_m)=0\)。故 \(\alpha_{T}\in V^{(m)}_{\mathrm{alt}}\),且映射 \(\alpha\mapsto\alpha_{T}\) 是 \(V^{(m)}_{\mathrm{alt}}\) 到自身的一个线性映射。

注(记号)。上一节末尾的动机性预告中,我们把拉回暂记作上标 \(\alpha^{T}\);按原书 9.40 的正式记号,应写作下标 \(\alpha_{T}\),本节起一律沿用原书。「拉回」(pullback) 一词的含义:我们不是把 \(T\) 的输出直接当作数据,而是让它先作用于变元,再喂给测量仪 \(\alpha\)。

关键的一步来了:取 \(m=n=\dim V\)。一维向量空间 \(V^{(n)}_{\mathrm{alt}}\) 到自身的线性映射只能是「乘以某个标量」,而且这个标量是唯一的——若乘以 \(c\) 与乘以 \(c'\) 是同一个映射,作用到任一非零元上即得 \(c=c'\)。于是每个 \(T\) 唯一确定一个数,原书把它定义为 \(T\) 的行列式 (原书 9.41)。

定义 9.41(算子的行列式,\(\det T\))。设 \(T\in\mathcal{L}(V)\),\(n=\dim V\)。\(T\) 的行列式记作 \(\det T\),定义为那个唯一的数 \(\det T\in\mathbf{F}\),使得

\[ \alpha_{T}=(\det T)\,\alpha\qquad\text{对一切 }\alpha\in V^{(n)}_{\mathrm{alt}}. \]

展开成变元的形式,并顺带把「与 \(\omega\) 的选取无关」这一良定性说透,就是我们与行列式的第一次正式会面。

命题(体积刻画与良定性)。设 \(n=\dim V\),\(T\in\mathcal{L}(V)\)。则 \(\det T\) 是唯一的数 \(c\in\mathbf{F}\),使得对每个非零交错 \(n\)-线性型 \(\omega\) 与每组向量 \(v_1,\dots,v_n\in V\),

\[ \omega(Tv_1,\dots,Tv_n)=c\,\omega(v_1,\dots,v_n). \]

特别地,比值 \(\omega(Tv_1,\dots,Tv_n)/\omega(v_1,\dots,v_n)\)(当分母非零时)与 \(\omega\) 的选取无关:\(c\) 只依赖 \(T\)。当 \(\mathbf{F}=\mathbf{R}\) 时,把 \(\omega\) 想成有向体积,\(\det T\) 就是有向体积的统一伸缩率

证明。取定某个非零 \(\omega_0\in V^{(n)}_{\mathrm{alt}}\)(它存在,9.37 的证明构造了一个,即 9.38 式)。由 9.41,存在唯一 \(c\in\mathbf{F}\) 使 \((\omega_0)_{T}=c\,\omega_0\),即对一切 \(v_1,\dots,v_n\),

\[ \omega_0(Tv_1,\dots,Tv_n)=c\,\omega_0(v_1,\dots,v_n). \]

再设 \(\omega\) 是任一非零交错 \(n\)-线性型。由 \(V^{(n)}_{\mathrm{alt}}\) 一维 (9.37),存在 \(a\in\mathbf{F}\setminus\{0\}\) 使 \(\omega=a\,\omega_0\)。由拉回的线性性,\(\omega_{T}=a\,(\omega_0)_{T}=a\,c\,\omega_0=c\,\omega\)。故同一个 \(c\) 对一切非零 \(\omega\) 同时生效,这正是所要的等式。唯一性:若 \(c'\) 也满足等式,取非零 \(\omega\) 与使 \(\omega(v_1,\dots,v_n)\ne 0\) 的列表(由 9.39,取基即可),两式相除立得 \(c=c'\)。证毕。

先热身一批最简单的例子(原书 9.42)——它们同时是后面若干定理的引信。

例 1(算子的行列式,原书 9.42)。设 \(n=\dim V\)。

  • 恒等算子:对一切 \(\alpha\),\(\alpha_{I}=\alpha\),故 \(\det I=1\)。
  • 数乘算子:若 \(\lambda\in\mathbf{F}\),则 \(\alpha_{\lambda I}(v_1,\dots,v_n)=\alpha(\lambda v_1,\dots,\lambda v_n)=\lambda^{n}\alpha(v_1,\dots,v_n)\),故 \(\det(\lambda I)=\lambda^{n}\)。注意指数是 \(n\),不是 \(1\):行列式把数乘「乘方」了。
  • 数乘一般算子:\(\alpha_{\lambda T}(v_1,\dots,v_n)=\alpha(\lambda Tv_1,\dots,\lambda Tv_n)=\lambda^{n}\alpha_{T}(v_1,\dots,v_n)\),故 \[ \det(\lambda T)=\lambda^{n}\det T. \]
  • 可对角化情形:设 \(e_1,\dots,e_n\) 是由 \(T\) 的特征向量组成的基,对应特征值 \(\lambda_1,\dots,\lambda_n\)(允许重复)。对任意 \(\alpha\in V^{(n)}_{\mathrm{alt}}\), \[ \alpha_{T}(e_1,\dots,e_n)=\alpha(\lambda_1e_1,\dots,\lambda_ne_n)=(\lambda_1\cdots\lambda_n)\,\alpha(e_1,\dots,e_n). \] 若 \(\alpha\ne 0\),则由 9.39,\(\alpha(e_1,\dots,e_n)\ne 0\),于是 \[ \det T=\lambda_1\cdots\lambda_n: \] 可对角化算子的行列式等于特征值之积(按重数计)。这是「行列式 = 体积在所有特征方向上各伸缩一次的总效果」的最初信号。

例 2(平面反射)。设 \(T\in\mathcal{L}(\mathbf{R}^{2})\) 交换两个坐标:\(T(x,y)=(y,x)\)。它以 \(e_1+e_2,e_1-e_2\) 为特征向量,特征值 \(1,-1\),故 \(\det T=1\cdot(-1)=-1\)。几何上:\(T\) 是关于直线 \(y=x\) 的镜面反射,任何图形的面积都不变(\(|\det T|=1\)),但定向翻转了(\(\det T\lt 0\))。图 1 把这两种情形画在一起。

T e1 = 2e1+e2,T e2 = e1+2e2 x y 面积 1 T e1 T e2 定向保持:det T = 2·2 − 1·1 = 3 交换两列:S = T∘W,det S = −3 x y 面积 1 S e1 S e2 同一块平行四边形,定向翻转
图 1:\(\mathbf{R}^{2}\) 上行列式的有向面积解读。左:单位正方形在 \(T\) 下变为由 \(Te_1,Te_2\) 张成的平行四边形,面积 \(|\det T|=3\),且 \(Te_1\) 转到 \(Te_2\) 仍为逆时针,读数为 \(+3\)。右:交换 \(T\) 的两列(即先作坐标交换 \(W\)),平行四边形形(面积)不变而定向翻转,读数为 \(-3\)——这正是交错型对置换变号 (9.35) 的几何面目。

矩阵的行列式与 Leibniz 公式

算子的行列式已经定义完毕,而且完全没提矩阵。接下来定义方阵的行列式:每个方阵先兑换成一个算子,再取算子的行列式 (原书 9.43)。

定义 9.43(矩阵的行列式,\(\det A\))。设 \(n\) 为正整数,\(A\) 是元素属于 \(\mathbf{F}\) 的 \(n\times n\) 方阵。令 \(T\in\mathcal{L}(\mathbf{F}^{n})\) 是关于 \(\mathbf{F}^{n}\) 标准基的矩阵等于 \(A\) 的算子,定义

\[ \det A=\det T. \]

例 3(矩阵的行列式,原书 9.44)。(a) \(n\times n\) 单位矩阵 \(I\) 对应恒等算子,故 \(\det I=1\)。(b) 若 \(A\) 是对角矩阵,对角元为 \(\lambda_1,\dots,\lambda_n\),则标准基即为其特征向量,特征值为 \(\lambda_1,\dots,\lambda_n\),由例 1 末条

\[ \det A=\lambda_1\cdots\lambda_n: \]

对角矩阵的行列式等于对角元之积

下面的定理说明:把 \(A\) 的各列当作 \(n\) 个变元,行列式本身就是 \(\mathbf{F}^{n}\) 上的交错 \(n\)-线性型——「按列多重线性、按列交错」这两个经典性质不是外加的公理,而是定义的直接推论。记号上,把 \(v_1,\dots,v_n\in\mathbf{F}^{n}\) 视为列向量,\(\bigl(\,v_1\ \cdots\ v_n\,\bigr)\) 表示以 \(v_k\) 为第 \(k\) 列的 \(n\times n\) 矩阵。

定理 9.45(行列式是交错多重线性型)。设 \(n\) 为正整数。映射

\[ v_1,\dots,v_n\ \longmapsto\ \det\bigl(\,v_1\ \cdots\ v_n\,\bigr) \]

是 \(\mathbf{F}^{n}\) 上的交错 \(n\)-线性型。

证明。设 \(e_1,\dots,e_n\) 是 \(\mathbf{F}^{n}\) 的标准基,\(v_1,\dots,v_n\in\mathbf{F}^{n}\)。令 \(T\in\mathcal{L}(\mathbf{F}^{n})\) 满足 \(Te_k=v_k\;(k=1,\dots,n)\),即 \(T\) 关于标准基的矩阵恰为 \(\bigl(\,v_1\ \cdots\ v_n\,\bigr)\);由 9.43,\(\det\bigl(\,v_1\ \cdots\ v_n\,\bigr)=\det T\)。

取 \(\mathbf{F}^{n}\) 上满足 \(\alpha(e_1,\dots,e_n)=1\) 的交错 \(n\)-线性型 \(\alpha\)(9.37 的证明中 9.38 式给出的那个即可)。于是

\[ \det\bigl(\,v_1\ \cdots\ v_n\,\bigr)=\det T=(\det T)\,\alpha(e_1,\dots,e_n)=\alpha(Te_1,\dots,Te_n)=\alpha(v_1,\dots,v_n), \]

其中第三个等号用了 \(\det T\) 的定义 9.41(作用在 \(\alpha\) 上并取值于 \(e_1,\dots,e_n\))。这说明「按列取行列式」这个函数就是交错 \(n\)-线性型 \(\alpha\)。证毕。

9.45 有立竿见影的推论:两列相同的矩阵行列式为 \(0\),某一列乘 \(c\) 行列式乘 \(c\),等等。但眼下更要紧的是给出显式公式。回忆 9.B 的定理 9.36:交错 \(n\)-线性型在任意 \(n\) 个向量上的值,等于它在基上的值乘一个对置换求和的展开式。把它套在「按列取行列式」上,就得到著名的 Leibniz 展开式 (原书 9.46)。约定 \(A_{j,k}\) 表示 \(A\) 的第 \(j\) 行第 \(k\) 列元素,\(\operatorname{perm} n\) 是 \(\{1,\dots,n\}\) 的全体 \(n\)-元置换,\(\operatorname{sign}\) 是 9.32 定义的符号。

定理 9.46(矩阵行列式的公式)。设 \(n\) 为正整数,\(A\) 是 \(n\times n\) 方阵。则

\[ \det A=\sum_{(j_1,\dots,j_n)\in\operatorname{perm} n}\bigl(\operatorname{sign}(j_1,\dots,j_n)\bigr)\,A_{j_1,1}\cdots A_{j_n,n}. \]

证明。在 9.36 中取 \(V=\mathbf{F}^{n}\)、基为标准基 \(e_1,\dots,e_n\)、\(\alpha\) 为把 \(v_1,\dots,v_n\) 送到 \(\det\bigl(\,v_1\ \cdots\ v_n\,\bigr)\) 的交错 \(n\)-线性型 (9.45)。把每个 \(v_k\) 取为 \(A\) 的第 \(k\) 列,则该列按标准基的分解系数恰为 \(b_{j,k}=A_{j,k}\)。又

\[ \alpha(e_1,\dots,e_n)=\det\bigl(\,e_1\ \cdots\ e_n\,\bigr)=\det I=1, \]

于是 9.36 的公式就化为本定理的公式。证毕。

例 4(显式公式,原书 9.47)。当 \(n=2\),和式遍历 \(\operatorname{perm}2=\{(1,2),(2,1)\}\),符号为 \(+1,-1\):

\[ \det A=A_{1,1}A_{2,2}-A_{2,1}A_{1,2}. \]

当 \(n=3\),\(\operatorname{perm}3\) 有六个元素,逐一写出符号:

\[ \det A=A_{1,1}A_{2,2}A_{3,3}-A_{2,1}A_{1,2}A_{3,3}-A_{3,1}A_{2,2}A_{1,3}-A_{1,1}A_{3,2}A_{2,3}+A_{3,1}A_{1,2}A_{2,3}+A_{2,1}A_{3,2}A_{1,3}. \]

例 5(具体演算:\(2\times2\) 与 \(3\times3\))。(a) 设

\[ B=\begin{pmatrix}3&1\\2&4\end{pmatrix},\qquad \det B=3\cdot4-1\cdot2=10. \]

(b) 设

\[ A=\begin{pmatrix}1&2&3\\4&5&6\\7&8&10\end{pmatrix}. \]

按例 4 的 \(3\times3\) 公式:

\[ \begin{aligned}\det A&=1\cdot5\cdot10-4\cdot2\cdot10-7\cdot5\cdot3-1\cdot8\cdot6+7\cdot2\cdot6+4\cdot8\cdot3\\&=50-80-105-48+84+96=-3.\end{aligned} \]

本节稍后的 9.57 将给出快得多的算法,先把答案留在这里作对照。

注(\(n!\) 的爆炸)。9.46 的和式有 \(n!\) 项:\(10!\) 已超过三百万,\(100!\approx10^{158}\),任何计算机都无法直接求和。显式公式是理论支柱,不是计算工具;实用计算靠的是 9.48 与 9.57 的初等变换法。

定理 9.48(上三角矩阵的行列式)。设 \(A\) 是对角元为 \(\lambda_1,\dots,\lambda_n\) 的上三角矩阵。则 \(\det A=\lambda_1\cdots\lambda_n\)。

证明。在 9.46 的和式中考察某个置换 \((j_1,\dots,j_n)\ne(1,\dots,n)\)。此时必有某个 \(k\in\{1,\dots,n\}\) 使 \(j_k\gt k\),而 \(A\) 上三角意味着第 \(k\) 列里行号大于 \(k\) 的元素全为零,故 \(A_{j_k,k}=0\),该项贡献为零。于是唯一可能非零的项对应恒等置换 \((1,\dots,n)\),符号 \(+1\),乘积为 \(A_{1,1}\cdots A_{n,n}=\lambda_1\cdots\lambda_n\)。证毕。

例 6(分块对角)。

\[ M=\begin{pmatrix}2&1&0\\1&3&0\\0&0&4\end{pmatrix}. \]

用 9.46 的置换观点:第 \(3\) 列只有 \(M_{3,3}=4\) 非零,故任何有贡献的置换必须满足 \(j_3=3\);剩下 \(j_1,j_2\) 取遍 \(\{1,2\}\) 的置换,贡献恰是左上 \(2\times2\) 块的行列式 \(2\cdot3-1\cdot1=5\)。于是

\[ \det M=4\cdot5=20=(\det A_1)(\det A_2),\qquad A_1=\begin{pmatrix}2&1\\1&3\end{pmatrix},\ A_2=(4). \]

一般分块上三角矩阵的公式见练习 3(原书练习 9C.5)。

行列式的基本性质

现在收获定义送来的第一批大礼。首先是全书最著名的恒等式——乘法公式,而它的证明只是把定义念了三遍 (原书 9.49)。

定理 9.49(行列式的乘法公式)。(a) 设 \(S,T\in\mathcal{L}(V)\),则

\[ \det(ST)=(\det S)(\det T). \]

(b) 设 \(A,B\) 是同阶方阵,则 \(\det(AB)=(\det A)(\det B)\)。

证明。(a) 记 \(n=\dim V\)。设 \(\alpha\in V^{(n)}_{\mathrm{alt}}\),\(v_1,\dots,v_n\in V\)。逐层使用定义:

\[ \alpha_{ST}(v_1,\dots,v_n)=\alpha(STv_1,\dots,STv_n)\overset{\det S}{=}(\det S)\,\alpha(Tv_1,\dots,Tv_n)\overset{\det T}{=}(\det S)(\det T)\,\alpha(v_1,\dots,v_n), \]

其中第一处等号是 \(\alpha_{ST}\) 的定义,第二处把 \(\det S\) 的定义用在列表 \(Tv_1,\dots,Tv_n\) 上,第三处再用 \(\det T\) 的定义。于是 \(\alpha_{ST}=(\det S)(\det T)\,\alpha\) 对一切 \(\alpha\) 成立,由定义 9.41 即得 (a)。

(b) 设 \(S,T\in\mathcal{L}(\mathbf{F}^{n})\) 关于标准基的矩阵分别为 \(A,B\),则 \(ST\) 的矩阵是 \(AB\)(矩阵乘法对应复合,原书 3.43)。于是

\[ \det(AB)=\det(ST)=(\det S)(\det T)=(\det A)(\det B), \]

中间等号用 (a),首尾等号用 9.43。证毕。

x y 1 Te1 Te2 STe1 STe2 S S 单位方块:面积 1 T(方块):面积 |det T| = 2 ST(方块):面积 |det ST| = 4 det(ST) = (det S)(det T) = 2 × 2 = 4(定理 9.49)
图 2:乘法公式的体积合成。取 \(Te_1=(1.5,\,0.5)\),\(Te_2=(0.5,\,1.5)\),则 \(\det T=2\);再取 \(S=2I\)(\(\det S=2\),图中虚线箭头表示 \(S\) 的拉伸)。单位方块经 \(T\) 变为面积为 \(2\) 的平行四边形,再经 \(S\) 变为面积为 \(4\) 的平行四边形:两次伸缩率相乘,即 \(\det(ST)=(\det S)(\det T)\)。

第二个大礼:行列式完全判别可逆性 (原书 9.50)。

定理 9.50(可逆 \(\Longleftrightarrow\) 行列式非零)。设 \(T\in\mathcal{L}(V)\)。则 \(T\) 可逆当且仅当 \(\det T\ne 0\)。而且当 \(T\) 可逆时,

\[ \det(T^{-1})=\frac{1}{\det T}. \]

证明。设 \(T\) 可逆,则 \(TT^{-1}=I\),由 9.49(a) 与 \(\det I=1\),

\[ 1=\det I=\det(TT^{-1})=(\det T)\bigl(\det(T^{-1})\bigr), \]

故 \(\det T\ne 0\) 且 \(\det(T^{-1})\) 是 \(\det T\) 的乘法逆元。

反之设 \(\det T\ne 0\),证 \(T\) 可逆。设 \(v\in V\),\(v\ne 0\)。把 \(v\) 扩充成 \(V\) 的基 \(v,e_2,\dots,e_n\),取非零 \(\alpha\in V^{(n)}_{\mathrm{alt}}\)。由 9.39,\(\alpha(v,e_2,\dots,e_n)\ne 0\),从而

\[ \alpha(Tv,Te_2,\dots,Te_n)=(\det T)\,\alpha(v,e_2,\dots,e_n)\ne 0. \]

特别地 \(Tv\ne 0\)。于是 \(T\) 把每个非零向量映为非零向量,即单射,从而可逆。证毕。

于是「\(A\) 可逆 \(\Longleftrightarrow\det A\ne 0\)」对方阵同样成立(矩阵可逆当且仅当对应算子可逆,原书 3.80)。把它与特征值的判别法 \(\lambda\) 是特征值 \(\Longleftrightarrow T-\lambda I\) 不可逆 (原书 5.7) 相接,立刻得到 (原书 9.51):

定理 9.51(特征值与行列式)。设 \(T\in\mathcal{L}(V)\),\(\lambda\in\mathbf{F}\)。则 \(\lambda\) 是 \(T\) 的特征值当且仅当

\[ \det(\lambda I-T)=0. \]

证明。\(\lambda\) 是 \(T\) 的特征值 \(\Longleftrightarrow\) \(T-\lambda I\) 不可逆 (5.7) \(\Longleftrightarrow\) \(\lambda I-T\) 不可逆 \(\Longleftrightarrow\) \(\det(\lambda I-T)=0\)(9.50)。证毕。

注。取 \(\lambda=0\):\(T\) 不可逆 \(\Longleftrightarrow\det T=0\),即 \(0\) 是特征值当且仅当行列式为零。又由例 1,数乘满足 \(\det(\lambda T)=\lambda^{n}\det T\);特别地 \(\det(-T)=(-1)^{n}\det T\),它马上会在 9.65 中登场。

第三个大礼:行列式是相似不变量。有个小陷阱值得先看穿:若想用 9.49 写 \(\det(S^{-1}TS)=(\det S^{-1})(\det T)(\det S)=\det T\),当 \(S\colon W\to V\) 是不同空间之间的同构时,该式毫无意义——\(\det S\) 只对「空间到自身」的算子有定义。下面的证明绕开了这一点,对 \(W\ne V\) 也成立 (原书 9.52)。

定理 9.52(行列式是相似不变量)。设 \(T\in\mathcal{L}(V)\),\(S\colon W\to V\) 是可逆线性映射。则

\[ \det(S^{-1}TS)=\det T. \]

证明。记 \(n=\dim W=\dim V\)。设 \(\tau\in W^{(n)}_{\mathrm{alt}}\),用 \(S^{-1}\) 把它搬运到 \(V\) 上:定义 \(\alpha\in V^{(n)}_{\mathrm{alt}}\) 为

\[ \alpha(v_1,\dots,v_n)=\tau(S^{-1}v_1,\dots,S^{-1}v_n),\qquad v_1,\dots,v_n\in V. \]

(与 9.40 同样的理由,\(\alpha\) 确是交错 \(n\)-线性型。)对任意 \(w_1,\dots,w_n\in W\),

\[ \tau_{S^{-1}TS}(w_1,\dots,w_n)=\tau(S^{-1}TSw_1,\dots,S^{-1}TSw_n)=\alpha(TSw_1,\dots,TSw_n)=\alpha_{T}(Sw_1,\dots,Sw_n)=(\det T)\,\alpha(Sw_1,\dots,Sw_n)=(\det T)\,\tau(w_1,\dots,w_n), \]

末一等号是 \(\alpha\) 的定义。由算子 \(S^{-1}TS\in\mathcal{L}(W)\) 的行列式定义,上式说明 \(\det(S^{-1}TS)=\det T\)。证毕。

现在可以回答一个悬了很久的问题:\(\det T\) 与 \(\det\mathcal{M}(T)\) 有何关系?答案是:完全一致,且与基的选取无关 (原书 9.53)。

定理 9.53(算子的行列式等于其矩阵的行列式)。设 \(T\in\mathcal{L}(V)\),\(e_1,\dots,e_n\) 是 \(V\) 的基。则

\[ \det T=\det\mathcal{M}\bigl(T,(e_1,\dots,e_n)\bigr). \]

证明。设 \(f_1,\dots,f_n\) 是 \(\mathbf{F}^{n}\) 的标准基,令 \(S\colon\mathbf{F}^{n}\to V\) 为满足 \(Sf_k=e_k\;(k=1,\dots,n)\) 的线性映射。则 \(\mathcal{M}\bigl(S,(f_1,\dots,f_n),(e_1,\dots,e_n)\bigr)\) 与 \(\mathcal{M}\bigl(S^{-1},(e_1,\dots,e_n),(f_1,\dots,f_n)\bigr)\) 都等于单位矩阵。由矩阵乘法对应复合 (3.43,用两次),

\[ \mathcal{M}\bigl(S^{-1}TS,(f_1,\dots,f_n)\bigr)=\mathcal{M}\bigl(T,(e_1,\dots,e_n)\bigr). \tag{9.54} \]

于是

\[ \det T=\det(S^{-1}TS)=\det\mathcal{M}\bigl(S^{-1}TS,(f_1,\dots,f_n)\bigr)=\det\mathcal{M}\bigl(T,(e_1,\dots,e_n)\bigr), \]

其中第一个等号用 9.52,第二个用矩阵行列式的定义 9.43,第三个用 9.54。证毕。

注。当 \(V=\mathbf{F}^{n}\) 且取标准基时,9.53 就是定义 9.43 本身;它的价值在于:左边不依赖基,故右端与基的选取无关——同一算子在不同基下的矩阵彼此相似,而 9.52 说相似变换不改变行列式。两条路线在山顶会师。

复数域上,9.53 立即给出本章最直观的刻画 (原书 9.55)。

定理 9.55(\(\mathbf{F}=\mathbf{C}\) 时行列式等于特征值之积)。设 \(\mathbf{F}=\mathbf{C}\),\(T\in\mathcal{L}(V)\)。则 \(\det T\) 等于 \(T\) 的全体特征值之积,每个特征值按其重数计入。

证明。由 8.B 的 Schur 型结论 (原书 8.37),存在 \(V\) 的基,使 \(T\) 的矩阵为上三角,且对角元恰为全体特征值(按重数)。对该矩阵用 9.53 与 9.48:\(\det T\) 等于对角元之积,即特征值之积。证毕。

例 7(特征值之积)。(a) 设 \(A\) 是对角元为 \(3,3,-1\) 的上三角矩阵(见例 9 与图 3 的具体矩阵),则特征值为 \(3\)(二重)与 \(-1\),故 \(\det A=3\cdot3\cdot(-1)=-9\)。(b) 设 \(T\) 不可逆,则 \(0\) 是特征值 (9.50 的注),于是 \(\det T=0\)——与 9.50 一致。把 9.55 写成第 8 章的语言:若 \(T\) 的互异特征值为 \(\lambda_1,\dots,\lambda_m\),重数为 \(d_1,\dots,d_m\),则

\[ \det T=\lambda_1^{d_1}\cdots\lambda_m^{d_m},\qquad \operatorname{tr}T=d_1\lambda_1+\cdots+d_m\lambda_m, \]

行列式与迹是「特征值初等对称函数」的两端,这一呼应将在 9.65 中精确化。

转置、对偶、伴随与快速计算

行列式与转置 (transpose)、对偶算子 (dual operator)、伴随算子 (adjoint) 都相处融洽 (原书 9.56)。提醒:复内积空间上 (c) 中出现的是共轭——证明 9.58 时它是必需品。

定理 9.56(转置、对偶、伴随的行列式)。

  • (a) 设 \(A\) 是方阵,则 \(\det A^{t}=\det A\)。
  • (b) 设 \(T\in\mathcal{L}(V)\),则 \(\det T'=\det T\)。
  • (c) 设 \(V\) 是内积空间,\(T\in\mathcal{L}(V)\),则 \(\det(T^{*})=\overline{\det T}\)(实内积空间上即 \(\det(T^{*})=\det T\))。

证明。(a) 定义 \(\alpha\colon(\mathbf{F}^{n})^{n}\to\mathbf{F}\) 为

\[ \alpha(v_1,\dots,v_n)=\det\bigl((\,v_1\ \cdots\ v_n\,)^{t}\bigr). \]

由公式 9.46,行列式对每一列线性,故 \(\alpha\) 是 \(n\)-线性型。设 \(v_j=v_k\;(j\ne k)\)。若矩阵 \((\,v_1\ \cdots\ v_n\,)^{t}\) 可逆,则存在方阵 \(B\) 使 \((\,v_1\ \cdots\ v_n\,)^{t}B=I\);但该乘积的第 \(j\) 行与第 \(k\) 行相同(都由相等的两列转置而来),而单位矩阵没有相同的行,矛盾。故 \((\,v_1\ \cdots\ v_n\,)^{t}\) 不可逆,从而 \(\alpha(v_1,\dots,v_n)=\det\bigl((\,v_1\ \cdots\ v_n\,)^{t}\bigr)=0\) (9.50 后的方阵版本)。于是 \(\alpha\) 是交错 \(n\)-线性型。又 \(\alpha(e_1,\dots,e_n)=\det I=1\),而满足 \(\alpha(e_1,\dots,e_n)=1\) 的交错 \(n\)-线性型只有一个(一维空间 9.37,倍数由该取值钉死),即「按列取行列式」 (9.45)。于是对任意方阵 \(A\)(取其列为 \(v_1,\dots,v_n\)),\(\det(A^{t})=\alpha(v_1,\dots,v_n)=\det\bigl(\,v_1\ \cdots\ v_n\,\bigr)=\det A\)。

(b) 在任意基下,\(T'\) 的矩阵是 \(T\) 的矩阵的转置 (原书 3.132),于是 \(\det T'=\det\mathcal{M}(T')=\det\bigl(\mathcal{M}(T)^{t}\bigr)=\det\mathcal{M}(T)=\det T\)(依次用 9.53、3.132、(a)、9.53)。

(c) 取 \(V\) 的标准正交基。\(T^{*}\) 在该基下的矩阵是 \(T\) 的矩阵的共轭转置 (原书 7.9)。于是由 9.53、(a) 以及「取共轭可与 9.46 的求和、乘积交换」(共轭是域自同构)得 \(\det(T^{*})=\overline{\det T}\)。证毕。

由 9.45(按列)与 9.56(a)(按行)合流,初等行/列变换对行列式的影响一目了然 (原书 9.57)。

定理 9.57(计算行列式的常用性质)。设 \(A\) 是方阵。

  • (a) 若 \(A\) 有两列(或两行)相同,则 \(\det A=0\)。
  • (b) 若 \(B\) 由 \(A\) 交换两列(或两行)得到,则 \(\det A=-\det B\)。
  • (c) 某一列(或某一行)乘以标量 \(c\),行列式乘以 \(c\)。
  • (d) 把某一列的 \(c\) 倍加到另一列,行列式不变。
  • (e) 把某一行的 \(c\) 倍加到另一行,行列式不变。

证明。核心事实:按列取行列式是交错 \(n\)-线性型 (9.45),按行取行列式(即对 \(A^{t}\) 按列取)也是 (9.56(a));再配上 9.B 的 9.30(交错型交换两变元变号)。

(a) 两列相同即两个变元相同,交错性直接给零;两行情形化为其转置的两列。(b) 交换两列即交换两个变元,由 9.30 取值变号;两行情形经转置化为两列。(c) 是多重线性性(对那个列槽提出因子 \(c\));行情形经转置。

(d) 以「把第二列的 \(c\) 倍加到第一列」为例(其余列组合同理)。设列为 \(v_1,\dots,v_n\in\mathbf{F}^{n}\),由多重线性性与交错性,

\[ \det\bigl(\,v_1+cv_2\ \ v_2\ \cdots\ v_n\,\bigr)=\det\bigl(\,v_1\ \ v_2\ \cdots\ v_n\,\bigr)+c\,\det\bigl(\,v_2\ \ v_2\ \ v_3\ \cdots\ v_n\,\bigr)=\det\bigl(\,v_1\ \ v_2\ \cdots\ v_n\,\bigr), \]

第二步的两列 \(v_2,v_2\) 相同,由 (a) 该项为零。(e) 由 (d) 与 9.56(a) 立得。证毕。

例 8(列变换演示)。

\[ M=\bigl(\,v_1\ \ v_2\ \ v_3\,\bigr)=\begin{pmatrix}2&1&0\\1&0&1\\1&1&0\end{pmatrix},\qquad v_1=(2,1,1),\ v_2=(1,0,1),\ v_3=(0,1,0). \]

按例 4 公式:\(\det M=2(0\cdot0-1\cdot1)-1(1\cdot0-1\cdot1)+0=-2+1=-1\)。现在把第一列换成 \(v_1-2v_2=(0,1,-1)\)(把第二列的 \(-2\) 倍加到第一列,9.57(d)),得到

\[ M'=\begin{pmatrix}0&1&0\\1&0&1\\-1&1&0\end{pmatrix},\qquad \det M'=0-1\cdot\bigl(1\cdot0-1\cdot(-1)\bigr)+0=-1=\det M, \]

行列式纹丝不动——但 \(M'\) 的第一行只剩一个非零元,计算量骤减。这正是高斯消元法求行列式的原理:用 9.57(b)(换行,变号)、(c)(某行乘非零常数,同行列式)、(e)(倍加行,不变)把矩阵化为上三角,再用 9.48(对角元之积)读出答案,并回乘中途提取的因子。对例 5 的 \(A\):\(R_2\to R_2-4R_1\)、\(R_3\to R_3-7R_1\)、再 \(R_3\to R_3-2R_2\),得上三角矩阵,对角元 \(1,-3,1\),行列式 \(-3\),与 Leibniz 公式的结果一致。

注(为什么不靠 \(\det(\lambda I-A)=0\) 求特征值)。9.51 诱使人以为求特征值的捷径是解方程 \(\det(\lambda I-A)=0\)。但含符号 \(\lambda\) 的矩阵无法机械地套用高斯消元——消元过程需要判断「某些量是否为零」,而这些判断在含 \(\lambda\) 时会变得一团糟。该程序只在 \(\dim V\) 很小(\(2\),至多 \(3,4\))时勉强可用。原书用第 8 章(上三角化、广义特征空间)而非行列式来研究特征值,理由正在于此;9.51 的正确用法是理论判据,不是数值配方。

几何意义:体积伸缩率与奇异值

本节余下部分让行列式与内积空间理论 (第 7 章) 胜利会师。第一站:酉算子 (unitary operator,保持范数的算子)。

定理 9.58(酉算子的行列式绝对值为 \(1\))。设 \(V\) 是内积空间,\(S\in\mathcal{L}(V)\) 是酉算子。则 \(|\det S|=1\)。

证明。由酉的定义,\(S^{*}S=I\) (原书 7.53)。于是

\[ 1=\det I=\det(S^{*}S)=(\det S^{*})(\det S)=\overline{\det S}\,\det S=|\det S|^{2}, \]

其中第二个等号用 9.49(a),第三个用 9.56(c)。故 \(|\det S|=1\)。证毕。

例 9(旋转与酉矩阵)。\(\mathbf{R}^{2}\) 上转角 \(\theta\) 的旋转矩阵 \(\begin{pmatrix}\cos\theta&-\sin\theta\\ \sin\theta&\cos\theta\end{pmatrix}\) 是酉的,行列式 \(\cos^{2}\theta+\sin^{2}\theta=1\):旋转保持面积与定向。复情形取 \(S=\operatorname{diag}(\mathrm{e}^{i\alpha},\mathrm{e}^{i\beta})\):\(\det S=\mathrm{e}^{i(\alpha+\beta)}\),模为 \(1\),与 9.58 相符。

正算子 (positive operator) 对应非负实数,其行列式也恰好非负 (原书 9.59)。

定理 9.59(正算子的行列式非负)。设 \(V\) 是内积空间,\(T\in\mathcal{L}(V)\) 是正算子。则 \(\det T\ge 0\)。

证明。由谱定理 (原书 7.29 或 7.31),\(V\) 有由 \(T\) 的特征向量组成的标准正交基,于是由例 1 末条,\(\det T\) 等于这些特征值(按重数)之积。正算子的特征值都非负 (原书 7.38),故积非负。证毕。

下一个结果把行列式与 7.F 的奇异值 (singular values) 缝在一起:行列式的绝对值就是奇异值之积,也是 7.F 里那个体积伸缩率 (原书 9.60)。

定理 9.60(\(|\det T|\) 等于奇异值之积)。设 \(V\) 是内积空间,\(T\in\mathcal{L}(V)\)。则

\[ |\det T|=\sqrt{\det(T^{*}T)}=\text{\(T\) 的奇异值之积}. \]

证明。由 9.56(c) 与 9.49(a),

\[ |\det T|^{2}=\overline{\det T}\cdot\det T=(\det T^{*})(\det T)=\det(T^{*}T), \]

开方得第一个等号。设 \(s_1,\dots,s_n\) 是 \(T\) 的奇异值,即 \(T^{*}T\) 的特征值的标准正交特征基所对应的 \(s_k^{2}\)(按重数)。注意 \(T^{*}T\) 是正算子,谱定理给出这样的基,于是由例 1 末条,

\[ \det(T^{*}T)=s_1^{2}\cdots s_n^{2}, \]

故 \(|\det T|=s_1\cdots s_n\)。证毕。

7.F 的定理 7.111(原书)说:实内积空间上的算子把体积放大「奇异值之积」倍。与 9.60 合并,就得到微积分换元公式里那个因子 (原书 9.61)。

定理 9.61(\(T\) 把体积放大 \(|\det T|\) 倍)。设 \(T\in\mathcal{L}(\mathbf{R}^{n})\),\(\Omega\subseteq\mathbf{R}^{n}\)。则

\[ \operatorname{volume} T(\Omega)=|\det T|\cdot(\operatorname{volume}\Omega). \]

证明。7.111 给出 \(\operatorname{volume}T(\Omega)=(s_1\cdots s_n)\operatorname{volume}\Omega\),其中 \(s_1,\dots,s_n\) 是 \(T\) 的奇异值;9.60 又给出 \(s_1\cdots s_n=|\det T|\)。两式相接即得。证毕。

注(定向)。9.61 只谈体积,不谈定向。在 \(\mathbf{R}^{n}\) 中,约定 \(e_1,\dots,e_n\) 给出「正定向」,则任何非零交错 \(n\)-线性型 \(\omega\) 在定向相同的基上取同号值。于是 \(\det T\gt 0\) 表示 \(T\) 保持定向(如旋转、拉伸),\(\det T\lt 0\) 表示反转定向(如镜面反射,例 2 与图 1 右);这正是「有向体积」中「有向」二字的分量。原书练习 9C.8 与 9C.9 把它推向定量结论:无特征值的实算子行列式必为正(见练习 5),偶数维实空间上 \(\det T\lt 0\) 迫使 \(T\) 至少有两个互异特征值。

特征多项式之桥:\(\det(zI-T)\)

现在来到全书的收束点之一。第 8 章把多项式 \(z\mapsto(z-\lambda_1)^{d_1}\cdots(z-\lambda_m)^{d_m}\) 命名为特征多项式 (characteristic polynomial,原书 8.26,当时仅限 \(\mathbf{F}=\mathbf{C}\))。行列式终于兑现这张支票 (原书 9.62)。

定理 9.62(\(\mathbf{F}=\mathbf{C}\) 时特征多项式等于 \(\det(zI-T)\))。设 \(\mathbf{F}=\mathbf{C}\),\(T\in\mathcal{L}(V)\)。设 \(\lambda_1,\dots,\lambda_m\) 是 \(T\) 的互异特征值,重数依次为 \(d_1,\dots,d_m\)。则

\[ \det(zI-T)=(z-\lambda_1)^{d_1}\cdots(z-\lambda_m)^{d_m}. \]

证明。由 8.37,存在 \(V\) 的基使 \(T\) 的矩阵为上三角,且对角元中每个 \(\lambda_k\) 恰出现 \(d_k\) 次。在该基下,\(zI-T\) 的矩阵是同阶上三角矩阵,对角元为 \(z-\lambda_k\)(各出现 \(d_k\) 次)。由 9.48(对符号 \(z\) 照样适用,因为它只是逐项乘积的断言),\(\det(zI-T)=(z-\lambda_1)^{d_1}\cdots(z-\lambda_m)^{d_m}\)。证毕。

实向量空间上的算子可能没有特征值,右端的写法不再可用;但左端永远有意义。于是原书把特征多项式重新定义如下 (原书 9.63),这一定义对实、复空间一视同仁,且在 \(\mathbf{F}=\mathbf{C}\) 时与 8.26 一致 (9.62)。

定义 9.63(特征多项式)。设 \(T\in\mathcal{L}(V)\)。多项式

\[ z\mapsto\det(zI-T) \]

称为 \(T\) 的特征多项式。由公式 9.46,它是首项系数为 \(1\)、次数为 \(\dim V\) 的多项式;它在 \(\mathbf{F}\) 中的零点恰是 \(T\) 的特征值 (9.51)。

det(zI − A) = (z − 3)2(z + 1) Re Im 0 λ2 = −1 λ1 = 3(二重) z det(λI − A) = 0 ⇔ λ 是 A 的特征值(定理 9.51,定义 9.63)
图 3:特征多项式的根图。取例 10 的矩阵 \(A\)(上三角,对角元 \(3,3,-1\)),多项式 \(\det(zI-A)=(z-3)^{2}(z+1)\):根恰为特征值,根的重数即代数重数(\(3\) 为二重根,\(-1\) 为单根)。

新的定义立刻扩大了旧定理的版图:凯莱–哈密顿定理 (Cayley–Hamilton theorem) 原先只在复空间上证明过 (8.29),现在实空间也一并拿下 (原书 9.64)。

定理 9.64(凯莱–哈密顿定理)。设 \(T\in\mathcal{L}(V)\),\(q\) 是 \(T\) 的特征多项式。则 \(q(T)=0\)。

证明。若 \(\mathbf{F}=\mathbf{C}\),则由 9.62,\(q\) 就是 8.26 意义下的特征多项式,结论即 8.29。

设 \(\mathbf{F}=\mathbf{R}\)。取定 \(V\) 的基,令 \(A=\mathcal{M}(T)\),又令 \(S\) 是 \(\mathbf{C}^{\dim V}\) 上关于标准基矩阵为 \(A\) 的算子(同一个实矩阵,搬进复空间)。对一切实数 \(z\),

\[ q(z)=\det(zI-T)=\det(zI-A)=\det(zI-S), \]

故两个多项式在无穷多个点取值相同,必相等,即 \(q\) 也是 \(S\) 的特征多项式。由已证的复情形,\(q(S)=0\),按矩阵写出即 \(q(A)=0\),而 \(q(A)\) 正是 \(q(T)\) 在所取基下的矩阵,故 \(q(T)=0\)。证毕。

注。9.64 加上「零化多项式的任一倍式仍零化」可知特征多项式是最小多项式的倍式 (原书 5.29 的视角);特别地,当最小多项式次数等于 \(\dim V\) 时二者相等——原书指出这对「绝大多数」算子成立(例如超过 \(99.999\%\) 的、元素取自 \([-100,100]\) 整数的 \(4\times4\) 矩阵)。

例 10(一个具体的特征多项式)。

\[ A=\begin{pmatrix}3&1&0\\0&3&2\\0&0&-1\end{pmatrix},\qquad q(z)=\det(zI-A)=(z-3)^{2}(z+1)=z^{3}-5z^{2}+3z+9. \]

读出三个系数:\(q\) 的 \(z^{2}\) 系数是 \(-5=-(\operatorname{tr}A)\),其中 \(\operatorname{tr}A=3+3-1=5\);常数项 \(9=(-1)^{3}\det A\),其中 \(\det A=3\cdot3\cdot(-1)=-9\) (9.48 或例 7);\(z\) 的系数 \(3\) 则是「特征值的二级对称函数」\(\lambda_1\lambda_2+\lambda_1\lambda_3+\lambda_2\lambda_3=3\cdot3+3\cdot(-1)+3\cdot(-1)=3\)。下面的定理说明前两条对一切算子成立。

定理 9.65(特征多项式、迹与行列式)。设 \(T\in\mathcal{L}(V)\),\(n=\dim V\),\(q\) 是 \(T\) 的特征多项式。则

\[ q(z)=z^{n}-(\operatorname{tr}T)\,z^{n-1}+\cdots+(-1)^{n}(\det T). \]

证明(常数项)。多项式的常数项等于它在 \(z=0\) 处的值:\(q(0)=\det(-T)=(-1)^{n}\det T\)(例 1 第三条)。

证明(\(z^{n-1}\) 的系数)。取定基,令 \(A=\mathcal{M}(T)\),则 \(zI-T\) 的矩阵是 \(zI-A\)。在 9.46 的和式中,恒等置换 \((1,\dots,n)\) 贡献

\[ (z-A_{1,1})\cdots(z-A_{n,n}), \]

其中 \(z^{n-1}\) 的系数是 \(-\bigl(A_{1,1}+\cdots+A_{n,n}\bigr)=-\operatorname{tr}T\)。其余任何置换 \((j_1,\dots,j_n)\ne(1,\dots,n)\) 必有某处 \(j_k\ne k\),其乘积中至多含 \(n-2\) 个形如 \(z-A_{k,k}\) 的因子,故根本够不到 \(z^{n-1}\) 次的档次,对 \(z^{n-1}\) 系数毫无贡献。证毕。

注(与 8.D 会师)。8.D 的定理 8.54(原书)已在复情形给出同一展开式;9.65 的证明不经过特征值,对实、复一致。于是第 8 章的两大谱不变量——迹 \(\operatorname{tr}T=\sum d_k\lambda_k\) 与行列式 \(\det T=\prod\lambda_k^{d_k}\)——被确认为同一个多项式的一头一尾:特征多项式把整本书记过的「谱对称函数」串成一串。也让 9.62 的复公式与 9.55 重新咬合:\(q(0)=\det(-T)=(-1)^{n}\lambda_1^{d_1}\cdots\lambda_m^{d_m}\)。

Hadamard 不等式与 Vandermonde 行列式

原书以两个经典结果为 9.C 的主体收尾:一个几何不等式,一个代数恒等式。

定理 9.66(Hadamard 不等式)。设 \(A\) 是 \(n\times n\) 矩阵,\(v_1,\dots,v_n\) 是它的各列(视为 \(\mathbf{F}^{n}\) 中的向量,范数来自标准内积)。则

\[ |\det A|\le\prod_{k=1}^{n}\|v_k\|. \]

证明。若 \(A\) 不可逆,则 \(\det A=0\),不等式平凡成立。设 \(A\) 可逆。由 QR 分解 (原书 7.58),存在酉矩阵 \(Q\) 与对角元全为正数的上三角矩阵 \(R\) 使 \(A=QR\)。于是

\[ |\det A|=|\det Q|\,|\det R|=|\det R|=\prod_{k=1}^{n}R_{k,k}\le\prod_{k=1}^{n}\|R_{\cdot,k}\|=\prod_{k=1}^{n}\|QR_{\cdot,k}\|=\prod_{k=1}^{n}\|v_k\|, \]

其中第一处等号用 9.49(b),第二处用 9.58(\(|\det Q|=1\)),第三处用 9.48(上三角矩阵 \(R\) 的行列式为对角元之积,而它们非负),不等号是因为每个对角元 \(R_{k,k}\) 不超过所在列 \(R_{\cdot,k}\) 的范数,第五处因为 \(Q\) 是等距,末处因为 \(A\) 的第 \(k\) 列 \(v_k=QR_{\cdot,k}\)。证毕。

注(几何解读与取等条件)。取 \(\mathbf{F}=\mathbf{R}\)。令 \(Te_k=v_k\),则 \(T\) 把单位盒子 \(P(e_1,\dots,e_n)\)(体积 \(1\))映为棱为 \(v_1,\dots,v_n\) 的平行多面体 \(P(v_1,\dots,v_n)\),由 9.61 其体积为 \(|\det A|\)。于是 Hadamard 不等式说的是:棱长给定的平行多面体,以诸棱互相垂直时体积最大,最大值即 \(\prod\|v_k\|\)(正交时正好是长方体)。取等的充要条件是各列两两正交(原书练习 9C.18)。数值一例:\(A=\begin{pmatrix}1&2\\2&1\end{pmatrix}\),\(|\det A|=|1-4|=3\le\sqrt{5}\cdot\sqrt{5}=5\),不取等,因为两列 \((1,2)\) 与 \((2,1)\) 不正交。

Vandermonde 矩阵 (Vandermonde matrix) 在多项式插值、离散傅里叶变换等领域随处可见;原书对它的处理是「在矩阵与线性映射之间自如切换」的示范 (原书 9.67)。

定理 9.67(Vandermonde 行列式)。设 \(n\gt 1\),\(\beta_1,\dots,\beta_n\in\mathbf{F}\)。则

\[ \det\begin{pmatrix}1&\beta_1&\beta_1^{2}&\cdots&\beta_1^{n-1}\\1&\beta_2&\beta_2^{2}&\cdots&\beta_2^{n-1}\\\vdots&\vdots&\vdots&&\vdots\\1&\beta_n&\beta_n^{2}&\cdots&\beta_n^{n-1}\end{pmatrix}=\prod_{1\le j\lt k\le n}(\beta_k-\beta_j). \]

证明。取 \(1,z,\dots,z^{n-1}\) 为 \(\mathcal{P}_{n-1}(\mathbf{F})\) 的基,\(e_1,\dots,e_n\) 为 \(\mathbf{F}^{n}\) 的标准基。定义线性映射 \(S\colon\mathcal{P}_{n-1}(\mathbf{F})\to\mathbf{F}^{n}\) 为

\[ Sp=\bigl(p(\beta_1),\dots,p(\beta_n)\bigr). \]

则题中的 Vandermonde 矩阵 \(A=\mathcal{M}\bigl(S,(1,z,\dots,z^{n-1}),(e_1,\dots,e_n)\bigr)\)。

再定义 \(\mathcal{P}_{n-1}(\mathbf{F})\) 上的算子 \(T\):\(T1=1\),且对 \(k=1,\dots,n-1\),

\[ Tz^{k}=(z-\beta_1)(z-\beta_2)\cdots(z-\beta_k). \]

令 \(B=\mathcal{M}\bigl(T,(1,z,\dots,z^{n-1})\bigr)\)。由于每个 \(Tz^{k}\) 是首一的 \(k\) 次多项式,\(B\) 是对角元全为 \(1\) 的上三角矩阵,故 \(\det B=1\) (9.48)。令 \(C=\mathcal{M}\bigl(ST,(1,z,\dots,z^{n-1}),(e_1,\dots,e_n)\bigr)\);由乘积对应复合 (原书 3.81),\(C=AB\),于是

\[ \det A=(\det A)(\det B)=\det C. \]

按定义算出 \(C\) 的各列:\(S(Tz^{k-1})\) 的第 \(j\) 个分量是多项式 \((z-\beta_1)\cdots(z-\beta_{k-1})\) 在 \(\beta_j\) 处的值,即

\[ C=\begin{pmatrix}1&0&0&\cdots&0\\1&\beta_2-\beta_1&0&\cdots&0\\1&\beta_3-\beta_1&(\beta_3-\beta_1)(\beta_3-\beta_2)&\cdots&0\\\vdots&\vdots&\vdots&&\vdots\\1&\beta_n-\beta_1&(\beta_n-\beta_1)(\beta_n-\beta_2)&\cdots&(\beta_n-\beta_1)\cdots(\beta_n-\beta_{n-1})\end{pmatrix}. \]

这是下三角矩阵,其转置是上三角矩阵,行列式为对角元之积 (9.48 与 9.56(a)):

\[ \det A=\det C=\prod_{k=1}^{n}\ \prod_{j=1}^{k-1}(\beta_k-\beta_j)=\prod_{1\le j\lt k\le n}(\beta_k-\beta_j). \]

证毕。

例 11(\(n=3\))。取 \(\beta_1=1,\beta_2=2,\beta_3=4\):

\[ \det\begin{pmatrix}1&1&1\\1&2&4\\1&4&16\end{pmatrix}=(2-1)(4-1)(4-2)=6, \]

与按例 4 公式的直算 \(\;1(32-16)-1(16-4)+1(4-2)=16-12+2=6\;\) 一致。顺带得到一个漂亮的推论:\(\beta_1,\dots,\beta_n\) 互异 \(\Longleftrightarrow\) Vandermonde 行列式非零 \(\Longleftrightarrow\) 「取值映射」\(p\mapsto\bigl(p(\beta_1),\dots,p(\beta_n)\bigr)\) 可逆——这正是「\(n\) 个点唯一确定次数 \(\lt n\) 的插值多项式」的代数内核。

行列式的「最后出场」

原书的前言解释过书名的来历:多数教材用行列式证明「复向量空间上每个算子都有特征值」,而行列式「难懂、不直观、常常在没有动机的情况下被定义」——为了让这条「曲折(甚至是折磨)的路径」看起来顺理成章,教材们必须先定义行列式,再证可逆性判据,再定义特征多项式。本书把这幅地图整个倒转:先用抽象向量空间与线性映射建立一切 (第 1–5 章),用谱定理与上三角化拿到特征值 (第 5、7、8 章),用多重线性代数搭好体积的舞台 (第 9 章 A、B 两节),最后才请出行列式——而它一出场,几乎每个经典结果都是一步到位的:

  • 乘法公式 9.49 是把定义 9.41 念了两遍;可逆性判据 9.50 是定义加 9.39;特征多项式之桥 9.62 是上三角化 8.37 加上三角行列式 9.48。
  • 矩阵的 Leibniz 公式 9.46 不是公理而是定理,是交错型展开式 9.36 的直接特例;按列多重线性与交错性 (9.45) 同样是定义的赠品。
  • 几何面目由 9.60–9.61 兑现:行列式就是体积伸缩率,其绝对值恰为奇异值之积;Hadamard 不等式 9.66 是「长方体体积最大」的代数翻译。

同样值得注意的是原书没有做什么:全书没有余子式展开 (cofactor expansion)、没有 Cramer 法则、没有伴随矩阵。这些经典内容既非必需,也容易把初学者拖入符号操作而看不见意义。离得最近的是原书练习 9C.2(把行列式沿第一列展开,归结为低一阶的行列式,本质上是余子式展开的归纳形式)与练习 9C.16(\(g(x)=\det(I+xT)\) 满足 \(g'(0)=\operatorname{tr}T\))。而原书练习 9C.21 给出了「正确」的代数刻画:\(\mathbf{C}^{n,n}\) 上既保持乘法、又在 diagonal 矩阵上取对角元之积的函数必是行列式——行列式被它的代数性质唯一确定,而不是被一个庞杂的公式定义。这印证了 Felix Klein 的提醒,原书把它放在本节末尾:

在我的初等课教学中,出于教学法的原因,我把行列式越来越推向后台。我一再经历这样的情形:学生们虽然熟练掌握了那些便于缩短长式的公式,却往往未能领会它们的意义;对技巧的娴熟反而妨碍了学生深入学科的细节、获得真正的掌握。——Felix Klein,《高观点下的初等数学:几何》

9.D 将以张量积 (tensor product) 收官全书:把「乘两个向量」这件本章一直在绕着走的事正式完成。行列式作为交错多重线性型的比例因子,正是张量理论这棵大树上最先成熟的一颗果实。

练习

练习 9.C-1

证明或给出反例:对任意 \(S,T\in\mathcal{L}(V)\),\(\det(S+T)=\det S+\det T\)。(原书练习 9C.1)

解答

反例。取 \(V=\mathbf{R}^{2}\),\(S=I\),\(T=-I\)。则 \(\det S=1\),而 \(\det T=\det((-1)I)=(-1)^{2}=1\) (例 1)。于是 \(\det S+\det T=2\);但 \(S+T=0\),故 \(\det(S+T)=0\ne 2\)。

行列式把「和」变成「积」的世界:\(n=\dim V\ge2\) 时它甚至不是线性的——乘法公式 9.49 才是它的本性。

练习 9.C-2

设 \(T\in\mathcal{L}(V)\) 是幂零算子 (nilpotent operator)。证明:\(\det(I+T)=1\)。(原书练习 9C.3)

解答

先注意:\(A=\mathcal{M}(T)\)(任取基)是实或复的幂零矩阵;令 \(S\) 为 \(\mathbf{C}^{n}\)(\(n=\dim V\))上关于标准基矩阵为 \(A\) 的算子,则 \(S\) 也幂零。幂零算子的特征值全为零:若 \(Sv=\lambda v\),则 \(0=S^{k}v=\lambda^{k}v\),而 \(v\ne0\) 得 \(\lambda=0\)。

由 8.37,存在 \(\mathbf{C}^{n}\) 的基使 \(\mathcal{M}(S)\) 为上三角且对角元全为零(特征值全零)。在该基下 \(\mathcal{M}(I+S)\) 是对角元全为 \(1\) 的上三角矩阵,故 \(\det(I+S)=1\) (9.48)。最后

\[ \det(I+T)=\det(I+A)=\det(I+S)=1, \]

其中第一个等号用 9.53,第二个用 9.43(\(I+A\) 看作 \(\mathbf{C}\) 上矩阵;实矩阵的行列式按 9.46 是元素的多项式,与在哪个域中计算无关)。

练习 9.C-3

设 \(A\) 是分块上三角矩阵

\[ A=\begin{pmatrix}A_1&&\ast\\&\ddots&\\0&&A_m\end{pmatrix}, \]

其中对角线上的每个 \(A_k\) 都是方阵。证明:\(\det A=(\det A_1)\cdots(\det A_m)\)。(原书练习 9C.5)

解答

对块数 \(m\) 归纳;\(m=1\) 平凡。设 \(A_1\) 的阶为 \(n_1\),总阶为 \(n\)。用 9.46 的置换和式。对第 \(k\le n_1\) 列(第一块的列),由分块上三角结构,行号大于 \(n_1\) 的元素全为零,故置换 \((j_1,\dots,j_n)\) 若有非零贡献,必满足 \(j_k\le n_1\) 对所有 \(k\le n_1\);又 \(\sigma=(j_1,\dots,j_n)\) 是单射,这迫使 \(\{j_1,\dots,j_{n_1}\}=\{1,\dots,n_1\}\)。于是 \(\sigma\) 分解为 \(\sigma_1\in\operatorname{perm} n_1\) 与余下指标集上的置换 \(\sigma_2\),且没有跨块逆序对:当 \(k\le n_1\lt\ell\) 时 \(\sigma(k)\le n_1\lt\sigma(\ell)\)。逆序数按块相加,故 \(\operatorname{sign}\sigma=\operatorname{sign}(\sigma_1)\operatorname{sign}(\sigma_2)\)(把 \(\sigma_2\) 平移重标为 \(\operatorname{perm}(n-n_1)\) 的元素不改变逆序数)。乘积 \(\prod_k A_{\sigma(k),k}\) 也按块分解,于是和式因式分解:

\[ \det A=\Bigl(\sum_{\sigma_1\in\operatorname{perm} n_1}\operatorname{sign}(\sigma_1)\prod_{k=1}^{n_1}(A_1)_{\sigma_1(k),k}\Bigr)\cdot\det A', \]

其中 \(A'\) 是去掉第一块行、列后的 \(m-1\) 块分块上三角矩阵。前者即 \(\det A_1\),后者由归纳假设等于 \((\det A_2)\cdots(\det A_m)\)。例 6 的 \(M\) 是 \(A_1=\begin{pmatrix}2&1\\1&3\end{pmatrix}\)、\(A_2=(4)\) 的特例:\(\det M=5\cdot4=20\)。

练习 9.C-4

设 \(A=\bigl(\,v_1\ \cdots\ v_n\,\bigr)\) 是 \(n\times n\) 矩阵,\(v_k\) 为第 \(k\) 列。证明:对每个 \((m_1,\dots,m_n)\in\operatorname{perm} n\),

\[ \det\bigl(\,v_{m_1}\ \cdots\ v_{m_n}\,\bigr)=\bigl(\operatorname{sign}(m_1,\dots,m_n)\bigr)\det A. \]

(原书练习 9C.6)

解答

记 \(D(u_1,\dots,u_n)=\det\bigl(\,u_1\ \cdots\ u_n\,\bigr)\);由 9.45,\(D\) 是 \(\mathbf{F}^{n}\) 上的交错 \(n\)-线性型。于是 \(\det\bigl(\,v_{m_1}\ \cdots\ v_{m_n}\,\bigr)=D(v_{m_1},\dots,v_{m_n})\)。对列表 \(v_1,\dots,v_n\) 与置换 \((m_1,\dots,m_n)\) 直接套用 9.B 的定理 9.35:

\[ D(v_{m_1},\dots,v_{m_n})=\bigl(\operatorname{sign}(m_1,\dots,m_n)\bigr)\,D(v_1,\dots,v_n)=\bigl(\operatorname{sign}(m_1,\dots,m_n)\bigr)\det A. \]

这就是 9.57(b)「交换两列变号」的完整版本:任意重排各列,行列式乘上该置换的符号。

练习 9.C-5

设 \(T\in\mathcal{L}(V)\) 是没有特征值的算子(由此可知 \(\mathbf{F}=\mathbf{R}\),且 \(\dim V\) 为偶数)。证明:\(\det T\gt 0\)。(原书练习 9C.8)

解答

取 \(V\) 的基,令 \(A=\mathcal{M}(T)\),并令 \(S\) 是 \(\mathbf{C}^{n}\) 上关于标准基矩阵为 \(A\) 的算子(\(n=\dim V\))。多项式 \(q(z)=\det(zI-A)\) 的系数全为实数,因此其非实复根按共轭成对出现且重数相同:若 \(q(\lambda)=0\),取共轭得 \(q(\overline{\lambda})=\overline{q(\lambda)}=0\) (9.46 的和式中取共轭即逐项取共轭),重数由泰勒展开的共轭不变性给出。

\(T\) 没有特征值 \(\Longleftrightarrow\) 对每个 \(\lambda\in\mathbf{R}\),\(\det(\lambda I-A)\ne 0\) (9.51),即 \(q\) 没有实根。于是 \(q\) 的根全是非实复数,成对 \(\lambda,\overline{\lambda}\),设为 \(\lambda_1,\overline{\lambda_1},\dots,\lambda_r,\overline{\lambda_r}\) (\(n=2r\))。\(S\) 的特征值恰是 \(q\) 的根 (9.51),故由 9.55

\[ \det T=\det A=\det S=\lambda_1\overline{\lambda_1}\cdots\lambda_r\overline{\lambda_r}=|\lambda_1|^{2}\cdots|\lambda_r|^{2}\gt 0, \]

中间的第一个等号用 9.53,第二个用 9.43。几何直觉:没有特征方向的实算子(如平面旋转)不可能翻转定向,只能保持定向。

练习 9.C-6

设 \(a,b,c\) 为正数。利用 9.61 求椭球

\[ \Bigl\{(x,y,z)\in\mathbf{R}^{3}:\ \tfrac{x^{2}}{a^{2}}+\tfrac{y^{2}}{b^{2}}+\tfrac{z^{2}}{c^{2}}\lt 1\Bigr\} \]

的体积。(原书练习 9C.17)

解答

取 \(\Omega\) 为单位开球 \(\{(u,v,w):u^{2}+v^{2}+w^{2}\lt1\}\)(体积 \(\tfrac{4}{3}\pi\),微积分标准结果),取 \(T\in\mathcal{L}(\mathbf{R}^{3})\) 为 \(T(u,v,w)=(au,bv,cw)\),即对角矩阵 \(\operatorname{diag}(a,b,c)\)。则 \(T(\Omega)\) 恰为题中椭球:\((x,y,z)=T(u,v,w)\) 时 \(\tfrac{x^{2}}{a^{2}}+\tfrac{y^{2}}{b^{2}}+\tfrac{z^{2}}{c^{2}}=u^{2}+v^{2}+w^{2}\lt1\),反之亦然。

\(\det T=abc\) (例 3),由 9.61,

\[ \operatorname{volume} T(\Omega)=|\det T|\cdot\operatorname{volume}\Omega=abc\cdot\frac{4}{3}\pi=\frac{4}{3}\pi abc. \]

当 \(a=b=c=r\) 时退化为半径 \(r\) 的球体积公式,作检验无误。

注(与原书对照)。原书 9.C「Determinants」分两个小节:「Defining the Determinant」(9.40–9.48,含算子与矩阵的定义、按列交错多重线性性、Leibniz 公式与上三角公式)与「Properties of Determinants」(9.49–9.67,含乘法公式、可逆性、特征值、相似不变性、转置/对偶/伴随、初等变换、酉与正算子、奇异值、体积、特征多项式、Cayley–Hamilton、迹与行列式、Hadamard、Vandermonde),其间 9.53 的证明里有一个展示式编号 9.54;练习 9C 共 21 题,节末附 Klein 的引语。本页编号与内容顺序与原书一一对应;唯本页把原书散见的评述(高斯消元、体积注记、「为何不用行列式求特征值」)整理为注记,并补充了 9.57(a)(b)(c) 的证明(原书留给读者)与图 1–3 三幅插图。原书 9.D「Tensor Products」自 9.68 起。