如无特别声明,本节恒设 \(V\) 是非零有限维向量空间且 \(T\in\mathcal{L}(V)\);讨论分解时设 \(\mathbf{F}=\mathbf{C}\)。上一节 (8.A) 已经说明:复向量空间上的算子未必有足够多的特征向量 (eigenvector) 构成基,但一定有足够多的广义特征向量 (generalized eigenvector) 构成基。本节把这一事实提炼为整个空间的结构定理,并展开它的代数与矩阵推论。
广义特征空间
定义 8.19(广义特征空间, generalized eigenspace). 设 \(T\in\mathcal{L}(V)\),\(\lambda\in\mathbf{F}\)。\(\lambda\) 对应的广义特征空间定义为 \[ G(\lambda,T)=\{\,v\in V:\ (T-\lambda I)^{k}v=0 \text{ 对某个正整数 } k\,\}. \] 即 \(G(\lambda,T)\) 是 \(\lambda\) 对应的所有广义特征向量连同 \(0\) 向量一起组成的集合。
由于特征向量都是广义特征向量(取 \(k=1\)),故对一切 \(\lambda\in\mathbf{F}\) 有 \(E(\lambda,T)\subseteq G(\lambda,T)\),其中 \(E(\lambda,T)=\operatorname{null}(T-\lambda I)\) 是特征空间 (eigenspace)。下面的定理把"对某个 \(k\)"统一成"取 \(k=\dim V\) 即可",从而立即看出 \(G(\lambda,T)\) 是子空间。
定理 8.20(广义特征空间的刻画). 设 \(T\in\mathcal{L}(V)\),\(\lambda\in\mathbf{F}\),则 \[ G(\lambda,T)=\operatorname{null}(T-\lambda I)^{\dim V}. \]
证明.记 \(n=\dim V\)。若 \(v\in\operatorname{null}(T-\lambda I)^{n}\),按定义 \(v\in G(\lambda,T)\)。反过来,设 \(v\in G(\lambda,T)\),则存在正整数 \(k\) 使 \(v\in\operatorname{null}(T-\lambda I)^{k}\)。对算子 \(T-\lambda I\) 用 8.A 中的 8.1 与 8.3(零空间链递增且在 \(\dim V\) 步后停止增长),得 \(v\in\operatorname{null}(T-\lambda I)^{n}\)。\(\blacksquare\)
由 8.20,\(G(\lambda,T)\) 是线性映射的零空间,故是 \(V\) 的子空间;而且若 \(\lambda\) 不是 \(T\) 的特征值 (eigenvalue),则 \(T-\lambda I\) 可逆,从而 \(G(\lambda,T)=\{0\}\)。因此广义特征空间只对特征值非平凡。
例 1(3 维算子的广义特征空间,对应原书 8.21). 定义 \(T\in\mathcal{L}(\mathbf{C}^{3})\): \[ T(z_1,z_2,z_3)=(4z_2,\,0,\,5z_3). \] \(T\) 在标准基下的矩阵是上三角矩阵 (upper-triangular matrix) \(\begin{pmatrix}0&4&0\\0&0&0\\0&0&5\end{pmatrix}\),对角元为 \(0,0,5\),故特征值为 \(0\) 与 \(5\)。逐次计算幂: \[ T^{3}(z_1,z_2,z_3)=(0,0,125z_3),\qquad (T-5I)^{3}(z_1,z_2,z_3)=(-125z_1+300z_2,\,-125z_2,\,0). \] 于是 \[ G(0,T)=\operatorname{null}T^{3}=\{(z_1,z_2,0)\},\qquad G(5,T)=\operatorname{null}(T-5I)^{3}=\{(0,0,z_3)\}, \] 且 \(\mathbf{C}^{3}=G(0,T)\oplus G(5,T)\)。注意 \(E(0,T)=\operatorname{null}T=\{(z_1,0,0)\}\) 只有一维:特征向量不够用,广义特征向量恰好补齐。
广义特征空间分解定理
例 1 中整个空间分解为两个广义特征空间的直和并非偶然。下面这个定理是本节的核心,也是全书最深刻的结构定理之一。证明要用到上一节的两个结果,为使论证自足,先将其(连同编号)复述于此,并给出证明概要或完整证明。
引理 A(广义特征向量构成基,原书 8.9). 设 \(\mathbf{F}=\mathbf{C}\),\(T\in\mathcal{L}(V)\)。则 \(V\) 有由 \(T\) 的广义特征向量构成的基。
证明.对 \(n=\dim V\) 归纳。\(n=1\) 时任意非零向量都是特征向量(此步用到 \(\mathbf{F}=\mathbf{C}\) 保证特征值存在)。设 \(n>1\) 且结论对更小维数成立。取 \(T\) 的一个特征值 \(\lambda\),对 \(T-\lambda I\) 使用 8.A 的 8.4: \[ V=\operatorname{null}(T-\lambda I)^{n}\oplus\operatorname{range}(T-\lambda I)^{n}. \] 若 \(\operatorname{null}(T-\lambda I)^{n}=V\),则 \(V\) 中每个非零向量都是对应 \(\lambda\) 的广义特征向量,任取一组基即可。否则由 \(\lambda\) 是特征值知 \(\operatorname{null}(T-\lambda I)^{n}\neq\{0\}\),故 \[ 0<\dim\operatorname{range}(T-\lambda I)^{n}<n. \] 又 \(\operatorname{range}(T-\lambda I)^{n}\) 在 \(T\) 下不变(第 5 章 5.18:\(p(T)\) 的零空间与值域都在 \(T\) 下不变),把归纳假设用于 \(T\) 在这个真不变子空间上的限制,得到该子空间的一组由广义特征向量构成的基;它们当然是 \(T\) 的广义特征向量。把它与 \(\operatorname{null}(T-\lambda I)^{n}\) 的任意一组基(其中每个向量都是对应 \(\lambda\) 的广义特征向量)合并,即得 \(V\) 的由广义特征向量构成的基。\(\blacksquare\)
引理 B(对应互异特征值的广义特征向量线性无关,原书 8.12). 设 \(T\in\mathcal{L}(V)\),则 \(T\) 的对应于互异特征值的任意一组广义特征向量线性无关 (linearly independent)。
证明.反证,取最小的 \(m\ge 2\),使得存在对应互异特征值 \(\lambda_1,\dots,\lambda_m\) 的线性相关广义特征向量组 \(v_1,\dots,v_m\);由 \(m\) 的最小性,可设 \[ a_1v_1+\cdots+a_mv_m=0,\qquad a_1,\dots,a_m \text{ 全不为 } 0. \] 记 \(n=\dim V\),对上式两边作用 \((T-\lambda_m I)^{n}\),得 \[ a_1w_1+\cdots+a_{m-1}w_{m-1}=0,\qquad w_k:=(T-\lambda_m I)^{n}v_k. \] 对每个 \(k<m\):若 \(w_k=0\),则 \(v_k\) 同时是对应 \(\lambda_k\) 与 \(\lambda_m\) 的广义特征向量,与 8.A 的 8.11(一个广义特征向量只对应一个特征值)矛盾,故 \(w_k\ne 0\);又因 \[ (T-\lambda_k I)^{n}w_k=(T-\lambda_m I)^{n}(T-\lambda_k I)^{n}v_k=0, \] 故 \(w_k\) 是对应 \(\lambda_k\) 的广义特征向量。于是 \(w_1,\dots,w_{m-1}\) 是 \(m-1\) 个对应互异特征值的线性相关广义特征向量,与 \(m\) 的最小性矛盾。\(\blacksquare\)
定理 8.22(广义特征空间分解, generalized eigenspace decomposition). 设 \(\mathbf{F}=\mathbf{C}\),\(T\in\mathcal{L}(V)\),\(\lambda_1,\dots,\lambda_m\) 是 \(T\) 的互异特征值。则:
(a) 每个 \(G(\lambda_k,T)\) 在 \(T\) 下不变 (invariant);
(b) \((T-\lambda_k I)\big|_{G(\lambda_k,T)}\) 是幂零算子 (nilpotent operator),\(k=1,\dots,m\);
(c) \(\displaystyle V=G(\lambda_1,T)\oplus\cdots\oplus G(\lambda_m,T)\)。
证明.(a) 由 8.20,\(G(\lambda_k,T)=\operatorname{null}(T-\lambda_k I)^{\dim V}\),而多项式作用于 \(T\) 的零空间在 \(T\) 下不变(5.18,取 \(p(z)=(z-\lambda_k)^{\dim V}\)),故 \(G(\lambda_k,T)\) 不变。
(b) 若 \(v\in G(\lambda_k,T)\),则由 8.20 有 \((T-\lambda_k I)^{\dim V}v=0\),即 \(\bigl((T-\lambda_k I)\big|_{G(\lambda_k,T)}\bigr)^{\dim V}=0\),故该限制是幂零算子。
(c) 先证直和。设 \(v_1+\cdots+v_m=0\),其中 \(v_k\in G(\lambda_k,T)\)。把诸 \(v_k\) 中非零者取出:它们是对应互异特征值的广义特征向量,由引理 B 线性无关,而其和为零,故必全为零,即每个 \(v_k=0\)。由第 1 章直和判则 (1.45),\(G(\lambda_1,T)+\cdots+G(\lambda_m,T)\) 是直和。再证张成:由引理 A,\(V\) 有由广义特征向量构成的基,而每个广义特征向量落在某一个 \(G(\lambda_k,T)\) 中,故这些子空间之和等于 \(V\)。\(\blacksquare\)
值得强调的是结论 (a)(b) 的含义:\(T\) 在每个广义特征空间上是一个"纯伸缩" \(\lambda_k I\) 加上一个幂零算子 (nilpotent operator),而幂零部分是我们完全了解的对象(上一节 8.16–8.18)。这样,"理解任意算子 \(T\)"就被化归为"理解有限个 \(\lambda I+\) 幂零型的小算子"——这正是本节标题的允诺。
特征值的重数
分解式 8.22(c) 中出现的维数十分重要,值得单独命名。
定义 8.23(重数, multiplicity). 设 \(T\in\mathcal{L}(V)\),\(\lambda\) 是 \(T\) 的特征值。\(\lambda\) 的重数定义为对应广义特征空间的维数 \[ d=\dim G(\lambda,T)=\dim\operatorname{null}(T-\lambda I)^{\dim V}. \] (第二个等号由 8.20 得到。)
由于 \(E(\lambda,T)\subseteq G(\lambda,T)\) 且 \(E(\lambda,T)\neq\{0\}\),特征值的重数至少是 \(1\),且总满足 \[ 1\ \le\ \dim E(\lambda,T)\ \le\ \dim G(\lambda,T)=d. \]
例 2(求重数,对应原书 8.24). 定义 \(T\in\mathcal{L}(\mathbf{C}^{3})\): \[ T(z_1,z_2,z_3)=(6z_1+3z_2+4z_3,\ 6z_2+2z_3,\ 7z_3),\qquad \mathcal{M}(T)=\begin{pmatrix}6&3&4\\0&6&2\\0&0&7\end{pmatrix}. \] 矩阵上三角,对角元 \(6,6,7\),故特征值为 \(6\) 与 \(7\)。计算幂: \[ (T-6I)(z)=(3z_2+4z_3,\ 2z_3,\ z_3),\qquad (T-6I)^{2}(z)=(10z_3,\ 2z_3,\ z_3), \] 且 \((T-6I)^{3}=(T-6I)^{2}\)(把上式再代入即得),故 \[ G(6,T)=\operatorname{null}(T-6I)^{3}=\{(z_1,z_2,0)\}=\operatorname{span}\bigl((1,0,0),(0,1,0)\bigr), \] 所以特征值 \(6\) 的重数为 \(2\)。类似地, \[ (T-7I)^{2}(z)=(z_1-6z_2+2z_3,\ z_2-2z_3,\ 0),\qquad (T-7I)^{3}(z)=(-z_1+9z_2-8z_3,\ -z_2+2z_3,\ 0), \] 解 \((T-7I)^{3}z=0\) 得 \(z_2=2z_3,\ z_1=10z_3\),故 \[ G(7,T)=\{(10t,\,2t,\,t)\}=\operatorname{span}\bigl((10,2,1)\bigr), \] 特征值 \(7\) 的重数为 \(1\)。于是 \[ \mathbf{C}^{3}=G(6,T)\oplus G(7,T),\qquad \underbrace{2}_{d_6}+\underbrace{1}_{d_7}=3=\dim\mathbf{C}^{3}, \] 并且 \((1,0,0),(0,1,0),(10,2,1)\) 是由广义特征向量构成的基。注意 \(E(6,T)=\operatorname{null}(T-6I)=\{(z_1,0,0)\}\) 只有一维,而 \(E(7,T)=\operatorname{span}((10,2,1))\)(可直接验证 \(T(10,2,1)=(70,14,7)=7(10,2,1)\)),特征空间维数之和 \(1+1=2<3\),故该算子不存在由特征向量构成的基。
定理 8.25(重数之和等于 dim V). 设 \(\mathbf{F}=\mathbf{C}\),\(T\in\mathcal{L}(V)\)。则 \(T\) 的所有特征值的重数之和等于 \(\dim V\)。
证明.由广义特征空间分解 8.22(c) 与直和的维数公式(3.94): \[ \dim V=\dim\bigl(G(\lambda_1,T)\oplus\cdots\oplus G(\lambda_m,T)\bigr)=\dim G(\lambda_1,T)+\cdots+\dim G(\lambda_m,T), \] 右边正是各特征值重数之和。\(\blacksquare\)
注(术语对照).许多教材使用"代数重数 (algebraic multiplicity)"与"几何重数 (geometric multiplicity)"的说法。用这里的记号:代数重数 \(=\dim G(\lambda,T)=\dim\operatorname{null}(T-\lambda I)^{\dim V}\),几何重数 \(=\dim E(\lambda,T)=\dim\operatorname{null}(T-\lambda I)\)。本书不借助行列式定义重数,比传统定义更直接;两者的等价性将由第 9 章的 9.62 给出。
特征多项式与凯莱–哈密顿定理
重数自然地导出一个多项式。
定义 8.26(特征多项式, characteristic polynomial). 设 \(\mathbf{F}=\mathbf{C}\),\(T\in\mathcal{L}(V)\),其互异特征值为 \(\lambda_1,\dots,\lambda_m\),重数依次为 \(d_1,\dots,d_m\)。称首一多项式 \[ q(z)=(z-\lambda_1)^{d_1}\cdots(z-\lambda_m)^{d_m} \] 为 \(T\) 的特征多项式。
例 3(特征多项式,对应原书 8.27).例 2 中算子的特征值为 \(6\)(重数 2)与 \(7\)(重数 1),故其特征多项式为 \(q(z)=(z-6)^{2}(z-7)\)。同理,例 1 中算子的特征多项式为 \(z^{2}(z-5)\)。
定理 8.28(特征多项式的次数与零点). 设 \(\mathbf{F}=\mathbf{C}\),\(T\in\mathcal{L}(V)\),则:
(a) \(T\) 的特征多项式的次数为 \(\dim V\);
(b) \(T\) 的特征多项式的零点恰为 \(T\) 的特征值,且 \(\lambda_j\) 作为零点的重数恰为 \(d_j\)。
证明.(a) 次数 \(=d_1+\cdots+d_m=\dim V\)(由 8.25)。(b) 每个因子 \((z-\lambda_j)^{d_j}\) 中 \(d_j\ge 1\),故每个特征值都是零点;反之,由因式分解形式,零点只能是 \(\lambda_1,\dots,\lambda_m\) 之一。由于各因子是一次多项式的互异幂,零点重数恰为对应指数 \(d_j\)。\(\blacksquare\)
多数教材用行列式定义特征多项式;本书的路线恰好相反——先用广义特征空间定义它,再在第 9 章证明两种定义一致(见本节末注记与 9.62)。这条路线立刻给出凯莱–哈密顿定理 (Cayley–Hamilton theorem) 一个非常简短的证明:
定理 8.29(凯莱–哈密顿定理). 设 \(\mathbf{F}=\mathbf{C}\),\(T\in\mathcal{L}(V)\),\(q\) 是 \(T\) 的特征多项式,则 \[ q(T)=0. \]
证明.设互异特征值为 \(\lambda_1,\dots,\lambda_m\),\(d_k=\dim G(\lambda_k,T)\)。由 8.22(b),\((T-\lambda_k I)\big|_{G(\lambda_k,T)}\) 是 \(G(\lambda_k,T)\)(维数为 \(d_k\))上的幂零算子,故由 8.A 的 8.16(幂零算子的 \(\dim\) 次幂为零)得 \[ (T-\lambda_k I)^{d_k}\Big|_{G(\lambda_k,T)}=0,\qquad k=1,\dots,m. \] 诸因子 \((T-\lambda_j I)^{d_j}\) 两两可交换(它们都是 \(T\) 的多项式),故对固定的 \(k\),可把因子 \((T-\lambda_k I)^{d_k}\) 移到最右端:对任意 \(v\in G(\lambda_k,T)\), \[ q(T)v=\Bigl[\prod_{j\ne k}(T-\lambda_j I)^{d_j}\Bigr]\,(T-\lambda_k I)^{d_k}v=0. \] 由 8.22(c),每个 \(v\in V\) 都可写成各 \(G(\lambda_k,T)\) 中向量之和,于是 \(q(T)v=0\) 对一切 \(v\) 成立,即 \(q(T)=0\)。\(\blacksquare\)
作为例证,在例 2 中可直接验证 \((T-6I)^{2}(T-7I)=0\):前面已算出 \((T-6I)^{2}(z)=z_3(10,2,1)\),而 \((10,2,1)\) 恰是对应 \(7\) 的特征向量,故 \((T-7I)\) 把它杀死。此外,例 2 中 \((T-6I)(T-7I)(z)=(-3z_2+6z_3,0,0)\neq 0\),故该算子的极小多项式 (minimal polynomial) 是 \((z-6)^{2}(z-7)\),与特征多项式相同。
定理 8.30(特征多项式是极小多项式的倍式). 设 \(\mathbf{F}=\mathbf{C}\),\(T\in\mathcal{L}(V)\),则 \(T\) 的特征多项式是 \(T\) 的极小多项式的多项式倍。
证明.由 8.29 有 \(q(T)=0\);由第 5 章 5.29(满足 \(s(T)=0\) 的多项式 \(s\) 恰为极小多项式的多项式倍),结论立得。\(\blacksquare\)
推论(特征多项式与极小多项式零点相同).极小多项式的零点都是特征多项式的零点(因前者整除后者);反之特征多项式的零点恰为特征值(8.28(b)),而由第 5 章 5.27(a) 特征值又都是极小多项式的零点。故两者的零点集合完全相同。特别地,若极小多项式次数等于 \(\dim V\)(这几乎是常态),则两个多项式相等。
注(相似不变性).特征多项式是附着于算子 \(T\) 而非某个矩阵的对象:对任意可逆 \(S\in\mathcal{L}(V)\),由 \((S^{-1}TS-\lambda I)^{k}=S^{-1}(T-\lambda I)^{k}S\) 可知 \(S^{-1}\) 把 \(G(\lambda,T)\) 同构地映到 \(G(\lambda,\,S^{-1}TS)\),故相似 (similar) 的算子有相同的特征值与相同的重数,从而有相同的特征多项式(这也是原书本节练习 3)。在第 9 章定义行列式之后,结合 9.62 便得到矩阵语言中的熟知的结论:\(\det(zI-S^{-1}AS)=\det(zI-A)\)。
重数与上三角矩阵的对角元
例 2 中矩阵对角线上 \(6\) 出现两次、\(7\) 出现一次,恰与重数一致。这不是巧合:
定理 8.31(重数 = 对角线上出现的次数). 设 \(\mathbf{F}=\mathbf{C}\),\(T\in\mathcal{L}(V)\),\(v_1,\dots,v_n\) 是 \(V\) 的基且 \(\mathcal{M}(T,(v_1,\dots,v_n))\) 是上三角矩阵。则每个特征值 \(\lambda\) 在该矩阵对角线上出现的次数等于 \(\lambda\) 的重数。
证明.记 \(A=\mathcal{M}(T,(v_1,\dots,v_n))\),其对角元为 \(\lambda_1,\dots,\lambda_n\)。上三角意味着对每个 \(k\), \[ Tv_k=u_k+\lambda_k v_k,\qquad u_k\in\operatorname{span}(v_1,\dots,v_{k-1}). \] 第一步.若 \(\lambda_k\ne 0\),则 \(Tv_k\notin\operatorname{span}(Tv_1,\dots,Tv_{k-1})\)。否则设 \(Tv_k=\sum_{j<k}b_jTv_j\),则 \[ \lambda_kv_k=\sum_{j<k}b_jTv_j-u_k\in\operatorname{span}(v_1,\dots,v_{k-1}) \] (每个 \(Tv_j\in\operatorname{span}(v_1,\dots,v_j)\subseteq\operatorname{span}(v_1,\dots,v_{k-1})\)),与基的线性无关性及 \(\lambda_k\ne 0\) 矛盾。由线性相关引理 (2.19),列表 \(\{Tv_k:\lambda_k\ne 0\}\) 线性无关。
第二步.设 \(d\) 为对角元中 \(0\) 的个数。由第一步,\(\dim\operatorname{range}T\ \ge\ n-d\);结合线性映射基本定理 (3.21) 得 \[ \dim\operatorname{null}T\ \le\ d. \]
第三步.\(T^{n}\) 在同基下的矩阵是 \(A^{n}\),它仍上三角,对角元为 \(\lambda_1^{n},\dots,\lambda_n^{n}\),其中为 \(0\) 的位置与 \(A\) 完全一致,个数仍为 \(d\)。把第二步应用于 \(T^{n}\) 得 \(\dim\operatorname{null}T^{n}\le d\)。
第四步.设特征值 \(\lambda\) 的重数为 \(m_{\lambda}\),在对角线上出现 \(d_{\lambda}\) 次。把第三步中的 \(T\) 换成 \(T-\lambda I\)(其矩阵 \(A-\lambda I\) 上三角,对角元 \(\lambda_k-\lambda\),零的个数恰为 \(d_{\lambda}\)),得 \[ m_{\lambda}=\dim G(\lambda,T)=\dim\operatorname{null}(T-\lambda I)^{n}\ \le\ d_{\lambda}. \] 另一方面,\(\sum_{\lambda}m_{\lambda}=n\)(定理 8.25),而由第 5 章 5.41,上三角矩阵的对角元都是特征值,故 \(\sum_{\lambda}d_{\lambda}=n\)(对角线长为 \(n\))。对所有不等式求和: \[ n=\sum_{\lambda}m_{\lambda}\ \le\ \sum_{\lambda}d_{\lambda}=n, \] 故每项不等式实为等式,即 \(m_{\lambda}=d_{\lambda}\)。\(\blacksquare\)
于是在例 1、例 2 中,仅凭上三角矩阵的对角线就能读出全部重数,进而写出特征多项式;\(G(\lambda,T)\) 的具体演算则给出分解本身。
分块对角矩阵
把矩阵看成由小块拼成,常常有助于理解。下面的定义推广了对角矩阵的概念。
定义 8.35(分块对角矩阵, block diagonal matrix).形如 \[ \begin{pmatrix} A_1 & & 0\\ & \ddots & \\ 0 & & A_m \end{pmatrix} \] 的方阵称为分块对角矩阵,其中 \(A_1,\dots,A_m\) 是沿对角线排列的方阵,其余元素全为 \(0\)。当每个 \(A_k\) 都是 \(1\times 1\) 矩阵时,它就是对角矩阵。
例 4(分块对角矩阵,对应原书 8.36). 定义 \(T\in\mathcal{L}(\mathbf{C}^{5})\): \[ T(z_1,\dots,z_5)=(4z_1,\ 2z_2-3z_3,\ 2z_3,\ z_4+7z_5,\ z_5). \] 其标准基下的矩阵为 \[ \begin{pmatrix} 4&0&0&0&0\\ 0&2&-3&0&0\\ 0&0&2&0&0\\ 0&0&0&1&7\\ 0&0&0&0&1 \end{pmatrix} =\begin{pmatrix} A_1 & & 0\\ & A_2 & \\ 0 & & A_3 \end{pmatrix},\quad A_1=(4),\ A_2=\begin{pmatrix}2&-3\\0&2\end{pmatrix},\ A_3=\begin{pmatrix}1&7\\0&1\end{pmatrix}. \] 每个 \(A_k\) 都是对角元全相等的上三角块:特征值 \(4,2,1\) 的重数分别为 \(1,2,2\)。
定理 8.37(带上三角块的分块对角矩阵). 设 \(\mathbf{F}=\mathbf{C}\),\(T\in\mathcal{L}(V)\),互异特征值 \(\lambda_1,\dots,\lambda_m\) 的重数为 \(d_1,\dots,d_m\)。则 \(V\) 有基使 \(T\) 的矩阵为分块对角 \[ \begin{pmatrix} A_1 & & 0\\ & \ddots & \\ 0 & & A_m \end{pmatrix},\qquad A_k=\begin{pmatrix} \lambda_k & & *\\ & \ddots & \\ 0 & & \lambda_k \end{pmatrix}, \] 其中 \(A_k\) 是 \(d_k\times d_k\) 上三角矩阵,对角线全为 \(\lambda_k\),对角线下方全为 \(0\)。
证明.由 8.22(b),每个 \(N_k:=(T-\lambda_k I)\big|_{G(\lambda_k,T)}\) 是幂零算子,且 \(\dim G(\lambda_k,T)=d_k\)。由 8.A 的 8.18(c),可取 \(G(\lambda_k,T)\) 的基,使 \(N_k\) 在该基下的矩阵对角线及其下方全为 \(0\)。在该基下, \[ T\big|_{G(\lambda_k,T)}=N_k+\lambda_k I\big|_{G(\lambda_k,T)} \] 的矩阵为:对角线全为 \(\lambda_k\),对角线下方全为 \(0\),上方为若干 \(*\)——即所需的 \(A_k\)。由 8.22(c),把这些基按顺序拼接即得 \(V\) 的基;因每个 \(G(\lambda_k,T)\) 在 \(T\) 下不变,\(T\) 把每个基向量送回它所属的子空间,故 \(T\) 的矩阵为分块对角,且每块恰为上述 \(A_k\)。\(\blacksquare\)
例 5(分块对角化的完整演算,对应原书 8.38).继续例 2。取 \(G(6,T)\) 的基 \((1,0,0),(0,1,0)\) 与 \(G(7,T)\) 的基 \((10,2,1)\)。逐项计算: \[ T(1,0,0)=(6,0,0)=6(1,0,0),\quad T(0,1,0)=(3,6,0)=3(1,0,0)+6(0,1,0),\quad T(10,2,1)=7(10,2,1). \] 故在广义特征向量基 \((1,0,0),(0,1,0),(10,2,1)\) 下, \[ \mathcal{M}(T)=\begin{pmatrix} 6&3&0\\ 0&6&0\\ 0&0&7 \end{pmatrix} =\begin{pmatrix} \begin{matrix}6&3\\0&6\end{matrix} & 0\\ 0 & (7) \end{pmatrix}, \] 正是 8.37 承诺的分块对角形式:\(2\times 2\) 块 \(=6I+\begin{pmatrix}0&3\\0&0\end{pmatrix}\)(幂零部分平方为零),\(1\times 1\) 块 \(=(7)\)。原来的矩阵 \(\begin{pmatrix}6&3&4\\0&6&2\\0&0&7\end{pmatrix}\) 虽也是上三角,但右上角的 \(4,2\) 把两个特征值"搅"在一起;换基后这些耦合被清除。
例 6(4×4 矩阵的完整分解演算).定义 \(T\in\mathcal{L}(\mathbf{C}^{4})\): \[ T(z_1,z_2,z_3,z_4)=(6z_1+4z_2+5z_4,\ 6z_2,\ 7z_3+z_4,\ 7z_4),\qquad \mathcal{M}(T)=\begin{pmatrix}6&4&0&5\\0&6&0&0\\0&0&7&1\\0&0&0&7\end{pmatrix}. \] 矩阵上三角,对角元 \(6,6,7,7\);由 8.31,特征值 \(6\) 与 \(7\) 的重数均为 \(2\)。用幂零演算验证并求出各广义特征空间: \[ (T-6I)^{2}(z)=(5z_4,\ 0,\ z_3+2z_4,\ z_4),\qquad (T-6I)^{4}(z)=(5z_4,\ 0,\ z_3+4z_4,\ z_4), \] 故 \(G(6,T)=\operatorname{null}(T-6I)^{4}=\{(z_1,z_2,0,0)\}\),维数 \(2\);而 \[ (T-7I)^{2}(z)=(z_1-8z_2-5z_4,\ z_2,\ 0,\ 0),\qquad (T-7I)^{4}(z)=(z_1-16z_2-5z_4,\ z_2,\ 0,\ 0), \] 解 \((T-7I)^{4}z=0\) 得 \(z_2=0,\ z_1=5z_4\),故 \(G(7,T)=\{(5t,0,z_3,t)\}=\operatorname{span}\bigl((5,0,0,1),(0,0,1,0)\bigr)\),维数 \(2\)。于是 \[ \mathbf{C}^{4}=G(6,T)\oplus G(7,T),\qquad 2+2=4, \] 特征多项式为 \(q(z)=(z-6)^{2}(z-7)^{2}\)。取基 \(e_1,e_2\in G(6,T)\) 与 \(v_3=(5,0,0,1),v_4=(0,0,1,0)\in G(7,T)\): \[ T(e_1)=6e_1,\quad T(e_2)=4e_1+6e_2,\quad T(v_3)=7v_3+v_4,\quad T(v_4)=7v_4, \] 故在基 \((e_1,e_2,v_3,v_4)\) 下 \[ \mathcal{M}(T)=\begin{pmatrix} 6&4&0&0\\ 0&6&0&0\\ 0&0&7&1\\ 0&0&0&7 \end{pmatrix} =\begin{pmatrix} \begin{matrix}6&4\\0&6\end{matrix} & 0\\ 0 & \begin{matrix}7&1\\0&7\end{matrix} \end{pmatrix}. \] 原矩阵中连接两个特征值的元素 \(5\)(第 1 行第 4 列)在换基后消失。此例中两个特征值的几何重数都是 1(\(E(6,T)=\operatorname{span}(e_1)\),\(E(7,T)=\operatorname{span}(v_4)\)),严格小于重数 2,故 \(T\) 不可对角化;其极小多项式为 \((z-6)^{2}(z-7)^{2}\),与特征多项式一致。
例 7(与可对角化情形对比).把例 2 的算子换成 \[ D(z_1,z_2,z_3)=(6z_1,\ 6z_2,\ 7z_3), \] 则 \((D-6I)^{k}(z)=(0,0,z_3)\) 对一切 \(k\ge 1\) 成立,故 \(G(6,D)=E(6,D)=\{(z_1,z_2,0)\}\);同理 \(G(7,D)=E(7,D)=\{(0,0,z_3)\}\)。两个算子的特征多项式同为 \((z-6)^{2}(z-7)\),但例 2 的极小多项式是 \((z-6)^{2}(z-7)\),而 \(D\) 的是 \((z-6)(z-7)\),且 \(D\) 的广义特征空间分解就是特征空间分解(第 5 章 5.55/5.62 意义下的可对角化分解)。一般地,设 \(\lambda_1,\dots,\lambda_m\) 是 \(T\) 的全部互异特征值,则 \[ T \text{ 可对角化}\iff G(\lambda_j,T)=E(\lambda_j,T)\ (j=1,\dots,m)\iff \dim E(\lambda_j,T)=d_j\ (j=1,\dots,m), \] 因为此时各特征空间的维数之和为 \(\sum d_j=\dim V\),恰好构成 5.55(d) 的判据。自伴算子与正规算子(第 7 章谱定理)正是这种理想情形的代表。
于是,"几乎对角化"至此兑现:任意复算子都能化到分块对角形,离对角矩阵只差每块内部的幂零余项;而幂零部分何时消失,正是可对角化的判据。
方法注记与展望
注 1(不借行列式定义特征多项式).本书的特色之一是:特征多项式、重数、乃至凯莱–哈密顿定理都不依赖行列式 (determinant)。大多数教材把 \(\det(zI-A)\) 定义为特征多项式,再从零点入手;这里恰好反过来——先用广义特征空间定义 \(q(z)=(z-\lambda_1)^{d_1}\cdots(z-\lambda_m)^{d_m}\),凯莱–哈密顿定理 \(q(T)=0\) 的证明(8.29)因此只需寥寥数行。行列式在本书中被推迟到第 9 章,届时 9.62 将证明 \(\det(zI-T)=q(z)\),两条路线合流;9.64 还把凯莱–哈密顿定理推广到实向量空间。
注 2(与若尔当标准形的关系).定理 8.37 只把每个块整理成"\(\lambda_k\) 在对角线、\(*\) 在对角线上方"的上三角块;若进一步利用幂零部分的结构(8.A 的 8.18 与链条件),可以把每个块再细化成若尔当块 (Jordan block)——对角线为 \(\lambda_k\)、紧邻对角线上方为 \(1\)、其余为 \(0\)——从而得到若尔当标准形 (Jordan form)。原书把这一细化放在下一节 8.C(平方根、若尔当基与若尔当标准形定理 8.44–8.46),此处从略。
注 3(凯莱–哈密顿定理的位置).按第 4 版的实际编排,凯莱–哈密顿定理 (8.29)、"特征多项式是极小多项式的倍式"(8.30)与"重数等于对角元出现次数"(8.31)都在本节 8.B 之内;8.C 标题为"广义特征空间分解的推论",内容是算子的平方根与若尔当形。读者若参看第 3 版,会发现章节划分不同,请以第 4 版为准。
练习
练习 8.B-1
定义 \(T\in\mathcal{L}(\mathbf{C}^{2})\) 为 \(T(w,z)=(-z,w)\)。求 \(T\) 的各广义特征空间,并验证 \(\mathbf{C}^{2}\) 是它们的直和。
解答/提示由 \(T^{2}=-I\) 得特征值满足 \(\lambda^{2}=-1\),即 \(\lambda=\pm i\)(在 \(\mathbf{R}\) 上则无特征值)。解 \(T(w,z)=i(w,z)\) 得 \(E(i,T)=G(i,T)=\operatorname{span}((1,-i))\);解 \(T(w,z)=-i(w,z)\) 得 \(E(-i,T)=G(-i,T)=\operatorname{span}((1,i))\)。两者重数各为 \(1\),和为 \(2=\dim\mathbf{C}^{2}\),且 \((1,-i),(1,i)\) 线性无关,故 \(\mathbf{C}^{2}=G(i,T)\oplus G(-i,T)\),特征多项式为 \((z-i)(z+i)=z^{2}+1\)。
练习 8.B-2
设 \(T\in\mathcal{L}(V)\) 可逆,\(\lambda\in\mathbf{F}\),\(\lambda\ne 0\)。证明:\(G(\lambda,T)=G(\lambda^{-1},T^{-1})\)。
解答/提示注意恒等式 \(T^{-1}(T-\lambda I)=(\lambda^{-1}I-T^{-1})\lambda\cdot(-\lambda^{-1})\) 的精确形式:\((T^{-1}-\lambda^{-1}I)=-\lambda^{-1}T^{-1}(T-\lambda I)\)。于是 \[ (T^{-1}-\lambda^{-1}I)^{k}=(-\lambda^{-1})^{k}\,T^{-k}(T-\lambda I)^{k}, \] 故对任意 \(k\ge 1\),\((T-\lambda I)^{k}v=0\iff (T^{-1}-\lambda^{-1}I)^{k}v=0\)(因 \(T^{-k}\) 可逆)。取 \(k\) 遍历正整数,即得两集合相等。
练习 8.B-3
设 \(T\in\mathcal{L}(V)\),\(S\in\mathcal{L}(V)\) 可逆。证明:\(T\) 与 \(S^{-1}TS\) 有相同的特征值,且对应重数相同;从而两者特征多项式相同。
解答/提示由 \((S^{-1}TS-\lambda I)^{k}=S^{-1}(T-\lambda I)^{k}S\) 与 \(S\) 可逆,得 \[ \operatorname{null}(S^{-1}TS-\lambda I)^{k}=S^{-1}\bigl(\operatorname{null}(T-\lambda I)^{k}\bigr), \] 故取 \(k=\dim V\) 有 \(\dim G(\lambda,S^{-1}TS)=\dim G(\lambda,T)\);又 \(\lambda\) 是特征值 \(\iff T-\lambda I\) 不可逆 \(\iff S^{-1}(T-\lambda I)S\) 不可逆,故特征值集合也相同。于是两组重数逐个相等,特征多项式按定义 (8.26) 相等。
练习 8.B-4
设 \(\lambda\) 是 \(T\in\mathcal{L}(V)\) 的特征值,重数为 \(d\)。证明:\(G(\lambda,T)=\operatorname{null}(T-\lambda I)^{d}\)。当 \(d<\dim V\) 时,这是对 8.20 的改进。
解答/提示"\(\supseteq\)" 显然(零空间链递增且 \(d\le\dim V\))。反之,记 \(N=(T-\lambda I)\big|_{G(\lambda,T)}\),由 8.22(b) 它是 \(G(\lambda,T)\) 上的幂零算子,而 \(\dim G(\lambda,T)=d\),故由 8.16 得 \(N^{d}=0\),即对 \(v\in G(\lambda,T)\) 有 \((T-\lambda I)^{d}v=0\)。于是 \(G(\lambda,T)\subseteq\operatorname{null}(T-\lambda I)^{d}\)。
练习 8.B-5
设 \(T\in\mathcal{L}(\mathbf{C}^{4})\) 为 \(T(z_1,z_2,z_3,z_4)=(0,z_1,z_2,z_3)\)。求 \(T\) 的特征多项式与极小多项式。
解答/提示\(T\) 是幂零算子 (nilpotent):\(T^{4}=0\) 而 \(T^{3}\ne 0\)(例如 \(T^{3}(1,0,0,0)=(0,0,0,1)\))。故 \(0\) 是唯一特征值,且 \(G(0,T)=\mathbf{C}^{4}\),重数为 \(4\),特征多项式为 \(z^{4}\)。极小多项式是整除 \(z^{4}\) 的 \(z\) 的最小幂且须满足 \(p(T)=0\):由 \(T^{3}\ne 0\) 知它也是 \(z^{4}\)。
练习 8.B-6
给出 \(\mathbf{C}^{4}\) 上一个算子的例子,使其特征多项式为 \((z-1)(z-5)^{3}\),极小多项式为 \((z-1)(z-5)^{2}\)。
解答/提示取分块对角构造:\(T(z_1,z_2,z_3,z_4)=(z_1,\ 5z_2+z_3,\ 5z_3,\ 5z_4)\),即块 \((1)\) 与 \(\begin{pmatrix}5&1&0\\0&5&0\\0&0&5\end{pmatrix}\)。特征值为 \(1\)(重数 1)与 \(5\)(重数 3),特征多项式 \((z-1)(z-5)^{3}\)。幂零部分 \(\begin{pmatrix}0&1&0\\0&0&0\\0&0&0\end{pmatrix}\) 平方为零但自身非零,故极小多项式中 \((z-5)\) 的次数为 \(2\),而 \((z-1)\) 的次数为 \(1\),即 \((z-1)(z-5)^{2}\)。
下一节 (8.C) 将利用本节的分解证明:复向量空间上每个可逆算子都有平方根,并把分块进一步细化为若尔当标准形。