对角矩阵、可对角化与特征空间
在 5.C 节中我们已经看到:当 \(\mathbf{F}=\mathbf{C}\) 时,每个算子在适当基下的矩阵都可以化为上三角矩阵。对角矩阵 (diagonal matrix) 是上三角矩阵的极端情形——除对角线外全部为零。
方阵称为对角矩阵,如果其不在对角线上的元素全为 \(0\)。
定义 \(T\in\mathcal{L}(\mathbf{F}^3)\) 为 \(T(x,y,z)=(6x,6y,7z)\)。\(T\) 在标准基下的矩阵为 \(\begin{pmatrix}6&0&0\\0&6&0\\0&0&7\end{pmatrix}\),是对角矩阵;这样的算子称为对角算子。容易看出它的特征值恰为对角元 \(6,7\),特征子空间的几何就是"沿坐标轴各自伸缩":\(T\) 把 \(x\)、\(y\) 两个方向都放大 \(6\) 倍,把 \(z\) 方向放大 \(7\) 倍。
若算子 \(T\) 在某组基 \(v_1,\dots,v_n\) 下的矩阵是对角矩阵 \(\operatorname{diag}(\mu_1,\dots,\mu_n)\),按矩阵的定义这等价于 \(Tv_k=\mu_k v_k\) 对每个 \(k\) 成立;由于基向量非零,每个 \(v_k\) 都是 \(T\) 的特征向量,而诸 \(\mu_k\) 恰为 \(T\) 的特征值(计重数)。于是有下面的基本定义。
算子 \(T\in\mathcal{L}(V)\) 称为可对角化 (diagonalizable) 的,如果存在 \(V\) 的一组基,使得 \(T\) 在该基下的矩阵是对角矩阵。等价地:\(V\) 有由 \(T\) 的特征向量组成的基。
一个算子可能在标准基下完全不像对角的,却在另一组基下对角:
定义 \(T\in\mathcal{L}(\mathbf{R}^2)\) 为 \(T(x,y)=(41x+7y,\,-20x+74y)\)。\(T\) 在标准基下的矩阵 \(\begin{pmatrix}41&7\\-20&74\end{pmatrix}\) 不是对角矩阵。但直接计算给出 \[ T(1,4)=(69,276)=69(1,4),\qquad T(7,5)=(322,230)=46(7,5), \] 即 \((1,4),(7,5)\) 都是特征向量。它们显然线性无关,故构成 \(\mathbf{R}^2\) 的基,而 \(T\) 在这组基下的矩阵是 \(\begin{pmatrix}69&0\\0&46\end{pmatrix}\)。于是 \(T\) 可对角化。这个例子说明:可对角化是算子本身的内在性质,与坐标的选取无关;"找一组使矩阵变对角的基",就是把坐标系掰到特征方向上去。
几何直观. 设二维情形中 \(T\) 可对角化,取特征向量基 \(v_1,v_2\),相应特征值为 \(\lambda_1,\lambda_2\)。任取 \(v=c_1v_1+c_2v_2\),则 \[ Tv=\lambda_1c_1v_1+\lambda_2c_2v_2 . \] 也就是说:\(T\) 的作用是沿特征方向各自独立地伸缩——\(v_1\) 方向的分量被乘以 \(\lambda_1\),\(v_2\) 方向的分量被乘以 \(\lambda_2\),两个方向互不干扰。由特征方向张成的"斜网格"被 \(T\) 映到自身:每条特征直线不变,网格线保持与特征方向平行(见图 1)。反过来,如果平面上存在两个被 \(T\) 独立伸缩的方向,那么 \(T\) 就可对角化。
为方便陈述,我们给"对应于同一个特征值的全部特征向量"一个记号。
设 \(T\in\mathcal{L}(V)\),\(\lambda\in\mathbf{F}\)。\(T\) 相应于 \(\lambda\) 的特征空间 (eigenspace) 定义为 \[ E(\lambda,T)=\operatorname{null}(T-\lambda I)=\{\,v\in V : Tv=\lambda v\,\}. \] 作为线性映射的零空间,\(E(\lambda,T)\) 是 \(V\) 的子空间;它由 \(\lambda\) 的全部特征向量再添上 \(0\) 向量组成。由 5.A 的结果,\(\lambda\) 是 \(T\) 的特征值当且仅当 \(E(\lambda,T)\neq\{0\}\)。把 \(T\) 限制在 \(E(\lambda,T)\) 上,得到的正是"乘以 \(\lambda\)"这个最简单的算子。
设 \(V\) 有基 \(v_1,v_2,v_3\),\(T\) 在此基下的矩阵为 \(\begin{pmatrix}8&0&0\\0&5&0\\0&0&5\end{pmatrix}\)。则 \[ E(8,T)=\operatorname{span}(v_1),\qquad E(5,T)=\operatorname{span}(v_2,v_3). \] 注意特征值 \(5\) 的特征空间是二维的:重根方向上"多出"的特征向量,正是可对角化得以发生的关键。
编号说明. 本页定义与定理的编号沿用原书第四版(5.48–5.65);例子与练习为本页自编(主题分别对应原书的有关例子),以免与原书编号冲突。原书本节还包含 Gershgorin 圆盘定理(5.66–5.67),本页从略,读者可直接参阅原书。
特征空间的直和与可对角化的等价刻画
"不同特征值的特征向量互相独立"是本节反复使用的事实,先把它回忆清楚。
设 \(T\in\mathcal{L}(V)\),\(\lambda_1,\dots,\lambda_m\) 是 \(T\) 的互异特征值,\(v_k\) 是相应于 \(\lambda_k\) 的特征向量。则 \(v_1,\dots,v_m\) 线性无关。
证明(回顾). 反设结论不真,取最小的正整数 \(m\) 使存在这样的线性相关组,则相应组合 \(a_1v_1+\cdots+a_mv_m=0\) 中诸系数全不为零(否则可去掉某项得到更短的相关组)。对两边施加 \(T-\lambda_m I\),利用 \(Tv_k=\lambda_kv_k\) 得 \[ a_1(\lambda_1-\lambda_m)v_1+\cdots+a_{m-1}(\lambda_{m-1}-\lambda_m)v_{m-1}=0, \] 诸特征值互异,故诸系数仍全不为零——这与 \(m\) 的最小性矛盾。\(\blacksquare\)
由此立即得到特征空间之间的"无重叠"性质。
设 \(T\in\mathcal{L}(V)\),\(\lambda_1,\dots,\lambda_m\) 是 \(T\) 的互异特征值。则 \(E(\lambda_1,T)+\cdots+E(\lambda_m,T)\) 是直和 (direct sum)。又若 \(V\) 有限维,则 \[ \dim E(\lambda_1,T)+\cdots+\dim E(\lambda_m,T)\le\dim V. \]
证明. 设 \(v_k\in E(\lambda_k,T)\) 且 \(v_1+\cdots+v_m=0\)。若某个 \(v_k\neq 0\),则其中非零的那些向量是互异特征值对应的特征向量,由上述引理它们线性无关;但去掉零向量后它们以系数全为 \(1\) 相加仍得 \(0\),构成非平凡的相关关系,矛盾。故每个 \(v_k=0\)。由直和的判定准则(子空间之和为直和,当且仅当零向量的分解唯一),该和是直和。当 \(V\) 有限维时,直和的维数等于各子空间维数之和,而它是 \(V\) 的子空间,维数不超过 \(\dim V\),得证。\(\blacksquare\)
现在给出本节的第一个主定理:可对角化的全部等价说法。
设 \(V\) 有限维,\(T\in\mathcal{L}(V)\),\(\lambda_1,\dots,\lambda_m\) 是 \(T\) 的全部互异特征值。则下列条件等价:
- (a) \(T\) 可对角化;
- (b) 存在由 \(T\) 的特征向量组成的列表张成 \(V\)(从而可从中选出由特征向量构成的基);
- (c) \(V=E(\lambda_1,T)\oplus\cdots\oplus E(\lambda_m,T)\);
- (d) \(\dim V=\dim E(\lambda_1,T)+\cdots+\dim E(\lambda_m,T)\)。
证明. (a)⟺(b): \(T\) 在基 \(v_1,\dots,v_n\) 下的矩阵为对角矩阵 \(\operatorname{diag}(\mu_1,\dots,\mu_n)\) 当且仅当 \(Tv_k=\mu_kv_k\) 对每个 \(k\) 成立,即该基由特征向量组成。又,有限维空间中任何张成列表都可删去若干项而得到基,删去的只是特征向量,留下的仍是特征向量,故"特征向量的张成列表"与"特征向量的基"等价。
(b)⟹(c): 设由特征向量组成的列表张成 \(V\)。每个特征向量的特征值必是 \(\lambda_1,\dots,\lambda_m\) 之一(它们是全部互异特征值),故该向量属于某个 \(E(\lambda_k,T)\),从而 \[ V=E(\lambda_1,T)+\cdots+E(\lambda_m,T). \] 再由 5.54,这个和是直和,得 (c)。
(c)⟹(d): 直和的维数等于各直和项维数之和。
(d)⟹(b): 在每个 \(E(\lambda_k,T)\) 中取一组基,把这几组基顺次拼接成列表 \(v_1,\dots,v_n\),其中每个 \(v_j\) 都是 \(T\) 的特征向量,且由 (d) 知列表长度 \(n=\dim V\)。证它线性无关:设 \(a_1v_1+\cdots+a_nv_n=0\)。对每个 \(k\),把属于 \(E(\lambda_k,T)\) 的那些项 \(a_jv_j\) 之和记为 \(u_k\),则 \(u_k\in E(\lambda_k,T)\) 且 \(u_1+\cdots+u_m=0\)。把为零的 \(u_k\) 去掉,剩下的(若还有)是互异特征值对应的特征向量,由上述引理线性无关,而它们相加为零,故剩下的为空,即 \(u_1=\cdots=u_m=0\)。而每个 \(u_k\) 是 \(E(\lambda_k,T)\) 中所取基向量的线性组合,基向量线性无关,故参与组合的诸 \(a_j\) 全为零。于是 \(v_1,\dots,v_n\) 线性无关,且长度等于 \(\dim V\),故它是 \(V\) 的基,即 (b) 成立。证明完毕。\(\blacksquare\)
这组等价条件给出两种最常用的判定方式:数一数各特征空间的维数之和是否凑满 \(\dim V\)(条件 (d));或者直接找一组特征向量凑成基(条件 (b))。下面两个反例说明"凑不满"与"根本没有"这两种失败方式。
定义 \(T\in\mathcal{L}(\mathbf{F}^2)\) 为 \(T(x,y)=(y,0)\),它在标准基下的矩阵是 \(\begin{pmatrix}0&1\\0&0\end{pmatrix}\)。由 \(T^2=0\)(\(T\) 是幂零 (nilpotent) 算子)知 \(T\) 的唯一特征值是 \(0\),且 \[ E(0,T)=\operatorname{null}T=\{(x,0):x\in\mathbf{F}\}=\operatorname{span}\bigl((1,0)\bigr) \] 是一维的。于是 \(\dim E(0,T)=1<\dim\mathbf{F}^2=2\),5.55 的 (d)(从而 (a))不成立:\(T\) 不可对角化,且不论 \(\mathbf{F}=\mathbf{R}\) 或 \(\mathbf{C}\) 都如此。(其极小多项式是 \(z^2\),有重零点 \(0\),与下文的 5.62 相互印证;几何图像见图 2 右栏:整个平面被"剪切塌缩"到 \(x\) 轴上。)
定义 \(T\in\mathcal{L}(\mathbf{R}^2)\) 为 \(T(x,y)=(-y,x)\),即绕原点逆时针旋转 \(90^\circ\)。若 \(Tv=\lambda v\) 且 \(v\neq 0\),则内积 \[ \langle Tv,v\rangle=\langle(-y,x),(x,y)\rangle=-yx+xy=0, \] 即 \(Tv\perp v\);而 \(\lambda v\perp v\) 当且仅当 \(\lambda=0\),此时又须 \(Tv=0\) 即 \(v=0\),矛盾。故 \(T\) 连一个(实)特征值都没有,遑论特征向量基:\(T\) 在 \(\mathbf{R}\) 上不可对角化。然而若把基域换成 \(\mathbf{C}\),则 \(\lambda^2=-1\) 给出特征值 \(\mathrm{i},-\mathrm{i}\),相应特征向量 \((1,-\mathrm{i}),(1,\mathrm{i})\),\(T\) 在 \(\mathbf{C}^2\) 上是可对角化的(练习 6)。可见可对角化依赖于基域 \(\mathbf{F}\):实向量空间上"转起来"的算子,到了复数域才摊得平。
虽然特征向量可能"不够用",但只要特征值的个数足够多,就一定够用:
设 \(V\) 有限维。若 \(T\in\mathcal{L}(V)\) 有 \(\dim V\) 个互异特征值,则 \(T\) 可对角化。
证明. 设 \(\lambda_1,\dots,\lambda_{\dim V}\) 是 \(T\) 的互异特征值,取相应特征向量 \(v_1,\dots,v_{\dim V}\)。由上述引理,这列表线性无关;而长度等于 \(\dim V\) 的线性无关列表必为基。在这组由特征向量组成的基下,\(T\) 的矩阵是对角矩阵。\(\blacksquare\)
5.58 只是充分条件。恒等算子 \(I\) 只有唯一特征值 \(1\),却在任何基下的矩阵都是 \(I\);例 1 中的对角算子只有两个互异特征值而维数为 \(3\),仍可对角化。问题的实质不在特征值的个数,而在每个特征空间是否"足维"——这正是接下来极小多项式判据要一语道破的。
极小多项式判据
先回顾 5.B 与 5.C 中关于极小多项式 (minimal polynomial) 的四条事实。设 \(V\) 有限维,\(T\in\mathcal{L}(V)\):
- 存在唯一的首一多项式 \(q\),满足 \(q(T)=0\) 且次数最小,称为 \(T\) 的极小多项式,且 \(\deg q\le\dim V\)(5.22, 5.24);
- \(q\) 的零点集恰为 \(T\) 的特征值集(5.27);
- 对任意多项式 \(s\):\(s(T)=0\) 当且仅当 \(s\) 是 \(q\) 的多项式倍(5.29);
- 若 \(T\) 有上三角矩阵且对角线为 \(\mu_1,\dots,\mu_n\),则 \((T-\mu_1I)\cdots(T-\mu_nI)=0\)(5.40)。
在 5.C 中我们证明过:\(T\) 有上三角矩阵当且仅当其极小多项式可写为 \((z-\lambda_1)\cdots(z-\lambda_m)\)(诸 \(\lambda_k\in\mathbf{F}\),允许重复)。下面的定理是本节的高潮:把"允许重复"改为"两两互异",恰好就从上三角跨到了对角。
设 \(V\) 有限维,\(T\in\mathcal{L}(V)\)。则 \(T\) 可对角化当且仅当 \(T\) 的极小多项式形如 \[ (z-\lambda_1)(z-\lambda_2)\cdots(z-\lambda_m), \] 其中 \(\lambda_1,\dots,\lambda_m\in\mathbf{F}\) 两两不同(此时它们恰为 \(T\) 的全部互异特征值)。换言之,\(T\) 可对角化当且仅当其极小多项式没有重零点。
证明. (⟸)充分性. 设极小多项式 \(q=(z-\lambda_1)\cdots(z-\lambda_m)\),诸 \(\lambda_k\) 互异。对 \(m\) 作归纳。若 \(m=1\),则 \(q=z-\lambda_1\),即 \(T=\lambda_1I\),任何基下矩阵均为对角矩阵。设 \(m>1\) 且结论对更小的 \(m\) 成立。记 \[ U=\operatorname{range}(T-\lambda_mI). \] 作为 \(T\) 的多项式作用的值域,\(U\) 在 \(T\) 下不变(5.A 中的事实),故 \(T|_U\) 是 \(U\) 上的算子。对任意 \(u\in U\),写 \(u=(T-\lambda_mI)v\),则由 \(q(T)=0\) 得 \[ (T-\lambda_1I)\cdots(T-\lambda_{m-1}I)\,u=(T-\lambda_1I)\cdots(T-\lambda_mI)\,v=q(T)v=0. \] 于是多项式 \((z-\lambda_1)\cdots(z-\lambda_{m-1})\) 作用于 \(T|_U\) 为零,由 5.29 它是 \(T|_U\) 的极小多项式的倍式;而该多项式无重零点,故 \(T|_U\) 的极小多项式也无重零点(不变子空间中 \(T|_U\) 的特征向量必是 \(T\) 的特征向量,其极小多项式的零点必是 \(\lambda_1,\dots,\lambda_{m-1}\) 中的某些)。由归纳假设,\(U\) 有一组由 \(T\) 的特征向量组成的基。
再证 \(U\cap\operatorname{null}(T-\lambda_mI)=\{0\}\)。设 \(u\) 属于这个交,则 \(Tu=\lambda_mu\),代入上段的关系式: \[ 0=(T-\lambda_1I)\cdots(T-\lambda_{m-1}I)u=(\lambda_m-\lambda_1)\cdots(\lambda_m-\lambda_{m-1})\,u, \] 诸特征值互异,系数之积非零,故 \(u=0\)。于是 \(U+\operatorname{null}(T-\lambda_mI)\) 是直和(两个子空间之和为直和当且仅当其交为 \(\{0\}\));又由线性映射基本定理(秩—零化度定理) \[ \dim U+\dim\operatorname{null}(T-\lambda_mI)=\dim V, \] 所以 \(U\oplus\operatorname{null}(T-\lambda_mI)=V\)。由于 \(\lambda_m\) 是极小多项式的零点,故是 \(T\) 的特征值(5.27),\(\operatorname{null}(T-\lambda_mI)\) 中的非零向量都是特征值 \(\lambda_m\) 的特征向量。把 \(U\) 的特征向量基与 \(\operatorname{null}(T-\lambda_mI)\) 的任意一组基合并,便得到 \(V\) 的由 \(T\) 的特征向量组成的基。故 \(T\) 可对角化。
(⟹)必要性. 设 \(T\) 可对角化,取由特征向量组成的基 \(v_1,\dots,v_n\),并设 \(\lambda_1,\dots,\lambda_m\) 是 \(T\) 的全部互异特征值。对每个基向量 \(v_j\),存在 \(k\) 使 \(Tv_j=\lambda_kv_j\)。诸算子 \(T-\lambda_iI\) 都是 \(T\) 的多项式,而同一算子的多项式两两可交换;于是把"消灭" \(v_j\) 的那个因子乘在最后,得 \[ (T-\lambda_1I)\cdots(T-\lambda_mI)\,v_j=0\quad(j=1,\dots,n), \] 即该乘积算子在一组基上为零,从而是零算子。由 5.29,极小多项式 \(q\) 整除 \((z-\lambda_1)\cdots(z-\lambda_m)\)。反过来,由 5.27,每个 \(\lambda_k\) 都是 \(q\) 的零点,故由因式定理每个 \(z-\lambda_k\) 整除 \(q\);诸 \(z-\lambda_k\) 两两互素,而两两互素且都整除 \(q\) 的多项式之乘积 \((z-\lambda_1)\cdots(z-\lambda_m)\) 也整除 \(q\)。两个首一多项式互相整除,故 \[ q=(z-\lambda_1)\cdots(z-\lambda_m). \] 证明完毕。\(\blacksquare\)
设 \(T\in\mathcal{L}(\mathbf{F}^3)\) 在某基下的矩阵为 \[ A=\begin{pmatrix}6&3&4\\0&6&2\\0&0&7\end{pmatrix}. \] 这是上三角矩阵,故特征值是对角元 \(6,7\)(5.41)。由上述第四条回顾事实,\((T-6I)^2(T-7I)=0\);又极小多项式 \(q\) 的次数不超过 \(\dim\mathbf{F}^3=3\) 且零点集恰为 \(\{6,7\}\),故 \(q\) 只可能是 \((z-6)(z-7)\) 或 \((z-6)^2(z-7)\)。直接计算: \[ (A-6I)(A-7I) =\begin{pmatrix}0&3&4\\0&0&2\\0&0&1\end{pmatrix}\begin{pmatrix}-1&3&4\\0&-1&2\\0&0&0\end{pmatrix} =\begin{pmatrix}0&-3&6\\0&0&0\\0&0&0\end{pmatrix}\neq 0. \] 于是 \(q=(z-6)^2(z-7)\),零点 \(6\) 是二重的。由 5.62,\(T\) 不可对角化。这与特征空间的账目吻合:\(E(6,T)=\operatorname{span}((1,0,0))\),\(E(7,T)=\operatorname{span}((10,2,1))\),两者维数之和 \(2<3\)。
判据"极小多项式无重零点"等价于"\(q\) 与其导数 \(q'\) 互素",而后者可用多项式的辗转相除在不知道 \(q\) 的零点的情况下判定。因此,即使特征值无法求出精确表达式,也仍能严格判定可对角性——这是 5.62 相对于"直接找特征向量"的一大优点(参见原书本节练习 15)。
设 \(T\in\mathcal{L}(V)\) 可对角化,\(U\) 是 \(T\) 的不变子空间 (invariant subspace)。则限制算子 \(T|_U\) 是 \(U\) 上的可对角化算子。
证明. 设 \(q\) 是 \(T\) 的极小多项式。由 \(T\) 可对角化与 5.62,\(q\) 无重零点。又在 \(U\) 上 \(q(T|_U)=q(T)|_U=0\),故由 5.29(用于算子 \(T|_U\)),\(T|_U\) 的极小多项式整除 \(q\),从而也无重零点。再由 5.62,\(T|_U\) 可对角化。\(\blacksquare\)
计算示例:完整对角化一个 3×3 矩阵
设 \(T\in\mathcal{L}(\mathbf{F}^3)\) 在标准基 \(e_1,e_2,e_3\) 下的矩阵为 \[ A=\begin{pmatrix}1&2&1\\0&2&1\\0&0&3\end{pmatrix}. \] 我们按"特征值 → 特征空间 → 判定 → 对角化"四步完整处理。
第一步:特征值。\(A\) 是上三角矩阵,故特征值恰为对角元(5.41): \[ \lambda=1,\;2,\;3, \] 三者互异,共 \(3=\dim\mathbf{F}^3\) 个。
第二步:特征空间。逐个解齐次方程组 \((A-\lambda I)v=0\)。
对 \(\lambda=1\): \[ A-I=\begin{pmatrix}0&2&1\\0&1&1\\0&0&2\end{pmatrix}\;\Rightarrow\; z=0,\; y=0,\; x\ \text{自由},\qquad E(1,T)=\operatorname{span}\bigl((1,0,0)\bigr). \] 对 \(\lambda=2\): \[ A-2I=\begin{pmatrix}-1&2&1\\0&0&1\\0&0&1\end{pmatrix}\;\Rightarrow\; z=0,\; x=2y,\qquad E(2,T)=\operatorname{span}\bigl((2,1,0)\bigr). \] 对 \(\lambda=3\): \[ A-3I=\begin{pmatrix}-2&2&1\\0&-1&1\\0&0&0\end{pmatrix}\;\Rightarrow\; z=y,\; x=\tfrac32y,\qquad E(3,T)=\operatorname{span}\bigl((3,2,2)\bigr). \] (验算:\(A(2,1,0)=(4,2,0)=2(2,1,0)\),\(A(3,2,2)=(9,6,6)=3(3,2,2)\)。)
第三步:判定。两种判据都可以用:其一,三个互异特征值的个数等于 \(\dim\mathbf{F}^3\),由 5.58 直接断定可对角化;其二,\(\dim E(1,T)+\dim E(2,T)+\dim E(3,T)=1+1+1=3=\dim\mathbf{F}^3\),由 5.55(d) 同样断定。此外其极小多项式为 \((z-1)(z-2)(z-3)\),无重零点,与 5.62 一致。
第四步:写出对角化。取特征向量 \(v_1=(1,0,0)\),\(v_2=(2,1,0)\),\(v_3=(3,2,2)\) 作列组成过渡矩阵 \[ P=(v_1\ v_2\ v_3)=\begin{pmatrix}1&2&3\\0&1&2\\0&0&2\end{pmatrix},\qquad \det P=2\neq 0, \] 故 \(P\) 可逆、\(v_1,v_2,v_3\) 构成基(也可由 5.11 直接看出线性无关)。逐列验证 \(AP=PD\): \[ AP=\bigl(Av_1\ Av_2\ Av_3\bigr)=\begin{pmatrix}1&4&9\\0&2&6\\0&0&6\end{pmatrix} =\begin{pmatrix}1&2&3\\0&1&2\\0&0&2\end{pmatrix}\begin{pmatrix}1&0&0\\0&2&0\\0&0&3\end{pmatrix}=PD, \] 其中 \(D=\operatorname{diag}(1,2,3)\)。具体求逆可得 \[ P^{-1}=\begin{pmatrix}1&-2&\tfrac12\\0&1&-1\\0&0&\tfrac12\end{pmatrix}, \] 于是 \[ P^{-1}AP=\begin{pmatrix}1&0&0\\0&2&0\\0&0&3\end{pmatrix}. \] 用算子的语言说:在基 \((1,0,0),(2,1,0),(3,2,2)\) 下,\(T\) 的矩阵就是对角矩阵 \(D\)。
可对角化算子的函数演算初步
可对角化的最大实惠在于:一切关于 \(T\) 的计算都化归为关于特征值的标量计算。先看多项式的情形。
设 \(T\in\mathcal{L}(V)\) 可对角化,\(\lambda_1,\dots,\lambda_m\) 是其全部互异特征值,\(p\in\mathcal{P}(\mathbf{F})\)。则:
- (i) 对每个 \(k\) 与每个 \(v\in E(\lambda_k,T)\),有 \(p(T)v=p(\lambda_k)v\);即 \(p(T)\) 在每个特征空间上就是"乘以 \(p(\lambda_k)\)"。
- (ii) \(p(T)\) 可对角化(与 \(T\) 可同时用一组特征向量基对角化),且 \(p(T)\) 的特征值集合恰为 \(\{p(\lambda_1),\dots,p(\lambda_m)\}\)。
- (iii) 特别地,对正整数 \(r\),\(T^r\) 的特征值为 \(\lambda_k^r\);\(p(T)=0\) 当且仅当 \(p(\lambda_k)=0\) 对所有 \(k\) 成立。
证明. (i) 由因式定理,\(p(z)-p(\lambda_k)\) 被 \(z-\lambda_k\) 整除,设 \(p(z)-p(\lambda_k)=(z-\lambda_k)s(z)\)。代入算子:\(p(T)-p(\lambda_k)I=(T-\lambda_kI)s(T)\),而 \(T-\lambda_kI\) 在 \(E(\lambda_k,T)\) 上为零,故左边的算子在该子空间上为零。
(ii) 取 \(V\) 的由特征向量组成的基。由 (i),\(p(T)\) 把每个基向量 \(v\) 送到 \(p(\lambda)v\)(\(\lambda\) 为 \(v\) 的特征值),故 \(p(T)\) 在该基下的矩阵是对角矩阵,对角元为诸 \(p(\lambda)\);而具有对角矩阵的算子,其特征值恰为对角元(5.41,或直接验证)。
(iii) 取 \(p(z)=z^r\) 即得第一条;第二条由 (i) 与"算子在基上的取值唯一确定算子"得到(若 \(p(\lambda_k)=0\) 对所有 \(k\),则 \(p(T)\) 在一组基上为零)。\(\blacksquare\)
沿用例 7 的矩阵 \(A\)。先把 \(e_3=(0,0,1)\) 按特征向量基分解:解 \[ e_3=a\,v_1+b\,v_2+c\,v_3, \] 比较第三个坐标得 \(2c=1\),即 \(c=\tfrac12\);第二个坐标得 \(b+2c=0\),即 \(b=-1\);第一个坐标得 \(a+2b+3c=0\),即 \(a=\tfrac12\)。于是 \[ e_3=\tfrac12v_1-v_2+\tfrac12v_3. \] 由上述命题 (iii)(或直接由 \(T^rv=\lambda^rv\)), \[ A^{50}e_3=\tfrac12\cdot 1^{50}\,v_1-2^{50}\,v_2+\tfrac12\cdot 3^{50}\,v_3 =\Bigl(\tfrac12-2^{51}+\tfrac{3^{51}}{2},\; -2^{50}+3^{50},\; 3^{50}\Bigr), \] 一次乘法都不用做矩阵乘。这正是"在特征坐标系里,算子的幂就是标量的幂"。
由特征值定义 \(f(T)\):逆与平方根.命题 (i) 提示了更一般的做法:只要给每个互异特征值 \(\lambda_k\) 指定一个数值 \(\mu_k\),就(至多)有一个算子在每个 \(E(\lambda_k,T)\) 上恰为"乘以 \(\mu_k\)"——当 \(T\) 可对角化时这个算子必存在,而且总可以取成 \(T\) 的多项式:由于 \(\lambda_1,\dots,\lambda_m\) 互异,拉格朗日插值给出多项式 \(p\) 使 \(p(\lambda_k)=\mu_k\),于是 \(p(T)\) 即为所求。两个重要特例:
- 逆:若 \(0\) 不是 \(T\) 的特征值(即 \(T\) 可逆),取 \(\mu_k=1/\lambda_k\),所得算子在每个特征空间上与 \(T\) 的逆一致,故 \(T^{-1}=p(T)\) 是 \(T\) 的多项式。可对角化算子的逆、以及它的一切幂,都活在同一组特征向量基里。
- 平方根:若 \(T\) 可对角化且所有特征值非负(例如 \(\mathbf{F}=\mathbf{R}\) 时),取 \(\mu_k=\sqrt{\lambda_k}\),所得算子 \(S=p(T)\) 满足 \(S^2=T\),称为 \(T\) 的一个平方根。
这里对函数演算 (functional calculus) 只作初步讨论。第 7 章的谱定理(7.29、7.31)将证明:自伴算子与正规算子可被规范正交基对角化,从而顺理成章地拥有平方根与丰富的函数演算(7.38);第 8 章则用广义特征空间处理一般情形。本节的框架是它们共同的雏形。
注记:理想形态与"几乎对角化"
可对角化是算子最理想的形态:在特征向量基下,矩阵只剩对角线上的伸缩因子,幂、多项式、方程求解全都化归为标量运算;几何上(图 1、图 2),算子的作用退化为若干独立方向上的一维伸缩,不再有任何方向之间的耦合。5.55 告诉我们,能否达到这一形态,完全取决于各特征空间能否"凑满"整个空间;5.62 进一步把这一几何条件压缩为极小多项式的一个代数条件——无重零点。
然而并非每个算子都可对角化:幂零算子把空间压扁(例 4),实平面上的旋转干脆没有实特征方向(例 5)。对于这些"顽固"的算子,第 8 章给出系统的补救方案:把特征空间放宽为广义特征空间 (generalized eigenspace) \[ G(\lambda,T)=\operatorname{null}(T-\lambda I)^{\dim V}, \] 在复向量空间上总有分解 \[ V=G(\lambda_1,T)\oplus\cdots\oplus G(\lambda_m,T), \] 从而 \(T\) 的矩阵可化为分块对角 (block diagonal) 形式——"几乎对角化";更精细的 Jordan 标准形(8.46)则在每个方块内部彻底描述残余的幂零部分。届时回看 5.62 会格外清晰:极小多项式无重零点,恰好等价于每个广义特征空间都退化为普通特征空间,残余的幂零部分全部消失。
最后再次强调基域:\(\mathbf{C}\) 上每个算子至少能上三角化(5.47),可对角化的障碍只有"重零点";\(\mathbf{R}\) 上还存在旋转这类连特征值都没有的算子,需要第 8 章或复化手段处理。原书本节还包含 Gershgorin 圆盘定理(对特征值做数值定位),本页从略。
练习
练习 5.D-1
设 \(T\in\mathcal{L}(V)\) 满足 \(T^2=T\)(这样的算子称为投影)。证明:\(T\) 可对角化,且 \(E(0,T)=\operatorname{null}T\),\(E(1,T)=\operatorname{range}T\)。
解答/提示由 \(T^2-T=0\) 知极小多项式整除 \(z(z-1)\),而 \(z(z-1)\) 无重零点,故 \(T\) 的极小多项式无重零点,由 5.62 得 \(T\) 可对角化。若 \(Tv=\lambda v\),\(v\neq 0\),则 \(\lambda^2v=T^2v=Tv=\lambda v\),故 \(\lambda\in\{0,1\}\),即特征值只可能是 \(0\) 或 \(1\);由 5.55(c),\(V=E(0,T)\oplus E(1,T)\)(其中某个特征空间可能为 \(\{0\}\),此时 \(T=0\) 或 \(T=I\))。最后:若 \(u=Tv\in\operatorname{range}T\),则 \(Tu=T^2v=Tv=u\),故 \(\operatorname{range}T\subseteq E(1,T)\);反包含显然,故 \(E(1,T)=\operatorname{range}T\)。而 \(E(0,T)=\operatorname{null}(T-0\cdot I)=\operatorname{null}T\)。
练习 5.D-2
证明:既幂零又可对角化的算子必为零算子。
解答/提示方法一(极小多项式):设 \(T\) 幂零,则 \(T^r=0\) 对某 \(r\) 成立,故极小多项式为 \(z^s\)(某 \(s\ge 1\));若 \(T\) 又可对角化,由 5.62 极小多项式无重零点,只能 \(s=1\),即 \(T=0\)。方法二(对角矩阵):取基使 \(\mathcal{M}(T)=D\) 对角,则 \(D^r\) 仍是对角矩阵且对角元为 \(\lambda_k^r\);\(D^r=0\) 迫使每个 \(\lambda_k=0\),故 \(D=0\)。
练习 5.D-3(Fibonacci 数列)
定义 \(T\in\mathcal{L}(\mathbf{R}^2)\) 为 \(T(x,y)=(y,x+y)\),并设 \(F_0=0,\ F_1=1,\ F_n=F_{n-2}+F_{n-1}\)。(a) 证明 \(T^n(0,1)=(F_n,F_{n+1})\);(b) 求 \(T\) 的特征值与一组特征向量基;(c) 由此推出通项公式 \[ F_n=\frac{1}{\sqrt5}\Bigl[\bigl(\tfrac{1+\sqrt5}{2}\bigr)^n-\bigl(\tfrac{1-\sqrt5}{2}\bigr)^n\Bigr]. \]
解答/提示(a) 对 \(n\) 归纳:\(n=0,1\) 直接验证;\(T^{n+1}(0,1)=T(F_n,F_{n+1})=(F_{n+1},F_n+F_{n+1})=(F_{n+1},F_{n+2})\)。
(b) \(T(x,y)=\lambda(x,y)\) 给出 \(y=\lambda x,\ x+y=\lambda y\),消去得 \(\lambda^2=\lambda+1\),故 \(\lambda=\varphi=\frac{1+\sqrt5}{2}\) 或 \(\psi=\frac{1-\sqrt5}{2}\);相应特征向量取 \((1,\varphi)\) 与 \((1,\psi)\)(如 \(T(1,\varphi)=(\varphi,1+\varphi)=(\varphi,\varphi^2)=\varphi(1,\varphi)\))。两特征值互异,由 5.58,\((1,\varphi),(1,\psi)\) 是特征向量基。
(c) 解 \((0,1)=a(1,\varphi)+b(1,\psi)\):由 \(a+b=0\)、\(a\varphi+b\psi=1\) 得 \(a=\frac{1}{\varphi-\psi}=\frac{1}{\sqrt5}\),\(b=-\frac{1}{\sqrt5}\)。于是 \[ T^n(0,1)=\tfrac{1}{\sqrt5}\,\varphi^n(1,\varphi)-\tfrac{1}{\sqrt5}\,\psi^n(1,\psi), \] 取第一个坐标并用 (a) 即得 \(F_n=\frac{1}{\sqrt5}(\varphi^n-\psi^n)\)。
练习 5.D-4
设 \(T\in\mathcal{L}(\mathbf{F}^5)\) 且 \(\dim E(8,T)=4\)。证明:\(T-2I\) 与 \(T-6I\) 中至少有一个可逆。
解答/提示反设两者都不可逆。由 5.A 中的等价刻画(\(\lambda\) 是 \(T\) 的特征值当且仅当 \(T-\lambda I\) 不可逆),\(2\) 与 \(6\) 都是 \(T\) 的特征值,于是 \(\dim E(2,T)\ge 1\) 且 \(\dim E(6,T)\ge 1\)。而 \(2,6,8\) 是三个互异特征值,由 5.54, \[ \dim E(2,T)+\dim E(6,T)+\dim E(8,T)\ge 1+1+4=6>\dim\mathbf{F}^5=5, \] 矛盾。故至少一个可逆。
练习 5.D-5
(a) 证明:若 \(T\) 可对角化,则 \(T^2\) 可对角化,且两者可被同一组特征向量基同时对角化。(b) 举例说明 (a) 的逆命题不成立。
解答/提示(a) 设 \(v_1,\dots,v_n\) 是 \(T\) 的特征向量基,\(Tv_k=\lambda_kv_k\),则 \(T^2v_k=\lambda_k^2v_k\),故同一组基也是 \(T^2\) 的特征向量基,两者在此基下的矩阵同为对角矩阵。
(b) 取例 4 的幂零算子 \(T(x,y)=(y,0)\):\(T^2=0\) 是可对角化的(零算子),但 \(T\) 本身不可对角化。
练习 5.D-6
设 \(T\in\mathcal{L}(\mathbf{C}^2)\) 仍为 \(T(w,z)=(-z,w)\)(例 5 中的旋转,基域换成 \(\mathbf{C}\))。证明 \(T\) 可对角化,求一组特征向量基及相应对角矩阵;并结合例 5 说明可对角化如何依赖于基域 \(\mathbf{F}\)。
解答/提示解 \(T(w,z)=\lambda(w,z)\):\(-z=\lambda w,\ w=\lambda z\),消去得 \(\lambda^2=-1\),故 \(\lambda=\mathrm{i}\) 或 \(\lambda=-\mathrm{i}\)。相应地取 \((1,-\mathrm{i})\)(对应 \(\mathrm{i}\))与 \((1,\mathrm{i})\)(对应 \(-\mathrm{i}\)):验证 \(T(1,-\mathrm{i})=(\mathrm{i},1)=\mathrm{i}(1,-\mathrm{i})\),\(T(1,\mathrm{i})=(-\mathrm{i},1)=-\mathrm{i}(1,\mathrm{i})\)。两特征值互异,由 5.58,该列表是特征向量基,\(T\) 在其下的矩阵为 \(\begin{pmatrix}\mathrm{i}&0\\0&-\mathrm{i}\end{pmatrix}\)。同一个公式定义的算子,在 \(\mathbf{R}^2\) 上没有任何特征值(例 5)因而不可对角化,在 \(\mathbf{C}^2\) 上却可对角化:可对角化不仅取决于算子,也取决于允许使用的标量域。