返回

矩阵基础

本文主要是一些关于矩阵的相对初等的内容,是考研期间做的完整考研线性代数归纳总结,目的是方便查阅。现在来看,这篇文章的主要任务是收纳若干关于矩阵的初级线性代数知识与技巧,对于线性空间、线性变换等内容,暂不涉及。在作者看来,这一部分的知识里理论的成分居多,读者如有需求,还是直接参考专业的线性代数或高等代数教材为好。

作者本科专业是数学与应用数学,后在学院内转去了统计学 (数理方向),有一定的数学基础,所以最基本的概念等本文就不再赘述了😊例如矩阵转置及其性质、矩阵逆的定义等等。

本文集作者所学同时参考了大量的文献和网络资料,在整理和归纳时难免有所纰漏,如果发现有错误的内容可以邮件联系我以订正。

本文中凡是没有特别指明的,都限制在实数域上讨论。如果需要在线做一些矩阵运算,个人推荐 WolframApha;如果需要做一系列复杂矩阵运算,个人推荐 Mathematica。

矩阵

(数字) 矩阵只是一个数表,作者看来没有所谓本质:他只是一张表,我们要往里面装什么东西,比如实数、复数、矩阵甚至随机变量,或是定义某种“奇形怪状”的新运算,都是可行的——“矩阵是什么”这个问题,取决于“我们希望用矩阵做什么”;如果一定要问出个“本质”来,那可能是线性变换吧;尽管矩阵也可以代表一个线性方程组(的系数),(数字) 矩阵的某些性质从该角度看更为直观。如果把矩阵看成向量组,那么一些向量组问题的答案瞬间便水落石出。矩阵还有许多其他作用,在不同的场景下有不同的任务,这里就不一一列举了。

矩阵的关系

众所周知,左乘初等矩阵等于做相应的行变换,右乘初等矩阵等于做相应的列变换,那么什么时候只能做行变换,什么时候只能做列变换呢?

一般而言:

  • 当把矩阵视为列向量的排列后,如果要直接确定线性相关的列向量之间的数量关系(例如已知某向量可以同时被两组向量线性表出,求该向量的值),则只能做初等列变换,因为只有列变换才是列向量间而不是其分量间的线性组合,保持了列向量的代数结构(但是可能会改变线性相关式kiαi=0\sum k_i\alpha_i=0的系数{ki}\{k_i\});
  • 当把矩阵视为列向量的排列后,如果要确定列向量的极大线性无关组(也可以是判断线性相关性),则只能做初等行变换,因为就线性相关性而言,矩阵的行秩等于列秩,但如果做初等列变换就会改变列向量的位置,从而无法确定本来的列向量组中到底谁和谁线性相关;
  • 当把矩阵视为线性方程的系数表时,如果要通过高斯消元法解方程,则只能做初等行变换,因为线性方程整体相加减不改变解的值,但如果做列变换则相当于把一个未知数的系数加到了另一个未知数上,破坏了线性方程的结构;

到底该行变换还是列变换,只是取决于目的是什么。例如第一个例子“已知某向量可以同时被两组向量线性表出,求该向量的值”,既可以将两个向量组视为列向量的排列而做初等列变换,也可以等价地认为两组向量依次列成的矩阵AA与那个可以被同时表出的向量bb构成的方程组Ax=bAx=b有解,从而利用高斯消元法对AA做初等行变换。

矩阵等价

  • 矩阵等价:如果矩阵AA可以经有限次初等变换得到BB,则ABA\cong B(矩阵等价)

    上述条件等价于存在一系列初等矩阵P1,P2,,Pn,Q1,Q2,,QmP_1,P_2,\cdots,P_n,Q_1,Q_2,\cdots,Q_m,使得A=P1P2PnBQ1Q2QmA=P_1P_2\cdots P_nBQ_1Q_2\cdots Q_m

    注:矩阵乘法按“左行右列”规则计算,表现为做乘时是用左边的行向量点乘右边的列向量得到新矩阵的一个元素,也表现为左乘初等矩阵则对原矩阵做相应行变换、右乘初等矩阵则对原矩阵做相应列变换

  • 同型矩阵等价的充要条件是秩相等(判断方法,矩阵等价的充要条件)

    联系到定义:初等矩阵总是满秩而可逆的

  • 若矩阵可逆则一定与EE等价,从特征值角度看是特征值均非零,因此行列式不为00,故矩阵可逆;从初等矩阵角度看,他可以被视作为有限个代表初等行列变换的初等矩阵的复合(矩阵乘法),即可以由EE经过有限次初等变换得到;也可以说该矩阵的对角矩阵一定为EE

  • 如果实矩阵AABB等价,那么A2A^2B2B^2不一定等价,除非A,BA,B中有一个矩阵为可逆矩阵

    如果实矩阵AABB等价,那么ABABABAB也不一定等价,除非A,BA,B中有一个矩阵为可逆矩阵

    如果实对称阵AABB合同,那么A2A^2B2B^2合同

    如果实对称阵AABB相似,那么A2A^2B2B^2相似

    之所以对两个等价的矩阵A,BA,B不一定有A2A^2B2B^2等价,是因为尽管A2A^2B2B^2的特征值相等,但二者的秩却不一定相等。进一步讲,更本质的原因是二者零特征值的几何重数不一定相等。也就是说,即使A,BA,B相似,从而A,BA,B的零特征值有相同的代数重数与几何重数,则只能得出A2A^2B2B^2的零特征值有相同的代数重数,但其几何重数可能是不相等的。对于命题“ABABABAB也不一定等价”,原因同理;

    最经典的例子是:

    {A=(111000000)n×nB=(111111000)n×nA2=AB2=OBA=AAB=O \left\{\begin{aligned}&A=\left(\begin{matrix}1&1&\cdots&1\\0&0&\cdots&0\\\vdots&\vdots&&\vdots\\0&0&\cdots&0\end{matrix}\right)_{n\times n}&&B=\left(\begin{matrix}1&1&\cdots&1\\-1&-1&\cdots&-1\\\vdots&\vdots&&\vdots\\0&0&\cdots&0\end{matrix}\right)_{n\times n}\\&A^2=A&&B^2=O\\&BA=A&&AB=O\end{aligned}\right.

    其中

    r(A)=r(B)=1 r(A)=r(B)=1 r(A2)=1,    r(B2)=0 r(A^2)=1,\ \ \ \ r(B^2)=0 r(BA)=1,    r(AB)=0 r(BA)=1,\ \ \ \ r(AB)=0

    这个例子十分经典,务必了解

矩阵合同

  • 矩阵合同:合同一定等价

  • 矩阵合同:若存在可逆阵CC,使得CTAC=BC^TAC=B,则ABA\simeq B(矩阵合同)

    其中CTACC^TAC称为AA的合同变换,实对称矩阵经合同变换还是实对称矩阵

    合同变换不要求A,BA,B都是对称阵,但对称阵经合同变换只能是对称阵,非对称阵经合同变换只能是非对称阵

  • 对称矩阵合同:对称矩阵若相似则一定合同

  • 对称矩阵合同的充要条件:正负惯性指数相等;规范型相同

  • 实对称矩阵AA与他的逆A1A^{-1}合同,即二者具有相同的规范型,这是因为A=AA1A=ATA1AA=AA^{-1}A=A^TA^{-1}A

  • 合同变换不改变正负惯性指数

  • 等价关系:矩阵等价、相似与合同都是广义上的

  • 等价关系(所以也有人认为矩阵等价应该译作相抵,以免与逻辑关系上的等价冲突),均满足自反性、对称性与传递性

  • 相似必然合同,但合同不一定相似

  • 在欧氏空间中,合同变换体现为在平面到自身的一一变换下,任意线段的长和它的像的长总相等

  • 正交变换是一种合同变换

  • 更多的内容将在后文二次型理论中提到

矩阵相似

补充定义:

  代数重数,指特征值在特征方程中作为根的重数;

  几何重数,指特征值对应的特征向量生成空间的维数,或者说是对应特征向量的极大线性无关组中向量个数;

  几何重数必然小于或等于代数重数

  • 矩阵相似:相似一定等价

  • 矩阵相似:若存在可逆阵PP,使得PAP1=BPAP^{-1}=B,则ABA\sim B(矩阵相似)

    上述条件等价于存在一系列初等矩阵P1,P2,,PnP_1,P_2,\cdots,P_n,使得A=P1P2PnBPn1Pn11P11A=P_1P_2\cdots P_nBP^{-1}_nP^{-1}_{n-1}\cdots P^{-1}_1

    其中PAP1PAP^{-1}称为AA的相似变换

  • 矩阵相似的充要条件:有相同的初等因子 / 有相同的Jordan标准型

  • 如果两个矩阵均可被相似对角化且都相似于同一对角阵,则两矩阵必然相似

  • 仅对实对称矩阵而言,相似的充要条件是有相同的特征值,因为他们都相似于同一对角矩阵

  • 对一般的矩阵而言,有相似的特征值只是相似的必要条件,即使特征值和特征向量均完全相同,也不一定相似,除非加上条件:两矩阵均可相似对角化,这也是为什么实对称矩阵有相同特征值便相似的原因(实对称矩阵必能相似对角化)

  • 由上可推出,相似必然合同,但合同不一定相似

  • 相似变换不改变特征值

    • 自然也不改变迹和行列式
    • ABA\sim B,则(anAn+an1An1++a0E)(anBn+an1Bn1++a0E)(a_nA^n+a_{n-1}A^{n-1}+\cdots+a_0E)\sim(a_nB^n+a_{n-1}B^{n-1}+\cdots+a_0E)
  • 相似变换:同⼀个线性变换在不同基下的表示矩阵相似,这是相似的另一种定义

  • 特征值相等,且AA的特征向量aa等于PbPb

  • 能相似对角化的两矩阵,若特征值相等则可以导出相似

  • 判定一般矩阵是否相似:

    1. 先检查迹,应当相等,迹如果都不一样就没必要进一步讨论了,必然不相似
    2. 验证⾏列式是否相等,若不相等则不相似
    3. 观察是否均可对角化,若其中一个可以对角化而另一个不能,则不相似
    4. 再判断秩,应该相等,若不相等则不相似
    5. 接着验证特征值是否均相等,若不相等则不相似(对实对称矩阵而言是充要的)
    6. 得到特征值λi\lambda_i后,观察λiAE\lambda_iA-EλiBE\lambda_iB-E的行列式与秩是否相等(若AABB相似,则这⼆者必相似,反之也成⽴)
    7. 以上均为必要条件,矩阵相似没有简单而通用的判断方法,除非计算Jordan标准型或初等因子,但对于笔算而言计算量过于大了;不过,通常到第 6 步时相似性已经能够判断
  • 矩阵的转置与⾃身相似,即AATA\sim A^T

    如果两矩阵相似,则他们的转置阵相似,即如果ABA\sim B,则ATBTA^T\sim B^T

    如果两矩阵相似且可逆,则他们的逆矩阵相似,即如果ABA\sim BA1A^{-1}存在,则A1B1A^{-1}\sim B^{-1}

    如果两矩阵相似,则他们的伴随矩阵相似,即如果ABA\sim B,则ABA^{\ast}\sim B^{\ast}

    综上所述,如果矩阵A,BA,B相似,则他们的任意次转置、逆与伴随所复合的矩阵A1,B1A_1,B_1也相似

  • ABABBABA并不一定相似,即使二者一定有相同的特征多项式与特征值

    尽管可以证明二者特征值的代数重数必然相等,但几何重数却不一定相等,这也导致了连秩都可能是不同的

    就算A,BA,B都是nn阶可逆矩阵ABABBABA也不一定相似,但如果A,BA,B都是nn阶实对称阵就可以断言必有AB,BAAB,BA相似了

  • 为什么有的矩阵特征值相同,却不相似?因为各特征值的代数重数相同,几何重数却不一定相同。即,两个线性变换的特征值相同只代表他们的缩放倍率相同,但缩放方向可能不同,那么他们就可能并不是同一个线性变换,简单例子如(0000)\left(\begin{matrix}0&0\\0&0\\\end{matrix}\right)(1000)\left(\begin{matrix}1&0\\0&0\\\end{matrix}\right),二者特征值均为0000,即都会产生“压缩”,但前者是将平行四边形“压”成点,而后者仅是“压”成线,缩放效果不同,对应的特征向量也不相同。更一般的,即使特征值相同、二者的对应的代数重数与几何重数也都相同,矩阵也不一定相似。“充要”的办法,还是只能考虑初等因子和Jordan标准型,但计算量十分地大;如果两个矩阵均可相似对角化,且特征方程相同 / 特征值相同,则两矩阵相似。

矩阵的逆

  • 矩阵求逆的四种基本⽅法:

    1. 公式法,针对⼆阶⽅阵的简便算法:

      [abcd]=1A[dbca] \left[\begin{matrix}a&b\\c&d\\\end{matrix}\right]=\frac1{|A|}\left[\begin{matrix}d&-b\\-c&a\\\end{matrix}\right]
    2. 伴随矩阵法,通⽤但麻烦:A1=1AAA^{-1}=\frac1{|A|}A^{\ast},重要性更多地体现在理论上

      本章末给出了该方法的改进计算法,使得计算时不必再考虑代数余子式的符号的问题

    3. 初等变换法,即高斯消元法,,有行变换与列变换两种方法:

      • 行变换方法:将矩阵AA作为分块,右接单位阵EE进行增广,即[AE][A|E],经初等行变化将左分块AA变为EE时得到结果[EA1][E|A^{-1}](可以看作整体左乘A1A^{-1}的结果,这是为什么只能进初等行变换的原因),再”取出“逆矩阵即可;这种方法可以推广到求A1BA^{-1}B,对[AB][A|B]进行同样的操作即可

      • 列变化方法:下接EE,然后做相应的初等列变换即可

      实际上右接EE是在“记录”将AA化为EE时的行变换,下接EE则在“记录”列变换;换一个角度看,对于[AE][A|E],左乘A1A^{-1}即得[EA1][E|A^{-1}],由于左乘对应初等行变换,所以将AA用初等行变换化为EE时右边剩余的部分即为A1A^{-1}。对分块矩阵也可以类似操作,但是在试图利用分块阵的逆时要注意子阵是否可逆呦!

    4. 在计算机中,使用LU分解法、SVD分解法、QR分解法更容易处理,而且适合并行计算

  • 逆与与转置可交换;与指数也可交换;与伴随也可交换,即(A)1=(A1)=1AA(A^{\ast})^{-1}=(A^{-1})^{\ast}=\frac1{|A|}A

  • 基本初等矩阵的逆:

    1. 交换某两行或某两列,由于交换两次后恢复原矩阵,因此逆就是自身

      [111]1=[111] \left[\begin{matrix}&1&\\1&&\\&&1\\\end{matrix}\right]^{-1}=\left[\begin{matrix}&1&\\1&&\\&&1\\\end{matrix}\right]
    2. 某一行或某一列倍乘kkk0k\neq0),逆是主对角线上的那个kk取其倒数1k\frac1k,其余元素不变

      [k11]1=[1k11] \left[\begin{matrix}k&&\\&1&\\&&1\\\end{matrix}\right]^{-1}=\left[\begin{matrix}\frac1k&&\\&1&\\&&1\\\end{matrix}\right]
    3. 某一行(某一列)倍乘kk后加到另一行(另一列),逆是非主对角线上的那个kk取其相反数k-k,其余元素不变

      [1k11]1=[1k11] \left[\begin{matrix}1&k&\\&1&\\&&1\\\end{matrix}\right]^{-1}=\left[\begin{matrix}1&-k&\\&1&\\&&1\\\end{matrix}\right]

    很多时候,利用初等矩阵的逆与对应的初等变换来计算矩阵乘法,能够极大地减少计算量

    对于复合的初等矩阵,也可以这样逐步操作求逆,但是一定要调换顺序,因为(ABC)1=C1B1A1(ABC)^{-1}=C^{-1}B^{-1}A^{-1}

    因此,本来是在矩阵左边乘起来的行变换,在式子取逆后也就变成了右乘,这时他是相应的列变换

  • 分块矩阵的逆:参见另一篇文章线性回归的理论与应用的附录: 分块矩阵的逆 部分,在此给出最简单的分块矩阵的逆:

    • A,BA,B均为可逆矩阵时(不要求同阶),有(AOOB)1=(A1OOB1)\left(\begin{matrix}A&O\\O&B\\\end{matrix}\right)^{-1}=\left(\begin{matrix}A^{-1}&O\\O&B^{-1}\\\end{matrix}\right),其实这可以通过复合初等变换直接得到
    • A,BA,B均为可逆矩阵时(不要求同阶),有(OABO)1=(OB1A1O)\left(\begin{matrix}O&A\\B&O\\\end{matrix}\right)^{-1}=\left(\begin{matrix}O&B^{-1}\\A^{-1}&O\\\end{matrix}\right)
    • A,CA,C均为可逆矩阵时(不要求BB为方阵),有(AOBC)1=(A1OC1BA1B1)\left(\begin{matrix}A&O\\B&C\\\end{matrix}\right)^{-1}=\left(\begin{matrix}A^{-1}&O\\-C^{-1}BA^{-1}&B^{-1}\\\end{matrix}\right)
  • 任何nn阶可逆方阵AA,逆A1A^{-1}一定是AA的多项式,且该多项式的形式不唯一;如果限定该多项式最高次小于极小多项式次数,则多项式是唯一存在的(不断乘上特征多项式,总能用更高次的多项式表示A1A^{-1}

    任何nn阶方阵AA,伴随矩阵AA^{\ast}一定是AA的多项式,对AA不可逆情形可以考虑摄动法证明

  • 对于三阶矩阵的伴随矩阵 / 逆矩阵,有一些相对而言更方便的计算方法。这里给出一种可以在计算中不用考虑代数余子式符号(1)m+n(-1)^{m+n}的计算法,以计算矩阵(122312253)\left(\begin{matrix}1&2&-2\\3&1&2\\2&-5&3\end{matrix}\right)的逆为例:

    1. 首先将矩阵拓展至55列,其中第4,54,5列分别照抄原矩阵的第1,21,2列,即

      (122123123125325) \left(\begin{array}{ccc:cc} 1&2&-2&1&2\\ 3&1&2&3&1\\ 2&-5&3&2&-5 \end{array}\right)
    2. 接着将新矩阵再拓展至55行,其中第4,54,5行分别照抄新矩阵的第1,21,2行,即

      (1221231231253251221231231) \left(\begin{array}{ccccc} 1&2&-2&1&2\\ 3&1&2&3&1\\ 2&-5&3&2&-5\\ \hdashline 1&2&-2&1&2\\ 3&1&2&3&1 \end{array}\right)
    3. 划去第11行与第11列不考虑,即

      (1221231231253251221231231)(1231532522121231) \left(\begin{array}{c|cccc} 1&2&-2&1&2\\ \hline 3&1&2&3&1\\ 2&-5&3&2&-5\\ 1&2&-2&1&2\\ 3&1&2&3&1 \end{array}\right)\Rightarrow\left(\begin{array}{cccc} 1&2&3&1\\ -5&3&2&-5\\ 2&-2&1&2\\ 1&2&3&1 \end{array}\right)
    4. 接着计算新矩阵的每个相邻行列的二阶主子式,共计3×3=93\times3=9个,他们相对位置的值分别就是(A)T(A^{\ast})^T对应位置元素的值,也就是说,不妨记新矩阵为B4×4B_{4\times4},则

      Aij=Bj,iBj,i+1Bj+1,iBj+1,i+1,      1i,j4 A^{\ast}_{ij}=\left|\begin{matrix}B_{j,i}&B_{j,i+1}\\B_{j+1,i}&B_{j+1,i+1}\end{matrix}\right|,\ \ \ \ \ \ 1\leqslant i,j\leqslant4

      分别计算,可以得到

      (1231532522121231)(125353222212233232212123312525121231)=A \left(\begin{array}{cccc} 1&2&3&1\\ -5&3&2&-5\\ 2&-2&1&2\\ 1&2&3&1 \end{array}\right)\to\left(\begin{array}{ccc} \left|\begin{matrix}1&2\\-5&3\end{matrix}\right|&\left|\begin{matrix}-5&3\\2&-2\end{matrix}\right|&\left|\begin{matrix}2&-2\\1&2\end{matrix}\right|\\ \left|\begin{matrix}2&3\\3&2\end{matrix}\right|&\left|\begin{matrix}3&2\\-2&1\end{matrix}\right|&\left|\begin{matrix}-2&1\\2&3\end{matrix}\right|\\ \left|\begin{matrix}3&1\\2&-5\end{matrix}\right|&\left|\begin{matrix}2&-5\\1&2\end{matrix}\right|&\left|\begin{matrix}1&2\\3&1\end{matrix}\right| \end{array}\right)=A^{\ast}

      二阶行列式是很好计算的,不难得

      A=(13465781795) A^{\ast}=\left(\begin{matrix}13&4&6\\-5&7&-8\\-17&9&-5\\\end{matrix}\right)
    5. 如果要进一步计算原矩阵的逆,按伴随矩阵与逆矩阵的关系,计算出行列式A|A|然后代入A1=1AAA^{-1}=\frac1{|A|}A^{\ast}即可。但这里并不需要在从AA出发计算A|A|,根据行列式的辅因子展开,直接用AA的第一行点乘AA^{\ast}的第一行结果即是AA(乘其他行或者乘列当然也都是可行的),所以

      A=(1,2,2)(13517)=1310+34=37 |A|=\left(\begin{matrix}1,2,-2\end{matrix}\right)\cdot\left(\begin{matrix}13\\-5\\-17\end{matrix}\right)=13-10+34=37

      因此

      A=137(13465781795) A^{\ast}=\frac1{37}\left(\begin{matrix}13&4&6\\-5&7&-8\\-17&9&-5\\\end{matrix}\right)

      这一方法的“好”在于不用考虑恼人的符号了

矩阵的秩

  • 矩阵A\boldsymbol{A}秩的等价定义:秩等于……

    1. 最⾼阶不为零⼦式的阶数
    2. ⾏向量组或列向量组的极⼤线性⽆关组中所含向量个数
    3. 列数减去Ax=0\boldsymbol{Ax=0}解空间的维数(kernel的维数)
      • 或者说是减去基础解系中自由变量的个数
      • 或者说是减去线性无关解的个数
    4. A\boldsymbol{A}是方阵时,秩等于阶数减去零特征值的特征子空间维数
      • 或者说是阶数减去零特征值的几何重数
    5. 线性变换值域(image,像空间)的维数,即 rank(A)=dim(值域(A))\text{rank}(A)=\dim\big(\text{值域}(A)\big)
  • 欲求一个具体矩阵的秩,做初等行(列)变换将矩阵化为行(列)阶梯型矩阵不失为一个好办法

  • 矩阵秩的等式与不等式:

    1. 0r(A)min{n,m}0\leqslant r(A)\leqslant \min\{n,m\}ARn×mA\in\mathbb{R}^{n\times m}

    2. r(A)=r(AT)=r(AAT)=r(ATA)=if n=mr(An)r(A)=r(A^T)=r(AA^T)=r(A^TA)\xlongequal{\text{if }\,n=m}r(A^n)ARn×mA\in\mathbb{R}^{n\times m}

    3. r(A+B)r[(A,B)]r(A)+r(B)r(A+B)\leqslant r\big[(A,B)\big]\leqslant r(A)+r(B)

    4. max{r(A),r(B)}r[(A,B)]r(A)+r(B)\max\{r(A),r(B)\}\leqslant r\big[(A,B)\big]\leqslant r(A)+r(B)

    5. r(AB)r(A),r(B)r(AB)\leqslant r(A),r(B)

    6. if AB=O, then r(A)+r(B)n,  n\text{if }AB=O,\text{ then }r(A)+r(B)\leqslant n,\ \ nAA的列数或BB的行数

      万分注意,nn并不是零矩阵OO的行数或列数而是AA的列数或BB的行数。例如,假设AAm×nm\times n矩阵、BBn×kn\times k矩阵,若有AB=Om×kAB=O_{m\times k},则r(A)+r(B)nr(A)+r(B)\leqslant n,该不等式与零矩阵OO的形状没有任何关系!

    7. AA列满秩,则r(AB)=r(B)r(AB)=r(B)矩阵左乘列满秩矩阵 / 右乘行满秩矩阵不改变秩

    8. r([AOOB])=r(A)+r(B)r\left(\left[\begin{matrix}A&O\\O&B\\\end{matrix}\right]\right)=r(A)+r(B)

    9. r(A)+r(B)r([AOCB])r(A)+r(B)+r(C)r(A)+r(B)\leqslant r\left(\left[\begin{matrix}A&O\\C&B\\\end{matrix}\right]\right)\leqslant r(A)+r(B)+r(C)

    10. r(A)+r(E+A)nr(A)+r(E+A)\geqslant nAAnn阶矩阵

    11. Frobenius:  r(ABC)r(AB)+r(BC)r(B)Frobenius:\ \ r(ABC)\geqslant r(AB)+r(BC)-r(B)

    12. Sylvester:  r(AB)r(A)+r(B)n\Rightarrow Sylvester:\ \ r(AB)\geqslant r(A)+r(B)-n

  • 伴随矩阵的秩:对于nn阶方阵AA

    rank(A)={n,rank(A)=n1,rank(A)=n10,rank(A)<n1 \text{rank}(A^{\ast})= \left\{\begin{aligned} &n,&&\text{rank}(A)=n\\ &1,&&\text{rank}(A)=n-1\\ &0,&&\text{rank}(A)\lt n-1 \end{aligned}\right.
  • 一般而言,对于等价的nn阶矩阵A,BA,B不一定成立r(AB)=r(BA)r(AB)=r(BA),即使A,BA,B有相同的特征多项式与特征值——因为r(AB)=r(BA)r(AB)=r(BA)的充要条件是ABABBABA的零特征值的代数重数相同、几何重数也相同,但通常来说ABABBABA只有零特征值的代数重数必然相同,几何重数是不一定相同的;

    同理也不一定成立r(A2)=r(B2)r(A^2)=r(B^2)这在前文是已经有所提及的;

    在后文“特征值、特征向量与特征子空间”中会给出秩与特征值、特征子空间的关系,实际上方阵的秩等于阶数减去零特征值的几何重数,这样一来为何存在r(AB)r(BA)r(AB)\neq r(BA)就显而易见了;也可以知道A2A^2B2B^2。由此可以导出推论:

    • 如果A,BA,B均满秩,则r(AB)=r(BA)=nr(AB)=r(BA)=n

    • 如果AB,BAAB,BA均有nn个线性无关的特征向量,则r(AB)=r(BA)r(AB)=r(BA)

    r(A)=r(B)r(A)=r(B)r(AB)r(BA)r(AB)\neq r(BA)r(A2)r(B2)r(A^2)\neq r(B^2)的一个经典例子是:

    A=(111000000)n×n     r(A)=1 \color{#6666FF}{A=\left(\begin{matrix}1&1&\cdots&1\\0&0&\cdots&0\\\vdots&\vdots&&\vdots\\0&0&\cdots&0\end{matrix}\right)_{n\times n}\Rightarrow\ \ \ \ \ r(A)=1} B=(111111000)n×n     r(B)=1 \color{#6666FF}{B=\left(\begin{matrix}1&1&\cdots&1\\-1&-1&\cdots&-1\\\vdots&\vdots&&\vdots\\0&0&\cdots&0\end{matrix}\right)_{n\times n}\Rightarrow\ \ \ \ \ r(B)=1}

    A,BA,B具有相同的秩11,容易验证:

    AB=On×nr(AB)=0BA=Br(BA)=1 \begin{align}&\color{#6666FF}{AB=O_{n\times n}}&&\color{#6666FF}{\Rightarrow}&&\color{#6666FF}{r(AB)=0}\\&\color{#6666FF}{BA=B}&&\color{#6666FF}{\Rightarrow}&&\color{#6666FF}{r(BA)=1}\end{align} \color{#6666FF}{-------------------}\notag A2=Ar(A2)=1B2=On×nr(B2)=0 \begin{align}&\color{#6666FF}{A^2=A}&&\color{#6666FF}{\Rightarrow}&&\color{#6666FF}{r(A^2)=1}\\&\color{#6666FF}{B^2=O_{n\times n}}&&\color{#6666FF}{\Rightarrow}&&\color{#6666FF}{r(B^2)=0}\end{align}

    这个例子十分重要,在本文已经是第二次出现了

线性变换与特殊矩阵

  • 正交变换:是一种线性变换,定义是从实或复的内积空间映射到自身且保持内积不变的变换。由于模长与夹角是用内积定义的,所以正交变换不改变图形的面积、大小,标准正交基经正交变换后仍为标准正交基。注意,在有限维空间下正交变换不一定等价于正交矩阵,从标准正交基变换到另一组标准正交基的过渡矩阵才是正交矩阵。在欧式空间中,正交变换只包含瑕旋转

  • 正交矩阵:AHA=EA^HA=E,在Rn×m\mathbb{R}^{n\times m}上表现为AT=A1A^T=A^{-1};正交矩阵的特点是行或列向量间正交,且长度均为11。正交矩阵的特征值只可能为±1\pm1,这体现在正交变换不改变图形大小,即仅包含旋转与反射及其组合。正交矩阵的特征值只可能为111-1,结合正交变换的性质这是容易理解的

  • 判断正交矩阵,除了验证是否有ATA=EA^TA=E、行列向量是否两两正交,最简便的办法是先看看各行或列平方和是否为11,如果不是则必然不是正交矩阵

  • 正交矩阵的逆矩阵也是正交矩阵,正交矩阵的伴随矩阵也是正交矩阵

  • 双线性函数:是内积的推广;和线性函数类似,在有限维线性空间中,由他对基的作用而唯一确定

  • 合同变换:互相合同的矩阵,是双线性函数在不同基下的度量矩阵

  • 矩阵合同:矩阵的合同变换,可以认为是对行列同时施加相同的操作

  • 正交变换系合同变换

  • 相似变换:在欧式空间中体现为图形的形状不变,尽管大小、方向与位置都可能改变;在矩阵的相似变换体现是两矩阵相似。相似变换实际上是同一个线性变换在不同基下的度量矩阵

矩阵杂例

特殊矩阵

  • 伴随矩阵{Aij}\{A_{ij}\},其中AijA_{ij}aija_{ij}的代数余子式

    • (kA)=kn1A(kA)^{\ast}=k^{n-1}A^{\ast}

    • 伴随矩阵的伴随矩阵:(A)=An2A(A^{\ast})^{\ast}=|A|^{n-2}A

    • 将伴随与转置视为算子,则他们是可交换的:(A)T=(AT)(A^{\ast})^T=(A^T)^{\ast};与逆同样是可交换的,(A)1=(A1)=1AA(A^{\ast})^{-1}=(A^{-1})^{\ast}=\frac1{|A|}A

    • 当方阵不可逆时,他的伴随矩阵与他的积为OO:恒有AA=AA=AEA^{\ast}A=AA^{\ast}=|A|E,当AA不可逆有AA=AA=OA^{\ast}A=AA^{\ast}=O

    • 已知伴随矩阵,如何求原矩阵?注意到只有伴随矩阵满秩时才能惟一求解(A1=1AAA^{-1}=\frac1{|A|}A^{\ast},而逆矩阵是唯一的),否则对应的原矩阵不唯一;当AA^{\ast}满秩时,可利用A=(1AA)1=An1  (A)1A=\left(\frac1{|A|}A^{\ast}\right)^{-1}=\sqrt[n-1]{|A^{\ast}|}\ \ (A^{\ast})^{-1},其中(A)1(A^{\ast})^{-1}可以通过高斯消元法求解

    • 和转置有(AB)T=BTAT(AB)^T=B^TA^T、逆有(AB)1=B1A1(AB)^{-1}=B^{-1}A^{-1}类似的,伴随有(AB)=BA(AB)^{\ast}=B^{\ast}A^{\ast},三者均可任意交换计算次序

    • 伴随矩阵的秩:

      rank(A)={n,rank(A)=n1,rank(A)=n10,rank(A)<n1 \text{rank}(A^{\ast})= \left\{\begin{aligned} &n,&&\text{rank}(A)=n\\ &1,&&\text{rank}(A)=n-1\\ &0,&&\text{rank}(A)\lt n-1 \end{aligned}\right.

      特别的,当r(A)=n1r(A)=n-1r(A)=1r(A^{\ast})=1,如果AA可相似对角化,则AA^{\ast}的唯一非零特征值的值等于AAn1n-1个非零特征值的乘积,也等于tr(A)\mathrm{tr}(A^{\ast});由于r(A)=1r(A^{\ast})=1AA^{\ast}的行或列之间也一定是成比例的

    • 伴随矩阵一定可以被表为原矩阵的某个多项式

    • 如果矩阵是对称阵,则其伴随矩阵也一定对称(根据定义易见)

  • 矩阵AA的转置矩阵ATA^T

    • AATA\sim A^T,即AAATA^T相似,因此二者具有相同的特征多项式与特征值

    • 不同特征值对应的AA的特征向量与ATA^T的特征向量必然正交

      这里做一个简短证明:设Aα1=λ1α1A\alpha_1=\lambda_1\alpha_1ATα2=λ2α2A^T\alpha_2=\lambda_2\alpha_2,其中λ1λ2\lambda_1\neq\lambda_2α1,α2\alpha_1,\alpha_2均为非零向量,则有

      λ1α1Tα2=(Aα1)Tα2=α1T(ATα2)=λ2α1Tα2 \lambda_1\alpha^T_1\alpha_2=(A\alpha_1)^T\alpha_2=\alpha^T_1(A^T\alpha_2)=\lambda_2\alpha^T_1\alpha_2

      λ1λ2\lambda_1\neq\lambda_2,所以只能有α1Tα2=0\alpha^T_1\alpha_2=0,证毕

  • AATAA^TATAA^TA的性质总结:在AA为实矩阵前提下,

    • AATAA^TATAA^TA均为实对称矩阵,当AA是方阵时AAT,ATAAA^T,A^TA特征值均相等且非负,而且其特征值恰为AA特征值的平方,因此有相似关系AATATAAA^T\sim A^TA
    • 由相似可导出矩阵等价,即r(AAT)=r(ATA)r(AA^T)=r(A^TA),这一性质对于复数域上的矩阵仍成立;又由于AA是实矩阵,故还有r(AAT)=r(ATA)=r(A)r(AA^T)=r(A^TA)=r(A)
    • 如果AA是方阵,则AATAA^TATAA^TA正定的充要条件是AA没有00特征值
    • 如果AAT=OAA^T=O,则ATA=OA^TA=O,当AA是方阵时,由于r(AAT)=r(ATA)=r(A)=0r(AA^T)=r(A^TA)=r(A)=0,因此A=OA=O
    • 但是一般来说AATATAAA^T\neq A^TA,即使AA是方阵
    • 如果AA是方阵,则当且仅当AA是上三角阵甚至于对角阵时AA才与ATA^T可交换,即AAT=ATAAA^T=A^TA
  • aaTaa^T也是对称的正定矩阵,其秩一定为11,而且tr(aaT)=aTa\text{tr}(aa^T)=a^Ta,这类矩阵的性质将在下文中讨论

  • 正交矩阵:AAT=ATA=EAT=A1AA^T=A^TA=E\Rightarrow A^T=A^{-1},特征值必为111-1,行列式必为111-1,矩阵的行向量间或者列向量间必定两两正交,而且每个行向量与列向量的长度均为11

    两个正交矩阵相乘,结果仍是正交矩阵;任何矩阵与正交矩阵相乘,特征值都不会变化(正交变换也是不改变向量长度的)

  • 对于nn阶实矩阵而言,矩阵是实对称阵的充要条件是矩阵有nn个两两正交的特征向量

    对任何对称阵AA都有A=12(A+AT)A=\frac12(A+A^T),对任何反对称阵AA都有A=12(AAT)A=\frac12(A-A^T),对任何方阵都有A=12(A+AT)+12(AAT)A=\frac12(A+A^T)+\frac12(A-A^T)

  • 反对称阵:相信绝大多数对线性代数有所了解的人都不会对实对称阵感到陌生,这里浅浅归纳一下出现频率没有那么高的反对称阵(AT=AA^T=-A)的性质:

    1. 反对称阵主子式元素必为00,因此迹也为00
    2. 奇数阶反对称阵行列式必为0\boldsymbol0
    3. 任何反对称矩阵行列式非负
    4. nn阶方阵AA是反对称阵的充要条件是xRn\forall x\in\mathbb{R}^n,有xTAx=0x^TAx=0(其实在任何数域上都是成立的)
    5. 实反对称阵的特征值只能为00或纯虚数
    6. 实反对称阵的秩必为偶数

    参考文章:知乎: 反对称阵相关性质的总结(高等代数 · 性质齐全且全部给出证明,并辅以例题)

计算杂例

  • 关于An\boldsymbol{A^n}的求法总结如下:

    1. 如果矩阵AA的秩为11,则可以分解为两个向量之积αβT\alpha\beta^T,容易验证此时必有An=kn1AA^n=k^{n-1}A,只要求出kk即可;关于矩阵αβT\alpha\beta^T的性质将在特征值与特征向量小节中做完整归纳

      事实上有结论:k=tr(A)=aTb\boldsymbol{k}=\text{tr}(\boldsymbol{A})=\boldsymbol{a}^T\boldsymbol{b}

      • 特别地, [kkkkkkkkk]n×nm=(nk)m1[kkkkkkkkk]n×n=k(nk)m1[111111111]n×n \begin{aligned}\left[\begin{matrix}k&k&\cdots&k\\k&k&\cdots&k\\\vdots&\vdots&&\vdots\\k&k&\cdots&k\\\end{matrix}\right]^m_{n\times n}&=(nk)^{m-1}\cdot\left[\begin{matrix}k&k&\cdots&k\\k&k&\cdots&k\\\vdots&\vdots&&\vdots\\k&k&\cdots&k\\\end{matrix}\right]_{n\times n}\\&=k(nk)^{m-1}\cdot\left[\begin{matrix}1&1&\cdots&1\\1&1&\cdots&1\\\vdots&\vdots&&\vdots\\1&1&\cdots&1\\\end{matrix}\right]_{n\times n}\end{aligned}
    2. 所有主对角线元素为00的上下三角阵都是nn次幂零矩阵(反之不成立),nn阶这样的矩阵AA的第nn次方必为OO,例如:

      A=[123456]A2=[41724]A3=[24]A4=O \begin{aligned} A&=\left[\begin{matrix}&1&2&3\\&&4&5\\&&&6\\&&&\\\end{matrix}\right]&&A^2=\left[\begin{matrix}&&4&17\\&&&24\\&&&\\&&&\\\end{matrix}\right]\\ A^3&=\left[\begin{matrix}&&&24\\&&&\\&&&\\&&&\\\end{matrix}\right]&&A^4=O \end{aligned}

      可以观察到趋于OO时,元素的变化也是有规律的,

      利用矩阵加法,一般的上下三角阵nn次方也可以计算,如:

      [123141]n=([111]+[234])n=En+Cn1En1[234]+Cn2En2[234]2+0+0+=[12nn(4n1)14n1] \begin{align} \left[\begin{matrix}1&2&3\\&1&4\\&&1\\\end{matrix}\right]^n&=\left(\left[\begin{matrix}1&&\\&1&\\&&1\\\end{matrix}\right]+\left[\begin{matrix}&2&3\\&&4\\&&\\\end{matrix}\right]\right)^n\\ &=E^n+C^1_nE^{n-1}\left[\begin{matrix}&2&3\\&&4\\&&\\\end{matrix}\right]+C^2_nE^{n-2}\left[\begin{matrix}&2&3\\&&4\\&&\\\end{matrix}\right]^2+0+0+\cdots\\ &=\left[\begin{matrix}1&2n&n(4n-1)\\&1&4n\\&&1\\\end{matrix}\right] \end{align}

      事实上Jordan标准型就可以被拆分为对角阵和幂零矩阵的和;由此可见,幂零矩阵虽然特征值均为00,但其本身不一定为零矩阵

    3. 利用对角化的快速幂方法(相似对角化,考虑特征值分解),若存在可逆阵PP使得A=PΛP1A=P\Lambda P^{-1}Λ\Lambda为对角矩阵,利用对角阵(λij)(\lambda_{ij})(λij)n=(λijn)(\lambda_{ij})^n=(\lambda^n_{ij})进而计算BnB^n,有An=PΛP1PΛP1PΛP1=PΛnP1A^n=P\Lambda P^{-1}P\Lambda P^{-1}\cdots P\Lambda P^{-1}=P\Lambda^nP^{-1}PP可以为任一特征向量矩阵

      推论:该方法也可以用于直接表出AnξA^n\xi的通式,只要ξ\xi能被表示为AA的线性无关的特征向量的线性组合

    4. 对于以下的类对角阵,当A,BA,B为方阵时,有

      [AOOB]n=[AnOOBn] \left[\begin{matrix}A&O\\O&B\\\end{matrix}\right]^n=\left[\begin{matrix}A^n&O\\O&B^n\\\end{matrix}\right]

      A,BA,B为同阶方阵时(以下公式在两矩阵不同阶时不成立),有

      [OABO]2=[ABOOBA] \left[\begin{matrix}O&A\\B&O\\\end{matrix}\right]^2=\left[\begin{matrix}AB&O\\O&BA\\\end{matrix}\right]

      因此,

      kN,  {[OABO]2k=[(AB)kOO(BA)k][OABO]2k+1=[(AB)kOO(BA)k][OABO]=[O(AB)kA(BA)kBO] \Rightarrow\forall k\in\mathbb{N},\ \ \left\{\begin{aligned} &\left[\begin{matrix}O&A\\B&O\\\end{matrix}\right]^{2k}=\left[\begin{matrix}(AB)^k&O\\O&(BA)^k\\\end{matrix}\right]\\ &\left[\begin{matrix}O&A\\B&O\\\end{matrix}\right]^{2k+1}=\left[\begin{matrix}(AB)^k&O\\O&(BA)^k\\\end{matrix}\right]\left[\begin{matrix}O&A\\B&O\\\end{matrix}\right]=\left[\begin{matrix}O&(AB)^kA\\(BA)^kB&O\\\end{matrix}\right] \end{aligned}\right.
    5. 通用方法:化为Jordan标准型,注意到这是一种上三角矩阵(类对角化),于是无论是结合第11点还是结合第33点,所有的矩阵都可以计算nn次幂通式了。不过该方法笔算的计算相对大得多……

  • 解矩阵方程AX=B\boldsymbol{AX=B}的方法列在了下文“线性方程组”中

  • 给定两个同阶矩阵A,BA,B,如果存在可逆矩阵PP使得P1AP=BP^{-1}AP=B,也就是说AA可以经相似变换PP化为BB,那么该如何寻找所有可能的PP呢?换句话说,就是如何求任意两相似矩阵间的相似变换。

    方法一:当AABB可相似对角化时,可以考虑该方法。分别计算A,BA,B的特征值与特征向量将其对角化,不妨设分别有P11AP1=ΛP^{-1}_1AP_1=\LambdaP21BP2=ΛP^{-1}_2BP_2=\Lambda,联立得P11AP1=P21BP2P^{-1}_1AP_1=P^{-1}_2BP_2,因此有P2P11AP1P21=BP_2P^{-1}_1AP_1P^{-1}_2=B,所以可令P=P1P21P=P_1P^{-1}_2,则这样得到的PP就是满足要求的一个解。该方法较为局限,一是只有在A,BA,B相似于同一对角阵时才能使用,二是不能解出所有可能的PP,只是给出了一个可行的解。

    方法二:该方法从特征值与特征向量原理出发,更为通用。设A,BA,B均为nn阶方阵,记P=(α1,α2,,αn)P=(\alpha_1,\alpha_2,\cdots,\alpha_n),其中{αi}\{\alpha_i\}是线性无关的nn维列向量组,根据条件P1AP=BP^{-1}AP=B,有

    AP=(Aα1,Aα2,,Aαn)=PB=(α1,α2,,αn)B AP=(A\alpha_1,A\alpha_2,\cdots,A\alpha_n)=PB=(\alpha_1,\alpha_2,\cdots,\alpha_n)B

    注意到上式中(α1,α2,,αn)B(\alpha_1,\alpha_2,\cdots,\alpha_n)B是可以直接计算的列向量组(α1,α2,,αn)(\alpha_1,\alpha_2,\cdots,\alpha_n)的线性组合,即

    {Aα1=b11α1+b21α2++bn1αnAα2=b12α1+b22α2++bn2αn                        Aαn=b1nα1+b2nα2++bnnαn \left\{\begin{aligned} &A\alpha_1=b_{11}\alpha_1+b_{21}\alpha_2+\cdots+b_{n1}\alpha_n\\ &A\alpha_2=b_{12}\alpha_1+b_{22}\alpha_2+\cdots+b_{n2}\alpha_n\\ &\ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \cdots\ \cdots\\ &A\alpha_n=b_{1n}\alpha_1+b_{2n}\alpha_2+\cdots+b_{nn}\alpha_n\\ \end{aligned}\right.

    到这里,如果有一部分方程等价为AA的特征向量的定义,则可以计算AA相应特征值的特征向量来优先解出这个向量,再代回方程组解出其他的向量;如果AA是一个Jordan标准型,则可以求循环基;如果上述方法都不可用,则只好设n2n^2个未知数硬解PP了。

  • 给定一个AA,如果存在下三角可逆阵PP与上三角可逆阵QQ使得PAQ=ΛPAQ=\Lambda,其中Λ\Lambda是一个对角阵,那么该如何寻找这样的PPQQ

    尽管这不是相似对角化问题,但由于PPQQ是可逆的,因此该问题等价于找出一系列的有限个初等行列变换,使得AA化为对角阵。

    本着和矩阵求逆一样用分块阵“记录”变换的思想,这种问题可以分两步解决:

    • (A,E)(A,E)作初等变换,将左边的AA化为上三角阵UU,整体上(A,E)(U,P)(A,E)\to(U,P),实际上是P(A,E)=(U,P)P(A,E)=(U,P),注意左乘矩阵对应行变换;
    • (UE)\left(\begin{matrix}U\\E\end{matrix}\right)作初等变换,将上边的UU化为对角阵Λ\Lambda,整体上(UE)(ΛQ)\left(\begin{matrix}U\\E\end{matrix}\right)\to\left(\begin{matrix}\Lambda\\Q\end{matrix}\right),实际上是(UE)Q=(ΛQ)\left(\begin{matrix}U\\E\end{matrix}\right)Q=\left(\begin{matrix}\Lambda\\Q\end{matrix}\right),注意右乘矩阵对应列变换;
    • 如此一来,就得到了使得PAQ=ΛPAQ=\LambdaPPQQ
  • 凡是可以相似对角化且特征值均非负的实方阵AA,我们都可以很方便地算出其实平方根矩阵A12A^{\frac12}:设特征值均非负的矩阵AA可相似对角化(即存在一可逆矩阵PP使得P1AP=ΛP^{-1}AP=\Lambda,其中Λ\Lambda是以AA特征值为对角元的对角矩阵),接着记AA的平方根矩阵为BB,也就是设B2=AB^2=A,则B=PΛ12P1B=P\Lambda^{\frac12}P^{-1},其中Λ12\Lambda^{\frac12}是将Λ\Lambda对角元取平方根后得到的新对角阵。

    这个方法的原理很简单,因为B2=PΛ12Λ12P1=PΛP1=AB^2=P\Lambda^{\frac12}\Lambda^{\frac12}P^{-1}=P\Lambda P^{-1}=A,按同样的思路也可以计算“立方根矩阵”、“四次根矩阵”等;由于正定矩阵必可对角化且特征值均非负,所以对于正定矩阵必然可以用这个方法求其平方根矩阵。

特别性质

  • C=ABC=AB行向量可以由BB行向量线性表示,ABAB列向量可以由AA列向量线性表示;

    利用分块矩阵这是非常直观的,不妨记AAm×nm\times n矩阵、BBn×sn\times s矩阵,对于前者按行分块有

    [a11a12a1na21a22a2nam1am2amn][β1Tβ2TβnT]=[γ1Tγ2TγmT] \left[\begin{matrix}a_{11}&a_{12}&\cdots&a_{1n}\\a_{21}&a_{22}&\cdots&a_{2n}\\\vdots&\vdots&&\vdots\\a_{m1}&a_{m2}&\cdots&a_{mn}\\\end{matrix}\right]\left[\begin{matrix}\boldsymbol{\beta}^T_1\\\boldsymbol{\beta}^T_2\\\vdots\\\boldsymbol{\beta}^T_n\end{matrix}\right]=\left[\begin{matrix}\boldsymbol{\gamma}^T_1\\\boldsymbol{\gamma}^T_2\\\vdots\\\boldsymbol{\gamma}^T_m\end{matrix}\right] {a11β1T+a12β2T++a1nβnT=γ1Ta21β1T+a22β2T++a2nβnT=γ2T                         am1β1T+am2β2T++amnβnT=γmT        \Rightarrow\left\{\begin{aligned} &a_{11}\boldsymbol{\beta}^T_1+a_{12}\boldsymbol{\beta}^T_2+\cdots+a_{1n}\boldsymbol{\beta}^T_n=\boldsymbol{\gamma}^T_1\\ &a_{21}\boldsymbol{\beta}^T_1+a_{22}\boldsymbol{\beta}^T_2+\cdots+a_{2n}\boldsymbol{\beta}^T_n=\boldsymbol{\gamma}^T_2\\ &\ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \cdots\ \ \cdots\\ &a_{m1}\boldsymbol{\beta}^T_1+a_{m2}\boldsymbol{\beta}^T_2+\cdots+a_{mn}\boldsymbol{\beta}^T_n=\boldsymbol{\gamma}^T_m\\ \end{aligned}\right.\ \ \ \ \ \ \

    C=(γij)C=(\gamma_{ij})的行向列可以由BB的行向量线性表出;同理,类似操作按列分块则可以得到CC的列向量可以由AA的列向量线性表出;

    同时,如果C=ABC=AB可逆,则AA行向量必然线性无关、BB列向量必然线性无关。以AA的行向量为例,不妨设AAn×mn\times m矩阵、BBm×nm\times n矩阵,ABAB可逆时有n=r(AB)r(A)nn=r(AB)\leqslant r(A)\leqslant n,同时注意到AA恰有nn个行向量,所以AAnn个行向量必然线性无关;对BB同理,可以知道BBmm个列向量必然线性无关

  • 关于矩阵可交换问题的讨论,对于nn阶方阵A,BA,B有如下重要特征:

    • “与矩阵AA可交换的矩阵均为AA的多项式”,这一断言成立的充要条件是AA的极小多项式与其特征多项式相等[1]^{[1]}

    • 如果矩阵AA的Jordan标准型中没有标量矩阵,则A,BA,B可交换的充要条件是BBAAn1n-1阶多项式[2]^{[2]},所以大多数情况下可以粗略地认为这是无条件的充要条件

      特例 1:对于非单位阵的二阶矩阵AAAB=BAAB=BA的充要条件是B=aE+bAB=aE+bA

      特例 2:可逆方阵AA的逆A1A^{-1}总是与AA可交换,可证明A1A^{-1}必然是AA的多项式

      特例 3:任何方阵AA的伴随矩阵AA^{\ast}总是与AA可交换,可证明AA^{\ast}必然是AA的多项式,对AA不可逆情形可以考虑摄动法证明

    • 如果AA是方阵,则当且仅当AA是上三角阵时AAATA^T才可交换,即AAT=ATAAA^T=A^TA[3]^{[3]}

    • 如果AAnn个不相等的特征值,则A,BA,B可交换的充要条件是A,BA,B有完全相同的特征子空间[4]^{[4]}

    • 如果A,BA,B可交换,则

      1. A,BA,B有公共特征向量,因为AA的特征子空间是BB的不变子空间

      2. AA的任一特征值λ\lambda,存在AA的对应λ\lambda的一个特征向量ξ\xiBB的某个特征值μ\mu,使得

        • λμ\lambda\muABAB的特征值[4]^{[4]}
        • ξ\xiBB的对应μ\mu的特征向量,也是ABAB的对应λμ\lambda\mu的特征向量[4]^{[4]}
      3. ABAB的任一特征值γ\gamma,存在ABAB的对应γ\gamma的一个特征向量ς\varsigmaAA的某个特征值λ\lambdaBB的某个特征值μ\mu,使得

        • ς\varsigmaAA的对应λ\lambda的特征向量,也是BB的对应μ\mu的特征向量[4]^{[4]}
        • ς=λμ [4]\varsigma=\lambda\mu\ ^{[4]}
    • 有些时候,即使不知道矩阵BB的具体形式,也可以导出A,BA,B可交换;

      一个比较经典的例子是AB=ABAB=A-B,该式可以因式分解为(A+E)(B+E)=E(A+E)(-B+E)=E,所以(A+E)(A+E)可逆而且逆为(B+E)(-B+E),由于矩阵和他的逆必然可交换且乘积为EE,所以进一步有(A+E)(B+E)=E=(B+E)(A+E)(A+E)(-B+E)=E=(-B+E)(A+E),化简得AB=BAAB=BA,即A,BA,B可交换;

      而且在这个例子中,只要AA没有特征值11的同时AAnn个线性无关的特征向量,那么AA的全部特征向量就是ABAB的全部特征向量,也是BB的全部特征向量。证明是容易的,这里只证前者,设Aξ=λξA\xi=\lambda\xi,则ABξ=B(Aξ)=λBξAB\xi=B(A\xi)=\lambda B\xi,联系到AB=ABAB=A-B,有λBξ=λ(ABA)ξ=λABξλ2ξ\lambda B\xi=\lambda(AB-A)\xi=\lambda AB\xi-\lambda^2\xi,综上有ABξ=λ2λ1ξAB\xi=\frac{\lambda^2}{\lambda-1}\xi,所以如果要进一步计算使ABAB相似对角化的相似变换PP,则直接计算AA的特征向量即可,而并不需要求出BB的具体形式。

      当然要计算使ABAB相似对角化的相似变换PP其实不需要讨论ABAB特征向量和AA特征向量间的关系,因为

    一些其他的性质:

    • A,BA,B分别是mm阶和nn阶的矩阵,则存在非零的m×nm\times n阶矩阵使得AX=XBAX=XB的充要条件是A,BA,B有公共特征值[4]^{[4]}

    • nn阶矩阵A,BA,B均可对角化,则AB=BAAB=BA的充要条件是存在nn阶可逆阵PP使得P1AP=P1BP=ΛP^{-1}AP=P^{-1}BP=\Lambda,其中Λ\Lambda是一个对角阵

    • A,BA,B均为nn阶实对称阵,则AB=BAAB=BA的充要条件是存在nn阶正交阵QQ使得QTAQ=QTBQ=ΛQ^TAQ=Q^TBQ=\Lambda,其中Λ\Lambda是一个对角阵

    [1] 林建富,杜翠真.矩阵可交换的充要条件[J].吉林师范大学学报(自然科学版),2012,33(04):59-61.

    [2] 钱微微,蔡耀志.论矩阵可交换的充要条件[J].大学数学,2007(05):143-146.

    [3] Stack Exchange: Does a square matrix always commute with its transpose?

    [4] 知乎: 矩阵可交换的条件

  • 一个有趣的例子,对于nn阶可逆矩阵A\boldsymbol{A}nn维非零列向量α\boldsymbol{\alpha}

    1. 如果A\boldsymbol{A}是正定或负定矩阵,则r(AααT0)=n+1r\left(\begin{matrix}\boldsymbol{A}&\boldsymbol{\alpha}\\\boldsymbol{\alpha}^T&0\end{matrix}\right)=n+1
    2. 如果A\boldsymbol{A}是反对称矩阵,则r(AααT0)=nr\left(\begin{matrix}\boldsymbol{A}&\boldsymbol{\alpha}\\\boldsymbol{\alpha}^T&0\end{matrix}\right)=n

    这两个例子其实都非常直观,既然A\boldsymbol{A}可逆,那么就很容易进行非退化的行列变换:

    (AααT0)(A0αTαTA1α)(A00TαTA1α) \left(\begin{matrix}\boldsymbol{A}&\boldsymbol{\alpha}\\\boldsymbol{\alpha}^T&0\end{matrix}\right)\to\left(\begin{matrix}\boldsymbol{A}&\boldsymbol0\\\boldsymbol{\alpha}^T&-\boldsymbol{\alpha}^T\boldsymbol{A}^{-1}\boldsymbol{\alpha}\end{matrix}\right)\to\left(\begin{matrix}\boldsymbol{A}&\boldsymbol0\\\boldsymbol0^T&-\boldsymbol{\alpha}^T\boldsymbol{A}^{-1}\boldsymbol{\alpha}\end{matrix}\right)

    所以,决定r(AααT0)r\left(\begin{matrix}\boldsymbol{A}&\boldsymbol{\alpha}\\\boldsymbol{\alpha}^T&0\end{matrix}\right)n+1n+1还是nn的关键在于αTA1α\boldsymbol{\alpha}^T\boldsymbol{A}^{-1}\boldsymbol{\alpha}是否为00

    • A\boldsymbol{A}是正定或负定矩阵,由于α0\boldsymbol{\alpha}\neq\boldsymbol0,所以αTA1α0\boldsymbol{\alpha}^T\boldsymbol{A}^{-1}\boldsymbol{\alpha}\neq0,易见r(AααT0)=r(A)+1=n+1r\left(\begin{matrix}\boldsymbol{A}&\boldsymbol{\alpha}\\\boldsymbol{\alpha}^T&0\end{matrix}\right)=r(\boldsymbol{A})+1=n+1
    • A\boldsymbol{A}是反对称矩阵,αTA1α=(αTA1α)T=αT(AT)1α=αTA1α\boldsymbol{\alpha}^T\boldsymbol{A}^{-1}\boldsymbol{\alpha}=(\boldsymbol{\alpha}^T\boldsymbol{A}^{-1}\boldsymbol{\alpha})^T=\boldsymbol{\alpha}^T\boldsymbol{(A}^T)^{-1}\boldsymbol{\alpha}=-\boldsymbol{\alpha}^T\boldsymbol{A}^{-1}\boldsymbol{\alpha},所以必然有αTA1α=0\boldsymbol{\alpha}^T\boldsymbol{A}^{-1}\boldsymbol{\alpha}=0,从而r(AααT0)=r(A)=nr\left(\begin{matrix}\boldsymbol{A}&\boldsymbol{\alpha}\\\boldsymbol{\alpha}^T&0\end{matrix}\right)=r(\boldsymbol{A})=n
  • 如果nn阶矩阵A\boldsymbol{A}满足(AαE)(AβE)=O(\boldsymbol{A}-\alpha\boldsymbol{E})(\boldsymbol{A}-\beta\boldsymbol{E})=\boldsymbol{O},其中αβ\alpha\neq\beta,则A\boldsymbol{A}的全部特征值只可能为α\alphaβ\beta,且A\boldsymbol{A}一定有nn个线性无关的特征向量,进而A\boldsymbol{A}一定能被相似对角化;换言之,如果A\boldsymbol{A}满足一个有互异实根的二次多项式,那么A\boldsymbol{A}就可相似对角化。证明是容易的:

    首先,由零化多项式(AαE)(AβE)=O(\boldsymbol{A}-\alpha\boldsymbol{E})(\boldsymbol{A}-\beta\boldsymbol{E})=\boldsymbol{O}A\boldsymbol{A}的特征值只可能为α,β\alpha,\beta,并且有r(AαE)+r(AβE)nr(\boldsymbol{A}-\alpha\boldsymbol{E})+r(\boldsymbol{A}-\beta\boldsymbol{E})\leqslant n;接着,有

    r(AαE)+r(AβE)=r(AαE)+r(A+βE)r(AαEA+βE)=(βα)r(E)=n \begin{align}r(\boldsymbol{A}-\alpha\boldsymbol{E})+r(\boldsymbol{A}-\beta\boldsymbol{E})&=r(\boldsymbol{A}-\alpha\boldsymbol{E})+r(-\boldsymbol{A}+\beta\boldsymbol{E})\\&\geqslant r(\boldsymbol{A}-\alpha\boldsymbol{E}-\boldsymbol{A}+\beta\boldsymbol{E})\\&=(\beta-\alpha)r(\boldsymbol{E})=n\end{align}

    所以α,β\alpha,\beta的几何重数(如果他们是特征值的话)之和为nn,即A\boldsymbol{A}存在nn个线性无关的特征向量,从而A\boldsymbol{A}能够被相似对角化

矩阵分解简述

矩阵分解在英语中称decomposition或factorization,这部分内容都在复数域C\mathbb{C}上进行讨论,记矩阵ACm×n\boldsymbol{A}\in\mathbb{C}^{m\times n}r(A)=rr(\boldsymbol{A})=r

AH\boldsymbol{A}^H表示矩阵A\boldsymbol{A}的共轭转置,在实数域上表现为A\boldsymbol{A}的转置AT\boldsymbol{A}^T;酉矩阵(幺正矩阵)指满足AHA=AAH=E\boldsymbol{A}^H\boldsymbol{A}=\boldsymbol{AA}^H=\boldsymbol{E}的矩阵A\boldsymbol{A},在实数域上表现为正交矩阵

1. 特征分解(相似对角化) eigendecomposition

2. 满秩分解 rank decomposition

对于复矩阵ACm×n\boldsymbol{A}\in\mathbb{C}^{m\times n},一定存在不唯一的mm阶可逆阵P\boldsymbol{P}nn阶可逆阵Q\boldsymbol{Q},使得

A=P(Ir000)Q=P(Ir0)(Ir0)Q=P1Q1 \boldsymbol{A}=\boldsymbol{P}\left(\begin{matrix}\boldsymbol{I}_r&0\\0&0\end{matrix}\right)\boldsymbol{Q}=\boldsymbol{P}\left(\begin{matrix}\boldsymbol{I}_r\\0\end{matrix}\right)\left(\begin{matrix}\boldsymbol{I}_r&0\end{matrix}\right)\boldsymbol{Q}=\boldsymbol{P}_1\boldsymbol{Q}_1

因此,可以说A\boldsymbol{A}一定能被两个满秩可逆矩阵对角化(实际上是矩阵等价关系借助初等矩阵的体现),也可以说A\boldsymbol{A}一定能被分解为两个矩阵的乘积

满秩分解的应用:

  1. 幂等矩阵B\boldsymbol{B}一定可以被一个可逆矩阵P\boldsymbol{P}表示为P(Ir000)P1\boldsymbol{P}\left(\begin{matrix}\boldsymbol{I}_r&0\\0&0\end{matrix}\right)\boldsymbol{P}^{-1},所以r(B)=tr(B)r(\boldsymbol{B})=\mathrm{tr}(\boldsymbol{B})
  2. 计算Moore-Penrose逆A+\boldsymbol{A}^+,对于A\boldsymbol{A}的一个满秩分解A=P1Q1\boldsymbol{A}=\boldsymbol{P}_1\boldsymbol{Q}_1,有:
    • A+=Q1H(Q1Q1H)1(P1HP1)1P1H\boldsymbol{A}^+=\boldsymbol{Q}^H_1(\boldsymbol{Q}_1\boldsymbol{Q}^H_1)^{-1}(\boldsymbol{P}^H_1\boldsymbol{P}_1)^{-1}\boldsymbol{P}^H_1
    • 如果A\boldsymbol{A}是行满秩的,则A+=AH(AAH)1\boldsymbol{A}^+=\boldsymbol{A}^H(\boldsymbol{AA}^H)^{-1}
    • 如果A\boldsymbol{A}是列满秩的,则A+=(AHA)1AH\boldsymbol{A}^+=(\boldsymbol{A}^H\boldsymbol{A})^{-1}\boldsymbol{A}^H
  3. 可以通过SVD找到满秩分解

3. 酉对角化 Schur decomposition

对于复方阵ACn×n\boldsymbol{A}\in\mathbb{C}^{n\times n},一定存在nn阶酉矩阵Q\boldsymbol{Q}使得与上三角方阵U\boldsymbol{U},使得

A=QUQH \boldsymbol{A}=\boldsymbol{QUQ}^H

也就是说,任何复方阵总是酉相似于一个上三角阵的

4. LU分解(三角分解)lower–upper (LU) decomposition

如果存在下三角方阵L\boldsymbol{L}与上三角方阵U\boldsymbol{U}使得复方阵A=LU\boldsymbol{A}=\boldsymbol{LU},则称A=LU\boldsymbol{A}=\boldsymbol{LU}A\boldsymbol{A}的LU分解;

对于满秩方阵ACn×n\boldsymbol{A}\in\mathbb{C}^{n\times n}A\boldsymbol{A}可作LU分解的充要条件是A\boldsymbol{A}的任何阶顺序主子式均不为00

对于非满秩方阵ACn×n\boldsymbol{A}\in\mathbb{C}^{n\times n},如果A\boldsymbol{A}的前rr个顺序主子式不为00,则可以作LU分解;

不是所有方阵都能进行LU分解,但如果方阵满秩且可LU分解,则LU分解是唯一确定的

5. QR分解 QR decomposition

对于复矩阵ACm×n\boldsymbol{A}\in\mathbb{C}^{m\times n}mnm\geqslant n,一定存在酉矩阵Qm×m\boldsymbol{Q}_{m\times m}与上三角矩阵Rm×n=(R1Omn,n)\boldsymbol{R}_{m\times n}=\left(\begin{matrix}\boldsymbol{R}_1\\\boldsymbol{O}_{m-n,n}\end{matrix}\right),其中R1\boldsymbol{R}_1nn阶上三角方阵,使得

A=QR \boldsymbol{A}=\boldsymbol{QR}

A\boldsymbol{A}满秩时(r=nr=n)如果要求R1\boldsymbol{R}_1的对角线元素为正,则分解是唯一确定的;如果A\boldsymbol{A}是实方阵,则Q\boldsymbol{Q}表现为正交矩阵

满秩分解的应用:

  1. 如果A\boldsymbol{A}列满秩,可以考虑用Gram–Schmidt方法计算QR分解
  2. 对于方阵,QR分解能有效地计算其特征值与特征向量,因为酉矩阵不改变特征值,所以A\boldsymbol{A}的特征值即是等于R\boldsymbol{R}的主对角元

6. SVD(奇异值分解)singular value decomposition

酉等价:对于A,BCm×n\boldsymbol{A},\boldsymbol{B}\in\mathbb{C}^{m\times n},如果存在mm阶酉矩阵U\boldsymbol{U}nn阶酉矩阵V\boldsymbol{V}使得UHAV=B\boldsymbol{U}^H\boldsymbol{AV}=\boldsymbol{B},则称A,B\boldsymbol{A},\boldsymbol{B}是酉等价的;

奇异值:如果ACm×n\boldsymbol{A}\in\mathbb{C}^{m\times n}r>0r>0,则称AHA\boldsymbol{A}^H\boldsymbol{A}的各特征值λ1λ2λr>λr+1==λn=0\lambda_1\geqslant\lambda_2\geqslant\cdots\geqslant\lambda_r>\lambda_{r+1}=\cdots=\lambda_n=0的平方根为奇异值,记为σi=λi, i=1,2,,n\sigma_i=\sqrt{\lambda_i},\ i=1,2,\cdots,n

SVD:对于ACm×n\boldsymbol{A}\in\mathbb{C}^{m\times n}r>0r>0,一定存在mm阶酉矩阵U\boldsymbol{U}nn阶酉矩阵V\boldsymbol{V},使得

A=U(diag(σ1,,σr)Or,nrOmr,rOmr,nr)V \boldsymbol{A}=\boldsymbol{U}\left(\begin{matrix}\mathrm{diag}(\sigma_1,\cdots,\sigma_r)&\boldsymbol{O}_{r,n-r}\\\boldsymbol{O}_{m-r,r}&\boldsymbol{O}_{m-r,n-r}\end{matrix}\right)\boldsymbol{V}

A\boldsymbol{A}与其奇异值对角阵酉等价

SVD的应用:

  • 计算Moore-Penrose逆A+\boldsymbol{A}^+
  • 极分解,SVD不是唯一的,但极分解唯一
  • 低秩近似
  • ……

SVD是在应用领域,尤其是计算机科学中应用最广泛的分解

摄动法

摄动法最初作为求解一些数学物理方程数值解的方法,后来被广泛运用于数理领域。在实变函数论中可以用简单函数逼近一般函数,在矩阵论中同样可以用可逆矩阵逼近不可逆矩阵,不少涉及不可逆矩阵的问题便也迎刃而解。

矩阵摄动法的保证是:对于任何nn阶矩阵AA,一定存在实数a>0a>0使得满足t<a\forall |t|\lt at0t\neq0tt,均有A+tEA+tE是可逆矩阵。

如何理解这一定理?根据代数学基本定理,AA的特征多项式λEA\big|\lambda E-A\big|至多只有nn个根,不妨记为λ1,λ2,,λn\lambda_1,\lambda_2,\cdots,\lambda_n,如果特征值均为00,则对取任意非零的数tt(所以这样的aa是肯定存在的),均有det(A+tE)=i=1nt0\det(A+tE)=\prod\limits^n_{i=1}t\neq0,因此A+tEA+tE可逆;如果特征值不全为00,不妨设不为零的特征值为λj1,λj2,,λjm\lambda_{j_1},\lambda_{j_2},\cdots,\lambda_{j_m},取a=min0km{λjk}0a=\min\limits_{0\leqslant k\leqslant m}\{|\lambda_{j_k}|\}\neq0,那么t s.t.  t<a\forall t\,\ s.t.\ \ |t|\lt a,均有det(A+tE)=i=1n(λi+t)0\det(A+tE)=\prod\limits^n_{i=1}(\lambda_i+t)\neq0,故而A+tEA+tE也是可逆的。该定理说明:即使矩阵不可逆,也存在一系列可逆矩阵{A+tiE:ti0 (i)}\{A+t_iE:t_i\to0\ (i\to\infty)\}可以逼近该矩阵。

因此,只要问题关于tit_i连续且对可逆矩阵成立,就可以把在可逆矩阵上的结论推广至不可逆矩阵。

例如可以证明对任意方阵有(AB)=BA(AB)^{\ast}=B^{\ast}A^{\ast}。当A,BA,B可逆时结果显然,而当A,BA,B是一般方阵时,由于(A+tiE)(A+t_iE)(B+tiE)(B+t_iE)也是可逆矩阵,所以方程[(A+tiE)(B+tiE)]=(B+tiE)(A+tiE)\big[(A+t_iE)(B+t_iE)\big]^{\ast}=(B+t_iE)^{\ast}(A+t_iE)^{\ast}成立,注意到该方程还是关于tit_i的多项式,因此对tit_i连续,故该结论可以推广至不可逆方阵,仍成立。

这是一个强大的工具,可以解决诸多问题。

第一同构定理

  • 第一同构定理:若f:GHf:G\to H同态,则Im(f)Gker(f)\text{Im}(f)\cong\frac{G}{\text{ker}(f)}

  • 第一同构定理(矩阵子空间):记线性变换L:VWL:V\to W,则Im(L)Vker(L)\text{Im}(L)\cong\frac{V}{\text{ker}(L)};如果维度还是有限的,则:

    dim(Im(L))+dim(Ker(L))=dim(V) \dim\big(\text{Im}(L)\big)+\dim\big(\text{Ker}(L)\big)=\dim(V)
    (Rank–nullity定理)

行列式

在我看来,如果要直观且通俗地讲,那么行列式是列向量在全空间下的有向体积,对应线性变换(矩阵)作用于某空间的标准正交基后单位几何体的在原空间下的体积,于是不满秩的数字矩阵(自然是可逆的)行列式为00也容易理解了(例如平面图形在三维空间的体积为00),符号代表左右手系;尽管可以直接用逆序数给出定义,但这种做法在低观点下容易令人感到匪夷所思。

在几何中,可以称行列式为线性变换的”伸缩因子“;用二阶矩阵做例子,可以发现他的行列式是一个平行四边形的面积。试着从这个角度思考,为何矩阵一般不满足交换律,而矩阵之积的行列式不论顺序如何改变,其行列式值也不发生变化。

由于行列式就是特征值的积,所以可以认为特征值是对各特征向量的缩放因子,而行列式是对整体的缩放因子。

nn阶行列式的逆序数定义:j1,j2,,jn(1)τ(j1,j2,,jn)a1,j1a2,j2an,jn\sum\limits_{j_1,j_2,\cdots,j_n}(-1)^{\tau(j_1,j_2,\cdots,j_n)}a_{1,j_1}a_{2,j_2}\cdots a_{n,j_n},一共有n!n!项,其中τ()\tau(\cdot)是逆序数,决定排列是奇排列(逆序数为奇)还是偶排列(逆序数为偶);a1,j1a2,j2an,jna_{1,j_1}a_{2,j_2}\cdots a_{n,j_n}则是是来自不同行不同列的nn个元素的乘积。该定义也被称为行列式的完全展开(相较于按行或列展开和拉普拉斯展开,是“完全”展开的),一般而言,求含有某未知数的行列式多项式中未知数某次幂的系数,就需要对行列式做适当变换后(以方便运用定义)用该定义求解——这比直接计算出整个行列式少了非常之多的计算量。

nn阶行列式的递归定义:用MijM_{ij}表示余子式、用Aij=(1)i+jMijA_{ij}=(-1)^{i+j}M_{ij}表示代数余子式,则j,  det(A)=i=1najiAji\forall j,\;\det(A)=\sum\limits^n_{i=1}a_{ji}A_{ji}。这实际上是按行展开,当然也可以按列展开或者按块展开(拉普拉斯展开)。

拉普拉斯定理略,可参考 【矩阵论】拉普拉斯定理及简单应用,作者甚至补充了拉普拉斯本人的背景。

用结构化的观点看,数域K\mathbb{K}上的nn阶行列式等价定义为:①列线性性、②列反对称性、③规范性(使得行列式唯一,定义了数量关系)。

  • 初等变换中,

    1. 交换行或列,行列式值取相反数
    2. 某行或列倍乘kk,行列式值乘kk
    3. 将某行或列倍乘kk后加到另一行或列,行列式值不变
  • 相似变换的有限复合均不改变行列式的值(更本质的是不改变特征值),利用这一点将矩阵化为上下三角矩阵,则行列式的值为主对角线元素的乘积;初等变换和合同变换一般不能保证特征值不变化

  • 副对角线上下三角矩阵AA的行列式值为(1)n(n1)2ai,ni+1(-1)^{\frac{n(n-1)}2}\prod a_{i,n-i+1},右边是副对角线元素的乘积

  • 矩阵做多项式运算后,各特征值也进⾏相应的多项式运算,利用这一点可以计算矩阵多项式的行列式

  • 矩阵相乘的⾏列式等于⾏列式相乘:AB=AB|AB|=|A|\cdot|B|,注意矩阵相加的⾏列式没有一般的通式,有时可以考虑通过特征根间接计算

  • kA=knA|kA|=k^n|A|(相当于对AA的每一行或列进行了放缩kk倍的初等变换)

  • 矩阵行列式之和的分解:

    α+β,γ1,γ2,=α,γ1,γ2,+β,γ1,γ2, |\alpha+\beta,\gamma_1,\gamma_2,\cdots|=|\alpha,\gamma_1,\gamma_2,\cdots|+|\beta,\gamma_1,\gamma_2,\cdots|

    特例:记A=[α,γ1,γ2,]A=[\alpha,\gamma_1,\gamma_2,\cdots]B=[β,γ1,γ2,]B=[\beta,\gamma_1,\gamma_2,\cdots],则A+B=2n1(A+B)|A+B|=2^{n-1}\big(|A|+|B|\big)(注:只有像这样极少数情况下,矩阵和差的行列式可以被直接计算出来)

  • 重要技巧:当已知A=det(α1,α2,)|A|=\det(\alpha_1,\alpha_2,\cdots)时欲求B=det(aiαi,biαi,)|B|=\det(\sum a_i\alpha_i,\sum b_i\alpha_i,\cdots)的值,应当记B=PAB=PA再解出PP,于是有B=PA|B|=|P|\cdot|A|,这是最简单的做法

  • 逆矩阵⾏列式为原矩阵行列式的倒数,A1=1A|A^{-1}|=\frac1{|A|};事实上,更本质的是逆矩阵的特征值是原矩阵特征值的倒数

  • 行列式的辅因子展开:矩阵AA的任意一行 (或一列) 的向量,与相应一行 (或一列) 元素的代数余子式的向量的内积等于A|A|,即

    j,  i=1naijAij=A,  其中Aij=(1)i+jMij \forall j,\ \ \sum^n_{i=1}a_{ij}A_{ij}=|A|,\ \ \text{其中}A_{ij}=(-1)^{i+j}M_{ij} i,  j=1naijAij=A,  其中Aij=(1)i+jMij \forall i,\ \ \sum^n_{j=1}a_{ij}A_{ij}=|A|,\ \ \text{其中}A_{ij}=(-1)^{i+j}M_{ij}
  • 与行列式辅因子展开相对应的,矩阵AA的任意一行 (或一列) 的向量,与并不相对应的其他一行 (或一列) 元素的代数余子式的向量的内积一定等于00,也就是说

    j 与 kj,  i=1naijAik=0,  其中Aik=(1)i+kMij \forall j\text{ 与 }k\neq j,\ \ \sum^n_{i=1}a_{ij}A_{ik}=0,\ \ \text{其中}A_{ik}=(-1)^{i+k}M_{ij} i 与 ki,  j=1naijAkj=0,  其中Akj=(1)k+jMkj \forall i\text{ 与 }k\neq i,\ \ \sum^n_{j=1}a_{ij}A_{kj}=0,\ \ \text{其中}A_{kj}=(-1)^{k+j}M_{kj}
  • 二阶三阶矩阵的行列式:

    1. acbd=adcb\left|\begin{matrix}a&c\\b&d\\\end{matrix}\right|=ad-cb
    2. adgbehcfi=aei+dhc+gbfgechfaidb\left|\begin{matrix}a&d&g\\b&e&h\\c&f&i\\\end{matrix}\right|=aei+dhc+gbf-gec-hfa-idb
  • 伴随矩阵⾏列式:A=An1|A^{\ast}|=|A|^{n-1}

  • 分块矩阵的行列式:请直接 参考此处,在此给出最简单的分块矩阵之行列式:

    • AACC均为方阵,则ABOC=AC\left|\begin{matrix}A&B\\O&C\\\end{matrix}\right|=|A||C|
    • AAnn阶方阵、CCmm阶方阵,则OABC=(1)nmAB\left|\begin{matrix}O&A\\B&C\\\end{matrix}\right|=(-1)^{nm}|A||B|
    • A,B,C,DA,B,C,D均为n×nn\times n矩阵且其一为零矩阵,则ABCD=det(ADBC)\left|\begin{matrix}A&B\\C&D\\\end{matrix}\right|=\det(AD-BC)
  • 基本初等矩阵的行列式:

    1. 交换某两行或某两列,对应的基本初等矩阵行列式为1-1

      111=1 \left|\begin{matrix}&1&\\1&&\\&&1\\\end{matrix}\right|=-1
    2. 某一行或某一列倍乘kkk0k\neq0),对应的基本初等矩阵行列式为kk

      k11=k \left|\begin{matrix}k&&\\&1&\\&&1\\\end{matrix}\right|=k
    3. 某一行(某一列)倍乘kk后加到另一行(另一列),对应的基本初等矩阵行列式为11

      1k11=1 \left|\begin{matrix}1&k&\\&1&\\&&1\\\end{matrix}\right|=1

    由此也可以看出,第一种与第二种初等变换只是不改变秩(不改变行列向量组的线性相关性),并不意味着不改变行列式

  • 特殊行列式

    • 范德蒙德行列式

      111x1x2xnx12x22xn2x1n1x2n1xnn1=1j<in(xixj)=(xnx1)(xn1x1)(x3x1)(x2x1)×(xnx2)(xn1x2)(x3x2)×(xnx3)(xn1x3)(x4x3)×(xnxn1) \begin{align}\left|\begin{matrix}1&1&\cdots&1\\x_1&x_2&\cdots&x_n\\x^2_1&x^2_2&\cdots&x^2_n\\\vdots&\vdots&&\vdots\\x^{n-1}_1&x^{n-1}_2&\cdots&x^{n-1}_n\end{matrix}\right|&=\prod\limits_{1\leqslant j\lt i\leqslant n}(x_i-x_j)\\&=\begin{array}{r}(x_n-x_1)(x_{n-1}-x_1)\cdots(x_3-x_1)(x_2-x_1)\\\times(x_n-x_2)(x_{n-1}-x_2)\cdots(x_3-x_2)\\\times(x_n-x_3)(x_{n-1}-x_3)\cdots(x_4-x_3)\\\cdots\\\times(x_n-x_{n-1})\end{array}\end{align}

      如果范德蒙德行列式“倒过来”了,则有 x1n1x2n1xnn1x1n2x2n2xnn2x12x22xn2x1x2xn111=1j<in(xjxi)\left|\begin{matrix}x^{n-1}_1&x^{n-1}_2&\cdots&x^{n-1}_n\\x^{n-2}_1&x^{n-2}_2&\cdots&x^{n-2}_n\\\vdots&\vdots&&\vdots\\x^2_1&x^2_2&\cdots&x^2_n\\x_1&x_2&\cdots&x_n\\1&1&\cdots&1\end{matrix}\right|=\prod\limits_{1\leqslant j\lt i\leqslant n}(x_{\color{#FF0000}{j}}-x_{\color{#FF0000}{i}})

      要注意的是,范德蒙德行列式的最后一行元素幂次均为n1n-1,首行元素均为11;若否之,则要利用范德蒙德行列式的值与首行向量(1,1,,1)(1,1,\cdots,1)无关的特点构造出范德蒙德行列式。例如:

      x1x2xnx12x22xn2x1nx2nxnn=i=1nxi111x1x2xnx1n1x2n1xnn1=i=1nxi1j<i(xixj) \begin{align}\left|\begin{matrix}x_1&x_2&\cdots&x_n\\x^2_1&x^2_2&\cdots&x^2_n\\\vdots&\vdots&&\vdots\\x^n_1&x^n_2&\cdots&x^n_n\end{matrix}\right|&=\prod^n_{i=1}x_i\left|\begin{matrix}1&1&\cdots&1\\x_1&x_2&\cdots&x_n\\\vdots&\vdots&&\vdots\\x^{n-1}_1&x^{n-1}_2&\cdots&x^{n-1}_n\end{matrix}\right|\\&=\prod\limits^n_{i=1}x_i\prod\limits_{1\leqslant j\lt i}(x_i-x_j)\end{align}
    • 箭头行列式

      λ0a1a2anb1λ1b2λ2bnλn=λ0i=1naibiλia1a2an0λ10λ20λn=(λ0i=1naibiλi)j=1nλj \begin{align}\left|\begin{matrix}\lambda_0&a_1&a_2&\cdots&a_n\\b_1&\lambda_1&&&\\b_2&&\lambda_2&&\\\vdots&&&\ddots&\\b_n&&&&\lambda_n\end{matrix}\right|&=\left|\begin{matrix}\lambda_0-\sum\limits^n_{i=1}\frac{a_ib_i}{\lambda_i}&a_1&a_2&\cdots&a_n\\0&\lambda_1&&&\\0&&\lambda_2&&\\\vdots&&&\ddots&\\0&&&&\lambda_n\end{matrix}\right|\\&=\left(\lambda_0-\sum\limits^n_{i=1}\frac{a_ib_i}{\lambda_i}\right)\prod^n_{j=1}\lambda_j\end{align}

      将第kk列的bkλk-\frac{b_k}{\lambda_k}倍加到第一倍消去{bi}\{b_i\}即可,1<in+11\lt i\leqslant n+1;如果类似矩阵但不便计算,可以考虑数学归纳法

  • 计算以行列式形式给出的多项式中某项的系数的方法:

    例如欲计算多项式

    f(x)=xx12x1x2121x1211x f(x)=\left|\begin{matrix}x&x&1&2x\\1&x&2&-1\\2&1&x&1\\2&-1&1&x\end{matrix}\right|

    x3x^3项的系数,至少有三种方法可以选择:

    • 法一:利用特征多项式系数公式λEA=λntr(A)λn1++(1)ndet(A)|\lambda E-A|=\lambda^n-\text{tr}(A)\lambda^{n-1}+\cdots+(-1)^n\det(A),先做初等行列变换将行列式化为未知数xx均位于对角线上的形式,类似于特征多项式:

      x0101x12321x3231x4 \left|\begin{matrix}x&0&1&0\\1&x-1&2&-3\\2&-1&x&-3\\2&-3&1&x-4\end{matrix}\right|

      若记A=0010112321032314A=\left|\begin{matrix}0&0&1&0\\1&-1&2&-3\\2&-1&0&-3\\2&-3&1&-4\end{matrix}\right|,则AA的特征多项式xEA|xE-A|正是f(x)f(x),所以x3x^3项的系数为tr(A)=5\mathrm{tr}(A)=-5

    • 法二:利用多项式的定义(完全展开),由定义知,行列式完全展开式为

      j1,j2,,jn(1)τ(j1,j2,,jn)a1,j1a2,j2an,jn \sum\limits_{j_1,j_2,\cdots,j_n}(-1)^{\tau(j_1,j_2,\cdots,j_n)}a_{1,j_1}a_{2,j_2}\cdots a_{n,j_n}

      其中τ()\tau(\cdot)代表逆序数,j1,j2,,jnj_1,j_2,\cdots,j_n1,2,,n1,2,\cdots,n的一个排列,即j1,j2,,jnj_1,j_2,\cdots,j_n互不相等。按该公式,只需要找出题干给出的f(x)f(x)行列式或等价地找出xEA|xE-A|中的全部x3x^3项的系数,然后再相加即可。以f(x)f(x)行列式为例,易见x3x^3项有1×(2×x×x×2x)-1\times(2\times x\times x\times2x)1×(1×x×x×x)-1\times(1\times x\times x\times x),相加得5x3-5x^3,因此x3x^3项的系数为5-5

    • 法三:通过初等行列变换,将f(x)f(x)完全展开,得到多项式i=04aixi\sum\limits^4_{i=0}a_ix^i形式后观察x3x^3的系数;这是最麻烦的方法,也是最直接的方法。一般而言不推荐完全展开来确定系数,因为太麻烦

    • 特别地,如果要计算的是常数项,令x=0x=0接着计算数字行列式即可,这样可能会比较快捷

向量与向量组

补充一下人尽皆知的定义,万一有初学者在读这篇文章呢,虽然应该没有:向量组α1,α2,,αn\boldsymbol{\alpha}_1,\boldsymbol{\alpha}_2,\cdots,\boldsymbol{\alpha}_n线性相关,定义为存在一组不全为00的数k1,k2,,knk_1,k_2,\cdots,k_n,使得k1α1+k2α2++knαn=0k_1\boldsymbol{\alpha}_1+k_2\boldsymbol{\alpha}_2+\cdots+k_n\boldsymbol{\alpha}_n=\boldsymbol0成立。按定义,零向量与任何向量均线性相关。线性无关则是向量最对任何一组不全为零的数k1,k2,,knk_1,k_2,\cdots,k_n,均有k1α1+k2α2++knαn0k_1\boldsymbol{\alpha}_1+k_2\boldsymbol{\alpha}_2+\cdots+k_n\boldsymbol{\alpha}_n\neq\boldsymbol0成立,由此可以导出线性无关的充要条件是向量组中任何一个向量都不能由剩余向量线性表示,但应注意线性相关的充要条件并不是“向量组中任何一个向量都能由剩余向量线性表示”,而是“向量组中存在一个向量,可由剩余向量线性表示”。极大线性无关组是指向量组中最大个数的线性无关向量构成的集合,称这个个数为向量组的秩。可以证明,若矩阵的行列式为00,则矩阵的行向量组和列向量组一定线性相关;若行列式不为00,则矩阵的行向量组和列向量组一定线性无关,事实上这是充要条件。

“部分相关,整体相关;整体无关,部分无关”这一思想在很多场景中均适用,这也体现在向量组中。

  • α1,α2,,αn\boldsymbol{\alpha}_1,\boldsymbol{\alpha}_2,\cdots,\boldsymbol{\alpha}_n可由β1,β2,,βm\boldsymbol{\beta}_1,\boldsymbol{\beta}_2,\cdots,\boldsymbol{\beta}_m线性表示,则r(α1,α2,,αn)r(β1,β2,,βm)r(\boldsymbol{\alpha}_1,\boldsymbol{\alpha}_2,\cdots,\boldsymbol{\alpha}_n)\leqslant r(\boldsymbol{\beta}_1,\boldsymbol{\beta}_2,\cdots,\boldsymbol{\beta}_m)

  • 矩阵左乘右乘向量,对矩阵间的左乘右乘意义不尽相同。对于向量而言,左乘α=Aβ\boldsymbol{\alpha=A\beta}代表坐标变换,这里A\boldsymbol{A}应视为针对向量的线性变换,将一个向量的各个分量映射到对应值,得到另一个向量;右乘α=βA\boldsymbol{\alpha=\beta A}通常代表基变换,A\boldsymbol{A}作为一个过渡矩阵,表示了两组基向量间的数量关系,不直接表示坐标

  • 矩阵等价要求两矩阵(在形状相同的前提下)秩相等,向量组等价要求两向量组(在维数相同的前提下)能被彼此互相表出,即r(α)=r(β)=r(α,β)r(\boldsymbol{\alpha})=r(\boldsymbol{\beta})=r(\boldsymbol{\alpha},\boldsymbol{\beta}),或者说二者具有共同的极大线性无关组,所以矩阵等价不代表他们的行列向量组等价,但行列向量组等价就一定有矩阵等价

  • 所有秩小于等于11的方阵都可以写为两向量之内积abTab^T,如果秩相同,那么他们都是等价的

  • Schmidt正交化步骤:

    en=1xn(xni=1n1xn,eiei) e_n=\frac1{\Vert x_n\Vert}\left(x_n-\sum^{n-1}_{i=1}\langle x_n,e_i\rangle e_i\right)

    对于实或复的线性无关向量组,记β=βTβ\Vert\beta\Vert=\beta^T\beta,有:

    1. β1=α1\beta_1=\alpha_1
    2. β2=α2α2Tβ1β1β1\beta_2=\alpha_2-\frac{\alpha_2^T\beta_1}{\Vert\beta_1\Vert}\beta_1
    3. β3=α3α3Tβ1β1β1α3Tβ2β2β2\beta_3=\alpha_3-\frac{\alpha_3^T\beta_1}{\Vert\beta_1\Vert}\beta_1-\frac{\alpha_3^T\beta_2}{\Vert\beta_2\Vert}\beta_2
    4. \cdots
    5. 最后再对各个向量单位化

    这个方法在更一般的希尔伯特空间中仍有效,所以这是个在理论上极其重要的方法

  • 若方程Ax=b\boldsymbol{Ax}=\boldsymbol{b}解得了通解,设A=(α1,α2,,αn)\boldsymbol{A}=(\boldsymbol{\alpha}_1,\boldsymbol{\alpha}_2,\cdots,\boldsymbol{\alpha}_n),其中{αi}\{\boldsymbol{\alpha}_i\}A\boldsymbol{A}的列向量组,则b=i=1nkiαi\boldsymbol{b}=\sum\limits^n_{i=1}k_i\boldsymbol{\alpha}_i,其中(k1,k2,,kn)T(k_1,k_2,\cdots,k_n)^TAx=b\boldsymbol{Ax}=\boldsymbol{b}的通解向量

  • 在欧氏空间中,正交向量组一定线性无关。证明是简单的,设有正交向量组{αi:1im,αiRn}\{\boldsymbol{\alpha}_i:1\leqslant i\leqslant m,\boldsymbol{\alpha}_i\in\mathbb{R}^n\},其中i, αi0\forall i,\ \boldsymbol{\alpha}_i\neq\boldsymbol0i,j, αi,αj=0\forall i,j,\ \langle\boldsymbol{\alpha}_i,\boldsymbol{\alpha}_j\rangle=0,假设 k1,k2,,kmR\exists\ k_1,k_2,\cdots,k_m\in\mathbb{R}使得β=k1α1+k2α2++kmαm=0\boldsymbol{\beta}=k_1\boldsymbol{\alpha}_1+k_2\boldsymbol{\alpha}_2+\cdots+k_m\boldsymbol{\alpha}_m=\boldsymbol0,则l\forall l0=β,αl=i=1mkiαi,αl=klαl,αl0=\langle\boldsymbol{\beta},\boldsymbol{\alpha}_l\rangle=\sum\limits^m_{i=1}k_i\langle\boldsymbol{\alpha}_i,\boldsymbol{\alpha}_l\rangle=k_l\langle\boldsymbol{\alpha}_l,\boldsymbol{\alpha}_l\rangle,其中αl,αl0\langle\boldsymbol{\alpha}_l,\boldsymbol{\alpha}_l\rangle\neq0{αi}\{\boldsymbol{\alpha}_i\}中没有零向量),所以kl=0k_l=0,遍历ll11mm,有k1=k2==km=0k_1=k_2=\cdots=k_m=0。综上所述,只存在一组全为00的实数使得{αi}\{\boldsymbol{\alpha}_i\}的线性组合为00,因而{αi}\{\boldsymbol{\alpha}_i\}线性无关

    • 推论 1:对于n×mn\times m的实矩阵A\boldsymbol{A},如果mnm\geqslant n,则其行向量组的极大线性无关组必然与Ax=0\boldsymbol{Ax}=\boldsymbol0的基础解系线性无关,且二者秩的和为mm
    • 推论 2:Rn\mathbb{R}^n中任意nn个两两正交的向量均可以作为一组基,即正交基

线性方程组

  • 解方程AX=B\boldsymbol{AX=B}(注意XX不止可以是向量,也可以是矩阵)的方法:

    1. 如果AA可逆则求逆即可,X=A1BX=A^{-1}B,有两种做法

      • 一种是直接计算A1A^{-1}再和BB相乘,可以通过高斯消元法、伴随矩阵、初等矩阵的逆等方法计算
      • 另一个办法是直接进行高斯消元法,对分块矩阵(A,B)\boldsymbol{(A,B)}作初等行变换变为(E,A1B)\boldsymbol{(E,A^{-1}B)}的形式,这直接就是XX的解了;同样地也可以作相应初等列变换
    2. 如果AA不可逆,和矩阵求逆类似地可以用高斯消元法解决,实际上这是解线性方程组的系统性方法。对AA右接BB得到增广矩阵[A,B][A,B]再初等行变换使得左部(即原本AA的位置)化为最简行阶梯阵。举个例子:

      AX=BAX=B,解XX;其中

      A=[133269133],      B=[2117414137] A=\left[\begin{matrix}1&3&3\\2&6&9\\-1&-3&3\\\end{matrix}\right],\ \ \ \ \ \ B=\left[\begin{matrix}2&-1&1\\7&4&-1\\4&13&-7\\\end{matrix}\right]

      由于det(A)=0\det(A)=0故不可用第一种方法,转而考虑对增广矩阵(A,B)(A,B)作初等行变换

      [1332112697411334137][1301741121000] \left[\begin{array}{ccc:ccc} 1 & 3 & 3 & 2 & -1 & 1\\ 2 & 6 & 9 & 7 & 4 & -1\\ -1 & -3 & 3 & 4 & 13 & -7\\ \end{array}\right]\rightarrow\left[\begin{array}{ccc:ccc} 1 & 3 & 0 & -1 & -7 & 4\\ & & 1 & 1 & 2 & -1\\ & & & 0 & 0 & 0\\ \end{array}\right]

      于是有

      {x1+3x2=1x3=1    {y1+3y2=7y3=2    {z1+3z2=4z3=1 \left\{\begin{aligned} &x_1+3x_2=-1\\ &x_3=1 \end{aligned}\right.\ \ \ \ \left\{\begin{aligned} &y_1+3y_2=-7\\ &y_3=2 \end{aligned}\right.\ \ \ \ \left\{\begin{aligned} &z_1+3z_2=4\\ &z_3=-1 \end{aligned}\right.

      最后将三个解向量按列封装为矩阵就解得了XX,即

      X=(x,y,z)=[3t13u73v+4tuv121] X=(\boldsymbol{x},\boldsymbol{y},\boldsymbol{z})=\left[\begin{matrix}-3t-1&-3u-7&-3v+4\\t&u&v\\1&2&-1\\\end{matrix}\right]

      消元过程中同样也可以下接BB然后作初等列变换,没有质的区别

  • 克拉默法则只适用于方阵情形

    对于线性方程组Ax=b\boldsymbol{Ax=b}(注:在克拉默法则中A\boldsymbol{A}必须是方阵),方程的解为

    xi=DiD \boldsymbol{x}_i=\frac{D_i}{D}

    其中,DiD_i是用b\boldsymbol{b}替换了A\boldsymbol{A}的第ii列得到的矩阵的行列式,DD则是A\boldsymbol{A}的行列式。

    • 推论 1:当A=0|\boldsymbol{A}|=0b0\boldsymbol{b}\neq\boldsymbol{0},方程可能无解,也可能有无穷个解
    • 推论 2:当A=0|\boldsymbol{A}|=0b=0\boldsymbol{b}=\boldsymbol{0},方程有无穷个解
    • 推论 3:当A0|\boldsymbol{A}|\neq0,方程有唯一解;特别地,还有b=0\boldsymbol{b}=\boldsymbol{0}时方程只有零解
    • 逆定理:若A=0|\boldsymbol{A}|=0,则方程Ax=b\boldsymbol{Ax=b}有唯一解
  • 关于矩阵同解问题的讨论,对于n×mn\times m矩阵A,B\boldsymbol{A},\boldsymbol{B}矩阵与命题 “Ax=0\boldsymbol{Ax}=\boldsymbol0Bx=0\boldsymbol{Bx}=\boldsymbol0同解”,有如下充要条件:

    1. A\boldsymbol{A}可经初等行变换化为B\boldsymbol{B}
    2. A,B\boldsymbol{A},\boldsymbol{B}的行向量组等价
    3. r(A)=r(B)=r(AB)r(\boldsymbol{A})=r(\boldsymbol{B})=r\left(\begin{matrix}\boldsymbol{A}\\\boldsymbol{B}\end{matrix}\right)
    4. Ax=0\boldsymbol{Ax}=\boldsymbol0的解均为Bx=0\boldsymbol{Bx}=\boldsymbol0的解,且r(A)=r(B)r(\boldsymbol{A})=r(\boldsymbol{B})

    特别地,Ax=0\boldsymbol{Ax}=\boldsymbol0ATAx=0\boldsymbol{A}^T\boldsymbol{Ax}=\boldsymbol0同解,但一般不和AATx=0\boldsymbol{AA}^T\boldsymbol{x}=\boldsymbol0同解

    对于一些分块矩阵的同解问题,可以将解向量也分块,再寻找极大线性无关组,或做分块矩阵的复合初等行变换

    针对非齐次方阵,类似地,命题 “Ax=ξ\boldsymbol{Ax}=\boldsymbol{\xi}Bx=η\boldsymbol{Bx}=\boldsymbol{\eta}同解(其中ξ,η\boldsymbol{\xi},\boldsymbol{\eta}均为非零向量)”,有如下充要条件:

    1. (A,ξ)(\boldsymbol{A},\boldsymbol{\xi})可经初等行变换化为(B,η)(\boldsymbol{B},\boldsymbol{\eta})
    2. (A,ξ)(\boldsymbol{A},\boldsymbol{\xi})(B,η)(\boldsymbol{B},\boldsymbol{\eta})的行向量组等价
    3. r(A,ξ)=r(AξBη)r(\boldsymbol{A},\boldsymbol{\xi})=r\left(\begin{matrix}\boldsymbol{A}&\boldsymbol{\xi}\\\boldsymbol{B}&\boldsymbol{\eta}\end{matrix}\right)
    4. Ax=ξ\boldsymbol{Ax}=\boldsymbol{\xi}的解均为Bx=η\boldsymbol{Bx}=\boldsymbol{\eta}的解,且r(A)=r(A,ξ)=r(B,η)=r(B)r(\boldsymbol{A})=r(\boldsymbol{A},\boldsymbol{\xi})=r(\boldsymbol{B},\boldsymbol{\eta})=r(\boldsymbol{B})
  • P\boldsymbol{P}nn阶可逆矩阵,则对于nn阶方阵AA而言,Ax=0\boldsymbol{Ax}=\boldsymbol{0}PAx=0\boldsymbol{PAx}=\boldsymbol{0}是同解线性方程组,具有相同的基础解系,因为相当于对A\boldsymbol{A}做初等行变换,这不会改变解;

    而如果Ax=0\boldsymbol{Ax}=\boldsymbol{0}的基础解系为ξ1,ξ2,,ξk\boldsymbol{\xi}_1,\boldsymbol{\xi}_2,\cdots,\boldsymbol{\xi}_kPξ1,Pξ2,,Pξk\boldsymbol{P\xi}_1,\boldsymbol{P\xi}_2,\cdots,\boldsymbol{P\xi}_k一般不是Ax=0\boldsymbol{Ax}=\boldsymbol{0}的基础解系

  • Ax=b\boldsymbol{Ax=b}有解的充要条件是r(A)=r(A,b)r(\boldsymbol{A})=r(\boldsymbol{A},\boldsymbol{b}),在这种情况下:

    • 当且仅当A\boldsymbol{A}是可逆方阵(满秩方阵)时有唯一解,可以用高斯消元法求解,也可以用克拉默法则求解
    • r(A)r(\boldsymbol{A})不等于列秩时,即对于nn元线性方程r(A)<nr(\boldsymbol{A})\lt n时,方程有无穷组解,具体求解需要解基础解系
  • 特别地,齐次线性方程组Ax=0\boldsymbol{Ax=0}必有零解,同样地:

    • 如果A\boldsymbol{A}是可逆方阵,则0\boldsymbol0是唯一解
    • r(A)r(\boldsymbol{A})不等于列秩时,方程有无穷组解,具体求解需要解基础解析解系
  • 特别地,对任何实方阵A\boldsymbol{A}非齐次线性方程组ATAx=ATx\boldsymbol{A}^T\boldsymbol{Ax}=\boldsymbol{A}^T\boldsymbol{x}必有解,因为r(ATA,ATb)=r(AT(A,b))r(AT)r(\boldsymbol{A}^T\boldsymbol{A},\boldsymbol{A}^T\boldsymbol{b})=r\big(\boldsymbol{A}^T(\boldsymbol{A},\boldsymbol{b})\big)\leqslant r(\boldsymbol{A}^T),同时又有r(ATA,ATb)r(ATA)=r(AT)r(\boldsymbol{A}^T\boldsymbol{A},\boldsymbol{A}^T\boldsymbol{b})\geqslant r(\boldsymbol{A}^T\boldsymbol{A})=r(\boldsymbol{A}^T),所以r(ATA,ATb)=r(ATA)=r(AT)r(\boldsymbol{A}^T\boldsymbol{A},\boldsymbol{A}^T\boldsymbol{b})=r(\boldsymbol{A}^T\boldsymbol{A})=r(\boldsymbol{A}^T),该非齐次线性方程组必有解

  • 解齐次方程Ax=0\boldsymbol{Ax=0}的基础解系,可以将A\boldsymbol{A}按初等行变换化为最简行阶梯矩阵(只能按行变换,因为习惯上竖着写向量),选取nr(A)n-r(\boldsymbol{A})个变量为自由变量,依次取第一自由变量为11、其余为00得到一个解,再取第二自由变量为11、其余为00得到另一个解,循环往复,直到得到nr(A)n-r(\boldsymbol{A})个解向量,他们是线性无关的,他们的线性组合就是所有的解(通解)

  • 解非齐次方程Ax=b\boldsymbol{Ax=b},可以先解Ax=0\boldsymbol{Ax=0}的基础解系,Ax=0\boldsymbol{Ax=0}的所有解加任意Ax=b\boldsymbol{Ax=b}的特解就是Ax=b\boldsymbol{Ax=b}的所有解(这里的加是向量之和的意思)

    • 也可以用初等行变换化增广矩阵(A,b)(\boldsymbol{A},\boldsymbol{b})为行阶梯型矩阵,将矩阵还原回线性方程组,选取nr(A)n-r(\boldsymbol{A})个变量用kik_i代替xix_i再直接解方程(解方程时把{ki}\{k_i\}当作已知的,即将其他分量用{ki}\{k_i\}和常数表示),得到一个包含未知数的解向量,最后将该解向量分离为nr(A)n-r(\boldsymbol{A})个线性无关向量的线性组合加一个常数向量的形式即可
  • 对于任意nn阶实矩阵A\boldsymbol{A},“x\boldsymbol{x}Ax=0\boldsymbol{Ax}=\boldsymbol{0}的解”的充要条件是“x\boldsymbol{x}ATAx=0\boldsymbol{A}^T\boldsymbol{Ax}=\boldsymbol{0}的解”。因为若Ax=0\boldsymbol{Ax}=\boldsymbol{0},则ATAx=AT(Ax)=0\boldsymbol{A}^T\boldsymbol{Ax}=\boldsymbol{A}^T(\boldsymbol{Ax})=\boldsymbol{0};反之,若ATAx=0\boldsymbol{A}^T\boldsymbol{Ax}=\boldsymbol{0},则xTATAx=0\boldsymbol{x}^T\boldsymbol{A}^T\boldsymbol{Ax=}0,从而(Ax)TAx=0Ax=0(\boldsymbol{Ax})^T\boldsymbol{Ax}=0\Rightarrow\boldsymbol{Ax}=\boldsymbol{0},证毕

  • 对于nn阶实矩阵A\boldsymbol{A},当r(A)=n1r(\boldsymbol{A})=n-1A\boldsymbol{A}的列向量均为Ax=0\boldsymbol{A}^{\ast}\boldsymbol{x}=\boldsymbol{0}的解,因为AA=0×E=O\boldsymbol{A}^{\ast}\boldsymbol{A}=0\times\boldsymbol{E}=\boldsymbol{O};尽管这一结论是显而易见的,但有些时候灵活运用是可以减小计算量的

接下来讨论一般线性方程组解的个数
  • 任意形式的方程组有解的充要条件是系数矩阵的秩与增广矩阵的秩相等:r(A)=r(A,b)r(\boldsymbol{A})=r(\boldsymbol{A},\boldsymbol{b})

  • 齐次方程的基础解系中自由变量的个数为:列数r(A)\text{列数}-r(\boldsymbol{A}),这也是解空间的维数、基础解系中线性无关向量的个数

  • 非齐次方程的线性无关解的个数,是相应的齐次方程解个数加一,即k+1k+1,其中kk是相应的齐次方程解空间的维数;当AAnn阶方阵时,就是nr(A)+1n-r(\boldsymbol{A})+1个;

    这是因为特解β\boldsymbol{\beta}与基础解系α1,α2,,αk\boldsymbol{\alpha}_1,\boldsymbol{\alpha}_2,\cdots,\boldsymbol{\alpha}_k线性无关,从而β,α1+β,,αk+β\boldsymbol{\beta},\boldsymbol{\alpha}_1+\boldsymbol{\beta},\cdots,\boldsymbol{\alpha}_k+\boldsymbol{\beta}k+1k+1个向量线性无关

  • A\boldsymbol{A}m×nm\times n矩阵时,其中nn既是列数也是未知数个数,则方程Ax=b\boldsymbol{Ax=b}解个数可归纳为:

    • 方程有解的条件下,若导出组只有零解(若m=nm=n,无条件等价为当A\boldsymbol{A}可逆时),则方程有唯一解

    • 导出组存在非零解时(若m=nm=n,等价为当A\boldsymbol{A}不可逆时):

      • r(A)=r(A,b)r(\boldsymbol{A})=r(\boldsymbol{A},\boldsymbol{b}),则方程有无穷个解,导出组的基础解系中有nrn-r个向量

      • r(A)<r(A,b)r(\boldsymbol{A})\lt r(\boldsymbol{A},\boldsymbol{b}),则方程无解

        ——很多时候,对于m=nm=nA\boldsymbol{A}是方阵的情况,利用好方程有无穷解或无解的必要条件A\boldsymbol{A}不可逆,会极大简化问题

    这些性质可以适当推广至AX=B\boldsymbol{AX=B}的情况

  • 非齐次方程Ax=b\boldsymbol{Ax=b}b0\boldsymbol{b}\neq\boldsymbol0)解的结构是齐次线性方程Ax=0\boldsymbol{Ax=0}的解向量加非齐次方程的任一特解,齐次线性方程的所有解构成一个线性空间,称为解空间;非齐次线性方程的解,即由基础解系加上一个给定特解而得到的所有向量,一定不能构成线性空间

  • 数值上,求解线性方程组的问题一般是通过最优化损失函数Axb2+λx2\Vert Ax-b\Vert^2+\lambda\Vert x\Vert^2,即岭估计

  • 推论 1:如果Am×n\boldsymbol{A}_{m\times n}是行满秩矩阵,则Ax=b\boldsymbol{Ax}=\boldsymbol{b}必有解,而且当A\boldsymbol{A}是方阵时有唯一解,反之有无穷多个解

  • 推论 2:方程Ax=b\boldsymbol{Ax}=\boldsymbol{b}(其中A\boldsymbol{A}m×nm\times n形矩阵)有唯一解的充要条件是r(A)=r(A,b)=nr(\boldsymbol{A})=r(\boldsymbol{A},\boldsymbol{b})=n

  • 推论 3:方程Ax=b\boldsymbol{Ax}=\boldsymbol{b}(其中A\boldsymbol{A}m×nm\times n形矩阵)有无穷多个解的充要条件是r(A)=r(A,b)<nr(\boldsymbol{A})=r(\boldsymbol{A},\boldsymbol{b})\lt n

  • 推论 4:方程Ax=b\boldsymbol{Ax}=\boldsymbol{b}(其中A\boldsymbol{A}m×nm\times n形矩阵)有无解的充要条件是r(A)r(A,b)r(\boldsymbol{A})\neq r(\boldsymbol{A},\boldsymbol{b})

  • 再次强调,以上结论均可以很自然地推广至方程AX=B\boldsymbol{AX}=\boldsymbol{B}

特征值和特征向量

正交矩阵、正交变换与特征值、特征向量有密不可分的关系

特征分解可推广为谱分解与奇异值分解(SVD),前者是对从向量空间的角度进行推广,一般在泛函分析中讨论,而后者SVD是对方阵对象进行推广,将分解方法扩展至一般的矩阵

如果只是希望计算矩阵的特征值与特征向量,除了用 WolframApha “大炮打蚊子”,也可以选择:矩阵计算器

注意,若对某抽象nn阶矩阵提到了 “各行元素之和为…” 或 “各列元素之和为…”,大概率需要联系到特征值与特征向量,可能需要联系到伴随矩阵(尤其是当问题明确涉及代数余子式时)。以nn阶矩阵AA的各行元素之和为22为例,可以推导

A(111)=(i=1na1ii=1na2ii=1nani)=(222) A\left(\begin{matrix}1\\1\\\vdots\\1\end{matrix}\right)=\left(\begin{matrix}\sum\limits^n_{i=1}a_{1i}\\\sum\limits^n_{i=1}a_{2i}\\\vdots\\\sum\limits^n_{i=1}a_{ni}\end{matrix}\right)=\left(\begin{matrix}2\\2\\\vdots\\2\end{matrix}\right)

所以22是矩阵AA的一个特征值,而且(1,1,,1)T\left(\begin{matrix}1,1,\cdots,1\end{matrix}\right)^T是特征值22对应的一个特征向量。若给出的条件是 “各列元素之和为…”,则对ATA^T作类似讨论即可

特征值、特征向量与特征子空间

  • 相似变换不改变特征值,但是初等变换、合同变换不能保证不改变

  • AABB相似,则他们有相同的特征多项式,进而有相同的特征值,虽然特征向量很可能不一样;但反过来,有相同特征多项式的两矩阵却不一定相似,加上秩相等的条件也不行;判断是否相似唯一的”充要“条件就是计算Jordan块

  • 由于nn次多项式方程虚根成对出现,因此奇数阶实矩阵一定有实数特征值,但偶数阶实矩阵不能确定实数特征值是否存在

    例如反对称阵的特征值就只能是00或纯虚数,而不可能有非零实数

  • 秩和特征值之间没有决定性的联系,但二者间也有些许关联,例如在Jordan标准型中的体现;

    但是根据“kk重特征值至多有kk个线性无关的特征向量”和线性方程组解的结构可以导出,若某nn阶矩阵不可逆 / 行列式为00,则00至少是该矩阵的nr(A)n-r(A)重特征值(从Ax=0Ax=\boldsymbol0出发推导)

    对于秩和特征值的关系,更一般地:

    对于一个不满秩的nn阶方阵AA,记零特征值的代数重数(00作为特征方程根的重数)为α\alpha、几何重数(特征值00的线性无关特征向量个数、零特征值的特征子空间维数)为β\betaαβ\alpha\geqslant\beta,则有:

    • nαr(A)<nn-\alpha\leqslant r(A)\lt nr(A)=nβ\boldsymbol{r(A)=n-\beta}

    • 推论 1:如果AA仅有一个零特征值,即α=β=1\alpha=\beta=1,则r(A)=n1r(A)=n-1

    • 推论 2:如果r(A)=1r(A)=1,则λ1=tr(A)\lambda_1=\mathrm{tr}(A)λ2=λ3==λn=0\lambda_2=\lambda_3=\cdots=\lambda_n=0,这也是在后文中专门对秩11矩阵讨论的一个结论

    • 推论 3:如果AA是实对称矩阵,则r(A)=nαr(A)=n-\alpha,这是因为实对称阵必可对角化,此时有α=β\alpha=\beta

    • 综上所述,零特征值代数重数仅能限定秩的范围,而在此范围内秩是由特征值的几何重数决定的,所以零特征值的个数(零特征值的代数重数α\alpha)与矩阵的秩间没有决定性关系

    参考文献:钟成义,肖宏儒.方阵秩与零特征值代数重数相关性探讨[J].高等数学研究,2009,12(01):96-97.

  • ABABBABA并不一定相似,即使二者一定有相同的特征多项式与特征值

    尽管可以证明二者特征值的代数重数必然相等,但几何重数却不一定相等,这也导致了连秩都可能是不同的

    就算A,BA,B都是nn阶可逆矩阵ABABBABA也不一定相似,但如果A,BA,B都是nn阶实对称阵就可以断言必有AB,BAAB,BA相似了

  • 相似的矩阵有相等的特征多项式,反之一般不成立

  • 特征值与矩阵多项式 ①:AA的特征值为(λ1λ2λn)\left(\begin{matrix}\lambda_1\\\lambda_2\\\vdots\\\lambda_n\end{matrix}\right),则矩阵多项式函数k=0makAk\sum\limits^m_{k=0}a_{k}A^k的特征值为(k=0makλ1kk=0makλ2kk=0makλnk)\left(\begin{matrix}\sum\limits^m_{k=0}a_{k}\lambda^k_1\\\sum\limits^m_{k=0}a_{k}\lambda^k_2\\\vdots\\\sum\limits^m_{k=0}a_{k}\lambda^k_n\end{matrix}\right),他们是一一对应的。其中,A0A^0约定为EE;将A1A^{-1}记为AA的逆,则式子k=1makAk\sum\limits^m_{k=-1}a_{k}A^k仍成立

    但是注意,对一般的非对称方阵AA而言,AATAA^T的特征值不再是简单的AA的特征值平方

    进一步的,对更一般的矩阵,两个矩阵相乘(与相加)得到的新矩阵的特征值与原来相乘(与相加)的两个矩阵各自的特征值间同样没有任何简单的数量关系

    P1AP=BP^{-1}AP=B的情况下A,BA,B却有相同的特征值,因为二者相似

  • 特征值与矩阵多项式 ②:最小多项式整除任意零化多项式,所以如果有多项式f(A)=Of(A)=O成立,则AA的任意特征值λi\lambda_i一定满足f(λ)=0f(\lambda)=0,但f(x)=0f(x)=0的根不一定都是特征值。这是一个强大的定理,例如方阵AA满足等式A2+A=OA^2+A=O,则AA的特征值至多只可能取值001-1,而不可能是这以外的任何数;再如果方阵AA满足等式A3=OA^3=O,则AA的特征值只能取值00

  • 特征值与矩阵多项式 ③:Cayley-Hamilton定理:设A\boldsymbol{A}是数域P\mathbb{P}上的矩阵,记其特征多项式为f(λ)f(\lambda),则f(A)=Of(\boldsymbol{A})=\boldsymbol{O}

    minimal_polynomial

    在拓扑中,这意味着可对角化方阵在所有的方阵中稠密

    根据Cayley-Hamilton定理,如果矩阵特征值均为00,则一定是幂零矩阵;根据特征值与矩阵多项式的关系又可知,如果一个矩阵是幂零矩阵,则特征值一定全为00,所以:矩阵是幂零矩阵当且仅当其特征值只取00

  • 主对角线上下三角阵的特征值就是主对角线上的各个元素

  • 特征值的和与积:

    • λi=tr(A)=aii\displaystyle{\sum\lambda_i=\text{tr}(\boldsymbol{A})=\sum a_{ii}}
    • λi=det(A)\displaystyle{\prod\lambda_i=\det(\boldsymbol{A})}

    验证特征值是否计算正确:利用 λi=tr(A)\ \displaystyle{\boldsymbol{\sum\lambda_i=}\text{tr}(\boldsymbol{A})},尽管这只是必要条件

  • 通过特征值和特征向量还原矩阵:

    A=PΛP1=[α1,α2,]diag(λ1,λ2,)[α1,α2,]1=[λ1α1,λ2α2,][α1,α2,]1 \begin{aligned} A&=P\Lambda P^{-1}=[\alpha_1,\alpha_2,\cdots]\text{diag}(\lambda_1,\lambda_2,\cdots)[\alpha_1,\alpha_2,\cdots]^{-1}\\ &=[\lambda_1\alpha_1,\lambda_2\alpha_2,\cdots][\alpha_1,\alpha_2,\cdots]^{-1} \end{aligned}

    运用这一公式计算是方便的,尤其在含00特征值的情况下

  • 实对称矩阵的特征值一定存在且为实数

  • nn阶方阵AA是实对称矩阵的充要条件:所属不同特征值的特征向量是两两正交的。有些时候,需要善用这一性质以根据条件解出特征向量。

    • 推论 1:实对称矩阵的特征向量经Schmidt化后仍为特征向量(属于同一特征值的线性无关特征向量仍可能是非正交的,但正交化后仍然其特征向量)
    • 推论 2:实对称矩阵一定可以被某个正交矩阵相似对角化
    • 推论 3:对非对称阵的特征向量进行Schmidt正交化后,得到的正交向量不再是其特征向量
    • 推论 4:二次型矩阵经正交矩阵相似对角化后得到的合同对角矩阵,主对角线上元素正是其特征值
  • 对秩11矩阵讨论的重要结论:若A=αβTOA=\alpha\beta^T\neq O,其中α,β\alpha,\beta均为长度为nn的列向量,则r(A)=1r(A)=1tr(A)=αTβ\text{tr}(A)=\alpha^T\beta。所有的秩为11的矩阵都可以被分解为αβT\alpha\beta^Tα,β0\alpha,\beta\neq\boldsymbol0),平凡地可知零矩阵也可以被如此分解,只要取α,β\alpha,\beta任一为零向量即可。事实上秩11矩阵的行或列之间一定是成比例的,因此:

    • nn阶矩阵AAr(A)1r(A)\leqslant1成立的充要条件是α,β,  s.t. A=αβT\exists \alpha,\beta,\ \ s.t.\ A=\alpha\beta^T
    • nn阶矩阵AAr(A)=1r(A)=1成立的充要条件是α,β0,  s.t. A=αβT\exists \alpha,\beta\neq\boldsymbol0,\ \ s.t.\ A=\alpha\beta^T

    更进一步地,如果αTβ0\alpha^T\beta\neq0,则AA的特征值为αTβ,0,0,,0n1 zeros\alpha^T\beta,\underbrace{0,0,\cdots,0}_{n-1 \text{ zeros}},并且属于特征值αTβ\alpha^T\beta的特征向量正是kαk\alpha,属于特征值00的特征向量则是{x:βTx=0}\{x:\beta^Tx=0\},共计n1n-1个属于00的线性无关特征向量。在表示属于00的第ii个特征向量时,可以令xi=1x_i=1xn=βiβnx_n=-\frac{\beta_i}{\beta_n}xx其余分量为00,记该向量为x(i)x^{(i)},从i=1i=1开始依次重复操作直到i=n1i=n-1时即可取完00的所有n1n-1个线性无关的特征向量{x(i)}\{x^{(i)}\}

    如果αTβ=0\alpha^T\beta=0α,β0\alpha,\beta\neq\boldsymbol0,则AA的秩仍为11且有nn个值为00的特征值,但仅有n1n-1个属于00的线性无关的特征向量,并且属于00的特征向量仍是{x:βTx=0}\{x:\beta^Tx=0\};由于此时Aα=α(βTα)=0A\alpha=\alpha(\beta^T\alpha)=0,故α\alpha不再是AA的特征向量。这就是一个特征值均为00但矩阵秩非00的例子

    这里有一道非常好的例题可以检验是否熟练掌握了秩11矩阵的性质:设α,β\alpha,\beta33维单位列向量且αTβ=0\alpha^T\beta=0,记A=βαT+αβT+λEA=\beta\alpha^T+\alpha\beta^T+\lambda EλR\lambda\in\mathbb{R},若AA为正定矩阵,试求λ\lambda的取值范围;

    分析:容易知道,βαT\beta\alpha^TαβT\alpha\beta^T均为特征值全为00的矩阵,但尤其注意βαT\beta\alpha^TαβT\alpha\beta^T的秩却不为00而是11,因为他们都是单位列向量,所以βαT\beta\alpha^TαβT\alpha\beta^T不可能为零矩阵,进而秩只能为11。进一步注意到

    1. βαT\beta\alpha^T(βαT)α=β(αTα)=1×β(\beta\alpha^T)\alpha=\beta(\alpha^T\alpha)=1\times\beta(βαT)β=β(αTβ)=0(\beta\alpha^T)\beta=\beta(\alpha^T\beta)=\boldsymbol0

    2. αβT\alpha\beta^T(αβT)β=α(βTβ)=1×α(\alpha\beta^T)\beta=\alpha(\beta^T\beta)=1\times\alpha(αβT)α=α(βTα)=0(\alpha\beta^T)\alpha=\alpha(\beta^T\alpha)=\boldsymbol0

    所以令B=βαT+αβTB=\beta\alpha^T+\alpha\beta^T,有

    {B(α+β)=(βαT+αβT)(α+β)=α+βB(αβ)=(βαT+αβT)(αβ)=(αβ) \left\{\begin{aligned} &B(\alpha+\beta)=(\beta\alpha^T+\alpha\beta^T)(\alpha+\beta)=\alpha+\beta\\ &B(\alpha-\beta)=(\beta\alpha^T+\alpha\beta^T)(\alpha-\beta)=-(\alpha-\beta) \end{aligned}\right.

    BB的三个特征值中,有两个分别为111-1;又注意到r(B)r(βαT)+r(αβT)=2r(B)\leqslant r(\beta\alpha^T)+r(\alpha\beta^T)=2,所以BB还有一个特征值为00。从而,A=B+λEA=B+\lambda E的特征值为1+λ,1+λ,λ1+\lambda,-1+\lambda,\lambda;此时需注意AA是实对称阵,因为B=βαT+αβT=βαT+(βαT)TB=\beta\alpha^T+\alpha\beta^T=\beta\alpha^T+(\beta\alpha^T)^T是实对称阵,根据实对称阵正定的充要条件,让AA的特征值均为实正数即可,因此λ>1\lambda>1

  • 特征多项式系数:λEA=λntr(A)λn1++(1)ndet(A)|\lambda E-A|=\lambda^n-\text{tr}(A)\lambda^{n-1}+\cdots+(-1)^n\det(A)

  • 特别地,对三阶方阵A\boldsymbol{A}的特征多项式,有:

    λEA=λ3tr(A)λ2+γλA \color{#990066}{\boldsymbol{|\lambda E-A|=\lambda^3-\textbf{tr}(A)\lambda^2+\gamma\lambda-|A|}}

    其中,γ\boldsymbol{\gamma}是三个子式的和:A11+A22+A33=a11a12a21a22+a11a13a31a33+a22a23a32a33\boldsymbol{A_{11}+A_{22}+A_{33}}=\left|\begin{matrix}a_{11}&a_{12}\\a_{21}&a_{22}\end{matrix}\right|+\left|\begin{matrix}a_{11}&a_{13}\\a_{31}&a_{33}\end{matrix}\right|+\left|\begin{matrix}a_{22}&a_{23}\\a_{32}&a_{33}\end{matrix}\right|,在数值上等于主对角线元素两两配对相乘之和减去对称位置元素两两相乘的和(除主对角线元素),即

    A=(a11a12a13a21a22a23a31a32a33) \color{#990066}{\boldsymbol{A=}\left(\begin{matrix}\color{#00CC33}{\boldsymbol{a_{11}}}&\color{#6666FF}{\boldsymbol{a_{12}}}&\color{#6666FF}{\boldsymbol{a_{13}}}\\\color{#6666FF}{\boldsymbol{a_{21}}}&\color{#00CC33}{\boldsymbol{a_{22}}}&\color{#6666FF}{\boldsymbol{a_{23}}}\\\color{#6666FF}{\boldsymbol{a_{31}}}&\color{#6666FF}{\boldsymbol{a_{32}}}&\color{#00CC33}{\boldsymbol{a_{33}}}\\\end{matrix}\right)} γ=A11+A22+A33=(a11a22+a11a33+a22a33)(a12a21+a13a31+a23a32) \color{#990066}{\begin{align}\boldsymbol{\gamma}&\boldsymbol{=A_{11}+A_{22}+A_{33}}\\&\boldsymbol{=\big(a_{11}a_{22}+a_{11}a_{33}+a_{22}a_{33}\big)-\big(a_{12}a_{21}+a_{13}a_{31}+a_{23}a_{32}\big)}\end{align}}

    在此补充一些多项式知识,在求解三阶方阵的特征多项式时大有用处:

    • 如果特征值不为0\boldsymbol0,可以利用迹、行列式与特征值的关系,尝试“凑”一下特征多项式的根,先解出一个因式,和下文类似

    • 一般来说,除了根据迹和行列式硬“凑”,可以尝试代入0\boldsymbol0±1\boldsymbol{\pm1}±2\boldsymbol{\pm2}±3\boldsymbol{\pm3}±2\boldsymbol{\pm\sqrt2}等简单值,如果这些值确为特征多项式的根,那么就可以做因式分解,剩下的根由一个二次函数确定,问题变得十分简单;通常来说特征值都逃不过这些特殊值,尤其是非满秩的方阵必有0\boldsymbol0特征值

    • 找根的一个方法:整系数多项式anxn+an1xn1++a1x1+a0\boldsymbol{a_nx_n+a_{n-1}x^{n-1}+\cdots+a_1x_1+a_0}的有理根若存在则必为pq\boldsymbol{\frac pq}的形式,其中p\boldsymbol pa0\boldsymbol{a_0}的因数、q\boldsymbol{q}an\boldsymbol{a_n}的因数,可简记为“0n\boldsymbol{\frac0n}”方便记忆

    • 最后,需要通过含参特征行列式解出参数的,就按照定义计算不失为一种好办法(长期以来我都是用这种最“原始”的方法计算的三阶行列式,并没有什么复杂的),只需要通过初等变换多消几个0\boldsymbol0出来,行列式就会很好计算,最重要的是在化0\boldsymbol0的过程中通常直接就会出现可以分解的因式

  • 特征向量总结:

    • AA的特征向量一定是AA的多项式f(A)=k=1nakAkf(A)=\sum\limits^n_{k=1}a_kA^k的特征向量(相应的特征值是不难计算的),但反之一般变成立
    • 如果AA是正定矩阵,则上一点的逆命题也成立,即AA的多项式f(A)=k=1nakAkf(A)=\sum\limits^n_{k=1}a_kA^k的特征向量也一定是AA的特征向量
    • 一般而言AA的特征向量与ATA^T的特征向量没什么关联,除非AA是对称阵,只不过对于实矩阵而言二者特征值相同
    • 关于AA^{\ast}的特征向量与AA的特征向量,对于nn阶矩阵AA
      • r(A)=nr(A)=n时,AA的特征子空间与A1A^{-1}AA^{\ast}的特征子空间相同(相应的特征值是不难计算的)
      • 如果r(A)=n1r(A)=n-1AAnn个线性无关的特征向量,则AA的属于非零特征值的特征向量和AA^{\ast}的属于特征值00的特征向量一致,AA的属于特征值00的特征向量和AA^{\ast}的属于非零特征值的特征向量一致,所以此时AA的特征子空间仍与AA^{\ast}的特征子空间相同
      • 如果r(A)=n1r(A)=n-1AA没有nn个线性无关的特征向量,即几何重数的和不等于nn,则只能保证AA的属于非零特征值的特征向量一定是AA^{\ast}的属于特征值00的特征向量,反之不一定,而且AA的属于特征值00的特征向量也不再必然是AA^{\ast}的属于非零特征值的特征向量
      • 特别地,r(A)=n1r(A)=n-1时,AA的列向量均为AA^{\ast}的零特征值的特征向量,因为AA=OA^{\ast}A=O
      • r(A)<n1r(A)\lt n-1,则AA的特征向量与AA^{\ast}的特征向量间似乎没有必然联系(毕竟此时AA^{\ast}已经是零矩阵了)

相似对角化

  • 相似对角化的一般形式是:P1AP=ΛP^{-1}AP=\Lambda,即:PΛP1=AP\Lambda P^{-1}=A

    不要混淆了,其中PPAA的特征向量列成的矩阵

  • 引理:Rn×n\mathbb{R}^{n\times n}上,若AA的特征值都是实数,则\exists正交矩阵PPs.t.  P1APs.t.\ \ P^{-1}AP为上三角阵

  • Rn×n\mathbb{R}^{n\times n}上,若AA的特征值都是实数,则AA正交相似于对角阵的充要条件是AA为正规矩阵(ATA=AATA^TA=AA^T

  • 推论:实数范围内,方阵为实对称矩阵 \Leftrightarrow 方阵能被正交矩阵相似对角化(正交变换是合同变换,只能把对称矩阵变为对称阵,反之亦然,永远保持对称性)

    • 注意到ATAA^TAAATAA^T必然是对称矩阵

    证明思路:特征值λ\lambda的特征子空间可以等价表为ker(AλE)\text{ker}(A-\lambda E),作为特征子空间的推广,称ker(AλE)k\text{ker}(A-\lambda E)^k为根子空间。由于根子空间的维必然等于根的代数重数,因此只需要证明实对称矩阵的根子空间等价于其特征子空间,注意到对实对称矩阵而言Ax=0\boldsymbol{Ax=0}Anx=0\boldsymbol{A}^n\boldsymbol{x=0}同解即可。根子空间与Jordan标准型息息相关。

  • 方阵的秩和可否对角化没有必然关系,只是若方阵满秩,则没有00特征值,如果可相似对角化那么对角阵的对角线上元素均非00;反过来,若可对角化(相似)于对角线上均非00的单位阵,则没有00特征值,方阵可逆

  • 单位阵只与自己相似,也只有单位阵能相似对角化为单位阵

  • 矩阵可相似对角化的充要条件:

    1. 最小多项式没有重根,且可分解为一次因式的乘积

    2. λ\lambda矩阵的最高阶(最大)不变因子没有重根

    3. 矩阵有nn个线性无关的特征向量,即特征多项式有nn个根,而且kk重根有kk个线性无关的特征向量

    4. 第三点直接等价为r(λiEA)=nnir(\lambda_iE-A)=n-n_i,其中nin_i是的λi\lambda_i作为特征多项式根的重数

    5. 第四点直接等价为 几何重数==代数重数

  • 矩阵可相似对角化的充分条件:

    1. 实对称阵必可被正交矩阵相似对角化(R\mathbb{R}上)

      • 推论 1:实对称矩阵的特征值均为实数

      • 推论 2:实对称矩阵的属于不同特征值的特征向量必然两两正交

      • 推论 3:实对称矩阵必然有nn个两两正交的特征向量(但不一定任意的特征向量都是正交的,除非两个特征向量不属于同一特征值)

      • 推论 4:对于nn阶实矩阵而言,矩阵是实对称阵的充要条件是矩阵有nn个两两正交的特征向量

    2. 矩阵有nn个互不相同的特征值

  • 如果可逆矩阵PP可相似对角化nn阶方阵AA,即P1AP=ΛP^{-1}AP=\Lambda,则有

    1. P1f(A)P=f(Λ)P^{-1}f(A)P=f(\Lambda),其中f(A)f(A)AA的任意次多项式
    2. 如果AA可逆,则P1A1P=Λ1P^{-1}A^{-1}P=\Lambda^{-1}Λ1\Lambda^{-1}Λ\Lambda对角元分别取倒数后的新对角阵
    3. 如果AA可逆,则P1AP=ΛP^{-1}A^{\ast}P=\Lambda^{\ast}Λ\Lambda^{\ast}Λ1\Lambda^{-1}对角元分别乘det(Λ)\det(\Lambda)后的新对角阵

二次型理论

学习二次型与合同理论,对空间解析几何和双线性泛函的研究至关重要。

  • A=(aij)n×n\boldsymbol{A}=(a_{ij})_{n\times n}为一个对称矩阵,则数域P\mathbb{P}上的任何一个二次型定义为

    xTAx=i=1nj=1naijxixj=a11x12+a22x22+annxn2+2a12x1x2+2a13x1x3+ \boldsymbol{x}^T\boldsymbol{Ax}=\sum\limits^n_{i=1}\sum\limits^n_{j=1}a_{ij}x_ix_j=a_{11}x^2_1+a_{22}x^2_2\cdots+a_{nn}x^2_n+2a_{12}x_1x_2+2a_{13}x_1x_3+\cdots

    任何二次型都可以经非退化线性变换化为一个标准型,即平方和的形式;

    也可以等价地说,数域P\mathbb{P}上任意一个对称矩阵都合同于一个对角矩阵

  • 立刻可以推导,若实矩阵A=(aij)m×n\boldsymbol{A}=(a_{ij})_{m\times n},则xTATAx\boldsymbol{x}^T\boldsymbol{A}^T\boldsymbol{Ax}也是一个二次型,有

    xTATAx=i=1m(j=1naikxk)2= i=1m(ai1x1+ai2x2++ainxn)2 \boldsymbol{x}^T\boldsymbol{A}^T\boldsymbol{Ax}=\sum^m_{i=1}\left(\sum^n_{j=1}a_{ik}x_k\right)^2=\ \sum^m_{i=1}\big(a_{i1}x_1+a_{i2}x_2+\cdots+a_{in}x_n\big)^2
  • 有些时候给所出的二次型f(x)=xTAxf(\boldsymbol{x})=\boldsymbol{x}^T\boldsymbol{Ax}形式,矩阵A\boldsymbol{A}可能并不是对称阵,这会给后续的一系列分析带来不便,所以需要将其对称化。按二次型的定义,只需要将A\boldsymbol{A}每一对对称位置的元素相加,除22平均一下,再分配回原来的位置即可,这样就能得到相应的对称矩阵Aˉ\bar{\boldsymbol{A}},该二次型也可以写为f(x)=xTAˉxf(\boldsymbol{x})=\boldsymbol{x}^T\bar{\boldsymbol{A}}\boldsymbol{x};用矩阵表达的话,即Aˉ=12(A+AT)\displaystyle{\bar{\boldsymbol{A}}=\frac12\big(\boldsymbol{A}+\boldsymbol{A}^T\big)}

  • 对于实对称矩阵A\boldsymbol{A}、二次型xTAx\boldsymbol{x}^T\boldsymbol{Ax}与可逆矩阵C\boldsymbol{C},称CTAC\boldsymbol{C}^T\boldsymbol{AC}A\boldsymbol{A}经合同变换y=Cx\boldsymbol{y}=\boldsymbol{Cx}后的新二次型,CTAC\boldsymbol{C}^T\boldsymbol{AC}仍是一个实对称矩阵

  • 惯性定理:任意的实的或复的二次型,经过适当的线性变换总能变为规范型,且规范型是唯一的

  • 称规范型的正系数个数为正惯性指数,或者说称矩阵与之合同的标准型矩阵的11的个数为正惯性指数;

    对应地,称规范型的负系数个数为负惯性指数

  • 称正惯性指数减负惯性指数的值为符号差

  • 任意复对称矩阵都合同于diag(1,1,,1,0,0,)\text{diag}(1,1,\cdots,1,0,0,\cdots),其中11的个数是矩阵的秩

    任意实矩阵矩阵都合同于diag(1,1,,1,1,1,,1,0,0,)\text{diag}(1,1,\cdots,1,-1,-1,\cdots,-1,0,0,\cdots)111-1的个数分别为正惯性指数与负惯性指数

  • 正惯性指数等于正特征值个数,负惯性指数等于负特征值个数

  • 如果对实对称矩阵A\boldsymbol{A}\forall非零x\boldsymbol{x},均有xTAx>(<)0\boldsymbol{x}^T\boldsymbol{Ax}>(<)\,0,则称A\boldsymbol{A}是正 (负) 定的;如果不等号不严格成立,则称A\boldsymbol{A}是半正 (负) 定或非负 (正) 定的;如果x1,x2Rn\exists \boldsymbol{x}_1,\boldsymbol{x}_2\in\mathbb{R}^ns.t. x1TAx1<0<x2TAx2s.t.\ \boldsymbol{x}^T_1\boldsymbol{Ax}_1<0<\boldsymbol{x}^T_2\boldsymbol{Ax}_2,则称A\boldsymbol{A}是不定的

  • nn阶实对称矩阵正定的充要条件:

    1. 特征值均大于00
    2. 正惯性指数等于nn
    3. 与单位阵合同,即存在A=CTEC=CTCA=C^TEC=C^TC,其中CC是实可逆矩阵
    4. 顺序主子式均大于00
  • nn阶实对称矩阵正定的必要条件:

    1. 主对角线上元素均大于00
    2. 行列式值大于00
  • nn阶实对称矩阵半正定(非负定)的充要条件:

    1. 特征值均非负
    2. 正惯性指数等于秩
    3. 有实矩阵CC使得A=CTCA=C^TC
    4. 所有主子式(行指标与列指标相同的子式)均大于或等于00
  • nn阶实对称矩阵负定的充要条件:

    1. 特征值均小于00
    2. 负惯性指数等于nn
    3. 与负单位阵合同,即存在A=CTEC=CTCA=-C^TEC=-C^TC,其中CC是实可逆矩阵
    4. 奇数阶顺序主子式均小于00,而偶数阶顺序主子式均大于00
  • nn阶实对称矩阵半负定(非正定)的充要条件:

    1. 特征值均非正
    2. 负惯性指数等于秩
    3. 有实矩阵CC使得A=CTCA=-C^TC
    4. 所有奇数阶主子式(行指标与列指标相同的子式)均小于或等于00,所有偶数阶主子式(行指标与列指标相同的子式)均大于或等于00
  • nn阶实对称矩阵不定的充要条件:

    1. 不满足上述任意情况时,例如至少存在一个正特征值和一个负特征值
    2. 二次型ff既会取到正值,又会取到负值(通过代特值,这个方法有时会比计算特征值来得快得多)
  • 既是正定矩阵又是正交矩阵的矩阵只有单位阵EE,因此对非单位阵而言“正交与正定不可得兼”

  • 对于二阶方阵而言,正定或负定的充要条件是行列式大于00,其中a11>0a_{11}>0则正定,a11<0a_{11}<0则负定;半正定或半负定的充要条件是行列式等于00;不定的充要条件是行列式小于00

  • 规范型是唯一的,标准型不唯一;

    但是经正交矩阵相似对角化得到的标准型(经正交变换的二次型)在不考虑元素顺序的情况下是唯一确定的,因为这时的标准型对角矩阵的主对角线上元素就是原二次型矩阵的特征值

  • 求标准型 / 规范型的方法:

    特别提示:若所求的是xTAx\boldsymbol{x}^T\boldsymbol{Ax}yTΛy\boldsymbol{y}^T\boldsymbol{\Lambda y}的非退化线性变换x=Py\boldsymbol{x}=\boldsymbol{Py},则经过合同变换法与正交变换法得到的变换矩阵直接就是P\boldsymbol{P},有A=PΛP1\boldsymbol{A}=\boldsymbol{P\Lambda P}^{-1}P1ΛP=Λ\boldsymbol{P}^{-1}\boldsymbol{\Lambda P}=\boldsymbol{\Lambda}但经配方法直接得到的矩阵C\boldsymbol{C}是需要取其逆才能得到变换矩阵的,因为配方法在配方时做的变换y=Q1Q2Qnx\boldsymbol{y=Q}_1\boldsymbol{Q}_2\cdots\boldsymbol{Q}_n\boldsymbol{x}是“反”着来的,也就是说Q1Q2Qn=C=P1\boldsymbol{Q}_1\boldsymbol{Q}_2\cdots\boldsymbol{Q}_n=\boldsymbol{C=P}^{-1}

    1. 配方法

      原始而麻烦,但有时却又是最实用的方法,只需要一步一步地逐个将含某变量的二次项都表示为和的平方即可。例如对于一个需要计算标准型的二次型x12+3x22+3x32+2x1x24x1x3x^2_1+3x^2_2+3x^2_3+2x_1x_2-4x_1x_3,第一步先将含x1x_1的项写为平方和以消除x1x_1与剩余变量的耦合,即(x1+x22x3)2+2x22x23+2x2x3(x_1+x_2-2x_3)^2+2x^2_2-x^3_2+2x_2x_3,再对剩余部分将含x2x_2的项写为平方和以消除x2x_2与剩余变量的耦合,即(x1+x22x3)2+2(x2+x3)23x32(x_1+x_2-2x_3)^2+2(x_2+x_3)^2-3x^2_3,到此为止就只剩下了一个平方项x32x^2_3,于是得到了

      {y1=x1+x22x3y2=         x2+  x3y3=                    x3 \left\{\begin{aligned} &y_1=x_1+x_2-2x_3\\ &y_2=\ \ \ \ \ \ \ \ \ x_2+\ \ x_3\\ &y_3=\ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ x_3 \end{aligned}\right.

      y=[112111]x=Cx\boldsymbol{y}=\left[\begin{matrix}1&1&-2\\&1&1\\&&1\end{matrix}\right]\boldsymbol{x}=\boldsymbol{C x},写为非退化线性变换形式则是

      x=C1y=[113111]y \boldsymbol{x}=\boldsymbol{C}^{-1}\boldsymbol{y}=\left[\begin{matrix}1&-1&3\\&1&-1\\&&1\end{matrix}\right]\boldsymbol{y}

      经变换后得到的标准型则是y12+2y223y32y^2_1+2y^2_2-3y^2_3,即yT[123]y\boldsymbol{y}^T\left[\begin{matrix}1&&\\&2&\\&&-3\end{matrix}\right]\boldsymbol{y}

      尤其注意,在做变换时一定要保证变换是非退化的、可逆的,例如有的二次型其正负惯性指数之和可能并不等于他的阶数,也就是说含有零特征值,譬如(x1+x2)23(x1+2x2x3)2(x_1+x_2)^2-3(x_1+2x_2-x_3)^2,如果我们令y1=x1+x2y_1=x_1+x_2y3=x1+2x2x3y_3=x_1+2x_2-x_3,那y3y_3该怎么办呢?这时只要保证y3y_3的线性变换不会使得他与y1,y2y_1,y_2线性相关即可,也就是说变换矩阵必须满秩、可逆:取y=x2x3y=x_2-x_3就是不被允许的,而y3=x3y_3=x_3y3=x1+x2+x3y_3=x_1+x_2+x_3则都是可行的。做变换时可以经多次代换得到结果,而不必一定要一次变化就化作标准型或规范型,在最后求总的变换时将多次变换对应的多个变换矩阵依次乘起来即可

      配方法有时需要一定的技巧。例如在用配方法求解2x1x2+4x1x32x_1x_2+4x_1x_3的标准型时,试图直接配方会遇到阻碍,因为原式中只含有x1x_1与剩余变量乘积的二次项,却不含有x12x^2_1项,这时就需要利用平方差公式“变”出平方项。先令

      {x1=y1+y2x2=y1y2x3=                 y3 \left\{\begin{aligned} &x_1=y_1+y_2\\ &x_2=y_1-y_2\\ &x_3=\ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ y_3 \end{aligned}\right.

      使得原式变为2(y1+y2)(y1y2)+4(y1+y2)y3=2(y1+y3)22(y2y3)22(y_1+y_2)(y_1-y_2)+4(y_1+y_2)y_3=2(y_1+y_3)^2-2(y_2-y_3)^2以“创造”出平方项,接下来和上例进行同样的操作即可:

      {z1=y1+y2z2=         y2y3z3=                  y3 \left\{\begin{aligned} &z_1=y_1+y_2\\ &z_2=\ \ \ \ \ \ \ \ \ y_2-y_3\\ &z_3=\ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ y_3 \end{aligned}\right.

      最后得到标准型2z122z222z^2_1-2z^2_2,其中的非退化线性变换为

      [110110001][110011001]1=[110110001][101011001]=[110112001] \left[\begin{matrix}1&1&0\\1&-1&0\\0&0&1\end{matrix}\right]\left[\begin{matrix}1&1&0\\0&1&-1\\0&0&1\end{matrix}\right]^{-1}=\left[\begin{matrix}1&1&0\\1&-1&0\\0&0&1\end{matrix}\right]\left[\begin{matrix}1&0&-1\\0&1&1\\0&0&1\end{matrix}\right]=\left[\begin{matrix}1&1&0\\1&-1&-2\\0&0&1\end{matrix}\right]
    2. 合同变换法

      可以视为配方法的矩阵描述。设二次型f(x1,x2,)=xTAxf(x_1,x_2,\cdots)=\boldsymbol{x}^T\boldsymbol{Ax}的矩阵为A\boldsymbol{A},对A\boldsymbol{A}下接E\boldsymbol{E}得到增广矩阵(AE)\left(\begin{matrix}\boldsymbol{A}\\\boldsymbol{E}\end{matrix}\right),接着进行相应行列变换将第一个分块A\boldsymbol{A}化为E\boldsymbol{E'}(其中E\boldsymbol{E'}是对角阵,若欲得到实标准型则E\boldsymbol{E'}主对角元只能为111-100),但是每进行一次行变换都要同样地进行相应列变换,记最后得到的矩阵为(EP)\left(\begin{matrix}\boldsymbol{E'}\\\boldsymbol{P}\end{matrix}\right),则x=Py\boldsymbol{x}=\boldsymbol{Py},其中y\boldsymbol{y}是新的变量,变换后的二次型即yTEy\boldsymbol{y}^T\boldsymbol{E'}\boldsymbol{y},矩阵表达为A=PTEP\boldsymbol{A=P}^T\boldsymbol{E'P},形式上和相似对角化是“相反”的,切勿混淆

      如果右接E\boldsymbol{E},则最后求出的变换矩阵需要经一次转置;

      这里E\boldsymbol{E}的作用是记录行变换,E\boldsymbol{E}替换为更一般的对称矩阵,可以将该方法推广到计算两个二次型之间的合同变换

    3. 正交变换法(利用特征分解和相似对角化计算标准型)

      当要求变换矩阵为正交矩阵或变换为正交变换时,考虑该方法(也可以用该方法计算标准型)。操作时,首先计算矩阵的特征值与特征向量,再将特征向量单位化、正交化,将特征向量按列逐个排列为矩阵即得到变换矩阵C\boldsymbol{C},有x=Cy\boldsymbol{x}=\boldsymbol{Cy},其中y\boldsymbol{y}是新的变量,变换后的二次型即yTdiag(λ1,λ2,)y\boldsymbol{y}^T\text{diag}(\lambda_1,\lambda_2,\cdots)\boldsymbol{y}

      事实上该方法的理论保证是实对称矩阵必能相似对角化,即对任意实对称矩阵A\boldsymbol{A},必存在正交矩阵Q\boldsymbol{Q},使得QTAQ=Λ\boldsymbol{Q}^{T}\boldsymbol{AQ}=\boldsymbol{\Lambda},故而有xTAx=xTQΛQ1x\boldsymbol{x}^T\boldsymbol{Ax}=\boldsymbol{x}^T\boldsymbol{Q\Lambda Q}^{-1}\boldsymbol{x},因此一个标准型就是经线性变换y=Q1x\boldsymbol{y}=\boldsymbol{Q}^{-1}\boldsymbol{x}后得到的yTΛy\boldsymbol{y}^T\boldsymbol{\Lambda y}

  • 求合同变换的方法:

    求合同变换的方法大体同上,大体上也是三种方法,但这个场景下最好用的或许还是配方法,这是因为如果考虑合同变换法,计算量较大;如果考虑正交变换法,有很多对称阵的特征向量又难以计算。

    个人比较推荐配方法,在此以一个例子作为演示:

    A=(110101011)\boldsymbol{A}=\left(\begin{matrix}1&1&0\\1&0&1\\0&1&-1\end{matrix}\right), B=(131351110)\boldsymbol{B}=\left(\begin{matrix}1&3&1\\3&5&1\\1&1&0\end{matrix}\right),已知A,B\boldsymbol{A},\boldsymbol{B}合同,求可逆矩阵P\boldsymbol{P}使得PTAP=B\boldsymbol{P}^T\boldsymbol{AP}=\boldsymbol{B}

    首先将A\boldsymbol{A}配为规范型,记f(x)=xTAx=x12x32+2x1x2+2x2x3f(\boldsymbol{x})=\boldsymbol{x}^T\boldsymbol{Ax}=x^2_1-x^2_3+2x_1x_2+2x_2x_3,有

    x12x32+2x1x2+2x2x3=(x1+x2)2x22x32+2x2x3=(x1+x2)2(x2x3)2 \begin{align} x^2_1-x^2_3+2x_1x_2+2x_2x_3&=(x_1+x_2)^2-x^2_2-x^2_3+2x_2x_3\\ &=(x_1+x_2)^2-(x_2-x_3)^2 \end{align}

    所以做非退化变换P1\boldsymbol{P}_1

    {z1=x1+x2z2=         x2x3z3=                  x3 \left\{\begin{aligned} &z_1=x_1+x_2\\ &z_2=\ \ \ \ \ \ \ \ \ x_2-x_3\\ &z_3=\ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ x_3 \end{aligned}\right.

    等价变换为xxzz的变换,即

    {x1=z1z2z3x2=        z2+z3x3=                z3 \left\{\begin{aligned} &x_1=z_1-z_2-z_3\\ &x_2=\ \ \ \ \ \ \ \,\ z_2+z_3\\ &x_3=\ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \,\,\ z_3 \end{aligned}\right.

    将这个变换的系数矩阵记为P1\boldsymbol{P}^{\ast}_1,实际上P1\boldsymbol{P}^{\ast}_1就是P1\boldsymbol{P}_1的逆,在这里提前列出P1\boldsymbol{P}_1的逆P1\boldsymbol{P}^{\ast}_1是为后面的计算提供便利;

    接着对g(y)=yTBy=y12+5y22+6y1y2+2y1y3+2y2y3g(\boldsymbol{y})=\boldsymbol{y}^T\boldsymbol{By}=y^2_1+5y^2_2+6y_1y_2+2y_1y_3+2y_2y_3配方,有

    y12+5y22+6y1y2+2y1y3+2y2y3=(y1+3y2+y3)24y22y324y2y3=(y1+3y2+y3)2(2y2+y3)2 \begin{align} y^2_1+5y^2_2+6y_1y_2+2y_1y_3+2y_2y_3&=(y_1+3y_2+y_3)^2-4y^2_2-y^2_3-4y_2y_3\\ &=(y_1+3y_2+y_3)^2-(2y_2+y_3)^2 \end{align}

    所以做非退化变换P2\boldsymbol{P}_2

    {z1=y1+3y2+y3z2=        2y2+y3z3=                  y3 \left\{\begin{aligned} &z_1=y_1+3y_2+y_3\\ &z_2=\ \ \ \ \ \ \ \,\ 2y_2+y_3\\ &z_3=\ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \,\,y_3 \end{aligned}\right.

    P2\boldsymbol{P}_2的逆为P2\boldsymbol{P}^{\ast}_2(但并不需要算出P2\boldsymbol{P}^{\ast}_2的具体形式)。如此一来,f(x)f(\boldsymbol{x})g(y)g(\boldsymbol{y})都配成了规范型z12z22z^2_1-z^2_2,如果只是用配方法求规范型或惯性指数那么到这里就结束了,但求两二次型间的合同变换还需要进一步讨论。由于经变换z=P1x\boldsymbol{z}=\boldsymbol{P}_1\boldsymbol{x}z=P2y\boldsymbol{z}=\boldsymbol{P}_2\boldsymbol{y},也就是变换x=P1z\boldsymbol{x}=\boldsymbol{P}^{\ast}_1\boldsymbol{z}y=P2z\boldsymbol{y}=\boldsymbol{P}^{\ast}_2\boldsymbol{z}后,f(x),g(y)f(\boldsymbol{x}),g(\boldsymbol{y})均化为了相同的规范型,所以

    xTAx=zT(P1)TAP1z=zTΛz=zT(P2)TBP2z=yTBy \boldsymbol{x}^T\boldsymbol{Ax}=\boldsymbol{z}^T\boxed{(\boldsymbol{P}^{\ast}_1)^T\boldsymbol{A}\boldsymbol{P}^{\ast}_1}\boldsymbol{z}=\boldsymbol{z}^T\boldsymbol{\Lambda z}=\boldsymbol{z}^T\boxed{(\boldsymbol{P}^{\ast}_2)^T\boldsymbol{B}\boldsymbol{P}^{\ast}_2}\boldsymbol{z}=\boldsymbol{y}^T\boldsymbol{By}

    (P1)TAP1=(P2)TBP2(\boldsymbol{P}^{\ast}_1)^T\boldsymbol{AP}^{\ast}_1=(\boldsymbol{P}^{\ast}_2)^T\boldsymbol{BP}^{\ast}_2,左乘P2T\boldsymbol{P}^T_2并右乘P2\boldsymbol{P}_2后即(P1P2)TAP1P2=B(\boldsymbol{P}^{\ast}_1\boldsymbol{P}_2)^T\boldsymbol{AP}^{\ast}_1\boldsymbol{P}_2=\boldsymbol{B},所以取P=P1P2\boldsymbol{P}=\boldsymbol{P}^{\ast}_1\boldsymbol{P}_2就有PTAP=B\boldsymbol{P}^T\boldsymbol{AP}=\boldsymbol{B}成立,综上所述,

    P=P1P2=[111011001][131021001]=[111022001] \boldsymbol{P}=\boldsymbol{P}^{\ast}_1\boldsymbol{P}_2=\left[\begin{matrix}1&-1&-1\\0&1&1\\0&0&1\end{matrix}\right]\left[\begin{matrix}1&3&1\\0&2&1\\0&0&1\end{matrix}\right]=\left[\begin{matrix}1&1&-1\\0&2&2\\0&0&1\end{matrix}\right]

    P\boldsymbol{P}不是惟一的,这只是其中一个可行的结果

  • 可以用一个可逆线性变换同时将两个二次型对角化吗,如果可以,该怎么做?这需要分数域讨论:

    • 在实数域上,如果其中一个二次型是正定或负定的,则一定可以找到一个可逆线性变换,使得这个正定或负定的二次型化为规范型的同时,另一个二次型化为标准型;
    • 在复数域上,对任意的两个二次型都能找到这样的可逆线性变换;

    这里以一道简单的例题为例给出通法:若可逆线性变换x=Py\boldsymbol{x}=\boldsymbol{Py}将二次型f(x1,x2)=x12+2x22+2x1x2f(x_1,x_2)=x^2_1+2x^2_2+2x_1x_2化为规范型y12+y22y^2_1+y^2_2,同时将二次型g(x1,x2)=x12+2x22+2x1x2g(x_1,x_2)=-x^2_1+2x^2_2+2x_1x_2化为标准型k1y12+k2y22k_1y^2_1+k_2y^2_2,求可逆矩阵P\boldsymbol{P}k1,k2k_1,k_2的值。

    1. 首先找到将f(x1,x2)f(x_1,x_2)化为规范型的可逆线性变换:显而易见地,这个例子中f(x1,x2)f(x_1,x_2)是正定的,进行简单配方即可找出我们需要的线性变换:f(x1,x2)=x12+2x22+2x1x2=(x1+x2)2+x22f(x_1,x_2)=x^2_1+2x^2_2+2x_1x_2=(x_1+x_2)^2+x^2_2,即

    {y1=x1+x2y2=         x2              {x1=y1y2x2=        y2 \left\{\begin{aligned} &y_1=x_1+x_2\\ &y_2=\ \ \ \ \ \ \ \ \ x_2 \end{aligned}\right.\ \ \ \ \ \ \ \Leftrightarrow\ \ \ \ \ \ \ \left\{\begin{align*} &x_1=y_1-y_2\\ &x_2=\ \ \ \ \ \ \ \ \,y_2 \end{align*}\right.

    因此记A=(1112)\boldsymbol{A}=\left(\begin{matrix}1&1\\1&2\end{matrix}\right)B=(1112)\boldsymbol{B}=\left(\begin{matrix}-1&1\\1&2\end{matrix}\right)C=(1101)\boldsymbol{C}=\left(\begin{matrix}1&-1\\0&1\end{matrix}\right),有

    CTAC=E \boldsymbol{C}^T\boldsymbol{AC}=\boldsymbol{E}

    2. 接着对另一个二次型g(x1,x2)g(x_1,x_2)作上述可逆线性变换x=Cy\boldsymbol{x}=\boldsymbol{Cy}g(x1,x2)g(x_1,x_2)作变换x=Cy\boldsymbol{x}=\boldsymbol{Cy},有

    CTBC=(1011)(1112)(1101)=(1221) \boldsymbol{C}^T\boldsymbol{BC}=\left(\begin{matrix}1&0\\-1&1\end{matrix}\right)\left(\begin{matrix}-1&1\\1&2\end{matrix}\right)\left(\begin{matrix}1&-1\\0&1\end{matrix}\right)=\left(\begin{matrix}-1&2\\2&-1\end{matrix}\right)

    (1221)\left(\begin{matrix}-1&2\\2&-1\end{matrix}\right)记为B1\boldsymbol{B}_1,显然B1\boldsymbol{B}_1并不是一个标准化的二次型——如果B1\boldsymbol{B}_1是标准化的二次型那也就不需要进行剩下的操作了

    3. 将对称阵B1\boldsymbol{B}_1相似对角化:分别计算B1\boldsymbol{B}_1的特征值与相应的特征向量,计算得B1\boldsymbol{B}_1有两个相异的特征值113-3,从属特征值11的特征向量为k1(1,1)Tk_1(1,1)^T,从属特征值3-3的特征向量为k2(1,1)Tk_2(1,-1)^T,所以B1\boldsymbol{B}_1的一个特征向量阵为(1111)\left(\begin{matrix}1&1\\1&-1\end{matrix}\right),将其单位正交化得到正交矩阵Q=(12121212)\boldsymbol{Q}=\left(\begin{matrix}\frac1{\sqrt{2}}&\frac1{\sqrt{2}}\\\frac1{\sqrt{2}}&-\frac1{\sqrt{2}}\end{matrix}\right),有

    QTB1Q=(1003) \boldsymbol{Q}^T\boldsymbol{B}_1\boldsymbol{Q}=\left(\begin{matrix}1&0\\0&-3\end{matrix}\right)

    4. 令P=CQ\boldsymbol{P}=\boldsymbol{CQ}最后将C\boldsymbol{C}Q\boldsymbol{Q}相乘,得到的新矩阵就是所需要的可逆矩阵P\boldsymbol{P},因为

    PTAP=QTCTACQ=QTEQ=QTQ=E \boldsymbol{P}^T\boldsymbol{AP}=\boldsymbol{Q}^T\boldsymbol{C}^T\boldsymbol{ACQ}=\boldsymbol{Q}^T\boldsymbol{EQ}=\boldsymbol{Q}^T\boldsymbol{Q}=\boldsymbol{E} PTBP=QTCTBCQ=QTB1Q=(1003) \boldsymbol{P}^T\boldsymbol{BP}=\boldsymbol{Q}^T\boldsymbol{C}^T\boldsymbol{BCQ}=\boldsymbol{Q}^T\boldsymbol{B}_1\boldsymbol{Q}=\left(\begin{matrix}1&0\\0&-3\end{matrix}\right)

    PTAP\boldsymbol{P}^T\boldsymbol{AP}中,主要用到了Q\boldsymbol{Q}是正交矩阵,正交矩阵的逆是自身的转置;在PTBP\boldsymbol{P}^T\boldsymbol{BP}中,主要用到了Q\boldsymbol{Q}是将B1\boldsymbol{B}_1化为标准型的正交变换。综上所述,P\boldsymbol{P}同时将A\boldsymbol{A}化为了规范型并将B\boldsymbol{B}化为了标准型,所以

    P=CQ=(1101)(12121212)=(021212) \boldsymbol{P}=\boldsymbol{CQ}=\left(\begin{matrix}1&-1\\0&1\end{matrix}\right)\left(\begin{matrix}\frac1{\sqrt{2}}&\frac1{\sqrt{2}}\\\frac1{\sqrt{2}}&-\frac1{\sqrt{2}}\end{matrix}\right)=\left(\begin{matrix}0&\sqrt2\\\frac1{\sqrt{2}}&-\frac1{\sqrt{2}}\end{matrix}\right)

    这是正交矩阵的一个妙用

线性空间(略)

考研不考

线性变换(略)

考研不考

不变子空间(略)

考研不考

最小多项式(略)

考研不考

λ-矩阵(略)

考研不考

欧氏空间(略)

考研不考

复数域上的内积空间(略)

考研不考

双线性泛函与希尔伯特空间(略)

考研不考

双线性泛函(略)

考研不考

对偶空间(略)

考研不考