Articulo de referencia

Teorema de Cayley-Hamilton

Arthur Cayley , FRS (1821–1895), es ampliamente reconocido como el matemático puro más destacado de Gran Bretaña en el siglo XIX. En 1848, Cayley viajó a Dublín para asistir a l...

Arthur Cayley , FRS (1821–1895), es ampliamente reconocido como el matemático puro más destacado de Gran Bretaña en el siglo XIX. En 1848, Cayley viajó a Dublín para asistir a las conferencias sobre cuaterniones impartidas por Hamilton, su descubridor. Posteriormente, Cayley lo impresionó al ser el segundo en publicar un trabajo sobre ellos. [ 1 ] Cayley enunció el teorema para matrices de dimensión 3 o menor, y publicó una demostración para el caso bidimensional.
William Rowan Hamilton (1805–1865), físico, astrónomo y matemático irlandés, fue el primer miembro extranjero de la Academia Nacional de Ciencias de Estados Unidos . Si bien mantuvo una postura opuesta sobre cómo debía estudiarse la geometría , Hamilton siempre mantuvo una excelente relación con Cayley. [ 1 ] Hamilton demostró que para una función lineal de cuaterniones existe una ecuación determinada, que depende de la función lineal, y que es satisfecha por la propia función lineal. [ 2 ] [ 3 ] [ 4 ]

En álgebra lineal , el teorema de Cayley-Hamilton (que recibe su nombre de los matemáticos Arthur Cayley y William Rowan Hamilton ) establece que toda matriz cuadrada sobre un anillo conmutativo (como los números reales o complejos o los enteros ) satisface su propia ecuación característica .

El polinomio característico de unnorte×norte{\displaystyle n\times n}La matriz A se define como [ 5 ]pagA(λ)=det(λInorteA){\displaystyle p_{A}(\lambda )=\det(\lambda I_{n}-A)}, donde det es la operación determinante , λ es un elemento escalar variable del anillo base , e I n es elnorte×norte{\displaystyle n\times n}matriz identidad . Dado que cada entrada de la matriz(λInorteA){\displaystyle (\lambda I_{n}-A)}es constante o lineal en λ , el determinante de(λInorteA){\displaystyle (\lambda I_{n}-A)}es un polinomio mónico de grado n en λ , por lo que se puede escribir como pagA(λ)=λnorte+donorte1λnorte1++do1λ+do0.{\displaystyle p_{A}(\lambda )=\lambda ^{n}+c_{n-1}\lambda ^{n-1}+\cdots +c_{1}\lambda +c_{0}.}Al reemplazar la variable escalar λ con la matriz A , se puede definir una expresión polinómica matricial análoga , pagA(A)=Anorte+donorte1Anorte1++do1A+do0Inorte.{\displaystyle p_{A}(A)=A^{n}+c_{n-1}A^{n-1}+\cdots +c_{1}A+c_{0}I_{n}.} (Aquí,A{\displaystyle A}es la matriz dada, no una variable, a diferencia deλ{\displaystyle \lambda }-entoncespagA(A){\displaystyle p_{A}(A)}es una constante en lugar de una función.) El teorema de Cayley-Hamilton establece que esta expresión polinómica es igual a la matriz cero , lo que significa quepagA(A)=0;{\displaystyle p_{A}(A)=0;}es decir, el polinomio característicopagA{\displaystyle p_{A}}es un polinomio anulador paraA.{\displaystyle A.}

Una de las aplicaciones del teorema de Cayley-Hamilton es que permite expresar A n como una combinación lineal de las potencias matriciales inferiores de A : Anorte=donorte1Anorte1do1Ado0Inorte.{\displaystyle A^{n}=-c_{n-1}A^{n-1}-\cdots -c_{1}A-c_{0}I_{n}.} Cuando el anillo es un cuerpo , el teorema de Cayley-Hamilton es equivalente a la afirmación de que el polinomio mínimo de una matriz cuadrada divide a su polinomio característico.

Un caso especial del teorema fue demostrado por primera vez por Hamilton en 1853 [ 6 ] en términos de inversas de funciones lineales de cuaterniones . [ 2 ] [ 3 ] [ 4 ] Esto corresponde al caso especial de ciertos4×4{\displaystyle 4\times 4}real o2×2{\displaystyle 2\times 2}matrices complejas. Cayley en 1858 declaró el resultado para3×3{\displaystyle 3\times 3} y matrices más pequeñas, pero solo publicó una prueba para la2×2{\displaystyle 2\times 2} caso. [ 7 ] [ 8 ] En cuanto anorte×norte{\displaystyle n\times n} Sobre las matrices, Cayley afirmó: «..., no he considerado necesario emprender el trabajo de una demostración formal del teorema en el caso general de una matriz de cualquier grado». El caso general fue demostrado por primera vez por Ferdinand Frobenius en 1878. [ 9 ]

Ejemplos

matrices de 1 × 1

Para un1×1{\displaystyle 1\times 1} matriz A = ( a ) , el polinomio característico viene dado por p ( λ ) = λa , y por lo tanto p ( A ) = ( a ) − a (1) = 0 es trivial.

matrices de 2 × 2

Como ejemplo concreto, dejemos A=(1234).{\displaystyle A={\begin{pmatrix}1&2\\3&4\end{pmatrix}}.} Su polinomio característico viene dado por pag(λ)=det(λI2A)=det(λ123λ4)=(λ1)(λ4)(2)(3)=λ25λ2.{\displaystyle {\begin{aligned}p(\lambda )&=\det(\lambda I_{2}-A)=\det \!{\begin{pmatrix}\lambda -1&-2\\-3&\lambda -4\end{pmatrix}}\\&=(\lambda -1)(\lambda -4)-(-2)(-3)=\lambda ^{2}-5\lambda -2.\end{aligned}}}

El teorema de Cayley-Hamilton afirma que, si definimospag(incógnita)=incógnita25incógnita2I2,{\displaystyle p(X)=X^{2}-5X-2I_{2},} entonces pag(A)=A25A2I2=(0000).{\displaystyle p(A)=A^{2}-5A-2I_{2}={\begin{pmatrix}0&0\\0&0\\\end{pmatrix}}.} Podemos verificar mediante cálculos que, efectivamente, A25A2I2=(7101522)(5101520)(2002)=(0000).{\displaystyle A^{2}-5A-2I_{2}={\begin{pmatrix}7&10\\15&22\\\end{pmatrix}}-{\begin{pmatrix}5&10\\15&20\\\end{pmatrix}}-{\begin{pmatrix}2&0\\0&2\\\end{pmatrix}}={\begin{pmatrix}0&0\\0&0\\\end{pmatrix}}.}

Para un genérico2×2{\displaystyle 2\times 2}matriz, A=(abdod),{\displaystyle A={\begin{pmatrix}a&b\\c&d\\\end{pmatrix}},}

El polinomio característico viene dado por p ( λ ) = λ 2 − ( a + d ) λ + ( adbc ) , por lo que el teorema de Cayley-Hamilton establece que pag(A)=A2(a+d)A+(adbdo)I2=(0000);{\displaystyle p(A)=A^{2}-(a+d)A+(ad-bc)I_{2}={\begin{pmatrix}0&0\\0&0\end{pmatrix}};} lo cual es cierto que siempre es así, como se evidencia al calcular las entradas de A 2 .

Prueba

A2(a+d)A+(adbdo)I2=(a2+bdoab+bdado+dodbdo+d2)(a(a+d)b(a+d)do(a+d)d(a+d))+(adbdo)I2=(bdoad00bdoad)+(adbdo)I2=(0000){\displaystyle {\begin{aligned}&{}A^{2}-(a+d)A+(ad-bc)I_{2}\\[1ex]&={\begin{pmatrix}a^{2}+bc&ab+bd\\ac+cd&bc+d^{2}\\\end{pmatrix}}-{\begin{pmatrix}a(a+d)&b(a+d)\\c(a+d)&d(a+d)\end{pmatrix}}+(ad-bc)I_{2}\\[1ex]&={\begin{pmatrix}bc-ad&0\\0&bc-ad\\\end{pmatrix}}+(ad-bc)I_{2}\\[1ex]&={\begin{pmatrix}0&0\\0&0\end{pmatrix}}\end{aligned}}}

Aplicaciones

Determinante y matriz inversa

Para un generalnorte×norte{\displaystyle n\times n}matriz invertible A , es decir, una con determinante distinto de cero, A −1 puede escribirse como una(norte1){\displaystyle (n-1)}expresión polinómica de orden en A : Como se indica, el teorema de Cayley-Hamilton equivale a la identidad

pag(A)=Anorte+donorte1Anorte1++do1A+(1)nortedet(A)Inorte=0.{\displaystyle p(A)=A^{n}+c_{n-1}A^{n-1}+\cdots +c_{1}A+(-1)^{n}\det(A)I_{n}=0.}

Los coeficientes c i vienen dados por los polinomios simétricos elementales de los valores propios de A. Utilizando identidades de Newton , los polinomios simétricos elementales pueden a su vez expresarse en términos de polinomios simétricos de suma de potencias de los valores propios: sk=i=1norteλik=tr(Ak),{\displaystyle s_{k}=\sum _{i=1}^{n}\lambda _{i}^{k}=\operatorname {tr} (A^{k}),} donde tr( A k ) es la traza de la matriz A k . Por lo tanto, podemos expresar c i en términos de la traza de las potencias de A .

En general, la fórmula para los coeficientes c i se da en términos de polinomios de Bell exponenciales completos como [ nb 1 ]donortek=(1)kk¡Bk(s1,1¡s2,2¡s3,,(1)k1(k1)¡sk).{\displaystyle c_{n-k}={\frac {(-1)^{k}}{k!}}B_{k}(s_{1},-1!s_{2},2!s_{3},\ldots ,(-1)^{k-1}(k-1)!s_{k}).}

En particular, el determinante de A es igual a (−1) n c 0 . Por lo tanto, el determinante se puede escribir como la identidad de traza : det(A)=1norte¡Bnorte(s1,1¡s2,2¡s3,,(1)norte1(norte1)¡snorte).{\displaystyle \det(A)={\frac {1}{n!}}B_{n}(s_{1},-1!s_{2},2!s_{3},\ldots ,(-1)^{n-1}(n-1)!s_{n}).}

Asimismo, el polinomio característico se puede escribir como (1)nortedet(A)Inorte=A(Anorte1+donorte1Anorte2++do1Inorte),{\displaystyle -(-1)^{n}\det(A)I_{n}=A(A^{n-1}+c_{n-1}A^{n-2}+\cdots +c_{1}I_{n}),} y, al multiplicar ambos lados por A −1 (nótese que −(−1) n = (−1) n −1 ), se llega a una expresión para el inverso de A como identidad de traza, A1=(1)norte1detA(Anorte1+donorte1Anorte2++do1Inorte),=1detAk=0norte1(1)norte+k1Anortek1k¡Bk(s1,1¡s2,2¡s3,,(1)k1(k1)¡sk).{\displaystyle {\begin{aligned}A^{-1}&={\frac {(-1)^{n-1}}{\det A}}(A^{n-1}+c_{n-1}A^{n-2}+\cdots +c_{1}I_{n}),\\[5pt]&={\frac {1}{\det A}}\sum _{k=0}^{n-1}(-1)^{n+k-1}{\frac {A^{n-k-1}}{k!}}B_{k}(s_{1},-1!s_{2},2!s_{3},\ldots ,(-1)^{k-1}(k-1)!s_{k}).\end{aligned}}}

Otro método para obtener estos coeficientes c k para un generalnorte×norte{\displaystyle n\times n}La matriz, siempre que ninguna raíz sea cero, se basa en la siguiente expresión alternativa para el determinante , pag(λ)=det(λInorteA)=λnorteexp(tr(registro(InorteA/λ))).{\displaystyle p(\lambda )=\det(\lambda I_{n}-A)=\lambda ^{n}\exp(\operatorname {tr} (\log(I_{n}-A/\lambda ))).} Por lo tanto, en virtud de la serie de Mercator , pag(λ)=λnorteexp(trmetro=1(Aλ)metrometro),{\displaystyle p(\lambda )=\lambda ^{n}\exp \left(-\operatorname {tr} \sum _{m=1}^{\infty }{({A \over \lambda })^{m} \over m}\right),} donde la exponencial solo necesita expandirse hasta el orden λ n , ya que p ( λ ) es de orden n , las potencias negativas netas de λ se anulan automáticamente por el teorema C–H. (Nuevamente, esto requiere un anillo que contenga los números racionales .) La diferenciación de esta expresión con respecto a λ permite expresar los coeficientes del polinomio característico para un n general como determinantes de matrices m × m , [ nb 2 ]donortemetro=(1)metrometro¡|trAmetro10trA2trAmetro2trAmetro1trAmetro21trAmetrotrAmetro1trA| .{\displaystyle c_{n-m}={\frac {(-1)^{m}}{m!}}{\begin{vmatrix}\operatorname {tr} A&m-1&0&\cdots \\\operatorname {tr} A^{2}&\operatorname {tr} A&m-2&\cdots \\\vdots &\vdots &&&\vdots \\\operatorname {tr} A^{m-1}&\operatorname {tr} A^{m-2}&\cdots &\cdots &1\\\operatorname {tr} A^{m}&\operatorname {tr} A^{m-1}&\cdots &\cdots &\operatorname {tr} A\end{vmatrix}}~.}

Ejemplos

Por ejemplo, los primeros polinomios de Bell son B 0 = 1, B 1 ( x 1 ) = x 1 , B 2 ( x 1 , x 2 ) = x 2 1 + x 2 , y B 3 ( x 1 , x 2 , x 3 ) = x 3 1 + 3 x 1 x 2 + x 3 .

Utilizando estos para especificar los coeficientes c i del polinomio característico de un2×2{\displaystyle 2\times 2} rendimientos de la matriz

do2=B0=1,do1=11¡B1(s1)=s1=tr(A),do0=12¡B2(s1,1¡s2)=12(s12s2)=12((tr(A))2tr(A2)).{\displaystyle {\begin{aligned}c_{2}=B_{0}=1,\\[4pt]c_{1}={\frac {-1}{1!}}B_{1}(s_{1})=-s_{1}=-\operatorname {tr} (A),\\[4pt]c_{0}={\frac {1}{2!}}B_{2}(s_{1},-1!s_{2})={\frac {1}{2}}(s_{1}^{2}-s_{2})={\frac {1}{2}}((\operatorname {tr} (A))^{2}-\operatorname {tr} (A^{2})).\end{aligned}}}

El coeficiente c 0 da el determinante de la2×2{\displaystyle 2\times 2} matriz, c 1 menos su traza, mientras que su inversa viene dada por A1=1detA(A+do1I2)=2(Atr(A)I2)(tr(A))2tr(A2).{\displaystyle A^{-1}={\frac {-1}{\det A}}(A+c_{1}I_{2})={\frac {-2(A-\operatorname {tr} (A)I_{2})}{(\operatorname {tr} (A))^{2}-\operatorname {tr} (A^{2})}}.}

Es evidente a partir de la fórmula general para c nk , expresada en términos de polinomios de Bell, que las expresiones tr(A)y12(tr(A)2tr(A2)){\displaystyle -\operatorname {tr} (A)\quad {\text{and}}\quad {\tfrac {1}{2}}(\operatorname {tr} (A)^{2}-\operatorname {tr} (A^{2}))}

siempre dé los coeficientes c n −1 de λ n −1 y c n −2 de λ n −2 en el polinomio característico de cualquiernorte×norte{\displaystyle n\times n}matriz, respectivamente. Entonces, para una3×3{\displaystyle 3\times 3} matriz A , el enunciado del teorema de Cayley-Hamilton también se puede escribir como A3(trA)A2+12((trA)2tr(A2))Adet(A)I3=O,{\displaystyle A^{3}-(\operatorname {tr} A)A^{2}+{\frac {1}{2}}\left((\operatorname {tr} A)^{2}-\operatorname {tr} (A^{2})\right)A-\det(A)I_{3}=O,} donde el lado derecho designa un3×3{\displaystyle 3\times 3}matriz con todas las entradas reducidas a cero. De igual modo, este determinante en el caso n = 3 , ahora es det(A)=13¡B3(s1,1¡s2,2¡s3)=16(s13+3s1(s2)+2s3)=16[(trA)33tr(A2)(trA)+2tr(A3)].{\displaystyle {\begin{aligned}\det(A)&={\frac {1}{3!}}B_{3}(s_{1},-1!s_{2},2!s_{3})={\frac {1}{6}}(s_{1}^{3}+3s_{1}(-s_{2})+2s_{3})\\[5pt]&={\frac {1}{6}}\left[(\operatorname {tr} A)^{3}-3\operatorname {tr} (A^{2})(\operatorname {tr} A)+2\operatorname {tr} (A^{3})\right].\end{aligned}}} Esta expresión da el negativo del coeficiente c n −3 de λ n −3 en el caso general, como se ve a continuación.

De manera similar, uno puede escribir para un4×4{\displaystyle 4\times 4}matriz A , A4(trA)A3+12[(trA)2tr(A2)]A216[(trA)33tr(A2)(trA)+2tr(A3)]A+det(A)I4=O,{\displaystyle A^{4}-(\operatorname {tr} A)A^{3}+{\tfrac {1}{2}}\left[(\operatorname {tr} A)^{2}-\operatorname {tr} (A^{2})\right]A^{2}-{\tfrac {1}{6}}\left[(\operatorname {tr} A)^{3}-3\operatorname {tr} (A^{2})(\operatorname {tr} A)+2\operatorname {tr} (A^{3})\right]A+\det(A)I_{4}=O,}

donde, ahora, el determinante es c n −4 ,

124[(trA)46tr(A2)(trA)2+3(tr(A2))2+8tr(A3)tr(A)6tr(A4)],{\displaystyle {\tfrac {1}{24}}\!\left[(\operatorname {tr} A)^{4}-6\operatorname {tr} (A^{2})(\operatorname {tr} A)^{2}+3\left(\operatorname {tr} (A^{2})\right)^{2}+8\operatorname {tr} (A^{3})\operatorname {tr} (A)-6\operatorname {tr} (A^{4})\right],}

y así sucesivamente para matrices más grandes. Las expresiones cada vez más complejas para los coeficientes c k se pueden deducir de las identidades de Newton o del algoritmo de Faddeev-LeVerrier .

n -ésima potencia de matriz

El teorema de Cayley-Hamilton siempre proporciona una relación entre las potencias de A (aunque no siempre la más simple), lo que permite simplificar expresiones que involucran dichas potencias y evaluarlas sin tener que calcular la potencia A n o cualquier potencia superior de A.

Como ejemplo, paraA=(1234){\displaystyle A={\begin{pmatrix}1&2\\3&4\end{pmatrix}}}El teorema da A2=5A+2I2.{\displaystyle A^{2}=5A+2I_{2}\,.}

Luego, para calcular A 4 , observe A3=(5A+2I2)A=5A2+2A=5(5A+2I2)+2A=27A+10I2,A4=A3A=(27A+10I2)A=27A2+10A=27(5A+2I2)+10A=145A+54I2.{\displaystyle {\begin{aligned}A^{3}&=(5A+2I_{2})A=5A^{2}+2A=5(5A+2I_{2})+2A=27A+10I_{2},\\[1ex]A^{4}&=A^{3}A=(27A+10I_{2})A=27A^{2}+10A=27(5A+2I_{2})+10A=145A+54I_{2}\,.\end{aligned}}} Asimismo, A1=12(A5I2) .A2=A1A1=14(A210A+25I2)=14((5A+2I2)10A+25I2)=14(5A+27I2) .{\displaystyle {\begin{aligned}A^{-1}&={\frac {1}{2}}\left(A-5I_{2}\right)~.\\[1ex]A^{-2}&=A^{-1}A^{-1}={\frac {1}{4}}\left(A^{2}-10A+25I_{2}\right)={\frac {1}{4}}\left((5A+2I_{2})-10A+25I_{2}\right)={\frac {1}{4}}\left(-5A+27I_{2}\right)~.\end{aligned}}}

Nótese que hemos podido expresar la potencia de una matriz como la suma de dos términos. De hecho, una potencia de matriz de cualquier orden k puede escribirse como un polinomio matricial de grado como máximo n − 1 , donde n es el tamaño de una matriz cuadrada. Este es un ejemplo donde el teorema de Cayley-Hamilton puede utilizarse para expresar una función matricial, lo cual analizaremos sistemáticamente más adelante.

funciones matriciales

Dada una función analíticaF(incógnita)=k=0akincógnitak{\displaystyle f(x)=\sum _{k=0}^{\infty }a_{k}x^{k}} y el polinomio característico p ( x ) de grado n de una matriz A de n × n , la función se puede expresar mediante división larga como F(incógnita)=q(incógnita)pag(incógnita)+r(incógnita),{\displaystyle f(x)=q(x)p(x)+r(x),} donde q ( x ) es algún polinomio cociente y r ( x ) es un polinomio resto tal que 0 ≤ deg r ( x ) < n .

Según el teorema de Cayley-Hamilton, al reemplazar x por la matriz A se obtiene p ( A ) = 0 , por lo que se tiene F(A)=r(A).{\displaystyle f(A)=r(A).}

Por lo tanto, la función analítica de la matriz A puede expresarse como un polinomio matricial de grado menor que n .

Sea el polinomio restante r(incógnita)=do0+do1incógnita++donorte1incógnitanorte1.{\displaystyle r(x)=c_{0}+c_{1}x+\cdots +c_{n-1}x^{n-1}.} Dado que p ( λ ) = 0 , al evaluar la función f ( x ) en los n autovalores de A se obtiene F(λi)=r(λi)=do0+do1λi++donorte1λinorte1,para i=1,2,...,norte.{\displaystyle f(\lambda _{i})=r(\lambda _{i})=c_{0}+c_{1}\lambda _{i}+\cdots +c_{n-1}\lambda _{i}^{n-1},\qquad {\text{for }}i=1,2,...,n.} Esto equivale a un sistema de n ecuaciones lineales , que se pueden resolver para determinar los coeficientes c i . Por lo tanto, se tiene F(A)=k=0norte1dokAk.{\displaystyle f(A)=\sum _{k=0}^{n-1}c_{k}A^{k}.}

Cuando los autovalores se repiten, es decir, λ i = λ j para algún i ≠ j , dos o más ecuaciones son idénticas; por lo tanto, las ecuaciones lineales no pueden resolverse de forma única. En tales casos, para un autovalor λ con multiplicidad m , las primeras m − 1 derivadas de p ( x ) se anulan en el autovalor. Esto conduce a m − 1 soluciones linealmente independientes adicionales.dkF(incógnita)dincógnitak|incógnita=λ=dkr(incógnita)dincógnitak|incógnita=λpara k=1,2,,metro1,{\displaystyle \left.{\frac {\mathrm {d} ^{k}f(x)}{\mathrm {d} x^{k}}}\right|_{x=\lambda }=\left.{\frac {\mathrm {d} ^{k}r(x)}{\mathrm {d} x^{k}}}\right|_{x=\lambda }\qquad {\text{for }}k=1,2,\ldots ,m-1,} que, combinadas con otras, producen las n ecuaciones necesarias para resolver c i .

Encontrar un polinomio que pase por los puntos ( λ i , f ( λ i )) es esencialmente un problema de interpolación , y se puede resolver utilizando técnicas de interpolación de Lagrange o Newton , lo que lleva a la fórmula de Sylvester .

Por ejemplo, supongamos que la tarea es encontrar la representación polinómica de F(A)=miAtwhmirmiA=(1203).{\displaystyle f(A)=e^{At}\qquad \mathrm {where} \qquad A={\begin{pmatrix}1&2\\0&3\end{pmatrix}}.}

El polinomio característico es p ( x ) = ( x − 1)( x − 3) = x 2 − 4 x + 3 , y los valores propios son λ = 1, 3 . Sea r ( x ) = c 0 + c 1 x . Evaluando f ( λ ) = r ( λ ) en los valores propios, se obtienen dos ecuaciones lineales, e t = c 0 + c 1 y e 3 t = c 0 + 3 c 1 .

Al resolver las ecuaciones se obtiene c 0 = (3 e te 3 t )/2 y c 1 = ( e 3 te t )/2 . Por lo tanto, se deduce que miAt=do0I2+do1A=(do0+do12do10do0+3do1)=(mitmi3tmit0mi3t).{\displaystyle e^{At}=c_{0}I_{2}+c_{1}A={\begin{pmatrix}c_{0}+c_{1}&2c_{1}\\0&c_{0}+3c_{1}\end{pmatrix}}={\begin{pmatrix}e^{t}&e^{3t}-e^{t}\\0&e^{3t}\end{pmatrix}}.}

Si, en cambio, la función fuera f ( A ) = sin At , entonces los coeficientes habrían sido c 0 = (3 sin t − sin 3 t )/2 y c 1 = (sin 3 t − sin t )/2 ; por lo tanto pecado(At)=do0I2+do1A=(pecadotpecado3tpecadot0pecado3t).{\displaystyle \sin(At)=c_{0}I_{2}+c_{1}A={\begin{pmatrix}\sin t&\sin 3t-\sin t\\0&\sin 3t\end{pmatrix}}.}

Como ejemplo adicional, al considerar F(A)=miAtwhmirmiA=(0110),{\displaystyle f(A)=e^{At}\qquad \mathrm {where} \qquad A={\begin{pmatrix}0&1\\-1&0\end{pmatrix}},} entonces el polinomio característico es p ( x ) = x 2  +  1 , y los valores propios son λ = ± i .

Como antes, al evaluar la función en los autovalores obtenemos las ecuaciones lineales e it = c 0 + ic 1 y e it = c 0ic 1 ; cuya solución da c 0 = ( e it + e it )/2 = cos t y c 1 = ( e ite it )/2 i = sin t . Por lo tanto, para este caso, miAt=(porquet)I2+(pecadot)A=(porquetpecadotpecadotporquet),{\displaystyle e^{At}=(\cos t)I_{2}+(\sin t)A={\begin{pmatrix}\cos t&\sin t\\-\sin t&\cos t\end{pmatrix}},} que es una matriz de rotación .

Ejemplos estándar de dicho uso es el mapeo exponencial del álgebra de Lie de un grupo de Lie matricial en el grupo. Está dado por una exponencial matricial , exp:gramoGRAMO;tincógnitamitincógnita=norte=0tnorteincógnitanortenorte¡=I+tincógnita+t2incógnita22+,tR,incógnitagramo.{\displaystyle \exp :{\mathfrak {g}}\rightarrow G;\qquad tX\mapsto e^{tX}=\sum _{n=0}^{\infty }{\frac {t^{n}X^{n}}{n!}}=I+tX+{\frac {t^{2}X^{2}}{2}}+\cdots ,t\in \mathbb {R} ,X\in {\mathfrak {g}}.} Tales expresiones se conocen desde hace mucho tiempo para SU(2) , mii(θ/2)(norte^σ)=I2porqueθ2+i(norte^σ)pecadoθ2,{\displaystyle e^{i(\theta /2)({\hat {\mathbf {n} }}\cdot \sigma )}=I_{2}\cos {\frac {\theta }{2}}+i({\hat {\mathbf {n} }}\cdot \sigma )\sin {\frac {\theta }{2}},} donde las σ son las matrices de Pauli y para SO(3) , miiθ(norte^J)=I3+i(norte^J)pecadoθ+(norte^J)2(porqueθ1),{\displaystyle e^{i\theta ({\hat {\mathbf {n} }}\cdot \mathbf {J} )}=I_{3}+i({\hat {\mathbf {n} }}\cdot \mathbf {J} )\sin \theta +({\hat {\mathbf {n} }}\cdot \mathbf {J} )^{2}(\cos \theta -1),} que es la fórmula de rotación de Rodrigues . Para la notación, véase el grupo de rotación 3D#A nota sobre álgebras de Lie .

Más recientemente, han aparecido expresiones para otros grupos, como el grupo de Lorentz SO(3, 1) , [ 10 ] O(4, 2) [ 11 ] y SU(2, 2) , [ 12 ] así como GL( n , R ) . [ 13 ] El grupo O(4, 2) es el grupo conforme del espaciotiempo , SU(2, 2) su recubrimiento simplemente conexo (para ser precisos, el recubrimiento simplemente conexo de la componente conexa SO + (4, 2) de O(4, 2) ). Las expresiones obtenidas se aplican a la representación estándar de estos grupos. Requieren el conocimiento de (algunos de) los autovalores de la matriz a exponenciar. Para SU(2) (y por lo tanto para SO(3) ), se han obtenido expresiones cerradas para todas las representaciones irreducibles, es decir, de cualquier espín. [ 14 ]

Ferdinand Georg Frobenius (1849–1917), matemático alemán. Sus principales intereses fueron las funciones elípticas , las ecuaciones diferenciales y, posteriormente, la teoría de grupos . En 1878 dio la primera demostración completa del teorema de Cayley - Hamilton. [ 9 ]

Teoría algebraica de números

El teorema de Cayley-Hamilton es una herramienta eficaz para calcular el polinomio mínimo de enteros algebraicos . Por ejemplo, dada una extensión finitaQ[α1,,αk]{\displaystyle \mathbb {Q} [\alpha _{1},\ldots ,\alpha _{k}]}deQ{\displaystyle \mathbb {Q} }y un entero algebraicoαQ[α1,,αk]{\displaystyle \alpha \in \mathbb {Q} [\alpha _{1},\ldots ,\alpha _{k}]}que es una combinación lineal no nula de laα1norte1αknortek{\displaystyle \alpha _{1}^{n_{1}}\cdots \alpha _{k}^{n_{k}}}podemos calcular el polinomio mínimo deα{\displaystyle \alpha }al encontrar una matriz que represente laQ{\displaystyle \mathbb {Q} }- transformación linealα:Q[α1,,αk]Q[α1,,αk]{\displaystyle \cdot \alpha :\mathbb {Q} [\alpha _{1},\ldots ,\alpha _{k}]\to \mathbb {Q} [\alpha _{1},\ldots ,\alpha _{k}]} Si llamamos a esta matriz de transformaciónA{\displaystyle A}, entonces podemos encontrar el polinomio mínimo aplicando el teorema de Cayley-Hamilton aA{\displaystyle A}. [ 15 ]

Pruebas

El teorema de Cayley-Hamilton es una consecuencia inmediata de la existencia de la forma normal de Jordan para matrices sobre cuerpos algebraicamente cerrados (véase Forma normal de Jordan §  Teorema de Cayley-Hamilton) . En esta sección se presentan demostraciones directas.

Como muestran los ejemplos anteriores, obtener el enunciado del teorema de Cayley-Hamilton para unnorte×norte{\displaystyle n\times n}matriz

A=(aij)i,j=1norte{\displaystyle A=\left(a_{ij}\right)_{i,j=1}^{n}} requiere dos pasos: primero se determinan los coeficientes c i del polinomio característico mediante el desarrollo como un polinomio en t del determinante

pag(t)=det(tInorteA)=|ta1,1a1,2a1,nortea2,1ta2,2a2,norteanorte,1anorte,2tanorte,norte|=tnorte+donorte1tnorte1++do1t+do0,{\displaystyle {\begin{aligned}p(t)&=\det(tI_{n}-A)={\begin{vmatrix}t-a_{1,1}&-a_{1,2}&\cdots &-a_{1,n}\\-a_{2,1}&t-a_{2,2}&\cdots &-a_{2,n}\\\vdots &\vdots &\ddots &\vdots \\-a_{n,1}&-a_{n,2}&\cdots &t-a_{n,n}\end{vmatrix}}\\[5pt]&=t^{n}+c_{n-1}t^{n-1}+\cdots +c_{1}t+c_{0},\end{aligned}}}

y luego estos coeficientes se utilizan en una combinación lineal de potencias de A que se iguala a lanorte×norte{\displaystyle n\times n}matriz cero: Anorte+donorte1Anorte1++do1A+do0Inorte=(0000).{\displaystyle A^{n}+c_{n-1}A^{n-1}+\cdots +c_{1}A+c_{0}I_{n}={\begin{pmatrix}0&\cdots &0\\\vdots &\ddots &\vdots \\0&\cdots &0\end{pmatrix}}.}

El lado izquierdo se puede calcular hasta unnorte×norte{\displaystyle n\times n}Una matriz cuyas entradas son expresiones polinómicas (enormes) en el conjunto de entradas a i , j de A , por lo que el teorema de Cayley-Hamilton establece que cada una de estas n 2 expresiones es igual a 0 . Para cualquier valor fijo de n , estas identidades se pueden obtener mediante manipulaciones algebraicas tediosas pero directas. Sin embargo, ninguno de estos cálculos puede demostrar por qué el teorema de Cayley-Hamilton debería ser válido para matrices de todos los tamaños posibles de n , por lo que se necesita una demostración uniforme para todo n .

Preliminares

Si un vector v de tamaño n es un vector propio de A con valor propio λ , en otras palabras, si Av = λv , entonces pag(A)v=Anortev+donorte1Anorte1v++do1Av+do0Inortev=λnortev+donorte1λnorte1v++do1λv+do0v=pag(λ)v,{\displaystyle {\begin{aligned}p(A)\cdot v&=A^{n}\cdot v+c_{n-1}A^{n-1}\cdot v+\cdots +c_{1}A\cdot v+c_{0}I_{n}\cdot v\\[6pt]&=\lambda ^{n}v+c_{n-1}\lambda ^{n-1}v+\cdots +c_{1}\lambda v+c_{0}v=p(\lambda )v,\end{aligned}}} que es el vector cero ya que p ( λ ) = 0 (los autovalores de A son precisamente las raíces de p ( t ) ). Esto se cumple para todos los posibles autovalores λ , por lo que las dos matrices igualadas por el teorema ciertamente dan el mismo resultado (nulo) cuando se aplican a cualquier autovector. Ahora bien, si A admite una base de autovectores, en otras palabras, si A es diagonalizable , entonces el teorema de Cayley-Hamilton debe cumplirse para A , ya que dos matrices que dan los mismos valores cuando se aplican a cada elemento de una base deben ser iguales. A=incógnitaDincógnita1,D=diagnóstico(λi),i=1,2,...,norte{\displaystyle A=XDX^{-1},\quad D=\operatorname {diag} (\lambda _{i}),\quad i=1,2,...,n}pagA(λ)=|λIA|=i=1norte(λλi)k=0nortedokλk{\displaystyle p_{A}(\lambda )=|\lambda I-A|=\prod _{i=1}^{n}(\lambda -\lambda _{i})\equiv \sum _{k=0}^{n}c_{k}\lambda ^{k}}pagA(A)=dokAk=incógnitapagA(D)incógnita1=incógnitadoincógnita1{\displaystyle p_{A}(A)=\sum c_{k}A^{k}=Xp_{A}(D)X^{-1}=XCX^{-1}}doii=k=0nortedokλik=j=1norte(λiλj)=0,doi,ji=0{\displaystyle C_{ii}=\sum _{k=0}^{n}c_{k}\lambda _{i}^{k}=\prod _{j=1}^{n}(\lambda _{i}-\lambda _{j})=0,\qquad C_{i,j\neq i}=0}pagA(A)=incógnitadoincógnita1=O.{\displaystyle \therefore p_{A}(A)=XCX^{-1}=O.}

Consideremos ahora la funciónmi:METROnorteMETROnorte{\displaystyle e\colon M_{n}\to M_{n}}qué mapasnorte×norte{\displaystyle n\times n}matrices anorte×norte{\displaystyle n\times n}matrices dadas por la fórmulami(A)=pagA(A){\displaystyle e(A)=p_{A}(A)}, es decir, que toma una matrizA{\displaystyle A}y lo inserta en su propio polinomio característico. No todas las matrices son diagonalizables, pero para matrices con coeficientes complejos muchas de ellas sí lo son: el conjuntoD{\displaystyle D}de matrices cuadradas complejas diagonalizables de un tamaño dado es denso en el conjunto de todas esas matrices cuadradas [ 16 ] (para que una matriz sea diagonalizable basta, por ejemplo, con que su polinomio característico no tenga raíces múltiples ). Ahora visto como una funciónmi:donorte2donorte2{\displaystyle e\colon \mathbb {C} ^{n^{2}}\to \mathbb {C} ^{n^{2}}}(ya que las matrices tienennorte2{\displaystyle n^{2}}entradas) vemos que esta función es continua . Esto es cierto porque las entradas de la imagen de una matriz están dadas por polinomios en las entradas de la matriz. Dado que mi(D)={(0000)}{\displaystyle e(D)=\left\{{\begin{pmatrix}0&\cdots &0\\\vdots &\ddots &\vdots \\0&\cdots &0\end{pmatrix}}\right\}}

y desde el conjuntoD{\displaystyle D}es denso, por continuidad esta función debe mapear todo el conjunto denorte×norte{\displaystyle n\times n}matrices a la matriz cero. Por lo tanto, el teorema de Cayley-Hamilton es cierto para números complejos y, por consiguiente, también debe cumplirse paraQ{\displaystyle \mathbb {Q} }- oR{\displaystyle \mathbb {R} }matrices con valores en .

Si bien esto proporciona una demostración válida, el argumento no es del todo satisfactorio, ya que las identidades representadas por el teorema no dependen en absoluto de la naturaleza de la matriz (diagonalizable o no), ni del tipo de entradas permitidas (para matrices con entradas reales, las diagonalizables no forman un conjunto denso, y parece extraño que haya que considerar matrices complejas para comprobar que el teorema de Cayley-Hamilton se cumple para ellas). Por lo tanto, ahora consideraremos únicamente argumentos que demuestren el teorema directamente para cualquier matriz utilizando solo manipulaciones algebraicas; estos también tienen la ventaja de funcionar para matrices con entradas en cualquier anillo conmutativo .

Existe una gran variedad de demostraciones del teorema de Cayley-Hamilton, de las cuales se presentarán varias aquí. Estas varían en la cantidad de nociones algebraicas abstractas necesarias para su comprensión. Las demostraciones más sencillas emplean únicamente las nociones necesarias para formular el teorema (matrices, polinomios con entradas numéricas, determinantes), pero implican cálculos técnicos que hacen que resulte algo misterioso el hecho de que conduzcan precisamente a la conclusión correcta. Es posible evitar estos detalles, pero a costa de utilizar nociones algebraicas más sutiles: polinomios con coeficientes en un anillo no conmutativo o matrices con tipos de entradas inusuales.

Matrices adjugadas

Todas las demostraciones que siguen utilizan la noción de matriz adjunta adj( M ) de una matriz.norte×norte{\displaystyle n\times n}matriz M , la transpuesta de su matriz de cofactores . Esta es una matriz cuyos coeficientes están dados por expresiones polinómicas en los coeficientes de M (de hecho, por ciertas(norte1)×(norte1){\displaystyle (n-1)\times (n-1)}determinantes), de tal manera que se cumplan las siguientes relaciones fundamentales, adj(METRO)METRO=det(METRO)Inorte=METROadj(METRO) .{\displaystyle \operatorname {adj} (M)\cdot M=\det(M)I_{n}=M\cdot \operatorname {adj} (M)~.} Estas relaciones son una consecuencia directa de las propiedades básicas de los determinantes: la evaluación de la entrada ( i , j ) del producto matricial de la izquierda da la expansión por columna j del determinante de la matriz obtenida de M reemplazando la columna i por una copia de la columna j , que es det( M ) si i = j y cero en caso contrario; el producto matricial de la derecha es similar, pero para expansiones por filas.

Al ser consecuencia de la mera manipulación de expresiones algebraicas, estas relaciones son válidas para matrices con entradas en cualquier anillo conmutativo (la conmutatividad debe asumirse para que los determinantes puedan definirse). Es importante destacar esto, ya que estas relaciones se aplicarán más adelante a matrices con entradas no numéricas, como los polinomios.

Una demostración algebraica directa

Esta demostración utiliza precisamente el tipo de objetos necesarios para formular el teorema de Cayley-Hamilton: matrices con polinomios como entradas. La matriztInorteA{\displaystyle tI_{n}-A}cuyo determinante es el polinomio característico de A es tal matriz, y dado que los polinomios forman un anillo conmutativo, tiene un adjugadoB=adj(tInorteA).{\displaystyle B=\operatorname {adj} (tI_{n}-A).} Entonces, según la relación fundamental derecha del adjugado, se tiene (tInorteA)B=det(tInorteA)Inorte=pag(t)Inorte.{\displaystyle (tI_{n}-A)B=\det(tI_{n}-A)I_{n}=p(t)I_{n}.}

Dado que B también es una matriz con polinomios en t como entradas, se puede, para cada i , recopilar los coeficientes deti{\displaystyle t^{i}}en cada entrada para formar una matriz B i de números, de tal manera que se tenga B=i=0norte1tiBi.{\displaystyle B=\sum _{i=0}^{n-1}t^{i}B_{i}.}(La forma en que se definen las entradas de B deja claro que no aparecen potencias superiores a t n −1 ). Si bien esto parece un polinomio con matrices como coeficientes, no consideraremos tal noción; es simplemente una forma de escribir una matriz con entradas polinómicas como una combinación lineal de n matrices constantes, y el coeficienteti{\displaystyle t^{i}}Se ha escrito a la izquierda de la matriz para enfatizar este punto de vista.

Ahora, podemos expandir el producto matricial en nuestra ecuación: pag(t)Inorte=(tInorteA)B=(tInorteA)i=0norte1tiBi=i=0norte1tInortetiBii=0norte1AtiBi=i=0norte1ti+1Bii=0norte1tiABi=tnorteBnorte1+i=1norte1ti(Bi1ABi)AB0.{\displaystyle {\begin{aligned}p(t)I_{n}&=(tI_{n}-A)B\\&=(tI_{n}-A)\sum _{i=0}^{n-1}t^{i}B_{i}\\&=\sum _{i=0}^{n-1}tI_{n}\cdot t^{i}B_{i}-\sum _{i=0}^{n-1}A\cdot t^{i}B_{i}\\&=\sum _{i=0}^{n-1}t^{i+1}B_{i}-\sum _{i=0}^{n-1}t^{i}AB_{i}\\&=t^{n}B_{n-1}+\sum _{i=1}^{n-1}t^{i}(B_{i-1}-AB_{i})-AB_{0}.\end{aligned}}}

Escribiendo pag(t)Inorte=tnorteInorte+tnorte1donorte1Inorte++tdo1Inorte+do0Inorte,{\displaystyle p(t)I_{n}=t^{n}I_{n}+t^{n-1}c_{n-1}I_{n}+\cdots +tc_{1}I_{n}+c_{0}I_{n},} Se obtiene una igualdad de dos matrices con entradas polinómicas, escritas como combinaciones lineales de matrices constantes con potencias de t como coeficientes.

Dicha igualdad solo puede cumplirse si en cualquier posición de la matriz la entrada que se multiplica por una potencia dada es igual a cero.ti{\displaystyle t^{i}}es lo mismo en ambos lados; por lo tanto, las matrices constantes con coeficienteti{\displaystyle t^{i}}En ambas expresiones debe ser igual. Escribiendo estas ecuaciones para i desde n hasta 0, se obtiene: Bnorte1=Inorte,Bi1ABi=doiInortepara 1inorte1,AB0=do0Inorte.{\displaystyle B_{n-1}=I_{n},\qquad B_{i-1}-AB_{i}=c_{i}I_{n}\quad {\text{for }}1\leq i\leq n-1,\qquad -AB_{0}=c_{0}I_{n}.}

Finalmente, multiplica la ecuación de los coeficientes deti{\displaystyle t^{i}}desde la izquierda porAi{\displaystyle A^{i}}y resumir:

AnorteBnorte1+i=1norte1(AiBi1Ai+1Bi)AB0=Anorte+donorte1Anorte1++do1A+do0Inorte.{\displaystyle A^{n}B_{n-1}+\sum \limits _{i=1}^{n-1}\left(A^{i}B_{i-1}-A^{i+1}B_{i}\right)-AB_{0}=A^{n}+c_{n-1}A^{n-1}+\cdots +c_{1}A+c_{0}I_{n}.}

Los lados izquierdos forman una suma telescópica y se cancelan completamente; los lados derechos sumanpag(A){\displaystyle p(A)}: 0=pag(A).{\displaystyle 0=p(A).} Con esto concluye la demostración.

Una demostración mediante polinomios con coeficientes matriciales.

Esta demostración es similar a la primera, pero intenta dar sentido a la noción de polinomio con coeficientes matriciales sugerida por las expresiones que aparecen en dicha demostración. Esto requiere un cuidado considerable, ya que es algo inusual considerar polinomios con coeficientes en un anillo no conmutativo, y no todo el razonamiento válido para polinomios conmutativos puede aplicarse en este contexto.

Cabe destacar que, si bien la aritmética de polinomios sobre un anillo conmutativo modela la aritmética de funciones polinómicas , esto no ocurre sobre un anillo no conmutativo (de hecho, en este caso no existe una noción obvia de función polinómica que sea cerrada bajo la multiplicación). Por lo tanto, al considerar polinomios en t con coeficientes matriciales, la variable t no debe considerarse como una incógnita, sino como un símbolo formal que debe manipularse según reglas dadas; en particular, no se puede simplemente asignar a t un valor específico. (F+gramo)(incógnita)=i(Fi+gramoi)incógnitai=iFiincógnitai+igramoiincógnitai=F(incógnita)+gramo(incógnita).{\displaystyle (f+g)(x)=\sum _{i}\left(f_{i}+g_{i}\right)x^{i}=\sum _{i}{f_{i}x^{i}}+\sum _{i}{g_{i}x^{i}}=f(x)+g(x).}

DejarMETRO(norte,R){\displaystyle M(n,R)}Sea el anillo de matrices n × n con entradas en algún anillo R (como los números reales o complejos) que tiene a A como elemento. Matrices con coeficientes polinomios en t , comotInorteA{\displaystyle tI_{n}-A}o su adjugado B en la primera demostración, son elementos deMETRO(norte,R[t]){\displaystyle M(n,R[t])}.

Al agrupar potencias semejantes de t , dichas matrices se pueden escribir como "polinomios" en t con matrices constantes como coeficientes; escribirMETRO(norte,R)[t]{\displaystyle M(n,R)[t]}para el conjunto de tales polinomios. Dado que este conjunto está en biyección conMETRO(norte,R[t]){\displaystyle M(n,R[t])}, se definen operaciones aritméticas sobre él de forma correspondiente, en particular la multiplicación viene dada por (iMETROiti)(jnortejtj)=i,j(METROinortej)ti+j,{\displaystyle \left(\sum _{i}M_{i}t^{i}\right)\!\!\left(\sum _{j}N_{j}t^{j}\right)=\sum _{i,j}(M_{i}N_{j})t^{i+j},} respetando el orden de las matrices de coeficientes de los dos operandos; obviamente esto da como resultado una multiplicación no conmutativa.

Por lo tanto, la identidad (tInorteA)B=pag(t)Inorte.{\displaystyle (tI_{n}-A)B=p(t)I_{n}.} a partir de la primera prueba puede verse como una que implica una multiplicación de elementos enMETRO(norte,R)[t]{\displaystyle M(n,R)[t]}.

En este punto, resulta tentador simplemente igualar t a la matriz A , lo que hace que el primer factor de la izquierda sea igual a la matriz cero y el lado derecho igual a p ( A ) ; sin embargo, esta no es una operación permitida cuando los coeficientes no conmutan. Es posible definir una "aplicación de evaluación derecha" ev A  : M [ t ] → M , que reemplaza cada t i por la potencia matricial A i de A , donde se estipula que la potencia siempre debe multiplicarse por la derecha por el coeficiente correspondiente. Pero esta aplicación no es un homomorfismo de anillos : la evaluación derecha de un producto difiere en general del producto de las evaluaciones derechas. Esto se debe a que la multiplicación de polinomios con coeficientes matriciales no modela la multiplicación de expresiones que contienen incógnitas: un productoMETROtinortetj=(METROnorte)ti+j{\displaystyle Mt^{i}Nt^{j}=(M\cdot N)t^{i+j}}se define asumiendo que t conmuta con N , pero esto puede fallar si t se reemplaza por la matriz A.

En la situación particular que nos ocupa, se puede sortear esta dificultad, ya que la aplicación de evaluación derecha anterior se convierte en un homomorfismo de anillo si la matriz A está en el centro del anillo de coeficientes, de modo que conmuta con todos los coeficientes de los polinomios (el argumento que demuestra esto es sencillo, precisamente porque la conmutación de t con los coeficientes ahora está justificada después de la evaluación).

Ahora bien, A no siempre está en el centro de M , pero podemos reemplazar M con un anillo más pequeño siempre que contenga todos los coeficientes de los polinomios en cuestión:Inorte{\displaystyle I_{n}}, A y los coeficientesBi{\displaystyle B_{i}}del polinomio B. La elección obvia para tal subanillo es el centralizador Z de A , el subanillo de todas las matrices que conmutan con A ; por definición, A está en el centro de Z.

Este centralizador obviamente contieneInorte{\displaystyle I_{n}}y A , pero hay que demostrar que contiene las matricesBi{\displaystyle B_{i}}Para ello, se combinan las dos relaciones fundamentales para los adjugados, escribiendo el adjugado B como un polinomio: (i=0metroBiti)(tInorteA)=(tInorteA)i=0metroBitii=0metroBiti+1i=0metroBiAti=i=0metroBiti+1i=0metroABitii=0metroBiAti=i=0metroABiti.{\displaystyle {\begin{aligned}\left(\sum _{i=0}^{m}B_{i}t^{i}\right)\!(tI_{n}-A)&=(tI_{n}-A)\sum _{i=0}^{m}B_{i}t^{i}\\\sum _{i=0}^{m}B_{i}t^{i+1}-\sum _{i=0}^{m}B_{i}At^{i}&=\sum _{i=0}^{m}B_{i}t^{i+1}-\sum _{i=0}^{m}AB_{i}t^{i}\\\sum _{i=0}^{m}B_{i}At^{i}&=\sum _{i=0}^{m}AB_{i}t^{i}.\end{aligned}}}

Igualando los coeficientes se observa que para cada i , tenemos AB i = B i A como se deseaba. Habiendo encontrado el contexto adecuado en el que ev A es efectivamente un homomorfismo de anillos, se puede completar la demostración como se sugirió anteriormente: evA(pag(t)Inorte)=evA((tInorteA)B)pag(A)=evA(tInorteA)evA(B)pag(A)=(AInorteA)evA(B)=OevA(B)=O.{\displaystyle {\begin{aligned}\operatorname {ev} _{A}\left(p(t)I_{n}\right)&=\operatorname {ev} _{A}((tI_{n}-A)B)\\[5pt]p(A)&=\operatorname {ev} _{A}(tI_{n}-A)\cdot \operatorname {ev} _{A}(B)\\[5pt]p(A)&=(AI_{n}-A)\cdot \operatorname {ev} _{A}(B)=O\cdot \operatorname {ev} _{A}(B)=O.\end{aligned}}} Con esto concluye la demostración.

Una síntesis de las dos primeras pruebas

En la primera demostración, se pudieron determinar los coeficientes B i de B basándose únicamente en la relación fundamental de la derecha para el adjugado. De hecho, las primeras n ecuaciones derivadas pueden interpretarse como la determinación del cociente B de la división euclidiana del polinomio p ( t ) I n por la izquierda por el polinomio mónico I n tA , mientras que la ecuación final expresa que el resto es cero. Esta división se realiza en el anillo de polinomios con coeficientes matriciales. En efecto, incluso sobre un anillo no conmutativo, la división euclidiana por un polinomio mónico P está definida y siempre produce un cociente y un resto únicos con la misma condición de grado que en el caso conmutativo, siempre que se especifique en qué lado se desea que P sea un factor (en este caso, a la izquierda).

Para comprobar que el cociente y el resto son únicos (que es la parte importante de la afirmación), basta con escribirPAGQ+r=PAGQ+r{\displaystyle PQ+r=PQ'+r'}comoPAG(QQ)=rr{\displaystyle P(Q-Q')=r'-r}y observe que, dado que P es mónico, P ( QQ ′) no puede tener un grado menor que el de P , a menos que Q = Q .

Pero el dividendo p ( t ) I n y el divisor I n tA utilizados aquí se encuentran ambos en el subanillo ( R [ A ])[ t ] , donde R [ A ] es el subanillo del anillo de matrices M ( n , R ) generado por A : el espacio R - lineal generado por todas las potencias de A . Por lo tanto, la división euclidiana puede realizarse de hecho dentro de ese anillo de polinomios conmutativos , y por supuesto da entonces el mismo cociente B y resto 0 que en el anillo más grande; en particular esto muestra que B de hecho se encuentra en ( R [ A ])[ t ] .

Pero, en este contexto conmutativo, es válido establecer t como A en la ecuación.

pag(t)Inorte=(tInorteA)B;{\displaystyle p(t)I_{n}=(tI_{n}-A)B;}

En otras palabras, aplicar el mapa de evaluación

evA:(R[A])[t]R[A]{\displaystyle \operatorname {ev} _{A}:(R[A])[t]\to R[A]}

que es un homomorfismo de anillos, dando

pag(A)=0evA(B)=0{\displaystyle p(A)=0\cdot \operatorname {ev} _{A}(B)=0}

igual que en la segunda prueba, como se deseaba.

Además de demostrar el teorema, el argumento anterior nos dice que los coeficientes B i de B son polinomios en A , mientras que de la segunda demostración solo sabíamos que se encuentran en el centralizador Z de A ; en general, Z es un subanillo mayor que R [ A ] , y no necesariamente conmutativo. En particular, el término constante B 0 = adj(− A ) se encuentra en R [ A ] . Dado que A es una matriz cuadrada arbitraria, esto prueba que adj( A ) siempre puede expresarse como un polinomio en A (con coeficientes que dependen de A ) .

De hecho, las ecuaciones encontradas en la primera demostración permiten expresar sucesivamenteBnorte1,,B1,B0{\displaystyle B_{n-1},\ldots ,B_{1},B_{0}}como polinomios en A , lo que lleva a la identidad

adj(A)=i=1nortedoiAi1,{\displaystyle \operatorname {adj} (-A)=\sum _{i=1}^{n}c_{i}A^{i-1},}

válido para todas las matrices n × n , donde pag(t)=tnorte+donorte1tnorte1++do1t+do0{\displaystyle p(t)=t^{n}+c_{n-1}t^{n-1}+\cdots +c_{1}t+c_{0}}es el polinomio característico de A.

Nótese que esta identidad también implica el enunciado del teorema de Cayley-Hamilton: se puede mover adj(− A ) al lado derecho, multiplicar la ecuación resultante (a la izquierda o a la derecha) por A y usar el hecho de que Aadj(A)=adj(A)(A)=det(A)Inorte=do0Inorte.{\displaystyle -A\cdot \operatorname {adj} (-A)=\operatorname {adj} (-A)\cdot (-A)=\det(-A)I_{n}=c_{0}I_{n}.}

Una demostración utilizando matrices de endomorfismos

Como se mencionó anteriormente, la matriz p ( A ) en el enunciado del teorema se obtiene evaluando primero el determinante y luego sustituyendo la matriz A por t ; haciendo esa sustitución en la matriztInorteA{\displaystyle tI_{n}-A}antes de evaluar el determinante no tiene sentido. Sin embargo, es posible dar una interpretación donde p ( A ) se obtiene directamente como el valor de un cierto determinante, pero esto requiere un entorno más complicado, uno de matrices sobre un anillo en el que se pueden interpretar ambas entradas.Ai,j{\displaystyle A_{i,j}}de A y todo A mismo. Se podría tomar para esto el anillo M ( n , R ) de matrices n × n sobre R , donde la entradaAi,j{\displaystyle A_{i,j}}se realiza comoAi,jInorte{\displaystyle A_{i,j}I_{n}}y A como sí misma. Pero considerar matrices con matrices como entradas podría causar confusión con matrices de bloques , lo cual no es la intención, ya que eso da una noción errónea de determinante (recordemos que el determinante de una matriz se define como la suma de productos de sus entradas, y en el caso de una matriz de bloques, esto generalmente no es lo mismo que la suma correspondiente de productos de sus bloques). Es más claro distinguir A del endomorfismo φ de un espacio vectorial n - dimensional V (o R -módulo libre si R no es un cuerpo) definido por él en una basemi1,,minorte{\displaystyle e_{1},\ldots ,e_{n}}y tomar matrices sobre el anillo End( V ) de todos esos endomorfismos. Entonces φ ∈ End( V ) es una posible entrada de matriz, mientras que A designa el elemento de M ( n , End( V )) cuya entrada i , j es un endomorfismo de multiplicación escalar porAi,j{\displaystyle A_{i,j}}; similarmenteInorte{\displaystyle I_{n}}se interpretará como un elemento de M ( n , End( V )) . Sin embargo, dado que End( V ) no es un anillo conmutativo, no se define ningún determinante en M ( n , End( V )) ; esto solo se puede hacer para matrices sobre un subanillo conmutativo de End( V ) . Ahora las entradas de la matrizφInorteA{\displaystyle \varphi I_{n}-A}todos se encuentran en el subanillo R [ φ ] generado por la identidad y φ , que es conmutativo. Entonces se define una aplicación determinante M ( n , R [ φ ]) → R [ φ ] , ydet(φInorteA){\displaystyle \det(\varphi I_{n}-A)}se evalúa al valor p ( φ ) del polinomio característico de A en φ (esto se cumple independientemente de la relación entre A y φ ); el teorema de Cayley-Hamilton establece que p ( φ ) es el endomorfismo nulo.

De esta forma, la siguiente demostración se puede obtener de la de Atiyah y MacDonald (1969 , Prop. 2.4) (que de hecho es la afirmación más general relacionada con el lema de Nakayama ; en esa proposición se toma por ideal todo el anillo R ). El hecho de que A sea la matriz de φ en la base e 1 , ..., e n significa que φ(mii)=j=1norteAj,imijpara i=1,,norte.{\displaystyle \varphi (e_{i})=\sum _{j=1}^{n}A_{j,i}e_{j}\quad {\text{for }}i=1,\ldots ,n.} Se pueden interpretar como n componentes de una ecuación en V n , cuyos miembros se pueden escribir usando el producto matriz-vector M ( n , End( V )) × V nV n que se define como usualmente, pero con entradas individuales ψ ∈ End( V ) y v en V siendo "multiplicadas" por formandoψ(v){\displaystyle \psi (v)}; esto da como resultado: φInortemi=Atrmi,{\displaystyle \varphi I_{n}\cdot E=A^{\operatorname {tr} }\cdot E,} dóndemiVnorte{\displaystyle E\in V^{n}}es el elemento cuyo componente i es e i (en otras palabras, es la base e 1 , ..., e n de V escrita como una columna de vectores). Escribiendo esta ecuación como (φInorteAtr)mi=0Vnorte{\displaystyle (\varphi I_{n}-A^{\operatorname {tr} })\cdot E=0\in V^{n}} uno reconoce la transpuesta de la matrizφInorteA{\displaystyle \varphi I_{n}-A}considerado anteriormente, y su determinante (como elemento de M ( n , R [ φ ])) también es p ( φ ). Para derivar de esta ecuación que p ( φ ) = 0 ∈ End( V ) , se multiplica por la izquierda por la matriz adjugada deφInorteAtr{\displaystyle \varphi I_{n}-A^{\operatorname {tr} }}, que se define en el anillo matricial M ( n , R [ φ ]) , dando como resultado 0=adj(φInorteAtr)((φInorteAtr)mi)=(adj(φInorteAtr)(φInorteAtr))mi=(det(φInorteAtr)Inorte)mi=(pag(φ)Inorte)mi;{\displaystyle {\begin{aligned}0&=\operatorname {adj} (\varphi I_{n}-A^{\operatorname {tr} })\cdot \left((\varphi I_{n}-A^{\operatorname {tr} })\cdot E\right)\\[1ex]&=\left(\operatorname {adj} (\varphi I_{n}-A^{\operatorname {tr} })\cdot (\varphi I_{n}-A^{\operatorname {tr} })\right)\cdot E\\[1ex]&=\left(\det(\varphi I_{n}-A^{\operatorname {tr} })I_{n}\right)\cdot E\\[1ex]&=(p(\varphi )I_{n})\cdot E;\end{aligned}}} La asociatividad de la multiplicación matriz-matriz y matriz-vector utilizada en el primer paso es una propiedad puramente formal de esas operaciones, independiente de la naturaleza de las entradas. Ahora bien, el componente i de esta ecuación dice que p ( φ )( e i ) = 0 ∈ V ; por lo tanto, p ( φ ) se anula en todos los e i , y dado que estos elementos generan V, se deduce que p ( φ ) = 0 ∈ End( V ) , completando así la demostración.

Un hecho adicional que se desprende de esta demostración es que la matriz A cuyo polinomio característico se toma no tiene por qué ser idéntica al valor φ sustituido en ese polinomio; basta con que φ sea un endomorfismo de V que satisfaga las ecuaciones iniciales.

φ(mii)=jAj,imij{\displaystyle \varphi (e_{i})=\sum _{j}A_{j,i}e_{j}} para alguna secuencia de elementos e 1 , ..., e n que generan V (cuyo espacio podría tener una dimensión menor que n , o en caso de que el anillo R no sea un cuerpo, podría no ser un módulo libre en absoluto).

Una "prueba" falsa: p ( A ) = det( AI nA ) = det( AA ) = 0

Un argumento elemental pero incorrecto persistente [ 17 ] para el teorema es "simplemente" tomar la definición pag(λ)=det(λInorteA){\displaystyle p(\lambda )=\det(\lambda I_{n}-A)} y sustituir A por λ , obteniendo pag(A)=det(AInorteA)=det(AA)=det(0)=0.{\displaystyle p(A)=\det(AI_{n}-A)=\det(A-A)=\det(\mathbf {0} )=0.}

Hay muchas maneras de ver por qué este argumento es erróneo. Primero, en el teorema de Cayley-Hamilton, p ( A ) es una matriz n × n . Sin embargo, el lado derecho de la ecuación anterior es el valor de un determinante, que es un escalar . Por lo tanto, no se pueden igualar a menos que n = 1 (es decir, A es solo un escalar). Segundo, en la expresióndet(λInorteA){\displaystyle \det(\lambda I_{n}-A)}La variable λ aparece en realidad en las entradas diagonales de la matriz.λInorteA{\displaystyle \lambda I_{n}-A}Para ilustrarlo, consideremos nuevamente el polinomio característico del ejemplo anterior:

det(λ123λ4).{\displaystyle \det \!{\begin{pmatrix}\lambda -1&-2\\-3&\lambda -4\end{pmatrix}}.}

Si se sustituye la matriz A completa por λ en esas posiciones, se obtiene

det((1234)123(1234)4),{\displaystyle \det \!{\begin{pmatrix}{\begin{pmatrix}1&2\\3&4\end{pmatrix}}-1&-2\\-3&{\begin{pmatrix}1&2\\3&4\end{pmatrix}}-4\end{pmatrix}},}

en la que la expresión "matriz" simplemente no es válida. Sin embargo, tenga en cuenta que si se restan múltiplos escalares de matrices identidad en lugar de escalares en lo anterior, es decir, si la sustitución se realiza como

det((1234)I22I23I2(1234)4I2),{\displaystyle \det \!{\begin{pmatrix}{\begin{pmatrix}1&2\\3&4\end{pmatrix}}-I_{2}&-2I_{2}\\-3I_{2}&{\begin{pmatrix}1&2\\3&4\end{pmatrix}}-4I_{2}\end{pmatrix}},}

entonces el determinante es efectivamente cero, pero la matriz expandida en cuestión no se evalúa aAInorteA{\displaystyle AI_{n}-A}; ni su determinante (un escalar) puede compararse con p ( A ) (una matriz). Por lo tanto, el argumento de quepag(A)=det(AInorteA)=0{\displaystyle p(A)=\det(AI_{n}-A)=0}Todavía no aplica.

En realidad, si tal argumento es válido, también debería serlo cuando se utilizan otras formas multilineales en lugar del determinante. Por ejemplo, si consideramos la función permanente y definimosq(λ)=permanente(λInorteA){\displaystyle q(\lambda )=\operatorname {perm} (\lambda I_{n}-A)}, entonces, por el mismo argumento, deberíamos poder "probar" que q ( A ) = 0 . Pero esta afirmación es demostrablemente errónea: en el caso bidimensional, por ejemplo, el permanente de una matriz viene dado por

permanente(abdod)=ad+bdo.{\displaystyle \operatorname {perm} \!{\begin{pmatrix}a&b\\c&d\end{pmatrix}}=ad+bc.}

Entonces, para la matriz A del ejemplo anterior,

q(λ)=permanente(λI2A)=permanente(λ123λ4)=(λ1)(λ4)+(2)(3)=λ25λ+10.{\displaystyle {\begin{aligned}q(\lambda )&=\operatorname {perm} (\lambda I_{2}-A)=\operatorname {perm} \!{\begin{pmatrix}\lambda -1&-2\\-3&\lambda -4\end{pmatrix}}\\[6pt]&=(\lambda -1)(\lambda -4)+(-2)(-3)=\lambda ^{2}-5\lambda +10.\end{aligned}}}

Sin embargo, se puede verificar que

q(A)=A25A+10I2=12I20.{\displaystyle q(A)=A^{2}-5A+10I_{2}=12I_{2}\neq 0.}

Una de las demostraciones del teorema de Cayley-Hamilton anterior guarda cierta similitud con el argumento de quepag(A)=det(AInorteA)=0{\displaystyle p(A)=\det(AI_{n}-A)=0}Al introducir una matriz con coeficientes no numéricos, se puede permitir que A viva dentro de una entrada de la matriz, pero entonces...AInorte{\displaystyle AI_{n}}no es igual a A , y la conclusión se alcanza de manera diferente.

Demostraciones mediante métodos de álgebra abstracta

Propiedades básicas de las derivaciones de Hasse-Schmidt en el álgebra exteriorA=METRO{\textstyle A=\bigwedge M}Gatto y Salehyan (2016 , §4) han utilizado algunos módulos B - M (que se suponen libres y de rango finito) para demostrar el teorema de Cayley-Hamilton. Véase también Gatto y Scherbak (2015) .

Una prueba combinatoria

Straubing [ 18 ] dio una demostración basada en el desarrollo de la fórmula de Leibniz para el polinomio característico y Foata y Cartier dieron una generalización utilizando la teoría del monoide de traza .

Abstracción y generalizaciones

Las demostraciones anteriores muestran que el teorema de Cayley-Hamilton se cumple para matrices con entradas en cualquier anillo conmutativo R , y que p ( φ ) = 0 se cumplirá siempre que φ sea un endomorfismo de un R -módulo generado por elementos e1 ,..., en que satisface

φ(mij)=aijmii,j=1,,norte.{\displaystyle \varphi (e_{j})=\sum a_{ij}e_{i},\qquad j=1,\ldots ,n.}

Esta versión más general del teorema es la fuente del célebre lema de Nakayama en álgebra conmutativa y geometría algebraica .

El teorema de Cayley-Hamilton también se cumple para matrices sobre los cuaterniones , un anillo no conmutativo . [ 19 ] [ nb 3 ]

Véase también

Observaciones

  1. Véase la sección 2 de Krivoruchenko (2016) . Kondratyuk y Krivoruchenko (1992) proporcionanuna expresión explícita para los coeficientes c i : doi=k1,k2,,knortel=1norte(1)kl+1lklkl¡tr(Al)kl,{\displaystyle c_{i}=\sum _{k_{1},k_{2},\ldots ,k_{n}}\prod _{l=1}^{n}{\frac {(-1)^{k_{l}+1}}{l^{k_{l}}k_{l}!}}\operatorname {tr} (A^{l})^{k_{l}},} donde la suma se toma sobre los conjuntos de todas las particiones enteras k l ≥ 0 que satisfacen la ecuación l=1nortelkl=nortei.{\displaystyle \sum _{l=1}^{n}lk_{l}=n-i.}
  2. Véase, por ejemplo, la página 54 de Brown 1994 , que resuelve la fórmula de Jacobi , pag(λ)λ=pag(λ)metro=0λ(metro+1)trAmetro=pag(λ) trIλIAtrB ,{\displaystyle {\frac {\partial p(\lambda )}{\partial \lambda }}=p(\lambda )\sum _{m=0}^{\infty }\lambda ^{-(m+1)}\operatorname {tr} A^{m}=p(\lambda )~\operatorname {tr} {\frac {I}{\lambda I-A}}\equiv \operatorname {tr} B~,} donde B es la matriz adjunta de la siguiente sección. También existe un algoritmo recursivo equivalente y relacionado introducido por Urbain Le Verrier y Dmitry Konstantinovich Faddeev —el algoritmo de Faddeev-LeVerrier— que se lee METRO0Odonorte=1(k=0)METROkAMETROk11k1(tr(AMETROk1))Idonortek=1ktr(AMETROk)k=1,,norte .{\displaystyle {\begin{aligned}M_{0}&\equiv O&c_{n}&=1\qquad &(k=0)\\[5pt]M_{k}&\equiv AM_{k-1}-{\frac {1}{k-1}}(\operatorname {tr} (AM_{k-1}))I\qquad \qquad &c_{n-k}&=-{\frac {1}{k}}\operatorname {tr} (AM_{k})\qquad &k=1,\ldots ,n~.\end{aligned}}} (véase, por ejemplo, Gantmacher 1960 , p. 88. ) Obsérvese A −1 = − M n / c 0 cuando termina la recursión. Véase la demostración algebraica en la siguiente sección, que se basa en los modos del adjugado, B kM nk . Específicamente, (λIA)B=Ipag(λ){\displaystyle (\lambda I-A)B=Ip(\lambda )}y la derivada anterior de p cuando se traza produce λpagnortepag=tr(AB) ,{\displaystyle \lambda p'-np=\operatorname {tr} (AB)~,}( Hou 1998 ), y las recursiones anteriores, a su vez.
  3. Debido a la naturaleza no conmutativa de la operación de multiplicación para cuaterniones y construcciones relacionadas, es necesario tener cuidado con las definiciones, especialmente en este contexto, para el determinante. El teorema también se cumple para los cuaterniones divididos ligeramente menos bien comportados , véase Alagös, Oral y Yüce (2012) . Los anillos de cuaterniones y cuaterniones divididos pueden representarse mediante ciertas matrices complejas de 2 × 2. (Cuando se restringe a la norma unitaria, estos son los grupos SU(2) y SU(1,1) respectivamente). Por lo tanto, no es sorprendente que el teorema se cumpla.No existe tal representación matricial para los octoniones , ya que la operación de multiplicación no es asociativa en este caso. Sin embargo, un teorema de Cayley-Hamilton modificado todavía se cumple para los octoniones, véase Tian (2000) .

Notas

  1. 1 2 Crilly 1998
  2. 1 2 Hamilton 1864a
  3. 1 2 Hamilton 1864b
  4. 1 2 Hamilton 1862
  5. Atiyah y MacDonald 1969
  6. Hamilton 1853 , pág. 562 
  7. Cayley 1858 , págs. 17–37 
  8. Cayley 1889 , págs. 475–496 
  9. 1 2 Frobenius 1878
  10. Zeni y Rodrigues 1992
  11. ^ Barut, Zeni y Laufer 1994a
  12. ^ Barut, Zeni y Laufer 1994b
  13. Laufer 1997
  14. Curtright, Fairlie y Zachos 2014
  15. Stein, William. Teoría algebraica de números, un enfoque computacional (PDF) . pág.  29.
  16. Bhatia 1997 , pág. 7 
  17. Garrett 2007 , pág. 381 
  18. Straubing, Howard (1983-01-01). "Una demostración combinatoria del teorema de Cayley-Hamilton" . Matemáticas Discretas . 43 (2): 273– 279. doi : 10.1016/0012-365X(83)90164-4 . ISSN 0012-365X . 
  19. Zhang 1997

Referencias

  • Alagös, Y.; Oral, K.; Yüce, S. (2012). "Matrices de cuaterniones divididos" . Miskolc Mathematical Notes . 13 (2): 223– 232. doi : 10.18514/MMN.2012.364 . ISSN 1787-2405 (acceso abierto)
  • Atiyah, MF ; MacDonald, IG (1969), Introducción al álgebra conmutativa , Westview Press, ISBN 978-0-201-40751-8
  • Barut, AO ; Zeni, JR; Laufer, A. (1994a). "El mapa exponencial para el grupo conforme O(2,4)". J. Phys. A: Math. Gen. 27 ( 15): 5239– 5250. arXiv : hep-th/9408105 . Bibcode : 1994JPhA...27.5239B . doi : 10.1088/0305-4470/27/15/022 .
  • Barut, AO ; Zeni, JR; Laufer, A. (1994b). "El mapa exponencial para el grupo unitario SU(2,2)". J. Phys. A: Math. Gen. 27 ( 20): 6799– 6806. arXiv : hep-th/9408145 . Bibcode : 1994JPhA...27.6799B . doi : 10.1088/0305-4470/27/20/017 . S2CID 16495633 . 
  • Bhatia, R. (1997). Análisis matricial . Textos de posgrado en matemáticas. Vol.  169. Springer. ISBN 978-0387948461.
  • Brown, Lowell S. (1994). Teoría cuántica de campos . Cambridge University Press . ISBN 978-0-521-46946-3.
  • Cayley, A. (1858). "Una memoria sobre la teoría de las matrices". Philos. Trans . 148 : 17. Bibcode : 1858RSPT..148...17C .
  • Cayley, A. (1889). The Collected Mathematical Papers of Arthur Cayley . (Classic Reprint). Vol.  2. Forgotten books. ASIN B008HUED9O . 
  • Crilly, T. (1998). "El joven Arthur Cayley". Notes Rec. R. Soc. Lond . 52 (2): 267– 282. doi : 10.1098/rsnr.1998.0050 . S2CID 146669911 . 
  • Curtright, TL ; Fairlie, DB ; Zachos, CK (2014). "Una fórmula compacta para rotaciones como polinomios de matriz de espín". SIGMA . 10 (2014): 084. arXiv : 1402.3541 . Bibcode : 2014SIGMA..10..084C . doi : 10.3842/SIGMA.2014.084 . S2CID 18776942 . 
  • Frobenius, G. (1878). "Ueber lineare Substutionen und bilineare Formen" . J. Reina Angew. Matemáticas . 1878 (84): 1–63 .
  • Gantmacher, FR (1960). La teoría de las matrices . Nueva York: Chelsea Publishing. ISBN 978-0-8218-1376-8.{{cite book}}: Incompatibilidad de ISBN/Fecha ( ayuda )
  • Gatto, Letterio; Salehyan, Parham (2016), Derivaciones de Hasse-Schmidt sobre álgebras de Grassmann , Springer, doi : 10.1007/978-3-319-31842-4 , ISBN 978-3-319-31842-4, MR 3524604 
  • Gatto, Letterio; Scherbak, Inna (2015), Observaciones sobre el teorema de Cayley-Hamilton , arXiv : 1510.03022
  • Garrett, Paul B. (2007). Álgebra abstracta . Nueva York: Chapman and Hall/CRC. ISBN 978-1584886891.
  • Hamilton, WR (1853). Lecciones sobre cuaterniones . Dublín.{{cite book}}: CS1 mantenimiento: falta el editor de ubicación ( enlace )
  • Hamilton, WR (1864a). "Sobre un método nuevo y general para invertir una función lineal y cuaterniónica de un cuaternión". Actas de la Real Academia Irlandesa . viii : 182–183 .(Comunicado el 9 de junio de 1862)
  • Hamilton, WR (1864b). "Sobre la existencia de una ecuación simbólica y bicuadrática, que es satisfecha por el símbolo de operación lineal en cuaterniones". Actas de la Real Academia Irlandesa . viii : 190–101 .(Comunicado el 23 de junio de 1862)
  • Hou, SH (1998). "Nota de clase: Una demostración sencilla del algoritmo del polinomio característico de Leverrier-Faddeev". SIAM Review . 40 (3): 706– 709. Bibcode : 1998SIAMR..40..706H . doi : 10.1137/S003614459732076X ."Apuntes de clase: Una demostración sencilla del algoritmo del polinomio característico de Leverrier-Faddeev"
  • Hamilton, WR (1862). "Sobre la existencia de una ecuación simbólica y bicuadrática que satisface el símbolo de la operación lineal o distributiva sobre un cuaternión" . The London, Edinburgh, and Dublin Philosophical Magazine and Journal of Science . Serie IV . 24 : 127–128 . ISSN 1478-6435 . Consultado el 14 de febrero de 2015 . 
  • Householder, Alston S. (2006). La teoría de las matrices en el análisis numérico . Dover Books on Mathematics. ISBN 978-0486449722.
  • Krivoruchenko, MI (2016). "Identidades de traza para matrices antisimétricas". arXiv : 1605.00447 [ math-ph ].
  • Kondratyuk, LA; Krivoruchenko, MI (1992). "Materia de quarks superconductores en el grupo de colores SU (2)". Zeitschrift für Physik A. 344 (1): 99– 115. Código Bib : 1992ZPhyA.344...99K . doi : 10.1007/BF01291027 . S2CID 120467300 . 
  • Laufer, A. (1997). "El mapa exponencial de GL(N)". J. Phys. A: Math. Gen . 30 (15): 5455– 5470. arXiv : hep-th/9604049 . Bibcode : 1997JPhA...30.5455L . doi : 10.1088/0305-4470/30/15/029 . S2CID 10699434 . 
  • Tian, ​​Y. (2000). "Representaciones matriciales de octoniones y su aplicación". Advances in Applied Clifford Algebras . 10 (1): 61– 90. arXiv : math/0003166 . Bibcode : 2000math......3166T . CiteSeerX 10.1.1.237.2217 . doi : 10.1007/BF03042010 . ISSN 0188-7009 . S2CID 14465054 .   
  • Zeni, JR; Rodrigues, WA (1992). "Un estudio reflexivo de las transformaciones de Lorentz mediante álgebras de Clifford". Int. J. Mod. Phys. A . 7 (8): 1793 pp. Bibcode : 1992IJMPA...7.1793Z . doi : 10.1142/S0217751X92000776 .
  • Zhang, F. (1997). "Cuaterniones y matrices de cuaterniones" . Álgebra lineal y sus aplicaciones . 251 : 21–57 . doi : 10.1016/0024-3795(95)00543-9 . ISSN 0024-3795 (archivo abierto).
  • "Teorema de Cayley-Hamilton" , Enciclopedia de Matemáticas , EMS Press, 2001 [1994]
  • Una demostración de PlanetMath.
  • El teorema de Cayley-Hamilton en MathPages