

En álgebra lineal , el teorema de Cayley-Hamilton (que recibe su nombre de los matemáticos Arthur Cayley y William Rowan Hamilton ) establece que toda matriz cuadrada sobre un anillo conmutativo (como los números reales o complejos o los enteros ) satisface su propia ecuación característica .
El polinomio característico de unLa matriz A se define como [ 5 ], donde det es la operación determinante , λ es un elemento escalar variable del anillo base , e I n es elmatriz identidad . Dado que cada entrada de la matrizes constante o lineal en λ , el determinante dees un polinomio mónico de grado n en λ , por lo que se puede escribir como Al reemplazar la variable escalar λ con la matriz A , se puede definir una expresión polinómica matricial análoga , (Aquí,es la matriz dada, no una variable, a diferencia de-entonceses una constante en lugar de una función.) El teorema de Cayley-Hamilton establece que esta expresión polinómica es igual a la matriz cero , lo que significa quees decir, el polinomio característicoes un polinomio anulador para
Una de las aplicaciones del teorema de Cayley-Hamilton es que permite expresar A n como una combinación lineal de las potencias matriciales inferiores de A : Cuando el anillo es un cuerpo , el teorema de Cayley-Hamilton es equivalente a la afirmación de que el polinomio mínimo de una matriz cuadrada divide a su polinomio característico.
Un caso especial del teorema fue demostrado por primera vez por Hamilton en 1853 [ 6 ] en términos de inversas de funciones lineales de cuaterniones . [ 2 ] [ 3 ] [ 4 ] Esto corresponde al caso especial de ciertosreal omatrices complejas. Cayley en 1858 declaró el resultado para y matrices más pequeñas, pero solo publicó una prueba para la caso. [ 7 ] [ 8 ] En cuanto a Sobre las matrices, Cayley afirmó: «..., no he considerado necesario emprender el trabajo de una demostración formal del teorema en el caso general de una matriz de cualquier grado». El caso general fue demostrado por primera vez por Ferdinand Frobenius en 1878. [ 9 ]
Ejemplos
matrices de 1 × 1
Para un matriz A = ( a ) , el polinomio característico viene dado por p ( λ ) = λ − a , y por lo tanto p ( A ) = ( a ) − a (1) = 0 es trivial.
matrices de 2 × 2
Como ejemplo concreto, dejemos Su polinomio característico viene dado por
El teorema de Cayley-Hamilton afirma que, si definimos entonces Podemos verificar mediante cálculos que, efectivamente,
Para un genéricomatriz,
El polinomio característico viene dado por p ( λ ) = λ 2 − ( a + d ) λ + ( ad − bc ) , por lo que el teorema de Cayley-Hamilton establece que lo cual es cierto que siempre es así, como se evidencia al calcular las entradas de A 2 .
Aplicaciones
Determinante y matriz inversa
Para un generalmatriz invertible A , es decir, una con determinante distinto de cero, A −1 puede escribirse como unaexpresión polinómica de orden en A : Como se indica, el teorema de Cayley-Hamilton equivale a la identidad
Los coeficientes c i vienen dados por los polinomios simétricos elementales de los valores propios de A. Utilizando identidades de Newton , los polinomios simétricos elementales pueden a su vez expresarse en términos de polinomios simétricos de suma de potencias de los valores propios: donde tr( A k ) es la traza de la matriz A k . Por lo tanto, podemos expresar c i en términos de la traza de las potencias de A .
En general, la fórmula para los coeficientes c i se da en términos de polinomios de Bell exponenciales completos como [ nb 1 ]
En particular, el determinante de A es igual a (−1) n c 0 . Por lo tanto, el determinante se puede escribir como la identidad de traza :
Asimismo, el polinomio característico se puede escribir como y, al multiplicar ambos lados por A −1 (nótese que −(−1) n = (−1) n −1 ), se llega a una expresión para el inverso de A como identidad de traza,
Otro método para obtener estos coeficientes c k para un generalLa matriz, siempre que ninguna raíz sea cero, se basa en la siguiente expresión alternativa para el determinante , Por lo tanto, en virtud de la serie de Mercator , donde la exponencial solo necesita expandirse hasta el orden λ − n , ya que p ( λ ) es de orden n , las potencias negativas netas de λ se anulan automáticamente por el teorema C–H. (Nuevamente, esto requiere un anillo que contenga los números racionales .) La diferenciación de esta expresión con respecto a λ permite expresar los coeficientes del polinomio característico para un n general como determinantes de matrices m × m , [ nb 2 ]
- Ejemplos
Por ejemplo, los primeros polinomios de Bell son B 0 = 1, B 1 ( x 1 ) = x 1 , B 2 ( x 1 , x 2 ) = x 2 1 + x 2 , y B 3 ( x 1 , x 2 , x 3 ) = x 3 1 + 3 x 1 x 2 + x 3 .
Utilizando estos para especificar los coeficientes c i del polinomio característico de un rendimientos de la matriz
El coeficiente c 0 da el determinante de la matriz, c 1 menos su traza, mientras que su inversa viene dada por
Es evidente a partir de la fórmula general para c n − k , expresada en términos de polinomios de Bell, que las expresiones
siempre dé los coeficientes c n −1 de λ n −1 y c n −2 de λ n −2 en el polinomio característico de cualquiermatriz, respectivamente. Entonces, para una matriz A , el enunciado del teorema de Cayley-Hamilton también se puede escribir como donde el lado derecho designa unmatriz con todas las entradas reducidas a cero. De igual modo, este determinante en el caso n = 3 , ahora es Esta expresión da el negativo del coeficiente c n −3 de λ n −3 en el caso general, como se ve a continuación.
De manera similar, uno puede escribir para unmatriz A ,
donde, ahora, el determinante es c n −4 ,
y así sucesivamente para matrices más grandes. Las expresiones cada vez más complejas para los coeficientes c k se pueden deducir de las identidades de Newton o del algoritmo de Faddeev-LeVerrier .
n -ésima potencia de matriz
El teorema de Cayley-Hamilton siempre proporciona una relación entre las potencias de A (aunque no siempre la más simple), lo que permite simplificar expresiones que involucran dichas potencias y evaluarlas sin tener que calcular la potencia A n o cualquier potencia superior de A.
Como ejemplo, paraEl teorema da
Luego, para calcular A 4 , observe Asimismo,
Nótese que hemos podido expresar la potencia de una matriz como la suma de dos términos. De hecho, una potencia de matriz de cualquier orden k puede escribirse como un polinomio matricial de grado como máximo n − 1 , donde n es el tamaño de una matriz cuadrada. Este es un ejemplo donde el teorema de Cayley-Hamilton puede utilizarse para expresar una función matricial, lo cual analizaremos sistemáticamente más adelante.
funciones matriciales
Dada una función analítica y el polinomio característico p ( x ) de grado n de una matriz A de n × n , la función se puede expresar mediante división larga como donde q ( x ) es algún polinomio cociente y r ( x ) es un polinomio resto tal que 0 ≤ deg r ( x ) < n .
Según el teorema de Cayley-Hamilton, al reemplazar x por la matriz A se obtiene p ( A ) = 0 , por lo que se tiene
Por lo tanto, la función analítica de la matriz A puede expresarse como un polinomio matricial de grado menor que n .
Sea el polinomio restante Dado que p ( λ ) = 0 , al evaluar la función f ( x ) en los n autovalores de A se obtiene Esto equivale a un sistema de n ecuaciones lineales , que se pueden resolver para determinar los coeficientes c i . Por lo tanto, se tiene
Cuando los autovalores se repiten, es decir, λ i = λ j para algún i ≠ j , dos o más ecuaciones son idénticas; por lo tanto, las ecuaciones lineales no pueden resolverse de forma única. En tales casos, para un autovalor λ con multiplicidad m , las primeras m − 1 derivadas de p ( x ) se anulan en el autovalor. Esto conduce a m − 1 soluciones linealmente independientes adicionales. que, combinadas con otras, producen las n ecuaciones necesarias para resolver c i .
Encontrar un polinomio que pase por los puntos ( λ i , f ( λ i )) es esencialmente un problema de interpolación , y se puede resolver utilizando técnicas de interpolación de Lagrange o Newton , lo que lleva a la fórmula de Sylvester .
Por ejemplo, supongamos que la tarea es encontrar la representación polinómica de
El polinomio característico es p ( x ) = ( x − 1)( x − 3) = x 2 − 4 x + 3 , y los valores propios son λ = 1, 3 . Sea r ( x ) = c 0 + c 1 x . Evaluando f ( λ ) = r ( λ ) en los valores propios, se obtienen dos ecuaciones lineales, e t = c 0 + c 1 y e 3 t = c 0 + 3 c 1 .
Al resolver las ecuaciones se obtiene c 0 = (3 e t − e 3 t )/2 y c 1 = ( e 3 t − e t )/2 . Por lo tanto, se deduce que
Si, en cambio, la función fuera f ( A ) = sin At , entonces los coeficientes habrían sido c 0 = (3 sin t − sin 3 t )/2 y c 1 = (sin 3 t − sin t )/2 ; por lo tanto
Como ejemplo adicional, al considerar entonces el polinomio característico es p ( x ) = x 2 + 1 , y los valores propios son λ = ± i .
Como antes, al evaluar la función en los autovalores obtenemos las ecuaciones lineales e it = c 0 + ic 1 y e − it = c 0 − ic 1 ; cuya solución da c 0 = ( e it + e − it )/2 = cos t y c 1 = ( e it − e − it )/2 i = sin t . Por lo tanto, para este caso, que es una matriz de rotación .
Ejemplos estándar de dicho uso es el mapeo exponencial del álgebra de Lie de un grupo de Lie matricial en el grupo. Está dado por una exponencial matricial , :{\mathfrak {g}}\rightarrow G;\qquad tX\mapsto e^{tX}=\sum _{n=0}^{\infty }{\frac {t^{n}X^{n}}{n!}}=I+tX+{\frac {t^{2}X^{2}}{2}}+\cdots ,t\in \mathbb {R} ,X\in {\mathfrak {g}}.} Tales expresiones se conocen desde hace mucho tiempo para SU(2) , donde las σ son las matrices de Pauli y para SO(3) , que es la fórmula de rotación de Rodrigues . Para la notación, véase el grupo de rotación 3D#A nota sobre álgebras de Lie .
Más recientemente, han aparecido expresiones para otros grupos, como el grupo de Lorentz SO(3, 1) , [ 10 ] O(4, 2) [ 11 ] y SU(2, 2) , [ 12 ] así como GL( n , R ) . [ 13 ] El grupo O(4, 2) es el grupo conforme del espaciotiempo , SU(2, 2) su recubrimiento simplemente conexo (para ser precisos, el recubrimiento simplemente conexo de la componente conexa SO + (4, 2) de O(4, 2) ). Las expresiones obtenidas se aplican a la representación estándar de estos grupos. Requieren el conocimiento de (algunos de) los autovalores de la matriz a exponenciar. Para SU(2) (y por lo tanto para SO(3) ), se han obtenido expresiones cerradas para todas las representaciones irreducibles, es decir, de cualquier espín. [ 14 ]

Teoría algebraica de números
El teorema de Cayley-Hamilton es una herramienta eficaz para calcular el polinomio mínimo de enteros algebraicos . Por ejemplo, dada una extensión finitadey un entero algebraicoque es una combinación lineal no nula de lapodemos calcular el polinomio mínimo deal encontrar una matriz que represente la- transformación lineal :\mathbb {Q} [\alpha _{1},\ldots ,\alpha _{k}]\to \mathbb {Q} [\alpha _{1},\ldots ,\alpha _{k}]} Si llamamos a esta matriz de transformación, entonces podemos encontrar el polinomio mínimo aplicando el teorema de Cayley-Hamilton a. [ 15 ]
Pruebas
El teorema de Cayley-Hamilton es una consecuencia inmediata de la existencia de la forma normal de Jordan para matrices sobre cuerpos algebraicamente cerrados (véase Forma normal de Jordan § Teorema de Cayley-Hamilton) . En esta sección se presentan demostraciones directas.
Como muestran los ejemplos anteriores, obtener el enunciado del teorema de Cayley-Hamilton para unmatriz
requiere dos pasos: primero se determinan los coeficientes c i del polinomio característico mediante el desarrollo como un polinomio en t del determinante
y luego estos coeficientes se utilizan en una combinación lineal de potencias de A que se iguala a lamatriz cero:
El lado izquierdo se puede calcular hasta unUna matriz cuyas entradas son expresiones polinómicas (enormes) en el conjunto de entradas a i , j de A , por lo que el teorema de Cayley-Hamilton establece que cada una de estas n 2 expresiones es igual a 0 . Para cualquier valor fijo de n , estas identidades se pueden obtener mediante manipulaciones algebraicas tediosas pero directas. Sin embargo, ninguno de estos cálculos puede demostrar por qué el teorema de Cayley-Hamilton debería ser válido para matrices de todos los tamaños posibles de n , por lo que se necesita una demostración uniforme para todo n .
Preliminares
Si un vector v de tamaño n es un vector propio de A con valor propio λ , en otras palabras, si A ⋅ v = λv , entonces que es el vector cero ya que p ( λ ) = 0 (los autovalores de A son precisamente las raíces de p ( t ) ). Esto se cumple para todos los posibles autovalores λ , por lo que las dos matrices igualadas por el teorema ciertamente dan el mismo resultado (nulo) cuando se aplican a cualquier autovector. Ahora bien, si A admite una base de autovectores, en otras palabras, si A es diagonalizable , entonces el teorema de Cayley-Hamilton debe cumplirse para A , ya que dos matrices que dan los mismos valores cuando se aplican a cada elemento de una base deben ser iguales.
Consideremos ahora la funciónqué mapasmatrices amatrices dadas por la fórmula, es decir, que toma una matrizy lo inserta en su propio polinomio característico. No todas las matrices son diagonalizables, pero para matrices con coeficientes complejos muchas de ellas sí lo son: el conjuntode matrices cuadradas complejas diagonalizables de un tamaño dado es denso en el conjunto de todas esas matrices cuadradas [ 16 ] (para que una matriz sea diagonalizable basta, por ejemplo, con que su polinomio característico no tenga raíces múltiples ). Ahora visto como una función(ya que las matrices tienenentradas) vemos que esta función es continua . Esto es cierto porque las entradas de la imagen de una matriz están dadas por polinomios en las entradas de la matriz. Dado que
y desde el conjuntoes denso, por continuidad esta función debe mapear todo el conjunto dematrices a la matriz cero. Por lo tanto, el teorema de Cayley-Hamilton es cierto para números complejos y, por consiguiente, también debe cumplirse para- omatrices con valores en .
Si bien esto proporciona una demostración válida, el argumento no es del todo satisfactorio, ya que las identidades representadas por el teorema no dependen en absoluto de la naturaleza de la matriz (diagonalizable o no), ni del tipo de entradas permitidas (para matrices con entradas reales, las diagonalizables no forman un conjunto denso, y parece extraño que haya que considerar matrices complejas para comprobar que el teorema de Cayley-Hamilton se cumple para ellas). Por lo tanto, ahora consideraremos únicamente argumentos que demuestren el teorema directamente para cualquier matriz utilizando solo manipulaciones algebraicas; estos también tienen la ventaja de funcionar para matrices con entradas en cualquier anillo conmutativo .
Existe una gran variedad de demostraciones del teorema de Cayley-Hamilton, de las cuales se presentarán varias aquí. Estas varían en la cantidad de nociones algebraicas abstractas necesarias para su comprensión. Las demostraciones más sencillas emplean únicamente las nociones necesarias para formular el teorema (matrices, polinomios con entradas numéricas, determinantes), pero implican cálculos técnicos que hacen que resulte algo misterioso el hecho de que conduzcan precisamente a la conclusión correcta. Es posible evitar estos detalles, pero a costa de utilizar nociones algebraicas más sutiles: polinomios con coeficientes en un anillo no conmutativo o matrices con tipos de entradas inusuales.
Matrices adjugadas
Todas las demostraciones que siguen utilizan la noción de matriz adjunta adj( M ) de una matriz.matriz M , la transpuesta de su matriz de cofactores . Esta es una matriz cuyos coeficientes están dados por expresiones polinómicas en los coeficientes de M (de hecho, por ciertasdeterminantes), de tal manera que se cumplan las siguientes relaciones fundamentales, Estas relaciones son una consecuencia directa de las propiedades básicas de los determinantes: la evaluación de la entrada ( i , j ) del producto matricial de la izquierda da la expansión por columna j del determinante de la matriz obtenida de M reemplazando la columna i por una copia de la columna j , que es det( M ) si i = j y cero en caso contrario; el producto matricial de la derecha es similar, pero para expansiones por filas.
Al ser consecuencia de la mera manipulación de expresiones algebraicas, estas relaciones son válidas para matrices con entradas en cualquier anillo conmutativo (la conmutatividad debe asumirse para que los determinantes puedan definirse). Es importante destacar esto, ya que estas relaciones se aplicarán más adelante a matrices con entradas no numéricas, como los polinomios.
Una demostración algebraica directa
Esta demostración utiliza precisamente el tipo de objetos necesarios para formular el teorema de Cayley-Hamilton: matrices con polinomios como entradas. La matrizcuyo determinante es el polinomio característico de A es tal matriz, y dado que los polinomios forman un anillo conmutativo, tiene un adjugado Entonces, según la relación fundamental derecha del adjugado, se tiene
Dado que B también es una matriz con polinomios en t como entradas, se puede, para cada i , recopilar los coeficientes deen cada entrada para formar una matriz B i de números, de tal manera que se tenga (La forma en que se definen las entradas de B deja claro que no aparecen potencias superiores a t n −1 ). Si bien esto parece un polinomio con matrices como coeficientes, no consideraremos tal noción; es simplemente una forma de escribir una matriz con entradas polinómicas como una combinación lineal de n matrices constantes, y el coeficienteSe ha escrito a la izquierda de la matriz para enfatizar este punto de vista.
Ahora, podemos expandir el producto matricial en nuestra ecuación:
Escribiendo Se obtiene una igualdad de dos matrices con entradas polinómicas, escritas como combinaciones lineales de matrices constantes con potencias de t como coeficientes.
Dicha igualdad solo puede cumplirse si en cualquier posición de la matriz la entrada que se multiplica por una potencia dada es igual a cero.es lo mismo en ambos lados; por lo tanto, las matrices constantes con coeficienteEn ambas expresiones debe ser igual. Escribiendo estas ecuaciones para i desde n hasta 0, se obtiene:
Finalmente, multiplica la ecuación de los coeficientes dedesde la izquierda pory resumir:
Los lados izquierdos forman una suma telescópica y se cancelan completamente; los lados derechos suman: Con esto concluye la demostración.
Una demostración mediante polinomios con coeficientes matriciales.
Esta demostración es similar a la primera, pero intenta dar sentido a la noción de polinomio con coeficientes matriciales sugerida por las expresiones que aparecen en dicha demostración. Esto requiere un cuidado considerable, ya que es algo inusual considerar polinomios con coeficientes en un anillo no conmutativo, y no todo el razonamiento válido para polinomios conmutativos puede aplicarse en este contexto.
Cabe destacar que, si bien la aritmética de polinomios sobre un anillo conmutativo modela la aritmética de funciones polinómicas , esto no ocurre sobre un anillo no conmutativo (de hecho, en este caso no existe una noción obvia de función polinómica que sea cerrada bajo la multiplicación). Por lo tanto, al considerar polinomios en t con coeficientes matriciales, la variable t no debe considerarse como una incógnita, sino como un símbolo formal que debe manipularse según reglas dadas; en particular, no se puede simplemente asignar a t un valor específico.
DejarSea el anillo de matrices n × n con entradas en algún anillo R (como los números reales o complejos) que tiene a A como elemento. Matrices con coeficientes polinomios en t , comoo su adjugado B en la primera demostración, son elementos de.
Al agrupar potencias semejantes de t , dichas matrices se pueden escribir como "polinomios" en t con matrices constantes como coeficientes; escribirpara el conjunto de tales polinomios. Dado que este conjunto está en biyección con, se definen operaciones aritméticas sobre él de forma correspondiente, en particular la multiplicación viene dada por respetando el orden de las matrices de coeficientes de los dos operandos; obviamente esto da como resultado una multiplicación no conmutativa.
Por lo tanto, la identidad a partir de la primera prueba puede verse como una que implica una multiplicación de elementos en.
En este punto, resulta tentador simplemente igualar t a la matriz A , lo que hace que el primer factor de la izquierda sea igual a la matriz cero y el lado derecho igual a p ( A ) ; sin embargo, esta no es una operación permitida cuando los coeficientes no conmutan. Es posible definir una "aplicación de evaluación derecha" ev A : M [ t ] → M , que reemplaza cada t i por la potencia matricial A i de A , donde se estipula que la potencia siempre debe multiplicarse por la derecha por el coeficiente correspondiente. Pero esta aplicación no es un homomorfismo de anillos : la evaluación derecha de un producto difiere en general del producto de las evaluaciones derechas. Esto se debe a que la multiplicación de polinomios con coeficientes matriciales no modela la multiplicación de expresiones que contienen incógnitas: un productose define asumiendo que t conmuta con N , pero esto puede fallar si t se reemplaza por la matriz A.
En la situación particular que nos ocupa, se puede sortear esta dificultad, ya que la aplicación de evaluación derecha anterior se convierte en un homomorfismo de anillo si la matriz A está en el centro del anillo de coeficientes, de modo que conmuta con todos los coeficientes de los polinomios (el argumento que demuestra esto es sencillo, precisamente porque la conmutación de t con los coeficientes ahora está justificada después de la evaluación).
Ahora bien, A no siempre está en el centro de M , pero podemos reemplazar M con un anillo más pequeño siempre que contenga todos los coeficientes de los polinomios en cuestión:, A y los coeficientesdel polinomio B. La elección obvia para tal subanillo es el centralizador Z de A , el subanillo de todas las matrices que conmutan con A ; por definición, A está en el centro de Z.
Este centralizador obviamente contieney A , pero hay que demostrar que contiene las matricesPara ello, se combinan las dos relaciones fundamentales para los adjugados, escribiendo el adjugado B como un polinomio:
Igualando los coeficientes se observa que para cada i , tenemos AB i = B i A como se deseaba. Habiendo encontrado el contexto adecuado en el que ev A es efectivamente un homomorfismo de anillos, se puede completar la demostración como se sugirió anteriormente: Con esto concluye la demostración.
Una síntesis de las dos primeras pruebas
En la primera demostración, se pudieron determinar los coeficientes B i de B basándose únicamente en la relación fundamental de la derecha para el adjugado. De hecho, las primeras n ecuaciones derivadas pueden interpretarse como la determinación del cociente B de la división euclidiana del polinomio p ( t ) I n por la izquierda por el polinomio mónico I n t − A , mientras que la ecuación final expresa que el resto es cero. Esta división se realiza en el anillo de polinomios con coeficientes matriciales. En efecto, incluso sobre un anillo no conmutativo, la división euclidiana por un polinomio mónico P está definida y siempre produce un cociente y un resto únicos con la misma condición de grado que en el caso conmutativo, siempre que se especifique en qué lado se desea que P sea un factor (en este caso, a la izquierda).
Para comprobar que el cociente y el resto son únicos (que es la parte importante de la afirmación), basta con escribircomoy observe que, dado que P es mónico, P ( Q − Q ′) no puede tener un grado menor que el de P , a menos que Q = Q ′ .
Pero el dividendo p ( t ) I n y el divisor I n t − A utilizados aquí se encuentran ambos en el subanillo ( R [ A ])[ t ] , donde R [ A ] es el subanillo del anillo de matrices M ( n , R ) generado por A : el espacio R - lineal generado por todas las potencias de A . Por lo tanto, la división euclidiana puede realizarse de hecho dentro de ese anillo de polinomios conmutativos , y por supuesto da entonces el mismo cociente B y resto 0 que en el anillo más grande; en particular esto muestra que B de hecho se encuentra en ( R [ A ])[ t ] .
Pero, en este contexto conmutativo, es válido establecer t como A en la ecuación.
En otras palabras, aplicar el mapa de evaluación
que es un homomorfismo de anillos, dando
igual que en la segunda prueba, como se deseaba.
Además de demostrar el teorema, el argumento anterior nos dice que los coeficientes B i de B son polinomios en A , mientras que de la segunda demostración solo sabíamos que se encuentran en el centralizador Z de A ; en general, Z es un subanillo mayor que R [ A ] , y no necesariamente conmutativo. En particular, el término constante B 0 = adj(− A ) se encuentra en R [ A ] . Dado que A es una matriz cuadrada arbitraria, esto prueba que adj( A ) siempre puede expresarse como un polinomio en A (con coeficientes que dependen de A ) .
De hecho, las ecuaciones encontradas en la primera demostración permiten expresar sucesivamentecomo polinomios en A , lo que lleva a la identidad
válido para todas las matrices n × n , donde es el polinomio característico de A.
Nótese que esta identidad también implica el enunciado del teorema de Cayley-Hamilton: se puede mover adj(− A ) al lado derecho, multiplicar la ecuación resultante (a la izquierda o a la derecha) por A y usar el hecho de que
Una demostración utilizando matrices de endomorfismos
Como se mencionó anteriormente, la matriz p ( A ) en el enunciado del teorema se obtiene evaluando primero el determinante y luego sustituyendo la matriz A por t ; haciendo esa sustitución en la matrizantes de evaluar el determinante no tiene sentido. Sin embargo, es posible dar una interpretación donde p ( A ) se obtiene directamente como el valor de un cierto determinante, pero esto requiere un entorno más complicado, uno de matrices sobre un anillo en el que se pueden interpretar ambas entradas.de A y todo A mismo. Se podría tomar para esto el anillo M ( n , R ) de matrices n × n sobre R , donde la entradase realiza comoy A como sí misma. Pero considerar matrices con matrices como entradas podría causar confusión con matrices de bloques , lo cual no es la intención, ya que eso da una noción errónea de determinante (recordemos que el determinante de una matriz se define como la suma de productos de sus entradas, y en el caso de una matriz de bloques, esto generalmente no es lo mismo que la suma correspondiente de productos de sus bloques). Es más claro distinguir A del endomorfismo φ de un espacio vectorial n - dimensional V (o R -módulo libre si R no es un cuerpo) definido por él en una basey tomar matrices sobre el anillo End( V ) de todos esos endomorfismos. Entonces φ ∈ End( V ) es una posible entrada de matriz, mientras que A designa el elemento de M ( n , End( V )) cuya entrada i , j es un endomorfismo de multiplicación escalar por; similarmentese interpretará como un elemento de M ( n , End( V )) . Sin embargo, dado que End( V ) no es un anillo conmutativo, no se define ningún determinante en M ( n , End( V )) ; esto solo se puede hacer para matrices sobre un subanillo conmutativo de End( V ) . Ahora las entradas de la matriztodos se encuentran en el subanillo R [ φ ] generado por la identidad y φ , que es conmutativo. Entonces se define una aplicación determinante M ( n , R [ φ ]) → R [ φ ] , yse evalúa al valor p ( φ ) del polinomio característico de A en φ (esto se cumple independientemente de la relación entre A y φ ); el teorema de Cayley-Hamilton establece que p ( φ ) es el endomorfismo nulo.
De esta forma, la siguiente demostración se puede obtener de la de Atiyah y MacDonald (1969 , Prop. 2.4) (que de hecho es la afirmación más general relacionada con el lema de Nakayama ; en esa proposición se toma por ideal todo el anillo R ). El hecho de que A sea la matriz de φ en la base e 1 , ..., e n significa que Se pueden interpretar como n componentes de una ecuación en V n , cuyos miembros se pueden escribir usando el producto matriz-vector M ( n , End( V )) × V n → V n que se define como usualmente, pero con entradas individuales ψ ∈ End( V ) y v en V siendo "multiplicadas" por formando; esto da como resultado: dóndees el elemento cuyo componente i es e i (en otras palabras, es la base e 1 , ..., e n de V escrita como una columna de vectores). Escribiendo esta ecuación como uno reconoce la transpuesta de la matrizconsiderado anteriormente, y su determinante (como elemento de M ( n , R [ φ ])) también es p ( φ ). Para derivar de esta ecuación que p ( φ ) = 0 ∈ End( V ) , se multiplica por la izquierda por la matriz adjugada de, que se define en el anillo matricial M ( n , R [ φ ]) , dando como resultado La asociatividad de la multiplicación matriz-matriz y matriz-vector utilizada en el primer paso es una propiedad puramente formal de esas operaciones, independiente de la naturaleza de las entradas. Ahora bien, el componente i de esta ecuación dice que p ( φ )( e i ) = 0 ∈ V ; por lo tanto, p ( φ ) se anula en todos los e i , y dado que estos elementos generan V, se deduce que p ( φ ) = 0 ∈ End( V ) , completando así la demostración.
Un hecho adicional que se desprende de esta demostración es que la matriz A cuyo polinomio característico se toma no tiene por qué ser idéntica al valor φ sustituido en ese polinomio; basta con que φ sea un endomorfismo de V que satisfaga las ecuaciones iniciales.
para alguna secuencia de elementos e 1 , ..., e n que generan V (cuyo espacio podría tener una dimensión menor que n , o en caso de que el anillo R no sea un cuerpo, podría no ser un módulo libre en absoluto).
Una "prueba" falsa: p ( A ) = det( AI n − A ) = det( A − A ) = 0
Un argumento elemental pero incorrecto persistente [ 17 ] para el teorema es "simplemente" tomar la definición y sustituir A por λ , obteniendo
Hay muchas maneras de ver por qué este argumento es erróneo. Primero, en el teorema de Cayley-Hamilton, p ( A ) es una matriz n × n . Sin embargo, el lado derecho de la ecuación anterior es el valor de un determinante, que es un escalar . Por lo tanto, no se pueden igualar a menos que n = 1 (es decir, A es solo un escalar). Segundo, en la expresiónLa variable λ aparece en realidad en las entradas diagonales de la matriz.Para ilustrarlo, consideremos nuevamente el polinomio característico del ejemplo anterior:
Si se sustituye la matriz A completa por λ en esas posiciones, se obtiene
en la que la expresión "matriz" simplemente no es válida. Sin embargo, tenga en cuenta que si se restan múltiplos escalares de matrices identidad en lugar de escalares en lo anterior, es decir, si la sustitución se realiza como
entonces el determinante es efectivamente cero, pero la matriz expandida en cuestión no se evalúa a; ni su determinante (un escalar) puede compararse con p ( A ) (una matriz). Por lo tanto, el argumento de queTodavía no aplica.
En realidad, si tal argumento es válido, también debería serlo cuando se utilizan otras formas multilineales en lugar del determinante. Por ejemplo, si consideramos la función permanente y definimos, entonces, por el mismo argumento, deberíamos poder "probar" que q ( A ) = 0 . Pero esta afirmación es demostrablemente errónea: en el caso bidimensional, por ejemplo, el permanente de una matriz viene dado por
Entonces, para la matriz A del ejemplo anterior,
Sin embargo, se puede verificar que
Una de las demostraciones del teorema de Cayley-Hamilton anterior guarda cierta similitud con el argumento de queAl introducir una matriz con coeficientes no numéricos, se puede permitir que A viva dentro de una entrada de la matriz, pero entonces...no es igual a A , y la conclusión se alcanza de manera diferente.
Demostraciones mediante métodos de álgebra abstracta
Propiedades básicas de las derivaciones de Hasse-Schmidt en el álgebra exteriorGatto y Salehyan (2016 , §4) han utilizado algunos módulos B - M (que se suponen libres y de rango finito) para demostrar el teorema de Cayley-Hamilton. Véase también Gatto y Scherbak (2015) .
Una prueba combinatoria
Straubing [ 18 ] dio una demostración basada en el desarrollo de la fórmula de Leibniz para el polinomio característico y Foata y Cartier dieron una generalización utilizando la teoría del monoide de traza .
Abstracción y generalizaciones
Las demostraciones anteriores muestran que el teorema de Cayley-Hamilton se cumple para matrices con entradas en cualquier anillo conmutativo R , y que p ( φ ) = 0 se cumplirá siempre que φ sea un endomorfismo de un R -módulo generado por elementos e1 ,..., en que satisface
Esta versión más general del teorema es la fuente del célebre lema de Nakayama en álgebra conmutativa y geometría algebraica .
El teorema de Cayley-Hamilton también se cumple para matrices sobre los cuaterniones , un anillo no conmutativo . [ 19 ] [ nb 3 ]
Véase también
Observaciones
- ↑ Véase la sección 2 de Krivoruchenko (2016) . Kondratyuk y Krivoruchenko (1992) proporcionanuna expresión explícita para los coeficientes c i : donde la suma se toma sobre los conjuntos de todas las particiones enteras k l ≥ 0 que satisfacen la ecuación
- ↑ Véase, por ejemplo, la página 54 de Brown 1994 , que resuelve la fórmula de Jacobi , donde B es la matriz adjunta de la siguiente sección. También existe un algoritmo recursivo equivalente y relacionado introducido por Urbain Le Verrier y Dmitry Konstantinovich Faddeev —el algoritmo de Faddeev-LeVerrier— que se lee (véase, por ejemplo, Gantmacher 1960 , p. 88. ) Obsérvese A −1 = − M n / c 0 cuando termina la recursión. Véase la demostración algebraica en la siguiente sección, que se basa en los modos del adjugado, B k ≡ M n − k . Específicamente, y la derivada anterior de p cuando se traza produce ( Hou 1998 ), y las recursiones anteriores, a su vez.
- ↑ Debido a la naturaleza no conmutativa de la operación de multiplicación para cuaterniones y construcciones relacionadas, es necesario tener cuidado con las definiciones, especialmente en este contexto, para el determinante. El teorema también se cumple para los cuaterniones divididos ligeramente menos bien comportados , véase Alagös, Oral y Yüce (2012) . Los anillos de cuaterniones y cuaterniones divididos pueden representarse mediante ciertas matrices complejas de 2 × 2. (Cuando se restringe a la norma unitaria, estos son los grupos SU(2) y SU(1,1) respectivamente). Por lo tanto, no es sorprendente que el teorema se cumpla.No existe tal representación matricial para los octoniones , ya que la operación de multiplicación no es asociativa en este caso. Sin embargo, un teorema de Cayley-Hamilton modificado todavía se cumple para los octoniones, véase Tian (2000) .
Notas
- 1 2 Crilly 1998
- 1 2 Hamilton 1864a
- 1 2 Hamilton 1864b
- 1 2 Hamilton 1862
- ↑ Atiyah y MacDonald 1969
- ↑ Hamilton 1853 , pág. 562
- ↑ Cayley 1858 , págs. 17–37
- ↑ Cayley 1889 , págs. 475–496
- 1 2 Frobenius 1878
- ↑ Zeni y Rodrigues 1992
- ^ Barut, Zeni y Laufer 1994a
- ^ Barut, Zeni y Laufer 1994b
- ↑ Laufer 1997
- ↑ Curtright, Fairlie y Zachos 2014
- ↑ Stein, William. Teoría algebraica de números, un enfoque computacional (PDF) . pág. 29.
- ↑ Bhatia 1997 , pág. 7
- ↑ Garrett 2007 , pág. 381
- ↑ Straubing, Howard (1983-01-01). "Una demostración combinatoria del teorema de Cayley-Hamilton" . Matemáticas Discretas . 43 (2): 273– 279. doi : 10.1016/0012-365X(83)90164-4 . ISSN 0012-365X .
- ↑ Zhang 1997
Referencias
- Alagös, Y.; Oral, K.; Yüce, S. (2012). "Matrices de cuaterniones divididos" . Miskolc Mathematical Notes . 13 (2): 223– 232. doi : 10.18514/MMN.2012.364 . ISSN 1787-2405 (acceso abierto)
- Atiyah, MF ; MacDonald, IG (1969), Introducción al álgebra conmutativa , Westview Press, ISBN 978-0-201-40751-8
- Barut, AO ; Zeni, JR; Laufer, A. (1994a). "El mapa exponencial para el grupo conforme O(2,4)". J. Phys. A: Math. Gen. 27 ( 15): 5239– 5250. arXiv : hep-th/9408105 . Bibcode : 1994JPhA...27.5239B . doi : 10.1088/0305-4470/27/15/022 .
- Barut, AO ; Zeni, JR; Laufer, A. (1994b). "El mapa exponencial para el grupo unitario SU(2,2)". J. Phys. A: Math. Gen. 27 ( 20): 6799– 6806. arXiv : hep-th/9408145 . Bibcode : 1994JPhA...27.6799B . doi : 10.1088/0305-4470/27/20/017 . S2CID 16495633 .
- Bhatia, R. (1997). Análisis matricial . Textos de posgrado en matemáticas. Vol. 169. Springer. ISBN 978-0387948461.
- Brown, Lowell S. (1994). Teoría cuántica de campos . Cambridge University Press . ISBN 978-0-521-46946-3.
- Cayley, A. (1858). "Una memoria sobre la teoría de las matrices". Philos. Trans . 148 : 17. Bibcode : 1858RSPT..148...17C .
- Cayley, A. (1889). The Collected Mathematical Papers of Arthur Cayley . (Classic Reprint). Vol. 2. Forgotten books. ASIN B008HUED9O .
- Crilly, T. (1998). "El joven Arthur Cayley". Notes Rec. R. Soc. Lond . 52 (2): 267– 282. doi : 10.1098/rsnr.1998.0050 . S2CID 146669911 .
- Curtright, TL ; Fairlie, DB ; Zachos, CK (2014). "Una fórmula compacta para rotaciones como polinomios de matriz de espín". SIGMA . 10 (2014): 084. arXiv : 1402.3541 . Bibcode : 2014SIGMA..10..084C . doi : 10.3842/SIGMA.2014.084 . S2CID 18776942 .
- Frobenius, G. (1878). "Ueber lineare Substutionen und bilineare Formen" . J. Reina Angew. Matemáticas . 1878 (84): 1–63 .
- Gantmacher, FR (1960). La teoría de las matrices . Nueva York: Chelsea Publishing. ISBN 978-0-8218-1376-8.
{{cite book}}: Incompatibilidad de ISBN/Fecha ( ayuda ) - Gatto, Letterio; Salehyan, Parham (2016), Derivaciones de Hasse-Schmidt sobre álgebras de Grassmann , Springer, doi : 10.1007/978-3-319-31842-4 , ISBN 978-3-319-31842-4, MR 3524604
- Gatto, Letterio; Scherbak, Inna (2015), Observaciones sobre el teorema de Cayley-Hamilton , arXiv : 1510.03022
- Garrett, Paul B. (2007). Álgebra abstracta . Nueva York: Chapman and Hall/CRC. ISBN 978-1584886891.
- Hamilton, WR (1853). Lecciones sobre cuaterniones . Dublín.
{{cite book}}: CS1 mantenimiento: falta el editor de ubicación ( enlace ) - Hamilton, WR (1864a). "Sobre un método nuevo y general para invertir una función lineal y cuaterniónica de un cuaternión". Actas de la Real Academia Irlandesa . viii : 182–183 .(Comunicado el 9 de junio de 1862)
- Hamilton, WR (1864b). "Sobre la existencia de una ecuación simbólica y bicuadrática, que es satisfecha por el símbolo de operación lineal en cuaterniones". Actas de la Real Academia Irlandesa . viii : 190–101 .(Comunicado el 23 de junio de 1862)
- Hou, SH (1998). "Nota de clase: Una demostración sencilla del algoritmo del polinomio característico de Leverrier-Faddeev". SIAM Review . 40 (3): 706– 709. Bibcode : 1998SIAMR..40..706H . doi : 10.1137/S003614459732076X ."Apuntes de clase: Una demostración sencilla del algoritmo del polinomio característico de Leverrier-Faddeev"
- Hamilton, WR (1862). "Sobre la existencia de una ecuación simbólica y bicuadrática que satisface el símbolo de la operación lineal o distributiva sobre un cuaternión" . The London, Edinburgh, and Dublin Philosophical Magazine and Journal of Science . Serie IV . 24 : 127–128 . ISSN 1478-6435 . Consultado el 14 de febrero de 2015 .
- Householder, Alston S. (2006). La teoría de las matrices en el análisis numérico . Dover Books on Mathematics. ISBN 978-0486449722.
- Krivoruchenko, MI (2016). "Identidades de traza para matrices antisimétricas". arXiv : 1605.00447 [ math-ph ].
- Kondratyuk, LA; Krivoruchenko, MI (1992). "Materia de quarks superconductores en el grupo de colores SU (2)". Zeitschrift für Physik A. 344 (1): 99– 115. Código Bib : 1992ZPhyA.344...99K . doi : 10.1007/BF01291027 . S2CID 120467300 .
- Laufer, A. (1997). "El mapa exponencial de GL(N)". J. Phys. A: Math. Gen . 30 (15): 5455– 5470. arXiv : hep-th/9604049 . Bibcode : 1997JPhA...30.5455L . doi : 10.1088/0305-4470/30/15/029 . S2CID 10699434 .
- Tian, Y. (2000). "Representaciones matriciales de octoniones y su aplicación". Advances in Applied Clifford Algebras . 10 (1): 61– 90. arXiv : math/0003166 . Bibcode : 2000math......3166T . CiteSeerX 10.1.1.237.2217 . doi : 10.1007/BF03042010 . ISSN 0188-7009 . S2CID 14465054 .
- Zeni, JR; Rodrigues, WA (1992). "Un estudio reflexivo de las transformaciones de Lorentz mediante álgebras de Clifford". Int. J. Mod. Phys. A . 7 (8): 1793 pp. Bibcode : 1992IJMPA...7.1793Z . doi : 10.1142/S0217751X92000776 .
- Zhang, F. (1997). "Cuaterniones y matrices de cuaterniones" . Álgebra lineal y sus aplicaciones . 251 : 21–57 . doi : 10.1016/0024-3795(95)00543-9 . ISSN 0024-3795 (archivo abierto).
Enlaces externos
- "Teorema de Cayley-Hamilton" , Enciclopedia de Matemáticas , EMS Press, 2001 [1994]
- Una demostración de PlanetMath.
- El teorema de Cayley-Hamilton en MathPages
- Teoremas de álgebra lineal
- teoría matricial
- William Rowan Hamilton