Articulo de referencia

cálculo matricial

En matemáticas , el cálculo matricial es una notación especializada para realizar cálculos multivariables , especialmente sobre espacios de matrices . Agrupa las diversas deriva...

En matemáticas , el cálculo matricial es una notación especializada para realizar cálculos multivariables , especialmente sobre espacios de matrices . Agrupa las diversas derivadas parciales de una función con respecto a múltiples variables , o de una función multivariable con respecto a una sola variable, en vectores y matrices que pueden tratarse como entidades únicas. Esto simplifica enormemente operaciones como encontrar el máximo o el mínimo de una función multivariable y resolver sistemas de ecuaciones diferenciales . La notación aquí empleada se usa comúnmente en estadística e ingeniería , mientras que la notación de índices tensoriales se prefiere en física .

Dos convenciones de notación contrapuestas dividen el campo del cálculo matricial en dos grupos distintos. Estos grupos se distinguen por si escriben la derivada de un escalar con respecto a un vector como un vector columna o como un vector fila . Ambas convenciones son posibles incluso cuando se asume comúnmente que los vectores deben tratarse como vectores columna al combinarse con matrices (en lugar de vectores fila). Una única convención puede ser relativamente estándar en un campo que utiliza comúnmente el cálculo matricial (por ejemplo, econometría , estadística, teoría de la estimación y aprendizaje automático ). Sin embargo, incluso dentro de un mismo campo, se pueden encontrar diferentes autores que utilizan convenciones contrapuestas. Los autores de ambos grupos suelen escribir como si sus convenciones específicas fueran estándar. Se pueden producir errores graves al combinar resultados de diferentes autores sin verificar cuidadosamente que se hayan utilizado notaciones compatibles. Las definiciones de estas dos convenciones y las comparaciones entre ellas se recogen en la sección de convenciones de formato .

Alcance

El cálculo matricial se refiere a diversas notaciones que utilizan matrices y vectores para obtener la derivada de cada componente de la variable dependiente con respecto a cada componente de la variable independiente. En general, la variable independiente puede ser un escalar, un vector o una matriz, mientras que la variable dependiente también puede ser cualquiera de estos. Cada situación requiere un conjunto diferente de reglas o un cálculo distinto , en el sentido más amplio del término. La notación matricial sirve como una forma práctica de organizar las múltiples derivadas.

Como primer ejemplo, consideremos el gradiente del cálculo vectorial . Para una función escalar de tres variables independientes,F(incógnita1,incógnita2,incógnita3){\displaystyle f(x_{1},x_{2},x_{3})}, el gradiente viene dado por la ecuación vectorial

F=Fincógnita1incógnita^1+Fincógnita2incógnita^2+Fincógnita3incógnita^3,{\displaystyle \nabla f={\frac {\partial f}{\partial x_{1}}}{\hat {x}}_{1}+{\frac {\partial f}{\partial x_{2}}}{\hat {x}}_{2}+{\frac {\partial f}{\partial x_{3}}}{\hat {x}}_{3},}

dóndeincógnita^i{\displaystyle {\hat {x}}_{i}}representa un vector unitario en elincógnitai{\displaystyle x_{i}}dirección para1i3{\displaystyle 1\leq i\leq 3}. Este tipo de derivada generalizada puede verse como la derivada de un escalar, f , con respecto a un vector,incógnita{\displaystyle \mathbf {x} }y su resultado se puede recopilar fácilmente en forma vectorial.

F=(Fincógnita)T=[Fincógnita1Fincógnita2Fincógnita3]T.{\displaystyle \nabla f=\left({\frac {\partial f}{\partial \mathbf {x} }}\right)^{\mathsf {T}}={\begin{bmatrix}{\dfrac {\partial f}{\partial x_{1}}}&{\dfrac {\partial f}{\partial x_{2}}}&{\dfrac {\partial f}{\partial x_{3}}}\\\end{bmatrix}}^{\textsf {T}}.}

Ejemplos más complejos incluyen la derivada de una función escalar con respecto a una matriz, conocida como matriz gradiente , que recoge la derivada con respecto a cada elemento de la matriz en la posición correspondiente de la matriz resultante. En ese caso, el escalar debe ser una función de cada una de las variables independientes de la matriz. Como otro ejemplo, si tenemos un vector de n variables dependientes, o funciones de m variables independientes, podríamos considerar la derivada del vector dependiente con respecto al vector independiente. El resultado podría recogerse en una matriz de m × n que contenga todas las combinaciones posibles de derivadas.

Existen un total de nueve posibilidades utilizando escalares, vectores y matrices. Nótese que, al considerar un mayor número de componentes en cada una de las variables independientes y dependientes, podemos obtener un número muy grande de posibilidades. Los seis tipos de derivadas que se pueden organizar de forma más ordenada en forma matricial se recogen en la siguiente tabla. [ 1 ]

Aquí, hemos utilizado el término «matriz» en su sentido más general, reconociendo que los vectores son simplemente matrices con una columna (y los escalares son simplemente vectores con una fila). Además, hemos utilizado letras en negrita para indicar vectores y letras mayúsculas en negrita para matrices. Esta notación se mantiene a lo largo de todo el texto.

Nótese que también podríamos hablar de la derivada de un vector con respecto a una matriz, o a cualquiera de las demás celdas vacías de nuestra tabla. Sin embargo, estas derivadas se organizan de forma más natural en un tensor de rango superior a 2, por lo que no se ajustan perfectamente a una matriz. En las siguientes tres secciones definiremos cada una de estas derivadas y las relacionaremos con otras ramas de las matemáticas. Consulte la sección de convenciones de formato para ver una tabla más detallada.

Relación con otros derivados

La derivada matricial es una notación conveniente para llevar el control de las derivadas parciales en los cálculos. La derivada de Fréchet es la forma estándar en el análisis funcional de calcular derivadas con respecto a vectores. Si una función matricial de una matriz es diferenciable en el sentido de Fréchet, ambas derivadas coincidirán salvo por una traducción de notaciones. Como ocurre en general con las derivadas parciales , algunas fórmulas pueden extenderse bajo condiciones analíticas más débiles que la existencia de la derivada como una aproximación lineal.

Usos

El cálculo matricial se utiliza para derivar estimadores estocásticos óptimos, a menudo mediante el uso de multiplicadores de Lagrange . Esto incluye la derivación de:

Notación

Las derivadas vectoriales y matriciales presentadas en las secciones siguientes aprovechan al máximo la notación matricial , utilizando una sola variable para representar un gran número de variables. A continuación, distinguiremos escalares, vectores y matrices por su tipografía. Denotaremos por M ( n , m ) el espacio de matrices reales n × m con n filas y m columnas. Dichas matrices se denotarán con letras mayúsculas en negrita: A , X , Y , etc. Un elemento de M ( n , 1) , es decir, un vector columna , se denota con una letra minúscula en negrita: a , x , y , etc. Un elemento de M (1, 1) es un escalar, denotado con una letra minúscula en cursiva: a , t , x , etc. XT denota la transpuesta de la matriz , tr( X ) es la traza y det( X ) o | X | es el determinante . Se asume que todas las funciones son de clase de diferenciabilidad C1 , a menos que se indique lo contrario. Generalmente, se usarán letras de la primera mitad del alfabeto (a, b, c, ...) para denotar constantes y de la segunda mitad (t, x, y, ...) para denotar variables.

NOTA : Como se mencionó anteriormente, existen notaciones alternativas para representar sistemas de derivadas parciales en vectores y matrices, y aún no parece haber un estándar establecido. Las dos secciones introductorias siguientes utilizan la convención de numeración simplemente por conveniencia, para evitar complicar demasiado la explicación. La sección posterior analiza las convenciones de representación con mayor detalle. Es importante tener en cuenta lo siguiente:

  1. A pesar de que se utilizan los términos "disposición del numerador" y "disposición del denominador", en realidad existen más de dos opciones de notación posibles. Esto se debe a que la elección entre numerador y denominador (o, en algunos casos, entre numerador y una combinación de ambos) puede realizarse de forma independiente para derivadas escalar-vector, vector-escalar, vector-vector y escalar-matriz, y varios autores combinan sus opciones de disposición de diversas maneras.
  2. La elección del formato del numerador en las secciones introductorias siguientes no implica que sea la opción "correcta" o "superior". Los distintos formatos tienen ventajas y desventajas. Combinar fórmulas escritas en formatos diferentes sin cuidado puede provocar errores graves, y la conversión de un formato a otro requiere precaución para evitar errores. Por lo tanto, al trabajar con fórmulas existentes, lo más recomendable es identificar el formato utilizado y mantener la coherencia, en lugar de intentar usar el mismo formato en todas las situaciones.

Alternativas

La notación de índices tensoriales con su convención de suma de Einstein es muy similar al cálculo matricial, excepto que solo se escribe un componente a la vez. Tiene la ventaja de que se pueden manipular fácilmente tensores de rango arbitrariamente alto, mientras que los tensores de rango superior a dos resultan bastante difíciles de manejar con la notación matricial. Todo el trabajo aquí presentado puede realizarse con esta notación sin utilizar la notación matricial de una sola variable. Sin embargo, muchos problemas en teoría de la estimación y otras áreas de las matemáticas aplicadas generarían demasiados índices difíciles de controlar adecuadamente, lo que favorece el cálculo matricial en esas áreas. Además, la notación de Einstein puede ser muy útil para demostrar las identidades presentadas aquí (véase la sección sobre diferenciación ) como alternativa a la notación de elementos típica, que puede volverse engorrosa cuando se manejan sumas explícitas. Cabe señalar que una matriz puede considerarse un tensor de rango dos.

Derivadas con vectores

Dado que los vectores son matrices con una sola columna, las derivadas matriciales más simples son derivadas vectoriales.

Las notaciones desarrolladas aquí permiten realizar las operaciones habituales del cálculo vectorial identificando el espacio M ( n ,1) de n vectores con el espacio euclidiano Rⁿ , y el escalar M (1,1) se identifica con R. El concepto correspondiente del cálculo vectorial se indica al final de cada subsección.

NOTA : En esta sección se utiliza la convención de numeración con fines pedagógicos. Algunos autores emplean convenciones diferentes. La sección sobre convenciones de formato aborda este tema con mayor detalle. Las identidades que se presentan más adelante se muestran en formatos compatibles con todas las convenciones de formato habituales.

Vector por escalar

La derivada de un vectory=[y1y2ymetro]T{\displaystyle \mathbf {y} ={\begin{bmatrix}y_{1}&y_{2}&\cdots &y_{m}\end{bmatrix}}^{\mathsf {T}}}, por un escalar x se escribe (en notación de numerador ) como

dydincógnita=[dy1dincógnitady2dincógnitadymetrodincógnita].{\displaystyle {\frac {d\mathbf {y} }{dx}}={\begin{bmatrix}{\frac {dy_{1}}{dx}}\\{\frac {dy_{2}}{dx}}\\\vdots \\{\frac {dy_{m}}{dx}}\\\end{bmatrix}}.}

En cálculo vectorial, la derivada de un vector y con respecto a un escalar x se conoce como el vector tangente del vector y .yincógnita{\displaystyle {\frac {\partial \mathbf {y} }{\partial x}}}. Nótese aquí que y : R 1R m .

Ejemplo: Algunos ejemplos sencillos de esto incluyen el vector velocidad en el espacio euclidiano , que es el vector tangente del vector posición (considerado como una función del tiempo). Asimismo, la aceleración es el vector tangente de la velocidad.

Escalar por vector

La derivada de un escalar y por un vectorincógnita=[incógnita1incógnita2incógnitanorte]{\displaystyle \mathbf {x} ={\begin{bmatrix}x_{1}&x_{2}&\cdots &x_{n}\end{bmatrix}}}, se escribe (en notación de numerador ) como

yincógnita=[yincógnita1yincógnita2yincógnitanorte].{\displaystyle {\frac {\partial y}{\partial \mathbf {x} }}={\begin{bmatrix}{\dfrac {\partial y}{\partial x_{1}}}&{\dfrac {\partial y}{\partial x_{2}}}&\cdots &{\dfrac {\partial y}{\partial x_{n}}}\end{bmatrix}}.}

En cálculo vectorial , el gradiente de un campo escalar f  : R nR (cuyas coordenadas independientes son las componentes de x ) es la transpuesta de la derivada de un escalar por un vector.

F=[Fincógnita1Fincógnitanorte]=(Fincógnita)T{\displaystyle \nabla f={\begin{bmatrix}{\frac {\partial f}{\partial x_{1}}}\\\vdots \\{\frac {\partial f}{\partial x_{n}}}\end{bmatrix}}=\left({\frac {\partial f}{\partial \mathbf {x} }}\right)^{\mathsf {T}}}

Por ejemplo, en física, el campo eléctrico es el gradiente vectorial negativo del potencial eléctrico .

La derivada direccional de una función escalar f ( x ) del vector espacial x en la dirección del vector unitario u (representado en este caso como un vector columna) se define utilizando el gradiente de la siguiente manera.

F(incógnita)=F(incógnita){\displaystyle \nabla _{\mathbf {u} }{f}(\mathbf {x} )=\nabla f(\mathbf {x} )\cdot \mathbf {u} }

Utilizando la notación que acabamos de definir para la derivada de un escalar con respecto a un vector, podemos reescribir la derivada direccional como F=Fincógnita.{\displaystyle \nabla _{\mathbf {u} }f={\frac {\partial f}{\partial \mathbf {x} }}\mathbf {u} .}Este tipo de notación será útil al demostrar reglas de producto y reglas de cadena que resultan similares a las que conocemos para la derivada escalar .

Vector por vector

Cada uno de los dos casos anteriores puede considerarse como una aplicación de la derivada de un vector con respecto a otro vector, utilizando un vector de tamaño uno. De manera similar, veremos que las derivadas que involucran matrices se reducen a derivadas que involucran vectores de forma análoga.

La derivada de una función vectorial (un vector cuyos componentes son funciones)y=[y1y2ymetro]T{\displaystyle \mathbf {y} ={\begin{bmatrix}y_{1}&y_{2}&\cdots &y_{m}\end{bmatrix}}^{\mathsf {T}}}, con respecto a un vector de entrada,incógnita=[incógnita1incógnita2incógnitanorte]T{\displaystyle \mathbf {x} ={\begin{bmatrix}x_{1}&x_{2}&\cdots &x_{n}\end{bmatrix}}^{\mathsf {T}}}, se escribe (en notación de numerador ) como

yincógnita=[y1incógnita1y1incógnita2y1incógnitanortey2incógnita1y2incógnita2y2incógnitanorteymetroincógnita1ymetroincógnita2ymetroincógnitanorte].{\displaystyle {\frac {\partial \mathbf {y} }{\partial \mathbf {x} }}={\begin{bmatrix}{\frac {\partial y_{1}}{\partial x_{1}}}&{\frac {\partial y_{1}}{\partial x_{2}}}&\cdots &{\frac {\partial y_{1}}{\partial x_{n}}}\\{\frac {\partial y_{2}}{\partial x_{1}}}&{\frac {\partial y_{2}}{\partial x_{2}}}&\cdots &{\frac {\partial y_{2}}{\partial x_{n}}}\\\vdots &\vdots &\ddots &\vdots \\{\frac {\partial y_{m}}{\partial x_{1}}}&{\frac {\partial y_{m}}{\partial x_{2}}}&\cdots &{\frac {\partial y_{m}}{\partial x_{n}}}\\\end{bmatrix}}.}

En cálculo vectorial , la derivada de una función vectorial y con respecto a un vector x cuyos componentes representan un espacio se conoce como la derivada directa (o diferencial) o matriz jacobiana .

El avance a lo largo de una función vectorial f con respecto al vector v en R n viene dado pordF(v)=Fvdv.{\displaystyle d\mathbf {f} (\mathbf {v} )={\frac {\partial \mathbf {f} }{\partial \mathbf {v} }}d\mathbf {v} .}

Derivadas con matrices

Existen dos tipos de derivadas de matrices que pueden organizarse en una matriz del mismo tamaño. Estas son la derivada de una matriz respecto a un escalar y la derivada de un escalar respecto a una matriz. Estas derivadas resultan útiles en problemas de minimización presentes en diversas áreas de las matemáticas aplicadas y han adoptado los nombres de matriz tangente y matriz gradiente , respectivamente, en referencia a sus análogos para vectores.

Nota : En esta sección se utiliza la convención de numeración con fines pedagógicos. Algunos autores emplean convenciones diferentes. La sección sobre convenciones de formato aborda este tema con mayor detalle. Las identidades que se presentan más adelante se muestran en formatos compatibles con todas las convenciones de formato habituales.

Matriz por escalar

La derivada de una función matricial Y con respecto a un escalar x se conoce como matriz tangente y viene dada (en notación de numerador ) por

Yincógnita=[y11incógnitay12incógnitay1norteincógnitay21incógnitay22incógnitay2norteincógnitaymetro1incógnitaymetro2incógnitaymetronorteincógnita].{\displaystyle {\frac {\partial \mathbf {Y} }{\partial x}}={\begin{bmatrix}{\frac {\partial y_{11}}{\partial x}}&{\frac {\partial y_{12}}{\partial x}}&\cdots &{\frac {\partial y_{1n}}{\partial x}}\\{\frac {\partial y_{21}}{\partial x}}&{\frac {\partial y_{22}}{\partial x}}&\cdots &{\frac {\partial y_{2n}}{\partial x}}\\\vdots &\vdots &\ddots &\vdots \\{\frac {\partial y_{m1}}{\partial x}}&{\frac {\partial y_{m2}}{\partial x}}&\cdots &{\frac {\partial y_{mn}}{\partial x}}\\\end{bmatrix}}.}

Escalar por matriz

La derivada de una función escalar y , con respecto a una matriz X de p × q de variables independientes, viene dada (en notación de numerador ) por

yincógnita=[yincógnita11yincógnita21yincógnitapag1yincógnita12yincógnita22yincógnitapag2yincógnita1qyincógnita2qyincógnitapagq].{\displaystyle {\frac {\partial y}{\partial \mathbf {X} }}={\begin{bmatrix}{\frac {\partial y}{\partial x_{11}}}&{\frac {\partial y}{\partial x_{21}}}&\cdots &{\frac {\partial y}{\partial x_{p1}}}\\{\frac {\partial y}{\partial x_{12}}}&{\frac {\partial y}{\partial x_{22}}}&\cdots &{\frac {\partial y}{\partial x_{p2}}}\\\vdots &\vdots &\ddots &\vdots \\{\frac {\partial y}{\partial x_{1q}}}&{\frac {\partial y}{\partial x_{2q}}}&\cdots &{\frac {\partial y}{\partial x_{pq}}}\\\end{bmatrix}}.}

Ejemplos importantes de funciones escalares de matrices incluyen la traza de una matriz y el determinante .

De forma análoga al cálculo vectorial, esta derivada se suele escribir de la siguiente manera.

incógnitay(incógnita)=y(incógnita)incógnita{\displaystyle \nabla _{\mathbf {X} }y(\mathbf {X} )={\frac {\partial y(\mathbf {X} )}{\partial \mathbf {X} }}}

También de forma análoga al cálculo vectorial , la derivada direccional de un escalar f ( X ) de una matriz X en la dirección de la matriz Y viene dada por

YF=tr(FincógnitaY).{\displaystyle \nabla _{\mathbf {Y} }f=\operatorname {tr} \left({\frac {\partial f}{\partial \mathbf {X} }}\mathbf {Y} \right).}

La matriz gradiente, en particular, encuentra numerosos usos en problemas de minimización en la teoría de la estimación , especialmente en la derivación del algoritmo del filtro de Kalman , que es de gran importancia en este campo.

Otras derivadas de matrices

Los tres tipos de derivadas que no se han considerado son las que involucran vectores por matrices, matrices por vectores y matrices por matrices. Estas no se estudian con tanta frecuencia y no existe un consenso generalizado sobre su notación.

Convenciones de diseño

Esta sección analiza las similitudes y diferencias entre las convenciones de notación empleadas en los diversos campos que utilizan el cálculo matricial. Si bien existen dos convenciones generalmente consistentes, algunos autores prefieren combinarlas, como se describe a continuación. Tras esta sección, las ecuaciones se presentarán por separado en ambas formas.

La cuestión fundamental es que la derivada de un vector con respecto a un vector, es deciryincógnita{\displaystyle {\frac {\partial \mathbf {y} }{\partial \mathbf {x} }}}A menudo se escribe de dos maneras contrapuestas. Si el numerador y tiene tamaño m y el denominador x tiene tamaño n , entonces el resultado se puede representar como una matriz m × n o una matriz n × m , es decir, los m elementos de y se disponen en filas y los n elementos de x en columnas, o viceversa. Esto da lugar a las siguientes posibilidades:

  1. Disposición del numerador , es decir, disposición según y y x T (es decir, en sentido contrario a x ). Esto a veces se conoce como la formulación jacobiana . Esto corresponde a la disposición m × n del ejemplo anterior, lo que significa que el número de fila deyincógnita{\displaystyle {\frac {\partial \mathbf {y} }{\partial \mathbf {x} }}}es igual al tamaño del numeradory{\displaystyle \mathbf {y} }y el número de columna deyincógnita{\displaystyle {\frac {\partial \mathbf {y} }{\partial \mathbf {x} }}}es igual al tamaño de x T .
  2. Disposición del denominador , es decir, disposición según y T y x (es decir, en sentido contrario a y ). A veces se la conoce como formulación hessiana . Algunos autores denominan a esta disposición gradiente , en contraposición al jacobiano (disposición del numerador), que es su transpuesta. (Sin embargo, gradiente se refiere más comúnmente a la derivadayincógnita,{\displaystyle {\frac {\partial y}{\partial \mathbf {x} }},}independientemente del diseño.). Esto corresponde al diseño n×m del ejemplo anterior, lo que significa que el número de fila deyincógnita{\displaystyle {\frac {\partial \mathbf {y} }{\partial \mathbf {x} }}}es igual al tamaño de x (el denominador).
  3. Una tercera posibilidad que a veces se ve es insistir en escribir la derivada comoyincógnita,{\displaystyle {\frac {\partial \mathbf {y} }{\partial \mathbf {x} '}},}(es decir, la derivada se toma con respecto a la transpuesta de x ) y se sigue la disposición del numerador. Esto permite afirmar que la matriz está dispuesta según el numerador y el denominador. En la práctica, esto produce resultados idénticos a los de la disposición del numerador.

Al manejar el gradienteyincógnita{\displaystyle {\frac {\partial y}{\partial \mathbf {x} }}}y el caso opuestoyincógnita,{\displaystyle {\frac {\partial \mathbf {y} }{\partial x}},}Tenemos los mismos problemas. Para ser coherentes, deberíamos hacer una de las siguientes cosas:

  1. Si elegimos el diseño del numerador parayincógnita,{\displaystyle {\frac {\partial \mathbf {y} }{\partial \mathbf {x} }},}Debemos establecer el gradiente.yincógnita{\displaystyle {\frac {\partial y}{\partial \mathbf {x} }}}como vector fila, yyincógnita{\displaystyle {\frac {\partial \mathbf {y} }{\partial x}}}como vector columna.
  2. Si elegimos la disposición del denominador parayincógnita,{\displaystyle {\frac {\partial \mathbf {y} }{\partial \mathbf {x} }},}Debemos establecer el gradiente.yincógnita{\displaystyle {\frac {\partial y}{\partial \mathbf {x} }}}como vector columna, yyincógnita{\displaystyle {\frac {\partial \mathbf {y} }{\partial x}}}como vector fila.
  3. En la tercera posibilidad anterior, escribimosyincógnita{\displaystyle {\frac {\partial y}{\partial \mathbf {x} '}}}yyincógnita,{\displaystyle {\frac {\partial \mathbf {y} }{\partial x}},}y utilice el diseño del numerador.

No todos los libros de texto y artículos de matemáticas son consistentes en este aspecto. Es decir, a veces se utilizan convenciones diferentes en distintos contextos dentro del mismo libro o artículo. Por ejemplo, algunos eligen la disposición del denominador para los gradientes (representados como vectores columna), pero la disposición del numerador para la derivada vector por vector.yincógnita.{\displaystyle {\frac {\partial \mathbf {y} }{\partial \mathbf {x} }}.}

De manera similar, cuando se trata de derivadas escalares por matricesyincógnita{\displaystyle {\frac {\partial y}{\partial \mathbf {X} }}}y derivadas de matriz por escalarYincógnita,{\displaystyle {\frac {\partial \mathbf {Y} }{\partial x}},}entonces la disposición consistente del numerador se organiza de acuerdo con Y y X T , mientras que la disposición consistente del denominador se organiza de acuerdo con Y T y X . Sin embargo, en la práctica, seguir una disposición del denominador paraYincógnita,{\displaystyle {\frac {\partial \mathbf {Y} }{\partial x}},}y la disposición del resultado según Y T , rara vez se ve porque da lugar a fórmulas feas que no se corresponden con las fórmulas escalares. Como resultado, a menudo se pueden encontrar las siguientes disposiciones:

  1. Diseño de numerador consistente , que organizaYincógnita{\displaystyle {\frac {\partial \mathbf {Y} }{\partial x}}}según Y yyincógnita{\displaystyle {\frac {\partial y}{\partial \mathbf {X} }}}Según X T .
  2. Diseño mixto , que organizaYincógnita{\displaystyle {\frac {\partial \mathbf {Y} }{\partial x}}}según Y yyincógnita{\displaystyle {\frac {\partial y}{\partial \mathbf {X} }}}Según X.
  3. Utilice la notaciónyincógnita,{\displaystyle {\frac {\partial y}{\partial \mathbf {X} '}},}con resultados idénticos a los de un diseño de numerador consistente.

En las siguientes fórmulas, manejamos las cinco combinaciones posibles.yincógnita,yincógnita,yincógnita,yincógnita{\displaystyle {\frac {\partial y}{\partial \mathbf {x} }},{\frac {\partial \mathbf {y} }{\partial x}},{\frac {\partial \mathbf {y} }{\partial \mathbf {x} }},{\frac {\partial y}{\partial \mathbf {X} }}}yYincógnita{\displaystyle {\frac {\partial \mathbf {Y} }{\partial x}}}por separado. También manejamos casos de derivadas escalares que involucran un vector o matriz intermedios. (Esto puede ocurrir, por ejemplo, si una curva paramétrica multidimensional se define en términos de una variable escalar, y luego se toma la derivada de una función escalar de la curva con respecto al escalar que parametriza la curva). Para cada una de las diversas combinaciones, proporcionamos resultados con numerador y denominador, excepto en los casos anteriores donde el denominador rara vez aparece. En los casos que involucran matrices donde tiene sentido, proporcionamos resultados con numerador y mixtos. Como se indicó anteriormente, los casos donde los denominadores de vectores y matrices se escriben en notación transpuesta son equivalentes al numerador con los denominadores escritos sin la transpuesta.

Tenga en cuenta que diversos autores utilizan distintas combinaciones de numeradores y denominadores para diferentes tipos de derivadas, y no hay garantía de que un autor utilice siempre el mismo formato para todos los tipos. Compare las fórmulas que aparecen a continuación con las citadas en la fuente para determinar el formato utilizado para ese tipo específico de derivada, pero tenga cuidado de no asumir que las derivadas de otros tipos necesariamente siguen el mismo formato.

Al calcular derivadas con un denominador agregado (vector o matriz) para hallar el máximo o el mínimo de dicho agregado, conviene tener en cuenta que el uso del numerador produce resultados transpuestos con respecto al agregado. Por ejemplo, al intentar hallar la estimación de máxima verosimilitud de una distribución normal multivariada mediante cálculo matricial, si el dominio es un vector columna de k × 1, el resultado obtenido con el numerador será un vector fila de 1 × k . Por lo tanto, los resultados deben transponerse al final o bien utilizarse el denominador (o un método mixto).

Los resultados de las operaciones se transpondrán al cambiar entre la notación con numerador y la notación con denominador.

Notación de disposición del numerador

Utilizando la notación de disposición del numerador, tenemos: [ 1 ]

yincógnita=[yincógnita1yincógnita2yincógnitanorte].yincógnita=[y1incógnitay2incógnitaymetroincógnita].yincógnita=[y1incógnita1y1incógnita2y1incógnitanortey2incógnita1y2incógnita2y2incógnitanorteymetroincógnita1ymetroincógnita2ymetroincógnitanorte].yincógnita=[yincógnita11yincógnita21yincógnitapag1yincógnita12yincógnita22yincógnitapag2yincógnita1qyincógnita2qyincógnitapagq].{\displaystyle {\begin{aligned}{\frac {\partial y}{\partial \mathbf {x} }}&={\begin{bmatrix}{\frac {\partial y}{\partial x_{1}}}&{\frac {\partial y}{\partial x_{2}}}&\cdots &{\frac {\partial y}{\partial x_{n}}}\end{bmatrix}}.\\{\frac {\partial \mathbf {y} }{\partial x}}&={\begin{bmatrix}{\frac {\partial y_{1}}{\partial x}}\\{\frac {\partial y_{2}}{\partial x}}\\\vdots \\{\frac {\partial y_{m}}{\partial x}}\\\end{bmatrix}}.\\{\frac {\partial \mathbf {y} }{\partial \mathbf {x} }}&={\begin{bmatrix}{\frac {\partial y_{1}}{\partial x_{1}}}&{\frac {\partial y_{1}}{\partial x_{2}}}&\cdots &{\frac {\partial y_{1}}{\partial x_{n}}}\\{\frac {\partial y_{2}}{\partial x_{1}}}&{\frac {\partial y_{2}}{\partial x_{2}}}&\cdots &{\frac {\partial y_{2}}{\partial x_{n}}}\\\vdots &\vdots &\ddots &\vdots \\{\frac {\partial y_{m}}{\partial x_{1}}}&{\frac {\partial y_{m}}{\partial x_{2}}}&\cdots &{\frac {\partial y_{m}}{\partial x_{n}}}\\\end{bmatrix}}.\\{\frac {\partial y}{\partial \mathbf {X} }}&={\begin{bmatrix}{\frac {\partial y}{\partial x_{11}}}&{\frac {\partial y}{\partial x_{21}}}&\cdots &{\frac {\partial y}{\partial x_{p1}}}\\{\frac {\partial y}{\partial x_{12}}}&{\frac {\partial y}{\partial x_{22}}}&\cdots &{\frac {\partial y}{\partial x_{p2}}}\\\vdots &\vdots &\ddots &\vdots \\{\frac {\partial y}{\partial x_{1q}}}&{\frac {\partial y}{\partial x_{2q}}}&\cdots &{\frac {\partial y}{\partial x_{pq}}}\\\end{bmatrix}}.\end{aligned}}}

Las siguientes definiciones se proporcionan únicamente en notación de numerador:

Yincógnita=[y11incógnitay12incógnitay1norteincógnitay21incógnitay22incógnitay2norteincógnitaymetro1incógnitaymetro2incógnitaymetronorteincógnita].dincógnita=[dincógnita11dincógnita12dincógnita1nortedincógnita21dincógnita22dincógnita2nortedincógnitametro1dincógnitametro2dincógnitametronorte].{\displaystyle {\begin{aligned}{\frac {\partial \mathbf {Y} }{\partial x}}&={\begin{bmatrix}{\frac {\partial y_{11}}{\partial x}}&{\frac {\partial y_{12}}{\partial x}}&\cdots &{\frac {\partial y_{1n}}{\partial x}}\\{\frac {\partial y_{21}}{\partial x}}&{\frac {\partial y_{22}}{\partial x}}&\cdots &{\frac {\partial y_{2n}}{\partial x}}\\\vdots &\vdots &\ddots &\vdots \\{\frac {\partial y_{m1}}{\partial x}}&{\frac {\partial y_{m2}}{\partial x}}&\cdots &{\frac {\partial y_{mn}}{\partial x}}\\\end{bmatrix}}.\\d\mathbf {X} &={\begin{bmatrix}dx_{11}&dx_{12}&\cdots &dx_{1n}\\dx_{21}&dx_{22}&\cdots &dx_{2n}\\\vdots &\vdots &\ddots &\vdots \\dx_{m1}&dx_{m2}&\cdots &dx_{mn}\\\end{bmatrix}}.\end{aligned}}}

Notación de disposición del denominador

Utilizando la notación de disposición del denominador, tenemos: [ 2 ]

yincógnita=[yincógnita1yincógnita2yincógnitanorte].yincógnita=[y1incógnitay2incógnitaymetroincógnita].yincógnita=[y1incógnita1y2incógnita1ymetroincógnita1y1incógnita2y2incógnita2ymetroincógnita2y1incógnitanortey2incógnitanorteymetroincógnitanorte].yincógnita=[yincógnita11yincógnita12yincógnita1qyincógnita21yincógnita22yincógnita2qyincógnitapag1yincógnitapag2yincógnitapagq].{\displaystyle {\begin{aligned}{\frac {\partial y}{\partial \mathbf {x} }}&={\begin{bmatrix}{\frac {\partial y}{\partial x_{1}}}\\{\frac {\partial y}{\partial x_{2}}}\\\vdots \\{\frac {\partial y}{\partial x_{n}}}\\\end{bmatrix}}.\\{\frac {\partial \mathbf {y} }{\partial x}}&={\begin{bmatrix}{\frac {\partial y_{1}}{\partial x}}&{\frac {\partial y_{2}}{\partial x}}&\cdots &{\frac {\partial y_{m}}{\partial x}}\end{bmatrix}}.\\{\frac {\partial \mathbf {y} }{\partial \mathbf {x} }}&={\begin{bmatrix}{\frac {\partial y_{1}}{\partial x_{1}}}&{\frac {\partial y_{2}}{\partial x_{1}}}&\cdots &{\frac {\partial y_{m}}{\partial x_{1}}}\\{\frac {\partial y_{1}}{\partial x_{2}}}&{\frac {\partial y_{2}}{\partial x_{2}}}&\cdots &{\frac {\partial y_{m}}{\partial x_{2}}}\\\vdots &\vdots &\ddots &\vdots \\{\frac {\partial y_{1}}{\partial x_{n}}}&{\frac {\partial y_{2}}{\partial x_{n}}}&\cdots &{\frac {\partial y_{m}}{\partial x_{n}}}\\\end{bmatrix}}.\\{\frac {\partial y}{\partial \mathbf {X} }}&={\begin{bmatrix}{\frac {\partial y}{\partial x_{11}}}&{\frac {\partial y}{\partial x_{12}}}&\cdots &{\frac {\partial y}{\partial x_{1q}}}\\{\frac {\partial y}{\partial x_{21}}}&{\frac {\partial y}{\partial x_{22}}}&\cdots &{\frac {\partial y}{\partial x_{2q}}}\\\vdots &\vdots &\ddots &\vdots \\{\frac {\partial y}{\partial x_{p1}}}&{\frac {\partial y}{\partial x_{p2}}}&\cdots &{\frac {\partial y}{\partial x_{pq}}}\\\end{bmatrix}}.\end{aligned}}}

Identidades

Como se indicó anteriormente, en general, los resultados de las operaciones se transpondrán al cambiar entre la notación con numerador y la notación con denominador.

Para comprender mejor las identidades que se presentan a continuación, tenga en cuenta las reglas más importantes: la regla de la cadena , la regla del producto y la regla de la suma . La regla de la suma se aplica universalmente, y la regla del producto se aplica en la mayoría de los casos que se muestran a continuación, siempre que se mantenga el orden de los productos de matrices, ya que estos no son conmutativos. La regla de la cadena se aplica en algunos casos, pero lamentablemente no se aplica a las derivadas de matrices por escalares ni a las derivadas de escalares por matrices (en este último caso, principalmente cuando se aplica el operador traza a las matrices). En este último caso, la regla del producto tampoco se puede aplicar directamente, pero se puede obtener un resultado equivalente con un poco más de trabajo utilizando las identidades diferenciales.

Las siguientes identidades adoptan las siguientes convenciones:

  • los escalares a , b , c , d y e son constantes con respecto a, y los escalares u y v son funciones de uno de x , x o X ;
  • los vectores a , b , c , d y e son constantes con respecto a, y los vectores u y v son funciones de uno de x , x o X ;
  • Las matrices A , B , C , D y E son constantes con respecto a, y las matrices U y V son funciones de uno de x , x o X.

Identidades vector por vector

Esto se presenta en primer lugar porque todas las operaciones que se aplican a la diferenciación vector por vector se aplican directamente a la diferenciación vector por escalar o escalar por vector simplemente reduciendo el vector apropiado en el numerador o denominador a un escalar.

Identidades escalares por vectoriales

Las identidades fundamentales se sitúan encima de la gruesa línea negra.

Identidades vector-escalares

NOTA : Las fórmulas que involucran derivadas vector por vectorgramo(){\displaystyle {\frac {\partial \mathbf {g} (\mathbf {u} )}{\partial \mathbf {u} }}}yF(gramo)gramo{\displaystyle {\frac {\partial \mathbf {f} (\mathbf {g} )}{\partial \mathbf {g} }}}(cuyas salidas son matrices) suponga que las matrices están dispuestas de forma consistente con la disposición del vector, es decir, matriz con disposición de numerador cuando vector con disposición de numerador y viceversa; de lo contrario, transponga las derivadas vector por vector.

Identidades escalares por matrices

Nótese que no existen equivalentes exactos de la regla del producto escalar y la regla de la cadena cuando se aplican a funciones de matrices con valores matriciales. Sin embargo, la regla del producto de este tipo sí se aplica a la forma diferencial (véase más adelante), y esta es la manera de derivar muchas de las identidades que se presentan a continuación, que involucran la función traza , combinada con el hecho de que la función traza permite la transposición y la permutación cíclica, es decir:

tr(A)=tr(A)tr(ABdoD)=tr(BdoDA)=tr(doDAB)=tr(DABdo){\displaystyle {\begin{aligned}\operatorname {tr} (\mathbf {A} )&=\operatorname {tr} \left(\mathbf {A^{\top }} \right)\\\operatorname {tr} (\mathbf {ABCD} )&=\operatorname {tr} (\mathbf {BCDA} )=\operatorname {tr} (\mathbf {CDAB} )=\operatorname {tr} (\mathbf {DABC} )\end{aligned}}}

Por ejemplo, para calculartr(AincógnitaBincógnitado)incógnita:{\displaystyle {\frac {\partial \operatorname {tr} (\mathbf {AXBX^{\top }C} )}{\partial \mathbf {X} }}:}dtr(AincógnitaBincógnitado)=dtr(doAincógnitaBincógnita)=tr(d(doAincógnitaBincógnita))=tr(doAincógnitad(Bincógnita)+d(doAincógnita)Bincógnita)=tr(doAincógnitad(Bincógnita))+tr(d(doAincógnita)Bincógnita)=tr(doAincógnitaBd(incógnita))+tr(doA(dincógnita)Bincógnita)=tr(doAincógnitaB(dincógnita))+tr(doA(dincógnita)Bincógnita)=tr((doAincógnitaB(dincógnita)))+tr(doA(dincógnita)Bincógnita)=tr((dincógnita)BincógnitaAdo)+tr(doA(dincógnita)Bincógnita)=tr(BincógnitaAdo(dincógnita))+tr(BincógnitadoA(dincógnita))=tr((BincógnitaAdo+BincógnitadoA)dincógnita)=tr((doAincógnitaB+AdoincógnitaB)dincógnita){\displaystyle {\begin{aligned}d\operatorname {tr} (\mathbf {AXBX^{\top }C} )&=d\operatorname {tr} \left(\mathbf {CAXBX^{\top }} \right)=\operatorname {tr} \left(d\left(\mathbf {CAXBX^{\top }} \right)\right)\\[1ex]&=\operatorname {tr} \left(\mathbf {CAX} d(\mathbf {BX^{\top }} \right)+d\left(\mathbf {CAX} )\mathbf {BX^{\top }} \right)\\[1ex]&=\operatorname {tr} \left(\mathbf {CAX} d\left(\mathbf {BX^{\top }} \right)\right)+\operatorname {tr} \left(d(\mathbf {CAX} )\mathbf {BX^{\top }} \right)\\[1ex]&=\operatorname {tr} \left(\mathbf {CAXB} d\left(\mathbf {X^{\top }} \right)\right)+\operatorname {tr} \left(\mathbf {CA} (d\mathbf {X} )\mathbf {BX^{\top }} \right)\\[1ex]&=\operatorname {tr} \left(\mathbf {CAXB} (d\mathbf {X} )^{\top }\right)+\operatorname {tr} (\mathbf {CA} \left(d\mathbf {X} )\mathbf {BX^{\top }} \right)\\[1ex]&=\operatorname {tr} \left(\left(\mathbf {CAXB} (d\mathbf {X} )^{\top }\right)^{\top }\right)+\operatorname {tr} \left(\mathbf {CA} (d\mathbf {X} )\mathbf {BX^{\top }} \right)\\[1ex]&=\operatorname {tr} \left((d\mathbf {X} )\mathbf {B^{\top }X^{\top }A^{\top }C^{\top }} \right)+\operatorname {tr} \left(\mathbf {CA} (d\mathbf {X} )\mathbf {BX^{\top }} \right)\\[1ex]&=\operatorname {tr} \left(\mathbf {B^{\top }X^{\top }A^{\top }C^{\top }} (d\mathbf {X} )\right)+\operatorname {tr} \left(\mathbf {BX^{\top }} \mathbf {CA} (d\mathbf {X} )\right)\\[1ex]&=\operatorname {tr} \left(\left(\mathbf {B^{\top }X^{\top }A^{\top }C^{\top }} +\mathbf {BX^{\top }} \mathbf {CA} \right)d\mathbf {X} \right)\\[1ex]&=\operatorname {tr} \left(\left(\mathbf {CAXB} +\mathbf {A^{\top }C^{\top }XB^{\top }} \right)^{\top }d\mathbf {X} \right)\end{aligned}}}

Por lo tanto,

tr(AincógnitaBincógnitado)incógnita=BincógnitaAdo+BincógnitadoA.{\displaystyle {\frac {\partial \operatorname {tr} \left(\mathbf {AXBX^{\top }C} \right)}{\partial \mathbf {X} }}=\mathbf {B^{\top }X^{\top }A^{\top }C^{\top }} +\mathbf {BX^{\top }CA} .}(diseño del numerador)
tr(AincógnitaBincógnitado)incógnita=doAincógnitaB+AdoincógnitaB.{\displaystyle {\frac {\partial \operatorname {tr} \left(\mathbf {AXBX^{\top }C} \right)}{\partial \mathbf {X} }}=\mathbf {CAXB} +\mathbf {A^{\top }C^{\top }XB^{\top }} .}(disposición del denominador)

(Para el último paso, consulte la sección Conversión de forma diferencial a derivada ).

Identidades de matriz por escalar

Identidades escalares

Con vectores involucrados

Con matrices involucradas

Identidades en forma diferencial

A menudo es más fácil trabajar con derivadas diferenciales y luego convertirlas a derivadas normales. Esto solo funciona bien con la disposición del numerador. En estas reglas, a es un escalar.

En la última fila,δij{\displaystyle \delta _{ij}}es el delta de Kronecker y(PAGk)ij=(Q)ik(Q1)kj{\displaystyle (\mathbf {P} _{k})_{ij}=(\mathbf {Q} )_{ik}(\mathbf {Q} ^{-1})_{kj}}es el conjunto de operadores de proyección ortogonales que se proyectan sobre el k -ésimo vector propio de X. Q es la matriz de vectores propios deincógnita=QΛQ1{\displaystyle \mathbf {X} =\mathbf {Q} {\boldsymbol {\Lambda }}\mathbf {Q} ^{-1}}, y(Λ)ii=λi{\displaystyle ({\boldsymbol {\Lambda }})_{ii}=\lambda _{i}}son los valores propios. La función de matrizF(incógnita){\displaystyle f(\mathbf {X} )}se define en términos de la función escalarF(incógnita){\displaystyle f(x)}para matrices diagonalizables porF(incógnita)=iF(λi)PAGi{\textstyle f(\mathbf {X} )=\sum _{i}f(\lambda _{i})\mathbf {P} _{i}}dóndeincógnita=iλiPAGi{\textstyle \mathbf {X} =\sum _{i}\lambda _{i}\mathbf {P} _{i}}conPAGiPAGj=δijPAGi{\displaystyle \mathbf {P} _{i}\mathbf {P} _{j}=\delta _{ij}\mathbf {P} _{i}}.

Para convertirlo a la forma derivada normal, primero conviértalo a una de las siguientes formas canónicas y luego utilice estas identidades:

Aplicaciones

El cálculo diferencial matricial se utiliza en estadística y econometría, particularmente para el análisis estadístico de distribuciones multivariadas , especialmente la distribución normal multivariada y otras distribuciones elípticas . [ 8 ] [ 9 ] [ 10 ]

Se utiliza en el análisis de regresión para calcular, por ejemplo, la fórmula de regresión de mínimos cuadrados ordinarios para el caso de múltiples variables explicativas . [ 11 ] También se utiliza en matrices aleatorias, momentos estadísticos, sensibilidad local y diagnósticos estadísticos. [ 12 ] [ 13 ]

Véase también

Notas

  1. 1 2 3 Aquí,0{\displaystyle \mathbf {0} }se refiere a un vector columna de todos 0, de tamaño n , donde n es la longitud de x .
  2. 1 2 Aquí,0{\displaystyle \mathbf {0} }se refiere a una matriz de todos ceros, de la misma forma que X.
  3. La constante a desaparece en el resultado. Esto es intencional. En general, dlnadincógnita=1ad(a)dincógnita=1aaddincógnita=1ddincógnita=dlndincógnita.{\displaystyle {\frac {d\ln au}{dx}}={\frac {1}{au}}{\frac {d(au)}{dx}}={\frac {1}{au}}a{\frac {du}{dx}}={\frac {1}{u}}{\frac {du}{dx}}={\frac {d\ln u}{dx}}.} o también dlnadincógnita=d(lna+ln)dincógnita=dlnadincógnita+dlndincógnita=dlndincógnita.{\displaystyle {\frac {d\ln au}{dx}}={\frac {d(\ln a+\ln u)}{dx}}={\frac {d\ln a}{dx}}+{\frac {d\ln u}{dx}}={\frac {d\ln u}{dx}}.}

Referencias

  1. 1 2 3 4 5 Thomas P., Minka (28 de diciembre de 2000). "Álgebra matricial antigua y nueva útil para la estadística" . Nota del MIT Media Lab (1997; revisada en diciembre de 2000) . Recuperado el 5 de febrero de 2016 .
  2. Felippa, Carlos A. "Apéndice D, Álgebra lineal: determinantes, inversas, rango" (PDF) . ASEN 5007: Introducción a los métodos de elementos finitos . Boulder, Colorado: Universidad de Colorado . Consultado el 5 de febrero de 2016 .Utiliza la definición de derivadas vectoriales y matriciales de la matriz hessiana ( transpuesta a la matriz jacobiana ).
  3. 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 Petersen, Kaare Brandt ; Pedersen, Michael Syskind. The Matrix Cookbook (PDF) . Archivado del original el 2 de marzo de 2010. Recuperado el 5 de febrero de 2016 .Este libro utiliza un diseño mixto, es decir, por Y enYincógnita,{\displaystyle {\frac {\partial \mathbf {Y} }{\partial x}},}por X enyincógnita.{\displaystyle {\frac {\partial y}{\partial \mathbf {X} }}.}
  4. Duchi, John C. "Propiedades de las derivadas de traza y matriz" (PDF) . Universidad de Stanford . Consultado el 5 de febrero de 2016 .
  5. Véase Determinante §  Derivada para la derivación.
  6. Giles, Mike B. (2008). "Resultados recopilados de derivadas matriciales para la diferenciación algorítmica en modo directo e inverso". En Bischof, Christian H.; Bücker, H. Martin; Hovland, Paul; Naumann, Uwe; Utke, Jean (eds.). Avances en diferenciación automática . Notas de clase en ciencia e ingeniería computacional. Vol. 64. Berlín: Springer. pp. 35–44 . doi : 10.1007/978-3-540-68942-3_4 . ISBN   978-3-540-68935-5. MR 2531677 . 
  7. Memorando inédito de S. Adler (IAS)
  8. Fang, Kai-Tai ; Zhang, Yao-Ting (1990). Análisis multivariante generalizado . Science Press (Pekín) y Springer-Verlag (Berlín). ISBN 3-540-17651-9. 9783540176510.
  9. Pan, Jianxin; Fang, Kaitai (2007). Modelos de curvas de crecimiento y diagnósticos estadísticos . Pekín: Science Press. ISBN 978-0-387-95053-2.
  10. ^ Kollo, Tõnu; Von Rosen, Dietrich (2005). Estadística multivariada avanzada con matrices . Dordrecht: Springer. ISBN 978-1-4020-3418-3.
  11. Magnus, Jan; Neudecker, Heinz (2019). Cálculo diferencial matricial con aplicaciones en estadística y econometría . Nueva York: John Wiley. ISBN 978-1-119-54120-2.
  12. Liu, Shuangzhe; Leiva, Victor; Zhuang, Dan; Ma, Tiefeng; Figueroa-Zúñiga, Jorge I. (2022). "Cálculo diferencial matricial con aplicaciones en el modelo lineal multivariado y su diagnóstico" . Journal of Multivariate Analysis . 188 104849. doi : 10.1016/j.jmva.2021.104849 .
  13. ^ Liu, Shuangzhe; Trenkler, Götz; Kollo, Tõnu; von Rosen, Dietrich; Baksalary, Oskar María (2023). "El profesor Heinz Neudecker y el cálculo diferencial matricial". Artículos estadísticos . 65 (4): 2605–2639.doi : 10.1007 / s00362-023-01499-w . S2CID 263661094 . 

Lecturas adicionales

  • Abadir, Karim M.; Magnus, Jan R. (2005). Álgebra matricial . Ejercicios econométricos. Cambridge: Cambridge University Press. ISBN 978-0-511-64796-3OCLC 569411497 
  • Lax, Peter D. (2007). "9. Cálculo de funciones vectoriales y matriciales". Álgebra lineal y sus aplicaciones (2.ª  ed.). Hoboken, NJ: Wiley-Interscience. ISBN 978-0-471-75156-4.
  • Magnus, Jan R. (octubre de 2010). "Sobre el concepto de derivada matricial". Journal of Multivariate Analysis . 101 (9): 2200– 2206. doi : 10.1016/j.jmva.2010.05.005 .Cabe señalar que este artículo de Wikipedia ha sido revisado casi por completo con respecto a la versión criticada en este artículo.

Software

  • MatrixCalculus.org , un sitio web para evaluar simbólicamente expresiones de cálculo matricial.
  • NCAlgebra , un paquete de Mathematica de código abierto que incluye algunas funcionalidades de cálculo matricial.
  • SymPy admite derivadas matriciales simbólicas en su módulo de expresiones matriciales , así como derivadas tensoriales simbólicas en su módulo de expresiones de matrices .
  • Tensorgrad , un paquete de Python de código abierto para cálculo matricial. Admite derivadas tensoriales simbólicas generales utilizando la notación gráfica de Penrose .

Información

  • Manual de referencia de matrices , Mike Brookes, Imperial College de Londres .
  • Diferenciación de matrices (y otras cosas) , Randal J. Barnes, Departamento de Ingeniería Civil, Universidad de Minnesota.
  • Notas sobre cálculo matricial , Paul L. Fackler, Universidad Estatal de Carolina del Norte .
  • Cálculo diferencial matricial Archivado el 16/09/2012 en Wayback Machine (presentación de diapositivas), Zhang Le, Universidad de Edimburgo .
  • Introducción a la diferenciación vectorial y matricial (notas sobre diferenciación matricial, en el contexto de la econometría ), Heino Bohn Nielsen.
  • Una nota sobre la diferenciación de matrices (notas sobre la diferenciación de matrices), Pawel Koval, del archivo personal RePEc de Múnich.
  • Cálculo vectorial/matricial. Más notas sobre la diferenciación de matrices.
  • Identidades matriciales (notas sobre diferenciación matricial), Sam Roweis.
  • Cálculo matricial mediante diagramas tensoriales .