Articulo de referencia

matriz hessiana

En matemáticas , la matriz hessiana , también conocida como matriz de Hesse, es una matriz cuadrada de derivadas parciales de segundo orden de una función escalar o campo escala...

En matemáticas , la matriz hessiana , también conocida como matriz de Hesse, es una matriz cuadrada de derivadas parciales de segundo orden de una función escalar o campo escalar . Describe la curvatura local de una función de muchas variables. La matriz hessiana fue desarrollada en el siglo XIX por el matemático alemán Ludwig Otto Hesse y posteriormente recibió su nombre en su honor. Hesse utilizó originalmente el término "determinantes funcionales". La matriz hessiana a veces se denota por H o{\displaystyle \nabla \nabla }o2{\displaystyle \nabla ^{2}}o{\displaystyle \nabla \otimes \nabla }oD2{\displaystyle D^{2}}.

Definiciones y propiedades

SuponerF:RnorteR{\displaystyle f:\mathbb {R} ^{n}\to \mathbb {R} }es una función que toma como entrada un vectorincógnitaRnorte{\displaystyle \mathbf {x} \in \mathbb {R} ^{n}}y generando un escalarF(incógnita)R.{\displaystyle f(\mathbf {x} )\in \mathbb {R} .}Si todas las derivadas parciales de segundo orden deF{\displaystyle f}Si existe, entonces la matriz hessianaH{\displaystyle \mathbf {H} }deF{\displaystyle f}es un cuadradonorte×norte{\displaystyle n\times n}matriz, generalmente definida y organizada como HF=[2Fincógnita122Fincógnita1incógnita22Fincógnita1incógnitanorte2Fincógnita2incógnita12Fincógnita222Fincógnita2incógnitanorte2Fincógnitanorteincógnita12Fincógnitanorteincógnita22Fincógnitanorte2].{\displaystyle \mathbf {H} _{f}={\begin{bmatrix}{\dfrac {\partial ^{2}f}{\partial x_{1}^{2}}}&{\dfrac {\partial ^{2}f}{\partial x_{1}\,\partial x_{2}}}&\cdots &{\dfrac {\partial ^{2}f}{\partial x_{1}\,\partial x_{n}}}\\[2.2ex]{\dfrac {\partial ^{2}f}{\partial x_{2}\,\partial x_{1}}}&{\dfrac {\partial ^{2}f}{\partial x_{2}^{2}}}&\cdots &{\dfrac {\partial ^{2}f}{\partial x_{2}\,\partial x_{n}}}\\[2.2ex]\vdots &\vdots &\ddots &\vdots \\[2.2ex]{\dfrac {\partial ^{2}f}{\partial x_{n}\,\partial x_{1}}}&{\dfrac {\partial ^{2}f}{\partial x_{n}\,\partial x_{2}}}&\cdots &{\dfrac {\partial ^{2}f}{\partial x_{n}^{2}}}\end{bmatrix}}.} Es decir, la entrada de la i -ésima fila y la j- ésima columna es (HF)i,j=2Fincógnitaiincógnitaj.{\displaystyle (\mathbf {H} _{f})_{i,j}={\frac {\partial ^{2}f}{\partial x_{i}\,\partial x_{j}}}.}

Si además las segundas derivadas parciales son todas continuas , la matriz hessiana es una matriz simétrica debido a la simetría de las segundas derivadas .

El determinante de la matriz hessiana se llama determinante hessiano . [ 1 ]

La matriz hessiana de una funciónF{\displaystyle f}es la transpuesta de la matriz jacobiana del gradiente de la funciónF{\displaystyle f}; eso es:H(F(incógnita))=J(F(incógnita))T.{\displaystyle \mathbf {H} (f(\mathbf {x} ))=\mathbf {J} (\nabla f(\mathbf {x} ))^{T}.}

Aplicaciones

Puntos de inflexión

SiF{\displaystyle f}es un polinomio homogéneo en tres variables, la ecuaciónF=0{\displaystyle f=0}es la ecuación implícita de una curva proyectiva plana . Los puntos de inflexión de la curva son precisamente los puntos no singulares donde el determinante hessiano es cero. Según el teorema de Bézout , una curva plana cúbica tiene como máximo 9 puntos de inflexión, ya que el determinante hessiano es un polinomio de grado 3.

Prueba de segunda derivada

La matriz hessiana de una función convexa es semidefinida positiva . Refinar esta propiedad nos permite comprobar si existe un punto crítico.incógnita{\displaystyle x}es un máximo local , un mínimo local o un punto de silla , como sigue (para todos los cuales también es necesario que el gradiente de la función sea igual a 0 enincógnita{\displaystyle x}):

Si la matriz hessiana es definida positiva enincógnita,{\displaystyle x,}entoncesF{\displaystyle f}alcanza un mínimo local aislado enincógnita.{\displaystyle x.}Si la matriz hessiana es definida negativa enincógnita,{\displaystyle x,}entoncesF{\displaystyle f}alcanza un máximo local aislado enincógnita.{\displaystyle x.}Si la matriz hessiana tiene valores propios tanto positivos como negativos , entoncesincógnita{\displaystyle x}es un punto de silla paraF.{\displaystyle f.}De lo contrario, la prueba no es concluyente. Esto implica que en un mínimo local la matriz hessiana es semidefinida positiva, y en un máximo local la matriz hessiana es semidefinida negativa.

Para las matrices hessianas semidefinidas positivas y negativas, la prueba no es concluyente (un punto crítico donde la matriz hessiana es semidefinida pero no definida puede ser un extremo local o un punto de silla). Sin embargo, se puede decir más desde el punto de vista de la teoría de Morse .

La prueba de la segunda derivada para funciones de una y dos variables es más sencilla que el caso general. En una variable, el hessiano contiene exactamente una segunda derivada; si es positiva, entoncesincógnita{\displaystyle x}es un mínimo local, y si es negativo, entoncesincógnita{\displaystyle x}es un máximo local; si es cero, la prueba no es concluyente. En dos variables, se puede usar el determinante , ya que este es el producto de los autovalores. Si es positivo, ambos autovalores son positivos o ambos negativos. Si es negativo, los dos autovalores tienen signos diferentes. Si es cero, la prueba de la segunda derivada no es concluyente.

De forma equivalente, las condiciones de segundo orden que son suficientes para un mínimo o máximo local pueden expresarse en términos de la secuencia de menores principales (superior izquierda) (determinantes de submatrices) del hessiano; estas condiciones son un caso especial de las que se dan en la siguiente sección para hessianos con borde para optimización con restricciones , el caso en el que el número de restricciones es cero. Específicamente, la condición suficiente para un mínimo es que todos estos menores principales sean positivos, mientras que la condición suficiente para un máximo es que los menores alternen en signo, con el1×1{\displaystyle 1\times 1}menor siendo negativo.

Puntos críticos

Si el gradiente (el vector de las derivadas parciales) de una funciónF{\displaystyle f}es cero en algún momentoincógnita,{\displaystyle \mathbf {x} ,}entoncesF{\displaystyle f}tiene un punto crítico (o punto estacionario ) enincógnita.{\displaystyle \mathbf {x} .}El determinante del hessiano enincógnita{\displaystyle \mathbf {x} }se denomina, en algunos contextos, discriminante . Si este determinante es cero, entoncesincógnita{\displaystyle \mathbf {x} }se denomina punto crítico degenerado deF,{\displaystyle f,}o un punto crítico no Morse deF.{\displaystyle f.}De lo contrario, no es degenerado y se denomina punto crítico de Morse.F.{\displaystyle f.}

La matriz hessiana desempeña un papel importante en la teoría de Morse y la teoría de catástrofes , ya que su núcleo y sus valores propios permiten clasificar los puntos críticos. [ 2 ] [ 3 ] [ 4 ]

El determinante de la matriz hessiana, evaluado en un punto crítico de una función, es igual a la curvatura gaussiana de la función considerada como una variedad. Los autovalores de la matriz hessiana en ese punto son las curvaturas principales de la función, y los autovectores son las direcciones principales de curvatura. (Véase Curvatura gaussiana §  Relación con las curvaturas principales ).

Uso en optimización

Las matrices hessianas se utilizan en problemas de optimización a gran escala dentro de los métodos de tipo Newton porque son el coeficiente del término cuadrático de una expansión de Taylor local de una función. Es decir, y=F(incógnita+Δincógnita)F(incógnita)+F(incógnita)TΔincógnita+12ΔincógnitaTH(incógnita)Δincógnita{\displaystyle y=f(\mathbf {x} +\Delta \mathbf {x} )\approx f(\mathbf {x} )+\nabla f(\mathbf {x} )^{\mathsf {T}}\Delta \mathbf {x} +{\frac {1}{2}}\,\Delta \mathbf {x} ^{\mathsf {T}}\mathbf {H} (\mathbf {x} )\,\Delta \mathbf {x} } dóndeF{\displaystyle \nabla f}es el gradiente(Fincógnita1,,Fincógnitanorte).{\displaystyle \left({\frac {\partial f}{\partial x_{1}}},\ldots ,{\frac {\partial f}{\partial x_{n}}}\right).}Calcular y almacenar la matriz hessiana completa llevaΘ(norte2){\displaystyle \Theta \left(n^{2}\right)}memoria, lo cual es inviable para funciones de alta dimensión como las funciones de pérdida de redes neuronales , campos aleatorios condicionales y otros modelos estadísticos con gran cantidad de parámetros. Para tales situaciones, se han desarrollado algoritmos de Newton truncado y cuasi-Newton . Esta última familia de algoritmos utiliza aproximaciones al hessiano; uno de los algoritmos cuasi-Newton más populares es BFGS . [ 5 ]

Estas aproximaciones pueden aprovechar el hecho de que un algoritmo de optimización utiliza la matriz hessiana únicamente como un operador lineal.H(v),{\displaystyle \mathbf {H} (\mathbf {v} ),}y procedamos observando primero que la matriz hessiana también aparece en la expansión local del gradiente: F(incógnita+Δincógnita)=F(incógnita)+H(incógnita)Δincógnita+O(Δincógnita2){\displaystyle \nabla f(\mathbf {x} +\Delta \mathbf {x} )=\nabla f(\mathbf {x} )+\mathbf {H} (\mathbf {x} )\,\Delta \mathbf {x} +{\mathcal {O}}(\|\Delta \mathbf {x} \|^{2})}

AlquilerΔincógnita=rv{\displaystyle \Delta \mathbf {x} =r\mathbf {v} }para algún escalarr,{\displaystyle r,}esto da H(incógnita)Δincógnita=H(incógnita)rv=rH(incógnita)v=F(incógnita+rv)F(incógnita)+O(r2),{\displaystyle \mathbf {H} (\mathbf {x} )\,\Delta \mathbf {x} =\mathbf {H} (\mathbf {x} )r\mathbf {v} =r\mathbf {H} (\mathbf {x} )\mathbf {v} =\nabla f(\mathbf {x} +r\mathbf {v} )-\nabla f(\mathbf {x} )+{\mathcal {O}}(r^{2}),} eso es, H(incógnita)v=1r[F(incógnita+rv)F(incógnita)]+O(r){\displaystyle \mathbf {H} (\mathbf {x} )\mathbf {v} ={\frac {1}{r}}\left[\nabla f(\mathbf {x} +r\mathbf {v} )-\nabla f(\mathbf {x} )\right]+{\mathcal {O}}(r)} por lo que si el gradiente ya está calculado, el hessiano aproximado se puede calcular mediante un número lineal (en el tamaño del gradiente) de operaciones escalares. (Si bien es sencillo de programar, este esquema de aproximación no es numéricamente estable ya quer{\displaystyle r}debe hacerse pequeño para evitar errores debido a laO(r){\displaystyle {\mathcal {O}}(r)}término, pero al disminuirlo se pierde precisión en el primer término. [ 6 ] )

En particular, con respecto a las heurísticas de búsqueda aleatoria, la matriz de covarianza de la estrategia evolutiva se adapta a la inversa de la matriz hessiana, salvo un factor escalar y pequeñas fluctuaciones aleatorias. Este resultado se ha demostrado formalmente para una estrategia de un solo progenitor y un modelo estático, a medida que aumenta el tamaño de la población, basándose en la aproximación cuadrática. [ 7 ]

Otras aplicaciones

La matriz hessiana se utiliza comúnmente para expresar operadores de procesamiento de imágenes en el procesamiento de imágenes y la visión por computadora (véase el detector de manchas laplacianas (LoG), el detector de manchas determinantes de la matriz hessiana (DoH) y el espacio de escalas ). Puede utilizarse en el análisis de modos normales para calcular las diferentes frecuencias moleculares en la espectroscopia infrarroja . [ 8 ] También puede utilizarse en la sensibilidad local y el diagnóstico estadístico. [ 9 ]

Generalizaciones

Hessiano con borde

Se utiliza un hessiano bordeado para la prueba de la segunda derivada en ciertos problemas de optimización con restricciones. Dada la funciónF{\displaystyle f}Considerado previamente, pero añadiendo una función de restricción.gramo{\displaystyle g}de tal manera quegramo(incógnita)=do,{\displaystyle g(\mathbf {x} )=c,}La matriz hessiana con borde es la matriz hessiana de la función de Lagrange.Λ(incógnita,λ)=F(incógnita)+λ[gramo(incógnita)do]{\displaystyle \Lambda (\mathbf {x} ,\lambda )=f(\mathbf {x} )+\lambda [g(\mathbf {x} )-c]}: [ 10 ]H(Λ)=[2Λλ22Λλincógnita(2Λλincógnita)T2Λincógnita2]=[0gramoincógnita1gramoincógnita2gramoincógnitanortegramoincógnita12Λincógnita122Λincógnita1incógnita22Λincógnita1incógnitanortegramoincógnita22Λincógnita2incógnita12Λincógnita222Λincógnita2incógnitanortegramoincógnitanorte2Λincógnitanorteincógnita12Λincógnitanorteincógnita22Λincógnitanorte2]=[0gramoincógnita(gramoincógnita)T2Λincógnita2]{\displaystyle \mathbf {H} (\Lambda )={\begin{bmatrix}{\dfrac {\partial ^{2}\Lambda }{\partial \lambda ^{2}}}&{\dfrac {\partial ^{2}\Lambda }{\partial \lambda \partial \mathbf {x} }}\\\left({\dfrac {\partial ^{2}\Lambda }{\partial \lambda \partial \mathbf {x} }}\right)^{\mathsf {T}}&{\dfrac {\partial ^{2}\Lambda }{\partial \mathbf {x} ^{2}}}\end{bmatrix}}={\begin{bmatrix}0&{\dfrac {\partial g}{\partial x_{1}}}&{\dfrac {\partial g}{\partial x_{2}}}&\cdots &{\dfrac {\partial g}{\partial x_{n}}}\\[2.2ex]{\dfrac {\partial g}{\partial x_{1}}}&{\dfrac {\partial ^{2}\Lambda }{\partial x_{1}^{2}}}&{\dfrac {\partial ^{2}\Lambda }{\partial x_{1}\,\partial x_{2}}}&\cdots &{\dfrac {\partial ^{2}\Lambda }{\partial x_{1}\,\partial x_{n}}}\\[2.2ex]{\dfrac {\partial g}{\partial x_{2}}}&{\dfrac {\partial ^{2}\Lambda }{\partial x_{2}\,\partial x_{1}}}&{\dfrac {\partial ^{2}\Lambda }{\partial x_{2}^{2}}}&\cdots &{\dfrac {\partial ^{2}\Lambda }{\partial x_{2}\,\partial x_{n}}}\\[2.2ex]\vdots &\vdots &\vdots &\ddots &\vdots \\[2.2ex]{\dfrac {\partial g}{\partial x_{n}}}&{\dfrac {\partial ^{2}\Lambda }{\partial x_{n}\,\partial x_{1}}}&{\dfrac {\partial ^{2}\Lambda }{\partial x_{n}\,\partial x_{2}}}&\cdots &{\dfrac {\partial ^{2}\Lambda }{\partial x_{n}^{2}}}\end{bmatrix}}={\begin{bmatrix}0&{\dfrac {\partial g}{\partial \mathbf {x} }}\\\left({\dfrac {\partial g}{\partial \mathbf {x} }}\right)^{\mathsf {T}}&{\dfrac {\partial ^{2}\Lambda }{\partial \mathbf {x} ^{2}}}\end{bmatrix}}}

Si hay, por ejemplo,metro{\displaystyle m}restricciones entonces el cero en la esquina superior izquierda es unmetro×metro{\displaystyle m\times m}bloque de ceros, y haymetro{\displaystyle m}filas de borde en la parte superior ymetro{\displaystyle m}columnas de borde a la izquierda.

Las reglas anteriores que establecen que los extremos se caracterizan (entre los puntos críticos con un hessiano no singular) por un hessiano definido positivo o definido negativo no pueden aplicarse aquí ya que un hessiano bordeado no puede ser ni definido negativo ni definido positivo, comozTHz=0{\displaystyle \mathbf {z} ^{\mathsf {T}}\mathbf {H} \mathbf {z} =0}siz{\displaystyle \mathbf {z} }es cualquier vector cuya única entrada distinta de cero es su primera.

La prueba de la segunda derivada consiste aquí en restricciones de signo de los determinantes de un cierto conjunto denortemetro{\displaystyle n-m}submatrices del hessiano bordeado. [ 11 ] Intuitivamente, lametro{\displaystyle m}Las restricciones pueden considerarse como una reducción del problema a uno connortemetro{\displaystyle n-m}variables libres. (Por ejemplo, la maximización deF(incógnita1,incógnita2,incógnita3){\displaystyle f\left(x_{1},x_{2},x_{3}\right)}sujeto a la restricciónincógnita1+incógnita2+incógnita3=1{\displaystyle x_{1}+x_{2}+x_{3}=1}puede reducirse a la maximización deF(incógnita1,incógnita2,1incógnita1incógnita2){\displaystyle f\left(x_{1},x_{2},1-x_{1}-x_{2}\right)}sin restricciones.)

Específicamente, se imponen condiciones de signo a la secuencia de menores principales principales (determinantes de submatrices alineadas superiormente a la izquierda) del hessiano bordeado, para el cual el primero2metro{\displaystyle 2m}Se descuidan los menores principales principales, siendo el menor más pequeño el primero truncado.2metro+1{\displaystyle 2m+1}filas y columnas, la siguiente consta de la primera truncada2metro+2{\displaystyle 2m+2}filas y columnas, y así sucesivamente, siendo la última la totalidad del hessiano bordeado; si2metro+1{\displaystyle 2m+1}es más grande quenorte+metro,{\displaystyle n+m,}entonces la menor principal principal más pequeña es la propia hessiana. [ 12 ] Hay, por lo tanto,nortemetro{\displaystyle n-m}menores a considerar, cada uno evaluado en el punto específico que se considera como un máximo o mínimo candidato . Una condición suficiente para un máximo local es que estos menores alternen en signo, siendo el más pequeño el que tenga el signo de(1)metro+1.{\displaystyle (-1)^{m+1}.} Una condición suficiente para un mínimo local es que todos estos menores tengan el signo de(1)metro.{\displaystyle (-1)^{m}.}(En el caso no restringido demetro=0{\displaystyle m=0}Estas condiciones coinciden con las condiciones para que la matriz hessiana sin bordes sea definida negativa o definida positiva, respectivamente.

Funciones con valores vectoriales

SiF{\displaystyle f}es en cambio un campo vectorialF:RnorteRmetro,{\displaystyle \mathbf {f} :\mathbb {R} ^{n}\to \mathbb {R} ^{m},} es decir, F(incógnita)=(F1(incógnita),F2(incógnita),,Fmetro(incógnita)),{\displaystyle \mathbf {f} (\mathbf {x} )=\left(f_{1}(\mathbf {x} ),f_{2}(\mathbf {x} ),\ldots ,f_{m}(\mathbf {x} )\right),} entonces la colección de segundas derivadas parciales no es unanorte×norte{\displaystyle n\times n}matriz, sino más bien un tensor de tercer orden . Esto puede pensarse como una matriz demetro{\displaystyle m}Matrices hessianas, una para cada componente deF{\displaystyle \mathbf {f} }: H(F)=(H(F1),H(F2),,H(Fmetro)).{\displaystyle \mathbf {H} (\mathbf {f} )=\left(\mathbf {H} (f_{1}),\mathbf {H} (f_{2}),\ldots ,\mathbf {H} (f_{m})\right).} Este tensor degenera en la matriz hessiana usual cuandometro=1.{\displaystyle m=1.}

Generalización al caso complejo

En el contexto de varias variables complejas , el hessiano puede generalizarse. Supongamos queF:donortedo,{\displaystyle f\colon \mathbb {C} ^{n}\to \mathbb {C} ,}y escribirF(z1,,znorte).{\displaystyle f\left(z_{1},\ldots ,z_{n}\right).} Identificacióndonorte{\displaystyle {\mathbb {C} }^{n}}conR2norte{\displaystyle {\mathbb {R} }^{2n}}, el hessiano "real" normal es un2norte×2norte{\displaystyle 2n\times 2n}matriz. Dado que el objeto de estudio en varias variables complejas son funciones holomorfas , es decir, soluciones a las condiciones de Cauchy-Riemann n-dimensionales , solemos fijarnos en la parte del hessiano que contiene información invariante bajo cambios holomorfos de coordenadas. Esta "parte" es el llamado hessiano complejo, que es la matriz(2Fzjz¯k)j,k.{\displaystyle \left({\frac {\partial ^{2}f}{\partial z_{j}\partial {\bar {z}}_{k}}}\right)_{j,k}.} Tenga en cuenta que siF{\displaystyle f}Si una función es holomorfa, su matriz hessiana compleja es idénticamente cero, por lo que la hessiana compleja se utiliza para estudiar funciones suaves pero no holomorfas; véase, por ejemplo, la pseudoconvexidad de Levi . Al tratar con funciones holomorfas, podríamos considerar la matriz hessiana.(2Fzjzk)j,k.{\displaystyle \left({\frac {\partial ^{2}f}{\partial z_{j}\partial z_{k}}}\right)_{j,k}.}

Generalizaciones a variedades riemannianas

Dejar(METRO,gramo){\displaystyle (M,g)}sea ​​una variedad riemanniana y{\displaystyle \nabla }su conexión Levi-Civita . DejemosF:METROR{\displaystyle f:M\to \mathbb {R} }Sea una función suave. Defina el tensor hessiano mediante Hess(F)Γ(TMETROTMETRO) por Hess(F):=F=dF,{\displaystyle \operatorname {Hess} (f)\in \Gamma \left(T^{*}M\otimes T^{*}M\right)\quad {\text{ by }}\quad \operatorname {Hess} (f):=\nabla \nabla f=\nabla df,} donde esto aprovecha el hecho de que la primera derivada covariante de una función es igual a su diferencial ordinaria. Elección de coordenadas locales{incógnitai}{\displaystyle \left\{x^{i}\right\}}da una expresión local para el hessiano como Hess(F)=ijF dincógnitaidincógnitaj=(2FincógnitaiincógnitajΓijkFincógnitak)dincógnitaidincógnitaj{\displaystyle \operatorname {Hess} (f)=\nabla _{i}\,\partial _{j}f\ dx^{i}\!\otimes \!dx^{j}=\left({\frac {\partial ^{2}f}{\partial x^{i}\partial x^{j}}}-\Gamma _{ij}^{k}{\frac {\partial f}{\partial x^{k}}}\right)dx^{i}\otimes dx^{j}} dóndeΓijk{\displaystyle \Gamma _{ij}^{k}}son los símbolos de Christoffel de la conexión. Otras formas equivalentes para el hessiano se dan por Hess(F)(incógnita,Y)=incógnitagraduadoF,Y y Hess(F)(incógnita,Y)=incógnita(YF)dF(incógnitaY).{\displaystyle \operatorname {Hess} (f)(X,Y)=\langle \nabla _{X}\operatorname {grad} f,Y\rangle \quad {\text{ and }}\quad \operatorname {Hess} (f)(X,Y)=X(Yf)-df(\nabla _{X}Y).}

Véase también

Referencias

  1. Binmore, Ken ; Davies, Joan (2007). Conceptos y métodos del cálculo . Cambridge University Press. pág.  190. ISBN 978-0-521-77541-0OCLC 717598615 
  2. Callahan, James J. (2010). Cálculo avanzado: una perspectiva geométrica . Springer Science & Business Media. pág. 248. ISBN  978-1-4419-7332-0.
  3. Casciaro, B.; Fortunato, D.; Francaviglia, M.; Masiello, A., eds. (2011). Recent Developments in General Relativity . Springer Science & Business Media. p. 178. ISBN  978-88-470-2113-6.
  4. Domenico PL Castrigiano; Sandra A. Hayes (2004). Teoría de las catástrofes . Westview Press. pág. 18. ISBN  978-0-8133-4126-2.
  5. Nocedal, Jorge ; Wright, Stephen (2000). Optimización numérica . Springer Verlag. ISBN 978-0-387-98793-4.
  6. Pearlmutter, Barak A. (1994). "Multiplicación exacta rápida por el hessiano" (PDF) . Neural Computation . 6 (1): 147– 160. doi : 10.1162/neco.1994.6.1.147 . S2CID 1251969 . 
  7. Shir, OM; A. Yehudayoff (2020). "Sobre la relación covarianza-hessiana en estrategias evolutivas" . Theoretical Computer Science . 801. Elsevier: 157–174 . arXiv : 1806.03674 . doi : 10.1016/j.tcs.2019.09.002 .
  8. Mott, Adam J.; Rez, Peter (24 de diciembre de 2014). "Cálculo de los espectros infrarrojos de las proteínas" . European Biophysics Journal . 44 (3): 103– 112. doi : 10.1007/s00249-014-1005-6 . ISSN 0175-7571 . PMID 25538002. S2CID 2945423 .   
  9. Liu, Shuangzhe; Leiva, Victor; Zhuang, Dan; Ma, Tiefeng; Figueroa-Zúñiga, Jorge I. (marzo de 2022). "Cálculo diferencial matricial con aplicaciones en el modelo lineal multivariado y su diagnóstico" . Journal of Multivariate Analysis . 188 104849. doi : 10.1016/j.jmva.2021.104849 .
  10. Hallam, Arne (7 de octubre de 2004). "Econ 500: Métodos cuantitativos en análisis económico I" (PDF) . Iowa State .
  11. Neudecker, Heinz; Magnus, Jan R. (1988). Cálculo diferencial matricial con aplicaciones en estadística y econometría . Nueva York: John Wiley & Sons . pág. 136. ISBN  978-0-471-91516-4.
  12. Chiang, Alpha C. (1984). Métodos fundamentales de economía matemática (Tercera ed.). McGraw-Hill. pág . 386. ISBN   978-0-07-010813-4.

Lecturas adicionales

  • Lewis, David W. (1991). Teoría de matrices . Singapur: World Scientific. ISBN 978-981-02-0689-5.
  • Magnus, Jan R.; Neudecker, Heinz (1999). «El segundo diferencial». Cálculo diferencial matricial: con aplicaciones en estadística y econometría (  Edición revisada). Nueva York: Wiley. págs. 99–115 . ISBN  0-471-98633-X.