Articulo de referencia

Teorema de Mercer

En matemáticas , específicamente en análisis funcional , el teorema de Mercer es una representación de una función simétrica definida positiva en un cuadrado como suma de una su...

En matemáticas , específicamente en análisis funcional , el teorema de Mercer es una representación de una función simétrica definida positiva en un cuadrado como suma de una sucesión convergente de funciones producto. Este teorema, presentado en ( Mercer 1909 ) , es uno de los resultados más notables del trabajo de James Mercer (1883-1932). Es una herramienta teórica importante en la teoría de ecuaciones integrales ; se utiliza en la teoría de espacios de Hilbert de procesos estocásticos , por ejemplo, el teorema de Karhunen-Loève ; y también se utiliza en la teoría de espacios de Hilbert de núcleo reproductor, donde caracteriza un núcleo simétrico definido positivo como un núcleo reproductor. [ 1 ]

Introducción

Para explicar el teorema de Mercer, primero consideramos un caso especial importante; véase más abajo una formulación más general. Un núcleo , en este contexto, es una función continua simétrica .

K:[a,b]×[a,b]R{\displaystyle K:[a,b]\times [a,b]\rightarrow \mathbb {R} }

dóndeK(incógnita,y)=K(y,incógnita){\displaystyle K(x,y)=K(y,x)}a pesar deincógnita,y[a,b]{\displaystyle x,y\in [a,b]}.

Se dice que K es un núcleo definido positivo si y solo si

i=1nortej=1norteK(incógnitai,incógnitaj)doidoj0{\displaystyle \sum _{i=1}^{n}\sum _{j=1}^{n}K(x_{i},x_{j})c_{i}c_{j}\geq 0}

para todas las secuencias finitas de puntos x 1 ,  ..., x n de [ a , b ] y todas las elecciones de números reales c 1 , ..., c n . Nótese que el término "definida positiva" está bien establecido en la literatura a pesar de la débil desigualdad en la definición. [ 2 ] [ 3 ]    

La caracterización fundamental de los núcleos estacionarios definidos positivos (dondeK(incógnita,y)=K(incógnitay){\displaystyle K(x,y)=K(x-y)}) viene dado por el teorema de Bochner . Afirma que una función continuaK(incógnitay){\displaystyle K(x-y)}es definida positiva si y solo si puede expresarse como la transformada de Fourier de una medida finita no negativa.μ{\displaystyle \mu }:

K(incógnitay)=mii(incógnitay)ωdμ(ω){\displaystyle K(x-y)=\int _{-\infty }^{\infty }e^{i(x-y)\omega }\,d\mu (\omega )}

Esta representación espectral revela la conexión entre la positividad definida y el análisis armónico, proporcionando una caracterización más fuerte y directa de la positividad definida que la definición abstracta en términos de desigualdades cuando el núcleo es estacionario, por ejemplo, cuando se puede expresar como una función de una variable de la distancia entre puntos en lugar de la función de dos variables de las posiciones de pares de puntos.

Asociado a K hay un operador lineal (más específicamente un operador integral de Hilbert-Schmidt cuando el intervalo es compacto) sobre funciones definidas por la integral

[TKφ](incógnita)=abK(incógnita,s)φ(s)ds.{\displaystyle [T_{K}\varphi ](x)=\int _{a}^{b}K(x,s)\varphi (s)\,ds.}

Suponemosφ{\displaystyle \varphi }puede abarcar el espacio de funciones de cuadrado integrable de valor real L 2 [ a , b ]; sin embargo, en muchos casos el espacio de Hilbert del núcleo reproductor asociado puede ser estrictamente mayor que L 2 [ a , b ]. Dado que T K es un operador lineal, existen los autovalores y las autofunciones de T K.  

Teorema . Supongamos que K es un núcleo continuo , simétrico y definido positivo. Entonces existe una base ortonormal { e i } i de [ a , b ] que consta de autofunciones de T K tales que la secuencia correspondiente de autovalores { λ i } i es no negativa. Las autofunciones correspondientes a autovalores distintos de cero son continuas en [ a , b ] y K tiene la representación  

K(s,t)=j=1λjmij(s)mij(t){\displaystyle K(s,t)=\sum _{j=1}^{\infty }\lambda _{j}\,e_{j}(s)\,e_{j}(t)}

donde la convergencia es absoluta y uniforme.

Detalles

A continuación, explicamos con mayor detalle la estructura de la demostración del teorema de Mercer, en particular su relación con la teoría espectral de operadores compactos .

  • La aplicación KT K es inyectiva .
  • T K es un operador compacto simétrico no negativo en L 2 [ a , b ]; además K ( x , x ) 0.

Para demostrar la compacidad, demuestre que la imagen de la bola unitaria de L 2 [ a , b ] bajo T K es equicontinua y aplique el teorema de Ascoli para demostrar que la imagen de la bola unitaria es relativamente compacta en C([ a , b ]) con la norma uniforme y a fortiori en L 2 [ a , b ].

Ahora aplicamos el teorema espectral para operadores compactos en espacios de Hilbert a T K para demostrar la existencia de la base ortonormal { e i } i de L 2 [ a , b ].

λimii(t)=[TKmii](t)=abK(t,s)mii(s)ds.{\displaystyle \lambda _{i}e_{i}(t)=[T_{K}e_{i}](t)=\int _{a}^{b}K(t,s)e_{i}(s)\,ds.}

Si λ i 0, se observa que el vector propio ( función propia ) e i es continuo en [ a , b ]. Ahora bien,

i=1λi|mii(t)mii(s)|sorberincógnita[a,b]|K(incógnita,incógnita)|,{\displaystyle \sum _{i=1}^{\infty }\lambda _{i}|e_{i}(t)e_{i}(s)|\leq \sup _{x\in [a,b]}|K(x,x)|,}

lo que demuestra que la secuencia

i=1λimii(t)mii(s){\displaystyle \sum _{i=1}^{\infty }\lambda _{i}e_{i}(t)e_{i}(s)}

converge absoluta y uniformemente a un núcleo K 0 que, como se puede ver fácilmente, define el mismo operador que el núcleo K . Por lo tanto, K = K 0, de donde se deduce el teorema de Mercer.

Finalmente, para demostrar la no negatividad de los autovalores se puede escribir:λF,F=F,TKF{\displaystyle \lambda \langle f,f\rangle =\langle f,T_{K}f\rangle }y expresando el lado derecho como una integral bien aproximada por sus sumas de Riemann, que son no negativas debido a la positividad definida de K , lo que implicaλF,F0{\displaystyle \lambda \langle f,f\rangle \geq 0}, lo que implicaλ0{\displaystyle \lambda \geq 0}.

Rastro

Lo siguiente es inmediato:

Teorema . Supongamos que K es un núcleo continuo simétrico definido positivo; T K tiene una secuencia de autovalores no negativos { λ i } i . Entonces

abK(t,t)dt=iλi.{\displaystyle \int _{a}^{b}K(t,t)\,dt=\sum _{i}\lambda _{i}.}

Esto demuestra que el operador T K es un operador de clase traza y

rastro(TK)=abK(t,t)dt.{\displaystyle \operatorname {trace} (T_{K})=\int _{a}^{b}K(t,t)\,dt.}

Generalizaciones

El teorema de Mercer es, en sí mismo, una generalización del resultado que establece que cualquier matriz simétrica semidefinida positiva es la matriz de Gram de un conjunto de vectores.

La primera generalización reemplaza el intervalo [ a , b ] con cualquier espacio compacto de Hausdorff y la medida de Lebesgue en [ a , b ] se reemplaza por una medida finita numerable aditiva μ en el álgebra de Borel de X cuyo soporte es X . Esto significa que μ ( U ) > 0 para cualquier subconjunto abierto no vacío U de X .  

Una generalización reciente reemplaza estas condiciones por las siguientes: el conjunto X es un espacio topológico numerable de primer orden dotado de una medida de Borel (completa) μ . X es el soporte de μ y, para todo x en X , existe un conjunto abierto U que contiene a x y tiene medida finita. Entonces, esencialmente, se cumple el mismo resultado:

Teorema . Supongamos que K es un núcleo continuo, simétrico y definido positivo en X. Si la función κ es L 1 μ ( X ), donde κ (x)  := K(x,x) para todo x en X , entonces existe un conjunto ortonormal { e i } i de L 2 μ ( X ) que consta de autofunciones de T K tales que la secuencia correspondiente de autovalores { λ i } i es no negativa. Las autofunciones correspondientes a autovalores no nulos son continuas en X y K tiene la representación

K(s,t)=j=1λjmij(s)mij(t){\displaystyle K(s,t)=\sum _{j=1}^{\infty }\lambda _{j}\,e_{j}(s)\,e_{j}(t)}

donde la convergencia es absoluta y uniforme en subconjuntos compactos de X.

La siguiente generalización trata sobre representaciones de núcleos medibles .

Sea ( X , M , μ ) un espacio de medida σ -finita. Un núcleo L 2 (o de cuadrado integrable) en X es una función

KLμμ2(incógnita×incógnita).{\displaystyle K\in L_{\mu \otimes \mu }^{2}(X\times X).}

Los núcleos L ​​2 definen un operador acotado T K mediante la fórmula

TKφ,ψ=incógnita×incógnitaK(y,incógnita)φ(y)ψ(incógnita)d[μμ](y,incógnita).{\displaystyle \langle T_{K}\varphi ,\psi \rangle =\int _{X\times X}K(y,x)\varphi (y)\psi (x)\,d[\mu \otimes \mu ](y,x).}

T K es un operador compacto (de hecho, es incluso un operador de Hilbert-Schmidt ). Si el núcleo K es simétrico, por el teorema espectral , T K tiene una base ortonormal de autovectores. Aquellos autovectores que corresponden a autovalores distintos de cero pueden ordenarse en una secuencia { e i } i (independientemente de la separabilidad).

Teorema . Si K es un núcleo simétrico definido positivo en ( X , M , μ ), entonces

K(y,incógnita)=inorteλimii(y)mii(incógnita){\displaystyle K(y,x)=\sum _{i\in \mathbb {N} }\lambda _{i}e_{i}(y)e_{i}(x)}

donde la convergencia en la norma L2 . Nótese que cuando no se asume la continuidad del núcleo, la expansión ya no converge uniformemente.

La condición de Mercer

Se dice que una función de valores reales K ( x , y ) cumple la condición de Mercer si para todas las funciones de cuadrado integrable g ( x ) se tiene

gramo(incógnita)K(incógnita,y)gramo(y)dincógnitady0.{\displaystyle \iint g(x)K(x,y)g(y)\,dx\,dy\geq 0.}

Analógico discreto

Esto es análogo a la definición de una matriz semidefinida positiva . Esta es una matriz.K{\displaystyle K}de dimensiónnorte{\displaystyle N}, que satisface, para todos los vectoresgramo{\displaystyle g}, la propiedad

(gramo,Kgramo)=gramoTKgramo=i=1nortej=1nortegramoiKijgramoj0{\displaystyle (g,Kg)=g^{T}{\cdot }Kg=\sum _{i=1}^{N}\sum _{j=1}^{N}\,g_{i}\,K_{ij}\,g_{j}\geq 0}.

Ejemplos

A positive constant function

K(x,y)=c{\displaystyle K(x,y)=c\,}

satisfies Mercer's condition, as then the integral becomes by Fubini's theorem

g(x)cg(y)dxdy=cg(x)dxg(y)dy=c(g(x)dx)2{\displaystyle \iint g(x)\,c\,g(y)\,dx\,dy=c\int \!g(x)\,dx\int \!g(y)\,dy=c\left(\int \!g(x)\,dx\right)^{2}}

which is indeed non-negative.

See also

Notes

  1. Bartlett, Peter (2008). "Reproducing Kernel Hilbert Spaces"(PDF). Lecture notes of CS281B/Stat241B Statistical Learning Theory. University of California at Berkeley.
  2. Mohri, Mehryar (2018). Foundations of machine learning. Afshin Rostamizadeh, Ameet Talwalkar (Second ed.). Cambridge, Massachusetts. ISBN 978-0-262-03940-6. OCLC 1041560990.{{cite book}}: CS1 maint: location missing publisher (link)
  3. Berlinet, A. (2004). Reproducing kernel Hilbert spaces in probability and statistics. Christine Thomas-Agnan. New York: Springer Science+Business Media. ISBN 1-4419-9096-8. OCLC 844346520.

References

  • Adriaan Zaanen, Linear Analysis, North Holland Publishing Co., 1960,
  • Ferreira, J. C., Menegatto, V. A., Eigenvalues of integral operators defined by smooth positive definite kernels, Integral equation and Operator Theory, 64 (2009), no. 1, 61–81. (Gives the generalization of Mercer's theorem for metric spaces. The result is easily adapted to first countable topological spaces)
  • Konrad Jörgens, Linear integral operators, Pitman, Boston, 1982,
  • Richard Courant and David Hilbert, Methods of Mathematical Physics, vol 1, Interscience 1953,
  • Robert Ash, Information Theory, Dover Publications, 1990,
  • Mercer, J. (1909), "Functions of positive and negative type and their connection with the theory of integral equations", Philosophical Transactions of the Royal Society A, 209 (441–458): 415–446, Bibcode:1909RSPTA.209..415M, doi:10.1098/rsta.1909.0016,
  • "Mercer theorem", Encyclopedia of Mathematics, EMS Press, 2001 [1994]
  • H. König, Eigenvalue distribution of compact operators, Birkhäuser Verlag, 1986. (Gives the generalization of Mercer's theorem for finite measures μ.)