Articulo de referencia

Análisis de componentes independientes

En el procesamiento de señales , el análisis de componentes independientes ( ICA ) es un método computacional para separar una señal multivariada en subcomponentes aditivos. Est...

En el procesamiento de señales , el análisis de componentes independientes ( ICA ) es un método computacional para separar una señal multivariada en subcomponentes aditivos. Esto se logra asumiendo que como máximo un subcomponente es gaussiano y que los subcomponentes son estadísticamente independientes entre sí. [ 1 ] ICA fue inventado por Jeanny Hérault y Christian Jutten en 1985. [ 2 ] ICA es un caso especial de separación ciega de fuentes . Un ejemplo común de aplicación de ICA es el " problema de la fiesta de cóctel ", que consiste en escuchar el habla de una persona en una habitación ruidosa. [ 3 ]

Introducción

ICA en cuatro videos mezclados aleatoriamente. [ 4 ] Fila superior: Los videos fuente originales. Fila central: Cuatro mezclas aleatorias utilizadas como entrada para el algoritmo. Fila inferior: Los videos reconstruidos.

El análisis de componentes independientes (ICA) intenta descomponer una señal multivariada en señales no gaussianas independientes. Por ejemplo, el sonido suele ser una señal compuesta por la suma numérica, en cada instante t, de señales provenientes de diversas fuentes. La cuestión, entonces, es si es posible separar estas fuentes contribuyentes de la señal total observada. Cuando se cumple el supuesto de independencia estadística, la separación ciega mediante ICA de una señal mixta ofrece muy buenos resultados. [ 5 ] También se utiliza para señales que, con fines de análisis, no se supone que se generen mediante mezcla.

Una aplicación sencilla del ICA es el problema de la "fiesta de cóctel ", donde las señales de voz subyacentes se separan de una muestra de datos compuesta por personas hablando simultáneamente en una habitación. Generalmente, el problema se simplifica asumiendo que no hay retardos ni ecos. Cabe destacar que una señal filtrada y retardada es una copia de un componente dependiente, por lo que no se incumple el supuesto de independencia estadística.

Mezclar pesos para construir elMETRO{\textstyle M}señales observadas de lanorte{\textstyle N}Los componentes se pueden colocar en unMETRO×norte{\textstyle M\times N}matriz. Algo importante a considerar es que sinorte{\textstyle N}Hay fuentes presentes, al menosnorte{\textstyle N}Se necesitan observaciones (por ejemplo, micrófonos si la señal observada es de audio) para recuperar las señales originales. Cuando hay un número igual de observaciones y señales fuente, la matriz de mezcla es cuadrada (METRO=norte{\textstyle M=N}). Otros casos de indeterminados (METRO<norte{\textstyle M<N}) y sobredeterminado (METRO>norte{\textstyle M>N}) han sido investigados.

El éxito de la separación ICA de señales mixtas se basa en dos supuestos y tres efectos de la mezcla de señales fuente. Dos supuestos:

  1. Las señales de origen son independientes entre sí.
  2. Los valores de cada señal fuente tienen distribuciones no gaussianas.

Tres efectos de la mezcla de señales de origen:

  1. Independencia: Según la suposición 1, las señales fuente son independientes; sin embargo, sus mezclas de señales no lo son. Esto se debe a que las mezclas de señales comparten las mismas señales fuente.
  2. Normalidad: Según el Teorema del Límite Central , la distribución de una suma de variables aleatorias independientes con varianza finita tiende a una distribución gaussiana. En términos generales, la suma de dos variables aleatorias independientes suele tener una distribución más cercana a la gaussiana que cualquiera de las dos variables originales. Aquí consideramos el valor de cada señal como la variable aleatoria.
  3. Complejidad: La complejidad temporal de cualquier mezcla de señales es mayor que la de su señal fuente constituyente más simple.

Estos principios contribuyen al establecimiento básico de ICA. Si las señales extraídas de un conjunto de mezclas son independientes y tienen distribuciones no gaussianas o tienen baja complejidad, entonces deben ser señales fuente. [ 6 ] [ 7 ]

Otro ejemplo común es la esteganografía de imágenes , donde se utiliza ICA para incrustar una imagen dentro de otra. Por ejemplo, dos imágenes en escala de grises se pueden combinar linealmente para crear imágenes mixtas en las que el contenido oculto es visualmente imperceptible. Posteriormente, se puede utilizar ICA para recuperar las imágenes originales a partir de las imágenes mixtas. Esta técnica es la base de la marca de agua digital, que permite incrustar información de propiedad en las imágenes, así como aplicaciones más encubiertas, como la transmisión de información sin ser detectada. El método incluso se ha relacionado con casos reales de ciberespionaje. En estas aplicaciones, ICA sirve para separar los datos basándose en la independencia estadística, lo que permite extraer componentes ocultos que no son evidentes en los datos observados.

Las técnicas esteganográficas, incluidas aquellas que potencialmente implican análisis basados ​​en ICA, se han utilizado en casos reales de ciberespionaje. En 2010, el FBI desmanteló una red de espionaje rusa conocida como el "Programa Ilegal" (Operación Ghost Stories), donde los agentes utilizaron herramientas esteganográficas personalizadas para ocultar mensajes de texto cifrados dentro de archivos de imagen compartidos en línea. [ 8 ]

En otro caso, Xiaoqing Zheng, exingeniero de General Electric, fue condenado en 2022 por espionaje económico. Zheng utilizó esteganografía para extraer información confidencial sobre tecnología de turbinas, insertando datos de propiedad exclusiva en archivos de imagen para su transferencia a entidades en China. [ 9 ]

Definición de la independencia de los componentes

ICA encuentra los componentes independientes (también llamados factores, variables latentes o fuentes) maximizando la independencia estadística de los componentes estimados. Podemos elegir una de muchas maneras de definir una aproximación para la independencia, y esta elección rige la forma del algoritmo ICA. Las dos definiciones más amplias de independencia para ICA son:

  1. Minimización de la información mutua
  2. Maximización de la no gaussianidad

La familia de algoritmos ICA de minimización de la información mutua (MMI) utiliza medidas como la divergencia de Kullback-Leibler y la entropía máxima . La familia de algoritmos ICA de no gaussianidad, motivada por el teorema del límite central , utiliza la curtosis y la negentropía . [ 10 ]

Los algoritmos típicos para ICA utilizan centrado (restar la media para crear una señal de media cero), blanqueamiento (generalmente con la descomposición de valores propios ), [ 11 ] y reducción de dimensionalidad como pasos de preprocesamiento para simplificar y reducir la complejidad del problema para el algoritmo iterativo real.

Definiciones matemáticas

El análisis de componentes independientes lineales se puede dividir en casos sin ruido y con ruido, donde el ICA sin ruido es un caso especial del ICA con ruido. El ICA no lineal debe considerarse como un caso aparte.

Derivación general

En el modelo ICA clásico, se supone que los datos observadosincógnitaiRmetro{\displaystyle \mathbf {x} _{i}\in \mathbb {R} ^{m}}en ese momentoti{\displaystyle t_{i}}se genera a partir de señales fuentesiRmetro{\displaystyle \mathbf {s} _{i}\in \mathbb {R} ^{m}}mediante una transformación linealincógnitai=Asi{\displaystyle \mathbf {x} _{i}=A\mathbf {s} _{i}}, dóndeA{\displaystyle A}es una matriz de mezcla desconocida e invertible. Para recuperar las señales de origen, los datos se centran primero (media cero) y luego se blanquean de modo que los datos transformados tengan covarianza unitaria. Este blanqueamiento reduce el problema de estimar una matriz general.A{\displaystyle A}para estimar una matriz ortogonalV{\displaystyle V}, lo que simplifica significativamente la búsqueda de componentes independientes.

Si la matriz de covarianza de los datos centrados esΣincógnita=AA{\displaystyle \Sigma _{x}=AA^{\top }}, luego utilizando la descomposición en valores propiosΣincógnita=QDQ{\displaystyle \Sigma _{x}=QDQ^{\top }}, la transformación blanqueadora puede tomarse comoD1/2Q{\displaystyle D^{-1/2}Q^{\top }}Este paso garantiza que las fuentes recuperadas no estén correlacionadas y tengan varianza unitaria, dejando únicamente la tarea de rotar los datos blanqueados para maximizar la independencia estadística. Esta derivación general subyace a muchos algoritmos ICA y es fundamental para comprender el modelo ICA. [ 12 ]

Problema de mezcla reducida

El análisis de componentes independientes ( ICA ) aborda el problema de recuperar un conjunto de señales fuente no observadas.si=(si1,si2,,simetro)T{\displaystyle s_{i}=(s_{i1},s_{i2},\dots ,s_{im})^{T}}a partir de señales mixtas observadasincógnitai=(incógnitai1,incógnitai2,,incógnitaimetro)T{\displaystyle x_{i}=(x_{i1},x_{i2},\dots ,x_{im})^{T}}, basado en el modelo de mezcla lineal:

incógnitai=Asi,{\displaystyle x_{i}=A\,s_{i},}

donde elA{\displaystyle A}es unmetro×metro{\displaystyle m\times m}matriz invertible llamada matriz de mezcla ,si{\displaystyle s_{i}}representa el vector m-dimensional que contiene los valores de las fuentes en el tiempoti{\displaystyle t_{i}}, yincógnitai{\displaystyle x_{i}}es el vector correspondiente de valores observados en el tiempoti{\displaystyle t_{i}}El objetivo es estimar ambosA{\displaystyle A}y las señales de origen{si}{\displaystyle \{s_{i}\}}únicamente a partir de los datos observados{incógnitai}{\displaystyle \{x_{i}\}}.

Tras centrarla, la matriz de Gram se calcula de la siguiente manera: (incógnita)Tincógnita=QDQT,{\displaystyle (X^{*})^{T}X^{*}=Q\,D\,Q^{T},} donde D es una matriz diagonal con entradas positivas (suponiendoincógnita{\displaystyle X^{*}}tiene rango máximo), y Q es una matriz ortogonal. [ 11 ] Escribiendo la SVD de la matriz de mezclaA=UΣVT{\displaystyle A=U\Sigma V^{T}}y comparando conAAT=UΣ2UT{\displaystyle AA^{T}=U\Sigma ^{2}U^{T}}La mezcla A tiene la forma A=QD1/2VT.{\displaystyle A=Q\,D^{1/2}\,V^{T}.} Por lo tanto, los valores fuente normalizados satisfacen si=Vyi{\displaystyle s_{i}^{*}=V\,y_{i}^{*}}, dóndeyi=D12QTincógnitai.{\displaystyle y_{i}^{*}=D^{-{\tfrac {1}{2}}}Q^{T}x_{i}^{*}.} Por lo tanto, ICA se reduce a encontrar la matriz ortogonal.V{\displaystyle V}Esta matriz se puede calcular utilizando técnicas de optimización mediante métodos de búsqueda de proyección (véase Búsqueda de proyección ). [ 11 ]

Entre los algoritmos más conocidos para el análisis de componentes independientes (ICA) se incluyen Infomax , FastICA , JADE y el análisis de componentes independientes del núcleo , entre otros. En general, el ICA no puede identificar el número real de señales fuente, un ordenamiento único y correcto de las mismas, ni la escala adecuada (incluido el signo) de las señales fuente.

El ICA es importante para la separación ciega de señales y tiene muchas aplicaciones prácticas. Está estrechamente relacionado con (o incluso es un caso especial de) la búsqueda de un código factorial de los datos, es decir, una nueva representación vectorial de cada vector de datos tal que se codifique de forma única mediante el vector de código resultante (codificación sin pérdidas), pero los componentes del código son estadísticamente independientes.

ICA lineal sin ruido

Los componentesincógnitai{\displaystyle x_{i}}del vector aleatorio observadoincógnita=(incógnita1,,incógnitametro)T{\displaystyle {\boldsymbol {x}}=(x_{1},\ldots ,x_{m})^{T}}se generan como la suma de los componentes independientessk{\displaystyle s_{k}},k=1,,norte{\displaystyle k=1,\ldots ,n}:

incógnitai=ai,1s1++ai,ksk++ai,nortesnorte{\displaystyle x_{i}=a_{i,1}s_{1}+\cdots +a_{i,k}s_{k}+\cdots +a_{i,n}s_{n}}

ponderado por los pesos de mezclaai,k{\displaystyle a_{i,k}}.

El mismo modelo generativo se puede escribir en forma vectorial comoincógnita=k=1norteskak{\displaystyle {\boldsymbol {x}}=\sum _{k=1}^{n}s_{k}{\boldsymbol {a}}_{k}}, donde el vector aleatorio observadoincógnita{\displaystyle {\boldsymbol {x}}}está representado por los vectores baseak=(a1,k,,ametro,k)T{\displaystyle {\boldsymbol {a}}_{k}=({\boldsymbol {a}}_{1,k},\ldots ,{\boldsymbol {a}}_{m,k})^{T}}Los vectores baseak{\displaystyle {\boldsymbol {a}}_{k}}forman las columnas de la matriz de mezclaA=(a1,,anorte){\displaystyle {\boldsymbol {A}}=({\boldsymbol {a}}_{1},\ldots ,{\boldsymbol {a}}_{n})}y la fórmula generativa se puede escribir comoincógnita=As{\displaystyle {\boldsymbol {x}}={\boldsymbol {A}}{\boldsymbol {s}}}, dóndes=(s1,,snorte)T{\displaystyle {\boldsymbol {s}}=(s_{1},\ldots ,s_{n})^{T}}.

Dado el modelo y las realizaciones (muestras)incógnita1,,incógnitanorte{\displaystyle {\boldsymbol {x}}_{1},\ldots ,{\boldsymbol {x}}_{N}}del vector aleatorioincógnita{\displaystyle {\boldsymbol {x}}}La tarea consiste en estimar la matriz de mezcla.A{\displaystyle {\boldsymbol {A}}}y las fuentess{\displaystyle {\boldsymbol {s}}}Esto se hace calculando de forma adaptativa elw{\displaystyle {\boldsymbol {w}}}vectores y estableciendo una función de costo que maximice la no gaussianidad de los calculadossk=wTincógnita{\displaystyle s_{k}={\boldsymbol {w}}^{T}{\boldsymbol {x}}}o minimiza la información mutua. En algunos casos, se puede utilizar el conocimiento previo de las distribuciones de probabilidad de las fuentes en la función de coste.

Las fuentes originaless{\displaystyle {\boldsymbol {s}}}se puede recuperar multiplicando las señales observadasincógnita{\displaystyle {\boldsymbol {x}}}con la inversa de la matriz de mezclaW=A1{\displaystyle {\boldsymbol {W}}={\boldsymbol {A}}^{-1}}, también conocida como matriz de desmezcla. Aquí se supone que la matriz de mezcla es cuadrada (norte=metro{\displaystyle n=m}). Si el número de vectores base es mayor que la dimensionalidad de los vectores observados,norte>metro{\displaystyle n>m}, la tarea es sobrecompleta pero aún se puede resolver con la pseudoinversa .

ICA lineal con ruido

Con la suposición adicional de ruido gaussiano de media cero y no correlacionadonortenorte(0,diagnóstico(Σ)){\displaystyle n\sim N(0,\operatorname {diag} (\Sigma ))}, el modelo ICA toma la formaincógnita=As+norte{\displaystyle {\boldsymbol {x}}={\boldsymbol {A}}{\boldsymbol {s}}+n}.

ICA no lineal

La mezcla de las fuentes no tiene por qué ser lineal. Utilizando una función de mezcla no linealF(|θ){\displaystyle f(\cdot |\theta )}con parámetrosθ{\displaystyle \theta }El modelo ICA no lineal esincógnita=F(s|θ)+norte{\displaystyle x=f(s|\theta )+n}.

Identificabilidad

Los componentes independientes son identificables salvo una permutación y escalado de las fuentes. [ 13 ] Esta identificabilidad requiere que:

  • Como máximo una de las fuentessk{\displaystyle s_{k}}es gaussiana,
  • El número de mezclas observadas,metro{\displaystyle m}debe ser al menos tan grande como el número de componentes estimadosnorte{\displaystyle n}:metronorte{\displaystyle m\geq n}. Es equivalente a decir que la matriz de mezclaA{\displaystyle {\boldsymbol {A}}}debe ser de rango completo para que exista su inverso.

ICA binario

Una variante especial del ICA es el ICA binario, en el que tanto las fuentes de señal como los monitores están en formato binario, y las observaciones de los monitores son mezclas disyuntivas de fuentes binarias independientes. Se ha demostrado que este problema tiene aplicaciones en diversos ámbitos, como el diagnóstico médico , la asignación de clústeres múltiples , la tomografía de redes y la gestión de recursos de internet .

Dejarincógnita1,incógnita2,,incógnitametro{\displaystyle {x_{1},x_{2},\ldots ,x_{m}}}sea ​​el conjunto de variables binarias demetro{\displaystyle m}monitores yy1,y2,,ynorte{\displaystyle {y_{1},y_{2},\ldots ,y_{n}}}sea ​​el conjunto de variables binarias denorte{\displaystyle n}fuentes. Las conexiones fuente-monitor están representadas por la matriz de mezcla (desconocida).GRAMO{\textstyle {\boldsymbol {G}}}, dóndegramoij=1{\displaystyle g_{ij}=1}indica que la señal de la i -ésima fuente puede ser observada por el j -ésimo monitor. El sistema funciona de la siguiente manera: en cualquier momento, si una fuentei{\displaystyle i}está activo (yi=1{\displaystyle y_{i}=1}) y está conectado al monitorj{\displaystyle j}(gramoij=1{\displaystyle g_{ij}=1}) luego el monitorj{\displaystyle j}observará alguna actividad (incógnitaj=1{\displaystyle x_{j}=1}Formalmente tenemos:

incógnitai=j=1norte(gramoijyj),i=1,2,,metro,{\displaystyle x_{i}=\bigvee _{j=1}^{n}(g_{ij}\wedge y_{j}),i=1,2,\ldots ,m,}

dónde{\displaystyle \wedge }es la operación booleana AND y{\displaystyle \vee }es una operación OR booleana. El ruido no se modela explícitamente, sino que puede tratarse como fuentes independientes.

El problema anterior se puede resolver heurísticamente [ 14 ] asumiendo que las variables son continuas y ejecutando FastICA en datos de observación binarios para obtener la matriz de mezcla.GRAMO{\textstyle {\boldsymbol {G}}}(valores reales), luego aplique técnicas de números redondos enGRAMO{\textstyle {\boldsymbol {G}}}para obtener los valores binarios. Se ha demostrado que este método produce un resultado muy impreciso.

Otro método consiste en utilizar programación dinámica : dividir recursivamente la matriz de observación.incógnita{\textstyle {\boldsymbol {X}}}en sus submatrices y ejecutar el algoritmo de inferencia en estas submatrices. La observación clave que lleva a este algoritmo es la submatrizincógnita0{\textstyle {\boldsymbol {X}}^{0}}deincógnita{\textstyle {\boldsymbol {X}}}dóndeincógnitaij=0,j{\textstyle x_{ij}=0,\forall j}corresponde a la matriz de observación imparcial de componentes ocultos que no tienen conexión con lai{\displaystyle i}-ésimo monitor. Los resultados experimentales de [ 15 ] muestran que este enfoque es preciso bajo niveles de ruido moderados.

El marco ICA binario generalizado [ 16 ] introduce una formulación del problema más amplia que no requiere conocimiento previo del modelo generativo. En otras palabras, este método intenta descomponer una fuente en sus componentes independientes (en la medida de lo posible y sin perder información) sin ninguna suposición previa sobre su generación. Si bien este problema parece bastante complejo, puede resolverse con precisión mediante un algoritmo de árbol de búsqueda de ramificación y acotación , o bien acotarse superiormente con una sola multiplicación de una matriz por un vector.

Métodos para la separación ciega de fuentes

Búsqueda de proyección

Las mezclas de señales tienden a tener funciones de densidad de probabilidad gaussianas, y las señales fuente tienden a tener funciones de densidad de probabilidad no gaussianas. Cada señal fuente se puede extraer de un conjunto de mezclas de señales calculando el producto escalar de un vector de ponderación y aquellas mezclas de señales donde este producto escalar proporciona una proyección ortogonal de las mezclas de señales. El desafío restante es encontrar dicho vector de ponderación. Un tipo de método para lograrlo es la búsqueda de proyección . [ 17 ] [ 18 ]

La búsqueda de proyecciones busca una proyección a la vez de manera que la señal extraída sea lo menos gaussiana posible. Esto contrasta con el ICA, que normalmente extrae M señales simultáneamente de M mezclas de señales, lo que requiere estimar una matriz de desmezcla M × M. Una ventaja práctica de la búsqueda de proyecciones sobre el ICA es que se pueden extraer menos de M señales si es necesario, donde cada señal fuente se extrae de M mezclas de señales utilizando un vector de ponderación de M elementos.

Podemos utilizar la curtosis para recuperar la señal de múltiples fuentes encontrando los vectores de peso correctos mediante el uso de la búsqueda de proyección.

La curtosis de la función de densidad de probabilidad de una señal, para una muestra finita, se calcula como

K=mi[(yy¯)4](mi[(yy¯)2])23{\displaystyle K={\frac {\operatorname {E} [(\mathbf {y} -\mathbf {\overline {y}} )^{4}]}{(\operatorname {E} [(\mathbf {y} -\mathbf {\overline {y}} )^{2}])^{2}}}-3}

dóndey¯{\displaystyle \mathbf {\overline {y}} }es la media muestral dey{\displaystyle \mathbf {y} }, las señales extraídas. La constante 3 asegura que las señales gaussianas tengan curtosis cero, las señales supergaussianas tengan curtosis positiva y las señales subgaussianas tengan curtosis negativa. El denominador es la varianza dey{\displaystyle \mathbf {y} }y garantiza que la curtosis medida tenga en cuenta la varianza de la señal. El objetivo de la búsqueda de proyección es maximizar la curtosis y lograr que la señal extraída sea lo menos normal posible.

Utilizando la curtosis como medida de no normalidad, ahora podemos examinar cómo la curtosis de una señaly=wTincógnita{\displaystyle \mathbf {y} =\mathbf {w} ^{T}\mathbf {x} }extraído de un conjunto de mezclas Mincógnita=(incógnita1,incógnita2,,incógnitaMETRO)T{\displaystyle \mathbf {x} =(x_{1},x_{2},\ldots ,x_{M})^{T}}varía según el vector de pesow{\displaystyle \mathbf {w} }se rota alrededor del origen. Dado nuestro supuesto de que cada señal fuentes{\displaystyle \mathbf {s} }es supergaussiano como cabría esperar:

  1. la curtosis de la señal extraíday{\displaystyle \mathbf {y} }ser máximo precisamente cuandoy=s{\displaystyle \mathbf {y} =\mathbf {s} }.
  2. la curtosis de la señal extraíday{\displaystyle \mathbf {y} }ser máximo cuandow{\displaystyle \mathbf {w} }es ortogonal a los ejes proyectadosS1{\displaystyle S_{1}}oS2{\displaystyle S_{2}}porque sabemos que el vector de peso óptimo debe ser ortogonal a un eje transformado.S1{\displaystyle S_{1}}oS2{\displaystyle S_{2}}.

Para señales de mezcla de múltiples fuentes, podemos utilizar la curtosis y la ortogonalización de Gram-Schmidt (GSO) para recuperar las señales. Dada una mezcla de M señales en un espacio de M dimensiones, GSO proyecta estos puntos de datos en un espacio de ( M-1 ) dimensiones mediante el vector de pesos. Podemos garantizar la independencia de las señales extraídas con el uso de GSO.

Para encontrar el valor correcto dew{\displaystyle \mathbf {w} }Podemos utilizar el método de descenso de gradiente . En primer lugar, blanqueamos los datos y los transformamos.incógnita{\displaystyle \mathbf {x} }en una nueva mezclaz{\displaystyle \mathbf {z} }, que tiene varianza unitaria, yz=(z1,z2,,zMETRO)T{\displaystyle \mathbf {z} =(z_{1},z_{2},\ldots ,z_{M})^{T}}Este proceso se puede lograr aplicando la descomposición en valores singulares aincógnita{\displaystyle \mathbf {x} },

incógnita=UDVT{\displaystyle \mathbf {x} =\mathbf {U} \mathbf {D} \mathbf {V} ^{T}}

Reescalar cada vectorUi=Ui/mi(Ui2){\displaystyle U_{i}=U_{i}/\operatorname {E} (U_{i}^{2})}y dejarz=U{\displaystyle \mathbf {z} =\mathbf {U} }. La señal extraída por un vector ponderadow{\displaystyle \mathbf {w} }esy=wTz{\displaystyle \mathbf {y} =\mathbf {w} ^{T}\mathbf {z} }. Si el vector de pesos w tiene longitud unitaria, entonces la varianza de y también es 1, es decirmi[(wTz)2]=1{\displaystyle \operatorname {E} [(\mathbf {w} ^{T}\mathbf {z} )^{2}]=1}La curtosis se puede escribir, por lo tanto, como:

K=mi[y4](mi[y2])23=mi[(wTz)4]3.{\displaystyle K={\frac {\operatorname {E} [\mathbf {y} ^{4}]}{(\operatorname {E} [\mathbf {y} ^{2}])^{2}}}-3=\operatorname {E} [(\mathbf {w} ^{T}\mathbf {z} )^{4}]-3.}

El proceso de actualización paraw{\displaystyle \mathbf {w} }es:

wnortemiw=woldηmi[z(woldTz)3].{\displaystyle \mathbf {w} _{new}=\mathbf {w} _{old}-\eta \operatorname {E} [\mathbf {z} (\mathbf {w} _{old}^{T}\mathbf {z} )^{3}].}

dóndeη{\displaystyle \eta }es una pequeña constante para garantizar quew{\displaystyle \mathbf {w} }converge a la solución óptima. Después de cada actualización, normalizamoswnortemiw=wnortemiw|wnortemiw|{\displaystyle \mathbf {w} _{new}={\frac {\mathbf {w} _{new}}{|\mathbf {w} _{new}|}}}y establecerwold=wnortemiw{\displaystyle \mathbf {w} _{old}=\mathbf {w} _{new}}y repetir el proceso de actualización hasta la convergencia. También podemos usar otro algoritmo para actualizar el vector de pesos.w{\displaystyle \mathbf {w} }.

Otro enfoque es usar negentropía [ 10 ] [ 19 ] en lugar de curtosis. Usar negentropía es un método más robusto que curtosis, ya que curtosis es muy sensible a los valores atípicos. Los métodos de negentropía se basan en una propiedad importante de la distribución gaussiana: una variable gaussiana tiene la mayor entropía entre todas las variables aleatorias continuas de igual varianza. Esta es también la razón por la que queremos encontrar las variables más no gaussianas. Una demostración simple se puede encontrar en Entropía diferencial .

J(incógnita)=S(y)S(incógnita){\displaystyle J(x)=S(y)-S(x)\,}

y es una variable aleatoria gaussiana con la misma matriz de covarianza que x.

S(incógnita)=pagincógnita()registropagincógnita()d{\displaystyle S(x)=-\int p_{x}(u)\log p_{x}(u)du}

Una aproximación para la negentropía es

J(incógnita)=112(mi(incógnita3))2+148(krt(incógnita))2{\displaystyle J(x)={\frac {1}{12}}(E(x^{3}))^{2}+{\frac {1}{48}}(kurt(x))^{2}}

Una demostración se puede encontrar en los trabajos originales de Comon; [ 20 ] [ 10 ] ha sido reproducida en el libro Análisis de componentes independientes de Aapo Hyvärinen, Juha Karhunen y Erkki Oja [ 21 ] Esta aproximación también sufre del mismo problema que la curtosis (sensibilidad a los valores atípicos). Se han desarrollado otros enfoques. [ 22 ]

J(y)=k1(mi(GRAMO1(y)))2+k2(mi(GRAMO2(y))mi(GRAMO2(v))2{\displaystyle J(y)=k_{1}(E(G_{1}(y)))^{2}+k_{2}(E(G_{2}(y))-E(G_{2}(v))^{2}}

Una selección deGRAMO1{\displaystyle G_{1}}yGRAMO2{\displaystyle G_{2}}son

GRAMO1=1a1registro(aporrear(a1)){\displaystyle G_{1}={\frac {1}{a_{1}}}\log(\cosh(a_{1}u))}yGRAMO2=exp(22){\displaystyle G_{2}=-\exp(-{\frac {u^{2}}{2}})}

Basado en Infomax

Infomax ICA [ 23 ] es esencialmente una versión paralela y multivariada de la búsqueda de proyección. Mientras que la búsqueda de proyección extrae una serie de señales una a una de un conjunto de M mezclas de señales, ICA extrae M señales en paralelo. Esto tiende a hacer que ICA sea más robusto que la búsqueda de proyección. [ 24 ]

El método de proyección utiliza la ortogonalización de Gram-Schmidt para garantizar la independencia de la señal extraída, mientras que el ICA utiliza la estimación infomax y de máxima verosimilitud para asegurar la independencia de la señal extraída. La no normalidad de la señal extraída se logra asignándole un modelo apropiado, o distribución a priori.

El proceso de ICA basado en Infomax , en resumen, es: dado un conjunto de mezclas de señalesincógnita{\displaystyle \mathbf {x} }y un conjunto de funciones de distribución acumulativa (FDA) de modelos independientes e idénticos.gramo{\displaystyle g}, buscamos la matriz de desmezclaW{\displaystyle \mathbf {W} }lo que maximiza la entropía conjunta de las señalesY=gramo(y){\displaystyle \mathbf {Y} =g(\mathbf {y} )}, dóndey=Wincógnita{\displaystyle \mathbf {y} =\mathbf {Wx} }son las señales extraídas porW{\displaystyle \mathbf {W} }Dado el óptimoW{\displaystyle \mathbf {W} }las señalesY{\displaystyle \mathbf {Y} }tienen entropía máxima y por lo tanto son independientes, lo que garantiza que las señales extraídasy=gramo1(Y){\displaystyle \mathbf {y} =g^{-1}(\mathbf {Y} )}también son independientes.gramo{\displaystyle g}es una función invertible, y es el modelo de señal. Nótese que si la función de densidad de probabilidad del modelo de señal de la fuentepags{\displaystyle p_{s}}coincide con la función de densidad de probabilidad de la señal extraídapagy{\displaystyle p_{\mathbf {y} }}, luego maximizando la entropía conjunta deY{\displaystyle Y}también maximiza la cantidad de información mutua entreincógnita{\displaystyle \mathbf {x} }yY{\displaystyle \mathbf {Y} }Por esta razón, el uso de la entropía para extraer señales independientes se conoce como infomax .

Consideremos la entropía de la variable vectorial.Y=gramo(y){\displaystyle \mathbf {Y} =g(\mathbf {y} )}, dóndey=Wincógnita{\displaystyle \mathbf {y} =\mathbf {Wx} }es el conjunto de señales extraídas por la matriz de desmezclaW{\displaystyle \mathbf {W} }Para un conjunto finito de valores muestreados de una distribución con pdfpagy{\displaystyle p_{\mathbf {y} }}, la entropía deY{\displaystyle \mathbf {Y} }se puede estimar como:

H(Y)=1nortet=1nortelnpagY(Yt){\displaystyle H(\mathbf {Y} )=-{\frac {1}{N}}\sum _{t=1}^{N}\ln p_{\mathbf {Y} }(\mathbf {Y} ^{t})}

El PDF conjuntopagY{\displaystyle p_{\mathbf {Y} }}Se puede demostrar que está relacionado con la función de densidad de probabilidad conjunta.pagy{\displaystyle p_{\mathbf {y} }}de las señales extraídas mediante la forma multivariada:

pagY(Y)=pagy(y)|Yy|{\displaystyle p_{\mathbf {Y} }(Y)={\frac {p_{\mathbf {y} }(\mathbf {y} )}{|{\frac {\partial \mathbf {Y} }{\partial \mathbf {y} }}|}}}

dóndeJ=Yy{\displaystyle \mathbf {J} ={\frac {\partial \mathbf {Y} }{\partial \mathbf {y} }}}es la matriz jacobiana . Tenemos|J|=gramo(y){\displaystyle |\mathbf {J} |=g'(\mathbf {y} )}, ygramo{\displaystyle g'}¿Es la función de densidad de probabilidad (pdf) asumida para las señales fuente?gramo=pags{\displaystyle g'=p_{s}}, por lo tanto,

pagY(Y)=pagy(y)|Yy|=pagy(y)pags(y){\displaystyle p_{\mathbf {Y} }(Y)={\frac {p_{\mathbf {y} }(\mathbf {y} )}{|{\frac {\partial \mathbf {Y} }{\partial \mathbf {y} }}|}}={\frac {p_{\mathbf {y} }(\mathbf {y} )}{p_{\mathbf {s} }(\mathbf {y} )}}}

por lo tanto,

H(Y)=1nortet=1nortelnpagy(y)pags(y){\displaystyle H(\mathbf {Y} )=-{\frac {1}{N}}\sum _{t=1}^{N}\ln {\frac {p_{\mathbf {y} }(\mathbf {y} )}{p_{\mathbf {s} }(\mathbf {y} )}}}

Sabemos que cuandopagy=pags{\displaystyle p_{\mathbf {y} }=p_{s}},pagY{\displaystyle p_{\mathbf {Y} }}es de distribución uniforme yH(Y){\displaystyle H({\mathbf {Y} })}se maximiza. Dado que

pagy(y)=pagincógnita(incógnita)|yincógnita|=pagincógnita(incógnita)|W|{\displaystyle p_{\mathbf {y} }(\mathbf {y} )={\frac {p_{\mathbf {x} }(\mathbf {x} )}{|{\frac {\partial \mathbf {y} }{\partial \mathbf {x} }}|}}={\frac {p_{\mathbf {x} }(\mathbf {x} )}{|\mathbf {W} |}}}

dónde|W|{\displaystyle |\mathbf {W} |}es el valor absoluto del determinante de la matriz de desmezclaW{\displaystyle \mathbf {W} }. Por lo tanto,

H(Y)=1nortet=1nortelnpagincógnita(incógnitat)|W|pags(yt){\displaystyle H(\mathbf {Y} )=-{\frac {1}{N}}\sum _{t=1}^{N}\ln {\frac {p_{\mathbf {x} }(\mathbf {x} ^{t})}{|\mathbf {W} |p_{\mathbf {s} }(\mathbf {y} ^{t})}}}

entonces,

H(Y)=1nortet=1nortelnpags(yt)+ln|W|+H(incógnita){\displaystyle H(\mathbf {Y} )={\frac {1}{N}}\sum _{t=1}^{N}\ln p_{\mathbf {s} }(\mathbf {y} ^{t})+\ln |\mathbf {W} |+H(\mathbf {x} )}

desdeH(incógnita)=1nortet=1nortelnpagincógnita(incógnitat){\displaystyle H(\mathbf {x} )=-{\frac {1}{N}}\sum _{t=1}^{N}\ln p_{\mathbf {x} }(\mathbf {x} ^{t})}y maximizarW{\displaystyle \mathbf {W} }no afectaHincógnita{\displaystyle H_{\mathbf {x} }}, por lo que podemos maximizar la función

h(Y)=1nortet=1nortelnpags(yt)+ln|W|{\displaystyle h(\mathbf {Y} )={\frac {1}{N}}\sum _{t=1}^{N}\ln p_{\mathbf {s} }(\mathbf {y} ^{t})+\ln |\mathbf {W} |}

para lograr la independencia de la señal extraída.

Si hay M funciones de densidad de probabilidad marginales de la función de densidad de probabilidad conjunta del modelopags{\displaystyle p_{\mathbf {s} }}son independientes y utilizan la función de densidad de probabilidad del modelo supergaussiano común para las señales fuente.pags=(1tanh(s)2){\displaystyle p_{\mathbf {s} }=(1-\tanh(\mathbf {s} )^{2})}, entonces tenemos

h(Y)=1nortei=1METROt=1norteln(1tanh(wiTincógnitat)2)+ln|W|{\displaystyle h(\mathbf {Y} )={\frac {1}{N}}\sum _{i=1}^{M}\sum _{t=1}^{N}\ln(1-\tanh(\mathbf {w} _{i}^{\mathsf {T}}\mathbf {x} ^{t})^{2})+\ln |\mathbf {W} |}

En la suma, dada una mezcla de señales observada incógnita{\displaystyle \mathbf {x} }, el conjunto correspondiente de señales extraídas y{\displaystyle \mathbf {y} } y modelo de señal de fuentepags=gramo{\displaystyle p_{\mathbf {s} }=g'}, podemos encontrar la matriz de desmezcla óptimaW{\displaystyle \mathbf {W} }y hacer que las señales extraídas sean independientes y no gaussianas. Al igual que en el caso de la búsqueda de proyección, podemos usar el método de descenso de gradiente para encontrar la solución óptima de la matriz de desmezcla.

Basado en la estimación de máxima verosimilitud

La estimación de máxima verosimilitud (MLE) es una herramienta estadística estándar para encontrar valores de parámetros (por ejemplo, la matriz de desmezcla).W{\displaystyle \mathbf {W} }) que proporcionan el mejor ajuste de algunos datos (por ejemplo, las señales extraídas)y{\displaystyle y}) a un modelo dado (por ejemplo, la función de densidad de probabilidad conjunta supuesta (pdf)pags{\displaystyle p_{s}}de señales de fuente). [ 24 ]

El "modelo" de ML incluye una especificación de un pdf, que en este caso es el pdfpags{\displaystyle p_{s}}de las señales de la fuente desconocidas{\displaystyle s}. Utilizando ML ICA , el objetivo es encontrar una matriz de desmezcla que produzca señales extraídas.y=Wincógnita{\displaystyle y=\mathbf {W} x}con un pdf conjunto lo más similar posible al pdf conjuntopags{\displaystyle p_{s}}de las señales de la fuente desconocidas{\displaystyle s}.

Por lo tanto, MLE se basa en la suposición de que si la función de densidad de probabilidad del modelopags{\displaystyle p_{s}}y los parámetros del modeloA{\displaystyle \mathbf {A} }Si son correctos, entonces se debería obtener una alta probabilidad para los datos.incógnita{\displaystyle x}que fueron realmente observados. Por el contrario, siA{\displaystyle \mathbf {A} }Si los valores de los parámetros están lejos de ser correctos, entonces se esperaría una baja probabilidad de los datos observados.

Utilizando MLE , llamamos probabilidad de los datos observados para un conjunto dado de valores de parámetros del modelo (por ejemplo, una pdf)pags{\displaystyle p_{s}}y una matrizA{\displaystyle \mathbf {A} }) la probabilidad de los valores de los parámetros del modelo dados los datos observados.

Definimos una función de verosimilitudL(W){\displaystyle \mathbf {L(W)} }deW{\displaystyle \mathbf {W} }:

L(W)=pags(Wincógnita)|detW|.{\displaystyle \mathbf {L(W)} =p_{s}(\mathbf {W} x)|\det \mathbf {W} |.}

Esto equivale a la densidad de probabilidad enincógnita{\displaystyle x}, desdes=Wincógnita{\displaystyle s=\mathbf {W} x}.

Por lo tanto, si deseamos encontrar unW{\displaystyle \mathbf {W} }que es muy probable que haya generado las mezclas observadasincógnita{\displaystyle x}a partir de señales de fuente desconocidas{\displaystyle s}con pdfpags{\displaystyle p_{s}}entonces solo necesitamos encontrar esoW{\displaystyle \mathbf {W} }lo que maximiza la probabilidadL(W){\displaystyle \mathbf {L(W)} }La matriz de desmezcla que maximiza la ecuación se conoce como el estimador de máxima verosimilitud (MLE) de la matriz de desmezcla óptima.

Es práctica común utilizar la verosimilitud logarítmica , porque es más fácil de evaluar. Como el logaritmo es una función monótona,W{\displaystyle \mathbf {W} }que maximiza la funciónL(W){\displaystyle \mathbf {L(W)} }también maximiza su logaritmolnL(W){\displaystyle \ln \mathbf {L(W)} }Esto nos permite tomar el logaritmo de la ecuación anterior, lo que produce la función de verosimilitud logarítmica.

lnL(W)=itlnpags(wiTincógnitat)+norteln|detW|{\displaystyle \ln \mathbf {L(W)} =\sum _{i}\sum _{t}\ln p_{s}(w_{i}^{T}x_{t})+N\ln |\det \mathbf {W} |}

Si sustituimos una función de densidad de probabilidad (pdf) de un modelo de curtosis alta de uso común para las señales fuentepags=(1tanh(s)2){\displaystyle p_{s}=(1-\tanh(s)^{2})}entonces tenemos

lnL(W)=1norteiMETROtnorteln(1tanh(wiTincógnitat)2)+ln|detW|{\displaystyle \ln \mathbf {L(W)} ={1 \over N}\sum _{i}^{M}\sum _{t}^{N}\ln(1-\tanh(w_{i}^{T}x_{t})^{2})+\ln |\det \mathbf {W} |}

Esta matrizW{\displaystyle \mathbf {W} }que maximiza esta función es la estimación de máxima verosimilitud .

Historia y antecedentes

El marco general inicial para el análisis de componentes independientes fue introducido por Jeanny Hérault y Bernard Ans en 1984, [ 25 ] desarrollado posteriormente por Christian Jutten en 1985 y 1986, [ 2 ] [ 26 ] [ 27 ] y refinado por Pierre Comon en 1991, [ 20 ] y popularizado en su artículo de 1994. [ 10 ] En 1995, Tony Bell y Terry Sejnowski introdujeron un algoritmo ICA rápido y eficiente basado en infomax , un principio introducido por Ralph Linsker en 1987. Existe un vínculo entre la estimación de máxima verosimilitud y los enfoques Infomax. [ 28 ] JF. Cardoso publicó un tutorial bastante completo sobre el enfoque de máxima verosimilitud para ICA en 1998. [ 29 ]

Hay muchos algoritmos disponibles en la literatura que realizan ICA. Uno muy utilizado, incluso en aplicaciones industriales, es el algoritmo FastICA, desarrollado por Hyvärinen y Oja, [ 30 ] que utiliza la negentropía como función de costo, ya propuesta 7 años antes por Pierre Comon en este contexto. [ 10 ] Otros ejemplos están más relacionados con la separación ciega de fuentes donde se utiliza un enfoque más general. Por ejemplo, se puede prescindir del supuesto de independencia y separar señales mutuamente correlacionadas, es decir, señales estadísticamente "dependientes". Sepp Hochreiter y Jürgen Schmidhuber mostraron cómo obtener ICA no lineal o separación de fuentes como un subproducto de la regularización (1999). [ 31 ] Su método no requiere conocimiento a priori sobre el número de fuentes independientes.

Aplicaciones

ICA puede extenderse para analizar señales no físicas. Por ejemplo, ICA se ha aplicado para descubrir temas de discusión en un conjunto de archivos de listas de noticias.

A continuación se enumeran algunas aplicaciones de la ICA: [ 6 ]

Análisis de componentes independientes en EEGLAB

Disponibilidad

ICA se puede aplicar a través del siguiente software:

Véase también

Notas

  1. "Análisis de componentes independientes: una demostración" .
  2. ^ Ans , B., Hérault, J. y Jutten, C. (1985). Arquitecturas neuromimétiques adaptativas : Detección de primitivas. Cognitiva 85 (Vol. 2, págs. 593-597). París: CESTA.
  3. Hyvärinen, Aapo (2013). " Análisis de componentes independientes: avances recientes" . Philosophical Transactions: Mathematical, Physical and Engineering Sciences . 371 (1984) 20110534. Bibcode : 2012RSPTA.37110534H . doi : 10.1098 / rsta.2011.0534 . ISSN 1364-503X . JSTOR 41739975. PMC 3538438. PMID 23277597 .    
  4. Isomura, Takuya; Toyoizumi, Taro (2016). "Una regla de aprendizaje local para el análisis de componentes independientes" . Scientific Reports . 6 28073. Bibcode : 2016NatSR...628073I . doi : 10.1038/srep28073 . PMC 4914970. PMID 27323661 .  
  5. Comon, P.; Jutten C., (2010): Handbook of Blind Source Separation, Independent Component Analysis and Applications. Academic Press, Oxford, Reino Unido. ISBN 978-0-12-374726-6
  6. 1 2 Stone, James V. (2004). Análisis de componentes independientes: una introducción didáctica . Cambridge, Massachusetts: MIT Press. ISBN 978-0-262-69315-8.
  7. Hyvärinen, Aapo; Karhunen, Juha; Oja, Erkki (2001). Análisis de componentes independientes (1ª ed.). Nueva York: John Wiley & Sons. ISBN  978-0-471-22131-9.
  8. "Operación Historias Fantasma: Dentro del Caso del Espionaje Ruso" . FBI.gov . Oficina Federal de Investigación. 28 de junio de 2010.
  9. "Exingeniero de GE Power condenado por conspiración para cometer espionaje económico" . Justice.gov . Departamento de Justicia de EE. UU. 3 de enero de 2022.
  10. 1 2 3 4 5 Pierre Comon (1994) Análisis de componentes independientes, ¿un concepto nuevo? http://www.ece.ucsb.edu/wcsl/courses/ECE594/594C_F10Madhow/comon94.pdf
  11. 1 2 3 Holmes, M. (2023). Introducción a la computación científica y al análisis de datos, 2.ª ed . Springer. ISBN 978-3-031-22429-4.
  12. Holmes, Mark (2023). Introducción a la computación científica y al análisis de datos (2.ª ed.). Springer. ISBN  978-3-031-22429-4.
  13. Teorema 11, Comon, Pierre. "Análisis de componentes independientes, ¿un concepto nuevo?". Procesamiento de señales 36.3 (1994): 287-314.
  14. Johan Himberg y Aapo Hyvärinen, Análisis de componentes independientes para datos binarios: un estudio experimental , Actas del Taller Internacional sobre Análisis de Componentes Independientes y Separación Ciega de Señales (ICA2001), San Diego, California, 2001.
  15. Huy Nguyen y Rong Zheng, Análisis de componentes independientes binarios con mezclas or , IEEE Transactions on Signal Processing, Vol. 59, Número 7. (julio de 2011), págs. 3168 3181.
  16. Painsky, Amichai; Rosset, Saharon; Feder, Meir (2014). "Análisis generalizado de componentes independientes binarios". Simposio Internacional IEEE de Teoría de la Información de 2014. págs. 1326–1330 . doi : 10.1109/ISIT.2014.6875048 . ISBN  978-1-4799-5186-4. S2CID 18579555 . 
  17. James V. Stone (2004); "Análisis de componentes independientes: una introducción didáctica", The MIT Press, Cambridge, Massachusetts, Londres, Inglaterra; ISBN 0-262-69315-1
  18. Kruskal, JB. 1969; "Hacia un método práctico que ayuda a descubrir la estructura de un conjunto de observaciones al encontrar la transformación de línea que optimiza un nuevo "índice de condensación", Páginas 427–440 de: Milton, RC, & Nelder, JA (eds), Computación estadística; Nueva York, Academic Press
  19. Hyvärinen, Aapo; Erkki Oja (2000). "Análisis de componentes independientes: algoritmos y aplicaciones". Redes Neuronales . 4-5. 13 ( 4– 5): 411– 430. Bibcode : 2000NN.....13..411H . CiteSeerX 10.1.1.79.7003 . doi : 10.1016/s0893-6080(00)00026-5 . PMID 10946390 . S2CID 11959218 .   
  20. 1 2 P.Comon, Análisis de componentes independientes, Taller sobre estadística de orden superior, julio de 1991, republicado en JL. Lacoume, editor, Estadística de orden superior, págs. 29-38. Elsevier, Ámsterdam, Londres, 1992. Enlace HAL
  21. Hyvärinen, Aapo; Karhunen, Juha; Oja, Erkki (2001). Análisis de componentes independientes (Reimpresión ed.). Nueva York, Nueva York: Wiley. ISBN  978-0-471-40540-5.
  22. Hyvärinen, Aapo (1998). "Nuevas aproximaciones de la entropía diferencial para el análisis de componentes independientes y la búsqueda de proyecciones". Advances in Neural Information Processing Systems . 10 : 273–279 .
  23. Bell, AJ; Sejnowski, TJ (1995). "Un enfoque de maximización de la información para la separación ciega y la deconvolución ciega", Neural Computation, 7, 1129-1159
  24. 1 2 James V. Stone (2004). "Análisis de componentes independientes: una introducción didáctica", The MIT Press Cambridge, Massachusetts, Londres, Inglaterra; ISBN 0-262-69315-1
  25. ^ Hérault, J.; Respuesta, B. (1984). "Réseau de neurones à synapses modificables: Décodage de mensajes sensoriales compuestos por aprendizaje no supervisado y permanente". Cuentas Rendus de la Academia de Ciencias, Serie III . 299 : 525-528 .
  26. ^ Hérault, J., Jutten, C. y Ans, B. (1985). Detección de grandezas primitivas en un mensaje compuesto por una arquitectura de cálculo neuromimétique en aprendizaje no supervisado. Actas del décimo taller Traitement du signal et ses apps (Vol. 2, págs. 1017-1022). Niza (Francia): GRETSI.
  27. Hérault, J., & Jutten, C. (1986). Procesamiento de señales adaptativo espacio-temporal mediante modelos de redes neuronales. Conferencia Internacional sobre Redes Neuronales para la Computación (págs. 206-211). Snowbird (Utah, EE. UU.).
  28. JF.Cardoso, "Infomax y máxima verosimilitud para la separación de fuentes", IEEE Sig. Proc. Letters, 1997, 4(4):112-114.
  29. JF.Cardoso, "Separación ciega de señales: principios estadísticos", Proc. of the IEEE, 1998, 90(8):2009-2025.
  30. Hyvärinen, A.; Oja, E. (2000-06-01). "Análisis de componentes independientes: algoritmos y aplicaciones" (PDF) . Redes neuronales . 13 (4): 411– 430. Bibcode : 2000NN.....13..411H . doi : 10.1016 / S0893-6080(00)00026-5 . ISSN 0893-6080 . PMID 10946390. S2CID 11959218 .   
  31. Hochreiter, Sepp; Schmidhuber, Jürgen (1999). "Feature Extraction Through LOCOCODE" ( PDF) . Neural Computation . 11 (3): 679–714 . doi : 10.1162/089976699300016629 . ISSN 0899-7667 . PMID 10085426. S2CID 1642107. Archivado del original (PDF) el 6 de julio de 2017. Consultado el 24 de febrero de 2018 .   
  32. Ferreira, Artur J.; Figueiredo, Mário AT (2006). "Sobre el uso del análisis de componentes independientes para la compresión de imágenes" . Procesamiento de señales: Comunicación de imágenes . 21 (5): 378– 389. doi : 10.1016/j.image.2006.01.002 . ISSN 0923-5965 . 
  33. Brown, GD; Yamada, S; Sejnowski, TJ (2001). "Análisis de componentes independientes en la fiesta del cóctel neuronal". Trends in Neurosciences . 24 (1): 54– 63. doi : 10.1016/s0166-2236(00)01683-0 . PMID 11163888 . S2CID 511254 .  
  34. Lewicki, MS (1998). "Revisión de métodos para la clasificación de picos: detección y clasificación de potenciales de acción neuronales". Network: Computation in Neural Systems . 9 (4): 53– 78. Bibcode : 1998NCNS....9..R53L . doi : 10.1088/0954-898X_9_4_001 . S2CID 10290908 . 
  35. Barlett, MS (2001). Análisis de imágenes faciales mediante aprendizaje no supervisado . Boston: Kluwer International Series on Engineering and Computer Science.
  36. Bell, AJ; Sejnowski, TJ (1997). "Los componentes independientes de las escenas naturales son filtros de borde" . Vision Research . 37 (23): 3327– 3338. doi : 10.1016/s0042-6989(97)00121-1 . PMC 2882863. PMID 9425547 .  
  37. Back, AD; Weigend, AS (1997). "Una primera aplicación del análisis de componentes independientes para extraer la estructura de los rendimientos bursátiles" . International Journal of Neural Systems . 8 (4): 473– 484. Bibcode : 1997IJNS...08..473B . doi : 10.1142/s0129065797000458 . PMID 9730022. S2CID 872703 .  
  38. Hyvarinen, A, Karhunen, J y Oja, E (2001a). Análisis de componentes independientes . Nueva York: John Wiley and Sons.{{cite book}}: CS1 maint: varios nombres: lista de autores ( enlace )
  39. Polder, G; van der Heijen, FWAM (2003). "Estimación de la distribución de compuestos en imágenes espectrales de tomates mediante análisis de componentes independientes" . En R. Leitner (ed.). Imágenes espectrales. Actas del Taller Internacional de Carinthian Tech Research AG, Graz, Austria, 3 de abril de 2003. Viena, Austria: Sociedad Austriaca de Informática. págs. 57–64 . 
  40. Delorme, A; Sejnowski, T; Makeig, S (2007). "Detección mejorada de artefactos en datos de EEG mediante estadísticas de orden superior y análisis de componentes independientes" . NeuroImage . 34 ( 4): 1443– 1449. doi : 10.1016/j.neuroimage.2006.11.004 . PMC 2895624. PMID 17188898 .  
  41. Douglas, P (2013). "Decodificación de ensayos individuales de la toma de decisiones sobre creencias a partir de datos de EEG y fMRI utilizando características de componentes independientes" . Frontiers in Human Neuroscience . 7 : 392. doi : 10.3389/fnhum.2013.00392 . PMC 3728485. PMID 23914164 .  
  42. Trapnell, C; Cacchiarelli, D; Grimsby, J (2014). "La dinámica y los reguladores de las decisiones sobre el destino celular se revelan mediante el ordenamiento pseudotemporal de células individuales" . Nature Biotechnology . 32 (4): 381– 386. doi : 10.1038/nbt.2859 . PMC 4122333. PMID 24658644 .  
  43. ^ Kiviniemi, Vesa J.; Kantola, Juha-Heikki; Jauhiainen, Jukka; Hyvärinen, Aapo; Tervonen, Osmo (2003). "Análisis de componentes independientes de fuentes de señales de resonancia magnética funcional no deterministas". NeuroImagen . 19 (2): 253– 260. doi : 10.1016/S1053-8119(03)00097-1 . PMID 12814576 . S2CID 17110486 .  
  44. ^ Wang, Jingying; Xu, Haiguang; Gu, Junhua; An, Tao; Cui, Haijuan; Li, Jianxun; Zhang, Zhongli; Zheng, Qian; Wu, Xiang-Ping (1 de noviembre de 2010). "¿Cómo identificar y separar cúmulos de galaxias brillantes del cielo de radio de baja frecuencia?" . La revista astrofísica . 723 (1): 620– 633. arXiv : 1008.3391 . Código Bib : 2010ApJ...723..620W . doi : 10.1088/0004-637X/723/1/620 . ISSN 0004-637X . 
  45. Moraux, Franck; Villa, Christophe (2003). «La dinámica de la estructura temporal de los tipos de interés: un análisis de componentes independientes». Enfoques conexionistas en economía y ciencias de la gestión . Avances en ciencias de la gestión computacional. Vol. 6. págs. 215–232 . doi : 10.1007/978-1-4757-3722-6_11 . ISBN   978-1-4757-3722-6.

Referencias

  • Comon, Pierre (1994): "Análisis de componentes independientes: ¿un nuevo concepto?" Archivado el 4 de marzo de 2016 en Wayback Machine , Procesamiento de señales , 36(3):287–314 (El artículo original que describe el concepto de ICA)
  • Hyvarinen, A.; Karhunen, J.; Oja, E. (2001): Análisis de componentes independientes , Nueva York: Wiley, ISBN 978-0-471-40540-5( Capítulo introductorio )
  • Hyvärinen, A.; Oja, E. (2000): "Análisis de componentes independientes: algoritmos y aplicaciones" , Redes neuronales , 13(4-5):411-430. (Introducción técnica pero pedagógica).
  • Comon, P.; Jutten C., (2010): Manual de separación ciega de fuentes, análisis de componentes independientes y aplicaciones. Academic Press, Oxford, Reino Unido. ISBN 978-0-12-374726-6
  • Lee, T.-W. (1998): Análisis de componentes independientes: Teoría y aplicaciones , Boston, Mass: Kluwer Academic Publishers, ISBN 0-7923-8261-7
  • Acharyya, Ranjan (2008): Un nuevo enfoque para la separación ciega de fuentes convolutivas: separación basada en ondículas mediante función de contracción ISBN 3-639-07797-0ISBN 978-3639077971(Este libro se centra en el aprendizaje no supervisado con separación ciega de fuentes).
  • ¿Qué es el análisis de componentes independientes? por Aapo Hyvärinen
  • Análisis de componentes independientes: un tutorial de Aapo Hyvärinen
  • Tutorial sobre análisis de componentes independientes
  • FastICA como paquete para Matlab, en lenguaje R, C++
  • Cajas de herramientas ICALAB para Matlab, desarrolladas en RIKEN.
  • El kit de herramientas de análisis de señales de alto rendimiento proporciona implementaciones en C++ de FastICA e Infomax.
  • Herramientas ICA de Matlab para ICA con Bell-Sejnowski, Molgedey-Schuster y ICA de campo medio. Desarrolladas en la DTU.
  • Demostración del problema de la fiesta cóctel. Archivado el 13 de marzo de 2010 en Wayback Machine.
  • EEGLAB Toolbox es una herramienta para el análisis integrado de componentes (ICA) de EEG para Matlab, desarrollada en la UCSD.
  • FMRLAB Toolbox, herramienta ICA de fMRI para Matlab, desarrollada en la UCSD.
  • MELODIC , parte de la biblioteca de software FMRIB .
  • Análisis del uso de ICA en un contexto de representación de formas biomédicas.
  • Algoritmos FastICA, CuBICA, JADE y TDSEP para Python y más...
  • Caja de herramientas ICA de grupo y caja de herramientas ICA de fusión
  • Tutorial: Uso de ICA para la limpieza de señales EEG. Archivado el 4 de marzo de 2016 en Wayback Machine.