Articulo de referencia

Análisis discriminante lineal

Análisis discriminante lineal en un espacio bidimensional con dos clases. El límite bayesiano se calcula en función de los parámetros reales de generación de datos, el límite es...

Análisis discriminante lineal en un espacio bidimensional con dos clases. El límite bayesiano se calcula en función de los parámetros reales de generación de datos, el límite estimado en los puntos de datos realizados. [ 1 ]
Animación de análisis discriminante lineal. Dado un conjunto de datos con dos etiquetas, este se proyecta sobre una línea. La proyección óptima se obtiene cuando se maximiza la relación entre la varianza entre clases y la varianza dentro de cada clase.

El análisis discriminante lineal ( LDA ), el análisis discriminante normal ( NDA ), el análisis de variables canónicas ( CVA ) o el análisis de función discriminante son una generalización del discriminante lineal de Fisher , un método utilizado en estadística y otros campos para encontrar una combinación lineal de características que caracteriza o separa dos o más clases de objetos o eventos. La combinación resultante puede utilizarse como clasificador lineal o, más comúnmente, para la reducción de dimensionalidad antes de la clasificación posterior .

LDA está estrechamente relacionado con el análisis de varianza (ANOVA) y el análisis de regresión , que también intentan expresar una variable dependiente como una combinación lineal de otras características o mediciones. [ 2 ] [ 3 ] Sin embargo, ANOVA utiliza variables independientes categóricas y una variable dependiente continua , mientras que el análisis discriminante tiene variables independientes continuas y una variable dependiente categórica ( es decir, la etiqueta de clase). [ 4 ] La regresión logística y la regresión probit son más similares a LDA que ANOVA, ya que también explican una variable categórica por los valores de variables independientes continuas. Estos otros métodos son preferibles en aplicaciones donde no es razonable suponer que las variables independientes tienen una distribución normal , que es una suposición fundamental del método LDA.

LDA también está estrechamente relacionado con el análisis de componentes principales (PCA) y el análisis factorial, ya que ambos buscan combinaciones lineales de variables que mejor expliquen los datos. [ 5 ] LDA intenta explícitamente modelar la diferencia entre las clases de datos. PCA, en cambio, no toma en cuenta ninguna diferencia de clase, y el análisis factorial construye las combinaciones de características basándose en similitudes en lugar de diferencias. El análisis discriminante también se diferencia del análisis factorial en que no es una técnica de interdependencia: debe hacerse una distinción entre variables independientes y variables dependientes (también llamadas variables criterio).

El análisis discriminante lineal (LDA) funciona cuando las mediciones realizadas sobre las variables independientes para cada observación son cantidades continuas. Cuando se trata de variables independientes categóricas, la técnica equivalente es el análisis de correspondencia discriminante. [ 6 ] [ 7 ]

El análisis discriminante se utiliza cuando los grupos se conocen a priori (a diferencia del análisis de conglomerados ). Cada caso debe tener una puntuación en una o más medidas predictoras cuantitativas y una puntuación en una medida de grupo. [ 8 ] En términos sencillos, el análisis de función discriminante es una clasificación: el acto de distribuir elementos en grupos, clases o categorías del mismo tipo.

Historia

El análisis discriminante dicotómico original fue desarrollado por Sir Ronald Fisher en 1936. [ 9 ] Es diferente de un ANOVA o MANOVA , que se utiliza para predecir una (ANOVA) o varias (MANOVA) variables dependientes continuas a partir de una o más variables categóricas independientes. El análisis de la función discriminante es útil para determinar si un conjunto de variables es eficaz para predecir la pertenencia a una categoría. [ 10 ]

LDA para dos clases

Consideremos un conjunto de observacionesincógnita{\displaystyle {\vec {x}}}(también llamados características, atributos, variables o mediciones) para cada muestra de un objeto o evento con una clase conociday{\displaystyle y}Este conjunto de muestras se denomina conjunto de entrenamiento en un contexto de aprendizaje supervisado . El problema de clasificación consiste entonces en encontrar un buen predictor para la clasey{\displaystyle y}de cualquier muestra de la misma distribución (no necesariamente del conjunto de entrenamiento) dada solo una observaciónincógnita{\displaystyle {\vec {x}}}. [ 11 ] : 338

LDA aborda el problema asumiendo que las funciones de densidad de probabilidad condicionalpag(incógnita|y=0){\displaystyle p({\vec {x}}|y=0)}ypag(incógnita|y=1){\displaystyle p({\vec {x}}|y=1)}son ambas distribuciones normales con media y parámetros de covarianza(μ0,Σ0){\displaystyle \left({\vec {\mu }}_{0},\Sigma _{0}\right)}y(μ1,Σ1){\displaystyle \left({\vec {\mu }}_{1},\Sigma _{1}\right)}, respectivamente. Bajo este supuesto, la solución óptima de Bayes consiste en predecir que los puntos pertenecen a la segunda clase si el logaritmo de las razones de verosimilitud es mayor que un umbral T, de modo que:

12(incógnitaμ0)TΣ01(incógnitaμ0)+12ln|Σ0|12(incógnitaμ1)TΣ11(incógnitaμ1)12ln|Σ1| > T{\displaystyle {\frac {1}{2}}({\vec {x}}-{\vec {\mu }}_{0})^{\mathrm {T} }\Sigma _{0}^{-1}({\vec {x}}-{\vec {\mu }}_{0})+{\frac {1}{2}}\ln |\Sigma _{0}|-{\frac {1}{2}}({\vec {x}}-{\vec {\mu }}_{1})^{\mathrm {T} }\Sigma _{1}^{-1}({\vec {x}}-{\vec {\mu }}_{1})-{\frac {1}{2}}\ln |\Sigma _{1}|\ >\ T}

Sin hacer suposiciones adicionales, el clasificador resultante se denomina análisis discriminante cuadrático (QDA).

En cambio, LDA hace la suposición adicional simplificadora de homocedasticidad ( es decir, que las covarianzas de clase son idénticas, por lo queΣ0=Σ1=Σ{\displaystyle \Sigma _{0}=\Sigma _{1}=\Sigma }) y que las covarianzas tienen rango completo. En este caso, varios términos se cancelan:

incógnitaTΣ01incógnita=incógnitaTΣ11incógnita{\displaystyle {\vec {x}}^{\mathrm {T} }\Sigma _{0}^{-1}{\vec {x}}={\vec {x}}^{\mathrm {T} }\Sigma _{1}^{-1}{\vec {x}}}
incógnitaTΣi1μi=μiTΣi1incógnita{\displaystyle {\vec {x}}^{\mathrm {T} }{\Sigma _{i}}^{-1}{\vec {\mu }}_{i}={{\vec {\mu }}_{i}}^{\mathrm {T} }{\Sigma _{i}}^{-1}{\vec {x}}} porque ambos lados son escalares y se transponen uno al otro (Σi{\displaystyle \Sigma _{i}}es hermitiano )

y el criterio de decisión anterior se convierte en un umbral en el producto escalar.

wTincógnita>do{\displaystyle {\vec {w}}^{\mathrm {T} }{\vec {x}}>c}

para alguna constante umbral c , donde

w=Σ1(μ1μ0){\displaystyle {\vec {w}}=\Sigma ^{-1}({\vec {\mu }}_{1}-{\vec {\mu }}_{0})}
do=12wT(μ1+μ0){\displaystyle c={\frac {1}{2}}\,{\vec {w}}^{\mathrm {T} }({\vec {\mu }}_{1}+{\vec {\mu }}_{0})}

Esto significa que el criterio de una entradaincógnita{\displaystyle {\vec {x}}}estar en una clasey{\displaystyle y}es puramente una función de esta combinación lineal de las observaciones conocidas.

A menudo resulta útil ver esta conclusión en términos geométricos: el criterio de una entradaincógnita{\displaystyle {\vec {x}}}estar en una clasey{\displaystyle y}es puramente una función de proyección de un punto en un espacio multidimensionalincógnita{\displaystyle {\vec {x}}}sobre vectorw{\displaystyle {\vec {w}}}(por lo tanto, solo consideramos su dirección). En otras palabras, la observación pertenece ay{\displaystyle y}si correspondeincógnita{\displaystyle {\vec {x}}}está ubicado en cierto lado de un hiperplano perpendicular aw{\displaystyle {\vec {w}}}La ubicación del plano está definida por el umbral.do{\displaystyle c}.

Supuestos

Los supuestos del análisis discriminante son los mismos que los del MANOVA. El análisis es bastante sensible a los valores atípicos y el tamaño del grupo más pequeño debe ser mayor que el número de variables predictoras. [ 8 ]

Se ha sugerido que el análisis discriminante es relativamente robusto ante pequeñas violaciones de estos supuestos, [ 12 ] y también se ha demostrado que el análisis discriminante puede seguir siendo fiable cuando se utilizan variables dicotómicas (donde a menudo se viola la normalidad multivariante). [ 13 ]

funciones discriminantes

El análisis discriminante funciona creando una o más combinaciones lineales de predictores, creando una nueva variable latente para cada función. Estas funciones se denominan funciones discriminantes. El número de funciones posibles esnortegramo1{\displaystyle N_{g}-1}dóndenortegramo{\displaystyle N_{g}}= número de grupos, opag{\displaystyle p}(el número de predictores), el que sea menor. La primera función creada maximiza las diferencias entre grupos en dicha función. La segunda función maximiza las diferencias en esa función, pero tampoco debe estar correlacionada con la función anterior. Esto continúa con las funciones subsiguientes, con el requisito de que la nueva función no esté correlacionada con ninguna de las funciones anteriores.

Dado el grupoj{\displaystyle j}, con Rj{\displaystyle \mathbb {R} _{j}} conjuntos de espacio muestral, existe una regla discriminante tal que siincógnitaRj{\displaystyle x\in \mathbb {R} _{j}}, entoncesincógnitaj{\displaystyle x\in j}. El análisis discriminante entonces encuentra regiones “buenas” de Rj{\displaystyle \mathbb {R} _{j}}para minimizar el error de clasificación, lo que lleva a un alto porcentaje de clasificaciones correctas en la tabla de clasificación. [ 14 ]

A cada función se le asigna una puntuación discriminante para determinar qué tan bien predice la ubicación en el grupo.

  • Coeficientes de correlación de estructura: La correlación entre cada predictor y la puntuación discriminante de cada función. Esta es una correlación de orden cero (es decir, no corregida para los otros predictores). [ 15 ]
  • Coeficientes estandarizados: Peso de cada predictor en la combinación lineal que constituye la función discriminante. Al igual que en una ecuación de regresión, estos coeficientes son parciales (es decir, corregidos en función de los demás predictores). Indican la contribución única de cada predictor a la predicción de la asignación de grupo.
  • Funciones en los centroides de grupo: Se proporcionan las puntuaciones discriminantes medias para cada variable de agrupación para cada función. Cuanto mayor sea la diferencia entre las medias, menor será el error de clasificación.

Normas contra la discriminación

  • Máxima probabilidad : Asignaincógnita{\displaystyle x}al grupo que maximiza la densidad de población (grupo). [ 16 ]
  • Regla discriminante de Bayes: Asignaincógnita{\displaystyle x}al grupo que maximizaπiFi(incógnita){\displaystyle \pi _{i}f_{i}(x)}, donde π i representa la probabilidad previa de esa clasificación, yFi(incógnita){\displaystyle f_{i}(x)}representa la densidad de población. [ 16 ]
  • Regla discriminante lineal de Fisher : Maximiza la razón entre SS entre y SS dentro de , y encuentra una combinación lineal de los predictores para predecir el grupo. [ 16 ]

valores propios

Un valor propio en el análisis discriminante es la raíz característica de cada función. Es una indicación de qué tan bien esa función diferencia los grupos, donde cuanto mayor sea el valor propio, mejor diferenciará la función. [ 8 ] Sin embargo, esto debe interpretarse con precaución, ya que los valores propios no tienen límite superior. [ 10 ] [ 8 ] El valor propio puede verse como una razón de SS entre y SS dentro como en ANOVA cuando la variable dependiente es la función discriminante, y los grupos son los niveles de la VI . [ 10 ] Esto significa que el valor propio más grande está asociado con la primera función, el segundo más grande con la segunda, etc.

Tamaño del efecto

Algunos sugieren el uso de valores propios como medidas del tamaño del efecto ; sin embargo, esto generalmente no cuenta con respaldo. [ 10 ] En cambio, la correlación canónica es la medida preferida del tamaño del efecto. Es similar al valor propio, pero es la raíz cuadrada de la razón de SS entre y SS total . Es la correlación entre los grupos y la función. [ 10 ] Otra medida popular del tamaño del efecto es el porcentaje de varianza para cada función. Esto se calcula mediante:(λincógnitaiλi)×100{\displaystyle \left({\frac {\lambda _{x}}{\sum _{i}\lambda _{i}}}\right)\times 100}dóndeλincógnita{\displaystyle \lambda _{x}}es el valor propio de la función yiλi{\displaystyle \sum _{i}\lambda _{i}}es la suma de todos los valores propios. Esto nos indica cuán fuerte es la predicción para esa función en particular en comparación con las demás. [ 10 ] El porcentaje de clasificaciones correctas también puede analizarse como un tamaño del efecto. El valor kappa puede describir esto corrigiendo el acuerdo por azar. [ 10 ] Kappa normaliza en todas las categorías en lugar de estar sesgado por clases con un rendimiento significativamente bueno o malo. [ 17 ]

Análisis discriminante canónico para k clases

El análisis discriminante canónico (ADC) encuentra ejes ( k  1 coordenadas canónicas , donde k es el número de clases) que mejor separan las categorías. Estas funciones lineales no están correlacionadas y definen, en efecto, un espacio óptimo de k  1 dimensiones a través de la nube de datos n -dimensional que mejor separa (las proyecciones en ese espacio de) los k grupos. Consulte “ LDA multiclase ” para obtener más detalles a continuación.

Debido a que LDA utiliza variables canónicas, inicialmente se la conocía a menudo como el "método de variables canónicas" [ 18 ] o análisis de variables canónicas (CVA). [ 19 ]

Discriminante lineal de Fisher

Los términos discriminante lineal de Fisher y LDA se utilizan a menudo indistintamente, aunque el artículo original de Fisher [ 2 ] describe en realidad un discriminante ligeramente diferente, que no hace algunos de los supuestos de LDA, como clases distribuidas normalmente o covarianzas de clase iguales .

Supongamos que dos clases de observaciones tienen mediasμ0,μ1{\displaystyle {\vec {\mu }}_{0},{\vec {\mu }}_{1}}y covarianzasΣ0,Σ1{\displaystyle \Sigma _{0},\Sigma _{1}}Luego, la combinación lineal de característicaswTincógnita{\displaystyle {\vec {w}}^{\mathrm {T} }{\vec {x}}}tendrá medioswTμi{\displaystyle {\vec {w}}^{\mathrm {T} }{\vec {\mu }}_{i}}y variacioneswTΣiw{\displaystyle {\vec {w}}^{\mathrm {T} }\Sigma _{i}{\vec {w}}}parai=0,1{\displaystyle i=0,1}Fisher definió la separación entre estas dos distribuciones como la razón entre la varianza entre las clases y la varianza dentro de las clases:

S=σentre2σdentro2=(wμ1wμ0)2wTΣ1w+wTΣ0w=(w(μ1μ0))2wT(Σ0+Σ1)w{\displaystyle S={\frac {\sigma _{\text{between}}^{2}}{\sigma _{\text{within}}^{2}}}={\frac {({\vec {w}}\cdot {\vec {\mu }}_{1}-{\vec {w}}\cdot {\vec {\mu }}_{0})^{2}}{{\vec {w}}^{\mathrm {T} }\Sigma _{1}{\vec {w}}+{\vec {w}}^{\mathrm {T} }\Sigma _{0}{\vec {w}}}}={\frac {({\vec {w}}\cdot ({\vec {\mu }}_{1}-{\vec {\mu }}_{0}))^{2}}{{\vec {w}}^{\mathrm {T} }(\Sigma _{0}+\Sigma _{1}){\vec {w}}}}}

Esta medida es, en cierto sentido, una medida de la relación señal-ruido para el etiquetado de clases. Se puede demostrar que la separación máxima ocurre cuando

w(Σ0+Σ1)1(μ1μ0){\displaystyle {\vec {w}}\propto (\Sigma _{0}+\Sigma _{1})^{-1}({\vec {\mu }}_{1}-{\vec {\mu }}_{0})}

Cuando se cumplen los supuestos de LDA, la ecuación anterior es equivalente a LDA.

El discriminante lineal de Fisher visualizado como un eje

Asegúrese de tener en cuenta que el vectorw{\displaystyle {\vec {w}}}es la normal al hiperplano discriminante . Como ejemplo, en un problema bidimensional, la línea que mejor divide a los dos grupos es perpendicular aw{\displaystyle {\vec {w}}}.

Generalmente, los puntos de datos que se van a discriminar se proyectan sobrew{\displaystyle {\vec {w}}}; luego se elige el umbral que mejor separa los datos a partir del análisis de la distribución unidimensional. No existe una regla general para el umbral. Sin embargo, si las proyecciones de los puntos de ambas clases exhiben aproximadamente las mismas distribuciones, una buena opción sería el hiperplano entre las proyecciones de las dos medias,wμ0{\displaystyle {\vec {w}}\cdot {\vec {\mu }}_{0}}ywμ1{\displaystyle {\vec {w}}\cdot {\vec {\mu }}_{1}}En este caso, el parámetro c en la condición de umbralwincógnita>do{\displaystyle {\vec {w}}\cdot {\vec {x}}>c}se puede encontrar explícitamente:

do=w12(μ0+μ1)=12μ1TΣ11μ112μ0TΣ01μ0{\displaystyle c={\vec {w}}\cdot {\frac {1}{2}}({\vec {\mu }}_{0}+{\vec {\mu }}_{1})={\frac {1}{2}}{\vec {\mu }}_{1}^{\mathrm {T} }\Sigma _{1}^{-1}{\vec {\mu }}_{1}-{\frac {1}{2}}{\vec {\mu }}_{0}^{\mathrm {T} }\Sigma _{0}^{-1}{\vec {\mu }}_{0}}.

El método de Otsu está relacionado con el discriminante lineal de Fisher y fue creado para binarizar el histograma de píxeles en una imagen en escala de grises, seleccionando de forma óptima el umbral blanco/negro que minimiza la varianza intraclase y maximiza la varianza interclase dentro/entre las escalas de grises asignadas a las clases de píxeles blancos y negros.

LDA multiclase

Visualización de ejes LDA de uno contra todos para 4 clases en 3D
Proyecciones a lo largo de ejes discriminantes lineales para 4 clases

En el caso de que haya más de dos clases, el análisis utilizado en la derivación del discriminante de Fisher puede extenderse para encontrar un subespacio que parezca contener toda la variabilidad de clase. [ 20 ] Esta generalización se debe a CR Rao . [ 21 ] Supongamos que cada una de las C clases tiene una mediaμi{\displaystyle \mu _{i}}y la misma covarianzaΣ{\displaystyle \Sigma }Entonces, la dispersión entre la variabilidad de las clases puede definirse mediante la covarianza muestral de las medias de las clases.

Σb=1doi=1do(μiμ)(μiμ)T{\displaystyle \Sigma _{b}={\frac {1}{C}}\sum _{i=1}^{C}(\mu _{i}-\mu )(\mu _{i}-\mu )^{\mathrm {T} }}

dóndeμ{\displaystyle \mu }es la media de las medias de clase. La separación de clases en una direcciónw{\displaystyle {\vec {w}}}en este caso será dado por

S=wTΣbwwTΣw{\displaystyle S={\frac {{\vec {w}}^{\mathrm {T} }\Sigma _{b}{\vec {w}}}{{\vec {w}}^{\mathrm {T} }\Sigma {\vec {w}}}}}

Esto significa que cuandow{\displaystyle {\vec {w}}}es un vector propio deΣ1Σb{\displaystyle \Sigma ^{-1}\Sigma _{b}}La separación será igual al valor propio correspondiente .

SiΣ1Σb{\displaystyle \Sigma ^{-1}\Sigma _{b}}es diagonalizable, la variabilidad entre características estará contenida en el subespacio generado por los vectores propios correspondientes a los C  1 valores propios más grandes (ya queΣb{\displaystyle \Sigma _{b}}tiene un rango C  1 como máximo). Estos autovectores se utilizan principalmente en la reducción de características, como en PCA. Los autovectores correspondientes a los autovalores más pequeños tienden a ser muy sensibles a la elección exacta de los datos de entrenamiento, y a menudo es necesario utilizar la regularización descrita en la siguiente sección.

Si se requiere clasificación, en lugar de reducción de dimensionalidad , existen varias técnicas alternativas. Por ejemplo, las clases pueden dividirse y utilizarse un discriminante de Fisher estándar o LDA para clasificar cada partición. Un ejemplo común es el método "uno contra el resto", donde los puntos de una clase se agrupan y el resto se agrupan, y luego se aplica LDA. Esto dará como resultado C clasificadores, cuyos resultados se combinan. Otro método común es la clasificación por pares, donde se crea un nuevo clasificador para cada par de clases (obteniendo un total de C ( C  -  1)/2 clasificadores), y los clasificadores individuales se combinan para producir una clasificación final.

LDA incremental

La implementación típica de la técnica LDA requiere que todas las muestras estén disponibles de antemano. Sin embargo, hay situaciones en las que el conjunto de datos completo no está disponible y los datos de entrada se observan como un flujo. En este caso, es deseable que la extracción de características LDA tenga la capacidad de actualizar las características LDA calculadas observando las nuevas muestras sin ejecutar el algoritmo en todo el conjunto de datos. Por ejemplo, en muchas aplicaciones en tiempo real, como la robótica móvil o el reconocimiento facial en línea, es importante actualizar las características LDA extraídas tan pronto como haya nuevas observaciones disponibles. Una técnica de extracción de características LDA que puede actualizar las características LDA simplemente observando nuevas muestras es un algoritmo LDA incremental , y esta idea se ha estudiado ampliamente durante las últimas dos décadas. [ 22 ] Chatterjee y Roychowdhury propusieron un algoritmo LDA incremental autoorganizado para actualizar las características LDA. [ 23 ] En otro trabajo, Demir y Ozmehmet propusieron algoritmos de aprendizaje local en línea para actualizar las características LDA incrementalmente utilizando corrección de errores y reglas de aprendizaje hebbianas. [ 24 ] Posteriormente, Aliyari et al. derivaron algoritmos incrementales rápidos para actualizar las características LDA observando las nuevas muestras. [ 22 ]

Uso práctico

En la práctica, las medias y covarianzas de las clases son desconocidas. Sin embargo, pueden estimarse a partir del conjunto de entrenamiento. En las ecuaciones anteriores, se puede utilizar la estimación de máxima verosimilitud o la de máxima probabilidad a posteriori en lugar del valor exacto. Si bien las estimaciones de la covarianza pueden considerarse óptimas en cierto sentido, esto no implica que el discriminante resultante, obtenido al sustituir estos valores, sea óptimo en absoluto, incluso si se asume que las clases siguen una distribución normal.

Otra complicación al aplicar LDA y el discriminante de Fisher a datos reales ocurre cuando el número de mediciones de cada muestra (es decir, la dimensionalidad de cada vector de datos) excede el número de muestras en cada clase. [ 5 ] En este caso, las estimaciones de covarianza no tienen rango completo y, por lo tanto, no se pueden invertir. Hay varias maneras de abordar esto. Una es usar una pseudoinversa en lugar de la inversa de matriz habitual en las fórmulas anteriores. Sin embargo, se puede lograr una mejor estabilidad numérica proyectando primero el problema en el subespacio generado porΣb{\displaystyle \Sigma _{b}}. [ 25 ] Otra estrategia para lidiar con tamaños de muestra pequeños es utilizar un estimador de contracción de la matriz de covarianza, que puede expresarse matemáticamente como

Σ=(1λ)Σ+λI{\displaystyle \Sigma =(1-\lambda )\Sigma +\lambda I\,}

dóndeI{\displaystyle I}es la matriz identidad, yλ{\displaystyle \lambda }es la intensidad de contracción o parámetro de regularización . Esto conduce al marco del análisis discriminante regularizado [ 26 ] o análisis discriminante de contracción. [ 27 ]

Además, en muchos casos prácticos, los discriminantes lineales no son adecuados. El análisis discriminante lineal (LDA) y el discriminante de Fisher pueden extenderse para su uso en la clasificación no lineal mediante el método del kernel . En este método, las observaciones originales se transforman en un espacio no lineal de mayor dimensión. La clasificación lineal en este espacio no lineal es entonces equivalente a la clasificación no lineal en el espacio original. El ejemplo más común es el discriminante de Fisher con kernel .

LDA se puede generalizar al análisis discriminante múltiple , donde c se convierte en una variable categórica con N estados posibles, en lugar de solo dos. Análogamente, si las densidades condicionales de clasepag(incógnitado=i){\displaystyle p({\vec {x}}\mid c=i)}son normales con covarianzas compartidas, el estadístico suficiente paraPAG(doincógnita){\displaystyle P(c\mid {\vec {x}})}son los valores de N proyecciones, que son el subespacio generado por las N medias, proyectadas afínmente por la matriz de covarianza inversa. Estas proyecciones se pueden obtener resolviendo un problema generalizado de valores propios , donde el numerador es la matriz de covarianza formada al tratar las medias como muestras, y el denominador es la matriz de covarianza compartida. Consulte “ LDA multiclase ” más arriba para obtener más detalles.

Aplicaciones

Además de los ejemplos que se muestran a continuación, LDA se aplica en el posicionamiento y la gestión de productos .

Predicción de quiebra

En la predicción de quiebras basada en ratios contables y otras variables financieras, el análisis discriminante lineal fue el primer método estadístico aplicado para explicar sistemáticamente qué empresas entraron en quiebra y cuáles sobrevivieron. A pesar de las limitaciones, incluida la conocida falta de conformidad de los ratios contables con los supuestos de distribución normal del análisis discriminante lineal, el modelo de Edward Altman de 1968 [ 28 ] sigue siendo un modelo líder en aplicaciones prácticas. [ 29 ] [ 30 ] [ 31 ]

Reconocimiento facial

En el reconocimiento facial computarizado , cada rostro se representa mediante un gran número de valores de píxeles. El análisis discriminante lineal se utiliza principalmente para reducir el número de características a una cantidad más manejable antes de la clasificación. Cada una de las nuevas dimensiones es una combinación lineal de valores de píxeles, que forman una plantilla. Las combinaciones lineales obtenidas mediante el discriminante lineal de Fisher se denominan rostros de Fisher , mientras que las obtenidas mediante el análisis de componentes principales relacionado se denominan eigenfaces .

Marketing

En marketing , el análisis discriminante se utilizaba con frecuencia para determinar los factores que distinguen a diferentes tipos de clientes y/o productos a partir de encuestas u otros datos recopilados. Actualmente, se utilizan con mayor frecuencia la regresión logística y otros métodos. El uso del análisis discriminante en marketing se puede describir mediante los siguientes pasos:

  1. Formular el problema y recopilar datos: identificar los atributos más relevantes que los consumidores utilizan para evaluar los productos de esta categoría; utilizar técnicas de investigación de mercado cuantitativas (como encuestas ) para recopilar datos de una muestra de clientes potenciales sobre sus valoraciones de todos los atributos del producto. La etapa de recopilación de datos suele estar a cargo de profesionales de la investigación de mercado. Las preguntas de la encuesta piden al encuestado que valore un producto del uno al cinco (o del 1 al 7, o del 1 al 10) en una serie de atributos elegidos por el investigador. Se eligen entre cinco y veinte atributos. Estos podrían incluir aspectos como: facilidad de uso, peso, precisión, durabilidad, variedad de colores, precio o tamaño. Los atributos elegidos variarán según el producto estudiado. Se formula la misma pregunta para todos los productos del estudio. Los datos de varios productos se codifican y se introducen en un programa estadístico como R , SPSS o SAS . (Este paso es el mismo que en el análisis factorial).
  2. Estimar los coeficientes de la función discriminante y determinar la significancia estadística y la validez: elegir el método de análisis discriminante apropiado. El método directo implica estimar la función discriminante de modo que todos los predictores se evalúen simultáneamente. El método paso a paso ingresa los predictores secuencialmente. El método de dos grupos debe usarse cuando la variable dependiente tiene dos categorías o estados. El método discriminante múltiple se usa cuando la variable dependiente tiene tres o más estados categóricos. Use la Lambda de Wilks para probar la significancia en SPSS o el estadístico F en SAS. El método más común utilizado para probar la validez es dividir la muestra en una muestra de estimación o análisis y una muestra de validación o de prueba. La muestra de estimación se usa para construir la función discriminante. La muestra de validación se usa para construir una matriz de clasificación que contiene el número de casos clasificados correctamente e incorrectamente. El porcentaje de casos clasificados correctamente se llama razón de aciertos .
  3. Represente los resultados en un mapa bidimensional, defina las dimensiones e interprete los resultados. El programa estadístico (o un módulo relacionado) generará el mapa. El mapa representará cada producto (generalmente en un espacio bidimensional). La distancia entre los productos indica su grado de diferencia. El investigador debe etiquetar las dimensiones. Esto requiere un juicio subjetivo y suele ser muy complejo. Véase mapeo perceptual .

Estudios biomédicos

La principal aplicación del análisis discriminante en medicina es la evaluación de la gravedad de la enfermedad en un paciente y el pronóstico de su evolución. Por ejemplo, durante un análisis retrospectivo, los pacientes se dividen en grupos según la gravedad de la enfermedad: leve, moderada y grave. A continuación, se estudian los resultados de los análisis clínicos y de laboratorio para identificar variables estadísticamente diferentes en estos grupos. Utilizando estas variables, se construyen funciones discriminantes para clasificar la gravedad de la enfermedad en futuros pacientes. Además, el análisis discriminante lineal (LDA) puede ayudar a seleccionar muestras más discriminantes para el aumento de datos, mejorando así el rendimiento de la clasificación. [ 32 ]

En biología, se utilizan principios similares para clasificar y definir grupos de diferentes objetos biológicos, por ejemplo, para definir tipos de fagos de Salmonella enteritidis basándose en espectros infrarrojos de transformada de Fourier, [ 33 ] para detectar la fuente animal de Escherichia coli estudiando sus factores de virulencia [ 34 ] etc.

Ciencias de la Tierra

Este método puede utilizarse para separar zonas dentro de sistemas minerales que sufrieron diferentes estilos de alteración . Por ejemplo, cuando se dispone de datos de distintas zonas, el análisis discriminante puede encontrar patrones dentro de los datos y clasificarlos eficazmente. [ 35 ]

Comparación con la regresión logística

El análisis de función discriminante es muy similar a la regresión logística , y ambos pueden usarse para responder las mismas preguntas de investigación. [ 10 ] La regresión logística no tiene tantas suposiciones y restricciones como el análisis discriminante. Sin embargo, cuando se cumplen las suposiciones del análisis discriminante, este es más potente que la regresión logística. [ 36 ] A diferencia de la regresión logística, el análisis discriminante puede usarse con tamaños de muestra pequeños. Se ha demostrado que cuando los tamaños de muestra son iguales y se cumple la homogeneidad de varianza/covarianza, el análisis discriminante es más preciso. [ 8 ] A pesar de todas estas ventajas, la regresión logística se ha convertido en la opción común, ya que rara vez se cumplen las suposiciones del análisis discriminante. [ 9 ] [ 8 ]

Discriminante lineal en altas dimensiones

Las anomalías geométricas en dimensiones superiores conducen a la conocida maldición de la dimensionalidad . Sin embargo, la utilización adecuada de los fenómenos de concentración de medidas puede facilitar el cálculo. [ 37 ] Un caso importante de estos fenómenos de bendición de la dimensionalidad fue destacado por Donoho y Tanner: si una muestra es esencialmente de alta dimensión, entonces cada punto puede separarse del resto de la muestra mediante una desigualdad lineal, con alta probabilidad, incluso para muestras exponencialmente grandes. [ 38 ] Estas desigualdades lineales pueden seleccionarse en la forma estándar (de Fisher) del discriminante lineal para una rica familia de distribuciones de probabilidad. [ 39 ] En particular, tales teoremas se demuestran para distribuciones log-cóncavas, incluida la distribución normal multidimensional (la demostración se basa en las desigualdades de concentración para medidas log-cóncavas [ 40 ] ) y para medidas de producto en un cubo multidimensional (esto se demuestra utilizando la desigualdad de concentración de Talagrand para espacios de probabilidad de producto). La separabilidad de datos mediante discriminantes lineales clásicos simplifica el problema de la corrección de errores para sistemas de inteligencia artificial en alta dimensión. [ 41 ]

Véase también

Referencias

  1. Holtel, Frederik (2023-02-20). "El análisis discriminante lineal (LDA) puede ser muy fácil" . Medium . Consultado el 18 de mayo de 2024 .
  2. 1 2 Fisher, RA (1936). "El uso de mediciones múltiples en problemas taxonómicos" (PDF) . Anales de Eugenesia . 7 (2): 179– 188. doi : 10.1111/j.1469-1809.1936.tb02137.x . hdl : 2440/15227 .
  3. McLachlan, GJ (2004). Análisis discriminante y reconocimiento estadístico de patrones . Wiley Interscience. ISBN 978-0-471-69115-0. MR 1190469 . 
  4. Análisis de datos cuantitativos: una introducción para investigadores sociales, Debra Wetcher-Hendricks, pág. 288
  5. 1 2 Martínez, AM; Kak, AC (2001). "PCA versus LDA" (PDF) . IEEE Transactions on Pattern Analysis and Machine Intelligence . 23 (2): 228– 233. doi : 10.1109/34.908974 . Archivado del original (PDF) el 11 de octubre de 2008. Recuperado el 30 de junio de 2010 .
  6. Abdi, H. (2007) "Análisis de correspondencia discriminante". En: NJ Salkind (Ed.): Enciclopedia de medición y estadística . Thousand Oaks (CA): Sage. pp. 270–275.
  7. Perriere, G.; Thioulouse, J. (2003). "Uso del análisis discriminante de correspondencia para predecir la localización subcelular de proteínas bacterianas". Computer Methods and Programs in Biomedicine . 70 (2): 99– 105. doi : 10.1016/s0169-2607(02)00011-1 . PMID 12507786 . 
  8. 1 2 3 4 5 6 7 8 9 Büyüköztürk, Ş. & Çokluk-Bökeoğlu, Ö. (2008). Análisis de funciones discriminantes: Concepto y aplicación . Egitim Arastirmalari - Revista euroasiática de investigación educativa, 33, 73-92.
  9. 1 2 Cohen et al. Análisis de regresión/correlación múltiple aplicada a las ciencias del comportamiento 3.ª ed. (2003). Taylor & Francis Group.
  10. 1 2 3 4 5 6 7 8 9 10 11 Hansen, John (2005). "Uso de SPSS para Windows y Macintosh: análisis y comprensión de datos" . The American Statistician . 59 : 113. doi : 10.1198/tas.2005.s139 .
  11. Venables, WN; Ripley, BD (2002). Modern Applied Statistics with S (4.ª ed.). Springer Verlag. ISBN  978-0-387-95457-8.
  12. Peter A. Lachenbruch . (1975). Análisis discriminante . Nueva York: Hafner
  13. Klecka, William R. (1980). Análisis discriminante . Serie Aplicaciones cuantitativas en las ciencias sociales, n.° 19. Thousand Oaks, CA: Sage Publications.
  14. Hardle, W., Simar, L. (2007). Análisis estadístico multivariante aplicado . Springer Berlin Heidelberg. pp. 289–303.
  15. Garson, GD (2008). Análisis de función discriminante. https://web.archive.org/web/20080312065328/http://www2.chass.ncsu.edu/garson/pA765/discrim.htm .
  16. 1 2 3 Hardle, W., Simar, L. (2007). Análisis estadístico multivariante aplicado . Springer Berlin Heidelberg. pp. 289-303.
  17. Israel, Steven A. (junio de 2006). "Métricas de rendimiento: cómo y cuándo". Geocarto International . 21 (2): 23– 32. Bibcode : 2006GeoIn..21...23I . doi : 10.1080/10106040608542380 . ISSN 1010-6049 . S2CID 122376081 .  
  18. Nabney, Ian (2002). Netlab: Algoritmos para el reconocimiento de patrones . pág. 274. ISBN  1-85233-440-1.
  19. Magwene, Paul (2023). "Capítulo 14: Análisis de variables canónicas". Computación estadística para biólogos .
  20. Garson, GD (2008). Análisis de función discriminante. "PA 765: Análisis de función discriminante" . Archivado del original el 12 de marzo de 2008. Recuperado el 4 de marzo de 2008 ..
  21. Rao, RC (1948). "La utilización de mediciones múltiples en problemas de clasificación biológica". Journal of the Royal Statistical Society, Serie B. 10 ( 2): 159– 203. doi : 10.1111/j.2517-6161.1948.tb00008.x . JSTOR 2983775 . 
  22. ^ Aliyari Ghassabeh, Youness; Rudzicz, Frank; Moghaddam, Hamid Abrishami (1 de junio de 2015). "Extracción rápida e incremental de funciones LDA". Reconocimiento de patrones . 48 (6): 1999–2012 . Bibcode : 2015PatRe..48.1999A . doi : 10.1016/j.patcog.2014.12.012 .
  23. Chatterjee, C.; Roychowdhury, VP (1997-05-01). "Sobre algoritmos y redes autoorganizadas para características de separabilidad de clases". IEEE Transactions on Neural Networks . 8 (3): 663– 678. doi : 10.1109/72.572105 . ISSN 1045-9227 . PMID 18255669 .  
  24. Demir, GK; Ozmehmet, K. (2005-03-01). "Algoritmos de aprendizaje local en línea para el análisis discriminante lineal". Pattern Recognit. Lett . 26 (4): 421– 431. Bibcode : 2005PaReL..26..421D . doi : 10.1016/j.patrec.2004.08.005 . ISSN 0167-8655 . 
  25. Yu, H.; Yang, J. (2001). "Un algoritmo LDA directo para datos de alta dimensión: con aplicación al reconocimiento facial". Pattern Recognition . 34 (10): 2067– 2069. Bibcode : 2001PatRe..34.2067Y . CiteSeerX 10.1.1.70.3507 . doi : 10.1016/s0031-3203(00)00162-x . 
  26. Friedman, JH (1989). "Análisis discriminante regularizado" ( PDF) . Journal of the American Statistical Association . 84 (405): 165– 175. CiteSeerX 10.1.1.382.2682 . doi : 10.2307/2289860 . JSTOR 2289860. MR 0999675 .   
  27. Ahdesmäki, M.; Strimmer, K. (2010). "Selección de características en problemas de predicción ómica utilizando puntuaciones CAT y control de la tasa de falsos negativos". Annals of Applied Statistics . 4 (1): 503– 519. arXiv : 0903.2003 . doi : 10.1214/09-aoas277 . S2CID 2508935 . 
  28. Altman, Edward I. (1968). "Ratios financieros, análisis discriminante y predicción de la quiebra corporativa". The Journal of Finance . 23 (4): 589– 609. doi : 10.2307/2978933 . JSTOR 2978933 . 
  29. Agarwal, Vineet; Taffler, Richard (2005). "Veinticinco años de puntuaciones z en el Reino Unido: ¿realmente funcionan?" (PDF) .
  30. Agarwal, Vineet; Taffler, Richard (2007). "Veinticinco años del modelo de puntuación Z de Taffler: ¿Realmente tiene capacidad predictiva?". Accounting and Business Research . 37 (4): 285– 300. doi : 10.1080/00014788.2007.9663313 .
  31. Bimpong, Patrick; et al. (2020). "Evaluación del poder predictivo y manipulación de ganancias. Estudio aplicado en empresas cotizadas de bienes y servicios de consumo en Ghana utilizando 3 modelos de puntuación Z" . Expert Journal of Finance . 8 (1): 1– 26. 
  32. Moradi, M; Demirel, H (2024). "Clasificación de la enfermedad de Alzheimer mediante selección de datos basada en GAN condicional progresiva 3D y LDA". Procesamiento de señales, imágenes y vídeo . 18 (2): 1847– 1861. doi : 10.1007/s11760-023-02878-4 .
  33. Preisner, O; Guiomar, R; Machado, J; Menezes, JC; Lopes, JA (2010). "Aplicación de la espectroscopia infrarroja por transformada de Fourier y la quimiometría para la diferenciación de los fagotipos de Salmonella enterica serovar Enteritidis" . Appl Environ Microbiol . 76 (11): 3538– 3544. Bibcode : 2010ApEnM..76.3538P . doi : 10.1128/aem.01589-09 . PMC 2876429. PMID 20363777 .  
  34. David, DE; Lynne, AM; Han, J; Foley, SL (2010). "Evaluación del perfil de factores de virulencia en la caracterización de aislamientos veterinarios de Escherichia coli" . Appl Environ Microbiol . 76 (22): 7509– 7513. Bibcode : 2010ApEnM..76.7509D . doi : 10.1128/aem.00726-10 . PMC 2976202. PMID 20889790 .  
  35. Tahmasebi, P.; Hezarkhani, A.; Mortazavi, M. (2010). "Aplicación del análisis discriminante para la separación de alteraciones; depósito de cobre de Sungun, Azerbaiyán Oriental, Irán. Australiano" (PDF) . Revista de Ciencias Básicas y Aplicadas . 6 (4): 564– 576.
  36. Trevor Hastie; Robert Tibshirani; Jerome Friedman. Los elementos del aprendizaje estadístico. Minería de datos, inferencia y predicción (segunda edición). Springer. pág. 128.  
  37. Kainen PC (1997) Utilización de anomalías geométricas de alta dimensión: Cuando la complejidad facilita el cálculo . En: Kárný M., Warwick K. (eds) Métodos computacionales intensivos en control y procesamiento de señales: La maldición de la dimensionalidad, Springer, 1997, pp. 282–294.
  38. Donoho, D., Tanner, J. (2009) Universalidad observada de las transiciones de fase en geometría de alta dimensión, con implicaciones para el análisis de datos y el procesamiento de señales modernos , Phil. Trans. R. Soc. A 367, 4273–4293.
  39. Gorban, Alexander N.; Golubkov, Alexander; Grechuck, Bogdan; Mirkes, Evgeny M.; Tyukin, Ivan Y. (2018). "Corrección de sistemas de IA mediante discriminantes lineales: fundamentos probabilísticos". Information Sciences . 466 : 303–322 . arXiv : 1811.05321 . doi : 10.1016/j.ins.2018.07.040 . S2CID 52876539 . 
  40. Guédon, O., Milman, E. (2011) Interpolación de estimaciones de capa delgada y de grandes desviaciones agudas para medidas logarítmicas cóncavas isotrópicas , Geom. Funct. Anal. 21 (5), 1043–1068.
  41. Gorban, Alexander N.; Makarov, Valeri A.; Tyukin, Ivan Y. (julio de 2019). "La eficacia irrazonable de pequeños conjuntos neuronales en el cerebro de alta dimensión" . Physics of Life Reviews . 29 : 55–88 . arXiv : 1809.07656 . Bibcode : 2019PhLRv..29...55G . doi : 10.1016/j.plrev.2018.09.005 . PMID 30366739 . 

Lecturas adicionales

  • Duda, RO; Hart, PE; Stork, DH (2000). Clasificación de patrones (2.ª  ed.). Wiley Interscience. ISBN 978-0-471-05669-0. MR 1802993 . 
  • Hilbe, JM (2009). Modelos de regresión logística . Chapman & Hall/CRC Press. ISBN 978-1-4200-7575-5.
  • Mika, S.; et  al. (1999). "Análisis discriminante de Fisher con núcleos". Redes neuronales para el procesamiento de señales IX: Actas del taller de la Sociedad de Procesamiento de Señales del IEEE de 1999 (Cat. No. 98TH8468) . págs. 41–48 . CiteSeerX 10.1.1.35.9904 . doi : 10.1109/NNSP.1999.788121 . ISBN   978-0-7803-5673-3. S2CID 8473401 . 
  • McFarland, H. Richard; Donald, St. P. Richards (2001). "Probabilidades exactas de clasificación errónea para funciones discriminantes cuadráticas normales de sustitución. I. El caso de medias iguales" . Journal of Multivariate Analysis . 77 (1): 21– 53. doi : 10.1006/jmva.2000.1924 .
  • McFarland, H. Richard; Donald, St. P. Richards (2002). "Probabilidades exactas de clasificación errónea para funciones discriminantes cuadráticas normales de sustitución. II. El caso heterogéneo" . Journal of Multivariate Analysis . 82 (2): 299– 330. doi : 10.1006/jmva.2001.2034 .
  • Haghighat, M.; Abdel-Mottaleb, M.; Alhalabi, W. (2016). "Análisis de correlación discriminante: fusión de características en tiempo real para el reconocimiento biométrico multimodal" . IEEE Transactions on Information Forensics and Security . 11 (9): 1984– 1996. doi : 10.1109/TIFS.2016.2569061 . S2CID 15624506 . 
  • Análisis de correlación discriminante (ACD) del artículo de Haghighat (ver más arriba)
  • ALGLIB contiene una implementación de LDA de código abierto en C# / C++ / Pascal / VBA.
  • LDA en Python - Implementación de LDA en Python
  • Tutorial de LDA usando MS Excel
  • Estadística biomédica. Análisis discriminante.
  • StatQuest: Análisis discriminante lineal (LDA) explicado claramente en YouTube.
  • Apuntes del curso: Análisis de funciones discriminantes, por G. David Garson, Universidad Estatal de Carolina del Norte.
  • Tutorial de análisis discriminante en Microsoft Excel por Kardi Teknomo
  • Apuntes del curso, Análisis de funciones discriminantes por David W. Stockburger, Universidad Estatal de Missouri. Archivado el 3 de marzo de 2016 en Wayback Machine.
  • Análisis de función discriminante (AD) por John Poulsen y Aaron French, Universidad Estatal de San Francisco. Archivado el 15 de diciembre de 2011 en Wayback Machine.