Articulo de referencia

Medida de similitud

En estadística y campos afines, una medida de similitud , función de similitud o métrica de similitud es una función de valor real que cuantifica la similitud entre dos objetos....

En estadística y campos afines, una medida de similitud , función de similitud o métrica de similitud es una función de valor real que cuantifica la similitud entre dos objetos. Si bien no existe una única definición de similitud, estas medidas suelen ser, en cierto sentido, la inversa de las métricas de distancia : toman valores grandes para objetos similares y cero o un valor negativo para objetos muy diferentes. En términos más generales, una función de similitud también puede satisfacer axiomas métricos.

La similitud del coseno es una medida de similitud comúnmente utilizada para vectores de valores reales, empleada en (entre otros campos) la recuperación de información para puntuar la similitud de documentos en el modelo de espacio vectorial . En el aprendizaje automático , las funciones de núcleo comunes , como el núcleo RBF, pueden considerarse funciones de similitud. [ 1 ]

Uso de diferentes fórmulas de medida de similitud

Existen diferentes tipos de medidas de similitud para distintos tipos de objetos, dependiendo de los objetos que se comparen. Para cada tipo de objeto existen diversas fórmulas de medición de similitud. [ 2 ]

Similitud entre dos puntos de datos

La imagen muestra el proceso de cálculo al utilizar la fórmula de la distancia euclidiana.

Existen diversas opciones para encontrar similitud entre dos puntos de datos, algunas de las cuales combinan diferentes métodos. Entre estos métodos se incluyen la distancia euclidiana, la distancia de Manhattan, la distancia de Minkowski y la distancia de Chebyshev. La fórmula de la distancia euclidiana se utiliza para calcular la distancia entre dos puntos en un plano, como se muestra en la imagen inferior. La distancia de Manhattan se usa comúnmente en aplicaciones GPS , ya que permite encontrar la ruta más corta entre dos direcciones. Al generalizar las fórmulas de la distancia euclidiana y la distancia de Manhattan, se obtiene la fórmula de la distancia de Minkowski , que puede utilizarse en una amplia variedad de aplicaciones.

Similitud entre cadenas

Para comparar cadenas de texto, existen diversas medidas de similitud . Algunos de estos métodos incluyen la distancia de edición, la distancia de Levenshtein, la distancia de Hamming y la distancia de Jaro. La fórmula más adecuada depende de los requisitos de la aplicación. Por ejemplo, la distancia de edición se usa frecuentemente en aplicaciones y funciones de procesamiento del lenguaje natural , como la corrección ortográfica. La distancia de Jaro se usa comúnmente en la vinculación de registros para comparar nombres y apellidos con otras fuentes.

Similitud entre dos distribuciones de probabilidad

Las medidas típicas de similitud para distribuciones de probabilidad son la distancia de Bhattacharyya y la distancia de Hellinger . Ambas cuantifican la similitud entre dos distribuciones de probabilidad en el mismo dominio y están estrechamente relacionadas matemáticamente. La distancia de Bhattacharyya no cumple la desigualdad triangular , lo que significa que no constituye una métrica . La distancia de Hellinger sí constituye una métrica en el espacio de distribuciones de probabilidad.

Similitud entre dos conjuntos

La fórmula del índice de Jaccard mide la similitud entre dos conjuntos basándose en la cantidad de elementos presentes en ambos conjuntos en relación con el número total de elementos. Se utiliza comúnmente en sistemas de recomendación y análisis de redes sociales . El coeficiente de Sørensen-Dice también compara la cantidad de elementos en ambos conjuntos con el número total de elementos presentes, pero otorga mayor peso a la cantidad de elementos compartidos. El coeficiente de Sørensen-Dice se utiliza comúnmente en aplicaciones biológicas para medir la similitud entre dos conjuntos de genes o especies .

Similitud entre dos secuencias

Al comparar secuencias temporales (series de tiempo), algunas medidas de similitud deben tener en cuenta, además, la similitud de dos secuencias que no están completamente alineadas.

Uso en agrupamiento

El análisis de clústeres es una técnica de minería de datos que se utiliza para descubrir patrones en los datos agrupando objetos similares. Consiste en dividir un conjunto de puntos de datos en grupos o clústeres según sus similitudes. Uno de los aspectos fundamentales del análisis de clústeres es cómo medir la similitud entre los puntos de datos.

Las medidas de similitud desempeñan un papel crucial en muchas técnicas de agrupamiento, ya que se utilizan para determinar el grado de relación entre dos puntos de datos y si deben agruparse en el mismo clúster. Una medida de similitud puede adoptar diversas formas según el tipo de datos que se estén agrupando y el problema específico que se esté resolviendo.

Una de las medidas de similitud más utilizadas es la distancia euclidiana , que se emplea en muchas técnicas de agrupamiento, incluyendo el agrupamiento K-means y el agrupamiento jerárquico . La distancia euclidiana es una medida de la distancia en línea recta entre dos puntos en un espacio de alta dimensión. Se calcula como la raíz cuadrada de la suma de las diferencias al cuadrado entre las coordenadas correspondientes de los dos puntos. Por ejemplo, si tenemos dos puntos de datos(incógnita1,y1){\displaystyle (x_{1},y_{1})}y(incógnita2,y2){\displaystyle (x_{2},y_{2})}, la distancia euclidiana entre ellos esd=[(incógnita2incógnita1)2+(y2y1)2]{\displaystyle d=\surd [(x_{2}-x_{1})^{2}+(y_{2}-y_{1})^{2}]}.

Mapa de calor de la región HIST1, que se encuentra en el cromosoma 13 del ratón en las siguientes coordenadas: [21,7 Mb, 24,1 Mb].

Otra medida de similitud comúnmente utilizada es el índice de Jaccard o similitud de Jaccard, que se emplea en técnicas de agrupamiento que trabajan con datos binarios, como datos de presencia/ausencia [ 3 ] o datos booleanos. La similitud de Jaccard es particularmente útil para técnicas de agrupamiento que trabajan con datos de texto, donde se puede utilizar para identificar grupos de documentos similares en función de sus características o palabras clave compartidas. [ 4 ] Se calcula como el tamaño de la intersección de dos conjuntos dividido por el tamaño de la unión de los dos conjuntos.J(A,B)=ABAB{\displaystyle J(A,B)={A\bigcap B \over A\bigcup B}}.

Se analizan las similitudes entre 162 perfiles nucleares relevantes mediante el índice de similitud de Jaccard (véase la figura con el mapa de calor). El índice de similitud de Jaccard de los perfiles nucleares varía de 0 a 1, donde 0 indica que no existe similitud entre los dos conjuntos y 1 indica una similitud perfecta, con el objetivo de agrupar los perfiles nucleares más similares.

La distancia de Manhattan, también conocida como geometría de taxi , es una medida de similitud comúnmente utilizada en técnicas de agrupamiento que trabajan con datos continuos. Es una medida de la distancia entre dos puntos de datos en un espacio de alta dimensión, calculada como la suma de las diferencias absolutas entre las coordenadas correspondientes de los dos puntos.|incógnita1incógnita2|+|y1y2|{\displaystyle \left\vert x_{1}-x_{2}\right\vert +\left\vert y_{1}-y_{2}\right\vert }.

Cuando se trabaja con datos de tipo mixto, que incluyen atributos nominales, ordinales y numéricos por objeto, la distancia (o similitud) de Gower es una opción común, ya que puede manejar diferentes tipos de variables de forma implícita. Primero calcula las similitudes entre el par de variables en cada objeto y luego combina esas similitudes en un único promedio ponderado por par de objetos. De esta manera, para dos objetosi{\displaystyle i}yj{\displaystyle j}teniendopag{\displaystyle p}descriptores, la similitudS{\displaystyle S}se define como:Sij=k=1pagwijksijkk=1pagwijk,{\displaystyle S_{ij}={\frac {\sum _{k=1}^{p}w_{ijk}s_{ijk}}{\sum _{k=1}^{p}w_{ijk}}},}donde elwijk{\displaystyle w_{ijk}}son pesos no negativos ysijk{\displaystyle s_{ijk}}es la similitud entre los dos objetos con respecto a suk{\displaystyle k}-ésima variable.

En el agrupamiento espectral , se utiliza una medida de similitud o afinidad para transformar los datos y superar las dificultades relacionadas con la falta de convexidad en la forma de la distribución de los datos. [ 5 ] La medida da lugar a una(norte,norte){\displaystyle (n,n)}-tamañomatriz de similitud para un conjunto denpuntos, donde la entrada(i,j){\displaystyle (i,j)}en la matriz puede ser simplemente el (recíproco de la) distancia euclidiana entrei{\displaystyle i}yj{\displaystyle j}o puede ser una medida de distancia más compleja como la gaussiana.mis1s22/2σ2{\displaystyle e^{-\|s_{1}-s_{2}\|^{2}/2\sigma ^{2}}}. [ 5 ] También es común modificar aún más este resultado con técnicas de análisis de redes. [ 6 ]

La elección de la medida de similitud depende del tipo de datos que se estén agrupando y del problema específico que se esté resolviendo. Por ejemplo, al trabajar con datos continuos, como los de expresión génica, la distancia euclidiana o la similitud del coseno pueden ser apropiadas. Si se trabaja con datos binarios, como la presencia de un locus genómico en un perfil nuclear, el índice de Jaccard puede ser más adecuado. Por último, al trabajar con datos organizados en una cuadrícula o estructura reticular, como los datos de procesamiento de imágenes o señales, la distancia de Manhattan resulta especialmente útil para la agrupación.

Uso en sistemas de recomendación

Las medidas de similitud se utilizan para desarrollar sistemas de recomendación . Observan la percepción y el gusto de un usuario por múltiples elementos. En los sistemas de recomendación, el método utiliza un cálculo de distancia comoDistancia euclidiana oSimilitud del coseno para generar unMatriz de similitud con valores que representan la similitud entre cualquier par de objetivos. Luego, al analizar y comparar los valores de la matriz, es posible relacionar dos objetivos con las preferencias de un usuario o vincular usuarios según sus marcas. En este sistema, es relevante observar el valor en sí y la distancia absoluta entre dos valores. [ 7 ] La recopilación de estos datos puede indicar la probabilidad de que una marca sea del agrado de un usuario, así como el grado de aceptación o rechazo mutuo de dos marcas. De esta manera, es posible recomendar a un usuario objetivos con alta similitud a sus gustos.

Los sistemas de recomendación se encuentran presentes en múltiples plataformas de entretenimiento en línea, redes sociales y sitios web de streaming. La lógica para la construcción de estos sistemas se basa en medidas de similitud.

Uso en alineación de secuencias

Las matrices de similitud se utilizan en el alineamiento de secuencias . Se asignan puntuaciones más altas a los caracteres más similares y puntuaciones más bajas o negativas a los caracteres diferentes.

Las matrices de similitud de nucleótidos se utilizan para alinear secuencias de ácidos nucleicos . Debido a que solo hay cuatro nucleótidos que se encuentran comúnmente en el ADN ( Adenina (A), Citosina (C), Guanina (G) y Timina (T)), las matrices de similitud de nucleótidos son mucho más simples que las matrices de similitud de proteínas . Por ejemplo, una matriz simple asignará a las bases idénticas una puntuación de +1 y a las bases no idénticas una puntuación de −1. Una matriz más compleja daría una puntuación más alta a las transiciones (cambios de una pirimidina como C o T a otra pirimidina, o de una purina como A o G a otra purina) que a las transversiones (de una pirimidina a una purina o viceversa). La relación de coincidencia/discrepancia de la matriz establece la distancia evolutiva objetivo. [ 8 ] [ 9 ] La matriz de ADN +1/−3 utilizada por BLASTN es la más adecuada para encontrar coincidencias entre secuencias que son 99% idénticas; Una matriz +1/−1 (o +4/−4) es mucho más adecuada para secuencias con un 70 % de similitud. Las matrices para secuencias con menor similitud requieren alineamientos de secuencias más largos.

Las matrices de similitud de aminoácidos son más complejas, ya que el código genético codifica 20 aminoácidos y, por lo tanto, existe un mayor número de posibles sustituciones. En consecuencia, la matriz de similitud de aminoácidos contiene 400 entradas (aunque suele ser simétrica ). El primer enfoque puntuaba todos los cambios de aminoácidos por igual. Una mejora posterior consistió en determinar las similitudes entre aminoácidos en función de cuántos cambios de bases se requerían para modificar un codón y codificar dicho aminoácido. Este modelo es mejor, pero no tiene en cuenta la presión selectiva de los cambios de aminoácidos. Los modelos más avanzados sí consideraban las propiedades químicas de los aminoácidos.

Un enfoque ha consistido en generar empíricamente las matrices de similitud. El método de Dayhoff utilizó árboles filogenéticos y secuencias de especies del árbol. Este enfoque dio origen a la serie de matrices PAM . Las matrices PAM se clasifican según la cantidad de cambios de nucleótidos que se han producido por cada 100 aminoácidos. Si bien las matrices PAM se benefician de contar con un modelo evolutivo bien definido, son más útiles para distancias evolutivas cortas (PAM10–PAM120). Para distancias evolutivas largas, por ejemplo PAM250 o un 20 % de identidad, se ha demostrado que las matrices BLOSUM son mucho más efectivas.

Las series BLOSUM se generaron comparando varias secuencias divergentes. Estas series se etiquetan según la cantidad de entropía que permanece sin mutar entre todas las secuencias, de modo que un número BLOSUM menor corresponde a un número PAM mayor.

Uso en visión artificial

El método más común para comparar dos imágenes en la recuperación de imágenes basada en contenido (normalmente una imagen de ejemplo y una imagen de la base de datos) es mediante una medida de distancia entre imágenes. Esta medida compara la similitud de dos imágenes en diversas dimensiones, como color, textura, forma, entre otras. Por ejemplo, una distancia de 0 indica una coincidencia exacta con la consulta, en lo que respecta a las dimensiones consideradas. Como se puede intuir, un valor mayor que 0 indica distintos grados de similitud entre las imágenes. Los resultados de la búsqueda se pueden ordenar según su distancia a la imagen consultada. [ 10 ] Se han desarrollado numerosas medidas de distancia entre imágenes (modelos de similitud). [ 11 ]

Véase también

Referencias

  1. ^ Vert, Jean-Philippe; Tsuda, Koji; Schölkopf, Bernhard (2004). "Introducción a los métodos del kernel" (PDF) . Métodos del kernel en biología computacional .
  2. "Diferentes tipos de mediciones de similitud" . OpenGenus.
  3. Chung, Neo Christopher; Miasojedow, BłaŻej; Startek, Michał; Gambin, Anna (2019). "Prueba de similitud de Jaccard/Tanimoto y métodos de estimación para datos de presencia-ausencia biológica" . BMC Bioinformatics . 20 (S15): 644. doi : 10.1186/s12859-019-3118-5 . ISSN 1471-2105 . PMC 6929325. PMID 31874610 .   
  4. Multiconferencia Internacional de Ingenieros y Científicos Informáticos : IMECS 2013 : 13-15 de marzo de 2013, Hotel Royal Garden, Kowloon, Hong Kong . SI Ao, Asociación Internacional de Ingenieros. Hong Kong: Newswood Ltd. 2013. ISBN   978-988-19251-8-3OCLC 842831996 {{cite book}}: CS1 mantenimiento: otros ( enlace )
  5. 1 2 Ng, AY; Jordan, MI; Weiss, Y. ( 2001), "Sobre la agrupación espectral: análisis y un algoritmo" , Advances in Neural Information Processing Systems , 14 , MIT Press: 849–856
  6. Li, Xin-Ye; Guo, Li-Jie (2012), "Construcción de matriz de afinidad en agrupamiento espectral basado en propagación de vecinos", Neurocomputing , 97 : 125–130 , doi : 10.1016/j.neucom.2012.06.023
  7. Bondarenko, Kirill (2019), Métricas de similitud en sistemas de recomendación , consultado el 25 de abril de 2023
  8. States, D; Gish, W; Altschul, S (1991). "Mejora de la sensibilidad de las búsquedas en bases de datos de ácidos nucleicos mediante matrices de puntuación específicas para cada aplicación". Methods: A Companion to Methods in Enzymology . 3 (1): 66. CiteSeerX 10.1.1.114.8183 . doi : 10.1016/S1046-2023(05)80165-3 . 
  9. Sean R. Eddy (2004). "¿De dónde provino la matriz de puntuación de alineación BLOSUM62?" (PDF) . Nature Biotechnology . 22 (8): 1035–6 . doi : 10.1038/nbt0804-1035 . PMID 15286655. S2CID 205269887. Archivado del original (PDF) el 3 de septiembre de 2006.  
  10. Shapiro, Linda ; George Stockman (2001). Visión por computadora . Upper Saddle River, NJ: Prentice Hall. ISBN 978-0-13-030796-5.
  11. Eidenberger, Horst (2011). "Comprensión fundamental de los medios", en prensa. ISBN 978-3-8423-7917-6.
  • F. Gregory Ashby; Daniel M. Ennis (2007). "Medidas de similitud" . Scholarpedia . 2 (12): 4116. Bibcode : 2007SchpJ...2.4116A . doi : 10.4249/scholarpedia.4116 .