El coeficiente de Dice-Sørensen es una estadística que se utiliza para medir la similitud de dos muestras . Fue desarrollado independientemente por los botánicos Lee Raymond Dice [ 1 ] y Thorvald Sørensen [ 2 ] , quienes publicaron en 1945 y 1948, respectivamente.
Nombre
El índice se conoce con varios otros nombres, especialmente índice de Sørensen-Dice , [ 3 ] índice de Sørensen y coeficiente de Dice . Otras variantes incluyen el "coeficiente de similitud" o "índice", como el coeficiente de similitud de Dice ( DSC ). Las grafías alternativas comunes para Sørensen son Sorenson , Soerenson y Sörenson , y las tres también pueden aparecer con la terminación -sen (la letra danesa ø es fonéticamente equivalente a la ö alemana/sueca, que puede escribirse como oe en ASCII).
Otros nombres incluyen:
- Puntuación de F1
- Índice binario (no cuantitativo) de Czekanowski [ 4 ]
- Medida de similitud genética [ 5 ]
- Índice de similitud de Zijdenbos, [ 6 ] [ 7 ] en referencia a un artículo de 1994 de Zijdenbos et al. [ 8 ] [ 3 ]
Fórmula
La fórmula original de Sørensen estaba destinada a aplicarse a datos discretos. Dados dos conjuntos, X e Y, se define como
donde | X | e | Y | son las cardinalidades de los dos conjuntos (es decir, el número de elementos en cada conjunto). El índice de Sørensen es igual al doble del número de elementos comunes a ambos conjuntos dividido por la suma del número de elementos en cada conjunto. De forma equivalente, el índice es el tamaño de la intersección como una fracción del tamaño promedio de los dos conjuntos.
Cuando se aplica a datos booleanos, utilizando la definición de verdadero positivo (TP), falso positivo (FP) y falso negativo (FN), se puede escribir como
- .
Es diferente del índice de Jaccard , que solo cuenta los verdaderos positivos una vez tanto en el numerador como en el denominador. El DSC es el cociente de similitud y varía entre 0 y 1. [ 9 ] Puede considerarse una medida de similitud entre conjuntos.
De forma similar al índice de Jaccard , las operaciones de conjuntos pueden expresarse en términos de operaciones vectoriales sobre vectores binarios a y b :
lo que da el mismo resultado sobre vectores binarios y también proporciona una métrica de similitud más general sobre vectores en términos generales.
Para conjuntos X e Y de palabras clave utilizadas en la recuperación de información , el coeficiente puede definirse como el doble de la información compartida (intersección) sobre la suma de cardinalidades: [ 10 ]
Cuando se toma como una medida de similitud de cadenas , el coeficiente se puede calcular para dos cadenas, x e y, usando bigramas de la siguiente manera: [ 11 ]
donde nt es el número de bigramas de caracteres que se encuentran en ambas cadenas, nx es el número de bigramas en la cadena x y ny es el número de bigramas en la cadena y . Por ejemplo, para calcular la similitud entre :
nightnacht
Encontraríamos el conjunto de bigramas en cada palabra:
- {
ni,ig,gh,ht} - {
na,ac,ch,ht}
Cada conjunto tiene cuatro elementos, y la intersección de estos dos conjuntos tiene solo un elemento: ht.
Al introducir estos números en la fórmula, calculamos que s = (2 · 1) / (4 + 4) = 0,25.
Coeficiente de dados continuo
Fuente: [ 12 ]
Para una verdad fundamental discreta (binaria)y medidas continuasEn el intervalo [0,1], se puede utilizar la siguiente fórmula:
Dóndey
c se puede calcular de la siguiente manera:
Silo que significa que no hay superposición entre A y B, c se establece en 1 arbitrariamente.
Diferencia con Jaccard
Este coeficiente no difiere mucho en forma del índice de Jaccard . De hecho, ambos son equivalentes en el sentido de que, dado un valor para el coeficiente de Sørensen-Dice,, se puede calcular el valor del índice de Jaccard correspondientey viceversa, utilizando las ecuacionesy.
Dado que el coeficiente de Sørensen-Dice no satisface la desigualdad triangular , puede considerarse una versión semimétrica del índice de Jaccard. [ 4 ]
La función varía entre cero y uno, como Jaccard. A diferencia de Jaccard, la función de diferencia correspondiente
no es una métrica de distancia adecuada ya que no satisface la desigualdad triangular. [ 4 ] El contraejemplo más simple de esto viene dado por los tres conjuntos,y. TenemosyPara satisfacer la desigualdad triangular, la suma de dos lados cualesquiera debe ser mayor o igual que la del lado restante. Sin embargo,.
Aplicaciones
El coeficiente de Sørensen-Dice es útil para datos de comunidades ecológicas (p. ej. Looman y Campbell, 1960 [ 13 ] ). La justificación de su uso es principalmente empírica más que teórica (aunque puede justificarse teóricamente como la intersección de dos conjuntos difusos [ 14 ] ). En comparación con la distancia euclidiana , la distancia de Sørensen mantiene la sensibilidad en conjuntos de datos más heterogéneos y da menos peso a los valores atípicos. [ 15 ] Recientemente, la puntuación de Dice (y sus variaciones, p. ej. logDice tomando su logaritmo ) se ha popularizado en la lexicografía computacional para medir la puntuación de asociación léxica de dos palabras dadas. [ 16 ] logDice también se utiliza como parte de la distancia de Mash para la estimación de la distancia del genoma y del metagenoma. [ 17 ] Finalmente, Dice se utiliza en la segmentación de imágenes , en particular para comparar la salida del algoritmo con máscaras de referencia en aplicaciones médicas. [ 8 ]
versión Abundancia
La expresión se extiende fácilmente a la abundancia en lugar de la presencia/ausencia de especies. Esta versión cuantitativa se conoce con varios nombres:
- Índice cuantitativo de Sørensen-Dice [ 4 ]
- Índice cuantitativo de Sørensen [ 4 ]
- Índice de Dice cuantitativo [ 4 ]
- Similitud de Bray-Curtis (1 menos la disimilitud de Bray-Curtis ) [ 4 ]
- Índice cuantitativo de Czekanowski [ 4 ]
- Índice Steinhaus [ 4 ]
- Porcentaje de similitud de Pielou [ 4 ]
- Proporción de acuerdo específico [ 18 ] o acuerdo positivo [ 19 ]
Véase también
Referencias
- ↑ Dice, Lee R. (1945). " Medidas de la cantidad de asociación ecológica entre especies". Ecology . 26 (3): 297– 302. Bibcode : 1945Ecol...26..297D . doi : 10.2307/1932409 . JSTOR 1932409. S2CID 53335638 .
- ^ Sørensen, T. (1948). "Un método para establecer grupos de igual amplitud en sociología vegetal basado en la similitud de especies y su aplicación a los análisis de la vegetación en los bienes comunes daneses". Kongelige Danske Videnskabernes Selskab . 5 (4): 1-34 .
- 1 2 Carass, A.; Roy, S.; Gherman, A.; Reinhold, JC; Jesson, A.; et al. (2020). " Evaluación de segmentaciones de lesiones de materia blanca con análisis refinado de Sørensen-Dice" . Scientific Reports . 10 (1): 8242. Bibcode : 2020NatSR..10.8242C . doi : 10.1038/s41598-020-64803-w . ISSN 2045-2322 . PMC 7237671. PMID 32427874 .
- 1 2 3 4 5 6 7 8 9 10 Gallagher, ED, 1999. Documentación de COMPAH , Universidad de Massachusetts, Boston
- ↑ Nei, M.; Li, WH (1979). "Modelo matemático para estudiar la variación genética en términos de endonucleasas de restricción" . PNAS . 76 (10): 5269– 5273. Bibcode : 1979PNAS...76.5269N . doi : 10.1073/pnas.76.10.5269 . PMC 413122. PMID 291943 .
- ↑ Prescott, JW; Pennell, M.; Best, TM; Swanson, MS; Haq, F.; Jackson, R.; Gurcan, MN (2009). "Un método automatizado para segmentar el fémur para la investigación de la osteoartritis". Conferencia Internacional Anual de 2009 de la Sociedad de Ingeniería en Medicina y Biología del IEEE . IEEE. págs. 6364–6367 . doi : 10.1109/iembs.2009.5333257 . PMC 2826829 .
- ↑ Swanson, MS; Prescott, JW; Best, TM; Powell, K.; Jackson, RD; Haq, F.; Gurcan, MN (2010). " Segmentación semiautomatizada para evaluar el menisco lateral en rodillas normales y osteoartríticas" . Osteoarthritis and Cartilage . 18 (3): 344– 353. doi : 10.1016/j.joca.2009.10.004 . ISSN 1063-4584 . PMC 2826568. PMID 19857510 .
- 1 2 Zijdenbos, AP; Dawant, BM; Margolin, RA; Palmer, AC (1994). "Análisis morfométrico de lesiones de la sustancia blanca en imágenes de RM: método y validación". IEEE Transactions on Medical Imaging . 13 (4): 716– 724. Bibcode : 1994ITMI...13..716Z . doi : 10.1109/42.363096 . ISSN 0278-0062 . PMID 18218550 .
- ↑ Murguía, Miguel; Luis Villaseñor, José (2003). "Estimación del efecto del coeficiente de similitud y el algoritmo de conglomerado en las clasificaciones biogeográficas" (PDF) . Annales Botanici Fennici . 40 : 415– 421. ISSN 0003-3847 .
- ^ van Rijsbergen, Cornelis Joost (1979). Recuperación de información . Londres: Butterworths. ISBN 3-642-12274-4.
- ↑ Kondrak, Grzegorz; Marcu, Daniel; Knight, Kevin (2003). "Los cognados pueden mejorar los modelos de traducción estadística" (PDF) . Actas de HLT-NAACL 2003: Conferencia sobre Tecnología del Lenguaje Humano del Capítulo Norteamericano de la Asociación de Lingüística Computacional . págs. 46–48 .
- ↑ Shamir, Reuben R.; Duchin, Yuval; Kim, Jinyoung; Sapiro, Guillermo; Harel, Noam (2018-04-25). "Coeficiente de Dice continuo: un método para evaluar segmentaciones probabilísticas". bioRxiv 10.1101/306977 .
- ↑ Looman, J.; Campbell, JB (1960). "Adaptación de la K de Sorensen (1948) para estimar las afinidades de las unidades en la vegetación de las praderas". Ecology . 41 (3): 409– 416. Bibcode : 1960Ecol...41..409L . doi : 10.2307/1933315 . JSTOR 1933315 .
- ↑ Roberts, DW (1986). "Ordenación basada en la teoría de conjuntos difusos". Vegetatio . 66 (3): 123– 131. doi : 10.1007/BF00039905 . S2CID 12573576 .
- ↑ McCune, Bruce y Grace, James (2002) Análisis de comunidades ecológicas. Mjm Software Design; ISBN 0-9721290-0-6.
- ↑ Rychlý, P. (2008) Una puntuación de asociación fácil de usar para lexicógrafos. Actas del Segundo Taller sobre Avances Recientes en el Procesamiento del Lenguaje Natural Eslavo RASLAN 2008: 6–9
- ↑ Ondov, Brian D., et al. "Mash: estimación rápida de distancias entre genomas y metagenomas mediante MinHash." Genome biology 17.1 (2016): 1-14.
- ↑ Ayappa, Indu; Norman, Robert G (2000). "Detección no invasiva de despertares relacionados con el esfuerzo respiratorio (RERA) mediante un sistema de cánula nasal/transductor de presión" . Sleep . 23 (6): 763– 771. doi : 10.1093/sleep/23.6.763 . PMID 11007443 .
- ↑ John Uebersax. "Índices de concordancia brutos" .
Enlaces externos
- evaluación de la recuperación de información
- Métricas de cadena
- teoría de la medida
- Medidas de similitud