Articulo de referencia

Etiquetado de clústeres

En el procesamiento del lenguaje natural y la recuperación de información , el etiquetado de grupos es el problema de elegir etiquetas descriptivas y legibles para los grupos pr...

En el procesamiento del lenguaje natural y la recuperación de información , el etiquetado de grupos es el problema de elegir etiquetas descriptivas y legibles para los grupos producidos por un algoritmo de agrupamiento de documentos ; los algoritmos de agrupamiento estándar no suelen producir este tipo de etiquetas. Los algoritmos de etiquetado de grupos examinan el contenido de los documentos por grupo para encontrar un etiquetado que resuma el tema de cada grupo y distinga los grupos entre sí.

Etiquetado diferencial de clústeres

El etiquetado diferencial de grupos etiqueta un grupo comparando las distribuciones de términos entre grupos, utilizando técnicas que también se utilizan para la selección de características en la clasificación de documentos , como la información mutua y la selección de características de chi-cuadrado . Los términos que tienen una frecuencia muy baja no son los mejores para representar a todo el grupo y se pueden omitir al etiquetar un grupo. Al omitir esos términos poco frecuentes y utilizar una prueba diferencial, se pueden lograr los mejores resultados con el etiquetado diferencial de grupos. [1]

Información mutua puntual

En los campos de la teoría de la probabilidad y la teoría de la información , la información mutua mide el grado de dependencia de dos variables aleatorias . La información mutua de dos variables X e Y se define como:

I ( incógnita , Y ) = incógnita incógnita y Y pag ( incógnita , y ) yo o gramo 2 ( pag ( incógnita , y ) pag 1 ( incógnita ) pag 2 ( y ) ) {\displaystyle I(X,Y)=\suma _{x\en X}{\suma _{y\en Y}{p(x,y)log_{2}\left({\frac {p(x,y)}{p_{1}(x)p_{2}(y)}}\right)}}}

donde p(x, y) es la distribución de probabilidad conjunta de las dos variables, p 1 (x) es la distribución de probabilidad de X y p 2 (y) es la distribución de probabilidad de Y.

En el caso del etiquetado de conglomerados, la variable X está asociada con la pertenencia a un conglomerado, y la variable Y está asociada con la presencia de un término. [2] Ambas variables pueden tener valores de 0 o 1, por lo que la ecuación puede reescribirse de la siguiente manera:

I ( do , yo ) = do 0 , 1 a 0 , 1 pag ( do = do , yo = a ) yo o gramo 2 ( pag ( do = do , yo = a ) pag ( do = do ) pag ( yo = a ) ) {\displaystyle I(C,T)=\sum _{c\in {0,1}}{\sum _{t\in {0,1}}{p(C=c,T=t)log_{2}\left({\frac {p(C=c,T=t)}{p(C=c)p(T=t)}}\right)}}}

En este caso, p(C = 1) representa la probabilidad de que un documento seleccionado al azar sea miembro de un grupo en particular, y p(C = 0) representa la probabilidad de que no lo sea. De manera similar, p(T = 1) representa la probabilidad de que un documento seleccionado al azar contenga un término dado, y p(T = 0) representa la probabilidad de que no lo contenga. La función de distribución de probabilidad conjunta p(C, T) representa la probabilidad de que dos eventos ocurran simultáneamente. Por ejemplo, p(0, 0) es la probabilidad de que un documento no sea miembro del grupo c y no contenga el término t ; p(0, 1) es la probabilidad de que un documento no sea miembro del grupo C y sí contenga el término T ; y así sucesivamente.

Selección de Chi-Cuadrado

La prueba de chi-cuadrado de Pearson se puede utilizar para calcular la probabilidad de que la ocurrencia de un evento coincida con las expectativas iniciales. En particular, se puede utilizar para determinar si dos eventos, A y B, son estadísticamente independientes . El valor de la estadística de chi-cuadrado es:

incógnita 2 = a A b B ( Oh a , b mi a , b ) 2 mi a , b {\displaystyle X^{2}=\suma _{a\en A}{\suma _{b\en B}{\frac {(O_{a,b}-E_{a,b})^{2}}{E_{a,b}}}}}

donde O a,b es la frecuencia observada de coocurrencia de a y b, y E a,b es la frecuencia esperada de coocurrencia.

En el caso del etiquetado de conglomerados, la variable A se asocia con la pertenencia a un conglomerado y la variable B se asocia con la presencia de un término. Ambas variables pueden tener valores de 0 o 1, por lo que la ecuación se puede reescribir de la siguiente manera:

incógnita 2 = a 0 , 1 b 0 , 1 ( Oh a , b mi a , b ) 2 mi a , b {\displaystyle X^{2}=\suma _{a\en {0,1}}{\suma _{b\en {0,1}}{\frac {(O_{a,b}-E_{a,b})^{2}}{E_{a,b}}}}}

Por ejemplo, O 1,0 es el número observado de documentos que se encuentran en un grupo particular pero que no contienen un término determinado, y E 1,0 es el número esperado de documentos que se encuentran en un grupo particular pero que no contienen un término determinado. Nuestra suposición inicial es que los dos eventos son independientes, por lo que las probabilidades esperadas de coocurrencia se pueden calcular multiplicando las probabilidades individuales: [3]

E 1,0 = N * P(C = 1) * P(T = 0)

donde N es el número total de documentos de la colección.

Etiquetado interno del clúster

El etiquetado interno del grupo selecciona etiquetas que dependen únicamente del contenido del grupo de interés. No se realiza ninguna comparación con los demás grupos. El etiquetado interno del grupo puede utilizar una variedad de métodos, como buscar términos que aparecen con frecuencia en el centroide o buscar el documento que se encuentra más cerca del centroide.

Etiquetas de centroide

Un modelo que se utiliza con frecuencia en el campo de la recuperación de información es el modelo de espacio vectorial, que representa los documentos como vectores. Las entradas del vector corresponden a términos del vocabulario . Los vectores binarios tienen un valor de 1 si el término está presente en un documento en particular y de 0 si está ausente. Muchos vectores utilizan pesos que reflejan la importancia de un término en un documento y/o la importancia del término en una colección de documentos. Para un grupo particular de documentos, podemos calcular el centroide hallando la media aritmética de todos los vectores de documentos. Si una entrada del vector centroide tiene un valor alto, entonces el término correspondiente aparece con frecuencia dentro del grupo. Estos términos se pueden utilizar como etiqueta para el grupo. Una desventaja de utilizar el etiquetado centroide es que puede captar palabras como "lugar" y "palabra" que tienen una alta frecuencia en el texto escrito, pero que tienen poca relevancia para el contenido del grupo en particular.

Etiquetas de centroide contextualizadas

Una forma sencilla y rentable de superar la limitación anterior es incrustar los términos centroides con el mayor peso en una estructura gráfica que proporcione un contexto para su interpretación y selección. [4] En este enfoque, primero se construye una matriz de coocurrencia término-término denominada para cada grupo . Cada celda representa el número de veces que un término coocurre con otro término dentro de una determinada ventana de texto (una oración, un párrafo, etc.). En una segunda etapa, se obtiene una matriz de similitud multiplicando por su transpuesta. Tenemos . Al ser el producto escalar de dos vectores normalizados y , denota la similitud de coseno entre términos y . El así obtenido se puede utilizar entonces como la matriz de adyacencia ponderada de un gráfico de similitud de términos. Los términos centroides son parte de este gráfico y, por lo tanto, se pueden interpretar y puntuar inspeccionando los términos que los rodean en el gráfico. yo a Estilo de visualización Tk S a Estilo de visualización: S_{k} i {\estilo de visualización i} yo {\estilo de visualización j} yo a s i metro {\displaystyle T_{k}^{sim}} yo a Estilo de visualización Tk yo a s i metro = yo a " yo a = ( a s i metro i yo ) {\displaystyle T_{k}^{sim}=T_{k}'T_{k}=(t_{{sim}_{ij}})} a ~ i {\displaystyle {\tilde {t}}_{i}} a ~ yo {\displaystyle {\tilde {t}}_{j}} a s i metro i yo {\displaystyle t_{{sim}_{ij}}} i {\estilo de visualización i} yo {\estilo de visualización j} yo a s i metro {\displaystyle T_{k}^{sim}}

Etiquetas de título

Una alternativa al etiquetado de centroide es el etiquetado de título. En este caso, buscamos el documento dentro del grupo que tenga la distancia euclidiana más pequeña al centroide y usamos su título como etiqueta para el grupo. Una ventaja de usar títulos de documentos es que brindan información adicional que no estaría presente en una lista de términos. Sin embargo, también tienen el potencial de confundir al usuario, ya que un documento podría no ser representativo de todo el grupo.

Etiquetas de conocimiento externo

El etiquetado de los clústeres se puede realizar de forma indirecta utilizando conocimiento externo, como el conocimiento precategorizado, como el de Wikipedia. [5] En estos métodos, primero se extrae un conjunto de características textuales importantes de los clústeres de los documentos del clúster. Estas características se pueden utilizar para recuperar los documentos categorizados más cercanos (ponderados) de los cuales se pueden extraer candidatos para las etiquetas del clúster. El paso final implica la clasificación de dichos candidatos. Los métodos adecuados son aquellos que se basan en un proceso de votación o fusión que se determina utilizando el conjunto de documentos categorizados y las características originales del clúster.

Combinación de varios etiquetadores de clúster

Las etiquetas de clúster de varios etiquetadores de clúster diferentes se pueden combinar aún más para obtener mejores etiquetas. Por ejemplo, se puede utilizar la regresión lineal para aprender una combinación óptima de puntuaciones de etiquetadores. [6] Una técnica más sofisticada se basa en un enfoque de fusión y análisis de la estabilidad de decisión de las etiquetas de clúster de varios etiquetadores. [7]

  • Agrupamiento jerárquico
  • Etiquetado automático de clústeres jerárquicos

Referencias

  1. ^ Manning, Christopher D., Prabhakar Raghavan y Hinrich Schütze. Introducción a la recuperación de información . Cambridge: Cambridge UP, 2008. Etiquetado de clústeres . Stanford Natural Language Processing Group. Web. 25 de noviembre de 2009. <http://nlp.stanford.edu/IR-book/html/htmledition/cluster-labeling-1.html>.
  2. ^ Manning, Christopher D., Prabhakar Raghavan y Hinrich Schütze. Introducción a la recuperación de información . Cambridge: Cambridge UP, 2008. Mutual Information . Stanford Natural Language Processing Group. Web. 25 de noviembre de 2009. <http://nlp.stanford.edu/IR-book/html/htmledition/mutual-information-1.html>.
  3. ^ Manning, Christopher D., Prabhakar Raghavan y Hinrich Schütze. Introducción a la recuperación de información . Cambridge: Cambridge UP, 2008. Selección de características Chi2 . Stanford Natural Language Processing Group. Web. 25 de noviembre de 2009. <http://nlp.stanford.edu/IR-book/html/htmledition/feature-selectionchi2-feature-selection-1.html>.
  4. ^ Francois Role, Moahmed Nadif. Más allá del etiquetado de los clústeres: interpretación semántica del contenido de los clústeres mediante una representación gráfica. Knowledge-Based Systems, volumen 56, enero de 2014: 141-155
  5. ^ David Carmel, Hageo Roitman, Naama Zwerdling. Mejora del etiquetado de grupos mediante wikipedia. SIGIR 2009: 139-146
  6. ^ David Carmel, Hageo Roitman, Naama Zwerdling. Mejora del etiquetado de grupos mediante wikipedia. SIGIR 2009: 139-146
  7. ^ Haggai Roitman, Shay Hummel, Michal Shmueli-Scheuer. Un enfoque de fusión para el etiquetado de clústeres. SIGIR 2014: 883-886
Obtenido de "https://es.wikipedia.org/w/index.php?title=Etiquetado_de_grupos&oldid=1135736489"