Articulo de referencia

Análisis de proximidad de co-citación

Figura que muestra el enfoque de Análisis de Proximidad de Co-citación (CPA, por sus siglas en inglés) para el cálculo de similitud de documentos. El análisis de proximidad de c...

Los documentos B y C se citan más cerca entre sí en el texto completo del documento que los cita, en comparación con el documento A. Por lo tanto, según el análisis de proximidad de co-citación, los documentos B y C están más estrechamente relacionados que los documentos A y B o A y C.
Figura que muestra el enfoque de Análisis de Proximidad de Co-citación (CPA, por sus siglas en inglés) para el cálculo de similitud de documentos.

El análisis de proximidad de co-citación ( CPA ) es una medida de similitud de documentos que utiliza el análisis de citas para evaluar la similitud semántica entre documentos tanto a nivel global como a nivel de sección individual. [ 1 ] [ 2 ] Esta medida de similitud se basa en el enfoque del análisis de co-citación , pero se diferencia en que aprovecha la información implícita en la ubicación de las citas dentro de los textos completos de los documentos.

El análisis de proximidad de co-citación fue concebido por B. Gipp en 2006 [ 3 ] y la descripción de la medida de similitud de documentos fue publicada posteriormente por Gipp y Beel en 2009. [ 1 ] La medida de similitud se basa en la suposición de que, dentro del texto completo de un documento, los documentos citados cerca unos de otros tienden a estar más relacionados que aquellos citados más distantes. La figura de la derecha ilustra el concepto. El enfoque CPA para la similitud de documentos supone que los documentos B y C están más relacionados que los documentos B y A, porque las citas a B y C aparecen dentro de la misma oración, mientras que las citas a B y A están separadas por varios párrafos.

La ventaja del método CPA, en comparación con otros métodos de análisis de citas y co-citas, radica en su mayor precisión. Otros métodos de análisis de citas ampliamente utilizados, como el acoplamiento bibliográfico , la co-citación o la medida de Amsler , no consideran la ubicación ni la proximidad de las citas dentro de los documentos. El método CPA permite una clasificación automática más detallada de los documentos y, además, puede utilizarse para identificar no solo documentos relacionados, sino también las secciones específicas dentro de los textos que presentan mayor relación.

Método de cálculo

La medida de similitud CPA calcula un Índice de Proximidad de Citas ( CPI ) para cada conjunto de documentos citados por un documento examinado. [ 1 ] A los documentos citados se les asigna un peso de12norte{\displaystyle {\frac {1}{2^{n}}}}donde n representa el número de niveles entre citas. Comenzando por el nivel más bajo, los niveles pueden definirse como grupos de citas, oraciones, párrafos, capítulos y, finalmente, el documento completo o incluso la revista.

Existen varias variantes del algoritmo CPA.

  • Concepto básico de CPA : concepto fundamental de CPA como se describe anteriormente.
  • CPA extendido : considera la estructura de árbol y el orden de las citas dentro de los grupos de citas.
  • CPA multidimensional : utiliza información adicional como el factor de impacto.
  • Hybrid-CPA combina el CPI con otras medidas de similitud, como por ejemplo, medidas basadas en texto. Esto mejora el rendimiento, especialmente en documentos con información de citas insuficiente.

Actuación

La medida de similitud CPA se basa en el enfoque de similitud de documentos de co-citación con la adición distintiva del análisis de proximidad. Por lo tanto, el enfoque CPA permite el cálculo de una resolución más granular de la similitud general de los documentos. Se ha encontrado que CPA supera al análisis de co-citación, especialmente cuando los documentos contienen bibliografías extensas y en casos donde los documentos no se han citado frecuentemente juntos (es decir, tienen una puntuación de co-citación baja). [ 1 ] [ 4 ] Liu y Chen encontraron que las co-citaciones a nivel de oración son marcadores potencialmente más eficientes para usar en el análisis de co-citación en comparación con las co-citaciones a nivel de artículo débilmente acopladas, ya que las co-citaciones a nivel de oración tienden a preservar la estructura esencial de la red de co-citación tradicional y también forman un subconjunto mucho más pequeño de todas las instancias de co-citación. [ 5 ]

Un análisis realizado por Schwarzer et al. [ 4 ] mostró que las medidas basadas en citas, CPA y el análisis de co-citación , tienen fortalezas complementarias en comparación con las medidas de similitud basadas en texto. Los enfoques de similitud basados ​​en texto identificaron de manera confiable artículos más estrechamente similares en una colección de prueba de artículos de Wikipedia, por ejemplo, artículos que comparten términos idénticos, mientras que el enfoque CPA superó a CoCit en la identificación de artículos relacionados de manera más amplia, así como artículos más populares, que según los autores probablemente también sean de mayor calidad. [ 4 ]

Véase también

Referencias

  1. 1 2 3 4 Bela Gipp y Joeran Beel, 2009 "Análisis de proximidad de citas (CPA): un nuevo enfoque para identificar trabajos relacionados basado en el análisis de co-citación" en Birger Larsen y Jacqueline Leta, editores, Actas de la 12.ª Conferencia Internacional sobre Cienciometría e Informetría (ISSI'09), volumen 2, páginas 571-575, Río de Janeiro (Brasil), julio de 2009.
  2. Bela Gipp y Joeran Beel. "Método y sistema para detectar la similitud de documentos". Solicitud de patente, 27 de octubre de 2011. 2011/0264672 A1 .
  3. Bela Gipp, 2006. "Propuesta doctoral: Análisis de proximidad de (co)citaciones: una medida para identificar trabajos relacionados"
  4. 1 2 3 M. Schwarzer, M. Schubotz, N. Meuschke, C. Breitinger, V. Markl y B. Gipp, "Evaluación de recomendaciones basadas en enlaces para Wikipedia" en Actas de la 16.ª Conferencia Conjunta ACM/IEEE-CS sobre Bibliotecas Digitales (JCDL), Nueva York, NY, EE. UU., 2016, págs. 191-200.
  5. Shengbo Liu y Chaomei Chen, 2001 "Los efectos de la proximidad de las co-citaciones en el análisis de co-citaciones" , XIII Conferencia de la Sociedad Internacional de Cienciometría e Informetría (ISSI), 4-7 de julio de 2011, Durban, Sudáfrica.
  6. Bela Gipp, Norman Meuschke y Mario Lipinski, 2015. "CITREC: Un marco de evaluación para medidas de similitud basadas en citas basadas en TREC Genomics y PubMed Central" en Actas de la iConference 2015, Newport Beach, California, 2015.

Lecturas adicionales

Bela Gipp y Joeran Beel. Identificación de documentos relacionados para el recomendador de artículos de investigación mediante CPA y COA. En SI Ao, C. Douglas, WS Grundfest y J. Burgstone (editores), Actas del Congreso Mundial de Ingeniería y Ciencias de la Computación 2009, volumen 1 de Lecture Notes in Engineering and Computer Science, páginas 636-639, Berkeley (EE. UU.), octubre de 2009. Asociación Internacional de Ingenieros (IAENG), Newswood Limited. Disponible aquí.

Bela Gipp. Medición de la relación entre documentos mediante análisis de proximidad de citas y análisis del orden de las citas. En M. Lalmas, J. Jose, A. Rauber, F. Sebastiani e I. Frommholz (eds.), Actas de la 14.ª Conferencia Europea sobre Bibliotecas Digitales (ECDL'10): Investigación y tecnología avanzada para bibliotecas digitales, volumen 6273 de Lecture Notes of Computer Science (LNCS). Springer, septiembre de 2010. Disponible aquí.