Articulo de referencia

detección de similitud de contenido

La detección de similitud de contenido o detección de plagio es el proceso de localizar casos de plagio o infracción de derechos de autor dentro de una obra o documento. El uso ...

La detección de similitud de contenido o detección de plagio es el proceso de localizar casos de plagio o infracción de derechos de autor dentro de una obra o documento. El uso generalizado de las computadoras y la llegada de Internet han facilitado el plagio del trabajo ajeno. [ 1 ] [ 2 ]

La detección de plagio puede realizarse de diversas maneras. La detección humana es la forma más tradicional de identificar plagio en trabajos escritos. Esta puede ser una tarea larga y laboriosa para el lector [ 2 ] y también puede generar inconsistencias en la forma en que se identifica el plagio dentro de una organización. [ 3 ] El software de comparación de texto (TMS), también conocido como "software de detección de plagio" o "software antiplagio", se ha vuelto ampliamente accesible, tanto en forma de productos comerciales como de software de código abierto. El TMS no detecta el plagio en sí, sino que encuentra pasajes específicos de texto en un documento que coinciden con texto en otro documento.

Detección de plagio asistida por software

La detección de plagio asistida por computadora es una tarea de recuperación de información (RI) respaldada por sistemas de RI especializados, que se denomina sistema de detección de plagio (PDS) o sistema de detección de similitud de documentos. [ 4 ]

En documentos de texto

Los sistemas para la detección de similitud de texto implementan uno de dos enfoques de detección genéricos, uno externo y otro intrínseco. [ 5 ] Los sistemas de detección externa comparan un documento sospechoso con una colección de referencia, que es un conjunto de documentos que se asumen genuinos. [ 6 ] Basándose en un modelo de documento elegido y criterios de similitud predefinidos, la tarea de detección es recuperar todos los documentos que contienen texto similar en un grado superior a un umbral elegido al texto del documento sospechoso. [ 7 ] Los PDS intrínsecos analizan únicamente el texto a evaluar sin realizar comparaciones con documentos externos. Este enfoque tiene como objetivo reconocer cambios en el estilo de escritura único de un autor como un indicador de plagio potencial. [ 8 ] [ 9 ] Los PDS no son capaces de identificar el plagio de forma fiable sin el juicio humano. Las similitudes y las características del estilo de escritura se calculan con la ayuda de modelos de documentos predefinidos y pueden representar falsos positivos. [ 10 ] [ 11 ] [ 12 ] [ 13 ] [ 14 ]

Eficacia de esas herramientas en entornos de educación superior

Se realizó un estudio para evaluar la eficacia de un software de detección de similitud en un entorno de educación superior. En una parte del estudio, se asignó a un grupo de estudiantes la tarea de escribir un trabajo. Estos estudiantes recibieron información sobre el plagio y se les informó que su trabajo sería analizado mediante un sistema de detección de similitud de contenido. A un segundo grupo de estudiantes se le asignó la tarea de escribir un trabajo sin ninguna información sobre el plagio. Los investigadores esperaban encontrar tasas más bajas en el primer grupo, pero hallaron tasas de plagio prácticamente iguales en ambos grupos. [ 15 ]

Aproches

La figura siguiente representa una clasificación de los métodos de detección utilizados para la detección de similitud de contenido asistida por computadora. Estos métodos se caracterizan por el tipo de evaluación de similitud que realizan: global o local. Los métodos de evaluación de similitud global utilizan las características extraídas de partes más extensas del texto o del documento en su conjunto para calcular la similitud, mientras que los métodos locales solo examinan segmentos de texto preseleccionados como entrada. [ 16 ]

Clasificación de los métodos de detección de plagio asistidos por computadora [ 16 ]
Toma de huellas dactilares

La huella digital es actualmente el enfoque más utilizado para la detección de similitud de contenido. Este método crea resúmenes representativos de documentos seleccionando un conjunto de múltiples subcadenas ( n-gramas ) de ellos. Los conjuntos representan las huellas digitales y sus elementos se denominan minucias. [ 17 ] [ 18 ] Un documento sospechoso se verifica para detectar plagio calculando su huella digital y consultando las minucias con un índice precalculado de huellas digitales para todos los documentos de una colección de referencia. Las minucias que coinciden con las de otros documentos indican segmentos de texto compartidos y sugieren un posible plagio si superan un umbral de similitud elegido. [ 19 ] Los recursos computacionales y el tiempo son factores limitantes para la huella digital, razón por la cual este método generalmente solo compara un subconjunto de minucias para acelerar el cálculo y permitir verificaciones en colecciones muy grandes, como Internet. [ 17 ]

Coincidencia de cadenas

La comparación de cadenas es un enfoque común en informática . Aplicada al problema de la detección de plagio, se comparan documentos para detectar coincidencias textuales exactas. Se han propuesto numerosos métodos para abordar esta tarea, algunos de los cuales se han adaptado a la detección de plagio externo. La verificación de un documento sospechoso en este contexto requiere el cálculo y almacenamiento de representaciones comparables de manera eficiente para todos los documentos de la colección de referencia, con el fin de compararlos por pares. Generalmente, se han utilizado modelos de documentos basados ​​en sufijos, como árboles o vectores de sufijos, para esta tarea. Sin embargo, la comparación de subcadenas sigue siendo computacionalmente costosa, lo que la convierte en una solución inviable para la verificación de grandes colecciones de documentos. [ 20 ] [ 21 ] [ 22 ]

Bolsa de palabras

El análisis de bolsa de palabras representa la adaptación de la recuperación de espacio vectorial , un concepto tradicional de recuperación de información, al ámbito de la detección de similitud de contenido. Los documentos se representan como uno o varios vectores, por ejemplo, para diferentes partes del documento, que se utilizan para cálculos de similitud por pares. El cálculo de similitud puede basarse en la medida de similitud del coseno tradicional o en medidas de similitud más sofisticadas. [ 23 ] [ 24 ] [ 25 ]

Análisis de citas

La detección de plagio basada en citas (CbPD) [ 26 ] se basa en el análisis de citas y es el único enfoque para la detección de plagio que no se basa en la similitud textual. [ 27 ] CbPD examina la información de citas y referencias en los textos para identificar patrones similares en las secuencias de citas. Por lo tanto, este enfoque es adecuado para textos científicos u otros documentos académicos que contienen citas. El análisis de citas para detectar plagio es un concepto relativamente nuevo. No ha sido adoptado por software comercial , pero existe un primer prototipo de un sistema de detección de plagio basado en citas. [ 28 ] El orden similar y la proximidad de las citas en los documentos examinados son los criterios principales utilizados para calcular las similitudes de los patrones de citas. Los patrones de citas representan subsecuencias que contienen, no exclusivamente, citas compartidas por los documentos comparados. [ 27 ] [ 29 ] También se consideran factores, como el número absoluto o la fracción relativa de citas compartidas en el patrón, así como la probabilidad de que las citas coocurran en un documento, para cuantificar el grado de similitud de los patrones. [ 27 ] [ 29 ] [ 30 ] [ 31 ]

Estilometría

La estilometría engloba métodos estadísticos para cuantificar el estilo de escritura único de un autor [ 32 ] [ 33 ] y se utiliza principalmente para la atribución de autoría o la detección intrínseca de plagio. [ 34 ] La detección de plagio mediante atribución de autoría requiere comprobar si el estilo de escritura del documento sospechoso, supuestamente escrito por un autor determinado, coincide con el de un corpus de documentos escritos por el mismo autor. La detección intrínseca de plagio, por otro lado, descubre el plagio basándose en evidencias internas del documento sospechoso sin compararlo con otros documentos. Esto se realiza construyendo y comparando modelos estilométricos para diferentes segmentos de texto del documento sospechoso, y los pasajes que son estilísticamente diferentes de los demás se marcan como potencialmente plagiados/infringidos. [ 8 ] Aunque son sencillos de extraer, los n-gramas de caracteres han demostrado ser una de las mejores características estilométricas para la detección intrínseca de plagio. [ 35 ]

Redes neuronales

Los enfoques más recientes para evaluar la similitud de contenido utilizando redes neuronales han logrado una precisión significativamente mayor, pero conllevan un alto costo computacional. [ 36 ] Los enfoques tradicionales de redes neuronales incrustan ambas piezas de contenido en incrustaciones de vectores semánticos para calcular su similitud, que a menudo es su similitud de coseno. Los métodos más avanzados realizan predicciones de similitud de extremo a extremo o clasificaciones utilizando la arquitectura Transformer . [ 37 ] [ 38 ] La detección de paráfrasis se beneficia particularmente de modelos preentrenados altamente parametrizados.

Actuación

Las evaluaciones comparativas de los sistemas de detección de similitud de contenido [ 6 ] [ 39 ] [ 40 ] [ 41 ] [ 42 ] [ 43 ] indican que su rendimiento depende del tipo de plagio presente (véase la figura). Excepto el análisis de patrones de citación, todos los métodos de detección se basan en la similitud textual. Por lo tanto, es sintomático que la precisión de la detección disminuya a medida que los casos de plagio se vuelven más complejos.

El rendimiento de detección de los métodos de detección de plagio asistidos por ordenador depende del tipo de plagio presente.

Las copias literales, también conocidas como plagio por copiar y pegar o infracción flagrante de derechos de autor, o los casos de plagio sutilmente disimulado, pueden detectarse con alta precisión mediante los sistemas PDS externos actuales si el software tiene acceso a la fuente. En particular, los procedimientos de coincidencia de subcadenas logran un buen rendimiento para el plagio por copiar y pegar, ya que suelen utilizar modelos de documentos sin pérdida de información, como los árboles de sufijos . El rendimiento de los sistemas que utilizan huellas digitales o análisis de bolsa de palabras para detectar copias depende de la pérdida de información que se produzca en el modelo de documento utilizado. Al aplicar estrategias flexibles de segmentación y selección, son más capaces de detectar formas moderadas de plagio disimulado en comparación con los procedimientos de coincidencia de subcadenas.

La detección intrínseca de plagio mediante estilometría puede superar, hasta cierto punto, las limitaciones de la similitud textual al comparar la similitud lingüística. Dado que las diferencias estilísticas entre los segmentos plagiados y originales son significativas y pueden identificarse de forma fiable, la estilometría puede ayudar a identificar el plagio encubierto y parafraseado . Es probable que las comparaciones estilométricas fallen en los casos en que los segmentos estén fuertemente parafraseados hasta el punto de asemejarse más al estilo de escritura personal del plagiador o si un texto fue compilado por varios autores. Los resultados de las Competiciones Internacionales sobre Detección de Plagio celebradas en 2009, 2010 y 2011, [ 6 ] [ 42 ] [ 43 ] así como los experimentos realizados por Stein, [ 34 ] indican que el análisis estilométrico parece funcionar de forma fiable solo para documentos de varios miles o decenas de miles de palabras, lo que limita la aplicabilidad del método a entornos de detección de plagio asistida por ordenador.

Cada vez se realizan más investigaciones sobre métodos y sistemas capaces de detectar plagio en traducciones. Actualmente, la detección de plagio entre idiomas (CLPD) no se considera una tecnología madura [ 44 ] y los sistemas correspondientes no han logrado resultados de detección satisfactorios en la práctica. [ 41 ]

La detección de plagio basada en citas mediante el análisis de patrones de citación es capaz de identificar paráfrasis y traducciones más sólidas con tasas de éxito más altas en comparación con otros métodos de detección, ya que es independiente de las características textuales. [ 27 ] [ 30 ] Sin embargo, dado que el análisis de patrones de citación depende de la disponibilidad de información de citación suficiente, se limita a textos académicos. Sigue siendo inferior a los métodos basados ​​en texto para detectar pasajes plagiados más cortos, que son típicos en casos de plagio por copiar y pegar o por mezclar fragmentos; este último se refiere a la combinación de fragmentos ligeramente alterados de diferentes fuentes. [ 45 ]

Software

El diseño del software de detección de similitud de contenido para su uso con documentos de texto se caracteriza por una serie de factores: [ 46 ]

La mayoría de los sistemas de detección de plagio a gran escala utilizan grandes bases de datos internas (además de otros recursos) que crecen con cada documento adicional que se envía para su análisis. Sin embargo, algunos consideran que esta característica constituye una violación de los derechos de autor de los estudiantes .

En el código fuente

El plagio en el código fuente informático también es frecuente y requiere herramientas diferentes a las utilizadas para la comparación de texto en documentos. Se ha dedicado una investigación significativa al plagio de código fuente académico. [ 47 ]

Un aspecto distintivo del plagio de código fuente es que no existen empresas que fabriquen ensayos fraudulentos , como ocurre con el plagio tradicional. Dado que la mayoría de las tareas de programación exigen que los estudiantes escriban programas con requisitos muy específicos, resulta muy difícil encontrar programas existentes que ya los cumplan. Como integrar código externo suele ser más complicado que escribirlo desde cero, la mayoría de los estudiantes que plagian optan por hacerlo a partir del código de sus compañeros.

Según Roy y Cordy, [ 48 ] los algoritmos de detección de similitud de código fuente se pueden clasificar en función de:

  • Cadenas de caracteres: busca coincidencias textuales exactas de segmentos, por ejemplo, secuencias de cinco palabras. Es rápido, pero puede verse afectado por el cambio de nombre de los identificadores.
  • Tokens: al igual que con las cadenas de texto, pero utilizando un analizador léxico para convertir primero el programa en tokens . Esto descarta espacios en blanco, comentarios y nombres de identificadores, lo que hace que el sistema sea más robusto frente a simples sustituciones de texto. La mayoría de los sistemas académicos de detección de plagio funcionan a este nivel, utilizando diferentes algoritmos para medir la similitud entre secuencias de tokens.
  • Árboles de análisis sintáctico : construya y compare árboles de análisis sintáctico. Esto permite detectar similitudes de nivel superior. Por ejemplo, la comparación de árboles puede normalizar sentencias condicionales y detectar construcciones equivalentes como similares entre sí.
  • Los gráficos de dependencia de programas (PDG, por sus siglas en inglés) capturan el flujo de control real en un programa y permiten localizar equivalencias de nivel mucho más alto, aunque a un costo mayor en complejidad y tiempo de cálculo.
  • Métricas: las métricas registran puntuaciones de segmentos de código según ciertos criterios; por ejemplo, "el número de bucles y condicionales" o "el número de variables diferentes utilizadas". Las métricas son fáciles de calcular y se pueden comparar rápidamente, pero también pueden generar falsos positivos: dos fragmentos con la misma puntuación en un conjunto de métricas pueden realizar funciones completamente diferentes.
  • Los enfoques híbridos, por ejemplo, los árboles de análisis sintáctico combinados con árboles de sufijos, pueden combinar la capacidad de detección de los árboles de análisis sintáctico con la velocidad que ofrecen los árboles de sufijos, un tipo de estructura de datos de coincidencia de cadenas .

La clasificación anterior se desarrolló para la refactorización de código , y no para la detección de plagio académico (un objetivo importante de la refactorización es evitar el código duplicado , denominado código clonado en la literatura). Los enfoques anteriores son efectivos contra diferentes niveles de similitud; la similitud de bajo nivel se refiere a texto idéntico, mientras que la similitud de alto nivel puede deberse a especificaciones similares. En un entorno académico, donde se espera que todos los estudiantes programen según las mismas especificaciones, se espera un código funcionalmente equivalente (con alta similitud), y solo la similitud de bajo nivel se considera prueba de plagio.

Diferencia entre plagio y derechos de autor

El plagio y los derechos de autor son conceptos esenciales en la escritura académica y creativa que escritores, investigadores y estudiantes deben comprender. Aunque puedan sonar similares, no lo son; se pueden utilizar diferentes estrategias para abordar cada uno de ellos. [ 49 ]

Algoritmos

Se han propuesto varios algoritmos para detectar código duplicado. Por ejemplo:

Complicaciones con el uso de software de comparación de textos para la detección de plagio

Se han documentado varias complicaciones con el uso de software de comparación de textos para la detección de plagio. Una de las preocupaciones más frecuentes se centra en la cuestión de los derechos de propiedad intelectual. El argumento principal es que los materiales deben agregarse a una base de datos para que el software de comparación de textos pueda determinar una coincidencia de manera efectiva, pero agregar los materiales de los usuarios a dicha base de datos puede infringir sus derechos de propiedad intelectual. [ 56 ] [ 57 ] Esta cuestión se ha planteado en varios casos judiciales.

Una complicación adicional con el uso de TMS es que el software solo encuentra coincidencias exactas con otros textos. No detecta, por ejemplo, paráfrasis deficientes ni la práctica de plagiar mediante el uso de suficientes sustituciones de palabras para eludir el software de detección, lo que se conoce como rogeting . Tampoco puede evaluar si la paráfrasis refleja genuinamente una comprensión original o si es un intento de eludir la detección. [ 58 ]

Otra complicación con TMS es su tendencia a marcar mucho más contenido del necesario, incluyendo citas legítimas y paráfrasis, lo que dificulta encontrar casos reales de plagio. [ 57 ] Este problema surge porque los algoritmos de TMS se centran principalmente en similitudes superficiales del texto sin considerar el contexto de la escritura. [ 58 ] [ 59 ] Los educadores han expresado su preocupación de que la dependencia de TMS pueda desviar la atención de la enseñanza de habilidades adecuadas de citación y escritura, y puede crear una visión simplificada del plagio que ignora los matices de la escritura estudiantil. [ 60 ] Como resultado, los académicos argumentan que estos falsos positivos pueden causar temor en los estudiantes y desalentarlos a usar su voz auténtica. [ 56 ]

Véase también

Referencias

  1. Culwin, Fintan; Lancaster, Thomas (2001). "Plagio, prevención, disuasión y detección" . CiteSeerX 10.1.1.107.178 . Archivado del original el 18 de abril de 2021. Recuperado el 11 de noviembre de 2022 a través de The Higher Education Academy . 
  2. 1 2 Bretag, T. y Mahmud, S. (2009). Un modelo para determinar el plagio estudiantil: detección electrónica y juicio académico. Journal of University Teaching & Learning Practice, 6 (1). Recuperado de http://ro.uow.edu.au/jutlp/vol6/iss1/6
  3. Macdonald, R., & Carroll, J. (2006). Plagio: un problema complejo que requiere un enfoque institucional integral. Assessment & Evaluation in Higher Education, 31 (2), 233–245. doi : 10.1080/02602930500262536
  4. Foltýnek, Tomáš; Meuschke, normando; Gipp, Bela (16 de octubre de 2019). "Detección de plagio académico: una revisión sistemática de la literatura" . Encuestas de Computación ACM . 52 (6): 1– 42. doi : 10.1145/3345317 .
  5. Stein, Benno; Koppel, Moshe; Stamatatos, Efstathios (diciembre de 2007), "Análisis de plagio, identificación de autoría y detección de duplicados cercanos PAN'07" (PDF) , SIGIR Forum , 41 (2): 68, doi : 10.1145/1328964.1328976 , S2CID 6379659 , archivado del original (PDF) el 2 de abril de 2012 , recuperado el 7 de octubre de 2011 
  6. 1 2 3 Potthast, Martin; Stein, Benno; Eiselt, Andreas; Barrón-Cedeño, Alberto; Rosso, Paolo (2009), "Overview of the 1st International Competition on Plagiarism Detection", PAN09 - 3rd Workshop on Uncovering Plagiarism, Authorship and Social Software Misuse and 1st International Competition on Plagiarism Detection (PDF) , CEUR Workshop Proceedings, vol. 502, pp. 1– 9, ISSN 1613-0073 , archivado del original (PDF) el 2 de abril de 2012   
  7. Stein, Benno; Meyer zu Eissen, Sven; Potthast, Martin (2007), "Estrategias para recuperar documentos plagiados", Actas de la 30.ª Conferencia Internacional Anual ACM SIGIR (PDF) , ACM, págs. 825–826 , doi : 10.1145/1277741.1277928 , ISBN  978-1-59593-597-7, S2CID 3898511 , archivado del original (PDF) el 2 de abril de 2012 , recuperado el 7 de octubre de 2011 
  8. 1 2 Meyer zu Eissen, Sven; Stein, Benno (2006), "Intrinsic Plagiarism Detection", Advances in Information Retrieval 28th European Conference on IR Research, ECIR 2006, Londres, Reino Unido, 10-12 de abril de 2006 Actas (PDF) , Lecture Notes in Computer Science, vol. 3936, Springer, pp. 565-569 , CiteSeerX 10.1.1.110.5366 , doi : 10.1007/11735106_66 , ISBN    978-3-540-33347-0Archivado del original (PDF) el 2 de abril de 2012 , consultado el 7 de octubre de 2011.
  9. Bensalem, Imene (2020). "Detección intrínseca de plagio: una revisión". Detección de plagio: un enfoque en el método intrínseco y la evaluación en lengua árabe (tesis doctoral) . Universidad Constantine 2. doi : 10.13140/RG.2.2.25727.84641 .
  10. Bao, Jun-Peng; Malcolm, James A. (2006), "Similitud de texto en artículos de conferencias académicas", Actas de la 2.ª Conferencia Internacional sobre Plagio (PDF) , Northumbria University Press, archivado del original el 16 de septiembre de 2018 , consultado el 7 de octubre de 2011.
  11. Clough, Paul (2000), Plagio en lenguajes naturales y de programación: una visión general de las herramientas y tecnologías actuales (PDF) (Informe técnico), Departamento de Informática, Universidad de Sheffield, archivado del original (PDF) el 18 de agosto de 2011.
  12. Culwin, Fintan; Lancaster, Thomas (2001), "Problemas de plagio en la educación superior" (PDF) , Vine , 31 (2): 36–41 , doi : 10.1108/03055720010804005 , archivado del original (PDF) el 5 de abril de 2012
  13. Lancaster, Thomas (2003), Detección eficaz y eficiente del plagio (Tesis doctoral), Escuela de Informática, Sistemas de Información y Matemáticas, Universidad South Bank
  14. Maurer, Hermann; Zaka, Bilal (2007), "Plagio: un problema y cómo combatirlo", Actas de la Conferencia Mundial sobre Multimedia Educativa, Hipermedia y Telecomunicaciones 2007 , AACE, pp. 4451–4458 , ISBN  9781880094624
  15. Youmans, Robert J. (noviembre de 2011). "¿La adopción de software de detección de plagio en la educación superior reduce el plagio?". Estudios en Educación Superior . 36 (7): 749– 761. doi : 10.1080/03075079.2010.523457 . S2CID 144143548 . 
  16. 1 2 Meuschke, Norman; Gipp, Bela (2013), "Estado del arte en la detección del plagio académico" (PDF) , International Journal for Educational Integrity , 9 (1): 50–71 , doi : 10.5281/zenodo.3482941 , consultado el 14 de abril de 2026
  17. 1 2 Hoad, Timothy; Zobel, Justin (2003), "Métodos para identificar documentos con versiones y plagiados" (PDF) , Journal of the American Society for Information Science and Technology , 54 (3): 203– 215, CiteSeerX 10.1.1.18.2680 , doi : 10.1002/asi.10170 , archivado del original (PDF) el 30 de abril de 2015 , recuperado el 14 de octubre de 2014 
  18. Stein, Benno (julio de 2005), "Huellas digitales difusas para la recuperación de información basada en texto", Actas de I-KNOW '05, 5.ª Conferencia Internacional sobre Gestión del Conocimiento, Graz, Austria (PDF) , Springer, Know-Center, págs. 572–579 , archivado del original (PDF) el 2 de abril de 2012 , consultado el 7 de octubre de 2011. 
  19. Brin, Sergey; Davis, James; Garcia-Molina, Hector (1995), "Copy Detection Mechanisms for Digital Documents", Actas de la Conferencia Internacional ACM SIGMOD de 1995 sobre Gestión de Datos (PDF) , ACM, págs. 398–409 , CiteSeerX 10.1.1.49.1567 , doi : 10.1145/223784.223855 , ISBN   978-1-59593-060-6, S2CID 8652205 , archivado del original (PDF) el 18 de agosto de 2016 , recuperado el 7 de octubre de 2011 
  20. Monostori, Krisztián; Zaslavsky, Arkady; Schmidt, Heinz (2000), "Sistema de detección de superposición de documentos para bibliotecas digitales distribuidas", Actas de la quinta conferencia ACM sobre bibliotecas digitales (PDF) , ACM, págs. 226–227 , doi : 10.1145/336597.336667 , ISBN  978-1-58113-231-1, S2CID 5796686 , archivado del original (PDF) el 15 de abril de 2012 , recuperado el 7 de octubre de 2011 
  21. Baker, Brenda S. (febrero de 1993), Sobre la detección de duplicaciones en cadenas y software (Informe técnico), AT&T Bell Laboratories, NJ, archivado del original (gs) el 30 de octubre de 2007.
  22. Khmelev, Dmitry V.; Teahan, William J. (2003), "Una medida basada en la repetición para la verificación de colecciones de texto y para la categorización de texto", SIGIR'03: Actas de la 26.ª conferencia internacional anual ACM SIGIR sobre investigación y desarrollo en recuperación de información , ACM, pp. 104–110 , CiteSeerX 10.1.1.9.6155 , doi : 10.1145/860435.860456 , ISBN   978-1581136463, S2CID 7316639 
  23. Si, Antonio; Leong, Hong Va; Lau, Rynson WH (1997), "CHECK: Un sistema de detección de plagio de documentos", SAC '97: Actas del simposio ACM de 1997 sobre computación aplicada (PDF) , ACM, págs. 70–77 , doi : 10.1145/331697.335176 , ISBN  978-0-89791-850-3, S2CID 15273799 
  24. Dreher, Heinz (2007), "Análisis conceptual automático para la detección de plagio" (PDF) , Information and Beyond: The Journal of Issues in Informing Science and Information Technology , 4 : 601–614 , doi : 10.28945/974
  25. Muhr, Markus; Zechner, Mario; Kern, Roman; Granitzer, Michael (2009), "Detección de plagio externo e intrínseco mediante modelos de espacio vectorial", PAN09 - 3er Taller sobre detección de plagio, autoría y mal uso de software social y 1ª Competición Internacional sobre detección de plagio (PDF) , Actas del Taller CEUR, vol. 502, págs. 47–55 , ISSN 1613-0073 , archivado del original (PDF) el 2 de abril de 2012   
  26. ^ Gipp, Bela (2014), Detección de plagio basada en citas , Springer Vieweg Research, ISBN 978-3-658-06393-1
  27. 1 2 3 4 Gipp, Bela; Beel, Jöran (junio de 2010), "Detección de plagio basada en citas: un nuevo enfoque para identificar el plagio de trabajos de forma independiente del idioma", Actas de la 21.ª Conferencia ACM sobre Hipertexto e Hipermedia (HT'10) (PDF) , ACM, págs. 273-274 , doi : 10.1145/1810617.1810671 , ISBN  978-1-4503-0041-4, S2CID 2668037 , archivado del original (PDF) el 25 de abril de 2012 , recuperado el 21 de octubre de 2011 
  28. Gipp, Bela; Meuschke, Norman; Breitinger, Corinna; Lipinski, Mario; Nürnberger, Andreas (28 de julio de 2013), "Demostración del análisis de patrones de citación para la detección de plagio", Actas de la 36.ª Conferencia Internacional ACM SIGIR sobre Investigación y Desarrollo en Recuperación de Información (PDF) , ACM, pág. 1119, doi : 10.1145/2484028.2484214 , ISBN  9781450320344, S2CID 2106222 
  29. 1 2 Gipp, Bela; Meuschke, Norman (septiembre de 2011), "Algoritmos de coincidencia de patrones de citas para la detección de plagio basada en citas: teselado de citas voraz, agrupamiento de citas y secuencia de citas común más larga", Actas del 11.º Simposio ACM sobre Ingeniería de Documentos (DocEng2011) (PDF) , ACM, págs. 249–258 , doi : 10.1145/2034691.2034741 , ISBN  978-1-4503-0863-2, S2CID 207190305 , archivado del original (PDF) el 25 de abril de 2012 , recuperado el 7 de octubre de 2011 
  30. 1 2 Gipp, Bela; Meuschke, Norman; Beel, Jöran (junio de 2011), "Evaluación comparativa de enfoques de detección de plagio basados ​​en texto y citas utilizando GuttenPlag", Actas de la 11.ª Conferencia Conjunta ACM/IEEE-CS sobre Bibliotecas Digitales (JCDL'11) (PDF) , ACM, págs. 255–258 , CiteSeerX 10.1.1.736.4865 , doi : 10.1145/1998076.1998124 , ISBN   978-1-4503-0744-4, S2CID 3683238 , archivado del original (PDF) el 25 de abril de 2012 , recuperado el 7 de octubre de 2011 
  31. Gipp, Bela; Beel, Jöran (julio de 2009), "Análisis de proximidad de citas (CPA): un nuevo enfoque para identificar trabajos relacionados basado en el análisis de co-citación", Actas de la 12.ª Conferencia Internacional sobre Cienciometría e Informetría (ISSI'09) (PDF) , Sociedad Internacional de Cienciometría e Informetría, págs. 571-575 , ISSN 2175-1935 , archivado del original (PDF) el 13 de septiembre de 2012 , consultado el 7 de octubre de 2011.  
  32. Holmes, David I. (1998), "La evolución de la estilometría en la investigación en humanidades", Literary and Linguistic Computing , 13 (3): 111– 117, doi : 10.1093/llc/13.3.111
  33. Juola, Patrick (2006), "Atribución de autoría" (PDF) , Foundations and Trends in Information Retrieval , 1 (3): 233–334 , CiteSeerX 10.1.1.219.1605 , doi : 10.1561/1500000005 , ISSN 1554-0669 , archivado del original (PDF) el 24 de octubre de 2020 , recuperado el 7 de octubre de 2011  
  34. 1 2 Stein, Benno; Lipka, Nedim; Prettenhofer, Peter (2011), "Análisis intrínseco del plagio" (PDF) , Language Resources and Evaluation , 45 (1): 63–82 , doi : 10.1007/s10579-010-9115-y , ISSN 1574-020X , S2CID 13426762 , archivado del original (PDF) el 2 de abril de 2012 , recuperado el 7 de octubre de 2011  
  35. Bensalem, Imene; Rosso, Paolo; Chikhi, Salim (2019). "Sobre el uso de n-gramas de caracteres como única evidencia intrínseca de plagio". Language Resources and Evaluation . 53 (3): 363– 396. doi : 10.1007/s10579-019-09444-w . hdl : 10251/159151 . S2CID 86630897 . 
  36. Reimers, Nils; Gurevych, Iryna (2019). "Sentence-BERT: Incrustaciones de oraciones usando redes BERT siamesas". arXiv : 1908.10084 [ cs.CL ].
  37. Lan, Wuwei; Xu, Wei (2018). "Modelos de redes neuronales para la identificación de paráfrasis, similitud textual semántica, inferencia del lenguaje natural y respuesta a preguntas" . Actas de la 27.ª Conferencia Internacional sobre Lingüística Computacional . Santa Fe, Nuevo México, EE. UU.: Asociación de Lingüística Computacional: 3890–3902 . arXiv : 1806.04330 .
  38. Wahle, Jan Philip; Ruas, Terry; Foltýnek, Tomáš; Meuschke, Norman; Gipp, Bela (2022), "Identifying Machine-Paraphrased Plagiarism" , en Smits, Malte (ed.), Information for a Better World: Shaping the Global Future , Lecture Notes in Computer Science, vol. 13192, Cham: Springer International Publishing, pp. 393–413 , arXiv : 2103.11909 , doi : 10.1007/978-3-030-96957-8_34 , ISBN   978-3-030-96956-1, S2CID 232307572 , consultado el 6 de octubre de 2022 
  39. Portal Plagiat - Softwaretest 2004 (en alemán), HTW Universidad de Ciencias Aplicadas de Berlín, archivado del original el 25 de octubre de 2011 , consultado el 6 de octubre de 2011.
  40. Portal Plagiat - Softwaretest 2008 (en alemán), HTW University of Applied Sciences Berlin , consultado el 6 de octubre de 2011.
  41. 1 2 Portal Plagiat - Softwaretest 2010 (en alemán), Universidad de Ciencias Aplicadas HTW de Berlín , consultado el 6 de octubre de 2011
  42. 1 2 Potthast, Martin; Barrón-Cedeño, Alberto; Eiselt, Andreas; Stein, Benno; Rosso, Paolo (2010), "Overview of the 2nd International Competition on Plagiarism Detection", Notebook Papers of CLEF 2010 LABs and Workshops, 22–23 September, Padua, Italy (PDF) , archivado del original (PDF) el 3 de abril de 2012 , recuperado el 7 de octubre de 2011
  43. 1 2 Potthast, Martin; Eiselt, Andreas; Barrón-Cedeño, Alberto; Stein, Benno; Rosso, Paolo (2011), "Overview of the 3rd International Competition on Plagiarism Detection", Notebook Papers of CLEF 2011 LABs and Workshops, 19–22 September, Amsterdam, Netherlands (PDF) , archivado del original (PDF) el 2 de abril de 2012 , recuperado el 7 de octubre de 2011
  44. ^ Potthast, Martín; Barrón-Cedeño, Alberto; Stein, Benno; Rosso, Paolo (2011), "Detección de plagio en varios idiomas" (PDF) , Evaluación y recursos lingüísticos , 45 (1): 45– 62, doi : 10.1007/s10579-009-9114-z , hdl : 10251/37479 , ISSN 1574-020X , S2CID 14942239 , archivado desde el original (PDF) el 26 de noviembre de 2013 , recuperado 7 de octubre 2011  
  45. Weber-Wulff, Debora (junio de 2008), "Sobre la utilidad del software de detección de plagio", en Actas de la 3.ª Conferencia Internacional sobre Plagio, Newcastle Upon Tyne (PDF) , archivado del original el 1 de octubre de 2013 , consultado el 29 de septiembre de 2013.
  46. "¿Cómo comprobar si un texto es plagiado? ¿Y cómo aumentar su originalidad?" . TextGears .
  47. "Prevención y detección de plagio: recursos en línea sobre plagio de código fuente" Archivado el 15 de noviembre de 2012 en Wayback Machine . Academia de Educación Superior , Universidad de Ulster .
  48. Roy, Chanchal Kumar; Cordy, James R. (26 de septiembre de 2007). "Un estudio sobre la investigación de detección de clones de software" . Escuela de Informática, Universidad Queen's, Canadá .
  49. Prasad, Suhani. "Plagio y derechos de autor" . CheckForPlag .
  50. Brenda S. Baker . Un programa para identificar código duplicado. Computing Science and Statistics, 24:49–57, 1992.
  51. Ira D. Baxter, et al. Detección de clones mediante árboles de sintaxis abstracta
  52. Detección visual de código duplicado Archivado el 29/06/2006 en Wayback Machine por Matthias Rieger, Stephane Ducasse.
  53. Yuan, Y. y Guo, Y. CMCD: Detección de clones de código basada en matriz de conteo, en 2011 18th Asia-Pacific Software Engineering Conference. IEEE, diciembre de 2011, págs. 250–257.
  54. Chen, X., Wang, AY y Tempero, ED (2014). Replicación y reproducción de estudios de detección de clones de código . En ACSC (págs. 105-114).
  55. Bulychev, Peter y Marius Minea. " Detección de código duplicado mediante anti-unificación ". Actas del Coloquio de Primavera/Verano para Jóvenes Investigadores en Ingeniería de Software. No. 2. Федеральное государственное бюджетное учреждение науки Институт системного программирования Российской академии наук, 2008.
  56. 1 2 Vie, Stephanie (1 de marzo de 2013). "Una pedagogía de resistencia hacia las tecnologías de detección de plagio" . Computers and Composition . Writing on the Frontlines. 30 (1): 3– 15. doi : 10.1016/j.compcom.2013.01.002 . ISSN 8755-4615 . 
  57. 1 2 Gillis, Kathleen; Lang, Susan; Norris, Monica; Palmer, Laura (noviembre de 2009). "Comprobadores electrónicos de plagio: barreras para desarrollar una voz académica" (PDF) . The WAC Journal . 20 : 51–62 . doi : 10.37514/WAC-J.2009.20.1.04 .
  58. 1 2 Canzonetta, Jordan; Kannan, Vani (2016). "Globalización del plagio y evaluación de la escritura: un estudio de caso de Turnitin" (PDF) . Revista de evaluación de la escritura de UC Davis . 9 (2).
  59. Stapleton, Paul (1 de junio de 2012). "Evaluación de la eficacia del software antiplagio: un estudio empírico de escritores graduados en segunda lengua" . Journal of English for Academic Purposes . 11 (2): 125– 133. doi : 10.1016/j.jeap.2011.10.003 . ISSN 1475-1585 . 
  60. Purdy, James P (2005). "Calling Off the Hounds: Technology and the Visibility of Plagiarism" . Pedagogy . 5 (2): 275– 296. doi : 10.1215/15314200-5-2-275 . ISSN 1533-6255 . 

Literatura

  • Carroll, J. (2002). Manual para prevenir el plagio en la educación superior . Oxford: Centro de Desarrollo del Personal y del Aprendizaje de Oxford, Universidad Oxford Brookes. (96 p.), ISBN 1873576560
  • Zeidman, B. (2011). Manual del detective de propiedad intelectual de software . Prentice Hall . (480 págs.), ISBN 0137035330