Articulo de referencia

Extracción de conocimiento

La extracción de conocimiento consiste en la creación de conocimiento a partir de fuentes estructuradas ( bases de datos relacionales , XML ) y no estructuradas ( texto , docume...

La extracción de conocimiento consiste en la creación de conocimiento a partir de fuentes estructuradas ( bases de datos relacionales , XML ) y no estructuradas ( texto , documentos, imágenes ). El conocimiento resultante debe estar en un formato legible e interpretable por máquina y debe representarlo de manera que facilite la inferencia. Si bien es metodológicamente similar a la extracción de información (EI) en el procesamiento del lenguaje natural (PLN) y a la extracción, transformación y carga (ETL), el criterio principal es que el resultado de la extracción va más allá de la creación de información estructurada o la transformación en un esquema relacional . Requiere la reutilización de conocimiento formal existente (reutilizando identificadores u ontologías ) o la generación de un esquema basado en los datos de origen.

El grupo RDB2RDF del W3C [ 1 ] estaba estandarizando un lenguaje para la extracción de marcos de descripción de recursos (RDF) de bases de datos relacionales . Otro ejemplo popular de extracción de conocimiento es la transformación de Wikipedia en datos estructurados y también el mapeo al conocimiento existente (ver DBpedia y Freebase ).

Descripción general

Tras la estandarización de lenguajes de representación del conocimiento como RDF y OWL , se ha llevado a cabo una gran cantidad de investigación en este campo, especialmente en lo que respecta a la transformación de bases de datos relacionales a RDF, la resolución de identidades , el descubrimiento de conocimiento y el aprendizaje de ontologías. El proceso general utiliza métodos tradicionales de extracción de información y de extracción, transformación y carga (ETL), que transforman los datos de las fuentes en formatos estructurados. De esta manera, se comprende cómo interactúan y aprenden unos de otros.

Los siguientes criterios pueden utilizarse para categorizar los enfoques en este tema (algunos de ellos solo tienen en cuenta la extracción de bases de datos relacionales): [ 2 ]

Ejemplos

Vinculación de entidades

  1. DBpedia Spotlight , OpenCalais , Dandelion dataTXT , la API de Zemanta, Extractiv y PoolParty Extractor analizan texto libre mediante el reconocimiento de entidades nombradas y luego desambiguan los candidatos mediante la resolución de nombres y vinculan las entidades encontradas al repositorio de conocimiento de DBpedia [ 3 ] ( Demostración de Dandelion dataTXT archivada el 2 de noviembre de 2013 en Wayback Machine o demostración web de DBpedia Spotlight o demostración de PoolParty Extractor ).

El presidente Obama pidió el miércoles al Congreso que prorrogue la exención fiscal para estudiantes incluida en el paquete de estímulo económico del año pasado, argumentando que dicha medida proporciona una ayuda más generosa.

Dado que el presidente Obama está vinculado a un recurso LinkedData de DBpedia , se puede recuperar información adicional automáticamente y un Razonador Semántico puede, por ejemplo, inferir que la entidad mencionada es del tipo Persona (usando FOAF (software) ) y del tipo Presidentes de los Estados Unidos (usando YAGO ). Contraejemplos: Métodos que solo reconocen entidades o se vinculan a artículos de Wikipedia y otros destinos que no proporcionan una recuperación adicional de datos estructurados y conocimiento formal.

Bases de datos relacionales a RDF

  1. Triplify , D2R Server, Ultrawrap Archived 2016-11-27 at the Wayback Machine , y Virtuoso RDF Views son herramientas que transforman bases de datos relacionales a RDF. Durante este proceso permiten reutilizar vocabularios y ontologías existentes durante la conversión. Al transformar una tabla relacional típica llamada users , una columna (por ejemplo, name ) o una agregación de columnas (por ejemplo, first_name y last_name ) debe proporcionar la URI de la entidad creada. Normalmente se utiliza la clave primaria. Cada una de las demás columnas se puede extraer como una relación con esta entidad. [ 4 ] Luego, se utilizan (y reutilizan) propiedades con semántica definida formalmente para interpretar la información. Por ejemplo, una columna en una tabla user llamada marriedTo se puede definir como una relación simétrica y una columna homepage se puede convertir en una propiedad del vocabulario FOAF llamada foaf:homepage , lo que la califica como una propiedad funcional inversa . Luego, cada entrada de la tabla de usuarios puede convertirse en una instancia de la clase foaf:Person (Ontología de población). Adicionalmente, se podría crear conocimiento del dominio (en forma de ontología) a partir del status_id , ya sea mediante reglas creadas manualmente (si status_id es 2, la entrada pertenece a la clase Teacher) o mediante métodos (semi)automatizados ( aprendizaje de ontologías ). Aquí hay un ejemplo de transformación:
: Peter : casadoCon : Mary . : casadoCon un búho : PropiedadSimétrica . : Peter foaf : página de inicio <https://example.org/Peters_page> . : Peter un foaf : Persona . : Peter un : Estudiante . : Claus un : Profesor .

Extracción de fuentes estructuradas a RDF

Mapeo 1:1 de tablas/vistas RDB a entidades/atributos/valores RDF

Al construir una representación RDB de un dominio de problema, el punto de partida suele ser un diagrama entidad-relación (DER). Normalmente, cada entidad se representa como una tabla de base de datos, cada atributo de la entidad se convierte en una columna de esa tabla y las relaciones entre entidades se indican mediante claves foráneas. Cada tabla define una clase particular de entidad, y cada columna, uno de sus atributos. Cada fila de la tabla describe una instancia de entidad, identificada de forma única por una clave primaria. Las filas de la tabla describen colectivamente un conjunto de entidades. En una representación RDF equivalente del mismo conjunto de entidades:

  • Cada columna de la tabla es un atributo (es decir, un predicado).
  • Cada valor de columna es un valor de atributo (es decir, un objeto).
  • Cada clave de fila representa un ID de entidad (es decir, sujeto).
  • Cada fila representa una instancia de entidad.
  • Cada fila (instancia de entidad) está representada en RDF por una colección de triples con un sujeto común (ID de entidad).

Por lo tanto, para generar una vista equivalente basada en la semántica RDF, el algoritmo de mapeo básico sería el siguiente:

  1. crear una clase RDFS para cada tabla
  2. convertir todas las claves primarias y claves foráneas en IRIs
  3. asignar un predicado IRI a cada columna
  4. asignar un predicado rdf:type para cada fila, vinculándolo a un IRI de clase RDFS correspondiente a la tabla.
  5. Para cada columna que no forme parte de una clave primaria ni de una clave foránea, construya una tripleta que contenga el IRI de la clave primaria como sujeto, el IRI de la columna como predicado y el valor de la columna como objeto.

Las primeras menciones de este mapeo básico o directo se pueden encontrar en la comparación que hace Tim Berners-Lee del modelo ER con el modelo RDF. [ 4 ]

Mapeos complejos de bases de datos relacionales a RDF

El mapeo 1:1 mencionado anteriormente expone los datos heredados como RDF de manera directa, se pueden emplear refinamientos adicionales para mejorar la utilidad de la salida RDF con respecto a los casos de uso dados. Normalmente, se pierde información durante la transformación de un diagrama entidad-relación (DER) a tablas relacionales (los detalles se pueden encontrar en el desajuste de impedancia objeto-relacional ) y tiene que ser ingeniería inversa . Desde una perspectiva conceptual, los enfoques para la extracción pueden provenir de dos direcciones. La primera dirección intenta extraer o aprender un esquema OWL del esquema de base de datos dado. Los enfoques iniciales usaban una cantidad fija de reglas de mapeo creadas manualmente para refinar el mapeo 1:1. [ 5 ] [ 6 ] [ 7 ] Los métodos más elaborados están empleando heurísticas o algoritmos de aprendizaje para inducir información esquemática (los métodos se superponen con el aprendizaje de ontologías ). Mientras que algunos enfoques intentan extraer la información de la estructura inherente al esquema SQL [ 8 ] (analizando, por ejemplo, las claves foráneas), otros analizan el contenido y los valores de las tablas para crear jerarquías conceptuales [ 9 ] (por ejemplo, las columnas con pocos valores son candidatas a convertirse en categorías). La segunda dirección intenta mapear el esquema y su contenido a una ontología de dominio preexistente (véase también: alineación de ontologías ). Sin embargo, a menudo no existe una ontología de dominio adecuada y debe crearse primero.

XML

Dado que XML se estructura como un árbol, cualquier dato puede representarse fácilmente en RDF, que se estructura como un grafo. XML2RDF es un ejemplo de un enfoque que utiliza nodos vacíos de RDF y transforma elementos y atributos XML en propiedades RDF. Sin embargo, el tema es más complejo, como en el caso de las bases de datos relacionales. En una tabla relacional, la clave primaria es un candidato ideal para convertirse en el sujeto de las tripletas extraídas. Un elemento XML, en cambio, puede transformarse —según el contexto— en sujeto, predicado u objeto de una tripleta. XSLT puede utilizarse como un lenguaje de transformación estándar para convertir manualmente XML a RDF.

Estudio de métodos/herramientas

Extracción de fuentes de lenguaje natural

La mayor parte de la información contenida en los documentos comerciales (aproximadamente el 80 % [ 10 ] ) está codificada en lenguaje natural y, por lo tanto, no está estructurada. Dado que los datos no estructurados representan un desafío para la extracción de conocimiento, se requieren métodos más sofisticados, que generalmente tienden a ofrecer peores resultados en comparación con los datos estructurados. Sin embargo, el potencial para la adquisición masiva de conocimiento extraído debería compensar la mayor complejidad y la menor calidad de la extracción. En adelante, las fuentes en lenguaje natural se entienden como fuentes de información donde los datos se proporcionan de forma no estructurada como texto plano. Si el texto proporcionado está además incrustado en un documento con marcado (por ejemplo, un documento HTML), los sistemas mencionados normalmente eliminan los elementos de marcado automáticamente.

Anotación lingüística / procesamiento del lenguaje natural (PLN)

Como paso previo al procesamiento para la extracción de conocimiento, puede ser necesario realizar anotaciones lingüísticas con una o varias herramientas de PLN . Los módulos individuales en un flujo de trabajo de PLN normalmente se basan en formatos específicos de la herramienta para la entrada y la salida, pero en el contexto de la extracción de conocimiento, se han aplicado formatos estructurados para representar las anotaciones lingüísticas.

Las tareas típicas de PLN relevantes para la extracción de conocimiento incluyen:

  • etiquetado de partes de la oración (POS)
  • lematización (LEMMA) o derivación (STEM)
  • desambiguación del sentido de las palabras (WSD, relacionada con la anotación semántica que aparece a continuación)
  • Reconocimiento de entidades nombradas (NER, véase también IE más abajo)
  • Análisis sintáctico, que a menudo adopta dependencias sintácticas (DEP).
  • Análisis sintáctico superficial (CHUNK): si el rendimiento es un problema, el análisis por fragmentos permite una extracción rápida de frases nominales y otras frases.
  • resolución de anáforas (véase resolución de correferencias en IE más abajo, pero aquí se entiende como la tarea de crear vínculos entre menciones textuales en lugar de entre la mención de una entidad y una representación abstracta de la misma)
  • Etiquetado de roles semánticos (SRL, relacionado con la extracción de relaciones; no confundir con la anotación semántica que se describe a continuación).
  • Análisis del discurso (relaciones entre diferentes oraciones, rara vez utilizado en aplicaciones del mundo real)

En PLN, estos datos se representan típicamente en formatos TSV (formatos CSV con tabulaciones como separadores), a menudo denominados formatos CoNLL. Para los flujos de trabajo de extracción de conocimiento, se han creado vistas RDF de estos datos de acuerdo con los siguientes estándares de la comunidad:

  • Formato de intercambio de PLN (NIF, para muchos tipos frecuentes de anotación) [ 11 ] [ 12 ]
  • Anotación web (WA, a menudo utilizada para vincular entidades) [ 13 ]
  • CoNLL-RDF (para anotaciones representadas originalmente en formatos TSV) [ 14 ] [ 15 ]

Otros formatos específicos de la plataforma incluyen:

  • Formato de intercambio LAPPS (LIF, utilizado en la red LAPPS) [ 16 ] [ 17 ]
  • Formato de anotación de PLN (NAF, utilizado en el sistema de gestión de flujo de trabajo NewsReader) [ 18 ] [ 19 ]

Extracción de información tradicional (EI)

La extracción de información tradicional [ 20 ] es una tecnología de procesamiento del lenguaje natural que extrae información de textos en lenguaje natural y la estructura de manera adecuada. Los tipos de información que se van a identificar deben especificarse en un modelo antes de comenzar el proceso, razón por la cual todo el proceso de extracción de información tradicional depende del dominio. La extracción de información se divide en las siguientes cinco subtareas.

La tarea de reconocimiento de entidades nombradas consiste en identificar y categorizar todas las entidades nombradas contenidas en un texto (asignación de una entidad nombrada a una categoría predefinida). Esto se logra mediante la aplicación de métodos basados ​​en gramática o modelos estadísticos.

La resolución de correferencias identifica entidades equivalentes, reconocidas mediante el reconocimiento de entidades nombradas (NER), dentro de un texto. Existen dos tipos relevantes de relaciones de equivalencia. El primero se refiere a la relación entre dos entidades representadas diferentes (por ejemplo, IBM Europe e IBM) y el segundo a la relación entre una entidad y sus referencias anafóricas (por ejemplo, it e IBM). Ambos tipos pueden ser reconocidos mediante la resolución de correferencias.

Durante la construcción de los elementos de la plantilla, el sistema IE identifica propiedades descriptivas de las entidades, reconocidas por NER y CO. Estas propiedades corresponden a cualidades comunes como rojo o grande.

La construcción de relaciones de plantilla identifica las relaciones que existen entre los elementos de la plantilla. Estas relaciones pueden ser de varios tipos, como "trabaja para" o "ubicado en", con la restricción de que tanto el dominio como el rango correspondan a entidades.

En el escenario modelo, los eventos de producción, que se describen en el texto, se identificarán y estructurarán con respecto a las entidades reconocidas por NER y CO y las relaciones identificadas por TR.

Extracción de información basada en ontologías (OBIE)

La extracción de información basada en ontologías [ 10 ] es un subcampo de la extracción de información, en el que se utiliza al menos una ontología para guiar el proceso de extracción de información de texto en lenguaje natural. El sistema OBIE utiliza métodos de extracción de información tradicionales para identificar conceptos , instancias y relaciones de las ontologías utilizadas en el texto, que se estructurarán en una ontología después del proceso. De esta manera, las ontologías de entrada constituyen el modelo de información que se extraerá. [ 21 ]

Aprendizaje de ontologías (OL)

El aprendizaje de ontologías consiste en la creación automática o semiautomática de ontologías, incluyendo la extracción de los términos del dominio correspondiente a partir de texto en lenguaje natural. Dado que la creación manual de ontologías requiere muchísimo trabajo y tiempo, existe una gran motivación para automatizar el proceso.

Anotación semántica (AS)

Durante la anotación semántica, [ 22 ] el texto en lenguaje natural se aumenta con metadatos (a menudo representados en RDFa ), que deberían hacer que la semántica de los términos contenidos sea comprensible para la máquina. En este proceso, que generalmente es semiautomático, se extrae conocimiento en el sentido de que se establece un vínculo entre términos léxicos y, por ejemplo, conceptos de ontologías. Así, se obtiene conocimiento sobre qué significado de un término en el contexto procesado se pretendía y, por lo tanto, el significado del texto se basa en datos legibles por máquina con la capacidad de hacer inferencias. La anotación semántica se divide típicamente en las siguientes dos subtareas.

  1. Extracción de terminología
  2. Vinculación de entidades

En la etapa de extracción terminológica, se extraen los términos léxicos del texto. Para ello, un tokenizador determina primero los límites de las palabras y resuelve las abreviaturas. Posteriormente, se extraen del texto los términos que corresponden a un concepto, con la ayuda de un léxico específico del dominio, para vincularlos en la vinculación de entidades.

En la vinculación de entidades [ 23 ], se establece un vínculo entre los términos léxicos extraídos del texto fuente y los conceptos de una ontología o base de conocimiento como DBpedia . Para ello, se detectan conceptos candidatos que se corresponden adecuadamente con los diversos significados de un término mediante un léxico. Finalmente, se analiza el contexto de los términos para determinar la desambiguación más apropiada y asignar el término al concepto correcto.

Cabe señalar que la "anotación semántica" en el contexto de la extracción de conocimiento no debe confundirse con el análisis semántico tal como se entiende en el procesamiento del lenguaje natural (también denominado "anotación semántica"): el análisis semántico busca una representación completa y legible por máquina del lenguaje natural, mientras que la anotación semántica en el sentido de extracción de conocimiento aborda solo un aspecto muy elemental de ello.

Herramientas

Los siguientes criterios pueden utilizarse para categorizar las herramientas que extraen conocimiento de textos en lenguaje natural.

La siguiente tabla describe algunas herramientas para la extracción de conocimiento a partir de fuentes en lenguaje natural.

descubrimiento del conocimiento

El descubrimiento de conocimiento describe el proceso de búsqueda automática en grandes volúmenes de datos para encontrar patrones que puedan considerarse conocimiento sobre los datos. [ 44 ] A menudo se describe como la derivación de conocimiento a partir de los datos de entrada. El descubrimiento de conocimiento se desarrolló a partir del dominio de la minería de datos y está estrechamente relacionado con él tanto en términos de metodología como de terminología. [ 45 ]

La rama más conocida de la minería de datos es el descubrimiento de conocimiento, también conocido como descubrimiento de conocimiento en bases de datos (KDD). Al igual que otras formas de descubrimiento de conocimiento, crea abstracciones de los datos de entrada. El conocimiento obtenido mediante este proceso puede convertirse en datos adicionales que pueden utilizarse para su posterior uso y descubrimiento. A menudo, los resultados del descubrimiento de conocimiento no son procesables; técnicas como la minería de datos orientada al dominio [ 46 ] buscan descubrir y proporcionar conocimiento e información procesables.

Otra aplicación prometedora del descubrimiento de conocimiento se encuentra en el área de modernización de software , detección de vulnerabilidades y cumplimiento normativo, lo que implica comprender los artefactos de software existentes. Este proceso está relacionado con el concepto de ingeniería inversa . Por lo general, el conocimiento obtenido del software existente se presenta en forma de modelos a los que se pueden realizar consultas específicas cuando sea necesario. Una relación de entidad es un formato frecuente para representar el conocimiento obtenido del software existente. Object Management Group (OMG) desarrolló la especificación Knowledge Discovery Metamodel (KDM), que define una ontología para los activos de software y sus relaciones con el fin de realizar el descubrimiento de conocimiento en el código existente. El descubrimiento de conocimiento de los sistemas de software existentes, también conocido como minería de software, está estrechamente relacionado con la minería de datos , ya que los artefactos de software existentes contienen un enorme valor para la gestión de riesgos y el valor empresarial , clave para la evaluación y evolución de los sistemas de software. En lugar de minar conjuntos de datos individuales , la minería de software se centra en los metadatos , como los flujos de procesos (por ejemplo, flujos de datos, flujos de control y mapas de llamadas), la arquitectura, los esquemas de bases de datos y las reglas/términos/procesos de negocio.

Datos de entrada

Formatos de salida

Véase también

Lecturas adicionales

  • Chicco, D; Masseroli, M (2016). "Predicción y priorización de anotaciones funcionales de genes basadas en ontologías" . IEEE /ACM Transactions on Computational Biology and Bioinformatics . 13 (2): 248– 260. doi : 10.1109/TCBB.2015.2459694 . PMID 27045825. S2CID 2795344 .  

Referencias

  1. Grupo de trabajo RDB2RDF, sitio web: http://www.w3.org/2001/sw/rdb2rdf/ , estatuto: http://www.w3.org/2009/08/rdb2rdf-charter , R2RML: lenguaje de mapeo de RDB a RDF: http://www.w3.org/TR/r2rml/
  2. LOD2 EU Deliverable 3.1.1 Extracción de conocimiento de fuentes estructuradas http://static.lod2.eu/Deliverables/deliverable-3.1.1.pdf Archivado el 27/08/2011 en Wayback Machine
  3. "La vida en la nube de datos enlazados" . www.opencalais.com. Archivado del original el 24/11/2009 . Consultado el 10/11/2009 . Wikipedia tiene una versión en la nube de datos enlazados llamada DBpedia. DBpedia tiene la misma información estructurada que Wikipedia, pero traducida a un formato legible por máquina.
  4. 1 2 Tim Berners-Lee (1998), "Bases de datos relacionales en la web semántica" . Recuperado: 20 de febrero de 2011.
  5. Hu et al. (2007), "Descubriendo mapeos simples entre esquemas de bases de datos relacionales y ontologías", En Actas de la 6.ª Conferencia Internacional sobre la Web Semántica (ISWC 2007), 2.ª Conferencia Asiática sobre la Web Semántica (ASWC 2007), LNCS 4825, páginas 225-238, Busan, Corea, 11-15 de noviembre de 2007. http://citeseerx.ist.psu.edu/viewdoc/download?doi=10.1.1.97.6934&rep=rep1&type=pdf
  6. R. Ghawi y N. Cullot (2007), "Generación de mapeos de bases de datos a ontologías para la interoperabilidad semántica". En Tercer Taller Internacional sobre Interoperabilidad de Bases de Datos (InterDB 2007). http://le2i.cnrs.fr/IMG/publications/InterDB07-Ghawi.pdf
  7. Li et al. (2005) "Un método semiautomático de adquisición de ontologías para la web semántica", WAIM, volumen 3739 de Lecture Notes in Computer Science, páginas 209-220. Springer. doi : 10.1007/11563952_19
  8. Tirmizi et al. (2008), "Traducción de aplicaciones SQL a la Web Semántica", Lecture Notes in Computer Science, Volumen 5181/2008 (Aplicaciones de bases de datos y sistemas expertos). http://citeseer.ist.psu.edu/viewdoc/download;jsessionid=15E8AB2A37BD06DAE59255A1AC3095F0?doi=10.1.1.140.3169&rep=rep1&type=pdf
  9. Farid Cerbah (2008). "Learning Highly Structured Semantic Repositories from Relational Databases", The Semantic Web: Research and Applications, volumen 5021 de Lecture Notes in Computer Science, Springer, Berlín/Heidelberg http://www.tao-project.eu/resources/publications/cerbah-learning-highly-structured-semantic-repositories-from-relational-databases.pdf Archivado el 20 de julio de 2011 en Wayback Machine
  10. 1 2 Wimalasuriya, Daya C.; Dou, Dejing (2010). "Extracción de información basada en ontologías: una introducción y una revisión de los enfoques actuales", Journal of Information Science , 36(3), págs. 306 - 323, http://ix.cs.uoregon.edu/~dou/research/papers/jis09.pdf (consultado el 18.06.2012).
  11. "Formato de intercambio de PLN (NIF) 2.0 - Descripción general y documentación" . persistence.uni-leipzig.org . Consultado el 5 de junio de 2020 .
  12. Hellmann, Sebastian; Lehmann, Jens; Auer, Sören; Brümmer, Martin (2013). «Integración del PLN mediante datos enlazados». En Alani, Harith; Kagal, Lalana; Fokoue, Achille; Groth, Paul; Biemann, Chris; Parreira, Josiane Xavier; Aroyo, Lora; Noy, Natasha; Welty, Chris (eds.). La Web Semántica – ISWC 2013. Lecture Notes in Computer Science. Vol. 7908. Berlín, Heidelberg: Springer. pp. 98–113 . doi : 10.1007/978-3-642-41338-4_7 . ISBN   978-3-642-41338-4.
  13. Verspoor, Karin ; Livingston, Kevin (julio de 2012). "Hacia la adaptación de las anotaciones lingüísticas a los formalismos de anotación académica en la web semántica" . Actas del Sexto Taller de Anotación Lingüística . Jeju, República de Corea: Asociación de Lingüística Computacional: 75–84 .
  14. ^ acoli-repo/conll-rdf , ACoLi, 27 de mayo de 2020 , consultado el 5 de junio de 2020
  15. Chiarcos, Christian; Fäth, Christian (2017). "CoNLL-RDF: Corporaciones enlazadas de forma amigable para el PLN" . En Gracia, Jorge; Bond, Francis; McCrae, John P.; Buitelaar, Paul; Chiarcos, Christian; Hellmann, Sebastian (eds.). Lenguaje, datos y conocimiento . Lecture Notes in Computer Science. Vol. 10318. Cham: Springer International Publishing. pp. 74–88 . doi : 10.1007/978-3-319-59888-8_6 . ISBN   978-3-319-59888-8.
  16. Verhagen, Marc; Suderman, Keith; Wang, Di; Ide, Nancy; Shi, Chunqi; Wright, Jonathan; Pustejovsky, James (2016). "The LAPPS Interchange Format" . En Murakami, Yohei; Lin, Donghui (eds.). Worldwide Language Service Infrastructure . Lecture Notes in Computer Science. Vol. 9442. Cham: Springer International Publishing. pp. 33–47 . doi : 10.1007/978-3-319-31468-6_3 . ISBN   978-3-319-31468-6.
  17. "The Language Application Grid | Una plataforma de servicios web para el desarrollo e investigación del procesamiento del lenguaje natural" . Consultado el 5 de junio de 2020 .
  18. lector de noticias/NAF , lector de noticias, 25/05/2020 , consultado el 05/06/2020
  19. Vossen, Piek; Agerri, Rodrigo; Aldabe, Itziar; Cybulska, Agata; van Erp, Marieke; Fokkens, Antske; Laparra, Egoitz; Minard, Anne-Lyse; Palmero Aprosio, Alessio; Rigau, German; Rospocher, Marco (2016-10-15). "NewsReader: Uso de recursos de conocimiento en una máquina de lectura multilingüe para generar más conocimiento a partir de flujos masivos de noticias" . Knowledge-Based Systems . 110 : 60–85 . doi : 10.1016/j.knosys.2016.07.013 . hdl : 1871.1/cbc310a9-677c-42ce-a84b-c59ebb344cc3 . ISSN 0950-7051 . 
  20. Cunningham, Hamish (2005). "Extracción automática de información", Enciclopedia del lenguaje y la lingüística , 2, págs. 665-677, http://gate.ac.uk/sale/ell2/ie/main.pdf (consultado el 18 de junio de 2012).
  21. Chicco, D; Masseroli, M (2016). "Predicción y priorización de anotaciones funcionales de genes basadas en ontologías" . IEEE /ACM Transactions on Computational Biology and Bioinformatics . 13 (2): 248– 260. doi : 10.1109/TCBB.2015.2459694 . PMID 27045825. S2CID 2795344 .  
  22. Erdmann, M.; Maedche, Alexander; Schnurr, H.-P.; Staab, Steffen (2000). "De la anotación semántica manual a la semiautomática: Acerca de las herramientas de anotación de texto basadas en ontologías", Actas de COLING , http://www.ida.liu.se/ext/epa/cis/2001/002/paper.pdf (consultado el 18.06.2012).
  23. Rao, Delip; McNamee, Paul; Dredze, Mark (2011). "Entity Linking: Finding Extracted Entities in a Knowledge Base", Multi-source, Multi-lingual Information Extraction and Summarization , http://www.cs.jhu.edu/~delip/entity-linking.pdf (consultado el 18.06.2012).
  24. Rocket Software, Inc. (2012). "Tecnología para extraer información de texto", http://www.rocketsoftware.com/products/aerotext Archivado el 21/06/2013 en Wayback Machine (consultado el 18/06/2012).
  25. Orchestr8 (2012): "Descripción general de AlchemyAPI", http://www.alchemyapi.com/api Archivado el 13 de mayo de 2016 en Wayback Machine (consultado el 18 de junio de 2012).
  26. La Universidad de Sheffield (2011). "ANNIE: un sistema de extracción de información casi nuevo", http://gate.ac.uk/sale/tao/splitch6.html#chap:annie (consultado el 18.06.2012).
  27. Red de Excelencia ILP. "ASIUM (LRI)", http://www-ai.ijs.si/~ilpnet2/systems/asium.html (consultado el 18.06.2012).
  28. Attensity (2012). "Extracción exhaustiva", http://www.attensity.com/products/technology/semantic-server/exhaustive-extraction/ Archivado el 11 de julio de 2012 en Wayback Machine (consultado el 18 de junio de 2012).
  29. Mendes, Pablo N.; Jakob, Max; Garcia-Sílva, Andrés; Bizer; Christian (2011). "DBpedia Spotlight: Arrojando luz sobre la web de documentos", Actas de la 7.ª Conferencia Internacional sobre Sistemas Semánticos , págs. 1-8, http://www.wiwiss.fu-berlin.de/en/institute/pwo/bizer/research/publications/Mendes-Jakob-GarciaSilva-Bizer-DBpediaSpotlight-ISEM2011.pdf Archivado el 5 de abril de 2012 en Wayback Machine (consultado el 18 de junio de 2012).
  30. ^ Gangemi, Aldo; Presutti, Valentina; Reforgiato Recupero, Diego; Nuzzolese, Andrea Giovanni; Draicchio, Francesco; Mongiovì, Misael (2016). "Lectura automática de web semántica con FRED", Semantic Web Journal , doi : 10.3233/SW-160240 , http://www.semantic-web-journal.net/system/files/swj1379.pdf
  31. Adrian, Benjamin; Maus, Heiko; Dengel, Andreas (2009). "iDocument: Uso de ontologías para extraer información de texto", http://www.dfki.uni-kl.de/~maus/dok/AdrianMausDengel09.pdf (consultado el 18.06.2012).
  32. SRA International, Inc. (2012). "NetOwl Extractor", http://www.sra.com/netowl/entity-extraction/ Archivado el 24/09/2012 en Wayback Machine (consultado el 18/06/2012).
  33. Fortuna, Blaz; Grobelnik, Marko; Mladenic, Dunja (2007). "OntoGen: Editor de ontologías semiautomático", Actas de la conferencia de 2007 sobre interfaz humana, Parte 2 , págs. 309-318, http://analytics.ijs.si/~blazf/papers/OntoGen2_HCII2007.pdf Archivado el 18 de septiembre de 2013 en Wayback Machine (consultado el 18 de junio de 2012).
  34. Missikoff, Michele; Navigli, Roberto; Velardi, Paola (2002). "Enfoque integrado para el aprendizaje y la ingeniería de ontologías web", Computer , 35(11), págs. 60-63, http://wwwusers.di.uniroma1.it/~velardi/IEEE_C.pdf Archivado el 19 de mayo de 2017 en Wayback Machine (consultado el 18 de junio de 2012).
  35. McDowell, Luke K.; Cafarella, Michael (2006). "Extracción de información basada en ontologías con OntoSyphon", Actas de la 5.ª conferencia internacional sobre la Web Semántica , págs. 428-444, http://turing.cs.washington.edu/papers/iswc2006McDowell-final.pdf (consultado el 18 de junio de 2012).
  36. Yildiz, Burcu; Miksch, Silvia (2007). "ontoX - Un método para la extracción de información basada en ontologías", Actas de la conferencia internacional de 2007 sobre ciencia computacional y sus aplicaciones , 3, págs. 660-673, http://publik.tuwien.ac.at/files/pub-inf_4769.pdf Archivado el 5 de julio de 2017 en Wayback Machine (consultado el 18 de junio de 2012).
  37. semanticweb.org (2011). "PoolParty Extractor", http://semanticweb.org/wiki/PoolParty_Extractor Archivado el 4 de marzo de 2016 en Wayback Machine (consultado el 18 de junio de 2012).
  38. Dill, Stephen; Eiron, Nadav; Gibson, David; Gruhl, Daniel; Guha, R.; Jhingran, Anant; Kanungo, Tapas; Rajagopalan, Sridhar; Tomkins, Andrew; Tomlin, John A.; Zien, Jason Y. (2003). "SemTag y Seeker: Arranque de la Web Semántica mediante Anotación Semántica Automatizada", Actas de la 12.ª conferencia internacional sobre la World Wide Web , págs. 178-186, http://www2003.org/cdrom/papers/refereed/p831/p831-dill.html (consultado el 18 de junio de 2012).
  39. Uren, Victoria; Cimiano, Philipp; Iria, José; Handschuh, Siegfried; Vargas-Vera, Maria; Motta, Enrico; Ciravegna, Fabio (2006). "Anotación semántica para la gestión del conocimiento: requisitos y una revisión del estado del arte", Web Semantics: Science, Services and Agents on the World Wide Web , 4(1), págs. 14-28, http://staffwww.dcs.shef.ac.uk/people/J.Iria/iria_jws06.pdf , (consultado el 18 de junio de 2012).
  40. Cimiano, Philipp; Völker, Johanna (2005). "Text2Onto - Un marco para el aprendizaje de ontologías y el descubrimiento de cambios impulsado por datos", Actas de la 10.ª Conferencia Internacional sobre Aplicaciones del Lenguaje Natural a los Sistemas de Información , 3513, págs. 227-238, http://www.cimiano.de/Publications/2005/nldb05/nldb05.pdf (consultado el 18 de junio de 2012).
  41. Maedche, Alexander; Volz, Raphael (2001). "The Ontology Extraction & Maintenance Framework Text-To-Onto", Actas de la Conferencia Internacional IEEE sobre Minería de Datos , http://users.csc.calpoly.edu/~fkurfess/Events/DM-KM-01/Volz.pdf (consultado el 18 de junio de 2012).
  42. Enlace de máquinas. "Nos conectamos a la nube de datos abiertos enlazados", http://thewikimachine.fbk.eu/html/index.html Archivado el 19 de julio de 2012 en Wayback Machine (consultado el 18 de junio de 2012).
  43. Inxight Federal Systems (2008). "Inxight ThingFinder y ThingFinder Professional", http://inxightfedsys.com/products/sdks/tf/ Archivado el 29/06/2012 en Wayback Machine (consultado el 18/06/2012).
  44. Frawley William. F. et al. (1992), "Descubrimiento de conocimiento en bases de datos: una visión general", AI Magazine (Vol. 13, n.º 3), 57-70 (versión completa en línea: http://www.aaai.org/ojs/index.php/aimagazine/article/viewArticle/1011 Archivado el 4 de marzo de 2016 en Wayback Machine )
  45. Fayyad U. et al. (1996), "From Data Mining to Knowledge Discovery in Databases", AI Magazine (Vol. 17, n.º 3), 37-54 (versión completa en línea: http://www.aaai.org/ojs/index.php/aimagazine/article/viewArticle/1230 Archivado el 4 de mayo de 2016 en Wayback Machine
  46. Cao, L. (2010). "Minería de datos orientada al dominio: desafíos y perspectivas". IEEE Transactions on Knowledge and Data Engineering . 22 (6): 755– 769. CiteSeerX 10.1.1.190.8427 . doi : 10.1109/tkde.2010.32 . S2CID 17904603 .