En el procesamiento del lenguaje natural , la extracción de información abierta ( OIE , por sus siglas en inglés) es la tarea de generar una representación estructurada y legible por máquina de la información en el texto, generalmente en forma de triples o proposiciones n-arias .
Descripción general
Una proposición puede entenderse como portadora de verdad , una expresión textual de un hecho potencial (por ejemplo, "Dante escribió la Divina Comedia"), representada en una estructura manejable para computadoras [por ejemplo, ("Dante", "escribió", "Divina Comedia")]. Una extracción OIE normalmente consta de una relación y un conjunto de argumentos. Por ejemplo, ("Dante", "falleció en" "Rávena") es una proposición formada por la relación "falleció en" y los argumentos "Dante" y "Rávena". El primer argumento se suele denominar sujeto, mientras que el segundo se considera el objeto. [ 1 ]
Se dice que la extracción es una representación textual de un hecho potencial porque sus elementos no están vinculados a una base de conocimiento . Además, la naturaleza fáctica de la proposición aún no se ha establecido. En el ejemplo anterior, transformar la extracción en un hecho completo requeriría, en primer lugar, vincular, si es posible, la relación y los argumentos a una base de conocimiento. En segundo lugar, sería necesario determinar la veracidad de la extracción. En informática, la transformación de extracciones OIE en hechos ontológicos se conoce como extracción de relaciones .
De hecho, la extracción de información en tiempo real (OIE) puede considerarse el primer paso hacia una amplia gama de tareas de comprensión de texto más profundas, como la extracción de relaciones, la construcción de bases de conocimiento, la respuesta a preguntas y el etiquetado de roles semánticos . Las proposiciones extraídas también pueden utilizarse directamente en aplicaciones para el usuario final, como la búsqueda estructurada (por ejemplo, recuperar todas las proposiciones cuyo sujeto sea "Dante").
La extracción de información en objetos (OIE) fue introducida por primera vez por TextRunner [ 2 ] , desarrollado en el Centro Turing de la Universidad de Washington , dirigido por Oren Etzioni . Otros métodos introducidos posteriormente, como Reverb [ 3 ] , OLLIE [ 4 ] , ClausIE [ 5 ] o CSD [ 6 ], contribuyeron a definir la tarea de OIE al caracterizar algunos de sus aspectos. En términos generales, todos estos enfoques utilizan un conjunto de patrones para generar las extracciones. Dependiendo del enfoque específico, estos patrones se crean manualmente o se aprenden.
Sistemas y contribuciones de la OIE
Reverb [ 3 ] sugirió la necesidad de generar relaciones significativas para capturar con mayor precisión la información del texto de entrada. Por ejemplo, dada la oración "Fausto hizo un pacto con el diablo", sería erróneo simplemente generar la extracción ("Fausto", "hizo", "un pacto"), ya que no sería suficientemente informativa. Una extracción más precisa sería ("Fausto", "hizo un pacto con", "el diablo"). Reverb también argumentó en contra de la generación de relaciones demasiado específicas.
OLLIE [ 4 ] destacó dos aspectos importantes para OIE. Primero, señaló la falta de factualidad de las proposiciones. Por ejemplo, en una oración como "Si John estudia mucho, aprobará el examen", sería inexacto considerar ("John", "aprobará", "el examen") como un hecho. Además, los autores indicaron que un sistema OIE debería ser capaz de extraer relaciones mediadas no verbales, que representan una parte significativa de la información expresada en texto en lenguaje natural. Por ejemplo, en la oración "Obama, el expresidente de EE. UU., nació en Hawái", un sistema OIE debería ser capaz de reconocer una proposición ("Obama", "es", "expresidente de EE. UU.").
ClausIE [ 5 ] introdujo la conexión entre cláusulas gramaticales, proposiciones y extracciones OIE. Los autores afirmaron que, dado que cada cláusula gramatical expresa una proposición, cada proposición mediada por verbo puede identificarse reconociendo únicamente el conjunto de cláusulas expresadas en cada oración. Esto implica que, para reconocer correctamente el conjunto de proposiciones en una oración de entrada, es necesario comprender su estructura gramatical. Los autores estudiaron el caso del idioma inglés, que solo admite siete tipos de cláusulas, lo que significa que la identificación de cada proposición solo requiere definir siete patrones gramaticales.
El hallazgo también estableció una separación entre el reconocimiento de las proposiciones y su materialización. En una primera etapa, la proposición puede identificarse sin considerar su forma final, de manera independiente del dominio y no supervisada, basándose principalmente en principios lingüísticos. En una segunda etapa, la información puede representarse según los requisitos de la aplicación subyacente, sin condicionar la fase de identificación.
Consideremos la oración " Albert Einstein nació en Ulm y murió en Princeton". El primer paso consiste en reconocer las dos proposiciones ("Albert Einstein", "nació", "en Ulm") y ("Albert Einstein", "murió", "en Princeton"). Una vez identificada correctamente la información, las proposiciones pueden adoptar la forma particular requerida por la aplicación subyacente [por ejemplo, ("Albert Einstein", "nació en", "Ulm") y ("Albert Einstein", "murió en", "Princeton")].
CSD [ 6 ] introdujo la idea de minimalidad en OIE. Considera que las computadoras pueden aprovechar mejor las extracciones si se expresan de forma compacta. Esto es especialmente importante en oraciones con cláusulas subordinadas. En estos casos, CSD sugiere la generación de extracciones anidadas. Por ejemplo, considérese la oración "La Embajada dijo que 6700 estadounidenses estaban en Pakistán". CSD genera dos extracciones: [i] ("6700 estadounidenses", "estaban", "en Pakistán") y [ii] ("La Embajada", "dijo", "que [i]"). Esto se conoce generalmente como reificación.
Referencias
- ↑ Del Corro, Luciano. "Métodos para la extracción de información abierta y la desambiguación de sentidos en texto en lenguaje natural" (PDF) .
{{cite journal}}: Para citar una revista se requiere|journal=( ayuda ) - ↑ Banko, Michele; Cafarella, Michael; Soderland, Stephen; Broadhead, Matt; Etzioni, Oren (2007). "Extracción de información abierta de la web" (PDF) . Conferencia sobre inteligencia artificial .
- 1 2 Fader, Anthony; Soderland, Stephen; Etzioni, Oren (2011). "Identifying relations for open information extraction" (PDF) . EMNLP . Archivado del original (PDF) el 8 de agosto de 2017. Recuperado el 4 de enero de 2018 .
- 1 2 Mausam; Schmitz, Michael; Soderland, Stephen; Bart, Robert; Etzioni, Oren (2012). "Aprendizaje de lenguaje abierto para la extracción de información" (PDF) . EMNLP .
- 1 2 Del Corro, Luciano; Gemulla, Rainer (2013). «ClausIE: extracción de información abierta basada en cláusulas» (PDF) . WWW .
- 1 2 Bast, Hannah ; Haussmann, Elmar (2013). "Extracción de información abierta mediante descomposición de oraciones contextuales" . ICSC .
- Procesamiento del lenguaje natural
- Lingüística computacional
- Tareas del procesamiento del lenguaje natural