Un modelo condicional restringido (CCM) es un marco de aprendizaje automático e inferencia que amplía el aprendizaje de modelos condicionales (probabilísticos o discriminativos) mediante restricciones declarativas. Estas restricciones permiten incorporar conocimiento previo expresivo al modelo y orientar las asignaciones del modelo aprendido para que satisfagan dichas restricciones. El marco facilita la toma de decisiones en un espacio de salida expresivo, manteniendo la modularidad y la manejabilidad del entrenamiento y la inferencia.
Los modelos de este tipo han atraído recientemente mucha atención dentro de la comunidad de procesamiento del lenguaje natural ( PLN ). Formular problemas como problemas de optimización con restricciones sobre la salida de modelos aprendidos tiene varias ventajas. Permite centrarse en el modelado de problemas al brindar la oportunidad de incorporar conocimiento específico del dominio como restricciones globales utilizando un lenguaje de primer orden. El uso de este marco declarativo libera al desarrollador de la ingeniería de características de bajo nivel , al tiempo que captura las propiedades específicas del dominio del problema y garantiza una inferencia exacta. Desde una perspectiva de aprendizaje automático, permite desacoplar la etapa de generación del modelo (aprendizaje) de la etapa de inferencia con restricciones, lo que ayuda a simplificar la etapa de aprendizaje y a mejorar la calidad de las soluciones. Por ejemplo, en el caso de generar oraciones comprimidas, en lugar de simplemente confiar en un modelo de lenguaje para conservar los n-gramas más utilizados en la oración, se pueden usar restricciones para asegurar que si se conserva un modificador en la oración comprimida, también se conservará su sujeto.
Motivación
La toma de decisiones en muchos ámbitos (como el procesamiento del lenguaje natural y los problemas de visión artificial ) suele implicar la asignación de valores a conjuntos de variables interdependientes, donde la estructura de dependencia expresiva puede influir, o incluso determinar, las asignaciones posibles. Estas configuraciones son aplicables no solo a problemas de aprendizaje estructurado, como el etiquetado de roles semánticos, sino también a casos que requieren el uso de múltiples componentes preaprendidos, como la generación de resúmenes, la inferencia textual y la respuesta a preguntas . En todos estos casos, resulta natural formular el problema de decisión como un problema de optimización con restricciones, cuya función objetivo se compone de modelos aprendidos, sujetos a restricciones específicas del dominio o del problema.
Los modelos condicionales restringidos forman un marco de aprendizaje e inferencia que amplía el aprendizaje de modelos condicionales (probabilísticos o discriminativos) con restricciones declarativas (escritas, por ejemplo, utilizando una representación de primer orden) como una forma de apoyar las decisiones en un espacio de salida expresivo, manteniendo la modularidad y la manejabilidad del entrenamiento y la inferencia. Estas restricciones pueden expresar restricciones estrictas, prohibiendo completamente algunas asignaciones, o restricciones flexibles, penalizando las asignaciones improbables. En la mayoría de las aplicaciones de este marco en PLN, siguiendo [ 1 ] , se utilizó la Programación Lineal Entera (PLE) como marco de inferencia, aunque se pueden utilizar otros algoritmos para ese propósito.
Definición formal
Dado un conjunto de funciones de característicasy un conjunto de restricciones, definido sobre una estructura de entraday una estructura de salida , un modelo condicional de restricción se caracteriza por dos vectores de peso, w yy se define como la solución al siguiente problema de optimización:
- .
Cada restricción es una asignación booleana que indica si la asignación conjuntaviola una restricción yes la penalización por violar las restricciones. Las restricciones con una penalización infinita se conocen como restricciones estrictas y representan asignaciones inviables para el problema de optimización.
paradigmas de entrenamiento
Aprender modelos locales frente a modelos globales
La función objetivo utilizada por los CCM se puede descomponer y aprender de varias maneras, desde un entrenamiento conjunto completo del modelo junto con las restricciones hasta el desacoplamiento completo de la etapa de aprendizaje y la inferencia. En este último caso, se aprenden varios modelos locales de forma independiente y la dependencia entre estos modelos se considera solo en el momento de la decisión a través de un proceso de decisión global. Las ventajas de cada enfoque se discuten en [ 2 ] que estudia los dos paradigmas de entrenamiento: (1) modelos locales: L+I (aprendizaje + inferencia) y (2) modelo global: IBT (entrenamiento basado en inferencia), y muestra tanto teórica como experimentalmente que, si bien IBT (entrenamiento conjunto) es el mejor en el límite, bajo ciertas condiciones (básicamente, componentes "buenos") L+I puede generalizar mejor.
La capacidad de CCM para combinar modelos locales resulta especialmente beneficiosa en casos donde el aprendizaje conjunto es computacionalmente inviable o cuando no se dispone de datos de entrenamiento para dicho aprendizaje. Esta flexibilidad distingue a CCM de otros marcos de aprendizaje que también combinan información estadística con restricciones declarativas, como las redes lógicas de Markov , que hacen hincapié en el entrenamiento conjunto.
CCM con supervisión mínima
CCM puede ayudar a reducir la supervisión mediante el uso de conocimiento del dominio (expresado como restricciones) para guiar el aprendizaje. Estas configuraciones se estudiaron en [ 3 ] y [ 4 ] . Estos trabajos introducen el aprendizaje guiado por restricciones semisupervisado (CODL) y muestran que al incorporar conocimiento del dominio, el rendimiento del modelo aprendido mejora significativamente.
Aprendizaje sobre representaciones latentes
Los CCM también se han aplicado a marcos de aprendizaje latente, donde el problema de aprendizaje se define sobre una capa de representación latente. Dado que la noción de una representación correcta está inherentemente mal definida, el aprendiz no dispone de datos etiquetados de referencia sobre la decisión de representación. Identificar la representación de aprendizaje correcta (u óptima) se considera un proceso de predicción estructurado y, por lo tanto, se modela como un CCM. Este problema se ha tratado en varios artículos, tanto en entornos supervisados [ 5 ] como no supervisados [ 6 ] . En todos los casos, la investigación demostró que modelar explícitamente las interdependencias entre las decisiones de representación mediante restricciones mejora el rendimiento.
Programación lineal entera para aplicaciones de procesamiento del lenguaje natural
Las ventajas de la formulación declarativa CCM y la disponibilidad de solucionadores listos para usar han llevado a que se formulen dentro del marco una gran variedad de tareas de procesamiento del lenguaje natural , incluyendo el etiquetado de roles semánticos , [ 7 ] el análisis sintáctico, [ 8 ] la resolución de correferencias , [ 9 ] la generación de resúmenes, [ 10 ] [ 11 ] [ 12 ] la transliteración , [ 13 ] la generación de lenguaje natural [ 14 ] y la extracción conjunta de información . [ 15 ] [ 16 ]
La mayoría de estos trabajos utilizan un solucionador de programación lineal entera (PLI) para resolver el problema de decisión. Si bien teóricamente la resolución de un programa lineal entero es exponencial en función del tamaño del problema de decisión, en la práctica, utilizando solucionadores de última generación y técnicas de inferencia aproximada [ 17 ], se pueden resolver problemas de gran escala de manera eficiente.
La principal ventaja de utilizar un solucionador de programación lineal entera (PLI) para resolver el problema de optimización definido por un modelo condicional con restricciones es la formulación declarativa utilizada como entrada para el solucionador de PLI, que consiste en una función objetivo lineal y un conjunto de restricciones lineales.
Recursos
- Tutorial de CCM : Predicción de estructuras en PLN: Modelos condicionales restringidos y programación lineal entera en PLN
Enlaces externos
- Grupo de Computación Cognitiva de la Universidad de Illinois
- Taller sobre programación lineal entera para el procesamiento del lenguaje natural, NAACL-2009
Referencias
- ↑ Dan Roth y Wen-tau Yih, "Una formulación de programación lineal para la inferencia global en tareas de lenguaje natural". Archivado el 25 de octubre de 2017 en Wayback Machine CoNLL , (2004).
- ↑ Vasin Punyakanok y Dan Roth y Wen-Tau Yih y Dav Zimak, "Aprendizaje e inferencia sobre salida restringida". Archivado el 25-10-2017 en Wayback Machine IJCAI , (2005).
- ↑ Ming-Wei Chang y Lev Ratinov y Dan Roth, "Guiding Semi-Supervision with Constraint-Driven Learning." Archivado el 3 de marzo de 2016 en Wayback Machine ACL , (2007).
- ↑ Ming-Wei Chang y Lev Ratinov y Dan Roth, "Restricciones como conocimiento previo". Archivado el 3 de marzo de 2016 en Wayback Machine ICML Workshop on Prior Knowledge for Text and Language Processing , (2008).
- ↑ Ming-Wei Chang y Dan Goldwasser y Dan Roth y Vivek Srikumar, "Aprendizaje discriminativo sobre representaciones latentes restringidas". Archivado el 25-10-2017 en Wayback Machine NAACL, (2010).
- ↑ Ming-Wei Chang, Dan Goldwasser, Dan Roth y Yuancheng Tu, "Aprendizaje no supervisado basado en restricciones para el descubrimiento de transliteraciones". NAACL, (2009).
- ↑ Vasin Punyakanok, Dan Roth, Wen-tau Yih y Dav Zimak, "Etiquetado de roles semánticos mediante inferencia de programación lineal entera". Archivado el 9 de agosto de 2017 en Wayback Machine COLING, (2004).
- ↑ Kenji Sagae, Yusuke Miyao y Jun'ichi Tsujii, "Análisis sintáctico HPSG con restricciones de dependencia superficiales". ACL, (2007).
- ↑ Pascal Denis y Jason Baldridge, "Determinación conjunta de la anafóricaidad y la resolución de correferencias mediante programación entera". Archivado el 21 de junio de 2010 en Wayback Machine NAACL-HLT, (2007).
- ↑ James Clarke y Mirella Lapata, "Inferencia global para la compresión de oraciones: un enfoque de programación lineal entera". Archivado el 10 de mayo de 2013 en Wayback Machine Journal of Artificial Intelligence Research (JAIR), (2008).
- ↑ Katja Filippova y Michael Strube, "Compresión de oraciones basada en árboles de dependencia". INLG , (2008).
- ↑ Katja Filippova y Michael Strube, "Fusión de oraciones mediante compresión de grafos de dependencia". EMNLP , (2008).
- ↑ Dan Goldwasser y Dan Roth, "Transliteración como optimización restringida". Archivado el 11 de agosto de 2017 en Wayback Machine EMNLP, (2008).
- ↑ Regina Barzilay y Mirrela Lapata, "Agregación mediante partición de conjuntos para la generación de lenguaje natural". NAACL , (2006).
- ↑ Dan Roth y Wen-tau Yih, "Una formulación de programación lineal para la inferencia global en tareas de lenguaje natural". Archivado el 25 de octubre de 2017 en Wayback Machine CoNLL , (2004).
- ↑ Yejin Choi , Eric Breck y Claire Cardie, "Extracción conjunta de entidades y relaciones para el reconocimiento de opiniones". EMNLP , (2006).
- ↑ André FT Martins, Noah A. Smith y Eric P. Xing, "Formulaciones concisas de programación lineal entera para el análisis de dependencias". ACL, (2009).
- Predicción estructurada