La lingüística computacional es un campo interdisciplinario que se ocupa del modelado computacional del lenguaje natural , así como del estudio de enfoques computacionales apropiados para cuestiones lingüísticas. En general, la lingüística computacional se nutre de la lingüística , la informática , la inteligencia artificial , las matemáticas , la lógica , la filosofía , la ciencia cognitiva , la psicología cognitiva , la psicolingüística , la antropología y la neurociencia , entre otras disciplinas. La lingüística computacional está estrechamente relacionada con la lingüística matemática .
Orígenes
El campo se solapaba con la inteligencia artificial desde los esfuerzos realizados en Estados Unidos en la década de 1950 para utilizar ordenadores para traducir automáticamente textos de idiomas extranjeros, en particular revistas científicas rusas, al inglés. [ 1 ] Dado que los enfoques basados en reglas podían realizar cálculos aritméticos (sistemáticos) mucho más rápido y con mayor precisión que los humanos, se esperaba que el léxico , la morfología , la sintaxis y la semántica también pudieran aprenderse utilizando reglas explícitas. Tras el fracaso de los enfoques basados en reglas , David Hays [ 2 ] acuñó el término para distinguir el campo de la IA y cofundó tanto la Asociación de Lingüística Computacional (ACL) como el Comité Internacional de Lingüística Computacional (ICCL) en las décadas de 1970 y 1980. Lo que comenzó como un esfuerzo por traducir entre idiomas evolucionó hasta convertirse en un campo mucho más amplio de procesamiento del lenguaje natural . [ 3 ]
Corpus anotados
Para poder estudiar meticulosamente el idioma inglés , era imprescindible contar con un corpus de texto anotado. El Penn Treebank [ 4 ] fue uno de los corpus más utilizados. Consistía en manuales de computadoras IBM, transcripciones de conversaciones telefónicas y otros textos, que en conjunto contenían más de 4,5 millones de palabras de inglés americano, anotadas mediante etiquetado de partes de la oración y corchetes sintácticos. [ 5 ]
Se analizaron corpus de oraciones japonesas y se encontró un patrón de log-normalidad en relación con la longitud de las oraciones. [ 6 ]
Semántica computacional
La semántica computacional es un subcampo de la lingüística computacional. [ 7 ] Su objetivo es dilucidar los mecanismos cognitivos que sustentan la generación e interpretación del significado en los seres humanos. Generalmente implica la creación de modelos computacionales que simulan fenómenos semánticos específicos y la evaluación de dichos modelos con datos de participantes humanos. Si bien la semántica computacional es un campo científico, tiene numerosas aplicaciones en entornos reales y se solapa sustancialmente con la inteligencia artificial .
En términos generales, la disciplina se puede subdividir en áreas que reflejan la organización interna de la lingüística . Por ejemplo, la semántica léxica y la semántica de marcos cuentan con comunidades de investigación activas dentro de la lingüística computacional. [ 8 ] Algunas metodologías populares también se inspiran en gran medida en la lingüística tradicional. En particular, el área de la semántica distribucional , que sustenta las investigaciones sobre incrustaciones y la estructura interna de los modelos de lenguaje a gran escala , tiene sus raíces en el trabajo de Zellig Harris . [ 9 ]
Algunos temas tradicionales de interés en la semántica computacional son: construcción de representaciones de significado , subespecificación semántica , resolución de anáforas , [ 10 ] proyección de presuposiciones y resolución del alcance de los cuantificadores . Los métodos empleados suelen basarse en la semántica formal o la semántica estadística . La semántica computacional tiene puntos de contacto con las áreas de la semántica léxica ( desambiguación del sentido de las palabras y etiquetado de roles semánticos ), la semántica del discurso, la representación del conocimiento y el razonamiento automatizado (en particular, la demostración automatizada de teoremas ). Desde 1999 existe un grupo de interés especial de la ACL sobre semántica computacional, SIGSEM.
Modelado de la adquisición del lenguaje
El hecho de que durante la adquisición del lenguaje , los niños estén expuestos principalmente solo a evidencia positiva, [ 11 ] lo que significa que solo se proporciona evidencia de lo que es una forma correcta, y ninguna evidencia de lo que no es correcto, [ 12 ] fue una limitación para los modelos en ese momento porque los modelos de aprendizaje profundo disponibles ahora no estaban disponibles a finales de la década de 1980. [ 13 ]
Se ha demostrado que los idiomas se pueden aprender con una combinación de información simple presentada de forma incremental a medida que el niño desarrolla una mejor memoria y una mayor capacidad de atención, [ 14 ] lo que explica el largo período de adquisición del lenguaje en bebés y niños humanos. [ 14 ]
Se han utilizado robots para probar teorías lingüísticas. [ 15 ] Con la capacidad de aprender como lo hacen los niños, se crearon modelos basados en un modelo de affordance en el que se establecieron correspondencias entre acciones, percepciones y efectos, y se vincularon con palabras habladas. Fundamentalmente, estos robots pudieron adquirir correspondencias funcionales entre palabras y significados sin necesidad de estructura gramatical.
Utilizando la ecuación de Price y la dinámica de la urna de Pólya , los investigadores han creado un sistema que no solo predice la evolución lingüística futura, sino que también ofrece información sobre la historia evolutiva de las lenguas modernas. [ 16 ]
Modelos computacionales
Los modelos computacionales se han utilizado durante mucho tiempo para explorar los mecanismos mediante los cuales los aprendices de idiomas procesan y manipulan la información lingüística . Los modelos de este tipo permiten a los investigadores controlar sistemáticamente variables de aprendizaje importantes que a menudo son difíciles de manipular en participantes humanos. [ 17 ]
Las teorías de Chomsky
Las teorías de Noam Chomsky han influido en la lingüística computacional, particularmente en la comprensión de cómo los bebés aprenden estructuras gramaticales complejas, como las descritas en la forma normal de Chomsky . [ 18 ] Se han realizado intentos para determinar cómo un bebé aprende una "gramática no normal" según la teoría de la forma normal de Chomsky. [ 12 ] La investigación en esta área combina enfoques estructurales con modelos computacionales para analizar grandes corpus lingüísticos como el Penn Treebank , lo que ayuda a descubrir patrones en la adquisición del lenguaje. [ 19 ]
Software
Véase también
- Inteligencia artificial en la ficción
- Análisis colocacional
- Lexicología computacional
- Lingüística Computacional (revista)
- Semiótica computacional
- Revisión asistida por computadora
- Sistemas de diálogo
- Glotocronología
- Inducción gramatical
- Proyecto del habla humana
- Lingüística de Internet
- Lexicoestadística
- Procesamiento del lenguaje natural
- Interfaz de usuario en lenguaje natural
- Lingüística cuantitativa
- Relación semántica
- Semantometría
- Lingüística sistémico-funcional
- Memoria de traducción
- Lenguaje de redes universal
Referencias
- ↑ John Hutchins: Retrospectiva y perspectiva en la traducción asistida por ordenador. Archivado el 14 de abril de 2008 en Wayback Machine . Actas de MT Summit VII, 1999, pp. 30–44.
- ↑ "Miembros fallecidos" . Miembros de ICCL . Archivado del original el 17 de mayo de 2017. Consultado el 15 de noviembre de 2017 .
- ↑ Procesamiento del lenguaje natural por Liz Liddy, Eduard Hovy, Jimmy Lin, John Prager, Dragomir Radev, Lucy Vanderwende, Ralph Weischedel
- ↑ Marcus, M. y Marcinkiewicz, M. (1993). «Construyendo un gran corpus anotado de inglés: The Penn Treebank» (PDF) . Lingüística Computacional . 19 (2): 313–330 . Archivado (PDF) del original el 9 de octubre de 2022.
- ↑ Taylor, Ann (2003). "1". Treebanks . Primavera Países Bajos. pp. 5–22 .
- ↑ Furuhashi, S. y Hayakawa, Y. (2012). "Lognormalidad de la distribución de la longitud de las oraciones japonesas". Revista de la Sociedad Física de Japón . 81 (3) 034004. Bibcode : 2012JPSJ...81c4004F . doi : 10.1143/JPSJ.81.034004 .
- ↑ Blackburn, Patrick y Johan Bos. " Semántica computacional ". Theoria: Revista internacional de teoría, historia y fundamentos de la ciencia (2003): 27–45.
- ↑ Eventos del Grupo de Interés Especial de la ACL sobre Semántica Léxica " https://aclanthology.org/sigs/siglex/ "
- ↑ Boleda, Gemma. 2020. Semántica distribucional y teoría lingüística. En Annual Review of Linguistics, Vol. 6:213-234. " https://doi.org/10.1146/annurev-linguistics-011619-030303 "
- ↑ Basile, Valerio, et al. " Desarrollo de un gran corpus anotado semánticamente ". LREC 2012, Octava Conferencia Internacional sobre Recursos y Evaluación del Lenguaje. 2012.
- ↑ Bowerman, M. (1988). El problema de la "falta de evidencia negativa": ¿Cómo evitan los niños construir una gramática demasiado general? Explicando los universales del lenguaje .
- 1 2 Braine, MDS (1971). Sobre dos tipos de modelos de internalización de gramáticas. En DI Slobin (Ed.), La ontogénesis de la gramática: una perspectiva teórica. Nueva York: Academic Press.
- ↑ Powers, DMW y Turk, CCR (1989). Aprendizaje automático del lenguaje natural . Springer-Verlag. ISBN 978-0-387-19557-5.
- 1 2 Elman, Jeffrey L. (1993). "Aprendizaje y desarrollo en redes neuronales: La importancia de empezar poco a poco". Cognición . 48 ( 1): 71– 99. CiteSeerX 10.1.1.135.4937 . doi : 10.1016/0010-0277(93)90058-4 . PMID 8403835. S2CID 2105042 .
- ↑ Salvi, G.; Montesano, L.; Bernardino, A.; Santos-Victor, J. (2012). "Language bootstrapping: learning word meanings from the perception-action association". IEEE Transactions on Systems, Man, and Cybernetics - Part B: Cybernetics . 42 (3): 660– 71. arXiv : 1711.09714 . Bibcode : 2012ITSMC..42..660S . doi : 10.1109/TSMCB.2011.2172420 . PMID 22106152 . S2CID 977486 .
- ↑ Gong, T.; Shuai, L.; Tamariz, M. y Jäger, G. (2012). E. Scalas (ed.). "Estudio del cambio lingüístico mediante la ecuación de precios y la dinámica de la urna de Pólya" . PLOS ONE . 7 (3) e33171. Bibcode : 2012PLoSO...733171G . doi : 10.1371/journal.pone.0033171 . PMC 3299756. PMID 22427981 .
- ↑ Zinszer, B. y Li, P. (2010). Un modelo SOM de desgaste léxico en la primera lengua . En S. Ohlsson y R. Catrambone (Eds.), Actas de la 32.ª Conferencia Anual de la Sociedad de Ciencias Cognitivas (pp. 2787-2792). Austin, TX: Sociedad de Ciencias Cognitivas.
- ↑ Yogita, Bansal (2016). "Perspectivas sobre la lingüística computacional" (PDF) . Revista Internacional 4.10. pág. 94. Recuperado el 22 de septiembre de 2024 .
- ↑ Yogita, Bansal (2016). "Perspectivas sobre la lingüística computacional" (PDF) . Revista Internacional 4.10. pág. 94. Recuperado el 22 de septiembre de 2024 .
Lecturas adicionales
- Bates, M (1995). "Modelos de comprensión del lenguaje natural" . Actas de la Academia Nacional de Ciencias de los Estados Unidos de América . 92 (22): 9977– 9982. Bibcode : 1995PNAS...92.9977B . doi : 10.1073 /pnas.92.22.9977 . PMC 40721. PMID 7479812 .
- Steven Bird, Ewan Klein y Edward Loper (2009). Procesamiento del lenguaje natural con Python . O'Reilly Media. ISBN 978-0-596-51649-9.
- Daniel Jurafsky y James H. Martin (2008). Procesamiento del habla y del lenguaje , 2.ª edición. Pearson Prentice Hall. ISBN 978-0-13-187321-6.
- Mohamed Zakaria KURDI (2016). Procesamiento del lenguaje natural y lingüística computacional: habla, morfología y sintaxis , Volumen 1. ISTE-Wiley. ISBN 978-1848218482.
- Mohamed Zakaria KURDI (2017). Procesamiento del lenguaje natural y lingüística computacional: semántica, discurso y aplicaciones , Volumen 2. ISTE-Wiley. ISBN 978-1848219212.
Enlaces externos
- Asociación de Lingüística Computacional (ACL)
- Antología de artículos de investigación de la ACL
- Wiki de ACL para Lingüística Computacional
- Conferencias anuales de CICLing sobre lingüística computacional. Archivado el 6 de febrero de 2019 en Wayback Machine.
- Taller de Lingüística Computacional – Aplicaciones
- Libro introductorio gratuito en línea sobre Lingüística Computacional en Wayback Machine (archivado el 25 de enero de 2008).
- Mundo de la tecnología lingüística
- Recursos para el procesamiento de texto, voz y lenguaje
- El Grupo de Investigación en Lingüística Computacional archivado el 1 de agosto de 2013 en Wayback Machine.
- Lingüística computacional
- ciencias formales
- Ciencia cognitiva
- Campos de estudio computacionales
- Lingüística matemática