Articulo de referencia

Historia del procesamiento del lenguaje natural

La historia del procesamiento del lenguaje natural describe los avances en este campo . Existe cierta superposición con la historia de la traducción automática , la historia del...

La historia del procesamiento del lenguaje natural describe los avances en este campo . Existe cierta superposición con la historia de la traducción automática , la historia del reconocimiento de voz y la historia de la inteligencia artificial .

Historia temprana

La historia de la traducción automática se remonta al siglo XVII, cuando filósofos como Leibniz y Descartes propusieron códigos que relacionaran palabras entre idiomas. Todas estas propuestas permanecieron en el plano teórico y ninguna llegó a desarrollarse como una máquina real.

Las primeras patentes para "máquinas de traducción" se solicitaron a mediados de la década de 1930. Una propuesta, de Georges Artsrouni , consistía simplemente en un diccionario bilingüe automático que utilizaba cinta de papel . La otra propuesta, de Peter Troyanskii , un ruso, era más detallada. La propuesta de Troyanskii incluía tanto el diccionario bilingüe como un método para tratar los roles gramaticales entre idiomas, basado en el esperanto . [ 1 ] [ 2 ]

Período lógico

En 1950, Alan Turing publicó su famoso artículo " Máquinas de computación e inteligencia ", en el que propuso lo que hoy se conoce como la prueba de Turing como criterio de inteligencia. Este criterio se basa en la capacidad de un programa informático para suplantar la identidad de un ser humano en una conversación escrita en tiempo real con un juez humano, con la suficiente precisión como para que el juez no pueda distinguir de forma fiable  —basándose únicamente en el contenido de la conversación—  entre el programa y un ser humano real.

En 1957, Estructuras sintácticas de Noam Chomsky revolucionó la lingüística con su « gramática universal », un sistema de estructuras sintácticas basado en reglas. [ 3 ]

El experimento de Georgetown de 1954 consistió en la traducción automática de más de sesenta oraciones rusas al inglés. Los autores afirmaron que, en tres o cinco años, la traducción automática sería un problema resuelto. [ 4 ] Sin embargo, el progreso real fue mucho más lento, y tras el informe ALPAC de 1966, que concluyó que diez años de investigación no habían cumplido las expectativas, la financiación para la traducción automática se redujo drásticamente. Se realizaron pocas investigaciones adicionales en traducción automática hasta finales de la década de 1980, cuando se desarrollaron los primeros sistemas estadísticos de traducción automática .

Algunos sistemas de PLN de notable éxito desarrollados en la década de 1960 fueron SHRDLU , un sistema de lenguaje natural que funcionaba en " mundos de bloques " restringidos con vocabularios restringidos.

En 1969, Roger Schank introdujo la teoría de la dependencia conceptual para la comprensión del lenguaje natural. [ 5 ] Este modelo, influenciado en parte por el trabajo de Sydney Lamb , fue ampliamente utilizado por los estudiantes de Schank en la Universidad de Yale , como Robert Wilensky, Wendy Lehnert y Janet Kolodner .

En 1970, William A. Woods introdujo la red de transición aumentada (ATN) para representar la entrada de lenguaje natural. [ 6 ] En lugar de reglas de estructura de frases, las ATN utilizaban un conjunto equivalente de autómatas de estados finitos que se llamaban recursivamente. Las ATN y su formato más general, denominado "ATN generalizadas", continuaron utilizándose durante varios años. Durante la década de 1970, muchos programadores comenzaron a escribir "ontologías conceptuales", que estructuraban la información del mundo real en datos comprensibles para la computadora. Algunos ejemplos son MARGIE (Schank, 1975), SAM (Cullingford, 1978), PAM (Wilensky, 1978), TaleSpin (Meehan, 1976), QUALM (Lehnert, 1977), Politics (Carbonell, 1979) y Plot Units (Lehnert, 1981). Durante este tiempo, se crearon muchos chatbots , entre ellos PARRY , Racter y Jabberwacky .

Período estadístico

Hasta la década de 1980, la mayoría de los sistemas de PLN se basaban en conjuntos complejos de reglas escritas a mano. Sin embargo, a partir de finales de la década de 1980, se produjo una revolución en PLN con la introducción de algoritmos de aprendizaje automático para el procesamiento del lenguaje. Esto se debió tanto al aumento constante de la capacidad computacional resultante de la ley de Moore como a la disminución gradual del predominio de las teorías lingüísticas chomskyanas (por ejemplo, la gramática transformacional ), cuyos fundamentos teóricos desalentaban el tipo de lingüística de corpus que subyace al enfoque de aprendizaje automático para el procesamiento del lenguaje. [ 7 ] Algunos de los primeros algoritmos de aprendizaje automático utilizados, como los árboles de decisión , producían sistemas de reglas condicionales estrictas similares a las reglas escritas a mano existentes. Sin embargo, cada vez más, la investigación se ha centrado en modelos estadísticos , que toman decisiones probabilísticas flexibles basadas en la asignación de ponderaciones de valor real a las características que componen los datos de entrada. Los modelos de lenguaje en caché en los que se basan muchos sistemas de reconocimiento de voz actuales son ejemplos de dichos modelos estadísticos. Estos modelos suelen ser más robustos cuando se les proporciona información de entrada desconocida, especialmente información que contiene errores (como es muy común en los datos del mundo real), y producen resultados más fiables cuando se integran en un sistema más amplio que comprende múltiples subtareas.

conjuntos de datos

El surgimiento de los enfoques estadísticos se vio favorecido tanto por el aumento de la capacidad de procesamiento informático como por la disponibilidad de grandes conjuntos de datos. En aquella época, comenzaban a surgir grandes corpus multilingües. Cabe destacar que algunos fueron elaborados por el Parlamento de Canadá y la Unión Europea como resultado de leyes que exigían la traducción de todos los procedimientos gubernamentales a todos los idiomas oficiales de los respectivos sistemas de gobierno.

Muchos de los primeros éxitos notables se produjeron en el campo de la traducción automática . En 1993, los modelos de alineación de IBM se utilizaron para la traducción automática estadística . [ 8 ] En comparación con los sistemas de traducción automática anteriores, que eran sistemas simbólicos codificados manualmente por lingüistas computacionales, estos sistemas eran estadísticos, lo que les permitía aprender automáticamente de grandes corpus textuales . Aunque estos sistemas no funcionan bien en situaciones donde solo se dispone de corpus pequeños, por lo que los métodos eficientes en el uso de datos siguen siendo un área de investigación y desarrollo.

En 2001, se utilizó un corpus de texto de mil millones de palabras, extraído de Internet, al que en aquel entonces se le denominaba "muy, muy grande", para la desambiguación de palabras . [ 9 ]

Para aprovechar los grandes conjuntos de datos sin etiquetar, se desarrollaron algoritmos para el aprendizaje no supervisado y el auto-supervisado . Generalmente, esta tarea es mucho más difícil que el aprendizaje supervisado y suele producir resultados menos precisos para una cantidad dada de datos de entrada. Sin embargo, existe una enorme cantidad de datos sin anotar disponibles (incluido, entre otros, todo el contenido de la World Wide Web ), lo que a menudo puede compensar los resultados inferiores.

Período neural

Cronología de los modelos de procesamiento del lenguaje natural

Los modelos de lenguaje neuronales se desarrollaron en la década de 1990. En 1990, la red de Elman , utilizando una red neuronal recurrente , codificó cada palabra de un conjunto de entrenamiento como un vector, llamado incrustación de palabra , y todo el vocabulario como una base de datos vectorial , lo que le permitió realizar tareas como predicciones de secuencias que están más allá del alcance de un perceptrón multicapa simple . Una limitación de las incrustaciones estáticas era que no diferenciaban entre los múltiples significados de los homónimos . [ 10 ]

Yoshua Bengio desarrolló el primer modelo de lenguaje probabilístico neuronal en 2000. [ 11 ] Los algoritmos novedosos, la disponibilidad de conjuntos de datos más grandes y una mayor capacidad de procesamiento hicieron posible el entrenamiento de modelos de lenguaje cada vez más grandes.

El mecanismo de atención fue introducido por Bahdanau et al. en 2014. [ 12 ] Este trabajo sentó las bases para el famoso artículo "Attention Is All You Need" [ 13 ] que introdujo la arquitectura Transformer en 2017. El concepto de modelo de lenguaje grande (LLM) surgió a finales de la década de 2010. Un LLM es un modelo de lenguaje entrenado con aprendizaje autosupervisado en una gran cantidad de texto. Los primeros LLM públicos tenían cientos de millones de parámetros [ 14 ] , pero este número aumentó rápidamente a miles de millones e incluso billones. [ 15 ]

En los últimos años, los avances en el aprendizaje profundo y los grandes modelos de lenguaje han mejorado significativamente las capacidades del procesamiento del lenguaje natural, lo que ha dado lugar a aplicaciones generalizadas en áreas como la atención médica, el servicio al cliente y la generación de contenido. [ 16 ]

Software

Referencias

  1. "Georges Artsrouni" . machinetranslate.org . Consultado el 10 de julio de 2025 .
  2. Hutchins, John; Lovtskii, Evgenii (2000), Petr Petrovich Troyanskii (1894-1950): Un pionero olvidado de la traducción mecánica , Traducción automática{{citation}}: CS1 mantenimiento: falta el editor de ubicación ( enlace )
  3. "SEM1A5 - Parte 1 - Una breve historia del PLN" . Consultado el 25 de junio de 2010 .
  4. Hutchins, J. (2005)
  5. Roger Schank , 1969, Un analizador de dependencias conceptuales para el lenguaje natural. Actas de la conferencia de 1969 sobre lingüística computacional, Sång-Säby, Suecia, páginas 1-3.
  6. Woods, William A (1970). "Gramáticas de redes de transición para el análisis del lenguaje natural". Communications of the ACM 13 (10): 591–606
  7. La lingüística chomskyana fomenta la investigación de « casos extremos » que ponen a prueba los límites de sus modelos teóricos (comparables afenómenos patológicos en matemáticas), creados típicamente mediante experimentos mentales , en lugar de la investigación sistemática de fenómenos típicos que ocurren en datos del mundo real, como sucede en la lingüística de corpus . La creación y el uso de dichos corpus de datos del mundo real son fundamentales para los algoritmos de aprendizaje automático aplicados al procesamiento del lenguaje natural (PLN). Además, los fundamentos teóricos de la lingüística chomskyana, como el argumento de la « pobreza del estímulo », implican que los algoritmos de aprendizaje generales, como los que se utilizan habitualmente en el aprendizaje automático, no pueden tener éxito en el procesamiento del lenguaje. En consecuencia, el paradigma chomskyano desaconsejó la aplicación de tales modelos al procesamiento del lenguaje.
  8. Brown, Peter F. (1993). "Las matemáticas de la traducción automática estadística: estimación de parámetros". Lingüística Computacional (19): 263–311 .
  9. Banko, Michele; Brill, Eric (2001). "Escalado a corpus muy muy grandes para la desambiguación del lenguaje natural" . Actas de la 39.ª Reunión Anual de la Asociación de Lingüística Computacional - ACL '01 . Morristown, NJ, EE. UU.: Asociación de Lingüística Computacional: 26–33 . doi : 10.3115/1073012.1073017 . S2CID 6645623 . 
  10. Elman, Jeffrey L. (marzo de 1990). "Encontrando estructura en el tiempo" . Cognitive Science . 14 (2): 179– 211. doi : 10.1207/s15516709cog1402_1 . S2CID 2763403 . 
  11. Bengio, Yoshua (2003), Un modelo de lenguaje probabilístico neuronal , —, vol. 3 (— ed.), Montreal, Canadá: Journal of Machine Learning Research, págs. 1137–1155, doi : 10.1162/153244303322533223   
  12. Bahdanau, Dzmitry; Cho, Kyunghyun; Bengio, Yoshua (2014). "Traducción automática neuronal mediante el aprendizaje conjunto de alineación y traducción". ICLR . arXiv : 1409.0473 .
  13. Vaswani, Ashish ; Shazeer, Noam; Parmar, Niki; Uszkoreit, Jakob; Jones, Llion; Gomez, Aidan N ; Kaiser, Łukasz; Polosukhin, Illia (2017). "Attention is All you Need" (PDF) . Advances in Neural Information Processing Systems . 30. Curran Associates, Inc. Archivado (PDF) del original el 21-02-2024 . Recuperado el 21-01-2024 .
  14. Brown, Tom B.; Mann, Benjamin; Ryder, Nick; Subbiah, Melanie; Kaplan, Jared; Dhariwal, Prafulla; Neelakantan, Arvind; Shyam, Pranav; Sastry, Girish; Askell, Amanda; Agarwal, Sandhini; Herbert-Voss, Ariel; Krueger, Gretchen; Henighan, Tom; Child, Rewon; Ramesh, Aditya; Ziegler, Daniel M.; Wu, Jeffrey; Winter, Clemens; Hesse, Christopher; Chen, Mark; Sigler, Eric; Litwin, Mateusz; Gray, Scott; Chess, Benjamin; Clark, Jack; Berner, Christopher; McCandlish, Sam; Radford, Alec; Sutskever, Ilya; Amodei, Dario (dic. 2020). Larochelle, H.; Ranzato, M.; Hadsell, R.; Balcan, MF; Lin, H. (eds.). "Los modelos de lenguaje son aprendices con pocos ejemplos" (PDF) . Advances in Neural Information Processing Systems . 33. Curran Associates, Inc.: 1877–1901 . arXiv : 2005.14165 . Archivado (PDF) del original el 17 de noviembre de 2023. Recuperado el 14 de marzo de 2023 .
  15. Dai, Andrew M; Du, Nan (9 de diciembre de 2021). "Aprendizaje contextual más eficiente con GLaM" . ai.googleblog.com . Archivado del original el 12 de marzo de 2023. Consultado el 9 de marzo de 2023 .
  16. Gruetzemacher, Ross (19 de abril de 2022). "El poder del procesamiento del lenguaje natural" . Harvard Business Review . ISSN 0017-8012 . Consultado el 7 de diciembre de 2024 . 
  17. McCorduck 2004 , pág. 286 , Crevier 1993 , págs. 76-79 , Russell y Norvig 2003 , pág. 19   
  18. McCorduck 2004 , págs. 291–296 , Crevier 1993 , págs. 134−139  
  19. Janet L. Kolodner, Christopher K. Riesbeck; Experiencia, memoria y razonamiento ; Psychology Press; reimpresión de 2014

Bibliografía

  • Crevier, Daniel (1993). IA: La tumultuosa búsqueda de la inteligencia artificial . Nueva York, NY: BasicBooks. ISBN 0-465-02997-3.
  • McCorduck, Pamela (2004), Máquinas que piensan (2.ª  ed.), Natick, MA: AK Peters, Ltd., ISBN 978-1-56881-205-2, OCLC 52197627 .
  • Russell, Stuart J.; Norvig , Peter (2003), Inteligencia artificial: un enfoque moderno (2.ª  ed.), Upper Saddle River, Nueva Jersey: Prentice Hall, ISBN 0-13-790395-2.
Obtenido de " https://en.wikipedia.org/w/index.php?title=History_of_natural_language_processing&oldid=1335145525 "