Articulo de referencia

Modelo de lenguaje

Un modelo de lenguaje es un modelo computacional que predice secuencias en lenguaje natural . [ 1 ] [ 2 ] Los modelos de lenguaje son útiles para una variedad de tareas, incluye...

Un modelo de lenguaje es un modelo computacional que predice secuencias en lenguaje natural . [ 1 ] [ 2 ] Los modelos de lenguaje son útiles para una variedad de tareas, incluyendo el reconocimiento de voz , [ 3 ] la traducción automática , [ 4 ] la generación de lenguaje natural (generación de texto más parecido al humano), el reconocimiento óptico de caracteres , la optimización de rutas , [ 5 ] el reconocimiento de escritura a mano , [ 6 ] la inducción gramatical , [ 7 ] la recuperación de información [ 8 ] [ 9 ] y la respuesta ante desastres . [ 10 ]

Los modelos de lenguaje a gran escala (LLM, por sus siglas en inglés), que actualmente representan su forma más avanzada a partir de 2026, se basan principalmente en transformadores entrenados con conjuntos de datos más grandes (frecuentemente utilizando textos extraídos de internet ) . Han reemplazado a los modelos basados ​​en redes neuronales recurrentes , que a su vez habían reemplazado a los modelos puramente estadísticos , como el modelo de lenguaje de n -gramas de palabras .

Historia

Noam Chomsky realizó un trabajo pionero sobre modelos de lenguaje en la década de 1950 al desarrollar una teoría de gramáticas formales . [ 11 ]

En 1980, se exploraron enfoques estadísticos que resultaron más útiles para muchos propósitos que las gramáticas formales basadas en reglas. Las representaciones discretas, como los modelos de lenguaje de n -gramas de palabras , con probabilidades para combinaciones discretas de palabras, supusieron avances significativos.

En la década de 2000, las representaciones continuas de palabras, como las incrustaciones de palabras , comenzaron a reemplazar a las representaciones discretas. [ 12 ] Por lo general, la representación es un vector de valores reales que codifica el significado de una palabra de tal manera que las palabras más cercanas en el espacio vectorial tienen significados similares y se conservan las relaciones comunes entre palabras, como el plural o el género.

Modelos puramente estadísticos

En 1980, se propuso el primer modelo estadístico de lenguaje significativo, y durante la década IBM realizó experimentos al estilo de Shannon , en los que se identificaron fuentes potenciales para la mejora del modelado del lenguaje mediante la observación y el análisis del desempeño de sujetos humanos en la predicción o corrección de texto. [ 13 ]

Modelos basados ​​en n -gramas de palabras

Un modelo de lenguaje de n-gramas es un modelo estadístico del lenguaje que calcula la probabilidad de la siguiente palabra en una secuencia a partir de una ventana de tamaño fijo de palabras anteriores. Si se considera una palabra anterior, es un modelo de bigramas; si son dos palabras, un modelo de trigramas; si son n  1 palabras, un modelo de n -gramas. [ 14 ]

Se introducen marcadores especiales para indicar el inicio y el final de una oración.s{\displaystyle \langle s\rangle }y/s{\displaystyle \langle /s\rangle }Para evitar que se asigne una probabilidad cero a las palabras no vistas, la probabilidad de cada palabra vista se reduce ligeramente para dejar espacio a las palabras no vistas en un corpus dado . Para lograr esto, se utilizan varios métodos de suavizado , desde el suavizado simple de "sumar uno" (asignar un recuento de 1 a los n -gramas no vistos, como una distribución a priori no informativa ) hasta técnicas más sofisticadas, como el descuento de Good-Turing o los modelos de retroceso .

Los modelos de n- gramas de palabras han sido reemplazados en gran medida por modelos basados ​​en redes neuronales recurrentes , que a su vez han sido reemplazados por modelos basados ​​en Transformer , a menudo denominados modelos de lenguaje grandes . [ 15 ]

Exponencial

Los modelos de lenguaje de máxima entropía codifican la relación entre una palabra y el historial de n -gramas utilizando funciones de características. La ecuación es

PAG(wmetrow1,,wmetro1)=1Z(w1,,wmetro1)exp(aTF(w1,,wmetro)){\displaystyle P(w_{m}\mid w_{1},\ldots ,w_{m-1})={\frac {1}{Z(w_{1},\ldots ,w_{m-1})}}\exp(a^{T}f(w_{1},\ldots ,w_{m}))}

dóndeZ(w1,,wmetro1){\displaystyle Z(w_{1},\ldots,w_{m-1})}es la función de partición ,a{\displaystyle a}es el vector de parámetros, yF(w1,,wmetro){\displaystyle f(w_{1},\ldots ,w_{m})}es la función de características. En el caso más simple, la función de características es solo un indicador de la presencia de un determinado n -grama. Es útil utilizar una distribución a priori ena{\displaystyle a}o alguna forma de regularización .

El modelo log-bilineal es otro ejemplo de un modelo de lenguaje exponencial.

Modelo Skip-gram

1-skip-2-grams para el texto "la lluvia en España cae principalmente en la llanura"

El modelo de lenguaje skip-gram es un intento de superar el problema de escasez de datos que enfrentaba el modelo anterior (es decir, el modelo de lenguaje word n- gram). Las palabras representadas en un vector de incrustación ya no eran necesariamente consecutivas, sino que podían dejar huecos que se omitían (de ahí el nombre "skip-gram"). [ 16 ]

Formalmente, un k -skip- n -grama es una subsecuencia de longitud n donde los componentes aparecen a una distancia máxima de k entre sí.

Por ejemplo, en el texto de entrada:

La lluvia en España cae principalmente en la llanura.

El conjunto de 1-skip-2-gramas incluye todos los bigramas (2-gramas) y, además, las subsecuencias.

la en , lluvia España , en cae , España principalmente , cae en , principalmente la , y en llanura .

En el modelo skip-gram, las relaciones semánticas entre palabras se representan mediante combinaciones lineales , capturando una forma de composicionalidad . Por ejemplo, en algunos de estos modelos, si v es la función que asigna una palabra w a su representación vectorial n -dimensional, entonces

v(kinortegramo)v(metroalmi)+v(Fmimetroalmi)v(qmiminorte){\displaystyle v(\mathrm {rey} )-v(\mathrm {masculino} )+v(\mathrm {femenino} )\approx v(\mathrm {reina} )}

donde ≈ se precisa al estipular que su lado derecho debe ser el vecino más cercano del valor del lado izquierdo. [ 17 ] [ 18 ]

Modelos neuronales

Red neuronal recurrente

Las representaciones continuas o incrustaciones de palabras se producen en modelos de lenguaje basados ​​en redes neuronales recurrentes (también conocidos como modelos de lenguaje de espacio continuo ). [ 19 ] Estas incrustaciones de espacio continuo ayudan a mitigar la maldición de la dimensionalidad , que es consecuencia del aumento exponencial del número de secuencias posibles de palabras con el tamaño del vocabulario, lo que a su vez causa un problema de escasez de datos. Las redes neuronales evitan este problema al representar las palabras como combinaciones no lineales de pesos en una red neuronal. [ 20 ]

Modelos de lenguaje a gran escala

Un modelo de lenguaje grande (LLM, por sus siglas en inglés) es un modelo de IA (generalmente una red neuronal ) entrenado con una gran cantidad de texto para tareas de procesamiento del lenguaje natural , especialmente la generación de lenguaje . Los LLM suelen generar, resumir, traducir y analizar texto en muchos contextos, y son una tecnología fundamental para los chatbots modernos . [ 21 ] Los datos de entrenamiento sesgados o inexactos pueden hacer que la salida de un LLM sea menos fiable. [ 22 ]

Los LLM se basan típicamente en la arquitectura de transformadores . [ 23 ] Los transformadores generativos preentrenados (GPT) son un tipo de LLM que se preentrena para predecir la siguiente palabra. [ 24 ] Los GPT a menudo se ajustan para seguir instrucciones y comportarse como asistentes. [ 25 ]

Las evaluaciones de referencia para los LLM intentan medir el razonamiento del modelo , la precisión fáctica, la alineación y la seguridad . [ 26 ]

Aunque a veces igualan el rendimiento humano, no está claro si son modelos cognitivos plausibles . Al menos en el caso de las redes neuronales recurrentes, se ha demostrado que a veces aprenden patrones que los humanos no aprenden, pero no logran aprender patrones que los humanos suelen aprender. [ 27 ]

Evaluación y puntos de referencia

La evaluación de la calidad de los modelos de lenguaje se realiza principalmente mediante la comparación con conjuntos de datos de referencia creados por humanos a partir de tareas típicas orientadas al lenguaje. Otras pruebas de calidad, menos establecidas, examinan el carácter intrínseco de un modelo de lenguaje o comparan dos modelos de este tipo. Dado que los modelos de lenguaje suelen estar diseñados para ser dinámicos y aprender de los datos que procesan, algunos modelos propuestos investigan la tasa de aprendizaje, por ejemplo, mediante el análisis de las curvas de aprendizaje. [ 28 ]

Se han desarrollado varios conjuntos de datos para su uso en la evaluación de sistemas de procesamiento del lenguaje. [ 29 ] Estos incluyen:

Véase también

Referencias

  1. Blank, Idan A. (noviembre de 2023). "¿Qué se supone que deben modelar los grandes modelos de lenguaje?" . Trends in Cognitive Sciences . 27 (11): 987– 989. doi : 10.1016/j.tics.2023.08.006 . PMID 37659920 . "Se supone que los modelos de lenguaje natural (LLM) modelan cómo se comportan las expresiones verbales."
  2. Jurafsky, Dan; Martin, James H. (2021). "Modelos de lenguaje N-grama" (PDF) . Procesamiento del habla y del lenguaje (3.ª ed.). Archivado del original el 22 de mayo de 2022. Recuperado el 24 de mayo de 2022 . 
  3. Kuhn, R.; De Mori, R. (1990). "Un modelo de lenguaje natural basado en caché para el reconocimiento de voz" . IEEE Transactions on Pattern Analysis and Machine Intelligence . 12 (6): 570– 583. Bibcode : 1990ITPAM..12..570K . doi : 10.1109/34.56193 .
  4. Andreas, Jacob, Andreas Vlachos y Stephen Clark (2013). "Análisis semántico como traducción automática". Archivado el 15 de agosto de 2020 en Wayback Machine . Actas de la 51.ª Reunión Anual de la Asociación de Lingüística Computacional (Volumen 2: Artículos breves).
  5. Liu, Yang; Wu, Fanyou; Liu, Zhiyuan; Wang, Kai; Wang, Feiyue; Qu, Xiaobo (2023). "¿Se pueden usar modelos de lenguaje para la optimización de rutas de entrega urbanas en el mundo real?" . The Innovation . 4 (6) 100520. Bibcode : 2023Innov...400520L . doi : 10.1016/j.xinn.2023.100520 . PMC 10587631 . PMID 37869471 .  
  6. Pham, Vu; Bluche, Théodore; Kermorvant, Christopher; Louradour, Jérôme (2013). "Dropout mejora las redes neuronales recurrentes para el reconocimiento de escritura a mano". arXiv : 1312.4569 [ cs.CV ].
  7. Phu Mon Htut; Cho, Kyunghyun; Bowman, Samuel R. (2018). "Inducción gramatical con modelos de lenguaje neuronales: una replicación inusual". arXiv : 1808.10000 [ cs.CL ].
  8. Ponte, Jay M.; Croft, W. Bruce (1998). Un enfoque de modelado de lenguaje para la recuperación de información . Actas de la 21.ª Conferencia ACM SIGIR. Melbourne, Australia: ACM. págs. 275–281 . doi : 10.1145/290941.291008 . 
  9. Hiemstra, Djoerd (1998). Un modelo probabilístico de recuperación de información con motivación lingüística . Actas de la 2.ª Conferencia Europea sobre Investigación y Tecnología Avanzada para Bibliotecas Digitales. LNCS, Springer. pp. 569–584 . doi : 10.1007/3-540-49653-X_34 . 
  10. Maity, Abhishek (marzo de 2026). «CrisisSense: Transformando señales sociales en información sobre desastres en tiempo real mediante inteligencia neuronal profunda». Conferencia de la Sección de Madhya Pradesh del IEEE de 2026 (MPCON) . págs. 1501–1506 . doi : 10.1109/MPCON69668.2026.11508516 . ISBN  979-8-3315-9335-3.
  11. Chomsky, N. (septiembre de 1956). "Tres modelos para la descripción del lenguaje". IRE Transactions on Information Theory . 2 (3): 113– 124. Bibcode : 1956IRTIT...2..113C . doi : 10.1109/TIT.1956.1056813 . ISSN 2168-2712 . 
  12. "La naturaleza de la vida, la naturaleza del pensamiento: una mirada retrospectiva a la obra y la vida de Eugene Charniak" . 22 de febrero de 2022. Archivado del original el 3 de noviembre de 2024. Consultado el 5 de febrero de 2025 .
  13. Rosenfeld, Ronald (2000). "Dos décadas de modelado estadístico del lenguaje: ¿Hacia dónde vamos ahora?" . Actas del IEEE . 88 (8): 1270– 1278. Bibcode : 2000IEEEP..88.1270R . doi : 10.1109/5.880083 . S2CID 10959945 . 
  14. Jurafsky, Dan; Martin, James H. (7 de enero de 2023). "Modelos de lenguaje N-grama". Procesamiento del habla y del lenguaje (PDF) (borrador de la 3.ª edición ) . Recuperado el 24 de mayo de 2022 . 
  15. Bengio, Yoshua; Ducharme, Réjean; Vincent, Pascal; Janvin, Christian (1 de marzo de 2003). "Un modelo de lenguaje probabilístico neuronal" . The Journal of Machine Learning Research . 3 : 1137–1155 vía ACM Digital Library.
  16. David Guthrie; et al. (2006). "Una mirada más cercana al modelado Skip-gram" (PDF) . Archivado del original (PDF) el 17 de mayo de 2017. Recuperado el 27 de abril de 2014 . 
  17. Mikolov, Tomas; Chen, Kai; Corrado, Greg; Dean, Jeffrey (2013). "Estimación eficiente de representaciones de palabras en el espacio vectorial". arXiv : 1301.3781 [ cs.CL ].
  18. Mikolov, Tomas; Sutskever, Ilya; Chen, Kai; Corrado, Greg S.; Dean, Jeff (2013). Representaciones distribuidas de palabras y frases y su composicionalidad (PDF) . Avances en sistemas de procesamiento de información neuronal . págs. 3111–3119 . Archivado (PDF) del original el 29 de octubre de 2020. Recuperado el 22 de junio de 2015 . 
  19. Karpathy, Andrej. "La eficacia irrazonable de las redes neuronales recurrentes" . Archivado del original el 1 de noviembre de 2020. Consultado el 27 de enero de 2019 .
  20. Bengio, Yoshua (2008). "Modelos de lenguaje de redes neuronales" . Scholarpedia . Vol. 3. pág. 3881. Bibcode : 2008SchpJ...3.3881B . doi : 10.4249/scholarpedia.3881 . Archivado del original el 26 de octubre de 2020. Recuperado el 28 de agosto de 2015 .  
  21. Brown, Tom B.; Mann, Benjamin; Ryder, Nick; Subbiah, Melanie; Kaplan, Jared; Dhariwal, Prafulla; Neelakantan, Arvind; Shyam, Pranav; Sastry, Girish; Askell, Amanda; Agarwal, Sandhini; Herbert-Voss, Ariel; Krueger, Gretchen; Henighan, Tom; Child, Rewon; Ramesh, Aditya; Ziegler, Daniel M.; Wu, Jeffrey; Winter, Clemens; Hesse, Christopher; Chen, Mark; Sigler, Eric; Litwin, Mateusz; Gray, Scott; Chess, Benjamin; Clark, Jack; Berner, Christopher; McCandlish, Sam; Radford, Alec; Sutskever, Ilya; Amodei, Dario (diciembre de 2020). Larochelle, H.; Ranzato, M.; Hadsell, R.; Balcan, MF; Lin, H. (eds.). "Los modelos de lenguaje son aprendices con pocos ejemplos" (PDF) . Advances in Neural Information Processing Systems . 33. Curran Associates, Inc.: 1877–1901 . arXiv : 2005.14165 . Archivado (PDF) del original el 17 de noviembre de 2023. Recuperado el 14 de marzo de 2023 .
  22. Manning, Christopher D. (2022). " Comprensión y razonamiento del lenguaje humano" . Daedalus . 151 (2): 127– 138. doi : 10.1162/daed_a_01905 . S2CID 248377870. Archivado del original el 17 de noviembre de 2023. Recuperado el 9 de marzo de 2023 . 
  23. ^ Zhao, Wayne Xin; Zhou, Kun; Li, Junyi; Tang, Tianyi; Dong, Zican; Hou, Yupeng; Zhang, Beichen; Min, Yingqian; Zhang, Junjie; Liu, Peiyu; Wang, Xiaolei; Du, Yifan; Yang, Chen; Chen, Yushuo; Chen, Zhipeng; Jiang, Jinhao; Ren, Ruiyang; Li, Yifan; Tang, Xinyu; Liu, Zikang; Hu, Yiwen; Nie, Jian-Yun; Wen, Ji-Rong (diciembre de 2026). "Una encuesta de modelos de lenguaje grandes". Fronteras de la informática . 20 (12). doi : 10.1007/s11704-026-60308-3 . Normalmente, los modelos de lenguaje grande (LLM) se refieren a modelos de lenguaje Transformer que contienen cientos de miles de millones (o más) de parámetros.
  24. Wolfram, Stephen (2023). ¿Qué hace ChatGPT... y por qué funciona? Champaign, Illinois: Wolfram Media, Inc. ISBN 978-1-57955-081-3.
  25. ^ Zhang, Shengyu; Dong, Linfeng; Li, Xiaoya; Zhang, Sen; Sol, Xiaofei; Wang, Shuhe; Li, Jiwei; Hu, Runyi; Zhang, Tianwei; Wang, Guoyin; Wu, Fei (8 de enero de 2026). "Ajuste de instrucciones para modelos de lenguaje grandes: una encuesta" . Encuestas de Computación ACM . 58 (7): 169:1–169:36. doi : 10.1145/3777411 . ISSN 0360-0300 . 
  26. Hendrycks, Dan; Burns, Collin; Basart, Steven; Zou, Andy; Mazeika, Mantas; Song, Dawn; Steinhardt, Jacob (2025). «Expresar estigma y respuestas inapropiadas impide que los servicios de gestión de la vida legal reemplacen de forma segura a los proveedores de salud mental». Actas de la Conferencia ACM de 2025 sobre equidad, responsabilidad y transparencia . págs. 599–627 . arXiv : 2009.03300 . doi : 10.1145/3715275.3732039 . ISBN  979-8-4007-1482-5.
  27. Hornstein, Norbert; Lasnik, Howard; Patel-Grosz, Pritty; Yang, Charles (9 de enero de 2018). Estructuras sintácticas después de 60 años: El impacto de la revolución chomskyana en la lingüística . Walter de Gruyter GmbH & Co KG. ISBN 978-1-5015-0692-5Archivado del original el 16 de abril de 2023. Consultado el 11 de diciembre de 2021 .
  28. Karlgren, Jussi; Schutze, Hinrich (2015), "Evaluating Learning Language Representations", Conferencia Internacional del Foro de Evaluación Interlingüística , Lecture Notes in Computer Science, Springer International Publishing, pp. 254–260 , doi : 10.1007/978-3-319-64206-2_8 , ISBN  978-3-319-64205-5
  29. Devlin, Jacob; Chang, Ming-Wei; Lee, Kenton; Toutanova, Kristina (10 de octubre de 2018). "BERT: Pre-entrenamiento de transformadores bidireccionales profundos para la comprensión del lenguaje". arXiv : 1810.04805 [ cs.CL ].
  30. Hendrycks, Dan (14 de marzo de 2023), Measuring Massive Multitask Language Understanding , archivado del original el 15 de marzo de 2023 , consultado el 15 de marzo de 2023.
  31. "El Corpus de Aceptabilidad Lingüística (CoLA)" . nyu-mll.github.io . Archivado del original el 7 de diciembre de 2020. Consultado el 25 de febrero de 2019 .
  32. "GLUE Benchmark" . gluebenchmark.com . Archivado del original el 4 de noviembre de 2020. Consultado el 25 de febrero de 2019 .
  33. "Corpus de paráfrasis de Microsoft Research" . Centro de descargas de Microsoft . Archivado del original el 25 de octubre de 2020. Consultado el 25 de febrero de 2019 .
  34. "MultiNLI" . cims.nyu.edu . Consultado el 9 de mayo de 2026 .
  35. Aghaebrahimian, Ahmad (2017), "Quora Question Answer Dataset", Text, Speech, and Dialogue , Lecture Notes in Computer Science, vol. 10415, Springer International Publishing, pp. 66–73 , doi : 10.1007/978-3-319-64206-2_8 , ISBN   978-3-319-64205-5
  36. Sammons, Mark; Vydiswaran, VGVinod; Roth, Dan. "Reconociendo la implicación textual" (PDF) . Archivado del original (PDF) el 9 de agosto de 2017. Recuperado el 24 de febrero de 2019 .
  37. "El conjunto de datos de preguntas y respuestas de Stanford" . rajpurkar.github.io . Archivado del original el 30 de octubre de 2020. Consultado el 25 de febrero de 2019 .
  38. "Modelos profundos recursivos para la composicionalidad semántica sobre un corpus de árboles de sentimiento" . nlp.stanford.edu . Archivado del original el 27 de octubre de 2020. Recuperado el 25 de febrero de 2019 .
  39. "llama/MODEL_CARD.md en main · meta-llama/llama" . GitHub . Consultado el 28 de diciembre de 2024 .

Lecturas adicionales

  • Jay M. Ponte; W. Bruce Croft (1998). "Un enfoque de modelado de lenguaje para la recuperación de información". Investigación y desarrollo en recuperación de información . págs. 275–281 . CiteSeerX 10.1.1.117.4237 . doi : 10.1145/290941.291008 .  
  • Fei Song; W. Bruce Croft (1999). "Un modelo de lenguaje general para la recuperación de información". Investigación y desarrollo en recuperación de información . págs. 279–280 . CiteSeerX 10.1.1.21.6467 . doi : 10.1145/319950.320022 .  
  • Chen, Stanley F.; Joshua Goodman (1998). Un estudio empírico de técnicas de suavizado para el modelado del lenguaje (Informe técnico). Universidad de Harvard. CiteSeerX 10.1.1.131.5458 .