Articulo de referencia

transformador generativo preentrenado

Modelo GPT original Un transformador generativo preentrenado ( GPT ) es un tipo de modelo de lenguaje grande (LLM) [ 1 ] [ 2 ] [ 3 ] que se utiliza ampliamente en chatbots de in...

Modelo GPT original

Un transformador generativo preentrenado ( GPT ) es un tipo de modelo de lenguaje grande (LLM) [ 1 ] [ 2 ] [ 3 ] que se utiliza ampliamente en chatbots de inteligencia artificial generativa . [ 4 ] [ 5 ] Los GPT se basan en una arquitectura de aprendizaje profundo llamada transformador . Se preentrenan en grandes conjuntos de datos de contenido sin etiquetar y son capaces de generar contenido novedoso. [ 2 ] [ 3 ]

OpenAI fue el primero en aplicar el preentrenamiento generativo a la arquitectura transformer, introduciendo el modelo GPT-1 en 2018. [ 6 ] El chatbot ChatGPT , lanzado a finales de 2022 (usando GPT-3.5 ), fue seguido por muchos chatbots de la competencia que utilizan sus propios transformadores generativos preentrenados para generar texto, como Gemini , DeepSeek y Claude .

Las GPT se utilizan principalmente para generar texto, pero pueden entrenarse para generar otros tipos de datos. Las GPT multimodales pueden procesar o generar múltiples tipos de datos, como texto, imágenes y audio. Para mejorar el rendimiento en tareas complejas, las GPT de razonamiento dedican más tiempo de cálculo al análisis del problema antes de generar un resultado.

Fondo

Durante la década de 2010, la mejora de los algoritmos de aprendizaje automático , la mayor potencia de los ordenadores y el aumento de la cantidad de material digitalizado propiciaron un auge de la IA . [ 7 ]

Por otra parte, el concepto de preentrenamiento generativo (GP) era una técnica consolidada en el aprendizaje automático. El GP es una forma de aprendizaje autosupervisado en la que un modelo se entrena primero con un conjunto de datos grande y sin etiquetar (el paso de "preentrenamiento") para aprender a generar puntos de datos. Este modelo preentrenado se adapta luego a una tarea específica utilizando un conjunto de datos etiquetado (el paso de " ajuste fino "). [ 8 ]

La arquitectura Transformer para aprendizaje profundo es la tecnología central de un GPT. Desarrollada por investigadores de Google , se presentó en el artículo " Attention Is All You Need ", publicado en 2017. La arquitectura Transformer resolvió muchos de los problemas de rendimiento asociados con los diseños anteriores de redes neuronales recurrentes (RNN) para el procesamiento del lenguaje natural (PLN). El uso de un mecanismo de atención por parte de la arquitectura permite a los modelos procesar secuencias completas de texto a la vez, lo que posibilita el entrenamiento de modelos mucho más grandes y sofisticados. [ 9 ] Desde 2017, los sistemas de PLN basados ​​en Transformer disponibles han sido capaces de procesar, extraer, organizar, conectar, contrastar y resumir textos, así como responder preguntas a partir de la entrada textual.

Historia

El 11 de junio de 2018, investigadores e ingenieros de OpenAI publicaron un artículo titulado "Mejora de la comprensión del lenguaje mediante el preentrenamiento generativo", que presentó GPT-1 , el primer modelo GPT. [ 10 ] Fue diseñado como un modelo de lenguaje grande basado en transformadores que utilizó preentrenamiento generativo (GP) en BookCorpus , un corpus de texto diverso , seguido de un ajuste fino discriminativo para centrarse en tareas lingüísticas específicas. Este enfoque semisupervisado fue visto como un avance. Los modelos GPT utilizan solo la parte del decodificador de la arquitectura del transformador, preentrenada para predecir el siguiente token en una secuencia. [ 11 ] [ 12 ] Anteriormente, los modelos neuronales de mejor rendimiento en el procesamiento del lenguaje natural (PLN) habían empleado comúnmente el aprendizaje supervisado a partir de grandes cantidades de datos etiquetados manualmente ; entrenar un modelo de lenguaje grande con este enfoque habría sido prohibitivamente caro y requeriría mucho tiempo. [ 10 ] 

El 14 de febrero de 2019, OpenAI presentó GPT-2 , un modelo más grande capaz de generar texto coherente. Creado como una ampliación directa de su predecesor, tanto su número de parámetros como el tamaño de su conjunto de datos se incrementaron en un factor de 10. GPT-2 cuenta con 1.500 millones de parámetros y fue entrenado con WebText, un conjunto de datos de 40 gigabytes que contiene 8 millones de páginas web . [ 13 ] [ 11 ] Debido a los riesgos de uso malicioso, OpenAI optó por un "lanzamiento por etapas", publicando inicialmente versiones más pequeñas del modelo antes de lanzar el modelo completo de 1.500 millones de parámetros en noviembre. [ 14 ]

El 10 de febrero de 2020, Microsoft presentó su modelo de generación de lenguaje natural Turing, que, según afirmó, era el "modelo de lenguaje más grande jamás publicado, con 17 mil millones de parámetros". El modelo superó a todos los modelos de lenguaje anteriores en diversas tareas, incluyendo el resumen de textos y la respuesta a preguntas . [ 15 ]

El 28 de mayo de 2020, OpenAI presentó GPT-3 , un modelo con 175 mil millones de parámetros entrenado con un conjunto de datos mayor que el de GPT-2. Esto representó un avance significativo en las capacidades de aprendizaje con pocos ejemplos y sin ejemplos. Con pocos ejemplos, podía realizar diversas tareas para las que no había sido entrenado explícitamente. [ 16 ] [ 12 ]

Tras el lanzamiento de GPT-3, OpenAI comenzó a utilizar el aprendizaje por refuerzo a partir de la retroalimentación humana (RLHF) para alinear el comportamiento de los modelos más estrechamente con las preferencias humanas. Esto condujo al desarrollo de InstructGPT , una versión refinada de GPT-3. OpenAI perfeccionó aún más InstructGPT para crear ChatGPT , el producto insignia de chatbot de OpenAI que se lanzó el 30 de noviembre de 2022. [ 17 ] ChatGPT se basó inicialmente en GPT-3.5 , pero posteriormente se migró al modelo GPT-4 , que se lanzó el 14 de marzo de 2023. [ 18 ] [ 19 ] GPT-4 también se integró en partes de varias aplicaciones, incluidas Microsoft Copilot , GitHub Copilot , Snapchat , Khan Academy y Duolingo . [ 20 ]

La inmensa popularidad de ChatGPT impulsó el desarrollo generalizado de sistemas GPT competitivos por parte de otras organizaciones. EleutherAI lanzó una serie de modelos de peso abierto , incluido GPT-J en 2021. Otras importantes empresas tecnológicas desarrollaron posteriormente sus propios modelos GPT, como PaLM y Gemini de Google , así como Llama de Meta AI . [ 21 ]

Muchos modelos GPT posteriores se han entrenado para ser multimodales (capaces de procesar o generar múltiples tipos de datos). Por ejemplo, GPT-4o puede procesar y generar texto, imágenes y audio. [ 22 ] Además, modelos GPT como o3 y DeepSeek R1 se han entrenado con aprendizaje por refuerzo para generar razonamientos en cadena de varios pasos antes de producir una respuesta final, lo que ayuda a resolver problemas complejos en dominios como las matemáticas. [ 23 ]

Modelos de fundación

Un modelo base es un modelo de IA entrenado con datos amplios a gran escala, de manera que pueda adaptarse a una amplia gama de tareas posteriores. [ 24 ] [ 25 ] Los GPT base también pueden emplear modalidades distintas al texto, para entrada y/o salida. [ 26 ] En cuanto a la salida multimodal , algunos modelos basados ​​en transformadores generativos se utilizan para tecnologías de texto a imagen como la difusión [ 27 ] y la decodificación paralela. [ 28 ] Este tipo de modelos pueden servir como modelos base visuales (VFM) para desarrollar sistemas posteriores que puedan trabajar con imágenes. [ 29 ]

Arquitecturas de transformadores eficientes

Los requisitos computacionales y de memoria de los modelos basados ​​en transformadores aumentan significativamente a medida que se escalan a tamaños mayores y secuencias de entrada más largas. El mecanismo de autoatención estándar tiene una complejidad cuadrática con respecto a la longitud de la secuencia de entrada, como se describe en Attention Is All You Need . [ 30 ]

Los investigadores propusieron varias mejoras de eficiencia, como mecanismos de atención dispersa y arquitecturas eficientes en memoria que reducen los costos computacionales al tiempo que admiten ventanas de contexto más largas. [ 31 ] Modelos como BigBird, Reformer y FlashAttention demuestran patrones de atención estructurados o computación optimizada para mejorar la escalabilidad y la eficiencia. [ 32 ] [ 33 ] [ 34 ]

Esto ha ayudado a que los modelos de lenguaje de gran tamaño procesen de manera eficiente secuencias de entrada largas con una menor cantidad de memoria y capacidad de cálculo tanto durante el entrenamiento como durante la inferencia.

Leyes de escala

Las leyes de escala describen relaciones empíricas entre el rendimiento de los modelos de lenguaje grandes y factores como el tamaño del modelo, el tamaño del conjunto de datos y los recursos computacionales. Los estudios empíricos han demostrado que el rendimiento tiende a seguir relaciones aproximadas de ley de potencias a medida que aumentan estos factores. [ 35 ]

Los modelos más grandes entrenados con más datos generalmente logran una menor pérdida de entrenamiento y una mejor generalización. Trabajos posteriores sugieren que el rendimiento no está determinado únicamente por la cantidad de parámetros, sino por cómo se equilibran el tamaño del modelo, los datos y la capacidad de cómputo durante el entrenamiento. [ 36 ]

Estas observaciones han influido en el desarrollo de los sucesivos modelos GPT, en particular en las decisiones sobre el diseño de la arquitectura, la composición del conjunto de datos y las estrategias de entrenamiento.

Habilidades emergentes

Las capacidades emergentes se refieren a funcionalidades que aparecen en modelos de lenguaje grandes solo cuando alcanzan una cierta escala y no están presentes en versiones más pequeñas de los mismos modelos. Estas capacidades se consideran "emergentes" porque surgen a medida que aumenta el tamaño del modelo, los datos de entrenamiento y la capacidad de cómputo. [ 37 ] [ 38 ]

Algunos ejemplos de habilidades emergentes incluyen el razonamiento en varios pasos, el aprendizaje en contexto (la capacidad de realizar tareas basándose en ejemplos proporcionados en las indicaciones sin entrenamiento adicional) y un mejor desempeño en pruebas de referencia complejas de lenguaje y razonamiento.

Las investigaciones sugieren que estas capacidades no escalan linealmente, sino que aparecen una vez que los modelos superan ciertos umbrales de tamaño y escala de entrenamiento. [ 38 ]

Este fenómeno ha influido en el desarrollo de modelos GPT más grandes y ha contribuido a su mayor eficacia en una amplia gama de tareas.

Problemas de marca

OpenAI afirma que "GPT" es su propia marca, citando su asociación con ChatGPT y las designaciones de las versiones de su modelo.

OpenAI , que creó el primer transformador preentrenado generativo (GPT) en 2018, afirmó en 2023 que "GPT" debía considerarse una marca de OpenAI. [ 39 ] En abril de 2023, OpenAI revisó las directrices de marca en sus términos de servicio para indicar que otras empresas que utilizaran su API para ejecutar sus servicios de IA ya no podrían incluir "GPT" en dichos nombres o marcas. [ 40 ] En mayo de 2023, OpenAI contrató un servicio de gestión de marcas para notificar a sus clientes de API sobre esta política, aunque estas notificaciones no llegaron a hacer reclamaciones legales explícitas (como alegaciones de infracción de marca registrada o demandas de cese y desistimiento ). [ 39 ] A partir de noviembre de 2023, OpenAI todavía prohíbe a sus licenciatarios de API nombrar sus propios productos con "GPT", [ 41 ] pero ha comenzado a permitir a sus suscriptores de ChatGPT Plus hacer "versiones personalizadas de ChatGPT" llamadas GPT en el sitio de OpenAI. [ 42 ] Los términos de servicio de OpenAI dicen que sus suscriptores pueden usar "GPT" en los nombres de estos, aunque se "desaconseja". [ 41 ]

En relación con esto, OpenAI solicitó a la Oficina de Patentes y Marcas de los Estados Unidos (USPTO) el registro de la marca comercial "GPT" en el campo de la IA. [ 39 ] OpenAI intentó acelerar la tramitación de su solicitud, pero la USPTO la rechazó en abril de 2023. [ 43 ] En mayo de 2023, la USPTO rechazó la solicitud de marca comercial de OpenAI, al considerar que "GPT" era descriptivo y genérico. [ 44 ] [ 45 ] [ 46 ] [ 47 ]

En la Unión Europea , la Oficina de Propiedad Intelectual de la Unión Europea registró "GPT" como marca comercial de OpenAI en la primavera de 2023. Sin embargo, desde la primavera de 2024 el registro está siendo impugnado y pendiente de cancelación. [ 48 ] En Suiza , el Instituto Federal Suizo de Propiedad Intelectual registró "GPT" como marca comercial de OpenAI en la primavera de 2023. [ 49 ] [ 50 ] La Administración Nacional de Propiedad Intelectual de China denegó las solicitudes de OpenAI para registrar como marcas comerciales los términos "GPT" y "ChatGPT" en 2024, y el término "GPT-5" en agosto de 2025, tras lo cual OpenAI presentó apelaciones. [ 51 ]

Evaluación y análisis comparativo

La evaluación de los modelos transformadores generativos preentrenados se lleva a cabo utilizando una variedad de puntos de referencia y métricas, que buscan evaluar su desempeño en diferentes tareas. Los enfoques comunes incluyen la precisión en conjuntos de datos estándar, así como otras características como robustez, sesgo y toxicidad. [ 52 ]

Estos modelos se suelen probar en tareas como la comprensión del lenguaje natural, el razonamiento, la respuesta a consultas y la generación de código. A veces combinan varias tareas para proporcionar una evaluación más amplia del rendimiento del modelo en diferentes dominios. [ 53 ]

Enfoques más recientes amplían estas evaluaciones para incluir otras características como la equidad, la eficiencia y la transparencia, con el fin de obtener una evaluación más precisa de estos modelos. [ 52 ]

La evaluación sigue siendo un área activa de investigación, ya que las pruebas existentes pueden no reflejar con precisión el rendimiento en el mundo real o los riesgos asociados con los modelos generativos a gran escala. [ 52 ]

Consideraciones éticas e impacto social

Los modelos transformadores generativos preentrenados han suscitado diversas preocupaciones éticas y sociales, en particular en lo que respecta al sesgo, la desinformación y el impacto ambiental. Los modelos de lenguaje de gran tamaño pueden reproducir y amplificar patrones presentes en sus datos de entrenamiento, incluidos los sesgos sociales, lo que puede dar lugar a resultados injustos o engañosos. [ 54 ] [ 55 ]

Estos modelos también se han asociado con la generación de información inexacta o engañosa, ya que están diseñados para producir texto fluido en lugar de verificar la exactitud de los hechos. Esto tiene un impacto en su uso en aplicaciones como la generación automatizada de contenido y la difusión de información. [ 56 ]

El entrenamiento de modelos a gran escala también requiere enormes recursos computacionales, lo que contribuye a un mayor consumo de energía y a mayores costos ambientales. La preocupación por el impacto ambiental de los grandes sistemas de IA ha generado demandas de métodos de entrenamiento más eficientes y mayor transparencia en la presentación de informes sobre el uso de recursos. [ 57 ] [ 58 ]

Véase también

Referencias

  1. Haddad, Mohammed. "¿Cómo funciona GPT-4 y cómo puedes empezar a usarlo en ChatGPT?" . www.aljazeera.com . Archivado del original el 5 de julio de 2023 . Consultado el 10 de abril de 2023 .
  2. 1 2 "Inteligencia artificial generativa: un cambio radical para el que la sociedad debe estar preparada" . Foro Económico Mundial . 9 de enero de 2023. Archivado del original el 25 de abril de 2023. Consultado el 8 de abril de 2023 .
  3. 1 2 "De la A a la Z de la Inteligencia Artificial" . Time . 13 de abril de 2023. Archivado del original el 16 de junio de 2023. Recuperado el 14 de abril de 2023 .
  4. Hu, Luhui (15 de noviembre de 2022). "Inteligencia artificial generativa y futuro" . Medium . Archivado del original el 5 de junio de 2023. Recuperado el 29 de abril de 2023 .
  5. "CSDL | IEEE Computer Society" . www.computer.org . Archivado del original el 28 de abril de 2023. Consultado el 29 de abril de 2023 .
  6. "Mejora de la comprensión del lenguaje con aprendizaje no supervisado" . openai.com . 11 de junio de 2018. Archivado del original el 18 de marzo de 2023. Consultado el 18 de marzo de 2023 .
  7. "Se empieza a comprender mejor la limitación de la IA" . The Economist . 11 de junio de 2020. ISSN 0013-0613 . Archivado del original el 31 de julio de 2020. Consultado el 31 de julio de 2020 . 
  8. Erhan, Dumitru; Courville, Aaron; Bengio, Yoshua; Vincent, Pascal (31 de marzo de 2010). "¿Por qué el preentrenamiento no supervisado ayuda al aprendizaje profundo?" . Actas de la Decimotercera Conferencia Internacional sobre Inteligencia Artificial y Estadística . Actas de talleres y conferencias de JMLR: 201–208 . Archivado del original el 24 de enero de 2024. Recuperado el 24 de enero de 2024 .
  9. Levy, Steven. "8 empleados de Google inventaron la IA moderna. Esta es la historia desde dentro" . Wired . ISSN 1059-1028 . Archivado del original el 20 de marzo de 2024. Consultado el 1 de junio de 2026 . 
  10. 1 2 Radford, Alec; Narasimhan, Karthik; Salimans, Tim; Sutskever, Ilya (11 de junio de 2018). "Mejora de la comprensión del lenguaje mediante el preentrenamiento generativo" (PDF) . pág. 12. Archivado (PDF) del original el 26 de enero de 2021. Recuperado el 31 de julio de 2020 . 
  11. 1 2 Radford, Alec; Wu, Jeffrey; Child, Rewon; Luan, David; Amodei, Dario; Sutskever, Ilua (14 de febrero de 2019). "Los modelos de lenguaje son aprendices multitarea no supervisados" (PDF) . OpenAI . 1 (8). Archivado (PDF) del original el 6 de febrero de 2021. Recuperado el 19 de diciembre de 2020 .
  12. 1 2 Brown, Tom B.; Mann, Benjamin; Ryder, Nick; Subbiah, Melanie; Kaplan, Jared; Dhariwal, Prafulla; Neelakantan, Arvind; Shyam, Pranav; Sastry, Girish; Askell, Amanda; Agarwal, Sandhini; Herbert-Voss, Ariel; Krueger, Gretchen; Henighan, Tom; Child, Rewon; Ramesh, Aditya; Ziegler, Daniel M.; Wu, Jeffrey; Winter, Clemens; Hesse, Christopher; Chen, Mark; Sigler, Eric; Litwin, Mateusz; Gray, Scott; Chess, Benjamin; Clark, Jack; Berner, Christopher; McCandlish, Sam; Radford, Alec; Sutskever, Ilya; Amodei, Dario (28 de mayo de 2020). "Los modelos de lenguaje son aprendices de pocos ejemplos". arXiv : 2005.14165 [ cs.CL ].
  13. Vincent, James (14 de febrero de 2019). "La nueva IA multitalentosa de OpenAI escribe, traduce y difama" . The Verge . Archivado del original el 18 de diciembre de 2020. Recuperado el 19 de diciembre de 2020 .
  14. Vincent, James (7 de noviembre de 2019). "OpenAI ha publicado la IA generadora de texto que, según afirmaba, era demasiado peligrosa para compartir" . The Verge . Archivado del original el 11 de junio de 2020. Consultado el 28 de abril de 2023 .
  15. Sterling, Bruce (13 de febrero de 2020). "Web Semantics: Microsoft Project Turing introduce Turing Natural Language Generation (T-NLG)" . Wired . ISSN 1059-1028 . Archivado del original el 4 de noviembre de 2020. Consultado el 31 de julio de 2020 . 
  16. Sagar, Ram (3 de junio de 2020). "OpenAI lanza GPT-3, el modelo más grande hasta la fecha" . Analytics India Magazine . Archivado del original el 4 de agosto de 2020. Consultado el 31 de julio de 2020 .
  17. Fu, Yao; Peng, Hao; Khot, Tushar (2022). "¿Cómo obtiene GPT su capacidad? Rastreo de las capacidades emergentes de los modelos de lenguaje hasta sus fuentes" . Yao Fu's Notion . Archivado del original el 19 de abril de 2023. Recuperado el 24 de junio de 2023 .
  18. Edwards, Benj (14 de marzo de 2023). "GPT-4 de OpenAI muestra un rendimiento de nivel humano en pruebas comparativas profesionales" . Ars Technica . Archivado del original el 14 de marzo de 2023. Consultado el 15 de marzo de 2023 .
  19. OpenAI (15 de marzo de 2023). "Informe técnico de GPT-4". arXiv : 2303.08774 [ cs.CL ].
  20. Gupta, Aman (21 de marzo de 2023). "GPT-4 conquista el mundo: lista de empresas que integraron el chatbot" . Mint . Archivado del original el 24 de febrero de 2024. Consultado el 23 de enero de 2024 .
  21. Alford, Anthony (13 de julio de 2021). "EleutherAI publica como código abierto el clon de GPT-3 con seis mil millones de parámetros, GPT-J" . InfoQ . Archivado del original el 10 de febrero de 2023. Recuperado el 3 de abril de 2023 .
  22. Colburn, Thomas (13 de mayo de 2024). "OpenAI presenta GPT-4o, un nuevo modelo insignia de IA multimodal" . The Register . Archivado del original el 21 de mayo de 2024. Consultado el 18 de mayo de 2024 .
  23. Zia, Dr. Tehseen (29 de marzo de 2025). "Cómo difieren los enfoques de razonamiento de o3, Grok 3, DeepSeek R1, Gemini 2.0 y Claude 3.7 de OpenAI" . Unite.AI . Consultado el 3 de agosto de 2025 .
  24. "Presentación del Centro de Investigación sobre Modelos de Fundamentos (CRFM)" . Stanford HAI . 18 de agosto de 2021. Archivado del original el 4 de junio de 2023. Consultado el 26 de abril de 2023 .
  25. "Reflexiones sobre los modelos fundacionales" . hai.stanford.edu . 18 de octubre de 2021. Archivado del original el 15 de agosto de 2024. Consultado el 15 de agosto de 2024 .
  26. Islam, Arham (27 de marzo de 2023). "Modelos de lenguaje multimodales: el futuro de la inteligencia artificial (IA)" . Archivado del original el 15 de mayo de 2023. Recuperado el 15 de mayo de 2023 .
  27. Islam, Arham (14 de noviembre de 2022). "¿Cómo funcionan DALL·E 2, la difusión estable y el viaje intermedio?" . MarkTechPost . Archivado del original el 18 de julio de 2023 . Recuperado el 21 de mayo de 2023 .
  28. Saha, Shritama (4 de enero de 2023). "Google lanza Muse, un nuevo modelo de transformación de texto a imagen" . Analytics India Magazine . Archivado del original el 15 de mayo de 2023. Recuperado el 15 de mayo de 2023 .
  29. ^ Wu (et-al), Chenfei (8 de marzo de 2023). "Chat visualGPT". arXiv : 2303.04671 [ cs.CV ].
  30. Vaswani, Ashish; Shazeer, Noam; Parmar, Niki; Uszkoreit, Jakob; Jones, Llion; Gomez, Aidan N.; Kaiser, Łukasz; Polosukhin, Illia (2017). "Attention Is All You Need" . Advances in Neural Information Processing Systems 30 (NeurIPS 2017) . Archivado del original el 8 de agosto de 2020 . Recuperado el 31 de marzo de 2026 .
  31. Tay, Yi; Dehghani, Mostafa; Bahri, Dara; Metzler, Donald (2022). "Transformadores eficientes: una revisión". ACM Computing Surveys . 55 (6): 109:1–109:28. doi : 10.1145/3530811 .
  32. ^ Zaheer, Manzil; Guruganesh, Gurú; Dubey, Kumar Avinava; Ainslie, Josué; Alberti, Chris; Ontañón, Santiago; Pham, Pedro; Rávula, Anirudh; Wang, Qifan; Ahmed, Murtaza; Smola, Alexander J. (2020). "Big Bird: Transformers para secuencias más largas" (PDF) . Avances en sistemas de procesamiento de información neuronal 33 (NeurIPS 2020) .
  33. Kitaev, Nikita; Kaiser, Łukasz; Levskaya, Anselm (2020). "Reformer: The Efficient Transformer" . Conferencia Internacional sobre Representaciones de Aprendizaje (ICLR 2020) . Archivado del original el 10 de marzo de 2026. Recuperado el 31 de marzo de 2026 .
  34. Mittal, Aayush (17 de julio de 2024). "Atención instantánea: revolucionando la eficiencia de los transformadores" . Unite.AI . Archivado del original el 5 de noviembre de 2025. Recuperado el 16 de noviembre de 2024 .
  35. Kaplan, Jared; McCandlish, Sam; Henighan, Tom (2020). "Leyes de escala para modelos de lenguaje neuronal". arXiv : 2001.08361 [ cs.LG ].
  36. Hoffmann, Jordan (2022). "Entrenamiento de modelos de lenguaje grandes computacionalmente óptimos". arXiv : 2203.15556 [ cs.CL ].
  37. Wei, Jason (2022). "Habilidades emergentes de modelos de lenguaje grandes". arXiv : 2206.07682 [ cs.CL ].
  38. 1 2 Zhao, Wayne Xin (2023). "Un estudio de los grandes modelos de lenguaje". arXiv : 2303.18223 [ cs.CL ].
  39. 1 2 3 Hicks, William (10 de mayo de 2023). "OpenAI, creador de ChatGPT, pide a las empresas emergentes que eliminen 'GPT' de sus nombres" . The Business Journal . Archivado del original el 28 de junio de 2023. Recuperado el 21 de mayo de 2023 .
  40. OpenAI (24 de abril de 2023). "Directrices de marca" . Archivado del original el 18 de julio de 2023. Consultado el 21 de mayo de 2023 .
  41. 1 2 "Directrices de marca" . Archivado del original el 18 de julio de 2023. Recuperado el 28 de noviembre de 2023 .
  42. "Presentación de GPTS" . 13 de marzo de 2024. Archivado del original el 20 de marzo de 2024. Consultado el 28 de noviembre de 2023 .
  43. Heah, Alexa (26 de abril de 2023). "OpenAI no logra acelerar su intento de registrar la marca 'GPT'"" . DesignTAXI . Archivado del original el 26 de abril de 2023 . Consultado el 21 de mayo de 2023 .
  44. Serrano, Jody (16 de febrero de 2024). "El intento de OpenAI de registrar la marca 'GPT' es frustrado por las autoridades federales" . Gizmodo . Consultado el 18 de julio de 2026 .
  45. David, Emilia (16 de febrero de 2024). "OpenAI no puede registrar 'GPT' como marca comercial, todavía" . The Verge . Consultado el 18 de julio de 2026 .
  46. Coldewey, Devin (15 de febrero de 2024). "No hay marca registrada 'GPT' para OpenAI" . TechCrunch . Recuperado el 18 de julio de 2026 .
  47. "ACCIÓN OFICIAL NO DEFINITIVA" . USPTO . 25 de mayo de 2023. Archivado del original el 3 de diciembre de 2023. Consultado el 30 de diciembre de 2023 .
  48. "EUIPO - eSearch" . euipo.europa.eu . Archivado del original el 19 de junio de 2026. Consultado el 4 de septiembre de 2025 .
  49. "Base de datos IPI" . www.swissreg.ch . Archivado del original el 20 de agosto de 2025. Consultado el 4 de septiembre de 2025 .
  50. Vogt, Reto (20 de febrero de 2024). "OpenAI está presente en Suiza" GPT "como Markenname" . www.inside-it.ch (en alemán). Archivado desde el original el 21 de marzo de 2025 . Consultado el 4 de septiembre de 2025 .
  51. Jiang, Ben (12 de agosto de 2025). "China rechaza la solicitud de marca registrada GPT-5 de OpenAI" . South China Morning Post . Consultado el 18 de julio de 2026 .
  52. 1 2 3 "Evaluación holística de modelos de lenguaje (HELM)" . Centro Stanford para la Investigación sobre Modelos Fundamentales . Archivado del original el 17 de febrero de 2026. Recuperado el 31 de marzo de 2026 .
  53. "Evaluación holística de modelos de lenguaje (HELM)" . Centro Stanford para la Investigación sobre Modelos Fundamentales . Archivado del original el 4 de febrero de 2026. Recuperado el 31 de marzo de 2026 .
  54. Bender, Emily M.; Gebru, Timnit; McMillan-Major, Angelina; Shmitchell, Shmargaret (2021). Sobre los peligros de los loros estocásticos: ¿Pueden los modelos de lenguaje ser demasiado grandes? Actas de la Conferencia ACM de 2021 sobre equidad, rendición de cuentas y transparencia (FAccT '21). págs. 610–623 . doi : 10.1145/3442188.3445922 . 
  55. Weidinger, Laura; Mellor, John; Rauh, Maribeth (2022). Taxonomía de los riesgos que plantean los modelos de lenguaje . Conferencia ACM de 2022 sobre equidad, rendición de cuentas y transparencia (FAccT '22). págs. 214–229 . doi : 10.1145/3531146.3533088 . 
  56. Pan, Yikang; Pan, Liangming; Chen, Wenhu; Nakov, Preslav; Kan, Min-Yen; Wang, William Yang (2023). Sobre el riesgo de contaminación por desinformación con modelos de lenguaje grandes . Hallazgos de la Asociación para la Lingüística Computacional: EMNLP 2023. págs. 1389–1403 . doi : 10.18653/v1/2023.findings-emnlp.97 . 
  57. Strubell, Emma; Ganesh, Ananya; McCallum, Andrew (2019). Consideraciones sobre energía y políticas para el aprendizaje profundo en PLN . Actas de la 57.ª Reunión Anual de la Asociación de Lingüística Computacional. pp. 3645–3650 . arXiv : 1906.02243 . doi : 10.18653/v1/P19-1355 . 
  58. Ren, Shaolei; Tomlinson, Bill; Black, Rebecca W.; Torrance, Andrew W. (2024). "Conciliando las narrativas contrastantes sobre el impacto ambiental de los grandes modelos de lenguaje" . Scientific Reports . 14 (1) 26310. Bibcode : 2024NatSR..1426310R . doi : 10.1038/s41598-024-76682-6 . PMC 11530614. PMID 39487230 .