Articulo de referencia

Palmera

PaLM ( Pathways Language Model ) es un modelo de lenguaje grande (LLM) basado en transformadores de decodificador único denso de 540 mil millones de parámetros desarrollado por ...

PaLM ( Pathways Language Model ) es un modelo de lenguaje grande (LLM) basado en transformadores de decodificador único denso de 540 mil millones de parámetros desarrollado por Google AI . [ 1 ] Los investigadores también entrenaron versiones más pequeñas de PaLM (con 8 y 62 mil millones de parámetros) para probar los efectos de la escala del modelo. [ 2 ]

Modelo

PaLM es capaz de realizar una amplia gama de tareas, incluyendo razonamiento de sentido común , razonamiento aritmético , explicación de chistes , generación de código y traducción . [ 2 ] [ 3 ] [ 4 ] [ 5 ] Cuando se combina con la inducción de cadena de pensamiento , PaLM logró un rendimiento significativamente mejor en conjuntos de datos que requieren razonamiento de varios pasos, como problemas verbales y preguntas basadas en lógica . [ 1 ] [ 2 ]

El modelo se anunció por primera vez en abril de 2022 y permaneció privado hasta marzo de 2023, cuando Google lanzó una API para PaLM y varias otras tecnologías. [ 6 ] La API estuvo inicialmente disponible para un número limitado de desarrolladores que se unieron a una lista de espera antes de su lanzamiento al público. [ 7 ]

Google y DeepMind desarrollaron una versión de PaLM 540B (con 540 mil millones de parámetros) llamada Med-PaLM , que se ajusta con precisión a datos médicos y supera a los modelos anteriores en pruebas comparativas de respuesta a preguntas médicas . [ 8 ] [ 9 ] Med-PaLM fue el primero en obtener una puntuación aprobatoria en las preguntas de licencia médica de EE. UU. , y además de responder con precisión tanto a preguntas de opción múltiple como a preguntas abiertas, proporciona razonamiento y es capaz de evaluar sus propias respuestas. [ 10 ]

Google también extendió PaLM usando un transformador de visión para crear PaLM-E , un modelo de lenguaje de visión que se puede usar para manipulación robótica sin necesidad de reentrenamiento o ajuste fino . [ 11 ] [ 12 ] [ 13 ]

En mayo de 2023, Google anunció PaLM 2 en la conferencia magistral anual Google I/O . [ 14 ] Se informa que PaLM 2 es un modelo de 340 mil millones de parámetros entrenado con 3,6 billones de tokens. [ 15 ]

En junio de 2023, Google anunció AudioPaLM para la traducción de voz a voz, que utiliza la arquitectura y la inicialización de PaLM-2. [ 16 ]

Capacitación

PaLM está preentrenado en un corpus de alta calidad de 780 mil millones de tokens que comprenden diversas tareas y casos de uso de lenguaje natural . Este conjunto de datos incluye páginas web filtradas, libros, artículos de Wikipedia , artículos de noticias, código fuente obtenido de repositorios de código abierto en GitHub y conversaciones en redes sociales . [ 1 ] [ 2 ] Se basa en el conjunto de datos utilizado para entrenar el modelo LaMDA de Google . [ 2 ] La parte del conjunto de datos correspondiente a las conversaciones en redes sociales constituye el 50 % del corpus, lo que ayuda al modelo en sus capacidades conversacionales. [ 2 ]

PaLM 540B se entrenó en dos Pods TPU v4 con 3072 chips TPU v4 en cada Pod conectados a 768 hosts, conectados mediante una combinación de paralelismo de modelo y datos , que fue la configuración TPU más grande. [ 2 ] [ 17 ] Esto permitió un entrenamiento eficiente a gran escala, utilizando 6144 chips, y marcó un récord para la mayor eficiencia de entrenamiento lograda para LLM a esta escala: una utilización de FLOPs de hardware del 57,8 %. [ 3 ]

Véase también

Referencias

  1. 1 2 3 Narang, Sharan; Chowdhery, Aakanksha. "Pathways Language Model (PaLM): Escalando a 540 mil millones de parámetros para un rendimiento revolucionario" . ai.googleblog.com . Recuperado el 17 de marzo de 2023 .
  2. 1 2 3 4 5 6 7 Chowdhery, Aakanksha; Narang, Sharan; Devlin, Jacob; et al. (2022). "PaLM: Escalando el modelado del lenguaje con rutas". arXiv : 2204.02311 [ cs.CL ]. 
  3. 1 2 Anadiotis, George (12 de abril de 2022). "Google establece el estándar para los modelos de lenguaje de IA con PaLM" . VentureBeat . Recuperado el 17 de marzo de 2023 .
  4. Bastian, Matthias (5 de abril de 2022). "Google PaLM: La IA de lenguaje gigante puede explicar chistes" . the decoder . Recuperado el 17 de marzo de 2023 .
  5. "Google: ¿Por qué nadie habla de PaLM?" . seekingalpha.com . 12 de diciembre de 2022 . Consultado el 17 de marzo de 2023 .
  6. Vincent, James (14 de marzo de 2023). "Google abre su modelo de lenguaje de IA PaLM para desafiar a OpenAI y GPT-3" . The Verge . Recuperado el 17 de marzo de 2023 .
  7. Huffman, Scott; Woodward, Josh. "PaLM API y MakerSuite: una forma accesible de comenzar a prototipar y construir aplicaciones de IA generativa" . Recuperado el 17 de marzo de 2023 .
  8. ^ Singhal, Karan; Azizi, Shekoofeh; Tu, Tao; et al. (2022). "Los grandes modelos de lenguaje codifican el conocimiento clínico". arXiv : 2212.13138 [ cs.CL ]. 
  9. "MedPaLM: Los nuevos chatbots pronto serán mejores que esperar a un médico" . The Medical Futurist . 17 de enero de 2023. Consultado el 17 de marzo de 2023 .
  10. Matias, Yossi; Corrado, Greg (14 de marzo de 2023). "Nuestras últimas actualizaciones de investigación sobre IA en salud" . Google . Recuperado el 17 de marzo de 2023 .
  11. ^ Seca, Danny; Xia, Fei; Sajjadi, Mehdi SM; et al. (2023). "PaLM-E: un modelo de lenguaje multimodal incorporado". arXiv : 2303.03378 [ cs.LG ]. 
  12. Driess, Danny; Florence, Pete. "PaLM-E: Un modelo de lenguaje multimodal encarnado" . ai.googleblog.com . Consultado el 17 de marzo de 2023 .
  13. Edwards, Benj (7 de marzo de 2023). "PaLM-E de Google es un cerebro robótico generalista que recibe órdenes" . Ars Technica . Consultado el 17 de marzo de 2023 .
  14. Lardinois, Frederic (10 de mayo de 2023). "Google lanza PaLM 2, su modelo de lenguaje grande de próxima generación" . TechCrunch . Archivado del original el 10 de mayo de 2023. Recuperado el 10 de mayo de 2023 .
  15. Elias, Jennifer (16 de mayo de 2023). "El modelo de IA más reciente de Google utiliza casi cinco veces más datos de texto para el entrenamiento que su predecesor" . CNBC . Consultado el 18 de mayo de 2023 .
  16. "AudioPaLM" . google-research.github.io . Consultado el 30 de junio de 2023 .
  17. "Análisis empírico del entrenamiento de modelos de lenguaje grandes con rendimiento computacional óptimo" . www.deepmind.com . 12 de abril de 2022. Consultado el 17 de marzo de 2023 .