Articulo de referencia

Gemma (modelo de lenguaje)

{{cite web |last1=Banks |first1=Jeanine |last2=Warkentin |first2=Tris |title=Gemma: Introducing new state-of-the-art open models |url=https://blog.google/technology/developers/g...

Gemma es una serie de modelos de lenguaje de gran tamaño disponibles en el código fuente, desarrollados por Google DeepMind . Se basa en tecnologías similares a las de Gemini . [ 4 ] La primera versión se lanzó en febrero de 2024, seguida de Gemma  2 en junio de 2024, Gemma  3 en marzo de 2025 y Gemma 4 con pesos abiertos en abril de 2026. También se han desarrollado variantes de Gemma, como el modelo de lenguaje visual PaliGemma y el modelo MedGemma para temas de consulta médica. 

Historia

En febrero de 2024, Google presentó Gemma, una colección de modelos de lógica difusa (LLM) con código fuente disponible que funcionan como una versión ligera de Gemini. El lanzamiento inicial incluyó dos tamaños: redes neuronales con dos y siete mil millones de parámetros , respectivamente. Varias publicaciones interpretaron esto como una respuesta a competidores como Meta , que publicaban el código fuente de sus modelos de IA, y como un cambio respecto a la práctica de larga data de Google de mantener privado el código fuente de su IA. [ 5 ] [ 6 ] [ 7 ] [ 8 ]

Gemma 2 se lanzó el 27 de junio de 2024, [ 9 ] y Gemma  3 se lanzó el  12 de marzo de 2025. [ 10 ] [ 11 ] El 2 de abril de 2026, Google lanzó Gemma  4 bajo la licencia libre y de código abierto Apache 2.0 . [ 2 ] [ 12 ]

Descripción general

Basada en tecnologías similares a las de la serie de modelos Gemini, Gemma es descrita por Google como una herramienta que contribuye a su misión de "hacer que la IA sea útil para todos". [ 13 ] Google ofrece variantes oficiales de Gemma optimizadas para casos de uso específicos, como MedGemma para análisis médicos. [ 14 ]

Desde su lanzamiento, los modelos Gemma han tenido más de 150 millones de descargas, con 70.000 variantes disponibles en Hugging Face . [ 15 ]

Gemma 3 se ofrecía con tamaños de parámetros de 1, 4, 12 y 27 mil millones, con soporte para más de 140 idiomas. Como modelos multimodales, admiten entrada de texto e imagen. [ 16 ] Google también ofrece Gemma  3n , modelos más pequeños optimizados para su ejecución en dispositivos de consumo como teléfonos inteligentes, computadoras portátiles y tabletas. [ 17 ] 

La última generación de modelos es Gemma 4, lanzada el  2 de abril de 2026. Está disponible en cuatro tamaños: Efectivo  2B (E2B), Efectivo  4B (E4B), Mezcla de Expertos 26B (MoE) y Denso 31B. Gemma  4 admite entrada multimodal, incluyendo imágenes y video en todos los modelos, con entrada de audio nativa en los modelos E2B y E4B. [ 18 ] [ 19 ] La variante Denso 31B de Gemma  4 alcanzó el tercer lugar en la clasificación de texto de Arena , y la variante 26B alcanzó el sexto lugar. [ 19 ] Gemma  4 12B se lanzó el  3 de junio de 2026 y cuenta con una arquitectura multimodal unificada que procesa imágenes y audio sin codificadores. [ 20 ]

Arquitectura

Gemma 3 se basa en una arquitectura de transformador solo con decodificador, con atención de consulta agrupada (GQA) y el codificador de visión SigLIP. Todos los modelos tienen una longitud de contexto de 128K, con la excepción de Gemma  31B, que tiene una longitud de contexto de 32K. [ 21 ]

También están disponibles versiones cuantizadas ajustadas mediante entrenamiento con conciencia de cuantización (QAT), [ 21 ] que ofrecen mejoras considerables en el uso de memoria con cierto impacto negativo en la exactitud y la precisión. [ 22 ]

Variantes

Google desarrolla variantes oficiales de los modelos Gemma diseñadas para fines específicos, como análisis médicos o programación. Estas incluyen:

  • CodeGemma (2B y 7B): CodeGemma es un grupo de modelos diseñados para la autocompletación de código , así como para el uso general de la programación. [ 23 ] Admite varios lenguajes de programación, incluidos Python , Java , C++ y otros. [ 24 ]
  • DolphinGemma (aproximadamente 400M): Desarrollado en colaboración con investigadores del Instituto Tecnológico de Georgia y el Proyecto Delfín Salvaje, DolphinGemma busca comprender mejor la comunicación de los delfines mediante el análisis de audio . Sin embargo, no se ha publicado ningún modelo ni dato. [ 25 ] [ 26 ]
  • MedGemma (4B y 27B): También basada en Gemma  3, MedGemma está diseñada para aplicaciones médicas como el análisis de imágenes. Sin embargo, Google también señala que MedGemma "aún no tiene calidad clínica". [ 27 ] Los desarrolladores de Tap Health en Gurgaon, India, han utilizado MedGemma para mejorar las aplicaciones de gestión de la diabetes asistidas por IA. [ 28 ]
  • PaliGemma (3B, 10B y 28B, basados ​​en Gemma 2 con 2B, 9B y 27B, respectivamente): Para visión artificial y análisis de imágenes. [ 29 ]
  • ShieldGemma 2 (4B): Basada en la  familia Gemma 3, ShieldGemma está diseñada para identificar y filtrar imágenes violentas, peligrosas y sexualmente explícitas. [ 30 ]
  • TranslateGemma (4B, 12B y 27B): Para traducción automática . [ 31 ]

Nota: los modelos de peso abierto pueden tener su longitud de contexto reescalada en el momento de la inferencia. Con Gemma  1, Gemma  2, PaliGemma y PaliGemma  2, el costo es un aumento lineal del tamaño de la caché kv en relación con el tamaño de la ventana de contexto. Con Gemma  3, hay una curva de crecimiento mejorada debido a la separación de la atención local y global. Con RecurrentGemma, el uso de memoria no cambia después de 2048 tokens.

Véase también

Referencias

  1. Banks, Jeanine; Warkentin, Tris (21 de febrero de 2024). "Gemma: Presentación de nuevos modelos abiertos de última generación" . The Keyword . Consultado el 16 de agosto de 2025 .
  2. 1 2 "Gemma 4: Byte a byte, los modelos abiertos más capaces" . Google . 2 de abril de 2026. Recuperado el 2 de abril de 2026 .
  3. 1 2 "Términos de uso de Gemma" . Google AI para desarrolladores . 1 de abril de 2026. Consultado el 12 de abril de 2026 .
  4. "Descripción general de los modelos Gemma" . Google AI para desarrolladores . Consultado el 24 de junio de 2026 .
  5. Khan, Jeremy (21 de febrero de 2024). "Google presenta una nueva familia de modelos de IA de código abierto llamada Gemma para competir con Meta y otros, demostrando que la IA de código abierto no es tan mala después de todo" . Fast Company . Archivado del original el 21 de febrero de 2024. Consultado el 21 de febrero de 2024 .
  6. Alba, Davey (21 de febrero de 2024). "Google profundiza en el código abierto con el lanzamiento del modelo de IA Gemma" . Bloomberg News . Archivado del original el 21 de febrero de 2024. Consultado el 21 de febrero de 2024 .
  7. Metz, Cade; Grant, Nico (21 de febrero de 2024). "Google está regalando parte de la IA que impulsa los chatbots" . The New York Times . ISSN 0362-4331 . Archivado del original el 21 de febrero de 2024. Recuperado el 21 de febrero de 2024 . 
  8. Nieva, Richard (21 de febrero de 2024). "Los últimos modelos de lenguaje de IA de Google son de peso abierto, no de código abierto" . Forbes . Recuperado el 3 de abril de 2026 .
  9. "Gemma 2 ya está disponible para investigadores y desarrolladores" . Google . 27 de junio de 2024. Consultado el 15 de agosto de 2024 .
  10. "Presentamos Gemma 3: el modelo más potente que puedes ejecutar en una sola GPU o TPU" . The Keyword . 12 de marzo de 2025.
  11. "Bienvenida Gemma 3: el nuevo modelo de aprendizaje de lenguaje natural (LLM) multimodal, multilingüe y de contexto extenso de Google" . Hugging Face . 12 de marzo de 2025.
  12. Whitwam, Ryan (2 de abril de 2026). "Google anuncia los modelos de IA abiertos Gemma 4 y cambia a la licencia Apache 2.0" . Ars Technica . Consultado el 3 de abril de 2026 .
  13. Banks, Jeanine; Warkentin, Tris (21 de febrero de 2024). "Gemma: Presentación de nuevos modelos abiertos de última generación" . The Keyword . Consultado el 13 de julio de 2025 .
  14. "Gemma - Google DeepMind" . Google DeepMind . Consultado el 13 de julio de 2025 .
  15. Wiggers, Kyle (12 de mayo de 2025). "Los modelos de IA Gemma de Google superan los 150 millones de descargas" . TechCrunch . Consultado el 13 de julio de 2025 .
  16. Gosthipaty, Aritra; merve; Cuenca, Pedro; Srivastav, Vaibhav (12 de marzo de 2025). "Bienvenida Gemma 3: el nuevo LLM multimodal, multilingüe y de contexto largo abierto de Google" . Hugging Face . Recuperado el 13 de julio de 2025 .
  17. "Descripción general del modelo Gemma 3n" . Google AI para desarrolladores . Consultado el 13 de julio de 2025 .
  18. "Gemma 4: Byte a byte, los modelos abiertos más capaces" . Google . 2 de abril de 2026. Consultado el 2 de abril de 2026 .
  19. 1 2 Bonifacic, Igor (3 de abril de 2026). "Google lanza Gemma 4, una familia de modelos abiertos basados ​​en Gemini 3" . Engadget . Recuperado el 5 de abril de 2026 .
  20. "Presentamos Gemma 4 12B: un modelo multimodal unificado y sin codificador" . Google . 3 de junio de 2026. Consultado el 9 de junio de 2026 .
  21. 1 2 Equipo Gemma (2025). "Informe técnico de Gemma 3". arXiv : 2503.19786v1 [ cs.CL ].
  22. Clark, Bryan (15 de mayo de 2025). "¿Qué es el entrenamiento con conciencia de cuantización?" . IBM . Consultado el 14 de julio de 2025 .
  23. Irwin, Kate (10 de abril de 2024). "Google lanza IA de codificación que podrían rivalizar con GitHub Copilot de Microsoft" . PCMag . Consultado el 15 de julio de 2025 .
  24. "CodeGemma" . Google AI para desarrolladores . Consultado el 15 de julio de 2025 .
  25. "DolphinGemma: Cómo la IA de Google está ayudando a descifrar la comunicación de los delfines" . Georgia Tech . Consultado el 15 de julio de 2025 .
  26. Herzing, Denise; Starner, Thad (14 de abril de 2025). "DolphinGemma: Cómo la IA de Google está ayudando a descifrar la comunicación de los delfines" . The Keyword . Recuperado el 15 de julio de 2025 .
  27. "MedGemma" . Fundamentos para desarrolladores de IA de Google Health . Consultado el 15 de julio de 2025 .
  28. "MedGemma: Nuestros modelos abiertos más capaces para el desarrollo de IA en salud" . Blog de investigación de Google . 28 de octubre de 2025. Consultado el 4 de noviembre de 2025. Los desarrolladores de Tap Health en Gurgaon, India , destacaron la sólida base médica de MedGemma y su potencial para mejorar el manejo de la diabetes asistido por IA.
  29. "PaliGemma" . Google AI para desarrolladores . Consultado el 24 de junio de 2026 .
  30. Equipo ShieldGemma (2025). "ShieldGemma 2: Moderación de contenido de imágenes robusta y manejable". arXiv : 2504.01081 [ cs.CV ].
  31. Dora (19 de enero de 2026). "¿Qué es TranslateGemma? Modelo de Traducción Open AI Explicado - Blog WaveSpeed" . WaveSpeedAI (en español) . Consultado el 24 de junio de 2026 .
  32. Botev, Aleksandar; et al. (2024). "RecurrentGemma: Moving Past Transformers for Efficient Open Language Models". arXiv : 2404.07839v2 [ cs.LG ]. 
  33. Equipo Gemma; Riviere, Morgane; Pathak, Shreya; Sessa, Pier Giuseppe; Hardin, Cassidy; Bhupatiraju, Surya; Hussenot, Léonard; Mesnard, Thomas; Shahriari, Bobak (2 de agosto de 2024), Gemma 2: Mejora de los modelos de lenguaje abiertos a un tamaño práctico , arXiv : 2408.00118
  34. "PaLI: Ampliación del aprendizaje de lenguaje e imágenes en más de 100 idiomas" . research.google . Consultado el 15 de agosto de 2024 .
  35. ^ Beyer, Lucas; et al. (10 de julio de 2024). "PaliGemma: un VLM 3B versátil para transferencia". arXiv : 2407.07726v2 [ cs.CV ]. 
  36. "Presentamos PaliGemma 2 mix: Un modelo de lenguaje de visión para múltiples tareas - Blog de desarrolladores de Google" . developers.googleblog.com . Consultado el 22 de febrero de 2025 .
  37. Steiner, Andrés; André Susano Pinto; Tschannen, Michael; Keysers, Daniel; Wang, Xiao; Bitton, Yonatan; Gritsenko, Alexey; Minderer, Matías; Sherbondy, Antonio; Largo, Shangbang; Qin, Siyang; Inglés, Reeve; Bugliarello, Emanuele; Kazemzadeh, Sahar; Mesnard, Thomas; Alabdulmohsin, Ibrahim; Beyer, Lucas; Zhai, Xiaohua (2024). "PaliGemma 2: una familia de VLM versátiles para transferencia". arXiv : 2412.03555v1 [ cs.CV ].
  38. Equipo, Gemma; et al. (2025). "Informe técnico de Gemma 3". arXiv : 2503.19786v1 [ cs.CL ]. 
  39. "google/gemma-4-31B-it" . Hugging Face . 2 de abril de 2026. Consultado el 3 de abril de 2026 .
  • Sitio web oficialEdita esto en Wikidata