Articulo de referencia

MMLU

La medición de la comprensión masiva del lenguaje multitarea ( MMLU ) es un punto de referencia popular para evaluar las capacidades de los modelos de lenguaje grandes . Inspiró...

La medición de la comprensión masiva del lenguaje multitarea ( MMLU ) es un punto de referencia popular para evaluar las capacidades de los modelos de lenguaje grandes . Inspiró varias otras versiones y derivados, como MMLU-Pro [ 1 ] , MMMLU [ 2 ] y MMLU-Redux [ 3 ] .

Descripción general

MMLU consta de 15.908 preguntas de opción múltiple, de las cuales 1.540 se utilizan para seleccionar y evaluar la configuración óptima de los modelos: temperatura, tamaño del lote y tasa de aprendizaje . Las preguntas abarcan 57 materias, desde campos STEM altamente complejos y derecho internacional hasta nutrición y religión. Fue uno de los benchmarks más utilizados para comparar las capacidades de los grandes modelos de lenguaje , con más de 100  millones de descargas hasta julio de 2024. [ 4 ] [ 5 ]

El benchmark fue publicado por Dan Hendrycks y un equipo de investigadores el 7  de septiembre de 2020. Fue diseñado para ser más desafiante que los benchmarks existentes en ese momento, como General Language Understanding Evaluation (GLUE), ya que los modelos comenzaron a superar a los humanos en pruebas más fáciles. Cuando se publicó MMLU, la mayoría de los modelos de lenguaje existentes obtuvieron una puntuación cercana al nivel del azar (25%). El modelo con mejor rendimiento, GPT-3 175B, logró una precisión del 43,9%. Los creadores de MMLU estimaron que los expertos humanos en el dominio logran alrededor del 89,8% de precisión. [ 4 ] A mediados de 2024, la mayoría de los modelos de lenguaje potentes como Claude 3.5 Sonnet , GPT-4o y Llama 3.1 405B lograron consistentemente el 88%. [ 6 ] [ 7 ] [ 8 ] A partir de 2025, MMLU ha sido parcialmente eliminado en favor de alternativas más difíciles.

Limitaciones

El 5 de junio de 2024, expertos publicaron un documento que detallaba su análisis manual de 5700 preguntas del benchmark, el cual reveló que contenía una cantidad muy significativa de errores de verdad fundamental. Por ejemplo, el 57 % de las preguntas del subconjunto de " Virología " se marcaron como portadoras de errores, tales como múltiples respuestas correctas (4 %), preguntas poco claras (14 %) o respuestas completamente incorrectas (33 %). En general, estimaron que el 6,5 % de las preguntas en MMLU contenían un error, lo que sugiere que la puntuación máxima alcanzable era significativamente inferior al 100 %. [ 9 ] La contaminación de datos también representó una amenaza significativa para la validez de este benchmark; las empresas podrían incluir fácilmente preguntas y respuestas en los datos de entrenamiento de sus modelos, lo que en la práctica lo haría ineficaz. [ 10 ]

Ejemplos

Los siguientes ejemplos provienen de las tareas de " Álgebra abstracta ", " Derecho internacional " y " Medicina profesional ", respectivamente. [ 4 ] Las respuestas correctas están marcadas en negrita:

Pregunta 1:

Encuentra tododo{\displaystyle c}enZ3{\displaystyle \mathbb {Z} _ {3}}de tal manera queZ3[incógnita]/(incógnita2+do){\displaystyle \mathbb {Z} _{3}[x]/(x^{2}+c)}es un campo.

(A) 0 │ (B) 1 │ (C) 2 │ (D) 3

Pregunta 2:

¿Sería aceptable en la práctica contemporánea una reserva a la definición de tortura que figura en el Pacto Internacional de Derechos Civiles y Políticos (PIDCP)?

(A) Esta es una reserva aceptable si la legislación del país que la formula emplea una definición diferente. (B) Esta es una reserva inaceptable porque contraviene el objeto y la finalidad del Pacto Internacional de Derechos Civiles y Políticos (PIDCP). (C) Esta es una reserva inaceptable porque la definición de tortura en el PIDCP es coherente con el derecho internacional consuetudinario. (D) Esta es una reserva aceptable porque, según el derecho internacional general, los Estados tienen derecho a formular reservas a los tratados.

Pregunta 3:

Un hombre de 33 años se somete a una tiroidectomía radical por cáncer de tiroides. Durante la operación, una hemorragia moderada requiere la ligadura de varios vasos en el lado izquierdo del cuello. En el postoperatorio, los análisis de sangre muestran una concentración de calcio de 7,5 mg/dL, una concentración de albúmina de 4 g/dL y una concentración de hormona paratiroidea de 200 pg/mL. ¿El daño a cuál de los siguientes vasos causó los hallazgos en este paciente?

(A) Rama del tronco costocervical. (B) Rama de la arteria carótida externa . (C) Rama del tronco tirocervical. (D) Afluente de la vena yugular interna .

Referencias

  1. TIGER-AI-Lab/MMLU-Pro , TIGER Lab, 13 de mayo de 2026 , consultado el 14 de mayo de 2026
  2. Estadísticas, LLM (14 de mayo de 2026). "Clasificación de referencia MMMLU" . Estadísticas de LLM . Consultado el 14 de mayo de 2026 .
  3. ^ Gema, Aryo Pradipta (7 de febrero de 2026), aryopg/mmlu-redux , consultado el 14 de mayo de 2026
  4. 1 2 3 Hendrycks, Dan; Burns, Collin; Basart, Steven; Zou, Andy; Mazeika, Mantas; Song, Dawn; Steinhardt, Jacob (2021). "Medición de la comprensión masiva del lenguaje multitarea". ICLR . arXiv : 2009.03300 .
  5. "cais/mmlu" . Hugging Face . 2024-07-08 . Recuperado el 2024-07-24 .
  6. "Presentación del soneto 3.5 de Claude" . Antropológico . Consultado el 6 de abril de 2025 .
  7. "Hola GPT-4o" . OpenAI . 13 de mayo de 2024. Consultado el 6 de abril de 2025 .
  8. "Presentamos Llama 3.1: Nuestros modelos más capaces hasta la fecha" . Blog de Meta . 23 de julio de 2024. Consultado el 6 de abril de 2025 .
  9. ^ Gema, Aryo Pradipta; Leang, Josué Ong Jun; Hong, Giwon; Devoto, Alessio; Mancino, Alberto Carlos María; Saxena, Rohit; Él, Xuanli; Zhao, Yu; Du, Xiaotang; Madani, Mohammad Reza Ghasemi; Barale, Claire; McHardy, Robert; Harris, Josué; Kaddour, Jean; Krieken, Emile van; Minervini, Pasquale (7 de junio de 2024). "¿Hemos terminado con MMLU?". arXiv : 2406.04127 [ cs.CL ].
  10. Roose, Kevin (15 de abril de 2024). "La IA tiene un problema de medición" . The New York Times . ISSN 0362-4331 . Consultado el 21 de abril de 2024 .