
Una prueba de rendimiento de modelos de lenguaje es una prueba estandarizada diseñada para evaluar el desempeño de los modelos de lenguaje en diversas tareas de procesamiento del lenguaje natural . Estas pruebas tienen como objetivo comparar las capacidades de diferentes modelos en áreas como la comprensión , la generación y el razonamiento del lenguaje .
Los benchmarks generalmente consisten en un conjunto de datos y métricas de evaluación correspondientes . El conjunto de datos proporciona muestras de texto y anotaciones, mientras que las métricas miden el rendimiento de un modelo en tareas como responder preguntas, clasificar textos y realizar traducciones automáticas. Estos benchmarks son desarrollados y mantenidos por instituciones académicas, organizaciones de investigación y empresas del sector para realizar un seguimiento del progreso en el campo. Además de la precisión, las métricas pueden incluir el rendimiento, la eficiencia energética, el sesgo, la confianza y la sostenibilidad. [ 1 ]
Descripción general
Tipos
Los puntos de referencia pueden describirse con los siguientes adjetivos, que no son mutuamente excluyentes:
- Clásico : Estas tareas se estudian en el procesamiento del lenguaje natural, incluso antes del auge del aprendizaje profundo. Algunos ejemplos son el Penn Treebank para probar el análisis sintáctico y semántico, así como la traducción bilingüe evaluada mediante puntuaciones BLEU .
- Respuesta a preguntas : Estas tareas constan de una pregunta y una respuesta de texto, a menudo de opción múltiple. Pueden ser a libro abierto o a libro cerrado . Las preguntas a libro abierto se asemejan a las preguntas de comprensión lectora , con pasajes relevantes incluidos como anotaciones en la pregunta, donde aparece la respuesta. Las preguntas a libro cerrado no incluyen pasajes relevantes. También se denominan preguntas y respuestas de dominio abierto . [ 2 ] [ 3 ] Antes de la era de los grandes modelos de lenguaje, las preguntas a libro abierto eran más comunes y se entendían como una forma de probar métodos de recuperación de información . Las preguntas a libro cerrado se popularizaron a partir de GPT-2 como método para medir el conocimiento almacenado en los parámetros del modelo. [ 4 ]
- Ómnibus : Un benchmark ómnibus combina varios benchmarks, a menudo publicados con anterioridad. Su objetivo es ofrecer una solución de benchmarking integral.
- Razonamiento : Estas tareas suelen tener formato de preguntas y respuestas, pero están diseñadas para ser más difíciles que las preguntas y respuestas estándar.
- Multimodal : Estas tareas requieren procesar no solo texto, sino también otras modalidades, como imágenes y sonido. Algunos ejemplos son el reconocimiento óptico de caracteres (OCR) y la transcripción .
- Agencia : Estas tareas son para un agente de software basado en un modelo de lenguaje que opera una computadora para un usuario, como editar imágenes, navegar por la web, etc.
- Adversario : Un benchmark es "adversario" si los elementos que lo componen se seleccionan específicamente para que ciertos modelos tengan un rendimiento deficiente en ellos. Los benchmarks adversarios suelen crearse después de que los modelos de última generación (SOTA) hayan alcanzado la máxima capacidad (un rendimiento del 100%) del benchmark, con el fin de renovarlo. Un benchmark es "adversario" solo en un momento determinado, ya que lo que es adversario puede dejar de serlo a medida que aparecen nuevos modelos SOTA.
- Público/Privado : Un benchmark puede ser parcial o totalmente privado, lo que significa que algunas o todas las preguntas no están disponibles públicamente. La idea es que si una pregunta está disponible públicamente, podría usarse para el entrenamiento, lo que se denominaría "entrenamiento con el conjunto de prueba" e invalidaría el resultado del benchmark. Por lo general, solo los responsables del benchmark tienen acceso a los subconjuntos privados, y para evaluar un modelo en dicho benchmark, se deben enviar los pesos del modelo o proporcionar acceso a la API a los responsables.
La distinción entre un conjunto de datos de referencia y un conjunto de datos de validación no es nítida. Generalmente, un conjunto de datos se divide en tres partes: entrenamiento, prueba y validación . Tanto la parte de prueba como la de validación son, en esencia, conjuntos de datos de referencia. En general, un conjunto de datos de referencia se diferencia de un conjunto de datos de prueba/validación en que el primero suele utilizarse para medir el rendimiento de muchos modelos diferentes que no se entrenan específicamente para obtener buenos resultados en dicho conjunto, mientras que el segundo se utiliza para medir el rendimiento de modelos entrenados específicamente en el conjunto de entrenamiento correspondiente. En otras palabras, un conjunto de datos de referencia puede considerarse como un conjunto de prueba/validación sin un conjunto de entrenamiento correspondiente.
Por el contrario, ciertos puntos de referencia pueden usarse como un conjunto de entrenamiento, como el English Gigaword [ 5 ] o el One Billion Word Benchmark, que en lenguaje moderno es simplemente la pérdida de log-verosimilitud negativa en un conjunto de preentrenamiento con 1 billón de palabras. [ 6 ] De hecho, la distinción entre punto de referencia y conjunto de datos en los modelos de lenguaje se hizo más clara después del auge del paradigma de preentrenamiento , en el que un modelo se entrena primero en conjuntos de datos masivos y sin etiquetar para aprender patrones generales del lenguaje, sintaxis y conocimiento (preentrenamiento), y luego el modelo base se adapta a tareas específicas posteriores utilizando conjuntos de datos más pequeños y etiquetados (ajuste fino).
Ciclo vital
Generalmente, el ciclo de vida de un benchmark consta de los siguientes pasos: [ 7 ]
- Inicio: Se publica un referente. Puede presentarse simplemente como una demostración del poder de un nuevo modelo (implícitamente) que otros adoptaron como referente, o como un referente que se anima a otros a utilizar (explícitamente).
- Crecimiento: Cada vez más artículos y modelos utilizan el índice de referencia, y el rendimiento en dicho índice aumenta.
- Madurez, degeneración o desuso: Un referente puede saturarse, tras lo cual los investigadores pasan a otros referentes. El progreso en dicho referente también puede descuidarse a medida que el campo se centra en otros.
- Renovación: Un índice de referencia saturado puede actualizarse para que deje de estar saturado, lo que permite un mayor progreso.
Construcción
Al igual que los conjuntos de datos, los puntos de referencia suelen construirse mediante varios métodos, individualmente o en combinación:
- Extracción de datos web: Se pueden extraer de internet pares de preguntas y respuestas ya preparados, por ejemplo, de sitios web que enseñan matemáticas y programación.
- Conversión: Los elementos se pueden construir mediante programación a partir de contenido web extraído, por ejemplo, eliminando entidades nombradas de las oraciones y pidiendo al modelo que complete los espacios en blanco. Esto se utilizó para crear la tarea de comprensión lectora de CNN/Daily Mail.
- Colaboración colectiva: Los ítems pueden crearse pagando a personas para que los escriban, por ejemplo, en Amazon Mechanical Turk . Este método se utilizó para crear el MCTest.
Evaluación
Por lo general, las pruebas de rendimiento están totalmente automatizadas. Esto limita las preguntas que se pueden formular. Por ejemplo, en el caso de las matemáticas, sería difícil comprobar automáticamente si se está demostrando una afirmación, mientras que calcular una respuesta con un único valor entero sí se podría comprobar automáticamente. En las tareas de programación, la respuesta suele comprobarse mediante pruebas unitarias, con un límite máximo de tiempo de ejecución.
Las puntuaciones de referencia son de los siguientes tipos:
- Para preguntas de opción múltiple o de completar espacios en blanco , las puntuaciones comunes son la exactitud (frecuencia de respuestas correctas), la precisión, la exhaustividad , la puntuación F1 , etc.
- pass@n: Se proporciona el modeloEl modelo realiza varios intentos para resolver cada problema. Si alguno de ellos es correcto, el modelo obtiene un punto. La puntuación pass@n es la puntuación promedio del modelo en todos los problemas.
- k@n: El modelo haceintentos de resolver cada problema, pero soloEntre todos los intentos, se seleccionan los que se envían. Si alguno es correcto, el modelo obtiene un punto. La puntuación k@n es la puntuación promedio del modelo en todos los problemas.
- cons@n: El modelo se daIntenta resolver cada problema. Si la respuesta más común es correcta, el modelo obtiene un punto. La puntuación cons@n es la puntuación promedio del modelo en todos los problemas. Aquí, "cons" significa "consenso" o "votación mayoritaria". [ 8 ]
La puntuación pass@n se puede estimar con mayor precisión haciendointentos y utilizar el estimador insesgado, dóndees el número de intentos correctos. [ 9 ]
Para tareas menos estructuradas, donde la salida puede ser cualquier oración, existen las siguientes puntuaciones de uso común, que incluyen BLEU ROUGE , METEOR , NIST , tasa de error de palabras , LEPOR , CIDEr, [ 10 ] y SPICE. [ 11 ]
Asuntos
- error: Es posible que algunas respuestas de referencia sean incorrectas. [ 12 ]
- Ambigüedad: Algunas preguntas de referencia pueden estar redactadas de forma ambigua.
- Subjetivo: Algunas preguntas de referencia pueden carecer de una respuesta objetiva. Este problema suele impedir la evaluación comparativa de la escritura creativa. Del mismo modo, impide la evaluación comparativa de la redacción de demostraciones en lenguaje natural, aunque sí es posible hacerlo en un lenguaje formal .
- Abierto: Algunas preguntas de evaluación comparativa pueden no tener una única respuesta de tamaño fijo. Este problema generalmente impide que las evaluaciones comparativas de programación utilicen tareas más naturales como "escribe un programa para X", y en su lugar utiliza tareas como "escribe una función que implemente la especificación X".
- Acuerdo entre anotadores: Algunas preguntas de referencia pueden no ser completamente objetivas, de modo que incluso las personas no estarían de acuerdo al 100% sobre cuál debería ser la respuesta. Esto es común en tareas de procesamiento del lenguaje natural, como la anotación sintáctica. [ 13 ] [ 14 ] [ 15 ] [ 16 ]
- Atajo: Algunas preguntas de referencia pueden resolverse fácilmente mediante un atajo "no intencionado". Por ejemplo, en la prueba de referencia SNLI, tener una palabra negativa como "no" en la segunda oración es una señal clara de la categoría "Contradicción", independientemente del contenido real de las oraciones. [ 17 ]
- Contaminación/fuga : Algunas preguntas de referencia pueden tener respuestas ya presentes en el conjunto de entrenamiento. También se denomina "entrenamiento en el conjunto de prueba". [ 18 ] [ 19 ] Algunas pruebas de referencia (como Big-Bench) pueden utilizar una "cadena canary", de modo que los documentos que contienen la cadena canary pueden eliminarse voluntariamente del conjunto de entrenamiento.
- Saturación: Con el paso del tiempo, muchos modelos alcanzan el máximo rendimiento posible, por lo que el sistema de evaluación comparativa deja de ser capaz de diferenciarlos. Por ejemplo, GLUE se había saturado, lo que hizo necesaria la creación de SuperGLUE.
- Ley de Goodhart : Si se diseñan o seleccionan nuevos modelos para obtener una puntuación alta en una prueba comparativa, esta puede dejar de ser un buen indicador de la calidad del modelo. [ 7 ]
- Selección sesgada de resultados : Las publicaciones de nuevos modelos pueden señalar únicamente las puntuaciones de referencia en las que el nuevo modelo tuvo un buen desempeño, evitando aquellas en las que obtuvo malos resultados.
Lista de puntos de referencia
Modelado general del lenguaje
En esencia, cualquier conjunto de datos puede utilizarse como referencia para el modelado estadístico del lenguaje , empleando la perplejidad (o, de forma casi equivalente, la log-verosimilitud negativa y los bits por carácter, como en la prueba original de Shannon sobre la entropía del idioma inglés) [ 20 ] como puntuación de referencia. Por ejemplo, el anuncio original de GPT-2 incluía los resultados del modelo en WikiText-2, enwik8, text8 y WikiText-103 (todos ellos conjuntos de datos estándar de lenguaje creados a partir de la Wikipedia en inglés ). [ 4 ] [ 21 ]
Sin embargo, ha habido conjuntos de datos más utilizados, o diseñados específicamente, para ser utilizados como referencia.
- Prueba de referencia de mil millones de palabras: La pérdida de verosimilitud logarítmica negativa en un conjunto de datos de mil millones de palabras. [ 6 ]
- Paloma (Análisis de Perplejidad para la Evaluación de Modelos de Lenguaje): Una colección de textos en inglés y en código, divididos en 546 dominios. Se utiliza para medir la perplejidad de un modelo en dominios específicos. [ 22 ]
- Penn Treebank : El error o la pérdida de verosimilitud logarítmica negativa para las etiquetas de partes de la oración en un conjunto de datos de texto.
Comprensión general del idioma
Consulte [ 23 ] para una revisión de más de 100 de estos puntos de referencia.
- Tarea de comprensión lectora de CNN/Daily Mail: Se extrajeron artículos de CNN (380 000 para entrenamiento, 3900 para desarrollo y 3200 para prueba) y Daily Mail (879 000 para entrenamiento, 64 800 para desarrollo y 53 200 para prueba). Se utilizaron los resúmenes con viñetas que acompañaban a los artículos de noticias. Una entidad en una viñeta se reemplazó con un marcador de posición, creando una pregunta de tipo cloze. El objetivo es identificar la entidad enmascarada del artículo. [ 24 ]
- CoLA (Corpus de Aceptabilidad Lingüística) : 10.657 oraciones en inglés de literatura lingüística publicada que fueron etiquetadas manualmente como gramaticales o agramaticales. [ 25 ] [ 26 ]
- HellaSwag (Finales más difíciles, contextos más largos y actividades con pocas probabilidades de éxito para SWAG): Una versión más difícil de SWAG. Contiene 10 000 elementos. [ 27 ] [ 28 ]
- LAMBADA: 10.000 pasajes narrativos de libros, cada uno con una última palabra faltante que los humanos pueden adivinar si se les da el pasaje completo, pero no solo a partir de la última oración. [ 29 ]
- MultiNLI (Inferencia del lenguaje natural multigénero): Similar a SNLI, con 433.000 pares de oraciones en inglés de diez géneros distintos de inglés escrito y hablado. [ 30 ]
- RACE (ReAding Comprehension Examinations): 100.000 problemas de comprensión lectora en 28.000 pasajes, recopilados de los exámenes de inglés para estudiantes chinos de secundaria y bachillerato en el rango de edad de 12 a 18 años. [ 31 ]
- SNLI (Stanford Natural Language Inference : 570.000 pares de oraciones en inglés escritas por humanos etiquetadas manualmente para una clasificación equilibrada con 3 etiquetas: " implicación ", "contradicción" y "neutral". [ 32 ] [ 33 ]
- SWAG (Situaciones con Generaciones Adversarias): 113 000 descripciones de actividades o eventos, cada una con 4 finales candidatos; el modelo debe elegir el final más plausible. Adversarial contra algunos modelos de lenguaje simples ( MLP , bolsa de palabras , CNN de una capa , etc.). [ 34 ]
- WSC ( Winograd schema challenge ): 273 oraciones con pronombres ambiguos. La tarea consiste en determinar a qué se refiere el pronombre. [ 35 ]
- WinoGrande: Una versión ampliada de WSC con 44 000 elementos. Diseñada para competir con SOTA 2019, dado que la versión original estaba saturada. Este conjunto de datos consta de oraciones con espacios en blanco, a diferencia del formato de pronombres de conjuntos de datos anteriores. [ 36 ] [ 37 ]
- WMT 2014 (Taller sobre traducción automática estadística): una colección de 4 conjuntos de datos de referencia para traducción automática en el Noveno Taller sobre traducción automática estadística. El artículo «Attention Is All You Need» lo utilizó como conjunto de datos de referencia. [ 38 ]
Generación de lenguaje general
- CharXiv: 9292 preguntas descriptivas (que examinan elementos básicos de gráficos) y 2323 preguntas de razonamiento (que sintetizan información a través de elementos visuales complejos) sobre 2323 gráficos de artículos científicos. [ 39 ]
- IFEval (Evaluación de seguimiento de instrucciones): 541 instrucciones a seguir, cada una con al menos una restricción verificable, como "mencionar la palabra clave de IA al menos 3 veces". [ 40 ]
- LMArena (anteriormente Chatbot Arena): Los usuarios humanos votan entre dos resultados de dos modelos de lenguaje. Se calcula una puntuación Elo para cada modelo de lenguaje en función de estos votos humanos. [ 41 ]
- MT-Bench (prueba comparativa de múltiples turnos): Una versión automatizada de Chatbot Arena donde los LLM reemplazan a los humanos en la generación de votos. [ 41 ]
- MultiChallenge: 273 instancias. Cada instancia es un historial de conversación de múltiples turnos (hasta 10 turnos) entre dos partes, que finaliza con un turno final del usuario que contiene un requisito/pregunta. Diseñado para evaluar simultáneamente el seguimiento de instrucciones, la asignación de contexto y el razonamiento contextual. Calificado por LLM como juez con rúbricas a nivel de instancia. [ 42 ]
- NaturalInstructions: 61 tareas distintas con instrucciones escritas por humanos y 193 000 instancias de tareas (pares de entrada-salida). Las instrucciones se obtienen a partir de instrucciones de crowdsourcing utilizadas para crear conjuntos de datos de PLN existentes y se asignan a un esquema unificado. [ 43 ]
- Instrucciones sobrenaturales: 1616 tareas de PLN diversas y sus instrucciones escritas por expertos, y 5 millones de instancias de tareas. [ 44 ]
Sistema de preguntas y respuestas con libro abierto
- ARC (AI2 Reasoning Challenge): Preguntas de opción múltiple, con un conjunto de desafío (2590 preguntas) y un conjunto fácil (5197 preguntas). Diseñado específicamente para ser adversario contra modelos que habían saturado SNLI y SQuAD. [ 45 ]
- ChartQA: 32 719 preguntas sobre 20 882 gráficos recopiladas de cuatro fuentes en línea diversas ( Statista , Pew Research Center , Our World In Data , OCDE ). De estas, 9608 fueron escritas por humanos (en ChartQA-H) y 23 111 fueron generadas por máquinas (en ChartQA-M). Las respuestas son textos textuales del gráfico o números enteros calculados a partir de los datos del gráfico. [ 46 ]
- CoQA (Preguntas y respuestas conversacionales): 127.000 preguntas con respuestas, obtenidas a partir de 8.000 conversaciones sobre fragmentos de texto de siete dominios diversos. [ 47 ]
- DocVQA: multimodal, 50 000 preguntas sobre 12 767 imágenes de documentos, seccionadas de 6071 documentos distintos. Los documentos proceden de 5 industrias (tabaco, alimentación, farmacéutica, combustibles fósiles y química) de la Biblioteca de Documentos Industriales de la UCSF , principalmente del período 1940-2010. Se priorizaron los documentos con elementos estructurados como tablas, formularios, listas y figuras. Las respuestas son extractos textuales del documento. [ 48 ] [ 49 ] [ 50 ]
- DROP (Razonamiento discreto sobre el contenido de párrafos): 96.567 preguntas junto con pasajes de Wikipedia, especialmente de narrativas ricas en información numérica (como resúmenes deportivos e historia), que a menudo implican razonamiento numérico de varios pasos sobre varios fragmentos de texto. Adversarial contra SOTA 2019. [ 51 ]
- GRS-QA: Conjunto de datos de razonamiento gráfico y respuesta a preguntas estructuradas. Un conjunto de datos diseñado para evaluar modelos de respuesta a preguntas en tareas de razonamiento basadas en gráficos. [ 52 ]
- HotpotQA: 113 000 preguntas de múltiples saltos que requieren la lectura de varios pasajes basados en Wikipedia para ser respondidas. Se generaron mostrando a los trabajadores de crowdsourcing varios documentos de contexto de apoyo y pidiéndoles que formularan preguntas que requirieran razonamiento sobre todos los documentos. [ 53 ]
- MCTest (Prueba de Comprensión Automática): 500 historias de ficción, cada una con 4 preguntas de opción múltiple (de las cuales al menos 2 requieren la comprensión de varias oraciones), diseñadas para ser comprensibles para un niño de 7 años. El vocabulario se limitó a aproximadamente 8000 palabras que probablemente conoce un niño de 7 años. Las historias fueron escritas por trabajadores de Amazon Mechanical Turk . [ 54 ]
- Preguntas naturales: 323045 elementos. Cada uno contiene una pregunta que se buscó en Google, una página de Wikipedia relevante para responderla, una respuesta larga (normalmente un párrafo) y una respuesta corta (una o más entidades) si están presentes en la página, o "nulo" si no hay respuesta larga/corta. [ 55 ]
- OpenBookQA: 5960 preguntas de opción múltiple, cada una acompañada de un dato científico de nivel elemental (el "libro abierto"). En total hay 1329 de estos datos. [ 56 ]
- SearchQA: 140.461 pares de preguntas y respuestas del archivo J!, con cada par aumentado con (en promedio 50) fragmentos y URL obtenidos al buscar la pregunta en Google. [ 57 ]
- SQuAD (Stanford Question Answering Dataset): más de 100 000 preguntas formuladas por colaboradores en más de 500 artículos de Wikipedia. La tarea consiste en, dado un fragmento de Wikipedia y una pregunta, encontrar un segmento de texto que responda a la pregunta. [ 58 ]
- SQuAD 2.0: 50 000 preguntas sin respuesta que se parecen a las preguntas de SQuAD. Cada una de estas preguntas sin respuesta debe responderse con una cadena vacía. Escritas por trabajadores de crowdsourcing. [ 59 ]
- StrategyQA: 2780 preguntas anotadas con pasajes relevantes de Wikipedia, de modo que la pregunta requiere un razonamiento de múltiples pasos sobre los pasajes para ser respondida. Por ejemplo, "¿Usaba Aristóteles una computadora portátil?" está anotada con pasajes de las páginas de Wikipedia para "computadora portátil" y "Aristóteles". [ 60 ]
- WebQuestions: 6642 pares de preguntas y respuestas diseñadas para ser respondidas con el conocimiento presente en la versión 2013 de Freebase . [ 61 ]
Preguntas y respuestas a libro cerrado
- C-Eval (Evaluación en chino): 13948 preguntas de opción múltiple sobre 52 materias en 4 niveles de dificultad. En chino. [ 62 ]
- MedQA: 61097 preguntas de exámenes de certificación médica profesional, en inglés, chino simplificado y chino tradicional. [ 63 ]
- OpenEQA (Open Embodied QA): más de 1600 preguntas que acompañan a vídeos, escaneos de entornos del mundo real y simulaciones. [ 64 ]
- PIQA (Physical Interaction QA): 17951 preguntas de dos opciones. Cada pregunta plantea un objetivo (como separar la yema de la clara con una botella de agua) y ofrece dos opciones para lograrlo. [ 65 ]
- RealWorldQA: 765 preguntas multimodales de opción múltiple. Cada una contiene una imagen y una pregunta. Diseñadas para evaluar la comprensión espacial. Las imágenes provienen de diversos escenarios del mundo real, incluyendo imágenes capturadas desde vehículos. [ 66 ]
- ScienceQA: 21208 preguntas de opción múltiple sobre ciencias naturales, ciencias sociales y lingüística, con niveles de dificultad desde el grado 1 hasta el grado 12, extraídas de los currículos de ciencias de primaria y secundaria. Algunas preguntas requieren la lectura de un diagrama. La mayoría de las preguntas incluyen anotaciones con explicaciones y textos de las clases. [ 67 ]
- SimpleQA: 4326 preguntas cortas que pueden responderse con conocimientos actualizados a 2023. Cada respuesta se califica como "correcta", "incorrecta" o "no intentada". Específicamente contra GPT-4. [ 68 ] [ 69 ]
- TruthfulQA: 817 preguntas sobre salud, derecho, finanzas y política con ideas erróneas comunes. Adversarial contra GPT-3 y T5 . [ 70 ]
General
Algunos índices de referencia son "ómnibus", lo que significa que se crean combinando varios índices de referencia anteriores.
- Big-Bench (Beyond the Imitation Game): Una colección de referencia de 204 tareas. [ 71 ] Un subconjunto particular de 23 tareas se llama BBH (Big-Bench Hard). [ 72 ] Una variante adversaria de BBH se llama BBEH (Big-Bench Extra Hard), creada reemplazando cada una de las 23 tareas de BBH con una variante similar pero adversaria. [ 73 ]
- GLUE (General Language Understanding Evaluation): colección de 9 pruebas de referencia diseñadas para evaluar la comprensión general del lenguaje. Las tareas se presentan en formato de oración o par de oraciones. Hay más de 1 millón de ítems. [ 74 ] [ 75 ]
- SuperGLUE: Una actualización de GLUE. Diseñado para seguir siendo un desafío para los modelos SOTA de la época (2019), ya que el original se había saturado. Incluye 8 tareas adicionales (por ejemplo, razonamiento lógico, inferencia de sentido común, resolución de correferencia). [ 76 ]
- HELM (Evaluación Holística de Modelos de Lenguaje): Un marco de referencia actualizado continuamente que incluye varios puntos de referencia, mantenido por el Centro Stanford para la Investigación sobre Modelos Fundamentales. [ 77 ]
- MMLU (Measuring Massive Multitask Language Understanding): 16 000 preguntas de opción múltiple que abarcan 57 materias académicas, incluyendo matemáticas, filosofía, derecho y medicina. [ 78 ] Actualizado a MMLU-Pro, que aumenta el número de opciones de 4 a 10, elimina las preguntas triviales y ruidosas de MMLU y añade problemas más difíciles. [ 79 ]
- CMMLU (MMLU chino): 1528 preguntas de opción múltiple en 67 materias, 16 de las cuales son específicas de China, como chino clásico . Algunos datos se recopilaron de materiales no disponibles públicamente, preguntas de exámenes simulados y preguntas de concursos televisivos para evitar la contaminación. Más del 80 % de los datos se extrajeron de archivos PDF después del OCR. [ 80 ]
- MMMLU (MMLU Multilingüe): El conjunto de prueba de MMLU, traducido a 14 idiomas por traductores humanos profesionales. [ 81 ]
Multimodal
Algunos tests de referencia evalúan específicamente la capacidad multimodal , generalmente entre texto, imagen, vídeo y audio.
- MMMU (Comprensión Multimodal Multidisciplinaria Masiva): Una versión de MMLU basada en el lenguaje visual. 11550 preguntas recopiladas de exámenes universitarios, cuestionarios y libros de texto, que abarcan 30 materias. Las preguntas requieren comprensión de imágenes para su resolución. Incluye preguntas de opción múltiple y preguntas abiertas (que se califican mediante extracción de expresiones regulares ). La base de referencia de expertos humanos es del 89 %. [ 82 ] [ 83 ]
- MMMU-Pro: 1730 preguntas multimodales de opción múltiple en el mismo formato que MMMU, diseñadas para ser adversarias a modelos basados únicamente en texto. Algunos problemas de MMMU resultaron ser respondibles sin mirar las imágenes, lo que hizo necesaria la creación de MMMU-Pro. Cada pregunta tiene 10 opciones y se presenta tanto en formato de texto e imagen como en formato de captura de pantalla/foto. [ 84 ]
- MMT-Bench: banco de pruebas diseñado para evaluar el rendimiento de los LVLM en tareas multimodales masivas que implican conocimiento experto, reconocimiento visual, localización, razonamiento y planificación. El banco de pruebas incluye 31 325 preguntas de opción múltiple de escenarios multimodales visuales (como conducción y navegación) que abarcan 32 metatareas principales y 162 subtareas. [ 85 ]
- OmniDocBench: 981 páginas PDF anotadas (ampliadas a 1355 en la versión 1.5) muestreadas de más de 200 000 documentos, que abarcan 9 tipos de documentos (artículos académicos, libros de texto, diapositivas, periódicos, notas manuscritas, etc.) en inglés, chino simplificado y una combinación de ambos. Evalúa el análisis de documentos mediante análisis de extremo a extremo, detección de diseño, reconocimiento de tablas, reconocimiento de fórmulas y OCR de texto. [ 86 ]
- Vibe-Eval: 269 indicaciones de comprensión visual, con respuestas estándar escritas por expertos. De estas, 100 eran "difíciles", lo que significa que no podían ser resueltas por un LLM (Reka Core) en el momento de la publicación. Puntuación automática por LLM. [ 87 ]
- VideoMMMU: Similar a MMMU, pero con vídeos. Contiene 300 vídeos de clases de nivel universitario en 30 asignaturas de 6 disciplinas (Arte, Negocios, Ciencias, Medicina, Humanidades e Ingeniería), con 900 preguntas. [ 88 ] [ 89 ]
Agencia
Ciertos puntos de referencia están especializados para evaluar agentes de IA basados en LLM . [ 90 ]
- Agentes APEX: un punto de referencia que muestra cómo los modelos de IA líderes se desempeñan al realizar tareas reales de trabajo de oficina, como consultoría, banca de inversión y derecho. [ 91 ]
- BFCL (Berkeley Function-Calling Leaderboard): La tarea consiste en escribir llamadas a la API según una especificación. Se publicó en 3 versiones, con 1760, 2251 y 1000 elementos respectivamente. Algunas llamadas se evalúan analizando el código en un AST y comparándolo con la respuesta de referencia, mientras que otras se evalúan llamando a la función y comparando la respuesta con la respuesta de referencia. Incluye Python , Java , JavaScript , SQL y API REST . [ 92 ]
- BrowseComp: 1266 preguntas que requieren la navegación por internet para encontrar una respuesta breve y objetiva. Adversarial contra GPT-4o con y sin navegación, OpenAI o1 y una versión temprana del modelo Deep Research. [ 93 ]
- GAIA: 450 preguntas con respuestas inequívocas que requieren información que se puede obtener navegando por Internet, y que exigen diferentes niveles de herramientas y autonomía para su resolución. Dividido en 3 niveles de dificultad. [ 94 ]
- GDPval: 1320 tareas que evalúan agentes de IA en entregables de trabajo del conocimiento del mundo real en 44 ocupaciones de las 9 industrias que más contribuyen al PIB de EE. UU. Tareas realizadas por profesionales con un promedio de 14 años de experiencia. La evaluación completa se realiza mediante una comparación por pares de expertos ciegos contra entregables de expertos humanos, cada comparación con un costo promedio de 1 hora humana. Un subconjunto de oro de 220 tareas está disponible públicamente. El conjunto público puede ser calificado por una versión ajustada de GPT-5. El conjunto reservado de 1100 tareas solo está disponible internamente en OpenAI, y no se pueden enviar modelos externos para su calificación en este conjunto. [ 95 ]
- Mind2Web: 2350 tareas recopiladas de 137 sitios web y secuencias de acciones obtenidas mediante crowdsourcing. La tarea consiste en reproducir la secuencia de acciones. [ 96 ]
- OSWorld: 369 tareas multimodales que utilizan la computadora, involucrando múltiples aplicaciones web y de escritorio reales y E/S de archivos del sistema operativo. Tanto en Windows como en Ubuntu . Cada tarea incluye una configuración de estado inicial y se prueba mediante un script de evaluación basado en la ejecución. [ 97 ]
- TAU-bench (Tool-Agent-User benchmark, también escrito como τ -bench): Dos entornos (comercio minorista, reserva de vuelos) que prueban a un agente para que cumpla las instrucciones del usuario, de forma interactiva a lo largo de múltiples turnos de diálogo. El usuario se simula mediante un modelo de lenguaje. [ 98 ] Actualizado a TAU2-bench (τ²-bench), que se centra en aplicaciones de telecomunicaciones . Las tareas se sintetizan mediante el documento de requisitos del producto generado por LLM , el esquema de la base de datos del agente, las herramientas del agente y los entornos del usuario ("teléfono simulado"). [ 99 ]
- terminal-bench: Una colección de tareas complejas en la terminal de Linux . [ 100 ]
- WebArena: 241 sitios web de prueba basados en sitios web reales ( Reddit , GitLab , portal de administración de Magento , etc.) y 812 tareas para realizar en los sitios web. Las tareas incluyen búsqueda de información, navegación del sitio y operación de contenido y configuración. [ 101 ]
- WebVoyager: 643 tareas multimodales basadas en 15 sitios web populares. La evaluación se realiza capturando pantallas de la secuencia de acciones y solicitando a un modelo de lenguaje visual que emita un juicio. [ 102 ]
- Windows Agent Arena: 154 tareas multimodales con el mismo formato que OSWorld. Solo en Windows. [ 103 ]
Longitud del contexto
Algunos puntos de referencia se diseñaron específicamente para evaluar el procesamiento de texto continuo de gran longitud.
- Fundamentación de FACTS: 1719 elementos divididos en un conjunto público (860) y un conjunto privado reservado (859). Cada uno contiene un documento, una instrucción del sistema que requiere que el LLM haga referencia exclusivamente al documento proporcionado y una solicitud del usuario que requiere la comprensión del documento. Las respuestas son puntuadas por LLM de vanguardia. [ 104 ] [ 105 ]
- InfiniteBench: 3946 elementos en 12 tareas de 5 dominios (recuperación, código, matemáticas, novelas y diálogo) con longitudes de contexto que superan los 100 000 tokens. [ 106 ]
- L-Eval: más de 2000 pares de consulta-respuesta etiquetados por humanos en 508 documentos largos en 20 tareas, incluyendo diversos tipos de tareas, dominios y longitud de entrada (3K-200K tokens). [ 107 ]
- LOFT (Long-Context Frontiers): 6 categorías de tareas de contexto largo (recuperación de texto, recuperación visual, recuperación de audio, generación aumentada por recuperación , consulta de conjuntos de datos tipo SQL , aprendizaje contextual de múltiples disparos ) en 35 conjuntos de datos y 4 modalidades. Hasta 1 millón de tokens. [ 108 ]
- LongBench: 4750 tareas en 21 conjuntos de datos en 6 categorías de tareas tanto en inglés como en chino, con una longitud promedio de 6711 palabras (inglés) y 13386 caracteres (chino). [ 109 ] Actualizado con LongBench v2 que contenía 503 tareas más, que requieren una longitud de contexto que va desde 8K hasta 2M palabras, con la mayoría por debajo de 128K. [ 110 ] [ 111 ]
- Long Range Arena: 6 tareas sintéticas que requerían de 1K a 16K tokens de longitud de contexto para resolverse. [ 112 ]
- Michelangelo: 3 tareas generadas programáticamente, y pueden ser arbitrariamente largas. Son Resolución de correferencias de múltiples rondas (MRCR, rastrear identidades y referencias en historiales de conversación adversarios de hasta 1 millón de tokens), Lista latente y No lo sé (IDK). [ 113 ]
- MTOB (Traducción automática a partir de un libro): traducir oraciones entre inglés y kalamang después de leer un libro de gramática de kalamang (~570 páginas), [ 114 ] una lista de palabras bilingüe (2531 entradas, con etiquetas de partes de la oración ) y un pequeño corpus paralelo de pares de oraciones (~400 oraciones de entrenamiento, 100 oraciones de prueba, filtradas para excluir ejemplos del libro), ambos publicados en Dictionaria . [ 115 ] [ 116 ]
- Pruebas de búsqueda de una aguja en un pajar (NIH): No se trata de una prueba de referencia específica, sino de un método para evaluar la longitud del contexto. En este método, se rellena una ventana de contexto extensa con texto, como los ensayos de Paul Graham, y se inserta una afirmación aleatoria. La tarea consiste en responder una pregunta sobre la afirmación insertada. [ 117 ]
- NoLiMa: Evaluación de contexto extenso más allá de la coincidencia literal. El conjunto de datos de referencia evalúa modelos de contexto extenso más allá de la simple coincidencia de palabras clave. Específicamente, las palabras de la pregunta tienen una superposición léxica mínima o nula con las palabras de la oración "aguja". Los "montones de heno" son 10 libros con licencia abierta. [ 118 ]
- REGLA: 13 tareas en 4 categorías (recuperación, salto múltiple, agregación, respuesta a preguntas). Cada tarea se especifica mediante un programa que puede generar instancias de longitud arbitraria de cada tarea bajo demanda. [ 119 ]
- ZeroSCROLLS: 4378 elementos en 6 tareas. Incluye 6 tareas de SCROLLS e introduce 4 nuevos conjuntos de datos. Se denomina "zero" porque fue diseñado para el aprendizaje de cero disparos durante los inicios del paradigma de preentrenamiento, cuando la capacidad de aprendizaje de cero disparos era poco común. [ 120 ]
Razonamiento
Matemáticas
- Alg514: 514 problemas de álgebra y sistemas de ecuaciones asociados recopilados de Algebra.com. [ 121 ] [ 122 ]
- AQuA-RAT (Algebra Question Answering with Rationales): También conocido simplemente como "AQuA". 100 000 problemas verbales algebraicos con 5 opciones por problema, y una anotación para la opción correcta con justificaciones en lenguaje natural. Se recopilaron 34 202 "problemas semilla" de muchas fuentes, como GMAT y GRE, que luego se ampliaron al conjunto de datos completo con Amazon Turk. [ 123 ]
- FrontierMath: Varios cientos de preguntas de áreas de matemáticas modernas que son difíciles de resolver para los matemáticos profesionales. Muchas preguntas tienen respuestas enteras, por lo que las respuestas se pueden verificar automáticamente. Reservado para evitar la contaminación. Dividido en niveles. [ 124 ] Los niveles 1-3 contenían 300 problemas y la construcción finalizó en noviembre de 2024. El nivel 4 contenía 50 problemas y la construcción finalizó en junio de 2025. [ 125 ] En enero de 2026, se añadieron Problemas Abiertos al conjunto de datos de referencia, que consisten en problemas sin resolver. [ 126 ] [ 127 ]
- GSM1K: 1205 elementos con el mismo formato y dificultad que GSM8K. Contenido de forma más segura para evitar los problemas de contaminación de datos de la versión anterior GSM8K. [ 128 ]
- GSM8K (Matemáticas de Primaria): 8.500 problemas de matemáticas de primaria lingüísticamente diversos que requieren de 2 a 8 operaciones aritméticas básicas para su resolución. [ 129 ] Contiene errores que se corrigieron con GSM8K-Platinum. [ 130 ]
- IMO-Bench: Evaluación comparativa basada en la IMO . Consta de 3 partes: IMO-AnswerBench (400) para obtener la respuesta correcta, IMO-ProofBench (60) para escribir una demostración, IMO-GradingBench (1000) para calificar una demostración según una rúbrica dada. [ 131 ] [ 132 ]
- MATEMÁTICAS: 12.500 problemas matemáticos de nivel competitivo divididos en niveles de dificultad del 1 al 5 (como en El arte de resolver problemas ), siendo los problemas AIME de nivel 5. Hay 1.324 ítems de nivel 5. [ 133 ] Una versión adversaria es MATH-P, que se obtiene modificando algunos caracteres en las preguntas originales. [ 134 ]
- Math23K: 23.164 problemas matemáticos de texto en chino para escuelas primarias, recopilados de varios sitios web educativos en línea. [ 135 ]
- MathArena: En lugar de un benchmark diseñado específicamente, el benchmark MathArena simplemente toma las competiciones matemáticas más recientes (AIME y HMMT ) lo antes posible y las usa para evaluar los LLM, para evitar la contaminación. [ 136 ]
- MathBench: 3709 preguntas en inglés y chino, divididas en 5 niveles de dificultad (aritmética básica, primaria, secundaria, bachillerato y universidad). Se divide en 2209 preguntas de MathBench-T (teóricas) y 1500 preguntas de MathBench-A (aplicadas). [ 137 ]
- MathEval: Un benchmark integral que contiene otros 20 benchmarks, como GSM8K, MATH y la subsección de matemáticas de MMLU. Más de 20 000 problemas matemáticos. El nivel de dificultad abarca desde primaria hasta bachillerato. [ 138 ]
- MathQA: 37.200 problemas de palabras en inglés. Cada problema proviene de AQuA-RAT y está anotado con un "programa de operaciones" que especifica con exactitud las operaciones matemáticas necesarias para resolver el problema, escrito en un lenguaje específico del dominio con 58 operadores. [ 139 ] Tiene una variante, MathQA-Python, que consta de 23.914 problemas, producidos al tomar las soluciones de un subconjunto del conjunto de datos MathQA y reescribirlas en Python. [ 140 ]
- miniF2F (mini formal-to-formal): 488 problemas matemáticos de nivel olímpico de AIME , AMC e IMO , enunciados en lenguajes formales ( Metamath , Lean , Isabelle (parcialmente) y HOL Light (parcialmente)). La tarea consiste en demostrar formalmente el enunciado formal, que puede verificarse automáticamente. [ 141 ]
- Omni-MATH: 4428 problemas matemáticos de nivel competitivo con anotaciones humanas. [ 142 ]
- ProofNet: 371 teoremas de matemáticas de nivel universitario, cada uno compuesto por un enunciado formal en Lean, un enunciado en lenguaje natural y una prueba en lenguaje natural. Hay dos tareas: dado un enunciado informal (formal), producir un enunciado formal (informal) correspondiente; dado un enunciado informal de teorema, su prueba informal y su enunciado formal, producir una prueba formal. [ 143 ] Originalmente estaba en Lean 3, [ 144 ] pero los autores originales lo desaprobaron en favor de la versión Lean 4. [ 145 ]
- PutnamBench: 1709 versiones formalizadas de preguntas de la competición Putnam durante 1962-2023. La tarea consiste en calcular la respuesta numérica (si existe) y proporcionar una demostración formal. Las formalizaciones se encuentran en Lean 4 , Isabelle y Rocq (luego: Coq ). [ 146 ] [ 147 ]
- TheoremQA: 800 preguntas que evalúan el uso de 350 teoremas de matemáticas, física, ingeniería eléctrica, informática y finanzas. [ 148 ]
- U-MATH: 1100 problemas de matemáticas extraídos de planes de estudio universitarios reales, distribuidos equitativamente entre seis asignaturas, con un 20 % de los problemas incluyendo elementos visuales. [ 149 ]
Programación
- Aider Polyglot: 225 de los ejercicios de programación más difíciles de Exercism , en lenguajes de C++, Go, Java, JavaScript, Python y Rust. [ 150 ]
- APLICACIONES: 10.000 problemas de Codewars , AtCoder, Kattis y Codeforces . [ 151 ]
- BigCodeBench: 1140 tareas que requieren múltiples llamadas a funciones. La prueba de rendimiento incluye 139 bibliotecas y 7 dominios. Un subconjunto, BigCodeBench-Hard, incluye solo un subconjunto de 148 tareas de la prueba de rendimiento completa. [ 152 ] [ 153 ]
- CodeElo: 387 problemas de concursos de Codeforces durante 2024, anotados con metadatos como divisiones de concursos, calificaciones de dificultad del problema y etiquetas de algoritmo del problema. La evaluación comparativa se realiza enviando directamente a Codeforces, lo que resulta en una calificación Elo . Limitado a 8 envíos por problema. [ 154 ]
- Cybench (banco de ciberseguridad): 40 tareas de Capture the Flag (CTF) de nivel profesional de 4 competiciones. Las tareas se dividen en subtareas para una puntuación más precisa. Al menos un equipo humano de nivel profesional en cada competición logró resolver cada una de las tareas. El tiempo que tardó el equipo más rápido en resolver cada tarea osciló entre 2 minutos y 25 horas. [ 155 ]
- DS-1000: 1000 problemas de ciencia de datos obtenidos mediante la reformulación de 451 problemas únicos de StackOverflow , que requieren el uso de 7 bibliotecas de Python, como NumPy y Pandas. Las respuestas se evalúan ejecutando casos de prueba, comparando los resultados y verificando la presencia o ausencia de API o palabras clave específicas. [ 156 ] [ 157 ]
- DSBench: 466 tareas de análisis de datos y 74 tareas de modelado de datos procedentes de las competiciones de Kaggle y ModelOff, que abarcan análisis exploratorios, uniones de múltiples tablas y modelado predictivo con grandes CSV y solicitudes multimodales. [ 158 ]
- HCAST (Tareas de Software de Autonomía Calibradas por Humanos): 189 tareas en aprendizaje automático, ciberseguridad, ingeniería de software y razonamiento general. Cada tarea tiene una "línea base", el tiempo promedio medido que requiere un humano experto en los dominios de la tarea, trabajando en condiciones idénticas a las de los agentes de IA. La línea base varía de 1 minuto a más de 8 horas. [ 159 ]
- HumanEval: 164 problemas cuya solución es siempre una función de Python, a menudo de tan solo unas pocas líneas. [ 9 ]
- KernelBench: 250 tareas de aprendizaje automático de PyTorch, para las cuales se debe escribir un kernel CUDA . [ 160 ]
- MBPP (Principalmente Problemas Básicos de Programación): 974 funciones cortas de Python diseñadas para ser resueltas por programadores principiantes. Cada una incluye una descripción textual y pruebas unitarias. Fueron escritas por un grupo interno de colaboradores con conocimientos básicos de Python. [ 140 ]
- PaperBench: 8316 tareas evaluables individualmente que serían necesarias para replicar desde cero 20 artículos destacados y orales de ICML 2024. La base humana de doctorados en aprendizaje automático (mejor de 3 intentos) con 48 horas de esfuerzo es del 41,4 %. [ 161 ]
- ScienceAgentBench: 102 tareas de ciencia de datos multimodales , cada una de ellas un problema real de descubrimiento científico basado en datos, reformulado como una tarea de generación de código. Los agentes deben producir un archivo de programa Python completo que implemente la tarea, pueda ejecutarse de forma aislada y guarde sus resultados. En los dominios de Bioinformática , Química Computacional , Ciencias de la Información Geográfica y Psicología y Neurociencia Cognitiva . Procedente de 44 publicaciones revisadas por pares que han publicado su código y datos bajo licencias permisivas. Cada tarea es validada por expertos en el dominio. [ 162 ]
- SpreadsheetBench: 912 tareas reales de manipulación de hojas de cálculo extraídas de foros públicos de ayuda de Excel, que abarcan la escritura de fórmulas, la limpieza de datos, el filtrado y la edición de diseños en diversos formatos. Se puntuó automáticamente en 2729 casos de prueba a nivel de celda, hoja y general. [ 163 ]
- SWE-bench: 2294 problemas de ingeniería de software extraídos de incidencias reales de GitHub y solicitudes de extracción correspondientes en 12 repositorios populares de Python. Dado un código fuente y una incidencia, la tarea consiste en editar el código fuente para resolver la incidencia. [ 164 ] Hay 2 subconjuntos: Lite (300 problemas que se ejecutan más rápido), Verified (subconjunto validado por humanos de 500 problemas revisados por ingenieros de software). [ 165 ] SWE-bench Pro se lanzó más tarde, conteniendo 1865 elementos más difíciles. Este tiene 3 divisiones: pública, reservada y propietaria (solo disponible para un conjunto selecto de startups en etapa temprana). [ 166 ] La versión Verified fue descontinuada por OpenAI en 2026-02, ya que muchos fallos restantes reflejaban pruebas defectuosas o insuficientemente especificadas. Recomendaron la división pública de SWE-bench Pro. [ 167 ]
- Multi-SWE-bench: 1632 problemas en 7 lenguajes: Java, TypeScript, JavaScript, Go, Rust, C y C++. Similar a SWE-bench. [ 168 ]
- SWE-bench Multimodal: una variante de SWE-bench, con 619 instancias de tareas de 17 repositorios populares de JavaScript, cada una con imágenes necesarias para resolver la tarea. [ 169 ]
- SWE-Lancer: 1488 tareas de ingeniería de software freelance de Upwork . Dos tipos de tareas: tareas de implementación (desde correcciones de errores de $50 hasta implementaciones de funciones de $32 000), llamadas "IC" (por "Individual Contributor"); tareas de "gestión", donde el modelo debe elegir entre propuestas de implementación técnica. Un subconjunto de 502 se publica como código abierto bajo el nombre SWE-Lancer-Diamond. Producido por OpenAI. [ 170 ] [ 171 ]
General
- AGIEval: preguntas de 20 exámenes oficiales, públicos y de alto nivel de admisión y cualificación, como el SAT , el Gaokao , las pruebas de admisión a la facultad de derecho, las competiciones de matemáticas, las pruebas de cualificación de abogados y los exámenes nacionales de la función pública . [ 172 ]
- ARC-AGI (Corpus de Abstracción y Razonamiento para la Inteligencia Artificial General): Dados tres pares de diagramas de antes y después de aplicar una regla, aplicar la misma regla al cuarto diagrama de antes. Es similar a una prueba de Matrices Progresivas de Raven . [ 173 ]
- GPQA (Google-Proof Q&A): 448 preguntas de opción múltiple escritas por expertos en biología, física y química, diseñadas para ser de nivel doctoral. OpenAI encontró que los expertos humanos logran una puntuación promedio de 69.7% en el subconjunto Diamante. [ 174 ] Está compuesto por 3 conjuntos: "Extendido" con 546 problemas, que contiene todos los problemas solicitados a los escritores; "Principal" con 448 problemas, que fueron un subconjunto validado por expertos de "Extendido"; "Diamante" con 198 problemas, que fueron los problemas más difíciles de "Principal". En el conjunto de datos, también hay una lista anonimizada de 60 expertos que validaron el conjunto de datos, y sus calificaciones. [ 175 ] [ 176 ] El acuerdo entre expertos en el conjunto Extendido es solo del 74%. La construcción del conjunto de datos costó ~$120 K. Cada pregunta costó un promedio de 2 horas de experto. A cada experto se le pagaban 100 dólares por hora. [ 177 ]
- SuperGPQA: 26.529 preguntas de opción múltiple recopiladas por expertos en 285 disciplinas de posgrado. Las preguntas fueron recopiladas por personas con doctorado o que estaban cursando un doctorado y luego refinadas e inspeccionadas con la ayuda de grandes modelos de lenguaje. [ 178 ]
- El último examen de la humanidad : 3000 preguntas multimodales sobre más de cien materias académicas, con un conjunto de datos privado reservado que no se publicó para evitar la contaminación. El 10 % de las preguntas requiere comprensión tanto de imágenes como de texto, y el resto son completamente textuales. El 80 % de las preguntas se califican mediante coincidencia exacta de cadenas, y el resto son de opción múltiple. [ 179 ]
- LiveBench: Una serie de pruebas de rendimiento publicadas mensualmente, que incluyen preguntas de competencias de matemáticas de secundaria, preguntas de programación competitiva, acertijos de lógica y otras tareas. [ 180 ]
- MathVista: 6141 preguntas que implican razonamiento cuantitativo y que requieren leer una imagen para resolverlas. [ 181 ]
- OlympicArena: 11.163 problemas de 62 competiciones olímpicas distintas. [ 182 ]
- OlympiadBench: 8.476 problemas de matemáticas y física en inglés y chino, procedentes de las Olimpiadas Internacionales, las Olimpiadas Chinas y el Gaokao. [ 183 ]
- SimpleBench: Un benchmark de texto de opción múltiple con más de 200 preguntas que abarcan el razonamiento espaciotemporal, la inteligencia social y la robustez lingüística adversaria (o preguntas capciosas). Está diseñado para evaluar el "razonamiento humano cotidiano". [ 184 ]
- SPaRC (Desafío de Razonamiento y Búsqueda de Rutas Espaciales): 1000 rompecabezas de cuadrícula (500 de entrenamiento, 500 de prueba). El participante traza una sola línea desde un punto de inicio hasta un punto final sin cruzarlo, siguiendo reglas como pasar por puntos, evitar huecos, separar piedras de colores en diferentes regiones y emparejar formas de poliominós . Los rompecabezas tienen una dificultad del 1 al 5, con reglas adaptadas del videojuego The Witness . Los anotadores humanos resolvieron el 98,0 % de los rompecabezas, mucho más que el mejor modelo probado. [ 185 ]
Véase también
Lecturas adicionales
- Hardt, Moritz (2025). "La ciencia emergente de los puntos de referencia de aprendizaje automático" . Recuperado el 6 de marzo de 2026 .
Referencias
- ^ Chang, Yupeng; Wang, Xu; Wang, Jindong; Wu, Yuan; Yang, Linyi; Zhu, Kaijie; Chen, Hao; Yi, Xiaoyuan; Wang, Cunxiang; Wang, Yidong; Sí, Wei; Zhang, Yue; Chang, Yi; Yu, Philip S.; Yang, Qiang (30 de junio de 2024). "Una encuesta sobre evaluación de modelos de lenguaje grandes" . Transacciones ACM sobre tecnología y sistemas inteligentes . 15 (3): 1– 45. doi : 10.1145/3641289 . ISSN 2157-6904 .
- ↑ Chen, Danqi; Yih, Wen-tau (julio de 2020). Savary, Agata; Zhang, Yue (eds.). "Respuesta a preguntas de dominio abierto" . Actas de la 58.ª Reunión Anual de la Asociación de Lingüística Computacional: Resúmenes de tutoriales . En línea: Asociación de Lingüística Computacional: 34–37 . doi : 10.18653/v1/2020.acl-tutorials.8 .
- ↑ Weng, Lilian (29-10-2020). "¿Cómo construir un sistema de preguntas y respuestas de dominio abierto?" . lilianweng.github.io . Recuperado el 5-03-2025 .
- 1 2 Radford, Alec; Wu, Jeffrey; Child, Rewon; Luan, David; Amodei, Dario; Sutskever, Ilya (14 de febrero de 2019). "Los modelos de lenguaje son aprendices multitarea no supervisados" (PDF) . OpenAI .
- ↑ "English Gigaword Fifth Edition" . Linguistic Data Consortium . 17 de junio de 2011. Consultado el 17 de mayo de 2025 .
- 1 2 Chelba, Ciprian; Mikolov, Tomas; Schuster, Mike; Ge, Qi; Brants, Thorsten; Koehn, Phillipp; Robinson, Tony (2013). "One Billion Word Benchmark for Measuring Progress in Statistical Language Modeling". arXiv : 1312.3005 [ cs.CL ].
- 1 2 Dehghani, Mostafa; Tay, Yi; Gritsenko, Alexey A.; Zhao, Zhe; Houlsby, Neil; Díaz, Fernando; Metzler, Donald; Vinyals, Oriol (2021-07-14). "La Lotería de Referencia". arXiv : 2107.07002 [ cs.LG ].
- ^ DeepSeek-AI; Guo, Daya; Yang, Dejian; Zhang, Haowei; Canción, Junxiao; Zhang, Ruoyu; Xu, Runxin; Zhu, Qihao; Mamá, Shirong (22 de enero de 2025). "DeepSeek-R1: incentivar la capacidad de razonamiento en LLM mediante el aprendizaje por refuerzo". arXiv : 2501.12948 [ cs.CL ].
- 1 2 Chen, Mark; Tworek, Jerry; Jun, Heewoo; Yuan, Qiming; Pinto, Henrique Ponde de Oliveira; Kaplan, Jared; Edwards, Harri; Burda, Yuri; Joseph, Nicholas (2021-07-14). "Evaluating Large Language Models Trained on Code". arXiv : 2107.03374 [ cs.LG ].
- ↑ Vedantam, Ramakrishna; Lawrence Zitnick, C.; Parikh, Devi (2015). "CIDEr: Evaluación de descripción de imágenes basada en consenso" . Conferencia IEEE de 2015 sobre Visión por Computadora y Reconocimiento de Patrones (CVPR) . págs. 4566–4575 . arXiv : 1411.5726 . doi : 10.1109/CVPR.2015.7299087 . ISBN 978-1-4673-6964-0.
- ↑ Anderson, Peter; Fernando, Basura; Johnson, Mark; Gould, Stephen (2016). "SPICE: Evaluación semántica proposicional de subtítulos de imágenes". En Leibe, Bastian; Matas, Jiri; Sebe, Nicu; Welling, Max (eds.). Visión por computadora – ECCV 2016. Notas de clase en ciencias de la computación. Vol. 9909. Cham: Springer International Publishing. pp. 382–398 . arXiv : 1607.08822 . doi : 10.1007/978-3-319-46454-1_24 . ISBN 978-3-319-46454-1.
- ↑ Northcutt, Curtis G.; Athalye, Anish; Mueller, Jonas (2021-11-07). "Errores generalizados en las etiquetas de los conjuntos de prueba desestabilizan los puntos de referencia de aprendizaje automático". arXiv : 2103.14749 [ stat.ML ].
- ↑ Richie, Russell; Grover, Sachin; Tsui, Fuchiang (Rich) (mayo de 2022). Demner-Fushman, Dina; Cohen, Kevin Bretonnel; Ananiadou, Sophia; Tsujii, Junichi (eds.). "El acuerdo entre anotadores no es el techo del rendimiento del aprendizaje automático: evidencia de un conjunto integral de simulaciones" . Actas del 21.º Taller sobre Procesamiento del Lenguaje Biomédico . Dublín, Irlanda: Asociación de Lingüística Computacional: 275–284 . doi : 10.18653/v1/2022.bionlp-1.26 .
- ↑ Artstein, Ron (2017), Ide, Nancy; Pustejovsky, James (eds.), "Inter-annotator Agreement" , Handbook of Linguistic Annotation , Dordrecht: Springer Netherlands, pp. 297–313 , doi : 10.1007/978-94-024-0881-2_11 , ISBN 978-94-024-0881-2, consultado el 22 de febrero de 2025
{{citation}}: CS1 mantenimiento: parámetro de trabajo con ISBN ( enlace ) - ↑ Nie, Yixin; Zhou, Xiang; Bansal, Mohit (noviembre de 2020). "¿Qué podemos aprender de las opiniones colectivas humanas sobre los datos de inferencia del lenguaje natural?" . En Webber, Bonnie; Cohn, Trevor; He, Yulan; Liu, Yang (eds.). Actas de la Conferencia de 2020 sobre Métodos Empíricos en Procesamiento del Lenguaje Natural (EMNLP) . En línea: Asociación para la Lingüística Computacional. págs. 9131–9143 . doi : 10.18653/v1/2020.emnlp-main.734 .
- ↑ Pavlick, Ellie; Kwiatkowski, Tom (noviembre de 2019). "Desacuerdos inherentes en las inferencias textuales humanas" . Transactions of the Association for Computational Linguistics . 7 : 677–694 . doi : 10.1162/tacl_a_00293 . ISSN 2307-387X .
- ↑ Gururangan, Suchin; Swayamdipta, Swabha; Levy, Omer; Schwartz, Roy; Bowman, Samuel R.; Smith, Noah A. (2018-04-16). "Artefactos de anotación en datos de inferencia del lenguaje natural". arXiv : 1803.02324 [ cs.CL ].
- ↑ Deng, Chunyuan; Zhao, Yilun; Tang, Xiangru; Gerstein, Mark; Cohan, Arman (junio de 2024). "Investigación de la contaminación de datos en los benchmarks modernos para modelos de lenguaje grandes" . En Duh, Kevin; Gomez, Helena; Bethard, Steven (eds.). Actas de la Conferencia de 2024 del Capítulo Norteamericano de la Asociación de Lingüística Computacional: Tecnologías del Lenguaje Humano (Volumen 1: Artículos largos) . Ciudad de México, México: Asociación de Lingüística Computacional. pp. 8706–8719 . arXiv : 2311.09783 . doi : 10.18653/v1/2024.naacl-long.482 .
- ↑ LI, Yanyang (17-02-2025), lyy1994/awesome-data-contamination , consultado el 22-02-2025
- ↑ Shannon, CE (1951). "Predicción y entropía del inglés impreso" . Bell System Technical Journal . 30 (1): 50– 64. Bibcode : 1951BSTJ...30...50S . doi : 10.1002/j.1538-7305.1951.tb01366.x . ISSN 1538-7305 .
- ↑ Radford, Alec; Wu, Jeffrey; Child, Rewon; Luan, David; Amodei, Dario; Sutskever, Ilya (14 de febrero de 2019). "Mejores modelos de lenguaje y sus implicaciones" . OpenAI .
- ^ Magnusson, Ian; Bhagia, Akshita; Hofmann, Valentín; Soldaini, Luca; Jha, Ananya Harsh; Tafjord, Oyvind; Schwenk, Dustin; Walsh, Evan Pete; Elazar, Yanai (7 de diciembre de 2024). "Paloma: un punto de referencia para evaluar la adecuación del modelo de lenguaje". arXiv : 2312.10523 [ cs.CL ].
- ↑ Davis, Ernest (23-10-2023). "Benchmarks for Automated Commonsense Reasoning: A Survey" . ACM Comput. Surv . 56 (4): 81:1–81:41. arXiv : 2302.04752 . doi : 10.1145/3615355 . ISSN 0360-0300 .
- ↑ Chen, Danqi; Bolton, Jason; Manning, Christopher D. (2016-08-08). "Un examen exhaustivo de la tarea de comprensión lectora de CNN/Daily Mail". arXiv : 1606.02858 [ cs.CL ].
- ↑ "El Corpus de Aceptabilidad Lingüística (CoLA)" . nyu-mll.github.io . Archivado del original el 11 de marzo de 2025. Consultado el 19 de abril de 2025 .
- ↑ Warstadt, Alex; Singh, Amanpreet; Bowman, Samuel R. (noviembre de 2019). "Juicios de aceptabilidad de redes neuronales" . Transactions of the Association for Computational Linguistics . 7 : 625–641 . arXiv : 1805.12471 . doi : 10.1162/tacl_a_00290 . ISSN 2307-387X .
- ↑ Zellers, Rowan; Holtzman, Ari; Bisk, Yonatan; Farhadi, Ali; Choi, Yejin (2019-05-19). "HellaSwag: ¿Puede una máquina realmente terminar tu frase?". arXiv : 1905.07830 [ cs.CL ].
- ↑ "HellaSwag" . rowanzellers.com . Consultado el 6 de febrero de 2025 .
- ^ Paperno, Denis; Kruszewski, Germán; Lazaridou, Angeliki; Pham, Quan Ngoc; Bernardi, Raffaella; Pezzelle, Sandro; Baroni, Marco; Boleda, Gemma; Fernández, Raquel (20-06-2016). "El conjunto de datos LAMBADA: predicción de palabras que requiere un contexto de discurso amplio". arXiv : 1606.06031 [ cs.CL ].
- ↑ Williams, Adina; Nangia, Nikita; Bowman, Samuel R. (2018-02-19). "Un corpus de desafío de amplia cobertura para la comprensión de oraciones a través de la inferencia". arXiv : 1704.05426 [ cs.CL ].
- ↑ Lai, Guokun; Xie, Qizhe; Liu, Hanxiao; Yang, Yiming; Hovy, Eduard (2017-12-05). "RACE: Conjunto de datos de comprensión lectora a gran escala a partir de exámenes". arXiv : 1704.04683 [ cs.CL ].
- ↑ Bowman, Samuel R.; Angeli, Gabor; Potts, Christopher; Manning, Christopher D. (septiembre de 2015). "Un gran corpus anotado para el aprendizaje de la inferencia del lenguaje natural" . En Màrquez, Lluís; Callison-Burch, Chris; Su, Jian (eds.). Actas de la Conferencia de 2015 sobre Métodos Empíricos en Procesamiento del Lenguaje Natural . Lisboa, Portugal: Asociación de Lingüística Computacional. pp. 632–642 . arXiv : 1508.05326 . doi : 10.18653/v1/D15-1075 .
- ↑ "El Grupo de Procesamiento del Lenguaje Natural de Stanford" . nlp.stanford.edu . Consultado el 22 de febrero de 2025 .
- ^ Zellers, Rowan; Bisk, Yonatan; Schwartz, Roy; Choi, Yejin (16 de agosto de 2018). "SWAG: un conjunto de datos contradictorios a gran escala para inferencias de sentido común fundamentadas". arXiv : 1808.05326 [ cs.CL ].
- ↑ Levesque, Hector; Davis, Ernest; Morgenstern, Leora (2012). El desafío del esquema de Winograd . Actas de la decimotercera Conferencia Internacional sobre Principios de Representación del Conocimiento y Razonamiento .
- ↑ Kocijan, Vid; Davis, Ernest; Lukasiewicz, Thomas; Marcus, Gary; Morgenstern, Leora (11 de julio de 2023). "La derrota del desafío del esquema de Winograd" . Inteligencia Artificial . 325 103971. arXiv : 2201.02387 . doi : 10.1016/j.artint.2023.103971 . ISSN 0004-3702 . S2CID 245827747 .
- ^ Sakaguchi, Keisuke; Le Brás, Ronan; Bhagavatula, Chandra; Choi, Yejin (2019). "WinoGrande: un desafío adversario del esquema de Winograd a escala". arXiv : 1907.10641 [ cs.CL ].
- ↑ Bojar, Ondřej; Buck, Christian; Federmann, Christian; Haddow, Barry; Koehn, Philipp; Leveling, Johannes; Monz, Christof; Pecina, Pavel; Post, Matt; Saint-Amand, Herve; Soricut, Radu; Specia, Lucia; Tamchyna, Aleš (junio de 2014). Bojar, Ondřej; Buck, Christian; Federmann, Christian; Haddow, Barry; Koehn, Philipp; Monz, Christof; Post, Matt; Specia, Lucia (eds.). "Resultados del Taller de 2014 sobre Traducción Automática Estadística" . Actas del Noveno Taller sobre Traducción Automática Estadística . Baltimore, Maryland, EE. UU.: Asociación de Lingüística Computacional: 12–58 . doi : 10.3115/v1/W14-3302 . hdl : 20.500.11820/789fbc29-61e0-4529-af4a-819461c57a8f .
- ↑ Daum, Shilo; Shapira, Tal; Bremler-Barr, Anat; Hay, David (2024). "Non-uniformity is All You Need: Efficient and Timely Encrypted Traffic Classification with ECHO". arXiv : 2406.01852 [ cs.NI ].
- ↑ Zhou, Jeffrey; Lu, Tianjian; Mishra, Swaroop; Brahma, Siddhartha; Basu, Sujoy; Luan, Yi; Zhou, Denny; Hou, Le (2023-11-14). "Evaluación de seguimiento de instrucciones para modelos de lenguaje grandes". arXiv : 2311.07911 [ cs.CL ].
- 1 2 Zheng, Lianmin; Chiang, Wei-Lin; Sheng, Ying; Zhuang, Siyuan; Wu, Zhanghao; Zhuang, Yonghao; Lin, Zi; Li, Zhuohan; Li, Dacheng (24 de diciembre de 2023). "Juzgar LLM como juez con MT-Bench y Chatbot Arena". arXiv : 2306.05685 [ cs.CL ].
- ↑ Sirdeshmukh, Ved; Deshpande, Kaustubh; Mols, Johannes; Jin, Lifeng; Cardona, Ed-Yeremai; Lee, Dean; Kritz, Jeremy; Primack, Willow; Yue, Summer; Xing, Chen (2025). "MultiChallenge: Un punto de referencia realista para la evaluación de conversaciones multiturno que supone un desafío para los sistemas de gestión del lenguaje de vanguardia". arXiv : 2501.17399 [ cs.CL ].
- ^ Mishra, Swaroop; Khashabi, Daniel; Baral, Chitta; Hajishirzi, Hannaneh (14 de marzo de 2022). "Generalización de tareas cruzadas mediante instrucciones de crowdsourcing en lenguaje natural". arXiv : 2104.08773 [ cs.CL ].
- ^ Wang, Yizhong; Mishra, Swaroop; Alipoormolabashi, Pegah; Kordi, Yeganeh; Mirzaei, Amirreza; Arunkumar, Anjana; Ashok, Arjun; Dhanasekaran, Arut Selvan; Naik, Atharva (24 de octubre de 2022). "Super-NaturalInstructions: Generalización mediante instrucciones declarativas en más de 1600 tareas de PNL". arXiv : 2204.07705 [ cs.CL ].
- ↑ Minev, ZK; Mundhada, SO; Shankar, S.; Reinhold, P.; Gutiérrez-Jáuregui, R.; Schoelkopf, RJ; Mirrahimi, M.; Carmichael, HJ; Devoret, MH (2019). "Para atrapar y revertir un salto cuántico en pleno vuelo". Naturaleza . 570 (7760): 200–204 . arXiv : 1803.00545 . Código Bib : 2019Natur.570..200M . doi : 10.1038/s41586-019-1287-z . PMID 31160725 .
- ↑ Masry, Ahmed; Do, Xuan Long; Tan, Jia Qing; Joty, Shafiq; Hoque, Enamul (mayo de 2022). "ChartQA: un punto de referencia para la respuesta a preguntas sobre gráficos con razonamiento visual y lógico" . En Muresan, Smaranda; Nakov, Preslav; Villavicencio, Aline (eds.). Hallazgos de la Asociación de Lingüística Computacional: ACL 2022. Dublín, Irlanda: Asociación de Lingüística Computacional. págs. 2263–2279 . arXiv : 2203.10244 . doi : 10.18653/v1/2022.findings-acl.177 .
- ↑ Reddy, Siva; Chen, Danqi; Manning, Christopher D. (2019-05-01). "CoQA: Un desafío de respuesta a preguntas conversacionales" . Transactions of the Association for Computational Linguistics . 7 : 249–266 . arXiv : 1808.07042 . doi : 10.1162/tacl_a_00266 . ISSN 2307-387X .
- ↑ "Biblioteca de documentos de la industria" . industrydocuments.ucsf.edu . Consultado el 5 de abril de 2025 .
- ↑ "DocVQA" . www.docvqa.org . Consultado el 5 de abril de 2025 .
- ^ Mateo, Minesh; Karatzas, Dimóstenes; Jawahar, CV (2021). "DocVQA: un conjunto de datos para VQA en imágenes de documentos" . págs. 2200-2209 .
- ↑ Mendoza-Arenas, JJ; Gómez-Ruiz, FJ; Rodríguez, FJ; Quiroga, L. (2019). "Aumento de las violaciones de las desigualdades de Leggett-Garg en sistemas de muchos cuerpos correlacionados en desequilibrio mediante interacciones y decoherencia" . Scientific Reports . 9 (1): 17772. arXiv : 1903.00016 . Bibcode : 2019NatSR...917772M . doi : 10.1038/ s41598-019-54121-1 . PMC 6882789. PMID 31780693 .
- ↑ Khrennikov, Andrei; Ozawa, Masanao; Benninger, Felix; Shor, Oded (2024). "Acoplamiento de la cognición cuántica con las redes neuronales dentro de la teoría de la probabilidad generalizada". arXiv : 2411.00036 [ physics.soc-ph ].
- ↑ Yang, Zhilin; Qi, Peng; Zhang, Saizheng; Bengio, Yoshua; Cohen, William; Salakhutdinov, Ruslan; Manning, Christopher D. (octubre de 2018). Riloff, Ellen; Chiang, David; Hockenmaier, Julia; Tsujii, Jun'ichi (eds.). "HotpotQA: un conjunto de datos para la respuesta a preguntas de múltiples saltos, diversa y explicable" . Actas de la Conferencia de 2018 sobre Métodos Empíricos en Procesamiento del Lenguaje Natural . Bruselas, Bélgica: Asociación de Lingüística Computacional: 2369–2380 . doi : 10.18653/v1/D18-1259 .
- ↑ Richardson, Matthew; Burges, Christopher JC; Renshaw, Erin (octubre de 2013). "MCTest: un conjunto de datos de desafío para la comprensión automática de texto en dominio abierto" . En Yarowsky, David; Baldwin, Timothy; Korhonen, Anna ; Livescu, Karen; Bethard, Steven (eds.). Actas de la Conferencia de 2013 sobre Métodos Empíricos en Procesamiento del Lenguaje Natural . Seattle, Washington, EE. UU.: Asociación de Lingüística Computacional. págs. 193–203 . doi : 10.18653/v1/D13-1020 .
- ↑ Kwiatkowski, Tom; Palomaki, Jennimaria; Redfield, Olivia; Collins, Michael; Parikh, Ankur; Alberti, Chris; Epstein, Danielle; Polosukhin, Illia; Devlin, Jacob; Lee, Kenton; Toutanova, Kristina; Jones, Llion; Kelcey, Matthew; Chang, Ming-Wei; Dai, Andrew M. (2019-08-01). "Natural Questions: A Benchmark for Question Answering Research" . Transactions of the Association for Computational Linguistics . 7 : 453–466 . doi : 10.1162/tacl_a_00276 . ISSN 2307-387X .
- ↑ Enns, John (2018). "Multiplicidades en la parte ordinaria de la cohomología mod $p$ para $\mathrm { GL } _n(\mathbb { Q } _p)$". arXiv : 1809.00278 [ math.NT ].
- ↑ Du Toit, EJ; o'Brien, MR; Vann, RGL (2017). "Un estudio cinético del arranque por microondas de plasmas de tokamak". EPJ Web of Conferences . 147 : 01002. arXiv : 1704.00517 . Bibcode : 2017EPJWC.14701002D . doi : 10.1051/epjconf/201714701002 .
- ↑ Baik, Jinho; Barraquand, Guillaume; Corwin, Ivan; Suidan, Toufic (2018). "Procesos de Schur de Pfaff y percolación de último paso en un semicuadrante". The Annals of Probability . 46 (6). arXiv : 1606.00525 . doi : 10.1214/17-AOP1226 .
- ↑ Wallis, Ben (2018). "Ideales cerrados de operadores que actúan sobre algunas familias de espacios de secuencias". arXiv : 1806.00382 [ math.FA ].
- ↑ Geva, Mor; Khashabi, Daniel; Segal, Elad; Khot, Tushar; Roth, Dan; Berant, Jonathan (26 de abril de 2021). "¿Usó Aristóteles una computadora portátil? Un punto de referencia de respuesta a preguntas con estrategias de razonamiento implícito" . Transactions of the Association for Computational Linguistics . 9 : 346–361 . doi : 10.1162/tacl_a_00370 . ISSN 2307-387X .
- ↑ Berant, Jonathan; Chou, Andrew; Frostig, Roy; Liang, Percy (octubre de 2013). "Análisis semántico en Freebase a partir de pares pregunta-respuesta" . En Yarowsky, David; Baldwin, Timothy; Korhonen, Anna ; Livescu, Karen; Bethard, Steven (eds.). Actas de la Conferencia de 2013 sobre Métodos Empíricos en Procesamiento del Lenguaje Natural . Seattle, Washington, EE. UU.: Asociación de Lingüística Computacional. págs. 1533–1544 . doi : 10.18653/v1/D13-1160 .
- ^ "Evaluación C: 一个适用于大语言模型的多层次多学科中文评估套件" . cevalbenchmark.com . Consultado el 25 de febrero de 2025 .
- ↑ Jin, Di; Pan, Eileen; Oufattole, Nassim; Weng, Wei-Hung; Fang, Hanyi; Szolovits, Peter (enero de 2021). "¿Qué enfermedad tiene este paciente? Un conjunto de datos de preguntas y respuestas de dominio abierto a gran escala a partir de exámenes médicos" . Applied Sciences . 11 (14): 6421. doi : 10.3390/app11146421 . hdl : 1721.1/136684.2 . ISSN 2076-3417 .
- ↑ Majumdar, Arjun; Ajay, Anurag; Zhang, Xiaohan; Putta, Pranav; Yenamandra, Sriram; Henaff, Mikael; Silwal, Sneha; Mcvay, Paul; Maksymets, Oleksandr; Arnaud, Sergio; Yadav, Karmesh; Li, Qiyang; Newman, Ben; Sharma, Mohit; Berges, Vincent (2024). "OpenEQA: Respuesta a preguntas encarnada en la era de los modelos fundamentales" . Conferencia IEEE/CVF de 2024 sobre visión por computadora y reconocimiento de patrones (CVPR) . págs. 16488–16498 . doi : 10.1109/CVPR52733.2024.01560 . ISBN 979-8-3503-5300-6.
- ↑ Bisk, Yonatan; Zellers, Rowan; Bras, Ronan Le; Gao, Jianfeng; Choi, Yejin (2020-04-03). "PIQA: Razonamiento sobre el sentido común físico en lenguaje natural" . Actas de la Conferencia AAAI sobre Inteligencia Artificial . 34 (5): 7432– 7439. arXiv : 1911.11641 . doi : 10.1609/aaai.v34i05.6239 . ISSN 2374-3468 .
- ^ "Vista previa de Grok-1.5 Vision | xAI" . x.ai. Consultado el 12 de marzo de 2025 .
- ↑ Lu, Pan; Mishra, Swaroop; Xia, Tanglin; Qiu, Liang; Chang, Kai-Wei; Zhu, Song-Chun; Tafjord, Oyvind; Clark, Peter; Kalyan, Ashwin (2022-12-06). "Aprender a explicar: razonamiento multimodal mediante cadenas de pensamiento para responder preguntas científicas" . Advances in Neural Information Processing Systems . 35 : 2507–2521 . arXiv : 2209.09513 .
- ↑ Wei, Jason; Karina, Nguyen; Chung, Hyung Won; Jiao, Yunxin Joy; Papay, Spencer; Glaese, Amelia; Schulman, John; Fedus, William (2024-11-07), Measuring short-form factuality in large language models , arXiv : 2411.04368
- ↑ "Presentación de SimpleQA" . openai.com . Consultado el 2 de octubre de 2025 .
- ↑ Matias, José; Oliveira, Julio PC; Le Roux, Galo AC; Jäschke, Johannes (2022). "Optimización en tiempo real en estado estacionario mediante mediciones transitorias en un banco de pruebas experimental". Journal of Process Control . 115 : 181–196 . arXiv : 2109.00795 . doi : 10.1016/j.jprocont.2022.04.015 .
- ↑ Lovesey, SW (2022). "Magnetización polar revelada por difracción de neutrones polarizados". Physical Review B . 106 (6) 064415. arXiv : 2206.00461 . Bibcode : 2022PhRvB.106f4415L . doi : 10.1103/PhysRevB.106.064415 .
- ↑ Ddamulira, Mahadi; Emong, Paul; Geoffrey Ismail Mirumbe (2022). "Miembros de la secuencia de vacas de Narayana que son concatenaciones de dos dígitos de rep". arXiv : 2210.00926 [ math.NT ].
- ^ Kazemi, Mehran; Fatemi, Bahare; Bansal, Hritik; Palowitch, John; Anastasiou, Chrysovalantis; Sanket Vaibhav Mehta; Jain, Lalit K.; Aglietti, Virginia; Jindal, Disha; Chen, Pedro; Dikkala, Nishanth; Tyen, Gladys; Liu, Xin; Shalit, Uri; Chiappa, Silvia; Olszewska, Kate; Tay, Yi; Tran, Vinh Q.; Le, Quoc V.; Firat, Orhan (2025). "BIG-Banch extra duro". arXiv : 2502.19187 [ cs.CL ].
- ↑ Wang, Alex; Singh, Amanpreet; Michael, Julian; Hill, Felix; Levy, Omer; Bowman, Samuel R. (2018). "GLUE: Una plataforma de análisis y evaluación comparativa multitarea para la comprensión del lenguaje natural". arXiv : 1804.07461 [ cs.CL ].
- ↑ "GLUE Benchmark" . gluebenchmark.com . Consultado el 25 de febrero de 2019 .
- ↑ Herzig, Florian; Kozioł, Karol; Vignéras, Marie-France (2020). "Sobre la existencia de representaciones supersingulares admisibles de grupos reductivos -ádicos". Forum of Mathematics, Sigma . 8 e2. arXiv : 1905.00053 . doi : 10.1017/fms.2019.50 .
- ↑ "Evaluación holística de modelos de lenguaje (HELM)" . crfm.stanford.edu . Consultado el 6 de febrero de 2026 .
- ↑ Hernandez, A.; Woo, S.; Corrales, H.; Parra, I.; Kim, E.; Llorca, DF; Sotelo, MA (2020). "3D-DEEP: Aprendizaje profundo tridimensional basado en patrones de elevación para la interpretación de escenas viales". Simposio IEEE de Vehículos Inteligentes 2020 (IV) . págs. 892–898 . arXiv : 2009.00330 . doi : 10.1109/IV47402.2020.9304601 . ISBN 978-1-7281-6673-5.
- ↑ Arjomandbigdeli, Ali; Mata, Andrew; Bak, Stanley (2024). "Verificación de sistemas de control de redes neuronales en tiempo continuo". Verificación de IA . Notas de clase en ciencias de la computación. Vol. 14846. pp. 100–115 . arXiv : 2406.00157 . doi : 10.1007/978-3-031-65112-0_5 . ISBN 978-3-031-65111-3.
- ↑ Zimmerman, Charlotte; Olsho, Alexis; Loverude, Michael; Suzanne White Brahmia (2023). "Recursos de razonamiento covariacional experto en tareas de graficación de física". arXiv : 2306.00921 [ physics.ed-ph ].
- ↑ "openai/MMMLU · Conjuntos de datos en Hugging Face" . huggingface.co . 22 de octubre de 2024. Consultado el 28 de febrero de 2025 .
- ↑ "MMMU" . mmmu-benchmark.github.io . Consultado el 28 de febrero de 2025 .
- ↑ Ates, Halim Cagri; Bhargava, Shruti; Li, Site; Lu, Jiarui; Maddula, Siddhardha; Moniz, Joel Ruben Antony; Nalamalapu, Anil Kumar; Nguyen, Roman Hoang; Ozyildirim, Melis; Patel, Alkesh; Piraviperumal, Dhivya; Renkens, Vincent; Samal, Ankit; Tran, Thy; Tseng, Bo-Hsiang; Yu, Hong; Zhang, Yuan; Zou, Shirley (2023). "MARRS: Sistema de resolución de referencias multimodales". Actas del sexto taller sobre modelos computacionales de referencia, anáfora y correferencia (CRAC 2023) . págs. 51–58 . arXiv : 2311.01650 . doi : 10.18653/v1/2023.crac-main.7 .
- ↑ Ma, Yingjie; Guo, Jing; Maloney, Andrew; Braatz, Richard (2024). "Enfoque de estado cuasiestacionario para la simulación y optimización multiescala eficiente de la glicosilación de mAb en cultivos celulares CHO". arXiv : 2409.00281 [ math.NA ].
- ↑ "MMT-Bench" . mmt-bench.github.io . Consultado el 12 de julio de 2025 .
- ↑ Ouyang, Linke; Qu, Yuan; Zhou, Hongbin; Zhu, Jiawei (2024). "OmniDocBench: Evaluación comparativa de diversos análisis de documentos PDF con anotaciones exhaustivas". arXiv : 2412.07626 [ cs.CV ].
- ↑ Padlewski, Piotr; Baño, Max; Henderson, Mateo; Zhu, Zhongkai; Relan, Nishant; Pham, Hai; Ong, Donovan; Aleksiev, Kaloyan; Ormazábal, Aitor; Phua, Samuel; Sí, Ethan; Lamprecht, Eugenia; Liu, Qi; Wang, Yuqi; Chen, Eric; Fu, Deyu; Li, Lei; Zheng, Che; Cyprien de Masson d'Autume; Yogatama, Dani; Artetxe, Mikel; Tay, Yi (2024). "Vibe-Eval: un conjunto de evaluación exhaustiva para medir el progreso de modelos de lenguaje multimodal". arXiv : 2405.02287 [ cs.CL ].
- ^ Hu, Kairui; Wu, Penghao; Pu, Fanyi; Xiao, Wang; Zhang, Yuan Han; Yue, Xiang; Li, Bo; Liu, Ziwei (2025). "Video-MMMU: Evaluación de la adquisición de conocimientos a partir de vídeos profesionales multidisciplinarios". arXiv : 2501.13826 [ cs.CV ].
- ↑ "Video-MMMU" . videommmu.github.io . Consultado el 7 de junio de 2025 .
- ↑ Mohammadi, Mahmoud; Li, Yipeng; Lo, Jane; Yip, Wendy (2025-08-03). "Evaluación y evaluación comparativa de agentes LLM: una revisión" . ACM Transactions on Intelligent Systems and Technology . 15 (3). ACM: 6129– 6139. doi : 10.1145/3711896.3736570 . ISBN 979-8-4007-1454-2.
- ↑ Brandom, Russell (22 de enero de 2026). "¿Están los agentes de IA preparados para el lugar de trabajo? Un nuevo punto de referencia genera dudas" .
- ↑ "Clasificación de llamadas a funciones de Berkeley" . gorilla.cs.berkeley.edu . Consultado el 11 de marzo de 2025 .
- ↑ Richarte, Martín G.; Toscano, Facundo; Lambas, Diego G.; Luparello, Heliana E.; Luiz Filipe Guimarães; Fabris, Julio C. (2025). "Pares de cuásares como trazadores de estructuras a gran escala". Astronomía y Astrofísica . 700 : A269. arXiv : 2504.01251 . Código Bib : 2025A y A...700A.269R . doi : 10.1051/0004-6361/202554998 .
- ↑ Bonneau, Pierre; Mazzilli, Emmanuel (2023). "Curvas casi holomorfas en hipersuperficies analíticas reales". arXiv : 2311.01298 [ math.CV ].
- ↑ Patwardhan, Tejal; Dias, Rachel; Proehl, Elizabeth; Kim, Grace (2025). "GDPval: Evaluación del rendimiento de modelos de IA en tareas económicas valiosas del mundo real". arXiv : 2510.04374 [ cs.LG ].
- ^ Deng, Xiang; Gu, Yu; Zheng, Boyuan; Chen, Shijie; Stevens, Sam; Wang, Boshi; Sol, Huan; Su, Yu (15 de diciembre de 2023). "Mind2Web: Hacia un agente generalista para la Web" . Avances en los sistemas de procesamiento de información neuronal . 36 : 28091–28114 . arXiv : 2306.06070 .
- ↑ "OSWorld: Evaluación comparativa de agentes multimodales para tareas abiertas en entornos informáticos reales" . os-world.github.io . Consultado el 24 de febrero de 2025 .
- ↑ Li, Tianyin (2025). "Simulaciones cuánticas de electrodinámica cuántica en el calibre de Coulomb". Physical Review D . 112 (5) 054512. arXiv : 2406.01204 . Bibcode : 2025PhRvD.112e4512L . doi : 10.1103/mbnt-svfp .
- ↑ Barres, Victor; Dong, Honghua; Ray, Soham; Si, Xujie; Narasimhan, Karthik (2025). "$τ^2$-Bench: Evaluación de agentes conversacionales en un entorno de control dual". arXiv : 2506.07982 [ cs.AI ].
- ↑ "Terminal-Bench" . Terminal-Bench . Consultado el 25 de mayo de 2025 .
- ↑ Ren, Kui; Soedjak, Nathan (2023). "Recuperación de coeficientes en un sistema de ecuaciones de Helmholtz semilineales a partir de datos internos". Problemas inversos . 40 (4): 045023. arXiv : 2307.01385 . Bibcode : 2024InvPr..40d5023R . doi : 10.1088/1361-6420/ad2cf9 .
- ^ Lin, Guying; Yang, Lei; Liu, Yuan; Zhang, Congyi; Hou, Junhui; Jin, Xiaogang; Komura, Taku; Keyser, Juan; Wang, Wenping (2024). "Sobre el muestreo óptimo para aprender SDF utilizando MLPS equipado con codificación posicional". arXiv : 2401.01391 [ cs.CV ].
- ↑ "Windows Agent Arena: Evaluación de agentes de sistema operativo multimodales a escala" . microsoft.github.io . Consultado el 24 de febrero de 2025 .
- ↑ "FACTS Grounding: Un nuevo punto de referencia para evaluar la veracidad de los grandes modelos de lenguaje" . Google DeepMind . 17 de diciembre de 2024. Consultado el 7 de junio de 2025 .
- ↑ Jacovi, Alon; Wang, Andrew; Alberti, Chris; Tao, Connie; Lipovetz, Jon; Olszewska, Kate; Haas, Lukas; Liu, Michelle; Keating, Nate; Bloniarz, Adam; Saroufim, Carl; Fry, Corey; Marcus, Dror; Kukliansky, Doron; Gaurav Singh Tomar; Swirhun, James; Xing, Jinwei; Wang, Lily; Gurumurthy, Madhu; Aaron, Michael; Ambar, Moran; Fellinger, Rachana; Wang, Rui; Zhang, Zizhao; Goldshtein, Sasha; Das, Dipanjan (2025). "The FACTS Grounding Leaderboard: Benchmarking LLMS' Ability to Ground Responses to Long-Form Input". arXiv : 2501.03200 [ cs.CL ].
- ^ Zhang, Xinrong; Chen, Yingfa; Hu, Shengding; Xu, Zihang; Chen, Junhao; Moo Khai Hao; Han, Xu; Zhen Leng tailandés; Wang, Shuo; Liu, Zhiyuan; Sol, Maosong (2024). "$\infty$Bench: Ampliación de la evaluación de contexto largo más allá de 100.000 tokens". arXiv : 2402.13718 [ cs.CL ].
- ↑ An, Chenxin; Gong, Shansan; Zhong, Ming; Zhao, Xingjian; Li, Mukai; Zhang, Jun; Kong, Lingpeng; Qiu, Xipeng (agosto de 2024). Ku, Lun-Wei; Martins, Andre; Srikumar, Vivek (eds.). "L-Eval: Instituting Standardized Evaluation for Long Context Language Models" . Actas de la 62.ª Reunión Anual de la Asociación de Lingüística Computacional (Volumen 1: Artículos largos) . Bangkok, Tailandia: Asociación de Lingüística Computacional: 14388–14411 . arXiv : 2307.11088 . doi : 10.18653/v1/2024.acl-long.776 .
- ↑ Lee, Jinhyuk; Chen, Anthony; Dai, Zhuyun; Dua, Dheeru; Devendra Singh Sachan; Boratko, Michael; Luan, Yi; Arnold, Sébastien MR; Perot, Vincent; Dalmia, Siddharth; Hu, Hexiang; Lin, Xudong; Pasupat, Panupong; Amini, Aida; Cole, Jeremy R.; Riedel, Sebastian; Naim, Iftekhar; Chang, Ming-Wei; Guu, Kelvin (2024). "¿Pueden los modelos de lenguaje de contexto largo englobar la recuperación, RAG, SQL y más?". arXiv : 2406.13121 [ cs.CL ].
- ↑ Li, Tianle; Zhang, Ge; Quy Duc Do; Yue, Xiang; Chen, Wenhu (2024). "Los sistemas LLMS de contexto largo tienen dificultades con el aprendizaje en contexto prolongado". arXiv : 2404.02060 [ cs.CL ].
- ↑ "LongBench v2" . longbench2.github.io . Consultado el 21 de febrero de 2025 .
- ↑ Bai, Yushi; Tu, Shangqing; Zhang, Jiajie; Peng, Hao; Wang, Xiaozhi; Lv, Xin; Cao, Shulin; Xu, Jiazheng; Hou, Lei; Dong, Yuxiao; Tang, Jie; Li, Juanzi (2024). "LongBench v2: hacia una comprensión y un razonamiento más profundos en multitareas realistas de contexto largo". arXiv : 2412.15204 [ cs.CL ].
- ↑ Tay, Yi; Dehghani, Mostafa; Abnar, Samira; Shen, Yikang; Bahri, Dara; Pham, Philip; Rao, Jinfeng; Yang, Liu; Ruder, Sebastian; Metzler, Donald (2020). "Long Range Arena: A Benchmark for Efficient Transformers". arXiv : 2011.04006 [ cs.LG ].
- ^ Vodrahalli, Kiran; Ontañón, Santiago; Tripuraneni, Nilesh; Xu, Kelvin; Jainista, Sanil; Shivanna, Rakesh; Hui, Jeffrey; Dikkala, Nishanth; Kazemi, Mehran (20 de septiembre de 2024). "Miguel Ángel: evaluaciones de contexto largas más allá de los pajares a través de consultas de estructura latente". arXiv : 2409.12640 [ cs.CL ].
- ↑ Visser, Eline (2022). Una gramática del kalamang . Language Science Press. ISBN 978-3-96110-343-0.
- ^ Visser, Eline (24 de septiembre de 2021), dictionaria/kalamang: diccionario Kalamang , doi : 10.5281/ZENODO.5526419 , consultado el 5 de abril de 2025
- ↑ Tanzer, Garrett; Suzgun, Mirac; Visser, Eline; Jurafsky, Dan; Melas-Kyriazi, Luke (2023). "Un punto de referencia para aprender a traducir un nuevo idioma a partir de un solo libro de gramática". arXiv : 2309.16575 [ cs.CL ].
- ↑ @GregKamradt (8 de noviembre de 2023). "Prueba de presión GPT-4-128K con recuperación de contexto larga..." ( Tweet ) – vía X (anteriormente Twitter) .
- ↑ Modarressi, Ali; Deilamsalehy, Hanieh; Dernoncourt, Franck; Bui, Trung; Rossi, Ryan A.; Yoon, Seunghyun; Schütze, Hinrich (2025). "NoLiMa: Evaluación de contexto largo más allá de la coincidencia literal". arXiv : 2502.05167 [ cs.CL ].
- ↑ Hsieh, Cheng-Ping; Sun, Simeng; Kriman, Samuel; Acharya, Shantanu; Rekesh, Dima; Jia, Fei; Zhang, Yang; Ginsburg, Boris (2024). "RULER: ¿Cuál es el tamaño real del contexto de sus modelos de lenguaje de contexto largo?". arXiv : 2404.06654 [ cs.CL ].
- ↑ Shaham, Uri; Ivgi, Maor; Efrat, Avia; Berant, Jonathan; Levy, Omer (2023). "ZeroSCROLLS: Un benchmark de cero disparos para la comprensión de textos largos". arXiv : 2305.14196 [ cs.CL ].
- ↑ Kushman, Nate; Artzi, Yoav; Zettlemoyer, Luke; Barzilay, Regina (junio de 2014). Toutanova, Kristina; Wu, Hua (eds.). "Aprendizaje para resolver automáticamente problemas verbales de álgebra" . Actas de la 52.ª Reunión Anual de la Asociación de Lingüística Computacional (Volumen 1: Artículos extensos) . Baltimore, Maryland: Asociación de Lingüística Computacional: 271–281 . doi : 10.3115/v1/P14-1026 .
- ↑ Huang, Danqing; Shi, Shuming; Lin, Chin-Yew; Yin, Jian; Ma, Wei-Ying (agosto de 2016). Erk, Katrin; Smith, Noah A. (eds.). "¿Qué tan bien resuelven las computadoras los problemas matemáticos verbales? Construcción y evaluación de conjuntos de datos a gran escala" . Actas de la 54.ª Reunión Anual de la Asociación de Lingüística Computacional (Volumen 1: Artículos extensos) . Berlín, Alemania: Asociación de Lingüística Computacional: 887–896 . doi : 10.18653/v1/P16-1084 .
- ↑ Ling, Wang; Yogatama, Dani; Dyer, Chris; Blunsom, Phil (julio de 2017). Barzilay, Regina; Kan, Min-Yen (eds.). "Inducción de programas mediante generación de racionalidad: aprendizaje para resolver y explicar problemas verbales algebraicos" . Actas de la 55.ª Reunión Anual de la Asociación de Lingüística Computacional (Volumen 1: Artículos extensos) . Vancouver, Canadá: Asociación de Lingüística Computacional: 158–167 . arXiv : 1705.04146 . doi : 10.18653/v1/P17-1015 .
- ↑ Glazer, Elliot; Erdil, Ege; Besiroglu, Tamay; Chicharro, Diego; et al. (2024). "FrontierMath: Un punto de referencia para evaluar el razonamiento matemático avanzado en IA". arXiv : 2411.04872 [ cs.AI ].
- ↑ "Acerca de FrontierMath" . Epoch AI . Consultado el 2 de octubre de 2025 .
- ↑ IA, Epoch (27-01-2026). "Introducción a FrontierMath: Problemas abiertos" . Epoch AI . Consultado el 20-03-2026 .
- ↑ "FrontierMath: Problemas abiertos - Desafíos matemáticos sin resolver" . Epoch AI . Consultado el 20 de marzo de 2026 .
- ↑ Zhang, Hugh; Da, Jeff; Lee, Dean; Robinson, Vaughn; et al. (2024). "Un examen cuidadoso del rendimiento de modelos de lenguaje grandes en aritmética de primaria". arXiv : 2405.00332 [ cs.CL ].
- ↑ Cobbe, Karl; Kosaraju, Vineet; Bavarian, Mohammad; Chen, Mark; et al. (2021). "Entrenamiento de verificadores para resolver problemas matemáticos verbales". arXiv : 2110.14168 [ cs.LG ].
- ↑ "madrylab/gsm8k-platinum · Conjuntos de datos en Hugging Face" . huggingface.co . Consultado el 7 de marzo de 2025 .
- ↑ Luong, Thang; Hwang, Dawsen; Nguyen, Hoang H; Ghiasi, Golnaz; et al. (noviembre de 2025). Christodoulopoulos, Christos; Chakraborty, Tanmoy; Rose, Carolyn; Peng, Violet (eds.). "Hacia un razonamiento matemático robusto" . Actas de la Conferencia de 2025 sobre Métodos Empíricos en Procesamiento del Lenguaje Natural . Suzhou, China: Asociación de Lingüística Computacional: 35406–35430 . ISBN 979-8-89176-332-6.
- ↑ Luong, Thang; Hwang, Dawsen; Nguyen, Hoang H.; Ghiasi, Golnaz; et al., "Hacia un razonamiento matemático robusto", Actas de la Conferencia de 2025 sobre Métodos Empíricos en Procesamiento del Lenguaje Natural , consultado el 8 de noviembre de 2025 a través de IMO-Bench
- ↑ Hendrycks, Dan; Burns, Collin; Kadavath, Saurav; Arora, Akul; Basart, Steven; Tang, Eric; Song, Dawn; Steinhardt, Jacob (2021). "Medición de la resolución de problemas matemáticos con el conjunto de datos MATH". arXiv : 2103.03874 [ cs.LG ].
- ↑ "MATH-Perturb" . math-perturb.github.io . Consultado el 9 de abril de 2025 .
- ↑ Wang, Yan; Liu, Xiaojiang; Shi, Shuming (septiembre de 2017). "Solucionador neuronal profundo para problemas matemáticos verbales" . En Palmer, Martha; Hwa, Rebecca; Riedel, Sebastian (eds.). Actas de la Conferencia de 2017 sobre Métodos Empíricos en Procesamiento del Lenguaje Natural . Copenhague, Dinamarca: Asociación de Lingüística Computacional. págs. 845–854 . doi : 10.18653/v1/D17-1088 .
- ↑ "MathArena.ai" . matharena.ai . Consultado el 22 de febrero de 2025 .
- ↑ Liu, Hongwei; Zheng, Zilong; Qiao, Yuxuan; Duan, Haodong; et al. (2024). "MathBench: Evaluación de la competencia teórica y aplicada de LLMS con un benchmark matemático jerárquico". arXiv : 2405.12209 [ cs.CL ].
- ^ evaluación-matemática (26 de enero de 2025), evaluación-matemática/MathEval , consultado el 27 de enero de 2025
- ↑ Amini, Aida; Gabriel, Saadia; Lin, Peter; Koncel-Kedziorski, Rik; Choi, Yejin; Hajishirzi, Hannaneh (2019). "MathQA: Hacia la resolución interpretable de problemas matemáticos verbales con formalismos basados en operaciones". arXiv : 1905.13319 [ cs.CL ].
- 1 2 Austin, Jacob; Odena, Augustus; Nye, Maxwell; Bosma, Maarten; Michalewski, Henryk; Dohan, David; Jiang, Ellen; Cai, Carrie; Terry, Michael; Le, Quoc; Sutton, Charles (2021). "Program Synthesis with Large Language Models". arXiv : 2108.07732 [ cs.PL ].
- ↑ openai/miniF2F , OpenAI, 1 de febrero de 2025 , consultado el 3 de febrero de 2025
- ↑ Gao, Bofei; Song, Feifan; Yang, Zhe; Cai, Zefan; et al. (2024). "Omni-MATH: Un punto de referencia matemático universal de nivel de olimpiada para grandes modelos de lenguaje". arXiv : 2410.07985 [ cs.CL ].
- ↑ Azerbayev, Zhangir; Piotrowski, Bartosz; Schoelkopf, Hailey; Ayers, Edward W.; Radev, Dragomir; Avigad, Jeremy (2023). "ProofNet: Autoformalización y demostración formal de matemáticas de nivel universitario". arXiv : 2302.12433 [ cs.CL ].
- ^ Azerbayev, Zhangir (2 de abril de 2025), zhangir-azerbayev/ProofNet , consultado el 3 de abril de 2025
- ↑ deepseek-ai/DeepSeek-Prover-V1.5 , DeepSeek, 2025-04-01 , recuperado el 2025-04-03
- ↑ Tsoukalas, George; Lee, Jasper; Jennings, John; Xin, Jimmy; Ding, Michelle; Jennings, Michael; Thakur, Amitayush; Chaudhuri, Swarat (2024). "PutnamBench: Evaluación de demostradores de teoremas neuronales en la competición matemática Putnam". arXiv : 2407.11214 [ cs.AI ].
- ↑ "PutnamBench: Un benchmark matemático multilingüe para la demostración formal de teoremas" . trishullab.github.io . Consultado el 2 de abril de 2025 .
- ↑ Chen, Wenhu; Yin, Ming; Ku, Max; Lu, Pan; Wan, Yixin; Ma, Xueguang; Xu, Jianyu; Wang, Xinyi; Xia, Tony (diciembre de 2023). "TheoremQA: un conjunto de datos de respuesta a preguntas basado en teoremas" . En Bouamor, Houda; Pino, Juan; Bali, Kalika (eds.). Actas de la Conferencia de 2023 sobre Métodos Empíricos en Procesamiento del Lenguaje Natural . Singapur: Asociación de Lingüística Computacional. págs. 7889–7901 . arXiv : 2305.12524 . doi : 10.18653 /v1/2023.emnlp-main.489 .
- ^ Chernyshev, Konstantin; Polshkov, Vitaliy; Artemova, Ekaterina; Myasnikov, Alex; Stepánov, Vlad; Miasnikov, Alexei; Tilga, Sergei (2024). "U-MATH: un punto de referencia a nivel universitario para evaluar habilidades matemáticas en LLMS". arXiv : 2412.03205 [ cs.CL ].
- ^ Aider-AI/polyglot-benchmark , Aider AI, 29 de marzo de 2025 , consultado el 30 de marzo de 2025
- ^ Hendrycks, Dan; Basart, Steven; Kadavath, Saurav; Mazeika, Mantas; Arora, Akul; Guo, Ethan; Quemaduras, Collin; Puranik, Samir; Él, Horacio; Canción, amanecer; Steinhardt, Jacob (2021). "Medición de la competencia en desafíos de codificación con aplicaciones". arXiv : 2105.09938 [ cs.SE ].
- ↑ Zhuo, Terry Yue; Chien, Vu Minh; Chim, Jenny; Hu, Han; Yu, Wenhao; Widyasari, Ratnadira; Yusuf, Imam Nur Bani; Zhan, Haolan; He, Junda; Paul, Indraneil; Brunner, Simon; Gong, Chen; Hoang, James; Zebaze, Armel Randy; Hong, Xiaoheng (2024-10-04). "BigCodeBench: Benchmarking Code Generation with Diverse Function Calls and Complex Instructions" . Iclr 2025. arXiv : 2406.15877 .
- ↑ "Clasificación de BigCodeBench" . bigcode-bench.github.io . Consultado el 9 de abril de 2025 .
- ↑ "CodeElo" . codeelo-bench.github.io . Consultado el 13 de febrero de 2025 .
- ↑ "Cybench" . cybench.github.io . Consultado el 10 de abril de 2025 .
- ^ Lai, Yuhang; Li, Chengxi; Wang, Yiming; Zhang, Tianyi; Zhong, Ruiqi; Zettlemoyer, Lucas; Scott Wen-tau Yih; Frito, Daniel; Wang, Asdi; Yu, Tao (2022). "DS-1000: un punto de referencia natural y confiable para la generación de código de ciencia de datos". arXiv : 2211.11501 [ cs.SE ].
- ↑ "DS-1000: Un punto de referencia natural y fiable para la generación de código en ciencia de datos" . ds1000-code-gen.github.io . Consultado el 11 de marzo de 2025 .
- ^ Jing, Liqiang; Huang, Zhehui; Wang, Xiaoyang; Yao, Wenlin; Yu, Wenhao; Mamá, Kaixin; Zhang, Hongming; Du, Xinya; Yu, Dong (2024). "DSBench: ¿Qué tan lejos están los agentes de ciencia de datos de convertirse en expertos en ciencia de datos?". arXiv : 2409.07703 [ cs.AI ].
- ↑ Rein, David; Becker, Joel; Deng, Amy; Nix, Seraphina; Canal, Chris; O'Connel, Daniel; Arnott, Pip; Bloom, Ryan; Broadley, Thomas; Garcia, Katharyn; Goodrich, Brian; Hasin, Max; Jawhar, Sami; Kinniment, Megan; Kwa, Thomas; Lajko, Aron; Rush, Nate; Lucas Jun Koba Sato; Sydney Von Arx; West, Ben; Chan, Lawrence; Barnes, Elizabeth (2025). "HCAST: Tareas de software de autonomía calibradas por humanos". arXiv : 2503.17354 [ cs.AI ].
- ↑ Ouyang, Anne; Guo, Simon; Arora, Simran; Zhang, Alex L.; Hu, William; Ré, Christopher; Mirhoseini, Azalia (2025). "KernelBench: ¿Puede LLMS escribir kernels de GPU eficientes?". arXiv : 2502.10517 [ cs.LG ].
- ↑ "PaperBench: Evaluación de la capacidad de la IA para replicar la investigación en IA" . openai.com . 2 de abril de 2025. Consultado el 2 de abril de 2025 .
- ^ Chen, Ziru; Chen, Shijie; Ning, Yuting; Zhang, Qianheng; Wang, Boshi; Yu, Botao; Li, Yifei; Liao, Zeyi; Wei, Chen (31 de marzo de 2025), ScienceAgentBench: hacia una evaluación rigurosa de agentes del lenguaje para el descubrimiento científico basado en datos , arXiv : 2410.05080
- ^ Mamá, Zeyao; Zhang, Bohan; Zhang, Jing; Yu, Jifan; Zhang, Xiaokang; Zhang, Xiaohan; Luo, Sijia; Wang, Xi; Tang, Jie (16 de diciembre de 2024). "SpreadsheetBench: hacia un desafío a la manipulación de hojas de cálculo en el mundo real" . Avances en los sistemas de procesamiento de información neuronal . 37 : 94871-94908 .
- ↑ Jimenez, Carlos E.; Yang, John; Wettig, Alexander; Yao, Shunyu; Pei, Kexin; Press, Ofir; Narasimhan, Karthik (2023). "SWE-bench: ¿Pueden los modelos de lenguaje resolver problemas reales de GitHub?". arXiv : 2310.06770 [ cs.CL ].
- ↑ "Presentamos SWE-bench Verified" . openai.com .
- ^ Deng, Xiang; Papá, Jeff; Pan, Edwin; Él, Yan; Ide, Charles; Garg, canaco; Lauffer, Niklas; Parque, Andrés; Pasari, Nitin; Rane, Chetan; Sampath, Karmini; Krishnan, maya; Kundurthy, Srivatsa; Hendryx, Sean M.; Wang, Zifan; Zhang, Chen Bo Calvin; Jacobson, Noé; Liu, Bing; Kenstler, Brad (2025). SWE-Bench Pro: ¿Pueden los agentes de IA resolver tareas de ingeniería de software a largo plazo? .
- ↑ "Por qué SWE-bench Verified ya no mide las capacidades de codificación de vanguardia" . OpenAI . 23 de febrero de 2026. Consultado el 30 de marzo de 2026 .
- ^ Zan, Daoguang; Huang, Zhirong; Liu, Wei; Chen, Hanwu; Zhang, Linhao; Xin, Shulin; Chen, Lu; Liu, Qi; Zhong, Xiaojian; Li, Aoyan; Liu, Siyao; Xiao, Yongsheng; Chen, Liangqiang; Zhang, Yuyu; Su, Jing; Liu, Tianyu; Largo, Rui; Shen, Kai; Xiang, Liang (2025). "Multi-SWE-bench: un punto de referencia multilingüe para la resolución de problemas". arXiv : 2504.02605 [ cs.SE ].
- ↑ "SWE-bench" . www.swebench.com . Consultado el 11 de febrero de 2025 .
- ↑ openai/SWELancer-Benchmark , OpenAI, 21/02/2025 , consultado el 21/02/2025
- ↑ Miserendino, Samuel; Wang, Michele; Patwardhan, Tejal; Heidecke, Johannes (2025). "SWE-Lancer: ¿Puede Frontier LLMS ganar 1 millón de dólares con la ingeniería de software independiente del mundo real?". arXiv : 2502.12115 [ cs.LG ].
- ^ Cui, Ruixiang (3 de febrero de 2025), ruixiangcui/AGIEval , consultado el 3 de febrero de 2025
- ↑ "Premio ARC" . Premio ARC . Consultado el 27 de enero de 2025 .
- ↑ "Aprender a razonar con LLM" . openai.com . 12 de septiembre de 2024. Consultado el 27 de febrero de 2025 .
- ↑ Rein, David; Betty Li Hou; Asa Cooper Stickland; Petty, Jackson; Richard Yuanzhe Pang; Dirani, Julien; Michael, Julian; Bowman, Samuel R. (2023). "GPQA: Un benchmark de preguntas y respuestas a prueba de Google para nivel de posgrado". arXiv : 2311.12022 [ cs.AI ].
- ^ Rein, I. David (24 de agosto de 2025), idavidrein/gpqa , consultado el 25 de agosto de 2025
- ↑ Rein, David (15 de mayo de 2024). "¿Pueden los buenos puntos de referencia contener errores? – Grupo de Investigación de Alineación de la NYU" . Recuperado el 15 de septiembre de 2025 .
- ↑ Equipo, MAP; et al. (2025). "SuperGPQA: Escalando la evaluación de LLM en 285 disciplinas de posgrado". arXiv : 2502.14739 [ cs.CL ].
- ↑ "El último examen de la humanidad" . lastexam.ai . Consultado el 2 de febrero de 2025 .
- ↑ "LiveBench" . livebench.ai . Consultado el 27 de enero de 2025 .
- ↑ "MathVista: Evaluación del razonamiento matemático en contextos visuales" . mathvista.github.io . Consultado el 7 de marzo de 2025 .
- ↑ "OlympicArena: Evaluación comparativa del razonamiento cognitivo multidisciplinario para la IA superinteligente" . gair-nlp.github.io . Consultado el 3 de febrero de 2025 .
- ^ Él, Chaoqun; Luo, Renjie; Bai, Yuzhuo; Hu, Shengding; Zhen Leng tailandés; Shen, Junhao; Hu, Jinyi; Han, Xu; Huang, Yujie; Zhang, Yuxiang; Liu, Jie; Qi, Lei; Liu, Zhiyuan; Sol, Maosong (2024). "OlympiadBench: un punto de referencia desafiante para promover la AGI con problemas científicos multimodales bilingües a nivel de la Olimpiada". arXiv : 2402.14008 [ cs.CL ].
- ↑ "SimpleBench" . simple-bench.com . Consultado el 9 de abril de 2025 .
- ↑ Kaesberg, Lars Benedikt; Wahle, Jan Philip; Ruas, Terry; Gipp, Bela (09-11-2025). Christodoulopoulos, Christos; Chakraborty, Tanmoy; Rose, Carolyn; Peng, Violet (eds.). "SPaRC: Un desafío de razonamiento para la búsqueda de rutas espaciales" . Actas de la Conferencia de 2025 sobre Métodos Empíricos en Procesamiento del Lenguaje Natural . Suzhou, China: Asociación de Lingüística Computacional: 10359–10390 . doi : 10.18653/v1/2025.emnlp-main.526 . ISBN 979-8-89176-332-6.
Enlaces externos
- Estadísticas de LLM : base de datos interactiva de código abierto que compara el rendimiento de diferentes programas de maestría en derecho (LLM).
- Comparación de software
- Conjuntos de datos en el aprendizaje automático
- Procesamiento del lenguaje natural
- Puntos de referencia (informática)