En inteligencia artificial , un modelo base ( FM ), también conocido como modelo x grande ( LxM , donde "x" es una variable que representa cualquier texto, imagen, sonido, etc.), es un modelo de aprendizaje automático o aprendizaje profundo entrenado en grandes conjuntos de datos para que pueda aplicarse a una amplia gama de casos de uso. [ 1 ] Las aplicaciones de IA generativa, como los modelos de lenguaje grandes (LLM), son ejemplos comunes de modelos base. [ 1 ]
La creación de modelos básicos suele ser muy intensiva en recursos, y los modelos más avanzados cuestan cientos de millones de dólares para cubrir los gastos de adquisición, organización y procesamiento de conjuntos de datos masivos, así como la potencia de cálculo necesaria para el entrenamiento. [ 2 ] Estos costos se derivan de la necesidad de una infraestructura sofisticada, tiempos de entrenamiento prolongados y hardware avanzado, como las GPU . En cambio, adaptar un modelo básico existente para una tarea específica o usarlo directamente es mucho menos costoso, ya que utiliza capacidades preentrenadas y normalmente solo requiere un ajuste fino en conjuntos de datos más pequeños y específicos para la tarea.
Ejemplos tempranos de modelos fundamentales son modelos de lenguaje como la serie GPT de OpenAI y BERT de Google . [ 3 ] [ 4 ] Más allá del texto, se han desarrollado modelos fundamentales en una variedad de modalidades , incluyendo DALL-E , difusión estable y Flamingo [ 5 ] para imágenes, MusicGen [ 6 ] y LLark [ 7 ] para música, y RT-2 [ 8 ] para control robótico. También se están desarrollando modelos fundamentales para campos como la astronomía, [ 9 ] la radiología, [ 10 ] la oftalmología, [ 11 ] la genómica, [ 12 ] las ciencias de la tierra, [ 13 ] la codificación, [ 14 ] la predicción de series temporales , [ 15 ] las matemáticas, [ 16 ] y la química. [ 17 ]
Definiciones
El Centro de Investigación sobre Modelos Fundamentales (CRFM) del Instituto Stanford para la Inteligencia Artificial Centrada en el Ser Humano (HAI) acuñó el término "modelo fundamental" en agosto de 2021 [ 18 ] para referirse a "cualquier modelo que se entrena con datos amplios (generalmente usando auto-supervisión a gran escala) que se puede adaptar (por ejemplo, ajustar) a una amplia gama de tareas posteriores". [ 19 ] Esto se basó en su observación de que los términos preexistentes, aunque se superponían, no eran adecuados, afirmando que "' modelo de lenguaje grande ' era demasiado limitado dado que el enfoque no es solo el lenguaje; 'modelo auto-supervisado' era demasiado específico para el objetivo de entrenamiento; y 'modelo preentrenado' sugería que la acción notable sucedía después del 'preentrenamiento'". [ 20 ] El término "modelo fundamental" se eligió en lugar de "modelo fundacional" [ 21 ] porque "fundacional" implica que estos modelos proporcionan principios fundamentales de una manera que "fundamento" no lo hace. [ 22 ] El término modelo de lenguaje-visión (VLM) también se utiliza como un casi sinónimo.
A medida que los gobiernos regulan los modelos de fundación, han surgido nuevas definiciones legales.
- En Estados Unidos, la Orden Ejecutiva sobre el Desarrollo y Uso Seguro, Confiable y Protegido de la Inteligencia Artificial, ahora revocada, definía un modelo fundamental como "un modelo de IA entrenado con datos amplios; que generalmente utiliza auto-supervisión ; que contiene al menos decenas de miles de millones de parámetros; y que es aplicable a una amplia gama de contextos". [ 23 ]
- En Estados Unidos, la propuesta de Ley de Transparencia del Modelo de Fundación de IA de 2023 [ 24 ] de los Representantes de la Cámara Don Beyer ( D - VA ) y Anna Eshoo (D- CA ) define un modelo de fundación como "un modelo de inteligencia artificial entrenado con datos amplios, que generalmente utiliza autosupervisión, generalmente contiene al menos 1.000.000.000 de parámetros, es aplicable en una amplia gama de contextos y exhibe, o podría modificarse fácilmente para exhibir, altos niveles de rendimiento en tareas que podrían representar un riesgo grave para la seguridad, la seguridad económica nacional, la salud o seguridad pública nacional, o cualquier combinación de esos asuntos".
- En la Unión Europea, la posición negociada del Parlamento Europeo sobre la Ley de IA de la UE define un modelo fundamental como un "modelo de IA entrenado con datos amplios a gran escala, diseñado para la generalidad de los resultados y adaptable a una amplia gama de tareas específicas".
- En el Reino Unido, el Informe inicial sobre los modelos fundamentales de IA de la Autoridad de Competencia y Mercados [ 1 ] define los modelos fundamentales como "un tipo de tecnología de IA que se entrena con grandes cantidades de datos que se pueden adaptar a una amplia gama de tareas y operaciones".
Las definiciones de Estados Unidos son las únicas que hacen referencia al tamaño de un modelo base, y difieren en magnitud. La definición de Beyer y Eshoo también especifica que los modelos base deben alcanzar un nivel de rendimiento que represente un peligro potencial. En cambio, la definición de la UE exige que el modelo esté diseñado para generar resultados generales. Todas las definiciones coinciden en que los modelos base deben entrenarse con una amplia gama de datos y tener aplicaciones potenciales en diversos ámbitos.
Historia
Tecnológicamente, los modelos base se construyen utilizando técnicas de aprendizaje automático consolidadas, como redes neuronales profundas , aprendizaje por transferencia y aprendizaje autosupervisado . Los modelos base se diferencian de las técnicas anteriores en que son modelos de propósito general que funcionan como una infraestructura reutilizable, en lugar de modelos personalizados y específicos para cada tarea.
Los avances en el paralelismo computacional (por ejemplo, las GPU CUDA ) y los nuevos desarrollos en la arquitectura de redes neuronales (por ejemplo, los Transformers ), y el mayor uso de datos de entrenamiento con supervisión mínima contribuyeron al auge de los modelos base. Los modelos base comenzaron a materializarse como la última ola de modelos de aprendizaje profundo a finales de la década de 2010. [ 25 ] En relación con la mayoría de los trabajos anteriores sobre aprendizaje profundo, estos modelos de lenguaje demostraron el potencial del entrenamiento en conjuntos de datos mucho más grandes obtenidos de la web utilizando objetivos auto-supervisados (por ejemplo, predecir la siguiente palabra en un gran corpus de texto). Estos enfoques, que se basan en trabajos anteriores como word2vec y GloVe , se desviaron de los enfoques supervisados anteriores que requerían datos anotados (por ejemplo, etiquetas obtenidas mediante crowdsourcing).
Los lanzamientos de Stable Diffusion y ChatGPT en 2022 (inicialmente impulsados por el modelo GPT-3.5) llevaron a que los modelos base y la IA generativa entraran en el debate público generalizado. Además, los lanzamientos de LLaMA , Llama 2 y Mistral en 2023 contribuyeron a un mayor énfasis en cómo se publican los modelos base, obteniendo los modelos base abiertos un gran apoyo [ 26 ] y un escrutinio considerable. [ 27 ]
Conceptos relacionados
Modelos de frontera
Ciertos modelos básicos altamente avanzados se denominan "modelos frontera", los cuales tienen el potencial de "poseer capacidades peligrosas suficientes para representar graves riesgos para la seguridad pública". [ 28 ] Estas "capacidades peligrosas" se derivan del mal uso accidental o intencional de dichos modelos, lo cual, junto con su naturaleza poderosa, puede provocar graves daños. A medida que los modelos básicos continúan mejorando, algunos investigadores de IA especulan que casi todos los modelos básicos de próxima generación se considerarán modelos frontera.
Dado que el concepto de capacidades peligrosas es inherentemente subjetivo, no existe una designación estricta sobre qué modelos fundamentales califican como modelos de frontera. Sin embargo, algunas ideas generalmente aceptadas sobre capacidades suficientemente peligrosas incluyen:
- Diseño y síntesis de nuevas armas biológicas o químicas [ 29 ]
- Producir y propagar desinformación convincente y personalizada con instrucciones mínimas para el usuario [ 30 ]
- Aprovechamiento de capacidades cibernéticas ofensivas sin precedentes [ 31 ]
- Evadir el control humano mediante medios engañosos [ 32 ]
La definición estadounidense (a través del Instituto de Seguridad de la IA del NIST ) también vinculó el estatus de "frontera" al umbral técnico de computación para crear requisitos legales objetivos. [ 33 ]
Debido a las capacidades únicas de los modelos de vanguardia, resulta difícil regular eficazmente su desarrollo e implementación. Debido a su naturaleza emergente, pueden surgir espontáneamente nuevas capacidades peligrosas en estos modelos, tanto durante su desarrollo como después de su implementación. [ 28 ] Además, dado que los modelos de vanguardia continúan adaptándose tras su implementación, sigue siendo difícil mitigar todos los daños derivados de los modelos ya implementados. Si un modelo de vanguardia es de código abierto o se publica en línea, también puede difundirse rápidamente, lo que dificulta aún más la labor de los reguladores al generar una falta de rendición de cuentas.
En respuesta, se crearon grupos como el Frontier Model Forum, fundado por OpenAI, Anthropic, Google y Microsoft, para crear estándares de seguridad para estos modelos fundamentales avanzados. [ 34 ] Ha surgido una red global de organismos gubernamentales e intergubernamentales para crear estándares de seguridad formales, incluyendo la Red Global de Institutos de Seguridad de la IA (AISIs) [ 35 ] y el "Proceso de IA de Hiroshima" (HAIP) del G7 [ 36 ] .
Inteligencia artificial de propósito general
Debido a su adaptabilidad a una amplia gama de casos de uso, los modelos fundacionales a veces se consideran ejemplos de IA de propósito general. Al diseñar la Ley de IA de la UE, el Parlamento Europeo ha declarado que una nueva ola de tecnologías de IA de propósito general da forma al ecosistema general de la IA. [ 37 ] La estructura más completa del ecosistema, además de las propiedades de los sistemas de IA de propósito general específicos, influye en el diseño de la política y la investigación de la IA. [ 38 ] Los sistemas de IA de propósito general también aparecen a menudo en la vida cotidiana de las personas a través de aplicaciones y herramientas como ChatGPT o DALL-E .
Organismos gubernamentales como el Parlamento Europeo han identificado la regulación de la IA de propósito general, como los modelos básicos, como una prioridad. Los sistemas de IA de propósito general suelen caracterizarse por su gran tamaño, opacidad y potencial de emergencia, factores que pueden generar daños no deseados. Dichos sistemas también influyen notablemente en las aplicaciones posteriores, lo que agrava aún más la necesidad de regulación. En cuanto a la legislación pertinente, diversas partes interesadas han presionado para que la Ley de IA de la UE incluya restricciones a los sistemas de IA de propósito general, que también se aplicarían a los modelos básicos.
Modelos mundiales
Los modelos del mundo a veces se describen como modelos fundamentales. [ 39 ] [ 40 ] Los modelos del mundo son una representación de un entorno destinada a predecir el estado de ese entorno después de tomar un conjunto de acciones, [ 41 ] [ 42 ] así como a modelar implícitamente conceptos físicos como la gravedad . [ 42 ] Las indicaciones de entrada para los modelos del mundo pueden incluir texto o imágenes, [ 43 ] [ 44 ] así como videos o escenas 3D, [ 45 ] y los entornos 3D resultantes se pueden exportar. [ 45 ] Los modelos del mundo, junto con la IA encarnada , los modelos multiagente y los modelos neurocientíficos del cerebro, se consideran alternativas a los grandes modelos de lenguaje para lograr la inteligencia artificial general . [ 46 ]
Los modelos del mundo no tienen una definición totalmente consensuada, pero se han dividido en dos ámbitos: uno para representar y comprender el entorno actual, y otro para predecir el estado futuro de dicho entorno. En el primer caso, los modelos del mundo se desarrollan utilizando aprendizaje por refuerzo basado en modelos y un proceso de decisión de Markov , empleando control predictivo basado en modelos o búsqueda en árbol de Monte Carlo para crear políticas. En el segundo caso, se pueden utilizar modelos de lenguaje ( multimodales ) de gran tamaño o modelos de generación de vídeo. Además, estos entornos pueden ser simulaciones inmersivas para entrenar agentes de IA que puedan interactuar en el mundo real. [ 47 ]
Historia
Quanta Magazine rastreó los modelos del mundo hasta una publicación de 1943 de Kenneth Craik sobre modelos mentales y el mundo de bloques de SHRDLU en la década de 1960. [ 48 ] Business Insider rastreó los modelos del mundo hasta un artículo de 1971 de Jay Wright Forrester . [ 46 ] Una idea relacionada de organización del conocimiento del mundo, la representación de marcos , fue propuesta por Marvin Minsky en 1974. [ 47 ]
En 2018, los investigadores David Ha y Jürgen Schmidhuber definieron modelos del mundo en el contexto del aprendizaje por refuerzo : un agente con un modelo de autoencoder variacional V para representar observaciones visuales, un modelo de red neuronal recurrente M para representar la memoria y un modelo lineal C para tomar decisiones. Sugirieron que los agentes entrenados con modelos del mundo en entornos que simulan la realidad podrían aplicarse a situaciones del mundo real. [ 49 ]
En 2022, Yann LeCun consideró un modelo del mundo (definido por él como una red neuronal que actúa como un modelo mental para aspectos del mundo que se consideran relevantes) como parte de un sistema más amplio de arquitectura cognitiva : otras redes neuronales análogas a diferentes regiones del cerebro . En su opinión, este marco podría conducir al razonamiento de sentido común . [ 50 ] [ 51 ] LeCun estimó que los modelos del mundo serían completamente funcionales a finales de la década de 2020 [ 52 ] o mediados de la década de 2030. [ 53 ]
Capacitación
Los modelos del mundo se entrenan con una variedad de modalidades de datos, incluyendo texto, imágenes, audio y video, y se han aplicado a la generación de video . [ 54 ] Un conjunto de datos de código abierto para modelos del mundo incluye mil millones de puntos de datos en múltiples modalidades (texto, imágenes, audio, video y nubes de puntos ), incluyendo 1 millón de anotaciones manuales . [ 42 ]
Ejemplos
TechCrunch vio a Sora como un ejemplo de un modelo mundial, [ 54 ] mientras que en enero de 2025, Nvidia lanzó su propio conjunto de modelos mundiales. [ 55 ] [ 40 ] El South China Morning Post escribió que Manycore Tech era otro ejemplo de empresas que buscaban construir un modelo mundial, viendo su trabajo como un ejemplo de inteligencia espacial . [ 56 ] En mayo de 2025, la Universidad de Inteligencia Artificial Mohamed bin Zayed lanzó un modelo mundial para construir simulaciones para probar agentes de IA . [ 57 ]
Google DeepMind también ha publicado dos modelos del mundo en un espacio bidimensional y en un espacio tridimensional , respectivamente, que fueron entrenados con datos de vídeo, y Google afirma que este último puede ser un entorno de entrenamiento para agentes de IA. [ 58 ] [ 59 ] Meta publicó un modelo del mundo en junio de 2025, [ 60 ] Tencent publicó un modelo del mundo de código abierto en julio de 2025. [ 61 ] Niantic Spatial , filial de Niantic , Inc. , está desarrollando un modelo del mundo utilizando escaneos de jugadores anonimizados de Pokémon GO . [ 62 ] [ 63 ] Otras empresas que planean construir modelos del mundo a partir de 2025 incluyen ByteDance [ 61 ] y xAI . [ 64 ]
Aplicaciones
Fei-Fei Li considera que los modelos del mundo se aplican a la robótica y a las obras creativas . Debido a la complejidad de estos modelos, aboga por estrategias más complejas en la adquisición , ingeniería , procesamiento y síntesis de datos . [ 65 ] Cofundó una empresa emergente dedicada a la creación de modelos del mundo, que, en 2024, planeaba hacerlo en tres fases: incorporar la comprensión del espacio tridimensional junto con el tiempo; brindar soporte para la realidad aumentada ; y brindar soporte para la robótica. [ 66 ] Su empresa emergente, World Labs, lanzó su modelo comercial del mundo, Marble, en noviembre de 2025. [ 67 ]
Los modelos del mundo están destinados a ser utilizados en medios interactivos (como videojuegos y películas [ 68 ] ) y simulación de entornos. [ 69 ] Entre los casos de uso propuestos para los modelos del mundo se incluyen la planificación de acciones y la predicción de resultados. [ 67 ] Otras aplicaciones incluyen simulacros sociales para simular sistemas sociales . [ 47 ] Wired comparó los modelos del mundo con el metaverso , [ 66 ] mientras que Business Insider señaló posibles aplicaciones militares . [ 65 ]
En 2025, los modelos mundiales se están aplicando a la guerra con drones , la robótica y los vehículos autónomos . El Wall Street Journal especuló que los modelos mundiales podrían mejorar el razonamiento espacial de los modelos de inteligencia artificial y automatizar con éxito tanto los trabajos manuales como los de oficina . [ 70 ] A octubre de 2025, la investigación ha mostrado resultados mixtos en las capacidades de razonamiento espacial de los modelos de texto a vídeo (en particular, Veo 3 ). [ 71 ] En oftalmología, los modelos fundamentales se han aplicado a la obtención de imágenes de la retina, incluida la tomografía de coherencia óptica volumétrica [ 72 ]
Preocupaciones
TechCrunch señaló que los modelos del mundo podrían usar más datos que los modelos de lenguaje grandes y requerirían una potencia computacional significativamente mayor (incluido el uso de miles de GPU para entrenamiento e inferencia). [ 51 ] [ 54 ] También señaló el riesgo de alucinaciones , sesgo de cobertura y sesgo algorítmico . [ 54 ] De manera similar, The Financial Times señaló la dificultad y el costo de recopilar datos para simular el mundo y entrenar modelos para usar esos datos. [ 64 ]
Los profesionales creativos han expresado su preocupación de que los modelos mundiales puedan perturbar los empleos en sus industrias. [ 69 ]
Otras preocupaciones incluyen la privacidad de los datos , [ 47 ] la simulación de situaciones dañinas, [ 47 ] la desinformación y la información errónea , [ 47 ] los comportamientos emergentes , [ 73 ] y los derechos de autor . [ 68 ]
Detalles técnicos
Arquitectura del modelo
Para que un modelo base se generalice eficazmente, debe adquirir representaciones ricas de los datos de entrenamiento. Por consiguiente, en la construcción de modelos base se suelen preferir arquitecturas de modelos expresivas que procesen eficientemente grandes volúmenes de datos. [ 19 ] Actualmente, la arquitectura Transformer es la opción de facto para la construcción de modelos base en diversas modalidades. [ 74 ]
Capacitación
Los modelos base se construyen optimizando una función de pérdida , que es una función matemática que determina cómo se actualizan los parámetros del modelo en función de las predicciones del modelo sobre los datos de entrenamiento. [ 75 ] Los modelos de lenguaje a menudo se entrenan con un objetivo de predicción de tokens siguientes, que se refiere al grado en que el modelo es capaz de predecir el siguiente token en una secuencia. Los modelos de imágenes se entrenan comúnmente con objetivos de aprendizaje contrastivo o de difusión. Para el aprendizaje contrastivo, las imágenes se aumentan aleatoriamente antes de ser evaluadas en función de la similitud resultante de las representaciones del modelo. Para los modelos de difusión, las imágenes se enrutan y el modelo aprende a eliminar gradualmente el ruido a través del objetivo. También existen objetivos de entrenamiento multimodales, algunos de los cuales separan imágenes y texto durante el entrenamiento, mientras que otros los examinan simultáneamente. [ 76 ] En general, los objetivos de entrenamiento para los modelos base promueven el aprendizaje de representaciones de datos ampliamente útiles.
Con el auge de los modelos base y los conjuntos de datos más grandes que los alimentan, un objetivo de entrenamiento debe ser capaz de analizar datos a escala de internet para extraer información relevante. Además, dado que los modelos base están diseñados para resolver una gama general de tareas, los objetivos de entrenamiento deben ser completos en su dominio , es decir, capaces de resolver un amplio conjunto de funcionalidades posteriores dentro de dicho dominio. Por último, los objetivos de entrenamiento de los modelos base deben buscar una buena escalabilidad y ser computacionalmente eficientes. Dado que el tamaño del modelo y la capacidad de procesamiento son limitaciones importantes, un objetivo de entrenamiento debe ser capaz de superar estos cuellos de botella.
Datos
Los modelos base se entrenan con una gran cantidad de datos, bajo la máxima de que "cuantos más datos, mejor". [ 77 ] La evaluación del rendimiento muestra que, en general, más datos conducen a un mejor rendimiento, pero surgen otros problemas a medida que aumenta la cantidad de datos. Tareas como la gestión del conjunto de datos, la integración de datos en nuevas aplicaciones, el cumplimiento de las licencias de datos y el mantenimiento de la calidad de los datos se vuelven más difíciles a medida que aumenta el tamaño de los datos. Las exigencias específicas de los modelos base no han hecho sino agravar estos problemas, ya que sigue siendo habitual que los grandes modelos base utilicen datos públicos extraídos de la web. Los modelos base también incluyen datos de motores de búsqueda y metaetiquetas SEO. Los datos web públicos siguen siendo un recurso abundante, pero también exigen una moderación y un procesamiento de datos rigurosos por parte de los desarrolladores de modelos base antes de que puedan integrarse con éxito en el proceso de entrenamiento. [ 78 ]
El entrenamiento de modelos base suele conllevar el riesgo de vulnerar la privacidad del usuario, ya que los datos privados pueden divulgarse, recopilarse o utilizarse de formas que van más allá del alcance establecido. Incluso si no se filtran datos privados, los modelos pueden comprometer la seguridad de forma inadvertida mediante el comportamiento aprendido en el modelo base resultante. [ 79 ] La calidad de los datos es otro punto clave, ya que los datos extraídos de la web suelen contener material sesgado, duplicado y tóxico. Una vez implementados los modelos base, garantizar la alta calidad de los datos sigue siendo un problema, ya que pueden surgir comportamientos indeseables a partir de pequeños subconjuntos de datos.
Sistemas
El tamaño de los modelos base también genera problemas con los sistemas informáticos en los que se ejecutan. El modelo base promedio es demasiado grande para ejecutarse dentro de la memoria de un solo acelerador, y el proceso de entrenamiento inicial requiere una cantidad considerable de recursos. [ 80 ] Se prevé que estos problemas se agraven aún más en el futuro a medida que los modelos base alcancen nuevas cotas. Debido a esta limitación, los investigadores han comenzado a estudiar la compresión del tamaño de los modelos mediante una inferencia de modelos ajustada.
Las GPU son la opción más común de hardware de computación para el aprendizaje automático, debido a su gran capacidad de almacenamiento de memoria y su potente rendimiento. El entrenamiento típico de modelos básicos requiere muchas GPU en una configuración de computación distribuida , conectadas en paralelo con interconexiones rápidas. Adquirir una cantidad suficiente de GPU con la eficiencia de computación necesaria representa un desafío para muchos desarrolladores de modelos básicos, lo que ha generado un dilema creciente en el sector. Los modelos más grandes requieren mayor potencia de cálculo, pero a menudo a costa de una mayor eficiencia. Dado que el entrenamiento sigue siendo lento y costoso, la disyuntiva entre potencia y eficiencia de cálculo ha provocado que solo unas pocas empresas selectas puedan afrontar los costos de producción de modelos básicos grandes y de última generación. Algunas técnicas, como la compresión y la destilación, pueden abaratar la inferencia, pero no logran solucionar completamente esta limitación.
Escalada
La precisión y las capacidades de los modelos básicos suelen escalar de forma predecible con el tamaño del modelo y la cantidad de datos de entrenamiento. En concreto, se han descubierto leyes de escalado, que son tendencias empíricas basadas en datos que relacionan los recursos (datos, tamaño del modelo, uso de cómputo) con las capacidades del modelo. En particular, la escala de un modelo se define por el cómputo, el tamaño del conjunto de datos y el número de parámetros, todos los cuales presentan una relación de ley de potencias con el rendimiento final.
Sin embargo, se han descubierto leyes de escala discontinuas [ 81 ] en las que esta relación transita suavemente (en puntos denominados puntos de ruptura ) de una ley de potencias con un exponente a otra con un exponente diferente. Cuando no se recogen puntos cercanos (o posteriores) a los puntos de ruptura, puede resultar difícil obtener una extrapolación precisa.
Adaptación
Los modelos base son inherentemente multipropósito: para utilizarlos en un caso de uso específico, se requiere algún tipo de adaptación. Como mínimo, los modelos deben adaptarse para realizar la tarea de interés (especificación de la tarea), pero a menudo se puede lograr un mejor rendimiento mediante una adaptación más exhaustiva al dominio de interés (especialización de dominio).
Una variedad de métodos (por ejemplo , indicaciones , aprendizaje en contexto , ajuste fino , LoRA ) ofrecen diferentes compensaciones entre los costos de adaptación y el grado de especialización de los modelos. Algunos aspectos importantes a considerar al adaptar un modelo base son el presupuesto computacional y la disponibilidad de datos. Los modelos base pueden ser muy grandes, hasta billones de parámetros, por lo que adaptar la totalidad de un modelo base puede ser computacionalmente costoso. Por lo tanto, los desarrolladores a veces adaptan solo la última capa neuronal o solo los vectores de sesgo para ahorrar tiempo y espacio. [ 82 ] Para aplicaciones particularmente específicas, es posible que tampoco se disponga de datos específicos para adaptar el modelo base de manera suficiente. En tales circunstancias, los datos deben etiquetarse manualmente, lo cual es costoso y puede requerir conocimientos especializados.
Evaluación
La evaluación es una parte clave del desarrollo de modelos base. No solo permite realizar un seguimiento del progreso de los modelos de alto rendimiento, sino que también crea puntos de referencia para el desarrollo de modelos futuros. Las partes interesadas confían en las evaluaciones para comprender el comportamiento de los modelos y obtener información sobre sus diversos atributos. Tradicionalmente, los modelos base se evalúan en relación con otros mediante puntos de referencia de tareas estandarizados como MMLU , [ 83 ] MMMU, [ 84 ] HumanEval, [ 85 ] y GSM8K. [ 86 ] Dado que los modelos base son multipropósito, cada vez se desarrollan más meta-puntos de referencia que agregan diferentes puntos de referencia subyacentes. Algunos ejemplos son LM-Harness, [ 87 ] BIG-Bench, [ 88 ] HELM, [ 89 ] OpenLLM Leaderboard, [ 90 ] DecodingTrust, [ 91 ] y HEIM. [ 92 ]
Dado que la utilidad de los modelos base depende de sus capacidades generales y del rendimiento de las aplicaciones optimizadas, la evaluación debe abarcar ambas métricas. Una evaluación adecuada examina tanto las aplicaciones derivadas de un modelo base en su conjunto como las propiedades directas que posee dicho modelo. Para garantizar una mayor equidad en la evaluación, algunos marcos de evaluación existentes tienen en cuenta todos los recursos de adaptación, lo que permite realizar análisis más informados en beneficio de todas las partes interesadas. [ 93 ]
Cadena de suministro
Las capacidades generales de los modelos base les permiten cumplir un rol único en el ecosistema de IA, [ 94 ] impulsado por muchas tecnologías ascendentes y descendentes. [ 1 ] Entrenar un modelo base requiere varios recursos (por ejemplo, datos, computación, mano de obra, hardware, código), y los modelos base a menudo involucran enormes cantidades de datos y computación (también conocido como poder computacional). Debido a los altos costos de desarrollo de los modelos base y los requisitos de adaptación económicos, el panorama de la IA se ha desplazado a un pequeño subconjunto de empresas de IA que crean modelos base para la adaptación descendente. [ 95 ] Por lo tanto, la mayoría de las empresas de modelos base subcontratan este paso a proveedores de datos especializados (por ejemplo , Scale AI , [ 96 ] Surge [ 97 ] ) y proveedores de computación (por ejemplo, Amazon Bedrock , Google Cloud , Microsoft Azure ).

El propio desarrollador del modelo base tomará los datos y utilizará la capacidad de procesamiento proporcionada para entrenar dicho modelo. Una vez que el modelo base esté completamente construido, gran parte de los requisitos de datos y mano de obra disminuyen. En este proceso de desarrollo, el hardware y la capacidad de procesamiento son los recursos más necesarios y también los más exclusivos. Para entrenar IA más grandes y complejas, una cantidad suficiente de capacidad de procesamiento es fundamental. Sin embargo, esta capacidad se concentra en manos de unas pocas entidades selectas, de las que dependen la mayoría de los desarrolladores de modelos base. Por lo tanto, el flujo de trabajo del modelo base se concentra en gran medida en torno a estos proveedores. La capacidad de procesamiento también es costosa; en 2023, las empresas de IA invirtieron más del 80 % de su capital total en recursos de procesamiento. [ 99 ]
Los modelos de base requieren una gran cantidad de datos generales para potenciar sus capacidades. Los primeros modelos de base extraían información de subconjuntos de internet para obtenerla. A medida que el tamaño y el alcance de los modelos de base aumentan, se hace necesario extraer mayores cantidades de datos de internet, lo que incrementa la probabilidad de obtener datos sesgados o perjudiciales. Estos datos sesgados o perjudiciales pueden perjudicar desproporcionadamente a los grupos marginados y exacerbar los prejuicios existentes. [ 100 ]
Para abordar este problema de datos de baja calidad que surgió con el entrenamiento no supervisado, algunos desarrolladores de modelos básicos han recurrido al filtrado manual. Esta práctica, conocida como trabajo de datos, conlleva una serie de problemas. [ 101 ] Esta desintoxicación manual de datos a menudo se subcontrata para reducir los costos laborales, y algunos trabajadores ganan menos de $2 por hora. [ 102 ]
El modelo base se alojará en línea, ya sea a través del desarrollador o de una organización externa. Una vez publicado, otras partes podrán crear aplicaciones basadas en este modelo, ya sea mediante ajustes o para fines completamente nuevos. Los usuarios podrán acceder a estas aplicaciones para sus diversos propósitos, lo que permitirá que un único modelo base impulse y llegue a un público amplio.
Estrategias de lanzamiento
Una vez creado un modelo base, puede publicarse de diversas maneras. La publicación abarca muchos aspectos: el propio recurso, quién tiene acceso, cómo cambia el acceso con el tiempo y las condiciones de uso. [ 103 ] Todos estos factores influyen en cómo un modelo base afectará a las aplicaciones posteriores. [ 104 ] En particular, las dos formas más comunes de publicar un modelo base son mediante API y descargas directas del modelo.
Cuando un modelo se publica a través de una API , los usuarios pueden consultarlo y recibir respuestas, pero no pueden acceder directamente a él. En cambio, el modelo podría descargarse directamente para que los usuarios accedan a él y lo modifiquen. Ambas estrategias de publicación suelen clasificarse como una publicación abierta. La definición exacta de una publicación abierta es objeto de debate, pero la Open Source Initiative proporciona requisitos ampliamente aceptados .
Algunos modelos de código abierto son: PaLM 2 , Llama 2 , Granite y Mistral . Si bien estos modelos facilitan la investigación y el desarrollo, también son más susceptibles al mal uso. Cualquiera puede descargarlos, y los modelos más potentes pueden ajustarse para causar daño, ya sea intencional o involuntariamente.
Durante una publicación cerrada, el modelo base no es accesible al público, sino que se utiliza internamente por la organización. Estas publicaciones se consideran más seguras, pero no ofrecen ningún valor adicional a la comunidad investigadora ni al público en general.
Algunos modelos fundamentales como Flamingo de Google DeepMind [ 105 ] son completamente cerrados, lo que significa que solo están disponibles para el desarrollador del modelo; otros, como GPT-4 de OpenAI , tienen acceso limitado, están disponibles para el público pero solo como una caja negra ; y otros, como Llama 2 de Meta , son abiertos, con pesos del modelo ampliamente disponibles que permiten la modificación y el escrutinio posteriores.
Referencias
- 1 2 3 4 Autoridad de Competencia y Mercados (18 de septiembre de 2023). "Modelos de la Fundación IA: Informe inicial" ( PDF) . gov.uk. Archivado (PDF) del original el 11 de diciembre de 2023. Recuperado el 11 de diciembre de 2023 .
- ↑ Nestor Maslej, Loredana Fattorini, Erik Brynjolfsson, John Etchemendy, Katrina Ligett, Terah Lyons, James Manyika, Helen Ngo, Juan Carlos Niebles, Vanessa Parli, Yoav Shoham, Russell Wald, Jack Clark y Raymond Perrault, "Informe anual del Índice de IA 2023", Comité Directivo del Índice de IA, Instituto de IA Centrada en el Ser Humano, Universidad de Stanford, Stanford, California, abril de 2023.
- ↑ Rogers, Anna; Kovaleva, Olga; Rumshisky, Anna (2020). "Una introducción a la BERtología: lo que sabemos sobre cómo funciona BERT". arXiv : 2002.12327 [ cs.CL ].
- ↑ Haddad, Mohammed. "¿Cómo funciona GPT-4 y cómo se puede empezar a usar en ChatGPT?" . Al Jazeera . Archivado del original el 5 de julio de 2023 . Consultado el 20 de octubre de 2024 .
- ↑ Abordar múltiples tareas con un único modelo de lenguaje visual , 28 de abril de 2022, archivado del original el 28 de abril de 2022 , consultado el 13 de junio de 2022.
- ^ Copet, Jade; Kreuk, Félix; Gat, Itai; Remez, Tal; Kant, David; Synnaeve, Gabriel; Adi, Yossi; Défossez, Alexandre (7 de noviembre de 2023). "Generación de música sencilla y controlable". arXiv : 2306.05284 [ cs.SD ].
- ↑ "LLark: Un modelo de base multimodal para la música" . Spotify Research . 13 de octubre de 2023. Consultado el 11 de diciembre de 2023 .
- ↑ "Robot parlante: Nuestro nuevo modelo de IA traduce la visión y el lenguaje en acciones robóticas" . Google . 28 de julio de 2023. Archivado del original el 11 de diciembre de 2023. Consultado el 11 de diciembre de 2023 .
- ↑ Nguyen, Tuan Dung; Ting, Yuan-Sen; Ciucă, Ioana; O'Neill, Charlie; Sun, Ze-Chang; Jabłońska, Maja; Kruk, Sandor; Perkowski, Ernest; Miller, Jack (12 de septiembre de 2023). "AstroLLaMA: Hacia modelos de fundamentos especializados en astronomía". arXiv : 2309.06126 [ astro-ph.IM ].
- ↑ Tu, Tao; Azizi, Shekoofeh; Seque, Danny; Schaekermann, Mike; Amín, Mohamed; Chang, Pi-Chuan; Carroll, Andrés; Lau, Chuck; Tanno, Ryutaro (26 de julio de 2023). "Hacia la IA biomédica generalista". arXiv : 2307.14334 [ cs.CL ].
- ↑ Judkiewicz, Raphael (2026). "Cambio del paradigma de los modelos de fundamentos retinianos de cortes a volúmenes para la tomografía de coherencia óptica" . npj Digital Medicine . doi : 10.1038/s41746-026-02496-7 . PMID 41786902 .
- ↑ Zvyagin, Maxim; Brace, Alexander; Hippe, Kyle; Deng, Yuntian; Zhang, Bin; Bohorquez, Cindy Orozco; Clyde, Austin; Kale, Bharat; Perez-Rivera, Danilo (2023). "GenSLMs: Los modelos de lenguaje a escala genómica revelan la dinámica evolutiva del SARS-CoV-2". The International Journal of High Performance Computing Applications . 37 (6): 683– 705. bioRxiv 10.1101/2022.10.10.511571 . doi : 10.1177/10943420231201154 .
- ↑ Zhu, Xiao Xiang; Xiong, Zhitong; Wang, Yi; Stewart, Adam J.; Heidler, Konrad; Wang, Yuanyuan; Yuan, Zhenghang; Dujardin, Thomas; Xu, Qingsong; Shi, Yilei (8 de enero de 2026). "Sobre los fundamentos de los modelos de cimentación de la Tierra" . Communications Earth & Environment . 7 (1): 103. doi : 10.1038/s43247-025-03127-x . ISSN 2662-4435 . Archivado del original el 8 de enero de 2026. Recuperado el 12 de julio de 2026 .
- ^ Li, Raymond; Allal, Loubna Ben; Zi, Yangtiano; Muennighoff, Niklas; Kočetkov, Denis; Mou, Chenghao; Marone, Marc; Akiki, Cristóbal; Li, Jia (9 de mayo de 2023). "StarCoder: ¡que la fuente esté contigo!". arXiv : 2305.06161 [ cs.CL ].
- ↑ Se, Ksenia; Spektor, Ian (5 de abril de 2024). "Revolucionando la predicción de series temporales: entrevista con los creadores de TimeGPT" . Turing Post . Consultado el 11 de abril de 2024 .
- ^ Azerbayev, Zhangir; Schoelkopf, Hailey; Paster, Keiran; Santos, Marco Dos; McAleer, Stephen; Jiang, Albert Q.; Deng, Jia; Biderman, Stella; Welleck, Sean (30 de noviembre de 2023). "Llema: un modelo de lenguaje abierto para las matemáticas". arXiv : 2310.10631 [ cs.CL ].
- ↑ "Orbital" . Archivado del original el 3 de septiembre de 2024. Consultado el 5 de septiembre de 2024 .
- ↑ "Presentación del Centro de Investigación sobre Modelos de Fundamentos (CRFM)" . Stanford HAI . 18 de agosto de 2021. Archivado del original el 4 de junio de 2023. Consultado el 11 de junio de 2022 .
- 1 2 Bommasani, Rishi; et al. (18 de agosto de 2021). Sobre las oportunidades y los riesgos de los modelos de fundación (Informe). arXiv : 2108.07258 .
- ↑ "Reflexiones sobre los modelos fundacionales" . Stanford HAI . 18 de octubre de 2021. Archivado del original el 15 de agosto de 2024. Consultado el 22 de mayo de 2023 .
- ↑ Bommasani, Rishi; Liang, Percy (18 de octubre de 2021). "Reflexiones sobre los modelos fundacionales" . Stanford CRFM . Consultado el 11 de diciembre de 2023 .
- ↑ Marcus, Gary (11 de septiembre de 2021). "¿Ha encontrado la IA una nueva base?" . The Gradient . Archivado del original el 11 de diciembre de 2023 . Recuperado el 11 de diciembre de 2023 .
- ↑ «Orden ejecutiva sobre el desarrollo y uso seguros, protegidos y confiables de la inteligencia artificial» . La Casa Blanca . 30 de octubre de 2023. Archivado del original el 1 de febrero de 2025. Consultado el 12 de febrero de 2024 .
- ↑ "Ley de Transparencia del Modelo de la Fundación de IA" (PDF) . Archivado (PDF) del original el 13 de febrero de 2024. Recuperado el 13 de febrero de 2024 .
- ^ Liang, Percy; Bommasani, Rishi; Lee, Tony; Tsipras, Dimitris; Soylu, Dilara; Yasunaga, Michihiro; Zhang, Yian; Narayanan, Deepak; Wu, Yuhuai (1 de octubre de 2023), "Evaluación holística de modelos lingüísticos", Annals of the New York Academy of Sciences , 1525 (1): 140– 146, arXiv : 2211.09110 , Bibcode : 2023NYASA1525..140B , doi : 10.1111/nyas.15007 , PMID 37230490
- ↑ «Declaración conjunta sobre seguridad y apertura de la IA» . Mozilla . 31 de octubre de 2023. Archivado del original el 4 de noviembre de 2023. Consultado el 12 de febrero de 2024 .
- ↑ "Hawley y Blumenthal exigen respuestas a Meta y advierten sobre un posible uso indebido tras la 'filtración' del modelo de IA de Meta" . Senador Josh Hawley . 6 de junio de 2023. Archivado del original el 13 de febrero de 2024. Consultado el 12 de febrero de 2024 .
- 1 2 Anderljung, Markus; Barnhart, Joslyn; Korinek, Anton; Leung, Jade ; O'Keefe, Cullen; Whittlestone, Jess; Avin, Shahar; Brundage, Miles; Bullock, Justin (7 de noviembre de 2023), Regulación de la IA de vanguardia: Gestión de riesgos emergentes para la seguridad pública , arXiv : 2307.03718
- ^ Singhal, Karan; Azizi, Shekoofeh; Tu, Tao; Mahdavi, S. Sara; Wei, Jason; Chung, Hyung Won; Escalas, Nathan; Tanwani, Ajay; Cole-Lewis, Heather; Pfohl, Stephen; Payne, Perry; Seneviratne, Martín; Apuesta, Paul; Kelly, Chris; Babiker, Abubakr (agosto de 2023). "Los grandes modelos de lenguaje codifican el conocimiento clínico" . Naturaleza . 620 (7972): 172–180 . arXiv : 2212.13138 . Código Bib : 2023Natur.620..172S . doi : 10.1038/s41586-023-06291-2 . ISSN 1476-4687 . PMC 10396962 . PMID 37438534 .
- ↑ Nori, Harsha; King, Nicholas; McKinney, Scott Mayer; Carignan, Dean; Horvitz, Eric (12 de abril de 2023), Capacidades de GPT-4 en problemas de desafíos médicos , arXiv : 2303.13375
- ↑ "Inteligencia artificial generativa y la nueva frontera en ciberseguridad" . AI Business . 7 de febrero de 2024. Archivado del original el 20 de enero de 2025. Consultado el 15 de enero de 2025 .
- ↑ Pillay, Tharin (15 de diciembre de 2024). "Nuevas pruebas revelan la capacidad de engaño de la IA" . TIME . Archivado del original el 22 de abril de 2025. Consultado el 15 de enero de 2025 .
- ↑ «Desarrollo y uso seguros, protegidos y confiables de la inteligencia artificial» . Registro Federal . 1 de noviembre de 2023. Archivado del original el 29 de abril de 2026. Consultado el 20 de abril de 2026 .
- ↑ "Acerca de" . Foro de Frontier Model . Archivado del original el 14 de abril de 2026. Consultado el 20 de abril de 2026 .
- ↑ Allen y Adamson (30 de octubre de 2024). "La Red Internacional del Instituto de Seguridad de la IA: Próximos pasos y recomendaciones" . CSIS - Centro de Estudios Estratégicos e Internacionales .
- ↑ "Documentos de logros | Proceso de IA de Hiroshima" . www.soumu.go.jp . Consultado el 20 de abril de 2026 .
- ↑ "Inteligencia artificial de propósito general | Think Tank | Parlamento Europeo" . www.europarl.europa.eu . Archivado del original el 13 de febrero de 2024. Consultado el 12 de febrero de 2024 .
- ↑ Bommasani, Rishi; Soylu, Dilara; Liao, Thomas I.; Creel, Kathleen A.; Liang, Percy (28 de marzo de 2023), Ecosystem Graphs: The Social Footprint of Foundation Models , arXiv : 2303.15772
- ↑ Bellan, Rebecca (5 de agosto de 2025). "DeepMind cree que su nuevo modelo del mundo Genie 3 representa un paso importante hacia la IA general" . TechCrunch . Archivado del original el 5 de agosto de 2025. Consultado el 8 de noviembre de 2025 .
- 1 2 Takahashi, Dean (7 de enero de 2025). "Nvidia lanza la plataforma de modelo de la fundación mundial Cosmos para acelerar la IA física" . VentureBeat . Archivado del original el 8 de enero de 2025. Recuperado el 15 de junio de 2025 .
- ↑ Pearl, Mike (15 de noviembre de 2025) .«Imagina un cubo flotando en el aire»: El nuevo sueño de la IA supuestamente está alejando a Yann LeCun de Meta . Gizmodo . Archivado del original el 16 de noviembre de 2025. Consultado el 28 de noviembre de 2025 .
- 1 2 3 Fried, Ina (17 de noviembre de 2025). "El próximo gran salto de la IA son los modelos que entienden el mundo" . Axios . Recuperado el 28 de noviembre de 2025 .
{{cite web}}: CS1 maint: servicio de archivado obsoleto ( enlace ) - ↑ Husain, Mishal (21 de noviembre de 2025). "La madrina de la IA no esperaba que fuera tan masiva" . Bloomberg News . Consultado el 28 de noviembre de 2025 .
{{cite web}}: CS1 maint: servicio de archivado obsoleto ( enlace ) - ↑ Whitwam, Ryan (5 de agosto de 2025). «DeepMind revela el "modelo del mundo" de Genie 3 que crea simulaciones interactivas en tiempo real» . Ars Technica . Archivado del original el 12 de septiembre de 2025. Consultado el 28 de noviembre de 2025 .
- 1 2 Pillay, Tharin (9 de diciembre de 2025). "Dentro del plan de Fei-Fei Li para construir mundos virtuales impulsados por IA" . TIME . Archivado del original el 10 de diciembre de 2025. Recuperado el 11 de diciembre de 2025 .
- 1 2 Gelling, Peter; Varanasi, Lakshmi. "Los catastrofistas de la IA están viviendo su momento" . Business Insider . Archivado del original el 25 de agosto de 2025. Recuperado el 14 de octubre de 2025 .
- 1 2 3 4 5 6 Ding, Jingtao; Zhang, Yunke; Shang, Yu; Zhang, Yuheng; Zong, Zefang; Feng, Jie; Yuan, Yuan; Su, Hongyuan; Li, Nian; Sukiennik, Nicolás; Xu, Fengli; Li, Yong (9 de septiembre de 2025). "¿Comprender el mundo o predecir el futuro? Un estudio completo de los modelos mundiales" . Computación ACM. Sobrevivir . 58 (3): 57:1–57:38. doi : 10.1145/3746449 . ISSN 0360-0300 .
- ^ Pavlus, John (2 de septiembre de 2025). "«Los "modelos mundiales", una vieja idea en IA, vuelven a resurgir» . Quanta Magazine . Archivado del original el 23 de septiembre de 2025. Consultado el 14 de octubre de 2025 .
- ↑ Ha, David; Schmidhuber, Jürgen (3 de diciembre de 2018). "Los modelos de mundo recurrentes facilitan la evolución de las políticas" . Actas de la 32.ª Conferencia Internacional sobre Sistemas de Procesamiento de Información Neuronal . NIPS'18. Red Hook, NY, EE. UU.: Curran Associates Inc.: 2455–2467 .
- ↑ Heikkilä, Melissa; Douglas Heaven, Will (24 de junio de 2022). "Yann LeCun tiene una nueva y audaz visión para el futuro de la IA" . MIT Technology Review . Archivado del original el 24 de junio de 2022. Recuperado el 15 de junio de 2025 .
- 1 2 Zeff, Maxwell (17 de octubre de 2024). "El jefe de IA de Meta dice que los modelos mundiales son clave para la 'IA a nivel humano', pero podría tardar 10 años" . TechCrunch . Archivado del original el 4 de marzo de 2025. Recuperado el 15 de junio de 2025 .
- ↑ Sawers, Paul (23 de enero de 2025). "Yann LeCun de Meta predice un 'nuevo paradigma de arquitecturas de IA' en 5 años y una 'década de la robótica'"." . TechCrunch . Archivado del original el 28 de septiembre de 2025 . Consultado el 17 de diciembre de 2025 .
- ↑ Zeff, Maxwell (17 de octubre de 2024). "El jefe de IA de Meta afirma que los modelos mundiales son clave para la 'IA a nivel humano', pero podría tardar 10 años" . TechCrunch . Archivado del original el 20 de septiembre de 2025. Consultado el 17 de diciembre de 2025 .
- 1 2 3 4 Wiggers, Kyle (14 de diciembre de 2024). "¿Qué son los 'modelos mundiales' de IA y por qué importan?" . TechCrunch . Archivado del original el 18 de marzo de 2025. Recuperado el 15 de junio de 2025 .
- ↑ Wiggers, Kyle (7 de enero de 2025). "Nvidia lanza su propia marca de modelos mundiales" . TechCrunch . Archivado del original el 5 de marzo de 2025. Recuperado el 15 de junio de 2025 .
- ↑ Chen, Wency (5 de mayo de 2025). "La respuesta de China a Autodesk es apostar por la IA para construir un 'modelo mundial'"." . South China Morning Post . Consultado el 15 de junio de 2025 .
{{cite web}}: CS1 maint: servicio de archivado obsoleto ( enlace ) - ↑ Knight, Will. «Un laboratorio de los Emiratos Árabes Unidos anuncia proyectos de IA de vanguardia y un nuevo puesto avanzado en Silicon Valley» . Wired . ISSN 1059-1028 . Archivado del original el 22 de mayo de 2025. Consultado el 15 de junio de 2025 .
- ↑ Orland, Kyle (5 de marzo de 2024). "El creador de juegos Genie de Google es el resultado de que la IA observe 30 000 horas de videojuegos" . Ars Technica . Archivado del original el 8 de diciembre de 2024. Consultado el 15 de junio de 2025 .
- ↑ Orland, Kyle (6 de diciembre de 2024). "La presentación del 'modelo mundial' de Genie 2 de Google deja más preguntas que respuestas" . Ars Technica . Archivado del original el 7 de diciembre de 2024. Recuperado el 15 de junio de 2025 .
- ↑ Browne, Ryan (11 de junio de 2025). «Meta lanza un "modelo mundial" de IA para impulsar la robótica y los coches autónomos» . CNBC . Archivado del original el 27 de septiembre de 2025. Consultado el 14 de octubre de 2025 .
- 1 2 Osawa, Juro; Liu, Qianer; Yang, Jing. "El próximo 'modelo mundial' de ByteDance; las reflexiones de Altman sobre el fiasco de GPT-5, la rentabilidad y la salida a bolsa" . The Information . Consultado el 14 de octubre de 2025 .
{{cite web}}: CS1 maint: servicio de archivado obsoleto ( enlace ) - ↑ Criddle, Cristina; Murphy, Hannah; Bradshaw, Tim (29 de septiembre de 2025). "Las grandes empresas de IA invierten dinero en modelos mundiales mientras los avances de LLM se ralentizan" . Ars Technica . Archivado del original el 4 de octubre de 2025. Recuperado el 14 de octubre de 2025 .
- ↑ Levine, Adam. "Pokémon Go está impulsando un spin-off de 4 mil millones de dólares. Esos mapas del juego podrían ser oro para la IA" . barrons . Archivado del original el 18 de marzo de 2025. Recuperado el 20 de noviembre de 2025 .
- 1 2 Criddle, Cristina (12 de octubre de 2025). "La xAI de Elon Musk se une a la carrera para construir 'modelos mundiales' para impulsar los videojuegos" . Financial Times . Recuperado el 14 de octubre de 2025 .
{{cite web}}: CS1 maint: servicio de archivado obsoleto ( enlace ) - 1 2 Varanasi, Lakshmi. "Los principales investigadores de IA afirman que el lenguaje es limitante. Este es el nuevo tipo de modelo que están desarrollando en su lugar" . Business Insider . Archivado del original el 15 de junio de 2025. Consultado el 21 de junio de 2025 .
- 1 2 Levy, Steven (13 de septiembre de 2024). "La madrina de la IA quiere que todos sean constructores de mundos" . Wired . ISSN 1059-1028 . Archivado del original el 7 de febrero de 2025. Recuperado el 21 de junio de 2025 .
- 1 2 Bellan, Rebecca (12 de noviembre de 2025). "World Labs de Fei-Fei Li acelera la carrera mundial de modelos con Marble, su primer producto comercial" . TechCrunch . Recuperado el 28 de noviembre de 2025 .
{{cite web}}: CS1 maint: servicio de archivado obsoleto ( enlace ) - 1 2 Wiggers, Kyle (6 de enero de 2025). "Google está formando un nuevo equipo para crear IA que pueda simular el mundo físico" . TechCrunch . Archivado del original el 12 de octubre de 2025. Recuperado el 3 de diciembre de 2025 .
- 1 2 Wiggers, Kyle (28 de mayo de 2025). "El nuevo modelo de IA de Odyssey transmite mundos interactivos en 3D" . TechCrunch . Archivado del original el 30 de mayo de 2025. Recuperado el 15 de junio de 2025 .
- ↑ Mims, Christopher (26 de septiembre de 2025). "¿Qué son los 'modelos mundiales'? La clave para el próximo gran salto de la IA" . The Wall Street Journal . Consultado el 14 de octubre de 2025 .
{{cite web}}: CS1 maint: servicio de archivado obsoleto ( enlace ) - ↑ Orland, Kyle (1 de octubre de 2025). "¿Pueden los modelos de vídeo de IA actuales modelar con precisión cómo funciona el mundo real?" . Ars Technica . Archivado del original el 3 de octubre de 2025. Recuperado el 14 de octubre de 2025 .
- ↑ Judkiewicz, Raphael (5 de mayo de 2026). "Cambio del paradigma de los modelos de fundamentos retinianos de cortes a volúmenes para la tomografía de coherencia óptica" . npj Digital Medicine . doi : 10.1038/s41746-026-02496-7 . PMID 41786902 .
- ^ Taniguchi, Tadahiro; Murata, Shingo; Suzuki, Masahiro; Ognibene, Dimitri; Lanillos, Pablo; Ugur, Emre; Jamón, Lorenzo; Nakamura, Tomoaki; Ciria, Alejandra; Lara, Bruno; Pezzulo, Giovanni (3 de julio de 2023). "Modelos mundiales y codificación predictiva para la robótica cognitiva y del desarrollo: fronteras y desafíos". Robótica Avanzada . 37 (13): 780– 806. doi : 10.1080/01691864.2023.2225232 . hdl : 10281/450879 . ISSN 0169-1864 .
- ↑ Bommasani, Rishi; Klyman, Kevin; Longpre, Shayne; Kapoor, Sayash; Maslej, Nestor; Xiong, Betty; Zhang, Daniel; Liang, Percy (19 de octubre de 2023), The Foundation Model Transparency Index , arXiv : 2310.12941
- ↑ Claude Elwood, Shannon (julio de 1948). "Una teoría matemática de la comunicación" (PDF) . Bell System Technical Journal . Archivado (PDF) del original el 4 de mayo de 2025. Recuperado el 13 de febrero de 2024 .
- ↑ Radford, Alec; Kim, Jong Wook; Hallacy, Chris; Ramesh, Aditya; Goh, Gabriel; Agarwal, Sandhini; Sastry, Girish; Askell, Amanda; Mishkin, Pamela (26 de febrero de 2021), Aprendizaje de modelos visuales transferibles a partir de la supervisión del lenguaje natural , arXiv : 2103.00020
- ↑ Kaplan, Jared; McCandlish, Sam; Henighan, Tom; Brown, Tom B.; Chess, Benjamin; Child, Rewon; Gray, Scott; Radford, Alec; Wu, Jeffrey (22 de enero de 2020), Leyes de escala para modelos de lenguaje neuronales , arXiv : 2001.08361
- ↑ Jo, Eun Seo; Gebru, Timnit (27 de enero de 2020). «Lecciones de los archivos: Estrategias para la recopilación de datos socioculturales en el aprendizaje automático». Actas de la Conferencia de 2020 sobre Equidad, Responsabilidad y Transparencia . págs. 306–316 . arXiv : 1912.10389 . doi : 10.1145/3351095.3372829 . ISBN 978-1-4503-6936-7.
- ↑ Bender, Emily M.; Gebru, Timnit; McMillan-Major, Angelina; Shmitchell, Shmargaret (1 de marzo de 2021). "Sobre los peligros de los loros estocásticos: ¿Pueden los modelos de lenguaje ser demasiado grandes? 🦜" . Actas de la Conferencia ACM de 2021 sobre equidad, responsabilidad y transparencia . FAccT '21. Nueva York, Nueva York, EE. UU.: Association for Computing Machinery. págs. 610–623 . doi : 10.1145/3442188.3445922 . ISBN 978-1-4503-8309-7Archivado del original el 3 de octubre de 2021. Consultado el 13 de febrero de 2024 .
- ↑ Brown, Tom B.; Mann, Benjamin; Ryder, Nick; Subbiah, Melanie; Kaplan, Jared; Dhariwal, Prafulla; Neelakantan, Arvind; Shyam, Pranav; Sastry, Girish (22 de julio de 2020), Los modelos de lenguaje son aprendices con pocos ejemplos , arXiv : 2005.14165
- ↑ Caballero, Ethan; Gupta, Kshitij; Rish, Irina; Krueger, David (2022). "Leyes de escalamiento neuronal rotas" . Conferencia Internacional sobre Representaciones de Aprendizaje (ICLR), 2023.
- ↑ Zaken, Elad Ben; Ravfogel, Shauli; Goldberg, Yoav (5 de septiembre de 2022), BitFit: Ajuste fino sencillo y eficiente de parámetros para modelos de lenguaje enmascarados basados en transformadores , arXiv : 2106.10199
- ↑ "Papers with Code – MMLU Benchmark (Multi-task Language Understanding)" . paperswithcode.com . Archivado del original el 13 de febrero de 2024. Consultado el 21 de abril de 2024 .
- ^ Yue, Xiang; Ni, Yuansheng; Zhang, Kai; Zheng, Tianyu; Liu, Ruoqi; Zhang, Ge; Stevens, Samuel; Jiang, Dongfu; Ren, Weiming (20 de diciembre de 2023), MMMU: un punto de referencia de razonamiento y comprensión multimodal masivo y multidisciplinario para AGI experto , arXiv : 2311.16502
- ↑ "Papers with Code – HumanEval Benchmark (Generación de código)" . paperswithcode.com . Consultado el 21 de abril de 2024 .
- ↑ "Papers with Code – GSM8K Benchmark (Razonamiento aritmético)" . paperswithcode.com . Archivado del original el 13 de febrero de 2024. Consultado el 21 de abril de 2024 .
- ↑ EleutherAI/lm-evaluation-harness , EleutherAI, 21 de abril de 2024, archivado del original el 8 de mayo de 2025 , consultado el 21 de abril de 2024
- ↑ Srivastava, Aarohi; Rastogi, Abhinav; Rao, Abhishek; Shoeb, Abu Awal Md; Abid, Abubakar; Fisch, Adam; Brown, Adam R.; Santoro, Adam; Gupta, Aditya (12 de junio de 2023), Más allá del juego de imitación: cuantificando y extrapolando las capacidades de los modelos de lenguaje , arXiv : 2206.04615
- ↑ "Evaluación holística de modelos de lenguaje (HELM)" . crfm.stanford.edu . Consultado el 21 de abril de 2024 .
- ↑ "open-llm-leaderboard (Clasificación abierta de LLM)" . huggingface.co . 9 de noviembre de 2023. Archivado del original el 11 de febrero de 2024. Consultado el 21 de abril de 2024 .
- ↑ "DecodingTrust Benchmark" . decodingtrust.github.io . Consultado el 21 de abril de 2024 .
- ↑ "Evaluación holística de modelos de imagen (HEIM)" . crfm.stanford.edu . Archivado del original el 13 de febrero de 2024. Consultado el 21 de abril de 2024 .
- ↑ Linzen, Tal (julio de 2020). Jurafsky, Dan; Chai, Joyce; Schluter, Natalie; Tetreault, Joel (eds.). "¿Cómo podemos acelerar el progreso hacia una generalización lingüística similar a la humana?" . Actas de la 58.ª Reunión Anual de la Asociación de Lingüística Computacional . En línea: Asociación de Lingüística Computacional: 5210–5217 . arXiv : 2005.00955 . doi : 10.18653/v1/2020.acl-main.465 . Archivado del original el 28 de abril de 2025. Recuperado el 13 de febrero de 2024 .
- ↑ "Gráficos de ecosistemas para modelos fundamentales" . crfm.stanford.edu . Archivado del original el 13 de febrero de 2024. Consultado el 13 de febrero de 2024 .
- ↑ Vipra, Jai; Korinek, Anton (2 de noviembre de 2023), Implicaciones de la concentración de mercado de los modelos de fundación , arXiv : 2311.01550
- ↑ "Acelere el desarrollo de aplicaciones de IA | Scale AI" . scale.com . Consultado el 21 de abril de 2024 .
- ↑ "Surge AI | La plataforma de etiquetado de datos más potente del mundo" . www.surgehq.ai . Archivado del original el 21 de abril de 2024. Consultado el 21 de abril de 2024 .
- ↑ "Índice de IA 2024 – capítulo 1" (PDF) . 15 de abril de 2024. págs. 37–39 . Archivado (PDF) del original el 2 de junio de 2024. Recuperado el 15 de junio de 2024 .
- ↑ "Poder computacional e IA" . AI Now Institute . 27 de septiembre de 2023. Consultado el 13 de febrero de 2024 .
- ↑ Tiku, Nitasha; Schaul, Kevin; Chen, Szu Yu. «Estas imágenes falsas revelan cómo la IA amplifica nuestros peores estereotipos» . Washington Post . Archivado del original el 25 de abril de 2024. Consultado el 13 de febrero de 2024 .
- ↑ "Cómo la industria de la IA se beneficia de la catástrofe" . MIT Technology Review . Consultado el 13 de febrero de 2024 .
- ↑ "Exclusiva: Los trabajadores que ganaban 2 dólares por hora y que hicieron que ChatGPT fuera más seguro" . TIME . 18 de enero de 2023. Archivado del original el 19 de enero de 2023. Consultado el 13 de febrero de 2024 .
- ↑ Liang, Percy; Bommasani, Rishi; Creel, Kathleen (17 de mayo de 2022). "Es el momento de desarrollar normas comunitarias para la publicación de modelos fundacionales" . Stanford CRFM . Archivado del original el 13 de febrero de 2024. Recuperado el 13 de febrero de 2024 .
- ↑ Solaiman, Irene (5 de febrero de 2023), El gradiente de lanzamiento de IA generativa: métodos y consideraciones , arXiv : 2302.04844
- ↑ Alayrac, Jean-Baptiste; Donahue, Jeff; Luc, Pauline; Miech, Antoine; Barr, Iain; Hasson, Yana; Lenc, Karel; Mensch, Arthur; Millican, Katie (15 de noviembre de 2022), Flamingo: un modelo de lenguaje visual para el aprendizaje con pocos ejemplos , arXiv : 2204.14198.
- Procesamiento del lenguaje natural
- Lingüística computacional
- Campos de estudio computacionales
- Modelado del lenguaje
- Aprendizaje no supervisado
- Aprendizaje profundo