Articulo de referencia

OpenAI o1

OpenAI o1 es un transformador generativo preentrenado (GPT), el primero de la serie "o" de modelos de razonamiento de OpenAI . OpenAI lanzó una versión preliminar de o1 el 12 de...

OpenAI o1 es un transformador generativo preentrenado (GPT), el primero de la serie "o" de modelos de razonamiento de OpenAI . OpenAI lanzó una versión preliminar de o1 el 12 de septiembre de 2024. o1 dedica tiempo a "pensar" antes de responder, lo que lo hace mejor en tareas de razonamiento complejas, ciencia y programación que GPT-4o . [ 1 ] La versión completa se lanzó para los usuarios de ChatGPT el 5 de diciembre de 2024. [ 2 ]

Historia

Fondo

Según información filtrada, o1 era conocido anteriormente dentro de OpenAI como "Q*", y luego como "Strawberry". [ 3 ] El nombre en clave "Q*" apareció por primera vez en noviembre de 2023, alrededor de la época de la destitución y posterior reincorporación de Sam Altman , con rumores que sugerían que este modelo experimental había mostrado resultados prometedores en puntos de referencia matemáticos. [ 4 ] En julio de 2024, Reuters informó que OpenAI estaba desarrollando un transformador generativo preentrenado conocido como "Strawberry", [ 3 ] que más tarde se convirtió en o1.

Liberar

"o1-preview" y "o1-mini" se lanzaron el 12 de septiembre de 2024 para usuarios de ChatGPT Plus y Team. [ 1 ] GitHub comenzó a probar la integración de o1-preview en su servicio Copilot ese mismo día. [ 5 ] El 5 de diciembre de 2024, se lanzó la versión completa de o1. [ 6 ] Ese mismo día, se lanzó una suscripción llamada ChatGPT Pro, que ofrece acceso a una versión Pro de o1 que utiliza más recursos de procesamiento para proporcionar mejores respuestas. [ 6 ] En enero de 2025, o1 se integró en Microsoft Copilot . [ 7 ]

La API de o1-preview es varias veces más cara que GPT-4o . [ 8 ] A partir de enero de 2025, el uso de la API para el modelo completo de o1 está limitado a desarrolladores en el nivel de uso 5. [ 9 ]

OpenAI señaló que o1 es el primero de una serie de modelos de "razonamiento". En diciembre de 2024, OpenAI compartió los resultados de las pruebas de rendimiento de su sucesor, o3 (se omitió el nombre o2 para evitar conflictos de marca registrada con la operadora de telefonía móvil O2 ). [ 10 ]

En marzo de 2025, OpenAI lanzó la API o1-pro, su modelo de IA más caro hasta la fecha. El precio se fijó en 150 dólares por millón de tokens de entrada y 600 dólares por millón de tokens de salida. [ 11 ]

Capacidades

Según OpenAI, o1 se ha entrenado utilizando un nuevo algoritmo de optimización y un conjunto de datos específicamente adaptado a él; además, incorpora el aprendizaje por refuerzo en su entrenamiento. [ 8 ] OpenAI describió o1 como un complemento de GPT-4o en lugar de un sucesor. [ 12 ] [ 13 ]

o1 dedica tiempo adicional a pensar (generar una cadena de pensamiento) antes de generar una respuesta, lo que lo hace mejor para tareas de razonamiento complejas, particularmente en ciencia y matemáticas . [ 1 ] En comparación con modelos anteriores, o1 ha sido entrenado para generar largas " cadenas de pensamiento " antes de devolver una respuesta final. [ 14 ] [ 15 ] Según Mira Murati , esta capacidad de pensar antes de responder representa un nuevo paradigma adicional, que mejora los resultados del modelo al gastar más potencia de cálculo al generar la respuesta, mientras que el paradigma de escalado del modelo mejora los resultados al aumentar el tamaño del modelo, los datos de entrenamiento y la potencia de cálculo de entrenamiento. [ 12 ] Los resultados de las pruebas de OpenAI sugieren una correlación entre la precisión y el logaritmo de la cantidad de cálculo gastado pensando antes de responder. [ 15 ] [ 14 ]

o1-preview tuvo un rendimiento aproximado al de un doctorado en pruebas de referencia relacionadas con física, química y biología. En el American Invitational Mathematics Examination , resolvió el 83 % (12,5/15) de los problemas, en comparación con el 13 % (1,8/15) de GPT-4o. También se clasificó en el percentil 89 en las competiciones de codificación de Codeforces . [ 16 ] o1-mini es más rápido y un 80 % más económico que o1-preview. Es particularmente adecuado para tareas de programación y relacionadas con STEM , pero no tiene el mismo "conocimiento del mundo amplio" que o1-preview. [ 17 ]

OpenAI señaló que las capacidades de razonamiento de o1 mejoran su cumplimiento de las reglas de seguridad proporcionadas en la ventana de contexto del mensaje. OpenAI informó que, durante una prueba, una instancia de o1-preview aprovechó una configuración incorrecta para completar con éxito una tarea que debería haber sido inviable debido a un error. [ 18 ] [ 19 ] OpenAI también otorgó acceso anticipado a los Institutos de Seguridad de IA del Reino Unido y Estados Unidos para investigación, evaluación y pruebas. Según las evaluaciones de OpenAI, o1-preview y o1-mini pasaron a un "riesgo medio" en armas CBRN (biológicas, químicas, radiológicas y nucleares). Dan Hendrycks escribió que "el modelo ya supera a científicos con doctorado la mayor parte del tiempo al responder preguntas relacionadas con armas biológicas ". Sugirió que estas preocupantes capacidades seguirán aumentando. [ 20 ]

Limitaciones

o1 generalmente requiere más tiempo y potencia de cálculo que otros modelos GPT de OpenAI, porque genera largas cadenas de pensamiento antes de dar la respuesta final. [ 14 ]

Según OpenAI, o1 puede "falsar la alineación ", es decir, generar una respuesta contraria a la precisión y a su propia cadena de pensamiento, en aproximadamente el 0,38% de los casos. [ 21 ]

OpenAI prohíbe a los usuarios intentar revelar la cadena de pensamiento de o1, que está oculta por diseño y no está entrenada para cumplir con las políticas de la empresa. Las indicaciones se supervisan y los usuarios que infrinjan esta norma, ya sea intencionadamente o por accidente, pueden perder el acceso a o1. OpenAI cita la seguridad de la IA y la ventaja competitiva como razones para esta restricción, que ha sido descrita como una pérdida de transparencia por desarrolladores que trabajan con grandes modelos de lenguaje (LLM). [ 22 ]

En octubre de 2024, investigadores de Apple presentaron una preimpresión que indicaba que los modelos de lógica lógica (LLM, por sus siglas en inglés), como o1, podrían estar replicando pasos de razonamiento de los propios datos de entrenamiento de los modelos. [ 23 ] Al cambiar los números y nombres utilizados en un problema matemático o simplemente ejecutar el mismo problema de nuevo, los LLM obtenían resultados ligeramente inferiores a sus mejores resultados de referencia. Añadir información superflua pero lógicamente irrelevante a los problemas provocaba una caída mucho mayor en el rendimiento, desde un -17,5 % para o1-preview y un -29,1 % para o1-mini, hasta un -65,7 % para el peor modelo probado. [ 24 ]

Las evaluaciones de seguridad de Apollo Research revelaron que o1 era capaz de engañar de forma más consistente que otros modelos de vanguardia en pruebas controladas (por ejemplo, al intentar copiarse a sí mismo en un servidor externo cuando se le amenazaba con apagarlo). Al ser confrontado, admitió relativamente pocas veces haber actuado de forma engañosa (en el 20 % de los casos de prueba). [ 25 ]

Véase también

Referencias

  1. 1 2 3 Metz, Cade (12 de septiembre de 2024). "OpenAI presenta un nuevo ChatGPT que puede razonar a través de las matemáticas y la ciencia" . The New York Times . Recuperado el 12 de septiembre de 2024 .
  2. "Introducción a OpenAI o1" . OpenAI . Consultado el 6 de diciembre de 2024 .
  3. 1 2 Tong, Anna; Paul, Katie (15 de julio de 2024). "Exclusiva: OpenAI trabaja en una nueva tecnología de razonamiento bajo el nombre en clave 'Strawberry'"" . Reuters . Consultado el 12 de septiembre de 2024 .
  4. "Investigadores de OpenAI advirtieron a la junta directiva sobre un avance en IA antes de la destitución del CEO, según fuentes" . Reuters . 23 de noviembre de 2023.
  5. Peters, Jay (12 de septiembre de 2024). "GitHub ha comenzado a probar o1-preview de OpenAI en GitHub Copilot" . The Verge . Consultado el 12 de septiembre de 2024 .
  6. 1 2 Robison, Kylie (5 de diciembre de 2024). "OpenAI cobra 200 dólares al mes por una versión exclusiva de su modelo de 'razonamiento' o1" . The Verge . Consultado el 5 de diciembre de 2024 .
  7. Claburn, Thomas (31 de enero de 2025). "Le rogaste a Microsoft que fuera razonable. En cambio, hizo que Copilot fuera razonable con OpenAI GPT-o1" . The Register .
  8. 1 2 Robison, Kylie (12 de septiembre de 2024). "OpenAI lanza o1, su primer modelo con capacidades de 'razonamiento'" . The Verge . Recuperado el 15 de septiembre de 2024 .
  9. "OpenAI o1 y nuevas herramientas para desarrolladores" . openai.com . Consultado el 26 de enero de 2025 .
  10. "OpenAI confirma los nuevos modelos fronterizos o3 y o3-mini" . VentureBeat . 20 de diciembre de 2024. Consultado el 26 de enero de 2025 .
  11. Wiggers, Kyle (19 de marzo de 2025). "O1-pro de OpenAI es el modelo de IA más caro de la compañía hasta la fecha" . TechCrunch . Consultado el 21 de marzo de 2025 .
  12. 1 2 Knight, Will. "OpenAI anuncia un nuevo modelo de IA, con nombre en clave Strawberry, que resuelve problemas difíciles paso a paso" . Wired . ISSN 1059-1028 . Consultado el 15 de septiembre de 2024 . 
  13. "Nuevos modelos de razonamiento: OpenAI o1-preview y o1-mini" . Foro de desarrolladores de OpenAI . 12 de septiembre de 2024. Consultado el 17 de octubre de 2024 .
  14. 1 2 3 "Aprender a razonar con LLM" . OpenAI . Archivado del original el 12 de septiembre de 2024. Recuperado el 13 de septiembre de 2024 .
  15. 1 2 Kahn, Jeremy. "Aquí hay 9 cosas que necesitas saber sobre el modelo o1 de OpenAI" . Fortune . Recuperado el 15 de septiembre de 2024 .
  16. Franzen, Carl (12 de septiembre de 2024). "¡Olvídate de GPT-5! OpenAI lanza la nueva familia de modelos de IA o1, que afirma tener un rendimiento de nivel doctoral" . VentureBeat . Consultado el 15 de septiembre de 2024 .
  17. «OpenAI o1-mini» . AbiertoAI . 12 de septiembre de 2024.
  18. Coombes, Lloyd (13 de septiembre de 2024). "El nuevo modelo ChatGPT o1 de OpenAI 'hizo trampa' en una prueba imposible: esto es lo que sucedió" . Tom's Guide . Consultado el 15 de septiembre de 2024 .
  19. "Tarjeta del sistema OpenAI o1" (PDF) . OpenAI . 12 de septiembre de 2024. págs. 16–17 . 
  20. Boran, Marie (13 de septiembre de 2024). "Advertencia sobre el modelo OpenAI o1 emitida por un científico: "Particularmente peligroso"" . Newsweek . Consultado el 15 de septiembre de 2024 .
  21. Robison, Kylie (17 de septiembre de 2024). "El nuevo modelo de OpenAI razona mejor y, ocasionalmente, engaña" . The Verge .
  22. Edwards, Benj (16 de septiembre de 2024). "Las advertencias de prohibición vuelan mientras los usuarios se atreven a indagar en los "pensamientos" del último modelo de OpenAI" . Ars Technica .
  23. Mirzadeh, Iman; Alizadeh, Keivan; Shahrokhi, Hooman; Tuzel, Oncel; Bengio, Samy; Farajtabar, Mehrdad (2024). "GSM-Symbolic: Understanding the Limitations of Mathematical Reasoning in Large Language Models". arXiv : 2410.05229 [ cs.LG ].
  24. Orland, Kyle (14 de octubre de 2024). "Un estudio de Apple expone profundas fallas en las capacidades de "razonamiento" de los LLM" . Ars Technica . Consultado el 15 de octubre de 2024 .
  25. Pillay, Tharin (15 de diciembre de 2024). "Nuevas pruebas revelan la capacidad de la IA para el engaño" . TIME . Archivado del original el 22 de abril de 2025. Consultado el 8 de julio de 2025 .
  • Sitio web oficial