Hangzhou DeepSeek Artificial Intelligence Basic Technology Research Co., Ltd. , [ 3 ] [ 4 ] [ 5 ] [ a ] que opera como DeepSeek , [ b ] es una empresa china de inteligencia artificial (IA) que desarrolla grandes modelos de lenguaje (LLM). Con sede en Hangzhou , Zhejiang , DeepSeek es propiedad de High-Flyer , un fondo de cobertura chino , que también la financia . DeepSeek fue fundada en julio de 2023 por Liang Wenfeng , cofundador de High-Flyer, quien también se desempeña como CEO de ambas empresas. [ 7 ] [ 8 ] [ 9 ] La empresa lanzó un chatbot homónimo junto con su modelo DeepSeek-R1 en enero de 2025.
DeepSeek-R1 proporcionó respuestas comparables a otros modelos de lenguaje grandes contemporáneos, como GPT-4 y o1 de OpenAI . [ 10 ] Se informó que su costo de entrenamiento fue significativamente menor que el de otros LLM. La compañía afirma que entrenó su modelo V3 por US$6 millones, mucho menos que el costo de US$100 millones para GPT-4 de OpenAI en 2023 [ 11 ] y utilizando aproximadamente una décima parte de la potencia de cálculo consumida por el modelo comparable de Meta , Llama 3.1 . [ 11 ] [ 12 ] [ 13 ] El éxito de DeepSeek frente a rivales más grandes y establecidos se ha descrito como "un giro radical en la IA". [ 14 ] [ 15 ]
Los modelos de DeepSeek se describen como de "peso abierto", lo que significa que los parámetros exactos se comparten abiertamente, pero los datos de entrenamiento no tienen licencia abierta. [ 16 ] [ 10 ] Desde el debut de DeepSeek-R1 en enero de 2025, la compañía ha puesto sus nuevos modelos a disposición bajo licencias de software libre y de código abierto , principalmente la Licencia MIT . [ 17 ] Según se informa, la compañía recluta investigadores de IA de las mejores universidades chinas [ 14 ] y también contrata a personas ajenas a los campos tradicionales de la informática para ampliar el conocimiento y las capacidades de sus modelos. [ 12 ]
DeepSeek redujo significativamente los gastos de entrenamiento de su modelo R1 al incorporar técnicas como capas de mezcla de expertos (MoE). [ 18 ] La empresa también entrenó sus modelos durante las restricciones comerciales vigentes a las exportaciones de chips de IA a China, utilizando chips de IA más débiles destinados a la exportación y empleando menos unidades en general. [ 13 ] [ 19 ] Los observadores dicen que este avance envió "ondas de choque" a través de la industria que se describieron como desencadenantes de un " momento Sputnik " para los EE. UU. en el campo de la inteligencia artificial, particularmente debido a sus modelos de IA de código abierto, rentables y de alto rendimiento. [ 20 ] [ 21 ] [ 22 ] Esto amenazó a líderes establecidos de hardware de IA como Nvidia ; el precio de las acciones de Nvidia cayó drásticamente, perdiendo US$600 mil millones en valor de mercado, la mayor caída de una sola empresa en la historia del mercado de valores de EE . UU. [ 23 ] [ 24 ]
Historia
Fundación y primeros años (2016–2023)
En febrero de 2016, High-Flyer fue cofundada por Liang Wenfeng , un entusiasta de la IA que había estado operando en bolsa desde la crisis financiera de 2008 mientras estudiaba en la Universidad de Zhejiang . [ 25 ] La empresa comenzó a operar en bolsa utilizando un modelo de aprendizaje profundo dependiente de GPU el 21 de octubre de 2016; antes de eso, había utilizado modelos lineales basados en CPU . A finales de 2017, la mayor parte de sus operaciones se basaban en IA. [ 26 ]
Liang fundó High-Flyer como un fondo de cobertura centrado en el desarrollo y uso de algoritmos de negociación de IA, y para 2021 la empresa utilizaba exclusivamente IA, [ 27 ] a menudo utilizando chips de Nvidia . [ 28 ]
En 2019, la empresa comenzó a construir su primer clúster de computación , Fire-Flyer, con un costo de 200 millones de yuanes; contenía 1100 GPU interconectadas a 200 Gbit/s y fue retirado después de 1,5 años de funcionamiento. [ 26 ]
Para 2021, Liang había comenzado a comprar grandes cantidades de GPU de Nvidia para un proyecto de IA, [ 28 ] supuestamente obtuvo 10 000 GPU Nvidia A100 [ 29 ] antes de que Estados Unidos restringiera las ventas de chips a China. [ 27 ] El clúster de computación Fire-Flyer 2 comenzó a construirse en 2021 con un presupuesto de 1000 millones de yuanes. [ 26 ]
Se informó que en 2022, la capacidad de Fire-Flyer 2 se había utilizado en más del 96%, lo que totalizó 56,74 millones de horas de GPU. El 27% se utilizó para dar soporte a la computación científica fuera de la empresa. [ 26 ]
Durante 2022, Fire-Flyer 2 contaba con 5000 GPU PCIe A100 en 625 nodos, cada uno con 8 GPU. En ese momento, utilizaba exclusivamente PCIe en lugar de la versión DGX de A100, ya que los modelos entrenados cabían en una única VRAM de GPU de 40 GB , por lo que no era necesario el mayor ancho de banda de DGX (es decir, solo requería paralelismo de datos, no de modelos). [ 30 ] Posteriormente, incorporó NVLinks y NCCL (Nvidia Collective Communications Library) para entrenar modelos más grandes que requerían paralelismo de modelos. [ 31 ] [ 32 ]
El 14 de abril de 2023, [ 33 ] High-Flyer anunció el lanzamiento de un laboratorio de investigación de inteligencia artificial general (IAG), declarando que el nuevo laboratorio se centraría en el desarrollo de herramientas de IA no relacionadas con el negocio financiero de la empresa. [ 34 ] [ 35 ] Dos meses después, el 17 de julio de 2023, [ 1 ] ese laboratorio se escindió en una empresa independiente, DeepSeek, con High-Flyer como su principal inversor y patrocinador. [ 27 ] [ 36 ] [ 35 ] Los inversores de capital riesgo se mostraron reacios a proporcionar financiación, ya que consideraban improbable que la empresa pudiera generar rápidamente una " salida ". [ 27 ]
Lanzamientos de modelos desde 2023
DeepSeek lanzó su primer modelo, DeepSeek Coder, el 2 de noviembre de 2023, seguido de la serie DeepSeek-LLM el 29 de noviembre de 2023. [ 37 ] : sección 5 En enero de 2024, lanzó dos modelos DeepSeek-MoE (Base y Chat), [ 38 ] y en abril 3 modelos DeepSeek-Math (Base, Instruct y RL). [ 39 ]
DeepSeek-V2 se lanzó en mayo de 2024, seguido un mes después por la serie DeepSeek-Coder V2. [ 40 ] En septiembre de 2024, se presentó DeepSeek V2.5 y se revisó en diciembre. [ 41 ] El 20 de noviembre de 2024, la vista previa de DeepSeek-R1-Lite estuvo disponible a través del chat. [ 42 ] [ 43 ] En diciembre, se lanzaron DeepSeek-V3-Base y DeepSeek-V3 (chat). [ 31 ]

El 20 de enero de 2025, DeepSeek lanzó el chatbot DeepSeek —basado en el modelo DeepSeek-R1— gratuito para iOS y Android . Para el 27 de enero, DeepSeek superó a ChatGPT como la aplicación gratuita más descargada en la App Store de iOS en Estados Unidos, [ 14 ] lo que provocó una caída del 18 % en el precio de las acciones de Nvidia. [ 44 ] [ 45 ]
El 24 de marzo de 2025, DeepSeek publicó DeepSeek-V3-0324 bajo la licencia MIT. [ 46 ] [ 47 ]
El 28 de mayo de 2025, DeepSeek publicó DeepSeek-R1-0528 bajo la licencia MIT. [ 48 ] Se ha observado que el modelo se ajusta más estrictamente a la ideología oficial del Partido Comunista Chino y a la censura en sus respuestas a las preguntas que los modelos anteriores. [ 49 ]
El 21 de agosto de 2025, DeepSeek lanzó DeepSeek V3.1 bajo la licencia MIT. [ 50 ] Este modelo presenta una arquitectura híbrida con modos de pensamiento y no pensamiento. También supera a modelos anteriores como V3 y R1, en más del 40% en ciertos benchmarks como SWE-bench y Terminal-bench. [ 51 ] Se actualizó a V3.1-Terminus el 22 de septiembre de 2025. [ 52 ] V3.2-Exp se lanzó el 29 de septiembre de 2025. Utiliza DeepSeek Sparse Attention, un mecanismo de atención más eficiente basado en investigaciones previas publicadas en febrero. [ 53 ] [ 54 ] DeepSeek-V3.2 se lanzó el 1 de diciembre de 2025, junto con una variante DeepSeek-V3.2-Speciale que se centró en el razonamiento. [ 55 ] [ 56 ]
En febrero de 2026, Anthropic acusó a DeepSeek de utilizar miles de cuentas fraudulentas para generar millones de conversaciones con Claude para entrenar sus propios modelos de lenguaje a gran escala. [ 57 ]
En abril de 2026, los inversores comenzaron a hablar con DeepSeek para una ronda de financiación de 300 millones de dólares, lo que llevaría a DeepSeek a una valoración total de 10 mil millones de dólares. [ 58 ]
El 24 de abril de 2026, DeepSeek publicó una vista previa de su serie V4, que incluye DeepSeek-V4-Pro de 1,6 billones de parámetros y DeepSeek-V4-Flash de 284 mil millones de parámetros, ambos con una ventana de contexto de 1 millón de tokens, bajo la licencia MIT. [ 59 ] [ 60 ] [ 61 ] El LLM V4 de DeepSeek ha sido adoptado por fabricantes clave de semiconductores y fabricantes de chips de inteligencia artificial como Huawei y Cambricon . [ 62 ]
Operación de la empresa
DeepSeek tiene su sede en Hangzhou, Zhejiang, y es propiedad de High-Flyer , que también la financia . Su cofundador, Liang Wenfeng , es el director ejecutivo. En mayo de 2024, Liang poseía personalmente una participación del 84 % en DeepSeek a través de dos empresas fantasma . [ nota 1 ] [ 63 ]
Estrategia
DeepSeek ha declarado que se centra en la investigación y no tiene planes inmediatos de comercialización. [ 64 ] Esta postura también significa que puede eludir ciertas disposiciones de las regulaciones chinas sobre IA dirigidas a tecnologías orientadas al consumidor. [ 12 ]
El enfoque de contratación de DeepSeek enfatiza las habilidades por encima de la larga experiencia laboral, lo que resulta en muchas contrataciones de recién graduados universitarios. [ 35 ] [ 12 ] La empresa también recluta personas sin formación en informática para ampliar el rango de conocimientos incorporados a los modelos, por ejemplo, en poesía o matemáticas avanzadas. [ 14 ] [ 12 ] Según The New York Times , docenas de investigadores de DeepSeek tienen o han tenido vínculos con laboratorios del Ejército Popular de Liberación y los Siete Hijos de la Defensa Nacional . [ 65 ]
Debido al impacto de las restricciones estadounidenses sobre los chips, DeepSeek perfeccionó sus algoritmos para maximizar la eficiencia computacional y, por lo tanto, aprovechó hardware más antiguo y redujo el consumo de energía. [ 66 ] : 19
DeepSeek también se expandió en el continente africano, ya que ofrece soluciones de IA más asequibles y con menor consumo energético. La compañía ha impulsado modelos de lenguaje africanos y ha generado varias startups, por ejemplo en Nairobi . Junto con los servicios de almacenamiento y computación en la nube de Huawei , su impacto en el panorama tecnológico del África subsahariana es considerable. DeepSeek ofrece soberanía de datos local y mayor flexibilidad en comparación con las plataformas de IA occidentales. [ 67 ]
Marco de formación
High-Flyer/DeepSeek había operado al menos dos clústeres de computación principales: Fire-Flyer (萤火一号) y Fire-Flyer 2 (萤火二号). Fire-Flyer 1 se construyó en 2019 y se retiró después de 1,5 años de operación. Fire-Flyer 2 sigue en funcionamiento a partir de 2025. Fire-Flyer 2 consta de una arquitectura de software y hardware de diseño conjunto. En el lado del hardware, las GPU de Nvidia utilizan interconexiones de 200 Gbps . El clúster está dividido en dos "zonas" y la plataforma admite tareas entre zonas. La topología de red era de dos árboles gordos , elegidos para un alto ancho de banda de bisección . En el lado del software están: [ 32 ] [ 26 ]
3FS(Sistema de archivos Fire-Flyer): Un sistema de archivos paralelo distribuido , diseñado específicamente para lecturas aleatorias asíncronas. Utiliza E/S directa y lectura RDMA . A diferencia de la E/S con búfer estándar, la E/S directa no almacena datos en caché. El almacenamiento en caché es inútil en este caso, ya que cada dato leído es aleatorio y no se reutiliza. [ 68 ] [ 69 ]hfreduce: Biblioteca para comunicación asíncrona, diseñada originalmente para reemplazar la Biblioteca de Comunicación Colectiva de Nvidia (NCCL). [ 30 ] Se utiliza principalmente para allreduce , especialmente de gradientes durante la retropropagación . Se ejecuta asíncronamente en la CPU para evitar el bloqueo de kernels en la GPU. [ 32 ] Utiliza difusión de dos árboles como NCCL. [ 30 ]hfai.nn: Biblioteca de software de operadores de uso común para el entrenamiento de redes neuronales, similar a latorch.nnde PyTorch .HaiScale Distributed Data Parallel(DDP): Biblioteca de entrenamiento paralelo que implementa diversas formas de paralelismo, como paralelismo de datos (DP), paralelismo de canalización (PP), paralelismo tensorial (TP), paralelismo de expertos (EP), paralelismo de datos totalmente fragmentados (FSDP) y optimizador de redundancia cero (ZeRO). Es similar a PyTorch DDP, que utiliza NCCL en el backend.HAI Platform: Diversas aplicaciones como la programación de tareas, el manejo de fallas y la recuperación ante desastres. [ 70 ]
En 2022, Fire-Flyer 2 contaba con 5000 GPU PCIe A100 en 625 nodos, cada uno con 8 GPU. [ 30 ] Posteriormente, incorporó NVLinks y NCCL para entrenar modelos más grandes que requerían paralelismo de modelos. [ 31 ] [ 32 ]
Historial de desarrollo y lanzamiento
Los primeros modelos DeepSeek eran esencialmente iguales a Llama, [ 37 ] que eran transformadores densos solo con decodificador . Los modelos posteriores incorporaron la atención latente multi-cabeza (MLA), la mezcla de expertos (MoE) y el almacenamiento en caché KV. [ 38 ] [ 40 ]
Un transformador de solo decodificador consta de múltiples capas de decodificación idénticas. Cada una de estas capas presenta dos componentes principales: una capa de atención y una capa de red de alimentación directa (FFN). [ 40 ] V2 reemplazó el mecanismo de atención multi-cabeza estándar (MHA) con atención latente multi-cabeza (MLA). Esto introduce vectores latentes comprimidos para reducir el tamaño de la caché KV (clave-valor) y, por lo tanto, el uso de memoria. [ 40 ]
Un transformador MoE estándar generalmente utiliza capas MoE con compuertas dispersas en las capas FFN. En una capa MoE de este tipo, hay varios módulos FFN en paralelo ("expertos enrutados") y un pequeño clasificador ("compuerta") para calcular una puntuación para todos estos módulos sobre cada token. Solo se activan los módulos con la puntuación más alta. A partir de DeepSeekMoE, DeepSeek adoptó una variante que añade "expertos compartidos", que siempre están activados. [ 38 ]
Descripción general de los modelos y especificaciones técnicas.
Los modelos de DeepSeek son de "peso abierto", lo que proporciona menos libertad de modificación que el software de código abierto verdadero . [ 16 ] [ 10 ]
Programador de DeepSeek
DeepSeek Coder es una serie de ocho modelos, cuatro preentrenados ( Base) y cuatro ajustados con instrucciones ( Instruct). Todos tienen longitudes de contexto de 16K. El modelo se publicó como código fuente bajo la Licencia DeepSeek, que incluye restricciones de "uso abierto y responsable posterior". [ 88 ]
El programa de capacitación fue: [ 89 ] [ 90 ] [ 91 ]
- Preentrenamiento: 1,8 T tokens (87 % código fuente, 10 % inglés relacionado con código (GitHub markdown y Stack Exchange ) y 3 % chino no relacionado con código).
- Preentrenamiento con contexto extenso: 200 mil millones de tokens. Esto amplía la longitud del contexto de 4K a 16K. Esto generó los
Basemodelos. - Ajuste fino supervisado (SFT): 2 mil millones de tokens de datos de instrucciones. Esto produjo los
Instructmodelos.
Fueron entrenados en clústeres de GPU Nvidia A100 y H800 , conectados por InfiniBand , NVLink , NVSwitch . [ 89 ]
DeepSeek-LLM
La serie DeepSeek-LLM se lanzó en noviembre de 2023. Tiene 7B y 67B parámetros tanto en la forma Base como en la Chat. El documento adjunto de DeepSeek afirmaba que los resultados de referencia eran superiores a los de Llama 2 y a la mayoría de los LLM de código abierto de la época. [ 37 ] : sección 5 El código del modelo está bajo la licencia DeepSeek de código abierto. [ 93 ]
La arquitectura era esencialmente la misma que la de la serie Llama . Utilizaron el Transformer decodificador solo pre-normalizado con RMSNorm como normalización, SwiGLU en las capas de alimentación directa, incrustación posicional rotativa (RoPE) y atención de consulta agrupada (GQA). Ambos tenían un tamaño de vocabulario de 102 400 ( BPE a nivel de byte ) y una longitud de contexto de 4096. Se entrenaron con 2 billones de tokens de texto en inglés y chino obtenidos mediante la eliminación de duplicados del Common Crawl . [ 37 ]
Las versiones Chat de los dos modelos Base se publicaron simultáneamente, obtenidas mediante el entrenamiento de Base por ajuste fino supervisado (SFT) seguido de optimización directa de políticas (DPO) . [ 37 ]
Ministerio de Educación
Los modelos DeepSeek-MoE (Base y Chat) tienen cada uno 16B parámetros (2,7B activados por token, longitud de contexto de 4K). El entrenamiento fue esencialmente el mismo que el de DeepSeek-LLM 7B y se entrenó con una parte de su conjunto de datos de entrenamiento. Afirmaron un rendimiento comparable al de un MoE de 16B como el de un modelo no MoE de 7B. Es una variante del MoE estándar con compuertas dispersas , con "expertos compartidos" que siempre se consultan y "expertos enrutados" que podrían no serlo. Descubrieron que esto ayuda a equilibrar a los expertos. En el MoE estándar, algunos expertos pueden usarse en exceso, mientras que otros se usan raramente, desperdiciando espacio. Intentar equilibrar el uso de los expertos hace que estos repliquen la misma capacidad. Propusieron que los expertos compartidos aprendieran las capacidades centrales que se usan con frecuencia y que los expertos enrutados aprendieran las capacidades periféricas que se usan raramente. [ 38 ]
Matemáticas
DeepSeek-Math incluye 3 modelos: Base, Instruct y RL. Math fue entrenado de la siguiente manera: [ 39 ]
- Inicializar con una base DeepSeek-Coder v1.5 7B previamente preentrenada.
- Se realizó un preentrenamiento adicional con 500 mil millones de tokens (6% DeepSeekMath Corpus, 4% AlgebraicStack, 10% arXiv, 20% código de GitHub, 10% Common Crawl). Esto produjo Base.
- Entrena un modelo de seguimiento de instrucciones mediante SFT Base con 776.000 problemas matemáticos y soluciones paso a paso integradas en el uso de herramientas. Esto produjo Instruct.
- Aprendizaje por refuerzo (RL): El modelo de recompensa fue un modelo de recompensa de proceso (PRM) entrenado a partir de Base según el método Math-Shepherd. [ 94 ] Este modelo de recompensa se utilizó luego para entrenar Instruct usando Optimización de Política Relativa de Grupo (GRPO) en un conjunto de datos de 144K preguntas de matemáticas "relacionadas con GSM8K y MATH ". El modelo de recompensa se actualizó continuamente durante el entrenamiento para evitar el hackeo de recompensas. Esto dio como resultado RL.
V2

En mayo de 2024, DeepSeek lanzó la serie DeepSeek-V2. La serie incluye 4 modelos, 2 modelos base (DeepSeek-V2, DeepSeek-V2 Lite) y 2 chatbots (Chat). Los dos modelos más grandes se entrenaron de la siguiente manera: [ 95 ]
- Preentrenar con un conjunto de datos de 8,1 billones de tokens, utilizando un 12 % más de tokens chinos que ingleses.
- Ampliar la longitud del contexto de 4K a 128K usando YaRN. [ 96 ] Esto dio como resultado DeepSeek-V2.
- SFT registró 1,2 millones de instancias de utilidad y 0,3 millones de seguridad. Esto dio como resultado Chat SFT, que finalmente no se lanzó.
- Aprendizaje por refuerzo (RL) con GRPO en dos etapas. La primera etapa se entrenó para resolver problemas matemáticos y de programación. Esta etapa utilizó un modelo de recompensa, entrenado con retroalimentación del compilador (para programación) y etiquetas de referencia (para matemáticas). La segunda etapa se entrenó para ser útil, seguro y seguir reglas. Esta etapa utilizó tres modelos de recompensa. Los modelos de recompensa de utilidad y seguridad se entrenaron con datos de preferencias humanas. El modelo de recompensa basado en reglas se programó manualmente. Todos los modelos de recompensa entrenados se inicializaron desde Chat (SFT). Esto dio como resultado la versión publicada de Chat.
Optaron por el aprendizaje por refuerzo (RL) de dos etapas, porque descubrieron que el RL en datos de razonamiento tenía "características únicas" diferentes del RL en datos generales. Por ejemplo, el RL en razonamiento podía mejorar con más pasos de entrenamiento. [ 95 ]
Los dos modelos V2-Lite eran más pequeños y se entrenaron de forma similar. DeepSeek-V2 Lite-Chat solo se sometió a SFT, no a RL. Entrenaron la versión Lite para ayudar a "impulsar la investigación y el desarrollo de MLA y DeepSeekMoE". [ 95 ]
Desde el punto de vista arquitectónico, los modelos V2 eran significativamente diferentes de la serie DeepSeek LLM. Modificaron el mecanismo de atención estándar mediante una aproximación de bajo rango denominada atención latente multi-cabeza (MLA), y utilizaron la variante de mezcla de expertos (MoE) publicada anteriormente. [ 38 ]
El Financial Times informó que era más barato que sus competidores, con un precio de 2 RMB por cada millón de tokens de salida. La clasificación del Tiger Lab de la Universidad de Waterloo situó a DeepSeek-V2 en séptimo lugar en su ranking LLM. [ 36 ]
La serie DeepSeek-Coder V2 incluía V2-Base, V2-Lite-Base, V2-Instruct y V20-Lite-Instruct. Entrenamiento: [ 40 ] [ nota 3 ]
- Los modelos base se inicializaron a partir de los puntos de control intermedios correspondientes después del preentrenamiento con 4,2 T tokens (no la versión al final del preentrenamiento), luego se preentrenaron aún más con 6 T tokens y, finalmente, se extendió el contexto a una longitud de contexto de 128 K.
- Se utilizaron DeepSeek-Coder y DeepSeek-Math para generar 20 000 datos de instrucciones relacionadas con el código y 30 000 relacionadas con las matemáticas, que luego se combinaron con un conjunto de datos de instrucciones de 300 millones de tokens. Esto se utilizó para SFT.
- Aprendizaje por refuerzo con GRPO. La recompensa para los problemas matemáticos se calculó comparándola con la etiqueta de referencia. La recompensa para los problemas de código se generó mediante un modelo de recompensa entrenado para predecir si un programa superaría las pruebas unitarias.
DeepSeek-V2.5 se creó combinando DeepSeek-V2-Chat y DeepSeek-Coder-V2-Instruct. [ 41 ]
V3

DeepSeek-V3-Base y DeepSeek-V3 (un modelo de chat) utilizan esencialmente la misma arquitectura que V2 con la adición de predicción de múltiples tokens , que (opcionalmente) decodifica tokens adicionales más rápido pero con menos precisión. Proceso de entrenamiento: [ 31 ]
- Preentrenamiento con 14,8 billones de tokens de un corpus multilingüe, principalmente en inglés y chino. Este corpus contenía una mayor proporción de expresiones matemáticas y de programación que el conjunto de datos de preentrenamiento de la versión 2.
- Extender la longitud del contexto dos veces, de 4K a 32K y luego a 128K, usando YaRN. [ 96 ] Esto produjo DeepSeek-V3-Base.
- Se aplicó SFT durante dos épocas a 1,5 millones de muestras de datos de razonamiento (matemáticas, programación, lógica) y no razonamiento (escritura creativa, juegos de rol, respuestas a preguntas sencillas). Los datos de razonamiento fueron generados por "modelos expertos". Los datos no de razonamiento fueron generados por DeepSeek-V2.5 y revisados por humanos.
- Los "modelos expertos" se entrenaron partiendo de un modelo base no especificado, seguido de SFT sobre datos de <problema, respuesta original> y datos sintéticos de <mensaje del sistema, mensaje, problema, respuesta de R1> generados por un modelo interno DeepSeek-R1-Lite. El mensaje del sistema solicitaba a R1 que reflexionara y verificara durante el proceso de pensamiento. Posteriormente, los modelos expertos se entrenaron mediante aprendizaje por refuerzo utilizando una función de recompensa no revelada.
- Cada modelo experto fue entrenado para generar únicamente datos de razonamiento sintético en un dominio específico (matemáticas, programación, lógica).
- En lugar del propio R1, se utilizaron modelos de expertos, ya que la salida de R1 adolecía de "sobreanálisis, formato deficiente y longitud excesiva".
- Los modelos de recompensa basados en modelos se crearon partiendo de un punto de control SFT de V3, para luego ajustarlos con datos de preferencias humanas que incluían tanto la recompensa final como la cadena de pensamiento que conducía a ella. El modelo de recompensa generó señales de recompensa tanto para preguntas con respuestas objetivas pero de formato libre, como para preguntas sin respuestas objetivas (como la escritura creativa).
- GRPO entrenó un punto de control SFT de V3 utilizando modelos de recompensa y recompensas basadas en reglas. La recompensa basada en reglas se calculó para problemas matemáticos con una respuesta final (ubicada en un recuadro) y para problemas de programación mediante pruebas unitarias. Esto dio como resultado DeepSeek-V3.
DeepSeek lanzó su modelo DeepSeek-V3-0324, que utilizaba la misma arquitectura que V3, el 24 de marzo de 2025 bajo la licencia MIT. [ 99 ]

V3[ 31 ] : Figura 6 El equipo de DeepSeek realizó una ingeniería de bajo nivel extensa para mejorar la eficiencia. Utilizaron aritmética de precisión mixta . Gran parte del paso hacia adelante se realizó en números de punto flotante de 8 bits (5E2M: exponente de 5 bits y mantisa de 2 bits ) en lugar de los 32 bits estándar , lo que requirió rutinas GEMM especiales para acumular con precisión. Utilizaron un flotante personalizado de 12 bits (E5M6) solo para las entradas a las capas lineales después de los módulos de atención. Los estados del optimizador estaban en 16 bits ( BF16 ). Minimizaron la latencia de comunicación al superponer ampliamente el cálculo y la comunicación, como dedicar 20 multiprocesadores de flujo de 132 por H800 solo para la comunicación entre GPU. Redujeron la comunicación reasignando (cada 10 minutos) la máquina exacta en la que estaba cada experto para evitar consultar ciertas máquinas con más frecuencia que otras, agregando pérdidas de equilibrio de carga auxiliares a la función de pérdida de entrenamiento y otras técnicas de equilibrio de carga. [ 31 ]
Tras el entrenamiento, se implementó en clústeres de GPU H800. Las 8 GPU H800 dentro de un clúster estaban conectadas por NVLink, y los clústeres estaban conectados por InfiniBand. [ 31 ]
El costo ha sido discutido [ 101 ] [ 102 ] [ 103 ] y calificado de engañoso, porque cubre solo partes del costo real. [ 104 ]
Las pruebas de rendimiento muestran que V3 superó a Llama 3.1 y Qwen 2.5, al tiempo que igualó a GPT-4o y Claude 3.5 Sonnet. [ 35 ] [ 105 ] [ 106 ] [ 107 ]
R1

En enero de 2025, DeepSeek lanzó el modelo DeepSeek-R1 bajo la licencia MIT . [ 108 ]
DeepSeek-R1-Lite-Preview [ 42 ] [ 43 ] [ nota 4 ] fue entrenado para inferencia lógica, razonamiento matemático y resolución de problemas en tiempo real. DeepSeek afirmó que superó el rendimiento de OpenAI o1 en pruebas comparativas como el American Invitational Mathematics Examination (AIME) y MATH. [ 109 ] Sin embargo, The Wall Street Journal informó que en 15 problemas de la edición 2024 de AIME, el modelo o1 alcanzó una solución más rápido. [ 110 ]
DeepSeek-R1 y DeepSeek-R1-Zero [ 111 ] se inicializaron a partir de DeepSeek-V3-Base y comparten su arquitectura. Los modelos DeepSeek-R1-Distill, en cambio, se inicializaron a partir de otros modelos de peso abierto preentrenados, incluidos LLaMA y Qwen , y luego se ajustaron con datos sintéticos generados por R1. [ 82 ]
DeepSeek-R1-ZeroUna conversación entre el Usuario y el Asistente. El usuario hace una pregunta y el Asistente la resuelve. El asistente primero reflexiona sobre el proceso de razonamiento y luego proporciona la respuesta al usuario. El proceso de razonamiento y la respuesta se encuentran dentro de las etiquetas <think> y <answer>, respectivamente, es decir, <think> proceso de razonamiento aquí </think> <answer> respuesta aquí </answer>. Usuario: <prompt>. Asistente:
DeepSeek-R1-Zero se entrenó exclusivamente utilizando GRPO RL sin SFT. A diferencia de las versiones anteriores, no utilizó ninguna recompensa basada en el modelo. Todas las funciones de recompensa se basaban en reglas, "principalmente" de dos tipos (no se especificaron otros tipos): recompensas de precisión y recompensas de formato. La recompensa de precisión consistía en comprobar si una respuesta enmarcada era correcta (para matemáticas) o si un código pasaba las pruebas (para programación). La recompensa de formato consistía en comprobar si el modelo colocaba su rastro de pensamiento dentro de una etiqueta <think>...</think>. [ 82 ]
R1-Zero tiene problemas de legibilidad y mezcla de idiomas. R1 fue entrenado para abordar estos problemas y mejorar aún más el razonamiento: [ 82 ]
- SFT DeepSeek-V3-Base se basa en "miles" de datos de "arranque en frío", todos con el formato estándar de
|special_token|<reasoning_process>|special_token|<summary>, diseñado para mejorar la legibilidad de la salida del modelo. - Se aplicó el mismo proceso GRPO RL que a R1-Zero, añadiendo una "recompensa por coherencia lingüística" para incentivar una respuesta monolingüe. Esto generó un modelo interno no publicado.
- Sintetiza 600 000 datos de razonamiento a partir del modelo interno, con muestreo por rechazo (es decir, si el razonamiento generado tiene una respuesta final incorrecta, se elimina). Sintetiza 200 000 datos que no sean de razonamiento (escritura, preguntas y respuestas sobre hechos, autoconocimiento, traducción) utilizando DeepSeek-V3.
- SFT DeepSeek-V3-Base en 800K datos sintéticos durante 2 épocas.
- Se aplicó el mismo proceso GRPO RL que a R1-Zero, con recompensa basada en reglas (para tareas de razonamiento) y también recompensa basada en modelos (para tareas que no requieren razonamiento, utilidad e inocuidad). Esto dio como resultado DeepSeek-R1.
Los modelos destilados fueron entrenados por SFT en 800K datos sintetizados de DeepSeek-R1, de manera similar al paso 3. No fueron entrenados con RL. [ 82 ]
Hubo informes de que R2, el sucesor previsto de R1, estaba originalmente planeado para su lanzamiento a principios de mayo de 2025. [ 112 ] Sin embargo, el 28 de mayo de 2025, R1 se actualizó a la versión R1-0528. [ 113 ] A principios de julio, R2 aún no se había lanzado, ya que Liang Wenfeng no estaba satisfecho con su rendimiento. La mayoría de los proveedores chinos de nube de R1 usaban Nvidia H20 . [ 114 ] A agosto, R2 aún no se había lanzado. Las fuentes citan problemas lentos con el etiquetado de datos y los chips. Específicamente, las autoridades alentaron a DeepSeek a adoptar los chips Ascend de Huawei para el entrenamiento, pero estos tenían problemas de estabilidad, conectividad entre chips más lenta y software inferior. En consecuencia, optó por usar chips Nvidia para el entrenamiento y chips Huawei para la inferencia. [ 115 ] También se informó que la Administración del Ciberespacio de China solicitó a varias grandes corporaciones que dejaran de comprar Nvidia H20 y que, en su lugar, compraran a proveedores nacionales. [ 116 ]
Con el lanzamiento de R1 en enero de 2025, el equipo de DeepSeek publicó una preimpresión en arXiv. [ 82 ] Posteriormente, se publicó una versión actualizada en Nature en septiembre de 2025. [ 117 ]
V4

En abril de 2026, DeepSeek publicó un avance de su nueva serie de modelos V4.
El modelo DeepSeek V4 mejoró su arquitectura anterior V3/R1 de las siguientes maneras [ 118 ] :
- El modelo utiliza su arquitectura de hiperconexiones con restricciones de variedad (mHC), que, según afirman, "mejora las conexiones residuales convencionales".
- Introdujeron la Atención Dispersa Restringida (CSA) y la Atención Altamente Comprimida (HCA), modificaciones al mecanismo de Atención utilizado dentro de los modelos Transformer basados en su arquitectura previa de Atención Dispersa DeepSeek introducida en la versión 3.2.
- El optimizador Muon se utilizó para la mayoría de las capas con el fin de lograr una "convergencia más rápida y una mayor estabilidad en el entrenamiento".
Lanzaron dos tamaños del modelo: V4-Flash y V4-Pro. Cada uno puede funcionar en modo sin razonamiento, en modo con razonamiento y en un modo de razonamiento extendido "Máximo".
Significado
El éxito de DeepSeek frente a rivales más grandes y establecidos fue una sorpresa tanto para la industria como para los mercados, [ 14 ] [ 119 ] y ha sido comparado por inversores y expertos con el " momento Sputnik ". [ 14 ] [ 120 ] [ 121 ] [ 22 ] [ 21 ] [ 20 ]
El modelo DeepSeek-R1 proporciona respuestas comparables a otros modelos de lenguaje grandes contemporáneos, como GPT-4o y o1 de OpenAI . [ 10 ] Se informa que su costo de entrenamiento es significativamente menor que el de otros LLM. [ 122 ] [ 123 ]
La empresa afirma que entrenó a V3, un predecesor de R1, por US$6 millones en comparación con los US$100 millones que costó GPT-4 de OpenAI en 2023, [ 11 ] y aproximadamente una décima parte de la potencia de cálculo utilizada para el modelo comparable de Meta , LLaMA 3.1 . [ 11 ] [ 12 ] [ 13 ]
Tras el lanzamiento en enero de 2025 del modelo R1, que ofrecía costes significativamente inferiores a los de los modelos de la competencia, algunos inversores anticiparon una guerra de precios en la industria estadounidense de la IA. [ 124 ] Se le denominó el « Pinduoduo de la IA», y otros gigantes tecnológicos chinos como ByteDance , Tencent , Baidu y Alibaba redujeron el precio de sus modelos de IA. A pesar de su bajo precio, resultó rentable en comparación con sus rivales deficitarios. [ 64 ]
Véase también
- Industria de la inteligencia artificial en China
- Lista de modelos de lenguaje grandes
- Listados de software de inteligencia artificial de código abierto
- Modelo de razonamiento
- Seis tigres de IA
- Seis pequeños dragones
- Universidad de Zhejiang
Notas
- ^宁波程信柔兆企业管理咨询合伙企业(有限合伙) y宁波程恩企业管理咨询合伙企业(有限合伙)
- ^ a b c El número de cabezales no es igual al número de cabezales KV, debido a GQA.
- ^ Inexplicablemente, el modelo mencionado
DeepSeek-Coder-V2 Chaten el artículo fue lanzado comoDeepSeek-Coder-V2-InstructHuggingFace. - ^ En aquel momento, era
R1-Lite-Previewnecesario seleccionar "Deep Think habilitado" y cada usuario solo podía usarlo 50 veces al día.
Referencias
- ^ a b "DeepSeek 突 传 消 息" . Corporación Sina . 1 de febrero de 2025 . Consultado el 1 de febrero de 2025 .
- ^ Wu, Zijing (14 de marzo de 2025). "DeepSeek se centra en la investigación por encima de los ingresos, a diferencia de Silicon Valley" . Financial Times . Consultado el 14 de marzo de 2025 .
- ^ "Hangzhou DeepSeek Artificial Intelligence Basic Technology Research Co., Ltd." Bloomberg LP
- ^ "DeepSeek Coder Model Service Agreement" (PDF) , DeepSeek , 19 de octubre de 2023, archivado (PDF) del original el 21 de febrero de 2025 , recuperado el 11 de febrero de 2025.
- ^ "Política de privacidad para programadores de DeepSeek" (PDF) . DeepSeek . Archivado del original (PDF) el 8 de julio de 2025. Consultado el 19 de febrero de 2025 .
- ^ "全国互联网安全管理平台" . beian.mps.gov.cn (en chino (China)). Ministerio de Seguridad Pública de la República Popular China . Archivado desde el original el 9 de febrero de 2025 . Consultado el 9 de febrero de 2025 .
- ^ Jiang, Ben (21 de enero de 2025). "Pekín destaca al nuevo rostro de la IA en China, Liang Wenfeng de DeepSeek" . South China Morning Post . Archivado del original el 21 de enero de 2025. Consultado el 4 de marzo de 2025 .
- ^ Baptista, Eduardo (28 de enero de 2025). "¿Quién es Liang Wenfeng, el fundador de DeepSeek?" . Reuters . Archivado desde el original el 19 de febrero de 2025 . Consultado el 4 de marzo de 2025 .
- ^ "Detrás de DeepSeek se esconde una deslumbrante universidad china" . The Economist . ISSN 0013-0613 . Consultado el 5 de marzo de 2025 .
{{cite news}}: CS1 maint: servicio de archivado obsoleto ( enlace ) - ^ a b c d Gibney, Elizabeth (23 de enero de 2025). "El modelo de IA barato y abierto de China, DeepSeek, entusiasma a los científicos" . Nature . 638 ( 8049): 13– 14. Bibcode : 2025Natur.638...13G . doi : 10.1038/d41586-025-00229-6 . PMID 39849139. Archivado del original el 29 de enero de 2025. Recuperado el 12 de febrero de 2025 .
- ^ a b c d Vincent, James (28 de enero de 2025). "El pánico de DeepSeek revela un mundo de IA listo para estallar" . The Guardian .
- ^ a b c d e f Metz, Cade; Tobin, Meaghan (23 de enero de 2025). "Cómo la startup china de IA DeepSeek está compitiendo con los gigantes de Silicon Valley" . The New York Times . ISSN 0362-4331 . Archivado del original el 23 de enero de 2025. Recuperado el 27 de enero de 2025 .
- ^ a b c Cosgrove, Emma (27 de enero de 2025). "Los modelos más baratos y los chips menos potentes de DeepSeek ponen en entredicho los billones de dólares invertidos en infraestructura de IA" . Business Insider . Archivado del original el 29 de enero de 2025. Recuperado el 27 de enero de 2025 .
- ^ a b c d e f Metz, Cade (27 de enero de 2025). "¿Qué es DeepSeek? ¿Y cómo está revolucionando la IA?" . The New York Times . ISSN 0362-4331 . Archivado del original el 27 de enero de 2025. Recuperado el 27 de enero de 2025 .
- ^ Roose, Kevin (28 de enero de 2025). "Por qué DeepSeek podría cambiar lo que Silicon Valley cree sobre la IA" The New York Times . ISSN 0362-4331 . Archivado del original el 28 de enero de 2025. Recuperado el 28 de enero de 2025 .
- ^ a b Delbert, Caroline (31 de enero de 2025). "DeepSeek está descifrando por completo la 'caja negra' de la IA corporativa" . Popular Mechanics . Archivado del original el 13 de febrero de 2025. Recuperado el 12 de febrero de 2025 .
- ^ Chen, Caiwei (12 de febrero de 2026). "¿Qué sigue para la IA de código abierto china?" . MIT Technology Review . Recuperado el 12 de abril de 2026 .
- ^ Metz, Cade (12 de febrero de 2025). "¿Cómo construyó DeepSeek su IA con menos dinero?" . The New York Times . Archivado del original el 19 de marzo de 2025. Recuperado el 21 de marzo de 2025 .
- ^ Allen, Gregory C. (7 de marzo de 2025). "DeepSeek, Huawei, controles de exportación y el futuro de la carrera de IA entre EE. UU. y China" . Centro de Estudios Estratégicos e Internacionales .
- ^ a b Hawkins, Amy (28 de enero de 2025). "¿Quién está detrás de DeepSeek y cómo logró su 'momento Sputnik' de IA?" . The Guardian .
- ^ a b Cassidy, John (3 de febrero de 2025). "¿Es DeepSeek el momento Sputnik de China?" . The New Yorker – vía www.newyorker.com.
- ^ a b Ruwitch, John (28 de enero de 2025). "DeepSeek: ¿Una startup china poco conocida provocó un 'momento Sputnik' para la IA?" . NPR . Recuperado el 2 de agosto de 2025 .
- ^ Saah, Jasper (13 de febrero de 2025). "DeepSeek causa conmoción en Silicon Valley" . Liberation News – El periódico del Partido por el Socialismo y la Liberación . Archivado del original el 17 de febrero de 2025. Recuperado el 13 de febrero de 2025 .
- ^ Sillars, James (28 de enero de 2025). "DeepSeek: La empresa tecnológica sufre la mayor caída en la historia del mercado bursátil estadounidense mientras la empresa china de IA de bajo coste ataca a Silicon Valley" . Sky News . Consultado el 13 de febrero de 2025 .
- ^ Chen, Caiwei (24 de enero de 2025). "Cómo un modelo de IA chino de alto rendimiento superó las sanciones estadounidenses" . MIT Technology Review . Archivado del original el 25 de enero de 2025. Recuperado el 25 de enero de 2025 .
- ^ a b c d e "幻方 | 幻方历程" . High-Flyer (en chino (China)). Archivado del original el 3 de febrero de 2025. Recuperado el 2 de febrero de 2025 .
- ^ a b c d Ottinger, Lily (9 de diciembre de 2024). "Deepseek: De fondo de cobertura a creador de modelos de vanguardia" . ChinaTalk . Archivado del original el 28 de diciembre de 2024. Recuperado el 28 de diciembre de 2024 .
- ^ a b Olcott, Eleanor; Wu, Zijing (24 de enero de 2025). "Cómo la pequeña empresa china de IA DeepSeek sorprendió a Silicon Valley" . Financial Times . Archivado del original el 25 de enero de 2025. Recuperado el 31 de enero de 2025 .
- ^ Leswing, Kif (23 de febrero de 2023). "Conozca el chip Nvidia de 10 000 dólares que impulsa la carrera por la IA" CNBC . Archivado del original el 29 de enero de 2025. Recuperado el 30 de enero de 2025 .
- ^ a b c d "hfreduce | 高性能的多卡并行通信工具" . "Alto vuelo" . 4 de marzo de 2020. Archivado desde el original el 28 de enero de 2025 . Consultado el 3 de febrero de 2025 .
- ^ a b c d e f g h i DeepSeek-AI; Liu, Aixin; Feng, Bei; Xue, Bing; Wang, Bingxuan; Wu, Bochao; Lu, Chengda; Zhao, Chenggang; Deng, Chengqi (27 de diciembre de 2024), Informe técnico de DeepSeek-V3 , arXiv : 2412.19437
- ^ a b c d An, Wei; Bi, Xiao; Chen, Guanting; Chen, Shanhuang; Deng, Chengqi; Ding, Honghui; Dong, Kai; Du, Qiushi; Gao, Wenjun; Guan, Kang; Guo, Jianzhong; Guo, Yongqiang; Fu, Zhe; Él, Ying; Huang, Panpan (17 de noviembre de 2024). "Fire-Flyer AI-HPC: un codiseño de software y hardware rentable para el aprendizaje profundo". SC24: Conferencia internacional sobre informática, redes, almacenamiento y análisis de alto rendimiento . IEEE. págs. 1 a 23. arXiv : 2408.14158 . doi : 10.1109/SC41406.2024.00089 . ISBN 979-8-3503-5291-7.
- ^ "独家 | 幻方量化回应市场关注: AGI不是用来炒股的", "和金融没关系"" . Yicai . Consultado el 3 de febrero de 2025 .
- ^ Yu, Xu (17 de abril de 2023). "[Exclusiva] El director general de un fondo de cobertura cuantitativo chino de alto rendimiento afirma que no utilizará AGI para operar con acciones" . Yicai Global . Archivado del original el 31 de diciembre de 2023. Consultado el 28 de diciembre de 2024 .
- ^ a b c d Jiang, Ben; Perezi, Bien (1 de enero de 2025). "Conozca a DeepSeek: la empresa emergente china que está cambiando la forma en que se entrenan los modelos de IA" . South China Morning Post . Archivado del original el 22 de enero de 2025. Recuperado el 1 de enero de 2025 .
- ^ a b McMorrow, Ryan; Olcott, Eleanor (9 de junio de 2024). "El fondo cuantitativo chino convertido en pionero de la IA" . Financial Times . Archivado del original el 17 de julio de 2024. Recuperado el 28 de diciembre de 2024 .
- ^ a b c d e f DeepSeek-AI; Bi, Xiao; Chen, Deli; Chen, Guanting; Chen, Shanhuang; Dai, Damai; Deng, Chengqi; Ding, Honghui; Dong, Kai (5 de enero de 2024), DeepSeek LLM: escalamiento de modelos de lenguaje de código abierto con longtermismo , arXiv : 2401.02954
- ^ a b c d e Dai, Damai; Deng, Chengqi; Zhao, Chenggang; Xu, RX; Gao, Huazuo; Chen, Deli; Li, Jiashi; Zeng, Wangding; Yu, Xingkai (11 de enero de 2024), DeepSeekMoE: hacia la máxima especialización de expertos en modelos de lenguajes de mezcla de expertos , arXiv : 2401.06066
- ^ a b Shao, Zhihong; Wang, Peiyi; Zhu, Qihao; Xu, Runxin; Canción, Junxiao; Bi, Xiao; Zhang, Haowei; Zhang, Mingchuan; Li, YK (27 de abril de 2024), DeepSeekMath: superando los límites del razonamiento matemático en modelos de lenguaje abierto , arXiv : 2402.03300.
- ^ a b c d e DeepSeek-AI; Zhu, Qihao; Guo, Daya; Shao, Zhihong; Yang, Dejian; Wang, Peiyi; Xu, Runxin; Wu, Y.; Li, Yukun (17 de junio de 2024), DeepSeek-Coder-V2: Rompiendo la barrera de los modelos de código cerrado en Code Intelligence , arXiv : 2406.11931
- ^ a b "deepseek-ai/DeepSeek-V2.5 · Hugging Face" . Hugging Face . 3 de enero de 2025. Archivado del original el 30 de enero de 2025. Recuperado el 28 de enero de 2025 .
- ^ a b "Página de inicio de sesión de Deepseek" . DeepSeek . Consultado el 30 de enero de 2025 .
- ^ a b "Noticias | Lanzamiento de DeepSeek-R1-Lite 2024/11/20: 🚀 DeepSeek-R1-Lite-Preview ya está disponible: ¡desata una potencia de razonamiento sobrealimentada!" . Documentación de la API de DeepSeek . Archivado del original el 20 de noviembre de 2024 . Consultado el 28 de enero de 2025 .
- ^ Field, Hayden (27 de enero de 2025). "La IA DeepSeek de China destrona a ChatGPT en la App Store: esto es lo que debes saber" . CNBC . Archivado del original el 28 de enero de 2025. Recuperado el 27 de enero de 2025 .
- ^ Picchi, Aimee (27 de enero de 2025). "¿Qué es DeepSeek y por qué está provocando la caída de las acciones de Nvidia y otras empresas?" . CBS News . Archivado del original el 29 de enero de 2025. Consultado el 27 de enero de 2025 .
- ^ Nuñez, Michael (24 de marzo de 2025). "DeepSeek-V3 ahora funciona a 20 tokens por segundo en Mac Studio, y eso es una pesadilla para OpenAI" . VentureBeat . Consultado el 24 de marzo de 2025 .
- ^ "deepseek-ai/DeepSeek-V3-0324 · Hugging Face" . Hugging Face . Archivado del original el 24 de marzo de 2025. Recuperado el 24 de marzo de 2025 .
- ^ "deepseek-ai/DeepSeek-R1-0528 · Hugging Face" . huggingface.co . 28 de mayo de 2025. Archivado del original el 28 de mayo de 2025. Consultado el 28 de mayo de 2025 .
- ^ Colville, Alex (12 de junio de 2025). "El cortafuegos global de IA de China" . China Media Project . Recuperado el 30 de junio de 2025 .
- ^ "deepseek-ai/DeepSeek-V3.1 · Hugging Face" . huggingface.co . 21 de agosto de 2025. Consultado el 25 de agosto de 2025 .
- ^ "Versión DeepSeek-V3.1 | Documentación de la API de DeepSeek" . api-docs.deepseek.com . Consultado el 25 de agosto de 2025 .
- ^ "deepseek-ai/DeepSeek-V3.1-Terminus · Hugging Face" . huggingface.co . 22 de septiembre de 2025 . Consultado el 24 de septiembre de 2025 .
- ^ Yuan, Jingyang; Gao, Huazuo; Dai, Damai; Luo, Junyu; Zhao, Liang; Zhang, Zhengyan; Xie, Zhenda; Wei, YX; Wang, Lean (27 de febrero de 2025), Atención dispersa nativa: atención dispersa alineada con hardware y entrenable de forma nativa , arXiv : 2502.11089
- ^ "deepseek-ai/DeepSeek-V3.2-Exp · Hugging Face" . huggingface.co . 29 de septiembre de 2025. Consultado el 2 de octubre de 2025 .
- ^ a b Binder, Matt (3 de diciembre de 2025). "DeepSeek v3.2: Qué es, cómo se compara con ChatGPT, cómo probarlo" . Mashable . Recuperado el 12 de abril de 2026 .
- ^ a b "Lanzamiento de DeepSeek-V3.2" . Documentación de la API de DeepSeek . 1 de diciembre de 2025. Consultado el 12 de abril de 2026 .
- ^ Metz, Cade (23 de febrero de 2026). "Anthropic acusa a 3 empresas chinas de extraer sus datos" . The New York Times . ISSN 0362-4331 . Consultado el 24 de febrero de 2026 .
- ^ Abu Sultan; Zaheer Kachwala (18 de abril de 2026). Anil D'Silva; Devika Syamnath (eds.). "DeepSeek de China está recaudando fondos con una valoración de 10 mil millones de dólares, informa The Information" . Reuters . Consultado el 21 de abril de 2026 .
- ^ a b Sankaran, Vishwam (24 de abril de 2026). "DeepSeek de China lanza un nuevo modelo de IA que, según afirma, supera a todos sus competidores de código abierto" . The Independent . Recuperado el 24 de abril de 2026 .
- ^ a b Chen, Caiwei (24 de abril de 2026). "Tres razones por las que el nuevo modelo de DeepSeek importa" . MIT Technology Review . Recuperado el 25 de abril de 2026 .
- ^ a b Tolomia, Cris (24 de abril de 2026). "DeepSeek regresa con un nuevo modelo de IA de código abierto construido sobre chips chinos" . Quartz . Recuperado el 25 de abril de 2026 .
- ^ "Los fabricantes de chips chinos se apresuran a adoptar la versión V4 de DeepSeek. ¿Qué nombres destacan?" . South China Morning Post . 6 de mayo de 2026 . Consultado el 7 de mayo de 2026 .
- ^ "大模型价格又砍一刀 这次"屠夫"竟是量化私募?" . www.cls.cn. 10 de mayo de 2024. Archivado desde el original el 27 de diciembre de 2024 . Consultado el 3 de febrero de 2025 .
- ^ a b Schneider, Jordan (27 de noviembre de 2024). "Deepseek: El gigante silencioso que lidera la carrera de IA de China" . ChinaTalk . Archivado del original el 29 de noviembre de 2024. Recuperado el 28 de diciembre de 2024 .
- ^ Mickle, Tripp; Swanson, Ana; Tobin, Meaghan; Metz, Cade (16 de abril de 2025). "Funcionarios estadounidenses apuntan a Nvidia y DeepSeek en medio de temores por el progreso de la IA en China" . The New York Times . ISSN 0362-4331 . Consultado el 17 de abril de 2025 .
{{cite news}}: CS1 maint: servicio de archivado obsoleto ( enlace ) - ^ Greenspan, Anna; Konior, Bogna (2025). «Introducción: Fuerzas fugaces y maquinaciones ingeniosas». En Bratton, Benjamin; Greenspan, Anna; Ireland, Amy; Konior, Bogna (eds.). La decisión de la máquina no es definitiva: China y la historia y el futuro de la inteligencia artificial . Urbanomic, MIT Press . ISBN 9781913029999.
- ^ Rai, Saritha, Loni Prinsloo y Helen Nyambura "DeepSeek de China supera a OpenAI y Google en África" Bloomberg Technology . Consultado el 27 de octubre de 2025.
- ^ "幻方力量 | 高速文件系统 3FS" . "Alto vuelo" . 13 de junio de 2019. Archivado desde el original el 3 de febrero de 2025 . Consultado el 3 de febrero de 2025 .
- ^ deepseek-ai/3FS , DeepSeek, 28 de febrero de 2025, archivado del original el 28 de febrero de 2025 , recuperado el 28 de febrero de 2025
- ^ "HFAiLab/hai-platform" , High-Flyer , 2 de febrero de 2025 , consultado el 3 de febrero de 2025
- ^ "LICENCIA · deepseek-ai/deepseek-coder-33b-base" . Hugging Face . 28 de octubre de 2023 . Recuperado el 12 de abril de 2026 .
- ^ "DeepSeek-LLM/LICENSE-MODEL" . GitHub . 29 de noviembre de 2023. Consultado el 12 de abril de 2026 .
- ^ "DeepSeek-MoE/LICENSE-MODEL" . 11 de enero de 2024. Recuperado el 12 de abril de 2026 a través de GitHub .
- ^ "LICENCIA · deepseek-ai/deepseek-math-7b-base" . Hugging Face . 6 de febrero de 2024. Recuperado el 12 de abril de 2026 .
- ^ "LICENCIA · deepseek-ai/deepseek-math-7b-instruct" . Hugging Face . 6 de febrero de 2024 . Recuperado el 12 de abril de 2026 .
- ^ "LICENCIA · deepseek-ai/deepseek-math-7b-rl" . Hugging Face . 6 de febrero de 2024 . Recuperado el 12 de abril de 2026 .
- ^ "LICENCIA · deepseek-ai/DeepSeek-V2.5" . 5 de septiembre de 2024. Recuperado el 12 de abril de 2026 – vía Hugging Face .
- ^ "LICENSE-MODEL · deepseek-ai/DeepSeek-V3-Base" . 26 de diciembre de 2024. Recuperado el 12 de abril de 2026 – vía Hugging Face .
- ^ "DeepSeek-Prover-V2/LICENSE-MODEL" . 30 de abril de 2025. Recuperado el 12 de abril de 2026 a través de GitHub .
- ^ "deepseek-ai/deepseek-vl2" . 27 de noviembre de 2025. Recuperado el 12 de abril de 2026 – vía Hugging Face .
- ^ "LICENCIA · deepseek-ai/DeepSeek-R1-0528" . 28 de mayo de 2025. Recuperado el 12 de abril de 2026 – vía Hugging Face .
- ^ a b c d e f DeepSeek-AI; Guo, Daya; Yang, Dejian; Zhang, Haowei; Canción, Junxiao; Zhang, Ruoyu; Xu, Runxin; Zhu, Qihao; Ma, Shirong (22 de enero de 2025), "DeepSeek-R1 incentiva el razonamiento en LLMS mediante el aprendizaje por refuerzo", Nature , 645 (8081): 633– 638, arXiv : 2501.12948 , Bibcode : 2025Natur.645..633G , doi : 10.1038/s41586-025-09422-z , PMC 12443585 , PMID 40962978
- ^ "LICENCIA · deepseek-ai/DeepSeek-R1-Distill-Qwen-32B" . 20 de enero de 2025. Recuperado el 12 de abril de 2026 – vía Hugging Face .
- ^ "LICENCIA · deepseek-ai/DeepSeek-V3.1-Base" . 19 de agosto de 2025. Recuperado el 12 de abril de 2026 – vía Hugging Face .
- ^ "LICENCIA · deepseek-ai/DeepSeek-V3.1-Terminus" . 22 de septiembre de 2025. Recuperado el 12 de abril de 2026 – vía Hugging Face .
- ^ "LICENCIA · deepseek-ai/DeepSeek-Math-V2" . 27 de noviembre de 2025. Recuperado el 12 de abril de 2026 – vía Hugging Face .
- ^ "LICENCIA · deepseek-ai/DeepSeek-V3.2" . 1 de diciembre de 2025. Recuperado el 12 de abril de 2026 – vía Hugging Face .
- ^ "DeepSeek-Coder/LICENSE-MODEL en main · deepseek-ai/DeepSeek-Coder" . GitHub . Archivado del original el 22 de enero de 2025. Recuperado el 24 de enero de 2025 .
- ^ a b c Guo, Daya; Zhu, Qihao; Yang, Dejian; Xie, Zhenda; Dong, Kai; Zhang, Wentao; Chen, Guanting; Bi, Xiao; Wu, Y. (26 de enero de 2024), DeepSeek-Coder: Cuando el modelo de lenguaje grande se encuentra con la programación: el auge de la inteligencia del código , arXiv : 2401.14196
- ^ "DeepSeek Coder" . deepseekcoder.github.io . Archivado del original el 27 de enero de 2025. Consultado el 27 de enero de 2025 .
- ^ deepseek-ai/DeepSeek-Coder , DeepSeek, 27 de enero de 2025, archivado del original el 27 de enero de 2025 , recuperado el 27 de enero de 2025
- ^ "deepseek-ai/deepseek-coder-5.7bmqa-base · Hugging Face" . Hugging Face . Consultado el 27 de enero de 2025 .
- ^ deepseek-ai/DeepSeek-LLM , DeepSeek, 27 de enero de 2025 , consultado el 27 de enero de 2025
- ^ Wang, Peiyi; Li, Lei; Shao, Zhihong; Xu, RX; Dai, Damai; Li, Yifei; Chen, Deli; Wu, Y.; Sui, Zhifang (19 de febrero de 2024), Math-Shepherd: verificar y reforzar los LLM paso a paso sin anotaciones humanas , arXiv : 2312.08935.
- ^ a b c d e DeepSeek-AI; Liu, Aixin; Feng, Bei; Wang, Bin; Wang, Bingxuan; Liu, Bo; Zhao, Chenggang; Dengr, Chengqi; Ruan, Chong (19 de junio de 2024), DeepSeek-V2: un modelo de lenguaje de combinación de expertos sólido, económico y eficiente , arXiv : 2405.04434.
- ^ a b Peng, Bowen; Quesnelle, Jeffrey; Fan, Honglu; Shippole, Enrico (1 de noviembre de 2023), YaRN: Extensión eficiente de la ventana de contexto de grandes modelos de lenguaje , arXiv : 2309.00071.
- ^ "config.json · deepseek-ai/DeepSeek-V2-Lite en main" . Hugging Face . 15 de mayo de 2024. Recuperado el 28 de enero de 2025 .
- ^ "config.json · deepseek-ai/DeepSeek-V2 en main" . Hugging Face . 6 de mayo de 2024. Recuperado el 28 de enero de 2025 .
- ^ Feng, Coco (25 de marzo de 2025). "DeepSeek sorprende a los programadores con un modelo V3 de código abierto más potente" . South China Morning Post . Consultado el 6 de abril de 2025 .
- ^ "config.json · deepseek-ai/DeepSeek-V3 en main" . Hugging Face . 26 de diciembre de 2024. Archivado del original el 26 de enero de 2025. Recuperado el 28 de enero de 2025 .
- ^ Patel, Dylan; Kourabi, AJ; O'Laughlin, Dylan; Knuhtsen, Doug (31 de enero de 2025). "Debates de DeepSeek: Liderazgo chino sobre costos, costo real de capacitación e impactos en el margen del modelo cerrado" . SemiAnalysis . Archivado del original el 13 de febrero de 2025. Recuperado el 13 de febrero de 2025 .
- ^ Thubron, Rob (3 de febrero de 2025). "Los costos de IA de DeepSeek superan con creces la cifra de 5,5 millones de dólares que se afirma, y podrían haber alcanzado los 1.600 millones de dólares con 50.000 GPU de Nvidia" . TechSpot . Consultado el 13 de febrero de 2025 .
- ^ Kajal, Kapil (31 de enero de 2025). "Una investigación revela que el costo de entrenamiento de la IA de DeepSeek no es de 6 millones de dólares, sino de la asombrosa cifra de 1300 millones de dólares" . Yahoo News . Archivado del original el 13 de febrero de 2025. Consultado el 13 de febrero de 2025 .
- ^ "Martin Vechev de INSAIT: "El costo de capacitación de DeepSeek de $ 6 millones es engañoso"" . TheRecursive.com . 28 de enero de 2025. Archivado del original el 13 de febrero de 2025 . Consultado el 13 de febrero de 2025 .
- ^ Jiang, Ben (27 de diciembre de 2024). "El nuevo modelo de IA de la empresa emergente china DeepSeek supera a los productos Meta y OpenAI" . South China Morning Post . Archivado del original el 27 de diciembre de 2024. Consultado el 28 de diciembre de 2024 .
- ^ Sharma, Shubham (26 de diciembre de 2024). "DeepSeek-V3, una IA de código abierto de gran tamaño, supera a Llama y Qwen en su lanzamiento" . VentureBeat . Archivado del original el 27 de diciembre de 2024. Consultado el 28 de diciembre de 2024 .
- ^ Wiggers, Kyle (26 de diciembre de 2024). "El nuevo modelo de IA de DeepSeek parece ser uno de los mejores competidores 'abiertos' hasta la fecha" . TechCrunch . Archivado del original el 2 de enero de 2025. Recuperado el 31 de diciembre de 2024 .
- ^ Edwards, Benj (21 de enero de 2025). "Un modelo chino de 'razonamiento' de vanguardia rivaliza con OpenAI o1, y se puede descargar gratis" . Ars Technica . Recuperado el 16 de febrero de 2025 .
- ^ Franzen, Carl (20 de noviembre de 2024). "El primer modelo de razonamiento de DeepSeek, R1-Lite-Preview, sorprende al superar el rendimiento de OpenAI o1" . VentureBeat . Archivado del original el 22 de noviembre de 2024. Recuperado el 28 de diciembre de 2024 .
- ^ Huang, Raffaele (24 de diciembre de 2024). "No se lo pierdan, pero la IA de China está avanzando rápidamente" . The Wall Street Journal . Archivado del original el 27 de diciembre de 2024. Consultado el 28 de diciembre de 2024 .
- ^ "Versión DeepSeek-R1 · deepseek-ai/DeepSeek-R1@23807ce" . GitHub . Archivado del original el 21 de enero de 2025 . Consultado el 21 de enero de 2025 .
- ^ Eduardo Baptista; Julie Zhu; Fanny Potkin (25 de febrero de 2025). "DeepSeek se apresura a lanzar un nuevo modelo de IA mientras China apuesta fuerte" . Reuters . Archivado del original el 21 de marzo de 2025. Consultado el 25 de febrero de 2025 .
- ^ Ding, Luz (29 de mayo de 2025). "DeepSeek afirma que su modelo mejorado razona mejor y tiene menos alucinaciones" . Bloomberg . Consultado el 9 de junio de 2025 .
- ^ "El lanzamiento de DeepSeek R2 se estanca debido a la reticencia del director ejecutivo a avanzar, informa The Information" . Reuters . 26 de junio de 2025. Consultado el 5 de julio de 2025 .
- ^ Olcott, Eleanor; Wu, Zijing (14 de agosto de 2025). "El próximo modelo de IA de DeepSeek se retrasa por el intento de usar chips chinos" . Financial Times . Consultado el 13 de noviembre de 2025 .
- « China advierte a las empresas tecnológicas sobre la compra de chips de IA Nvidia H2O, según fuentes» . Reuters . 12 de agosto de 2025.
- ^ Guo, Daya; Yang, Dejian; Zhang, Haowei; Canción, Junxiao; Wang, Peiyi; Zhu, Qihao; Xu, Runxin; Zhang, Ruoyu; Mamá, Shirong; Bi, Xiao; Zhang, Xiaokang; Yu, Xingkai; Wu, Yu; Wu, ZF; Gou, Zhibin (septiembre de 2025). "DeepSeek-R1 incentiva el razonamiento en los LLM mediante el aprendizaje por refuerzo" . Naturaleza . 645 (8081): 633– 638. arXiv : 2501.12948 . Código Bib : 2025Natur.645..633G . doi : 10.1038/s41586-025-09422-z . ISSN 1476-4687 . PMC 12443585 . PMID 40962978 .
- ^ a b https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro/blob/main/DeepSeek_V4.pdf
- ^ Roose, Kevin (28 de enero de 2025). "Por qué DeepSeek podría cambiar la forma en que Silicon Valley cree sobre la IA". The New York Times . ISSN 0362-4331 . Archivado del original el 28 de enero de 2025. Recuperado el 28 de enero de 2025 .
- ^ "Más allá de los titulares sobre el momento Sputnik de DeepSeek: una conversación con Jimmy Goodrich - IGCC" . Instituto de la UC sobre Conflicto y Cooperación Global (IGCC) . 12 de febrero de 2025.
{{cite web}}: CS1 maint: servicio de archivado obsoleto ( enlace ) - ^ "¿Es 'el momento Sputnik' una analogía apropiada para el lanzamiento de DeepSeek? - LCFI" . LCFI - Centro Leverhulme para el Futuro de la Inteligencia . 2 de febrero de 2025.
- ^ Roeloffs, Mary Whitfill. "¿Qué es DeepSeek? La nueva inteligencia artificial china rivaliza con ChatGPT y OpenAI" . Forbes . Consultado el 5 de agosto de 2025 .
- ^ DeepSeek-AI; et al. (2024). "Informe técnico de DeepSeek-V3". arXiv : 2412.19437 [ cs.CL ].
- ^ Chow, Andrew R.; Perrigo, Billy (30 de enero de 2025). "¿Es exagerado el pánico por DeepSeek?" . TIME . Archivado del original el 17 de marzo de 2025 . Recuperado el 17 de marzo de 2025 .
Enlaces externos
- Sitio web oficial

- DeepSeek en GitHub
- DeepSeek en Hugging Face
- Documentación oficial de la API
- Antología de artículos de DeepSeek
- Blog de investigación de High-Flyer
- Empresas chinas establecidas en 2023
- empresas de inteligencia artificial
- laboratorios de inteligencia artificial
- Empresas con sede en Hangzhou
- Empresas tecnológicas fundadas en 2023
- marcas chinas
- Inteligencia artificial de código abierto
- 2023 en inteligencia artificial