Hangzhou DeepSeek Artificial Intelligence Basic Technology Research Co., Ltd. , [ 3 ] [ 4 ] [ 5 ] [ a ] que opera como DeepSeek , [ b ] es una empresa china de inteligencia artificial (IA) que desarrolla grandes modelos de lenguaje (LLM). Con sede en Hangzhou , Zhejiang , DeepSeek es propiedad de High-Flyer , un fondo de cobertura chino , que también la financia . DeepSeek fue fundada en julio de 2023 por Liang Wenfeng , quien también se desempeña como CEO de ambas empresas. [ 7 ] [ 8 ] [ 9 ] La empresa lanzó un chatbot homónimo junto con su modelo DeepSeek-R1 en enero de 2025.
DeepSeek-R1 proporcionó respuestas comparables a otros LLM contemporáneos, como GPT-4 y o1 de OpenAI . [ 10 ] Se informó que su costo de entrenamiento fue menor que el de otros LLM. La compañía afirma que entrenó V3 por US$6 millones, lo que fue menos que el costo de US$100 millones reportado por OpenAI para GPT-4 en 2023. [ 11 ] DeepSeek también afirmó que estaban utilizando aproximadamente una décima parte de la potencia de cálculo consumida por el modelo comparable de Meta , Llama 3.1 . [ 11 ] [ 12 ] [ 13 ] El éxito de DeepSeek frente a rivales más grandes y establecidos se ha descrito como "un giro radical en la IA". [ 14 ] [ 15 ]
Los modelos de DeepSeek son de peso abierto , lo que significa que los parámetros exactos se comparten abiertamente, pero los datos de entrenamiento no tienen licencia abierta. [ 10 ] [ 16 ] Desde el debut de DeepSeek-R1 en enero de 2025, la compañía ha puesto sus nuevos modelos a disposición bajo licencias de software libre y de código abierto , como la Licencia MIT . [ 17 ] Según se informa, la compañía recluta investigadores de IA de las mejores universidades chinas y contrata a personas ajenas a los campos tradicionales de la informática para ampliar el conocimiento y las capacidades de sus modelos. [ 12 ] [ 14 ]
DeepSeek redujo significativamente los gastos de entrenamiento de su modelo R1 al incorporar técnicas como la mezcla de expertos (MoE). [ 18 ] La empresa también entrenó sus modelos durante las restricciones comerciales vigentes a las exportaciones de chips de IA a China. DeepSeek utilizó chips de IA menos potentes destinados a la exportación y empleó menos unidades en general. [ 13 ] [ 19 ] Observadores como el New York Post y The Guardian han dicho que este avance causó conmoción en la industria, describiéndose como un momento Sputnik para Estados Unidos en el campo de la inteligencia artificial, particularmente debido a sus modelos de IA de peso abierto, rentables y de alto rendimiento. [ 20 ] [ 21 ] [ 22 ] Esto amenazó a líderes en hardware de IA como Nvidia . El precio de sus acciones cayó drásticamente, perdiendo 600 mil millones de dólares en valor de mercado, la mayor caída de una sola empresa en la historia del mercado de valores de EE . UU. [ 23 ] [ 24 ]
Historia
Años previos a la fundación
En junio de 2015, High-Flyer fue cofundada por Liang Wenfeng, un entusiasta de la IA que había estado operando en bolsa desde la crisis financiera de 2008 mientras estudiaba en la Universidad de Zhejiang . [ 25 ] La empresa comenzó a operar en bolsa utilizando un modelo de aprendizaje profundo dependiente de GPU el 21 de octubre de 2016. Anteriormente, había utilizado modelos lineales basados en CPU. A finales de 2017, la mayor parte de sus operaciones se realizaban mediante IA. [ 26 ]
Volador de fuego
En 2019, la empresa comenzó a construir su primer clúster de computación , Fire-Flyer, con un costo de 200 millones de yuanes. El clúster contenía 1100 GPU interconectadas a 200 Gbit/s y fue retirado después de 1,5 años de funcionamiento. [ 26 ] Para 2021, Liang había comenzado a comprar grandes cantidades de GPU Nvidia para un proyecto de IA, [ 27 ] supuestamente obtuvo 10 000 GPU Nvidia A100 antes de que Estados Unidos restringiera las ventas de chips a China. [ 28 ] [ 29 ]
Volador de fuego 2
El clúster de computación Fire-Flyer 2 comenzó su construcción en 2021 con un presupuesto de 1.000 millones de yuanes. [ 26 ] Se informó que en 2022, la capacidad de Fire-Flyer 2 se había utilizado en más del 96%, totalizando 56,74 millones de horas de GPU. El 27% de la capacidad de Fire-Flyer 2 se utilizó para dar soporte a la computación científica fuera de la empresa. [ 26 ] Fire-Flyer 2 tenía 5.000 GPU PCIe A100 en 625 nodos, cada uno con 8 GPU. En ese momento, utilizaba exclusivamente PCIe en lugar de la versión DGX de A100. Esto se debía a que los modelos que entrenaba podían caber en una sola VRAM de GPU de 40 GB . Por lo tanto, no había necesidad del mayor ancho de banda de DGX en ese momento (solo requería paralelismo de datos, pero no paralelismo de modelos). [ 30 ] Posteriormente, incorporó tanto NVLinks como la biblioteca de comunicaciones colectivas de Nvidia (NCCL) para entrenar modelos más grandes que requerían paralelismo de modelos. [ 31 ] [ 32 ]
Establecimiento
El 14 de abril de 2023, [ 33 ] High-Flyer anunció el lanzamiento de un laboratorio de investigación de inteligencia artificial general (IAG), declarando que el nuevo laboratorio se centraría en el desarrollo de herramientas de IA no relacionadas con el negocio financiero de la empresa. [ 34 ] [ 35 ] Dos meses después, el 17 de julio de 2023, [ 1 ] ese laboratorio se escindió en una empresa independiente. Ese laboratorio se denominó DeepSeek, con High-Flyer como su principal inversor y patrocinador. [ 28 ] [ 35 ] [ 36 ] Inicialmente, los inversores de capital riesgo se mostraron reacios a proporcionar financiación, ya que consideraban improbable que la empresa pudiera generar rápidamente una salida (una participación en la propiedad de una inversión). [ 28 ]
Operación de la empresa
DeepSeek tiene su sede en Hangzhou, Zhejiang, y es propiedad de High-Flyer , que también la financia . Su cofundador, Liang Wenfeng , es el director ejecutivo. En mayo de 2024, Liang poseía personalmente una participación del 84 % en DeepSeek a través de dos empresas fantasma . [ nota 1 ] [ 37 ] En febrero de 2026, Anthropic acusó a DeepSeek de utilizar miles de cuentas fraudulentas para generar millones de conversaciones con Claude para capacitar a sus propios LLM. [ 38 ] En abril de 2026, los inversores comenzaron a hablar con DeepSeek para una ronda de financiación de 300 millones de dólares, lo que llevaría a DeepSeek a una valoración total de 10 mil millones de dólares. [ 39 ]

Estrategia
DeepSeek ha declarado que se centra en la investigación y no tiene planes inmediatos de comercialización. [ 40 ] Esta postura también significa que puede eludir ciertas disposiciones de las regulaciones chinas sobre IA dirigidas a tecnologías orientadas al consumidor. [ 12 ]
El enfoque de contratación de DeepSeek enfatiza las habilidades por encima de la larga experiencia laboral, lo que resulta en muchas contrataciones de recién graduados universitarios. [ 12 ] [ 35 ] La empresa también recluta personas sin formación en informática para ampliar el rango de conocimientos incorporados a los modelos, por ejemplo, en poesía o matemáticas avanzadas. [ 12 ] [ 14 ] Según The New York Times , docenas de investigadores de DeepSeek tienen o han tenido vínculos con laboratorios del Ejército Popular de Liberación y los Siete Hijos de la Defensa Nacional . [ 41 ]
Debido a las restricciones de chips de EE. UU., DeepSeek ha perfeccionado continuamente sus algoritmos para maximizar la eficiencia computacional, aprovechando hardware antiguo y reduciendo el consumo de energía. [ 42 ] : 19
DeepSeek también se expandió en el continente africano, ya que ofrece soluciones de IA más asequibles y con menor consumo energético. La compañía ha impulsado modelos de lenguaje africanos y ha generado varias startups, por ejemplo en Nairobi . Junto con los servicios de almacenamiento y computación en la nube de Huawei , su impacto en el panorama tecnológico del África subsahariana es considerable. DeepSeek ofrece soberanía de datos local y mayor flexibilidad en comparación con las plataformas de IA occidentales. [ 43 ]
Marco de formación
High-Flyer/DeepSeek había operado al menos dos clústeres de computación principales: Fire-Flyer y Fire-Flyer 2. Fire-Flyer 1 se construyó en 2019 y se retiró después de 1,5 años de operación. Fire-Flyer 2 sigue en funcionamiento a partir de 2025. Fire-Flyer 2 consta de una arquitectura de software y hardware de diseño conjunto. En el lado del hardware, las GPU de Nvidia utilizan interconexiones de 200 Gbps . El clúster está dividido en dos zonas y la plataforma admite tareas entre zonas. La topología de red era de dos árboles gordos , elegidos para un alto ancho de banda de bisección . En el lado del software, hay: [ 26 ] [ 32 ]
3FS(Sistema de archivos Fire-Flyer): Un sistema de archivos paralelo distribuido diseñado para lecturas aleatorias asíncronas. Utiliza E/S directa y lectura RDMA . A diferencia de la E/S con búfer estándar, la E/S directa no almacena datos en caché. El almacenamiento en caché es inútil en este caso, ya que cada dato leído es aleatorio y no se reutiliza. [ 44 ] [ 45 ]hfreduce: Biblioteca para comunicación asíncrona , diseñada originalmente para reemplazar la Biblioteca de Comunicación Colectiva de Nvidia (NCCL). [ 30 ] Se utiliza principalmente para allreduce , especialmente de gradientes durante la retropropagación . Se ejecuta asíncronamente en la CPU para evitar el bloqueo de kernels en la GPU. [ 32 ] Utiliza difusión de dos árboles como NCCL. [ 30 ]hfai.nn: Biblioteca de software de operadores de uso común para el entrenamiento de redes neuronales, similar a latorch.nnde PyTorch .HaiScale Distributed Data Parallel(DDP): Biblioteca de entrenamiento paralelo que implementa diversas formas de paralelismo, como paralelismo de datos (DP), paralelismo de canalización (PP), paralelismo tensorial (TP), paralelismo de expertos (EP), paralelismo de datos totalmente fragmentados (FSDP) y optimizador de redundancia cero (ZeRO). Es similar a PyTorch DDP, que utiliza NCCL en el backend.HAI Platform: Diversas aplicaciones como la programación de tareas, el manejo de fallas y la recuperación ante desastres. [ 46 ]
En 2022, Fire-Flyer 2 contaba con 5000 GPU PCIe A100 en 625 nodos, cada uno con 8 GPU. [ 30 ] Posteriormente, incorporó NVLinks y NCCL para entrenar modelos más grandes que requerían paralelismo de modelos. [ 31 ] [ 32 ]
Autorizaciones de modelos
DeepSeek Coder y DeepSeek LLM
DeepSeek lanzó su primer modelo, DeepSeek Coder, el 2 de noviembre de 2023. La serie DeepSeek-Coder V2 se lanzó poco después. Le siguió la serie DeepSeek-LLM el 29 de noviembre de 2023. [ 47 ] : sección 5
Varios.
En enero de 2024, DeepSeek lanzó dos modelos DeepSeek-MoE. [ 48 ] El 3 de abril de 2024, lanzaron 3 modelos DeepSeek-Math. [ 49 ]
Serie V2
DeepSeek-V2 se lanzó en mayo de 2024. [ 50 ] En septiembre de 2024, se presentó DeepSeek-V2.5 y se revisó en diciembre. [ 51 ]
Serie V3
En diciembre de 2025, se lanzaron DeepSeek-V3-Base y DeepSeek-V3 (chat). [ 31 ] El 24 de marzo de 2025, DeepSeek lanzó DeepSeek-V3-0324 bajo la licencia MIT, una versión revisada de V3. [ 52 ] [ 53 ]
El 21 de agosto de 2025, DeepSeek lanzó DeepSeek V3.1 bajo la licencia MIT. [ 54 ] Este modelo presenta una arquitectura híbrida con modos de pensamiento y no pensamiento. También supera a modelos anteriores como V3 y R1, en más del 40% en ciertos benchmarks como SWE-bench y Terminal-bench. [ 55 ] Se actualizó a V3.1-Terminus el 22 de septiembre de 2025, que corrigió varios artefactos de lenguaje y mejoró la inteligencia en general. [ 56 ]
DeepSeek V3.2-Exp se lanzó el 29 de septiembre de 2025. Utiliza DeepSeek Sparse Attention, un mecanismo de atención más eficiente basado en investigaciones previas publicadas en febrero. Se basó en DeepSeek V3.1 Terminus. [ 57 ] [ 58 ] DeepSeek-V3.2 se lanzó el 1 de diciembre de 2025, junto con una variante DeepSeek-V3.2-Speciale que se centró en el razonamiento. [ 59 ] [ 60 ]
Serie R1
El 20 de noviembre de 2024, la vista previa de DeepSeek-R1-Lite estuvo disponible a través del chat. Era un modelo propietario, que solo se había publicado a través de API y web. [ 61 ] [ 62 ] El 20 de enero de 2025, DeepSeek lanzó el modelo DeepSeek-R1, que era gratuito para iOS y Android . Para el 27 de enero, DeepSeek superó a ChatGPT como la aplicación gratuita más descargada en la App Store de iOS en los Estados Unidos, [ 14 ] provocando una caída del 18% en el precio de las acciones de Nvidia. [ 63 ] [ 64 ] Posteriormente, DeepSeek lanzó múltiples variantes destiladas de DeepSeek R1, que iban desde 1.500 millones de parámetros hasta 70.000 millones de parámetros. [ 65 ]
El 28 de mayo de 2025, DeepSeek lanzó DeepSeek-R1-0528 bajo la licencia MIT, que fue una actualización menor de R1. Sus puntuaciones también han superado a DeepSeek R1 (enero) y DeepSeek V3-0324 en ciertos benchmarks. [ 66 ]
Serie V4
El 24 de abril de 2026, DeepSeek publicó una vista previa de su serie V4, que incluye DeepSeek-V4-Flash con 284 mil millones de parámetros y DeepSeek-V4-Pro con 1,6 billones de parámetros. Ambos cuentan con una ventana de contexto de un millón de tokens , bajo la licencia MIT. [ 67 ] [ 68 ] [ 69 ] Una ventana de contexto es un límite de tokens del contexto de un modelo de IA. V4 ha sido adoptado por fabricantes de semiconductores como Huawei y Cambricon Technologies . [ 70 ]
Los primeros modelos DeepSeek eran esencialmente iguales a Llama, [ 47 ] que eran transformadores densos solo con decodificador . Los modelos posteriores incorporaron la atención latente multi-cabeza (MLA), MoE y el almacenamiento en caché KV. [ 48 ] [ 50 ]
Un transformador de solo decodificador consta de múltiples capas de decodificación idénticas. Cada una de estas capas presenta dos componentes principales: una capa de atención y una capa de red de alimentación directa (FFN). [ 50 ] V2 reemplazó el mecanismo de atención multi-cabeza estándar (MHA) con atención latente multi-cabeza (MLA). Esto introduce vectores latentes comprimidos para reducir el tamaño de la caché de clave-valor (KV) y, por lo tanto, el uso de memoria. [ 50 ]
Un transformador de mezcla de expertos estándar generalmente utiliza capas MoE con compuertas dispersas en las capas FFN. En una capa MoE de este tipo, hay varios módulos FFN en paralelo (expertos enrutados) y un pequeño clasificador (compuerta) para calcular una puntuación para todos estos módulos en cada token. Solo se activan los módulos con la puntuación más alta. A partir de DeepSeekMoE, DeepSeek adoptó una variante que añade expertos compartidos, que siempre están activados. [ 48 ]
Especificaciones técnicas de los modelos
Los modelos de DeepSeek son de peso abierto, lo que proporciona menos libertad de modificación que el software de código abierto verdadero . [ 10 ] [ 16 ]
Programador de DeepSeek
DeepSeek Coder es una serie de ocho modelos, cuatro preentrenados ( Base) y cuatro ajustados con instrucciones ( Instruct). [ c ] Todos tienen longitudes de contexto de 16K. [ 88 ] El modelo se publicó con pesos abiertos bajo la Licencia DeepSeek, que incluye restricciones como el uso abierto y responsable posterior. [ 89 ]
El programa de capacitación fue: [ 90 ] [ 91 ] [ 92 ]
- Preentrenamiento: 1,8 T tokens (87 % código fuente, 10 % inglés relacionado con código (GitHub markdown y Stack Exchange ) y 3 % chino no relacionado con código).
- Preentrenamiento con contexto extenso: 200 mil millones de tokens. Esto extiende la longitud del contexto de 4K a 16K. Esto generó los
Basemodelos. - Ajuste fino supervisado (SFT): 2 mil millones de tokens de datos de instrucciones. Esto produjo los
Instructmodelos.
Fueron entrenados en clústeres de GPU Nvidia A100 y H800 , conectados por InfiniBand , NVLink , NVSwitch . [ 90 ]
DeepSeek-LLM
La serie DeepSeek-LLM se lanzó en noviembre de 2023. Tiene 7B y 67B parámetros tanto en la forma Base como en la Chat. El documento adjunto de DeepSeek afirmaba que los resultados de referencia eran superiores a los de Llama 2 y a la mayoría de los LLM de código abierto de la época. [ 47 ] : sección 5 El código del modelo está bajo la licencia DeepSeek de código abierto. [ 94 ]
La arquitectura era esencialmente la misma que la de la serie Llama . [ d ] Ambas tenían un tamaño de vocabulario de 102.400 ( BPE a nivel de byte ) y una longitud de contexto de 4096. Se entrenaron con 2 billones de tokens de texto en inglés y chino obtenidos mediante la eliminación de duplicados del Common Crawl . [ 47 ]
Las versiones de chat de los dos modelos base se publicaron simultáneamente, obtenidas mediante el entrenamiento de la base por ajuste fino supervisado (SFT) seguido de optimización directa de políticas (DPO) . DPO también se conoce como aprendizaje por refuerzo a partir de la retroalimentación humana. [ 47 ]
DeepSeek-MoE
Los modelos DeepSeek-MoE (Base y Chat) tienen cada uno 16B parámetros (2,7B activados por token, longitud de contexto de 4K). El entrenamiento fue esencialmente el mismo que el de DeepSeek-LLM 7B y se entrenó con una parte de su conjunto de datos de entrenamiento. DeepSeek afirmó que el rendimiento de un MoE de 16B era comparable al de un MoE de 7B sin MoE. Es una variante del MoE estándar con compuertas dispersas , con expertos compartidos que siempre se consultan y expertos enrutados que podrían no serlo. La empresa descubrió que esto ayudaba a equilibrar los expertos. En el MoE estándar, algunos expertos pueden usarse en exceso, mientras que otros se usan raramente, lo que desperdicia espacio. Intentar equilibrar el uso de los expertos hace que estos repliquen la misma capacidad. Propusieron que los expertos compartidos aprendieran las capacidades centrales que se usan con frecuencia y que los expertos enrutados aprendieran las capacidades periféricas que se usan raramente. [ 48 ]
DeepSeek-Math
DeepSeek-Math incluye 3 modelos: Base, Instruct y RL. Math fue entrenado de la siguiente manera: [ 49 ]
- Inicializar con una base DeepSeek-Coder v1.5 7B previamente preentrenada.
- Se realizó un preentrenamiento adicional con 500 mil millones de tokens (6% DeepSeekMath Corpus, 4% AlgebraicStack, 10% arXiv, 20% código de GitHub, 10% Common Crawl). Esto produjo Base.
- Entrena un modelo de seguimiento de instrucciones mediante SFT Base con 776.000 problemas matemáticos y soluciones paso a paso integradas en el uso de herramientas. Esto produjo Instruct.
- Aprendizaje por refuerzo (RL) El modelo de recompensa fue un modelo de recompensa de proceso (PRM) entrenado a partir de Base según el método Math-Shepherd. [ 95 ] Este modelo de recompensa se utilizó luego para entrenar Instruct usando Optimización de Política Relativa de Grupo (GRPO) en un conjunto de datos de 144K preguntas de matemáticas relacionadas con GSM8K y MATH . El modelo de recompensa se actualizó continuamente durante el entrenamiento para evitar el hackeo de recompensa. Esto dio como resultado RL.
V2

En mayo de 2024, DeepSeek lanzó la serie DeepSeek-V2. La serie incluye 4 modelos, 2 modelos base (DeepSeek-V2, DeepSeek-V2 Lite) y 2 chatbots (variantes de chat). Los dos modelos más grandes se entrenaron de la siguiente manera: [ 96 ]
- Preentrenar con un conjunto de datos de 8,1 billones de tokens, utilizando un 12 % más de tokens chinos que ingleses.
- Ampliar la longitud del contexto de 4K a 128K usando YaRN. [ 97 ] Esto dio como resultado DeepSeek-V2.
- SFT registró 1,2 millones de instancias de utilidad y 0,3 millones de seguridad. Esto dio como resultado Chat SFT, que finalmente no se lanzó.
- Aprendizaje por refuerzo (RL) con GRPO en dos etapas. La primera etapa se entrenó para resolver problemas matemáticos y de programación. Esta etapa utilizó un modelo de recompensa, entrenado con retroalimentación del compilador (para programación) y etiquetas de referencia (para matemáticas). La segunda etapa se entrenó para ser útil, seguro y seguir reglas. Esta etapa utilizó tres modelos de recompensa. Los modelos de recompensa de utilidad y seguridad se entrenaron con datos de preferencias humanas. El modelo de recompensa basado en reglas se programó manualmente. Todos los modelos de recompensa entrenados se inicializaron desde Chat (SFT). Esto dio como resultado la versión publicada de Chat.
Optaron por el aprendizaje por refuerzo (RL) de dos etapas, porque descubrieron que el RL aplicado a datos de razonamiento tenía características únicas, diferentes del RL aplicado a datos generales. Por ejemplo, el RL aplicado al razonamiento podía mejorar con más pasos de entrenamiento. [ 96 ]
Los dos modelos V2-Lite eran más pequeños y se entrenaron de forma similar. DeepSeek-V2 Lite-Chat solo se sometió a SFT, no a RL. Entrenaron la versión Lite para ayudar a la investigación y el desarrollo de MLA y DeepSeekMoE. [ 96 ]
Desde el punto de vista arquitectónico, los modelos V2 eran significativamente diferentes de la serie DeepSeek LLM. Modificaron el mecanismo de atención estándar mediante una aproximación de bajo rango denominada atención latente multi-cabeza (MLA) y utilizaron la variante MoE publicada anteriormente. [ 48 ]
El Financial Times informó que era más barato que sus pares con un precio de 2 RMB por cada millón de tokens emitidos. [ 36 ]
La serie DeepSeek-Coder V2 incluía V2-Base, V2-Lite-Base, V2-Instruct y V2-Lite-Instruct. Proceso de entrenamiento: [ 50 ] [ nota 3 ]
- Los modelos base se inicializaron a partir de los puntos de control intermedios correspondientes después del preentrenamiento con 4,2 T tokens (no la versión al final del preentrenamiento), luego se preentrenaron aún más con 6 T tokens y, finalmente, se extendió el contexto a una longitud de contexto de 128 K.
- Se utilizaron DeepSeek-Coder y DeepSeek-Math para generar 20 000 datos de instrucciones relacionadas con el código y 30 000 relacionadas con las matemáticas, que luego se combinaron con un conjunto de datos de instrucciones de 300 millones de tokens. Esto se utilizó para SFT.
- Aprendizaje por refuerzo con GRPO. La recompensa para los problemas matemáticos se calculó comparándola con la etiqueta de referencia. La recompensa para los problemas de código se generó mediante un modelo de recompensa entrenado para predecir si un programa superaría las pruebas unitarias.
DeepSeek-V2.5 se creó combinando DeepSeek-V2-Chat y DeepSeek-Coder-V2-Instruct. [ 51 ]
V3

DeepSeek-V3-Base y DeepSeek-V3 (variante de chat) utilizan esencialmente la misma arquitectura que V2 con la adición de predicción de múltiples tokens , que opcionalmente decodifica tokens adicionales más rápido pero con menos precisión. Proceso de entrenamiento: [ 31 ]
- Preentrenamiento con 14,8 billones de tokens de un corpus multilingüe, principalmente en inglés y chino. Este corpus contenía una mayor proporción de expresiones matemáticas y de programación que el conjunto de datos de preentrenamiento de la versión 2.
- Extender la longitud del contexto dos veces, de 4K a 32K y luego a 128K, usando YaRN. [ 97 ] Esto produjo DeepSeek-V3-Base.
- Se aplicó SFT durante dos épocas a 1,5 millones de muestras de datos de razonamiento (matemáticas, programación, lógica) y no razonamiento (escritura creativa, juegos de rol, preguntas sencillas ). Los datos de razonamiento fueron generados por modelos expertos. Los datos no de razonamiento fueron generados por DeepSeek-V2.5 y revisados por humanos.
- Los modelos expertos se entrenaron partiendo de un modelo base no especificado, seguido de SFT sobre datos de <problema, respuesta original> y datos sintéticos de <mensaje del sistema, mensaje, problema, respuesta de R1> generados por un modelo interno DeepSeek-R1-Lite. El mensaje del sistema solicitaba a R1 que reflexionara y verificara durante el proceso de pensamiento. Posteriormente, los modelos expertos se entrenaron mediante aprendizaje por refuerzo utilizando una función de recompensa no revelada.
- Cada modelo experto fue entrenado para generar únicamente datos de razonamiento sintético en un dominio específico (matemáticas, programación, lógica).
- En lugar del propio R1, se utilizaron modelos de expertos, ya que la salida de R1 adolecía de un exceso de análisis, un formato deficiente y una longitud excesiva.
- Los modelos de recompensa basados en modelos se crearon partiendo de un punto de control SFT de V3, para luego ajustarlos con datos de preferencias humanas que incluían tanto la recompensa final como la cadena de pensamiento que conducía a ella. El modelo de recompensa generó señales de recompensa tanto para preguntas con respuestas objetivas pero de formato libre, como para preguntas sin respuestas objetivas (como la escritura creativa).
- GRPO entrenó un punto de control SFT de V3 utilizando modelos de recompensa y recompensas basadas en reglas. La recompensa basada en reglas se calculó para problemas matemáticos con una respuesta final (ubicada en un recuadro) y para problemas de programación mediante pruebas unitarias. Esto dio como resultado DeepSeek-V3.
DeepSeek lanzó su modelo DeepSeek-V3-0324, que utilizaba la misma arquitectura que V3, el 24 de marzo de 2025 bajo la licencia MIT. [ 100 ]

V3[ 31 ] : Figura 6El equipo de DeepSeek realizó ingeniería de bajo nivel para mejorar la eficiencia, como aritmética de precisión mixta . Gran parte del paso hacia adelante se realizó en números de punto flotante de 8 bits (5E2M: exponente de 5 bits y mantisa de 2 bits ) en lugar de los 32 bits estándar , lo que requirió rutinas GEMM especiales para acumular con precisión. Utilizaron un flotante personalizado de 12 bits (E5M6) solo para las entradas a las capas lineales después de los módulos de atención. Los estados del optimizador estaban en 16 bits ( BF16 ). Minimizaron la latencia de comunicación superponiendo ampliamente el cálculo y la comunicación, como dedicar 20 multiprocesadores de flujo de 132 por H800 solo para la comunicación entre GPU. Redujeron la comunicación reasignando (cada 10 minutos) la máquina exacta en la que estaba cada experto para evitar consultar ciertas máquinas con más frecuencia que otras, agregando pérdidas de equilibrio de carga auxiliares a la función de pérdida de entrenamiento y otras técnicas de equilibrio de carga. [ 31 ]
Tras el entrenamiento, se implementó en clústeres de GPU H800. Las 8 GPU H800 dentro de un clúster estaban conectadas por NVLink, y los clústeres estaban conectados por InfiniBand. [ 31 ]
El costo ha sido discutido y calificado de engañoso, porque cubre solo partes del costo real. [ 102 ] [ 103 ] [ 104 ] [ 105 ]
Las pruebas de rendimiento muestran que V3 superó a Llama 3.1 y Qwen 2.5, al tiempo que igualó a GPT-4o y Claude 3.5 Sonnet. [ 35 ] [ 106 ] [ 107 ] [ 108 ]
R1

En enero de 2025, DeepSeek lanzó el modelo DeepSeek-R1 bajo la licencia MIT . [ 109 ]
DeepSeek-R1-Lite-Preview [ 61 ] [ 62 ] [ nota 4 ] fue entrenado para inferencia lógica, razonamiento matemático y resolución de problemas en tiempo real. DeepSeek afirmó que superó el rendimiento de OpenAI o1 en pruebas comparativas como el American Invitational Mathematics Examination (AIME) y MATH. [ 110 ] Sin embargo, The Wall Street Journal informó que en 15 problemas de la edición 2024 de AIME, el modelo o1 alcanzó una solución más rápido. [ 111 ]
DeepSeek-R1 y DeepSeek-R1-Zero [ 65 ] se inicializaron a partir de DeepSeek-V3-Base y comparten su arquitectura. Los modelos DeepSeek-R1-Distill, en cambio, se inicializaron a partir de otros modelos de peso abierto preentrenados, incluidos LLaMA y Qwen , y luego se ajustaron con datos sintéticos generados por R1. [ 81 ]
DeepSeek-R1-ZeroUna conversación entre el Usuario y el Asistente. El usuario hace una pregunta y el Asistente la resuelve. El asistente primero reflexiona sobre el proceso de razonamiento y luego proporciona la respuesta al usuario. El proceso de razonamiento y la respuesta se encuentran dentro de las etiquetas <think> y <answer>, respectivamente, es decir, <think> proceso de razonamiento aquí </think> <answer> respuesta aquí </answer>. Usuario: <prompt>. Asistente:
DeepSeek-R1-Zero se entrenó exclusivamente utilizando GRPO RL sin SFT. A diferencia de las versiones anteriores, no utilizó ninguna recompensa basada en el modelo. Todas las funciones de recompensa se basaban en reglas, principalmente de dos tipos (no se especificaron otros tipos): recompensas de precisión y recompensas de formato. La recompensa de precisión consistía en comprobar si una respuesta enmarcada era correcta (para matemáticas) o si un código pasaba las pruebas (para programación). La recompensa de formato consistía en comprobar si el modelo colocaba su rastro de pensamiento dentro de una etiqueta <think>...</think>. [ 81 ]
R1-Zero tiene problemas de legibilidad y mezcla de idiomas. R1 fue entrenado para abordar estos problemas y mejorar aún más el razonamiento: [ 81 ]
- SFT DeepSeek-V3-Base se basa en miles de datos de arranque en frío , todos con el formato estándar de
|special_token|<reasoning_process>|special_token|<summary>, diseñado para mejorar la legibilidad de la salida del modelo. - Se aplicó el mismo proceso GRPO RL que a R1-Zero, añadiendo una recompensa por coherencia lingüística para incentivar una respuesta monolingüe. Esto generó un modelo interno no publicado.
- Sintetiza 600 000 datos de razonamiento a partir del modelo interno, con muestreo por rechazo (es decir, si el razonamiento generado tiene una respuesta final incorrecta, se elimina). Sintetiza 200 000 datos que no sean de razonamiento (escritura, preguntas y respuestas sobre hechos, autoconocimiento, traducción) utilizando DeepSeek-V3.
- SFT DeepSeek-V3-Base en 800K datos sintéticos durante 2 épocas.
- Se aplicó el mismo proceso GRPO RL que a R1-Zero, con recompensa basada en reglas (para tareas de razonamiento) y también recompensa basada en modelos (para tareas que no requieren razonamiento, utilidad e inocuidad). Esto dio como resultado DeepSeek-R1.
Los modelos destilados fueron entrenados por SFT en 800K datos sintetizados de DeepSeek-R1, de manera similar al paso 3. No fueron entrenados con RL. [ 81 ]
V4

En abril de 2026, DeepSeek publicó una vista previa de su nueva serie de modelos V4, también bajo la licencia MIT. [ 67 ] [ 112 ]
El modelo DeepSeek V4 mejoró su arquitectura anterior V3/R1 de las siguientes maneras: [ 112 ]
- El modelo utiliza su arquitectura de hiperconexiones con restricciones de variedad (mHC, por sus siglas en inglés), que según DeepSeek mejora las conexiones residuales convencionales.
- Introdujeron la Atención Dispersa Restringida (CSA) y la Atención Altamente Comprimida (HCA), modificaciones al mecanismo de Atención utilizado dentro de los modelos Transformer basados en su arquitectura previa de Atención Dispersa DeepSeek introducida en la versión 3.2.
- El optimizador Muon se utilizó para la mayoría de las capas con el fin de lograr una convergencia más rápida y una mayor estabilidad del entrenamiento.
Lanzaron dos tamaños del modelo: V4-Flash y V4-Pro. Cada uno puede funcionar en modo sin razonamiento, en modo con razonamiento y en un modo de razonamiento extendido "Máximo".
estatus legal
En Estados Unidos, la Ley de Autorización de Defensa Nacional para el Año Fiscal 2026 ordena al Secretario de Defensa y al Director de Inteligencia Nacional que retiren y excluyan cualquier inteligencia artificial desarrollada por DeepSeek o propiedad de HighFlyer de los dispositivos operados por el Departamento de Defensa y la Comunidad de Inteligencia de Estados Unidos o sus contratistas. La inteligencia artificial de DeepSeek solo está permitida con permisos explícitos para investigación, capacitación y evaluación o actividades militares que apoyen funciones de seguridad nacional como la lucha contra el terrorismo o la contrainteligencia . [ 113 ] [ 114 ]
En Australia, el Departamento del Interior emitió una directiva a nivel gubernamental "para impedir el uso o la instalación de productos, aplicaciones y servicios web de DeepSeek y, en caso de detectarse, eliminar todas las instancias existentes de productos, aplicaciones y servicios web de DeepSeek de todos los sistemas y dispositivos del Gobierno australiano". [ 115 ]
Véase también
Notas
- ^ Chino :杭州深度求索人工智能基础技术研究有限公司. [ 6 ] A veces se lo denomina simplemente en inglés Hangzhou DeepSeek Artificial Intelligence .
- ^ Chino :深度求索; pinyin : Shēndù Qiúsuǒ
- ↑ El preentrenamiento es cuando un modelo de IA aprende probabilidades y predice qué palabra es probable que aparezca a continuación. El conocimiento del modelo queda entonces congelado. [ 87 ]
- ↑ Utilizó el Transformer decodificador solo pre-norma con RMSNorm como normalización, SwiGLU en las capas de alimentación directa, incrustación posicional rotativa (RoPE) y atención de consulta agrupada (GQA).
- ↑宁波程信柔兆企业管理咨询合伙企业(有限合伙) y宁波程恩企业管理咨询合伙企业(有限合伙)
- 1 2 3 El número de cabezales no es igual al número de cabezales KV, debido a GQA.
- ↑ Inexplicablemente, el modelo mencionado
DeepSeek-Coder-V2 Chaten el artículo fue lanzado comoDeepSeek-Coder-V2-InstructHuggingFace. - ↑ En ese momento, era
R1-Lite-Previewnecesario seleccionar "Deep Think habilitado" y cada usuario solo podía usarlo 50 veces al día.
Referencias
- ^ " DeepSeek突传消息" . Corporación Sina . 1 de febrero de 2025 . Consultado el 1 de febrero de 2025 .
- ↑ Wu, Zijing (14 de marzo de 2025). "DeepSeek se centra en la investigación por encima de los ingresos, a diferencia de Silicon Valley" . Financial Times . Consultado el 14 de marzo de 2025 .
- ↑ "Hangzhou DeepSeek Artificial Intelligence Basic Technology Research Co., Ltd" . Bloomberg LP
- ↑ "Acuerdo de servicio modelo para programadores de DeepSeek" (PDF) , DeepSeek , 19 de octubre de 2023, archivado (PDF) del original el 21 de febrero de 2025 , consultado el 11 de febrero de 2025.
- ↑ "Política de privacidad para programadores de DeepSeek" (PDF) . DeepSeek . Archivado del original (PDF) el 8 de julio de 2025. Consultado el 19 de febrero de 2025 .
- ^ "全国互联网安全管理平台" . beian.mps.gov.cn (en chino (China)). Ministerio de Seguridad Pública de la República Popular China . Archivado desde el original el 9 de febrero de 2025 . Consultado el 9 de febrero de 2025 .
- ↑ Jiang, Ben (21 de enero de 2025). "Pekín destaca al nuevo rostro de la IA en China, Liang Wenfeng de DeepSeek" . South China Morning Post . Archivado del original el 21 de enero de 2025. Consultado el 4 de marzo de 2025 .
- ↑ Baptista, Eduardo (28 de enero de 2025). "¿Quién es Liang Wenfeng, el fundador de DeepSeek?" . Reuters . Archivado desde el original el 19 de febrero de 2025 . Consultado el 4 de marzo de 2025 .
- ↑ "Detrás de DeepSeek se esconde una deslumbrante universidad china" . The Economist . ISSN 0013-0613 . Consultado el 5 de marzo de 2025 .
{{cite news}}: CS1 maint: servicio de archivado obsoleto ( enlace ) - 1 2 3 Gibney, Elizabeth (23 de enero de 2025). "El modelo de IA barato y abierto de China, DeepSeek, entusiasma a los científicos" . Nature . 638 ( 8049): 13– 14. Bibcode : 2025Natur.638...13G . doi : 10.1038/d41586-025-00229-6 . PMID 39849139. Archivado del original el 29 de enero de 2025. Recuperado el 12 de febrero de 2025 .
- 1 2 Vincent, James (28 de enero de 2025). "El pánico de DeepSeek revela un mundo de IA a punto de estallar" . The Guardian .
- 1 2 3 4 5 Metz, Cade; Tobin, Meaghan (23 de enero de 2025). "Cómo la startup china de IA DeepSeek está compitiendo con los gigantes de Silicon Valley" . The New York Times . ISSN 0362-4331 . Archivado del original el 23 de enero de 2025. Recuperado el 27 de enero de 2025 .
- 1 2 Cosgrove, Emma (27 de enero de 2025). "Los modelos más baratos y los chips menos potentes de DeepSeek ponen en entredicho los billones de dólares invertidos en infraestructura de IA" . Business Insider . Archivado del original el 29 de enero de 2025. Recuperado el 27 de enero de 2025 .
- 1 2 3 4 Metz, Cade (27 de enero de 2025). "¿Qué es DeepSeek? ¿Y cómo está revolucionando la IA?" . The New York Times . ISSN 0362-4331 . Archivado del original el 27 de enero de 2025. Recuperado el 27 de enero de 2025 .
- ↑ Roose, Kevin (28 de enero de 2025). "Por qué DeepSeek podría cambiar lo que Silicon Valley cree sobre la IA" The New York Times . ISSN 0362-4331 . Archivado del original el 28 de enero de 2025. Recuperado el 28 de enero de 2025 .
- 1 2 Delbert, Caroline (31 de enero de 2025). "DeepSeek está descifrando por completo la 'caja negra' de la IA corporativa" . Popular Mechanics . Archivado del original el 13 de febrero de 2025. Recuperado el 12 de febrero de 2025 .
- ↑ Chen, Caiwei (12 de febrero de 2026). "¿Qué sigue para la IA de código abierto china?" . MIT Technology Review . Recuperado el 12 de abril de 2026 .
- ↑ Metz, Cade (12 de febrero de 2025). "¿Cómo logró DeepSeek desarrollar su IA con menos dinero?" . The New York Times . Archivado del original el 19 de marzo de 2025. Consultado el 21 de marzo de 2025 .
- ↑ Allen, Gregory C. (7 de marzo de 2025). "DeepSeek, Huawei, controles de exportación y el futuro de la carrera de IA entre EE. UU. y China" . Centro de Estudios Estratégicos e Internacionales .
- ↑ Hawkins, Amy (28 de enero de 2025). "¿Quién está detrás de DeepSeek y cómo logró su 'momento Sputnik' de IA?" . The Guardian .
- ↑ Cassidy, John (3 de febrero de 2025). "¿Es DeepSeek el momento Sputnik de China?" . The New Yorker – vía www.newyorker.com.
- ↑ Ruwitch, John (28 de enero de 2025). "DeepSeek: ¿Una startup china poco conocida provocó un 'momento Sputnik' para la IA?" . NPR . Consultado el 2 de agosto de 2025 .
- ↑ Saah, Jasper (13 de febrero de 2025). "DeepSeek causa conmoción en Silicon Valley" . Liberation News – Periódico del Partido por el Socialismo y la Liberación . Archivado del original el 17 de febrero de 2025. Consultado el 13 de febrero de 2025 .
- ↑ Sillars, James (28 de enero de 2025). "DeepSeek: La empresa tecnológica sufre la mayor caída en la historia del mercado bursátil estadounidense mientras la empresa china de IA de bajo coste ataca a Silicon Valley" . Sky News . Consultado el 13 de febrero de 2025 .
- ↑ Chen, Caiwei (24 de enero de 2025). "Cómo un modelo de IA chino de alto rendimiento superó las sanciones estadounidenses" . MIT Technology Review . Archivado del original el 25 de enero de 2025. Recuperado el 25 de enero de 2025 .
- 1 2 3 4 5 "幻方 | 幻方历程" . High-Flyer (en chino (China)). Archivado del original el 3 de febrero de 2025. Recuperado el 2 de febrero de 2025 .
- ↑ Olcott, Eleanor; Wu, Zijing (24 de enero de 2025). "Cómo la pequeña empresa china de IA DeepSeek sorprendió a Silicon Valley" . Financial Times . Archivado del original el 25 de enero de 2025. Recuperado el 31 de enero de 2025 .
- 1 2 3 Ottinger, Lily (9 de diciembre de 2024). "Deepseek: De fondo de cobertura a creador de modelos de vanguardia" . ChinaTalk . Archivado del original el 28 de diciembre de 2024. Recuperado el 28 de diciembre de 2024 .
- ↑ Leswing, Kif (23 de febrero de 2023). "Conozca el chip Nvidia de 10 000 dólares que impulsa la carrera por la IA" CNBC . Archivado del original el 29 de enero de 2025. Recuperado el 30 de enero de 2025 .
- ^ "hfreduce |高性能的多卡并行通信工具" . "Alto vuelo" . 4 de marzo de 2020. Archivado desde el original el 28 de enero de 2025 . Consultado el 3 de febrero de 2025 .
- 1 2 3 4 5 6 7 8 9 DeepSeek-AI; Liu, Aixin; Feng, Bei; et al. (27 de diciembre de 2024), Informe técnico de DeepSeek-V3 , arXiv : 2412.19437
- 1 2 3 4 An, Wei; Bi, Xiao; Chen, Guanting; Chen, Shanhuang; Deng, Chengqi; Ding, Honghui; Dong, Kai; Du, Qiushi; Gao, Wenjun; Guan, Kang; Guo, Jianzhong; Guo, Yongqiang; Fu, Zhe; Él, Ying; Huang, Panpan (17 de noviembre de 2024). "Fire-Flyer AI-HPC: un codiseño de software y hardware rentable para el aprendizaje profundo". SC24: Conferencia internacional sobre informática, redes, almacenamiento y análisis de alto rendimiento . IEEE. págs. 1 a 23. arXiv : 2408.14158 . doi : 10.1109/SC41406.2024.00089 . ISBN 979-8-3503-5291-7.
- ^ "独家|幻方量化回应市场关注:AGI不是用来炒股的,"和金融没关系"" . Yicai . Consultado el 3 de febrero de 2025 .
- ↑ Yu, Xu (17 de abril de 2023). " [ Exclusiva ] El director general de un fondo de cobertura cuantitativo chino de alto rendimiento afirma que no utilizará AGI para operar con acciones" . Yicai Global . Archivado del original el 31 de diciembre de 2023. Consultado el 28 de diciembre de 2024 .
- 1 2 3 4 Jiang, Ben; Perezi, Bien (1 de enero de 2025). "Conozca a DeepSeek: la empresa emergente china que está cambiando la forma en que se entrenan los modelos de IA" . South China Morning Post . Archivado del original el 22 de enero de 2025. Recuperado el 1 de enero de 2025 .
- 1 2 McMorrow, Ryan; Olcott, Eleanor (9 de junio de 2024). "El fondo cuantitativo chino convertido en pionero de la IA" . Financial Times . Archivado del original el 17 de julio de 2024. Recuperado el 28 de diciembre de 2024 .
- ^ "大模型价格又砍一刀 这次"屠夫"竟是量化私募?" . www.cls.cn. 10 de mayo de 2024. Archivado desde el original el 27 de diciembre de 2024 . Consultado el 3 de febrero de 2025 .
- ↑ Metz, Cade (23 de febrero de 2026). "Anthropic acusa a 3 empresas chinas de extraer sus datos" . The New York Times . ISSN 0362-4331 . Consultado el 24 de febrero de 2026 .
- ↑ Abu Sultan; Zaheer Kachwala (18 de abril de 2026). Anil D'Silva; Devika Syamnath (eds.). "DeepSeek de China está recaudando fondos con una valoración de 10 mil millones de dólares, informa The Information" . Reuters . Consultado el 21 de abril de 2026 .
- ↑ Schneider, Jordan (27 de noviembre de 2024). "Deepseek: El gigante silencioso que lidera la carrera de la IA en China" . ChinaTalk . Archivado del original el 29 de noviembre de 2024. Consultado el 28 de diciembre de 2024 .
- ↑ Mickle, Tripp; Swanson, Ana; Tobin, Meaghan; Metz, Cade (16 de abril de 2025). "Funcionarios estadounidenses apuntan a Nvidia y DeepSeek en medio de temores por el progreso de la IA en China" . The New York Times . ISSN 0362-4331 . Consultado el 17 de abril de 2025 .
{{cite news}}: CS1 maint: servicio de archivado obsoleto ( enlace ) - ↑ Greenspan, Anna; Konior, Bogna (2025). «Introducción: Fuerzas fugaces y maquinaciones ingeniosas». En Bratton, Benjamin; Greenspan, Anna; Ireland, Amy; Konior, Bogna (eds.). La decisión de la máquina no es definitiva: China y la historia y el futuro de la inteligencia artificial . Urbanomic, MIT Press . ISBN 9781913029999.
- ↑ Rai, Saritha, Loni Prinsloo y Helen Nyambura "DeepSeek de China supera a OpenAI y Google en África" Bloomberg Technology . Consultado el 27 de octubre de 2025.
- ^ "幻方力量 | 高速文件系统 3FS" . "Alto vuelo" . 13 de junio de 2019. Archivado desde el original el 3 de febrero de 2025 . Consultado el 3 de febrero de 2025 .
- ↑ deepseek-ai/3FS , DeepSeek, 28 de febrero de 2025, archivado del original el 28 de febrero de 2025 , recuperado el 28 de febrero de 2025
- ↑ "HFAiLab/hai-platform" , High-Flyer , 2 de febrero de 2025 , consultado el 3 de febrero de 2025
- ^ DeepSeek - AI ; Bi, Xiao; Chen, Deli; Chen, Guanting; Chen, Shanhuang; Dai, Damai; Deng, Chengqi; Ding, Honghui; Dong, Kai (5 de enero de 2024), DeepSeek LLM: escalamiento de modelos de lenguaje de código abierto con longtermismo , arXiv : 2401.02954
- 1 2 3 4 5 Dai, Damai; Deng, Chengqi; Zhao, Chenggang; Xu, RX; Gao, Huazuo; Chen, Deli; Li, Jiashi; Zeng, Wangding; Yu, Xingkai (11 de enero de 2024), DeepSeekMoE: hacia la máxima especialización de expertos en modelos de lenguajes de mezcla de expertos , arXiv : 2401.06066
- 1 2 Shao, Zhihong; Wang, Peiyi; Zhu, Qihao; Xu, Runxin; Canción, Junxiao; Bi, Xiao; Zhang, Haowei; Zhang, Mingchuan; Li, YK (27 de abril de 2024), DeepSeekMath: superando los límites del razonamiento matemático en modelos de lenguaje abierto , arXiv : 2402.03300.
- ^ DeepSeek - AI ; Zhu, Qihao; Guo, Daya; Shao, Zhihong; Yang, Dejian; Wang, Peiyi; Xu, Runxin; Wu, Y.; Li, Yukun (17 de junio de 2024), DeepSeek-Coder-V2: Rompiendo la barrera de los modelos de código cerrado en Code Intelligence , arXiv : 2406.11931
- 1 2 "deepseek-ai/DeepSeek-V2.5 · Hugging Face" . Hugging Face . 3 de enero de 2025. Archivado del original el 30 de enero de 2025. Recuperado el 28 de enero de 2025 .
- ↑ Nuñez, Michael (24 de marzo de 2025). "DeepSeek-V3 ahora funciona a 20 tokens por segundo en Mac Studio, y eso es una pesadilla para OpenAI" . VentureBeat . Consultado el 24 de marzo de 2025 .
- ↑ "deepseek-ai/DeepSeek-V3-0324 · Hugging Face" . Hugging Face . Archivado del original el 24 de marzo de 2025. Recuperado el 24 de marzo de 2025 .
- ↑ "deepseek-ai/DeepSeek-V3.1 · Hugging Face" . huggingface.co . 21 de agosto de 2025. Consultado el 25 de agosto de 2025 .
- ↑ "Lanzamiento de DeepSeek-V3.1 | Documentación de la API de DeepSeek" . api-docs.deepseek.com . Consultado el 25 de agosto de 2025 .
- ↑ "deepseek-ai/DeepSeek-V3.1-Terminus · Hugging Face" . huggingface.co . 22 de septiembre de 2025. Consultado el 24 de septiembre de 2025 .
- ^ Yuan, Jingyang; Gao, Huazuo; Dai, Damai; Luo, Junyu; Zhao, Liang; Zhang, Zhengyan; Xie, Zhenda; Wei, YX; Wang, Lean (27 de febrero de 2025), Atención dispersa nativa: atención dispersa alineada con hardware y entrenable de forma nativa , arXiv : 2502.11089
- ↑ "deepseek-ai/DeepSeek-V3.2-Exp · Hugging Face" . huggingface.co . 29 de septiembre de 2025. Consultado el 2 de octubre de 2025 .
- 1 2 Binder, Matt (3 de diciembre de 2025). "DeepSeek v3.2: Qué es, cómo se compara con ChatGPT, cómo probarlo" . Mashable . Recuperado el 12 de abril de 2026 .
- 1 2 "Lanzamiento de DeepSeek-V3.2" . Documentación de la API de DeepSeek . 1 de diciembre de 2025. Consultado el 12 de abril de 2026 .
- 1 2 "Página de inicio de sesión de Deepseek" . DeepSeek . Consultado el 30 de enero de 2025 .
- 1 2 "Noticias | Lanzamiento de DeepSeek-R1-Lite 2024/11/20: 🚀 DeepSeek-R1-Lite-Preview ya está disponible: ¡desata una potencia de razonamiento sobrealimentada!" . Documentación de la API de DeepSeek . Archivado del original el 20 de noviembre de 2024 . Consultado el 28 de enero de 2025 .
- ↑ Field, Hayden (27 de enero de 2025). "La IA DeepSeek de China destrona a ChatGPT en la App Store: esto es lo que debes saber" . CNBC . Archivado del original el 28 de enero de 2025. Consultado el 27 de enero de 2025 .
- ↑ Picchi, Aimee (27 de enero de 2025). "¿Qué es DeepSeek y por qué está provocando la caída de las acciones de Nvidia y otras empresas?" . CBS News . Archivado del original el 29 de enero de 2025. Consultado el 27 de enero de 2025 .
- 1 2 "Release DeepSeek-R1 · deepseek-ai/DeepSeek-R1@23807ce" . GitHub . Archivado del original el 21 de enero de 2025 . Recuperado el 21 de enero de 2025 .
- 1 2 "LICENCIA · deepseek-ai/DeepSeek-R1-0528" . 28 de mayo de 2025. Recuperado el 12 de abril de 2026 a través de Hugging Face .
- 1 2 3 Sankaran, Vishwam (24 de abril de 2026). "DeepSeek de China lanza un nuevo modelo de IA que, según afirma, supera a todos sus competidores de código abierto" . The Independent . Recuperado el 24 de abril de 2026 .
- 1 2 Chen, Caiwei (24 de abril de 2026). "Tres razones por las que el nuevo modelo de DeepSeek importa" . MIT Technology Review . Recuperado el 25 de abril de 2026 .
- 1 2 Tolomia, Cris (24 de abril de 2026). "DeepSeek regresa con un nuevo modelo de IA de código abierto basado en chips chinos" . Quartz . Recuperado el 25 de abril de 2026 .
- ↑ "Los fabricantes de chips chinos se apresuran a adoptar la versión V4 de DeepSeek. ¿Qué nombres destacan?" . South China Morning Post . 6 de mayo de 2026 . Consultado el 7 de mayo de 2026 .
- ↑ "LICENCIA · deepseek-ai/deepseek-coder-33b-base" . Hugging Face . 28 de octubre de 2023. Consultado el 12 de abril de 2026 .
- ↑ "DeepSeek-LLM/LICENSE-MODEL" . GitHub . 29 de noviembre de 2023. Consultado el 12 de abril de 2026 .
- ↑ "DeepSeek-MoE/LICENSE-MODEL" . 11 de enero de 2024. Recuperado el 12 de abril de 2026 a través de GitHub .
- ↑ "LICENCIA · deepseek-ai/deepseek-math-7b-base" . Hugging Face . 6 de febrero de 2024. Consultado el 12 de abril de 2026 .
- ↑ "LICENCIA · deepseek-ai/deepseek-math-7b-instruct" . Hugging Face . 6 de febrero de 2024. Consultado el 12 de abril de 2026 .
- ↑ "LICENCIA · deepseek-ai/deepseek-math-7b-rl" . Hugging Face . 6 de febrero de 2024. Consultado el 12 de abril de 2026 .
- ↑ "LICENCIA · deepseek-ai/DeepSeek-V2.5" . 5 de septiembre de 2024. Recuperado el 12 de abril de 2026 – vía Hugging Face .
- ↑ "LICENSE-MODEL · deepseek-ai/DeepSeek-V3-Base" . 26 de diciembre de 2024. Recuperado el 12 de abril de 2026 – vía Hugging Face .
- ↑ "DeepSeek-Prover-V2/LICENSE-MODEL" . 30 de abril de 2025. Recuperado el 12 de abril de 2026 a través de GitHub .
- ↑ "deepseek-ai/deepseek-vl2" . 27 de noviembre de 2025. Recuperado el 12 de abril de 2026 – vía Hugging Face .
- ^ DeepSeek - AI ; Guo, Daya; Yang, Dejian; Zhang, Haowei; Canción, Junxiao; Zhang, Ruoyu; Xu, Runxin; Zhu, Qihao; Ma, Shirong (22 de enero de 2025), "DeepSeek-R1 incentiva el razonamiento en LLMS mediante el aprendizaje por refuerzo", Nature , 645 (8081): 633– 638, arXiv : 2501.12948 , Bibcode : 2025Natur.645..633G , doi : 10.1038/s41586-025-09422-z , PMC 12443585 , PMID 40962978
- ↑ "LICENCIA · deepseek-ai/DeepSeek-R1-Distill-Qwen-32B" . 20 de enero de 2025. Recuperado el 12 de abril de 2026 – vía Hugging Face .
- ↑ "LICENCIA · deepseek-ai/DeepSeek-V3.1-Base" . 19 de agosto de 2025. Recuperado el 12 de abril de 2026 – vía Hugging Face .
- ↑ "LICENCIA · deepseek-ai/DeepSeek-V3.1-Terminus" . 22 de septiembre de 2025. Recuperado el 12 de abril de 2026 – vía Hugging Face .
- ↑ "LICENCIA · deepseek-ai/DeepSeek-Math-V2" . 27 de noviembre de 2025. Recuperado el 12 de abril de 2026 – vía Hugging Face .
- ↑ "LICENCIA · deepseek-ai/DeepSeek-V3.2" . 1 de diciembre de 2025. Recuperado el 12 de abril de 2026 – vía Hugging Face .
- ↑ Eltaybani, Sameh (2026). "Knowledge Cut-Off in Large Language Models: Implications for Critical Care Nursing" . Nursing in Critical Care . 31 (3) e70458. doi : 10.1111/nicc.70458 . ISSN 1478-5153 . PMID 41906802 .
- ↑ Eltaybani, Sameh (2026). "Knowledge Cut-Off in Large Language Models: Implications for Critical Care Nursing" . Nursing in Critical Care . 31 (3) e70458. doi : 10.1111/nicc.70458 . ISSN 1478-5153 . PMID 41906802 .
- ↑ "DeepSeek-Coder/LICENSE-MODEL en main · deepseek-ai/DeepSeek-Coder" . GitHub . Archivado del original el 22 de enero de 2025. Consultado el 24 de enero de 2025 .
- 1 2 3 Guo, Daya; Zhu, Qihao; Yang, Dejian; Xie, Zhenda; Dong, Kai; Zhang, Wentao; Chen, Guanting; Bi, Xiao; Wu, Y. (26 de enero de 2024), DeepSeek-Coder: Cuando el modelo de lenguaje grande se encuentra con la programación: el auge de la inteligencia del código , arXiv : 2401.14196
- ↑ "DeepSeek Coder" . deepseekcoder.github.io . Archivado del original el 27 de enero de 2025. Consultado el 27 de enero de 2025 .
- ↑ deepseek-ai/DeepSeek-Coder , DeepSeek, 27 de enero de 2025, archivado del original el 27 de enero de 2025 , recuperado el 27 de enero de 2025
- ↑ "deepseek-ai/deepseek-coder-5.7bmqa-base · Hugging Face" . Hugging Face . Consultado el 27 de enero de 2025 .
- ↑ deepseek-ai/DeepSeek-LLM , DeepSeek, 27 de enero de 2025 , consultado el 27 de enero de 2025
- ↑ Wang, Peiyi; Li, Lei; Shao, Zhihong; et al. (19 de febrero de 2024), Math-Shepherd: Verificar y reforzar modelos LLM paso a paso sin anotaciones humanas , arXiv : 2312.08935 .
- 1 2 3 4 5 DeepSeek-AI; Liu, Aixin; Feng, Bei; et al. (19 de junio de 2024), DeepSeek-V2: Un modelo de lenguaje de mezcla de expertos fuerte, económico y eficiente , arXiv : 2405.04434 .
- 1 2 Peng, Bowen; Quesnelle, Jeffrey; Fan, Honglu; Shippole, Enrico (1 de noviembre de 2023), YaRN: Extensión eficiente de la ventana de contexto de grandes modelos de lenguaje , arXiv : 2309.00071.
- ↑ "config.json · deepseek-ai/DeepSeek-V2-Lite en main" . Hugging Face . 15 de mayo de 2024. Consultado el 28 de enero de 2025 .
- ↑ "config.json · deepseek-ai/DeepSeek-V2 en main" . Hugging Face . 6 de mayo de 2024. Consultado el 28 de enero de 2025 .
- ↑ Feng, Coco (25 de marzo de 2025). "DeepSeek sorprende a los programadores con un modelo V3 de código abierto más potente" . South China Morning Post . Consultado el 6 de abril de 2025 .
- ↑ "config.json · deepseek-ai/DeepSeek-V3 en main" . Hugging Face . 26 de diciembre de 2024. Archivado del original el 26 de enero de 2025. Recuperado el 28 de enero de 2025 .
- ↑ Thubron, Rob (3 de febrero de 2025). "Los costos de IA de DeepSeek superan con creces la cifra de 5,5 millones de dólares que se afirma, y podrían haber alcanzado los 1.600 millones de dólares con 50.000 GPU de Nvidia" . TechSpot . Consultado el 13 de febrero de 2025 .
- ↑ Kajal, Kapil (31 de enero de 2025). "Una investigación revela que el costo de entrenamiento de la IA de DeepSeek no es de 6 millones de dólares, sino de la asombrosa cifra de 1300 millones de dólares" . Yahoo News . Archivado del original el 13 de febrero de 2025. Consultado el 13 de febrero de 2025 .
- ↑ Patel, Dylan; Kourabi, AJ; O'Laughlin, Dylan; Knuhtsen, Doug (31 de enero de 2025). "Debates sobre DeepSeek: Liderazgo chino sobre costes, costes reales de formación e impactos en los márgenes del modelo cerrado" . SemiAnalysis . Archivado del original el 13 de febrero de 2025. Recuperado el 13 de febrero de 2025 .
- ^ "Martin Vechev de INSAIT: "El coste de formación de DeepSeek de 6 millones de dólares es engañoso"" . TheRecursive.com . 28 de enero de 2025. Archivado del original el 13 de febrero de 2025 . Consultado el 13 de febrero de 2025 .
- ↑ Jiang, Ben (27 de diciembre de 2024). "El nuevo modelo de IA de la empresa emergente china DeepSeek supera a los productos Meta y OpenAI" . South China Morning Post . Archivado del original el 27 de diciembre de 2024. Consultado el 28 de diciembre de 2024 .
- ↑ Sharma, Shubham (26 de diciembre de 2024). "DeepSeek-V3, una IA de código abierto de gran tamaño, supera a Llama y Qwen en su lanzamiento" . VentureBeat . Archivado del original el 27 de diciembre de 2024. Consultado el 28 de diciembre de 2024 .
- ↑ Wiggers, Kyle (26 de diciembre de 2024). "El nuevo modelo de IA de DeepSeek parece ser uno de los mejores competidores 'abiertos' hasta la fecha" . TechCrunch . Archivado del original el 2 de enero de 2025. Consultado el 31 de diciembre de 2024 .
- ↑ Edwards, Benj (21 de enero de 2025). "Un modelo chino de 'razonamiento' de vanguardia rivaliza con OpenAI o1, y se puede descargar gratis" . Ars Technica . Consultado el 16 de febrero de 2025 .
- ↑ Franzen, Carl (20 de noviembre de 2024). "El primer modelo de razonamiento de DeepSeek, R1-Lite-Preview, sorprende y supera el rendimiento de OpenAI o1" . VentureBeat . Archivado del original el 22 de noviembre de 2024. Consultado el 28 de diciembre de 2024 .
- ↑ Huang, Raffaele (24 de diciembre de 2024). "No te des cuenta, pero la IA de China está avanzando rápidamente" . The Wall Street Journal . Archivado del original el 27 de diciembre de 2024. Consultado el 28 de diciembre de 2024 .
- 1 2 3 DeepSeek-AI; Xu, Anyi; Lin, Bangcai; et al. (26 de abril de 2026), DeepSeek-V4: Hacia una inteligencia contextual de millones de tokens altamente eficiente , arXiv : 2606.19348
- ↑ "Disposiciones sobre ciberseguridad e inteligencia artificial en la Ley de Autorización de Defensa Nacional (NDAA) para el año fiscal 2026" . www.congress.gov . Consultado el 6 de julio de 2026 .
- ↑ Senador Cornyn, John [R-TX (18 de diciembre de 2025). "Texto - S.1071 - 119.º Congreso (2025-2026): Ley de Autorización de Defensa Nacional para el Año Fiscal 2026" . www.congress.gov . Consultado el 6 de julio de 2026 .
- ↑ "Actualización de la dirección de PSPF: productos, aplicaciones y servicios web de DeepSeek" . Protectivesecurity.gov.au/ . 4 de febrero de 2025. Archivado del original el 7 de febrero de 2025. Consultado el 9 de julio de 2026 .
Enlaces externos
- Sitio web oficial

- DeepSeek en GitHub
- DeepSeek en Hugging Face
- Documentación oficial de la API
- Antología de artículos de DeepSeek
- Blog de investigación de High-Flyer
- Empresas chinas establecidas en 2023
- empresas de inteligencia artificial
- laboratorios de inteligencia artificial
- Empresas con sede en Hangzhou
- Empresas tecnológicas fundadas en 2023
- marcas chinas
- Inteligencia artificial de código abierto
- 2023 en inteligencia artificial