
Hopper es una microarquitectura de unidad de procesamiento gráfico (GPU) desarrollada por Nvidia . Está diseñada para centros de datos y se utiliza junto con la microarquitectura Lovelace .
La arquitectura Hopper , que recibe su nombre de la científica informática y contralmirante de la Armada de los Estados Unidos , Grace Hopper , se filtró en noviembre de 2019 y se reveló oficialmente en marzo de 2022. Mejora a sus predecesoras, las microarquitecturas Turing y Ampere , e incluye un nuevo multiprocesador de flujo , un subsistema de memoria más rápido y un motor de aceleración Transformer .
Arquitectura
La GPU Nvidia Hopper H100 se implementa utilizando el proceso TSMC N4 con 80 mil millones de transistores. Consta de hasta 144 multiprocesadores de flujo . [ 1 ] Debido al mayor ancho de banda de memoria que proporciona el zócalo SXM5 , la Nvidia Hopper H100 ofrece un mejor rendimiento cuando se utiliza en una configuración SXM5 que en el zócalo PCIe típico. [ 2 ]
multiprocesador de transmisión
Los multiprocesadores de flujo para Hopper mejoran las microarquitecturas Turing y Ampere , aunque el número máximo de warps concurrentes por multiprocesador de flujo (SM) permanece igual entre las arquitecturas Ampere y Hopper, 64. [ 3 ] La arquitectura Hopper proporciona un acelerador de memoria tensorial (TMA), que admite la transferencia de memoria asíncrona bidireccional entre la memoria compartida y la memoria global. [ 4 ] Bajo TMA, las aplicaciones pueden transferir hasta 5 tensores 5D. Al escribir desde la memoria compartida a la memoria global, se pueden usar operadores de reducción elemento a elemento y operadores bit a bit, evitando registros e instrucciones SM y permitiendo a los usuarios escribir códigos especializados para warps. TMA se expone a través de cuda::memcpy_async. [ 5 ]
Al paralelizar aplicaciones, los desarrolladores pueden usar clústeres de bloques de subprocesos . Los bloques de subprocesos pueden realizar operaciones atómicas en la memoria compartida de otros bloques de subprocesos dentro de su clúster, también conocida como memoria compartida distribuida . La memoria compartida distribuida puede ser utilizada por un SM simultáneamente con la caché L2 ; cuando se usa para comunicar datos entre SM, esto puede aprovechar el ancho de banda combinado de la memoria compartida distribuida y L2. El tamaño máximo de clúster portátil es 8, aunque el Nvidia Hopper H100 puede admitir un tamaño de clúster de 16 mediante el uso de la cudaFuncAttributeNonPortableClusterSizeAllowedfunción, potencialmente a costa de una reducción en el número de bloques activos. [ 6 ] Con la multidifusión L2 y la memoria compartida distribuida, se reduce el ancho de banda requerido para las lecturas y escrituras de memoria de acceso aleatorio dinámico . [ 7 ]
Hopper ofrece un rendimiento mejorado en formato de punto flotante de precisión simple (FP32), con el doble de operaciones FP32 por ciclo por SM que su predecesor. Además, la arquitectura Hopper añade soporte para nuevas instrucciones, incluido el algoritmo Smith-Waterman . [ 6 ] Al igual que Ampere, admite la aritmética TensorFloat-32 (TF-32). El patrón de mapeo para ambas arquitecturas es idéntico. [ 8 ]
Memoria
La Nvidia Hopper H100 admite memoria HBM3 y HBM2e de hasta 80 GB; el sistema de memoria HBM3 admite 3 TB/s, un aumento del 50 % con respecto a los 2 TB/s de la Nvidia Ampere A100. En toda la arquitectura, se incrementó la capacidad y el ancho de banda de la caché L2. [ 9 ]
Hopper permite que los kernels de cómputo CUDA utilicen compresión automática en línea, incluso en la asignación de memoria individual, lo que permite acceder a la memoria con mayor ancho de banda. Esta función no aumenta la cantidad de memoria disponible para la aplicación, ya que los datos (y, por lo tanto, su compresibilidad ) pueden cambiar en cualquier momento. El compresor elegirá automáticamente entre varios algoritmos de compresión. [ 9 ]
El Nvidia Hopper H100 aumenta la capacidad de la caché L1 combinada, la caché de texturas y la memoria compartida a 256 KB. Al igual que sus predecesores, combina las cachés L1 y de texturas en una caché unificada diseñada para funcionar como un búfer coalescente. El atributo cudaFuncAttributePreferredSharedMemoryCarveoutpuede utilizarse para definir la asignación de la caché L1. Hopper introduce mejoras en NVLink mediante una nueva generación con un ancho de banda de comunicación general más rápido. [ 10 ]
dominios de sincronización de memoria
Algunas aplicaciones CUDA pueden experimentar interferencias al realizar operaciones de bloqueo o vaciado debido al ordenamiento de la memoria. Dado que la GPU no puede saber qué escrituras están garantizadas y cuáles son visibles por azar, puede esperar a que finalicen operaciones de memoria innecesarias, lo que ralentiza las operaciones de bloqueo o vaciado. Por ejemplo, cuando un kernel realiza cálculos en la memoria de la GPU y un kernel paralelo se comunica con un nodo par, el kernel local vaciará sus escrituras, lo que resultará en escrituras NVLink o PCIe más lentas . En la arquitectura Hopper, la GPU puede reducir la transmisión de datos mediante una operación de bloqueo. [ 11 ]
Instrucciones DPX
La interfaz de programación de aplicaciones (API) matemática de la arquitectura Hopper expone funciones en el SM como __viaddmin_s16x2_relu, que realiza la media palabra por . En el algoritmo Smith-Waterman, se puede usar , un mínimo o máximo de tres vías seguido de un ajuste a cero. [ 12 ] De manera similar, Hopper acelera las implementaciones del algoritmo Needleman-Wunsch . [ 13 ]__vimax3_s16x2_relu
Motor transformador
La arquitectura Hopper fue la primera arquitectura de Nvidia en implementar el motor Transformer. [ 14 ] El motor Transformer acelera los cálculos reduciéndolos dinámicamente de precisiones numéricas más altas (es decir, FP16) a precisiones más bajas que son más rápidas de realizar (es decir, FP8) cuando la pérdida de precisión se considera aceptable. [ 14 ] El motor Transformer también es capaz de asignar dinámicamente bits en la precisión elegida a la mantisa o al exponente en tiempo de ejecución para maximizar la precisión. [ 5 ]
Eficiencia energética
El H100 con formato SXM5 tiene una potencia de diseño térmico (TDP) de 700 vatios . En cuanto a su asincronía, la arquitectura Hopper puede alcanzar altos grados de utilización y, por lo tanto, puede tener un mejor rendimiento por vatio. [ 15 ]
Grace Hopper
El GH200 combina una GPU H100 basada en Hopper con una CPU de 72 núcleos basada en Grace en un solo módulo. El consumo total de energía del módulo es de hasta 1000 W. La CPU y la GPU están conectadas mediante NVLink, que proporciona coherencia de memoria entre la memoria de la CPU y la GPU. [ 16 ]
Historia
En noviembre de 2019, una conocida cuenta de Twitter publicó un tuit revelando que la siguiente arquitectura después de Ampere se llamaría Hopper, en honor a la científica informática y contralmirante de la Armada de los Estados Unidos , Grace Hopper , una de las primeras programadoras de la Harvard Mark I. La cuenta afirmó que Hopper se basaría en un diseño de módulo multichip , lo que resultaría en una mayor productividad con menor desperdicio. [ 17 ]
Durante la conferencia Nvidia GTC de marzo de 2022 , Nvidia anunció Hopper. [ 18 ]
A finales de 2022, debido a las regulaciones estadounidenses que limitaban la exportación de chips a la República Popular China , Nvidia adaptó el chip H100 al mercado chino con el H800. Este modelo tiene un ancho de banda menor en comparación con el modelo H100 original. [ 19 ] [ 20 ] A finales de 2023, el gobierno estadounidense anunció nuevas restricciones a la exportación de chips de IA a China, incluidos los modelos A800 y H800. [ 21 ] Esto llevó a Nvidia a crear otro chip basado en la microarquitectura Hopper: el H20, una versión modificada del H100. El H20 se había convertido en el chip más destacado en el mercado chino a partir de 2025. [ 22 ]
Para 2023, durante el auge de la IA , las H100 tenían una gran demanda. Larry Ellison de Oracle Corporation dijo ese año que en una cena con el CEO de Nvidia, Jensen Huang , él y Elon Musk de Tesla, Inc. y xAI "estaban suplicando" por H100, "Supongo que esa es la mejor manera de describirlo. Una hora de sushi y súplicas". [ 23 ]
En enero de 2024, los analistas de Raymond James Financial estimaron que Nvidia vendía la GPU H100 a un precio de entre 25 000 y 30 000 dólares cada una, mientras que en eBay, las H100 individuales costaban más de 40 000 dólares. [ 24 ] En febrero de 2024, según informes, Nvidia enviaba GPU H100 a centros de datos en vehículos blindados. [ 25 ]
Acelerador H100 y DGX H100
Comparación de aceleradores utilizados en DGX: [ 26 ] [ 27 ] [ 28 ]
Controles de exportación y cuestiones de comercio internacional
A principios de 2026, el acelerador de IA H200 de Nvidia, basado en la arquitectura Hopper, se convirtió en el centro de las disputas comerciales internacionales que involucraban la política de exportación de EE. UU. y los controles de importación de China. Si bien el gobierno estadounidense aprobó la exportación limitada de chips H200 a China bajo condiciones de seguridad específicas, informes indicaron que los funcionarios de aduanas chinos impidieron la entrada al país de los procesadores a pesar de la autorización estadounidense, lo que llevó a los proveedores a suspender la producción de componentes H200 ante la incertidumbre sobre el bloqueo a las importaciones. Según informes, las autoridades chinas instruyeron a las empresas nacionales para que no compraran los chips a menos que fuera necesario, aunque no se anunció públicamente ninguna prohibición formal y el alcance a largo plazo de las restricciones seguía sin estar claro. Esta situación puso de manifiesto la sensibilidad geopolítica en torno a las exportaciones de hardware avanzado para IA y la compleja interacción entre las regulaciones de exportación de EE. UU. y las políticas de importación de China. [ 29 ]
En mayo de 2026, los controles de exportación del gobierno estadounidense sobre el procesador Nvidia H200 se convirtieron en un punto clave de debate durante la visita de Estado del presidente estadounidense Donald Trump a China . Estados Unidos autorizó a 10 empresas chinas, entre ellas Alibaba Group , Tencent , ByteDance y JD.com , y a distribuidores como Lenovo y Foxconn , a comprar chips H200 de NVIDIA. [ 30 ]
Referencias
Citas
- ^ Elster y Haugdahl 2022 , pág. 4.
- ^ Nvidia 2023c , pág. 20.
- ^ Nvidia 2023b , pág. 9.
- ^ Fujita et al. 2023 , pág. 6.
- ^ a b "La próxima GPU de Nvidia demuestra que los Transformers están transformando la IA - IEEE Spectrum" . spectrum.ieee.org . Consultado el 23 de octubre de 2024 .
- ^ a b Nvidia 2023b , pág. 10.
- ^ Vishal Mehta (septiembre de 2022). Modelo de programación CUDA para la arquitectura Hopper . Santa Clara: Nvidia . Recuperado el 29 de mayo de 2023 .
- ^ Fujita et al. 2023 , pág. 4.
- ^ a b Nvidia 2023b , pág. 11.
- ^ Nvidia 2023b , pág. 12.
- ^ Nvidia 2023a , pág. 44.
- ^ Tirumala, Ajay; Eaton, Joe; Tyrlik, Matt (8 de diciembre de 2022). "Mejora del rendimiento de la programación dinámica mediante las instrucciones DPX de la GPU NVIDIA Hopper" . Nvidia . Recuperado el 29 de mayo de 2023 .
- ^ Harris, Dion (22 de marzo de 2022). "La arquitectura de GPU Hopper de NVIDIA acelera la programación dinámica hasta 40 veces utilizando nuevas instrucciones DPX" . Nvidia . Recuperado el 29 de mayo de 2023 .
- ^ a b Salvator, Dave (22 de marzo de 2022). "El motor H100 Transformer potencia el entrenamiento de IA, ofreciendo un rendimiento hasta 6 veces superior sin perder precisión" . Nvidia . Recuperado el 29 de mayo de 2023 .
- ^ Elster y Haugdahl 2022 , pág. 8.
- ^ "NVIDIA: Grace Hopper ha entrado en plena producción y anuncia la supercomputadora de IA DGX GH200" . Anandtech . 29 de mayo de 2023. Archivado del original el 29 de mayo de 2023.
- ^ Pirzada, Usman (16 de noviembre de 2019). "Se filtra la GPU Hopper de próxima generación de NVIDIA: basada en el diseño MCM, se lanzará después de Ampere" . Wccftech . Recuperado el 29 de mayo de 2023 .
- ^ Vincent, James (22 de marzo de 2022). "Nvidia revela la GPU H100 para IA y adelanta 'la supercomputadora de IA más rápida del mundo'"." . The Verge . Consultado el 29 de mayo de 2023 .
- ^ "Nvidia modifica su chip insignia H100 para exportarlo a China como H800" . Reuters . Archivado del original el 22 de noviembre de 2023. Consultado el 28 de enero de 2025 .
- ^ "NVIDIA prepara una adaptación de la GPU H100 para el H800 para el mercado chino" . TechPowerUp . Archivado del original el 2 de septiembre de 2023. Consultado el 28 de enero de 2025 .
- ^ Leswing, Kif (17 de octubre de 2023). "EE. UU. restringe la exportación de más chips de IA, incluido el Nvidia H800, a China" . CNBC . Consultado el 28 de enero de 2025 .
- ^ "Estos son los chips que Nvidia puede vender a China" . qz.com .
- ^ Fitch, Asa (26 de febrero de 2024). "El impresionante ascenso de Nvidia también la ha convertido en un objetivo gigante" . The Wall Street Journal . Consultado el 27 de febrero de 2024 .
- ^ Vanian, Jonathan (18 de enero de 2024). "Mark Zuckerberg indica que Meta está gastando miles de millones de dólares en chips de IA de Nvidia" . CNBC . Consultado el 6 de junio de 2024 .
- ^ Bousquette, Isabelle; Lin, Belle (14 de febrero de 2024). "Vehículos blindados y precios de billones de dólares: cómo algunos líderes tecnológicos quieren solucionar la escasez de chips" . The Wall Street Journal . Consultado el 30 de mayo de 2024 .
- ^ Smith, Ryan (22 de marzo de 2022). "Anuncian la arquitectura de GPU Hopper de NVIDIA y el acelerador H100: trabajando de forma más inteligente y eficiente" . AnandTech . Archivado del original el 23 de septiembre de 2023.
- ^ Smith, Ryan (14 de mayo de 2020). "NVIDIA Ampere Unleashed: NVIDIA anuncia una nueva arquitectura de GPU, la GPU A100 y un acelerador" . AnandTech. Archivado del original el 29 de julio de 2024.
- ^ Garreffa, Anthony (17 de septiembre de 2017). "Prueba de la NVIDIA Tesla V100: Potencia de GPU casi increíble" . TweakTown.com . Consultado el 30 de diciembre de 2025 .
- « China bloquea los chips de IA Nvidia H200 que el gobierno estadounidense autorizó para su exportación, según un informe» . The Guardian . 17 de enero de 2026. Consultado el 21 de enero de 2026 .
- ^ "Exclusiva: EE. UU. autoriza la venta de chips H200 a 10 empresas chinas mientras el CEO de Nvidia busca un avance decisivo" . Reuters . 14 de mayo de 2026. Consultado el 14 de mayo de 2026 .
Obras citadas
- Elster, Anne; Haugdahl, Tor (marzo de 2022). "Aspectos destacados de la GPU Hopper de Nvidia y la CPU Grace" . Computing in Science & Engineering . 24 (2): 95– 100. Bibcode : 2022CSE....24b..95E . doi : 10.1109/MCSE.2022.3163817 . hdl : 11250/3051840 . S2CID 249474974. Recuperado el 29 de mayo de 2023 .
- Fujita, Kohei; Yamaguchi, Takuma; Kikuchi, Yuma; Ichimura, Tsuyoshi; Hori, Muneo; Maddegedara, Lalith (abril de 2023). "Cálculo de la función de correlación cruzada acelerada por las operaciones de TensorFloat-32 Tensor Core en las GPU Ampere y Hopper de NVIDIA" . Revista de ciencia computacional . 68 . doi : 10.1016/j.jocs.2023.101986 .
- Guía de programación CUDA C++ (PDF) . Nvidia . 17 de abril de 2023.
- Guía de ajuste de Hopper (PDF) . Nvidia . 13 de abril de 2023.
- Arquitectura de GPU NVIDIA H100 Tensor Core (PDF) . Nvidia . 2022.
Lecturas adicionales
- Choquette, Jack (mayo de 2023). "GPU NVIDIA Hopper H100: escalado del rendimiento" . IEEE Micro . 43 (3): 9–17 . doi : 10.1109/MM.2023.3256796 . S2CID 257544490. Recuperado el 29 de mayo de 2023 .
- Moore, Samuel (8 de abril de 2022). "La próxima GPU de Nvidia demuestra que los Transformers están transformando la IA" . IEEE Spectrum . Recuperado el 29 de mayo de 2023 .
- Morgan, Timothy (31 de marzo de 2022). "Análisis en profundidad de la arquitectura de GPU "Hopper" de Nvidia" . The Next Platform . Recuperado el 29 de mayo de 2023 .
- microarquitecturas de Nvidia
- microarquitecturas gráficas