TensorFloat-32 ( TF32 ) es un formato numérico de punto flotante diseñado para Tensor Core que se ejecuta en ciertas GPU de Nvidia . Se implementó por primera vez en la arquitectura Ampere [ 1 ] . TensorFloat-32 combina el tamaño del exponente de 8 bits de la precisión simple IEEE con el tamaño de la mantisa de 10 bits de la precisión media, para un total de 19 bits por número. Es comparable al formato bfloat16 , que utiliza una mantisa de 7 bits.
Formato
El formato binario es:
- 1 bit de signo
- 8 bits de exponente
- 10 bits de significando (también llamados mantisa o bits de precisión)
![]()
El formato de 19 bits significativos cabe dentro de una palabra doble (32 bits), y aunque carece de precisión en comparación con un número de punto flotante IEEE 754 normal de 32 bits , proporciona un cálculo mucho más rápido, hasta 8 veces en un A100 (en comparación con un V100 que usa FP32 ). [ 2 ]
Almacenado en el mismo espacio que FP32, no es un formato de almacenamiento distinto, sino una especificación para operaciones de multiplicación y acumulación FP32 de precisión reducida . Las entradas FP32 se redondean a TF32, se multiplican para producir un producto de 21 bits (incluido el bit más significativo implícito, esto es una multiplicación de 11×11→22 bits) y se suman en un acumulador FP32 estándar. [ 3 ]
Véase también
Referencias
- ↑ Kharya, Paresh (14 de mayo de 2020). "TensorFloat-32 en la GPU A100 acelera el entrenamiento de IA y HPC hasta 20 veces" . Recuperado el 7 de enero de 2026 .
- ↑ "NVIDIA TF32" . 8 de febrero de 2023. Consultado el 23 de mayo de 2024 .
- ↑ Stosic, Dusan; Micikevicius, Paulius (27 de enero de 2021). "Acelerando el entrenamiento de IA con los núcleos tensoriales NVIDIA TF32" . Recuperado el 10 de diciembre de 2025 .
- aritmética informática
- estándares IEEE
- Tipos de punto flotante
- Aritmética binaria