Los métodos de mapeo de activación de clase son técnicas de IA explicable (XAI) que se utilizan para visualizar las regiones de una imagen de entrada que son más relevantes para una tarea particular, especialmente la clasificación de imágenes , en redes neuronales convolucionales (CNN) . Estos métodos generan mapas de calor ponderando los mapas de características de una capa convolucional según su relevancia para la clase objetivo. [ 1 ]
Las CNN están diseñadas para procesar datos con estructura espacial, como imágenes, aprovechando una serie de operaciones de convolución , activación no lineal y agrupación para extraer características relevantes contenidas en los llamados mapas de características de los datos de entrada. [ 2 ] Las CNN han demostrado ser altamente efectivas en una variedad de tareas de visión artificial y procesamiento de imágenes . [ 1 ] A pesar de sus fortalezas, las CNN (y los modelos de aprendizaje profundo en general) se describen como cajas negras [ 3 ] debido a sus capas internas de representación complejas y no transparentes. La necesidad de interpretar los procesos de toma de decisiones dio origen a las técnicas de IA explicable (XAI). [ 1 ]
Los métodos de mapeo de activación de clase se desarrollaron originalmente para escenarios de discriminación de clases con el fin de visualizar qué partes de la imagen de entrada influyen en la decisión de clasificación, es decir, para resaltar visualmente las regiones de esos mapas de características que contribuyen más a la predicción de una clase determinada. Las versiones más avanzadas de estos métodos no se limitan a tareas de clasificación de imágenes, sino que también se han extendido a varias tareas relacionadas con la visión, como la detección de objetos, [ 4 ] la generación de subtítulos para imágenes, la respuesta visual a preguntas, la segmentación de imágenes [ 1 ] y la interpretación de imágenes médicas. [ 5 ]
Fondo
Los siguientes métodos sentaron las bases para los enfoques de mapas de activación de clases, formando la base conceptual del uso de gradientes para resaltar regiones discriminatorias de clase. [ 6 ]
Visualización de modelos de clase y mapas de prominencia para redes neuronales convolucionales
Los enfoques de visualización del modelo de clase y mapas de prominencia específicos de la imagen se han presentado en el trabajo fundamental "Deep Inside Convolutional Networks: Visualising Image Classification Models and Saliency Maps" de Karen Simonyan, Andrea Vedaldi y Andrew Zisserman [ 7 ] y generaliza el método deconvnet de Zeiler y Fergus. [ 8 ]
- La visualización del modelo de clase sintetiza una imagen de entrada artificial que activa fuertemente las neuronas de salida asociadas con una clase objetivo. Dado un modelo fijo y entrenado, este método comienza con una imagen inicializada a cero, retropropaga los gradientes desde la puntuación de la clase a los píxeles de la imagen, actualiza los píxeles de la imagen aumentando las puntuaciones de clase específicas y repite el proceso de actualización de píxeles, mostrando un prototipo codificado (versión idealizada) de la clase de interés. [ 7 ]
- El método de visualización de prominencia de clase específica de la imagen proporciona una explicación visual al resaltar los píxeles más relevantes en una imagen para predecir una determinada clase C de interés. Esto se hace calculando el gradiente de la puntuación de clase con respecto a la imagen de entrada,aproximando el modelo localmente (alrededor de) como lineal, utilizando una expansión de Taylor de primer orden : . La magnitud deEl gradiente indica la importancia de los píxeles: gradientes mayores sugieren una mayor influencia en la predicción. Una vez conocido el gradiente, el mapa de prominencia se define como el gradiente absoluto máximo a través de los canales de color: lo que da como resultado un mapa de prominencia (es decir, un mapa de calor). [ 7 ] [ 9 ]
Retropropagación guiada
El concepto de retropropagación guiada se puede rastrear por primera vez en el artículo de Springenberg et al. "Striving For Simplicity: The All Convolutional Net" [ 10 ] y también este método se basa en el trabajo de Zeiler y Fergus "Visualizing and Understanding Convolutional Networks" [ 8 ] .

El objetivo principal de la retropropagación guiada es comprender qué está aprendiendo una CNN, visualizando los patrones que activan con mayor intensidad las neuronas individuales (o filtros), en arquitecturas que no dependen de una capa de agrupación máxima .
Al propagar gradientes hacia atrás a través de una unidad lineal rectificada (ReLU) , la retropropagación guiada transmite el gradiente si y solo si la entrada a la ReLU fue positiva (paso hacia adelante) y el gradiente de salida es positivo (señal hacia atrás), abordando tanto las neuronas inactivas como los gradientes negativos y suprimiendo el ruido. El resultado muestra visualizaciones más nítidas y de alta resolución de a qué responde cada neurona. [ 10 ]
La retropropagación guiada representa un método sencillo y práctico para la interpretabilidad de modelos, ayudando a comprender cómo y dónde las redes neuronales detectan conceptos semánticos a través de las capas. Además, debido a su principio de funcionamiento, puede aplicarse a cualquier arquitectura de red. [ 11 ]
Versiones base

El mapeo de activación de clase y el mapeo de activación de clase ponderado por gradiente son los métodos originales y más utilizados para las explicaciones visuales en redes neuronales convolucionales. Estos métodos sirven de base para muchos desarrollos posteriores en IA explicable. [ 12 ]
Notación: En este artículo, los símbolos i y j representan índices enteros que desaparecen dentro de sumas o promedios, mientras que x e y son las coordenadas continuas (o enteras sobremuestreadas) del mapa de calor final que se grafica.
Mapeo de activación de clases (CAM)

El mapeo de activación de clase (CAM) fue la primera y original versión de los métodos CAM, y dio nombre a toda la categoría. El enfoque fue introducido por primera vez por Zhou et al. en su trabajo fundamental "Learning Deep Features for Discriminative Localization". [ 13 ]
Este enfoque permite obtener mapas de calor específicos para cada clase modificando las arquitecturas de las redes neuronales convolucionales (CNN) de clasificación de imágenes, reemplazando las capas totalmente conectadas por capas convolucionales y una capa final de agrupación promedio global.
Su objetivo principal es localizar y resaltar regiones discriminatorias de una imagen de entrada que una CNN utiliza para identificar una clase particular, sin necesidad de anotaciones explícitas de cuadros delimitadores. [ 12 ] [ 13 ] [ 14 ] [ 15 ]
Agrupación promedio global (GAP)
La agrupación promedio global (GAP) representa el elemento clave en el enfoque CAM original. [ 16 ]
Es una técnica de reducción de dimensionalidad y, al igual que otras capas de agrupación, permite el submuestreo de los mapas de características, calculando valores representativos para una región específica del mapa. La particularidad de GAP es que calcula un único valor para todo el mapa de características, reduciendo significativamente las dimensiones del modelo. [ 12 ] [ 13 ] [ 14 ] [ 15 ]
Descripción matemática
La descripción matemática considera como clave la combinación de capas convolucionales y capas GAP.
En CAM, es obligatorio tener la capa GAP después de la última capa convolucional y antes de la capa final del clasificador lineal. Este último elemento de la arquitectura conecta los logits de salida (las predicciones de la red)., a los valores GAP, con sus respectivos pesos ajustados,.
En vista deComo los últimos mapas de características de la última capa convolucional, GAP produce un valor para cada mapa de características, promediando todos los elementos de la matriz (i, j) del mapa de características:
con
Es decir, en la capa GAP, cada mapa de características se reduce a un único escalar mediante GAP, produciendo k valores, reduciendo así la dimensionalidad de la red. Un kmetroEl tensor n se reduce a k escalares, lo que disminuye la cantidad de parámetros para el cabezal del clasificador lineal.
Los logits de salida finales se calculan como la suma lineal de los valores GAP, los pesos y el sesgo:
El mapa de localización se calcula de la siguiente manera:
a saber,es la activación del nodo k en la capa objetivo del modelo, yes el peso específico de la clase, para el canal k, en la capa del clasificador lineal. [ 12 ] [ 13 ] [ 14 ] [ 15 ]
Ventajas e inconvenientes
El uso de la capa GAP representa un ejemplo de un enfoque de interpretabilidad por diseño (IBD, por sus siglas en inglés). IBD se refiere a una técnica que utiliza la propia arquitectura del modelo para ayudar a explicar sus predicciones.
El principal inconveniente de CAM es que es altamente específico del modelo, siendo aplicable a arquitecturas CNN cuya capa anterior a la softmax es una GAP.
Dado que el enfoque se basa en las ponderaciones posteriores a GAP para la evaluación general, el método no se puede aplicar a las capas intermedias.
La elección de utilizar un enfoque IBD restringe la posibilidad de generalizar la arquitectura del modelo. Además, los métodos IBD a menudo requieren un nuevo entrenamiento del modelo. [ 12 ] [ 13 ] [ 14 ] [ 15 ]
Mapeo de activación de clase ponderado por gradiente (Grad-CAM)
El mapeo de activación de clase ponderado por gradiente (Grad-CAM) es una versión generalizada de CAM que aborda sus limitaciones arquitectónicas. [ 17 ] Grad-CAM calcula el gradiente de una puntuación de clase objetivo, el logit pre-softmax, con respecto a los mapas de características de una red neuronal convolucional. Los gradientes se agrupan mediante un promedio global para obtener pesos de importancia, que se utilizan para calcular un mapa de localización específico de la clase ponderando linealmente los mapas de características. El resultado es un mapa de calor que resalta las regiones de la imagen de entrada que son más influyentes para predecir la clase objetivo.
La principal ventaja de Grad-CAM, con respecto al CAM estándar, es que es independiente del modelo (siempre que la red aún deba ser diferenciable ), lo que significa que genera una explicación visual para cualquier red basada en CNN sin cambios arquitectónicos ni reentrenamiento, lo que la hace ampliamente aplicable a modelos preentrenados. [ 12 ] [ 14 ] [ 18 ] [ 19 ]
Descripción matemática
En vista de:
- ylos logits (es decir, las neuronas activadas antes de softmax responsables de una determinada predicción de clase) de interés;
- Ael mapa de características activadas para una capa convolucional específica;
- L∈el mapa de localización discriminatorio de clase, de ancho u y alto v para cualquier clase c;
Grad-CAM, empleando retropropagación, calcula el gradiente logit con respecto al mapa de características A.como
resaltando la importancia de un determinado proceso de decisión de discriminación de clases del logit. Estos gradientes se agrupan mediante un promedio global sobre cada elemento del mapa de características (por lo tanto, resaltando la "importancia" de los elementos de un mapa de características k para una clase objetivo C):
Así pues, para tener en cuenta el número total de mapas de características, cada uno de ellos se multiplica por su peso (mediante el producto escalar) y se realiza la suma elemento a elemento:
Se puede observar que, debido a la naturaleza intrínseca de la operación de gradiente, algunos elementos del mapa de características ponderado tendrán un valor negativo, por lo que, dado que solo interesan los elementos que han aumentado el logit de la clase predicha, se aplica una función de activación ReLU:
Por último, las dimensiones de la imagen del mapa de calor de salida se amplían al tamaño de la imagen original para que coincidan con las dimensiones de entrada. [ 12 ] [ 14 ] [ 18 ] [ 19 ]
Ventajas e inconvenientes
Grad-CAM aborda las limitaciones más importantes de CAM. Libera a CAM de la necesidad de la capa GAP, generalizando su comportamiento y permitiendo la explicación visual en capas intermedias.
Sin embargo, Grad-CAM se centra en la región más discriminatoria al contribuir a la clasificación. Si hay varios objetos similares, Grad-CAM suele resaltar solo uno de ellos, o parte de él, lo que también proporciona mapas menos precisos y una menor exactitud en la localización.
Además, Grad-CAM recupera información retrospectiva (los gradientes), sin tener en cuenta cómo fluyó la activación hacia adelante durante la predicción (a menos que se combine con la técnica de retropropagación guiada), lo que resulta en una cierta probabilidad de omitir patrones resaltados en la señal directa. Por si fuera poco, los mapas de calor de Grad-CAM tienen baja resolución al elegir una capa muy profunda.
Por último, puede haber un énfasis falso en el mapa de calor cuando se calculan gradientes grandes para valores de activación bajos. Grad-CAM asume que el gradiente implica importancia, ignorando el valor de las características de activación. [ 12 ] [ 14 ] [ 18 ] [ 19 ]
Comparación entre Grad-CAM y CAM
Versiones perfeccionadas
Diversos métodos han perfeccionado Grad-CAM para mejorar su claridad y flexibilidad. Guided Grad-CAM, Grad-CAM++, Score-CAM y Layer-CAM optimizan aspectos como la precisión de la localización, la independencia del gradiente y la visualización multicapa. Estas técnicas se basan directamente en los principios de CAM y Grad-CAM.
Grad-CAM guiada
Guided Grad-CAM combina la localización gruesa y discriminativa de clases de Grad-CAM con los detalles de alta resolución de la retropropagación guiada. Primero, se calcula el mapa de calor de Grad-CAM para la clase objetivo y se amplía al tamaño de entrada. Luego, se calcula un mapa de prominencia de retropropagación guiada para la misma clase. El resultado final, obtenido elemento a elemento, es el mapa de visualización de Guided Grad-CAM.
El resultado es un mapa de prominencia de alta resolución y específico para cada clase que resalta exactamente qué píxeles contribuyen más a la decisión de la red. [ 18 ]
Grad-CAM++
Grad-CAM++ introduce una forma más refinada de calcular los pesos para cada mapa de características, evitando el promedio global de los gradientes que ofrece Grad-CAM. Este enfoque busca mejorar el efecto visual cuando hay múltiples instancias objetivo en una sola imagen.
En concreto, Grad-CAM++ emplea gradientes píxel a píxel (mediante gradientes de orden superior) para calcular la importancia de un píxel específico para una predicción, iluminando múltiples instancias de objetos en la misma imagen.
Estas mejoras permiten obtener un mapa de calor de salida más preciso y detallado.
El marco matemático asociado se define mediante el siguiente mapa de localización:
en el que el coeficientese define como:
con, la activación del nodo k en la capa objetivo del modelo en la posición (x,y);la puntuación logit para la clase C yser:
Si bien el método Grad-CAM++ aborda algunos problemas de Grad-CAM, aún se basa en gradientes y solo mejora las matemáticas subyacentes. Sin embargo, sigue partiendo de la idea de asignar una relación directa y válida entre el gradiente y la importancia. [ 14 ] [ 20 ]
Notación: (a,b) indexa todas las posiciones de píxeles en el mapa de características, exactamente como lo hace (i,j), pero para la suma en el denominador.
Puntuación-CAM
Score-CAM es una técnica CAM sin gradientes, que redefine los principios de funcionamiento originales de Grad-CAM y Grad-CAM++. Utiliza las puntuaciones de confianza del modelo en lugar de los gradientes.
Score-CAM realiza las siguientes operaciones:
- Extrae los mapas de característicasde las capas convolucionales finales, como en el Grad-CAM original;
- Aumenta la frecuencia de muestreo de cada mapa de activación.a las mismas dimensiones de la imagen de entrada, definiendo una máscaray cada máscara está normalizada;
- Multiplica la imagen de entrada original por la máscara, definiendo así una imagen enmascarada.(es la multiplicación elemento a elemento );
- Obtiene una puntuación de confianza (una probabilidad softmax es el valor de salida después de la operación softmax; el logit es el valor antes de softmax) para las imágenes enmascaradas., introduciéndolo en la CNN (se puede utilizar tanto la probabilidad softmax como el logit sin procesar; ambos producen resultados similares en la práctica);
- Considera esa puntuación de confianza como el pesopara el mapa de características.
Estas operaciones permiten sustituir los cálculos de gradiente por los resultados reales del modelo, lo que permite crear mapas de calor más precisos.
Matemáticamente, el mapa de localización se define como:
y el coeficientes:
dóndees la activación del canal k en la ubicación (x,y),es el logit para la clase C para una entrada X yes la máscara, definida como:
concomo la operación de sobremuestreo.
Dado que el proceso de cálculo de la puntuación se repite para cada canal, Score-CAM es lento en comparación con los métodos basados en gradientes. Además, se centra en las regiones resaltadas por mapas de características individuales, ignorando el contexto de la imagen completa, lo que reduce la interpretabilidad en escenas complejas. [ 14 ] [ 21 ]
LayerCAM
LayerCAM mejora los gradientes específicos de cada clase mediante capas convolucionales intermedias y finales. La combinación de información entre capas permite obtener una mayor resolución y un nivel de detalle más preciso, lo que mejora la localización.
Específicamente, para cada posición en el mapa de características, LayerCAM evalúa el gradiente. Los gradientes positivos se emplean como pesos,. Es decir:
A continuación, se ponderan las activaciones y se obtiene el mapa de activación de clase final sumando los resultados de todos los canales.
Esta técnica ofrece mapas de calor de alta resolución, localización flexible y precisión por ubicación, empleando gradientes positivos. [ 14 ] [ 22 ]
Referencias
- 1 2 3 4 Somani, Ayush; Horsch, Alexander; Prasad, Dilip K. (2023). Interpretabilidad en el aprendizaje profundo . Springer International Publishing. pp. 1–18 , 125–133 , 297–302 . doi : 10.1007/978-3-031-20639-9 . ISBN 978-3-031-20638-2.
- ↑ LeCun, Yann; Bengio, Yoshua; Hinton, Geoffrey (2015). "Aprendizaje profundo" . Nature . 521 (7553): 436– 444. Bibcode : 2015Natur.521..436L . doi : 10.1038/nature14539 . PMID 26017442 .
- ↑ Iqbal, Saeed; Qureshi, Adnan N.; Alhussein, Musaed; Aurangzeb, Khursheed; Anwar, Muhammad Shahid (2024). "AD-CAM: Mejora de la interpretabilidad de las redes neuronales convolucionales con un marco ligero: de caja negra a caja de cristal". IEEE Journal of Biomedical and Health Informatics . 28 (1): 514– 525. Bibcode : 2024IJBHI..28..514I . doi : 10.1109/jbhi.2023.3329231 . PMID 37910403 .
- ↑ Ishrak, Md Fatin; Nahar, Jannatun; Faiza, Fairooz Afnad; Siddiqua, Lamia Mahzabin (2024). "Mejora de la interpretabilidad de la detección de objetos para visualizaciones discriminativas de clases con Grad-CAM". 27.ª Conferencia Internacional sobre Informática y Tecnología de la Información (ICCIT) de 2024. pp. 1493–1498 . doi : 10.1109/iccit64611.2024.11022089 . ISBN 979-8-3315-1909-4.
- ↑ Dusza, Piotr; Banzato, Tomasso; Burti, Silvia; Bendazzoli, Margarita; Müller, Henning; Wodzinski, Marek (13 de agosto de 2025). "Evaluación comparativa de métodos CAM para mejorar la explicabilidad en radiografía veterinaria" . Informes científicos . 15 (1): 29690. Código bibliográfico : 2025NatSR..1529690D . doi : 10.1038/s41598-025-14060-6 . ISSN 2045-2322 . PMC 12350829 . PMID 40804451 .
- ^ Zhou, Bolei; Khosla, Aditya; Lapedriza, Ágata; Oliva, Aude; Torralba, Antonio (14 de diciembre de 2015). "Aprendizaje de funciones profundas para una localización discriminativa". arXiv : 1512.04150 [ cs.CV ].
- 1 2 3 Simonyan, Karen; Vedaldi, Andrea; Zisserman, Andrew (2014-04-19). "Deep Inside Convolutional Networks: Visualising Image Classification Models and Saliency Maps". arXiv : 1312.6034 [ cs.CV ].
- 1 2 Zeiler, Matthew D.; Fergus, Rob (2014). "Visualización y comprensión de redes neuronales convolucionales" . Visión por computadora – ECCV 2014. Notas de clase en ciencias de la computación. Vol. 8689. págs. 818–833 . doi : 10.1007/978-3-319-10590-1_53 . ISBN 978-3-319-10589-5.
- ↑ Yang, Shengping; Berdine, Gilbert (2023). "Inteligencia artificial (IA) interpretable: mapas de prominencia" . The Southwest Respiratory and Critical Care Chronicles . 11 (48): 31– 37. doi : 10.12746/swrccc.v11i48.1209 .
- 1 2 Springenberg, Jost Tobias; Dosovitskiy, Alexey; Brox, Thomas; Riedmiller, Martin (2014). "En busca de la simplicidad: la red totalmente convolucional". arXiv : 1412.6806 [ cs.LG ].
- ↑ Chen, Xiongren; Li, Jiuyong; Liu, Jixue; Peters, Stefan; Liu, Lin; Le, Thuc Duy; Walsh, Walsh (2023). "Mejora de la interpretabilidad de los cuellos de botella de información para la atribución con propagación de relevancia por capas". 2023 IEEE International Conference on Big Data (BigData) . pp. 1064–1069 . doi : 10.1109/bigdata59044.2023.10386271 . ISBN 979-8-3503-2445-7.
- 1 2 3 4 5 6 7 8 9 Guo, Xianpeng; Hou, Biao; Wu, Zitong; Ren, Bo; Wang, Shuang; Jiao, Licheng (2022). "Prob-POS: Un marco para mejorar las explicaciones visuales de las redes neuronales convolucionales para la clasificación de imágenes de teledetección" . Teledetección . 14 (13): 3042. Bibcode : 2022RemS...14.3042G . doi : 10.3390/rs14133042 .
- 1 2 3 4 5 Zhou, Bolei; Khosla, Aditya; Lapedriza, Agata; Oliva, Aude; Torralba, Antonio (2016). "Aprendizaje de características profundas para la localización discriminativa". Conferencia IEEE de 2016 sobre visión por computadora y reconocimiento de patrones (CVPR) . págs. 2921–2929 . doi : 10.1109/cvpr.2016.319 . hdl : 1721.1/112986 . ISBN 978-1-4673-8851-1.
- 1 2 3 4 5 6 7 8 9 10 Wang, Yue; Liu, Yuyang; Zou, Jiaqi; Huo, Mengyao (2023). Procesamiento de señales e información, redes y computadoras: Actas de la 10.ª Conferencia Internacional sobre Procesamiento de Señales e Información, Redes y Computadoras (ICSINC) . Singapur: Springer Nature Singapore. págs. 399–407 . doi : 10.1007/978-981-19-9968-0 . ISBN 978-981-19996-7-3.
- 1 2 3 4 Jung, Hyungsik; Oh, Youngrock (2021). "Hacia mejores explicaciones del mapeo de activación de clases". 2021 IEEE/CVF International Conference on Computer Vision (ICCV) . pp. 1316–1324 . arXiv : 2102.05228 . doi : 10.1109/iccv48922.2021.00137 . ISBN 978-1-6654-2812-5.
- ↑ Zhou, Bolei; Khosla, Aditya; Lapedriza, Agata; Oliva, Aude; Torralba, Antonio (junio de 2016). "Aprendizaje de características profundas para la localización discriminativa". Conferencia IEEE de 2016 sobre visión por computadora y reconocimiento de patrones (CVPR) . págs. 2921–2929 . doi : 10.1109/CVPR.2016.319 . hdl : 1721.1/112986 . ISBN 978-1-4673-8851-1.
- ↑ Selvaraju, Ramprasaath R.; Cogswell, Michael; Das, Abhishek; Vedantam, Ramakrishna; Parikh, Devi; Batra, Dhruv (octubre de 2017). «Grad-CAM: Explicaciones visuales de redes neuronales profundas mediante localización basada en gradientes». 2017 IEEE International Conference on Computer Vision (ICCV) . págs. 618–626 . doi : 10.1109/ICCV.2017.74 . ISBN 978-1-5386-1032-9.
- 1 2 3 4 Selvaraju, Ramprasaath R.; Cogswell, Michael; Das, Abhishek; Vedantam, Ramakrishna; Parikh, Devi; Batra, Dhruv (2017). "Grad-CAM: Explicaciones visuales de redes neuronales profundas mediante localización basada en gradientes". 2017 IEEE International Conference on Computer Vision (ICCV) . pp. 618–626 . doi : 10.1109/iccv.2017.74 . ISBN 978-1-5386-1032-9.
- 1 2 3 Zhang, Yubo; Zhu, Yong; Liu, Junli; Yu, Wei; Jiang, Chuang (2025). "Un método de optimización de interpretabilidad para redes de aprendizaje profundo basado en Grad-CAM". IEEE Internet of Things Journal . 12 (4): 3961– 3970. Bibcode : 2025IITJ...12.3961Z . doi : 10.1109/jiot.2024.3485765 .
- ↑ Chattopadhyay, Aditya; Sarkar, Anirban; Howlader, Prantik; Balasubramanian, Vineeth N. (2018). "Grad-CAM++: Explicaciones visuales generalizadas basadas en gradientes para redes neuronales convolucionales profundas". 2018 IEEE Winter Conference on Applications of Computer Vision (WACV) . pp. 839–847 . arXiv : 1710.11063 . doi : 10.1109/wacv.2018.00097 . ISBN 978-1-5386-4886-5.
- ↑ Wang, Haofan; Wang, Zifan; Du, Mengnan; Yang, Fan; Zhang, Zijian; Ding, Sirui; Mardziel, Piotr; Hu, Xia (2020). "Score-CAM: Explicaciones visuales ponderadas por puntuación para redes neuronales convolucionales". 2020 IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW) . pp. 111–119 . doi : 10.1109/cvprw50498.2020.00020 . ISBN 978-1-7281-9360-1.
- ↑ Jiang, Peng-Tao; Zhang, Chang-Bin; Hou, Qibin; Cheng, Ming-Ming; Wei, Yunchao (2021). "LayerCAM: Explorando mapas de activación de clases jerárquicas para localización". IEEE Transactions on Image Processing . 30 : 5875–5888 . Bibcode : 2021ITIP...30.5875J . doi : 10.1109/tip.2021.3089943 . PMID 34156941 .
Enlaces externos
- "La Conferencia Mundial sobre Inteligencia Artificial Explicable" .
- "Conferencia de la ACM sobre equidad, rendición de cuentas y transparencia (FAccT)" .
- "Mapas de prominencia específicos de imágenes de PyTorch" . GitHub .
- "Retropropagación guiada con PyTorch y TensorFlow" . 21 de diciembre de 2021.
- "Implementación en PyTorch de "Aprendizaje de características profundas para localización discriminativa"" . GitHub .
- "Explicabilidad avanzada de IA para PyTorch" . GitHub .
- visión por computadora
- Procesamiento de imágenes
- Arquitecturas de redes neuronales
- Inteligencia artificial