Articulo de referencia

mapeo de activación de clase

Los métodos de mapeo de activación de clase son técnicas de IA explicable (XAI) que se utilizan para visualizar las regiones de una imagen de entrada que son más relevantes para...

Los métodos de mapeo de activación de clase son técnicas de IA explicable (XAI) que se utilizan para visualizar las regiones de una imagen de entrada que son más relevantes para una tarea particular, especialmente la clasificación de imágenes , en redes neuronales convolucionales (CNN) . Estos métodos generan mapas de calor ponderando los mapas de características de una capa convolucional según su relevancia para la clase objetivo. [ 1 ]

Las CNN están diseñadas para procesar datos con estructura espacial, como imágenes, aprovechando una serie de operaciones de convolución , activación no lineal y agrupación para extraer características relevantes contenidas en los llamados mapas de características de los datos de entrada. [ 2 ] Las CNN han demostrado ser altamente efectivas en una variedad de tareas de visión artificial y procesamiento de imágenes . [ 1 ] A pesar de sus fortalezas, las CNN (y los modelos de aprendizaje profundo en general) se describen como cajas negras [ 3 ] debido a sus capas internas de representación complejas y no transparentes. La necesidad de interpretar los procesos de toma de decisiones dio origen a las técnicas de IA explicable (XAI). [ 1 ]

Los métodos de mapeo de activación de clase se desarrollaron originalmente para escenarios de discriminación de clases con el fin de visualizar qué partes de la imagen de entrada influyen en la decisión de clasificación, es decir, para resaltar visualmente las regiones de esos mapas de características que contribuyen más a la predicción de una clase determinada. Las versiones más avanzadas de estos métodos no se limitan a tareas de clasificación de imágenes, sino que también se han extendido a varias tareas relacionadas con la visión, como la detección de objetos, [ 4 ] la generación de subtítulos para imágenes, la respuesta visual a preguntas, la segmentación de imágenes [ 1 ] y la interpretación de imágenes médicas. [ 5 ]

Fondo

Los siguientes métodos sentaron las bases para los enfoques de mapas de activación de clases, formando la base conceptual del uso de gradientes para resaltar regiones discriminatorias de clase. [ 6 ]

Visualización de modelos de clase y mapas de prominencia para redes neuronales convolucionales

Los enfoques de visualización del modelo de clase y mapas de prominencia específicos de la imagen se han presentado en el trabajo fundamental "Deep Inside Convolutional Networks: Visualising Image Classification Models and Saliency Maps" de Karen Simonyan, Andrea Vedaldi y Andrew Zisserman [ 7 ] y generaliza el método deconvnet de Zeiler y Fergus. [ 8 ]

  • La visualización del modelo de clase sintetiza una imagen de entrada artificial que activa fuertemente las neuronas de salida asociadas con una clase objetivo. Dado un modelo fijo y entrenado, este método comienza con una imagen inicializada a cero, retropropaga los gradientes desde la puntuación de la clase a los píxeles de la imagen, actualiza los píxeles de la imagen aumentando las puntuaciones de clase específicas y repite el proceso de actualización de píxeles, mostrando un prototipo codificado (versión idealizada) de la clase de interés. [ 7 ]
  • El método de visualización de prominencia de clase específica de la imagen proporciona una explicación visual al resaltar los píxeles más relevantes en una imagen para predecir una determinada clase C de interés. Esto se hace calculando el gradiente de la puntuación de clase con respecto a la imagen de entrada,I0,{\displaystyle I_{0},}w=SdoI|I0{\displaystyle w=\left.{\frac {\partial S_{C}}{\partial I}}\right|_{I_{0}}}aproximando el modelo localmente (alrededor deI0{\displaystyle I_{0}}) como lineal, utilizando una expansión de Taylor de primer orden : Sdo(I)wdoTI+b{\displaystyle S_{C}(I)\approx w_{C}^{T}I+b}. La magnitud dewdo{\displaystyle w_{C}}El gradiente indica la importancia de los píxeles: gradientes mayores sugieren una mayor influencia en la predicción. Una vez conocido el gradiente, el mapa de prominencia se define como el gradiente absoluto máximo a través de los canales de color: METROij=metroaincógnitado|SdoIijdo|{\displaystyle M_{ij}=max_{C}\left|{\frac {\partial S_{C}}{\partial I_{ij}^{C}}}\right|} lo que da como resultado un mapa de prominencia (es decir, un mapa de calor). [ 7 ] [ 9 ]

Retropropagación guiada

El concepto de retropropagación guiada se puede rastrear por primera vez en el artículo de Springenberg et al. "Striving For Simplicity: The All Convolutional Net" [ 10 ] y también este método se basa en el trabajo de Zeiler y Fergus "Visualizing and Understanding Convolutional Networks" [ 8 ] .

Visualización mediante retropropagación guiada en una imagen de Leonardo DiCaprio.

El objetivo principal de la retropropagación guiada es comprender qué está aprendiendo una CNN, visualizando los patrones que activan con mayor intensidad las neuronas individuales (o filtros), en arquitecturas que no dependen de una capa de agrupación máxima .

Al propagar gradientes hacia atrás a través de una unidad lineal rectificada (ReLU) , la retropropagación guiada transmite el gradiente si y solo si la entrada a la ReLU fue positiva (paso hacia adelante) y el gradiente de salida es positivo (señal hacia atrás), abordando tanto las neuronas inactivas como los gradientes negativos y suprimiendo el ruido. El resultado muestra visualizaciones más nítidas y de alta resolución de a qué responde cada neurona. [ 10 ]

La retropropagación guiada representa un método sencillo y práctico para la interpretabilidad de modelos, ayudando a comprender cómo y dónde las redes neuronales detectan conceptos semánticos a través de las capas. Además, debido a su principio de funcionamiento, puede aplicarse a cualquier arquitectura de red. [ 11 ]

Versiones base

Principales diferencias en la arquitectura de red entre las técnicas CAM y Grad-CAM, con un ejemplo visual.

El mapeo de activación de clase y el mapeo de activación de clase ponderado por gradiente son los métodos originales y más utilizados para las explicaciones visuales en redes neuronales convolucionales. Estos métodos sirven de base para muchos desarrollos posteriores en IA explicable. [ 12 ]

Notación: En este artículo, los símbolos i y j representan índices enteros que desaparecen dentro de sumas o promedios, mientras que x e y son las coordenadas continuas (o enteras sobremuestreadas) del mapa de calor final que se grafica.

Mapeo de activación de clases (CAM)

Localización visual CAM del traje de Leonardo DiCaprio. Utilizando una arquitectura ResNet-50 modificada, el modelo de localización basado en CAM se encargó de identificar el traje de Leonardo DiCaprio, asignándole a esa clase una puntuación de confianza del 59,53 %.

El mapeo de activación de clase (CAM) fue la primera y original versión de los métodos CAM, y dio nombre a toda la categoría. El enfoque fue introducido por primera vez por Zhou et al. en su trabajo fundamental "Learning Deep Features for Discriminative Localization". [ 13 ]

Este enfoque permite obtener mapas de calor específicos para cada clase modificando las arquitecturas de las redes neuronales convolucionales (CNN) de clasificación de imágenes, reemplazando las capas totalmente conectadas por capas convolucionales y una capa final de agrupación promedio global.

Su objetivo principal es localizar y resaltar regiones discriminatorias de una imagen de entrada que una CNN utiliza para identificar una clase particular, sin necesidad de anotaciones explícitas de cuadros delimitadores. [ 12 ] [ 13 ] [ 14 ] [ 15 ]

Agrupación promedio global (GAP)

La agrupación promedio global (GAP) representa el elemento clave en el enfoque CAM original. [ 16 ]

Es una técnica de reducción de dimensionalidad y, al igual que otras capas de agrupación, permite el submuestreo de los mapas de características, calculando valores representativos para una región específica del mapa. La particularidad de GAP es que calcula un único valor para todo el mapa de características, reduciendo significativamente las dimensiones del modelo. [ 12 ] [ 13 ] [ 14 ] [ 15 ]

Descripción matemática

La descripción matemática considera como clave la combinación de capas convolucionales y capas GAP.

En CAM, es obligatorio tener la capa GAP después de la última capa convolucional y antes de la capa final del clasificador lineal. Este último elemento de la arquitectura conecta los logits de salida (las predicciones de la red).ydo{\displaystyle y^{C}}, a los valores GAP, con sus respectivos pesos ajustados,wkdo{\displaystyle w_{k}^{C}}.

En vista deAk{\displaystyle A^{k}}Como los últimos mapas de características de la última capa convolucional, GAP produce un valor para cada mapa de características, promediando todos los elementos de la matriz (i, j) del mapa de características:

Fk=1metronortei=1metroj=1norteAijk{\displaystyle F^{k}={\frac {1}{mn}}\sum _{i=1}^{m}\sum _{j=1}^{n}A_{ij}^{k}}

con Ak=[A11kA12kA1nortekA21kA22kA2nortekAmetro1kAmetro2kAmetronortek]={Aijk1imetro, 1jnorte}{\displaystyle A^{k}={\begin{bmatrix}A_{11}^{k}&A_{12}^{k}&\cdots &A_{1n}^{k}\\A_{21}^{k}&A_{22}^{k}&\cdots &A_{2n}^{k}\\\vdots &\vdots &\ddots &\vdots \\A_{m1}^{k}&A_{m2}^{k}&\cdots &A_{mn}^{k}\end{bmatrix}}=\left\{A_{ij}^{k}\mid 1\leq i\leq m,\ 1\leq j\leq n\right\}}

Es decir, en la capa GAP, cada mapa de características se reduce a un único escalar mediante GAP, produciendo k valores, reduciendo así la dimensionalidad de la red. Un k×{\displaystyle \times }metro×{\displaystyle \times }El tensor n se reduce a k escalares, lo que disminuye la cantidad de parámetros para el cabezal del clasificador lineal.

Los logits de salida finales se calculan como la suma lineal de los valores GAP, los pesos y el sesgo:

ydo=kwkdoFk{\displaystyle y^{C}=\sum _{k}w_{k}^{C}F^{k}}

El mapa de localización se calcula de la siguiente manera:

LdoAMETROdo(incógnita,y)=RmiLU(kwkdoAk(incógnita,y)){\displaystyle L_{CAM}^{C}(x,y)=ReLU(\sum _ {k}w_{k}^{C}A_{k}(x,y))}

a saber,Ak(incógnita,y){\displaystyle A_{k}(x,y)}es la activación del nodo k en la capa objetivo del modelo, ywkdo{\displaystyle w_{k}^{C}}es el peso específico de la clase, para el canal k, en la capa del clasificador lineal. [ 12 ] [ 13 ] [ 14 ] [ 15 ]

Ventajas e inconvenientes

El uso de la capa GAP representa un ejemplo de un enfoque de interpretabilidad por diseño (IBD, por sus siglas en inglés). IBD se refiere a una técnica que utiliza la propia arquitectura del modelo para ayudar a explicar sus predicciones.

El principal inconveniente de CAM es que es altamente específico del modelo, siendo aplicable a arquitecturas CNN cuya capa anterior a la softmax es una GAP.

Dado que el enfoque se basa en las ponderaciones posteriores a GAP para la evaluación general, el método no se puede aplicar a las capas intermedias.

La elección de utilizar un enfoque IBD restringe la posibilidad de generalizar la arquitectura del modelo. Además, los métodos IBD a menudo requieren un nuevo entrenamiento del modelo. [ 12 ] [ 13 ] [ 14 ] [ 15 ]

Mapeo de activación de clase ponderado por gradiente (Grad-CAM)

El mapeo de activación de clase ponderado por gradiente (Grad-CAM) es una versión generalizada de CAM que aborda sus limitaciones arquitectónicas. [ 17 ] Grad-CAM calcula el gradiente de una puntuación de clase objetivo, el logit pre-softmax, con respecto a los mapas de características de una red neuronal convolucional. Los gradientes se agrupan mediante un promedio global para obtener pesos de importancia, que se utilizan para calcular un mapa de localización específico de la clase ponderando linealmente los mapas de características. El resultado es un mapa de calor que resalta las regiones de la imagen de entrada que son más influyentes para predecir la clase objetivo.

La principal ventaja de Grad-CAM, con respecto al CAM estándar, es que es independiente del modelo (siempre que la red aún deba ser diferenciable ), lo que significa que genera una explicación visual para cualquier red basada en CNN sin cambios arquitectónicos ni reentrenamiento, lo que la hace ampliamente aplicable a modelos preentrenados. [ 12 ] [ 14 ] [ 18 ] [ 19 ]

Descripción matemática

En vista de:

  • ydo{\displaystyle ^{C}}los logits (es decir, las neuronas activadas antes de softmax responsables de una determinada predicción de clase) de interés;
  • Ak{\displaystyle ^{k}}el mapa de características activadas para una capa convolucional específica;
  • LGrad-CAMdo{\displaystyle _{\text{Grad-CAM}}^{C}}R×v{\displaystyle \mathbb {R} ^{u\times v}}el mapa de localización discriminatorio de clase, de ancho u y alto v para cualquier clase c;

Grad-CAM, empleando retropropagación, calcula el gradiente logit con respecto al mapa de características A.k{\displaystyle ^{k}}como

ydoAk(i,j){\displaystyle {\frac {\partial {y^{C}}}{\partial {A^{k}}(i,j)}}}

resaltando la importancia de un determinado proceso de decisión de discriminación de clases del logit. Estos gradientes se agrupan mediante un promedio global sobre cada elemento del mapa de características (por lo tanto, resaltando la "importancia" de los elementos de un mapa de características k para una clase objetivo C):

αkdo=1vijydoAk(i,j){\displaystyle \alpha _{k}^{C}={\frac {1}{uv}}\sum _{i}\sum _{j}{\frac {\partial {y^{C}}}{\partial {A^{k}}(i,j)}}}

Así pues, para tener en cuenta el número total de mapas de características, cada uno de ellos se multiplica por su peso (mediante el producto escalar) y se realiza la suma elemento a elemento:

kαkdoAk{\displaystyle \sum _{k}\alpha _{k}^{C}A^{k}}

Se puede observar que, debido a la naturaleza intrínseca de la operación de gradiente, algunos elementos del mapa de características ponderado tendrán un valor negativo, por lo que, dado que solo interesan los elementos que han aumentado el logit de la clase predicha, se aplica una función de activación ReLU:

LGRAMOraddoAMETROdo(incógnita,y)=RmiLU(kαkdoAk(incógnita,y)){\displaystyle L_{Grad-CAM}^{C}(x,y)=ReLU(\sum _ {k}\alpha _ {k}^{C}A^{k}(x,y))}

Por último, las dimensiones de la imagen del mapa de calor de salida se amplían al tamaño de la imagen original para que coincidan con las dimensiones de entrada. [ 12 ] [ 14 ] [ 18 ] [ 19 ]

Ventajas e inconvenientes

Grad-CAM aborda las limitaciones más importantes de CAM. Libera a CAM de la necesidad de la capa GAP, generalizando su comportamiento y permitiendo la explicación visual en capas intermedias.

Sin embargo, Grad-CAM se centra en la región más discriminatoria al contribuir a la clasificación. Si hay varios objetos similares, Grad-CAM suele resaltar solo uno de ellos, o parte de él, lo que también proporciona mapas menos precisos y una menor exactitud en la localización.

Además, Grad-CAM recupera información retrospectiva (los gradientes), sin tener en cuenta cómo fluyó la activación hacia adelante durante la predicción (a menos que se combine con la técnica de retropropagación guiada), lo que resulta en una cierta probabilidad de omitir patrones resaltados en la señal directa. Por si fuera poco, los mapas de calor de Grad-CAM tienen baja resolución al elegir una capa muy profunda.

Por último, puede haber un énfasis falso en el mapa de calor cuando se calculan gradientes grandes para valores de activación bajos. Grad-CAM asume que el gradiente implica importancia, ignorando el valor de las características de activación. [ 12 ] [ 14 ] [ 18 ] [ 19 ]

Comparación entre Grad-CAM y CAM

Versiones perfeccionadas

Diversos métodos han perfeccionado Grad-CAM para mejorar su claridad y flexibilidad. Guided Grad-CAM, Grad-CAM++, Score-CAM y Layer-CAM optimizan aspectos como la precisión de la localización, la independencia del gradiente y la visualización multicapa. Estas técnicas se basan directamente en los principios de CAM y Grad-CAM.

Grad-CAM guiada

Guided Grad-CAM combina la localización gruesa y discriminativa de clases de Grad-CAM con los detalles de alta resolución de la retropropagación guiada. Primero, se calcula el mapa de calor de Grad-CAM para la clase objetivo y se amplía al tamaño de entrada. Luego, se calcula un mapa de prominencia de retropropagación guiada para la misma clase. El resultado final, obtenido elemento a elemento, es el mapa de visualización de Guided Grad-CAM.

El resultado es un mapa de prominencia de alta resolución y específico para cada clase que resalta exactamente qué píxeles contribuyen más a la decisión de la red. [ 18 ]

Grad-CAM++

Grad-CAM++ introduce una forma más refinada de calcular los pesos para cada mapa de características, evitando el promedio global de los gradientes que ofrece Grad-CAM. Este enfoque busca mejorar el efecto visual cuando hay múltiples instancias objetivo en una sola imagen.

En concreto, Grad-CAM++ emplea gradientes píxel a píxel (mediante gradientes de orden superior) para calcular la importancia de un píxel específico para una predicción, iluminando múltiples instancias de objetos en la misma imagen.

Estas mejoras permiten obtener un mapa de calor de salida más preciso y detallado.

El marco matemático asociado se define mediante el siguiente mapa de localización:

LGRAMOraddoAMETRO++do(incógnita,y)=kwkdoAk(incógnita,y){\displaystyle L_{Grad-CAM++}^{C}(x,y)=\sum _{k}w_{k}^{C}A_{k}(x,y)}

en el que el coeficientewkdo{\displaystyle w_{k}^{C}}se define como:

wkdo=i,jαkdo(i,j)×RmiLU(ydoAk(i,j)){\displaystyle w_{k}^{C}=\sum _{i,j}\alpha _{k}^{C}(i,j)\times ReLU({\frac {\partial y^{C}}{\partial A_{k}(i,j)}})}

conAk(incógnita,y){\displaystyle A^{k}(x,y)}, la activación del nodo k en la capa objetivo del modelo en la posición (x,y);ydo{\displaystyle y^{C}}la puntuación logit para la clase C yαkdo(i,j){\displaystyle \alpha _{k}^{C}(i,j)}ser:

αkdo(i,j)=2ydo(Ak(i,j))22×2ydo(Ak(i,j))2+a,bAk(a,b)×3ydo(Ak(i,j))3{\displaystyle \alpha _{k}^{C}(i,j)={\frac {\frac {\partial ^{2}y^{C}}{\partial (A_{k}(i,j))^{2}}}{2\times {\frac {\partial ^{2}y^{C}}{\partial (A_{k}(i,j))^{2}}}+\sum _{a,b}A_{k}(a,b)\times {\frac {\partial ^{3}y^{C}}{\partial (A_{k}(i,j))^{3}}}}}}

Si bien el método Grad-CAM++ aborda algunos problemas de Grad-CAM, aún se basa en gradientes y solo mejora las matemáticas subyacentes. Sin embargo, sigue partiendo de la idea de asignar una relación directa y válida entre el gradiente y la importancia. [ 14 ] [ 20 ]

Notación: (a,b) indexa todas las posiciones de píxeles en el mapa de características, exactamente como lo hace (i,j), pero para la suma en el denominador.

Puntuación-CAM

Score-CAM es una técnica CAM sin gradientes, que redefine los principios de funcionamiento originales de Grad-CAM y Grad-CAM++. Utiliza las puntuaciones de confianza del modelo en lugar de los gradientes.

Score-CAM realiza las siguientes operaciones:

  1. Extrae los mapas de característicasAk{\displaystyle A_{k}}de las capas convolucionales finales, como en el Grad-CAM original;
  2. Aumenta la frecuencia de muestreo de cada mapa de activación.Ak{\displaystyle A_{k}}a las mismas dimensiones de la imagen de entrada, definiendo una máscaraMETROk{\displaystyle M_{k}}y cada máscara está normalizada;
  3. Multiplica la imagen de entrada original por la máscara, definiendo así una imagen enmascarada.incógnitak=METROkincógnita{\displaystyle X'_{k}=M_{k}\odot X}({\displaystyle \odot }es la multiplicación elemento a elemento );
  4. Obtiene una puntuación de confianza (una probabilidad softmax es el valor de salida después de la operación softmax; el logit es el valor antes de softmax) para las imágenes enmascaradas.incógnitak{\displaystyle X'_{k}}, introduciéndolo en la CNN (se puede utilizar tanto la probabilidad softmax como el logit sin procesar; ambos producen resultados similares en la práctica);
  5. Considera esa puntuación de confianza como el pesowkdo{\displaystyle w_{k}^{c}}para el mapa de característicasAk{\displaystyle A_{k}}.

Estas operaciones permiten sustituir los cálculos de gradiente por los resultados reales del modelo, lo que permite crear mapas de calor más precisos.

Matemáticamente, el mapa de localización se define como:

LSdoormidoAMETROdo(incógnita,y)=RmiLU(kwkdoAk(incógnita,y)){\displaystyle L_{Score-CAM}^{C}(x,y)=ReLU(\sum _{k}w_{k}^{c}A_{k}(x,y))}

y el coeficientewkdo{\displaystyle w_{k}^{C}}s:

wkdo=soFtmetroaincógnitak(ydo(incógnitak))=miincógnitapag(ydo(incógnitak))metromiincógnitapag(ydo(incógnitametro)){\displaystyle w_{k}^{C}=softmax_{k}(y^{C}(X'_{k}))={\frac {exp(y^{C}(X'_{k}))}{\sum _{m}exp(y^{C}(X'_{m}))}}}

dóndeAk(incógnita,y){\displaystyle A_{k}(x,y)}es la activación del canal k en la ubicación (x,y),ydo(incógnita){\displaystyle y^{C}(X)}es el logit para la clase C para una entrada X yMETROk{\displaystyle M_{k}}es la máscara, definida como:

METROk(incógnita,y)=U(Ak)(incógnita,y)metroinorteincógnita,yU(Ametro)metroaincógnitaincógnita,yU(Ak)metroinorteincógnita,yU(Ak){\displaystyle M_{k}(x,y)={\frac {U(A_{k})(x,y)-min_{x,y}U(A_{m})}{max_{x,y}U(A_{k})-min_{x,y}U(A_{k})}}}

conU{\displaystyle U}como la operación de sobremuestreo.

Dado que el proceso de cálculo de la puntuación se repite para cada canal, Score-CAM es lento en comparación con los métodos basados ​​en gradientes. Además, se centra en las regiones resaltadas por mapas de características individuales, ignorando el contexto de la imagen completa, lo que reduce la interpretabilidad en escenas complejas. [ 14 ] [ 21 ]

LayerCAM

LayerCAM mejora los gradientes específicos de cada clase mediante capas convolucionales intermedias y finales. La combinación de información entre capas permite obtener una mayor resolución y un nivel de detalle más preciso, lo que mejora la localización.

Específicamente, para cada posición en el mapa de características, LayerCAM evalúa el gradiente. Los gradientes positivos se emplean como pesos,wkdo{\displaystyle w_{k}^{C}}. Es decir:

wkdo(incógnita,y)=RmiLU(ydoAk(i,j)(incógnita,y)){\displaystyle w_{k}^{C}(x,y)=ReLU({\frac {\partial y^{C}}{\partial A_{k}(i,j)}}(x,y))}

A continuación, se ponderan las activaciones y se obtiene el mapa de activación de clase final sumando los resultados de todos los canales.

LLaymirdoAMETROdo(incógnita,y)=RmiLU(kwkdo(incógnita,y)Ak(incógnita,y)){\displaystyle L_{Layer-CAM}^{C}(x,y)=ReLU(\sum _{k}w_{k}^{C}(x,y)A_{k}(x,y))}

Esta técnica ofrece mapas de calor de alta resolución, localización flexible y precisión por ubicación, empleando gradientes positivos. [ 14 ] [ 22 ]

Referencias

  1. 1 2 3 4 Somani, Ayush; Horsch, Alexander; Prasad, Dilip K. (2023). Interpretabilidad en el aprendizaje profundo . Springer International Publishing. pp. 1–18 , 125–133 , 297–302 . doi : 10.1007/978-3-031-20639-9 . ISBN  978-3-031-20638-2.
  2. LeCun, Yann; Bengio, Yoshua; Hinton, Geoffrey (2015). "Aprendizaje profundo" . Nature . 521 (7553): 436– 444. Bibcode : 2015Natur.521..436L . doi : 10.1038/nature14539 . PMID 26017442 . 
  3. Iqbal, Saeed; Qureshi, Adnan N.; Alhussein, Musaed; Aurangzeb, Khursheed; Anwar, Muhammad Shahid (2024). "AD-CAM: Mejora de la interpretabilidad de las redes neuronales convolucionales con un marco ligero: de caja negra a caja de cristal". IEEE Journal of Biomedical and Health Informatics . 28 (1): 514– 525. Bibcode : 2024IJBHI..28..514I . doi : 10.1109/jbhi.2023.3329231 . PMID 37910403 . 
  4. Ishrak, Md Fatin; Nahar, Jannatun; Faiza, Fairooz Afnad; Siddiqua, Lamia Mahzabin (2024). "Mejora de la interpretabilidad de la detección de objetos para visualizaciones discriminativas de clases con Grad-CAM". 27.ª Conferencia Internacional sobre Informática y Tecnología de la Información (ICCIT) de 2024. pp. 1493–1498 . doi : 10.1109/iccit64611.2024.11022089 . ISBN  979-8-3315-1909-4.
  5. Dusza, Piotr; Banzato, Tomasso; Burti, Silvia; Bendazzoli, Margarita; Müller, Henning; Wodzinski, Marek (13 de agosto de 2025). "Evaluación comparativa de métodos CAM para mejorar la explicabilidad en radiografía veterinaria" . Informes científicos . 15 (1): 29690. Código bibliográfico : 2025NatSR..1529690D . doi : 10.1038/s41598-025-14060-6 . ISSN 2045-2322 . PMC 12350829 . PMID 40804451 .   
  6. ^ Zhou, Bolei; Khosla, Aditya; Lapedriza, Ágata; Oliva, Aude; Torralba, Antonio (14 de diciembre de 2015). "Aprendizaje de funciones profundas para una localización discriminativa". arXiv : 1512.04150 [ cs.CV ].
  7. 1 2 3 Simonyan, Karen; Vedaldi, Andrea; Zisserman, Andrew (2014-04-19). "Deep Inside Convolutional Networks: Visualising Image Classification Models and Saliency Maps". arXiv : 1312.6034 [ cs.CV ].
  8. 1 2 Zeiler, Matthew D.; Fergus, Rob (2014). "Visualización y comprensión de redes neuronales convolucionales" . Visión por computadora – ECCV 2014. Notas de clase en ciencias de la computación. Vol. 8689. págs. 818–833 . doi : 10.1007/978-3-319-10590-1_53 . ISBN   978-3-319-10589-5.
  9. Yang, Shengping; Berdine, Gilbert (2023). "Inteligencia artificial (IA) interpretable: mapas de prominencia" . The Southwest Respiratory and Critical Care Chronicles . 11 (48): 31– 37. doi : 10.12746/swrccc.v11i48.1209 .
  10. 1 2 Springenberg, Jost Tobias; Dosovitskiy, Alexey; Brox, Thomas; Riedmiller, Martin (2014). "En busca de la simplicidad: la red totalmente convolucional". arXiv : 1412.6806 [ cs.LG ].
  11. Chen, Xiongren; Li, Jiuyong; Liu, Jixue; Peters, Stefan; Liu, Lin; Le, Thuc Duy; Walsh, Walsh (2023). "Mejora de la interpretabilidad de los cuellos de botella de información para la atribución con propagación de relevancia por capas". 2023 IEEE International Conference on Big Data (BigData) . pp. 1064–1069 . doi : 10.1109/bigdata59044.2023.10386271 . ISBN  979-8-3503-2445-7.
  12. 1 2 3 4 5 6 7 8 9 Guo, Xianpeng; Hou, Biao; Wu, Zitong; Ren, Bo; Wang, Shuang; Jiao, Licheng (2022). "Prob-POS: Un marco para mejorar las explicaciones visuales de las redes neuronales convolucionales para la clasificación de imágenes de teledetección" . Teledetección . 14 (13): 3042. Bibcode : 2022RemS...14.3042G . doi : 10.3390/rs14133042 .
  13. 1 2 3 4 5 Zhou, Bolei; Khosla, Aditya; Lapedriza, Agata; Oliva, Aude; Torralba, Antonio (2016). "Aprendizaje de características profundas para la localización discriminativa". Conferencia IEEE de 2016 sobre visión por computadora y reconocimiento de patrones (CVPR) . págs. 2921–2929 . doi : 10.1109/cvpr.2016.319 . hdl : 1721.1/112986 . ISBN  978-1-4673-8851-1.
  14. 1 2 3 4 5 6 7 8 9 10 Wang, Yue; Liu, Yuyang; Zou, Jiaqi; Huo, Mengyao (2023). Procesamiento de señales e información, redes y computadoras: Actas de la 10.ª Conferencia Internacional sobre Procesamiento de Señales e Información, Redes y Computadoras (ICSINC) . Singapur: Springer Nature Singapore. págs. 399–407 . doi : 10.1007/978-981-19-9968-0 . ISBN  978-981-19996-7-3.
  15. 1 2 3 4 Jung, Hyungsik; Oh, Youngrock (2021). "Hacia mejores explicaciones del mapeo de activación de clases". 2021 IEEE/CVF International Conference on Computer Vision (ICCV) . pp. 1316–1324 . arXiv : 2102.05228 . doi : 10.1109/iccv48922.2021.00137 . ISBN  978-1-6654-2812-5.
  16. Zhou, Bolei; Khosla, Aditya; Lapedriza, Agata; Oliva, Aude; Torralba, Antonio (junio de 2016). "Aprendizaje de características profundas para la localización discriminativa". Conferencia IEEE de 2016 sobre visión por computadora y reconocimiento de patrones (CVPR) . págs. 2921–2929 . doi : 10.1109/CVPR.2016.319 . hdl : 1721.1/112986 . ISBN  978-1-4673-8851-1.
  17. Selvaraju, Ramprasaath R.; Cogswell, Michael; Das, Abhishek; Vedantam, Ramakrishna; Parikh, Devi; Batra, Dhruv (octubre de 2017). «Grad-CAM: Explicaciones visuales de redes neuronales profundas mediante localización basada en gradientes». 2017 IEEE International Conference on Computer Vision (ICCV) . págs. 618–626 . doi : 10.1109/ICCV.2017.74 . ISBN  978-1-5386-1032-9.
  18. 1 2 3 4 Selvaraju, Ramprasaath R.; Cogswell, Michael; Das, Abhishek; Vedantam, Ramakrishna; Parikh, Devi; Batra, Dhruv (2017). "Grad-CAM: Explicaciones visuales de redes neuronales profundas mediante localización basada en gradientes". 2017 IEEE International Conference on Computer Vision (ICCV) . pp. 618–626 . doi : 10.1109/iccv.2017.74 . ISBN  978-1-5386-1032-9.
  19. 1 2 3 Zhang, Yubo; Zhu, Yong; Liu, Junli; Yu, Wei; Jiang, Chuang (2025). "Un método de optimización de interpretabilidad para redes de aprendizaje profundo basado en Grad-CAM". IEEE Internet of Things Journal . 12 (4): 3961– 3970. Bibcode : 2025IITJ...12.3961Z . doi : 10.1109/jiot.2024.3485765 .
  20. Chattopadhyay, Aditya; Sarkar, Anirban; Howlader, Prantik; Balasubramanian, Vineeth N. (2018). "Grad-CAM++: Explicaciones visuales generalizadas basadas en gradientes para redes neuronales convolucionales profundas". 2018 IEEE Winter Conference on Applications of Computer Vision (WACV) . pp. 839–847 . arXiv : 1710.11063 . doi : 10.1109/wacv.2018.00097 . ISBN  978-1-5386-4886-5.
  21. Wang, Haofan; Wang, Zifan; Du, Mengnan; Yang, Fan; Zhang, Zijian; Ding, Sirui; Mardziel, Piotr; Hu, Xia (2020). "Score-CAM: Explicaciones visuales ponderadas por puntuación para redes neuronales convolucionales". 2020 IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW) . pp. 111–119 . doi : 10.1109/cvprw50498.2020.00020 . ISBN  978-1-7281-9360-1.
  22. Jiang, Peng-Tao; Zhang, Chang-Bin; Hou, Qibin; Cheng, Ming-Ming; Wei, Yunchao (2021). "LayerCAM: Explorando mapas de activación de clases jerárquicas para localización". IEEE Transactions on Image Processing . 30 : 5875–5888 . Bibcode : 2021ITIP...30.5875J . doi : 10.1109/tip.2021.3089943 . PMID 34156941 . 
  • "La Conferencia Mundial sobre Inteligencia Artificial Explicable" .
  • "Conferencia de la ACM sobre equidad, rendición de cuentas y transparencia (FAccT)" .
  • "Mapas de prominencia específicos de imágenes de PyTorch" . GitHub .
  • "Retropropagación guiada con PyTorch y TensorFlow" . 21 de diciembre de 2021.
  • "Implementación en PyTorch de "Aprendizaje de características profundas para localización discriminativa"" . GitHub .
  • "Explicabilidad avanzada de IA para PyTorch" . GitHub .