Articulo de referencia

Inception (arquitectura de aprendizaje profundo)

Inception [ 1 ] es una familia de redes neuronales convolucionales (CNN) para visión artificial , introducida por investigadores de Google en 2014 como GoogLeNet (posteriormente...

Inception [ 1 ] es una familia de redes neuronales convolucionales (CNN) para visión artificial , introducida por investigadores de Google en 2014 como GoogLeNet (posteriormente renombrada Inception v1). La serie fue históricamente importante como una de las primeras CNN que separa el tallo (ingesta de datos), el cuerpo (procesamiento de datos) y la cabeza (predicción), un diseño arquitectónico que persiste en todas las CNN modernas. [ 2 ]

Modelo Inception-v3

Historial de versiones

Origen v1

Arquitectura de GoogleNet

En 2014, un equipo de Google desarrolló la arquitectura GoogLeNet, una instancia de la cual ganó el ImageNet Large-Scale Visual Recognition Challenge 2014 (ILSVRC14). [ 1 ] [ 3 ]

El nombre proviene de LeNet de 1998, ya que tanto LeNet como GoogLeNet son CNN. También la llamaron "Inception" por el meme de internet "we need to go deeper" (Necesitamos ir más allá), una frase de la película Inception (2010) . [ 1 ] Debido a que posteriormente se lanzaron más versiones, la arquitectura original de Inception fue renombrada nuevamente como "Inception v1".

Los modelos y el código se publicaron bajo la licencia Apache 2.0 en GitHub. [ 4 ]

Un módulo individual de Inception. A la izquierda se muestra un módulo estándar y a la derecha un módulo de dimensiones reducidas.
Un único módulo de dimensión reducida Inception

La arquitectura Inception v1 es una CNN profunda compuesta por 22 capas. La mayoría de estas capas eran "módulos Inception". El artículo original afirmaba que los módulos Inception son una "culminación lógica" de la red en la red [ 5 ] y (Arora et al, 2014). [ 6 ]

Dado que Inception v1 es una red profunda, sufrió el problema del gradiente evanescente . El equipo lo resolvió utilizando dos "clasificadores auxiliares", que son clasificadores softmax lineales insertados a 1/3 y 2/3 de profundidad dentro de la red, y la función de pérdida es una suma ponderada de los tres:L=0,3Laincógnita,1+0,3Laincógnita,2+Lrmial{\displaystyle L=0.3L_{aux,1}+0.3L_{aux,2}+L_{real}}

Estos se eliminaron una vez finalizado el entrenamiento. Esto se solucionó posteriormente con la arquitectura ResNet .

La arquitectura consta de tres partes apiladas una encima de la otra: [ 2 ]

  • La etapa inicial (ingesta de datos): Las primeras capas convolucionales realizan un preprocesamiento de datos para reducir el tamaño de las imágenes.
  • El cuerpo (procesamiento de datos): Los siguientes módulos de Inception realizan la mayor parte del procesamiento de datos.
  • La cabeza (predicción): La capa final totalmente conectada y softmax producen una distribución de probabilidad para la clasificación de imágenes.

Esta estructura se utiliza en la mayoría de las arquitecturas de redes neuronales convolucionales modernas.

Origen v2

Inception v2 se publicó en 2015, en un artículo más famoso por proponer la normalización por lotes . [ 7 ] [ 8 ] Tenía 13,6 millones de parámetros.

Mejora la versión Inception v1 al añadir normalización por lotes y eliminar la eliminación de parámetros (dropout) y la normalización de respuesta local, que consideraron innecesarias al utilizar la normalización por lotes.

Inception v3

Inception v3 se lanzó en 2016. [ 7 ] [ 9 ] Mejora Inception v2 mediante el uso de convoluciones factorizadas.

Por ejemplo, una convolución simple de 5×5 se puede factorizar en una convolución de 3×3 apilada sobre otra de 3×3. Ambas tienen un campo receptivo de 5×5. El núcleo de convolución de 5×5 tiene 25 parámetros, en comparación con solo 18 en la versión factorizada. Por lo tanto, la convolución de 5×5 es estrictamente más potente que la versión factorizada. Sin embargo, esta potencia no es necesariamente necesaria. Empíricamente, el equipo de investigación descubrió que las convoluciones factorizadas son útiles.

También utiliza una forma de reducción de dimensionalidad mediante la concatenación de la salida de una capa convolucional y una capa de agrupación . Como ejemplo, un tensor de tamaño35×35×320{\displaystyle 35\times 35\times 320}puede reducirse mediante una convolución con paso 2 a17×17×320{\displaystyle 17\times 17\times 320}y mediante maxpooling con tamaño de pool2×2{\displaystyle 2\times 2}a17×17×320{\displaystyle 17\times 17\times 320}Estos luego se concatenan a17×17×640{\displaystyle 17\times 17\times 640}.

Además de esto, también eliminó el clasificador auxiliar más bajo durante el entrenamiento. Descubrieron que el clasificador auxiliar funcionaba como una forma de regularización .

También propusieron la regularización de suavizado de etiquetas en la clasificación. Para una imagen con etiquetado{\displaystyle c}en lugar de hacer que el modelo prediga la distribución de probabilidadδdo=(0,0,,0,1do-entrada,0,,0){\displaystyle \delta _{c}=(0,0,\dots ,0,\underbrace {1} _{c{\text{-th entry}}},0,\dots ,0)}, hicieron que el modelo predijera la distribución suavizada(1ϵ)δdo+ϵ/K{\displaystyle (1-\epsilon )\delta _{c}+\epsilon /K}dóndeK{\displaystyle K}es el número total de clases.

Origen v4

En 2017, el equipo lanzó Inception v4, Inception ResNet v1 e Inception ResNet v2. [ 10 ]

Inception v4 es una actualización incremental con convoluciones aún más factorizadas y otras complicaciones que, según se ha comprobado empíricamente, mejoran los resultados de las pruebas de rendimiento.

Inception ResNet v1 y v2 son modificaciones de Inception v4, donde se agregan conexiones residuales a cada módulo de Inception, inspiradas en la arquitectura ResNet . [ 11 ]

Xcepción

Xception ("Extreme Inception") se publicó en 2017. [ 12 ] Es una pila lineal de capas de convolución separables en profundidad con conexiones residuales. El diseño se propuso bajo la hipótesis de que en una CNN, las correlaciones entre canales y las correlaciones espaciales en los mapas de características pueden desacoplarse por completo .

El entrenamiento de cada red tardó 3 días en 60 GPU K80, o aproximadamente 0,5 petaFLOP-días. [ 13 ]

Referencias

  1. 1 2 3 Szegedy, Christian; Wei Liu; Yangqing Jia; Sermanet, Pierre; Reed, Scott; Anguelov, Dragomir; Erhan, Dumitru; Vanhoucke, Vincent; Rabinovich, Andrew (junio de 2015). "Profundizando con convoluciones". Conferencia IEEE de 2015 sobre Visión por Computadora y Reconocimiento de Patrones (CVPR) . IEEE. págs. 1–9 . arXiv : 1409.4842 . doi : 10.1109/CVPR.2015.7298594 . ISBN  978-1-4673-6964-0.
  2. 1 2 Zhang, Aston; Lipton, Zachary; Li, Mu; Smola, Alexander J. (2024). "8.4. Redes multiramificadas (GoogLeNet)" . Sumérgete en el aprendizaje profundo . Cambridge Nueva York Puerto Melbourne Nueva Delhi Singapur: Cambridge University Press. ISBN 978-1-009-38943-3.
  3. Repositorio oficial de Inception V1 en Kaggle, publicado por Google.
  4. "google/inception" . Google. 19 de agosto de 2024. Consultado el 19 de agosto de 2024 .
  5. Lin, Min; Chen, Qiang; Yan, Shuicheng (4 de marzo de 2014). "Red en red". arXiv : 1312.4400 [ cs.NE ].
  6. Arora, Sanjeev; Bhaskara, Aditya; Ge, Rong; Ma, Tengyu (27 de enero de 2014). "Límites demostrables para el aprendizaje de algunas representaciones profundas" . Actas de la 31.ª Conferencia Internacional sobre Aprendizaje Automático . PMLR: 584–592 . arXiv : 1310.6343 .
  7. 1 2 Szegedy, Christian; Vanhoucke, Vincent; Ioffe, Sergey; Shlens, Jon; Wojna, Zbigniew (2016). "Repensando la arquitectura Inception para la visión por computadora" . Conferencia IEEE de 2016 sobre visión por computadora y reconocimiento de patrones (CVPR) . págs. 2818–2826 . doi : 10.1109/CVPR.2016.308 . ISBN  978-1-4673-8851-1.
  8. Repositorio oficial de Inception V2 en Kaggle, publicado por Google.
  9. Repositorio oficial de Inception V3 en Kaggle, publicado por Google.
  10. Szegedy, Christian; Ioffe, Sergey; Vanhoucke, Vincent; Alemi, Alexander (2017-02-12). "Inception-v4, Inception-ResNet y el impacto de las conexiones residuales en el aprendizaje" . Actas de la Conferencia AAAI sobre Inteligencia Artificial . 31 (1). arXiv : 1602.07261 . doi : 10.1609/aaai.v31i1.11231 . ISSN 2374-3468 . 
  11. Él, Kaiming; Zhang, Xiangyu; Ren, Shaoqing; Sun, Jian (10 de diciembre de 2015). "Aprendizaje residual profundo para el reconocimiento de imágenes". arXiv : 1512.03385 [ cs.CV ].
  12. Chollet, Francois (2017). "Xception: Aprendizaje profundo con convoluciones separables en profundidad" . Conferencia IEEE de 2017 sobre visión por computadora y reconocimiento de patrones (CVPR) . págs. 1251–1258 . doi : 10.1109/CVPR.2017.195 . ISBN  978-1-5386-0457-1.
  13. "IA y computación" . openai.com . 9 de junio de 2022. Consultado el 28 de abril de 2025 .
  • Una lista de todos los modelos Inception publicados por Google: "models/research/slim/README.md en master · tensorflow/models" . GitHub . Consultado el 19 de octubre de 2024 .