Articulo de referencia

MobileNet

MobileNet es una familia de arquitecturas de redes neuronales convolucionales (CNN) diseñadas para la clasificación de imágenes , la detección de objetos y otras tareas de visió...

MobileNet es una familia de arquitecturas de redes neuronales convolucionales (CNN) diseñadas para la clasificación de imágenes , la detección de objetos y otras tareas de visión artificial. Están diseñadas para ser compactas, de baja latencia y bajo consumo de energía, lo que las hace idóneas para la inferencia en el dispositivo y la computación perimetral en dispositivos con recursos limitados, como teléfonos móviles y sistemas embebidos . Originalmente, se diseñaron para ejecutarse de manera eficiente en dispositivos móviles con TensorFlow Lite .

La necesidad de contar con modelos de aprendizaje profundo eficientes para dispositivos móviles llevó a los investigadores de Google a desarrollar MobileNet. A junio de 2025, la familia contaba con cinco versiones, cada una de las cuales mejoraba la anterior en términos de rendimiento y eficiencia.

Características

V1

MobileNetV1 se publicó en abril de 2017. [ 1 ] [ 2 ] Su principal innovación arquitectónica fue la incorporación de convoluciones separables en profundidad . Fue desarrollado por primera vez por Laurent Sifre durante una pasantía en Google Brain en 2013 como una variación arquitectónica de AlexNet para mejorar la velocidad de convergencia y el tamaño del modelo. [ 3 ]

La convolución separable en profundidad descompone una única convolución estándar en dos convoluciones: una convolución en profundidad que filtra cada canal de entrada de forma independiente y una convolución puntual (1×1{\displaystyle 1\times 1}convolución) que combina las salidas de la convolución en profundidad. Esta factorización reduce significativamente el costo computacional.

MobileNetV1 tiene dos hiperparámetros: un multiplicador de anchoα{\displaystyle \alpha }que controla el número de canales en cada capa. Valores más pequeños deα{\displaystyle \alpha }conducen a modelos más pequeños y rápidos, pero a costa de una menor precisión y un multiplicador de resolución.ρ{\displaystyle \rho }, que controla la resolución de entrada de las imágenes. Las resoluciones más bajas dan como resultado un procesamiento más rápido, pero potencialmente una menor precisión.

V2

MobileNetV2 se publicó en marzo de 2019. [ 4 ] [ 5 ] Utiliza capas residuales invertidas y cuellos de botella lineales .

Los residuos invertidos modifican la estructura tradicional del bloque residual. En lugar de comprimir los canales de entrada antes de la convolución en profundidad, los expanden . Esta expansión es seguida por una1×1{\displaystyle 1\times 1}convolución en profundidad y luego una1×1{\displaystyle 1\times 1}Capa de proyección que reduce el número de canales. Esta estructura invertida ayuda a mantener la capacidad de representación al permitir que la convolución en profundidad opere en un espacio de características de mayor dimensión, preservando así un mayor flujo de información durante el proceso convolucional.

Los cuellos de botella lineales eliminan la función de activación ReLU típica en las capas de proyección. Esto se justificó argumentando que la activación no lineal pierde información en espacios de menor dimensión, lo cual resulta problemático cuando el número de canales ya es pequeño.

V3

MobileNetV3 se publicó en 2019. [ 6 ] [ 7 ] La publicación incluyó MobileNetV3-Small, MobileNetV3-Large y MobileNetEdgeTPU (optimizado para Pixel 4 ). Se encontraron mediante una forma de búsqueda de arquitectura neuronal (NAS) que toma en cuenta la latencia móvil, para lograr un buen equilibrio entre precisión y latencia. [ 8 ] [ 9 ] Usó aproximaciones lineales por partes de las funciones de activación swish y sigmoide (que llamaron "h-swish" y "h-sigmoide"), módulos de compresión y excitación , [ 10 ] y los cuellos de botella invertidos de MobileNetV2.

V4

MobileNetV4 se publicó en septiembre de 2024. [ 11 ] [ 12 ] La publicación incluyó una gran cantidad de arquitecturas encontradas por NAS.

Inspirada en Vision Transformers , la serie V4 incluyó atención de consultas múltiples . [ 13 ] También unificó tanto el residuo invertido como el cuello de botella invertido de la serie V3 con el "cuello de botella invertido universal", que incluye estos dos como casos especiales.

V5

La arquitectura de MobileNetV5 se publicó poco después del lanzamiento de Gemma 3n en junio de 2025 [ 14 ] . Si bien el anuncio indicaba que pronto estaría disponible un informe técnico sobre MobileNetV5, este aún no se ha materializado. La red es 10 veces más grande que la variante V4 más grande [ 14 ] .

Véase también

Referencias

  1. Howard, Andrew G.; Zhu, Menglong; Chen, Bo; Kalenichenko, Dmitry; Wang, Weijun; Weyand, Tobias; Andreetto, Marco; Adam, Hartwig (2017). "MobileNets: Redes neuronales convolucionales eficientes para aplicaciones de visión móvil". arXiv : 1704.04861 [ cs.CV ].
  2. "MobileNets: modelos de código abierto para una visión eficiente en dispositivos" . research.google . 14 de junio de 2017. Consultado el 18 de octubre de 2024 .
  3. Chollet, François (2017). "Xception: Deep Learning with Depthwise Separable Convolutions" . 2017 IEEE Conference on Computer Vision and Pattern Recognition (CVPR) . pp. 1800–1807 . arXiv : 1610.02357 . doi : 10.1109/CVPR.2017.195 . ISBN  978-1-5386-0457-1.
  4. Sandler, Mark; Howard, Andrew; Zhu, Menglong; Zhmoginov, Andrey; Chen, Liang-Chieh (2018). "MobileNetV2: residuos invertidos y cuellos de botella lineales". arXiv : 1801.04381 ​​[ cs.CV ].
  5. "MobileNetV2: La próxima generación de redes de visión artificial en dispositivos" . research.google . 3 de abril de 2018. Consultado el 18 de octubre de 2024 .
  6. "Presentamos la próxima generación de modelos de visión en dispositivos: MobileNetV3 y Mobi" . research.google . 13 de noviembre de 2019. Consultado el 18 de octubre de 2024 .
  7. ^ Howard, Andrés; Sandler, Marcos; Chu, Gracia; Chen, Liang-Chieh; Chen, Bo; Bronceado, Mingxing; Wang, Weijun; Zhu, Yukun; Pang, Ruoming; Vasudevan, Vijay; Le, Quoc V.; Adán, Hartwig (2019). "Buscando MobileNetV3" . Iccv 2019 : 1314– 1324. arXiv : 1905.02244 .
  8. Tan, Mingxing; Chen, Bo; Pang, Ruoming; Vasudevan, Vijay; Sandler, Mark; Howard, Andrew; Le, Quoc V. (junio de 2019). "MnasNet: Búsqueda de arquitectura neuronal con conciencia de plataforma para dispositivos móviles". Conferencia IEEE/CVF de 2019 sobre visión por computadora y reconocimiento de patrones (CVPR) . IEEE. págs. 2815–2823 . arXiv : 1807.11626 . doi : 10.1109 /CVPR.2019.00293 . ISBN  978-1-7281-3293-8.
  9. Yang, Tien-Ju; Howard, Andrew; Chen, Bo; Zhang, Xiao; Go, Alec; Sandler, Mark; Sze, Vivienne; Adam, Hartwig (2018). "NetAdapt: ​​Adaptación de redes neuronales con reconocimiento de plataforma para aplicaciones móviles" . Eccv 2018 : 285–300 . arXiv : 1804.03230 .
  10. Hu, Jie; Shen, Li; Sun, Gang (2018). "Redes de compresión y excitación" . Eccv 2018 : 7132–7141 .
  11. Qin, Danfeng; Leichner, Chas; Delakis, Manolis; Fornoni, Marco; Luo, Shixin; Yang, Fan; Wang, Weijun; Banbury, Colby; Ye, Chengxi; Akin, Berkin; Aggarwal, Vaibhav; Zhu, Tenghui; Moro, Daniele; Howard, Andrew (2024). "MobileNetV4 -- Modelos universales para el ecosistema móvil". arXiv : 2404.10518 [ cs.CV ].
  12. Wightman, Ross. "MobileNet-V4 (ahora en timm)" . huggingface.co . Consultado el 18 de octubre de 2024 .
  13. Shazeer, Noam (2019). "Decodificación rápida de transformadores: un solo cabezal de escritura es todo lo que necesita". arXiv : 1911.02150 [ cs.NE ].
  14. 1 2 "Presentando Gemma 3n: La guía para desarrolladores - Blog de desarrolladores de Google" . developers.googleblog.com . Consultado el 10 de abril de 2026 .
  • "mobilenet" . GitHub . Consultado el 18 de octubre de 2024 .
  • "Documentación de Keras: MobileNet, MobileNetV2 y MobileNetV3" . Keras . Consultado el 18 de octubre de 2024 .