EfficientNet es una familia de redes neuronales convolucionales (CNN) para visión artificial publicada por investigadores de Google AI en 2019. [ 1 ] Su innovación clave es el escalado compuesto , que escala uniformemente todas las dimensiones de profundidad, anchura y resolución utilizando un único parámetro.
Los modelos EfficientNet se han adoptado en diversas tareas de visión artificial, incluyendo la clasificación de imágenes , la detección de objetos y la segmentación .
Escalamiento compuesto
EfficientNet introduce el escalado compuesto , que, en lugar de escalar una dimensión de la red a la vez, como la profundidad (número de capas), el ancho (número de canales) o la resolución (tamaño de la imagen de entrada), utiliza un coeficiente compuesto.para escalar las tres dimensiones simultáneamente. Específicamente, dada una red base, la profundidad, el ancho y la resolución se escalan de acuerdo con las siguientes ecuaciones: [ 1 ]sujeto ay. ElLa condición es tal que el aumentopor un factor deaumentaría el total de FLOPs de ejecutar la red en una imagen aproximadamentetiempos. Los hiperparámetros,, yse determinan mediante una búsqueda en cuadrícula pequeña . El artículo original sugería 1,2, 1,1 y 1,15, respectivamente.
Desde el punto de vista arquitectónico, optimizaron la elección de módulos mediante la búsqueda de arquitectura neuronal (NAS, por sus siglas en inglés) y descubrieron que la convolución de cuello de botella invertida (a la que llamaron MBConv ) utilizada en MobileNet funcionaba bien.
La familia EfficientNet es una pila de capas MBConv, con formas determinadas por el escalado compuesto. La publicación original constaba de 8 modelos, desde EfficientNet-B0 hasta EfficientNet-B7, con un tamaño y precisión de modelo crecientes. EfficientNet-B0 es la red base, y los modelos subsiguientes se obtienen escalando la red base mediante un escalado creciente..
Variantes
EfficientNet ha sido adaptado para inferencia rápida en TPU de borde [ 2 ] y clústeres de TPU o GPU centralizados por NAS. [ 3 ]
EfficientNet V2 se publicó en junio de 2021. La arquitectura se mejoró mediante una búsqueda NAS adicional con más tipos de capas convolucionales. [ 4 ] También introdujo un método de entrenamiento que aumenta progresivamente el tamaño de la imagen durante el entrenamiento y utiliza técnicas de regularización como dropout , RandAugment [ 5 ] y Mixup. [ 6 ] Los autores afirman que este enfoque mitiga las caídas de precisión que suelen asociarse con el redimensionamiento progresivo.
Véase también
Referencias
- 1 2 Tan, Mingxing; Le, Quoc V. (2020-09-11), EfficientNet: Repensando el escalado de modelos para redes neuronales convolucionales , arXiv : 1905.11946
- ↑ "EfficientNet-EdgeTPU: Creación de redes neuronales optimizadas para aceleradores con AutoML" . research.google . 6 de agosto de 2019. Consultado el 18 de octubre de 2024 .
- ↑ Li, Sheng; Tan, Mingxing; Pang, Ruoming; Li, Andrew; Cheng, Liqun; Le, Quoc; Jouppi, Norman P. (2021-02-10), Búsqueda de familias de modelos rápidos en aceleradores de centros de datos , arXiv : 2102.05610
- ↑ Tan, Mingxing; Le, Quoc V. (23 de junio de 2021), EfficientNetV2: Modelos más pequeños y entrenamiento más rápido , arXiv : 2104.00298
- ↑ Cubuk, Ekin D.; Zoph, Barret; Shlens, Jonathon; Le, Quoc V. (2020). "Randaugment: Aumento práctico y automatizado de datos con un espacio de búsqueda reducido" : 702–703 . arXiv : 1909.13719 .
{{cite journal}}: Para citar una revista se requiere|journal=( ayuda ) - ^ Zhang, Hongyi; Cissé, Moustapha; Dauphin, Yann N.; López-Paz, David (27 de abril de 2018), confusión: Más allá de la minimización del riesgo empírico , arXiv : 1710.09412
Enlaces externos
- EfficientNet: Mejora de la precisión y la eficiencia mediante AutoML y escalado de modelos (Blog de IA de Google)
- Aprendizaje automático
- visión por computadora
- Redes neuronales artificiales
- Software de Google