Perceiver es una variante de la arquitectura Transformer , adaptada para procesar datos de cualquier tipo, como imágenes, sonidos, vídeo y datos espaciales . A diferencia de sistemas Transformer anteriores, como BERT y GPT-3 , diseñados para el procesamiento de texto, Perceiver es una arquitectura general capaz de aprender de grandes cantidades de datos heterogéneos. Lo logra mediante un mecanismo de atención asimétrica que reduce las entradas a un cuello de botella latente.
Perceiver iguala o supera a los modelos especializados en tareas de clasificación. [ 1 ]
Perceiver fue presentado en junio de 2021 por DeepMind . [ 1 ] Le siguió Perceiver IO en agosto de 2021. [ 2 ]
Diseño
Perceiver está diseñado sin elementos específicos de cada modalidad . Por ejemplo, no tiene elementos especializados para procesar imágenes, texto o audio. Además, puede manejar múltiples flujos de entrada correlacionados de tipos heterogéneos. Utiliza un pequeño conjunto de unidades latentes que forman un cuello de botella de atención por el que deben pasar las entradas. Una ventaja es que elimina el problema de escalado cuadrático que se encontraba en los transformadores anteriores. Los trabajos anteriores utilizaban extractores de características personalizados para cada modalidad. [ 1 ]
Asocia características específicas de posición y modalidad con cada elemento de entrada (por ejemplo, cada píxel o muestra de audio). Estas características se pueden aprender o construir utilizando características de Fourier de alta fidelidad . [ 1 ]
Perceiver utiliza atención cruzada para producir capas de complejidad lineal y para separar la profundidad de la red del tamaño de la entrada. Este desacoplamiento permite arquitecturas más profundas. [ 1 ]
Componentes
Un módulo de atención cruzada mapea una matriz de bytes (más grande) (por ejemplo, una matriz de píxeles) y una matriz latente (más pequeña) a otra matriz latente, reduciendo la dimensionalidad . Una torre transformadora mapea una matriz latente a otra matriz latente, que se utiliza para consultar la entrada nuevamente. Los dos componentes se alternan. Ambos componentes utilizan atención de clave-valor de consulta (QKV). La atención QKV aplica redes de consulta, clave y valor, que suelen ser perceptrones multicapa , a cada elemento de una matriz de entrada, produciendo tres matrices que conservan la dimensionalidad del índice (o longitud de la secuencia) de sus entradas.
E/S del receptor
Perceiver IO puede consultar de forma flexible el espacio latente del modelo para producir resultados de tamaño y semántica arbitrarios. Logra resultados en tareas con espacios de salida estructurados, como comprensión del lenguaje natural y visual , StarCraft II y multitarea. Perceiver IO iguala una línea base BERT basada en Transformer en el benchmark de lenguaje GLUE sin necesidad de tokenización de entrada y alcanza un rendimiento de vanguardia en la estimación de flujo óptico de Sintel . [ 2 ]
Las salidas se generan al procesar la matriz latente mediante una consulta de salida específica asociada a esa salida en particular. Por ejemplo, para predecir el flujo óptico en un píxel, una consulta procesaría las coordenadas xy del píxel más una incrustación de tarea de flujo óptico para producir un único vector de flujo. Se trata de una variación de la arquitectura codificador/decodificador utilizada en otros diseños. [ 2 ]
Actuación
El rendimiento de Perceiver es comparable al de ResNet -50 y ViT en ImageNet sin convoluciones 2D . Atiende a 50.000 píxeles . Es competitivo en todas las modalidades en AudioSet . [ 1 ]
Véase también
Referencias
- 1 2 3 4 5 6 Jaegle, Andrew; Gimeno, Felix; Brock, Andrew; Zisserman, Andrew; Vinyals, Oriol; Carreira, Joao (2021-06-22). "Perceiver: Percepción general con atención iterativa". arXiv : 2103.03206 [ cs.CV ].
- 1 2 3 Jaegle, Andrés; Borgeaud, Sebastián; Alayrac, Jean-Baptiste; Doersch, Carl; Ionescu, Catalín; Ding, David; Koppula, Skanda; Zoran, Daniel; Brock, Andrés; Shelhamer, Evan; Hénaff, Olivier (2 de agosto de 2021). "Perceiver IO: una arquitectura general para entradas y salidas estructuradas". arXiv : 2107.14795 [ cs.LG ].
Enlaces externos
- Aprendizaje automático