La captura de movimiento facial es el proceso de convertir electrónicamente los movimientos del rostro de una persona en una base de datos digital mediante cámaras o escáneres láser . Esta base de datos se puede utilizar para producir gráficos por computadora (CG), animación por computadora para películas, videojuegos o avatares en tiempo real. Dado que el movimiento de los personajes CGI se deriva de los movimientos de personas reales, se obtiene una animación de personajes por computadora más realista y detallada que si la animación se creara manualmente.
Una base de datos de captura de movimiento facial describe las coordenadas o posiciones relativas de los puntos de referencia en el rostro del actor. La captura puede ser bidimensional, en cuyo caso el proceso se denomina a veces " seguimiento de expresiones ", o tridimensional. La captura bidimensional se puede lograr utilizando una sola cámara y un software de captura. Esto produce un seguimiento menos sofisticado y no permite capturar completamente movimientos tridimensionales como la rotación de la cabeza. La captura tridimensional se realiza utilizando sistemas multicámara o sistemas de marcadores láser. Estos sistemas suelen ser mucho más caros, complejos y requieren más tiempo de uso. Existen dos tecnologías predominantes: sistemas de seguimiento con marcadores y sistemas de seguimiento sin marcadores.
La captura de movimiento facial está relacionada con la captura de movimiento corporal, pero resulta más compleja debido a los mayores requisitos de resolución para detectar y rastrear expresiones sutiles, posibles incluso a partir de pequeños movimientos de ojos y labios. Estos movimientos suelen ser de tan solo unos milímetros, lo que exige una resolución y fidelidad aún mayores, así como técnicas de filtrado diferentes a las que se utilizan habitualmente en la captura de cuerpo completo. Las limitaciones adicionales del rostro también ofrecen más posibilidades para el uso de modelos y reglas.
La captura de expresiones faciales es similar a la captura de movimiento facial. Es un proceso que utiliza medios visuales o mecánicos para manipular personajes generados por computadora a partir de rostros humanos , o para reconocer emociones en un usuario.
Historia
Uno de los primeros artículos que trataban sobre animación basada en el rendimiento fue publicado por Lance Williams en 1990. En él, describe «un método para adquirir las expresiones de rostros reales y aplicarlas a rostros generados por ordenador». [ 1 ]
Tecnologías
Basado en marcadores
Los sistemas tradicionales basados en marcadores aplican hasta 350 marcadores al rostro del actor y rastrean su movimiento con cámaras de alta resolución . Esto se ha utilizado en películas como El Expreso Polar y Beowulf para permitir que un actor como Tom Hanks controlara las expresiones faciales de varios personajes. Desafortunadamente, esto resulta bastante engorroso y hace que las expresiones del actor se vean exageradas una vez aplicados el suavizado y el filtrado. Los sistemas de nueva generación, como CaptiveMotion, utilizan variantes del sistema tradicional basado en marcadores con un mayor nivel de detalle.
Actualmente, la tecnología de marcadores LED activos se utiliza para controlar la animación facial en tiempo real y proporcionar retroalimentación al usuario.
Sin marcadores
Las tecnologías sin marcadores utilizan las características del rostro, como las fosas nasales , las comisuras de los labios y los ojos, y las arrugas, para luego rastrearlas. Esta tecnología se analiza y demuestra en CMU , [ 2 ] IBM , [ 3 ] la Universidad de Manchester (donde gran parte de esto comenzó con Tim Cootes , [ 4 ] Gareth Edwards y Chris Taylor) y otros lugares, utilizando modelos de apariencia activa , análisis de componentes principales , seguimiento de autovalores , modelos de superficies deformables y otras técnicas para rastrear las características faciales deseadas fotograma a fotograma. Esta tecnología es mucho menos engorrosa y permite una mayor expresividad para el actor.
Estos métodos basados en visión también permiten rastrear el movimiento de las pupilas, los párpados y la oclusión dental por los labios y la lengua, problemas evidentes en la mayoría de las animaciones por computadora. Las limitaciones típicas de estos métodos son la resolución y la velocidad de fotogramas, las cuales están disminuyendo a medida que se generaliza el acceso a cámaras CMOS de alta velocidad y alta resolución de diversos fabricantes.
La tecnología de seguimiento facial sin marcadores está relacionada con la de un sistema de reconocimiento facial , ya que este último puede aplicarse secuencialmente a cada fotograma de vídeo, lo que permite el seguimiento facial. Por ejemplo, el sistema Neven Vision [ 5 ] (anteriormente Eyematics, ahora adquirido por Google) permitía el seguimiento facial 2D en tiempo real sin entrenamiento específico para cada persona; su sistema también se encontraba entre los de mejor rendimiento en la Prueba de Proveedores de Reconocimiento Facial (FRVT) del Gobierno de EE. UU. de 2002. Por otro lado, algunos sistemas de reconocimiento no rastrean explícitamente las expresiones o incluso fallan con expresiones no neutras, por lo que no son adecuados para el seguimiento. En cambio, sistemas como los modelos de superficie deformable combinan información temporal para desambiguar y obtener resultados más robustos, por lo que no podrían aplicarse a partir de una sola fotografía.
El seguimiento facial sin marcadores ha evolucionado hasta convertirse en sistemas comerciales como Image Metrics , que se ha aplicado en películas como las secuelas de Matrix [ 6 ] y El curioso caso de Benjamin Button . Esta última utilizó el sistema Mova para capturar un modelo facial deformable, que luego se animó con una combinación de seguimiento manual y visual. [ 7 ] Avatar fue otra película destacada de captura de movimiento; sin embargo, utilizó marcadores pintados en lugar de un sistema sin marcadores. Dynamixyz es otro sistema comercial que se utiliza actualmente.
Los sistemas sin marcadores se pueden clasificar según varios criterios distintivos:
- Seguimiento en 2D frente a seguimiento en 3D
- si se requiere capacitación específica para la persona u otro tipo de asistencia humana.
- Rendimiento en tiempo real (lo cual solo es posible si no se requiere capacitación ni supervisión).
- ya sea que necesiten una fuente de información adicional, como patrones proyectados o pintura invisible como la que se usa en el sistema Mova.
Hasta la fecha, ningún sistema es ideal con respecto a todos estos criterios. Por ejemplo, el sistema Neven Vision era totalmente automático y no requería patrones ocultos ni entrenamiento por persona, pero era 2D. El sistema Face/Off [ 8 ] es 3D, automático y en tiempo real, pero requiere patrones proyectados.
captura de expresiones faciales
Tecnología
Los métodos digitales basados en vídeo son cada vez más populares, ya que los sistemas mecánicos tienden a ser engorrosos y difíciles de usar.
Mediante cámaras digitales , las expresiones del usuario se procesan para determinar la postura de la cabeza , lo que permite al software identificar los ojos, la nariz y la boca. El rostro se calibra inicialmente con una expresión neutra. Posteriormente, según la estructura facial, las cejas, los párpados, las mejillas y la boca se procesan como diferencias respecto a la expresión neutra. Esto se logra, por ejemplo, detectando los bordes de los labios y reconociéndolos como un elemento único. A menudo se utilizan maquillaje o marcadores para realzar el contraste, u otros métodos para acelerar el procesamiento. Al igual que con el reconocimiento de voz, las mejores técnicas solo son efectivas en el 90 % de los casos, requiriendo ajustes manuales frecuentes o cierta tolerancia a errores.
Dado que los personajes generados por computadora no tienen músculos reales , se utilizan diferentes técnicas para lograr el mismo resultado. Algunos animadores crean huesos u objetos controlados por el software de captura y los mueven en consecuencia, lo que, cuando el personaje está correctamente articulado, proporciona una buena aproximación. Como los rostros son muy elásticos, esta técnica suele combinarse con otras, ajustando los pesos de forma diferente según la elasticidad de la piel y otros factores, dependiendo de las expresiones deseadas.
Uso
Varias empresas comerciales están desarrollando productos que ya se han utilizado, pero que resultan bastante caros.
Se espera que este dispositivo se convierta en un elemento clave para los videojuegos una vez que el software esté disponible en un formato asequible, pero el hardware y el software aún no existen, a pesar de que la investigación de los últimos 15 años ha producido resultados casi utilizables.
Comunicación con avatares en tiempo real
La primera aplicación que tuvo una amplia acogida fue la comunicación. Inicialmente, la videotelefonía y la mensajería multimedia, y más tarde en 3D con gafas de realidad mixta.
Con el avance del aprendizaje automático , la potencia de cálculo y los sensores avanzados, especialmente en los teléfonos móviles, la tecnología de captura de movimiento facial se ha generalizado. Dos ejemplos notables son la función de lentes de Snapchat y los Memoji de Apple [ 9 ] que se pueden usar para grabar mensajes con avatares o en directo a través de la aplicación FaceTime . Con estas aplicaciones (y muchas otras), la mayoría de los teléfonos móviles modernos son capaces de realizar captura de movimiento facial en tiempo real. Más recientemente, la captura de movimiento facial en tiempo real, combinada con avatares 3D realistas, se introdujo para permitir la comunicación inmersiva en realidad mixta (RM) y realidad virtual (RV). Meta demostró sus Codec Avatars para comunicarse a través de sus auriculares de RM Meta Quest Pro para grabar un podcast con dos participantes remotos. [ 10 ] Los auriculares de RM de Apple , Apple Vision Pro, también admiten la captura de movimiento facial en tiempo real que se puede usar con aplicaciones como FaceTime . Las aplicaciones de comunicación en tiempo real priorizan la baja latencia para facilitar la conversación natural y la facilidad de uso, con el objetivo de hacer que la tecnología sea accesible a un público amplio. Estas consideraciones pueden limitar la precisión posible de la captura de movimiento.
Véase también
Referencias
- ↑ Animación facial orientada al rendimiento, Lance Williams, Computer Graphics, Volumen 24, Número 4, agosto de 1990
- ↑ Algoritmos de ajuste AAM archivados el 22/02/2017 en la Wayback Machine del Instituto de Robótica de Carnegie Mellon
- ↑ "Reconocimiento automático en tiempo real de expresiones faciales en el mundo real" (PDF) . Archivado del original (PDF) el 19/11/2015 . Consultado el 17/11/2015 .
- ↑ Software de modelado y búsqueda archivado el 23/02/2009 en Wayback Machine ("Este documento describe cómo construir, visualizar y utilizar modelos estadísticos de apariencia.")
- ↑ Wiskott, Laurenz; Fellous, J.-M.; Kruger, N.; von der Malsurg, C. (1997), "Reconocimiento facial mediante coincidencia de grafos de grupos elásticos", Computer Analysis of Images and Patterns , Lecture Notes in Computer Science, vol. 1296, Springer, pp. 456–463 , CiteSeerX 10.1.1.18.1256 , doi : 10.1007/3-540-63460-6_150 , ISBN 978-3-540-63460-7
- ↑ Borshukov, George; Piponi, Dan; Larsen, Oystein; Lewis, JP; Tempelaar-Lietz, Christina (2005). "Captura universal: animación facial basada en imágenes para "Matrix Reloaded"". Cursos de ACM SIGGRAPH 2005 sobre - SIGGRAPH '05 . p. 16. doi : 10.1145/1198555.1198596 .
- ↑ Barba, Eric; Preeg, Steve (18 de marzo de 2009), "El rostro curioso de Benjamin Button", Presentación en el capítulo de Vancouver de ACM SIGGRAPH, 18 de marzo de 2009.
- ↑ Weise, Thibaut; Li, Hao; Van Gool, Luc; Pauly, Mark (2009). "Face/Off: Marionetas faciales en vivo" . Actas del Simposio ACM SIGGRAPH/Eurographics de Animación por Computadora de 2009. págs. 7–16 . doi : 10.1145/1599470.1599472 . ISBN 978-1-60558-610-6.
- ↑ "Usa Memoji en tu iPhone o iPad Pro" . support.apple.com . Consultado el 16 de octubre de 2024 ..
- ↑ "#398 – Mark Zuckerberg: Primera entrevista en el metaverso" . lexfriedman.com . 28 de septiembre de 2023. Consultado el 16 de octubre de 2024 .
Enlaces externos
- Universidad Carnegie Mellon
- Universidad Tecnológica de Delft
- Intel
- Sheffield y Otago
- Animación por computadora
- expresiones faciales
- Dispositivos de entrada de computación
- Captura de movimiento
- Realidad virtual