Articulo de referencia

Dong Yu (computer scientist)

Dong Yu (俞栋) is a Chinese-American computer scientist, AI researcher, and engineer, known for his research in speech recognition , deep learning , and multi-modal artificial int...

Dong Yu(俞栋) is a Chinese-American computer scientist, AI researcher, and engineer, known for his research in speech recognition, deep learning, and multi-modal artificial intelligence.[1] He is a Fellow of the Association for Computing Machinery (ACM), the Institute of Electrical and Electronics Engineers (IEEE), and the International Speech Communication Association (ISCA).[2] Yu currently serves as Distinguished Scientist and Vice General Manager at Tencent AI Lab and Chief Scientist and Vice General Manager at Tencent Cloud AI.[3]

Early life and education

Yu received a Bachelor of Science in Electrical Engineering from Zhejiang University and a master's degree in Pattern Recognition and Intelligent Control from the Chinese Academy of Sciences.[2] He subsequently earned a Master of Science in Computer Science from Indiana University at Bloomington and a Ph.D. in Computer Science from the University of Idaho.[4]

Career

Yu began his professional career at Microsoft Research in Redmond, Washington, in 1998, where he worked in the Speech and Dialog Research Group.[5][6] During his time at Microsoft, he led research on automatic speech recognition, multi-modal AI, and deep learning framework, contributing to products such as Microsoft Cortana, Skype Translator, and Ford Sync.[7]

In 2017, Yu joined Tencent America, where he holds dual leadership roles at Tencent AI Lab and Tencent Cloud AI.[8] His work focuses on developing large language models, multi-modal AI systems, and research toward artificial general intelligence (AGI).[9] He has led teams that created systems for conversational AI, speech and music synthesis, multi-modal interaction, and intelligent web agents.[7]

Fue presidente del Comité Técnico de Procesamiento del Habla y el Lenguaje del IEEE y copresidente del Programa Técnico de ICASSP 2021. [ 10 ] Además, ha colaborado como editor asociado y editor jefe de área para las Transacciones IEEE/ACM sobre Procesamiento de Audio, Habla y Lenguaje, y ha actuado como editor invitado para varias revistas y números especiales de conferencias del IEEE centrados en el aprendizaje profundo, el procesamiento del habla y la IA conversacional. [ 11 ]

También fue profesor adjunto en la Universidad de Zhejiang , posee aproximadamente 60 patentes y fue uno de los fundadores y principales contribuyentes de CNTK , un marco de aprendizaje profundo de código abierto. [ 1 ]

Investigación y contribuciones

Yu es conocido por la aplicación del aprendizaje profundo al reconocimiento de voz con vocabulario extenso , incluyendo el desarrollo de redes neuronales profundas dependientes del contexto (CD-DNN-HMM), que mejoraron significativamente la precisión del reconocimiento e influyeron tanto en el ámbito académico como en la industria. [ 12 ]

También ha impulsado redes neuronales recurrentes y convolucionales , [ 13 ] arquitecturas de aprendizaje profundo de extremo a extremo, IA multimodal y síntesis de voz , contribuyendo a tecnologías que sustentan los asistentes virtuales modernos y los sistemas de interacción humano-computadora . [ 11 ] Yu desarrolló el Computational Network Toolkit (CNTK), un marco de aprendizaje profundo de código abierto, e introdujo métodos de entrenamiento escalables para sistemas multi-GPU. [ 14 ]

Más recientemente, su investigación se ha centrado en modelos de lenguaje multimodales a gran escala e IAG, dando como resultado modelos como SongGeneration, AlphaLLM, LiteSearch, WebVoyager, Cognitive Kernel, R-Zero y WebEvolver, así como sistemas de interfaz de audio y síntesis de voz utilizados en productos de Tencent. [ 15 ]

Referencias

  1. 1 2 Jing, Meng (2017-05-02). "Tencent nombra a un experto mundial en IA para dirigir un nuevo laboratorio en Seattle" . South China Morning Post . Recuperado el 25 de diciembre de 2025 .
  2. 1 2 "Líderes de la industria en procesamiento de señales y aprendizaje automático: Dong Yu | IEEE Signal Processing Society" . signalprocessingsociety.org . Consultado el 25 de diciembre de 2025 .
  3. Jiang, Sijia. "Tencent intensifica su apuesta por la IA con un laboratorio de investigación en Seattle" . Reuters .
  4. Jia, Marlene (19 de junio de 2017). "Conozca a los principales investigadores e innovadores de IA de China" . TOPBOTS . Recuperado el 25 de diciembre de 2025 .
  5. "ACM Multimedia 2020 - Charla invitada industrial" . 2020.acmmm.org . Archivado del original el 10 de marzo de 2021. Consultado el 25 de diciembre de 2025 .
  6. Hughes, Alyssa (29 de agosto de 2011). "El reconocimiento de voz da grandes pasos adelante" . Microsoft Research . Recuperado el 25 de diciembre de 2025 .
  7. 1 2 Ali, Abder Rahman. "Aprendizaje profundo (entrevista con Dong Yu) – Dr. Abder-Rahman Ali" . Harvard . Recuperado el 25 de diciembre de 2025 .
  8. Nickelsburg, Monica (28 de abril de 2017). "Tencent, la empresa matriz de WeChat, abrirá un laboratorio de IA en Seattle dirigido por un exinvestigador de Microsoft" . GeekWire . Consultado el 25 de diciembre de 2025 .
  9. Yang, Yuan. "Tencent de China abrirá su primer laboratorio de IA en Estados Unidos" . Financial Times . Consultado el 25 de diciembre de 2025 .
  10. "Dong Yu" . speakers.acm.org . Consultado el 25 de diciembre de 2025 .
  11. 1 2 "Personas de ACM - Dong Yu es un científico distinguido y subdirector general en Tencent AI Lab" . www.acm.org . Consultado el 25 de diciembre de 2025 .
  12. Linn, Allison (18 de octubre de 2016). "Los investigadores de Microsoft alcanzan la paridad humana en el reconocimiento de voz conversacional" . El blog de IA . Consultado el 25 de diciembre de 2025 .
  13. Abdel-Hamid, Ossama; Mohamed, Abdel-rahman; Jiang, Hui; Deng, Li; Penn, Gerald; Yu, Dong (2014). "Redes neuronales convolucionales para el reconocimiento del habla". IEEE/ACM Transactions on Audio, Speech, and Language Processing . 22 (10): 1533– 1545. Bibcode : 2014ITASL..22.1533A . doi : 10.1109/TASLP.2014.2339736 . ISSN 2329-9304 . 
  14. Mayer, Tricia (07/12/2015). "Microsoft Computational Network Toolkit ofrece el rendimiento computacional de aprendizaje profundo distribuido más eficiente" . Microsoft Research . Recuperado el 25/12/2025 .
  15. ^ Wang, Jiaqi; Jiang, Hanqi; Liu, Yiheng; Mamá, Chong; Zhang, Xu; Pan, Yi; Liu, Mengyuan; Gu, Peiran; Xia, Sichen; Li, Wenjun; Zhang, Yutong; Wu, Zihao; Liu, Zhengliang; Zhong, Tianyang; Ge, Bao; Zhang, Tuo; Qiang, Ning; Hu, Xintao; Jiang, Xi; Zhang, Xin; Zhang, Wei; Shen, Dinggang; Liu, Tianming; Zhang, Shu (2024). "Una revisión completa de modelos de lenguajes grandes multimodales: rendimiento y desafíos en diferentes tareas". arXiv : 2408.01319v1 [ cs.AI ].