Articulo de referencia

Gerald Tesauro

[[Princeton University]] (Ph.D. Physics, 1986)"},"thesis_title":{"wt":"Steady-State Dynamics and Selection Principles in Nonequilibrium Pattern-Forming Systems"},"thesis_url":{"...

Gerald J. " Gerry " Tesauro es un científico informático estadounidense e investigador de IBM, conocido por el desarrollo de TD-Gammon , un programa de backgammon que aprendió a jugar a nivel de campeonato mundial mediante el autoaprendizaje y el aprendizaje por diferencia temporal , un éxito temprano en el aprendizaje por refuerzo y las redes neuronales . Posteriormente, investigó sobre computación autónoma , sistemas multiagente para el comercio electrónico y contribuyó a los algoritmos de estrategia de juego para IBM Watson .

Carrera

Educación

Tesauro obtuvo una licenciatura en física de la Universidad de Maryland, College Park . Posteriormente, realizó estudios de posgrado en física de plasmas en la Universidad de Princeton , con el apoyo de una beca de la Fundación Hertz a partir de 1980. [ 1 ] Completó su doctorado en física teórica en 1986 bajo la supervisión del premio Nobel Philip W. Anderson . [ 2 ]

Chaquete

Tras completar su doctorado, realizó una investigación postdoctoral en el Centro de Investigación de Sistemas Complejos de la Universidad de Illinois en Urbana-Champaign . [ 3 ] [ 4 ] Durante este período, comenzó a aplicar redes neuronales a juegos, siendo coautor de un artículo en NeurIPS en 1987 con Terrence Sejnowski sobre una red neuronal que aprendió a jugar al backgammon. [ 5 ] A finales de la década de 1980, Tesauro se unió al Centro de Investigación Thomas J. Watson de IBM (IBM Research) como científico investigador, donde pasaría varias décadas, llegando finalmente al puesto de Investigador Principal en Ciencias de la IA. [ 1 ]

A finales de la década de 1980, desarrolló Neurogammon , un programa de backgammon entrenado con partidas de expertos humanos mediante aprendizaje supervisado . Neurogammon ganó el torneo de backgammon en la 1.ª Olimpiada de Computación en 1989, demostrando el potencial de las redes neuronales en la IA de juegos. [ 3 ]

Desarrolló TD-Gammon entre 1990 y 1998, utilizando aprendizaje por refuerzo , específicamente aprendizaje por diferencia temporal (TD) . TD-Gammon aprendió mediante autoaprendizaje, empleando una red neuronal para evaluar las posiciones del tablero y mejorando su estrategia a lo largo de millones de partidas. El programa alcanzó un nivel de juego de campeonato mundial, capaz de desafiar a los mejores jugadores humanos. [ 6 ] A menudo se le considera un éxito temprano de las redes neuronales, el aprendizaje automático y el RL, y se cita frecuentemente como precursor en publicaciones sobre sistemas de juego posteriores, como AlphaZero . [ 7 ]

Durante este período, Tesauro también contribuyó a la investigación del ajedrez computarizado en IBM, explorando métodos de aprendizaje automático para el entrenamiento de funciones de evaluación , aunque el proyecto principal Deep Blue fue liderado por otros. Específicamente, algunos pesos de la función de evaluación lineal se entrenaron mediante entrenamiento de comparación discretizado. [ 8 ] Los pesos evaluaban principalmente la seguridad del rey. [ 9 ] Desde 2010, también contribuyó al Go computarizado trabajando en un programa llamado Fuego. [ 3 ]

Comercio electrónico

A finales de la década de 1990, Tesauro centró su atención en los sistemas multiagente y su aplicación en el comercio electrónico , como los "pricebots" autónomos, que son agentes de software diseñados para aprender estrategias óptimas de precios y pujas en mercados electrónicos. [ 10 ] Los métodos incluían el aprendizaje Q para estrategias de precios dinámicas (por ejemplo, cooperación o reducción de precios) en entornos competitivos. [ 11 ] [ 12 ] Fue una de las primeras aplicaciones del aprendizaje por refuerzo multiagente al modelado económico y al comercio automatizado . También exploró la aplicación de redes neuronales a la detección de virus informáticos . [ 13 ]

computación autónoma

Desde principios de la década de 2000, Tesauro se convirtió en un colaborador clave de la iniciativa de computación autónoma de IBM , cuyo objetivo era crear sistemas de TI autogestionados. Aplicó el aprendizaje por refuerzo para automatizar tareas como la asignación de recursos, la optimización del rendimiento y la gestión de energía en centros de datos y sistemas distribuidos. Algunos ejemplos incluyen múltiples agentes de aprendizaje por refuerzo que cooperaban para optimizar los recursos del servidor (CPU, memoria, energía) con el fin de alcanzar los objetivos de rendimiento o minimizar el consumo de energía. [ 14 ] [ 15 ] [ 16 ] [ 17 ]

Tesauro figura como inventor en numerosas patentes estadounidenses, centradas principalmente en computación autónoma y aplicaciones de IA para la gestión de sistemas, presentadas principalmente entre 2004 y 2007. Estas incluían generalmente métodos para el aprendizaje basado en recompensas de políticas de sistemas, asignación dinámica de recursos basada en utilidad y transferencia de modelos autónomos en sistemas informáticos. [ 18 ]

IBM Watson

Alrededor de 2009, Tesauro se unió al equipo de IBM Research, liderado por David Ferrucci , [ 3 ] que desarrolló IBM Watson , el sistema de respuesta a preguntas famoso por derrotar a los campeones humanos Ken Jennings y Brad Rutter en el programa de preguntas y respuestas Jeopardy! en 2011.

Tesauro se centró en los componentes de la estrategia de juego de Watson, incluyendo algoritmos para la sincronización del pulsador, la selección de pistas y las decisiones de apuesta (especialmente para Daily Doubles y Final Jeopardy! ). Él y sus colegas desarrollaron un Evaluador del Estado del Juego y utilizaron optimización basada en simulación, empleando técnicas de inferencia bayesiana , teoría de juegos , programación dinámica y aprendizaje por refuerzo para refinar el juego estratégico de Watson. Estos algoritmos estratégicos contribuyeron significativamente al éxito de Watson, permitiéndole gestionar el riesgo de manera efectiva y tomar decisiones de apuesta casi óptimas. [ 19 ] [ 20 ] [ 21 ]

Durante este tiempo, Tesauro también continuó investigando en algoritmos centrales de IA, siendo coautor de un artículo sobre equilibrio de simulación de Monte Carlo con David Silver (posteriormente de DeepMind ) en ICML 2009. [ 22 ] Después de Watson, Tesauro continuó investigando en IBM, en áreas como aprendizaje profundo por refuerzo , [ 23 ] RL jerárquico, sistemas multiagente, [ 24 ] y aprendizaje continuo. [ 25 ]

Honores y premios

Referencias

  1. 1 2 3 "Gerald Tesauro" . Fundación Hertz . Consultado el 12 de mayo de 2025 .
  2. https://mail.mathgenealogy.org/id.php?id=268642
  3. ^ " Gerald Tesauro - Wiki de programación de ajedrez " . www.chessprogramming.org . Consultado el 12 de mayo de 2025 .
  4. Tesauro, Gerald. Una red neuronal derrota a su creador en una partida de backgammon . Centro de Investigación de Sistemas Complejos, Universidad de Illinois, 1988.
  5. Tesauro, Gerald; Sejnowski, Terrence J. (1987). "Una red 'neuronal' que aprende a jugar al backgammon" . En Anderson, Dana Z. (ed.). Sistemas de procesamiento de información neuronal . Sistemas de procesamiento de información neuronal. pp. 794–803 . ISBN  0-88318-569-5Archivado del original (PDF) el 2 de julio de 2003.
  6. Tesauro, Gerald (2002). "Programación de backgammon mediante redes neuronales autoaprendizaje" . Inteligencia Artificial . 134 ( 1–2 ): 181–199 . doi : 10.1016/S0004-3702(01)00110-2 .
  7. Silver, David; Schrittwieser, Julian; Simonyan, Karen; Antonoglou, Ioannis; Huang, Aja; Guez, Arthur; Hubert, Thomas; Baker, Lucas; Lai, Matthew; Bolton, Adrian; Chen, Yutian; Lillicrap, Timothy; Hui, Fan; Sifre, Laurent; van den Driessche, George (octubre de 2017). "Dominando el juego de Go sin conocimiento humano" . Nature . 550 (7676): 354–359 . Bibcode : 2017Natur.550..354S . doi : 10.1038/nature24270 . ISSN 1476-4687 . PMID 29052630 .  
  8. Tesauro, Gerald (1988). "Aprendizaje conexionista de preferencias expertas mediante entrenamiento comparativo" . Avances en sistemas de procesamiento de información neuronal . 1. Morgan-Kaufmann.
  9. Tesauro, Gerald (1 de enero de 2001), "Entrenamiento comparativo de funciones de evaluación de ajedrez" , Máquinas que aprenden a jugar , EE. UU.: Nova Science Publishers, Inc., págs. 117–130 , ISBN  978-1-59033-021-0
  10. Greenwald, Amy R.; Kephart, Jeffrey O.; Tesauro, Gerald J. (noviembre de 1999). "Dinámica estratégica de los bots de precios" . Actas de la 1.ª conferencia ACM sobre comercio electrónico . ACM. págs. 58–67 . doi : 10.1145/336992.337008 . ISBN  978-1-58113-176-5.
  11. Tesauro, Gerald; Kephart, Jeffrey O. (2002-09-01). "Pricing in Agent Economies Using Multi-Agent Q-Learning" . Autonomous Agents and Multi-Agent Systems . 5 (3): 289– 304. doi : 10.1023/A:1015504423309 . ISSN 1573-7454 . 
  12. Tesauro, Gerald J.; Kephart, Jeffrey O. (marzo de 2000). "Algoritmos de precios basados ​​en la previsión en economías de agentes" . Decision Support Systems . 28 ( 1–2 ): 49–60 . doi : 10.1016/S0167-9236(99)00074-3 .
  13. Tesauro, Gerald; Kephart, Jeffrey O.; Sorkin, Gregory B. (1997). "Redes neuronales para el reconocimiento de virus informáticos" . IEEE Expert: Intelligent Systems and Their Applications . 11 (4): 5– 6. doi : 10.1109/64.511768 .
  14. Kephart, Jeffrey O.; Chan, Hoi; Das, Rajarshi; Levine, David W.; Tesauro, Gerald; Rawson, Freeman; Lefurgy, Charles (junio de 2007). «Coordinación de múltiples gestores autónomos para lograr compensaciones específicas entre potencia y rendimiento». Cuarta Conferencia Internacional sobre Computación Autónoma (ICAC'07) . pág. 24. doi : 10.1109/ICAC.2007.12 . ISBN  978-0-7695-2779-6.
  15. Tesauro, Gerald (2007). "Aprendizaje por refuerzo en computación autónoma: un manifiesto y estudios de caso". IEEE Internet Computing . 11 (1): 22– 30. Bibcode : 2007IIC....11a..22T . doi : 10.1109/MIC.2007.21 . ISSN 1089-7801 . 
  16. Tesauro, G.; Jong, NK; Das, R.; Bennani, MN (2006). "Un enfoque híbrido de aprendizaje por refuerzo para la asignación autónoma de recursos". 2006 IEEE International Conference on Autonomic Computing . IEEE. pp. 65–73 . doi : 10.1109/ICAC.2006.1662383 . ISBN  978-1-4244-0175-8.
  17. Tesauro, G.; Das, R.; Walsh, WE; Kephart, JO (2005). "Asignación de recursos basada en funciones de utilidad en sistemas autónomos". Segunda Conferencia Internacional sobre Computación Autónoma (ICAC'05) . IEEE. págs. 342–343 . doi : 10.1109/ICAC.2005.65 . ISBN  0-7965-2276-9.{{cite book}}: Valor de comprobación |isbn=: suma de comprobación ( ayuda )
  18. "Patentes del inventor Gerald Tesauro" . Justia Patents . Consultado el 12 de mayo de 2025 .
  19. "Conferencia Distinguida del ISR: Cómo Watson aprende estrategias sobrehumanas de Jeopardy!" . Instituto de Investigación de Sistemas, Universidad de Maryland . 7 de noviembre de 2011. Consultado el 12 de mayo de 2025 .
  20. Tesauro, G.; Gondek, DC; Lenchner, J.; Fan, J.; Prager, JM (2013-05-31). "Análisis de las estrategias de Watson para jugar a Jeopardy!" . Journal of Artificial Intelligence Research . 47 : 205– 251. arXiv : 1402.0571 . doi : 10.1613/jair.3834 . ISSN 1076-9757 . 
  21. "Día 2 del Desafío Watson... ¿y la controversia del Doble Diario?" . Galería de concursos de Howell . 16 de febrero de 2011 . Consultado el 12 de mayo de 2025 .
  22. Silver, David; Tesauro, Gerald (14 de junio de 2009). "Equilibrio de simulación de Montecarlo" . Actas de la 26.ª Conferencia Internacional Anual sobre Aprendizaje Automático . ACM. págs. 945–952 . doi : 10.1145/1553374.1553495 . ISBN  978-1-60558-516-1.
  23. Machado, Marlos C.; Rosenbaum, Clemens; Guo, Xiaoxiao; Riemer, Matthew; Tesauro, Gerald; Campbell, Murray (2018). "Descubrimiento de eigenopciones a través de la representación de sucesores profundos" . Conferencia Internacional sobre Representaciones de Aprendizaje (ICLR) 2018. https://iclr.cc/Conferences/2018 .{{cite conference}}: |conference-url=falta el título ( ayuda )
  24. Kim, Dong-Ki; Liu, Miao; Riemer, Matthew; Sun, Chuangchuang; Abdulhai, Marutaro; Habibi, Golnaz; Srinivasan, Vikram; Tesauro, Gerald; How, Jonathan P. (2022). "Influencia en el comportamiento a largo plazo en el aprendizaje por refuerzo multiagente" . En Oh, Alice H. (ed.). Avances en sistemas de procesamiento de información neuronal (NeurIPS) 35. págs. 31914–31927 . 
  25. Riemer, Matthew; Cases, Ignacio; Ajemian, Robert; Liu, Miao; Rish, Irina; Tu, Yuhai; Tesauro, Gerald (2019). "Aprender a aprender sin olvidar maximizando la transferencia y minimizando la interferencia" . Conferencia Internacional sobre Representaciones de Aprendizaje (ICLR) 2019. https://iclr.cc/Conferences/2019 .{{cite conference}}: |conference-url=falta el título ( ayuda )
  26. «Becarios AAAI electos» . AAAI . Consultado el 12 de mayo de 2025 .
  27. «Dr. Gerald Tesauro» . premios.acm.org . Consultado el 12 de mayo de 2025 .
  • Página de Gerald Tesauro en Chess Programming Wiki.
  • Bibliografía de Gerald Tesauro en DBLP .