Articulo de referencia

Motor de tres en raya educativo de Matchbox

Una recreación de MENACE construida en 2015. El Matchbox Educable Noughts and Crosses Engine (a veces llamado Machine Educable Noughts and Crosses Engine o MENACE ) fue una comp...

Este es un buen artículo. Haz clic aquí para obtener más información.

Recreación de MENACE
Una recreación de MENACE construida en 2015.

El Matchbox Educable Noughts and Crosses Engine (a veces llamado Machine Educable Noughts and Crosses Engine o MENACE ) fue una computadora mecánica hecha con 304 cajas de cerillas , diseñada y construida por el investigador de inteligencia artificial Donald Michie y su colega Roger Chambers en 1961. Fue diseñada para jugar contra oponentes humanos al tres en raya, devolviendo una jugada para cualquier estado de juego dado y refinando su estrategia mediante aprendizaje por refuerzo . Este fue uno de los primeros tipos de inteligencia artificial.

Michie y Chambers no tenían acceso inmediato a una computadora; sortearon esta limitación construyendo el motor con cajas de cerillas. [ 1 ] Cada caja de cerillas que usaron representaba una única disposición posible de una cuadrícula de tres en raya. Cuando la computadora jugaba por primera vez, elegía aleatoriamente los movimientos según la disposición actual. A medida que jugaba más partidas, mediante un bucle de reforzamiento, descartaba las estrategias que llevaban a perder y reforzaba las que llevaban a ganar. Michie organizó un torneo contra MENACE en 1961, donde experimentó con diferentes aperturas.

Tras su primer torneo contra Michie, MENACE demostró una inteligencia artificial eficaz en su estrategia. Los ensayos de Michie sobre la inicialización de pesos de MENACE y el algoritmo BOXES utilizado por este se popularizaron en el campo de la investigación en informática. Michie fue galardonado por su contribución a la investigación en aprendizaje automático y recibió en dos ocasiones el encargo de programar una simulación de MENACE en un ordenador real.

Origen

Donald Michie en 1986
Donald Michie , 1986

Donald Michie (1923–2007) formó parte del equipo que descifró el código Tunny alemán durante la Segunda Guerra Mundial . [ 2 ] Quince años después, quiso demostrar aún más su destreza matemática y computacional con una red neuronal convolucional temprana . Dado que no se disponía de equipos informáticos para tales usos, [ 3 ] y Michie no tenía una computadora a mano, [ 3 ] decidió mostrar y demostrar la inteligencia artificial en un formato más esotérico y construyó una computadora mecánica funcional con cajas de cerillas y cuentas. [ 4 ] [ 5 ]

MENACE se construyó como resultado de una apuesta con un colega de ciencias de la computación que postulaba que tal máquina era imposible. [ 6 ] Michie emprendió la tarea de recolectar y definir cada caja de cerillas como un "proyecto divertido", que luego se convirtió en una herramienta de demostración. [ 1 ] Michie completó su ensayo sobre MENACE en 1963, [ 5 ] "Experimentos sobre la mecanización del aprendizaje de juegos", así como su ensayo sobre el algoritmo BOXES, escrito con RA Chambers [ 1 ] y había creado una unidad de investigación de IA en Hope Park Square, Edimburgo , Escocia . [ 7 ]

MENACE aprendió jugando partidas sucesivas de tres en raya. En cada ocasión, eliminaba una estrategia perdedora mediante la confiscación por parte del jugador humano de las fichas correspondientes a cada movimiento. [ 5 ] Reforzaba las estrategias ganadoras aumentando la probabilidad de los movimientos, proporcionando fichas adicionales. [ 8 ] Esta fue una de las primeras versiones del Bucle de Refuerzo , el algoritmo esquemático que consiste en repetir el algoritmo, descartando las estrategias fallidas hasta que solo queden las ganadoras. [ 5 ] Este modelo comienza siendo completamente aleatorio y aprende gradualmente. [ 9 ]

Composición

MENACE se construyó con 304 cajas de cerillas pegadas entre sí en una disposición similar a la de una cómoda. [ 10 ] Cada caja tenía un código numérico que se introducía en una tabla. Esta tabla contenía dibujos de cuadrículas del juego de tres en raya con diversas configuraciones de X , O y casillas vacías, [ 5 ] correspondientes a todas las permutaciones posibles que podía experimentar el juego a medida que avanzaba. [ 11 ] Tras eliminar las disposiciones duplicadas (aquellas que eran simplemente rotaciones o imágenes especulares de otras configuraciones), MENACE utilizó 304 permutaciones en su tabla y, por lo tanto, esa cantidad de cajas de cerillas. [ 12 ]

Cada bandeja de caja de cerillas individual contenía una colección de cuentas de colores. [ 13 ] Cada color representaba un movimiento en una casilla de la cuadrícula del juego, por lo que las cajas de cerillas con disposiciones donde las posiciones en la cuadrícula ya estaban ocupadas no tendrían cuentas para esa posición. Además, en el frente de la bandeja había dos piezas de cartón adicionales en forma de "V", [ 10 ] la punta de la "V" apuntando hacia el frente de la caja de cerillas. [ 11 ] Michie y su equipo de inteligencia artificial llamaron al algoritmo de MENACE "Boxes", [ 7 ] en honor al aparato utilizado para la máquina. La primera etapa de "Boxes" operaba en cinco fases, cada una estableciendo una definición y un precedente para las reglas del algoritmo en relación con el juego. [ 14 ]

Operación

Un ejemplo de juego jugado por MENACE (O) y un humano (X) usando cuentas de los colores originales de Michie ; como MENACE perdió este juego, todas las cuentas mostradas se retiran de sus respectivas cajas [ 15 ] [ 16 ]

MENACE jugaba primero, como O, ya que todas las cajas de cerillas representaban permutaciones relevantes solo para el jugador "X". [ 12 ] [ 17 ] Para recuperar la elección de movimiento de MENACE, el oponente u operador localizaba la caja de cerillas que coincidía con el estado actual del juego, o una rotación o imagen especular del mismo. Por ejemplo, al comienzo de un juego, esta sería la caja de cerillas para una cuadrícula vacía. Se retiraba la bandeja y se agitaba ligeramente para mover las cuentas. [ 5 ] Entonces, la cuenta que había rodado hasta la punta de la forma de "V" en el frente de la bandeja era el movimiento que MENACE había elegido hacer. [ 5 ] Su color se utilizaba entonces como la posición para jugar, y, después de tener en cuenta las rotaciones o volteos necesarios según la relación de la configuración de la caja de cerillas elegida con la cuadrícula actual, se colocaba la O en esa casilla. Luego el jugador realizaba su movimiento, se localizaba el nuevo estado, se seleccionaba un nuevo movimiento, y así sucesivamente, hasta que terminaba el juego. [ 12 ]

Cuando el juego terminó, el jugador humano observó el resultado. A medida que se desarrollaba el juego, cada caja de cerillas utilizada en el turno de MENACE volvía a colocar su bandeja entreabierta, y la cuenta utilizada se guardaba aparte, de modo que se registraban las elecciones de movimientos de MENACE y los estados del juego a los que pertenecían. Michie describió su sistema de refuerzo con "recompensa" y "castigo". Una vez finalizado el juego, si MENACE había ganado, recibía una "recompensa" por su victoria. Las cuentas retiradas mostraban la secuencia de los movimientos ganadores. [ 17 ] Estas se devolvían a sus respectivas bandejas, fácilmente identificables ya que estaban ligeramente abiertas, junto con tres cuentas de bonificación del mismo color. [ 11 ] De esta manera, en juegos futuros, MENACE tendría más probabilidades de repetir esos movimientos ganadores, reforzando así las estrategias ganadoras. Si perdía, las cuentas retiradas no se devolvían, "castigando" a MENACE, lo que significaba que en el futuro sería menos probable, y eventualmente incapaz si faltaba una cuenta de ese color, de repetir los movimientos que causaban una derrota. [ 4 ] [ 8 ] Si el juego terminaba en empate, se añadía una cuenta adicional a cada casilla. [ 11 ]

Resultados en la práctica

Estrategia óptima

Estrategia óptima de tres en raya
Estrategia óptima para el jugador X si comienza en una esquina. En cada cuadrícula, la X roja sombreada indica el movimiento óptimo, y la ubicación del siguiente movimiento de O proporciona la siguiente subcuadrícula a examinar.

El tres en raya tiene una estrategia óptima bien conocida. [ 18 ] Un jugador debe colocar su símbolo de manera que impida al otro jugador formar filas, mientras que él mismo forma una. Sin embargo, si ambos jugadores usan esta estrategia, el juego siempre termina en empate. [ 18 ] Si el jugador humano conoce la estrategia óptima y MENACE puede aprenderla rápidamente, entonces los juegos eventualmente solo terminarán en empate. La probabilidad de que la computadora gane aumenta rápidamente cuando juega contra un oponente aleatorio. [ 4 ]

Cuando se juega contra un jugador que usa la estrategia óptima, las probabilidades de un empate aumentan al 100%. En el torneo oficial de Donald Michie contra MENACE en 1961 [ 5 ] usó la estrategia óptima, y ​​él y la computadora comenzaron a empatar consistentemente después de veinte juegos. El torneo de Michie [ 19 ] tuvo los siguientes hitos: Michie comenzó abriendo consistentemente con "Variante 0", la casilla central. En 15 juegos, MENACE abandonó todas las aperturas que no fueran de esquina. Con poco más de 20, Michie cambió a usar consistentemente "Variante 1", la casilla inferior derecha. En 60, regresó a la Variante 0. Cuando se acercaba a 80 juegos, pasó a "Variante 2", la superior central. En 110, cambió a "Variante 3", la superior derecha. En 135, cambió a "Variante 4", la central derecha. A los 190 años, volvió a la Variante 1, y a los 210, volvió a la Variante 0.

La tendencia en los cambios de cuentas en las cajas "2" es la siguiente: [ 19 ]

Correlación

Gráfico de dispersión del torneo de Michie.
Un gráfico de dispersión que muestra los resultados de los juegos de Donald Michie contra MENACE.

Dependiendo de la estrategia empleada por el jugador humano, MENACE produce una tendencia diferente en los gráficos de dispersión de victorias. [ 5 ] Usar un turno aleatorio del jugador humano da como resultado una tendencia positiva casi perfecta. Jugar la estrategia óptima produce un aumento ligeramente más lento. [ 4 ] El refuerzo no crea un estándar perfecto de victorias; el algoritmo extraerá conclusiones aleatorias e inciertas cada vez. Después de la j -ésima ronda, la correlación del juego casi perfecto es la siguiente:

1DDD(j+2)i=0jD(ji+1)Vi{\displaystyle {1-D \over DD^{(j+2)}}\sum _{i=0}^{j}D^{(ji+1)}V_{i}}

Donde V i es el resultado (+1 es victoria, 0 es empate y -1 es derrota) y D es el factor de decaimiento (promedio de los valores pasados ​​de victorias y derrotas). A continuación, M n es el multiplicador para la n -ésima ronda del juego. [ 5 ]

Legado

MENACE, de Donald Michie, demostró que una computadora podía aprender de los fracasos y los éxitos para mejorar en una tarea. [ 17 ] Utilizó principios que se convertirían en fundamentales en el campo del aprendizaje automático antes de que se teorizaran adecuadamente. Por ejemplo, la combinación de cómo MENACE comienza con un número igual de tipos de cuentas en cada caja de cerillas, y cómo estas se seleccionan al azar, crea un comportamiento de aprendizaje similar a la inicialización de pesos en las redes neuronales artificiales modernas . [ 20 ] En 1968, Donald Michie y RA Chambers crearon otro algoritmo basado en BOXES llamado GLEE (Game Learning Expectimaxing Engine) que tenía que aprender a equilibrar un poste sobre un carro. [ 21 ]

Después de la rotunda recepción de MENACE, Michie fue invitado a la Oficina de Investigación Naval de los Estados Unidos , donde se le encargó construir un programa que ejecutara BOXES para una computadora IBM para su uso en la Universidad de Stanford . [ 22 ] Michie creó un programa de simulación de MENACE en una computadora Pegasus 2 con la ayuda de D. Martin. [ 5 ] Ha habido múltiples recreaciones de MENACE en años más recientes, tanto en su forma física original como en un programa de computadora. [ 12 ] Su algoritmo convergió más tarde en el algoritmo Q-Learning de Christopher Watkin . [ 23 ] Aunque no como una computadora funcional, en ejemplos de demostración, MENACE se ha utilizado como ayuda didáctica para varias clases de redes neuronales, [ 24 ] [ 25 ] [ 26 ] incluyendo una demostración pública del investigador del University College London Matthew Scroggs. [ 27 ] [ 28 ] Una copia de MENACE construida por Scroggs apareció en las Conferencias Navideñas de la Royal Institution de 2019 , [ 29 ] [ 30 ] y en un episodio de QI XL de 2023. [ 31 ]

MENACE se menciona en el cuento de Fred Saberhagen de 1963 , Without A Thought , y en la novela de Thomas J Ryan de 1977, The Adolescence of P-1 . [ 32 ] En su libro de 2023 , The Future , la autora Naomi Alderman incluye una conferencia ficticia con una descripción detallada de MENACE.

Véase también

Referencias

  1. 1 2 3 Donald, Michie; Chambers, Roger (1968). E. Dale y D. Michie (eds.). BOXES: Un experimento en control adaptativo . Machine Intelligence. Vol.  2. Universidad de Edimburgo. pp. 137–152 . CiteSeerX 10.1.1.474.2430 . Archivado del original el 26 de junio de 2020. Recuperado el 31 de julio de 2020 .  
  2. Boden, Margaret (15 de agosto de 2007). " Donald Michie (1923–2007)" . Nature . 448 (7155): 765. doi : 10.1038/448765a . ISSN 1476-4687 . PMID 17700692. S2CID 5239830 .   
  3. 1 2 Wright, Matt (31 de marzo de 2020). "Donald Michie: El pionero de la IA que probó su programa informático con una caja de cerillas y algunas cuentas" . Scroll.in . Archivado del original el 20 de octubre de 2020. Recuperado el 18 de octubre de 2020 .
  4. 1 2 3 4 Child, Oliver (13 de marzo de 2016). "Menace: the Machine Educable Noughts And Crosses Engine" . Chalkdust . Archivado del original el 12 de mayo de 2020. Recuperado el 17 de mayo de 2020 .
  5. 1 2 3 4 5 6 7 8 9 10 11 Michie, Donald. "Experimentos sobre la mecanización del aprendizaje de juegos Parte 1. Caracterización del modelo y sus parámetros" (PDF) . Archivado (PDF) del original el 21 de noviembre de 2019. Recuperado el 1 de junio de 2020 .
  6. "Obituario de Donald Michie en el Daily Telegraph" . The Daily Telegraph . 9 de julio de 2007. Archivado del original el 11 de junio de 2020. Consultado el 25 de mayo de 2021 .
  7. 1 2 Muggleton, Stephen (10 de julio de 2007). "Obituario de Donald Michie, un artículo en The Guardian de 2007" . The Guardian . Archivado del original el 1 de octubre de 2020. Recuperado el 22 de mayo de 2021 .
  8. 1 2 Hardingham, Samantha; Frazer, John; Jones, Emma Letizia (2012). "John Frazer en conversación con Samantha Hardingham" . AA Files (64): 69–77 . ISSN 0261-6823 . JSTOR 41762307 .  
  9. Wylie, Caspar (5 de octubre de 2018). "Cómo 300 cajas de cerillas aprendieron a jugar al tres en raya usando MENACE" . Open Data Science . Archivado del original el 15 de mayo de 2021. Recuperado el 15 de mayo de 2021 .
  10. 1 2 El libro de ciencias, segunda edición, Dorling Kindersley Ltd., 2015, pág. 288
  11. 1 2 3 4 Gardner, Martin (1962). "Juegos matemáticos". Scientific American . 206 (3): 138– 154. Bibcode : 1962SciAm.206c.138G . doi : 10.1038/scientificamerican0362-138 . JSTOR 24937263 . 
  12. 1 2 3 4 "Motor de tres en raya educable Matchbox en modelado empírico" (PDF) . Universidad de Warwick . Recuperado el 22 de mayo de 2021 .
  13. De Raedt, Luc. " La revolución del aprendizaje automático en la IA ". Archivado del original el 12 de junio de 2020.
  14. Russel, David (2012). Extracto de «La metodología BOXES». (Capítulo 2. La metáfora del juego) . Londres: Springer Professional. ISBN 978-1849965279.
  15. "Menace: The Machine Educable Noughts and Crosses Engine" . 13 de marzo de 2016.
  16. Michie, Donald (noviembre de 1963). "Experimentos sobre la mecanización del aprendizaje de juegos. Parte I: Caracterización del modelo y sus parámetros" . The Computer Journal . 6 (3): 232–236 . doi : 10.1093/comjnl/6.3.232 . Consultado el 28 de agosto de 2024 .
  17. 1 2 3 "MENACE 2, una inteligencia artificial hecha de cajones de madera y cuentas de colores" . 12 de abril de 2016. Archivado del original el 12 de julio de 2020. Recuperado el 22 de mayo de 2021 .
  18. 1 2 Cappiell, Emily (30 de noviembre de 2020). "Cómo ganar al tres en raya: las estrategias que necesitas dominar" . Reader's Digest . Archivado del original el 22 de enero de 2021. Recuperado el 6 de febrero de 2021 .
  19. 1 2 Ensayo y error, Michie Donald, Penguin Science Surveys 1961 Vol 2
  20. Yam, Jim YF; Chow, Tommy WS (1 de enero de 2000). "Un método de inicialización de pesos para mejorar la velocidad de entrenamiento en redes neuronales de alimentación directa" . Neurocomputing . 30 (1): 219– 232. doi : 10.1016/S0925-2312(99)00127-7 . ISSN 0925-2312 . 
  21. Sutton, Richard S.; Barto, Andrew G. (2018). Aprendizaje por refuerzo: una introducción . MIT Press. pág. 753. ISBN  978-0262039246.
  22. "Profesor Donald Michie" . The Daily Telegraph . 8 de julio de 2007. ISSN 0307-1235 . Archivado del original el 11 de junio de 2020. Consultado el 11 de junio de 2020 . 
  23. Scaruffi, Piero (2014). La inteligencia no es artificial: por qué la singularidad no llegará pronto y otras meditaciones sobre la condición posthumana y el futuro de la inteligencia.Omniware. pág.  27. ISBN 978-0976553199.
  24. Zhao, Yibo (1 de diciembre de 2013). "Motor educable de máquina sobre tres en raya en el estudio de modelos" . Universidad de Warwick. Archivado del original el 11 de junio de 2020. Recuperado el 22 de mayo de 2021 .
  25. "Temas de IA... Estrategia de tres en raya en el pensamiento computacional, Introducción, MENACE" . Archivado del original el 8 de febrero de 2021. Recuperado el 22 de mayo de 2021 .
  26. Ute Schmid – "Aprendizaje interactivo con explicaciones mutuas" (Cómo los humanos y los sistemas de aprendizaje automático pueden beneficiarse mutuamente) – Universidad de Bamberg, Alemania Enlace
  27. Scroggs, Matthew (3 de julio de 2017).'Construyendo una máquina MENACE', Matthew Scroggs, University College London (Youtube).
  28. "Inspirando a la próxima generación de científicos informáticos | King's Worcester" . King's Worcester . 11 de noviembre de 2019. Archivado del original el 12 de junio de 2020. Consultado el 12 de junio de 2020 .
  29. Scroggs, Matthew (27 de diciembre de 2019). "Visualizando el aprendizaje de MENACE" . mscroggs.co.uk . Archivado del original el 11 de julio de 2020. Recuperado el 30 de julio de 2020 .
  30. @rsi_science (27 de diciembre de 2019). "El creador de Menace Machine se presentó con sus 304 cajas de cerillas para explicar cómo la hizo" ( Tweet ) . Recuperado el 14 de octubre de 2020 vía Twitter .
  31. "QI XL Series T, Ticks Tax Toes" . BBC . 6 de enero de 2023. Consultado el 4 de febrero de 2023 .
  32. Scroggs, Matthew (16 de diciembre de 2018). "La amenaza en la ficción" . mscroggs.co.uk . Archivado del original el 11 de julio de 2020. Recuperado el 18 de marzo de 2020 .

Fuentes

  • Michie, D.; Chambers, RA (1968), "BOXES: Un experimento en control adaptativo", Machine Intelligence , Edimburgo, Reino Unido: Oliver and Boyd, S2CID 18229198 vía Semantic Scholar , el artículo de Michie y R. A. Chambers sobre las implicaciones de IA de BOXES y MENACE.
  • Russell, David W. (2012), La metodología BOXES: Control dinámico de caja negra , Springer London, ISBN 978-1849965286, un libro sobre el algoritmo "Boxes" empleado por MENACE.
  • Simulación en línea de MENACE