Articulo de referencia

Mejor respuesta

En la teoría de juegos , la mejor respuesta es la estrategia (o estrategias) que produce el resultado más favorable para un jugador, considerando las estrategias de los demás ju...

En la teoría de juegos , la mejor respuesta es la estrategia (o estrategias) que produce el resultado más favorable para un jugador, considerando las estrategias de los demás jugadores como dadas. [ 1 ] El concepto de mejor respuesta es fundamental para la contribución más conocida de John Nash , el equilibrio de Nash , el punto en el que cada jugador en un juego ha seleccionado la mejor respuesta (o una de las mejores respuestas) a las estrategias de los demás jugadores. [ 2 ]

Correspondencia

Figura 1. Correspondencia de reacciones para el jugador Y en el juego de la Caza del Ciervo.

Las correspondencias de reacción , también conocidas como correspondencias de mejor respuesta, se utilizan en la prueba de la existencia de equilibrios de Nash de estrategia mixta . [ 3 ] [ 4 ] Las correspondencias de reacción no son "funciones de reacción" ya que las funciones deben tener solo un valor por argumento, y muchas correspondencias de reacción estarán indefinidas, es decir, una línea vertical, para alguna elección de estrategia del oponente. Se construye una correspondencia b (·) , para cada jugador desde el conjunto de perfiles de estrategia del oponente al conjunto de estrategias del jugador. Así, para cualquier conjunto dado de estrategias del oponente σ −i , b i ( σ −i ) representa las mejores respuestas del jugador i a σ −i .

Figura 2. Correspondencia de reacciones para el jugador X en el juego de la Caza del Ciervo.

Correspondencias de respuesta para todosLos juegos de forma normal de 2 × 2 se pueden representar con una línea para cada jugador en un espacio de estrategia de cuadrado unitario . Las figuras 1 a 3 muestran las correspondencias de mejor respuesta para el juego de la caza del ciervo . La línea punteada en la figura 1 muestra la probabilidad óptima de que el jugador Y juegue 'Ciervo' (en el eje y ), en función de la probabilidad de que el jugador X juegue 'Ciervo' (mostrada en el eje x ). En la figura 2, la línea punteada muestra la probabilidad óptima de que el jugador X juegue 'Ciervo' (mostrada en el eje x ), en función de la probabilidad de que el jugador Y juegue 'Ciervo' (mostrada en el eje y ). Nótese que la figura 2 representa las variables independientes y de respuesta en ejes opuestos a los que se usan normalmente, de modo que se puede superponer al gráfico anterior para mostrar los equilibrios de Nash en los puntos donde coinciden las mejores respuestas de los dos jugadores en la figura 3.

Existen tres formas de correspondencia de reacción distintivas, una para cada uno de los tres tipos de simetría.Juegos de 2 × 2 : juegos de coordinación, juegos de descoordinación y juegos con estrategias dominadas (el cuarto caso trivial en el que las recompensas son siempre iguales para ambos movimientos no es realmente un problema de teoría de juegos). Cualquier pago simétricoEl juego de 2 × 2 adoptará una de estas tres formas.

Juegos de coordinación

Figura 3. Correspondencia de reacción para ambos jugadores en el juego de la Caza del Ciervo. Los equilibrios de Nash se muestran con puntos, donde las correspondencias de los dos jugadores coinciden, es decir, se cruzan.

Los juegos en los que los jugadores obtienen la puntuación más alta cuando ambos eligen la misma estrategia, como la caza del ciervo y la batalla de los sexos , se denominan juegos de coordinación . Estos juegos tienen correspondencias de reacción con la misma forma que la Figura 3, donde hay un equilibrio de Nash en la esquina inferior izquierda, otro en la superior derecha y un equilibrio de Nash de mezcla en algún punto de la diagonal entre los otros dos.

Juegos anti-coordinación

Figura 4. Correspondencia de reacción para ambos jugadores en el juego del halcón y la paloma. Los equilibrios de Nash se muestran con puntos, donde las correspondencias de los dos jugadores coinciden, es decir, se cruzan.

Juegos como el juego del gallina y el juego del halcón-paloma en los que los jugadores obtienen la puntuación más alta cuando eligen estrategias opuestas, es decir, descoordinadas, se denominan juegos de anticoordinación. Tienen correspondencias de reacción (Figura 4) que se cruzan en la dirección opuesta a los juegos de coordinación, con tres equilibrios de Nash, uno en cada una de las esquinas superior izquierda e inferior derecha, donde un jugador elige una estrategia y el otro jugador elige la estrategia opuesta. El tercer equilibrio de Nash es una estrategia mixta que se encuentra a lo largo de la diagonal desde la esquina inferior izquierda hasta la superior derecha. Si los jugadores no saben cuál de ellos es cuál, entonces el Nash mixto es una estrategia evolutivamente estable (ESS) , ya que el juego se limita a la línea diagonal de la esquina inferior izquierda a la superior derecha. De lo contrario, se dice que existe una asimetría no correlacionada , y los equilibrios de Nash de las esquinas son ESS .

Juegos con estrategias dominadas

Figura 5. Correspondencia de reacción para un juego con una estrategia dominada.

Los juegos con estrategias dominadas tienen correspondencias de reacción que solo se cruzan en un punto, que estará en la esquina inferior izquierda o superior derecha en simetría de pago.Juegos de 2 × 2. Por ejemplo, en el dilema del prisionero de una sola partida , la jugada "Cooperar" no es óptima para ninguna probabilidad de cooperación del oponente. La Figura 5 muestra la correspondencia de reacción para dicho juego, donde las dimensiones son "Probabilidad de jugar Cooperar", el equilibrio de Nash se encuentra en la esquina inferior izquierda, donde ninguno de los jugadores juega Cooperar. Si las dimensiones se definieran como "Probabilidad de jugar Defraudar", entonces las curvas de mejor respuesta de ambos jugadores serían 1 para todas las probabilidades de estrategia del oponente y las correspondencias de reacción se cruzarían (y formarían un equilibrio de Nash) en la esquina superior derecha.

Otros juegos (con pagos asimétricos)

Es posible una gama más amplia de formas de correspondencias de reacción enJuegos de 2 × 2 con asimetrías en las recompensas. Para cada jugador, existen cinco posibles formas de respuesta óptimas, que se muestran en la Figura 6. De izquierda a derecha, estas son: estrategia dominada (siempre jugar 2), estrategia dominada (siempre jugar 1), ascendente (jugar la estrategia 2 si la probabilidad de que el otro jugador juegue 2 está por encima del umbral), descendente (jugar la estrategia 1 si la probabilidad de que el otro jugador juegue 2 está por encima del umbral) e indiferente (ambas estrategias funcionan igual de bien en todas las condiciones).

Figura 6 - Las cinco posibles correspondencias de reacción para un jugador en unJuego de 2 × 2. Se supone que los ejes muestran la probabilidad de que el jugador juegue su estrategia 1. De izquierda a derecha: A) Siempre juega 2, la estrategia 1 está dominada, B) Siempre juega 1, la estrategia 2 está dominada, C) La estrategia 1 es la mejor cuando el oponente juega su estrategia 1 y la 2 es la mejor cuando el oponente juega su 2, D) La estrategia 1 es la mejor cuando el oponente juega su estrategia 2 y la 2 es la mejor cuando el oponente juega su 1, E) Ambas estrategias funcionan igual de bien sin importar lo que juegue el oponente.

Si bien solo existen cuatro tipos posibles de pago simétricoEn los juegos de 2 × 2 (uno de los cuales es trivial), las cinco curvas de mejor respuesta diferentes por jugador permiten un mayor número de tipos de juegos asimétricos en cuanto a las recompensas. Muchos de estos no son realmente diferentes entre sí. Las dimensiones pueden redefinirse (intercambiando los nombres de las estrategias 1 y 2) para producir juegos simétricos que son lógicamente idénticos.

Monedas iguales

Un juego conocido con asimetrías en las recompensas es el juego de las monedas . En este juego, un jugador, el jugador de la fila (representado en el eje Y), gana si ambos jugadores coordinan sus acciones (ambos eligen cara o ambos eligen cruz), mientras que el otro jugador, el jugador de la columna (representado en el eje X ), gana si no coordinan sus acciones. La respuesta del jugador Y corresponde a un juego de coordinación, mientras que la del jugador X corresponde a un juego de descoordinación. El único equilibrio de Nash es la combinación de estrategias mixtas en la que ambos jugadores eligen independientemente cara o cruz con una probabilidad de 0,5 cada una.

Figura 7. Correspondencias de reacción para los jugadores en el juego de emparejar monedas . El diagrama de la izquierda corresponde al jugador coordinador, mientras que el del centro muestra la correspondencia para el jugador descoordinado. El único equilibrio de Nash se muestra en el gráfico de la derecha.

Dinámica

En la teoría de juegos evolutiva , la dinámica de mejor respuesta representa una clase de reglas de actualización de estrategias, donde las estrategias de los jugadores en la siguiente ronda están determinadas por sus mejores respuestas a un subconjunto de la población. Algunos ejemplos incluyen:

  • En un modelo de población grande, los jugadores eligen su siguiente acción de forma probabilística, basándose en qué estrategias son las mejores respuestas para la población en su conjunto.
  • En un modelo espacial, los jugadores eligen (en la siguiente ronda) la acción que es la mejor respuesta a todos sus vecinos. [ 5 ]

Es importante destacar que, en estos modelos, los jugadores solo eligen la mejor respuesta en la siguiente ronda, aquella que les reporte la mayor ganancia . No consideran el impacto que la elección de una estrategia en la siguiente ronda tendría en el desarrollo futuro del juego. Esta limitación hace que la regla dinámica se denomine a menudo " mejor respuesta miope" .

En la teoría de juegos potenciales , la dinámica de mejor respuesta se refiere a una forma de encontrar un equilibrio de Nash calculando la mejor respuesta para cada jugador:

Teorema : En cualquier juego de potencial finito, la dinámica de mejor respuesta siempre converge a un equilibrio de Nash. [ 6 ]

Suavizado

Figura 8. Correspondencia BR (negro) y funciones BR suavizadas (colores).

En lugar de correspondencias de mejor respuesta, algunos modelos utilizan funciones de mejor respuesta suavizadas . Estas funciones son similares a las correspondencias de mejor respuesta, con la diferencia de que no "saltan" de una estrategia pura a otra. La diferencia se ilustra en la Figura 8, donde el negro representa la correspondencia de mejor respuesta y los demás colores representan diferentes funciones de mejor respuesta suavizadas. En las correspondencias de mejor respuesta estándar, incluso el más mínimo beneficio para una acción hará que el individuo la realice con probabilidad 1. En las funciones de mejor respuesta suavizadas, a medida que disminuye la diferencia entre dos acciones, la probabilidad de que el individuo realice la acción se aproxima a 50:50.

Existen muchas funciones que representan funciones de respuesta óptima suavizadas. Las funciones que se ilustran aquí son varias variaciones de la siguiente función:

mimi(1)/γmimi(1)/γ+mimi(2)/γ{\displaystyle {\frac {e^{E(1)/\gamma }}{e^{E(1)/\gamma }+e^{E(2)/\gamma }}}}

donde E ( x ) representa la recompensa esperada de la acción x , y γ es un parámetro que determina el grado en que la función se desvía de la verdadera mejor respuesta (un γ mayor implica que el jugador tiene más probabilidades de cometer 'errores').

El uso de la mejor respuesta suavizada presenta varias ventajas, tanto teóricas como empíricas. En primer lugar, es coherente con los experimentos psicológicos; cuando los individuos son prácticamente indiferentes entre dos acciones, parecen elegir más o menos al azar. En segundo lugar, el juego de los individuos está determinado de forma unívoca en todos los casos, ya que se trata de una correspondencia que también es una función . Finalmente, el uso de la mejor respuesta suavizada con algunas reglas de aprendizaje (como en el juego ficticio ) puede dar lugar a que los jugadores aprendan a jugar equilibrios de Nash de estrategia mixta . [ 7 ]

Véase también

Referencias

Bibliografía

  • Ellison, G. (1993), "Aprendizaje, interacción local y coordinación" (PDF) , Econometrica , 61 (5): 1047–1071 , doi : 10.2307/2951493 , JSTOR 2951493 
  • Fudenberg, D.; Levine, David K. (1998), La teoría del aprendizaje en los juegos , Cambridge, Massachusetts: MIT Press
  • Fudenberg, Drew ; Tirole, Jean (1991), Teoría de juegos , Cambridge, Massachusetts: MIT Press , ISBN 9780262061414Vista previa del libro.
  • Gibbons, R. (1992), Introducción a la teoría de juegos , Harvester-Wheatsheaf, S2CID 10248389 
  • Nash, John F. (1950), "Puntos de equilibrio en juegos de n personas", Actas de la Academia Nacional de Ciencias de los Estados Unidos de América , 36 (1): 48– 49, Bibcode : 1950PNAS...36...48N , doi : 10.1073/pnas.36.1.48 , PMC 1063129 , PMID 16588946  
  • Nisan, N.; Roughgarden, T.; Tardos, É.; Vazirani, VV (2007), Teoría de juegos algorítmica (PDF) , Nueva York: Cambridge University Press
  • Osborne, MJ; Rubinstein, Ariel (1994), Un curso de teoría de juegos , Cambridge, Massachusetts: MIT Press
  • Young, HP (2005), Aprendizaje estratégico y sus límites , Oxford University Press