Articulo de referencia

desafío del esquema de Winograd

El desafío del esquema de Winograd ( WSC ) es una prueba de inteligencia artificial propuesta en 2012 por Hector Levesque , científico informático de la Universidad de Toronto ....

El desafío del esquema de Winograd ( WSC ) es una prueba de inteligencia artificial propuesta en 2012 por Hector Levesque , científico informático de la Universidad de Toronto . Diseñado para ser una mejora de la prueba de Turing , es una prueba de opción múltiple que emplea esquemas de Winograd , preguntas de una estructura muy específica que llevan el nombre de Terry Winograd , profesor de informática de la Universidad de Stanford . [ 1 ]

En apariencia, las preguntas del esquema de Winograd simplemente requieren la resolución de la anáfora : la máquina debe identificar el antecedente de un pronombre ambiguo en una oración. Esto la convierte en una tarea de procesamiento del lenguaje natural , pero Levesque argumenta que, para los esquemas de Winograd, la tarea requiere el uso de conocimiento y razonamiento de sentido común . [ 2 ]

El desafío se considera "superado" desde 2019, cuando varios modelos de lenguaje basados ​​en transformadores lograron precisiones superiores al 90%. [ 3 ]

Historia

El desafío del esquema de Winograd se propuso inspirado en la prueba de Turing . Propuesta por Alan Turing en 1950, la prueba de Turing desempeña un papel fundamental en la filosofía de la inteligencia artificial . Turing propuso que, en lugar de debatir si una máquina puede pensar, la ciencia de la IA debería centrarse en demostrar un comportamiento inteligente, que puede ser comprobado. Sin embargo, la naturaleza exacta de la prueba propuesta por Turing ha sido objeto de escrutinio, especialmente desde que un chatbot de IA llamado Eugene Goostman afirmó haberla superado en 2014. Una de las principales preocupaciones con la prueba de Turing es que una máquina podría superarla fácilmente mediante fuerza bruta o engaños, en lugar de verdadera inteligencia. [ 4 ]

El desafío del esquema de Winograd se propuso en 2012 en parte para mejorar los problemas que salieron a la luz con la naturaleza de los programas que tuvieron un buen desempeño en la prueba. [ 5 ]

La propuesta original de Turing fue lo que él denominó el juego de imitación , que consiste en conversaciones fluidas y sin restricciones en inglés entre jueces humanos y programas informáticos a través de un canal exclusivamente de texto (como el teletipo). En general, la máquina supera la prueba si los interrogadores no pueden distinguir entre ella y un humano en una conversación de cinco minutos. [ 4 ]

Nuance Communications anunció en julio de 2014 que patrocinaría una competencia anual de WSC, con un premio de $25,000 para el mejor sistema que pudiera igualar el rendimiento humano. [ 6 ] Sin embargo, el premio ya no se ofrece.

Debilidades de la prueba de Turing

El desempeño de Eugene Goostman exhibió algunos de los problemas de la prueba de Turing. Levesque identifica varios problemas importantes, [ 2 ] resumidos de la siguiente manera: [ 7 ]

  • Engaño: La máquina se ve obligada a construir una identidad falsa, lo cual no forma parte de la inteligencia.
  • Conversación: Mucha interacción puede considerarse una "conversación legítima" (bromas, comentarios ingeniosos, cuestiones de orden) sin necesidad de razonamiento inteligente.
  • Evaluación: Los seres humanos cometen errores y los jueces a menudo no se ponen de acuerdo sobre los resultados.

Esquemas de Winograd

El factor clave en el WSC es el formato especial de sus preguntas, derivadas de los esquemas de Winograd. Este tipo de preguntas pueden diseñarse para requerir conocimientos y razonamiento de sentido común en diversos ámbitos. Además, deben redactarse cuidadosamente para que las respuestas no se vean sesgadas por restricciones de selección o información estadística sobre las palabras de la oración.

Origen

El primer ejemplo citado de un esquema de Winograd (y la razón de su nombre) se debe a Terry Winograd : [ 8 ]

Los concejales de la ciudad negaron el permiso a los manifestantes porque temían o promovían la violencia.

Las opciones de "temido" y "defensor" convierten el esquema en sus dos instancias:

Los concejales de la ciudad denegaron el permiso a los manifestantes por temor a que se produjeran actos de violencia.

Los concejales de la ciudad denegaron el permiso a los manifestantes porque estos incitaban a la violencia.

La pregunta del desafío del esquema es: "¿El pronombre 'ellos' se refiere a los concejales o a los manifestantes?". Cambiar entre las dos instancias del esquema modifica la respuesta. La respuesta es inmediata para un lector humano, pero resulta difícil de emular en máquinas. Levesque [ 2 ] argumenta que el conocimiento desempeña un papel fundamental en estos problemas: la respuesta a este esquema tiene que ver con nuestra comprensión de las relaciones típicas y el comportamiento de los concejales y los manifestantes.

Desde la propuesta original del desafío del esquema de Winograd, Ernest Davis, profesor de la Universidad de Nueva York , ha compilado una lista de más de 140 esquemas de Winograd de diversas fuentes como ejemplos de los tipos de preguntas que deberían aparecer en el desafío del esquema de Winograd. [ 9 ]

Descripción formal

Una pregunta de desafío del esquema de Winograd consta de tres partes:

  1. Una oración o discurso breve que contiene lo siguiente:
    • Dos frases nominales de la misma clase semántica (masculino, femenino, inanimado o grupo de objetos o personas),
    • Un pronombre ambiguo que puede referirse a cualquiera de las frases nominales anteriores, y
    • Una palabra especial y una palabra alternativa, de tal manera que si la palabra especial se reemplaza por la palabra alternativa, la resolución natural del pronombre cambia.
  2. Una pregunta que indaga la identidad del pronombre ambiguo, y
  3. Dos opciones de respuesta que corresponden a las frases nominales en cuestión.

A la máquina se le presentará el problema en un formato estandarizado que incluye las opciones de respuesta, convirtiéndolo así en un problema de decisión binaria .

Ventajas

El desafío del esquema de Winograd tiene las siguientes supuestas ventajas:

  • Para resolverlos se requieren conocimientos y razonamiento de sentido común.
  • Se pueden diseñar esquemas de Winograd de dificultad variable, que abarcan desde simples relaciones de causa y efecto hasta narrativas complejas de eventos.
  • Pueden estar diseñados para evaluar la capacidad de razonamiento en dominios específicos (por ejemplo, razonamiento social/psicológico o espacial).
  • No hay necesidad de jueces humanos. [ 5 ]

Escollos

Una dificultad del desafío del esquema de Winograd radica en el desarrollo de las preguntas. Estas deben diseñarse cuidadosamente para garantizar que requieran razonamiento de sentido común para su resolución. Por ejemplo, Levesque [ 5 ] ofrece el siguiente ejemplo de un supuesto esquema de Winograd que resulta "demasiado fácil":

Las mujeres dejaron de tomar las pastillas porque estaban [embarazadas/cancerígenas]. ¿Qué individuos estaban [embarazados/cancerígenos]?

La respuesta a esta pregunta puede determinarse a partir de restricciones de selección : en cualquier situación, las píldoras no se quedan embarazadas, las mujeres sí; las mujeres no pueden ser cancerígenas, pero las píldoras sí. Por lo tanto, esta respuesta podría derivarse sin necesidad de razonamiento ni de comprender el significado de las oraciones; lo único necesario son datos sobre las restricciones de selección de embarazo y carcinogenicidad.

Actividad

En 2016 y 2018, Nuance Communications patrocinó un concurso, ofreciendo un gran premio de 25 000 dólares para el participante con la puntuación más alta, superior al 90 % (en comparación, los humanos responden correctamente al 92-96 % de las preguntas del WSC [ 10 ] ). Sin embargo, nadie estuvo cerca de ganar el premio en 2016 y el concurso de 2018 se canceló por falta de participantes; [ 11 ] el premio ya no se ofrece. [ 12 ]

El Duodécimo Simposio Internacional sobre Formalizaciones Lógicas del Razonamiento de Sentido Común se celebró del 23 al 25 de marzo de 2015 en la Serie de Simposios de Primavera de la AAAI en la Universidad de Stanford, con especial énfasis en el desafío del esquema de Winograd. El comité organizador incluyó a Leora Morgenstern ( Leidos ), Theodore Patkos (The Foundation for Research & Technology Hellas) y Robert Sloan ( Universidad de Illinois en Chicago ). [ 13 ]

El Desafío de Esquemas de Winograd 2016 se llevó a cabo el 11 de julio de 2016 en IJCAI-16. Hubo cuatro concursantes. La primera ronda del concurso consistió en resolver PDP (problemas de desambiguación de pronombres), adaptados de fuentes literarias, no construidos como pares de oraciones. [ 14 ] La puntuación más alta obtenida fue del 58 % de respuestas correctas, por Quan Liu et al., de la Universidad de Ciencia y Tecnología de China. [ 15 ] Por lo tanto, según las reglas de ese desafío, no se otorgaron premios y el desafío no pasó a la segunda ronda. El comité organizador en 2016 estuvo conformado por Leora Morgenstern, Ernest Davis y Charles Ortiz. [ 16 ]

En 2017, un modelo de asociación neuronal diseñado para la adquisición de conocimiento de sentido común logró una precisión del 70 % en 70 problemas seleccionados manualmente del conjunto de datos original de 273 esquemas de Winograd. [ 17 ] En junio de 2018, se logró una precisión del 63,7 % en el conjunto de datos completo utilizando un conjunto de modelos de lenguaje de redes neuronales recurrentes , [ 18 ] lo que marcó el primer uso de redes neuronales profundas que aprenden de corpus independientes para adquirir conocimiento de sentido común. En 2019, se logró una puntuación del 90,1 % en el conjunto de datos original del esquema de Winograd mediante el ajuste fino del modelo de lenguaje BERT con datos de entrenamiento apropiados similares a WSC para evitar tener que aprender razonamiento de sentido común. [ 10 ] El modelo de lenguaje general GPT-3 logró una puntuación del 88,3 % sin ajuste fino específico en 2020. [ 19 ]

En 2019 se diseñó un conjunto de datos más desafiante y competitivo, denominado "Winogrande", con 44 000 problemas. Este conjunto de datos consiste en oraciones con espacios en blanco, a diferencia del formato de pronombres de los conjuntos de datos anteriores. [ 10 ]

Una versión del desafío del esquema de Winograd es una parte de la colección de desafíos de referencia GLUE ( General Language Understanding Evaluation ) en comprensión automatizada del lenguaje natural . [ 20 ]

Referencias

  1. Ackerman, Evan (29 de julio de 2014). "¿Pueden los esquemas de Winograd reemplazar la prueba de Turing para definir la IA a nivel humano?" . IEEE Spectrum . Recuperado el 29 de octubre de 2014 .
  2. 1 2 3 Levesque, HJ (2014). "Sobre nuestro mejor comportamiento" . Inteligencia Artificial . 212 : 27–35 . doi : 10.1016/j.artint.2014.03.007 .
  3. Kocijan, Vid; Davis, Ernest; Lukasiewicz, Thomas; Marcus, Gary; Morgenstern, Leora (11 de julio de 2023). "La derrota del desafío del esquema de Winograd" . Inteligencia Artificial . 325 103971. arXiv : 2201.02387 . doi : 10.1016/j.artint.2023.103971 . ISSN 0004-3702 . S2CID 245827747 .  
  4. 1 2 Turing, Alan (octubre de 1950). "Máquinas de computación e inteligencia" (PDF) . Mind . LIX (236): 433–460 . doi : 10.1093/mind/LIX.236.433 . Recuperado el 28 de octubre de 2014 .
  5. 1 2 3 Levesque, Hector; Davis, Ernest; Morgenstern, Leora (2012). El desafío del esquema de Winograd . Actas de la decimotercera Conferencia Internacional sobre Principios de Representación del Conocimiento y Razonamiento .
  6. "Nuance anuncia el desafío de esquemas de Winograd para impulsar la innovación en inteligencia artificial" . Business Wire . 28 de julio de 2014. Consultado el 9 de noviembre de 2014 .
  7. Michael, Julian (18 de mayo de 2015). La teoría de las fórmulas de correlación y su aplicación a la coherencia del discurso (tesis). Repositorio digital de la UT. pág. 6. hdl : 2152/29979 . 
  8. Winograd, Terry (enero de 1972). "Understanding Natural Language" (PDF) . Cognitive Psychology . 3 (1): 1– 191. doi : 10.1016/0010-0285(72)90002-3 . Recuperado el 4 de noviembre de 2014 .
  9. Davis, Ernest. "Una colección de esquemas de Winograd" . cs.nyu.edu . NYU . Consultado el 30 de octubre de 2014 .
  10. 1 2 3 Sakaguchi, Keisuke; Le Brás, Ronan; Bhagavatula, Chandra; Choi, Yejin (2019). "WinoGrande: un desafío adversario del esquema de Winograd a escala". arXiv : 1907.10641 [ cs.CL ].
  11. Boguslavsky, IM; Frolova, TI; Iomdin, LL; Lazursky, AV; Rygaev, IP; Timoshenko, SP (2019). "Enfoque basado en el conocimiento para el desafío del esquema de Winograd" (PDF) . Actas de la Conferencia Internacional de Lingüística Computacional y Tecnologías Intelectuales . Moscú. Archivado del original (PDF) el 8 de octubre de 2023. Recuperado el 1 de agosto de 2020. El premio no pudo ser otorgado a nadie. La mayoría de los participantes mostraron un resultado cercano a la elección aleatoria o incluso peor. La segunda competencia programada para 2018 fue cancelada debido a la falta de participantes potenciales.
  12. "Desafío del esquema de Winograd" . CommonsenseReasoning.org . Consultado el 24 de enero de 2020 .
  13. "Simposios de primavera de la AAAI 2015" . Asociación para el Avance de la Inteligencia Artificial . Consultado el 1 de enero de 2015 .
  14. ^ Davis, Ernesto; Morgenstern, Leora; Ortiz, Charles (otoño de 2017). "El primer desafío del esquema de Winograd en IJCAI-16" . Revista AI .
  15. ^ Liu, Quan; Jiang, Hui; Ling, Zhen-Hua; Zhu, Xiaodan; Wei, Si; Hu, Yu (2016). "Incrustaciones mejoradas de conocimiento de sentido común para resolver problemas de desambiguación de pronombres en el desafío del esquema de Winograd". arXiv : 1611.04146 [ cs.AI ].
  16. Morgenstern, Leora; Davis, Ernest; Ortiz, Charles L. (marzo de 2016). "Planificación, ejecución y evaluación del desafío del esquema de Winograd" . AI Magazine . 37 (1): 50– 54. doi : 10.1609/aimag.v37i1.2639 . ISSN 0738-4602 . 
  17. Liu, Quan; Jiang, Hui; Evdokimov, Andrew; Ling, Zhen-Hua; Zhu, Xiaodan; Wei, Si; Hu, Yu (2017). «Adquisición de conocimiento de causa-efecto y modelo de asociación neuronal para resolver un conjunto de problemas de esquemas de Winograd» . Actas de la Vigésimo Sexta Conferencia Internacional Conjunta sobre Inteligencia Artificial . págs. 2344–2350 . doi : 10.24963/ijcai.2017/326 . ISBN  9780999241103.
  18. Trinh, Trieu H.; Le, Quoc V. (26 de septiembre de 2019). "Un método simple para el razonamiento de sentido común". arXiv : 1806.02847 [ cs.AI ].
  19. Brown, Tom B.; Mann, Benjamin; Ryder, Nick; Subbiah, Melanie; Kaplan, Jared; Dhariwal, Prafulla; Neelakantan, Arvind; Shyam, Pranav; Sastry, Girish; Askell, Amanda; Agarwal, Sandhini; Herbert-Voss, Ariel; Krueger, Gretchen; Henighan, Tom; Child, Rewon; Ramesh, Aditya; Ziegler, Daniel M.; Wu, Jeffrey; Winter, Clemens; Hesse, Christopher; Chen, Mark; Sigler, Eric; Litwin, Mateusz; Gray, Scott; Chess, Benjamin; Clark, Jack; Berner, Christopher; McCandlish, Sam; Radford, Alec; et al. (2020). "Los modelos de lenguaje son aprendices con pocos ejemplos". arXiv : 2005.14165 [ cs.CL ]. 
  20. "GLUE Benchmark" . GlueBenchmark.com . Consultado el 30 de julio de 2019 .
  • Sitio web del concurso patrocinado por Nuance Communications.
  • Kocijan, Vid; Davis, Ernest; Lukasiewicz, Thomas; Marcus, Gary; Morgenstern, Leora (1 de diciembre de 2023). "La derrota del desafío del esquema de Winograd" . Inteligencia Artificial . 325 103971. arXiv : 2201.02387 . doi : 10.1016/j.artint.2023.103971 . ISSN 0004-3702 . 
  • Kocijan, Vid; Lukasiewicz, Thomas; Davis, Ernesto; Marco, Gary; Morgenstern, Leora (2020). "Una revisión de los conjuntos de datos y enfoques del desafío del esquema de Winograd". arXiv : 2004.13831 [ cs.CL ].