Articulo de referencia

Prueba de Turing visual

Ejemplos de preguntas seleccionadas generadas por el generador de consultas para una prueba de Turing visual. La prueba de Turing visual es un dispositivo asistido por un operad...

Ejemplos de preguntas seleccionadas generadas por el generador de consultas para una prueba de Turing visual.

La prueba de Turing visual es un dispositivo asistido por un operador que genera una secuencia estocástica de preguntas binarias a partir de una imagen de prueba dada. [ 1 ] El motor de consulta produce una secuencia de preguntas con respuestas impredecibles según el historial de preguntas. La prueba se basa únicamente en la visión y no requiere procesamiento del lenguaje natural . La tarea del operador humano es proporcionar la respuesta correcta a la pregunta o rechazarla por ambigua. El generador de consultas produce preguntas que siguen una "trama natural", similar a la que siguen los humanos al observar una imagen.

Historia

La investigación en visión artificial se remonta a la década de 1960, cuando Seymour Papert intentó resolver el problema por primera vez. Este intento fallido se conoció como el Proyecto Visión de Verano . La razón de su fracaso radica en que la visión artificial es más compleja de lo que se suele pensar. Esta complejidad está relacionada con el sistema visual humano. Aproximadamente el 50% del cerebro humano se dedica al procesamiento de la visión, lo que indica que se trata de un problema difícil.

Posteriormente, se intentó resolver los problemas con modelos inspirados en el cerebro humano. Los perceptrones de Frank Rosenblatt , una forma de redes neuronales , fueron uno de los primeros enfoques de este tipo. Sin embargo, estas sencillas redes neuronales no cumplieron con las expectativas y presentaban ciertas limitaciones, por lo que no se consideraron en investigaciones posteriores.

Más adelante, con la disponibilidad del hardware y cierta capacidad de procesamiento, la investigación se centró en el procesamiento de imágenes , que implica operaciones a nivel de píxel, como la detección de bordes , la reducción de ruido o la aplicación de filtros, entre otras. Se lograron grandes avances en este campo, pero el problema de la visión, que consistía en lograr que las máquinas comprendieran las imágenes, aún no se había resuelto. Durante este tiempo, las redes neuronales también resurgieron, ya que se demostró que las limitaciones de los perceptrones podían superarse con perceptrones multicapa . Asimismo, a principios de la década de 1990, surgieron las redes neuronales convolucionales , que mostraron excelentes resultados en el reconocimiento de dígitos, pero no escalaron bien a problemas más complejos.

A finales de la década de 1990 y principios de la de 2000 nació la visión artificial moderna. Una de las razones de este auge fue la disponibilidad de algoritmos clave para la extracción y representación de características . Estas características, junto con los algoritmos de aprendizaje automático ya existentes, se utilizaron para detectar, localizar y segmentar objetos en imágenes.

Mientras se producían todos estos avances, la comunidad sintió la necesidad de contar con conjuntos de datos y métricas de evaluación estandarizados para poder comparar el rendimiento. Esto dio lugar a desafíos como el Pascal VOC y el ImageNet . La disponibilidad de métricas de evaluación estándar y los desafíos abiertos orientaron la investigación. Se introdujeron mejores algoritmos para tareas específicas como la detección y clasificación de objetos .

El objetivo de la prueba Visual Turing es dar una nueva dirección a la investigación en visión artificial, lo que conduciría a la introducción de sistemas que estarán un paso más cerca de comprender las imágenes de la misma manera que lo hacen los humanos.

Prácticas de evaluación actuales

Se han anotado y generalizado numerosos conjuntos de datos para comparar el rendimiento de diferentes clases de algoritmos y evaluar distintas tareas de visión (por ejemplo, detección/reconocimiento de objetos) en algún dominio de imágenes (por ejemplo, imágenes de escenas).

Uno de los conjuntos de datos más famosos en visión artificial es ImageNet , que se utiliza para evaluar el problema de la clasificación de imágenes a nivel de objeto. ImageNet es uno de los conjuntos de datos anotados más grandes disponibles y contiene más de un millón de imágenes. Otra tarea importante de visión es la detección y localización de objetos, que se refiere a detectar la instancia del objeto en la imagen y proporcionar las coordenadas del cuadro delimitador alrededor de la instancia del objeto o segmentar el objeto. El conjunto de datos más popular para esta tarea es el conjunto de datos Pascal. De manera similar, existen otros conjuntos de datos para tareas específicas, como el conjunto de datos H3D [ 2 ] para la detección de la postura humana, y el conjunto de datos Core para evaluar la calidad de los atributos de los objetos detectados, como el color, la orientación y la actividad.

Disponer de estos conjuntos de datos estándar ha ayudado a la comunidad de visión artificial a desarrollar algoritmos de alto rendimiento para todas estas tareas. El siguiente paso lógico es crear una tarea más amplia que englobe estas subtareas más pequeñas. Contar con dicha tarea permitiría construir sistemas capaces de comprender imágenes, ya que la comprensión de imágenes implica inherentemente la detección, localización y segmentación de objetos.

Detalles

A diferencia de la prueba de Turing tradicional, la Prueba de Turing Visual (VTT, por sus siglas en inglés) cuenta con un sistema de motor de consultas que interroga a un sistema de visión artificial en presencia de un coordinador humano.

Es un sistema que genera una secuencia aleatoria de preguntas binarias específicas para la imagen de prueba, de manera que la respuesta a cualquier pregunta k es impredecible dadas las respuestas verdaderas a las k  1 preguntas anteriores (también conocidas como historial de preguntas).

La prueba se realiza en presencia de un operador humano cuya función principal es dos: eliminar las preguntas ambiguas y proporcionar las respuestas correctas a las preguntas no ambiguas. Dada una imagen, se pueden formular infinitas preguntas binarias, muchas de las cuales serán ambiguas. Si el motor de búsqueda genera estas preguntas, el moderador humano las elimina y, en su lugar, el motor genera otra pregunta cuya respuesta es impredecible, considerando el historial de preguntas.

El objetivo de la prueba de Turing visual es evaluar la comprensión de imágenes por parte de un sistema informático, y una parte importante de dicha comprensión es la narrativa visual que presenta la imagen. Cuando los humanos observan una imagen, no piensan que hay un coche a ' x ' píxeles de la izquierda y a ' y ' píxeles de la parte superior, sino que la interpretan como una historia; por ejemplo, podrían pensar que hay un coche aparcado en la carretera, una persona que sale del coche y se dirige hacia un edificio. Los elementos más importantes de la narrativa visual son los objetos, por lo que para extraer cualquier narrativa de una imagen, la primera y más importante tarea es instanciar los objetos que contiene, y eso es precisamente lo que hace el motor de consultas.

Motor de consulta

El motor de consultas es el núcleo de la Prueba de Turing Visual y consta de dos partes principales  : vocabulario y preguntas.

Vocabulario

El vocabulario es un conjunto de palabras que representan los elementos de las imágenes. Este vocabulario, al usarse con la gramática adecuada, da lugar a un conjunto de preguntas. La gramática se define en la siguiente sección de manera que genere un espacio de preguntas binarias.

El vocabularioV{\displaystyle {\mathcal {V}}}Consta de tres componentes:

  1. Tipos de objetosT{\displaystyle {\mathcal {T}}}
  2. Atributos dependientes del tipo de los objetosA(t){\displaystyle {\mathcal {A}}(t)}
  3. Relaciones dependientes del tipo entre dos objetosR(t,t){\displaystyle {\mathcal {R}}(t,t')}

Para imágenes de escenas urbanas callejeras, los tipos de objetos incluyen personas , vehículos y edificios . Los atributos se refieren a las propiedades de estos objetos, por ejemplo, mujer, niño, con sombrero o llevando algo , para personas y en movimiento, estacionado, detenido, con una rueda visible o dos ruedas visibles para vehículos. Las relaciones entre cada par de clases de objetos pueden ser "ordenadas" o "no ordenadas". Las relaciones no ordenadas pueden incluir hablar , caminar juntos y las relaciones ordenadas incluyen más alto , más cerca de la cámara, ocluir, estar ocluido, etc.

Regiones de muestra utilizadas como contexto en una prueba de Turing visual. La de la izquierda muestra regiones con 1/8 del tamaño de la imagen y la de la derecha muestra regiones con 1/4 del tamaño de la imagen.

Además, todo este vocabulario se utiliza en el contexto de regiones de imagen rectangulares w ∈ W que permiten la localización de objetos en la imagen. Es posible un número extremadamente grande de dichas regiones, lo que complica el problema. Por lo tanto, para esta prueba, solo se utilizan regiones a escalas específicas, que incluyen 1/16 del tamaño de la imagen, 1/4 del tamaño de la imagen, 1/2 del tamaño de la imagen o mayores.

Preguntas

El espacio de preguntas se compone de cuatro tipos de preguntas:

  • Preguntas de existencia: El objetivo de las preguntas de existencia es encontrar nuevos objetos en la imagen que no hayan sido identificados previamente de forma unívoca. Tienen la siguiente forma  :
Q existe = '¿Existe una instancia de un objeto de tipo t con atributos A parcialmente visible en la región w que no haya sido instanciada previamente?'
  • Preguntas de unicidad: Una pregunta de unicidad intenta identificar de forma única un objeto para instanciarlo.
Q uniq = '¿Existe una instancia única de un objeto de tipo t con atributos A parcialmente visible en la región w que no haya sido instanciada previamente?'

Las preguntas sobre la unicidad, junto con las preguntas sobre la existencia, conforman las preguntas sobre la instanciación. Como se mencionó anteriormente, la instanciación de objetos plantea otras preguntas interesantes y, finalmente, da lugar a una historia. Las preguntas sobre la unicidad siguen a las preguntas sobre la existencia, y una respuesta afirmativa conduce a la instanciación de un objeto.

  • Consultas sobre atributos: Una consulta sobre atributos busca obtener más información sobre el objeto una vez que ha sido instanciado. Estas consultas pueden referirse a un solo atributo, a la combinación de dos atributos o a la disyunción de dos atributos.
Q att (o t ) = {'¿Tiene el objeto o t el atributo a?', '¿El objeto o t tiene el atributo a 1 o el atributo a 2 ?¿ El objeto o t tiene el atributo a 1 y el atributo a 2 ?
  • Preguntas sobre relaciones: Una vez que se han instanciado varios objetos, una pregunta sobre relaciones explora la relación entre pares de objetos.
Q rel (o t ,o t' ) = '¿Tiene el objeto o t una relación r con el objeto o t' ?'

Detalles de implementación

Como se mencionó anteriormente, el núcleo de la Prueba de Turing Visual es el generador de consultas, que genera una secuencia de preguntas binarias de tal manera que la respuesta a cualquier pregunta k es impredecible dadas las respuestas correctas a las k  1 preguntas anteriores. Este es un proceso recursivo: dado un historial de preguntas y sus respuestas correctas, el generador de consultas se detiene porque no hay más preguntas impredecibles, o bien selecciona aleatoriamente una pregunta impredecible y la agrega al historial.

El espacio de preguntas definido anteriormente impone implícitamente una restricción al flujo de las preguntas. Para ser más claros, esto significa que las preguntas sobre atributos y relaciones no pueden preceder a las preguntas de instanciación. Solo cuando los objetos se han instanciado, se pueden consultar sus atributos y relaciones con otros objetos instanciados previamente. Por lo tanto, dado un historial, podemos restringir las posibles preguntas que pueden seguirlo, y este conjunto de preguntas se denomina preguntas candidatas.Qpoder{\displaystyle Q_{\text{puede}}}.

La tarea consiste en elegir una pregunta impredecible de entre las preguntas candidatas, de manera que se ajuste al flujo de preguntas que describiremos en la siguiente sección. Para ello, determine el grado de imprevisibilidad de cada pregunta entre las candidatas.

DejarH{\displaystyle H}sea ​​una variable aleatoria binaria, dondeH(I)=1{\displaystyle H(I)=1}, si la historiaH{\displaystyle H}es válido para la imagenI{\displaystyle I}y0{\displaystyle 0}de lo contrario. DejaqQ{\displaystyle q\in Q}puede ser la pregunta propuesta, yincógnitaq{\displaystyle X_{q}}ser la respuesta a la preguntaq{\displaystyle q}.

Luego, encuentre la probabilidad condicional de obtener la respuesta X q a la pregunta q dado el historial H.

PAGH(incógnitaq=incógnita)=PAG{I:H(I)=1,incógnitaq(I)=incógnita}PAG{I:H(I)=1}{\displaystyle P_{H}(X_{q}=x)={\frac {P\{I:H(I)=1,X_{q}(I)=x\}}{P\{I:H(I)=1\}}}}

Dada esta probabilidad, la medida de la imprevisibilidad viene dada por:

ρH(q)=|PAGH(incógnitaQ=1)0,5|{\displaystyle \rho _{H}(q)=|P_{H}(X_{Q}=1)-0.5|}

Cuanto más cercaρH(q){\displaystyle \rho _{H}(q)}Cuanto más se acerque a 0, más impredecible será la pregunta.ρH(q){\displaystyle \rho _{H}(q)}para cada pregunta se calcula. Las preguntas para las cualesρH(q)<ϵ{\displaystyle \rho _{H}(q)<\epsilon }, son el conjunto de preguntas casi impredecibles y la siguiente pregunta se elige al azar de entre ellas.

Flujo de preguntas

Como se explicó en la sección anterior, existe un orden implícito en el espacio de preguntas, según el cual las preguntas sobre atributos vienen después de las preguntas sobre instanciación y las preguntas sobre relaciones vienen después de las preguntas sobre atributos, una vez que se han instanciado varios objetos.

Por lo tanto, el motor de consultas sigue una estructura de bucle en la que primero instancia un objeto con las preguntas de existencia y unicidad, luego consulta sobre sus atributos y, finalmente, se formulan las preguntas de relación para ese objeto con todos los objetos instanciados previamente.

Es evidente que las preguntas interesantes sobre los atributos y las relaciones surgen después de las preguntas sobre la instanciación, por lo que el generador de consultas tiene como objetivo instanciar tantos objetos como sea posible.

Las preguntas de instanciación se componen de preguntas de existencia y de unicidad, pero son las preguntas de unicidad las que, si obtienen una respuesta positiva, instancian un objeto. Por lo tanto, si el generador de consultas debe elegir aleatoriamente una pregunta de instanciación, prefiere elegir una pregunta de unicidad impredecible, si está presente. Si no existe dicha pregunta, el generador de consultas elige una pregunta de existencia que, con alta probabilidad, derive en una pregunta de unicidad en el futuro. En este caso, el generador de consultas realiza una búsqueda anticipada.

Argumento

Una parte fundamental del objetivo final de construir sistemas que puedan comprender las imágenes como lo hacen los humanos es la narrativa visual. Los humanos intentan descifrar una historia en la imagen que ven. El generador de consultas logra esto mediante la continuidad en las secuencias de preguntas.

Esto significa que, una vez instanciado el objeto, se intenta explorarlo con mayor detalle. Además de determinar sus atributos y su relación con otros objetos, la localización es un paso fundamental. Por lo tanto, como siguiente paso, el generador de consultas intenta localizar el objeto en la región donde se identificó inicialmente, restringiendo así el conjunto de preguntas de instanciación a las regiones dentro de la región original.

Preferencia por la simplicidad

La preferencia por la simplicidad establece que el generador de consultas debe priorizar las preguntas más sencillas sobre las más complejas. Las preguntas más sencillas son aquellas que contienen menos atributos. Por lo tanto, esto ordena las preguntas según la cantidad de atributos, y el generador de consultas da preferencia a las más sencillas.

Estimación de la predictibilidad

Para seleccionar la siguiente pregunta en la secuencia, VTT debe estimar la predictibilidad de cada pregunta propuesta. Esto se realiza utilizando el conjunto de entrenamiento anotado de imágenes. Cada imagen está anotada con un cuadro delimitador alrededor de los objetos y etiquetada con los atributos, y los pares de objetos están etiquetados con las relaciones. Consideremos cada tipo de pregunta por separado:

  1. Preguntas de instanciación : El estimador de probabilidad condicional para preguntas de instanciación se puede representar como:PAG^(incógnitaq=1)=#{IT,H(I)=1,incógnitaq(I)=1}#{IT,H(I)=1}{\displaystyle \quad {\widehat {P}}(X_{q}=1)={\frac {\#\{I\in T,H(I)=1,X_{q}(I)=1\}}{\#\{I\in T,H(I)=1\}}}} La pregunta solo se considera si el denominador es al menos 80 imágenes. La condición deH(I)=1{\displaystyle H(I)=1}Es muy estricto y puede no ser cierto para un gran número de imágenes, ya que cada pregunta en el historial elimina aproximadamente la mitad de los candidatos (imágenes en este caso). Como resultado, el historial se recorta y se eliminan las preguntas que no alteran la probabilidad condicional. Un historial más corto nos permite considerar un mayor número de imágenes para la estimación de la probabilidad. El recorte del historial se realiza en dos etapas:
    • En la primera etapa se eliminan todas las preguntas sobre atributos y relaciones, bajo el supuesto de que la presencia e instanciación de objetos solo depende de otros objetos y no de sus atributos o relaciones. Además, se eliminan todas las preguntas de existencia que se refieren a regiones disjuntas de la región a la que se hace referencia en la pregunta propuesta, bajo el supuesto de que la probabilidad de la presencia de un objeto en una ubicaciónw{\displaystyle w}no cambia con la presencia o ausencia de objetos en lugares distintos aw{\displaystyle w}. Y finalmente, todas las preguntas de unicidad con una respuesta negativa que se refieren a regiones disjuntas de la región a la que se hace referencia en la pregunta propuesta, se descartan con el supuesto de que las preguntas de unicidad con una respuesta positiva, si se descartan, pueden alterar la respuesta de las futuras preguntas de instanciación. El historial de preguntas obtenido después de esta primera etapa de poda puede denominarse comoHq{\displaystyle H_{q}'}.
    • En la segunda etapa se realiza una poda imagen por imagen.qi{\displaystyle q_{i}}ser una cuestión de singularidad enH{\displaystyle H}que no ha sido podado y se conserva enHq{\displaystyle H_{q}'}. Si esta pregunta se plantea en el contexto de una región que es disjunta de la región a la que se hace referencia en la pregunta propuesta, entonces la respuesta esperada a esta pregunta será:1{\displaystyle 1}, debido a las restricciones en la primera etapa. Pero si la respuesta real a esta pregunta para la imagen de entrenamiento es0{\displaystyle 0}, entonces esa imagen de entrenamiento no se considera para la estimación de probabilidad, y la preguntaqi{\displaystyle q_{i}}También se descarta. El historial final de preguntas después de esto esH~(q,I){\displaystyle {\tilde {H}}(q,I)}y la probabilidad viene dada por:PAG^(incógnitaq=1)=#{IT,H~(q,I)=1,incógnitaq(I)=1}#{IT,H~(q,I)=1}{\displaystyle \quad {\widehat {P}}(X_{q}=1)={\frac {\#\{I\in T,{\tilde {H}}(q,I)=1,X_{q}(I)=1\}}{\#\{I\in T,{\tilde {H}}(q,I)=1\}}}}
  2. Preguntas de atributo : El estimador de probabilidad para las preguntas de atributo depende del número de objetos etiquetados en lugar de las imágenes, a diferencia de las preguntas de instanciación. Considere una pregunta de atributo de la forma  : '¿Tiene el objeto o t el atributo a?' , dondeot{\displaystyle o_{t}}es un objeto de tipot{\displaystyle t}yaAt{\displaystyle a\in A_{t}}. DejarA{\displaystyle A}ser el conjunto de atributos que ya se sabe que pertenecen aot{\displaystyle o_{t}}Debido a la historia. DejemosOT{\displaystyle {\mathcal {O}}_{\mathbb {T} }}sea ​​el conjunto de todos los objetos anotados (verdad fundamental) en el conjunto de entrenamiento, y para cadaoOT{\displaystyle o\in {\mathcal {O}}_{\mathbb {T} }}, dejarTT(o){\displaystyle {\mathcal {T}}_{\mathbb {T} }(o)}ser el tipo de objeto, yAT(o){\displaystyle {\mathcal {A}}_{\mathbb {T} }(o)}ser el conjunto de atributos que pertenecen ao{\displaystyle o}Entonces, el estimador viene dado por: PAG(incógnitaq=1)=#{oOT:TT(o)=t,A{a}AT(o)}#{oOT:TT(o)=t,AAT(o)}{\displaystyle \quad P(X_{q}=1)={\frac {\#\{o\in {\mathcal {O}}_{\mathbb {T} }:{\mathcal {T}}_{\mathbb {T} }(o)=t,A\cup \{a\}\subseteq {\mathcal {A}}_{\mathbb {T} }(o)\}}{\#\{o\in {\mathcal {O}}_{\mathbb {T} }:{\mathcal {T}}_{\mathbb {T} }(o)=t,A\subseteq {\mathcal {A}}_{\mathbb {T} }(o)\}}}} Básicamente, esta es la proporción del número de veces que el objetoo{\displaystyle o}de tipot{\displaystyle t}con atributosA{a}{\displaystyle A\cup \{a\}}ocurre en los datos de entrenamiento, al número de veces que el objetoo{\displaystyle o}de tipot{\displaystyle t}con atributosA{\displaystyle A}ocurre en los datos de entrenamiento. Un alto número de atributos enA{\displaystyle A}conduce a un problema de escasez similar a las cuestiones de instanciación. Para abordarlo, dividimos los atributos en subconjuntos que son aproximadamente independientes condicionados a pertenecer al objeto.ot{\displaystyle o_{t}}Por ejemplo, parat={\displaystyle t={}}En el caso de una persona, atributos como cruzar la calle y permanecer quieta no son independientes, pero ambos son bastante independientes del sexo de la persona , de si la persona es un niño o un adulto , y de si lleva algo o no . Estas independencias condicionales reducen el tamaño del conjunto.A{\displaystyle A}y, de este modo, superar el problema de la escasez.
  3. Preguntas sobre relaciones : El enfoque para las preguntas sobre relaciones es el mismo que para las preguntas sobre atributos, donde en lugar del número de objetos, se considera el número de pares de objetos y, para el supuesto de independencia, se incluyen las relaciones que son independientes de los atributos de los objetos relacionados y las relaciones que son independientes entre sí.

Ejemplo

Aquí se pueden encontrar ejemplos detallados de secuencias . [ 3 ]

Conjunto de datos

Las imágenes consideradas para el trabajo de Geman et al. [ 1 ] pertenecen al conjunto de datos «Escenas de calles urbanas» [ 1 ] , que contiene escenas de calles de diferentes ciudades del mundo. Por ello, en este experimento, los tipos de objetos se limitan a personas y vehículos.

Imágenes de escenas urbanas callejeras procedentes de los datos de entrenamiento. Los datos de entrenamiento son una colección de imágenes de este tipo con escenas de diferentes ciudades de todo el mundo.

Otro conjunto de datos presentado por el Instituto Max Planck de Informática se conoce como DAQUAR [ 4 ] [ 5 ] , que contiene imágenes del mundo real de escenas interiores. Pero ellos [ 4 ] proponen una versión diferente de la prueba de Turing visual que adopta un enfoque holístico y espera que el sistema participante exhiba un sentido común similar al humano.

Ejemplos de anotaciones de imágenes de entrenamiento proporcionadas por los trabajadores humanos.

Conclusión

Este es un trabajo muy reciente, publicado el 9 de marzo de 2015 en la revista Proceedings of the National Academy of Sciences por investigadores de la Universidad de Brown y la Universidad Johns Hopkins . Evalúa cómo los sistemas de visión artificial interpretan las imágenes en comparación con los humanos. Actualmente, la prueba es escrita y el interrogador es una máquina, ya que la evaluación oral por parte de un interrogador humano otorga a este último una ventaja indebida debido a la subjetividad y a la expectativa de respuestas en tiempo real.

Se espera que la Prueba de Turing Visual marque un nuevo rumbo en la investigación de la visión artificial. Empresas como Google y Facebook están invirtiendo millones de dólares en este campo y buscan desarrollar sistemas que se asemejen al sistema visual humano. Recientemente, Facebook anunció su nueva plataforma M, que analiza una imagen y proporciona una descripción para ayudar a las personas con discapacidad visual. [ 6 ] Estos sistemas podrían tener un buen desempeño en la Prueba de Turing Visual.

Referencias

  1. 1 2 3 Geman, Donald; Geman, Stuart; Hallonquist, Neil; Younes, Laurent (2015-03-24). "Prueba de Turing visual para sistemas de visión por computadora" . Actas de la Academia Nacional de Ciencias . 112 (12): 3618– 3623. Bibcode : 2015PNAS..112.3618G . doi : 10.1073/pnas.1422953112 . ISSN 0027-8424 . PMC 4378453. PMID 25755262 .   
  2. "H3D" . www.eecs.berkeley.edu . Consultado el 19 de noviembre de 2015 .
  3. "Prueba de Turing visual | División de Matemáticas Aplicadas" . www.brown.edu . Consultado el 19 de noviembre de 2015 .
  4. ^ " Max-Planck-Institut für Informatik: Desafío Visual Turing" . www.mpi-inf.mpg.de . Consultado el 19 de noviembre de 2015 .
  5. Malinowski, Mateusz; Fritz, Mario (29 de octubre de 2014). "Hacia un desafío Visual Turing". arXiv : 1410.8027 [ cs.AI ].
  6. Metz, Cade (27 de octubre de 2015). "La IA de Facebook puede subtitular fotos para personas ciegas por sí sola" . WIRED . Recuperado el 19 de noviembre de 2015 .