El premio Netflix fue una competición abierta para encontrar el mejor algoritmo de filtrado colaborativo para predecir las valoraciones de los usuarios de películas , basándose en valoraciones anteriores sin ninguna otra información sobre los usuarios o las películas, es decir, sin que los usuarios fueran identificados salvo por los números asignados para el concurso.
El concurso fue organizado por Netflix , un servicio de transmisión de video, y estaba abierto a cualquier persona que no estuviera relacionada con Netflix (empleados actuales y anteriores, agentes, familiares cercanos de empleados de Netflix, etc.) ni residiera en ciertos países bloqueados (como Cuba o Corea del Norte). [ 1 ] El 21 de septiembre de 2009, el gran premio de US$1.000.000 fue otorgado al equipo Pragmatic Chaos de BellKor, que superó el algoritmo de Netflix para predecir las calificaciones en un 10,06 %. [ 2 ]
Problemas y conjuntos de datos
Netflix proporcionó un conjunto de datos de entrenamiento de 100.480.507 calificaciones que 480.189 usuarios dieron a 17.770 películas. Cada calificación de entrenamiento es un cuádruple de la forma <user, movie, date of grade, grade>. Los campos de usuario y película son identificadores enteros , mientras que las calificaciones van de 1 a 5 estrellas ( enteras ). [ 3 ]
El conjunto de datos de calificación contiene más de 2.817.131 tripletes de la forma <user, movie, date of grade>, con calificaciones conocidas solo por el jurado. El algoritmo de un equipo participante debe predecir calificaciones en todo el conjunto de calificación, pero se les informa la puntuación de solo la mitad de los datos: un conjunto de cuestionario de 1.408.342 calificaciones. La otra mitad es el conjunto de prueba de 1.408.789, y el rendimiento en este es utilizado por el jurado para determinar los posibles ganadores del premio. Solo los jueces saben qué calificaciones están en el conjunto de cuestionario y cuáles están en el conjunto de prueba; esta disposición está diseñada para dificultar el ascenso de colina en el conjunto de prueba. Las predicciones enviadas se califican en comparación con las calificaciones reales en forma de error cuadrático medio (RMSE), y el objetivo es reducir este error tanto como sea posible. Tenga en cuenta que, si bien las calificaciones reales son números enteros en el rango de 1 a 5, las predicciones enviadas no tienen por qué serlo. Netflix también identificó un subconjunto de prueba de 1.408.395 calificaciones dentro del conjunto de datos de entrenamiento . Los conjuntos de datos de prueba , cuestionario y evaluación se eligieron para que tuvieran propiedades estadísticas similares.
En resumen, los datos utilizados en el Premio Netflix son los siguientes:
- Conjunto de entrenamiento (99.072.112 calificaciones sin incluir el conjunto de prueba; 100.480.507 incluyendo el conjunto de prueba)
- Conjunto de sondas (1.408.395 valoraciones)
- Conjunto de clasificación (2.817.131 valoraciones) compuesto por:
- Conjunto de prueba (1.408.789 valoraciones), utilizado para determinar a los ganadores.
- Conjunto de cuestionarios (1.408.342 valoraciones), utilizado para calcular las puntuaciones de la clasificación.
Para cada película, el título y el año de estreno se proporcionan en un conjunto de datos separado. No se proporciona ninguna información sobre los usuarios. Para proteger la privacidad de los clientes, "algunos de los datos de calificación de algunos clientes en los conjuntos de entrenamiento y calificación se han alterado deliberadamente de una o más de las siguientes maneras: eliminando calificaciones; insertando calificaciones y fechas alternativas; y modificando las fechas de las calificaciones". [ 2 ]
El conjunto de entrenamiento se construyó de tal manera que el usuario promedio calificó más de 200 películas, y la película promedio fue calificada por más de 5000 usuarios. Pero existe una gran variabilidad en los datos: algunas películas en el conjunto de entrenamiento tienen tan solo 3 calificaciones, [ 4 ] mientras que un usuario calificó más de 17 000 películas. [ 5 ]
Hubo cierta controversia en cuanto a la elección del RMSE como métrica definitoria. Se ha afirmado que incluso una mejora tan pequeña como el 1% de RMSE produce una diferencia significativa en la clasificación de las 10 películas más recomendadas para un usuario. [ 6 ]
Premios

Los premios se basaban en la mejora respecto al algoritmo propio de Netflix, llamado Cinematch , o en la puntuación del año anterior si un equipo había mejorado más allá de un cierto umbral. Un algoritmo trivial que predice para cada película del concurso su calificación promedio a partir de los datos de entrenamiento produce un RMSE de 1,0540. Cinematch utiliza " modelos lineales estadísticos sencillos con mucho condicionamiento de datos". [ 7 ] El rendimiento de Cinematch se había estancado en 2006. [ 8 ]
Utilizando únicamente los datos de entrenamiento, Cinematch obtiene un RMSE de 0,9514 en los datos del cuestionario, lo que representa una mejora aproximada del 10 % con respecto al algoritmo trivial. Cinematch tiene un rendimiento similar en el conjunto de prueba, 0,9525. Para ganar el gran premio de 1.000.000 de dólares, un equipo participante debía mejorar este resultado en un 10 % adicional, alcanzando 0,8572 en el conjunto de prueba. [ 2 ] Dicha mejora en el conjunto del cuestionario corresponde a un RMSE de 0,8563.
Mientras ningún equipo ganara el gran premio, se otorgaba anualmente un premio de progreso de 50 000 dólares al mejor resultado obtenido hasta la fecha. Sin embargo, para ganar este premio, un algoritmo debía mejorar el RMSE del conjunto de preguntas en al menos un 1 % con respecto al ganador del premio de progreso anterior (o con respecto a Cinematch, el primer año). Si ninguna propuesta tenía éxito, el premio de progreso no se otorgaba ese año.
Para ganar un premio menor o el gran premio, un participante debía proporcionar el código fuente y una descripción del algoritmo al jurado en el plazo de una semana tras ser contactado por este. Tras la verificación, el ganador también debía otorgar una licencia no exclusiva a Netflix. Netflix publicaría únicamente la descripción del sistema, no el código fuente. (Para mantener en secreto su algoritmo y código fuente, un equipo podía optar por no reclamar el premio). El jurado también mantenía sus predicciones en secreto para los demás participantes. Un equipo podía enviar tantos intentos de predicción de calificaciones como deseara. Inicialmente, las presentaciones estaban limitadas a una vez por semana, pero el intervalo se modificó rápidamente a una vez al día. La mejor presentación de un equipo hasta el momento se consideraba su presentación actual.
Una vez que uno de los equipos lograba mejorar el RMSE en un 10 % o más, el jurado emitía una última convocatoria , otorgando a todos los equipos 30 días para enviar sus propuestas. Solo entonces, al equipo con la mejor propuesta se le solicitaba la descripción del algoritmo, el código fuente y la licencia no exclusiva, y, tras una verificación exitosa, se le declaraba ganador del gran premio.
El concurso duraría hasta que se anunciara al ganador del gran premio. Si nadie hubiera ganado el gran premio, habría durado al menos cinco años (hasta el 2 de octubre de 2011). Después de esa fecha, el concurso podría haberse cancelado en cualquier momento a discreción exclusiva de Netflix.
Progreso a lo largo de los años
La competición comenzó el 2 de octubre de 2006. Para el 8 de octubre, un equipo llamado WXYZConsulting ya había superado los resultados de Cinematch. [ 9 ]
Para el 15 de octubre, había tres equipos que habían superado a Cinematch, uno de ellos por un 1,06%, suficiente para optar al premio anual al progreso. [ 10 ] Para junio de 2007, más de 20 000 equipos se habían inscrito en la competición procedentes de más de 150 países. 2000 equipos habían enviado más de 13 000 conjuntos de predicciones. [ 3 ]
Durante el primer año de la competición, un puñado de favoritos intercambiaron el primer puesto. Los más destacados fueron: [ 11 ]
- WXYZConsulting, un equipo formado por Wei Xu y Yi Zhang. (Uno de los favoritos durante noviembre y diciembre de 2006).
- ML@UToronto A, un equipo de la Universidad de Toronto liderado por el profesor Geoffrey Hinton . (Uno de los favoritos durante parte de octubre-diciembre de 2006).
- Gravity, un equipo de cuatro científicos de la Universidad Tecnológica de Budapest (uno de los favoritos entre enero y mayo de 2007).
- BellKor, un grupo de científicos de AT&T Labs . (Uno de los favoritos desde mayo de 2007).
- Dinosaur Planet, un equipo formado por tres estudiantes de la Universidad de Princeton . (Lideró la competencia el 3 de septiembre de 2007 durante una hora antes de que BellKor recuperara el liderato).
Los algoritmos utilizados por los equipos líderes solían ser un conjunto de descomposición en valores singulares , k-vecinos más cercanos , redes neuronales , etc. [ 12 ] [ 13 ]
El 12 de agosto de 2007, numerosos participantes se reunieron en la Copa y Taller KDD 2007, celebrada en San José, California . [ 14 ] Durante el taller, los cuatro equipos mejor clasificados en ese momento presentaron sus técnicas. El equipo de IBM Research —Yan Liu, Saharon Rosset, Claudia Perlich y Zhenzhen Kou— obtuvo el tercer lugar en la Tarea 1 y el primer lugar en la Tarea 2.
Durante el segundo año de la competición, solo tres equipos alcanzaron la primera posición:
- BellKor, un grupo de científicos de AT&T Labs (favorito entre mayo de 2007 y septiembre de 2008).
- BigChaos, un equipo de científicos austriacos de Commendo Research & Consulting (líder indiscutible desde octubre de 2008).
- BellKor en BigChaos, un equipo conjunto de los dos equipos individuales líderes (uno de los favoritos desde septiembre de 2008).
Premio al Progreso 2007
El 2 de septiembre de 2007, la competición entró en el periodo de "última llamada" para el Premio al Progreso 2007. Más de 40 000 equipos de 186 países se habían inscrito en el concurso. Tenían treinta días para presentar sus propuestas. Al comienzo de este periodo, el equipo líder era BellKor, con un RMSE de 0,8728 (8,26 % de mejora), seguido de Dinosaur Planet (RMSE = 0,8769; 7,83 % de mejora) [ 15 ] y Gravity (RMSE = 0,8785; 7,66 % de mejora). En la última hora del periodo de última llamada, una propuesta de "KorBell" obtuvo el primer puesto. Este resultó ser un nombre alternativo para el equipo BellKor. [ 16 ]
El 13 de noviembre de 2007, el equipo KorBell (anteriormente BellKor) fue declarado ganador del Premio al Progreso de $50,000 con un RMSE de 0.8712 (una mejora del 8.43%). [ 17 ] El equipo estaba compuesto por tres investigadores de AT&T Labs : Yehuda Koren, Robert Bell y Chris Volinsky. [ 18 ] Como se requería, publicaron una descripción de su algoritmo. [ 12 ]
Premio al Progreso 2008
El Premio al Progreso 2008 fue otorgado al equipo BellKor. Su propuesta, junto con la de otro equipo, BigChaos, alcanzó un RMSE de 0,8616 con 207 conjuntos de predictores. [ 19 ] El equipo conjunto estaba formado por dos investigadores de Commendo Research & Consulting GmbH, Andreas Töscher y Michael Jahrer (originalmente del equipo BigChaos) y tres investigadores de AT&T Labs , Yehuda Koren, Robert Bell y Chris Volinsky (originalmente del equipo BellKor). [ 20 ] Como se requería, publicaron una descripción de su algoritmo. [ 21 ] [ 22 ]
Este fue el último Premio al Progreso, ya que obtener la mejora requerida del 1 % con respecto al Premio al Progreso de 2008 era suficiente para optar al Gran Premio. El dinero del premio se donó a las organizaciones benéficas elegidas por los ganadores.
2009
El 26 de junio de 2009, el equipo "BellKor's Pragmatic Chaos", una fusión de los equipos "Bellkor in BigChaos" y "Pragmatic Theory", logró una mejora del 10,05 % sobre Cinematch (un RMSE de Quiz de 0,8558). El concurso del Premio Netflix entró entonces en el período de "última llamada" para el Gran Premio. De acuerdo con las Reglas, los equipos tenían treinta días, hasta el 26 de julio de 2009 a las 18:42:37 UTC, para enviar las propuestas que serían consideradas para este Premio. [ 23 ]
El 25 de julio de 2009, el equipo "The Ensemble", una fusión de los equipos "Grand Prize Team" y "Opera Solutions and Vandelay United", logró una mejora del 10,09% sobre Cinematch (un RMSE de Quiz de 0,8554). [ 24 ] [ 25 ]
El 26 de julio de 2009, Netflix dejó de recibir candidaturas para el concurso del Premio Netflix. [ 26 ]
La clasificación final en ese momento mostró que dos equipos cumplieron con los requisitos mínimos para el Gran Premio. "The Ensemble" con una mejora del 10,10 % sobre Cinematch en el conjunto de clasificación (un RMSE de Quiz de 0,8553), y "BellKor's Pragmatic Chaos" con una mejora del 10,09 % sobre Cinematch en el conjunto de clasificación (un RMSE de Quiz de 0,8554). [ 27 ] [ 28 ] El ganador del Gran Premio sería el que tuviera el mejor rendimiento en el conjunto de prueba.
El 18 de septiembre de 2009, Netflix anunció al equipo "BellKor's Pragmatic Chaos" como ganador del premio (un RMSE de prueba de 0,8567), y el premio se entregó al equipo en una ceremonia el 21 de septiembre de 2009. [ 29 ] El equipo "The Ensemble" había igualado el resultado de BellKor, pero como BellKor envió sus resultados 20 minutos antes, las reglas otorgan el premio a BellKor. [ 25 ] [ 30 ]
El equipo conjunto "BellKor's Pragmatic Chaos" estaba formado por dos investigadores austriacos de Commendo Research & Consulting GmbH, Andreas Töscher y Michael Jahrer (originalmente del equipo BigChaos), dos investigadores de AT&T Labs , Robert Bell y Chris Volinsky, Yehuda Koren de Yahoo! (originalmente del equipo BellKor) y dos investigadores de Pragmatic Theory, Martin Piotte y Martin Chabbert. [ 31 ] Como era requerido, publicaron una descripción de su algoritmo. [ 32 ]
El equipo que, según se informa, obtuvo el dudoso honor ( sic Netflix) de obtener los peores RMSE en los conjuntos de datos de Quiz y Test , entre las 44.014 entregas realizadas por 5.169 equipos, fue "Lanterne Rouge", liderado por JM Linacre, quien también era miembro del equipo "The Ensemble". Linacre afirmó que el resultado fue deliberadamente malo, como correspondía al nombre de " Lanterne rouge ". [ 33 ]
Secuela cancelada
Al concluir la competencia, Netflix anunció una secuela planeada. Esta presentaría a los concursantes datos demográficos y de comportamiento, incluyendo la edad, el género, el código postal, las calificaciones de género y las películas elegidas previamente por los arrendatarios, pero no las calificaciones. La tarea consistía en predecir qué películas les gustarían a esas personas. No habría un objetivo de precisión específico para ganar el premio. En cambio, se otorgarían $500,000 al equipo que liderara después de 6 meses, y otros $500,000 al líder después de 18 meses. [ 30 ]
El 12 de marzo de 2010, Netflix anunció que no celebraría un segundo concurso del Premio que había anunciado el agosto anterior. La decisión se debió a una demanda y a las preocupaciones de la Comisión Federal de Comercio sobre la privacidad. [ 34 ] Algunos participantes, como Volinsky, expresaron su decepción por la cancelación. [ 13 ]
preocupaciones sobre la privacidad
Aunque los conjuntos de datos se crearon para preservar la privacidad de los clientes, el premio ha sido criticado por defensores de la privacidad. En 2007, dos investigadores de la Universidad de Texas en Austin ( Vitaly Shmatikov y Arvind Narayanan) lograron identificar a usuarios individuales al comparar los conjuntos de datos con las calificaciones de películas en la base de datos de películas de Internet . [ 35 ] [ 36 ]
El 17 de diciembre de 2009, cuatro usuarios de Netflix presentaron una demanda colectiva contra Netflix, alegando que la compañía había violado las leyes de competencia leal de EE. UU. y la Ley de Protección de la Privacidad de Video al divulgar los conjuntos de datos. [ 37 ] Se generó un debate público sobre la privacidad de los participantes en la investigación . El 19 de marzo de 2010, Netflix llegó a un acuerdo con los demandantes, tras lo cual estos retiraron voluntariamente la demanda.
Véase también
Referencias
- ↑ "Reglas del Premio Netflix" (PDF) . Archivado del original (PDF) el 10 de mayo de 2020. Consultado el 6 de noviembre de 2019 .
- 1 2 3 "El premio Netflix" . Archivado del original el 24 de septiembre de 2009. Consultado el 9 de julio de 2012 .
- 1 2 James Bennett; Stan Lanning (12 de agosto de 2007). "El premio Netflix" (PDF) . Actas de la Copa y Taller KDD 2007. Archivado del original (PDF) el 27 de septiembre de 2007. Recuperado el 25 de agosto de 2007 .
- ↑ Curva sigmoidea (08/10/2006). "Miss Simpatía" . Foro del Premio Netflix . Archivado del original el 06/02/2012 . Consultado el 25/08/2007 .
- ↑ prodigioso (06/10/2006). "Un solo cliente que calificó 17.000 películas" . Foro del Premio Netflix . Archivado del original el 06/02/2012 . Recuperado el 25/08/2007 .
- ↑ YehudaKoren (18 de diciembre de 2007). "¿Qué tan útil es un RMSE más bajo?" . Foro del Premio Netflix . Archivado del original el 6 de febrero de 2012.
- ↑ "Preguntas frecuentes sobre el premio Netflix" . Archivado del original el 21 de agosto de 2007. Consultado el 21 de agosto de 2007 .
- ↑ Thompson, Clive (21 de noviembre de 2008). "Si te gustó esto, seguro que te encantará aquello" . The New York Times . ISSN 0362-4331 . Consultado el 26 de marzo de 2025 .
- ↑ "Clasificación de premios de Netflix" . Hacking Netflix . 9 de octubre de 2006. Archivado del original el 30 de octubre de 2006. Consultado el 21 de agosto de 2007 .
- ↑ "Premio Netflix (intenté resistirme, pero...)" . Blog de Juho Snellman . 15 de octubre de 2006. Consultado el 21 de agosto de 2007 .
- ↑ "Principales candidatos al Premio al Progreso 2007" (lista) . Archivado del original el 15 de febrero de 2008.
- 1 2 R. Bell; Y. Koren; C. Volinsky (2007). "La solución BellKor al Premio Netflix". CiteSeerX 10.1.1.142.9009 .
- 1 2 Jackson, Dan (2017-07-07). "El premio Netflix: cómo un concurso de 1 millón de dólares cambió para siempre el consumo compulsivo de series" . Thrillist . Recuperado el 26 de marzo de 2025 .
- ↑ "Copa y taller KDD 2007" .
- ↑ "Planeta Dinosaurio" . 8 de diciembre de 2022.
- ↑ admin (28/08/2022). "El caos pragmático de BellKor gana el premio de Netflix de 1 millón de dólares por apenas minutos" . Populousness . Consultado el 28/08/2022 .
- ↑ Prizemaster (13/11/2007). "Premio Netflix Progress 2007 otorgado al equipo KorBell" . Foro de premios de Netflix . Archivado del original el 06/02/2012.
- ↑ "Se otorga el premio Progress de $50,000 en el primer aniversario del premio Netflix de $1 millón" . Netflix .
- ↑ Robert Bell; Yehuda Koren; Chris Volinsky (10 de diciembre de 2008). "La solución BellKor 2008 al premio Netflix" (PDF) . Foro del premio Netflix . Archivado del original (PDF) el 22 de mayo de 2013. Consultado el 5 de septiembre de 2013 .
- ↑ "Netflix otorga un premio de $50,000 al progreso en el segundo año del concurso multinacional y plurianual del premio Netflix" . Archivado del original el 30 de junio de 2009. Consultado el 22 de junio de 2009 .
- ↑ A. Töscher; M. Jahrer (2008). "La solución de BigChaos al Premio Netflix 2008" (PDF) . Archivado del original (PDF) el 16 de febrero de 2012. Consultado el 24 de junio de 2009 .
- ↑ R. Bell; Y. Koren; C. Volinsky (2008). "La solución BellKor al Premio Netflix 2008" (PDF) . Archivado del original (PDF) el 16 de febrero de 2012. Consultado el 24 de junio de 2009 .
- ↑ "El caos pragmático de BellKor" . 26 de junio de 2009.
- ↑ "The Ensemble" . 8 de diciembre de 2022. Archivado del original el 27 de diciembre de 2014.
- 1 2 "Clasificación del premio Netflix" . 26 de julio de 2009. Archivado del original el 13 de diciembre de 2013. Consultado el 9 de diciembre de 2013 .
- ↑ "Concurso cerrado" . 26/07/2009. Archivado del original el 28/07/2009 . Consultado el 27/07/2009 .
- ↑ Lester Mackey (8 de diciembre de 2022). "Cuenta regresiva para la entrega final" . Archivado del original el 27 de diciembre de 2014.
- ↑ "El premio Netflix llega a un final emocionante y de infarto" . 26 de julio de 2009.
- ↑ "Gran Premio otorgado al equipo BellKor's Pragmatic Chaos" . Foro de premios de Netflix. 21 de septiembre de 2009. Archivado del original el 7 de mayo de 2012.
- 1 2 Steve Lohr (21 de septiembre de 2009). "Una ganga de investigación de 1 millón de dólares para Netflix, y tal vez un modelo para otros" . New York Times .
- ↑ "Netflix otorga un premio de 1 millón de dólares y anuncia un segundo desafío de 1 millón de dólares" . Archivado del original el 25 de septiembre de 2009. Consultado el 24 de septiembre de 2009 .
- ↑ Andreas Töscher y Michael Jahrer (5 de septiembre de 2009). "La solución BigChaos al gran premio de Netflix" (PDF) . commendo research & consulting . Consultado el 2 de noviembre de 2022 .
- ↑ "Lecciones de Rasch del concurso Netflix® Prize Challenge" . www.rasch.org . Consultado el 26 de marzo de 2025 .
- ↑ Hunt, Neil (12 de marzo de 2010). "Actualización del Premio Netflix" . Foro del Premio Netflix. Archivado del original el 12 de abril de 2010.
- ↑ Narayanan, Arvind; Shmatikov, Vitaly (2006). "Cómo romper el anonimato del conjunto de datos del premio Netflix". arXiv : cs/0610105 .
- ↑ Demerjian, Dave (15 de marzo de 2007). "El auge de los hackers de Netflix" . wired.com . Wired . Consultado el 13 de diciembre de 2014 .
- ↑ Singel, Ryan. "Netflix reveló tu secreto de Brokeback Mountain, según una demanda" . Wired . Consultado el 11 de agosto de 2017 .
Enlaces externos
- Sitio web oficial
- Premio Netflix en RecSysWiki
- Kate Greene (6 de octubre de 2006). "El reto de Netflix de 1 millón de dólares" . Technology Review .
- Bell, R.; Bennett, J.; Koren, Y.; Volinsky, C. (mayo de 2009). "El premio de programación de un millón de dólares". IEEE Spectrum . 46 (5): 28– 33. doi : 10.1109/MSPEC.2009.4907383 . ISSN 0018-9235 .
- Desanonimización robusta de grandes conjuntos de datos dispersos por Arvind Narayanan y Vitaly Shmatikov
- Robert M. Bell, Yehuda Koren y Chris Volinsky (2010), "Todos juntos ahora: Una perspectiva sobre el PREMIO NETFLIX", Chance , 23 (1): 24, doi : 10.1007/s00144-010-0005-2
- Andrey Feuerverger; Yu He y Shashi Khatri (2012), "Significación estadística del desafío de Netflix", Statistical Science , 27 (2): 202–231 , arXiv : 1207.5649 , doi : 10.1214/11-STS368 , S2CID 43556443
- El premio de 1 millón de dólares de Netflix: Netflix nunca utilizó su algoritmo de 1 millón de dólares debido a los costos de ingeniería (2009) - Saint. Archivado el 30 de enero de 2019 en Wayback Machine.
- competiciones de inteligencia artificial
- Premios establecidos en 2006.
- Los premios fueron suprimidos en 2009.
- concursos de informática
- Crowdsourcing
- Netflix
- Sistemas de recomendación