Reynold Xin es un científico informático e ingeniero especializado en big data , sistemas distribuidos y computación en la nube . Es cofundador y arquitecto jefe de Databricks . [1] Es más conocido por su trabajo en Apache Spark , un proyecto líder de big data de código abierto . [2] Fue diseñador y desarrollador principal de los componentes GraphX , Project Tungsten y Structured Streaming y codiseñó DataFrames , todos los cuales son parte de la distribución principal de Apache Spark; también se desempeñó como gerente de lanzamiento para el lanzamiento 2.0 de Spark. [3]
Biografía
Berkeley
Xin comenzó a trabajar en el proyecto de código abierto Spark mientras era candidato a doctorado en el AMPLab de la Universidad de California, Berkeley . Recibió su doctorado en informática en Berkeley, donde sus asesores fueron Michael J. Franklin e Ion Stoica . [4]
El primer proyecto de investigación, Shark, [5] creó un sistema que podía ejecutar de manera eficiente SQL y cargas de trabajo de análisis avanzado a escala. Shark ganó el premio a la mejor demostración en SIGMOD 2012. [6] Shark fue uno de los primeros SQL interactivo de código abierto en sistemas Hadoop, con afirmaciones de que era entre 10 y 100 veces más rápido que Apache Hive . Shark fue utilizado por empresas de tecnología como Yahoo, [7] aunque fue reemplazado por un sistema más nuevo llamado Spark SQL en 2014. [8]
El segundo proyecto de investigación, GraphX, [9] creó un sistema de procesamiento de gráficos sobre Spark, un sistema general de datos en paralelo. GraphX al mismo tiempo desafió la noción de que los sistemas especializados son necesarios para el cálculo de gráficos. GraphX fue lanzado como un proyecto de código abierto y se fusionó con Spark en 2014, como la biblioteca de procesamiento de gráficos en Spark.
Bloques de datos
En 2013, junto con Matei Zaharia y otros colaboradores clave de Spark, Xin cofundó Databricks , una empresa respaldada por capital de riesgo con sede en San Francisco que ofrece una plataforma de datos como servicio, basada en Spark.
En 2014, Xin dirigió un equipo de ingenieros de Databricks para competir en el Sort Benchmark y ganó el récord mundial de 2014 en Daytona GraySort usando Spark, superando el récord anterior en poder de Apache Hadoop por 30 veces. [10] Xin afirmó que Spark era el motor de código abierto más rápido para ordenar un petabyte de datos. [11]
Mientras estaba en Databricks, también inició el proyecto DataFrames, [12] el proyecto Tungsten, [13] y Structured Streaming. [14] DataFrames se ha convertido en la API fundamental, mientras que Tungsten se ha convertido en el nuevo motor de ejecución.
Referencias
- ^ "Reynold Xin: Perfil ejecutivo y biografía - Businessweek". bloomberg.com . Bloomberg Businessweek . Consultado el 21 de septiembre de 2016 .
- ^ Woodie, Alex (8 de junio de 2016). "Apache Spark Adoption by the Numbers" (Adopción de Apache Spark en cifras). datanami.com . Tabor Communications . Consultado el 21 de septiembre de 2016 .
- ^ "Lista de desarrolladores de Apache Spark - [ANUNCIO] Anuncio de Apache Spark 2.0.0". apache-spark-developers-list.1001551.n3.nabble.com . Consultado el 4 de agosto de 2016 .
- ^ "Portavoz Reynold Xin". engsci.utoronto.ca . 5 de octubre de 2020.
- ^ Xin, Reynold S.; Rosen, Josh; Zaharia, Matei; Franklin, Michael J.; Shenker, Scott; Stoica, Ion (1 de enero de 2013). "Tiburón". Actas de la Conferencia internacional ACM SIGMOD de 2013 sobre gestión de datos . SIGMOD '13. Nueva York, NY, EE. UU.: ACM. págs. 13– 24. doi :10.1145/2463676.2465288. ISBN 9781450320375.S2CID 1597960 .
- ^ "Shark gana el premio a la mejor demostración en SIGMOD 2012". AMPLab - UC Berkeley . 24 de mayo de 2012 . Consultado el 4 de agosto de 2016 .
- ^ Tully. "Análisis de Spark y Shark en Yahoo" (PDF) .
- ^ "Shark, Spark SQL, Hive en Spark y el futuro de SQL en Apache Spark". 2014-07-01 . Consultado el 2016-08-04 .
- ^ Gonzalez, Joseph E.; Xin, Reynold S.; Dave, Ankur; Crankshaw, Daniel; Franklin, Michael J.; Stoica, Ion (1 de enero de 2014). "GraphX: procesamiento de gráficos en un marco de flujo de datos distribuido". Actas de la 11.ª Conferencia USENIX sobre diseño e implementación de sistemas operativos . OSDI'14. Berkeley, CA, EE. UU.: Asociación USENIX: 599– 613. ISBN 9781931971164.
- ^ Finley, Klint. "Startup procesa 100 terabytes de datos en un tiempo récord de 23 minutos". Wired . Consultado el 4 de agosto de 2016 .
- ^ "Apache Spark, el motor de código abierto más rápido para ordenar un petabyte". 2014-10-10 . Consultado el 2016-08-04 .
- ^ "Introducción de DataFrames en Apache Spark para la ciencia de datos a gran escala". 17 de febrero de 2015. Consultado el 4 de agosto de 2016 .
- ^ Woodie, Alex (4 de mayo de 2015). "Análisis profundo de los grandes planes de aceleración de Databricks para Apache Spark". datanami.com . Tabor Communications . Consultado el 21 de septiembre de 2016 .
- ^ Woodie, Alex (25 de febrero de 2016). "Spark 2.0 presentará un nuevo motor de 'transmisión estructurada'". datanami.com . Tabor Communications . Consultado el 21 de septiembre de 2016 .