Esta es una lista de publicaciones en ciencia de datos , generalmente organizadas según el orden de uso en un flujo de trabajo de análisis de datos .

Consulte la lista de publicaciones en estadística para obtener publicaciones más basadas en la investigación y de carácter fundamental; mientras que esta lista es más aplicada, orientada a los negocios e interdisciplinaria.
Los criterios generales de inclusión de artículos son:
- Artículos de profesionales destacados o profesores destacados, ya sea con una página de Wikipedia o una referencia a su relevancia.
- Conocimientos generales que todo profesional de datos debería saber, con referencias que validan esta afirmación.
- Publicaciones de estadística aplicada y aprendizaje automático con un alto número de citas
- Artículos que facilitan el debate en el campo de la ciencia de datos en su conjunto (por ejemplo, el artículo "Attention Is All You Need " es sin duda un artículo fundamental [ 1 ] que se puede añadir aquí, pero es específico de la inteligencia artificial generativa , no para todos los profesionales de datos).
Algunas razones por las que una publicación en particular podría considerarse importante:
- Creador de temas : una publicación que creó un nuevo tema.
- Avance científico : una publicación que cambió significativamente el conocimiento científico.
- Influencia : Una publicación que ha influido significativamente en el mundo o que ha tenido un impacto enorme en la enseñanza de la ciencia de datos.
Siempre que sea posible, se utiliza una referencia para validar la inclusión de la publicación en esta lista.
Historia
Modelado estadístico: Las dos culturas (con comentarios y una réplica del autor)
- Autor: Leo Breiman
- Datos de publicación: [ 2 ]
- Versión en línea: https://projecteuclid.org/journals/statistical-science/volume-16/issue-3/Statistical-Modeling--The-Two-Cultures-with-comments-and-a/10.1214/ss/1009213726.pdf
- Descripción: Describe dos enfoques de la estadística: uno que utiliza un modelo estocástico parsimonioso y generativo, y otro que emplea un modelo algorítmico sin un mecanismo conocido para la generación de datos. Breiman argumenta que, si bien la estadística tradicionalmente ha favorecido el uso del modelo estocástico, resulta valioso ampliar los métodos que los estadísticos pueden utilizar para estudiar los fenómenos.
- Importancia: Influencia en las filosofías de los estadísticos justo antes del aumento del uso de métodos de aprendizaje automático y aprendizaje profundo. En una retrospectiva de 20 años sobre este artículo, "las palabras de Breiman son quizás más relevantes que nunca". [ 3 ] Estadísticos notables de la época escribieron artículos de opinión sobre la publicación. Aunque en general crítico con la publicación, David Cox escribe que la publicación "contiene suficiente verdad y expone suficientes debilidades como para invitar a la reflexión". [ 2 ] Bradley Efron comentó que esta publicación es un "artículo estimulante". [ 2 ] Emanuel Parzen también comenta sobre esta publicación que "Breiman nos alerta sobre errores sistemáticos (que llevan a conclusiones erróneas) que se han cometido al aplicar la práctica estadística actual de modelado de datos ". [ 2 ]
Científico de datos: El trabajo más atractivo del siglo XXI
- Autores: Thomas H. Davenport y DJ Patil
- Datos de publicación: [ 4 ]
- Versión en línea : hbr.org/2022/07/is-data-scientist-still-the-sexiest-job-of-the-21st-century
- Descripción: Describe el nuevo rol en las empresas denominado "científico de datos" , qué hacen, cómo una organización puede reclutar a uno y cómo trabajar eficazmente con él.
- Importancia: Esta publicación ha influido en la comunidad de datos, como lo mencionaron instituciones como IEEE Spectrum [ 5 ] casi al momento de su publicación en 2012 , y también casi una década después, planteando la misma pregunta que plantea el título. [ 6 ] [ 7 ] En una respuesta retrospectiva a su propia publicación de 10 años antes, los autores Davenport y Patil reflexionaron que el rol del científico de datos se ha institucionalizado mejor, el alcance del trabajo se ha redefinido, la tecnología en la que se basa ha avanzado enormemente y la importancia de la experiencia no técnica, como la ética y la gestión del cambio, ha crecido. [ 8 ]
50 años de ciencia de datos
- Autor: David Donoho
- Datos de publicación: [ 9 ]
- Versión en línea: https://www.tandfonline.com/doi/full/10.1080/10618600.2017.1384734
- Descripción: Documento de análisis retrospectivo sobre la historia y los orígenes de la ciencia de datos, con comentarios de destacados estadísticos.
- Importancia: Se ha descrito como "el primero en el campo en presentar un estudio y una visión general tan completos y profundos" [ 10 ] y ayuda a definir el campo que tiene muchas definiciones.
El manifiesto del sistema de gestión de datos componible
- Autor: Pedro Pedreira, Orri Erling, Konstantinos Karanasos, Scott Schneider, Wes McKinney , Satya R Valluri, Mohamed Zait, Jacques Nadeau
- Datos de publicación: [ 11 ]
- Versión en línea: https://www.vldb.org/pvldb/vol16/p2679-pedreira.pdf
- Descripción: Documento conceptual que aboga por un cambio de paradigma en el diseño de los sistemas de gestión de datos, utilizando herramientas estándar, componibles e interoperables en lugar de herramientas de software aisladas.
- Importancia: Una visión que cambia el paradigma sobre cómo deberían diseñarse las futuras herramientas de software de ciencia de datos para lograr flujos de trabajo más eficientes, cuyos principios "serán especialmente cruciales para abordar la fragmentación, mejorar la interoperabilidad y promover la centralidad del usuario a medida que los ecosistemas de datos se vuelven cada vez más complejos". [ 12 ]
Recopilación y organización de datos
Datos ordenados
- Autor: Hadley Wickham
- Datos de publicación: [ 13 ]
- Versión en línea: https://www.jstatsoft.org/article/view/v059i10/ https://vita.had.co.nz/papers/tidy-data.pdf
- Descripción: Describe un marco para la limpieza de datos que se resume en la cita: "cada variable es una columna, cada observación es una fila y cada tipo de unidad de observación es una tabla". [ 13 ] Esto permite una estructura de datos estándar sobre la cual se pueden construir de manera consistente las herramientas de análisis de datos.
- Importancia : Citado más de 1500 veces, este esfuerzo por organizar los datos ha sido descrito por David Donoho como de "mayor impacto en la práctica actual del análisis de datos que muchos artículos de estadística teórica de gran prestigio". [ 9 ] En el contexto de la visualización de datos , se dice que esta publicación apoya "la exploración y la creación de prototipos eficientes porque se pueden asignar diferentes roles a las variables en el gráfico sin modificar nada del conjunto de datos original". [ 14 ]
Organización de datos en hojas de cálculo
- Autores: Karl W. Broman y Kara H. Woo
- Datos de publicación: [ 15 ]
- Versión en línea: https://www.tandfonline.com/doi/full/10.1080/00031305.2017.1375989
- Descripción: Este artículo ofrece recomendaciones prácticas para organizar datos en hojas de cálculo, como Microsoft Excel y Google Sheets , para reducir errores y facilitar análisis posteriores debido a limitaciones en las hojas de cálculo o peculiaridades del software .
- Importancia: Influye en la enseñanza tanto de profesionales de datos como de quienes no lo son para crear hojas de cálculo más fáciles de analizar, y se ha descrito para establecer las "mejores prácticas de las hojas de cálculo". [ 16 ]
visualizaciones de datos
Gráficos cuantitativos en estadística: una breve historia
- Autores: James R. Beniger y Dorothy L. Robyn
- Datos de publicación: [ 17 ]
- Versión en línea: https://www.jstor.org/stable/2683467
- Descripción: Describe la historia y la evolución de los gráficos cuantitativos en estadística, pasando por la organización espacial (siglos XVII y XVIII), la comparación discreta (siglos XVIII y XIX), la distribución continua (siglo XIX) y la distribución y correlación multivariante (finales del siglo XIX y siglo XX).
- Importancia: Ayuda a poner en perspectiva a los profesionales que aprenden datos la reciente utilización de gráficos. Una publicación posterior, "Métodos gráficos en estadística", de Stephen Fienberg en 1979, afirma que su publicación "debe mucho al trabajo de Beniger y Robyn". [ 18 ]
Práctica
Ciencia de datos para los negocios
- Autores: Foster Provost y Tom Fawcett
- Datos de publicación: [ 19 ]
- Versión en línea: No disponible
- Descripción: Describe a grandes rasgos los principios de la ciencia de datos y el pensamiento analítico de datos para las empresas.
- Importancia: Citado más de 3000 veces [ 20 ] , es "altamente recomendado para estudiantes" [ 21 ] , pero también se recomienda debido a su "relevancia para los líderes de alta dirección que desean crear y dirigir un equipo de científicos de datos e implementar la ciencia de datos para resolver problemas empresariales complejos". [ 22 ]
Estampación
Deuda técnica oculta en los sistemas de aprendizaje automático
- Autor: D. Sculley, Gary Holy, Daniel Golovin, Eugene Davydov, Todd Phillips, Dietmar Ebner, Vinay Chaudhary, Michael Young, Jean-François Crespo, Dan Dennison
- Datos de publicación: [ 23 ]
- Versión en línea: https://proceedings.neurips.cc/paper_files/paper/2015/file/86df7dcfd896fcaf2674f757a2463eba-Paper.pdf
- Descripción: Este artículo argumenta que es "peligroso pensar que los logros rápidos [en el aprendizaje automático complejo] se obtienen gratis" y ofrece una visión general de los factores de riesgo que deben tenerse en cuenta al implementar un sistema de aprendizaje automático.
- Importancia: Todos los autores trabajaron para Google , el artículo ha sido citado más de 2000 veces, [ 24 ] y ayudó a los profesionales que pensaban en implementar rápidamente una herramienta de aprendizaje automático sin comprender el mantenimiento a largo plazo de la herramienta.
Algunos aspectos útiles que debes saber sobre el aprendizaje automático.
- Autor: Pedro Domingos
- Datos de publicación: [ 25 ]
- Versión en línea: https://dl.acm.org/doi/10.1145/2347736.2347755 https://homes.cs.washington.edu/~pedrod/papers/cacm12.pdf
- Descripción: El propósito de este artículo es destilar el " conocimiento popular " inaccesible para implementar eficazmente proyectos de aprendizaje automático porque "los proyectos de aprendizaje automático tardan mucho más de lo necesario o terminan produciendo resultados menos que ideales". [ 25 ]
- Importancia: Citado más de 4000 veces [ 26 ] para influir en el conjunto común de conocimientos para profesionales de datos que utilizan aprendizaje automático. [ 27 ]
Enseñanza de la ciencia de datos
Curso introductorio de estadística: un currículo ptolemaico
- Autor: George W. Cobb [ 28 ]
- Datos de publicación: [ 29 ]
- Versión en línea: https://escholarship.org/uc/item/6hb3k0nz
- Descripción: Este artículo aboga por replantear la forma en que los profesores de estadística deberían estructurar sus cursos introductorios de estadística, alejándose de la maquinaria técnica basada en la distribución normal y acercándose a métodos alternativos más sencillos basados en permutaciones realizadas por ordenador.
- Importancia: Citado más de 300 veces, [ 30 ] este artículo influyó en los profesores de estadística del siglo XXI para que reconsideraran la enseñanza de la mera mecánica de la estadística, mientras que el uso de computadoras puede aprovecharse para hacer más con menos.
Véase también
Referencias
- ↑ "Conozca a las superestrellas de la IA de 4 mil millones de dólares que Google perdió" . Bloomberg . 13 de julio de 2023 – vía www.bloomberg.com.
- 1 2 3 4 Breiman, Leo (1 de agosto de 2001). "Modelado estadístico: las dos culturas (con comentarios y una réplica del autor)" . Statistical Science . 16 (3). doi : 10.1214/ss/1009213726 . ISSN 0883-4237 .
- ↑ Raper, Simon (29 de enero de 2020). "Las dos culturas de Leo Breiman"" . Importancia . 17 : 34– 37. doi : 10.1111/j.1740-9713.2020.01357.x . Consultado el 21 de mayo de 2024 .
- ↑ "Científico de datos: El trabajo más atractivo del siglo XXI" . Harvard Business Review . 1 de octubre de 2012. ISSN 0017-8012 . Consultado el 27 de marzo de 2025 .
- ↑ "¿Es el científico de datos el trabajo más atractivo de nuestro tiempo? - IEEE Spectrum" . spectrum.ieee.org . Consultado el 27 de marzo de 2025 .
- ↑ "Científicos de datos: Sigue siendo el trabajo más atractivo, si tan solo alguien les hiciera caso" . ZDNET . Consultado el 27 de marzo de 2025 .
- ↑ Kumar, Krishna (15 de marzo de 2021). "Por qué 'Científico de datos' seguirá siendo 'el trabajo más atractivo del siglo XXI'"" . Emprendedor . Consultado el 27 de marzo de 2025 .
- ↑ "¿Sigue siendo el científico de datos el trabajo más atractivo del siglo XXI?" . Harvard Business Review . 15 de julio de 2022. ISSN 0017-8012 . Consultado el 27 de marzo de 2025 .
- 1 2 Donoho, David (2 de octubre de 2017). "50 años de ciencia de datos" . Journal of Computational and Graphical Statistics . 26 (4): 745– 766. doi : 10.1080/10618600.2017.1384734 . ISSN 1061-8600 .
- ↑ Cao, Longbing (29 de junio de 2017). "Ciencia de datos: una visión general integral" . ACM Computing Surveys . 50 (3): 43:1–43:42. arXiv : 2007.03606 . doi : 10.1145/3076253 . ISSN 0360-0300 .
- ↑ Pedreira, Pedro; Erling, Orri; Karanasos, Konstantinos; Schneider, Scott; McKinney, Wes; Valluri, Satya R; Zait, Mohamed; Nadeau, Jacques (1 de junio de 2023). "El Manifiesto del Sistema de Gestión de Datos Composable" . Actas del Fondo de Dotación VLDB . 16 (10): 2679–2685.doi : 10.14778 / 3603581.3603604 . ISSN 2150-8097 .
- ↑ Somrah, Priyanka (18 de abril de 2024). "Destilando el manifiesto del sistema de gestión de datos componible" . Work-Bench . Recuperado el 17 de mayo de 2024 .
- 1 2 Wickham, Hadley (12 de septiembre de 2014). "Tidy Data" . Journal of Statistical Software . 59 (10): 1– 23. doi : 10.18637/jss.v059.i10 . ISSN 1548-7660 .
- ↑ Waskom, Michael (6 de abril de 2021). "seaborn: visualización de datos estadísticos" . Journal of Open Source Software . 6 (60): 3021. Bibcode : 2021JOSS....6.3021W . doi : 10.21105/joss.03021 . ISSN 2475-9066 .
- ^ Broman, Karl W.; Woo, Kara H. (2 de enero de 2018). «Organización de datos en Hojas de Cálculo» . El estadístico estadounidense . 72 (1): 2– 10. doi : 10.1080/00031305.2017.1375989 . ISSN 0003-1305 .
- ↑ Estaki, Mehrbod; Jiang, Lingjing; Bokulich, Nicholas A.; McDonald, Daniel; González, Antonio; Kosciolek, Tomasz; Martino, Cameron; Zhu, Qiyun; Birmingham, Amanda; Vázquez-Baeza, Yoshiki; Dillon, Matthew R.; Bolyen, Evan; Caporaso, J. Gregory; Knight, Rob (2020). "QIIME 2 permite un análisis integral de extremo a extremo de diversos datos de microbioma y estudios comparativos con datos disponibles públicamente" . Current Protocols in Bioinformatics . 70 (1): e100. doi : 10.1002/cpbi.100 . ISSN 1934-3396 . PMC 9285460. PMID 32343490 .
- ↑ Beniger, James R.; Robyn, Dorothy L. (1 de febrero de 1978). "Gráficos cuantitativos en estadística: una breve historia" . The American Statistician . 32 (1): 1– 11. doi : 10.2307/2683467 . JSTOR 2683467 .
- ↑ Fienberg, Stephen E. (1979). "Métodos gráficos en estadística" . The American Statistician . 33 (4): 165– 178. doi : 10.2307/2683729 . hdl : 11299/199302 . JSTOR 2683729 .
- ↑ Provost, Foster (2013). Ciencia de datos para los negocios . Tom Fawcett. Sebastopol, California: O'Reilly. ISBN 978-1-4493-7428-0.
- ↑ "Google Académico" . scholar.google.com . Consultado el 10 de marzo de 2026 .
- ↑ Bandyopadhyay, Ganadeva (15 de enero de 2014). "Reseña del libro: 'Ciencia de datos para los negocios' de Foster Provost y Tom Fawcett" . Blogcritics . Consultado el 10 de marzo de 2026 .
- ↑ B, Girish Pai (enero de 2024). "Reseña del libro - Data Science for Business – What You Need To Know About Data Mining and Data-Analytic Thinking de Foster Provost y Tom Fawcett, publicado por O'Reilly Media, Inc., 1006 Gravenstein Highway North, Sebastopol, CA 95472, 386 páginas, tapa dura, $49.99" (PDF) . MSNIM Management Review . 2 (1): 51– 52.
- ↑ Sculley, D.; Holt, Gary; Golovin, Daniel; Davydov, Eugene; Phillips, Todd; Ebner, Dietmar; Chaudhary, Vinay; Young, Michael; Crespo, Jean-Francois; Dennison, Dan (7 de diciembre de 2015). "Deuda técnica oculta en sistemas de aprendizaje automático" . Actas de la 28.ª Conferencia Internacional sobre Sistemas de Procesamiento de Información Neuronal - Volumen 2. NIPS'15. Cambridge, MA, EE. UU.: MIT Press: 2503–2511 .
- ↑ "Google Académico" . scholar.google.com . Consultado el 10 de marzo de 2026 .
- 1 2 Domingos, Pedro (1 de octubre de 2012). "Algunas cosas útiles que saber sobre el aprendizaje automático" . Communications of the ACM . 55 (10): 78– 87. doi : 10.1145/2347736.2347755 . ISSN 0001-0782 .
- ↑ Referencias de Google Scholar https://scholar.google.com/scholar?cites=4404716649035182981&as_sdt=40005&sciodt=0,10&hl=en&oi=gsb
- ↑ Burrell, Jenna (1 de junio de 2016). "Cómo 'piensa' la máquina: Entendiendo la opacidad en los algoritmos de aprendizaje automático" . Big Data & Society . 3 (1): 205395171562251. doi : 10.1177/2053951715622512 . ISSN 2053-9517 .
- ↑ "Recordando a George Cobb (1947–2020) | Noticias de Amstat" . 1 de julio de 2020. Consultado el 21 de abril de 2024 .
- ↑ Cobb, George W (12 de octubre de 2007). "El curso de estadística introductoria: ¿un currículo ptolemaico?" . Innovaciones tecnológicas en la educación estadística . 1 (1). doi : 10.5070/t511000028 . ISSN 1933-4214 .
- ↑ Referencias de Google Scholar https://scholar.google.com/scholar?cites=13882980985899619210&as_sdt=800005&sciodt=0,15&hl=en&oi=gsb
Enlaces externos
- Artículos y blogs técnicos de empresas que comparten sus trabajos sobre ciencia de datos y aprendizaje automático en entornos de producción.
- Ciencia de datos
- Listas relacionadas con la informática
- Listados de publicaciones científicas