Articulo de referencia

dplyr

dplyr es un paquete de R cuyo conjunto de funciones está diseñado para permitir la manipulación de dataframes (una estructura de datos similar a una hoja de cálculo ) de una man...

dplyr es un paquete de R cuyo conjunto de funciones está diseñado para permitir la manipulación de dataframes (una estructura de datos similar a una hoja de cálculo ) de una manera intuitiva y fácil de usar. Es uno de los paquetes principales del popular conjunto de paquetes tidyverse en el lenguaje de programación R. [ 2 ] Los analistas de datos suelen usar dplyr para transformar conjuntos de datos existentes a un formato más adecuado para algún tipo particular de análisis o visualización de datos. [ 3 ] [ 4 ]

Por ejemplo, alguien que desee analizar un conjunto de datos extenso podría querer visualizar solo un subconjunto menor. Alternativamente, un usuario podría querer reorganizar los datos para ver las filas ordenadas por algún valor numérico, o incluso según una combinación de valores del conjunto de datos original. Las funciones del paquete dplyr permiten realizar estas tareas.

dplyr se lanzó en 2014. [ 5 ] En la página web de dplyr, el paquete se describe como "una gramática de manipulación de datos, que proporciona un conjunto consistente de verbos que le ayudan a resolver los desafíos más comunes de manipulación de datos". [ 6 ]

Los cinco verbos básicos

Aunque dplyr incluye varias docenas de funciones que permiten diversas formas de manipulación de datos, el paquete presenta cinco verbos o acciones principales: [ 7 ]

  • filter() , que se utiliza para extraer filas de un dataframe, en función de las condiciones especificadas por el usuario;
  • select() , que se utiliza para seleccionar un subconjunto de un dataframe según sus columnas;
  • arrange() , que se utiliza para ordenar filas en un dataframe en función de los atributos que contienen columnas específicas;
  • mutate() , que se utiliza para crear nuevas variables, alterando y/o combinando valores de columnas existentes; y
  • summarize() , también escrito summarise() , se utiliza para agrupar valores de un dataframe en un único resumen.

Funciones adicionales

Además de sus cinco verbos principales, dplyr también incluye varias otras funciones que permiten la exploración y manipulación de dataframes. Entre ellas se incluyen:

  • count() , que se utiliza para sumar el número de observaciones únicas que contienen algún valor o atributo categórico en particular;
  • rename() , que permite al usuario modificar los nombres de las columnas de las variables, a menudo para mejorar la facilidad de uso y la comprensión intuitiva de un conjunto de datos;
  • slice_max() , que devuelve un subconjunto de datos que contiene las filas con el mayor número de valores para alguna variable en particular;
  • slice_min() , que devuelve un subconjunto de datos que contiene las filas con el menor número de valores para alguna variable en particular.

Conjuntos de datos integrados

El paquete dplyr viene con cinco conjuntos de datos. Estos son: band_instruments, band_instruments2, band_members, starwars, storms.

Los derechos de autor de dplyr pertenecen a Posit PBC , anteriormente RStudio PBC. dplyr se lanzó originalmente bajo una licencia GPL , pero en 2022, Posit cambió los términos de la licencia del paquete a la licencia MIT, "más permisiva" . [ 8 ] La principal diferencia entre los dos tipos de licencia es que la licencia MIT permite la reutilización posterior del código dentro de software propietario , mientras que una licencia GPL no lo permite.

Referencias

  1. "Versión 1.2.1" . 3 de abril de 2026. Consultado el 4 de abril de 2026 .
  2. Wickham, Hadley; Averick, Mara; Bryan, Jennifer; Chang, Winston; McGowan, Lucy D'Agostino; François, Romain; Grolemund, Garrett; Hayes, Alex; Henry, Lionel; Hester, Jim; Kuhn, Max; Pedersen, Thomas Lin; Miller, Evan; Bache, Stephan Milton; Müller, Kirill (2019-11-21). "Bienvenido al Tidyverse" . Journal of Open Source Software . 4 (43): 1686. doi : 10.21105/joss.01686 . ISSN 2475-9066 . 
  3. Yadav, Rohit (29 de octubre de 2019). "Pandas de Python vs. Tidyverse de R: ¿Quién sale victorioso?" . Analytics India Magazine . Recuperado el 6 de febrero de 2021 .
  4. Krill, Paul (30 de junio de 2015). "¿Por qué R? Ventajas e inconvenientes del lenguaje R" . InfoWorld . Consultado el 6 de febrero de 2021 .
  5. "Presentando dplyr" . blog.rstudio.com . 17 de enero de 2014. Consultado el 2 de septiembre de 2020 .
  6. "Referencia de función" . dplyr.tidyverse.org . Consultado el 6 de febrero de 2021 .
  7. Grolemund, Garrett; Wickham, Hadley. 5 Transformación de datos | R para la ciencia de datos .
  8. "Una gramática de la manipulación de datos" . tidyverse.org . Consultado el 14 de enero de 2023 .