Articulo de referencia

Análisis de datos

El análisis de datos es el proceso de inspeccionar, limpiar , transformar y modelar datos con el objetivo de descubrir información útil, fundamentar conclusiones y apoyar la tom...

El análisis de datos es el proceso de inspeccionar, limpiar , transformar y modelar datos con el objetivo de descubrir información útil, fundamentar conclusiones y apoyar la toma de decisiones . [ 1 ] El análisis de datos tiene múltiples facetas y enfoques, abarcando diversas técnicas bajo una variedad de nombres, y se utiliza en diferentes dominios de negocios, ciencia y ciencias sociales. [ 2 ] En el mundo empresarial actual, el análisis de datos juega un papel importante para hacer que las decisiones sean más científicas y ayudar a las empresas a operar de manera más efectiva. [ 3 ] Se utiliza ampliamente en campos como la analítica empresarial, la atención médica y la inteligencia artificial para extraer información significativa de los datos.

La minería de datos es una técnica particular de análisis de datos que se centra en el modelado estadístico y el descubrimiento de conocimiento con fines predictivos en lugar de puramente descriptivos, mientras que la inteligencia empresarial abarca el análisis de datos que se basa en gran medida en la agregación, centrándose principalmente en la información empresarial. En las aplicaciones estadísticas, el análisis de datos se puede dividir en estadística descriptiva , análisis exploratorio de datos (AED) y análisis confirmatorio de datos (ACD). [ 4 ] El AED se centra en descubrir nuevas características en los datos, mientras que el ACD se centra en confirmar o refutar hipótesis existentes . [ 5 ] El análisis predictivo se centra en la aplicación de modelos estadísticos para la predicción o clasificación predictiva, mientras que el análisis de texto aplica técnicas estadísticas, lingüísticas y estructurales para extraer y clasificar información de fuentes textuales, una variedad de datos no estructurados . Todas las anteriores son variedades de análisis de datos. [ 6 ]

proceso de análisis de datos

Diagrama de flujo del proceso de ciencia de datos, extraído de " Doing Data Science" , de Schutt  y O'Neil (2013).

El análisis de datos es un proceso para obtener datos brutos y, posteriormente, convertirlos en información útil para la toma de decisiones por parte de los usuarios. [ 1 ] El estadístico John Tukey definió el análisis de datos en 1961 como:

"Procedimientos para analizar datos, técnicas para interpretar los resultados de dichos procedimientos, formas de planificar la recopilación de datos para que su análisis sea más fácil, más preciso o más exacto, y toda la maquinaria y los resultados de la estadística (matemática) que se aplican al análisis de datos." [ 7 ]

Hay varias fases, y son iterativas , de modo que la retroalimentación de fases posteriores puede dar lugar a trabajo adicional en fases anteriores. [ 8 ]

Requisitos de datos

Los datos son necesarios como insumos para el análisis, el cual se especifica según los requisitos de quienes dirigen el análisis (o los clientes, quienes utilizarán el producto final del análisis). [ 9 ] El tipo general de entidad sobre la cual se recopilarán los datos se denomina unidad experimental (por ejemplo, una persona o una población de personas). Se pueden especificar y obtener variables específicas relacionadas con una población (por ejemplo, edad e ingresos). Los datos pueden ser numéricos o categóricos (es decir, una etiqueta de texto para números). [ 8 ]

Recopilación de datos

Los datos pueden recopilarse de diversas fuentes [ 10 ] y organizarse en conjuntos de datos , algunos de los cuales están disponibles públicamente . Los analistas pueden comunicar los requisitos a los responsables de los datos, como el personal de Tecnologías de la Información de una organización [ 11 ] . La recopilación de datos es el proceso de obtener y medir información sobre variables específicas en un sistema establecido, lo que permite responder preguntas relevantes y evaluar resultados. Los datos también pueden recopilarse mediante sensores en el entorno, como cámaras de tráfico, satélites, dispositivos de grabación, etc. Asimismo, pueden obtenerse mediante entrevistas, descargas de fuentes en línea o consulta de documentación [ 8 ] .

Proceso de datos

Las fases del ciclo de inteligencia que se utilizan para convertir la información bruta en inteligencia o conocimiento útil son conceptualmente similares a las fases del análisis de datos.

La integración de datos es un paso previo al análisis de datos: los datos, una vez obtenidos, deben procesarse u organizarse para su análisis. Por ejemplo, esto puede implicar la colocación de datos en filas y columnas en formato de tabla ( conocido como datos estructurados ) para su posterior análisis, a menudo mediante el uso de hojas de cálculo (por ejemplo, Excel) o software estadístico. [ 8 ]

Limpieza de datos

Una vez procesados ​​y organizados, los datos pueden estar incompletos, contener duplicados o errores. [ 12 ] La necesidad de limpiar los datos surgirá de problemas en la forma en que se ingresan y almacenan. [ 12 ] [ 13 ] La limpieza de datos es el proceso de prevenir y corregir estos errores. Las tareas comunes incluyen la comparación de registros, la identificación de inexactitudes en los datos, la calidad general de los datos existentes, la eliminación de duplicados y la segmentación de columnas. [ 14 ] [ 15 ]

Estos problemas de datos también pueden identificarse mediante diversas técnicas analíticas. Por ejemplo, con información financiera, los totales de variables específicas pueden compararse con cifras publicadas por separado que se consideran fiables. [ 16 ] También pueden revisarse cantidades inusuales, superiores o inferiores a umbrales predeterminados. Existen varios tipos de limpieza de datos que dependen del tipo de datos del conjunto; esto podría incluir números de teléfono, direcciones de correo electrónico, empleadores u otros valores. [ 17 ] Los métodos de datos cuantitativos para la detección de valores atípicos pueden utilizarse para eliminar datos que parecen tener una mayor probabilidad de haber sido introducidos incorrectamente. Los correctores ortográficos de texto pueden utilizarse para reducir la cantidad de palabras mal escritas. Sin embargo, es más difícil determinar si las palabras son contextualmente (es decir, semántica e idiomáticamente) correctas.

Análisis exploratorio de datos

Una vez limpios los conjuntos de datos, se pueden comenzar a analizar mediante análisis exploratorio de datos . El proceso de exploración de datos puede dar lugar a una limpieza adicional de los datos o a solicitudes adicionales de datos; por lo tanto, la inicialización de las fases iterativas mencionadas anteriormente. [ 18 ] Las estadísticas descriptivas , como la media, la mediana y la desviación estándar, se utilizan a menudo para caracterizar ampliamente los datos. [ 19 ] [ 20 ] También se utiliza la visualización de datos , en la que el analista puede examinar los datos en un formato gráfico para obtener información adicional sobre los mensajes que contienen. [ 8 ]

Modelado de datos

Se pueden aplicar fórmulas o modelos matemáticos (apoyados por algoritmos ) a los datos para identificar relaciones entre las variables; por ejemplo, comprobando la correlación y determinando si existe causalidad . En términos generales, se pueden desarrollar modelos para evaluar una variable específica en función de otras variables contenidas en el conjunto de datos, con un cierto error residual que depende de la precisión del modelo implementado ( p. ej. , Datos = Modelo + Error). [ 21 ]

La estadística inferencial utiliza técnicas que miden las relaciones entre variables particulares. [ 22 ] Por ejemplo, el análisis de regresión puede utilizarse para modelar si un cambio en la publicidad ( variable independiente X ) proporciona una explicación para la variación en las ventas ( variable dependiente Y ), es decir, ¿es Y una función de X? Esto puede describirse como ( Y = aX + b + error), donde el modelo se diseña de tal manera que ( a ) y ( b ) minimizan el error cuando el modelo predice Y para un rango dado de valores de X. [ 23 ]

Producto de datos

Un producto de datos es una aplicación informática que toma datos de entrada y genera salidas , reintroduciéndolas en el entorno. [ 24 ] Puede basarse en un modelo o algoritmo. Por ejemplo, una aplicación que analiza datos sobre el historial de compras de un cliente y utiliza los resultados para recomendarle otras compras que podrían gustarle. [ 25 ] [ 8 ]

Comunicación

La visualización de datos se utiliza para ayudar a comprender los resultados después de que se analizan los datos. [ 26 ]

Una vez analizados los datos, pueden presentarse en diversos formatos a los usuarios del análisis para satisfacer sus necesidades. [ 27 ] Los usuarios pueden proporcionar retroalimentación, lo que da lugar a análisis adicionales.

Al determinar cómo comunicar los resultados, el analista puede considerar la implementación de diversas técnicas de visualización de datos para facilitar la comunicación del mensaje a la audiencia de manera más clara y eficiente. La visualización de datos utiliza representaciones gráficas (como tablas y diagramas) para comunicar los mensajes clave contenidos en los datos. Las tablas son una herramienta valiosa, ya que permiten al usuario consultar y centrarse en cifras específicas; mientras que los diagramas (por ejemplo, de barras o de líneas) pueden ayudar a explicar los mensajes cuantitativos contenidos en los datos. [ 28 ]

Mensajes cuantitativos

Una serie temporal ilustrada con un gráfico lineal que muestra las tendencias del gasto y los ingresos federales de Estados Unidos a lo largo del tiempo.
Un diagrama de dispersión que ilustra la correlación entre dos variables (inflación y desempleo) medidas en momentos determinados.

Stephen Few describió ocho tipos de mensajes cuantitativos que los usuarios pueden intentar comunicar a partir de un conjunto de datos, incluidos los gráficos asociados. [ 29 ] [ 30 ]

  1. Series temporales: Se registra una única variable a lo largo de un período de tiempo, como la tasa de desempleo durante un período de 10 años. Se puede utilizar un gráfico de líneas para mostrar la tendencia.
  2. Clasificación: Las subdivisiones categóricas se clasifican en orden ascendente o descendente, como por ejemplo una clasificación del rendimiento de ventas (la medida ) por vendedores (la categoría , donde cada vendedor constituye una subdivisión categórica ) durante un período determinado. Se puede utilizar un gráfico de barras para mostrar la comparación entre los vendedores. [ 31 ]
  3. Parte-todo: Las subdivisiones categóricas se miden como una proporción respecto al total (es decir, un porcentaje sobre el 100%). Un gráfico circular o de barras puede mostrar la comparación de proporciones, como la cuota de mercado representada por los competidores en un mercado. [ 32 ]
  4. Desviación: Las subdivisiones categóricas se comparan con una referencia, como por ejemplo, una comparación de los gastos reales frente a los presupuestados para varios departamentos de una empresa durante un período determinado. Un gráfico de barras puede mostrar la comparación entre el importe real y el de referencia. [ 33 ]
  5. Distribución de frecuencias: Muestra el número de observaciones de una variable determinada para un intervalo dado, como el número de años en los que la rentabilidad del mercado de valores se encuentra entre intervalos como 0-10%, 11-20%, etc. Para este análisis se puede utilizar un histograma , un tipo de gráfico de barras.
  6. Correlación: Comparación entre observaciones representadas por dos variables (X, Y) para determinar si tienden a moverse en la misma dirección o en direcciones opuestas. Por ejemplo, graficar el desempleo (X) y la inflación (Y) para una muestra de meses. Generalmente se utiliza un diagrama de dispersión para este propósito. [ 34 ]
  7. Comparación nominal: Comparación de subdivisiones categóricas sin un orden específico, como el volumen de ventas por código de producto. Para esta comparación se puede utilizar un gráfico de barras. [ 35 ]
  8. Geográfico o geoespacial: Comparación de una variable a través de un mapa o diseño, como la tasa de desempleo por estado o el número de personas en los distintos pisos de un edificio. Generalmente se utiliza un cartograma . [ 29 ]

Análisis de datos cuantitativos en finanzas

El autor Jonathan Koomey ha recomendado una serie de buenas prácticas para comprender los datos cuantitativos. Estas incluyen: [ 16 ]

  • Antes de realizar un análisis, compruebe si existen anomalías en los datos brutos.
  • Repita los cálculos importantes, como la verificación de columnas de datos que se basan en fórmulas;
  • Confirme que los totales principales son la suma de los subtotales;
  • Compruebe las relaciones entre los números que deberían estar relacionados de forma predecible, como por ejemplo las proporciones a lo largo del tiempo;
  • Normalizar las cifras para facilitar las comparaciones, como por ejemplo analizar las cantidades por persona o en relación con el PIB o como un valor de índice en relación con un año base;
  • Descomponga los problemas en sus partes componentes analizando los factores que llevaron a los resultados, como el análisis DuPont del retorno sobre el capital.

Para las variables que se examinan, los analistas suelen obtener estadísticas descriptivas , como la media (promedio), la mediana y la desviación estándar . También pueden analizar la distribución de las variables clave para ver cómo se agrupan los valores individuales alrededor de la media. [ 16 ]

Una ilustración del principio MECE utilizado para el análisis de datos.

McKinsey & Company denominó principio MECE a una técnica para descomponer un problema cuantitativo en sus partes componentes . MECE significa "Mutuamente Exclusivo y Colectivamente Exhaustivo". [ 36 ] Cada capa se puede descomponer en sus componentes; cada uno de los subcomponentes debe ser mutuamente excluyente y sumar colectivamente la capa superior. Por ejemplo, el beneficio, por definición, se puede descomponer en ingresos totales y costes totales. [ 37 ]

Los analistas pueden utilizar mediciones estadísticas sólidas para resolver ciertos problemas analíticos. La prueba de hipótesis se utiliza cuando el analista formula una hipótesis particular sobre el estado real de las cosas y se recopilan datos para determinar si esa hipótesis es verdadera o falsa. [ 38 ] Por ejemplo, la hipótesis podría ser que "el desempleo no tiene efecto sobre la inflación", lo cual se relaciona con un concepto económico llamado curva de Phillips . [ 39 ] La prueba de hipótesis implica considerar la probabilidad de errores de tipo I y tipo II , que se relacionan con si los datos respaldan la aceptación o el rechazo de la hipótesis. [ 40 ]

El análisis de regresión puede utilizarse cuando el analista intenta determinar en qué medida la variable independiente X afecta a la variable dependiente Y (por ejemplo, "¿En qué medida los cambios en la tasa de desempleo (X) afectan a la tasa de inflación (Y)?"). [ 41 ]

El análisis de condiciones necesarias (ACN) puede utilizarse cuando el analista intenta determinar en qué medida la variable independiente X permite la variable Y (por ejemplo, "¿En qué medida es necesaria una determinada tasa de desempleo (X) para una determinada tasa de inflación (Y)?"). [ 41 ] Mientras que el análisis de regresión (múltiple) utiliza lógica aditiva, donde cada variable X puede producir el resultado y las X pueden compensarse entre sí (son suficientes pero no necesarias), [ 42 ] el análisis de condiciones necesarias (ACN) utiliza lógica de necesidad, donde una o más variables X permiten que exista el resultado, pero pueden no producirlo (son necesarias pero no suficientes). Cada condición necesaria debe estar presente y la compensación no es posible. [ 43 ]

Actividades analíticas de los usuarios de datos

Actividades analíticas de los usuarios de visualización de datos

Los usuarios pueden tener puntos de datos específicos de interés dentro de un conjunto de datos, a diferencia de los mensajes generales descritos anteriormente. Estas actividades analíticas de bajo nivel se presentan en la siguiente tabla. La taxonomía también puede organizarse en tres polos de actividades: recuperación de valores, búsqueda de puntos de datos y organización de puntos de datos. [ 44 ] [ 45 ] [ 46 ]

Obstáculos para un análisis eficaz

Pueden existir barreras para un análisis eficaz entre los analistas que realizan el análisis de datos o entre la audiencia. Distinguir entre hechos y opiniones, los sesgos cognitivos y la falta de conocimientos numéricos son desafíos para un análisis de datos sólido. [ 47 ]

Confusión entre hechos y opiniones

Tienes derecho a tu propia opinión, pero no tienes derecho a tus propios hechos.

Un análisis eficaz requiere obtener datos relevantes para responder preguntas, fundamentar una conclusión u opinión formal , o probar hipótesis . [ 48 ] Los hechos, por definición, son irrefutables, lo que significa que cualquier persona involucrada en el análisis debería poder ponerse de acuerdo sobre ellos. El auditor de una empresa pública debe llegar a una opinión formal sobre si los estados financieros de las corporaciones que cotizan en bolsa están «presentados de manera razonable, en todos los aspectos materiales». [ 49 ] Esto requiere un análisis exhaustivo de datos y evidencia fáctica para fundamentar su opinión.

Sesgos cognitivos

Existen diversos sesgos cognitivos que pueden afectar negativamente el análisis. Por ejemplo, el sesgo de confirmación es la tendencia a buscar o interpretar información de manera que confirme las propias ideas preconcebidas. [ 50 ] Además, las personas pueden desacreditar la información que no respalda sus puntos de vista. [ 51 ]

Los analistas pueden recibir formación específica para ser conscientes de estos sesgos y cómo superarlos. [ 52 ] En su libro Psicología del análisis de inteligencia , el analista retirado de la CIA, Richards Heuer, escribió que los analistas deberían delimitar claramente sus supuestos y cadenas de inferencia, y especificar el grado y la fuente de la incertidumbre implicada en las conclusiones. [ 53 ] Hizo hincapié en los procedimientos para ayudar a descubrir y debatir puntos de vista alternativos. [ 54 ]

Innumeración

Los analistas eficaces suelen dominar diversas técnicas numéricas. Sin embargo, es posible que el público no posea tales conocimientos numéricos o habilidades aritméticas ; se dice que son analfabetos en números. [ 55 ] Quienes comunican los datos también pueden intentar engañar o desinformar, utilizando deliberadamente técnicas numéricas erróneas. [ 56 ]

Por ejemplo, que un número aumente o disminuya puede no ser el factor clave. Más importante puede ser el número en relación con otro, como el tamaño de los ingresos o gastos del gobierno en relación con el tamaño de la economía (PIB) o el monto de los costos en relación con los ingresos en los estados financieros corporativos. [ 57 ] Esta técnica numérica se conoce como normalización [ 16 ] o escalamiento común. Existen muchas técnicas de este tipo empleadas por los analistas, ya sea para ajustar por inflación (es decir, comparar datos reales con nominales) o para considerar el aumento de la población, la demografía, etc. [ 58 ]

Los analistas también pueden analizar datos bajo diferentes supuestos o escenarios. Por ejemplo, cuando realizan un análisis de estados financieros , a menudo reformulan los estados financieros bajo diferentes supuestos para ayudar a llegar a una estimación del flujo de efectivo futuro, que luego descuentan a valor presente en función de alguna tasa de interés, para determinar la valoración de la empresa o sus acciones. [ 59 ] De manera similar, la CBO analiza los efectos de varias opciones de política sobre los ingresos, los gastos y los déficits del gobierno, creando escenarios futuros alternativos para medidas clave. [ 60 ]

Otras aplicaciones

Análisis e inteligencia empresarial

La analítica es el "uso extensivo de datos, análisis estadístico y cuantitativo, modelos explicativos y predictivos, y gestión basada en hechos para impulsar decisiones y acciones". Es un subconjunto de la inteligencia empresarial , que es un conjunto de tecnologías y procesos que utiliza datos para comprender y analizar el desempeño empresarial con el fin de impulsar la toma de decisiones. [ 61 ]

Educación

En educación , la mayoría de los educadores tienen acceso a un sistema de datos para analizar los datos de los estudiantes. [ 62 ] Estos sistemas de datos presentan los datos a los educadores en un formato de datos de venta libre (que incluye etiquetas, documentación complementaria y un sistema de ayuda, y permite tomar decisiones clave sobre el empaquetado, la visualización y el contenido) para mejorar la precisión de los análisis de datos de los educadores. [ 63 ]

Notas para profesionales

Esta sección contiene explicaciones bastante técnicas que pueden ayudar a los profesionales, pero que están fuera del alcance típico de un artículo de Wikipedia. [ 64 ]

Análisis inicial de datos

La distinción más importante entre la fase inicial de análisis de datos y la fase principal de análisis es que durante el análisis inicial de datos se evita cualquier análisis que tenga como objetivo responder a la pregunta de investigación original. La fase inicial de análisis de datos se guía por las siguientes cuatro preguntas: [ 65 ]

Calidad de los datos

La calidad de los datos debe verificarse lo antes posible. La calidad de los datos puede evaluarse de varias maneras, utilizando diferentes tipos de análisis: recuentos de frecuencia, estadística descriptiva (media, desviación estándar, mediana), normalidad (asimetría, curtosis, histogramas de frecuencia); es necesaria la imputación normal. [ 66 ]

  • Análisis de observaciones extremas : las observaciones atípicas en los datos se analizan para ver si parecen perturbar la distribución. [ 67 ]
  • Comparación y corrección de diferencias en los esquemas de codificación: las variables se comparan con los esquemas de codificación de variables externas al conjunto de datos y, posiblemente, se corrigen si los esquemas de codificación no son comparables. [ 68 ]
  • Prueba de varianza del método común . La elección de los análisis para evaluar la calidad de los datos durante la fase inicial de análisis de datos depende de los análisis que se realizarán en la fase principal de análisis. [ 69 ]

Calidad de las mediciones

La calidad de los instrumentos de medición solo debe verificarse durante la fase inicial de análisis de datos cuando este no sea el foco o la pregunta de investigación del estudio. [ 70 ] Se debe verificar si la estructura de los instrumentos de medición corresponde a la estructura reportada en la literatura.

Existen dos maneras de evaluar la calidad de la medición:

  • Análisis factorial confirmatorio
  • Análisis de homogeneidad ( consistencia interna ), que proporciona una indicación de la fiabilidad de un instrumento de medición. [ 71 ] Durante este análisis, se inspeccionan las varianzas de los ítems y las escalas, el alfa de Cronbach de las escalas y el cambio en el alfa de Cronbach cuando se elimina un ítem de una escala. [ 72 ]

transformaciones iniciales

Tras evaluar la calidad de los datos y de las mediciones, se podría decidir imputar los datos faltantes o realizar transformaciones iniciales de una o más variables, aunque esto también puede hacerse durante la fase principal del análisis. [ 73 ] Las posibles transformaciones de variables son: [ 74 ]

  • Transformación de raíz cuadrada (si la distribución difiere moderadamente de la normal)
  • Transformación logarítmica (si la distribución difiere sustancialmente de la normal)
  • Transformación inversa (si la distribución difiere considerablemente de la normal)
  • Convertir en categórica (ordinal/dicotómica) (si la distribución difiere gravemente de la normal y ninguna transformación ayuda).

¿La implementación del estudio cumplió con los objetivos del diseño de la investigación?

Se debe verificar el éxito del procedimiento de aleatorización , por ejemplo, comprobando si las variables de antecedentes y sustantivas se distribuyen de manera uniforme dentro y entre los grupos. Si el estudio no necesitó o no utilizó un procedimiento de aleatorización, se debe verificar el éxito del muestreo no aleatorio, por ejemplo, comprobando si todos los subgrupos de la población de interés están representados en la muestra. [ 75 ] Otras posibles distorsiones de datos que deben verificarse son:

Características de la muestra de datos

En cualquier informe o artículo, la estructura de la muestra debe describirse con precisión. Es especialmente importante determinar con exactitud el tamaño del subgrupo cuando se realizarán análisis de subgrupos durante la fase de análisis principal. [ 77 ] Las características de la muestra de datos pueden evaluarse observando:

  • Estadísticas básicas de variables importantes
  • Diagramas de dispersión
  • Correlaciones y asociaciones
  • Tablas de contingencia [ 78 ]

Etapa final del análisis inicial de datos.

Durante la etapa final, se documentan los resultados del análisis de datos inicial y se toman las medidas correctivas necesarias, preferibles y posibles. Asimismo, el plan original para los análisis de datos principales puede y debe detallarse o reescribirse. Para ello, se pueden y deben tomar varias decisiones sobre los análisis de datos principales:

  • En el caso de variables no normales : ¿debería transformarse la variable; convertirla en categórica (ordinal/dicotómica); adaptar el método de análisis?
  • En caso de datos faltantes : ¿deben ignorarse o imputarse los datos faltantes? ¿Qué técnica de imputación debe utilizarse?
  • En caso de valores atípicos : ¿deberían utilizarse técnicas de análisis robustas?
  • En caso de que los ítems no se ajusten a la escala: ¿debería adaptarse el instrumento de medición omitiendo ítems, o más bien garantizar la comparabilidad con otros (usos del) instrumento(s) de medición?
  • En el caso de subgrupos (demasiado) pequeños: ¿debería descartarse la hipótesis sobre las diferencias entre grupos o utilizarse técnicas para muestras pequeñas, como pruebas exactas o bootstrapping ?
  • En caso de que el procedimiento de aleatorización parezca defectuoso: ¿se pueden y se deben calcular las puntuaciones de propensión e incluirlas como covariables en los análisis principales? [ 79 ]

Análisis

Se pueden utilizar varios análisis durante la fase inicial de análisis de datos: [ 80 ]

  • Estadísticas univariadas (variable única)
  • Asociaciones bivariadas (correlaciones)
  • Técnicas gráficas (diagramas de dispersión)

Es importante tener en cuenta los niveles de medición de las variables para los análisis, ya que existen técnicas estadísticas especiales para cada nivel: [ 81 ]

  • Variables nominales y ordinales
    • Recuentos de frecuencia (números y porcentajes)
    • Asociaciones
      • circunvalaciones (tablas cruzadas)
      • Análisis loglineal jerárquico (restringido a un máximo de 8 variables)
      • Análisis loglineal (para identificar variables relevantes/importantes y posibles factores de confusión)
    • Pruebas exactas o remuestreo (en caso de que los subgrupos sean pequeños).
    • Cálculo de nuevas variables
  • Variables continuas
    • Distribución
      • Estadísticas (media, desviación estándar, varianza, asimetría, curtosis)
      • Exhibiciones de tallos y hojas
      • Diagramas de caja

Análisis de datos principales

En la fase de análisis principal, se realizan análisis destinados a responder la pregunta de investigación, así como cualquier otro análisis relevante necesario para redactar el primer borrador del informe de investigación. [ 82 ]

Enfoques exploratorios y confirmatorios

En la fase principal de análisis, se puede adoptar un enfoque exploratorio o confirmatorio. Por lo general, el enfoque se decide antes de recopilar los datos. [ 83 ] En un análisis exploratorio, no se plantea ninguna hipótesis clara antes de analizar los datos, y se buscan modelos que los describan adecuadamente. [ 84 ] En un análisis confirmatorio, se ponen a prueba hipótesis claras sobre los datos. [ 85 ]

El análisis exploratorio de datos debe interpretarse con cuidado. Al probar varios modelos a la vez, existe una alta probabilidad de encontrar al menos uno de ellos como significativo, pero esto puede deberse a un error de tipo I. Es importante ajustar siempre el nivel de significancia al probar varios modelos, por ejemplo, mediante una corrección de Bonferroni . [ 86 ] Además, no se debe realizar un análisis confirmatorio después de un análisis exploratorio en el mismo conjunto de datos. [ 87 ] Un análisis exploratorio se utiliza para encontrar ideas para una teoría, pero no para probarla. [ 87 ] Cuando se encuentra un modelo exploratorio en un conjunto de datos, realizar un análisis confirmatorio después de ese análisis en el mismo conjunto de datos podría simplemente significar que los resultados del análisis confirmatorio se deben al mismo error de tipo I que dio lugar al modelo exploratorio en primer lugar. [ 87 ] Por lo tanto, el análisis confirmatorio no será más informativo que el análisis exploratorio original. [ 88 ]

Estabilidad de los resultados

Es importante obtener alguna indicación sobre cuán generalizables son los resultados. [ 89 ] Si bien esto suele ser difícil de comprobar, se puede observar la estabilidad de los resultados. ¿Son los resultados fiables y reproducibles? Hay dos formas principales de hacerlo.

  • Validación cruzada . Al dividir los datos en varias partes, podemos comprobar si un análisis (como un modelo ajustado) basado en una parte de los datos se generaliza también a otra parte de los datos. [ 90 ] Sin embargo, la validación cruzada suele ser inapropiada si existen correlaciones dentro de los datos, por ejemplo, con datos de panel . [ 91 ] Por lo tanto, a veces es necesario utilizar otros métodos de validación. Para más información sobre este tema, véase validación de modelos estadísticos . [ 92 ]
  • Análisis de sensibilidad . Un procedimiento para estudiar el comportamiento de un sistema o modelo cuando se varían (sistemáticamente) los parámetros globales. Una forma de hacerlo es mediante el método bootstrap . [ 93 ]

Software gratuito para el análisis de datos

El software gratuito para el análisis de datos incluye:

  • DevInfo – Un sistema de base de datos avalado por el Grupo de las Naciones Unidas para el Desarrollo para el seguimiento y análisis del desarrollo humano. [ 94 ]
  • ELKI – Marco de minería de datos en Java con funciones de visualización orientadas a la minería de datos.
  • KNIME – Konstanz Information Miner, un marco de análisis de datos completo y fácil de usar.
  • Orange : una herramienta de programación visual que incluye visualización interactiva de datos y métodos para el análisis estadístico de datos, la minería de datos y el aprendizaje automático .
  • Pandas : biblioteca de Python para el análisis de datos.
  • PAW – Marco de análisis de datos FORTRAN/C desarrollado en el CERN .
  • R – Un lenguaje de programación y entorno de software para computación estadística y gráficos. [ 95 ]
  • ROOT – Marco de análisis de datos en C++ desarrollado en el CERN .
  • SciPy – Biblioteca de Python para computación científica.
  • Julia : un lenguaje de programación muy adecuado para el análisis numérico y la ciencia computacional.

Análisis reproducible

El flujo de trabajo típico para el análisis de datos implica recopilar datos, ejecutar análisis, crear visualizaciones y redactar informes. Sin embargo, este flujo de trabajo presenta desafíos, como la separación entre los scripts de análisis y los datos, así como la brecha entre el análisis y la documentación. A menudo, el orden correcto para ejecutar los scripts se describe de forma informal o reside en la memoria del científico de datos. La posibilidad de perder esta información genera problemas de reproducibilidad.

Para abordar estos desafíos, es esencial documentar el contenido y el flujo de trabajo de los scripts de análisis. Además, la documentación general es crucial, así como proporcionar informes comprensibles tanto para máquinas como para humanos, y garantizar una representación precisa del flujo de trabajo de análisis incluso a medida que los scripts evolucionan. [ 96 ]

concursos de análisis de datos

Diversas empresas y organizaciones organizan concursos de análisis de datos para incentivar a los investigadores a utilizar sus datos o a resolver una pregunta específica mediante el análisis de datos. Algunos ejemplos de concursos internacionales de análisis de datos reconocidos son:

Véase también

Referencias

Citas

  1. 1 2 "Transformando datos no estructurados en información útil" , Big Data, Minería y Analítica , Auerbach Publications, 12 de marzo de 2014, págs. 227–246 , doi : 10.1201/b16666-14 , ISBN  978-0-429-09529-0, consultado el 29 de mayo de 2021
  2. «Las múltiples facetas de las funciones de correlación» , Técnicas de análisis de datos para científicos físicos , Cambridge University Press, 2017, págs. 526–576 , doi : 10.1017/9781108241922.013 , ISBN  978-1-108-41678-8, consultado el 29 de mayo de 2021
  3. Xia, BS, & Gong, P. (2015). Revisión de la inteligencia empresarial mediante el análisis de datos. Benchmarking , 21 (2), 300-311. doi : 10.1108/BIJ-08-2012-0050
  4. "Reglas de codificación de datos y análisis exploratorio (EDA) para la codificación de datos y supuestos estadísticos del análisis exploratorio de datos (EDA)" , SPSS para estadística intermedia , Routledge, 16 de agosto de 2004, págs. 42-67 , doi : 10.4324/9781410611420-6 , ISBN  978-1-4106-1142-0, consultado el 29 de mayo de 2021
  5. ^ Samandar, Petersson; Svantesson, Sofía (2017). Skapandet av förtroende inom eWOM : Enstudie av profilbildens effekt ur ett könsperspektiv . Högskolan i Gävle, Företagsekonomi. OCLC 1233454128 .  
  6. Buenas noches, James (13 de enero de 2011). "El pronóstico para el análisis predictivo: caliente y cada vez más caliente" . Análisis estadístico y minería de datos: The ASA Data Science Journal . 4 (1): 9– 10. doi : 10.1002/sam.10106 . ISSN 1932-1864 . S2CID 38571193 .  
  7. Tukey, John W. (marzo de 1962). "John Tukey: El futuro del análisis de datos - julio de 1961" . The Annals of Mathematical Statistics . 33 (1): 1– 67. doi : 10.1214/aoms/1177704711 . Archivado del original el 26 de enero de 2020. Consultado el 1 de enero de 2015 .
  8. 1 2 3 4 5 6 Schutt, Rachel; O'Neil, Cathy (2013). Doing Data Science . O'Reilly Media . ISBN 978-1-449-35865-5.
  9. "USO DE LOS DATOS" , Manual de análisis de productos derivados del petróleo , Hoboken, NJ: John Wiley & Sons, Inc, 6 de febrero de 2015, págs. 296–303 , doi : 10.1002/9781118986370.ch18 , ISBN  978-1-118-98637-0, consultado el 29 de mayo de 2021
  10. ^ Olusola, Johnson Adedeji; Shote, Adebola Adekunle; Ouigmane, Abdellah; Isaifan, Rima J. (7 de mayo de 2021). "Tabla 1: Tipo de datos y fuentes de datos recopilados para esta investigación" . PeerJ . 9 : e11387. doi : 10.7717/peerj.11387/table-1 .
  11. MacPherson, Derek (16 de octubre de 2019), «Perspectivas de los analistas de tecnología de la información» , Estrategia de datos en colegios y universidades , Routledge, págs. 168-183 , doi : 10.4324/9780429437564-12 , ISBN  978-0-429-43756-4, S2CID 211738958 , consultado el 29-05-2021 
  12. 1 2 Bohannon, John (24 de febrero de 2016). "Muchas encuestas, aproximadamente una de cada cinco, pueden contener datos fraudulentos" . Science . doi : 10.1126/science.aaf4104 . ISSN 0036-8075 . 
  13. Hancock, RGV; Carter, Tristan (febrero de 2010). "¿Qué tan confiables son nuestros análisis arqueométricos publicados? Efectos de las técnicas analíticas a lo largo del tiempo en el análisis elemental de obsidiana" . Journal of Archaeological Science . 37 (2): 243– 250. Bibcode : 2010JArSc..37..243H . doi : 10.1016/j.jas.2009.10.004 . ISSN 0305-4403 . 
  14. "Limpieza de datos" . Microsoft Research. Archivado del original el 29 de octubre de 2013. Consultado el 26 de octubre de 2013 .
  15. Hellerstein, Joseph (27 de febrero de 2008). "Limpieza cuantitativa de datos para grandes bases de datos" (PDF) . División de Ciencias de la Computación de EECS : 3. Archivado (PDF) del original el 13 de octubre de 2013. Recuperado el 26 de octubre de 2013 .
  16. 1 2 3 4 "Perceptual Edge-Jonathan Koomey-Mejores prácticas para comprender datos cuantitativos-14 de febrero de 2006" (PDF) . Archivado (PDF) del original el 5 de octubre de 2014. Recuperado el 12 de noviembre de 2014 .
  17. Peleg, Roni; Avdalimov, Angelika; Freud, Tamar (23 de marzo de 2011). "Proporcionar números de teléfono móvil y direcciones de correo electrónico a los pacientes: la perspectiva del médico" . BMC Research Notes . 4 (1): 76. doi : 10.1186/1756-0500-4-76 . ISSN 1756-0500 . PMC 3076270. PMID 21426591 .   
  18. "La FTC solicita datos adicionales" . Pump Industry Analyst . 1999 (48): 12. Diciembre de 1999. doi : 10.1016/s1359-6128(99)90509-8 . ISSN 1359-6128 . 
  19. "Explorando sus datos con visualización de datos y estadística descriptiva: estadística descriptiva común para datos cuantitativos" . 2017. doi : 10.4135/9781529732795 .{{cite journal}}: Para citar una revista se requiere |journal=( ayuda )
  20. Murray, Daniel G. (2013). ¡ Analiza tus datos con Tableau!: análisis visual rápido y sencillo con el software Tableau . J. Wiley & Sons. ISBN  978-1-118-61204-0OCLC 873810654 
  21. Evans, Michelle V.; Dallas, Tad A.; Han, Barbara A.; Murdock, Courtney C.; Drake, John M. (28 de febrero de 2017). Brady, Oliver (ed.). "Figura 2. Importancia de las variables por permutación, promediada sobre 25 modelos" . eLife . 6 : e22053. doi : 10.7554/elife.22053.004 .
  22. Watson, Kevin; Halperin, Israel; Aguilera-Castells, Joan; Iacono, Antonio Dello (12 de noviembre de 2020). "Tabla 3: Estadísticas descriptivas (media ± DE), inferenciales (IC del 95 %) y cualitativas (ES) de todas las variables entre condiciones autoseleccionadas y predeterminadas" . PeerJ . 8 : e10361. doi : 10.7717/peerj.10361/table-3 .
  23. Nwabueze, JC (2008-05-21). "Rendimiento de los estimadores de modelos lineales con términos de error autocorrelacionados cuando la variable independiente es normal" . Revista de la Asociación Nigeriana de Física Matemática . 9 (1). doi : 10.4314/jonamp.v9i1.40071 . ISSN 1116-4336 . 
  24. Conway, Steve (2012-07-04). "Una nota de precaución sobre las entradas de datos y las salidas visuales en el análisis de redes sociales" . British Journal of Management . 25 (1): 102– 117. doi : 10.1111/j.1467-8551.2012.00835.x . hdl : 2381/36068 . ISSN 1045-3172 . S2CID 154347514 .  
  25. "Compras de clientes y otros eventos repetidos" , Análisis de datos con SQL y Excel® , Indianápolis, Indiana: John Wiley & Sons, Inc., 29 de enero de 2016, págs. 367–420 , doi : 10.1002/9781119183419.ch8 , ISBN  978-1-119-18341-9, consultado el 31 de mayo de 2021
  26. ^ Grandjean, Martín (2014). "La connaissance est un réseau" (PDF) . Les Cahiers du Numérique . 10 (3): 37– 54. doi : 10.3166/lcn.10.3.37-54 . Archivado (PDF) desde el original el 27 de septiembre de 2015 . Consultado el 5 de mayo de 2015 .
  27. Requisitos de datos para chips semiconductores. Formatos de datos de intercambio y diccionario de datos , BSI British Standards, doi : 10.3403/02271298 , consultado el 31 de mayo de 2021.
  28. Visualización de datos sobre museos del Reino Unido: gráficos de barras, gráficos de líneas y mapas de calor . 2021. doi : 10.4135/9781529768749 . ISBN 9781529768749. S2CID 240967380 . 
  29. 1 2 "Stephen Few-Perceptual Edge-Selecting the Right Graph for Your Message-2004" (PDF) . Archivado (PDF) del original el 05-10-2014 . Recuperado el 29-10-2014 .
  30. "Matriz de selección de grafos de aristas perceptuales de Stephen Few" (PDF) . Archivado (PDF) del original el 5 de octubre de 2014. Recuperado el 29 de octubre de 2014 .
  31. Swamidass, PM (2000). "Gráfico de barras X". Enciclopedia de gestión de producción y fabricación . pág. 841. doi : 10.1007/1-4020-0612-8_1063 . ISBN  978-0-7923-8630-8.
  32. "Gráfico C5.3. Porcentaje de jóvenes de 15 a 19 años que no estudian, según su situación laboral (2012)" . doi : 10.1787/888933119055 . Consultado el 3 de junio de 2021 .{{cite journal}}: Para citar una revista se requiere |journal=( ayuda )
  33. "Gráfico 7: Hogares: gasto de consumo final frente a consumo individual real" . doi : 10.1787/665527077310 . Consultado el 3 de junio de 2021 .{{cite journal}}: Para citar una revista se requiere |journal=( ayuda )
  34. Garnier, Elodie M.; Fouret, Nastasia; Descoins, Médéric (3 de febrero de 2020). "Tabla 2: Comparación gráfica entre diagrama de dispersión, diagrama de violín + diagrama de dispersión, mapa de calor y gráfico ViSiElse" . PeerJ . 8 : e8341. doi : 10.7717/peerj.8341/table-2 .
  35. "Tabla comparativa de productos: Dispositivos portátiles" . Conjunto de datos PsycEXTRA . 2009. doi : 10.1037/e539162010-006 . Consultado el 3 de junio de 2021 .
  36. «Consultores empleados por McKinsey & Company» , Comportamiento organizacional 5 , Routledge, 30 de julio de 2008, págs. 77-82 , doi : 10.4324/9781315701974-15 , ISBN  978-1-315-70197-4, consultado el 3 de junio de 2021
  37. Carey, Malachy (noviembre de 1981). "Sobre las propiedades mutuamente excluyentes y colectivamente exhaustivas de las funciones de demanda" . Economica . 48 (192): 407–415 . doi : 10.2307/2553697 . ISSN 0013-0427 . JSTOR 2553697 .  
  38. Heckman (1978). "Modelos estadísticos simples para datos de panel discretos desarrollados y aplicados para probar la hipótesis de dependencia de estado verdadera contra la hipótesis de dependencia de estado espuria" . Annales de l'inséé (30/31): 227–269 . doi : 10.2307/20075292 . ISSN 0019-0209 . JSTOR 20075292 .  
  39. Munday, Stephen CR (1996), "Desempleo, inflación y la curva de Phillips" , Current Developments in Economics , Londres: Macmillan Education UK, pp. 186–218 , doi : 10.1007/978-1-349-24986-2_11 , ISBN  978-0-333-64444-7, consultado el 3 de junio de 2021
  40. Louangrath, Paul I. (2013). "Pruebas alfa y beta para la determinación de errores inferenciales de tipo I y tipo II en pruebas de hipótesis" . Revista electrónica SSRN . doi : 10.2139/ssrn.2332756 . ISSN 1556-5068 . 
  41. 1 2 Yanamandra, Venkataramana (septiembre de 2015). "Cambios en el tipo de cambio e inflación en India: ¿Cuál es el alcance de la transmisión del tipo de cambio a las importaciones?" . Análisis y política económica . 47 : 57–68 . doi : 10.1016/j.eap.2015.07.004 . ISSN 0313-5926 . 
  42. Feinmann, Jane. "¿Cómo pueden ayudarse mutuamente los ingenieros y los periodistas?" (Vídeo). The Institute of Engineering & Technology. doi : 10.1049/iet-tv.48.859 . Consultado el 3 de junio de 2021 .
  43. Dul, Jan (2015). "Análisis de condiciones necesarias (NCA): lógica y metodología de la causalidad 'necesaria pero no suficiente'" . Revista electrónica SSRN . doi : 10.2139/ssrn.2588480 . hdl : 1765/77890 . ISSN 1556-5068 . S2CID 219380122 .  
  44. Robert Amar, James Eagan y John Stasko (2005) "Componentes de bajo nivel de la actividad analítica en la visualización de información" Archivado el 13 de febrero de 2015 en Wayback Machine
  45. William Newman (1994) "Análisis preliminar de los productos de la investigación en HCI, utilizando resúmenes pro forma" Archivado el 3 de marzo de 2016 en Wayback Machine
  46. Mary Shaw (2002) "¿Qué hace que una investigación en ingeniería de software sea buena?" Archivado el 5 de noviembre de 2018 en Wayback Machine
  47. "Herramienta de conectividad que transfiere datos entre bases de datos y productos estadísticos" . Computational Statistics & Data Analysis . 8 (2): 224. Julio de 1989. doi : 10.1016/0167-9473(89)90021-2 . ISSN 0167-9473 . 
  48. «Información relevante para su trabajo» , Obtención de información para una gestión eficaz , Routledge, 11 de julio de 2007, págs. 48-54 , doi : 10.4324/9780080544304-16 (inactivo el 1 de julio de 2025), ISBN  978-0-08-054430-4, consultado el 3 de junio de 2021{{citation}}: CS1 maint: DOI inactivo desde julio de 2025 ( enlace )
  49. Gordon, Roger (marzo de 1990). "¿Actúan las corporaciones que cotizan en bolsa en interés público?" . Documentos de trabajo de la Oficina Nacional de Investigación Económica . Cambridge, MA. doi : 10.3386/w3303 .
  50. Rivard, Jillian R (2014). Sesgo de confirmación en las entrevistas a testigos: ¿Pueden los entrevistadores ignorar sus ideas preconcebidas? (Tesis). Universidad Internacional de Florida. doi : 10.25148/etd.fi14071109 (inactivo el 21 de enero de 2026).{{cite thesis}}: CS1 maint: DOI inactivo desde enero de 2026 ( enlace )
  51. Papineau, David (1988), "¿Desacredita la sociología de la ciencia a la ciencia?" , Relativismo y realismo en la ciencia , Dordrecht: Springer Netherlands, pp. 37–57 , doi : 10.1007/978-94-009-2877-0_2 , ISBN  978-94-010-7795-8, consultado el 3 de junio de 2021
  52. Bromme, Rainer; Hesse, Friedrich W.; Spada, Hans, eds. (2005). Barreras y sesgos en la comunicación del conocimiento mediada por ordenador . doi : 10.1007/b105100 . ISBN 978-0-387-24317-7.
  53. Heuer, Richards (10 de junio de 2019). Heuer, Richards J (ed.). Enfoques cuantitativos de la inteligencia política . doi : 10.4324/9780429303647 . ISBN 9780429303647. S2CID 145675822 . 
  54. "Introducción" (PDF) . Agencia Central de Inteligencia. Archivado (PDF) del original el 25/10/2021 . Recuperado el 25/10/2021 .
  55. "Figura 6.7. Las diferencias en los puntajes de alfabetización entre los países de la OCDE generalmente reflejan las diferencias en aritmética" . doi : 10.1787/888934081549 . Consultado el 3 de junio de 2021 .
  56. Ritholz, Barry. "Matemáticas erróneas que se hacen pasar por perspicacia" . Bloomberg View . Archivado del original el 29 de octubre de 2014. Consultado el 29 de octubre de 2014 .
  57. Gusnaini, Nuriska; Andesto, Rony; Ermawati (15 de diciembre de 2020). "El efecto del tamaño del gobierno regional, el tamaño legislativo, el número de población y los ingresos intergubernamentales en la divulgación de los estados financieros" . European Journal of Business and Management Research . 5 (6). doi : 10.24018/ejbmr.2020.5.6.651 . ISSN 2507-1076 . S2CID 231675715 .  
  58. Taura, Toshiharu; Nagai, Yukari (2011). «Comparación de grupos nominales con equipos reales». Design Creativity 2010. Londres: Springer-Verlag London. pp. 165–171 . ISBN  978-0-85729-223-0.
  59. Gross, William H. (julio de 1979). "Valoración de cupones y ciclos de tipos de interés". Financial Analysts Journal . 35 (4): 68– 71. doi : 10.2469/faj.v35.n4.68 . ISSN 0015-198X . 
  60. "25. Gastos totales del gobierno general" . doi : 10.1787/888932348795 . Consultado el 3 de junio de 2021 .
  61. Davenport, Thomas; Harris, Jeanne (2007). Competir con análisis de datos . O'Reilly. ISBN 978-1-4221-0332-6.
  62. Aarons, D. (2009). Un informe revela que los estados están en camino de construir sistemas de datos de alumnos. Education Week, 29 (13), 6.
  63. Rankin, J. (28 de marzo de 2013). Cómo los sistemas de datos e informes pueden combatir o propagar la epidemia de errores en el análisis de datos, y cómo los líderes educativos pueden ayudar. Archivado el 26 de marzo de 2019 en Wayback Machine. Presentación realizada en la Cumbre de Liderazgo Escolar del Centro de Información Tecnológica para el Liderazgo Administrativo (TICAL).
  64. Brödermann, Eckart J. (2018), "Artículo 2.2.1 (Ámbito de aplicación de la sección)" , Derecho mercantil , Nomos Verlagsgesellschaft mbH & Co. KG, p. 525, doi : 10.5771/9783845276564-525 , ISBN  978-3-8452-7656-4, consultado el 3 de junio de 2021
  65. Adèr 2008a , pág. 337.
  66. Kjell, Oscar NE; Thompson, Sam (19 de diciembre de 2013). "Estadísticas descriptivas que indican la media, la desviación estándar y la frecuencia de valores faltantes para cada condición (N = número de participantes) y para las variables dependientes (VD)" . PeerJ . 1 : e231. doi : 10.7717/peerj.231/table-1 .
  67. Práctica para el manejo de observaciones atípicas , ASTM International, doi : 10.1520/e0178-16a , consultado el 3 de junio de 2021
  68. "Esquemas de codificación alternativos para variables ficticias" , Regresión con variables ficticias , Newbury Park, CA: SAGE Publications, Inc., 1993, págs. 64–75 , doi : 10.4135/9781412985628.n5 , ISBN  978-0-8039-5128-0, consultado el 3 de junio de 2021
  69. ^ Adèr 2008a , págs. 338–341.
  70. Newman, Isadore (1998). Metodología de investigación cualitativa-cuantitativa : explorando el continuo interactivo . Southern Illinois University Press. ISBN  0-585-17889-5OCLC 44962443 
  71. Terwilliger, James S.; Lele, Kaustubh (junio de 1979). "Algunas relaciones entre consistencia interna, reproducibilidad y homogeneidad" . Journal of Educational Measurement . 16 (2): 101– 108. doi : 10.1111/j.1745-3984.1979.tb00091.x . ISSN 0022-0655 . 
  72. ^ Adèr 2008a , págs. 341–342.
  73. Adèr 2008a , pág. 344.
  74. Tabachnick y Fidell, 2007, págs. 87-88.
  75. Muestreo aleatorio y procedimientos de aleatorización , BSI British Standards, doi : 10.3403/30137438 , consultado el 3 de junio de 2021
  76. ^ Adèr 2008a , págs. 344–345.
  77. ^ Cuarto, cristiano; Hedrick, Brandon P.; Ezcurra, Martín D. (18 de enero de 2016). "Figura 4: Análisis de regresión del tamaño del centroide para la muestra principal" . PeerJ . 4 : e1589. doi : 10.7717/peerj.1589/fig-4 .
  78. Adèr 2008a , pág. 345.
  79. ^ Adèr 2008a , págs. 345–346.
  80. ^ Adèr 2008a , págs. 346–347.
  81. ^ Adèr 2008a , págs. 349–353.
  82. Adèr 2008b , pág. 363.
  83. "Análisis exploratorio de datos" , Python® para usuarios de R , Hoboken, NJ, EE. UU.: John Wiley & Sons, Inc., 13 de octubre de 2017, págs. 119–138 , doi : 10.1002/9781119126805.ch4 , hdl : 11380/971504 , ISBN  978-1-119-12680-5, consultado el 3 de junio de 2021
  84. "Participación en el análisis exploratorio de datos, visualización y comprobación de hipótesis: análisis exploratorio de datos, geovisualización y datos" , Spatial Analysis , CRC Press, 28 de julio de 2015, págs. 106-139 , doi : 10.1201/b18808-8 , ISBN  978-0-429-06936-9, S2CID 133412598 , consultado el 3 de junio de 2021 
  85. «Hipótesis sobre categorías» , Introducción a la estadística: una guía breve y clara , Londres: SAGE Publications Ltd, 2010, págs. 138–151 , doi : 10.4135/9781446287873.n14 , ISBN  978-1-84920-098-1, consultado el 3 de junio de 2021
  86. Liquet, Benoit; Riou, Jérémie (2013-06-08). "Corrección del nivel de significancia al intentar múltiples transformaciones de una variable explicativa en modelos lineales generalizados" . BMC Medical Research Methodology . 13 (1): 75. doi : 10.1186/1471-2288-13-75 . ISSN 1471-2288 . PMC 3699399. PMID 23758852 .   
  87. 1 2 3 Mcardle, John J. (2008). "Algunas cuestiones éticas en el análisis confirmatorio versus exploratorio" . Conjunto de datos PsycEXTRA . doi : 10.1037/e503312008-001 . Recuperado el 3 de junio de 2021 .
  88. ^ Adèr 2008b , págs. 361–362.
  89. ^ Adèr 2008b , págs. 361–371.
  90. Benson, Noah C; Winawer, Jonathan (diciembre de 2018). " Análisis bayesiano de mapas retinotópicos" . eLife . 7 e40224. doi : 10.7554/elife.40224 . PMC 6340702. PMID 30520736 .  Archivo complementario 1. Esquema de validación cruzada. doi : 10.7554/elife.40224.014
  91. Hsiao, Cheng (2014), "Datos de panel dependientes transversales" , Análisis de datos de panel , Cambridge: Cambridge University Press, pp. 327–368 , doi : 10.1017/cbo9781139839327.012 , ISBN  978-1-139-83932-7, consultado el 3 de junio de 2021
  92. Hjorth, JS Urban (19 de octubre de 2017), "Validación cruzada" , Métodos estadísticos intensivos computacionales , Chapman and Hall/CRC, págs. 24–56 , doi : 10.1201/9781315140056-3 , ISBN  978-1-315-14005-6, consultado el 3 de junio de 2021
  93. Sheikholeslami, Razi; Razavi, Saman; Haghnegahdar, Amin (10 de octubre de 2019). "¿Qué debemos hacer cuando un modelo falla? Recomendaciones para el análisis de sensibilidad global de modelos de sistemas terrestres y ambientales" . Geoscientific Model Development . 12 (10): 4275– 4296. Bibcode : 2019GMD....12.4275S . doi : 10.5194/gmd-12-4275-2019 . ISSN 1991-9603 . S2CID 204900339 .  
  94. Programa de las Naciones Unidas para el Desarrollo (2018). «Índices compuestos de desarrollo humano». Índices e indicadores de desarrollo humano 2018. Naciones Unidas. págs. 21–41 . doi : 10.18356/ce6f8e92-en . S2CID 240207510 .  
  95. Wiley, Matt; Wiley, Joshua F. (2019), "Visualización de datos multivariados" , Programación estadística avanzada en R y modelos de datos , Berkeley, CA: Apress, pp. 33–59 , doi : 10.1007/978-1-4842-2872-2_2 , ISBN  978-1-4842-2871-5, S2CID 86629516 , consultado el 3 de junio de 2021 
  96. Mailund, Thomas (2022). Introducción a la ciencia de datos en R 4: Análisis, visualización y modelado de datos para el científico de datos (2.ª ed.). ISBN  978-148428155-0.
  97. "La comunidad de aprendizaje automático se enfrenta al bosón de Higgs" . Symmetry Magazine . 15 de julio de 2014. Archivado del original el 16 de abril de 2021. Consultado el 14 de enero de 2015 .
  98. "Data.Gov: Rendimiento a largo plazo del pavimento (LTPP)" . 26 de mayo de 2016. Archivado del original el 1 de noviembre de 2017. Consultado el 10 de noviembre de 2017 .
  99. Nehme, Jean (29 de septiembre de 2016). "Concurso Internacional de Análisis de Datos LTPP" . Administración Federal de Carreteras. Archivado del original el 21 de octubre de 2017. Recuperado el 22 de octubre de 2017 .

Bibliografía

  • Adèr, Herman J. (2008a). «Capítulo 14: Fases y pasos iniciales en el análisis de datos». En Adèr, Herman J.; Mellenbergh, Gideon J .; Hand, David J. (eds.). Asesoramiento sobre métodos de investigación  : una guía para consultores . Huizen, Países Bajos: Johannes van Kessel Pub. pp. 333–356 . ISBN  9789079418015OCLC 905799857 .​ 
  • Adèr, Herman J. (2008b). «Capítulo 15: La fase principal de análisis». En Adèr, Herman J.; Mellenbergh, Gideon J .; Hand, David J. (eds.). Asesoramiento sobre métodos de investigación  : una guía para consultores . Huizen, Países Bajos: Johannes van Kessel Pub. pp. 357–386 . ISBN  9789079418015OCLC 905799857 .​ 
  • Tabachnick, BG y Fidell, LS (2007). Capítulo 4: Poniendo orden en sus acciones. Selección de datos antes del análisis. En BG Tabachnick y LS Fidell (Eds.), Uso de estadísticas multivariantes, Quinta edición (págs.  60-116). Boston: Pearson Education, Inc. / Allyn and Bacon.

Lecturas adicionales

  • Adèr, HJ y Mellenbergh, GJ (con contribuciones de DJ Hand) (2008). Asesoramiento sobre métodos de investigación: Guía práctica para consultores . Huizen, Países Bajos: Johannes van Kessel Publishing. ISBN 978-90-79418-01-5
  • Chambers, John M.; Cleveland, William S .; Kleiner, Beat; Tukey, Paul A. (1983). Métodos gráficos para el análisis de datos , Wadsworth/Duxbury Press. ISBN 0-534-98052-X
  • Fandango, Armando (2017). Análisis de datos con Python, 2.ª edición . Packt Publishers. ISBN 978-1787127487
  • Juran, Joseph M.; Godfrey, A. Blanton (1999). Manual de calidad de Juran, 5.ª edición. Nueva York: McGraw Hill. ISBN 0-07-034003-X
  • Lewis-Beck, Michael S. (1995). Análisis de datos: una introducción , Sage Publications Inc, ISBN 0-8039-5772-6
  • NIST/SEMATECH (2008) Manual de métodos estadísticos
  • Pyzdek, T, (2003). Manual de ingeniería de calidad , ISBN 0-8247-4614-7
  • Richard Veryard (1984). Análisis pragmático de datos . Oxford  : Blackwell Scientific Publications. ISBN 0-632-01311-7
  • Tabachnick, BG; Fidell, LS (2007). Uso de estadísticas multivariantes, 5.ª edición . Boston: Pearson Education, Inc. / Allyn and Bacon, ISBN 978-0-205-45938-4