
Un histograma es una representación visual de la distribución de datos cuantitativos. Para construir un histograma, el primer paso es agrupar (o segmentar) el rango de valores —dividir todo el rango de valores en una serie de intervalos— y luego contar cuántos valores caen en cada intervalo. Los intervalos se especifican generalmente como intervalos consecutivos y no superpuestos de una variable. Los intervalos son adyacentes y suelen ser (aunque no necesariamente) del mismo tamaño. [ 1 ]
Los histogramas ofrecen una idea aproximada de la densidad de la distribución subyacente de los datos y, a menudo, se utilizan para la estimación de la densidad : estimar la función de densidad de probabilidad de la variable subyacente. El área total de un histograma utilizado para la densidad de probabilidad siempre se normaliza a 1. Si la longitud de los intervalos en el eje x es toda de 1, entonces un histograma es idéntico a un gráfico de frecuencia relativa .
Los histogramas a veces se confunden con los gráficos de barras . En un histograma, cada intervalo representa un rango diferente de valores, por lo que, en conjunto, el histograma ilustra la distribución de los valores. En cambio, en un gráfico de barras, cada barra representa una categoría diferente de observaciones (por ejemplo, cada barra podría representar una población diferente), por lo que, en conjunto, el gráfico de barras se puede utilizar para comparar distintas categorías. Algunos autores recomiendan que los gráficos de barras siempre tengan espacios entre las barras para aclarar que no son histogramas. [ 2 ] [ 3 ]
Etimología
El término histograma fue introducido por primera vez por Karl Pearson , el fundador de la estadística matemática , en las conferencias que impartió en 1892 en el University College de Londres . A veces se dice erróneamente que el término de Pearson combina la raíz griega γραμμα ( gramma ; 'figura' o 'dibujo') con la raíz ἱστορία (historia; 'investigación' o 'historia'). Alternativamente, también se propone la raíz ἱστίον ( histion ), que significa 'tejido' o 'tejido' (como en histología , el estudio del tejido biológico). Ambas etimologías son incorrectas, y de hecho Pearson, que conocía bien el griego antiguo , derivó el término de una raíz griega diferente, aunque homófona , ἱστός ('algo puesto en posición vertical' o 'mástil'), en referencia a las barras verticales del gráfico. El nuevo término de Pearson estaba integrado en una serie de otros neologismos análogos , como estigmograma y radiograma . [ 4 ]
El propio Pearson señaló en 1895 que, si bien el término histograma era nuevo, el tipo de gráfico que designa era "una forma común de representación gráfica". [ 5 ] De hecho, la técnica de usar un gráfico de barras para representar mediciones estadísticas fue ideada por el economista escocés William Playfair en su Atlas comercial y político (1786). [ 4 ]
Ejemplos
Estos son los datos para el histograma de la derecha, utilizando 500 elementos:

Las palabras que se utilizan para describir los patrones en un histograma son: "simétrico", "sesgado a la izquierda" o "a la derecha", "unimodal", "bimodal" o "multimodal".
Simétrico, unimodal

Bimodal
Multimodal
Simétrico
Es recomendable representar gráficamente los datos utilizando distintos intervalos de tiempo para comprenderlos mejor. Aquí tienes un ejemplo sobre las propinas que se dan en un restaurante.
Consejos que utilizan un ancho de contenedor de $1, sesgados hacia la derecha, unimodales.
Consejos que utilizan un ancho de intervalo de 10 centavos, todavía sesgado a la derecha, multimodal con modas en cantidades de $ y 50 centavos, indica redondeo, también algunos valores atípicos
La Oficina del Censo de los Estados Unidos descubrió que había 124 millones de personas que trabajan fuera de sus hogares. [ 6 ] Utilizando sus datos sobre el tiempo empleado en el viaje al trabajo, la tabla a continuación muestra que el número absoluto de personas que respondieron con tiempos de viaje "de al menos 30 pero menos de 35 minutos" es mayor que los números para las categorías superior e inferior. Esto probablemente se deba a que las personas redondearon el tiempo de viaje que informaron. El problema de informar valores como números redondeados de manera algo arbitraria es un fenómeno común al recopilar datos de personas. [ 7 ] [ 8 ] [ 9 ]

Este histograma muestra el número de casos por intervalo unitario como la altura de cada bloque, de modo que el área de cada bloque es igual al número de personas encuestadas que pertenecen a su categoría. El área bajo la curva representa el número total de casos (124 millones). Este tipo de histograma muestra números absolutos, con Q en miles.

Este histograma se diferencia del primero únicamente en la escala vertical . El área de cada bloque representa la fracción del total que corresponde a cada categoría, y el área total de todas las barras es igual a 1 (la fracción significa "total"). La curva mostrada es una estimación simple de la densidad . Esta versión muestra proporciones y también se conoce como histograma de área unitaria.
En otras palabras, un histograma representa una distribución de frecuencias mediante rectángulos cuyos anchos representan intervalos de clase y cuyas áreas son proporcionales a las frecuencias correspondientes: la altura de cada uno es la densidad de frecuencia promedio para el intervalo. Los intervalos se colocan juntos para mostrar que los datos representados por el histograma, si bien son exclusivos, también son contiguos. (Por ejemplo, en un histograma es posible tener dos intervalos conectados de 10,5–20,5 y 20,5–33,5, pero no dos intervalos conectados de 10,5–20,5 y 22,5–32,5. Los intervalos vacíos se representan como tales y no se omiten). [ 10 ]
Definiciones matemáticas

Los datos utilizados para construir un histograma se generan mediante una función m i que cuenta el número de observaciones que caen en cada una de las categorías disjuntas (conocidas como intervalos ). Por lo tanto, si denotamos por n el número total de observaciones y por k el número total de intervalos, los datos del histograma m i cumplen las siguientes condiciones:
Un histograma puede considerarse una estimación de densidad de kernel simplificada , que utiliza un kernel para suavizar las frecuencias en los intervalos. Esto produce una función de densidad de probabilidad más suave , que generalmente refleja con mayor precisión la distribución de la variable subyacente. La estimación de densidad puede representarse gráficamente como una alternativa al histograma, y suele dibujarse como una curva en lugar de un conjunto de cajas. Sin embargo, en las aplicaciones se prefieren los histogramas cuando es necesario modelar sus propiedades estadísticas. La variación correlacionada de una estimación de densidad de kernel es muy difícil de describir matemáticamente, mientras que resulta sencillo para un histograma, donde cada intervalo varía de forma independiente.
Una alternativa a la estimación de densidad de kernel es el histograma desplazado promedio, [ 11 ] que es rápido de calcular y proporciona una estimación de curva suave de la densidad sin utilizar kernels.
Histograma acumulativo
Un histograma acumulativo: una representación que cuenta el número acumulado de observaciones en todos los intervalos hasta el intervalo especificado. Es decir, el histograma acumulativo M i de un histograma m j se puede definir como:
Número de contenedores y ancho
No existe un número "óptimo" de intervalos, y los diferentes tamaños de intervalos pueden revelar distintas características de los datos. La agrupación de datos es al menos tan antigua como el trabajo de Graunt en el siglo XVII, pero no se dieron pautas sistemáticas [ 12 ] hasta el trabajo de Sturges en 1926. [ 13 ]
Utilizar intervalos más amplios donde la densidad de los puntos de datos subyacentes es baja reduce el ruido debido a la aleatoriedad del muestreo; usar intervalos más estrechos donde la densidad es alta (de modo que la señal enmascara el ruido) proporciona mayor precisión a la estimación de la densidad. Por lo tanto, variar el ancho de los intervalos dentro de un histograma puede ser beneficioso. No obstante, los intervalos de igual ancho son ampliamente utilizados.
Algunos teóricos han intentado determinar un número óptimo de intervalos, pero estos métodos generalmente se basan en supuestos importantes sobre la forma de la distribución. Dependiendo de la distribución real de los datos y los objetivos del análisis, pueden ser apropiados diferentes anchos de intervalo, por lo que suele ser necesario experimentar para determinar el ancho adecuado. Sin embargo, existen diversas pautas y reglas prácticas útiles. [ 14 ]
El número de intervalos k se puede asignar directamente o se puede calcular a partir de un ancho de intervalo sugerido h de la siguiente manera:

Los corchetes indican la función del techo .
Elección de raíz cuadrada
que toma la raíz cuadrada del número de puntos de datos en la muestra y redondea al entero más cercano . Esta regla es sugerida por varios libros de texto de estadística elemental [ 15 ] y está ampliamente implementada en muchos paquetes de software. [ 16 ]
La fórmula de Sturges
La regla de Sturges [ 13 ] se deriva de una distribución binomial y asume implícitamente una distribución aproximadamente normal.
La fórmula de Sturges basa implícitamente el tamaño de los intervalos en el rango de los datos y puede tener un rendimiento deficiente si n < 30 , ya que el número de intervalos será pequeño (menos de siete) y es poco probable que muestre bien las tendencias en los datos. En el otro extremo, la fórmula de Sturges puede sobreestimar el ancho de los intervalos para conjuntos de datos muy grandes, lo que da como resultado histogramas demasiado suavizados. [ 17 ] También puede tener un rendimiento deficiente si los datos no tienen una distribución normal.
En comparación con la regla de Scott y la regla de Terrell-Scott, otras dos fórmulas ampliamente aceptadas para los intervalos de histogramas, el resultado de la fórmula de Sturges es el más cercano cuando n ≈ 100. [ 17 ]
Gobierno de Rice
La regla de Rice [ 18 ] se presenta como una alternativa simple a la regla de Sturges.
Fórmula de Doane
La fórmula de Doane [ 19 ] es una modificación de la fórmula de Sturges que intenta mejorar su rendimiento con datos no normales.
dóndees la asimetría estimada del tercer momento de la distribución y
Regla de referencia normal de Scott
Ancho del contenedores dado por
dóndees la desviación estándar de la muestra . La regla de referencia normal de Scott [ 20 ] es óptima para muestras aleatorias de datos con distribución normal, en el sentido de que minimiza el error cuadrático medio integrado de la estimación de la densidad. [ 12 ] Esta es la regla predeterminada utilizada en Microsoft Excel. [ 21 ]
Regla Terrell-Scott
La regla de Terrell-Scott [ 17 ] [ 22 ] no es una regla de referencia normal. Proporciona el número mínimo de intervalos requeridos para un histograma asintóticamente óptimo, donde la optimalidad se mide por el error cuadrático medio integrado. El límite se deriva encontrando la densidad posible más "suave", que resulta serCualquier otra densidad requerirá más intervalos; por lo tanto, la estimación anterior también se conoce como la regla de "sobre-suavizado". La similitud de las fórmulas y el hecho de que Terrell y Scott estuvieran en la Universidad de Rice cuando la propusieron sugiere que este es también el origen de la regla de Rice.
Regla de Freedman-Diaconis
La regla de Freedman-Diaconis proporciona el ancho del contenedor.como: [ 23 ] [ 12 ]
que se basa en el rango intercuartil , denotado por IQR. Reemplaza 3,5σ de la regla de Scott con 2 IQR, que es menos sensible que la desviación estándar a los valores atípicos en los datos.
Minimizar el error cuadrático estimado de validación cruzada
Este enfoque de minimizar el error cuadrático medio integrado de la regla de Scott se puede generalizar más allá de las distribuciones normales, utilizando validación cruzada de dejar uno fuera: [ 24 ] [ 25 ]
Aquí,es el número de puntos de datos en el k -ésimo intervalo, y elegir el valor de h que minimice J minimizará el error cuadrático medio integrado.
La elección de Shimazaki y Shinomoto
La elección se basa en la minimización de una función de riesgo L 2 estimada [ 26 ].
dóndeyson la media y la varianza sesgada de un histograma con ancho de intervalo,y.
Anchos de contenedores variables
En lugar de elegir intervalos uniformemente espaciados, para algunas aplicaciones es preferible variar el ancho del intervalo. Esto evita intervalos con recuentos bajos. Un caso común es elegir intervalos equiprobables , donde se espera que el número de muestras en cada intervalo sea aproximadamente igual. Los intervalos pueden elegirse de acuerdo con alguna distribución conocida o pueden elegirse en función de los datos de manera que cada intervalo tengamuestras. Al trazar el histograma, se utiliza la densidad de frecuencia para el eje dependiente. Si bien todos los intervalos tienen aproximadamente el mismo área, las alturas del histograma se aproximan a la distribución de densidad.
Para contenedores equiprobables, se sugiere la siguiente regla para el número de contenedores: [ 27 ]
Esta elección de intervalos se justifica por maximizar la potencia de una prueba de chi-cuadrado de Pearson que evalúa si los intervalos contienen el mismo número de muestras. Más específicamente, para un intervalo de confianza dadoSe recomienda elegir entre 1/2 y 1 veces la siguiente ecuación: [ 28 ]
Dóndees la función probit . Siguiendo esta regla paradaría entreyEl coeficiente de 2 se elige como un valor fácil de recordar dentro de este amplio rango óptimo.
Observación
Una buena razón por la que el número de contenedores debería ser proporcional aes lo siguiente: supongamos que los datos se obtienen comorealizaciones independientes de una distribución de probabilidad acotada con densidad suave. Entonces el histograma permanece igualmente "rugoso" comotiende al infinito. Sies la "amplitud" de la distribución (por ejemplo, la desviación estándar o el rango intercuartil), entonces el número de unidades en un intervalo (la frecuencia) es de ordeny el error estándar relativo es de orden. En comparación con el siguiente intervalo, el cambio relativo de la frecuencia es de ordensiempre que la derivada de la densidad sea distinta de cero. Estas dos son del mismo orden siestá de orden, de modo queestá de ordenEsta sencilla elección de raíz cúbica también se puede aplicar a contenedores con anchos no constantes.

Aplicaciones
- En hidrología, el histograma y la función de densidad estimada de los datos de precipitación y caudal de los ríos, analizados con una distribución de probabilidad , se utilizan para comprender su comportamiento y frecuencia de ocurrencia. [ 30 ] Un ejemplo se muestra en la figura azul.
- En muchos programas de procesamiento de imágenes digitales existe una herramienta de histograma que muestra la distribución del contraste /brillo de los píxeles .

Histograma de contraste
Véase también
- Visualización de datos e información
- Agrupación de datos
- Estimación de densidad
- Estimación de densidad de kernel , un método de estimación de densidad más suave pero más complejo.
- Estimación de la entropía
- Regla de Freedman-Diaconis
- histograma de la imagen
- Diagrama de Pareto
- Siete herramientas básicas de calidad
- Histogramas V-óptimos
Referencias
- ↑ Howitt, D.; Cramer, D. (2008). Introducción a la estadística en psicología (Cuarta ed.). Prentice Hall. ISBN 978-0-13-205161-3.
- ↑ Naomi, Robbins. "Un histograma NO es un gráfico de barras" . Forbes . Consultado el 31 de julio de 2018 .
- ↑ M. Eileen Magnello (diciembre de 2006). "Karl Pearson y los orígenes de la estadística moderna: un experto en elasticidad se convierte en estadístico" . The New Zealand Journal for the History and Philosophy of Science and Technology . 1 volumen. OCLC 682200824 .
- 1 2 Daniel Riaño Rufilanchas (2017), “Sobre el origen del término 'histograma' de Karl Pearson» , Estadística Española vol. 59, núm. 192, pág. 29-35.
- ↑ Pearson, K. (1895). "Contribuciones a la teoría matemática de la evolución. II. Variación asimétrica en material homogéneo" . Philosophical Transactions of the Royal Society A: Mathematical, Physical and Engineering Sciences . 186 : 343–414 . Bibcode : 1895RSPTA.186..343P . doi : 10.1098/rsta.1895.0010 .
- ↑ Censo de EE. UU. de 2000 .
- ↑ Taylor Wilson; Safia Abdirizak (2017). Examen estadístico de las tendencias de redondeo en la encuesta de entrevistas sobre gastos del consumidor (PDF) . JSM. págs. 894–907 .
- ↑ Pamela Giustinelli; Charles Manski; Francesca Mollinari (2018). Redondeo de cola y centro de expectativas probabilísticas en el estudio de salud y jubilación (documento de trabajo). NBER . doi : 10.3386/w24559 .
- ↑ Charles Manski; Francesca Mollinari. "Redondeo de las expectativas probabilísticas en las encuestas" . Journal of Business & Economic Statistics . 28 (2): 219– 232. doi : 10.1198/jbes.2009.08098 . PMC 2847785 .
- ↑ Dean, S., & Illowsky, B. (2009, 19 de febrero). Estadísticas descriptivas: Histograma. Recuperado del sitio web de Connexions: http://cnx.org/content/m16298/1.11/
- ↑ David W. Scott (diciembre de 2009). "Histograma desplazado promediado" . Wiley Interdisciplinary Reviews: Computational Statistics . 2 (2): 160– 164. doi : 10.1002/wics.54 . S2CID 122986682 .
- 1 2 3 Scott, David W. (1992). Estimación de densidad multivariante: teoría, práctica y visualización . Nueva York: John Wiley.
- 1 2 Sturges, HA (1926). "La elección de un intervalo de clase". Journal of the American Statistical Association . 21 (153): 65– 66. doi : 10.1080/01621459.1926.10502161 . JSTOR 2965501 .
- ↑ p. ej. § 5.6 "Estimación de densidad", WN Venables y BD Ripley, Modern Applied Statistics with S (2002), Springer, 4.ª edición. ISBN 0-387-95457-0.
- ↑ Lohaka, HO (2007). "Creación de una tabla de frecuencias de datos agrupados: desarrollo y examen del algoritmo de iteración" . Tesis doctoral, Universidad de Ohio. pág. 87.
- ↑ "MathWorks: Histograma" .
- 1 2 3 Scott, David W. (2009). "Regla de Sturges". WIREs Computational Statistics . 1 (3): 303– 306. doi : 10.1002/wics.35 . S2CID 197483064 .
- ↑ Educación estadística en línea: Un curso de estudio multimedia ( http://onlinestatbook.com/ ). Director del proyecto: David M. Lane, Universidad Rice (capítulo 2 "Representación gráfica de distribuciones", sección "Histogramas")
- ↑ Doane DP (1976) Clasificación de frecuencia estética. American Statistician, 30: 181–183
- ↑ Scott, David W. (1979). "Sobre histogramas óptimos y basados en datos". Biometrika . 66 (3): 605– 610. doi : 10.1093/biomet/66.3.605 .
- ↑ "Excel: Crear un histograma" .
- ↑ Terrell, GR y Scott, DW, 1985. Estimaciones de densidad no paramétricas sobresuavizadas. Journal of the American Statistical Association, 80(389), pp.209-214.
- ^ Liberto, David; Diaconis, P. (1981). "Sobre el histograma como estimador de densidad: teoría L 2 " (PDF) . Zeitschrift für Wahrscheinlichkeitstheorie und Verwandte Gebiete . 57 (4): 453– 476. CiteSeerX 10.1.1.650.2473 . doi : 10.1007/BF01025868 . S2CID 14437088 .
- ↑ Wasserman, Larry (2004). All of Statistics . Nueva York: Springer. pág. 310. ISBN 978-1-4419-2322-6.
- ↑ Stone, Charles J. (1984). "Una regla de selección de histogramas asintóticamente óptima" (PDF) . Actas de la conferencia de Berkeley en honor a Jerzy Neyman y Jack Kiefer .
- ↑ Shimazaki, H.; Shinomoto, S. (2007). "Un método para seleccionar el tamaño del intervalo de un histograma de tiempo". Neural Computation . 19 (6): 1503– 1527. CiteSeerX 10.1.1.304.6404 . doi : 10.1162/neco.2007.19.6.1503 . PMID 17444758 . S2CID 7781236 .
- ↑ Jack Prins; Don McCormack; Di Michelson; Karen Horrell. "Prueba de bondad de ajuste chi-cuadrado" . Manual electrónico de métodos estadísticos NIST/SEMATECH . NIST/SEMATECH. pág. 7.2.1.1 . Consultado el 29 de marzo de 2019 .
- ↑ Moore, David (1986). "3". En D'Agostino, Ralph; Stephens, Michael (eds.). Técnicas de bondad de ajuste . Nueva York, NY, EE. UU.: Marcel Dekker Inc. pág. 70. ISBN 0-8247-7487-6.
- ↑ Una calculadora para distribuciones de probabilidad y funciones de densidad
- ↑ Ilustración de histogramas y funciones de densidad de probabilidad
Lecturas adicionales
- Lancaster, HO. Introducción a la estadística médica. John Wiley and Sons. 1974. ISBN 0-471-51250-8
Enlaces externos
- Explorando los histogramas , un ensayo de Aran Lunzer y Amelia McNamara.
- Trayecto al trabajo y lugar de trabajo (ubicación del documento censal citado en el ejemplo)
- Histograma suavizado para señales e imágenes de algunas muestras. Archivado el 7 de enero de 2013 en Wayback Machine.
- Histogramas: Construcción, análisis y comprensión, con enlaces externos y una aplicación a la física de partículas.
- Un método para seleccionar el tamaño de los intervalos de un histograma.
- Histogramas: Teoría y práctica , algunas excelentes ilustraciones de algunos de los conceptos de ancho de intervalo derivados anteriormente.
- Función de Matlab para generar histogramas de calidad.
- Histograma dinámico en MS Excel
- Construcción y manipulación de histogramas mediante applets de Java y gráficos en SOCR.
- Caja de herramientas para construir los mejores histogramas. Archivado el 24/10/2017 en Wayback Machine.
- Gráficos y diagramas estadísticos
- Herramientas de control de calidad
- Estimación de densidades
- estadística no paramétrica
- Distribución de frecuencia