El análisis de varianza ( ANOVA ) es un conjunto de métodos estadísticos que se utilizan para comparar las medias de dos o más grupos mediante el análisis de la varianza. Específicamente, el ANOVA compara la variación entre las medias de los grupos con la variación dentro de cada grupo. Si la variación entre grupos es sustancialmente mayor que la variación dentro de cada grupo, sugiere que las medias de los grupos probablemente sean diferentes. Esta comparación se realiza mediante una prueba F. El principio fundamental del ANOVA se basa en la ley de la varianza total , que establece que la varianza total en un conjunto de datos se puede descomponer en componentes atribuibles a diferentes fuentes. En el caso del ANOVA, estas fuentes son la variación entre grupos y la variación dentro de los grupos.
El análisis de varianza (ANOVA) fue desarrollado por el estadístico Ronald Fisher . En su forma más simple, proporciona una prueba estadística para determinar si dos o más medias poblacionales son iguales y, por lo tanto, generaliza la prueba t más allá de dos medias.
Historia
Si bien el análisis de varianza alcanzó su máximo esplendor en el siglo XX, sus antecedentes se remontan a siglos atrás, según Stigler . [ 1 ] Estos incluyen pruebas de hipótesis, partición de sumas de cuadrados, técnicas experimentales y el modelo aditivo. Laplace realizaba pruebas de hipótesis en la década de 1770. [ 2 ] Alrededor de 1800, Laplace y Gauss desarrollaron el método de mínimos cuadrados para combinar observaciones, lo que mejoró los métodos utilizados entonces en astronomía y geodesia . También dio inicio a muchos estudios sobre las contribuciones a las sumas de cuadrados. Laplace sabía cómo estimar una varianza a partir de una suma residual (en lugar de una suma total) de cuadrados. [ 3 ] Para 1827, Laplace utilizaba métodos de mínimos cuadrados para abordar problemas de ANOVA relacionados con mediciones de mareas atmosféricas. [ 4 ] Antes de 1800, los astrónomos habían aislado errores de observación resultantes de los tiempos de reacción (la " ecuación personal ") y habían desarrollado métodos para reducir los errores. [ 5 ] Los métodos experimentales utilizados en el estudio de la ecuación personal fueron posteriormente aceptados por el campo emergente de la psicología [ 6 ] que desarrolló métodos experimentales robustos (factoriales completos) a los que pronto se añadieron la aleatorización y el enmascaramiento. [ 7 ] En 1885 se disponía de una explicación elocuente y no matemática del modelo de efectos aditivos. [ 8 ]
Ronald Fisher introdujo el término varianza y propuso su análisis formal en un artículo de 1918 sobre genética de poblaciones teórica, The Correlation Between Relatives on the Supposition of Mendelian Inheritance . [ 9 ] Su primera aplicación del análisis de varianza al análisis de datos se publicó en 1921, Studies in Crop Variation I. [ 10 ] Este dividió la variación de una serie temporal en componentes que representan causas anuales y deterioro lento. El siguiente trabajo de Fisher, Studies in Crop Variation II , escrito con Winifred Mackenzie y publicado en 1923, estudió la variación en el rendimiento en parcelas sembradas con diferentes variedades y sometidas a diferentes tratamientos de fertilización. [ 11 ] El análisis de varianza se hizo ampliamente conocido después de ser incluido en el libro de Fisher de 1925 Statistical Methods for Research Workers .
Varios investigadores desarrollaron modelos de aleatorización. El primero fue publicado en polaco por Jerzy Neyman en 1923. [ 12 ]
Ejemplo



El análisis de varianza puede utilizarse para describir relaciones complejas entre variables. Un ejemplo de ello es una exposición canina. Esta no es una muestra aleatoria de la raza: generalmente se limita a perros adultos, de raza pura y ejemplares. Un histograma de los pesos de los perros en una exposición probablemente sea bastante complejo, como la distribución amarillo-naranja que se muestra en las ilustraciones. Supongamos que queremos predecir el peso de un perro basándonos en un conjunto determinado de características. Una forma de hacerlo es explicar la distribución de pesos dividiendo la población canina en grupos según esas características. Una agrupación exitosa dividirá a los perros de tal manera que (a) cada grupo tenga una baja varianza de pesos (lo que significa que el grupo es relativamente homogéneo) y (b) la media de cada grupo sea distinta (si dos grupos tienen la misma media, no es razonable concluir que los grupos estén, de hecho, separados de alguna manera significativa).
En las ilustraciones de la derecha, los grupos se identifican como X 1 , X 2 , etc. En la primera ilustración, los perros se dividen según el producto (interacción) de dos agrupaciones binarias: jóvenes frente a viejos, y de pelo corto frente a de pelo largo (por ejemplo, el grupo 1 son perros jóvenes de pelo corto, el grupo 2 son perros jóvenes de pelo largo, etc.). Dado que las distribuciones del peso de los perros dentro de cada grupo (mostradas en azul) tienen una varianza relativamente grande, y dado que las medias son muy similares entre los grupos, agrupar a los perros por estas características no proporciona una forma eficaz de explicar la variación en los pesos de los perros: saber a qué grupo pertenece un perro no nos permite predecir su peso mucho mejor que simplemente saber que el perro participa en una exposición canina. Por lo tanto, esta agrupación no logra explicar la variación en la distribución general (amarillo-naranja).
Un intento de explicar la distribución del peso agrupando a los perros en mascotas frente a razas de trabajo y menos atléticos frente a más atléticos probablemente sería algo más exitoso (ajuste razonable). Los perros de exposición más pesados probablemente sean razas grandes, fuertes y de trabajo, mientras que las razas mantenidas como mascotas tienden a ser más pequeñas y, por lo tanto, más ligeras. Como se muestra en la segunda ilustración, las distribuciones tienen varianzas considerablemente menores que en el primer caso, y las medias son más distinguibles. Sin embargo, la superposición significativa de las distribuciones, por ejemplo, significa que no podemos distinguir X 1 y X 2 de manera confiable. Agrupar a los perros según el lanzamiento de una moneda podría producir distribuciones que parezcan similares.
Intentar explicar el peso según la raza probablemente dé como resultado un ajuste muy bueno. Todos los chihuahuas son ligeros y todos los san bernardos son pesados. La diferencia de peso entre los setters y los pointers no justifica la existencia de razas separadas. El análisis de varianza proporciona las herramientas formales para justificar estos juicios intuitivos. Un uso común del método es el análisis de datos experimentales o el desarrollo de modelos. El método tiene algunas ventajas sobre la correlación: no todos los datos tienen que ser numéricos y uno de los resultados del método es una valoración de la confianza en una relación explicativa.
Clases de modelos
En el análisis de varianza se utilizan tres clases de modelos, que se describen a continuación.
Modelos de efectos fijos
El modelo de efectos fijos (clase I) del análisis de varianza se aplica a situaciones en las que el experimentador aplica uno o más tratamientos a los sujetos del experimento para observar si cambian los valores de la variable de respuesta . Esto permite al experimentador estimar los rangos de valores de la variable de respuesta que el tratamiento generaría en la población en su conjunto.

Modelos de efectos aleatorios
El modelo de efectos aleatorios (clase II) se utiliza cuando los tratamientos no son fijos. Esto ocurre cuando los distintos niveles de los factores se muestrean a partir de una población más amplia. Dado que los niveles en sí mismos son variables aleatorias , algunos supuestos y el método para contrastar los tratamientos (una generalización multivariable de las diferencias simples) difieren del modelo de efectos fijos. [ 13 ]
Modelos de efectos mixtos
Un modelo de efectos mixtos (clase III) contiene factores experimentales de tipo fijo y de efectos aleatorios, con interpretaciones y análisis apropiadamente diferentes para ambos tipos.
Ejemplo
Un departamento universitario podría realizar experimentos de enseñanza para encontrar un buen libro de texto introductorio, considerando cada texto como un tratamiento. El modelo de efectos fijos compararía una lista de textos candidatos. El modelo de efectos aleatorios determinaría si existen diferencias importantes entre una lista de textos seleccionados al azar. El modelo de efectos mixtos compararía los textos vigentes (con efectos fijos) con alternativas seleccionadas al azar.
Definir los efectos fijos y aleatorios ha resultado difícil, con múltiples definiciones contrapuestas. [ 14 ]
Supuestos
El análisis de varianza se ha estudiado desde diversas perspectivas, la más común de las cuales utiliza un modelo lineal que relaciona la respuesta con los tratamientos y los bloques. Cabe destacar que el modelo es lineal en sus parámetros, pero puede ser no lineal entre los niveles de los factores. Su interpretación es sencilla cuando los datos están equilibrados entre los factores, pero se requiere una comprensión mucho más profunda para datos desequilibrados.
Análisis de libros de texto utilizando una distribución normal
El análisis de varianza se puede presentar en términos de un modelo lineal , que hace las siguientes suposiciones sobre la distribución de probabilidad de las respuestas: [ 15 ] [ 16 ] [ 17 ] [ 18 ]
- Independencia de las observaciones: esta es una suposición del modelo que simplifica el análisis estadístico.
- Normalidad : las distribuciones de los residuos son normales .
- Igualdad (u "homogeneidad") de las varianzas, denominada homocedasticidad : la varianza de los datos en los grupos debe ser la misma.
Los supuestos separados del modelo del libro de texto implican que los errores están distribuidos de forma independiente, idéntica y normal para los modelos de efectos fijos, es decir, que los errores () son independientes y
Análisis basado en la aleatorización
En un experimento controlado aleatorizado , los tratamientos se asignan aleatoriamente a las unidades experimentales, siguiendo el protocolo experimental. Esta aleatorización es objetiva y se declara antes de que se lleve a cabo el experimento. La asignación aleatoria objetiva se utiliza para probar la significancia de la hipótesis nula , siguiendo las ideas de C.S. Peirce y Ronald Fisher . Este análisis basado en el diseño fue discutido y desarrollado por Francis J. Anscombe en la Estación Experimental de Rothamsted y por Oscar Kempthorne en la Universidad Estatal de Iowa . [ 19 ] Kempthorne y sus estudiantes hacen la suposición de aditividad de los tratamientos unitarios , que se discute en los libros de Kempthorne y David R. Cox . [ 20 ] [ 21 ]
Aditividad del tratamiento unitario
En su forma más simple, el supuesto de aditividad de tratamiento unitario [ nb 1 ] establece que la respuesta observadade la unidad experimentalal recibir tratamientose puede escribir como la suma de la respuesta de la unidady el efecto del tratamiento, es decir [ 22 ] [ 23 ] [ 24 ] La suposición de aditividad de tratamiento unitario implica que, para cada tratamiento, elEl tratamiento tiene exactamente el mismo efecto.en cada unidad experimental.
Según Cox y Kempthorne, el supuesto de aditividad de los tratamientos unitarios generalmente no puede refutarse directamente. Sin embargo, muchas consecuencias de la aditividad de los tratamientos unitarios sí pueden refutarse. En un experimento aleatorio, el supuesto de aditividad de los tratamientos unitarios implica que la varianza es constante para todos los tratamientos. Por lo tanto, por contraposición , una condición necesaria para la aditividad de los tratamientos unitarios es que la varianza sea constante.
El uso de la aditividad del tratamiento unitario y la aleatorización es similar a la inferencia basada en el diseño que es estándar en el muestreo de encuestas de poblaciones finitas .
Modelo lineal derivado
Kempthorne utiliza la distribución de aleatorización y la suposición de aditividad de tratamiento unitario para producir un modelo lineal derivado , muy similar al modelo del libro de texto discutido anteriormente. [ 25 ] Los estadísticos de prueba de este modelo lineal derivado se aproximan estrechamente a los estadísticos de prueba de un modelo lineal normal apropiado, según teoremas de aproximación y estudios de simulación. [ 26 ] Sin embargo, existen diferencias. Por ejemplo, el análisis basado en la aleatorización da como resultado una correlación pequeña pero (estrictamente) negativa entre las observaciones. [ 27 ] [ 28 ] En el análisis basado en la aleatorización, no hay ninguna suposición de una distribución normal y ciertamente ninguna suposición de independencia . ¡Por el contrario, las observaciones son dependientes !
El análisis basado en la aleatorización tiene la desventaja de que su exposición implica álgebra tediosa y mucho tiempo. Dado que este análisis es complejo y se aproxima bastante al enfoque que utiliza un modelo lineal normal, la mayoría de los profesores hacen hincapié en este último. Pocos estadísticos se oponen al análisis basado en modelos de experimentos aleatorizados balanceados.
Modelos estadísticos para datos de observación
Sin embargo, cuando se aplica a datos de experimentos no aleatorizados o estudios observacionales , el análisis basado en modelos carece de la garantía de aleatorización. [ 29 ] Para los datos observacionales, la derivación de intervalos de confianza debe utilizar modelos subjetivos , como enfatizaron Ronald Fisher y sus seguidores. En la práctica, las estimaciones de los efectos del tratamiento de los estudios observacionales suelen ser inconsistentes. En la práctica, los "modelos estadísticos" y los datos observacionales son útiles para sugerir hipótesis que el público debe tratar con mucha cautela. [ 30 ]
Resumen de supuestos
El análisis ANOVA basado en el modelo normal presupone la independencia, normalidad y homogeneidad de las varianzas de los residuos. El análisis basado en la aleatorización presupone únicamente la homogeneidad de las varianzas de los residuos (como consecuencia de la aditividad de los tratamientos unitarios) y utiliza el procedimiento de aleatorización del experimento. Ambos análisis requieren homocedasticidad , como supuesto para el análisis basado en el modelo normal y como consecuencia de la aleatorización y la aditividad para el análisis basado en la aleatorización.
Sin embargo, se han realizado con éxito estudios de procesos que modifican las varianzas en lugar de las medias (denominados efectos de dispersión) utilizando ANOVA. [ 31 ] No existen supuestos necesarios para el uso de ANOVA en su máxima generalidad, pero la prueba F utilizada para la comprobación de hipótesis de ANOVA tiene supuestos y limitaciones prácticas que siguen siendo de interés.
Los problemas que no satisfacen los supuestos del ANOVA a menudo pueden transformarse para satisfacerlos. La propiedad de aditividad de tratamiento unitario no es invariante bajo un "cambio de escala", por lo que los estadísticos suelen utilizar transformaciones para lograr la aditividad de tratamiento unitario. Si se espera que la variable de respuesta siga una familia paramétrica de distribuciones de probabilidad, el estadístico puede especificar (en el protocolo del experimento o estudio observacional) que las respuestas se transformen para estabilizar la varianza. [ 32 ] Además, un estadístico puede especificar que se apliquen transformaciones logarítmicas a las respuestas que se cree que siguen un modelo multiplicativo. [ 23 ] [ 33 ] Según el teorema de la ecuación funcional de Cauchy , el logaritmo es la única transformación continua que relaciona las operaciones de multiplicación con las operaciones de suma sobre los números reales. [ 34 ] [ 35 ] [ 36 ]
Características
ANOVA se utiliza en el análisis de experimentos comparativos, aquellos en los que solo interesa la diferencia en los resultados. La significación estadística del experimento se determina mediante una razón de dos varianzas. Esta razón es independiente de varias posibles alteraciones de las observaciones experimentales: Sumar una constante a todas las observaciones no altera la significación. Multiplicar todas las observaciones por una constante no altera la significación. Por lo tanto, el resultado de la significación estadística de ANOVA es independiente del sesgo constante y los errores de escala, así como de las unidades utilizadas para expresar las observaciones. En la era del cálculo mecánico era común restar una constante de todas las observaciones (cuando era equivalente a eliminar los dígitos iniciales) para simplificar la entrada de datos. [ 37 ] [ 38 ] Este es un ejemplo de codificación de datos .
Algoritmo
Los cálculos del ANOVA se pueden caracterizar como el cálculo de varias medias y varianzas, la división de dos varianzas y la comparación de la razón con un valor de referencia para determinar la significación estadística. Calcular el efecto de un tratamiento es entonces trivial: "el efecto de cualquier tratamiento se estima tomando la diferencia entre la media de las observaciones que reciben el tratamiento y la media general". [ 39 ]
Partición de la suma de cuadrados

ANOVA utiliza la terminología estandarizada tradicional. La ecuación de definición de la varianza muestral esdonde el divisor se llama grados de libertad (GL), la suma se llama suma de cuadrados (SC), el resultado se llama cuadrado medio (CM) y los términos al cuadrado son desviaciones de la media muestral. El ANOVA estima 3 varianzas muestrales: una varianza total basada en todas las desviaciones de las observaciones de la media general, una varianza de error basada en todas las desviaciones de las observaciones de sus medias de tratamiento apropiadas, y una varianza de tratamiento. La varianza de tratamiento se basa en las desviaciones de las medias de tratamiento de la media general, y el resultado se multiplica por el número de observaciones en cada tratamiento para tener en cuenta la diferencia entre la varianza de las observaciones y la varianza de las medias.
La técnica fundamental consiste en dividir la suma total de cuadrados (SS) en componentes relacionados con los efectos utilizados en el modelo. Por ejemplo, el modelo para un ANOVA simplificado con un tipo de tratamiento en diferentes niveles.
El número de grados de libertad (GL) se puede dividir de forma similar: uno de estos componentes (el del error) especifica una distribución chi-cuadrado que describe la suma de cuadrados asociada, mientras que lo mismo ocurre con los "tratamientos" si no hay efecto del tratamiento.
La prueba F

La prueba F se utiliza para comparar los factores de la desviación total. Por ejemplo, en un ANOVA unidireccional o de un factor, la significancia estadística se prueba comparando el estadístico de la prueba F.
donde MS es el cuadrado medio,es el número de tratamientos yes el número total de casos de la distribución F consiendo el numerador los grados de libertad ylos grados de libertad del denominador. El uso de la distribución F es una opción natural porque el estadístico de prueba es la razón de dos sumas de cuadrados escaladas, cada una de las cuales sigue una distribución chi-cuadrado escalada .
El valor esperado de F es(dónde(es el tamaño de la muestra del tratamiento), que es 1 para indicar que no hay efecto del tratamiento. A medida que los valores de F aumentan por encima de 1, la evidencia se vuelve cada vez más inconsistente con la hipótesis nula. Dos métodos experimentales aparentes para aumentar F son aumentar el tamaño de la muestra y reducir la varianza del error mediante controles experimentales estrictos.
Existen dos métodos para concluir la prueba de hipótesis ANOVA, y ambos producen el mismo resultado:
- El método estándar consiste en comparar el valor observado de F con el valor crítico de F determinado a partir de tablas. El valor crítico de F depende de los grados de libertad del numerador y del denominador, así como del nivel de significancia ( α ). Si F ≥ F crítico , se rechaza la hipótesis nula.
- El método computacional calcula la probabilidad ( valor p ) de que el valor de F sea mayor o igual al valor observado. La hipótesis nula se rechaza si esta probabilidad es menor o igual al nivel de significancia ( α ).
Se sabe que la prueba F de ANOVA es casi óptima en el sentido de minimizar los errores de falsos negativos para una tasa fija de errores de falsos positivos (es decir, maximizar la potencia para un nivel de significancia fijo). Por ejemplo, para probar la hipótesis de que varios tratamientos médicos tienen exactamente el mismo efecto, los valores p de la prueba F se aproximan mucho a los valores p de la prueba de permutación : la aproximación es particularmente cercana cuando el diseño está equilibrado. [ 26 ] [ 40 ] Estas pruebas de permutación caracterizan las pruebas con máxima potencia frente a todas las hipótesis alternativas , como observó Rosenbaum . [ nb 2 ] La prueba F de ANOVA (de la hipótesis nula de que todos los tratamientos tienen exactamente el mismo efecto) se recomienda como una prueba práctica, debido a su robustez frente a muchas distribuciones alternativas. [ 41 ] [ nb 3 ]
Algoritmo extendido
ANOVA consta de partes separables; la partición de las fuentes de varianza y la prueba de hipótesis pueden utilizarse individualmente. ANOVA se utiliza para complementar otras herramientas estadísticas. Primero se utiliza la regresión para ajustar modelos más complejos a los datos, y luego se utiliza ANOVA para comparar modelos con el objetivo de seleccionar modelos más simples que describan adecuadamente los datos. "Estos modelos podrían ajustarse sin ninguna referencia a ANOVA, pero las herramientas de ANOVA podrían utilizarse para comprender los modelos ajustados y para probar hipótesis sobre lotes de coeficientes." [ 42 ] "[Pensamos] en el análisis de varianza como una forma de comprender y estructurar modelos multinivel, no como una alternativa a la regresión, sino como una herramienta para resumir inferencias complejas de alta dimensión ..." [ 42 ]
Para un solo factor
El experimento más sencillo apto para el análisis ANOVA es el experimento completamente aleatorio con un solo factor. Los experimentos más complejos con un solo factor implican restricciones en la aleatorización e incluyen bloques completamente aleatorios y cuadrados latinos (y variantes: cuadrados grecolatinos , etc.). Los experimentos más complejos comparten muchas de las complejidades de los experimentos con múltiples factores.
Existen algunas alternativas al análisis de varianza unidireccional convencional, por ejemplo: la prueba F heterocedástica de Welch, la prueba F heterocedástica de Welch con medias recortadas y varianzas winsorizadas, la prueba de Brown-Forsythe, la prueba de Alexander-Govern, la prueba de segundo orden de James y la prueba de Kruskal-Wallis, disponibles en onewaytests R.
Resulta útil representar cada punto de datos de la siguiente forma, denominada modelo estadístico: dónde
- i = 1, 2, 3, ..., R
- j = 1, 2, 3, ..., C
- μ = promedio general (media)
- τ j = efecto diferencial (respuesta) asociado con el nivel j de X;Esto supone que en general los valores de τ j suman cero (es decir,)
- ε ij = ruido o error asociado con el valor de datos ij en particular.
Es decir, imaginamos un modelo aditivo que establece que cada punto de datos puede representarse sumando tres cantidades: la media real, promediada sobre todos los niveles de factores que se están investigando, más un componente incremental asociado con la columna particular (nivel del factor), más un componente final asociado con todo lo demás que afecta a ese valor de datos específico.
Por múltiples factores
El ANOVA se generaliza al estudio de los efectos de múltiples factores. Cuando el experimento incluye observaciones en todas las combinaciones de niveles de cada factor, se denomina factorial . Los experimentos factoriales son más eficientes que una serie de experimentos de un solo factor, y la eficiencia aumenta a medida que se incrementa el número de factores. [ 43 ] Por consiguiente, los diseños factoriales se utilizan ampliamente.
El uso de ANOVA para estudiar los efectos de múltiples factores presenta una complicación. En un ANOVA de tres vías con factores x, y y z, el modelo ANOVA incluye términos para los efectos principales (x, y, z) y términos para las interacciones (xy, xz, yz, xyz). Todos los términos requieren pruebas de hipótesis. La proliferación de términos de interacción aumenta el riesgo de que alguna prueba de hipótesis produzca un falso positivo por azar. Afortunadamente, la experiencia indica que las interacciones de orden superior son poco frecuentes. [ 44 ] La capacidad de detectar interacciones es una ventaja importante del ANOVA multifactorial. Probar un factor a la vez oculta las interacciones, pero produce resultados experimentales aparentemente inconsistentes. [ 43 ]
Se recomienda precaución al encontrar interacciones; primero se deben probar los términos de interacción y, si se encuentran interacciones, se debe ampliar el análisis más allá del ANOVA. Los textos varían en sus recomendaciones sobre la continuación del procedimiento ANOVA después de encontrar una interacción. Las interacciones complican la interpretación de los datos experimentales. Ni los cálculos de significancia ni los efectos de tratamiento estimados pueden tomarse al pie de la letra. "Una interacción significativa a menudo enmascarará la significancia de los efectos principales." [ 45 ] Se recomiendan métodos gráficos para mejorar la comprensión. La regresión suele ser útil. En Cox (1958) se encuentra una discusión extensa sobre las interacciones. [ 46 ] Algunas interacciones pueden eliminarse (mediante transformaciones), mientras que otras no.
Se utilizan diversas técnicas con el ANOVA multifactorial para reducir costos. Una técnica empleada en los diseños factoriales consiste en minimizar la replicación (posiblemente sin replicación, con el apoyo de trucos analíticos ) y combinar grupos cuando se observa que los efectos son estadísticamente (o prácticamente) insignificantes. Un experimento con muchos factores insignificantes puede reducirse a uno con pocos factores respaldados por numerosas replicaciones. [ 47 ]
Análisis asociado
Se requiere cierto análisis para respaldar el diseño del experimento, mientras que otro análisis se realiza después de que se comprueba formalmente que los cambios en los factores producen cambios estadísticamente significativos en las respuestas. Dado que la experimentación es iterativa, los resultados de un experimento modifican los planes para los experimentos posteriores.
Análisis preparatorio
El número de unidades experimentales
En el diseño de un experimento, se planifica el número de unidades experimentales para satisfacer los objetivos del experimento. La experimentación suele ser secuencial.
Los primeros experimentos suelen diseñarse para proporcionar estimaciones imparciales de los efectos del tratamiento y del error experimental. Los experimentos posteriores suelen diseñarse para comprobar la hipótesis de que un efecto del tratamiento tiene una magnitud importante; en este caso, el número de unidades experimentales se elige de forma que el experimento se ajuste al presupuesto y tenga la potencia estadística adecuada, entre otros objetivos.
En psicología, generalmente se requiere informar sobre el análisis del tamaño de la muestra. "Proporcione información sobre el tamaño de la muestra y el proceso que llevó a las decisiones sobre el tamaño de la muestra". [ 48 ] El análisis, que se incluye en el protocolo experimental antes de realizar el experimento, se examina en las solicitudes de subvención y en las juntas de revisión administrativa.
Además del análisis de potencia, existen métodos menos formales para seleccionar el número de unidades experimentales. Estos incluyen métodos gráficos basados en limitar la probabilidad de errores falsos negativos, métodos gráficos basados en un aumento de la variación esperada (por encima de los residuos) y métodos basados en lograr un intervalo de confianza deseado. [ 49 ]
Análisis de potencia
El análisis de potencia se aplica frecuentemente en el contexto del ANOVA para evaluar la probabilidad de rechazar con éxito la hipótesis nula si se asume un diseño de ANOVA, un tamaño del efecto en la población, un tamaño de muestra y un nivel de significancia determinados. El análisis de potencia puede ayudar en el diseño del estudio al determinar qué tamaño de muestra se requeriría para tener una probabilidad razonable de rechazar la hipótesis nula cuando la hipótesis alternativa es verdadera. [ 50 ] [ 51 ] [ 52 ] [ 53 ]

Tamaño del efecto
Se han propuesto varias medidas estandarizadas del efecto para el ANOVA con el fin de resumir la fuerza de la asociación entre uno o más predictores y la variable dependiente, o la diferencia estandarizada global del modelo completo. Las estimaciones estandarizadas del tamaño del efecto facilitan la comparación de los resultados entre estudios y disciplinas. Sin embargo, si bien los tamaños del efecto estandarizados se utilizan comúnmente en gran parte de la literatura especializada, una medida no estandarizada del tamaño del efecto con unidades inmediatamente "significativas" puede ser preferible para fines de presentación de informes. [ 54 ]
Confirmación del modelo
En ocasiones, se realizan pruebas para determinar si se incumplen los supuestos del ANOVA. Se examinan o analizan los residuos para confirmar la homocedasticidad y la normalidad general. [ 55 ] Los residuos deberían presentar la apariencia de ruido (distribución normal con media cero) al graficarlos en función de cualquier variable, incluyendo el tiempo y los valores de los datos modelados. Las tendencias sugieren interacciones entre factores o entre observaciones.
Pruebas de seguimiento
Un efecto estadísticamente significativo en un análisis de varianza (ANOVA) suele ir seguido de pruebas adicionales. Esto se puede hacer para evaluar qué grupos difieren de otros o para probar diversas hipótesis específicas. Las pruebas de seguimiento suelen distinguirse según sean "planificadas" ( a priori ) o "post hoc ". Las pruebas planificadas se determinan antes de analizar los datos, mientras que las pruebas post hoc se conciben solo después de analizarlos (aunque el término "post hoc" se usa de forma inconsistente).
Las pruebas de seguimiento pueden ser comparaciones simples por pares de las medias de los grupos individuales o comparaciones compuestas (por ejemplo, comparar la media combinada de los grupos A, B y C con la media del grupo D). Las comparaciones también pueden analizar pruebas de tendencia, como relaciones lineales y cuadráticas, cuando la variable independiente presenta niveles ordenados. A menudo, las pruebas de seguimiento incorporan un método para ajustar el problema de las comparaciones múltiples .
Las pruebas de seguimiento para identificar qué grupos, variables o factores específicos presentan medias estadísticamente diferentes incluyen la prueba de rangos de Tukey y la nueva prueba de rangos múltiples de Duncan . A su vez, estas pruebas suelen ir seguidas de una metodología de Visualización de Letras Compactas (CLD, por sus siglas en inglés) para que los resultados sean más comprensibles para un público no especializado en estadística.
Diseños de estudio
Existen varios tipos de ANOVA. Muchos estadísticos basan el ANOVA en el diseño del experimento , [ 56 ] especialmente en el protocolo que especifica la asignación aleatoria de tratamientos a los sujetos; la descripción del mecanismo de asignación en el protocolo debe incluir una especificación de la estructura de los tratamientos y de cualquier bloqueo . También es común aplicar el ANOVA a datos observacionales utilizando un modelo estadístico apropiado. [ 57 ]
Algunos diseños populares utilizan los siguientes tipos de ANOVA:
- El ANOVA unidireccional se utiliza para probar diferencias entre dos o más grupos independientes (medias), por ejemplo, diferentes niveles de aplicación de urea en un cultivo, o diferentes niveles de acción de antibióticos en varias especies bacterianas diferentes, [ 58 ] o diferentes niveles de efecto de algún medicamento en grupos de pacientes. Sin embargo, si estos grupos no son independientes y hay un orden en los grupos (como enfermedad leve, moderada y grave), o en la dosis de un medicamento (como 5 mg/mL, 10 mg/mL, 20 mg/mL) administrado al mismo grupo de pacientes, entonces se debe utilizar una estimación de tendencia lineal . Sin embargo, normalmente el ANOVA unidireccional se utiliza para probar diferencias entre al menos tres grupos, ya que el caso de dos grupos puede cubrirse con una prueba t . [ 59 ] Cuando solo hay dos medias para comparar, la prueba t y la prueba F del ANOVA son equivalentes; la relación entre ANOVA y t viene dada por F = t 2 .
- El análisis de varianza factorial ( ANOVA) se utiliza cuando hay más de un factor.
- El ANOVA de medidas repetidas se utiliza cuando se emplean los mismos sujetos para cada factor (por ejemplo, en un estudio longitudinal ).
- El análisis multivariado de varianza (MANOVA) se utiliza cuando hay más de una variable de respuesta .
Precauciones
Los experimentos balanceados (aquellos con un tamaño de muestra igual para cada tratamiento) son relativamente fáciles de interpretar; los experimentos desbalanceados presentan mayor complejidad. Para el ANOVA de un factor (unidireccional), el ajuste para datos desbalanceados es sencillo, pero el análisis desbalanceado carece de robustez y potencia. [ 60 ] Para diseños más complejos, la falta de balance conlleva mayores complicaciones. "La propiedad de ortogonalidad de los efectos principales y las interacciones presentes en los datos balanceados no se traslada al caso desbalanceado. Esto significa que las técnicas habituales de análisis de varianza no se aplican. En consecuencia, el análisis de factores desbalanceados es mucho más difícil que el de diseños balanceados." [ 61 ] En el caso general, "El análisis de varianza también se puede aplicar a datos desbalanceados, pero entonces las sumas de cuadrados, las medias cuadráticas y las razones F dependerán del orden en que se consideren las fuentes de variación." [ 42 ]
ANOVA es (en parte) una prueba de significación estadística. La Asociación Americana de Psicología (y muchas otras organizaciones) sostiene que simplemente informar la significación estadística es insuficiente y que es preferible informar los intervalos de confianza. [ 54 ]
Generalizaciones
ANOVA se considera un caso especial de regresión lineal [ 62 ] [ 63 ] que a su vez es un caso especial del modelo lineal general . [ 64 ] Todos consideran que las observaciones son la suma de un modelo (ajuste) y un residuo (error) que se debe minimizar.
La prueba de Kruskal-Wallis y la prueba de Friedman son pruebas no paramétricas que no dependen de un supuesto de normalidad. [ 65 ] [ 66 ]
Conexión con la regresión lineal
A continuación, explicamos la relación entre el ANOVA multifactorial y la regresión lineal.
Reordenar linealmente los datos de manera queLa observación -ésima está asociada con una respuesta.y factoresdóndedenota los diferentes factores yes el número total de factores. En ANOVA unidireccionaly en ANOVA bidireccional. Además, asumimos que-ésimo factor tieneniveles, a saber. Ahora, podemos codificar los factores mediante codificación one-hot en elvector dimensional.
La función de codificación one-hotse define de tal manera que el-entrada dees El vectores la concatenación de todos los vectores anteriores para todos. De este modo,Para obtener una generalización completaANOVA de interacción de dos vías también debemos concatenar cada término de interacción adicional en el vectory luego agregar un término de intersección. Sea ese vector.
Con esta notación, ahora tenemos la conexión exacta con la regresión lineal. Simplemente hacemos una regresión de la respuesta.contra el vectorSin embargo, existe preocupación por la identificabilidad . Para superar estos problemas, asumimos que la suma de los parámetros dentro de cada conjunto de interacciones es igual a cero. A partir de ahí, se pueden utilizar estadísticas F u otros métodos para determinar la relevancia de los factores individuales.
Ejemplo
Podemos considerar el ejemplo de interacción bidireccional donde suponemos que el primer factor tiene 2 niveles y el segundo factor tiene 3 niveles.
Definirsiysi, es decires la codificación one-hot del primer factor yes la codificación one-hot del segundo factor.
Con eso, donde el último término es un término de intersección. Para un ejemplo más concreto, supongamos que Entonces,
Véase también
- ANOVA sobre rangos
- Análisis de componentes simultáneos ANOVA
- Análisis de covarianza ( ANCOVA )
- Análisis de varianza molecular (AMOVA)
- Análisis de varianza rítmica (ANORVA)
- Cuadrados medios esperados
- Variación explicada
- Estimación de tendencia lineal
- Análisis de varianza de diseño mixto
- Análisis multivariado de covarianza ( MANCOVA )
- Análisis de varianza por permutación
- Análisis de componentes principales
- Descomposición de la varianza
Notas a pie de página
- ↑ La aditividad del tratamiento unitario se denomina simplemente aditividad en la mayoría de los textos. Hinkelmann y Kempthorne añaden adjetivos y distinguen entre aditividad en sentido estricto y amplio. Esto permite un análisis detallado de las múltiples fuentes de error (tratamiento, estado, selección, medición y muestreo) en la página 161.
- ↑ Rosenbaum (2002, página 40) cita la Sección 5.7 (Pruebas de permutación), Teorema 2.3 (en realidad Teorema 3, página 184) de Testing Statistical Hypotheses de Lehmann (1959).
- ↑ La prueba F para la comparación de varianzas tiene una reputación mixta. No se recomienda como prueba de hipótesis para determinar si dos muestras diferentes tienen la misma varianza. Se recomienda para ANOVA dondese comparan dos estimaciones de la varianza de la misma muestra. Si bien la prueba F no es generalmente robusta frente a desviaciones de la normalidad, se ha encontrado que es robusta en el caso especial de ANOVA. Citas de Moore y McCabe (2003): "El análisis de varianza utiliza estadísticos F, pero estos no son lo mismo que el estadístico F para comparar dos desviaciones estándar poblacionales." (página 554) "La prueba F y otros procedimientos para inferencia sobre varianzas carecen de robustez de tal manera que son de poca utilidad en la práctica." (página 556) "[La prueba F de ANOVA ] es relativamente insensible a la no normalidad moderada y a las varianzas desiguales, especialmente cuando los tamaños de muestra son similares." (página 763) ANOVA asume homocedasticidad, pero es robusta. La prueba estadística de homocedasticidad (la prueba F ) no es robusta. Moore y McCabe recomiendan una regla práctica.
Notas
- ↑ Stigler (1986)
- ↑ Stigler (1986, pág. 134)
- ↑ Stigler (1986, pág. 153)
- ↑ Stigler (1986, págs. 154–155)
- ↑ Stigler (1986, págs. 240–242)
- ↑ Stigler (1986, Capítulo 7 – La psicofísica como contrapunto)
- ↑ Stigler (1986, pág. 253)
- ↑ Stigler (1986, págs. 314–315)
- ↑ La correlación entre parientes bajo la suposición de herencia mendeliana . Ronald A. Fisher. Philosophical Transactions of the Royal Society of Edinburgh . 1918. (volumen 52, páginas 399–433)
- ↑ Fisher, Ronald A. (1921). "Estudios sobre la variación de cultivos. I. Un examen del rendimiento del grano procesado de Broadbalk". Journal of Agricultural Science . 11 (2): 107– 135. doi : 10.1017/S0021859600003750 . hdl : 2440/15170 . S2CID 86029217 .
- ↑ Fisher, Ronald A. (1923). ") Estudios sobre la variación de cultivos. II. La respuesta del estiércol de diferentes variedades de papa". Journal of Agricultural Science . 13 (3): 311– 320. doi : 10.1017/S0021859600003592 . hdl : 2440/15179 . S2CID 85985907 .
- ↑ Scheffé (1959, p. 291, "Los modelos de aleatorización fueron formulados por primera vez por Neyman (1923) para el diseño completamente aleatorizado, por Neyman (1935) para bloques aleatorizados, por Welch (1937) y Pitman (1937) para el cuadrado latino bajo una determinada hipótesis nula, y por Kempthorne (1952, 1955) y Wilk (1955) para muchos otros diseños.")
- ↑ Montgomery (2001, Capítulo 12: Experimentos con factores aleatorios)
- ↑ Gelman (2005, págs. 20–21)
- ↑ Snedecor, George W.; Cochran, William G. (1967). Métodos estadísticos (6.ª ed.). pág. 321.
- ↑ Cochran y Cox (1992, pág. 48)
- ↑ Howell (2002, pág. 323)
- ↑ Anderson, David R.; Sweeney, Dennis J.; Williams, Thomas A. (1996). Estadística para negocios y economía (6.ª ed.). Minneapolis/St. Paul: West Pub. Co. pp. 452–453 . ISBN 978-0-314-06378-6.
- ↑ Anscombe (1948)
- ↑ Hinkelmann, Klaus; Kempthorne, Oscar (2005). Diseño y análisis de experimentos, volumen 2: Diseño experimental avanzado . John Wiley. pág. 213. ISBN 978-0-471-70993-0.
- ↑ Cox, DR (1992). Planificación de experimentos . Wiley. ISBN 978-0-471-57429-3.
- ↑ Kempthorne (1979, pág. 30)
- 1 2 Cox (1958, Capítulo 2: Algunos supuestos clave)
- ↑ Hinkelmann y Kempthorne (2008, Volumen 1, a lo largo del texto. Introducido en la Sección 2.3.3: Principios del diseño experimental; El modelo lineal; Esquema de un modelo)
- ↑ Hinkelmann y Kempthorne (2008, Volumen 1, Sección 6.3: Diseño completamente aleatorio; Modelo lineal derivado)
- 1 2 Hinkelmann y Kempthorne (2008, Volumen 1, Sección 6.6: Diseño completamente aleatorizado; Aproximación de la prueba de aleatorización)
- ↑ Bailey (2008, Capítulo 2.14 "Un modelo más general" en Bailey, págs. 38–40)
- ↑ Hinkelmann y Kempthorne (2008, Volumen 1, Capítulo 7: Comparación de tratamientos)
- ↑ Kempthorne (1979, pp. 125-126, «El experimentador debe decidir cuáles de las diversas causas que cree que producirán variaciones en sus resultados deben controlarse experimentalmente. Aquellas causas que no controla experimentalmente, porque las desconoce, debe controlarlas mediante el método de aleatorización.» «[S]ólo cuando el experimentador aplica los tratamientos en el experimento utilizando el procedimiento de aleatorización completa es válida la cadena de inferencia inductiva. Solo en estas circunstancias el experimentador puede atribuir los efectos que observa únicamente al tratamiento. En estas circunstancias, sus conclusiones son fiables en el sentido estadístico.»)
- ↑ Liberto
- ↑ Montgomery (2001, Sección 3.8: Descubriendo los efectos de dispersión)
- ↑ Hinkelmann y Kempthorne (2008, Volumen 1, Sección 6.10: Diseño completamente aleatorio; Transformaciones)
- ↑ Bailey (2008)
- ↑ "Ecuación funcional de Cauchy" .
- ^ Cauchy, Agustín Luis (1821). Cours d'analyse de l'École royale polytechnique [ Curso de análisis en la Real Escuela Politécnica ] (en francés). Imprimerie royale. págs. 106–109 . OL 6477125M .
- ↑ "Solución de ecuaciones mediante la determinación de los valores de la función desconocida en un conjunto denso". Lecciones sobre ecuaciones funcionales, sus aplicaciones . Matemáticas en ciencia e ingeniería. Vol. 19. 1966. págs. 31–139 . doi : 10.1016/S0076-5392(09)60208-3 . ISBN 978-0-12-043750-4.
- ↑ Montgomery (2001, Sección 3-3: Experimentos con un solo factor: El análisis de varianza; Análisis del modelo de efectos fijos)
- ↑ Cochran y Cox (1992, pág. 2, ejemplo)
- ↑ Cochran y Cox (1992, pág. 49)
- ↑ Hinkelmann y Kempthorne (2008, Volumen 1, Sección 6.7: Diseño completamente aleatorizado; CRD con número desigual de réplicas)
- ↑ Moore y McCabe (2003, página 763)
- 1 2 3 Gelman (2008)
- 1 2 Montgomery (2001, Sección 5-2: Introducción a los diseños factoriales; Las ventajas de los diseños factoriales)
- ↑ Belle (2008, Sección 8.4: Las interacciones de orden superior ocurren raramente)
- ↑ Montgomery (2001, Sección 5-1: Introducción a los diseños factoriales; Definiciones y principios básicos)
- ↑ Cox (1958, Capítulo 6: Ideas básicas sobre experimentos factoriales)
- ↑ Montgomery (2001, Sección 5-3.7: Introducción a los diseños factoriales; El diseño factorial de dos factores; Una observación por celda)
- ↑ Wilkinson (1999, pág. 596)
- ↑ Montgomery (2001, Sección 3-7: Determinación del tamaño de la muestra)
- ↑ Howell (2002, Capítulo 8: Poder)
- ↑ Howell (2002, Sección 11.12: Potencia (en ANOVA))
- ↑ Howell (2002, Sección 13.7: Análisis de potencia para experimentos factoriales)
- ↑ Moore y McCabe (2003, págs. 778–780)
- 1 2 Wilkinson (1999, pág. 599)
- ↑ Montgomery (2001, Sección 3-4: Verificación de la adecuación del modelo)
- ↑ Cochran y Cox (1957, pág. 9, "La regla general [es] que la forma en que se lleva a cabo el experimento determina no solo si se pueden hacer inferencias, sino también los cálculos necesarios para hacerlas.")
- ↑ "Diseño ANOVA" . bluebox.creighton.edu . Consultado el 23 de enero de 2023 .
- ↑ "ANOVA unidireccional/de un solo factor" . Archivado del original el 7 de noviembre de 2014.
- ↑ "El error probable de una media". Biometrika . 6 : 1–25 . 1908. doi : 10.1093/biomet/6.1.1 . hdl : 10338.dmlcz/143545 .
- ↑ Montgomery (2001, Sección 3-3.4: Datos desequilibrados)
- ↑ Montgomery (2001, Sección 14-2: Datos desequilibrados en el diseño factorial)
- ↑ Gelman (2005, p. 1) (con salvedades en el texto posterior)
- ↑ Montgomery (2001, Sección 3.9: El enfoque de regresión para el análisis de varianza)
- ↑ Howell (2002, pág. 604)
- ↑ Howell (2002, Capítulo 18: Remuestreo y enfoques no paramétricos de los datos)
- ↑ Montgomery (2001, Sección 3-10: Métodos no paramétricos en el análisis de varianza)
Referencias
- Anscombe, FJ (1948). "La validez de los experimentos comparativos". Journal of the Royal Statistical Society. Serie A (General) . 111 (3): 181– 211. doi : 10.2307/2984159 . JSTOR 2984159. MR 0030181 .
- Bailey, RA (2008). Diseño de experimentos comparativos . Cambridge University Press. ISBN 978-0-521-68357-9.Los capítulos previos a la publicación están disponibles en línea.
- Bella, Gerald van (2008). Reglas generales estadísticas (2ª ed.). Hoboken, Nueva Jersey: Wiley. ISBN 978-0-470-14448-0.
- Cochran, William G.; Cox , Gertrude M. (1992). Diseños experimentales (2.ª ed.). Nueva York: Wiley. ISBN 978-0-471-54567-5.
- Cohen, Jacob (1988). Análisis de potencia estadística para las ciencias del comportamiento (2.ª ed.). Routledge ISBN 978-0-8058-0283-2
- Cohen, Jacob (1992). "Estadística: una introducción al poder estadístico". Psychological Bulletin . 112 (1): 155– 159. doi : 10.1037/0033-2909.112.1.155 . PMID 19565683. S2CID 14411587 .
- Cox, David R. (1958). Planificación de experimentos . Reimpreso como ISBN. 978-0-471-57429-3
- Cox, David R. (2006). Principios de inferencia estadística . Cambridge Nueva York: Cambridge University Press. ISBN 978-0-521-68567-2.
- Freedman, David A. (2005). Modelos estadísticos: teoría y práctica , Cambridge University Press. ISBN 978-0-521-67105-7
- Gelman, Andrew (2005). "¿Análisis de varianza? Por qué es más importante que nunca". The Annals of Statistics . 33 : 1–53 . arXiv : math/0504499 . doi : 10.1214/009053604000001048 . S2CID 13529149 .
- Gelman, Andrew (2008). «Varianza, análisis de». El nuevo diccionario Palgrave de economía (2.ª ed.). Basingstoke, Hampshire Nueva York: Palgrave Macmillan. ISBN 978-0-333-78676-5.
- Hinkelmann, Klaus y Kempthorne, Oscar (2008). Diseño y análisis de experimentos . Vol. I y II (Segunda edición). Wiley. ISBN 978-0-470-38551-7.
- Howell, David C. (2002). Métodos estadísticos para la psicología (5.ª ed.). Pacific Grove, CA: Duxbury/Thomson Learning. ISBN 978-0-534-37770-0.
- Kempthorne, Oscar (1979). El diseño y análisis de experimentos (Reimpresión corregida de la edición de Wiley de 1952). Robert E. Krieger. ISBN 978-0-88275-105-4.
- Lehmann, EL (1959) Prueba de hipótesis estadísticas. John Wiley & Sons.
- Montgomery, Douglas C. (2001). Diseño y análisis de experimentos (5.ª ed.). Nueva York: Wiley. ISBN 978-0-471-31649-7.
- Moore, David S. y McCabe, George P. (2003). Introducción a la práctica de la estadística (4.ª ed.). WH Freeman & Co. ISBN 0-7167-9657-0
- Rosenbaum, Paul R. (2002). Estudios observacionales (2.ª ed.). Nueva York: Springer-Verlag. ISBN 978-0-387-98967-9
- Scheffé, Henry (1959). El análisis de varianza . Nueva York: Wiley.
- Stigler, Stephen M. (1986). Historia de la estadística : la medición de la incertidumbre antes de 1900. Cambridge, Mass: Belknap Press de Harvard University Press. ISBN 978-0-674-40340-6OCLC 1422544327
- Wilkinson, Leland (agosto de 1999). "Métodos estadísticos en revistas de psicología: directrices y explicaciones". American Psychologist . 54 (8): 594– 604. doi : 10.1037/0003-066X.54.8.594 .
Lecturas adicionales
- Freedman, David A .; Pisani, Robert; Purves, Roger (2007). Estadística (4.ª ed.). WW Norton & Company. ISBN 978-0-393-92972-0.
- Tabachnick, Barbara G.; Fidell, Linda S. (2006). Uso de estadísticas multivariadas . Edición internacional de Pearson (5.ª ed.). Needham, MA: Allyn & Bacon, Inc. ISBN 978-0-205-45938-4.
- Wichura, Michael J. (2006). El enfoque sin coordenadas para modelos lineales . Cambridge Series in Statistical and Probabilistic Mathematics. Cambridge University Press. pp. xiv+199. ISBN 978-0-521-86842-6MR 2283455 .
{{cite book}}: CS1 mantenimiento: falta el editor de ubicación ( enlace ) - Christensen, Ronald (2002). Respuestas planas a preguntas complejas: La teoría de los modelos lineales (Tercera ed.). Nueva York: Springer. ISBN 978-0-387-95361-8.
- Caliński, Tadeusz; Kageyama, Sanpei (2000). Diseños de bloques: un enfoque de aleatorización . Lecture Notes in Statistics. Vol. 150. doi : 10.1007/978-1-4612-1192-1 . ISBN 978-0-387-98578-7.
- Cox, DR; Reid, Nancy (2000). La teoría del diseño de experimentos . doi : 10.1201/9781420035834 . ISBN 978-0-429-12628-4.
- Hettmansperger, TP; McKean, JW (1998). Métodos estadísticos no paramétricos robustos . Biblioteca de Estadística de Kendall. Vol. 5 (1.ª ed.). Nueva York: Publicación de Hodder Arnold. pp. xiv+467. ISBN 978-0-340-54937-7MR 1604954 .
- Lentner, Marvin; Bishop, Thomas (1993). Diseño y análisis experimental (2.ª ed.). Blacksburg, VA: Valley Book Company. ISBN 978-0-9616255-2-8.
- Phadke, Madhav S. (1989). Ingeniería de calidad mediante diseño robusto . Nueva Jersey: Prentice Hall PTR. ISBN 978-0-13-745167-8.
- Box, GEP (1954). "Algunos teoremas sobre formas cuadráticas aplicadas al estudio de problemas de análisis de varianza, II. Efectos de la desigualdad de varianza y de la correlación entre errores en la clasificación bidireccional" . The Annals of Mathematical Statistics . 25 (3): 484. doi : 10.1214/aoms/1177728717 .
- Box, GEP (1954). "Algunos teoremas sobre formas cuadráticas aplicadas al estudio de problemas de análisis de varianza, I. Efecto de la desigualdad de varianza en la clasificación unidireccional" . The Annals of Mathematical Statistics . 25 (2): 290. doi : 10.1214/aoms/1177728786 .
- Box, GEP (1953). "Non-Normality and Tests on Variances". Biometrika . 40 (3/4): 318– 335. doi : 10.1093/biomet/40.3-4.318 . JSTOR 2333350 .
- Fisher, RA (abril de 1921). "Estudios sobre la variación de cultivos. I. Un examen del rendimiento de grano procesado de Broadbalk". The Journal of Agricultural Science . 11 (2): 107– 135. doi : 10.1017/S0021859600003750 . hdl : 2440/15170 . CORE output ID 162101431 .
Enlaces externos
- SOCR : Actividad ANOVA
- Ejemplos de todos los modelos ANOVA y ANCOVA con hasta tres factores de tratamiento, incluidos bloques aleatorios, parcelas divididas, medidas repetidas y cuadrados latinos, y su análisis en R (Universidad de Southampton).
- Manual electrónico de métodos estadísticos de NIST/SEMATECH, sección 7.4.3: "¿Son iguales las medias?"
- Análisis de varianza: Introducción
- Análisis de varianza
- Diseño de experimentos
- Pruebas estadísticas
- estadística paramétrica