En estadística , el análisis de Yates es un método para analizar datos obtenidos de un experimento diseñado con un diseño factorial . Los diseños factoriales completos y fraccionados son comunes en experimentos diseñados para aplicaciones científicas y de ingeniería. En estos diseños, a cada factor se le asignan dos niveles, generalmente denominados nivel bajo y nivel alto, representados por los símbolos "-" y "+". Para fines computacionales, los factores se escalan de manera que al nivel bajo se le asigna un valor de -1 y al nivel alto un valor de +1.
Un diseño factorial completo incluye todas las combinaciones posibles de niveles bajos/altos para todos los factores. Un diseño factorial fraccionado incluye un subconjunto cuidadosamente seleccionado de estas combinaciones. El criterio para elegir los subconjuntos se analiza en detalle en el artículo sobre diseños factoriales fraccionados .
Formalizado por Frank Yates , el análisis de Yates aprovecha la estructura especial de estos diseños para generar estimaciones de mínimos cuadrados para los efectos de los factores, tanto para los factores como para las interacciones relevantes. El análisis de Yates puede utilizarse para responder a las siguientes preguntas:
- ¿Cuál es la lista de factores clasificados?
- ¿Cuál es la bondad de ajuste (medida mediante la desviación estándar residual) de los distintos modelos?
Los detalles matemáticos del análisis de Yates se presentan en el capítulo 10 de Box, Hunter y Hunter (1978).
El análisis de Yates se complementa normalmente con una serie de técnicas gráficas , como el gráfico de medias del DOE y el gráfico de contorno del DOE ("DOE" significa "diseño de experimentos").
La orden de Yates
Antes de realizar un análisis de Yates, los datos deben estar ordenados según el "orden de Yates". Es decir, dados k factores, la k -ésima columna consta de 2 ( k -1) signos negativos (es decir, el nivel bajo del factor) seguidos de 2 ( k -1) signos positivos (es decir, el nivel alto del factor). Por ejemplo, para un diseño factorial completo con tres factores, la matriz de diseño es:
Para comprender y utilizar mejor la tabla de signos anterior, un método para detallar los factores y las combinaciones de tratamientos se denomina notación moderna. Esta notación es una forma abreviada que surge al tomar los subíndices de cada combinación de tratamientos, convertirlos en exponentes, evaluar la expresión resultante y usarla como el nuevo nombre de la combinación de tratamientos. Cabe señalar que, si bien los nombres se parecen mucho a expresiones algebraicas, son simplemente nombres y no se les asignan nuevos valores. Tomando el modelo de 3 factores y 2 niveles anterior, en el orden de Yates, las variables de respuesta son:
que en notación moderna se convierte en:
en el que es evidente que los exponentes en los nombres de notación modernos son simplemente los subíndices de los anteriores (nótese que cualquier cosa elevada a la potencia cero es 1 y cualquier cosa elevada a la primera potencia es ella misma). Cada variable de respuesta se asigna luego fila por fila a la tabla anterior. Por lo tanto, la primera fila es para, la segunda fila es paray así sucesivamente. Los signos en cada columna representan los signos que debe tomar cada variable de respuesta en el cálculo de las estimaciones del efecto para ese factor.
Para determinar el orden de Yates en diseños factoriales fraccionados, es necesario conocer la estructura de confusión del diseño factorial fraccionado.
Producción
Un análisis de Yates genera el siguiente resultado.
- Un identificador de factor (del orden de Yates). El identificador específico variará según el programa utilizado para generar el análisis de Yates. Dataplot , por ejemplo, utiliza el siguiente para un modelo de 3 factores.
- 1 = factor 1
- 2 = factor 2
- 3 = factor 3
- 12 = interacción del factor 1 y el factor 2
- 13 = interacción del factor 1 y el factor 3
- 23 = interacción del factor 2 y el factor 3
- 123 = interacción de los factores 1, 2 y 3
- Una lista clasificada de factores importantes. Es decir, los efectos de los factores estimados mediante mínimos cuadrados, ordenados de mayor a menor magnitud (más significativos).
Para determinar las magnitudes, las variables de respuesta se ordenan primero según el método de Yates, tal como se describe en la sección anterior. A continuación, se suman y restan términos por pares para determinar la siguiente columna. Más específicamente, dados los valores de las variables de respuesta (tal como deberían haberse obtenido directamente del experimento) en el orden de Yates, se suman los dos primeros términos y esa suma constituye el primer término de la nueva columna. Luego se suman los dos términos siguientes, que constituyen el segundo término de la nueva columna. Dado que los términos se suman por pares, la mitad de la nueva columna queda completa y debe estar compuesta enteramente por las sumas por pares de los datos. La segunda mitad de la columna se obtiene de forma análoga, pero tomando las diferencias por pares: el primer término se resta del segundo, el tercero del cuarto, y así sucesivamente. De esta manera se completa la columna. Si se necesitan más columnas, se repite el mismo proceso, pero utilizando la nueva columna. En otras palabras, la enésima columna se genera a partir de la (n-1)-ésima columna (Berger et al. denominan a este proceso "Yatesing de los datos"). En undiseño, se requerirán k columnas, y la última columna es la que se utiliza para calcular las estimaciones del efecto.
- Un valor t para las estimaciones del efecto de cada factor individual. El valor t se calcula como
donde e es el efecto estimado del factor y s e es la desviación estándar del efecto estimado del factor.
- La desviación estándar residual que resulta del modelo con un solo término. Es decir, la desviación estándar residual del modelo.
donde X i es la estimación del i- ésimo factor o efecto de interacción.
- La desviación estándar residual acumulada que resulta del modelo utilizando el término actual más todos los términos que preceden a ese término. Es decir,
Esto consiste en un conjunto de desviaciones estándar residuales que disminuyen monótonamente (lo que indica un mejor ajuste a medida que aumenta el número de términos en el modelo). La primera desviación estándar residual acumulada es para el modelo.
donde la constante es la media general de la variable de respuesta. La última desviación estándar residual acumulada es para el modelo.
Este último modelo tendrá una desviación estándar residual de cero.
Ejemplo
(Adaptado de Berger et al., capítulo 9) Supongamos que se realiza un estudio donde se vende un producto por correo y se intenta determinar el efecto de tres factores (franqueo, precio del producto, tamaño del sobre) en la tasa de respuesta de las personas (es decir, si comprarán el producto). Cada factor tiene dos niveles: para el franqueo (etiquetado A), son tercera clase (bajo) y primera clase (alto); para el precio del producto (etiquetado B), el nivel bajo es de $9.95 y el nivel alto es de $12.95; y para el tamaño del sobre (etiquetado C), el nivel bajo es #10 y el nivel alto es de 9x12. Del experimento, se obtienen los siguientes datos. Nótese que la tasa de respuesta se da como una proporción de las personas que respondieron la encuesta (favorablemente y desfavorablemente) para cada combinación de tratamiento.
Si por ahora nos centramos en el factor A (franqueo) para el cálculo, la estimación global de A debe tener en cuenta también los efectos de interacción de B y C sobre él. Los cuatro términos para el cálculo son:
- a –1, estimación de A con B y C bajos
- ab – b, estimación de A con B alto y C bajo
- ac – c, estimación de A con B bajo y C alto
- abc – bc, estimación de A con B y C altos
La estimación total es la suma de estos cuatro términos dividida por cuatro. En otras palabras, la estimación de A es
donde la suma se ha reorganizado para agrupar todos los términos positivos y los negativos para facilitar su visualización. En el orden de Yates, la suma se escribe como
Las estimaciones para B y C se pueden determinar de manera similar. El cálculo de los efectos de interacción también es similar, pero las respuestas se promedian considerando todos los demás efectos no tenidos en cuenta.

La tabla completa de signos para un diseño de tres factores y dos niveles se muestra a la derecha. Tanto los factores (columnas) como las combinaciones de tratamientos (filas) están escritos en el orden de Yates. La utilidad de ordenar la suma en el orden de Yates resulta evidente, ya que solo es necesario modificar los signos según la tabla para obtener las estimaciones del efecto para cada combinación de tratamientos. Observe que las columnas de A, B y C son las mismas que las de la matriz de diseño en la sección anterior del orden de Yates. Observe también que las columnas de los efectos de interacción se pueden obtener calculando el producto escalar de las columnas de los factores individuales (es decir, multiplicando las columnas elemento a elemento para obtener otra columna de la misma longitud). Tenga en cuenta que todas las sumas deben dividirse por 4 para obtener la estimación del efecto real, como se mostró anteriormente. Utilizando esta tabla, las estimaciones del efecto se calculan de la siguiente manera:
Un valor positivo indica que un aumento en el factor genera un incremento en la tasa de respuesta, mientras que un valor negativo indica que ese mismo aumento produce una disminución en la tasa de respuesta. Cabe señalar, sin embargo, que estos efectos aún no se han determinado como estadísticamente significativos; solo se ha constatado su existencia en la tasa de respuesta para cada factor. La significación estadística debe determinarse mediante otros métodos, como el análisis de varianza (ANOVA) .
Para más información, consulte Berger et al., capítulo 9.
Estimaciones de parámetros a medida que se añaden términos
En la mayoría de los casos de ajuste por mínimos cuadrados, los coeficientes del modelo para los términos añadidos previamente cambian según los términos que se añadan sucesivamente. Por ejemplo, el coeficiente X₁ podría cambiar dependiendo de si se incluye o no un término X₂ en el modelo. Esto no ocurre cuando el diseño es ortogonal, como en un diseño factorial completo 2³ . En los diseños ortogonales, las estimaciones de los términos incluidos previamente no cambian a medida que se añaden términos adicionales. Esto significa que la lista ordenada de estimaciones de efectos sirve simultáneamente como estimación de los coeficientes de mínimos cuadrados para modelos progresivamente más complejos.
Selección y validación de modelos
A partir de los resultados de Yates, se pueden definir los modelos potenciales del análisis. Un componente importante del análisis de Yates es la selección del mejor modelo entre los modelos potenciales disponibles. El paso anterior enumera todos los modelos potenciales. De esta lista, queremos seleccionar el modelo más apropiado. Esto requiere equilibrar los dos objetivos siguientes.
- Queremos que el modelo incluya todos los factores importantes.
- Queremos que el modelo sea parsimonioso. Es decir, el modelo debe ser lo más simple posible.
En resumen, buscamos que nuestro modelo incluya todos los factores e interacciones importantes y omita los irrelevantes. Cabe destacar que la desviación estándar residual por sí sola no es suficiente para determinar el modelo más adecuado, ya que siempre disminuirá al añadir factores adicionales. En su lugar, se utilizan siete criterios para definir los factores importantes. Estos siete criterios no son todos igualmente importantes, ni generarán subconjuntos idénticos; en tal caso, se deberá extraer un subconjunto de consenso o un subconjunto de consenso ponderado. En la práctica, algunos de estos criterios pueden no ser aplicables en todas las situaciones, y algunos analistas pueden tener criterios adicionales. Estos criterios se presentan como pautas útiles. La mayoría de los analistas se centrarán en los criterios que consideren más útiles.
- Importancia práctica de los efectos
- Orden de magnitud de los efectos
- Significancia estadística de los efectos
- Gráficos de probabilidad de los efectos
- Gráfico de Youden de promedios
- Importancia práctica de la desviación estándar residual
- Significancia estadística de la desviación estándar residual
Los primeros cuatro criterios se centran en la magnitud del efecto, con tres criterios numéricos y uno gráfico. El quinto criterio se centra en los promedios. Los dos últimos criterios se centran en la desviación estándar residual del modelo. Una vez seleccionado un modelo preliminar, el término de error debe cumplir con los supuestos de un proceso de medición univariado . Es decir, el modelo debe validarse analizando los residuos.
Presentación gráfica
Algunos analistas podrían preferir una presentación más gráfica de los resultados de Yates. En particular, los siguientes gráficos podrían resultar útiles:
- Gráfico de datos ordenados
- Gráfico de efectos absolutos ordenados
- Gráfico de desviación estándar residual acumulada
Técnicas relacionadas
Referencias
- Box, GEP; Hunter, WG; Hunter, JS (1978). Estadística para experimentadores: Introducción al diseño, análisis de datos y construcción de modelos . John Wiley and Sons. ISBN 0-471-09315-7.
- Knuth, Donald Ervin (1997), Algoritmos seminuméricos , El arte de la programación informática , vol. 2 (3.ª ed.), Addison-Wesley. Aquí: sección 4.3.4.
- Koivisto, Mikko (enero de 2004), Algoritmos suma-producto para el análisis de riesgos genéticos (tesis doctoral), Dept. CS Ser. Pub. A, vol. A-2004-1, Universidad de Helsinki, ISBN 952-10-1578-0Aquí: pág. 45, 96–103.
- Yates, F. (1937), El diseño y análisis de experimentos factoriales (Comunicación técnica), vol. 35, Harpenden, Inglaterra: Commonwealth Bureau of SoilsAquí: págs. 66-67.
- Berger, Paul D.; Maurer, Robert E.; Celli, Giovana B. (30 de noviembre de 2017). "9". Introducción al diseño experimental . SpringerLink. págs. 295–342 . doi : 10.1007/978-3-319-64583-4_1 . ISBN 978-3-319-64583-4.
Este artículo incorpora material de dominio público del Instituto Nacional de Estándares y Tecnología.
Enlaces externos
- Análisis de Yates
- Diseño de experimentos