En estadística , y en particular en el análisis de regresión , una matriz de diseño , también conocida como matriz de modelo o matriz de regresores y a menudo denotada por X , es una matriz de valores de variables explicativas de un conjunto de objetos. Cada fila representa un objeto individual, y las columnas sucesivas corresponden a las variables y sus valores específicos para ese objeto. La matriz de diseño se utiliza en ciertos modelos estadísticos , por ejemplo, el modelo lineal general . [ 1 ] [ 2 ] [ 3 ] Puede contener variables indicadoras (unos y ceros) que indican la pertenencia a un grupo en un ANOVA , o puede contener valores de variables continuas .
La matriz de diseño contiene datos sobre las variables independientes (también llamadas variables explicativas) en un modelo estadístico que busca explicar los datos observados en una variable de respuesta (a menudo denominada variable dependiente ). La teoría relacionada con estos modelos utiliza la matriz de diseño como entrada para algún cálculo de álgebra lineal ; véase, por ejemplo, la regresión lineal . Una característica destacada del concepto de matriz de diseño es su capacidad para representar diversos diseños experimentales y modelos estadísticos, como ANOVA , ANCOVA y regresión lineal.
Definición
La matriz de diseño se define como una matrizde tal manera que(la j -ésima columna de la i- ésima fila de) representa el valor de la j -ésima variable asociada con el i- ésimo objeto.
Un modelo de regresión puede representarse mediante multiplicación de matrices como
donde X es la matriz de diseño,es un vector de los coeficientes del modelo (uno para cada variable),es un vector de errores aleatorios con media cero, e y es el vector de salidas predichas para cada objeto.
Tamaño
La matriz de diseño tiene dimensión n x p , donde n es el número de muestras observadas y p es el número de variables ( características ) medidas en todas las muestras. [ 4 ] [ 5 ]
En esta representación, las distintas filas suelen representar diferentes repeticiones de un experimento, mientras que las columnas representan diferentes tipos de datos (por ejemplo, los resultados de pruebas específicas). Por ejemplo, supongamos que se realiza un experimento en el que se selecciona a 10 personas al azar y se les hacen 4 preguntas. La matriz de datos M sería una matriz de 10×4 (es decir, 10 filas y 4 columnas). El dato en la fila i y la columna j de esta matriz sería la respuesta de la i- ésima persona a la j -ésima pregunta.
Ejemplos
Media aritmética
La matriz de diseño para una media aritmética es un vector columna de unos .
regresión lineal simple
Esta sección ofrece un ejemplo de regresión lineal simple —es decir, regresión con una sola variable explicativa— con siete observaciones. Los siete puntos de datos son { y i , x i }, para i = 1, 2, …, 7. El modelo de regresión lineal simple es
dóndees la intersección con el eje y yes la pendiente de la línea de regresión. Este modelo se puede representar en forma matricial como
donde la primera columna de 1s en la matriz de diseño permite estimar la intersección con el eje y, mientras que la segunda columna contiene los valores de x asociados a los valores de y correspondientes . La matriz cuyas columnas son 1s y xs en este ejemplo es la matriz de diseño.
regresión múltiple
Esta sección contiene un ejemplo de regresión múltiple con dos covariables (variables explicativas): w y x . Supongamos de nuevo que los datos constan de siete observaciones y que para cada valor observado que se va a predecir (), también se observan los valores w i y x i de las dos covariables. El modelo a considerar es
Este modelo se puede escribir en términos matriciales como
Aquí, la matriz de 7×3 del lado derecho es la matriz de diseño.
ANOVA unidireccional (modelo de medias celulares)
Esta sección contiene un ejemplo con un análisis de varianza unidireccional ( ANOVA ) con tres grupos y siete observaciones. El conjunto de datos proporcionado tiene las tres primeras observaciones pertenecientes al primer grupo, las dos siguientes al segundo grupo y las dos últimas al tercer grupo. Si el modelo a ajustar es simplemente la media de cada grupo, entonces el modelo es
que se puede escribir
En este modelorepresenta la media de lael grupo.
ANOVA unidireccional (desplazamiento respecto al grupo de referencia)
El modelo ANOVA podría escribirse de forma equivalente como cada parámetro de grupo.siendo un desplazamiento de alguna referencia general. Normalmente, este punto de referencia se toma como uno de los grupos en consideración. Esto tiene sentido en el contexto de comparar múltiples grupos de tratamiento con un grupo de control y el grupo de control se considera la "referencia". En este ejemplo, el grupo 1 fue elegido como grupo de referencia. Como tal, el modelo a ajustar es
con la restricción de quees cero.
En este modeloes la media del grupo de referencia yes la diferencia del grupoal grupo de referencia.no se incluye en la matriz porque su diferencia con el grupo de referencia (él mismo) es necesariamente cero.
Véase también
Referencias
- ↑ Everitt, BS (2002). Diccionario de estadística de Cambridge (2.ª ed.). Cambridge, Reino Unido: Cambridge University Press. ISBN 0-521-81099-X.
- ↑ Box, GEP ; Tiao, GC (1992) [1973]. Inferencia bayesiana en el análisis estadístico . Nueva York: John Wiley and Sons. ISBN 0-471-57428-7.(Sección 8.1.1)
- ↑ Timm, Neil H. (2007). Análisis multivariante aplicado . Springer Science & Business Media. pág. 107. ISBN 9780387227719.
- ↑ Johnson, Richard A; Wichern, Dean W (2001). Análisis estadístico multivariante aplicado . Pearson. págs. 111–112 . ISBN 0131877151.
- ↑ "Conceptos básicos para estadística multivariante, pág. 2" (PDF) . SAS Institute.
Lecturas adicionales
- Verbeek, Albert (1984). «La geometría de la selección de modelos en regresión». En Dijkstra, Theo K. (ed.). Análisis de especificaciones erróneas . Nueva York: Springer. pp. 20–36 . ISBN 0-387-13893-5.
- Matrices (matemáticas)
- Análisis de regresión
- Diseño de experimentos
- estadística multivariante
- Datos