Articulo de referencia

Variable categórica

En estadística , una variable categórica (también llamada variable cualitativa ) es una variable que puede tomar uno de un número limitado, y generalmente fijo, de valores posib...

En estadística , una variable categórica (también llamada variable cualitativa ) es una variable que puede tomar uno de un número limitado, y generalmente fijo, de valores posibles, asignando a cada individuo u otra unidad de observación a un grupo particular o categoría nominal en función de alguna propiedad cualitativa . [ 1 ] En informática y algunas ramas de las matemáticas, las variables categóricas se denominan enumeraciones o tipos enumerados . Comúnmente (aunque no en este artículo), cada uno de los valores posibles de una variable categórica se denomina nivel . La distribución de probabilidad asociada a una variable categórica aleatoria se denomina distribución categórica .

Los datos categóricos son el tipo de datos estadísticos que consisten en variables categóricas o en datos que se han convertido a esa forma, por ejemplo, como datos agrupados . Más específicamente, los datos categóricos pueden derivarse de observaciones de datos cualitativos que se resumen como recuentos o tablas de contingencia , o de observaciones de datos cuantitativos agrupados en intervalos determinados. A menudo, los datos puramente categóricos se resumen en forma de tabla de contingencia . Sin embargo, particularmente al considerar el análisis de datos, es común usar el término "datos categóricos" para referirse a conjuntos de datos que, si bien contienen algunas variables categóricas, también pueden contener variables no categóricas. Las variables ordinales tienen un orden significativo, mientras que las variables nominales no lo tienen.

Una variable categórica que puede tomar exactamente dos valores se denomina variable binaria o variable dicotómica ; un caso especial importante es la variable de Bernoulli . Las variables categóricas con más de dos valores posibles se denominan variables politómicas ; a menudo se asume que las variables categóricas son politómicas a menos que se especifique lo contrario. La discretización consiste en tratar los datos continuos como si fueran categóricos. La dicotomización consiste en tratar los datos continuos o las variables politómicas como si fueran variables binarias. El análisis de regresión a menudo trata la pertenencia a una categoría con una o más variables ficticias cuantitativas .

Ejemplos de variables categóricas

Ejemplos de valores que podrían estar representados en una variable categórica:

  • Información demográfica de una población: sexo, estado de salud.
  • El grupo sanguíneo de una persona: A, B, AB u O.
  • El partido político por el que un votante podría votar, por ejemplo, Partido Verde , Demócrata Cristiano , Socialdemócrata , etc.
  • El tipo de roca: ígnea , sedimentaria o metamórfica .
  • La identidad de una palabra en particular (por ejemplo, en un modelo de lenguaje ) : Una de V opciones posibles, para un vocabulario de tamaño V.

Notación

Para facilitar el procesamiento estadístico, a las variables categóricas se les pueden asignar índices numéricos, por ejemplo, del 1 al K para una variable categórica de K dimensiones (es decir, una variable que puede expresar exactamente K valores posibles). Sin embargo, en general, los números son arbitrarios y no tienen otra importancia que la de proporcionar una etiqueta conveniente para un valor particular. En otras palabras, los valores de una variable categórica existen en una escala nominal : cada uno representa un concepto lógicamente separado, no necesariamente se pueden ordenar de forma significativa y no se pueden manipular como los números. En cambio, las operaciones válidas son la equivalencia , la pertenencia a un conjunto y otras operaciones relacionadas con conjuntos.

Como resultado, la tendencia central de un conjunto de variables categóricas viene dada por su moda ; ni la media ni la mediana pueden definirse. Por ejemplo, dado un conjunto de personas, podemos considerar el conjunto de variables categóricas correspondientes a sus apellidos. Podemos considerar operaciones como la equivalencia (si dos personas tienen el mismo apellido), la pertenencia a un conjunto (si una persona tiene un nombre en una lista dada), el conteo (cuántas personas tienen un apellido dado) o el cálculo de la moda (qué nombre aparece con mayor frecuencia). Sin embargo, no podemos calcular de forma significativa la "suma" de Smith + Johnson, ni preguntar si Smith es "menor que" o "mayor que" Johnson. Por lo tanto, no podemos preguntar de forma significativa cuál es el "nombre promedio" (la media) o el "nombre intermedio" (la mediana) en un conjunto de nombres.

Esto ignora el concepto de orden alfabético , que es una propiedad que no es inherente a los nombres en sí, sino a la forma en que construimos las etiquetas. Por ejemplo, si escribimos los nombres en cirílico y consideramos el orden de las letras cirílicas, podríamos obtener un resultado diferente al evaluar "Smith < Johnson" que si escribimos los nombres en el alfabeto latino estándar ; y si escribimos los nombres en caracteres chinos , no podemos evaluar "Smith < Johnson" de manera significativa, porque no existe un orden consistente definido para dichos caracteres. Sin embargo, si consideramos los nombres tal como están escritos, por ejemplo, en el alfabeto latino, y definimos un orden que corresponda al orden alfabético estándar, entonces los hemos convertido efectivamente en variables ordinales definidas en una escala ordinal .

Número de valores posibles

Las variables aleatorias categóricas se describen estadísticamente mediante una distribución categórica , que permite expresar una variable categórica arbitraria de K categorías con probabilidades separadas para cada uno de los K resultados posibles. Estas variables categóricas multicategóricas se analizan a menudo mediante una distribución multinomial , que contabiliza la frecuencia de cada combinación posible de ocurrencias de las distintas categorías. El análisis de regresión sobre resultados categóricos se realiza mediante regresión logística multinomial , probit multinomial o un modelo de elección discreta similar .

Las variables categóricas que solo tienen dos resultados posibles (por ejemplo, "sí" frente a "no" o "éxito" frente a "fracaso") se conocen como variables binarias (o variables de Bernoulli ). Debido a su importancia, estas variables suelen considerarse una categoría aparte, con una distribución propia (la distribución de Bernoulli ) y modelos de regresión independientes ( regresión logística , regresión probit , etc.). Por consiguiente, el término "variable categórica" ​​se suele reservar para casos con tres o más resultados, a veces denominados variables multivariables en contraposición a las variables binarias.

También es posible considerar variables categóricas donde el número de categorías no está fijado de antemano. Por ejemplo, para una variable categórica que describe una palabra en particular, es posible que no conozcamos de antemano el tamaño del vocabulario y queramos contemplar la posibilidad de encontrar palabras que aún no hayamos visto. Los modelos estadísticos estándar, como los que involucran la distribución categórica y la regresión logística multinomial , asumen que el número de categorías se conoce de antemano, y cambiarlo sobre la marcha es complicado. En tales casos, deben utilizarse técnicas más avanzadas. Un ejemplo es el proceso de Dirichlet , que pertenece al ámbito de la estadística no paramétrica . En este caso, se asume lógicamente que existe un número infinito de categorías, pero en cualquier momento dado la mayoría de ellas (de hecho, todas menos un número finito) nunca se han visto. Todas las fórmulas se formulan en términos del número de categorías realmente vistas hasta el momento, en lugar del número total (infinito) de categorías potenciales existentes, y se crean métodos para la actualización incremental de las distribuciones estadísticas, incluyendo la adición de "nuevas" categorías.

Variables categóricas y regresión

Las variables categóricas representan un método cualitativo de puntuación de datos (es decir, representan categorías o pertenencia a grupos). Estas pueden incluirse como variables independientes en un análisis de regresión o como variables dependientes en una regresión logística o probit , pero deben convertirse en datos cuantitativos para poder analizarlos. Esto se logra mediante el uso de sistemas de codificación. Los análisis se realizan de manera que solo se codifiquen g - 1 ( donde g es el número de grupos). Esto minimiza la redundancia sin dejar de representar el conjunto completo de datos, ya que no se obtendría información adicional al codificar los g grupos en total: por ejemplo, al codificar el género (donde g = 2: masculino y femenino), si solo codificamos mujeres, todos los restantes serían necesariamente hombres. En general, el grupo que no se codifica es el de menor interés. [ 2 ]

Existen tres sistemas de codificación principales que se utilizan habitualmente en el análisis de variables categóricas en regresión: codificación ficticia, codificación de efectos y codificación de contrastes. La ecuación de regresión tiene la forma Y = bX + a , donde b es la pendiente y proporciona el peso empíricamente asignado a una variable explicativa, X es la variable explicativa y a es la intersección con el eje Y. Estos valores adquieren diferentes significados según el sistema de codificación utilizado. La elección del sistema de codificación no afecta a las estadísticas F ni . Sin embargo, se elige un sistema de codificación en función de la comparación de interés, ya que la interpretación de los valores de b variará. [ 2 ]

Código ficticio

La codificación ficticia se utiliza cuando se tiene en mente un grupo de control o de comparación. Por lo tanto, se analizan los datos de un grupo en relación con el grupo de comparación: a representa la media del grupo de control y b es la diferencia entre la media del grupo experimental y la media del grupo de control. Se sugiere que se cumplan tres criterios para especificar un grupo de control adecuado: el grupo debe ser un grupo bien establecido (por ejemplo, no debe ser una categoría "otra"), debe haber una razón lógica para seleccionar este grupo como comparación (por ejemplo, se prevé que el grupo obtenga la puntuación más alta en la variable dependiente) y, finalmente, el tamaño de la muestra del grupo debe ser sustancial y no pequeño en comparación con los otros grupos. [ 3 ]

En la codificación ficticia, al grupo de referencia se le asigna un valor de 0 para cada variable de código, al grupo de interés para la comparación con el grupo de referencia se le asigna un valor de 1 para su variable de código especificada, mientras que a todos los demás grupos se les asigna 0 para esa variable de código en particular. [ 2 ]

Los valores b deben interpretarse comparando el grupo experimental con el grupo de control. Por lo tanto, un valor b negativo implicaría que el grupo experimental obtuvo una puntuación menor que el grupo de control en la variable dependiente . Para ilustrar esto, supongamos que medimos el optimismo entre varias nacionalidades y decidimos que los franceses servirían como grupo de control. Si los comparamos con los italianos y observamos un valor b negativo , esto sugeriría que los italianos obtienen puntuaciones de optimismo más bajas en promedio.

La siguiente tabla es un ejemplo de codificación ficticia con el francés como grupo de control y C1, C2 y C3 siendo respectivamente los códigos para italiano , alemán y otros (ni francés, ni italiano, ni alemán):

Codificación de efectos

En el sistema de codificación de efectos, los datos se analizan comparando un grupo con todos los demás. A diferencia de la codificación ficticia, no hay un grupo de control. La comparación se realiza en la media de todos los grupos combinados ( a es ahora la media general ). Por lo tanto, no se buscan datos en relación con otro grupo, sino en relación con la media general. [ 2 ]

La codificación de efectos puede ser ponderada o no ponderada. La codificación de efectos ponderada consiste simplemente en calcular una media general ponderada, teniendo en cuenta así el tamaño de la muestra en cada variable. Esto es más apropiado en situaciones donde la muestra es representativa de la población en cuestión. La codificación de efectos no ponderada es más apropiada en situaciones donde las diferencias en el tamaño de la muestra son resultado de factores fortuitos. La interpretación de b es diferente para cada caso: en la codificación de efectos no ponderada, b es la diferencia entre la media del grupo experimental y la media general, mientras que en la situación ponderada es la media del grupo experimental menos la media general ponderada. [ 2 ]

En la codificación de efectos, asignamos un 1 al grupo de interés, al igual que en la codificación ficticia. La principal diferencia radica en que asignamos un -1 al grupo que menos nos interesa. Dado que seguimos utilizando un esquema de codificación g - 1, el grupo con el código -1 es el que no genera datos, de ahí que sea el que menos nos interese. A todos los demás grupos se les asigna un código de 0.

Los valores b deben interpretarse de manera que el grupo experimental se compare con la media de todos los grupos combinados (o la media ponderada general en el caso de la codificación de efectos ponderados). Por lo tanto, un valor b negativo implicaría que el grupo codificado obtuvo una puntuación inferior a la media de todos los grupos en la variable dependiente. Siguiendo con nuestro ejemplo anterior de puntuaciones de optimismo entre nacionalidades, si el grupo de interés son los italianos, un valor b negativo sugiere que obtienen una puntuación de optimismo menor.

La siguiente tabla es un ejemplo de codificación de efectos, donde " Otros" es el grupo de menor interés.

Codificación de contraste

El sistema de codificación de contraste permite al investigador formular directamente preguntas específicas. En lugar de que el sistema de codificación dicte la comparación que se realiza (es decir, con un grupo de control como en la codificación ficticia, o con todos los grupos como en la codificación de efectos), se puede diseñar una comparación única que se adapte a la pregunta de investigación específica. Esta hipótesis personalizada se basa generalmente en teorías y/o investigaciones previas. Las hipótesis propuestas suelen ser las siguientes: primero, la hipótesis central, que postula una gran diferencia entre dos conjuntos de grupos; la segunda hipótesis sugiere que, dentro de cada conjunto, las diferencias entre los grupos son pequeñas. Gracias a sus hipótesis enfocadas a priori , la codificación de contraste puede aumentar la potencia de la prueba estadística en comparación con los sistemas de codificación anteriores, menos dirigidos. [ 2 ]

Al comparar los coeficientes a priori entre ANOVA y regresión, surgen ciertas diferencias. A diferencia de ANOVA, donde el investigador puede elegir valores de coeficientes ortogonales o no ortogonales, en regresión es fundamental que los valores de los coeficientes asignados en la codificación de contrastes sean ortogonales. Además, en regresión, los coeficientes deben ser fraccionarios o decimales; no pueden ser valores de intervalo.

La construcción de códigos de contraste está restringida por tres reglas:

  1. La suma de los coeficientes de contraste para cada variable de código debe ser igual a cero.
  2. La diferencia entre la suma de los coeficientes positivos y la suma de los coeficientes negativos debe ser igual a 1.
  3. Las variables codificadas deben ser ortogonales. [ 2 ]

Violar la regla 2 produce valores R 2 y F precisos , lo que indica que llegaríamos a las mismas conclusiones sobre si existe o no una diferencia significativa; sin embargo, ya no podemos interpretar los valores b como una diferencia de medias.

Para ilustrar la construcción de códigos de contraste, considere la siguiente tabla. Los coeficientes se eligieron para ilustrar nuestras hipótesis a priori: Hipótesis 1: Las personas francesas e italianas obtendrán puntuaciones más altas en optimismo que las alemanas (francesas = +0,33, italianas = +0,33, alemanas = −0,66). Esto se ilustra asignando el mismo coeficiente a las categorías francesas e italianas y uno diferente a las alemanas. Los signos asignados indican la dirección de la relación (por lo tanto, dar a los alemanes un signo negativo es indicativo de sus puntuaciones de optimismo hipotetizadas más bajas). Hipótesis 2: Se espera que los franceses e italianos difieran en sus puntuaciones de optimismo (francesas = +0,50, italianas = −0,50, alemanas = 0). Aquí, asignar un valor cero a los alemanes demuestra su no inclusión en el análisis de esta hipótesis. Nuevamente, los signos asignados son indicativos de la relación propuesta.

Codificación sin sentido

La codificación sin sentido se produce cuando se utilizan valores arbitrarios en lugar de los "0", "1" y "-1" designados en los sistemas de codificación anteriores. Aunque produce valores medios correctos para las variables, no se recomienda el uso de la codificación sin sentido, ya que dará lugar a resultados estadísticos ininterpretables. [ 2 ]

Incrustaciones

Las incrustaciones son codificaciones de valores categóricos en espacios vectoriales de baja dimensión con valores reales (a veces complejos ), generalmente de forma que a valores "similares" se les asignan vectores "similares", o con respecto a algún otro criterio que hace que los vectores sean útiles para la aplicación correspondiente. Un caso especial común son las incrustaciones de palabras , donde los posibles valores de la variable categórica son las palabras de un idioma y a las palabras con significados similares se les asignan vectores similares.

Interacciones

Una interacción puede surgir al considerar la relación entre tres o más variables, y describe una situación en la que la influencia simultánea de dos variables sobre una tercera no es aditiva. Las interacciones con variables categóricas pueden presentarse de dos maneras: interacciones entre variables categóricas o interacciones entre variables categóricas y continuas.

Interacciones entre variables categóricas

Este tipo de interacción surge cuando tenemos dos variables categóricas. Para analizar este tipo de interacción, se codifica utilizando el sistema que mejor se ajuste a la hipótesis del investigador. El producto de los códigos da como resultado la interacción. A continuación, se puede calcular el valor b y determinar si la interacción es significativa. [ 2 ]

Interacciones entre variables categóricas y continuas

El análisis de pendientes simples es una prueba post hoc común utilizada en regresión, similar al análisis de efectos simples en ANOVA, que se utiliza para analizar interacciones. En esta prueba, examinamos las pendientes simples de una variable independiente en valores específicos de la otra variable independiente. Esta prueba no se limita al uso con variables continuas, sino que también puede emplearse cuando la variable independiente es categórica. No podemos simplemente elegir valores para analizar la interacción como lo haríamos en el caso de variables continuas debido a la naturaleza nominal de los datos (es decir, en el caso continuo, se podrían analizar los datos en niveles alto, moderado y bajo, asignando 1 desviación estándar por encima de la media, en la media y en una desviación estándar por debajo de la media, respectivamente). En nuestro caso categórico, usaríamos una ecuación de regresión simple para cada grupo para investigar las pendientes simples. Es práctica común estandarizar o centrar las variables para que los datos sean más interpretables en el análisis de pendientes simples; sin embargo, las variables categóricas nunca deben estandarizarse ni centrarse. Esta prueba puede utilizarse con todos los sistemas de codificación. [ 2 ]

Véase también

Referencias

  1. Yates, Daniel S.; Moore, David S .; Starnes, Daren S. (2003). La práctica de la estadística (2.ª  ed.). Nueva York: Freeman . ISBN 978-0-7167-4773-4Archivado del original el 9 de febrero de 2005. Consultado el 28 de septiembre de 2014 .
  2. 1 2 3 4 5 6 7 8 9 10 Cohen, J.; Cohen, P.; West, SG; Aiken, LS (2003). Análisis de regresión/correlación múltiple aplicada a las ciencias del comportamiento (3.ª ed.) . Nueva York, NY: Routledge.
  3. Hardy, Melissa (1993). Regresión con variables ficticias . Newbury Park, CA: Sage.

Lecturas adicionales

  • Andersen, Erling B. 1980. Modelos estadísticos discretos con aplicaciones en ciencias sociales . North Holland, 1980.
  • Bishop, YMM ; Fienberg, SE ; Holland, PW (1975). Análisis multivariante discreto: teoría y práctica . MIT Press. ISBN 978-0-262-02113-5MR 0381130 . 
  • Christensen, Ronald (1997). Modelos log-lineales y regresión logística . Textos de Springer en Estadística (Segunda  edición). Nueva York: Springer-Verlag. pp.  xvi+483. ISBN 0-387-98247-7. SR 1633357 . 
  • Friendly, Michael. Visualizing categorical data. SAS Institute, 2000.
  • Lauritzen, Steffen L. (2002) [1979]. Lectures on Contingency Tables(PDF) (updated electronic version of the (University of Aalborg) 3rd (1989) ed.).
  • NIST/SEMATEK (2008) Handbook of Statistical Methods