Articulo de referencia

Tabla de contingencia

En estadística , una tabla de contingencia (también conocida como tabla cruzada ) es un tipo de tabla en formato matricial que muestra la distribución de frecuencia multivariada...

En estadística , una tabla de contingencia (también conocida como tabla cruzada ) es un tipo de tabla en formato matricial que muestra la distribución de frecuencia multivariada de las variables. Se utilizan ampliamente en la investigación mediante encuestas, la inteligencia empresarial, la ingeniería y la investigación científica. Proporcionan una visión básica de la interrelación entre dos variables y pueden ayudar a encontrar interacciones entre ellas. El término tabla de contingencia fue utilizado por primera vez por Karl Pearson en "Sobre la teoría de la contingencia y su relación con la asociación y la correlación normal" [ 1 ] , parte de la serie biométrica I de Drapers' Company Research Memoirs, publicada en 1904.

Un problema crucial de la estadística multivariante es encontrar la estructura de dependencia (directa) subyacente a las variables contenidas en tablas de contingencia de alta dimensión. Si se revelan algunas de las independencias condicionales , incluso el almacenamiento de los datos puede realizarse de forma más inteligente (véase Lauritzen (2002)). Para ello, se pueden utilizar conceptos de la teoría de la información , que obtienen la información únicamente de la distribución de probabilidad, la cual puede expresarse fácilmente a partir de la tabla de contingencia mediante las frecuencias relativas.

Una tabla dinámica es una forma de crear tablas de contingencia utilizando software de hoja de cálculo.

Ejemplo

Supongamos que existen dos variables: sexo (masculino o femenino) y lateralidad (diestro o zurdo). Supongamos además que se seleccionan aleatoriamente 100 individuos de una población muy grande como parte de un estudio sobre las diferencias de género en la lateralidad. Se puede crear una tabla de contingencia para mostrar el número de individuos que son diestros y zurdos, y de mujeres diestras y zurdas. Dicha tabla de contingencia se muestra a continuación.

Las cifras de hombres, mujeres, diestros y zurdos se denominan totales marginales . El total general (el número total de individuos representados en la tabla de contingencia) es el número que aparece en la esquina inferior derecha.

La tabla permite a los usuarios ver de un vistazo que la proporción de hombres diestros es aproximadamente la misma que la proporción de mujeres diestras, aunque las proporciones no son idénticas. La fuerza de la asociación se puede medir mediante la razón de probabilidades , y la razón de probabilidades poblacional se estima mediante la razón de probabilidades muestral . La significancia de la diferencia entre las dos proporciones se puede evaluar con una variedad de pruebas estadísticas, incluyendo la prueba chi-cuadrado de Pearson , la prueba G , la prueba exacta de Fisher , la prueba de Boschloo y la prueba de Barnard , siempre que las entradas en la tabla representen individuos muestreados aleatoriamente de la población sobre la cual se van a extraer conclusiones. Si las proporciones de individuos en las diferentes columnas varían significativamente entre filas (o viceversa), se dice que hay una contingencia entre las dos variables. En otras palabras, las dos variables no son independientes. Si no hay contingencia, se dice que las dos variables son independientes .

El ejemplo anterior muestra el tipo más simple de tabla de contingencia, una tabla en la que cada variable tiene solo dos niveles; se denomina tabla de contingencia de 2  ×  2. En principio, se puede utilizar cualquier número de filas y columnas. También puede haber más de dos variables, pero las tablas de contingencia de orden superior son difíciles de representar visualmente. La relación entre variables ordinales , o entre variables ordinales y categóricas, también puede representarse en tablas de contingencia, aunque esta práctica es poco común. Para más información sobre el uso de una tabla de contingencia para la relación entre dos variables ordinales, consulte la gamma de Goodman y Kruskal .

Contenido estándar de una tabla de contingencia

  • Columnas múltiples (históricamente, se diseñaron para ocupar todo el espacio en blanco de una página impresa). Cuando cada fila se refiere a un subgrupo específico de la población (en este caso, hombres o mujeres), las columnas a veces se denominan puntos de referencia o secciones (y las filas a veces se denominan segmentos ).
  • Pruebas de significancia. Normalmente, se utilizan comparaciones de columnas , que comprueban las diferencias entre columnas y muestran los resultados mediante letras, o bien comparaciones de celdas , que utilizan colores o flechas para identificar una celda de una tabla que destaque de alguna manera.
  • Netos o netos que son subtotales.
  • Uno o más de los siguientes: porcentajes, porcentajes de fila, porcentajes de columna, índices o promedios.
  • Tamaños de muestra no ponderados (recuentos).

Medidas de asociación

El grado de asociación entre las dos variables puede evaluarse mediante diversos coeficientes. Las siguientes subsecciones describen algunos de ellos. Para una explicación más completa de sus usos, consulte los artículos principales enlazados bajo el título de cada subsección.

Razón de probabilidades

La medida de asociación más simple para una tabla de contingencia de 2  ×  2 es la razón de probabilidades . Dados dos eventos, A y B, la razón de probabilidades se define como la razón entre la probabilidad de A en presencia de B y la probabilidad de A en ausencia de B, o equivalentemente (debido a la simetría), la razón entre la probabilidad de B en presencia de A y la probabilidad de B en ausencia de A. Dos eventos son independientes si y solo si la razón de probabilidades es 1; si la razón de probabilidades es mayor que 1, los eventos están asociados positivamente; si la razón de probabilidades es menor que 1, los eventos están asociados negativamente.

La razón de probabilidades tiene una expresión simple en términos de probabilidades; dada la distribución de probabilidad conjunta:

B=1B=0A=1pag11pag10A=0pag01pag00{\displaystyle {\begin{array}{c|cc}&B=1&B=0\\\hline A=1&p_{11}&p_{10}\\A=0&p_{01}&p_{00}\end{array}}}

La razón de probabilidades es:

OR=pag11pag00pag10pag01.{\displaystyle OR={\frac {p_{11}p_{00}}{p_{10}p_{01}}}.}

coeficiente phi

Una medida simple, aplicable solo al caso de tablas de contingencia de 2  ×  2, es el coeficiente phi (φ) definido por

ϕ=±χ2norte,{\displaystyle \phi =\pm {\sqrt {\frac {\chi ^{2}}{N}}},}

donde χ² se calcula como en la prueba chi-cuadrado de Pearson , y N es el total general de observaciones. φ varía de 0 (que corresponde a ninguna asociación entre las variables) a 1 o −1 (asociación completa o asociación inversa completa), siempre que se base en datos de frecuencia representados en tablas de 2 ×  2.  Entonces su signo es igual al signo del producto de los elementos de la diagonal principal de la tabla menos el producto de los elementos fuera de la diagonal. φ toma el valor mínimo de −1,0 o el valor máximo de +1,0 si y solo si cada proporción marginal es igual a 0,5 (y dos celdas diagonales están vacías). [ 2 ]

La V de Cramér y el coeficiente de contingencia C

Dos alternativas son el coeficiente de contingencia C y la V de Cramér .

Las fórmulas para los coeficientes C y V son:

do=χ2norte+χ2{\displaystyle C={\sqrt {\frac {\chi ^{2}}{N+\chi ^{2}}}}}y
V=χ2norte(k1),{\displaystyle V={\sqrt {\frac {\chi ^{2}}{N(k-1)}}},}

donde k es el número de filas o el número de columnas, el que sea menor.

C presenta la desventaja de no alcanzar un máximo de 1,0; en particular, el valor máximo que puede alcanzar en una tabla de 2  ×  2 es 0,707. Puede alcanzar valores más cercanos a 1,0 en tablas de contingencia con más categorías; por ejemplo, puede alcanzar un máximo de 0,870 en una tabla de 4  ×  4. Por lo tanto, no debería utilizarse para comparar asociaciones en tablas diferentes si tienen un número distinto de categorías. [ 3 ]

C se puede ajustar de modo que alcance un máximo de 1,0 cuando existe una asociación completa en una tabla de cualquier número de filas y columnas dividiendo C pork1k{\displaystyle {\sqrt {\frac {k-1}{k}}}}donde k es el número de filas o columnas, cuando la tabla es cuadrada , o porr1r×do1do4{\displaystyle {\sqrt[{\scriptstyle 4}]{{r-1 \over r}\times {c-1 \over c}}}}donde r es el número de filas y c es el número de columnas. [ 4 ]

Coeficiente de correlación tetracórica

Otra opción es el coeficiente de correlación tetracórica, pero solo es aplicable a tablas de 2 × 2. La correlación policórica es una extensión de la correlación tetracórica a tablas que incluyen variables con más de dos niveles.  

La correlación tetracórica supone que la variable subyacente a cada medida dicotómica tiene una distribución normal. [ 5 ] El coeficiente proporciona "una medida conveniente de la correlación [de Pearson] cuando las mediciones graduadas se han reducido a dos categorías". [ 6 ]

El coeficiente de correlación tetracórica no debe confundirse con el coeficiente de correlación de Pearson , que se calcula asignando, por ejemplo, los valores 0,0 y 1,0 para representar los dos niveles de cada variable (lo cual es matemáticamente equivalente al coeficiente φ).

coeficiente lambda

El coeficiente lambda es una medida de la fuerza de asociación de las tablas de contingencia cuando las variables se miden al nivel nominal . Los valores oscilan entre 0,0 (sin asociación) y 1,0 (la máxima asociación posible).

La lambda asimétrica mide la mejora porcentual en la predicción de la variable dependiente. La lambda simétrica mide la mejora porcentual cuando la predicción se realiza en ambas direcciones.

Coeficiente de incertidumbre

El coeficiente de incertidumbre , o U de Theil, es otra medida para variables a nivel nominal. Sus valores oscilan entre -1,0 (asociación negativa del 100% o inversión perfecta) y +1,0 (asociación positiva del 100% o concordancia perfecta). Un valor de 0,0 indica la ausencia de asociación.

Además, el coeficiente de incertidumbre es condicional y una medida asimétrica de asociación, que puede expresarse como

U(incógnita|Y)U(Y|incógnita){\displaystyle U(X|Y)\neq U(Y|X)}.

Esta propiedad asimétrica puede conducir a conclusiones que no son tan evidentes en las medidas simétricas de asociación. [ 7 ]

Otros

Gamma, Tau-b y Tau-c se utilizan cuando las categorías o niveles de ambas variables tienen un orden natural.

  • Prueba gamma : No se realiza ningún ajuste ni por el tamaño de la tabla ni por los empates.
  • Tau de Kendall : Ajuste por empates.
    • Tau-b : Se utiliza para mesas cuadradas.
    • Tau-c : Se utiliza para mesas rectangulares.

Véase también

Referencias

  1. Karl Pearson, FRS (1904). Contribuciones matemáticas a la teoría de la evolución . Dulau and Co.
  2. Ferguson, GA (1966). Análisis estadístico en psicología y educación . Nueva York: McGraw–Hill.
  3. Smith, SC, & Albaum, GS (2004) Fundamentos de la investigación de mercados . Sage: Thousand Oaks, CA. pág. 631
  4. Blaikie, N. (2003) Análisis de datos cuantitativos . Sage: Thousand Oaks, CA. pág. 100
  5. Ferguson.
  6. Ferguson, 1966, pág. 244
  7. "La búsqueda de correlación categórica" . 26 de diciembre de 2019.

Lecturas adicionales

  • Andersen, Erling B. 1980. Modelos estadísticos discretos con aplicaciones en ciencias sociales . North Holland, 1980.
  • Bishop, YMM ; Fienberg, SE ; Holland, PW (1975). Análisis multivariante discreto: teoría y práctica . MIT Press. ISBN 978-0-262-02113-5MR 0381130 . 
  • Christensen, Ronald (1997). Modelos log-lineales y regresión logística . Textos de Springer en Estadística (Segunda  edición). Nueva York: Springer-Verlag. pp.  xvi+483. ISBN 0-387-98247-7. SR 1633357 . 
  • Lauritzen, Steffen L. (1979). Lecciones sobre tablas de contingencia (Universidad de Aalborg) (PDF) (4.ª edición (primera edición electrónica),  ed. 2002).
  • Gokhale, DV; Kullback, Solomon (1978). La información en las tablas de contingencia . Marcel Dekker. ISBN 0-824-76698-9.
  • Análisis en línea de tablas de contingencia: calculadora con ejemplos
  • Tablas de contingencia interactivas, prueba de chi-cuadrado independiente y tutorial.
  • Calculadora de Fisher y chi-cuadrado para tablas de contingencia de 2 × 2  
  • Más coeficientes de correlación
  • Asociación nominal: Phi, coeficiente de contingencia, T de Tschuprow, V de Cramer, Lambda, coeficiente de incertidumbre , 24 de marzo de 2008, G. David Garson, Universidad Estatal de Carolina del Norte
  • Tabulación cruzada de CustomInsight.com
  • El proyecto POWERMUTT: IV. VISUALIZACIÓN DE DATOS CATEGÓRICOS
  • StATS: El intento de Steve de enseñar estadística: razón de probabilidades versus riesgo relativo (9 de enero de 2001)
  • Tutorial de Epi Info sobre evaluación de la salud comunitaria, lección 5: Análisis: Creación de estadísticas