El análisis de frecuencia configuracional (AFC) es un método de análisis exploratorio de datos , introducido por Gustav A. Lienert en 1969. [ 1 ] El objetivo del AFC es detectar patrones en los datos que ocurren con una frecuencia significativamente mayor (estos patrones se denominan Tipos ) o significativamente menor (estos patrones se denominan Antitipos ) de lo esperado por azar. Por lo tanto, la idea del AFC es proporcionar a los tipos y antitipos identificados información sobre la estructura de los datos. Los Tipos se interpretan como conceptos constituidos por un patrón de valores de variables. Los Antitipos se interpretan como patrones de valores de variables que, en general, no ocurren juntos.
Idea básica del algoritmo CFA
Explicamos la idea básica del CFA con un ejemplo sencillo. Supongamos que tenemos un conjunto de datos que describe, para cada uno de n pacientes, si presentan ciertos síntomas s 1 , ..., s m . Para simplificar, asumimos que un síntoma se presenta o no, es decir, tenemos un conjunto de datos dicotómico .
Cada registro en el conjunto de datos es, por lo tanto, una m -tupla ( x 1 , ..., x m ) donde cada x i es igual a 0 (el paciente no muestra el síntoma i ) o 1 (el paciente sí muestra el síntoma i ). Cada m -tupla de este tipo se llama configuración . Sea C el conjunto de todas las configuraciones posibles, es decir, el conjunto de todas las m -tuplas posibles en {0,1} m . El conjunto de datos se puede describir enumerando las frecuencias observadas f ( c ) de todas las configuraciones posibles en C .
La idea básica del CFA es estimar la frecuencia de cada configuración bajo el supuesto de que los m síntomas son estadísticamente independientes . Sea e ( c ) esta frecuencia estimada bajo el supuesto de independencia.
Sea p i (1) la probabilidad de que un miembro de la población investigada muestre el síntoma s i y p i (0) la probabilidad de que un miembro de la población investigada no muestre el síntoma s i . Bajo el supuesto de que todos los síntomas son independientes, podemos calcular la frecuencia relativa esperada de una configuración c = ( c 1 , ..., c m ) mediante:
Ahora, f ( c ) y e ( c ) se pueden comparar mediante una prueba estadística (las pruebas típicas aplicadas en el AFC son la prueba chi-cuadrado de Pearson , la prueba binomial o la prueba hipergeométrica de Lehmacher).
Si la prueba estadística sugiere para un dado-nivel que la diferencia entre f ( c ) y e ( c ) es significativa entonces c se denomina tipo si f ( c ) > e ( c ) y se denomina antitipo si f ( c ) < e ( c ). Si no hay una diferencia significativa entre f ( c ) y e ( c ), entonces c no es ni un tipo ni un antitipo. Por lo tanto, cada configuración c puede tener en principio tres estados diferentes: puede ser un tipo, un antitipo o no estar clasificada.
Los tipos y antitipos se definen simétricamente. Sin embargo, en aplicaciones prácticas, los investigadores se centran principalmente en la detección de tipos. Por ejemplo, los estudios clínicos suelen buscar combinaciones de síntomas que sean indicadores de una enfermedad. Estas son, por definición, combinaciones de síntomas que se presentan con mayor frecuencia de lo esperado por azar; es decir, son tipos.
Control del nivel alfa
Dado que en CFA se aplica una prueba de significancia en paralelo para cada configuración c, existe un alto riesgo de cometer un error de tipo I (es decir, detectar un tipo o antitipo cuando la hipótesis nula es verdadera). El método más popular actualmente para controlar esto es usar la corrección de Bonferroni para el nivel α . [ 2 ] Hay varios métodos alternativos para controlar el nivel α . Una alternativa, el método Holm-Bonferroni introducido por Sture Holm , considera el número de pruebas ya terminadas cuando se realiza la i -ésima prueba. [ 3 ] Por lo tanto, en este método el nivel alfa no es constante para todas las pruebas.
Algoritmo en el caso no dicotómico
En nuestro ejemplo anterior, por simplicidad, asumimos que los síntomas son dicotómicos. Sin embargo, esta no es una restricción necesaria. El CFA también se puede aplicar a síntomas (o atributos más generales de un objeto) que no son dicotómicos pero tienen un número finito de grados. En este caso, una configuración es un elemento de C = S 1 x ... x S m , donde S i es el conjunto de los posibles grados para el síntoma s i . [ 2 ] [ 4 ] [ 5 ] [ 6 ]
modelo de probabilidad
La suposición de independencia de los síntomas puede ser reemplazada por otro método para calcular las frecuencias esperadas e ( c ) de las configuraciones. Dicho método se denomina modelo de probabilidad .
En la mayoría de las aplicaciones del análisis factorial confirmatorio (AFC), se utiliza como modelo de probabilidad la suposición de que todos los síntomas son independientes. Un AFC que utiliza este modelo se denomina AFC de primer orden . Este es el método clásico de AFC, que en muchas publicaciones se considera incluso el único método de AFC. Un ejemplo de un modelo de probabilidad alternativo es la suposición de que todas las configuraciones tienen la misma probabilidad. Un AFC que utiliza este modelo se denomina AFC de orden cero .
Referencias
- ^ Lienert, GA (1969). "Die Konfigurationsfrequenzanalyse als Klassifikationsmethode in der klinischen Psychologie" [ El análisis de frecuencia configural como método de clasificación en psicología clínica ] . En Irle, M. (ed.). Bericht über den 26. Kongress der Deutschen Gesellschaft für Psychologie en Tübingen 1968 . Gotinga: Hogrefe. págs. 244-253 .
- ^ Krauth , J.; Lienert, GA (1973). KFA. Die Konfigurationsfrequenzanalyse und ihre Anwendungen in Psychologie und Medizin [ CFA. Análisis de frecuencia configural y su aplicación en psicología y medicina . Friburgo: Alber.
- ↑ Holm, S. (1979). "Un procedimiento simple de prueba múltiple de rechazo secuencial". Scandinavian Journal of Statistics . 6 (2): 65– 70. JSTOR 4615733 .
- ↑ von Eye, A. (1990). Introducción al análisis de frecuencia configuracional: La búsqueda de tipos y antitipos en clasificaciones cruzadas . Cambridge, Reino Unido: Cambridge University Press. ISBN 0521380901.
- ↑ Lautsch, E.; Weber, S. (1990). Análisis de frecuencia de configuración (KFA) . Berlín: Volk und Wissen.
- ^ Krauth, J. (1993). Einführung in die Konfigurationsfrequenzanalyse (KFA) [ Introducción al análisis de frecuencia configural (CFA) ] . Weinheim: Beltz, Psychologie Verlags Union. ISBN 3621271821.
Lecturas adicionales
- Lehmacher, W. (1981). "Un procedimiento de prueba simultánea más potente en el análisis de frecuencia configuracional". Biometrical Journal . 23 (5): 429– 436. doi : 10.1002/bimj.4710230503 .
- Schrepp, M. (2006). "El uso del análisis de frecuencia configuracional para el análisis exploratorio de datos". British Journal of Mathematical and Statistical Psychology . 59 (1): 59– 73. doi : 10.1348/000711005X66761 . PMID 16709279 .
- von Eye, A. (2002). "Las probabilidades favorecen a los antitipos: una comparación de pruebas para la identificación de tipos configuracionales y antitipos" (PDF) . Métodos de investigación psicológica . 7 (3): 1– 29.
- von Eye, A.; Rovine, MJ (1988). "Una comparación de pruebas de significancia para el análisis de frecuencia configuracional". EDP en Medicina y Biología . 19 : 6–13 .
- von Eye, A.; Spiel, C.; Wood, PK (1996). "Análisis de frecuencia configuracional en la investigación psicológica aplicada". Applied Psychology: An International Review . 45 (4): 301– 352. doi : 10.1111/j.1464-0597.1996.tb00770.x .
- von Weber, S. (2000). "Una comparación de pruebas utilizadas en CFA mediante simulación". Beiträge psicológico . 42 (3).
- Análisis exploratorio de datos