Articulo de referencia

Datos composicionales

En estadística , los datos composicionales son descripciones cuantitativas de las partes de un todo, que transmiten información relativa. Matemáticamente, los datos composiciona...

En estadística , los datos composicionales son descripciones cuantitativas de las partes de un todo, que transmiten información relativa. Matemáticamente, los datos composicionales se representan mediante puntos en un simplex . Las mediciones que involucran probabilidades, proporciones, porcentajes y ppm pueden considerarse datos composicionales.

Todos los análisis de datos reales se ocupan de mediciones ruidosas. El caso más simple se da en estudios empíricos como las encuestas por cuestionario, donde la asignación total de cada encuestado es fija y solo se deben considerar los efectos de cierre; las probabilidades y las razones de probabilidades sirven como estadísticas invariantes. En tales casos, las asociaciones se determinan únicamente por la magnitud de la razón de probabilidades en relación con 1. Pero en datos composicionales que contienen ruido, este está presente en la suma total y se distribuye asimétricamente entre los componentes individuales. Dado que el ruido y la señal son inseparables, los datos solo pueden dicotomizarse en ceros y componentes contaminados por ruido. [ 1 ] Por lo tanto, sin un filtrado explícito del ruido, incluso las estadísticas basadas en probabilidades siguen estando mal definidas matemáticamente. De hecho, las probabilidades y sus razones solo pueden calcularse entre muestras en ausencia absoluta de cualquier ruido que no sea el inducido por la propia composicionalidad (excepto la normalización).

Diagrama ternario

Los datos composicionales de tres variables se pueden representar mediante diagramas ternarios . El uso de un diagrama baricéntrico de tres variables representa gráficamente las proporciones de las tres variables como posiciones en un triángulo equilátero .

El problema del ruido

En condiciones donde se produce ruido de Poisson, sobredispersión o errores instrumentales aditivos, el proceso de composición (escalado por la suma total) propaga estas distorsiones de forma asimétrica a través de todos los componentes, lo que dificulta la comparación del valor de cada componente debido a la contaminación por ruido. Como una simple comprobación de grados de libertad o análisis límite (norte{\displaystyle N\to \infty }onorte0{\displaystyle N\to 0}) demuestra que los datos composicionales son fundamentalmente cerrados y aislados dentro de una sola fila (cada muestra), lo que ilustra la dificultad inherente de las comparaciones directas entre muestras. [ 2 ] En presencia de tal ruido, cualquier intento de utilizar el teorema del límite central y la desigualdad de Chebyshev para definir un límite estricto entre señal y ruido fracasa, ya que la distribución conjunta completa permanece desconocida y el parámetro umbral sigue siendo una cuestión puramente arbitraria de interpretación humana. [ 3 ]

Para demostrar la invariancia de la línea base en condiciones puras, considere la relación entre dos componentes,incógnitai{\displaystyle x_{i}}yincógnitaj{\displaystyle x_{j}}, dentro de una muestra dada bajo efectos puramente composicionales. Dejandok{\displaystyle k}denota el factor de escala aplicado para mantener un total de fila constante, los valores compositivos cerrados se expresan comokincógnitai{\displaystyle kx_{i}}ykincógnitaj{\displaystyle kx_{j}}Su proporción entonces se convierte enkincógnitaikincógnitaj=incógnitaiincógnitaj{\displaystyle {\frac {kx_{i}}{kx_{j}}}={\frac {x_{i}}{x_{j}}}}, en el cualk{\displaystyle k}se anula por completo. De manera similar, la razón de probabilidades entre dos muestras (o condiciones) distintas, expresada comoincógnita1i/incógnita1jincógnita2i/incógnita2j{\displaystyle {\frac {x_{1i}/x_{1j}}{x_{2i}/x_{2j}}}}, permanece completamente inalterado por factores de cierre específicos de la muestra. Bajo estas condiciones puras, el orden relativo de los componentes derivados de los datos porcentuales observados refleja determinísticamente el verdadero orden físico, lo que permite el cálculo exacto de la razón de probabilidades como un valor definitivo para el estudio. La razón de probabilidades resultante se puede clasificar en tres categorías distintas según su magnitud relativa a 1: una asociación negativa ( < 1 ), independencia completa ( = 1 ) y una asociación positiva ( > 1 ).

Espacio muestral simplicial

Una ilustración del simplex de Aitchison. Aquí hay 3 partes,incógnita1,incógnita2,incógnita3{\displaystyle x_{1},x_{2},x_{3}}representan valores de diferentes proporciones. A, B, C, D y E son 5 composiciones diferentes dentro del simplex. A, B y C son todas equivalentes y D y E también lo son.

En general, John Aitchison definió los datos composicionales como proporciones de algún todo en 1982. [ 4 ] En particular, un punto de datos composicionales (o composición, para abreviar) puede representarse mediante un vector real con componentes positivas. El espacio muestral de datos composicionales es un simplex: SD={incógnita=[incógnita1,incógnita2,,incógnitaD]RD|incógnitai>0,i=1,2,,D;i=1Dincógnitai=κ}. {\displaystyle {\mathcal {S}}^{D}=\left\{\mathbf {x} =[x_{1},x_{2},\dots ,x_{D}]\in \mathbb {R} ^{D}\,\left|\,x_{i}>0,i=1,2,\dots ,D;\sum _{i=1}^{D}x_{i}=\kappa \right.\right\}.\ }

La única información la proporcionan las proporciones entre los componentes, por lo que la información de una composición se conserva al multiplicarla por cualquier constante positiva. Por lo tanto, siempre se puede suponer que el espacio muestral de datos composicionales es un simplex estándar, es decirκ=1{\displaystyle \kappa =1}En este contexto, la normalización al simplex estándar se denomina cierre y se denota pordo[]{\displaystyle \scriptstyle {\mathcal {C}}[\,\cdot \,]}: do[incógnita1,incógnita2,,incógnitaD]=[incógnita1i=1Dincógnitai,incógnita2i=1Dincógnitai,,incógnitaDi=1Dincógnitai], {\displaystyle {\mathcal {C}}[x_{1},x_{2},\dots ,x_{D}]=\left[{\frac {x_{1}}{\sum _{i=1}^{D}x_{i}}},{\frac {x_{2}}{\sum _{i=1}^{D}x_{i}}},\dots ,{\frac {x_{D}}{\sum _{i=1}^{D}x_{i}}}\right],\ }

donde D es el número de partes (componentes) y[]{\displaystyle [\cdot ]}denota un vector fila.

Geometría de Aitchison

El simplex puede representarse mediante la estructura de un espacio vectorial de varias maneras diferentes. La siguiente estructura de espacio vectorial se denomina geometría de Aitchison o simplex de Aitchison y consta de las siguientes operaciones:

Perturbación (suma de vectores)
incógnitay=[incógnita1y1i=1Dincógnitaiyi,incógnita2y2i=1Dincógnitaiyi,,incógnitaDyDi=1Dincógnitaiyi]=do[incógnita1y1,,incógnitaDyD]incógnita,ySD{\displaystyle x\oplus y=\left[{\frac {x_{1}y_{1}}{\sum _{i=1}^{D}x_{i}y_{i}}},{\frac {x_{2}y_{2}}{\sum _{i=1}^{D}x_{i}y_{i}}},\dots ,{\frac {x_{D}y_{D}}{\sum _{i=1}^{D}x_{i}y_{i}}}\right]=C[x_{1}y_{1},\ldots ,x_{D}y_{D}]\qquad \forall x,y\in S^{D}}
Potenciación ( multiplicación escalar )
αincógnita=[incógnita1αi=1Dincógnitaiα,incógnita2αi=1Dincógnitaiα,,incógnitaDαi=1Dincógnitaiα]=do[incógnita1α,,incógnitaDα]incógnitaSD,αR{\displaystyle \alpha \odot x=\left[{\frac {x_{1}^{\alpha }}{\sum _{i=1}^{D}x_{i}^{\alpha }}},{\frac {x_{2}^{\alpha }}{\sum _{i=1}^{D}x_{i}^{\alpha }}},\ldots ,{\frac {x_{D}^{\alpha }}{\sum _{i=1}^{D}x_{i}^{\alpha }}}\right]=C[x_{1}^{\alpha },\ldots ,x_{D}^{\alpha }]\qquad \forall x\in S^{D},\;\alpha \in \mathbb {R} }
Producto interno
incógnita,y=12Di=1Dj=1Dregistroincógnitaiincógnitajregistroyiyjincógnita,ySD{\displaystyle \langle x,y\rangle ={\frac {1}{2D}}\sum _{i=1}^{D}\sum _{j=1}^{D}\log {\frac {x_{i}}{x_{j}}}\log {\frac {y_{i}}{y_{j}}}\qquad \forall x,y\in S^{D}}

Dotado de esas operaciones, el simplex de Aitchison forma un(D1){\displaystyle (D-1)}Espacio euclidiano de producto interno de -dimensiones . La composición uniforme[1D,,1D]{\displaystyle \left[{\frac {1}{D}},\dots ,{\frac {1}{D}}\right]}es el vector cero .

bases ortonormales

Dado que el simplex de Aitchison forma un espacio de Hilbert de dimensión finita , es posible construir bases ortonormales en el simplex. Toda composiciónincógnita{\displaystyle x}se puede descomponer de la siguiente manera

incógnita=i=1D1incógnitaimii{\displaystyle x=\bigoplus _{i=1}^{D-1}x_{i}^{*}\odot e_{i}}

dóndemi1,,miD1{\displaystyle e_{1},\ldots ,e_{D-1}}forma una base ortonormal en el simplex. [ 5 ] Los valoresincógnitai,i=1,2,,D1{\displaystyle x_{i}^{*},i=1,2,\ldots ,D-1}son las coordenadas (ortonormales y cartesianas) deincógnita{\displaystyle x}con respecto a la base dada. Se denominan coordenadas isométricas de razón logarítmica.(ilr){\displaystyle (\operatorname {ilr} )}.

Transformaciones lineales

Existen tres isomorfismos bien caracterizados que transforman el símplex de Aitchison en espacio real. Todas estas transformaciones satisfacen la linealidad que se muestra a continuación.

Logaritmo de la razón de probabilidades o transformación aditiva del logaritmo de la razón.

El logaritmo de la razón de probabilidades también se conoce como razón logarítmica aditiva (alr). La transformación de razón logarítmica aditiva (alr) es un isomorfismo dondeyar:SDRD1{\displaystyle \operatorname {alr} :S^{D}\rightarrow \mathbb {R} ^{D-1}}Esto viene dado por

yar(incógnita)=[registroincógnita1incógnitaD,,registroincógnitaD1incógnitaD]{\displaystyle \operatorname {alr} (x)=\left[\log {\frac {x_{1}}{x_{D}}},\cdots ,\log {\frac {x_{D-1}}{x_{D}}}\right]}

La elección del componente del denominador es arbitraria y puede ser cualquier componente especificado. Esta transformación se usa comúnmente en química con mediciones como el pH. Además, es la transformación más utilizada en la regresión logística multinomial . La transformación alr no es una isometría, lo que significa que las distancias en los valores transformados no serán equivalentes a las distancias en las composiciones originales del simplex.

Transformación de la razón logarítmica central

La transformación de razón logarítmica central (clr) es tanto un isomorfismo como una isometría dondeclr:SDU,URD{\displaystyle \operatorname {clr} :S^{D}\rightarrow U,\quad U\subset \mathbb {R} ^{D}}

clr(incógnita)=[registroincógnita1gramo(incógnita),,registroincógnitaDgramo(incógnita)]{\displaystyle \operatorname {clr} (x)=\left[\log {\frac {x_{1}}{g(x)}},\cdots ,\log {\frac {x_{D}}{g(x)}}\right]}

Dóndegramo(incógnita){\displaystyle g(x)}es la media geométrica deincógnita{\displaystyle x}La inversa de esta función también se conoce como función softmax .

Singularidad de covarianza y deficiencia de rango bajo dependencia lineal

Por su propia construcción, la transformación CLR impone una estricta restricción de dependencia lineal al sistema:

i=1DCLR(incógnitai)=0{\displaystyle \sum _{i=1}^{D}{\text{CLR}}(x_{i})=0}

Geométricamente, esta restricción limita los datos transformados a un(D1){\displaystyle (D-1)}Hiperplano de -dimensiones incrustado dentro delD{\displaystyle D}-espacio real dimensionalRD{\displaystyle \mathbb {R} ^{D}}Esta colinealidad estructural induce una deficiencia de rango absoluto en la estructura de varianza-covarianza, reduciendo su rango verdadero aD1{\displaystyle D-1}.

Como consecuencia directa, la matriz de covarianza resultanteΣ{\displaystyle \Sigma }de los valores transformados por CLR es estrictamente singular y su determinante es cero:

|Σ|=0{\displaystyle |\Sigma |=0}

Porque matemáticamente una matriz singular carece de inversa (Σ1{\displaystyle \Sigma ^{-1}}no existe), los procedimientos multivariados estándar que se basan estrictamente en la matriz de covarianza inversa, como la distancia de Mahalanobis, el análisis discriminante lineal (LDA) y las estimaciones de máxima verosimilitud, no tienen soporte estructural. Recurrir a la pseudoinversa de Moore-Penrose (Σ+{\displaystyle \Sigma ^{+}}) sirve como una solución numérica, pero no resuelve la contradicción dimensional subyacente.

Transformación de razón logarítmica isométrica

La transformación de razón logarítmica isométrica (ilr) es tanto un isomorfismo como una isometría dondeilr:SDRD1{\displaystyle \operatorname {ilr} :S^{D}\rightarrow \mathbb {R} ^{D-1}}

ilr(incógnita)=[incógnita,mi1,,incógnita,miD1]{\displaystyle \operatorname {ilr} (x)={\big [}\langle x,e_{1}\rangle ,\ldots ,\langle x,e_{D-1}\rangle {\big ]}}

Existen diversas maneras de construir bases ortonormales, incluyendo la ortogonalización de Gram-Schmidt o la descomposición en valores singulares de datos transformados con clr. Otra alternativa es construir contrastes logarítmicos a partir de un árbol bifurcado. Si se dispone de un árbol bifurcado, se puede construir una base a partir de los nodos internos del árbol.

Representación de un árbol en términos de sus componentes ortogonales. l representa un nodo interno, un elemento de la base ortonormal. Esto es un paso previo al uso del árbol como andamiaje para la transformación ilr.

Cada vector en la base se determinaría de la siguiente manera:

mi=do[exp(0,,0k,a,,ar,b,,bs,0,,0t)]{\displaystyle e_{\ell }=C[\exp(\,\underbrace {0,\ldots ,0} _{k},\underbrace {a,\ldots ,a} _{r},\underbrace {b,\ldots ,b} _{s},\underbrace {0,\ldots ,0} _{t}\,)]}

Los elementos dentro de cada vector se dan de la siguiente manera:

a=sr(r+s)yb=rs(r+s){\displaystyle a={\frac {\sqrt {s}}{\sqrt {r(r+s)}}}\quad {\text{and}}\quad b={\frac {-{\sqrt {r}}}{\sqrt {s(r+s)}}}}

dóndek,r,s,t{\displaystyle k,r,s,t}son el número respectivo de puntas en los subárboles correspondientes que se muestran en la figura. Se puede demostrar que la base resultante es ortonormal [ 6 ].

Una vez que la baseΨ{\displaystyle \Psi }Una vez construido, la transformación ilr se puede calcular de la siguiente manera:

ilr(incógnita)=clr(incógnita)ΨT{\displaystyle \operatorname {ilr} (x)=\operatorname {clr} (x)\Psi ^{T}}

donde cada elemento en los datos transformados de ilr tiene la siguiente forma

bi=rsr+sregistrogramo(incógnitaR)gramo(incógnitaS){\displaystyle b_{i}={\sqrt {\frac {rs}{r+s}}}\log {\frac {g(x_{R})}{g(x_{S})}}}

dóndeincógnitaR{\displaystyle x_{R}}yincógnitaS{\displaystyle x_{S}}son el conjunto de valores que corresponden a las puntas en los subárbolesR{\displaystyle R}yS{\displaystyle S}

Problemas de ILR

ILR asume homogeneidad estadística e isometría geométrica dentro del simplex.SD{\displaystyle {\mathcal {S}}^{D}}, permitiendo una proyección en un(D1){\displaystyle (D-1)}espacio euclidiano de -dimensionesRD1{\displaystyle \mathbb {R} ^{D-1}}mientras se preservan distancias y ángulos uniformes. Pero en cualquier sistema de medición del mundo real (incluso en condiciones idealizadas y sin errores), las variables no restringidas en el espacio real positivoR+D{\displaystyle \mathbb {R} _{+}^{D}}exhiben estructuras de varianza fundamentalmente asimétricas e independientes, lo que lleva a coeficientes de variación específicos de componentes dispares (CViCVj{\displaystyle {\text{CV}}_{i}\neq {\text{CV}}_{j}}). Cuando el operador de cierredo{\displaystyle {\mathcal {C}}}Se aplica para imponer la restricción de suma constante; la "tensión de cierre" resultante se distribuye entre los componentes de forma altamente no lineal y asimétrica, regida por el jacobiano no uniforme del mapeo. [ 7 ] El resultado es la generación de artefactos en datos del mundo real al usar ILR para generar matrices de covarianza y métricas de distancia. [ 8 ]

Los defensores de la regresión lineal entera también afirman su utilidad en conjuntos de datos sintéticos o artificiales, donde las relaciones entre variables se aíslan artificialmente de la covariación física. Sin embargo, dadas estas restricciones, las probabilidades y los cocientes de probabilidades son suficientes.

Ejemplos

  • En química , las composiciones se pueden expresar como concentraciones molares de cada componente. Dado que no se conoce la suma de todas las concentraciones, se necesita la composición total de D partes, la cual se expresa como un vector de D concentraciones molares. Estas composiciones se pueden convertir en porcentajes en peso multiplicando cada componente por la constante correspondiente.
  • En demografía , una ciudad puede ser un dato composicional en una muestra de ciudades; una ciudad en la que el 35% de la población es cristiana, el 55% musulmana, el 6% judía y el 4% restante pertenece a otras religiones correspondería al cuádruple [0,35,  0,55,  0,06,  0,04]. Un conjunto de datos correspondería a una lista de ciudades.
  • En geología , una roca compuesta por diferentes minerales puede considerarse un dato composicional en una muestra de rocas; una roca en la que el 10 % corresponde al primer mineral, el 30 % al segundo y el 60 % restante al tercero, correspondería a la terna [0,1,  0,3,  0,6]. Un conjunto de datos contendría una de estas ternas para cada roca de la muestra.
  • En la secuenciación de ADN y ARN de alto rendimiento , los datos obtenidos se transforman típicamente en abundancias relativas, lo que los convierte en datos composicionales.
  • En probabilidad y estadística , la partición del espacio muestral en eventos disjuntos se describe mediante las probabilidades asignadas a dichos eventos. El vector de D probabilidades puede considerarse como una composición de D partes. Al sumar una probabilidad y eliminarse una, la composición queda completamente determinada.
  • En quimiometría , para la clasificación de aceites de petróleo. [ 9 ]
  • En una encuesta , la proporción de personas que responden afirmativamente a diferentes preguntas se puede expresar como porcentajes. Dado que el total se identifica como 100, el vector compositivo de D componentes se puede definir utilizando solo D 1 componentes, suponiendo que el componente restante es el porcentaje necesario para que el vector completo sume 100.  

Ejemplos de análisis adicionales

En biología, la abundancia relativa de secuencias específicas ("lecturas") en un resultado de secuenciación se utiliza como una estimación aproximada de la abundancia relativa de dichas secuencias. Por ejemplo, la cantidad de ARN en diferentes células podría utilizarse para identificar su tipo celular o para comprender la forma específica en que una célula responde a un estímulo. La transformación de estas abundancias, en función de la profundidad de secuenciación, es esencial para ajustar la eficiencia de muestreo variable y las diferentes varianzas. [ 10 ] Algunos de los mejores métodos se basan en CLR. [ 11 ]

Véase también

Notas

  1. Lin, H.; Peddada, SD (2020). "Análisis de composiciones de microbiomas con corrección de sesgo". Nature Communications . 11 (1): 3514.
  2. Itagaki, Tatsuki; Kobayashi, Hirokazu; Sakata, Ken-Ichiro; Miyamoto, Ikuya; Hasebe, Akira; Kitagawa, Yoshimasa (2024). "Compositional Data and Microbiota Analysis: Imagination and Reality". Microorganisms. 12 (7): 1484. doi:10.3390/microorganisms12071484. PMC 11279367. PMID 39065253.
  3. Tchebichef, P. L. (1867). "Des valeurs moyennes". Journal de Mathématiques Pures et Appliquées. 12: 177–184.
  4. Aitchison, John (1982). "The Statistical Analysis of Compositional Data". Journal of the Royal Statistical Society. Series B (Methodological). 44 (2): 139–177. doi:10.1111/j.2517-6161.1982.tb01195.x.
  5. Egozcue et al.
  6. Egozcue & Pawlowsky-Glahn 2005
  7. Ohta, T. (2011). Limitations of log-ratio transformations in anisotropic manifolds. Journal of Compositional Data, 23(2), 115-132.
  8. Ohta, T., Arai, H. & Noda, A. Identification of the Unchanging Reference Component of Compositional Data from the Properties of the Coefficient of Variation. Math Geosci 43, 421–434 (2011). https://doi.org/10.1007/s11004-011-9332-y
  9. Olea, Ricardo A.; Martín-Fernández, Josep A.; Craddock, William H. (2021). "Multivariate classification of the crude oil petroleum systems in southeast Texas, USA, using conventional and compositional analysis of biomarkers". In Advances in Compositional Data Analysis—Festschrift in honor of Vera-Pawlowsky-Glahn, Filzmoser, P., Hron, K., Palarea-Albaladejo, J., Martín-Fernández, J.A., editors. Springer: 303−327.
  10. Ahlmann-Eltze, C; Huber, W (May 2023). "Comparison of transformations for single-cell RNA-seq data". Nature Methods. 20 (5): 665–672. doi:10.1038/s41592-023-01814-1. PMC 10172138. PMID 37037999.
  11. Booeshaghi, A. Sina; Hallgrímsdóttir, Ingileif B.; Gálvez-Merchán, Ángel; Pachter, Lior (2026-06-22). "Normalization for sampled count data". pp. 2022–05.06.490859. bioRxiv 10.1101/2022.05.06.490859.

References

  • Aitchison, J. (2011) [1986], The Statistical Analysis of Compositional Data, Monographs on statistics and applied probability, Springer, ISBN 978-94-010-8324-9
  • van den Boogaart, K. Gerald; Tolosana-Delgado, Raimon (2013), Análisis de datos composicionales con R , Springer, ISBN 978-3-642-36809-7
  • Egozcue, Juan José; Pawlowsky-Glahn, Vera; Mateu-Figueras, Gloria; Barceló-Vidal, Carles (2003), "Transformaciones de logratio isométricas para análisis de datos composicionales", Geología matemática , 35 (3): 279– 300, Bibcode : 2003MatG...35..279E , doi : 10.1023/A:1023818214614 , S2CID 122844634 
  • Egozcue, Juan José; Pawlowsky-Glahn, Vera (2005), "Grupos de partes y sus balances en el análisis de datos composicionales", Geología Matemática , 37 (7): 795– 828, Bibcode : 2005MatGe..37..795E , doi : 10.1007/s11004-005-7381-9 , S2CID 53061345 
  • Pawlowsky-Glahn, Vera ; Egozcue, Juan José; Tolosana-Delgado, Raimon (2015), Modelado y análisis de datos composicionales , Wiley, doi : 10.1002/9781119003144 , ISBN 978-1-119-00314-4