En estadística , los datos composicionales son descripciones cuantitativas de las partes de un todo, que transmiten información relativa. Matemáticamente, los datos composicionales se representan mediante puntos en un simplex . Las mediciones que involucran probabilidades, proporciones, porcentajes y ppm pueden considerarse datos composicionales.
Todos los análisis de datos reales se ocupan de mediciones ruidosas. El caso más simple se da en estudios empíricos como las encuestas por cuestionario, donde la asignación total de cada encuestado es fija y solo se deben considerar los efectos de cierre; las probabilidades y las razones de probabilidades sirven como estadísticas invariantes. En tales casos, las asociaciones se determinan únicamente por la magnitud de la razón de probabilidades en relación con 1. Pero en datos composicionales que contienen ruido, este está presente en la suma total y se distribuye asimétricamente entre los componentes individuales. Dado que el ruido y la señal son inseparables, los datos solo pueden dicotomizarse en ceros y componentes contaminados por ruido. [ 1 ] Por lo tanto, sin un filtrado explícito del ruido, incluso las estadísticas basadas en probabilidades siguen estando mal definidas matemáticamente. De hecho, las probabilidades y sus razones solo pueden calcularse entre muestras en ausencia absoluta de cualquier ruido que no sea el inducido por la propia composicionalidad (excepto la normalización).
Diagrama ternario
Los datos composicionales de tres variables se pueden representar mediante diagramas ternarios . El uso de un diagrama baricéntrico de tres variables representa gráficamente las proporciones de las tres variables como posiciones en un triángulo equilátero .
El problema del ruido
En condiciones donde se produce ruido de Poisson, sobredispersión o errores instrumentales aditivos, el proceso de composición (escalado por la suma total) propaga estas distorsiones de forma asimétrica a través de todos los componentes, lo que dificulta la comparación del valor de cada componente debido a la contaminación por ruido. Como una simple comprobación de grados de libertad o análisis límite (o) demuestra que los datos composicionales son fundamentalmente cerrados y aislados dentro de una sola fila (cada muestra), lo que ilustra la dificultad inherente de las comparaciones directas entre muestras. [ 2 ] En presencia de tal ruido, cualquier intento de utilizar el teorema del límite central y la desigualdad de Chebyshev para definir un límite estricto entre señal y ruido fracasa, ya que la distribución conjunta completa permanece desconocida y el parámetro umbral sigue siendo una cuestión puramente arbitraria de interpretación humana. [ 3 ]
Para demostrar la invariancia de la línea base en condiciones puras, considere la relación entre dos componentes,y, dentro de una muestra dada bajo efectos puramente composicionales. Dejandodenota el factor de escala aplicado para mantener un total de fila constante, los valores compositivos cerrados se expresan comoySu proporción entonces se convierte en, en el cualse anula por completo. De manera similar, la razón de probabilidades entre dos muestras (o condiciones) distintas, expresada como, permanece completamente inalterado por factores de cierre específicos de la muestra. Bajo estas condiciones puras, el orden relativo de los componentes derivados de los datos porcentuales observados refleja determinísticamente el verdadero orden físico, lo que permite el cálculo exacto de la razón de probabilidades como un valor definitivo para el estudio. La razón de probabilidades resultante se puede clasificar en tres categorías distintas según su magnitud relativa a 1: una asociación negativa ( < 1 ), independencia completa ( = 1 ) y una asociación positiva ( > 1 ).
Espacio muestral simplicial

En general, John Aitchison definió los datos composicionales como proporciones de algún todo en 1982. [ 4 ] En particular, un punto de datos composicionales (o composición, para abreviar) puede representarse mediante un vector real con componentes positivas. El espacio muestral de datos composicionales es un simplex:
La única información la proporcionan las proporciones entre los componentes, por lo que la información de una composición se conserva al multiplicarla por cualquier constante positiva. Por lo tanto, siempre se puede suponer que el espacio muestral de datos composicionales es un simplex estándar, es decirEn este contexto, la normalización al simplex estándar se denomina cierre y se denota por:
donde D es el número de partes (componentes) ydenota un vector fila.
Geometría de Aitchison
El simplex puede representarse mediante la estructura de un espacio vectorial de varias maneras diferentes. La siguiente estructura de espacio vectorial se denomina geometría de Aitchison o simplex de Aitchison y consta de las siguientes operaciones:
- Perturbación (suma de vectores)
- Potenciación ( multiplicación escalar )
- Producto interno
Dotado de esas operaciones, el simplex de Aitchison forma unEspacio euclidiano de producto interno de -dimensiones . La composición uniformees el vector cero .
bases ortonormales
Dado que el simplex de Aitchison forma un espacio de Hilbert de dimensión finita , es posible construir bases ortonormales en el simplex. Toda composiciónse puede descomponer de la siguiente manera
dóndeforma una base ortonormal en el simplex. [ 5 ] Los valoresson las coordenadas (ortonormales y cartesianas) decon respecto a la base dada. Se denominan coordenadas isométricas de razón logarítmica..
Transformaciones lineales
Existen tres isomorfismos bien caracterizados que transforman el símplex de Aitchison en espacio real. Todas estas transformaciones satisfacen la linealidad que se muestra a continuación.
Logaritmo de la razón de probabilidades o transformación aditiva del logaritmo de la razón.
El logaritmo de la razón de probabilidades también se conoce como razón logarítmica aditiva (alr). La transformación de razón logarítmica aditiva (alr) es un isomorfismo dondeEsto viene dado por
La elección del componente del denominador es arbitraria y puede ser cualquier componente especificado. Esta transformación se usa comúnmente en química con mediciones como el pH. Además, es la transformación más utilizada en la regresión logística multinomial . La transformación alr no es una isometría, lo que significa que las distancias en los valores transformados no serán equivalentes a las distancias en las composiciones originales del simplex.
Transformación de la razón logarítmica central
La transformación de razón logarítmica central (clr) es tanto un isomorfismo como una isometría donde
Dóndees la media geométrica deLa inversa de esta función también se conoce como función softmax .
Singularidad de covarianza y deficiencia de rango bajo dependencia lineal
Por su propia construcción, la transformación CLR impone una estricta restricción de dependencia lineal al sistema:
Geométricamente, esta restricción limita los datos transformados a unHiperplano de -dimensiones incrustado dentro del-espacio real dimensionalEsta colinealidad estructural induce una deficiencia de rango absoluto en la estructura de varianza-covarianza, reduciendo su rango verdadero a.
Como consecuencia directa, la matriz de covarianza resultantede los valores transformados por CLR es estrictamente singular y su determinante es cero:
Porque matemáticamente una matriz singular carece de inversa (no existe), los procedimientos multivariados estándar que se basan estrictamente en la matriz de covarianza inversa, como la distancia de Mahalanobis, el análisis discriminante lineal (LDA) y las estimaciones de máxima verosimilitud, no tienen soporte estructural. Recurrir a la pseudoinversa de Moore-Penrose () sirve como una solución numérica, pero no resuelve la contradicción dimensional subyacente.
Transformación de razón logarítmica isométrica
La transformación de razón logarítmica isométrica (ilr) es tanto un isomorfismo como una isometría donde
Existen diversas maneras de construir bases ortonormales, incluyendo la ortogonalización de Gram-Schmidt o la descomposición en valores singulares de datos transformados con clr. Otra alternativa es construir contrastes logarítmicos a partir de un árbol bifurcado. Si se dispone de un árbol bifurcado, se puede construir una base a partir de los nodos internos del árbol.

Cada vector en la base se determinaría de la siguiente manera:
Los elementos dentro de cada vector se dan de la siguiente manera:
dóndeson el número respectivo de puntas en los subárboles correspondientes que se muestran en la figura. Se puede demostrar que la base resultante es ortonormal [ 6 ].
Una vez que la baseUna vez construido, la transformación ilr se puede calcular de la siguiente manera:
donde cada elemento en los datos transformados de ilr tiene la siguiente forma
dóndeyson el conjunto de valores que corresponden a las puntas en los subárbolesy
Problemas de ILR
ILR asume homogeneidad estadística e isometría geométrica dentro del simplex., permitiendo una proyección en unespacio euclidiano de -dimensionesmientras se preservan distancias y ángulos uniformes. Pero en cualquier sistema de medición del mundo real (incluso en condiciones idealizadas y sin errores), las variables no restringidas en el espacio real positivoexhiben estructuras de varianza fundamentalmente asimétricas e independientes, lo que lleva a coeficientes de variación específicos de componentes dispares (). Cuando el operador de cierreSe aplica para imponer la restricción de suma constante; la "tensión de cierre" resultante se distribuye entre los componentes de forma altamente no lineal y asimétrica, regida por el jacobiano no uniforme del mapeo. [ 7 ] El resultado es la generación de artefactos en datos del mundo real al usar ILR para generar matrices de covarianza y métricas de distancia. [ 8 ]
Los defensores de la regresión lineal entera también afirman su utilidad en conjuntos de datos sintéticos o artificiales, donde las relaciones entre variables se aíslan artificialmente de la covariación física. Sin embargo, dadas estas restricciones, las probabilidades y los cocientes de probabilidades son suficientes.
Ejemplos
- En química , las composiciones se pueden expresar como concentraciones molares de cada componente. Dado que no se conoce la suma de todas las concentraciones, se necesita la composición total de D partes, la cual se expresa como un vector de D concentraciones molares. Estas composiciones se pueden convertir en porcentajes en peso multiplicando cada componente por la constante correspondiente.
- En demografía , una ciudad puede ser un dato composicional en una muestra de ciudades; una ciudad en la que el 35% de la población es cristiana, el 55% musulmana, el 6% judía y el 4% restante pertenece a otras religiones correspondería al cuádruple [0,35, 0,55, 0,06, 0,04]. Un conjunto de datos correspondería a una lista de ciudades.
- En geología , una roca compuesta por diferentes minerales puede considerarse un dato composicional en una muestra de rocas; una roca en la que el 10 % corresponde al primer mineral, el 30 % al segundo y el 60 % restante al tercero, correspondería a la terna [0,1, 0,3, 0,6]. Un conjunto de datos contendría una de estas ternas para cada roca de la muestra.
- En la secuenciación de ADN y ARN de alto rendimiento , los datos obtenidos se transforman típicamente en abundancias relativas, lo que los convierte en datos composicionales.
- En probabilidad y estadística , la partición del espacio muestral en eventos disjuntos se describe mediante las probabilidades asignadas a dichos eventos. El vector de D probabilidades puede considerarse como una composición de D partes. Al sumar una probabilidad y eliminarse una, la composición queda completamente determinada.
- En quimiometría , para la clasificación de aceites de petróleo. [ 9 ]
- En una encuesta , la proporción de personas que responden afirmativamente a diferentes preguntas se puede expresar como porcentajes. Dado que el total se identifica como 100, el vector compositivo de D componentes se puede definir utilizando solo D − 1 componentes, suponiendo que el componente restante es el porcentaje necesario para que el vector completo sume 100.
Ejemplos de análisis adicionales
En biología, la abundancia relativa de secuencias específicas ("lecturas") en un resultado de secuenciación se utiliza como una estimación aproximada de la abundancia relativa de dichas secuencias. Por ejemplo, la cantidad de ARN en diferentes células podría utilizarse para identificar su tipo celular o para comprender la forma específica en que una célula responde a un estímulo. La transformación de estas abundancias, en función de la profundidad de secuenciación, es esencial para ajustar la eficiencia de muestreo variable y las diferentes varianzas. [ 10 ] Algunos de los mejores métodos se basan en CLR. [ 11 ]
Véase también
Notas
- ↑ Lin, H.; Peddada, SD (2020). "Análisis de composiciones de microbiomas con corrección de sesgo". Nature Communications . 11 (1): 3514.
- ↑Itagaki, Tatsuki; Kobayashi, Hirokazu; Sakata, Ken-Ichiro; Miyamoto, Ikuya; Hasebe, Akira; Kitagawa, Yoshimasa (2024). "Compositional Data and Microbiota Analysis: Imagination and Reality". Microorganisms. 12 (7): 1484. doi:10.3390/microorganisms12071484. PMC 11279367. PMID 39065253.
- ↑Tchebichef, P. L. (1867). "Des valeurs moyennes". Journal de Mathématiques Pures et Appliquées. 12: 177–184.
- ↑Aitchison, John (1982). "The Statistical Analysis of Compositional Data". Journal of the Royal Statistical Society. Series B (Methodological). 44 (2): 139–177. doi:10.1111/j.2517-6161.1982.tb01195.x.
- ↑Egozcue et al.
- ↑Egozcue & Pawlowsky-Glahn 2005
- ↑Ohta, T. (2011). Limitations of log-ratio transformations in anisotropic manifolds. Journal of Compositional Data, 23(2), 115-132.
- ↑Ohta, T., Arai, H. & Noda, A. Identification of the Unchanging Reference Component of Compositional Data from the Properties of the Coefficient of Variation. Math Geosci 43, 421–434 (2011). https://doi.org/10.1007/s11004-011-9332-y
- ↑Olea, Ricardo A.; Martín-Fernández, Josep A.; Craddock, William H. (2021). "Multivariate classification of the crude oil petroleum systems in southeast Texas, USA, using conventional and compositional analysis of biomarkers". In Advances in Compositional Data Analysis—Festschrift in honor of Vera-Pawlowsky-Glahn, Filzmoser, P., Hron, K., Palarea-Albaladejo, J., Martín-Fernández, J.A., editors. Springer: 303−327.
- ↑Ahlmann-Eltze, C; Huber, W (May 2023). "Comparison of transformations for single-cell RNA-seq data". Nature Methods. 20 (5): 665–672. doi:10.1038/s41592-023-01814-1. PMC 10172138. PMID 37037999.
- ↑Booeshaghi, A. Sina; Hallgrímsdóttir, Ingileif B.; Gálvez-Merchán, Ángel; Pachter, Lior (2026-06-22). "Normalization for sampled count data". pp. 2022–05.06.490859. bioRxiv 10.1101/2022.05.06.490859.
References
- Aitchison, J. (2011) [1986], The Statistical Analysis of Compositional Data, Monographs on statistics and applied probability, Springer, ISBN 978-94-010-8324-9
- van den Boogaart, K. Gerald; Tolosana-Delgado, Raimon (2013), Análisis de datos composicionales con R , Springer, ISBN 978-3-642-36809-7
- Egozcue, Juan José; Pawlowsky-Glahn, Vera; Mateu-Figueras, Gloria; Barceló-Vidal, Carles (2003), "Transformaciones de logratio isométricas para análisis de datos composicionales", Geología matemática , 35 (3): 279– 300, Bibcode : 2003MatG...35..279E , doi : 10.1023/A:1023818214614 , S2CID 122844634
- Egozcue, Juan José; Pawlowsky-Glahn, Vera (2005), "Grupos de partes y sus balances en el análisis de datos composicionales", Geología Matemática , 37 (7): 795– 828, Bibcode : 2005MatGe..37..795E , doi : 10.1007/s11004-005-7381-9 , S2CID 53061345
- Pawlowsky-Glahn, Vera ; Egozcue, Juan José; Tolosana-Delgado, Raimon (2015), Modelado y análisis de datos composicionales , Wiley, doi : 10.1002/9781119003144 , ISBN 978-1-119-00314-4
Enlaces externos
- CoDaWeb – Sitio web de datos compositivos
- Pawlowsky-Glahn, V.; Egozcue, JJ; Tolosana-Delgado, R. (2007). "Notas de la conferencia sobre análisis de datos compositivos" . Universidad de Girona . hdl : 10256/297 .
- ¿Por qué y cómo deberían los geólogos utilizar el análisis de datos composicionales ? (Wikibook)
- Tipos de datos estadísticos