Articulo de referencia

Inferencia de trayectoria

Inferencia de trayectorias tal como se implementa en Slingshot para (a) un conjunto de datos bidimensionales simulados y (b) un conjunto de datos de secuenciación de ARN de célu...

Inferencia de trayectorias tal como se implementa en Slingshot para (a) un conjunto de datos bidimensionales simulados y (b) un conjunto de datos de secuenciación de ARN de células individuales del epitelio olfativo .

La inferencia de trayectorias o el ordenamiento pseudotemporal es una técnica computacional utilizada en la transcriptómica de células individuales para determinar el patrón de un proceso dinámico experimentado por las células y luego organizarlas según su progresión a través de dicho proceso. Los protocolos de células individuales presentan niveles de ruido mucho mayores que la secuenciación de ARN masiva (RNA-seq ) [ 1 ] , por lo que un paso común en un flujo de trabajo de transcriptómica de células individuales es la agrupación de células en subgrupos [ 2 ] . La agrupación puede lidiar con esta variación inherente al combinar la señal de muchas células, al tiempo que permite la identificación de tipos celulares [ 3 ] . Sin embargo, algunas diferencias en la expresión génica entre células son el resultado de procesos dinámicos como el ciclo celular , la diferenciación celular o la respuesta a un estímulo externo. La inferencia de trayectorias busca caracterizar dichas diferencias colocando las células a lo largo de una ruta continua que representa la evolución del proceso, en lugar de dividirlas en grupos discretos [ 4 ] . En algunos métodos, esto se realiza proyectando las células sobre un eje llamado pseudotiempo , que representa la progresión a través del proceso [ 5 ] .

Métodos

Desde 2015, se han creado más de 50 algoritmos para la inferencia de trayectorias. [ 6 ] Aunque los enfoques adoptados son diversos, existen algunas similitudes entre los métodos. Típicamente, los pasos del algoritmo consisten en la reducción de dimensionalidad para disminuir la complejidad de los datos, la construcción de trayectorias para determinar la estructura del proceso dinámico y la proyección de los datos sobre la trayectoria de manera que las células se posicionen según su desarrollo a través del proceso y las células con perfiles de expresión similares se sitúen cerca unas de otras. [ 6 ] Los algoritmos de inferencia de trayectorias difieren en el procedimiento específico utilizado para la reducción de dimensionalidad, los tipos de estructuras que se pueden utilizar para representar el proceso dinámico y la información previa que se requiere o se puede proporcionar. [ 2 ] DynVerse proporciona una evaluación comparativa exhaustiva de los métodos de inferencia de trayectorias.

Análisis de componentes principales (ACP) de una distribución gaussiana multivariada . Los vectores mostrados son el primer (vector más largo) y el segundo componente principal, que indican las direcciones de máxima varianza.

Reducción de dimensionalidad

Los datos producidos por la secuenciación de ARN de células individuales pueden consistir en miles de células, cada una con niveles de expresión registrados en miles de genes. [ 7 ] Para procesar eficientemente datos con una dimensionalidad tan alta, muchos algoritmos de inferencia de trayectorias emplean un procedimiento de reducción de dimensionalidad, como el análisis de componentes principales (PCA), el análisis de componentes independientes (ICA) o t-SNE, como primer paso. [ 8 ] El propósito de este paso es combinar muchas características de los datos en una medida más informativa de los mismos. [ 4 ] Por ejemplo, una coordenada resultante de la reducción de dimensionalidad podría combinar los niveles de expresión de muchos genes asociados con el ciclo celular en un valor que represente la posición de una célula en el ciclo celular. [ 8 ] Dicha transformación corresponde a la reducción de dimensionalidad en el espacio de características, pero la reducción de dimensionalidad también se puede aplicar al espacio de muestras agrupando grupos de células similares. [ 1 ]

Construcción de trayectorias

Un grafo con seis vértices. Muchos algoritmos de inferencia de trayectorias utilizan grafos para construir la trayectoria.

Muchos métodos representan la estructura del proceso dinámico mediante un enfoque basado en grafos . En este enfoque, los vértices del grafo corresponden a estados del proceso dinámico, como los tipos de células en la diferenciación celular, y las aristas entre los nodos corresponden a transiciones entre los estados. [ 6 ] La creación del grafo de trayectoria se puede realizar utilizando algoritmos de k-vecinos más cercanos o de árbol de expansión mínima . [ 9 ] La topología de la trayectoria se refiere a la estructura del grafo y los diferentes algoritmos se limitan a la creación de topologías de grafos de un tipo particular, como lineal , ramificada o cíclica . [ 4 ]

Uso de información previa

Algunos métodos requieren o permiten la entrada de información previa que se utiliza para guiar la creación de la trayectoria. El uso de información previa puede conducir a una determinación de trayectoria más precisa, pero una información previa deficiente puede desviar al algoritmo o sesgar los resultados hacia las expectativas. [ 6 ] Ejemplos de información previa que se pueden utilizar en la inferencia de trayectorias son la selección de celdas de inicio que se encuentran al comienzo de la trayectoria, el número de ramificaciones en la trayectoria y el número de estados finales de la trayectoria. [ 10 ]

Software

MARGARETA

MARGARET emplea un enfoque de aprendizaje métrico profundo no supervisado para inferir el espacio latente celular y los grupos celulares. La trayectoria se modela mediante un grafo de conectividad de clústeres para capturar topologías de trayectoria complejas. MARGARET utiliza la trayectoria inferida para determinar estados terminales e inferir la plasticidad del destino celular mediante un modelo de cadena de Markov absorbente escalable . [ 11 ]

Monóculo

Monocle primero emplea una prueba de expresión diferencial para reducir el número de genes y luego aplica un análisis de componentes independientes para una mayor reducción de dimensionalidad. Para construir la trayectoria, Monocle calcula un árbol de expansión mínima y luego encuentra el camino conectado más largo en ese árbol. Las células se proyectan sobre el punto más cercano a ellas a lo largo de ese camino. [ 5 ]

p-Creode

p-Creode encuentra la ruta más probable a través de un grafo de k vecinos más cercanos ajustado por densidad . Los grafos de un conjunto se evalúan con una métrica de similitud de grafos para seleccionar la topología más representativa. p-Creode se ha probado en diversas plataformas de células individuales, incluyendo citometría de masas , inmunofluorescencia multiplex [ 12 ] y secuenciación de ARN de células individuales . No se requiere información previa [ 13 ] .

FLOR

Phlower aprovecha el componente armónico de la descomposición de Hodge en complejos simpliciales para inferir incrustaciones de flujo a partir de datos multimodales de células individuales. PHLOWER se evaluó en conjuntos de datos de referencia exhaustivos con grandes árboles de diferenciación celular, lo que confirmó sus ventajas con respecto a los métodos de vanguardia. También se utilizó para analizar programas reguladores que controlan la diferenciación de células de organoides renales . [ 14 ]

Honda

Slingshot toma como entrada las etiquetas de los clústeres y luego ordena estos clústeres en linajes mediante la construcción de un árbol de expansión mínima . Las rutas a través del árbol se suavizan ajustando curvas principales simultáneas y el valor de pseudotiempo de una celda se determina por su proyección sobre una o más de estas curvas. La información previa, como los clústeres iniciales y terminales, es opcional. [ 10 ]

TSCAN

TSCAN realiza una reducción de dimensionalidad mediante análisis de componentes principales y agrupa las celdas utilizando un modelo de mezcla . Se calcula un árbol de expansión mínima utilizando los centros de los grupos y la trayectoria se determina como el camino conectado más largo de dicho árbol. TSCAN es un algoritmo no supervisado que no requiere información previa. [ 15 ]

Ganas de viajar/Hueso de la suerte

Wanderlust se desarrolló para el análisis de datos de citometría de masas , pero se ha adaptado para aplicaciones de transcriptómica de células individuales . Se utiliza un algoritmo de k vecinos más cercanos para construir un grafo que conecta cada célula con la célula más cercana a ella con respecto a una métrica como la distancia euclidiana o la distancia coseno . Wanderlust requiere como entrada una célula inicial como información previa. [ 16 ]

Wishbone se basa en Wanderlust y permite una bifurcación en la topología del grafo, mientras que Wanderlust crea un grafo lineal . Wishbone combina el análisis de componentes principales y los mapas de difusión para lograr la reducción de dimensionalidad y, además, crea un grafo KNN . [ 17 ]

Cascada

El algoritmo Waterfall realiza una reducción de dimensionalidad mediante análisis de componentes principales y utiliza un algoritmo k-means para encontrar grupos de células. Se construye un árbol de expansión mínima entre los centros de los grupos. Waterfall es completamente no supervisado, no requiere información previa y produce trayectorias lineales . [ 18 ]

Referencias

  1. 1 2 Bacher, Rhonda; Kendziorski, Christina (2016-04-07). "Diseño y análisis computacional de experimentos de secuenciación de ARN de células individuales" . Genome Biology . 17 (1): 63. doi : 10.1186/s13059-016-0927-y . ISSN 1474-760X . PMC 4823857. PMID 27052890 .   
  2. 1 2 Hwang, Byungjin; Lee, Ji Hyun; Bang, Duhee (2018-08-07). "Tecnologías de secuenciación de ARN de células individuales y pipelines bioinformáticos" . Medicina Experimental y Molecular . 50 (8): 1– 14. doi : 10.1038/s12276-018-0071-8 . ISSN 2092-6413 . PMC 6082860. PMID 30089861 .   
  3. Stegle, Oliver; Teichmann, Sarah A.; Marioni, John C. (2015-01-28). "Desafíos computacionales y analíticos en transcriptómica de células individuales". Nature Reviews Genetics . 16 (3): 133– 145. doi : 10.1038/nrg3833 . ISSN 1471-0056 . PMID 25628217 . S2CID 205486032 .   
  4. 1 2 3 Cannoodt, Robrecht; Saelens, Wouter; Saeys, Yvan (2016-10-19). "Métodos computacionales para la inferencia de trayectorias a partir de transcriptómica de células individuales" . European Journal of Immunology . 46 (11): 2496– 2506. doi : 10.1002/eji.201646347 . hdl : 1854/LU-8510906 . ISSN 0014-2980 . PMID 27682842. S2CID 19562455 .   
  5. 1 2 Trapnell, Cole; Cacchiarelli, Davide; Grimsby, Jonna; Pokharel, Prapti; Li, Shuqiang; Morse, Michael; Lennon, Niall J; Livak, Kenneth J; Mikkelsen, Tarjei S (2014-03-23). ​​"La dinámica y los reguladores de las decisiones del destino celular se revelan mediante el ordenamiento pseudotemporal de células individuales" . Nature Biotechnology . 32 (4): 381– 386. doi : 10.1038/nbt.2859 . ISSN 1087-0156 . PMC 4122333. PMID 24658644 .   
  6. 1 2 3 4 Saelens, Wouter; Cannoodt, Robrecht; Todorov, Helena; Saeys, Yvan (2019-01-04). "Una comparación de métodos de inferencia de trayectorias de células individuales" . Nature Biotechnology . 37 (5): 547– 555. doi : 10.1038/s41587-019-0071-9 . PMID 30936559. S2CID 89616753 .  
  7. Conesa, Ana; Madrigal, Pedro; Tarazona, Sonia; Gómez-Cabrero, David; Cervera, Alejandra; McPherson, Andrés; Szcześniak, Michał Wojciech; Gaffney, Daniel J.; Elo, Laura L. (26 de enero de 2016). "Una encuesta de mejores prácticas para el análisis de datos de RNA-seq" . Biología del genoma . 17 (1): 13. doi : 10.1186/s13059-016-0881-8 . ISSN 1474-760X . PMC 4728800 . PMID 26813401 .   
  8. 1 2 Yosef, Nir; Regev, Aviv; Wagner, Allon (noviembre de 2016). "Revelando los vectores de identidad celular con genómica de célula única" . Nature Biotechnology . 34 (11): 1145– 1160. doi : 10.1038/nbt.3711 . ISSN 1546-1696 . PMC 5465644. PMID 27824854 .   
  9. Cahan, Patrick; Tan, Yuqi; Kumar, Pavithra (2017-01-01). "Comprensión del desarrollo y las células madre mediante análisis de expresión génica basados ​​en células individuales" . Development . 144 ( 1): 17–32 . doi : 10.1242/dev.133058 . ISSN 1477-9129 . PMC 5278625. PMID 28049689 .   
  10. 1 2 Street, Kelly; Risso, Davide; Fletcher, Russell B.; Das, Diya; Ngai, John; Yosef, Nir; Purdom, Elizabeth; Dudoit, Sandrine (2018-06-19). "Slingshot: inferencia de linaje celular y pseudotiempo para transcriptómica de células individuales" . BMC Genomics . 19 (1): 477. doi : 10.1186/s12864-018-4772-0 . PMC 6007078. PMID 29914354 .  
  11. Pandey, Kushagra; Zafar, Hamim (2022). "Inferencia de transiciones de estado celular y plasticidad del destino celular a partir de células individuales con MARGARET" . Nucleic Acids Research . 50 (15): e86. doi : 10.1093/nar/gkac412 . ISSN 0305-1048 . PMC 9410915. PMID 35639499 .   
  12. Gerdes, MJ; Sevinsky, CJ; Sood, A.; Adak, S.; Bello, MO; Bordwell, A.; Can, A.; Corwin, A.; Dinn, S. (2013-07-01). "Análisis de células individuales altamente multiplexado de tejido canceroso fijado con formalina e incluido en parafina" . Actas de la Academia Nacional de Ciencias . 110 (29): 11982– 11987. Bibcode : 2013PNAS..11011982G . doi : 10.1073/pnas.1300136110 . ISSN 0027-8424 . PMC 3718135. PMID 23818604 .   
  13. Lau, Ken S.; Coffey, Robert J.; Gerdes, Michael J.; Liu, Qi; Franklin, Jeffrey L.; Roland, Joseph T.; Ping, Jie; Simmons, Alan J.; McKinley, Eliot T. (2018-01-24). "Análisis de trayectoria no supervisado de datos de ARN-Seq e imágenes de células individuales revela orígenes alternativos de células en penacho en el intestino" . Cell Systems . 6 (1): 37–51.e9. doi : 10.1016/j.cels.2017.10.012 . ISSN 2405-4712 . PMC 5799016. PMID 29153838 .   
  14. Cheng, Mingbo; Jansen, Jitske; Reimer, Katharina C.; Grande, Vincent P.; Nagai, James S.; Li, Zhijian; Kießling, Paul; Grasshoff, Martin; Kuppe, Christoph; Schaub, Michael T.; Kramann, Rafael; Costa, Ivan G. (noviembre de 2025). "PHLOWER aprovecha datos multimodales de células individuales para inferir trayectorias de diferenciación celular complejas y de múltiples ramificaciones" . Nature Methods . 22 (11): 2328– 2336. doi : 10.1038/s41592-025-02870-5 . ISSN 1548-7105 . PMC 12615267. PMID 41131366 .   
  15. Ji, Zhicheng; Ji, Hongkai (2016-05-13). "TSCAN: Reconstrucción y evaluación de pseudotiempo en el análisis de ARN-seq de células individuales" . Nucleic Acids Research . 44 (13): e117. doi : 10.1093/nar/gkw430 . ISSN 0305-1048 . PMC 4994863. PMID 27179027 .   
  16. Bendall, Sean C.; Davis, Kara L.; Amir, El-ad David; Tadmor, Michelle D.; Simonds, Erin F.; Chen, Tiffany J.; Shenfeld, Daniel K.; Nolan, Garry P.; Pe'Er, Dana (2014-04-24). "La detección de trayectorias de células individuales revela la progresión y la coordinación regulatoria en el desarrollo de células B humanas" . Cell . 157 ( 3): 714– 725. doi : 10.1016/j.cell.2014.04.005 . ISSN 0092-8674 . PMC 4045247. PMID 24766814 .   
  17. Setty, Manu; Tadmor, Michelle D; Reich-Zeliger, Shlomit; Angel, Omer; Salame, Tomer Meir; Kathail, Pooja; Choi, Kristy; Bendall, Sean; Friedman, Nir (2016-05-02). "Wishbone identifica trayectorias de desarrollo bifurcadas a partir de datos de células individuales" . Nature Biotechnology . 34 (6): 637– 645. doi : 10.1038/nbt.3569 . ISSN 1087-0156 . PMC 4900897. PMID 27136076 .   
  18. Shin, Jaehoon; Berg, Daniel A.; Zhu, Yunhua; Shin, Joseph Y.; Song, Juan; Bonaguidi, Michael A.; Enikolopov, Grigori; Nauen, David W.; Christian, Kimberly M.; Ming, Guo-li; Song, Hongjun (2015-09-03). "Single-Cell RNA-Seq with Waterfall Reveals Molecular Cascades underlying Adult Neurogenesis" . Cell Stem Cell . 17 (3): 360– 372. doi : 10.1016/j.stem.2015.07.013 . ISSN 1934-5909 . PMC 8638014. PMID 26299571 .   
  • Una colección de más de 50 métodos de inferencia de trayectorias dentro de una interfaz común.
  • Tabla de herramientas para el análisis de datos de secuenciación de ARN de células individuales.
  • Algoritmos de estimación de pseudotiempo para secuenciación de ARN de células individuales