
La sustracción digital del transcriptoma ( DTS ) es un método bioinformático para detectar la presencia de nuevas transcripciones de patógenos mediante la eliminación computacional de las secuencias del huésped. La DTS es el análogo directo in silico del análisis de diferencias representacionales (RDA) con un enfoque de laboratorio húmedo , y es posible gracias a una secuenciación imparcial de alto rendimiento y a la disponibilidad de un genoma de referencia anotado y de alta calidad del huésped. El método examina específicamente el agente etiológico de las enfermedades infecciosas y es más conocido por descubrir el poliomavirus de células de Merkel , el agente causal sospechoso del carcinoma de células de Merkel . [1]
Historia
Meyerson et al. [2] propusieron por primera vez en 2002 el uso de la sustracción computacional para descubrir nuevos patógenos utilizando conjuntos de datos de etiquetas de secuencia expresada (EST) humanas . En un experimento de prueba de principio , Meyerson et al. demostraron que era un enfoque factible utilizando linfocitos infectados con el virus de Epstein-Barr en el trastorno linfoproliferativo postrasplante (PTLD) . [3]
En 2007, el término "sustracción del transcriptoma digital" fue acuñado por el grupo de Chang - Moore [4] , y se utilizó para descubrir el polimavirus de células de Merkel en el carcinoma de células de Merkel . [1]
Simultáneamente al descubrimiento del MCV, este enfoque se utilizó para implicar a un nuevo arenavirus como causa de fatalidad en un caso en el que tres pacientes murieron de enfermedades similares poco después de trasplantes de órganos de un solo donante. [5]
Método

Construcción de una biblioteca de ADNc
Después del tratamiento con DNasa I para eliminar el ADN genómico humano, se extrae el ARN total del tejido infectado primario. Luego, el ARN mensajero se purifica utilizando una columna de oligo-dT que se une a la cola de poli-A , una señal que se encuentra específicamente en los genes transcritos. Mediante el cebado con hexámeros aleatorios, la transcriptasa inversa (RT) convierte todo el ARNm en ADNc y se clona en vectores bacterianos. Luego, las bacterias, generalmente E. coli , se transforman utilizando los vectores de ADNc y se seleccionan utilizando un marcador; la colección de clones transformados es la biblioteca de ADNc. Esto genera una instantánea del ARNm del tejido que es estable y se puede secuenciar en una etapa posterior.
Secuenciación y control de calidad
La biblioteca de ADNc debe secuenciarse en gran profundidad (es decir, en la cantidad de clones secuenciados) para detectar una secuencia patógena rara teórica (Tabla 1), especialmente si la secuencia extraña es nueva. Chang-Moore recomienda una profundidad de secuenciación de 200 000 transcripciones o más utilizando múltiples plataformas de secuenciación. [1]
A continuación, se aplica un control de calidad estricto a las secuencias sin procesar para minimizar los resultados falsos positivos. El análisis de calidad inicial utiliza varios parámetros generales para excluir secuencias ambiguas, dejando como resultado un conjunto de datos de lecturas de alta fidelidad (Hi-Fi).
- Se utiliza un valor de corte de puntuación Phred bajo para eliminar secuencias finales de baja calidad. Normalmente, se utiliza un valor de corte de puntuación Phred de 20 o 30 para garantizar una precisión del 99 % al 99,9 % en cada llamada de base.
- Eliminación de vector y adaptador.
- Baja complejidad: el puntaje de complejidad de una secuencia refleja el número de bases idénticas en una serie (homopolímeros) como poli-dT o poli-dA.
- ADN humano repetitivo .
- Longitud: el parámetro depende de la longitud de lectura optimizada específica de la tecnología de secuenciación que se utilizó.
- BLAST y excluye secuencias del genoma de E. coli .
BLAST para hospedar el genoma
Con MEGABLAST, las lecturas de alta fidelidad se comparan con secuencias en bases de datos anotadas y las coincidencias positivas se restan del conjunto de datos. La longitud mínima de coincidencia para una coincidencia positiva de una secuencia humana es normalmente de 30 bases idénticas consecutivas, lo que equivale a una puntuación BLAST de 60; por lo general, la secuencia restante se vuelve a comparar con BLAST con parámetros menos estrictos para permitir ligeras discrepancias (1 de cada 20 nucleótidos). La gran mayoría de las secuencias (>99 %) se deben eliminar del conjunto de datos en esta etapa.
Las secuencias restadas generalmente incluyen:
- Transcriptoma humano de referencia : elimina cualquier transcripción humana conocida de los conjuntos de bibliotecas de expresión.
- Genoma humano de referencia : elimina los genes que no se han detectado durante el proceso de anotación y cualquier secuencia genómica contaminante durante la construcción de la biblioteca de ADNc.
- ADN mitocondrial : el ADN mitocondrial es muy abundante y polimórfico debido a su rápida tasa de mutación.
- Región de inmunoglobulina : los loci de inmunoglobulina son altamente polimórficos y de lo contrario producirían un falso positivo debido a una mala alineación con el genoma de referencia.
- Otras secuencias de vertebrados
- Secuencias no anotadas
Análisis de candidatos “no anfitriones”
Alineación con bases de datos de patógenos
Después de estrictas rondas de sustracción, las secuencias restantes se agrupan en contigs no redundantes y se alinean con secuencias patógenas conocidas utilizando parámetros de baja rigurosidad. Como los genomas de los patógenos mutan rápidamente, las alineaciones nucleótido-nucleótido, o blastn [ ancla rota ] , suelen ser poco informativas ya que es posible tener mutaciones en ciertas bases sin cambiar el residuo de aminoácido debido a la degeneración del codón . La coincidencia de las secuencias de proteínas traducidas in silico de los 6 marcos de lectura abiertos con la secuencia de aminoácidos de las proteínas anotadas, o blastx [ ancla rota ] , es el método de alineación preferido ya que aumenta la probabilidad de identificar un nuevo patógeno al coincidir con una cepa/especie relacionada. [5] La extensión experimental de secuencias candidatas también se puede utilizar en esta etapa para maximizar las posibilidades de una coincidencia positiva. [6]
De nuevoasamblea
En los casos en que la alineación con patógenos conocidos no es informativa o es ambigua, los contigs de la secuencia candidata se pueden utilizar como plantillas para el recorrido de cebadores en el tejido infectado primario para generar la secuencia completa del genoma del patógeno. [1] [5] Como las transcripciones virales son extremadamente raras en relación con el ARNm del tejido (10 transcripciones en 1 millón), [1] es poco probable generar un transcriptoma basado únicamente en las secuencias candidatas originales debido a la baja cobertura .
Validación de patógenos
Una vez que se ha identificado un posible patógeno en los datos de secuenciación de alto rendimiento, es imperativo validar la presencia del patógeno en pacientes infectados utilizando técnicas más sensibles, como:
- RT-PCR y métodos derivados, incluido 3'- y 5'-RACE para confirmar la existencia de ARNm del patógeno.
- Inmunohistoquímica que utiliza anticuerpos contra patógenos relacionados para determinar la existencia del patógeno en los tejidos.
- Pruebas serológicas para medir el título de anticuerpos específicos del patógeno .
- Cultivo bacteriano / cultivo viral , que se considera el estándar de oro en el diagnóstico de laboratorio.
Aplicaciones
La principal aplicación de la DTS radica en la identificación de virus patógenos en el cáncer. [1] [4] También se puede utilizar para identificar patógenos virales en enfermedades no relacionadas con el cáncer. [5] Las futuras aplicaciones clínicas podrían incluir el uso de la DTS de forma rutinaria en individuos. La DTS también podría aplicarse a la agricultura , identificando patógenos que tienen un efecto sobre la producción. La sustracción computacional ya se utilizó en un estudio de metagenómica que asoció la infección viral por IAPV con el trastorno de colapso de colonias en abejas melíferas . [7]
Ventajas
- No requiere conocimientos previos sobre la secuencia del patógeno. [8]
- Puede identificar patógenos previamente no asociados y potencialmente tratables.
- Utiliza métodos y recursos moleculares ya disponibles.
Desventajas
- Identifica la presencia de patógeno pero no establece un vínculo causal con la enfermedad. [8] Véase el postulado de Koch y los criterios de Bradford Hill .
- Debe tener un transcriptoma de referencia altamente confiable y completo para el organismo en estudio. [8]
- La falta de identificación de una secuencia extraña no puede excluir por completo un cuerpo extraño patógeno. [8]
Referencias
- ^ abcdef Feng H, Shuda M, Chang Y, Moore PS (enero de 2008). "Integración clonal de un poliomavirus en el carcinoma de células de Merkel humano". Science . 5866. 319 (5866): 1096–1100. Bibcode :2008Sci...319.1096F. doi :10.1126/science.1152586. PMC 2740911 . PMID 18202256.
- ^ ab Weber G, Shendure J, Tanenbaum DM, Church GM, Meyerson M (febrero de 2002). "Identificación de secuencias de genes extraños mediante filtrado de transcripción frente al genoma humano". Nat Genet . 2. 30 (2): 141–142. doi :10.1038/ng818. PMID 11788827. S2CID 21842679.
- ^ ab Xu Y, Stange-Thomann N, Weber G, Bo R, Dodge S, David RG, Foley K, Beheshti J, Harris NL, Birren B, Lander ES, Meyerson M (marzo de 2003). "Descubrimiento de patógenos a partir de tejido humano mediante sustracción computacional basada en secuencias". Genomics . 3. 81 (3): 329–335. doi :10.1016/S0888-7543(02)00043-5. PMID 12659816.
- ^ ab Feng H, Taylor JL, Benos PV, Newton R, Waddell K, Lucas SB, Chang Y, Moore PS (agosto de 2007). "Sustracción del transcriptoma humano mediante el uso de etiquetas de secuencia corta para buscar virus tumorales en el carcinoma conjuntival". J Virol . 20. 81 (20): 11332–11340. doi :10.1128/JVI.00875-07. PMC 2045575 . PMID 17686852.
- ^ abcd Palacios G, Druce J, Du L, Tran T, Birch C, Briese T, Conlan S, Quan PL, Hui J, Marshall J, Simons JF, Egholm M, Paddock CD, Shieh WJ, Goldsmith CS, Zaki SR, Catton M, Lipkin WI (marzo de 2008). "Un nuevo arenavirus en un grupo de enfermedades mortales asociadas a trasplantes". N Inglés J Med . 10. 358 (10): 991–998. CiteSeerX 10.1.1.453.2859 . doi :10.1056/NEJMoa073785. PMID 18256387.
- ^ Chang Y, Moore PS. "Nuevo descubrimiento de patógenos: sustracción digital del transcriptoma". Archivado desde el original el 25 de enero de 2010. Consultado el 1 de marzo de 2012 .
- ^ Cox-Foster DL, Conlan S, Holmes EC, Palacios G, Evans JD, Moran NA, Quan PL, Briese T, Hornig M, Geiser DM, Martinson V, vanEngelsdorp D, Kalkstein AL, Drysdale A, Hui J, Zhai J, Cui L, Hutchison SK, Simons JF, Egholm M, Pettis JS, Lipkin WI (octubre de 2007). "Un estudio metagenómico de microbios en el trastorno de colapso de colonias de abejas melíferas". Science . 5848. 318 (5848): 283–287. Bibcode :2007Sci...318..283C. doi : 10.1126/science.1146498 . PMID 17823314. S2CID 14013425.
- ^ abcd MacConaill L, Meyerson M (abril de 2008). "Adición de patógenos mediante sustracción genómica". Nat Genet . 4. 40 (4): 380–382. doi :10.1038/ng0408-380. PMID 18368124.