La detección de SNV a partir de datos de NGS es cualquiera de los diversos métodos para identificar la existencia de variantes de un solo nucleótido (SNV) a partir de los resultados de experimentos de secuenciación de nueva generación (NGS). Estas son técnicas computacionales, y contrastan con los métodos experimentales especiales basados en polimorfismos de un solo nucleótido conocidos en toda la población (véase genotipado de SNP ). Debido a la creciente abundancia de datos de NGS, estas técnicas se están volviendo cada vez más populares para realizar el genotipado de SNP, con una amplia variedad de algoritmos diseñados para diseños experimentales y aplicaciones específicas. [ 1 ] Además del dominio de aplicación habitual del genotipado de SNP, estas técnicas se han adaptado con éxito para identificar SNP raros dentro de una población, [ 2 ] así como para detectar SNV somáticos dentro de un individuo utilizando múltiples muestras de tejido. [ 3 ]
Métodos para detectar variantes de la línea germinal
La mayoría de los métodos basados en NGS para la detección de SNV están diseñados para detectar variaciones de la línea germinal en el genoma del individuo. Estas son las mutaciones que un individuo hereda biológicamente de sus padres y son el tipo habitual de variantes que se buscan al realizar este tipo de análisis (excepto en ciertas aplicaciones específicas donde se buscan mutaciones somáticas ). Con frecuencia, las variantes buscadas se presentan con cierta frecuencia (posiblemente baja) en la población, en cuyo caso se las denomina polimorfismos de un solo nucleótido (SNP). Técnicamente, el término SNP se refiere únicamente a este tipo de variaciones; sin embargo, en la práctica, se suele utilizar como sinónimo de SNV en la literatura sobre la detección de variantes. Además, dado que la detección de SNV de la línea germinal requiere determinar el genotipo del individuo en cada locus, la expresión "genotipado de SNP" también puede utilizarse para referirse a este proceso. No obstante, esta expresión también puede referirse a procedimientos experimentales de laboratorio para clasificar genotipos en un conjunto de ubicaciones de SNP conocidas.
El proceso habitual de dichas técnicas se basa en: [ 1 ]
- Filtrado del conjunto de lecturas NGS para eliminar fuentes de error/sesgo.
- Alineación de las lecturas con un genoma de referencia.
- Utilizar un algoritmo, ya sea basado en un modelo estadístico o en alguna heurística, para predecir la probabilidad de variación en cada locus, basándose en las puntuaciones de calidad y los recuentos de alelos de las lecturas alineadas en ese locus.
- Filtrar los resultados previstos, a menudo basándose en métricas relevantes para la aplicación.
- Anotación de SNP para predecir el efecto funcional de cada variación.
El resultado habitual de estos procedimientos es un archivo VCF .
Métodos probabilísticos

En un mundo ideal sin errores y con alta cobertura de lectura , la tarea de identificar variantes a partir de los resultados de una alineación de datos NGS sería sencilla; en cada locus (posición en el genoma) se puede contar el número de ocurrencias de cada nucleótido distinto entre las lecturas alineadas en esa posición, y el genotipo verdadero sería obvio: AA si todos los nucleótidos coinciden con el alelo A , BB si coinciden con el alelo B , o AB si hay una mezcla. Sin embargo, al trabajar con datos NGS reales, este enfoque ingenuo no se utiliza, ya que no puede tener en cuenta el ruido en los datos de entrada. [ 4 ] Los recuentos de nucleótidos utilizados para la identificación de bases contienen errores y sesgos, debidos tanto a las lecturas secuenciadas como al proceso de alineación. Este problema puede mitigarse hasta cierto punto mediante la secuenciación a una mayor profundidad de cobertura de lectura; sin embargo, esto suele ser costoso, y muchos estudios prácticos requieren realizar inferencias sobre datos de baja cobertura. [ 1 ]
Los métodos probabilísticos buscan superar el problema mencionado, generando estimaciones robustas de las probabilidades de cada uno de los genotipos posibles, teniendo en cuenta el ruido y otra información previa disponible que puede utilizarse para mejorar las estimaciones. Posteriormente, se puede predecir un genotipo basándose en estas probabilidades, a menudo según la estimación MAP .
Los métodos probabilísticos para la detección de variantes se basan en el teorema de Bayes . En el contexto de la detección de variantes, el teorema de Bayes define la probabilidad de que cada genotipo sea el verdadero, dados los datos observados, en términos de las probabilidades a priori de cada genotipo posible y la distribución de probabilidad de los datos dado cada genotipo posible. La fórmula es:
En la ecuación anterior:
- se refiere a los datos observados; es decir, las lecturas alineadas
- es el genotipo cuya probabilidad se está calculando
- se refiere al i -ésimo genotipo posible, de entre n posibilidades.
Dado el marco anterior, las diferentes soluciones de software para detectar SNV varían en función de cómo calculan las probabilidades previas., el modelo de error utilizado para modelar las probabilidadesy la partición de los genotipos generales en subgenotipos separados, cuyas probabilidades pueden estimarse individualmente en este marco. [ 5 ]
Estimación de probabilidad de genotipo previo
El cálculo de las probabilidades a priori depende de los datos disponibles del genoma estudiado y del tipo de análisis realizado. En estudios con datos de referencia fiables que contienen frecuencias de mutaciones conocidas (por ejemplo, en el estudio del genoma humano ), estas frecuencias conocidas de genotipos en la población pueden utilizarse para estimar las probabilidades a priori. Con las frecuencias alélicas de toda la población , las probabilidades a priori de los genotipos pueden calcularse en cada locus según el equilibrio de Hardy-Weinberg . [ 6 ] En ausencia de dichos datos, pueden utilizarse probabilidades a priori constantes, independientemente del locus. Estas pueden establecerse mediante valores heurísticos, posiblemente en función del tipo de variaciones que se buscan en el estudio. Alternativamente, se han investigado procedimientos de aprendizaje automático supervisado que buscan aprender valores óptimos a priori para los individuos de una muestra, utilizando datos de secuenciación de nueva generación (NGS) proporcionados por estos individuos. [ 4 ]
Modelos de error para observaciones de datos
El modelo de error utilizado para crear un método probabilístico para la detección de variantes es la base para calcular eltérmino utilizado en el teorema de Bayes. Si se asumiera que los datos están libres de errores, entonces la distribución de recuentos de nucleótidos observados en cada locus seguiría una distribución binomial , con el 100% de los nucleótidos coincidiendo con el alelo A o B respectivamente en los casos AA y BB , y una probabilidad del 50% de que cada nucleótido coincida con A o B en el caso AB . Sin embargo, en presencia de ruido en los datos de lectura, esta suposición se viola y laLos valores deben tener en cuenta la posibilidad de que haya nucleótidos erróneos presentes en las lecturas alineadas en cada locus.
Un modelo de error simple consiste en introducir un pequeño error en el término de probabilidad de datos en los casos homocigotos, permitiendo una pequeña probabilidad constante de que se observen nucleótidos que no coincidan con el alelo A en el caso AA , y respectivamente una pequeña probabilidad constante de que se observen nucleótidos que no coincidan con el alelo B en el caso BB . Sin embargo, existen procedimientos más sofisticados que intentan replicar de forma más realista los patrones de error reales observados en datos reales al calcular las probabilidades de datos condicionales. Por ejemplo, se han incorporado estimaciones de la calidad de lectura (medida como puntuaciones de calidad Phred ) en estos cálculos, teniendo en cuenta la tasa de error esperada en cada lectura individual en un locus. [ 7 ] Otra técnica que se ha incorporado con éxito a los modelos de error es la recalibración de la calidad de base, donde se calculan tasas de error separadas, basadas en información previa conocida sobre patrones de error, para cada posible sustitución de nucleótido. La investigación muestra que no todas las posibles sustituciones de nucleótido tienen la misma probabilidad de aparecer como un error en los datos de secuenciación, por lo que se ha aplicado la recalibración de la calidad de base para mejorar las estimaciones de probabilidad de error. [ 6 ]
Partición del genotipo
En la discusión anterior, se ha asumido que las probabilidades genotípicas en cada locus se calculan de forma independiente; es decir, el genotipo completo se divide en genotipos independientes en cada locus, cuyas probabilidades se calculan de forma independiente. Sin embargo, debido al desequilibrio de ligamiento, los genotipos de loci cercanos generalmente no son independientes. En consecuencia, dividir el genotipo general en una secuencia de haplotipos superpuestos permite modelar estas correlaciones, lo que resulta en estimaciones de probabilidad más precisas mediante la incorporación de las frecuencias de haplotipos de toda la población en la distribución a priori. El uso de haplotipos para mejorar la precisión en la detección de variantes se ha aplicado con éxito, por ejemplo, en el Proyecto 1000 Genomas . [ 8 ]
Algoritmos basados en heurísticas
Como alternativa a los métodos probabilísticos, existen métodos heurísticos para la detección de variantes en datos de secuenciación de nueva generación (NGS). En lugar de modelar la distribución de los datos observados y utilizar la estadística bayesiana para calcular las probabilidades de genotipo, la detección de variantes se basa en diversos factores heurísticos, como recuentos mínimos de alelos, umbrales de calidad de lectura, límites de profundidad de lectura, etc. Si bien han sido relativamente impopulares en la práctica en comparación con los métodos probabilísticos, gracias al uso de límites y umbrales, pueden ser robustos ante datos atípicos que violan los supuestos de los modelos probabilísticos. [ 9 ]
Genoma de referencia utilizado para la alineación
Una parte importante del diseño de métodos de detección de variantes mediante datos NGS es la secuencia de ADN utilizada como referencia para alinear las lecturas NGS. En estudios de genética humana, se dispone de referencias de alta calidad, procedentes de fuentes como el proyecto HapMap [ 10 ] , que pueden mejorar sustancialmente la precisión de las llamadas de variantes realizadas por los algoritmos de detección de variantes. Además, dichas referencias pueden proporcionar probabilidades de genotipo previas para análisis bayesianos. Sin embargo, en ausencia de una referencia de tan alta calidad, las lecturas obtenidas experimentalmente pueden ensamblarse primero para crear una secuencia de referencia para la alineación [ 1 ] .
Preprocesamiento y filtrado de resultados
Existen diversos métodos para filtrar datos en experimentos de detección de variantes, con el fin de eliminar fuentes de error o sesgo. Esto puede implicar la eliminación de lecturas sospechosas antes de realizar la alineación y/o el filtrado de la lista de variantes devuelta por el algoritmo de detección de variantes.
Dependiendo de la plataforma de secuenciación utilizada, pueden existir diversos sesgos en el conjunto de lecturas secuenciadas. Por ejemplo, puede producirse un sesgo de hebra, donde existe una distribución muy desigual de las direcciones directa e inversa en las lecturas alineadas en una región cercana. Además, puede producirse una duplicación inusualmente alta de algunas lecturas (por ejemplo, debido a un sesgo en la PCR ). Dichos sesgos pueden dar lugar a llamadas de variantes dudosas; por ejemplo, si un fragmento que contiene un error de PCR en algún locus se sobreamplifica debido a un sesgo de PCR, ese locus tendrá un alto recuento del alelo falso y puede ser clasificado como un SNV. Por ello, los flujos de trabajo de análisis suelen filtrar las llamadas en función de estos sesgos. [ 1 ]
Métodos para detectar variantes somáticas
Además de los métodos que alinean las lecturas de muestras individuales con un genoma de referencia para detectar variantes genéticas de la línea germinal , las lecturas de múltiples muestras de tejido de un mismo individuo pueden alinearse y compararse para detectar variantes somáticas. Estas variantes corresponden a mutaciones que han ocurrido de novo en grupos de células somáticas dentro de un individuo (es decir, no están presentes en las células germinales del individuo). Este tipo de análisis se ha aplicado con frecuencia al estudio del cáncer , donde muchos estudios se centran en investigar el perfil de mutaciones somáticas en tejidos cancerosos. Dichas investigaciones han dado lugar a herramientas de diagnóstico con aplicación clínica, que se utilizan para mejorar la comprensión científica de la enfermedad, por ejemplo, mediante el descubrimiento de nuevos genes relacionados con el cáncer, la identificación de redes reguladoras de genes y vías metabólicas implicadas , y la elaboración de modelos sobre cómo crecen y evolucionan los tumores. [ 11 ]
Novedades recientes
Hasta hace poco, las herramientas de software para realizar este tipo de análisis estaban muy poco desarrolladas y se basaban en los mismos algoritmos utilizados para detectar variaciones en la línea germinal. Dichos procedimientos no están optimizados para esta tarea, ya que no modelan adecuadamente la correlación estadística entre los genotipos presentes en múltiples muestras de tejido del mismo individuo. [ 3 ]
Investigaciones más recientes han dado como resultado el desarrollo de herramientas de software especialmente optimizadas para la detección de mutaciones somáticas a partir de múltiples muestras de tejido. Se han desarrollado técnicas probabilísticas que combinan los recuentos de alelos de todas las muestras de tejido en cada locus y, utilizando modelos estadísticos para las probabilidades de genotipos conjuntos para todos los tejidos y la distribución de los recuentos de alelos dado el genotipo, son capaces de calcular probabilidades relativamente robustas de mutaciones somáticas en cada locus utilizando todos los datos disponibles. [ 3 ] [ 12 ] Además, recientemente se ha investigado el uso de técnicas basadas en aprendizaje automático para realizar este análisis. [ 13 ] [ 14 ] [ 15 ] [ 16 ]
En 2021, el Consorcio de Control de Calidad de Secuenciación Fase 2 [ 17 ] publicó varios estudios que investigaron los efectos de las preparaciones de muestras, los kits de bibliotecas de secuenciación, las plataformas de secuenciación y los flujos de trabajo bioinformáticos en la precisión de la detección de SNV somáticos [ 18 ] basándose en un par de líneas celulares tumorales-normales que el Consorcio ha establecido como muestras de referencia, datos y conjuntos de llamadas. [ 19 ]
Lista de software disponible
- VarNet
- Genómica de macrodatos: el aguacate
- Beagle
- Variante profunda
- Bahías libres
- GATK (incluido MuTect)
- IMPUTE2
- JointSNVMix
- MaCH
- Magnolia DCNN
- Neusomático
- NGSEP
- Piscis
- Ornitorrinco
- realSFS
- Revelar
- Herramientas SAM
- SNVmix
- SOAPsnp
- SomaticSeq
- Francotirador somático
- Strelka
- Diccionario de variables
- VarScan
Referencias
- 1 2 3 4 5 Nielsen, R., Paul, JS, Albrechtsen, A., y Song, YS (2011). " Genotipo y llamada de SNP a partir de datos de secuenciación de próxima generación" . Nature Reviews Genetics . 12 (6): 443– 451. doi : 10.1038/nrg2986 . PMC 3593722. PMID 21587300 .
{{cite journal}}: CS1 maint: varios nombres: lista de autores ( enlace ) - ↑ Bansal, V. (2010). "Un método estadístico para la detección de variantes a partir de la resecuenciación de nueva generación de grupos de ADN" . Bioinformatics . 26 ( 12): i318– i324. doi : 10.1093/bioinformatics/btq214 . PMC 2881398. PMID 20529923 .
- 1 2 3 Roth, A., Ding, J., Morin, R., Crisan, A., Ha, G., Giuliany, R., Bashashati, A., Hirst, M., Turashvili, G., Oloumi, A., Marra, MA, Aparicio, S., y Shah, SP (2012). "JointSNVMix: un modelo probabilístico para la detección precisa de [ mutaciones somáticas en datos de secuenciación de próxima generación emparejados normal/tumor" . Bioinformatics . 28 ( 7): 907– 913. doi : 10.1093/bioinformatics/bts053 . PMC 3315723. PMID 22285562 .
{{cite journal}}: CS1 maint: varios nombres: lista de autores ( enlace ) - 1 2 Martin, ER, Kinnamon, DD, Schmidt, MA, Powell, EH, Zuchner, S., y Morris, RW (2010). "SeqEM: un enfoque adaptativo de llamada de genotipos para estudios de secuenciación de próxima generación" . Bioinformatics . 26 (22): 2803– 2810. doi : 10.1093/bioinformatics/btq526 . PMC 2971572. PMID 20861027 .
{{cite journal}}: CS1 maint: varios nombres: lista de autores ( enlace ) - ↑ You, N., Murillo, G., Su, X., Zeng, X., Xu, J., Ning, K., Zhang, S., Zhu, J., y Cui, X. (2012). "Detección de SNP mediante selección de modelos de genotipo en datos de secuenciación de alto rendimiento" . Bioinformatics . 28 ( 5): 643– 650. doi : 10.1093/bioinformatics/bts001 . PMC 3338331. PMID 22253293 .
{{cite journal}}: CS1 maint: varios nombres: lista de autores ( enlace ) - 1 2 Li, R., Li, Y., Fang, X., Yang, H., Wang, J., Kristiansen, K., y Wang, J. (2009). " Detección de SNP para resecuenciación masivamente paralela de todo el genoma" . Genome Research . 19 (6): 1124– 1132. doi : 10.1101/gr.088013.108 . PMC 2694485. PMID 19420381 .
{{cite journal}}: CS1 maint: varios nombres: lista de autores ( enlace ) - ↑ Li, H., Ruan, J., y Durbin, R. (2008). "Mapeo de lecturas cortas de secuenciación de ADN y llamada de variantes utilizando puntuaciones de calidad de mapeo" . Genome Research . 18 (11): 1851– 1858. doi : 10.1101/gr.078212.108 . PMC 2577856. PMID 18714091 .
{{cite journal}}: CS1 maint: varios nombres: lista de autores ( enlace ) - ↑ Abecasis, GR, Altshuler, D., Auton, A., Brooks, LD, Durbin, RM, Gibbs, RA, Hurles, ME, McVean, GA, Bentley, DR, Chakravarti, A..., y el Consorcio del Proyecto 1000 Genomas (2010). " Un mapa de la variación del genoma humano a partir de la secuenciación a escala poblacional" . Nature . 467 (7319): 1061– 1073. Bibcode : 2010Natur.467.1061T . doi : 10.1038/nature09534 . PMC 3042601. PMID 20981092 .
{{cite journal}}: CS1 maint: nombres múltiples: lista de autores ( enlace ) CS1 maint: nombres numéricos: lista de autores ( enlace ) - ↑ Koboldt, DC, Zhang, Q., Larson, DE, Shen, D., McLellan, MD, Lin, L., Miller, CA, Mardis, ER, Ding, L., y Wilson, RK (2012). "VarScan 2: descubrimiento de mutaciones somáticas y alteraciones del número de copias en cáncer mediante secuenciación del exoma" . Genome Research . 22 (3): 568– 576. doi : 10.1101/gr.129684.111 . PMC 3290792. PMID 22300766 .
{{cite journal}}: CS1 maint: varios nombres: lista de autores ( enlace ) - ↑ Gibbs, RA, Belmont, JW, Hardenbol, P., Willis, TD, Yu, F., Yang, H., Ch'ang, L.-Y., Huang, W. y Liu, Bin y Shen, Yan (2003). "El proyecto internacional HapMap" ( PDF) . Nature . 426 (6968): 789– 796. Bibcode : 2003Natur.426..789G . doi : 10.1038/nature02168 . hdl : 2027.42/62838 . PMID 14685227. S2CID 4387110 .
{{cite journal}}: CS1 maint: varios nombres: lista de autores ( enlace ) - ↑ Shyr, D., y Liu, Q. (2013). "Secuenciación de próxima generación en la investigación del cáncer y la aplicación clínica" . Biological Procedures Online . 15 (4): 4. doi : 10.1186/1480-9222-15-4 . PMC 3599179. PMID 23406336 .
{{cite journal}}: CS1 maint: varios nombres: lista de autores ( enlace ) - ↑ Larson, DE, Harris, CC, Chen, K., Koboldt, DC, Abbott, TE, Dooling, DJ, Ley, TJ, Mardis, ER, Wilson, RK y Ding, L. (2012). "SomaticSniper: identificación de mutaciones puntuales somáticas en datos de secuenciación del genoma completo" . Bioinformatics . 28 ( 3): 311– 317. doi : 10.1093/bioinformatics/btr665 . PMC 3268238. PMID 22155872 .
{{cite journal}}: CS1 maint: varios nombres: lista de autores ( enlace ) - ↑ Ding, J., Bashashati, A., Roth, A., Oloumi, A., Tse, K., Zeng, T., Haffari, G., Hirst, M., Marra, MA, Condon, A., Aparicio, S., y Shah, SP (2012). "Clasificadores basados en características para la detección de mutaciones somáticas en datos de secuenciación pareados tumor-normal" . Bioinformatics . 28 ( 2): 167– 175. doi : 10.1093/bioinformatics/btr629 . PMC 3259434. PMID 22084253 .
{{cite journal}}: CS1 maint: varios nombres: lista de autores ( enlace ) - ↑ Fang, LT, Afshar, PT, Chhibber, A., Mohiyuddin, M., Fan, Y., Mu, JC, Gibeling, G., Barr, S., Asadi, NB, Gerstein, MB, Koboldt, DC, Wang, W., Wong, WH y Lam, HYK (2015). "Un enfoque de conjunto para detectar con precisión mutaciones somáticas utilizando SomaticSeq" . Genome Biology . 16 (1): 197. doi : 10.1186/s13059-015-0758-2 . PMC 4574535. PMID 26381235 .
{{cite journal}}: CS1 maint: varios nombres: lista de autores ( enlace ) - ↑ Sahraeian, SME, Liu, R., Lau, B., Podesta, K., Mohiyuddin, M., y Lam, HYK (2019). " Redes neuronales convolucionales profundas para la detección precisa de mutaciones somáticas" . Nature Communications . 10 (1): 1041. Bibcode : 2019NatCo..10.1041S . doi : 10.1038/s41467-019-09027-x . PMC 6399298. PMID 30833567 .
{{cite journal}}: CS1 maint: varios nombres: lista de autores ( enlace ) - ↑ Krishnamachari, K., Lu, D., Swift-Scott, A., Yeraliyev, A., Lee, K., Huang, W., Sim, NL, Skanderup., AJ (2022). "Detección precisa de variantes somáticas mediante aprendizaje profundo débilmente supervisado" . Nature Communications . 13 (1): 4248. Bibcode : 2022NatCo..13.4248K . doi : 10.1038/ s41467-022-31765-8 . PMC 9307817. PMID 35869060 .
{{cite journal}}: CS1 maint: varios nombres: lista de autores ( enlace ) - ↑ "Consorcio MAQC-IV/SEQC2" . Administración de Alimentos y Medicamentos de EE. UU. 9 de septiembre de 2020. Consultado el 11 de octubre de 2021 .
- ↑ Xiao, W., Ren, L., Chen, Z., Fang, LT, Zhao, Y., Lack, J., Guan, M., Zhu, B., Jaeger, E., Kerrigan, L., Blomquist, TM, Hung, T., Sultan, M., Idler, K., Lu, C., Scherer, A., Kusko, R., Moos, M., Xiao, C; et al. (2021). "Hacia las mejores prácticas en la detección de mutaciones del cáncer con secuenciación del genoma completo y del exoma completo" . Nature Biotechnology . 39 (9): 1141– 1150. doi : 10.1038/s41587-021-00994-5 . PMC 8506910. PMID 34504346. S2CID 237471055 .
{{cite journal}}: CS1 maint: varios nombres: lista de autores ( enlace ) - ↑ Fang, LT, Zhu, B., Zhao, Y., Chen, W., Yang, Z., Kerrigan, L., Langenbach, K., de Mars, M., Lu, C., Idler, K., Jacob, H., Zheng, Y., Ren, L., Yu, Y., Jaeger, E., Schroth, GP, Abaan, OD, Talsania, K., Lack, J.; et al. (2021). "Establecimiento de muestras de referencia comunitarias, datos y conjuntos de llamadas para la evaluación comparativa de la detección de mutaciones de cáncer mediante secuenciación del genoma completo" . Nature Biotechnology . 39 (9): 1151– 1160. doi : 10.1038/s41587-021-00993-6 . PMC 8532138. PMID 34504347 . S2CID 237469255 .
{{cite journal}}: CS1 maint: varios nombres: lista de autores ( enlace )
- secuenciación de ADN
- Técnicas genéticas