El análisis de acoplamiento directo o DCA es un término general que engloba varios métodos para analizar datos de secuencias en biología computacional . [ 1 ] La idea común de estos métodos es utilizar modelos estadísticos para cuantificar la fuerza de la relación directa entre dos posiciones de una secuencia biológica , excluyendo los efectos de otras posiciones. Esto contrasta con las medidas habituales de correlación , que pueden ser elevadas incluso si no existe una relación directa entre las posiciones (de ahí el nombre de análisis de acoplamiento directo ). Dicha relación directa puede ser, por ejemplo, la presión evolutiva para que dos posiciones mantengan compatibilidad mutua en la estructura biomolecular de la secuencia, lo que conduce a la coevolución molecular entre las dos posiciones.
DCA se ha utilizado en la inferencia de contactos de residuos de proteínas , [ 1 ] [ 2 ] [ 3 ] [ 4 ] [ 5 ] predicción de la estructura del ARN , [ 6 ] [ 7 ] la inferencia de redes de interacción proteína-proteína , [ 8 ] [ 9 ] [ 10 ] [ 11 ] [ 12 ] el modelado de paisajes de aptitud , [ 13 ] [ 14 ] [ 15 ] la generación de proteínas con funciones novedosas, [ 16 ] y el modelado de la evolución de proteínas . [ 17 ] [ 18 ]
Modelo matemático e inferencia
Modelo matemático
La base de DCA es un modelo estadístico para la variabilidad dentro de un conjunto de secuencias biológicas filogenéticamente relacionadas . Cuando se ajusta a un alineamiento de secuencias múltiples (MSA) de secuencias de longitud, el modelo define una probabilidad para todas las secuencias posibles de la misma longitud. [ 1 ] Esta probabilidad puede interpretarse como la probabilidad de que la secuencia en cuestión pertenezca a la misma clase de secuencias que las del MSA, por ejemplo, la clase de todas las secuencias de proteínas que pertenecen a una familia de proteínas específica .
Denotamos una secuencia por, con elsiendo variables categóricas que representan los monómeros de la secuencia (si las secuencias son, por ejemplo, secuencias de aminoácidos alineadas de proteínas de una familia de proteínas, latomar como valores cualquiera de los 20 aminoácidos estándar ). La probabilidad de una secuencia dentro de un modelo se define entonces como
dónde
- son conjuntos de números reales que representan los parámetros del modelo (más abajo)
- es una constante de normalización (un número real ) para garantizar
Los parámetrosdepender de una posicióny el símboloen esta posición. Suelen llamarse campos [ 1 ] y cada uno representa la propensión del símbolose encontrará en la posiciónLos parámetrosdependen de pares de posicionesy los símbolosen estas posiciones. Suelen denominarse acoplamientos [ 1 ] y representan una interacción, es decir, un término que cuantifica la compatibilidad entre los símbolos de ambas posiciones. El modelo es totalmente conexo , por lo que existen interacciones entre todos los pares de posiciones. El modelo puede considerarse una generalización del modelo de Ising , donde los espines no solo toman dos valores, sino cualquier valor de un alfabeto finito dado. De hecho, cuando el tamaño del alfabeto es 2, el modelo se reduce al modelo de Ising. Dado que también recuerda al modelo del mismo nombre , a menudo se le denomina modelo de Potts . [ 19 ]
Incluso conociendo las probabilidades de todas las secuencias no se determinan los parámetros.de forma única. Por ejemplo, una simple transformación de los parámetros
para cualquier conjunto de números realesdeja las probabilidades iguales. La función de verosimilitud también es invariante bajo tales transformaciones, por lo que los datos no se pueden usar para fijar estos grados de libertad (aunque una distribución a priori sobre los parámetros podría hacerlo [ 3 ] ).
Una convención que se encuentra a menudo en la literatura [ 3 ] [ 20 ] es fijar estos grados de libertad de tal manera que la norma de Frobenius de la matriz de acoplamiento
se minimiza (de forma independiente para cada par de posiciones)y).
Derivación de máxima entropía
Para justificar el modelo de Potts, a menudo se señala que puede derivarse siguiendo un principio de máxima entropía : [ 21 ] Para un conjunto dado de covarianzas y frecuencias de muestra, el modelo de Potts representa la distribución con la máxima entropía de Shannon de todas las distribuciones que reproducen esas covarianzas y frecuencias. Para un alineamiento de secuencias múltiples , las covarianzas de muestra se definen como
- ,
dóndees la frecuencia relativa de encontrar símbolosyen posicionesyen la misma secuencia en el MSA, yla frecuencia relativa de encontrar el símboloen posiciónEl modelo de Potts es entonces la distribución únicaque maximiza la funcionalidad
El primer término en el funcional es la entropía de Shannon de la distribución.son multiplicadores de Lagrange para asegurar, consiendo la probabilidad marginal de encontrar símbolosen posicionesEl multiplicador de Lagrangeasegura la normalización. Maximizar esta función e identificar
Esto conduce al modelo de Potts descrito anteriormente. Este procedimiento solo proporciona la forma funcional del modelo de Potts, mientras que los valores numéricos de los multiplicadores de Lagrange (identificados con los parámetros) aún deben determinarse ajustando el modelo a los datos.
Acoplamientos directos y correlación indirecta
El punto central de DCA es interpretar el(que puede representarse como unmatriz si haysímbolos posibles) como acoplamientos directos. Si dos posiciones están bajo presión evolutiva conjunta (por ejemplo, para mantener un enlace estructural), cabría esperar que estos acoplamientos fueran grandes porque solo las secuencias con pares de símbolos adecuados deberían tener una probabilidad significativa. Por otro lado, una gran correlación entre dos posiciones no significa necesariamente que los acoplamientos sean grandes, ya que grandes acoplamientos entre, por ejemplo, posicionesypodría conducir a grandes correlaciones entre posicionesy, mediado por la posición. [ 1 ] De hecho, tales correlaciones indirectas se han visto implicadas en la alta tasa de falsos positivos al inferir contactos de residuos de proteínas utilizando medidas de correlación como la información mutua . [ 22 ]
Inferencia
La inferencia del modelo de Potts en un alineamiento de secuencias múltiples (MSA) mediante la estimación de máxima verosimilitud suele ser computacionalmente intratable, porque es necesario calcular la constante de normalización., que es para la longitud de la secuenciaysímbolos posibles una suma detérminos (lo que significa, por ejemplo, para una pequeña familia de dominios proteicos con 30 posiciones)términos). Por lo tanto, se han desarrollado numerosas aproximaciones y alternativas:
- mpDCA [ 23 ] (inferencia basada en el paso de mensajes/propagación de creencias )
- mfDCA [ 1 ] (inferencia basada en una aproximación de campo medio )
- gaussDCA [ 20 ] (inferencia basada en una aproximación gaussiana )
- plmDCA [ 3 ] (inferencia basada en pseudoverosimilitudes )
- bmDCA [ 24 ] (inferencia basada en máquinas de Boltzmann )
- Expansión adaptativa de clústeres [ 25 ]
Todos estos métodos conducen a algún tipo de estimación para el conjunto de parámetros.maximizar la probabilidad del MSA. Muchos de ellos incluyen regularización o términos previos para asegurar un problema bien planteado o promover una solución dispersa.
Aplicaciones
Predicción del contacto de residuos de proteínas
Una posible interpretación de los altos valores de acoplamiento en un modelo ajustado a un alineamiento múltiple de secuencias (AMS) de una familia de proteínas es la existencia de contactos conservados entre posiciones (residuos) en la familia. Dicho contacto puede conducir a la coevolución molecular , ya que una mutación en uno de los dos residuos, sin una mutación compensatoria en el otro, probablemente alterará la estructura de la proteína y afectará negativamente su aptitud. Por lo tanto, se espera que los pares de residuos para los que existe una fuerte presión selectiva para mantener la compatibilidad mutua muten juntos o no muten en absoluto. Esta idea (que ya se conocía en la literatura mucho antes de la concepción del DCA [ 26 ] ) se ha utilizado para predecir mapas de contacto de proteínas , por ejemplo, analizando la información mutua entre residuos de proteínas.
Dentro del marco de DCA, una puntuación para la fuerza de la interacción directa entre un par de residuosa menudo se define [ 3 ] [ 20 ] utilizando la norma de Frobeniusde la matriz de acoplamiento correspondientey aplicando una corrección del producto medio (APC):
dóndese ha definido anteriormente y
- .
Este término de corrección se introdujo por primera vez para la información mutua [ 27 ] y se utiliza para eliminar los sesgos de posiciones específicas para producir grandesTambién se han utilizado puntuaciones que son invariantes bajo transformaciones de parámetros que no afectan las probabilidades. [ 1 ] Ordenar todos los pares de residuos por esta puntuación da como resultado una lista en la que la parte superior de la lista está fuertemente enriquecida en contactos de residuos cuando se compara con el mapa de contactos de proteínas de una proteína homóloga. [ 4 ] Las predicciones de alta calidad de contactos de residuos son valiosas como información previa en la predicción de la estructura de proteínas . [ 4 ]
Inferencia de la interacción proteína-proteína
DCA puede utilizarse para detectar interacciones conservadas entre familias de proteínas y para predecir qué pares de residuos forman contactos en un complejo proteico . [ 8 ] [ 9 ] Dichas predicciones pueden utilizarse al generar modelos estructurales para estos complejos, [ 28 ] o al inferir redes de interacción proteína-proteína formadas por más de dos proteínas. [ 9 ] [ 12 ]
Modelado de paisajes de aptitud
DCA puede utilizarse para modelar paisajes de aptitud y para predecir el efecto de una mutación en la secuencia de aminoácidos de una proteína sobre su aptitud. [ 13 ] [ 14 ]
Enlaces externos
Servicios en línea:
- Acoplamientos para vehículos eléctricos
- Duendecillo
- Servicio web de DCA
- AmoAi
- ELIHKSIR
Código fuente:
- gplmDCA Archivado el 7 de marzo de 2014 en Wayback Machine
- GaussDCA
- plmDCA Archivado el 15/01/2017 en Wayback Machine
Aplicaciones útiles:
- DCA-MOL: un complemento de PyMOL para analizar los resultados de DCA en una estructura [ 29 ]
Referencias
- 1 2 3 4 5 6 7 8 Morcos, F.; Pagnani, A.; Lunt, B.; Bertolino, A.; Marks, DS; Sander, C.; Zecchina, R.; Onuchic, JN; Hwa, T.; Weigt, M. (21 de noviembre de 2011). "El análisis de acoplamiento directo de la coevolución de residuos captura contactos nativos en muchas familias de proteínas" . Actas de la Academia Nacional de Ciencias . 108 (49): E1293– E1301. arXiv : 1110.5223 . Bibcode : 2011PNAS..108E1293M . doi : 10.1073 / pnas.1111471108 . PMC 3241805. PMID 22106262 .
- ↑ Kamisetty, H.; Ovchinnikov, S.; Baker, D. (5 de septiembre de 2013). "Evaluación de la utilidad de las predicciones de contacto residuo-residuo basadas en la coevolución en una era rica en secuencias y estructuras" . Actas de la Academia Nacional de Ciencias . 110 (39): 15674– 15679. Bibcode : 2013PNAS..11015674K . doi : 10.1073/pnas.1314045110 . PMC 3785744. PMID 24009338 .
- 1 2 3 4 5 Ekeberg, Magnus; Lövkvist, Cecilia; Lan, Yueheng; Weigt, Martin; Aurell, Erik (11 de enero de 2013). "Predicción mejorada de contactos en proteínas: uso de pseudoverosimilitudes para inferir modelos de Potts". Physical Review E . 87 (1) 012707. arXiv : 1211.1281 . Bibcode : 2013PhRvE..87a2707E . doi : 10.1103/PhysRevE.87.012707 . PMID 23410359 . S2CID 27772365 .
- 1 2 3 Marks, Debora S.; Colwell, Lucy J.; Sheridan, Robert; Hopf, Thomas A.; Pagnani, Andrea; Zecchina, Riccardo; Sander, Chris; Sali, Andrej (7 de diciembre de 2011). "Estructura 3D de proteínas calculada a partir de la variación de secuencia evolutiva" . PLOS ONE . 6 (12) e28766. Bibcode : 2011PLoSO...628766M . doi : 10.1371/journal.pone.0028766 . PMC 3233603. PMID 22163331 .
- ↑ Ekeberg, Magnus; Hartonen, Tuomo; Aurell, Erik (2014-11-01). "Maximización rápida de pseudoverosimilitud para el análisis de acoplamiento directo de la estructura de proteínas a partir de muchas secuencias homólogas de aminoácidos" . Journal of Computational Physics . 276 : 341–356 . arXiv : 1401.4832 . Bibcode : 2014JCoPh.276..341E . doi : 10.1016/j.jcp.2014.07.024 . ISSN 0021-9991 . S2CID 15635703 .
- ↑ De Leonardis, Eleonora; Lutz, Benjamin; Ratz, Sebastian; Cocco, Simona; Monasson, Rémi; Schug, Alexander; Weigt, Martin (29 de septiembre de 2015). "El análisis de acoplamiento directo de la coevolución de nucleótidos facilita la predicción de la estructura secundaria y terciaria del ARN" . Nucleic Acids Research . 43 (21): 10444– 55. arXiv : 1510.03351 . doi : 10.1093/nar/gkv932 . PMC 4666395. PMID 26420827 .
- ↑ Weinreb, Caleb; Riesselman, Adam J.; Ingraham, John B.; Gross, Torsten; Sander, Chris; Marks, Debora S. (mayo de 2016). " ARN 3D e interacciones funcionales a partir de acoplamientos evolutivos" . Cell . 165 (4): 963–975 . doi : 10.1016/j.cell.2016.03.030 . PMC 5024353. PMID 27087444 .
- 1 2 Ovchinnikov, Sergey; Kamisetty, Hetunandan; Baker, David (1 de mayo de 2014). "Predicción robusta y precisa de interacciones residuo-residuo a través de interfaces de proteínas utilizando información evolutiva" . eLife . 3 e02030 . doi : 10.7554/eLife.02030 . PMC 4034769. PMID 24842992 .
- 1 2 3 Feinauer, Christoph; Szurmant, Hendrik; Weigt, Martin; Pagnani, Andrea; Keskin, Ozlem (16 de febrero de 2016). "La coevolución de secuencias interproteicas predice interacciones físicas conocidas en ribosomas bacterianos y el operón Trp" . PLOS ONE . 11 (2) e0149166. arXiv : 1512.05420 . Bibcode : 2016PLoSO..1149166F . doi : 10.1371 / journal.pone.0149166 . PMC 4755613. PMID 26882169 .
- ↑ dos Santos, RN; Morcos, F.; Jana, B.; Andricopulo, AD; Onuchic, JN (4 de septiembre de 2015). "Interacciones diméricas y formación de complejos mediante acoplamientos coevolutivos directos" . Scientific Reports . 5 13652. Bibcode : 2015NatSR...513652D . doi : 10.1038/srep13652 . PMC 4559900. PMID 26338201 .
- ↑ Uguzzoni, Guido; John Lovis, Shalini; Oteri, Francesco; Schug, Alexander; Szurmant, Hendrik; Weigt, Martin (2017-03-28). "Identificación a gran escala de señales de coevolución a través de interfaces de proteínas homo-oligoméricas mediante análisis de acoplamiento directo" . Actas de la Academia Nacional de Ciencias . 114 (13): E2662– E2671. arXiv : 1703.01246 . Bibcode : 2017PNAS..114E2662U . doi : 10.1073/pnas.1615068114 . ISSN 0027-8424 . PMC 5380090. PMID 28289198 .
- 1 2 Croce, Giancarlo; Gueudré, Thomas; Cuevas, Maria Virginia Ruiz; Keidel, Victoria; Figliuzzi, Matteo; Szurmant, Hendrik; Weigt, Martin (2019-10-21). "Un enfoque coevolutivo multiescala para predecir interacciones entre dominios proteicos" . PLOS Computational Biology . 15 (10) e1006891. Bibcode : 2019PLSCB..15E6891C . doi : 10.1371 / journal.pcbi.1006891 . ISSN 1553-7358 . PMC 6822775. PMID 31634362 .
- 1 2 Ferguson, Andrew L.; Mann, Jaclyn K.; Omarjee, Saleha; Ndung'u, Thumbi; Walker, Bruce D.; Chakraborty, Arup K. (marzo de 2013). "La traducción de secuencias del VIH a paisajes de aptitud cuantitativa predice vulnerabilidades virales para el diseño racional de inmunógenos" . Immunity . 38 (3): 606– 617. doi : 10.1016/j.immuni.2012.11.022 . PMC 3728823. PMID 23521886 .
- 1 2 Figliuzzi, Matteo; Jacquier, Hervé; Schug, Alexander; Tenaillon, Oliver; Weigt, Martin (enero de 2016). " Inferencia del paisaje coevolutivo y la dependencia del contexto de las mutaciones en la beta-lactamasa TEM-1" . Biología molecular y evolución . 33 (1): 268–280 . doi : 10.1093/molbev/msv211 . PMC 4693977. PMID 26446903 .
- ↑ Asti, Lorenzo; Uguzzoni, Guido; Marcatili, Paolo; Pagnani, Andrea; Ofran, Yanay (13 de abril de 2016). " Modelos de máxima entropía de repertorios inmunes secuenciados predicen la afinidad antígeno-anticuerpo" . PLOS Computational Biology . 12 (4) e1004870. Bibcode : 2016PLSCB..12E4870A . doi : 10.1371/journal.pcbi.1004870 . PMC 4830580. PMID 27074145 .
- ^ Russ, William P.; Figliuzzi, Matteo; Stocker, cristiano; Barrat-Charlaix, Pierre; Socolich, Michael; Kast, Peter; Hilvert, Donald; Monasson, Rémi; Cocco, Simona; Peso, Martín; Ranganathan, Rama (24 de julio de 2020). "Un modelo basado en la evolución para el diseño de enzimas corismato mutasa" . Ciencia . 369 (6502): 440– 445. Bibcode : 2020Sci...369..440R . doi : 10.1126/ciencia.aba3304 . ISSN 0036-8075 . PMID 32703877 . S2CID 220714458 .
- ↑ Rodríguez-Rivas, Juan; Croce, Giancarlo; Muscat, Maureen; Weigt, Martin (25 de enero de 2022). "Los modelos epistáticos predicen sitios mutables en proteínas y epítopos del SARS-CoV-2" . Actas de la Academia Nacional de Ciencias . 119 (4). arXiv : 2112.10093 . Bibcode : 2022PNAS..11913118R . doi : 10.1073/pnas.2113118119 . ISSN 0027-8424 . PMC 8795541. PMID 35022216 .
- ↑ Vigué, Lucile; Croce, Giancarlo; Petitjean, Marie; Ruppé, Etienne; Tenaillon, Olivier; Weigt, Martin (2022-07-12). " Descifrando el polimorfismo en 61.157 genomas de Escherichia coli a través de paisajes de secuencias epistáticas" . Nature Communications . 13 (1): 4030. Bibcode : 2022NatCo..13.4030V . doi : 10.1038/s41467-022-31643-3 . ISSN 2041-1723 . PMC 9276797. PMID 35821377 .
- ↑ Feinauer, Christoph; Skwark, Marcin J.; Pagnani, Andrea; Aurell, Erik (9 de octubre de 2014). "Mejora de la predicción de contactos en tres dimensiones" . PLOS Computational Biology . 10 (10) e1003847. arXiv : 1403.0379 . Bibcode : 2014PLSCB..10E3847F . doi : 10.1371/journal.pcbi.1003847 . PMC 4191875. PMID 25299132 .
- 1 2 3 Baldassi, Carlo; Zamparo, Marco; Feinauer, Christoph; Procaccini, Andrea; Zecchina, Riccardo; Weigt, Martin; Pagnani, Andrea (24 de marzo de 2014). "Modelado gaussiano multivariado rápido y preciso de familias de proteínas: predicción de contactos de residuos y socios de interacción de proteínas" . PLOS ONE . 9 (3) e92721. arXiv : 1404.1240 . Bibcode : 2014PLoSO...992721B . doi : 10.1371/ journal.pone.0092721 . PMC 3963956. PMID 24663061 .
- ↑ Stein, Richard R.; Marks, Debora S.; Sander, Chris; Chen, Shi-Jie (30 de julio de 2015). "Inferencia de interacciones por pares a partir de datos biológicos mediante modelos de probabilidad de máxima entropía" . PLOS Computational Biology . 11 (7) e1004182. Bibcode : 2015PLSCB..11E4182S . doi : 10.1371/journal.pcbi.1004182 . PMC 4520494. PMID 26225866 .
- ↑ Burger, Lukas; van Nimwegen, Erik; Bourne, Philip E. (1 de enero de 2010). "Disentangling Direct from Indirect Co-Evolution of Residues in Protein Alignments" . PLOS Computational Biology . 6 (1) e1000633. Bibcode : 2010PLSCB...6E0633B . doi : 10.1371/journal.pcbi.1000633 . PMC 2793430. PMID 20052271 .
- ↑ Weigt, M.; White, RA; Szurmant, H.; Hoch, JA; Hwa, T. (30 de diciembre de 2008). "Identificación de contactos directos de residuos en la interacción proteína-proteína mediante paso de mensajes" . Actas de la Academia Nacional de Ciencias . 106 (1): 67– 72. arXiv : 0901.1248 . Bibcode : 2009PNAS..106...67W . doi : 10.1073 /pnas.0805923106 . PMC 2629192. PMID 19116270 .
- ↑ Figliuzzi, Matteo; Barrat-Charlaix, Pierre; Weigt, Martin (1 de abril de 2018). "¿Cómo capturan los modelos coevolutivos por pares la variabilidad colectiva de residuos en las proteínas?". Biología molecular y evolución . 35 (4): 1018– 1027. arXiv : 1801.04184 . doi : 10.1093/molbev/msy007 .
- ↑ Barton, JP; De Leonardis, E.; Coucke, A.; Cocco, S. (21 de junio de 2016). "ACE: expansión adaptativa de clústeres para la inferencia de modelos gráficos de máxima entropía" . Bioinformatics . 32 (20): 3089–3097 . doi : 10.1093/bioinformatics/btw328 . PMID 27329863 .
- ↑ Göbel, Ulrike; Sander, Chris; Schneider, Reinhard; Valencia, Alfonso (abril de 1994). "Mutaciones correlacionadas y contactos de residuos en proteínas". Proteins : Structure, Function, and Genetics . 18 (4): 309– 317. doi : 10.1002/prot.340180402 . PMID 8208723. S2CID 14978727 .
- ↑ Dunn, SD; Wahl, LM; Gloor, GB (5 de diciembre de 2007). "La información mutua sin la influencia de la filogenia o la entropía mejora drásticamente la predicción de contactos entre residuos" . Bioinformatics . 24 (3): 333– 340. doi : 10.1093/bioinformatics/btm604 . PMID 18057019 .
- ↑ Schug, A.; Weigt, M.; Onuchic, JN; Hwa, T.; Szurmant, H. (17 de diciembre de 2009). "Complejos proteicos de alta resolución a partir de la integración de información genómica con simulación molecular" . Actas de la Academia Nacional de Ciencias . 106 (52): 22124– 22129. Bibcode : 2009PNAS..10622124S . doi : 10.1073/pnas.0912100106 . PMC 2799721. PMID 20018738 .
- ↑ Jarmolinska, Aleksandra I.; Zhou, Qin; Sulkowska, Joanna I. ; Morcos, Faruck (11 de enero de 2019). "DCA-MOL: Un complemento de PyMOL para analizar acoplamientos evolutivos directos". Journal of Chemical Information and Modeling . 59 (2): 625– 629. doi : 10.1021/acs.jcim.8b00690 . PMID 30632747 . S2CID 58634008 .
- Bioinformática