En biología molecular , el alineamiento de proteínas , también conocido como reconocimiento de plegamiento , es un método de modelado de proteínas que se utiliza para modelar aquellas proteínas que tienen el mismo plegamiento que proteínas de estructura conocida , pero que no tienen proteínas homólogas con estructura conocida. Se diferencia del método de modelado por homología para la predicción de estructuras, ya que el alineamiento de proteínas se utiliza para proteínas cuyas estructuras homólogas no están depositadas en el Protein Data Bank (PDB), mientras que el modelado por homología se utiliza para aquellas proteínas que sí las tienen. El alineamiento funciona utilizando el conocimiento estadístico de la relación entre las estructuras depositadas en el PDB y la secuencia de la proteína que se desea modelar.
La predicción se realiza mediante el "alineamiento" (es decir, la colocación) de cada aminoácido de la secuencia objetivo en una posición de la estructura plantilla, y evaluando qué tan bien se ajusta la secuencia objetivo a la plantilla. Una vez seleccionada la plantilla que mejor se ajusta, se construye el modelo estructural de la secuencia basándose en el alineamiento con la plantilla elegida. El alineamiento de proteínas se basa en dos observaciones fundamentales: que el número de plegamientos diferentes en la naturaleza es relativamente pequeño (aproximadamente 1300); y que el 90 % de las nuevas estructuras enviadas a la base de datos PDB en los últimos tres años tienen plegamientos estructurales similares a los que ya se encuentran en la base de datos PDB.
Clasificación de la estructura de las proteínas
La base de datos de Clasificación Estructural de Proteínas (SCOP) proporciona una descripción detallada y completa de las relaciones estructurales y evolutivas de las estructuras conocidas. Las proteínas se clasifican para reflejar tanto su parentesco estructural como evolutivo. Existen muchos niveles en la jerarquía, pero los principales son familia , superfamilia y plegamiento.
- Familia (relación evolutiva clara): Las proteínas agrupadas en familias están claramente relacionadas evolutivamente. Generalmente, esto significa que la identidad de residuos entre pares de proteínas es del 30 % o superior. Sin embargo, en algunos casos, funciones y estructuras similares proporcionan evidencia definitiva de descendencia común en ausencia de una alta identidad de secuencia; por ejemplo, muchas globinas forman una familia aunque algunos miembros tengan identidades de secuencia de tan solo el 15 %.
- Superfamilia (probable origen evolutivo común): Las proteínas con baja identidad de secuencia, pero cuyas características estructurales y funcionales sugieren un probable origen evolutivo común, se agrupan en superfamilias. Por ejemplo, la actina , el dominio ATPasa de la proteína de choque térmico y la hexoquinasa forman una superfamilia.
- Plegamiento (similitud estructural principal): Se define que las proteínas tienen un plegamiento común si poseen las mismas estructuras secundarias principales en la misma disposición y con las mismas conexiones topológicas. Diferentes proteínas con el mismo plegamiento suelen tener elementos periféricos de estructura secundaria y regiones de giro que difieren en tamaño y conformación. En algunos casos, estas regiones periféricas diferentes pueden constituir la mitad de la estructura. Las proteínas agrupadas en la misma categoría de plegamiento pueden no tener un origen evolutivo común: las similitudes estructurales podrían surgir simplemente de la física y la química de las proteínas, que favorecen ciertas disposiciones de empaquetamiento y topologías de cadena.
Método
Un paradigma general de enhebrado de proteínas consta de los siguientes cuatro pasos:
- La construcción de una base de datos de plantillas estructurales : Seleccionar estructuras de proteínas de las bases de datos de estructuras de proteínas como plantillas estructurales. Esto generalmente implica seleccionar estructuras de proteínas de bases de datos como Protein Data Bank (PDB), Families of Structural Similar Proteins (FSSP), Structural Classification of Proteins (SCOP) o CATH , después de eliminar las estructuras de proteínas con alta similitud de secuencia.
- Diseño de la función de puntuación: Diseñe una función de puntuación adecuada para medir la compatibilidad entre secuencias objetivo y plantillas, basándose en el conocimiento de las relaciones conocidas entre las estructuras y las secuencias. Una buena función de puntuación debe incluir el potencial de mutación, el potencial de compatibilidad ambiental, el potencial de interacción por pares, la compatibilidad de la estructura secundaria y las penalizaciones por huecos. La calidad de la función de energía está estrechamente relacionada con la precisión de la predicción, especialmente con la precisión de la alineación.
- Alineación de secuencias: Alinea la secuencia objetivo con cada una de las plantillas de estructura optimizando la función de puntuación diseñada. Este paso es una de las tareas principales de todos los programas de predicción de estructuras basados en alineamiento que tienen en cuenta el potencial de contacto entre pares; de lo contrario, un algoritmo de programación dinámica puede realizarlo.
- Predicción de alineación: Seleccione la alineación que sea estadísticamente más probable como predicción de alineación. Luego, construya un modelo estructural para la secuencia objetivo colocando los átomos del esqueleto de la secuencia objetivo en sus posiciones alineadas con la plantilla estructural seleccionada.
Comparación con el modelado por homología
El modelado por homología y el alineamiento de proteínas son métodos basados en plantillas y no existe una distinción rigurosa entre ellos en cuanto a técnicas de predicción. Sin embargo, las estructuras proteicas de sus objetivos son diferentes. El modelado por homología se utiliza para aquellos objetivos que tienen proteínas homólogas con estructura conocida (generalmente/posiblemente de la misma familia), mientras que el alineamiento de proteínas se utiliza para aquellos objetivos en los que solo se ha encontrado homología a nivel de plegamiento. En otras palabras, el modelado por homología se utiliza para objetivos más "fáciles" y el alineamiento de proteínas para objetivos más "difíciles".
El modelado por homología trata la plantilla en un alineamiento como una secuencia, y solo se utiliza la homología de secuencia para la predicción. El enhebrado de proteínas trata la plantilla en un alineamiento como una estructura, y tanto la información de secuencia como la de estructura extraídas del alineamiento se utilizan para la predicción. Cuando no se encuentra una homología significativa, el enhebrado de proteínas puede realizar una predicción basada en la información de la estructura. Esto también explica por qué el enhebrado de proteínas puede ser más eficaz que el modelado por homología en muchos casos.
En la práctica, cuando la identidad de secuencia en un alineamiento de secuencias es baja (es decir, <25%), el modelado por homología puede no generar una predicción significativa. En este caso, si se encuentra una homología distante para la secuencia objetivo, el enhebrado de proteínas puede generar una buena predicción.
Más información sobre el enhebrado
Los métodos de reconocimiento de plegamiento se pueden dividir en dos tipos principales: aquellos que derivan un perfil unidimensional para cada estructura en la biblioteca de plegamiento y alinean la secuencia objetivo con estos perfiles; y aquellos que consideran la estructura tridimensional completa de la proteína plantilla. Un ejemplo sencillo de representación de perfil sería tomar cada aminoácido en la estructura y simplemente etiquetarlo según esté enterrado en el núcleo de la proteína o expuesto en la superficie. Los perfiles más elaborados podrían tener en cuenta la estructura secundaria local (por ejemplo, si el aminoácido forma parte de una hélice alfa ) o incluso información evolutiva (cuán conservado está el aminoácido). En la representación tridimensional, la estructura se modela como un conjunto de distancias interatómicas, es decir, las distancias se calculan entre algunos o todos los pares de átomos en la estructura. Esta es una descripción mucho más rica y flexible de la estructura, pero es mucho más difícil de usar para calcular un alineamiento. El método de reconocimiento de plegamiento basado en perfiles fue descrito por primera vez por Bowie, Lüthy y David Eisenberg en 1991. [ 1 ] El término «enhebrado» fue acuñado por primera vez por David Jones , William R. Taylor y Janet Thornton en 1992, [ 2 ] y originalmente se refería específicamente al uso de una representación atómica de la estructura 3D completa de la plantilla de proteína en el reconocimiento de plegamiento. Hoy en día, los términos «enhebrado» y «reconocimiento de plegamiento» se usan frecuentemente (aunque de forma algo incorrecta) indistintamente.
Los métodos de reconocimiento de plegamiento proteico son ampliamente utilizados y eficaces porque se cree que existe un número estrictamente limitado de plegamientos proteicos diferentes en la naturaleza, principalmente como resultado de la evolución, pero también debido a las restricciones impuestas por la física y la química básicas de las cadenas polipeptídicas. Por lo tanto, existe una alta probabilidad (actualmente del 70-80%) de que una proteína con un plegamiento similar a la proteína objetivo ya haya sido estudiada mediante cristalografía de rayos X o espectroscopia de resonancia magnética nuclear (RMN) y se encuentre en la base de datos PDB. Actualmente se conocen cerca de 1300 plegamientos proteicos diferentes, pero cada año se siguen descubriendo nuevos plegamientos, en gran parte gracias a los proyectos de genómica estructural en curso .
Se han propuesto numerosos algoritmos para determinar la correcta alineación de una secuencia en una estructura, aunque muchos utilizan programación dinámica de alguna forma. Para la alineación tridimensional completa, identificar la mejor alineación resulta muy difícil (es un problema NP-difícil para algunos modelos de alineación). Los investigadores han empleado diversos métodos de optimización combinatoria, como campos aleatorios condicionales , recocido simulado , ramificación y acotación , y programación lineal , en busca de soluciones heurísticas. Es interesante comparar los métodos de alineación con los que intentan alinear dos estructuras proteicas ( alineación estructural de proteínas ), y de hecho, muchos de los mismos algoritmos se han aplicado a ambos problemas.
Software de enhebrado de proteínas
- HHpred es un popular servidor multihilo que ejecuta HHsearch , un software ampliamente utilizado para la detección remota de homología basada en la comparación por pares de modelos ocultos de Markov .
- RAPTOR es un software de alineación de proteínas basado en programación entera. Ha sido reemplazado por un nuevo programa de alineación de proteínas, RaptorX , que emplea modelos gráficos probabilísticos e inferencia estadística para la alineación de proteínas tanto con una sola plantilla como con múltiples plantillas. [ 3 ] [ 4 ] [ 5 ] [ 6 ] RaptorX supera significativamente a RAPTOR y es especialmente bueno alineando proteínas con perfiles de secuencia dispersos. El servidor RaptorX es gratuito.
- Phyre es un popular servidor multihilo que combina HHsearch con modelado ab initio y de plantillas múltiples.
- MUSTER es un algoritmo de enhebrado estándar basado en programación dinámica y alineación de perfiles de secuencia. También combina múltiples recursos estructurales para facilitar la alineación de perfiles de secuencia. [ 7 ]
- SPARKS X es un método probabilístico de comparación de secuencias a estructuras entre las propiedades estructurales unidimensionales predichas de la consulta y las propiedades nativas correspondientes de las plantillas. [ 8 ]
- BioShell es un algoritmo de enhebrado que utiliza un algoritmo de programación dinámica de perfil a perfil optimizado combinado con la estructura secundaria predicha. [ 9 ]
Véase también
Referencias
- ↑ Bowie JU, Lüthy R, Eisenberg D (1991). "Un método para identificar secuencias de proteínas que se pliegan en una estructura tridimensional conocida". Science . 253 (5016): 164– 170. Bibcode : 1991Sci...253..164B . doi : 10.1126/science.1853201 . PMID 1853201 .
- ↑ Jones DT, Taylor WR, Thornton JM (1992). "Un nuevo enfoque para el reconocimiento del plegamiento de proteínas". Nature . 358 ( 6381): 86– 89. Bibcode : 1992Natur.358...86J . doi : 10.1038/358086a0 . PMID 1614539. S2CID 4266346 .
- ↑ Peng, Jian; Jinbo Xu (2011). "RaptorX: aprovechamiento de la información estructural para el alineamiento de proteínas mediante inferencia estadística" . Proteins . 79 Suppl 10 (Suppl 10): 161–171 . doi : 10.1002/prot.23175 . PMC 3226909. PMID 21987485 .
- ↑ Peng, Jian; Jinbo Xu (2010). "Enhebrado de proteínas de baja homología" . Bioinformatics . 26 (12): i294– i300. doi : 10.1093/bioinformatics/btq192 . PMC 2881377. PMID 20529920 .
- ↑ Peng, Jian; Jinbo Xu (abril de 2011). "Un enfoque de plantillas múltiples para el enhebrado de proteínas" . Proteins . 79 ( 6): 1930–1939 . doi : 10.1002/prot.23016 . PMC 3092796. PMID 21465564 .
- ↑ Ma, Jianzhu; Sheng Wang; Jinbo Xu (junio de 2012). "Un modelo de campos neuronales condicionales para el enhebrado de proteínas" . Bioinformatics . 28 (12): i59–66. doi : 10.1093/bioinformatics/bts213 . PMC 3371845. PMID 22689779 .
- ↑ Wu S, Zhang Y (2008). "MUSTER: Mejora de los alineamientos de perfiles de secuencias de proteínas mediante el uso de múltiples fuentes de información estructural" . Proteins . 72 ( 2): 547– 56. doi : 10.1002/prot.21945 . PMC 2666101. PMID 18247410 .
- ↑ Yang Y, Faraggi E, Zhao H, Zhou Y (2011). "Mejora del reconocimiento del plegamiento de proteínas y el modelado basado en plantillas mediante el empleo de una coincidencia probabilística entre las propiedades estructurales unidimensionales predichas de la consulta y las propiedades nativas correspondientes de las plantillas" . Bioinformatics . 27 (15): 2076–2082 . doi : 10.1093/bioinformatics/btr350 . PMC 3137224. PMID 21666270 .
- ↑ Gront D, Blaszczyk M, Wojciechowski P, Kolinski A (2012). "BioShell Threader: detección de homología de proteínas basada en perfiles de secuencia y perfiles de estructura secundaria" . Nucleic Acids Research . 40 (W1): W257– W262. doi : 10.1093/nar/gks555 . PMC 3394251. PMID 22693216 .
Lecturas adicionales
- Finkelstein, AV; Reva, BA (junio de 1991). "Una búsqueda de los pliegues más estables de las cadenas proteicas". Nature . 351 ( 6326): 497–9 . Bibcode : 1991Natur.351..497F . doi : 10.1038/351497a0 . PMID 2046752. S2CID 4319142 .
- Lathrop RH (1994). "El problema del enhebrado de proteínas con preferencias de interacción de aminoácidos de secuencia es NP-completo". Protein Eng . 7 (9): 1059– 1068. CiteSeerX 10.1.1.367.9081 . doi : 10.1093/protein/7.9.1059 . PMID 7831276 .
- Jones DT, Hadley C (2000). "Métodos de alineación para la predicción de la estructura de proteínas". En Higgins D, Taylor WR (eds.). Bioinformática: Secuencia, estructura y bases de datos . Heidelberg: Springer-Verlag. pp. 1–13 .
- Xu J, Li M, Kim D, Xu Y (2003). "RAPTOR: Optimal Protein Threading by Linear Programming, the inaugural issue". J Bioinform Comput Biol . 1 (1): 95– 117. CiteSeerX 10.1.1.5.4844 . doi : 10.1142/S0219720003000186 . PMID 15290783 .
- Xu J, Li M, Lin G, Kim D, Xu Y (2003). "Alineamiento de proteínas mediante programación lineal". Pac Symp Biocomput : 264–275 . PMID 12603034 .
- Métodos de proteínas
- Bioinformática
- problemas NP-completos