
El modelado por homología , también conocido como modelado comparativo de proteínas, se refiere a la construcción de un modelo de resolución atómica de la proteína " objetivo " a partir de su secuencia de aminoácidos y una estructura tridimensional experimental de una proteína homóloga relacionada (la " plantilla "). El modelado por homología se basa en la identificación de una o más estructuras proteicas conocidas que probablemente se asemejen a la estructura de la secuencia de consulta, y en la producción de una alineación de secuencias que mapea los residuos de la secuencia de consulta con los residuos de la secuencia plantilla. Se ha observado que las estructuras proteicas están más conservadas que las secuencias proteicas entre homólogos, pero las secuencias con una identidad de secuencia inferior al 20 % pueden tener estructuras muy diferentes. [ 1 ]
Las proteínas evolutivamente relacionadas tienen secuencias similares y las proteínas homólogas que se encuentran en la naturaleza tienen estructuras proteicas similares. Se ha demostrado que la estructura tridimensional de las proteínas está evolutivamente más conservada de lo que cabría esperar basándose únicamente en la conservación de la secuencia. [ 2 ]
La alineación de secuencias y la estructura de la plantilla se utilizan posteriormente para producir un modelo estructural del objetivo. Dado que las estructuras proteicas están más conservadas que las secuencias de ADN, los niveles detectables de similitud de secuencias suelen implicar una similitud estructural significativa. [ 3 ]
La calidad del modelo de homología depende de la calidad del alineamiento de secuencias y de la estructura de la plantilla. El enfoque puede complicarse por la presencia de huecos de alineamiento (comúnmente llamados indels) que indican una región estructural presente en la proteína diana pero no en la plantilla, y por huecos estructurales en la plantilla que surgen de la baja resolución en el procedimiento experimental (generalmente cristalografía de rayos X ) utilizado para resolver la estructura. La calidad del modelo disminuye con la disminución de la identidad de secuencia ; un modelo típico tiene una desviación cuadrática media de ~1–2 Å entre los átomos C α coincidentes con un 70 % de identidad de secuencia, pero solo una concordancia de 2–4 Å con un 25 % de identidad de secuencia. Sin embargo, los errores son significativamente mayores en las regiones de bucle, donde las secuencias de aminoácidos de las proteínas diana y plantilla pueden ser completamente diferentes.
Las regiones del modelo que se construyeron sin una plantilla, generalmente mediante modelado de bucles , suelen ser mucho menos precisas que el resto del modelo. Los errores en el empaquetamiento y la posición de las cadenas laterales también aumentan con la disminución de la identidad, y se ha sugerido que las variaciones en estas configuraciones de empaquetamiento son una razón importante de la mala calidad del modelo con baja identidad. [ 4 ] En conjunto, estos diversos errores de posición atómica son significativos e impiden el uso de modelos de homología para propósitos que requieren datos de resolución atómica, como el diseño de fármacos y las predicciones de interacción proteína-proteína ; incluso la estructura cuaternaria de una proteína puede ser difícil de predecir a partir de modelos de homología de su(s) subunidad(es). Sin embargo, los modelos de homología pueden ser útiles para llegar a conclusiones cualitativas sobre la bioquímica de la secuencia de consulta, especialmente para formular hipótesis sobre por qué se conservan ciertos residuos, lo que a su vez puede conducir a experimentos para probar esas hipótesis. Por ejemplo, la disposición espacial de los residuos conservados puede sugerir si un residuo en particular se conserva para estabilizar el plegamiento, para participar en la unión de alguna molécula pequeña o para fomentar la asociación con otra proteína o ácido nucleico . [ 5 ]
El modelado por homología puede producir modelos estructurales de alta calidad cuando el objetivo y la plantilla están estrechamente relacionados, lo que ha inspirado la formación de un consorcio de genómica estructural dedicado a la producción de estructuras experimentales representativas para todas las clases de plegamientos de proteínas. [ 6 ] Las principales imprecisiones en el modelado por homología, que empeoran con una menor identidad de secuencia , se derivan de errores en el alineamiento de secuencia inicial y de una selección de plantilla inadecuada. [ 7 ] Al igual que otros métodos de predicción de estructura, la práctica actual en el modelado por homología se evalúa en un experimento bienal a gran escala conocido como Evaluación Crítica de Técnicas para la Predicción de Estructura de Proteínas, o Evaluación Crítica de la Predicción de Estructura ( CASP ).
Motivo
El método de modelado por homología se basa en la observación de que la estructura terciaria de las proteínas se conserva mejor que la secuencia de aminoácidos . [ 3 ] Por lo tanto, incluso las proteínas que han divergido apreciablemente en su secuencia, pero que aún comparten similitud detectable, también compartirán propiedades estructurales comunes, en particular el plegamiento general. Dado que es difícil y laborioso obtener estructuras experimentales mediante métodos como la cristalografía de rayos X y la RMN de proteínas para cada proteína de interés, el modelado por homología puede proporcionar modelos estructurales útiles para generar hipótesis sobre la función de una proteína y orientar trabajos experimentales posteriores.
Existen excepciones a la regla general de que las proteínas que comparten una identidad de secuencia significativa compartirán un plegamiento. Por ejemplo, un conjunto de mutaciones cuidadosamente seleccionadas que afecten a menos del 50 % de una proteína puede hacer que esta adopte un plegamiento completamente diferente. [ 8 ] [ 9 ] Sin embargo, es improbable que se produzca una reorganización estructural tan masiva en la evolución , especialmente porque la proteína suele estar sujeta a la restricción de que debe plegarse correctamente y cumplir su función en la célula. En consecuencia, la estructura plegada aproximada de una proteína (su "topología") se conserva durante más tiempo que su secuencia de aminoácidos y mucho más tiempo que la secuencia de ADN correspondiente; en otras palabras, dos proteínas pueden compartir un plegamiento similar incluso si su relación evolutiva es tan distante que no se puede discernir con fiabilidad. En comparación, la función de una proteína se conserva mucho menos que la secuencia de la proteína, ya que se requieren relativamente pocos cambios en la secuencia de aminoácidos para asumir una función relacionada.
Pasos en la producción del modelo
El procedimiento de modelado por homología se puede dividir en cuatro pasos secuenciales: selección de plantilla, alineación objetivo-plantilla, construcción del modelo y evaluación del modelo. [ 3 ] Los dos primeros pasos suelen realizarse de forma conjunta, ya que los métodos más comunes para identificar plantillas se basan en la producción de alineaciones de secuencias; sin embargo, estas alineaciones pueden no ser de la calidad suficiente, dado que las técnicas de búsqueda en bases de datos priorizan la velocidad sobre la calidad de la alineación. Estos procesos pueden realizarse de forma iterativa para mejorar la calidad del modelo final, aunque las evaluaciones de calidad que no dependen de la estructura objetivo real aún están en desarrollo.
Optimizar la velocidad y la precisión de estos pasos para su uso en la predicción automatizada de estructuras a gran escala es un componente clave de las iniciativas de genómica estructural, en parte porque el volumen de datos resultante será demasiado grande para procesarlo manualmente y en parte porque el objetivo de la genómica estructural requiere proporcionar modelos de calidad razonable a investigadores que no son expertos en predicción de estructuras. [ 3 ]
Selección de plantillas y alineación de secuencias
El primer paso crítico en el modelado por homología es la identificación de la mejor estructura plantilla, si es que existe alguna disponible. El método más simple de identificación de plantillas se basa en alineamientos de secuencias por pares en serie, asistidos por técnicas de búsqueda en bases de datos como FASTA y BLAST . Los métodos más sensibles basados en alineamientos de secuencias múltiples , de los cuales PSI-BLAST es el ejemplo más común, actualizan iterativamente su matriz de puntuación específica de posición para identificar sucesivamente homólogos más distantemente relacionados. Se ha demostrado que esta familia de métodos produce un mayor número de plantillas potenciales e identifica mejores plantillas para secuencias que solo tienen relaciones distantes con cualquier estructura resuelta. El enhebrado de proteínas , [ 10 ] también conocido como reconocimiento de plegamiento o alineación 3D-1D, también puede utilizarse como técnica de búsqueda para identificar plantillas que se utilizarán en los métodos tradicionales de modelado por homología. [ 3 ] Experimentos recientes de CASP indican que algunos métodos de enhebrado de proteínas, como RaptorX, son más sensibles que los métodos puramente basados en secuencias (perfiles) cuando solo se dispone de plantillas distantemente relacionadas para las proteínas bajo predicción. Al realizar una búsqueda BLAST, un primer enfoque fiable consiste en identificar coincidencias con un valor E suficientemente bajo , que se consideran suficientemente cercanas en evolución como para generar un modelo de homología fiable. Otros factores pueden inclinar la balanza en casos marginales; por ejemplo, la plantilla puede tener una función similar a la de la secuencia de consulta, o puede pertenecer a un operón homólogo . Sin embargo, una plantilla con un valor E bajo generalmente no debe elegirse, incluso si es la única disponible, ya que podría tener una estructura incorrecta, lo que llevaría a la producción de un modelo erróneo. Un enfoque mejor es enviar la secuencia primaria a servidores de reconocimiento de plegamiento [ 10 ] o, mejor aún, a metaservidores de consenso que mejoran los servidores de reconocimiento de plegamiento individuales al identificar similitudes (consenso) entre predicciones independientes.
A menudo, estos enfoques identifican varias estructuras candidatas a plantillas. Aunque algunos métodos pueden generar modelos híbridos con mayor precisión a partir de múltiples plantillas, [ 10 ] [ 11 ] la mayoría se basa en una sola plantilla. Por lo tanto, elegir la mejor plantilla entre las candidatas es un paso clave y puede afectar significativamente la precisión final de la estructura. Esta elección está guiada por varios factores, como la similitud de las secuencias de consulta y plantilla, de sus funciones y de las estructuras secundarias predichas de la consulta y observadas de la plantilla . Quizás lo más importante sea la cobertura de las regiones alineadas: la fracción de la estructura de la secuencia de consulta que se puede predecir a partir de la plantilla y la plausibilidad del modelo resultante. Así, a veces se producen varios modelos de homología para una sola secuencia de consulta, y el candidato más probable se elige solo en el paso final.
Es posible utilizar la alineación de secuencias generada por la técnica de búsqueda en la base de datos como base para la producción del modelo posterior; sin embargo, también se han explorado enfoques más sofisticados. Una propuesta genera un conjunto de alineaciones por pares definidas estocásticamente entre la secuencia objetivo y una única plantilla identificada como un medio para explorar el "espacio de alineación" en regiones de secuencia con baja similitud local. [ 12 ] Alineaciones "perfil-perfil" que primero generan un perfil de secuencia del objetivo y lo comparan sistemáticamente con los perfiles de secuencia de estructuras resueltas; se cree que el grano grueso inherente a la construcción del perfil reduce el ruido introducido por la deriva de secuencia en regiones no esenciales de la secuencia. [ 13 ]
Generación de modelos
Dada una plantilla y una alineación, la información contenida en ellas debe utilizarse para generar un modelo estructural tridimensional del objetivo, representado como un conjunto de coordenadas cartesianas para cada átomo de la proteína. Se han propuesto tres clases principales de métodos de generación de modelos. [ 14 ] [ 15 ]
Ensamblaje de fragmentos
El método original de modelado por homología se basaba en el ensamblaje de un modelo completo a partir de fragmentos estructurales conservados identificados en estructuras resueltas estrechamente relacionadas. Por ejemplo, un estudio de modelado de serina proteasas en mamíferos identificó una clara distinción entre regiones estructurales "centrales" conservadas en todas las estructuras experimentales de la clase, y regiones variables típicamente ubicadas en los bucles donde se localizaba la mayoría de las diferencias de secuencia. Así, las proteínas no resueltas podían modelarse construyendo primero el núcleo conservado y luego sustituyendo regiones variables de otras proteínas en el conjunto de estructuras resueltas. [ 16 ] Las implementaciones actuales de este método difieren principalmente en la forma en que manejan las regiones que no están conservadas o que carecen de una plantilla. [ 17 ] Las regiones variables a menudo se construyen con la ayuda de una biblioteca de fragmentos de proteínas .
Coincidencia de segmentos
El método de alineación de segmentos divide la proteína diana en una serie de segmentos cortos, cada uno de los cuales se compara con su propia plantilla ajustada del Protein Data Bank . De este modo, la alineación de secuencias se realiza sobre segmentos en lugar de sobre la proteína completa. La selección de la plantilla para cada segmento se basa en la similitud de secuencia, las comparaciones de las coordenadas de los carbonos alfa y los conflictos estéricos predichos que surgen de los radios de van der Waals de los átomos divergentes entre la proteína diana y la plantilla. [ 18 ]
Satisfacción de las restricciones espaciales
El método de modelado por homología más común actualmente se inspira en los cálculos necesarios para construir una estructura tridimensional a partir de datos generados por espectroscopia de RMN . Se utilizan uno o más alineamientos objetivo-plantilla para construir un conjunto de criterios geométricos que luego se convierten en funciones de densidad de probabilidad para cada restricción. Las restricciones aplicadas a las coordenadas internas principales de la proteína ( distancias del esqueleto proteico y ángulos diedros ) sirven como base para un procedimiento de optimización global que originalmente utilizaba la minimización de energía por gradiente conjugado para refinar iterativamente las posiciones de todos los átomos pesados de la proteína. [ 19 ]
Este método se ha ampliado drásticamente para aplicarse específicamente al modelado de bucles, que puede ser extremadamente difícil debido a la alta flexibilidad de los bucles en las proteínas en solución acuosa . [ 20 ] Una expansión más reciente aplica el modelo de restricción espacial a mapas de densidad electrónica derivados de estudios de criomicroscopía electrónica , que proporcionan información de baja resolución que generalmente no es suficiente para generar modelos estructurales de resolución atómica. [ 21 ] Para abordar el problema de las imprecisiones en la alineación inicial de la secuencia objetivo-plantilla, también se ha introducido un procedimiento iterativo para refinar la alineación en función del ajuste estructural inicial. [ 22 ] El software más utilizado en el modelado basado en restricciones espaciales es MODELLER y se ha establecido una base de datos llamada ModBase para modelos fiables generados con él. [ 23 ]
Modelado de bucles
Las regiones de la secuencia objetivo que no están alineadas con una plantilla se modelan mediante modelado de bucles ; son las más susceptibles a errores de modelado importantes y ocurren con mayor frecuencia cuando el objetivo y la plantilla tienen baja identidad de secuencia. Las coordenadas de las secciones no coincidentes determinadas por los programas de modelado de bucles son generalmente mucho menos precisas que las obtenidas simplemente copiando las coordenadas de una estructura conocida, particularmente si el bucle es más largo de 10 residuos. Los dos primeros ángulos diedros de la cadena lateral (χ 1 y χ 2 ) generalmente se pueden estimar dentro de 30° para una estructura de la cadena principal precisa; sin embargo, los ángulos diedros posteriores que se encuentran en cadenas laterales más largas como la lisina y la arginina son notoriamente difíciles de predecir. Además, pequeños errores en χ 1 (y, en menor medida, en χ 2 ) pueden causar errores relativamente grandes en las posiciones de los átomos en el extremo de la cadena lateral; dichos átomos a menudo tienen una importancia funcional, particularmente cuando se encuentran cerca del sitio activo .
Evaluación del modelo
Se han desarrollado numerosos métodos para seleccionar una estructura similar a la nativa a partir de un conjunto de modelos. Las funciones de puntuación se han basado en funciones de energía de mecánica molecular (Lazaridis y Karplus 1999; Petrey y Honig 2000; Feig y Brooks 2002; Felts et al. 2002; Lee y Duan 2004), potenciales estadísticos (Sippl 1995; Melo y Feytmans 1998; Samudrala y Moult 1998; Rojnuckarin y Subramaniam 1999; Lu y Skolnick 2001; Wallqvist et al. 2002; Zhou y Zhou 2002), entornos de residuos (Luthy et al. 1992; Eisenberg et al. 1997; Park et al. 1997; Summa et al. 2005), interacciones locales de cadenas laterales y esqueleto (Fang y Shortle 2005), propiedades dependientes de la orientación (Buchete et al. 2004a,b; Hamelryck 2005), estimaciones de empaquetamiento (Berglund et al. 2004), energía de solvatación (Petrey y Honig 2000; McConkey et al. 2003; Wallner y Elofsson 2003; Berglund et al. 2004), enlaces de hidrógeno (Kortemme et al. 2003) y propiedades geométricas (Colovos y Yeates 1993; Kleywegt 2000; Lovell et al. 2003; Mihalek et al. 2003). Diversos métodos combinan diferentes potenciales para obtener una puntuación global, generalmente mediante una combinación lineal de términos (Kortemme et al. 2003; Tosatto 2005) o con la ayuda de técnicas de aprendizaje automático, como redes neuronales (Wallner y Elofsson 2003) y máquinas de vectores de soporte (SVM) (Eramian et al. 2006). En trabajos recientes de Pettitt et al. (2005), Tosatto (2005) y Eramian et al. (2006) se pueden encontrar comparaciones de diferentes programas de evaluación de la calidad de modelos globales.
Se han publicado menos estudios sobre la evaluación de la calidad local de los modelos. Las puntuaciones locales son importantes en el contexto del modelado, ya que permiten estimar la fiabilidad de diferentes regiones de una estructura predicha. Esta información puede utilizarse para determinar qué regiones deben refinarse, cuáles deben considerarse para el modelado mediante múltiples plantillas y cuáles deben predecirse desde cero. La información sobre la calidad del modelo local también podría utilizarse para reducir el problema combinatorio al considerar alineamientos alternativos; por ejemplo, al puntuar diferentes modelos locales por separado, se necesitarían menos modelos (suponiendo que las interacciones entre las distintas regiones sean insignificantes o puedan estimarse por separado).
Uno de los métodos de puntuación local más utilizados es Verify3D (Luthy et al. 1992; Eisenberg et al. 1997), que combina la estructura secundaria, la accesibilidad al disolvente y la polaridad de los entornos de los residuos. ProsaII (Sippl 1993), que se basa en una combinación de un potencial estadístico por pares y un término de solvatación, también se aplica ampliamente en la evaluación de modelos. Otros métodos incluyen el programa Errat (Colovos y Yeates 1993), que considera las distribuciones de átomos no enlazados según el tipo de átomo y la distancia, y el método de tensión energética (Maiorov y Abagyan 1998), que utiliza las diferencias de las energías promedio de los residuos en diferentes entornos para indicar qué partes de una estructura proteica podrían ser problemáticas. Melo y Feytmans (1998) utilizan un potencial atómico por pares y un potencial de solvatación basado en la superficie (ambos basados en el conocimiento) para evaluar estructuras proteicas. Aparte del método de deformación energética, que es un enfoque semiempírico basado en el campo de fuerza ECEPP3 (Nemethy et al. 1992), todos los métodos locales mencionados anteriormente se basan en potenciales estadísticos. Un enfoque conceptualmente distinto es el método ProQres, introducido recientemente por Wallner y Elofsson (2006). ProQres se basa en una red neuronal que combina características estructurales para distinguir las regiones correctas de las incorrectas. Se demostró que ProQres supera a las metodologías anteriores basadas en enfoques estadísticos (Verify3D, ProsaII y Errat). Los datos presentados en el estudio de Wallner y Elofsson sugieren que su enfoque de aprendizaje automático basado en características estructurales es, de hecho, superior a los métodos basados en estadísticas. Sin embargo, los métodos basados en el conocimiento examinados en su trabajo, Verify3D (Luthy et al. 1992; Eisenberg et al. 1997), Prosa (Sippl 1993) y Errat (Colovos y Yeates 1993), no se basan en potenciales estadísticos más recientes.
Evaluación comparativa
Se han realizado varios esfuerzos de evaluación comparativa a gran escala para evaluar la calidad relativa de diversos métodos actuales de modelado por homología. La Evaluación Crítica de la Predicción de Estructuras ( CASP ) es un experimento de predicción a nivel comunitario que se lleva a cabo cada dos años durante los meses de verano y desafía a los equipos de predicción a presentar modelos estructurales para varias secuencias cuyas estructuras se han resuelto experimentalmente recientemente, pero que aún no se han publicado. Su socio, la Evaluación Crítica de la Predicción de Estructuras Totalmente Automatizada ( CAFASP ), se ha ejecutado en paralelo con CASP, pero solo evalúa modelos producidos mediante servidores totalmente automatizados. Los experimentos de ejecución continua que no tienen "temporadas" de predicción se centran principalmente en la evaluación comparativa de servidores web disponibles públicamente. LiveBench y EVA se ejecutan continuamente para evaluar el rendimiento de los servidores participantes en la predicción de estructuras de próxima publicación del PDB. CASP y CAFASP sirven principalmente como evaluaciones del estado del arte en el modelado, mientras que las evaluaciones continuas buscan evaluar la calidad del modelo que obtendría un usuario no experto empleando herramientas disponibles públicamente.
Exactitud
La precisión de las estructuras generadas por modelado por homología depende en gran medida de la identidad de secuencia entre el objetivo y la plantilla. Por encima del 50 % de identidad de secuencia, los modelos tienden a ser fiables, con solo errores menores en el empaquetamiento de las cadenas laterales y el estado rotamérico , y una RMSD global entre la estructura modelada y la experimental que se sitúa alrededor de 1 Å . Este error es comparable a la resolución típica de una estructura resuelta por RMN. En el rango de identidad del 30-50 %, los errores pueden ser más graves y a menudo se localizan en bucles. Por debajo del 30 % de identidad, se producen errores graves, que a veces dan lugar a una predicción errónea del plegamiento básico. [ 14 ] Esta región de baja identidad se suele denominar la "zona crepuscular", dentro de la cual el modelado por homología es extremadamente difícil y para la que posiblemente sea menos adecuado que los métodos de reconocimiento de plegamiento . [ 24 ]
Con identidades de secuencia elevadas, la principal fuente de error en el modelado por homología proviene de la elección de la plantilla o plantillas en las que se basa el modelo, mientras que identidades más bajas presentan errores graves en el alineamiento de secuencias que inhiben la producción de modelos de alta calidad. [ 7 ] Se ha sugerido que el principal impedimento para la producción de modelos de calidad son las deficiencias en el alineamiento de secuencias, ya que los alineamientos estructurales "óptimos" entre dos proteínas de estructura conocida pueden utilizarse como entrada para los métodos de modelado actuales para producir reproducciones bastante precisas de la estructura experimental original. [ 25 ]
Se han realizado intentos para mejorar la precisión de los modelos de homología construidos con métodos existentes sometiéndolos a simulación de dinámica molecular con el fin de mejorar su RMSD respecto a la estructura experimental. Sin embargo, las parametrizaciones actuales del campo de fuerza pueden no ser suficientemente precisas para esta tarea, ya que los modelos de homología utilizados como estructuras iniciales para la dinámica molecular tienden a producir estructuras ligeramente peores. [ 26 ] Se han observado pequeñas mejoras en los casos en que se utilizaron restricciones significativas durante la simulación. [ 27 ]
Fuentes de error
Las dos fuentes de error más comunes y de mayor escala en el modelado por homología son la mala selección de plantillas y las imprecisiones en el alineamiento de secuencias objetivo-plantilla. [ 7 ] [ 28 ] Controlar estos dos factores mediante el uso de un alineamiento estructural , o un alineamiento de secuencias producido a partir de la comparación de dos estructuras resueltas, reduce drásticamente los errores en los modelos finales; estos alineamientos de "estándar de oro" pueden usarse como entrada para los métodos de modelado actuales para producir reproducciones bastante precisas de la estructura experimental original. [ 25 ] Los resultados del experimento CASP más reciente sugieren que los métodos de "consenso" que recopilan los resultados del reconocimiento de múltiples pliegues y búsquedas de alineamiento múltiple aumentan la probabilidad de identificar la plantilla correcta; de manera similar, el uso de múltiples plantillas en el paso de construcción del modelo puede ser peor que el uso de una sola plantilla correcta, pero mejor que el uso de una sola subóptima. [ 28 ] Los errores de alineamiento pueden minimizarse mediante el uso de un alineamiento múltiple incluso si solo se usa una plantilla, y mediante el refinamiento iterativo de regiones locales de baja similitud. [ 3 ] [ 12 ] Una fuente menor de errores del modelo son los errores en la estructura de la plantilla. El PDBREPORT Archivado el 31 de mayo de 2007 en la base de datos Wayback Machine enumera varios millones de errores, en su mayoría muy pequeños pero ocasionalmente dramáticos, en estructuras experimentales (plantilla) que se han depositado en el PDB .
Pueden surgir errores locales graves en los modelos de homología cuando una mutación por inserción o deleción , o un hueco en una estructura resuelta, da como resultado una región de la secuencia objetivo para la que no existe una plantilla correspondiente. Este problema puede minimizarse mediante el uso de múltiples plantillas, pero el método se complica por las diferentes estructuras locales de las plantillas alrededor del hueco y por la probabilidad de que una región faltante en una estructura experimental también falte en otras estructuras de la misma familia de proteínas. Las regiones faltantes son más comunes en bucles , donde la alta flexibilidad local aumenta la dificultad de resolver la región mediante métodos de determinación de la estructura. Aunque incluso con una sola plantilla se proporciona cierta orientación mediante el posicionamiento de los extremos de la región faltante, cuanto más largo sea el hueco, más difícil será modelarlo. En algunos casos, los bucles de hasta aproximadamente 9 residuos pueden modelarse con una precisión moderada si la alineación local es correcta. [ 3 ] Las regiones más grandes a menudo se modelan individualmente utilizando técnicas de predicción de estructura ab initio , aunque este enfoque solo ha tenido éxito aislado. [ 29 ]
Los estados rotaméricos de las cadenas laterales y su disposición de empaquetamiento interno también presentan dificultades en el modelado por homología, incluso en objetivos para los que la estructura del esqueleto es relativamente fácil de predecir. Esto se debe en parte a que muchas cadenas laterales en las estructuras cristalinas no se encuentran en su estado rotamérico "óptimo" como resultado de factores energéticos en el núcleo hidrofóbico y en el empaquetamiento de las moléculas individuales en un cristal de proteína. [ 30 ] Un método para abordar este problema requiere buscar en una biblioteca rotamérica para identificar combinaciones de estados de empaquetamiento localmente de baja energía. [ 31 ] Se ha sugerido que una razón importante por la que el modelado por homología es tan difícil cuando la identidad de secuencia objetivo-plantilla es inferior al 30% es que dichas proteínas tienen plegamientos ampliamente similares pero disposiciones de empaquetamiento de cadenas laterales muy divergentes. [ 4 ]
Utilidad
Los usos de los modelos estructurales incluyen la predicción de interacciones proteína-proteína , el acoplamiento proteína-proteína , el acoplamiento molecular y la anotación funcional de genes identificados en el genoma de un organismo . [ 32 ] Incluso los modelos de homología de baja precisión pueden ser útiles para estos propósitos, porque sus imprecisiones tienden a ubicarse en los bucles de la superficie de la proteína, que normalmente son más variables incluso entre proteínas estrechamente relacionadas. Las regiones funcionales de la proteína, especialmente su sitio activo , tienden a estar más conservadas y, por lo tanto, se modelan con mayor precisión. [ 14 ]
Los modelos de homología también pueden utilizarse para identificar diferencias sutiles entre proteínas relacionadas cuyas estructuras aún no se han resuelto por completo. Por ejemplo, el método se utilizó para identificar sitios de unión de cationes en la Na + /K + ATPasa y para proponer hipótesis sobre la afinidad de unión de diferentes ATPasas. [ 33 ] Utilizados junto con simulaciones de dinámica molecular , los modelos de homología también pueden generar hipótesis sobre la cinética y la dinámica de una proteína, como en estudios de la selectividad iónica de un canal de potasio . [ 34 ] Se ha intentado realizar un modelado automatizado a gran escala de todas las regiones codificantes de proteínas identificadas en un genoma para la levadura Saccharomyces cerevisiae , lo que dio como resultado casi 1000 modelos de calidad para proteínas cuyas estructuras aún no se habían determinado en el momento del estudio, e identificó nuevas relaciones entre 236 proteínas de levadura y otras estructuras previamente resueltas. [ 35 ]
Véase también
Referencias
- ↑ Chothia, C; Lesk, AM (1986). " La relación entre la divergencia de secuencia y estructura en las proteínas" . EMBO J. 5 ( 4): 823–6 . doi : 10.1002/j.1460-2075.1986.tb04288.x . PMC 1166865. PMID 3709526 .
- ↑ Kaczanowski, S; Zielenkiewicz, P (2010). "¿Por qué secuencias de proteínas similares codifican estructuras tridimensionales similares?" (PDF) . Theoretical Chemistry Accounts . 125 ( 3–6 ): 643–50 . doi : 10.1007/s00214-009-0656-3 . S2CID 95593331 .
- 1 2 3 4 5 6 7 Marti-Renom, MA; Stuart, AC; Fiser, A; Sanchez, R; Melo, F; Sali, A. (2000). "Modelado comparativo de la estructura de proteínas de genes y genomas" . Annu Rev Biophys Biomol Struct . 29 : 291–325 . doi : 10.1146/annurev.biophys.29.1.291 . PMID 10940251. S2CID 11498685 .
- 1 2 Chung SY, Subbiah S. (1996.) Una explicación estructural para la zona crepuscular de la homología de secuencias de proteínas. Structure 4: 1123–27.
- ↑ Yousif, Ragheed Hussam, et al. "Explorando las interacciones moleculares entre la neoculina y los receptores del gusto dulce humanos mediante enfoques computacionales." Sains Malaysiana 49.3 (2020): 517-525. APA
- ↑ Williamson AR (2000). "Creación de un consorcio de genómica estructural" . Nat Struct Biol . 7 (S1(11s)): 953. doi : 10.1038/80726 . PMID 11103997. S2CID 35185565 .
- 1 2 3 Venclovas C, Margeleviĉius M (2005). "Modelado comparativo en CASP6 utilizando un enfoque de consenso para la selección de plantillas, alineación de secuencia-estructura y evaluación de la estructura". Proteins . 61 (S7): 99– 105. doi : 10.1002/prot.20725 . PMID 16187350 . S2CID 45345271 .
- ↑ Dalal, S; Balasubramanian, S; Regan, L (1997). "Transmutación de hélices alfa y láminas beta" . Fold Des . 2 (5): R71–9. doi : 10.1016/s1359-0278(97)00036-9 . PMID 9377709 .
- ↑ Dalal, S; Balasubramanian, S; Regan, L. (1997). "Alquimia de proteínas: transformando la lámina beta en hélice alfa". Nat Struct Biol . 4 (7): 548– 52. doi : 10.1038/nsb0797-548 . PMID 9228947. S2CID 5608132 .
- 1 2 3 Peng, Jian; Jinbo Xu (2011). " RaptorX: Explotación de información estructural para alineación de proteínas mediante inferencia estadística" . Proteins . 79 (Supl. 10): 161–71 . doi : 10.1002/prot.23175 . PMC 3226909. PMID 21987485 .
- ↑ Peng, Jian; Jinbo Xu (abril de 2011). "un enfoque de plantillas múltiples para el enhebrado de proteínas" . Proteins . 79 ( 6): 1930– 1939. doi : 10.1002/prot.23016 . PMC 3092796. PMID 21465564 .
- 1 2 Muckstein, U; Hofacker, IL; Stadler, PF (2002). "Alineamientos estocásticos por pares" . Bioinformática . 18 (Supl. 2): S153–60. doi : 10.1093/bioinformatics/18.suppl_2.S153 . PMID 12385998 .
- ↑ Rychlewski, L; Zhang, B; Godzik, A. (1998). "Predicciones de plegamiento y función para proteínas de Mycoplasma genitalium". Fold Des . 3 (4): 229– 38. doi : 10.1016/S1359-0278(98)00034-0 . PMID 9710568 .
- 1 2 3 Baker, D; Sali, A (2001). "Predicción de la estructura de proteínas y genómica estructural". Science . 294 (5540): 93– 96. Bibcode : 2001Sci...294...93B . doi : 10.1126/science.1065659 . PMID 11588250 . S2CID 7193705 .
- ↑ Zhang Y (2008). " Avances y desafíos en la predicción de la estructura de proteínas" . Curr Opin Struct Biol . 18 (3): 342– 348. doi : 10.1016/j.sbi.2008.02.004 . PMC 2680823. PMID 18436442 .
- ↑ Greer, J. (1981). "Construcción de modelos comparativos de las serina proteasas de mamíferos". Journal of Molecular Biology . 153 (4): 1027– 42. doi : 10.1016/0022-2836(81)90465-4 . PMID 7045378 .
- ↑ Wallner, B; Elofsson, A (2005). "No todos son iguales: una evaluación comparativa de diferentes programas de modelado por homología" . Protein Science . 14 (5): 1315– 1327. doi : 10.1110/ps.041253405 . PMC 2253266. PMID 15840834 .
- ↑ Levitt, M. (1992). "Modelado preciso de la conformación de proteínas mediante coincidencia automática de segmentos" . J Mol Biol . 226 (2): 507–33 . doi : 10.1016/0022-2836(92)90964-L . PMID 1640463 .
- ↑ Sali, A; Blundell, TL. (1993). "Modelado comparativo de proteínas mediante la satisfacción de restricciones espaciales". J Mol Biol . 234 (3): 779– 815. doi : 10.1006/jmbi.1993.1626 . PMID 8254673 .
- ↑ Fiser, A; Sali, A. (2003). "ModLoop: modelado automatizado de bucles en estructuras proteicas" . Bioinformatics . 19 (18): 2500– 1. doi : 10.1093/bioinformatics/btg362 . PMID 14668246 .
- ↑ Topf, M; Baker, ML; Marti-Renom, MA; Chiu, W; Sali, A. (2006). "Refinamiento de estructuras proteicas mediante modelado comparativo iterativo y ajuste de densidad por crio-EM". J Mol Biol . 357 (5): 1655– 68. doi : 10.1016/j.jmb.2006.01.062 . PMID 16490207 .
- ↑ John, B; Sali, A. (2003). "Modelado comparativo de la estructura de proteínas mediante alineación iterativa, construcción de modelos y evaluación de modelos" . Nucleic Acids Res . 31 (14): 3982– 92. doi : 10.1093/nar/gkg460 . PMC 165975. PMID 12853614 .
- ↑ Ursula Pieper, Narayanan Eswar, Hannes Braberg, MS Madhusudhan, Fred Davis, Ashley C. Stuart, Nebojsa Mirkovic, Andrea Rossi, Marc A. Marti-Renom, Andras Fiser, Ben Webb, Daniel Greenblatt, Conrad Huang, Tom Ferrin, Andrej Sali. MODBASE, una base de datos de modelos de estructura proteica comparativos anotados y recursos asociados. Nucleic Acids Res 32, D217-D222, 2004.
- ↑ Blake, JD; Cohen, FE. (2001). "Alineación de secuencias por pares por debajo de la zona crepuscular". J Mol Biol . 307 (2): 721–35 . doi : 10.1006/jmbi.2001.4495 . PMID 11254392 .
- 1 2 Zhang, Y; Skolnick, J. (2005). "El problema de la predicción de la estructura de proteínas podría resolverse utilizando la biblioteca PDB actual" . Proc . Natl. Acad. Sci. USA . 102 (4): 1029– 34. Bibcode : 2005PNAS..102.1029Z . doi : 10.1073/pnas.0407152101 . PMC 545829. PMID 15653774 .
- ↑ Koehl, P; Levitt, M. (1999). "Un futuro más brillante para la predicción de la estructura de las proteínas". Nat Struct Biol . 6 (2): 108– 11. doi : 10.1038/5794 . PMID 10048917. S2CID 3162636 .
- ↑ Flohil, JA; Vriend, G; Berendsen, HJ. (2002). "Completación y refinamiento de modelos de homología 3-D con dinámica molecular restringida: aplicación a los objetivos 47, 58 y 111 en la competición de modelado CASP y análisis posterior". Proteins . 48 (4): 593– 604. doi : 10.1002/prot.10105 . PMID 12211026 . S2CID 11280977 .
- 1 2 Ginalski, K. (2006). "Modelado comparativo para la predicción de la estructura de proteínas". Curr Opin Struct Biol . 16 (2): 172– 7. doi : 10.1016/j.sbi.2006.02.003 . PMID 16510277 .
- ↑ Kryshtafovych A, Venclovas C, Fidelis K, Moult J. (2005). Avances durante la primera década de experimentos CASP. Proteins 61(S7):225–36.
- ↑ Vasquez, M. (1996). "Modelado de la conformación de la cadena lateral". Curr Opin Struct Biol . 6 (2): 217– 21. doi : 10.1016/S0959-440X(96)80077-7 . PMID 8728654 .
- ↑ Wilson, C; Gregoret, LM; Agard, DA. (1993). "Modelado de la conformación de la cadena lateral para proteínas homólogas mediante una búsqueda de rotámeros basada en energía". J Mol Biol . 229 (4): 996– 1006. doi : 10.1006/jmbi.1993.1100 . PMID 8445659 .
- ^ Gopal, S; Schroeder, M; Pieper, U; Sczyrba, A; Aytekin-Kurban, G; Bekiranov, S; Fajardo, JE; Eswar, N; Sánchez, R; et al. (2001). "La anotación basada en homología produce 1.042 nuevos genes candidatos en el genoma de Drosophila melanogaster". Nat Genet . 27 (3): 337– 40. doi : 10.1038/85922 . PMID 11242120 . S2CID 2144435 .
- ↑ Ogawa, H; Toyoshima, C. (2002). "Modelado por homología de los sitios de unión de cationes de la Na+K+-ATPasa" . Proc Natl Acad Sci USA . 99 (25): 15977– 15982. Bibcode : 2002PNAS...9915977O . doi : 10.1073/pnas.202622299 . PMC 138550. PMID 12461183 .
- ↑ Capener, CE; Shrivastava, IH; Ranatunga, KM; Forrest, LR; Smith, GR; Sansom, MSP (2000). "Modelado por homología y estudios de simulación de dinámica molecular de un canal de potasio rectificador interno" . Biophys J. 78 ( 6): 2929– 2942. Bibcode : 2000BpJ....78.2929C . doi : 10.1016/ S0006-3495 (00)76833-0 . PMC 1300878. PMID 10827973 .
- ↑ Sánchez, R; Sali, A. (1998). "Modelado de la estructura proteica a gran escala del genoma de Saccharomyces cerevisiae" . Proc Natl Acad Sci USA . 95 (23): 13597– 13602. Bibcode : 1998PNAS...9513597S . doi : 10.1073/pnas.95.23.13597 . PMC 24864. PMID 9811845 .
- Bioinformática
- Métodos de proteínas
- Estructura de las proteínas