Articulo de referencia

Análisis de acoplamiento estadístico

El análisis de acoplamiento estadístico (SCA) es un método utilizado en bioinformática para estudiar cómo evolucionan conjuntamente pares de aminoácidos en una secuencia proteic...

El análisis de acoplamiento estadístico (SCA) es un método utilizado en bioinformática para estudiar cómo evolucionan conjuntamente pares de aminoácidos en una secuencia proteica . Analiza un alineamiento múltiple de secuencias (MSA), que es una representación de las secuencias de muchas proteínas relacionadas, organizadas para resaltar similitudes y diferencias. El SCA mide cuánto cambia la composición de aminoácidos en una posición de la proteína cuando se altera la composición de aminoácidos en otra posición. Esta relación se cuantifica como energía de acoplamiento estadístico . Una mayor energía de acoplamiento indica que es más probable que los aminoácidos en ambas posiciones hayan coevolucionado y, por lo tanto, estén vinculados funcional o estructuralmente. En términos más sencillos, ayuda a los científicos a comprender qué partes de una proteína trabajan juntas y cómo han cambiado a lo largo del tiempo evolutivo. [ 1 ]

Definición de energía de acoplamiento estadístico

La energía de acoplamiento estadístico mide cómo una perturbación de la distribución de aminoácidos en un sitio de un MSA afecta la distribución de aminoácidos en otro sitio. Por ejemplo, consideremos un alineamiento de secuencias múltiples con sitios (o columnas) de la a a la z , donde cada sitio tiene una distribución de aminoácidos. En la posición i , el 60% de las secuencias tienen valina y el 40% restante tienen leucina ; en la posición j , la distribución es 40% isoleucina , 40% histidina y 20% metionina ; k tiene una distribución promedio (los 20 aminoácidos están presentes aproximadamente con las mismas frecuencias que se observan en todas las proteínas); y l tiene 80% histidina y 20% valina. Dado que las posiciones i , j y l tienen una distribución de aminoácidos diferente de la distribución media observada en todas las proteínas, se dice que tienen cierto grado de conservación .

En el análisis de acoplamiento estadístico, la conservación (ΔG stat ) en cada sitio ( i ) se define como:ΔGRAMOistat=incógnita(lnPAGiincógnita)2{\displaystyle \Delta G_{i}^{stat}={\sqrt {\sum _{x}(\ln P_{i}^{x})^{2}}}}. [ 2 ]

Aquí, P i x describe la probabilidad de encontrar el aminoácido x en la posición i , y se define mediante una función en forma binomial de la siguiente manera:

PAGiincógnita=norte¡norteincógnita¡(nortenorteincógnita)¡pagincógnitanorteincógnita(1pagincógnita)nortenorteincógnita{\displaystyle P_{i}^{x}={\frac {N!}{n_{x}!(N-n_{x})!}}p_{x}^{n_{x}}(1-p_{x})^{N-n_{x}}},

donde N es 100, n x es el porcentaje de secuencias con el residuo x (por ejemplo, metionina) en la posición i , y p x corresponde a la distribución aproximada del aminoácido x en todas las posiciones entre todas las proteínas secuenciadas. La suma se extiende a los 20 aminoácidos. Después de calcular ΔG i stat , se toma la conservación para la posición i en un subalineamiento producido después de una perturbación de la distribución de aminoácidos en j (ΔG i | δj stat ). La energía de acoplamiento estadístico, denotada ΔΔG i, j stat , es simplemente la diferencia entre estos dos valores. Es decir:

ΔΔGRAMOi,jstat=ΔGRAMOi|δjstatΔGRAMOistat{\displaystyle \Delta \Delta G_{i,j}^{stat}=\Delta G_{i|\delta j}^{stat}-\Delta G_{i}^{stat}}o, más comúnmente,ΔΔGRAMOi,jstat=incógnita(lnPAGi|δjincógnitalnPAGiincógnita)2{\displaystyle \Delta \Delta G_{i,j}^{stat}={\sqrt {\sum _{x}(\ln P_{i|\delta j}^{x}-\ln P_{i}^{x})^{2}}}}

La energía de acoplamiento estadístico se calcula sistemáticamente entre una posición fija y perturbada y todas las demás posiciones en un MSA. Siguiendo con el ejemplo del MSA del principio de la sección, consideremos una perturbación en la posición j donde la distribución de aminoácidos cambia de 40% I, 40% H, 20% M a 100% I. Si, en un subalineamiento posterior, esto cambia la distribución en i de 60% V, 40% L a 90% V, 10% L, pero no cambia la distribución en la posición l , entonces habría cierta cantidad de energía de acoplamiento estadístico entre i y j , pero ninguna entre l y j .

Aplicaciones

Ranganathan y Lockless desarrollaron originalmente el SCA para examinar el acoplamiento termodinámico (energético) de pares de residuos en proteínas. [ 3 ] Utilizando la familia de dominios PDZ , pudieron identificar una pequeña red de residuos que estaban acoplados energéticamente a un residuo del sitio de unión. La red consistía tanto en residuos espacialmente cercanos al sitio de unión en el pliegue terciario, llamados pares de contacto, como en residuos más distantes que participan en interacciones energéticas de mayor alcance. Aplicaciones posteriores del SCA por parte del grupo de Ranganathan en las familias de GPCR , serina proteasa y hemoglobina también mostraron acoplamiento energético en redes dispersas de residuos que cooperan en la comunicación alostérica . [ 4 ]

El análisis de acoplamiento estadístico también se ha utilizado como base para el diseño computacional de proteínas. En 2005, Socolich et al. [ 5 ] utilizaron un SCA para el dominio WW para crear proteínas artificiales con estabilidad termodinámica y estructura similares a los dominios WW naturales. El hecho de que 12 de las 43 proteínas diseñadas con el mismo perfil SCA que los dominios WW naturales se plegaran correctamente proporcionó una fuerte evidencia de que se requería poca información —solo información de acoplamiento— para especificar el plegamiento de la proteína. Este apoyo a la hipótesis del SCA se hizo más convincente considerando que a) las proteínas plegadas con éxito tenían solo un 36% de identidad de secuencia promedio con los plegamientos WW naturales, y b) ninguna de las proteínas artificiales diseñadas sin información de acoplamiento se plegó correctamente. Un estudio complementario mostró que los dominios WW artificiales eran funcionalmente similares a los dominios WW naturales en afinidad y especificidad de unión al ligando . [ 6 ]

En la predicción de la estructura de proteínas de novo , se ha demostrado que, cuando se combina con una métrica simple de distancia residuo-residuo, la puntuación basada en SCA puede distinguir con bastante precisión los plegamientos de proteínas nativos de los no nativos. [ 7 ]

Véase también

Información mutua

  • ¿Qué es un dominio WW?
  • Conferencia de Ranganathan sobre análisis de acoplamiento estadístico (audio incluido)
  • ¿Plegamiento de proteínas: un paso más cerca? - Resumen del diseño de dominios WW artificiales pero funcionales realizado por el laboratorio de Ranganathan, basado en la tecnología SCA.

Referencias

  1. "Material complementario para 'Las redes de residuos conservadas evolutivamente median la comunicación alostérica en las proteínas'."" .
  2. Dekker; Fodor, A; Aldrich, RW; Yellen, G; et al. (2004). "Un método basado en perturbaciones para calcular la probabilidad explícita de covarianza evolutiva en alineamientos de secuencias múltiples" . Bioinformatics . 20 (10): 1565– 1572. doi : 10.1093/bioinformatics/bth128 . PMID 14962924 .  
  3. Lockless SW, Ranaganathan R (1999). "Vías de conectividad energética conservadas evolutivamente en familias de proteínas". Science . 286 (5438): 295– 299. doi : 10.1126/science.286.5438.295 . PMID 10514373 . 
  4. Suel; Lockless, SW; Wall, MA; Ranganathan, R; et al. (2003). "Redes de residuos conservadas evolutivamente median la comunicación alostérica en proteínas". Nature Structural Biology . 10 (1): 59– 69. doi : 10.1038/nsb881 . PMID 12483203. S2CID 67749580 .   
  5. Socolich; Lockless, SW; Russ, WP; Lee, H; Gardner, KH; Ranganathan, R; et al. (2005). "Información evolutiva para especificar un plegamiento de proteína". Nature . 437 (7058): 512– 518. Bibcode : 2005Natur.437..512S . doi : 10.1038/nature03991 . PMID 16177782 . S2CID 4363255 .   
  6. Russ; Lowery, DM; Mishra, P; Yaffe, MB; Ranganathan, R; et al. (2005). "Función similar a la natural en dominios WW artificiales". Nature . 437 (7058): 579– 583. Bibcode : 2005Natur.437..579R . doi : 10.1038/nature03990 . PMID 16177795 . S2CID 4424336 .   
  7. Bartlett GJ, Taylor WR (2008). "Uso de puntuaciones derivadas del análisis de acoplamiento estadístico para distinguir pliegues correctos e incorrectos en la predicción de la estructura de proteínas de novo" . Proteins . 71 ( 1): 950– 959. doi : 10.1002/prot.21779 . PMID 18004776. S2CID 33836866 .  {{cite journal}}: CS1 maint: servicio de archivado obsoleto ( enlace )