Los sitios I son motivos cortos de secuencia-estructura extraídos del Protein Data Bank (PDB) que se correlacionan fuertemente con elementos estructurales tridimensionales. Estos motivos de secuencia-estructura se utilizan para la predicción de la estructura local de las proteínas. La estructura local puede expresarse como fragmentos o como ángulos del esqueleto. Las ubicaciones en la secuencia de la proteína que tienen predicciones de sitios I de alta confianza pueden ser los sitios de inicio del plegamiento . Los sitios I también se han identificado como modelos discretos para las vías de plegamiento. Los sitios I constan de aproximadamente 250 motivos. Cada motivo tiene un perfil de aminoácidos, una estructura de fragmento (representada por un fragmento "paradigma" elegido de una proteína en el PDB) y, opcionalmente, un tensor de 4 dimensiones de covarianza de secuencia por pares.
Construcción de la biblioteca I-site
La base de datos de secuencias y estructuras
La base de datos constaba inicialmente de 471 familias de secuencias de proteínas de la base de datos HSSP, con un promedio de 47 secuencias alineadas por familia. Cada familia contenía una única estructura conocida (parental) del Banco de Datos de Proteínas de Brookhaven. Estas eran un subconjunto de la lista PDBSelect-25, con una identidad de secuencia no superior al 25 % entre cualquier par de alineamientos. Se omitieron los bucles desordenados. Se ignoraron los huecos e inserciones en la secuencia.
Agrupación de segmentos de secuencia
Cada posición en la base de datos se describe mediante una frecuencia ponderada de aminoácidos. Una medida de similitud en el espacio de secuencias entre un segmento (p) y un grupo de segmentos (q) se define como:
donde Pij(p) es la frecuencia del aminoácido i en la posición j dentro del segmento p. Nq es el número de segmentos de secuencia k en el clúster q. Fi es la frecuencia del tipo de aminoácido i en la base de datos en general. Los valores óptimos de a y a0 se determinaron empíricamente como 0,5 y 15, respectivamente. Utilizando esta medida de similitud, los segmentos de una longitud dada (de 3 a 15) se agruparon mediante el algoritmo k-means .
Evaluación de la estructura dentro de un grupo; elección de paradigma.
La similitud estructural entre dos segmentos peptídicos cualesquiera se evaluó utilizando una combinación del error de matriz de distancia RMS (dme):
donde ai->j es la distancia entre los átomos de carbono α i y j en el segmento s1 de longitud L, y la desviación máxima en los ángulos de torsión de la cadena principal (mda) a lo largo de la longitud del segmento viene dada por:
La estructura paradigmática para un clúster se seleccionó de los 20 segmentos con mayor puntuación en la base de datos, como aquel con la menor suma de valores mda respecto a los otros 19. Se probaron otras medidas estructurales antes de decantarse por estas dos: desviación cuadrática media (RMSD) de los átomos de carbono α, dme por sí solo y un filtro estructural que buscaba contactos conservados específicos. Este último funcionó mejor para discriminar entre verdaderos y falsos positivos, pero no se podía automatizar fácilmente. Se descubrió que la RMSD y el dme eran discriminadores deficientes de los dos tipos de tapa de hélice. El filtro combinado mda-dme simula mejor el filtro de contactos conservados y se calcula rápidamente.
Referencias
Bystroff, C; Baker, D (1998). "Predicción de la estructura local en proteínas utilizando una biblioteca de motivos de secuencia-estructura" (PDF) . Journal of Molecular Biology . 281 (3): 565– 77. CiteSeerX 10.1.1.125.3690 . doi : 10.1006/jmbi.1998.1943 . PMID 9698570 .
Enlaces externos
- Biblioteca de I-sites archivada el 28/03/2012 en Wayback Machine.
- Servidor de predicción I-sites/HMMSTR
- motivos estructurales de proteínas