Articulo de referencia

CS-BLAST

CS-BLAST [ 1 ] [ 2 ] [ 3 ] (BLAST específico de contexto) es una herramienta que busca una secuencia de proteína que extiende BLAST (herramienta básica de búsqueda de alineación...

CS-BLAST [ 1 ] [ 2 ] [ 3 ] (BLAST específico de contexto) es una herramienta que busca una secuencia de proteína que extiende BLAST (herramienta básica de búsqueda de alineación local) , [ 4 ] utilizando probabilidades de mutación específicas de contexto. Más específicamente, CS-BLAST deriva similitudes de aminoácidos específicas de contexto en cada secuencia de consulta a partir de ventanas cortas en las secuencias de consulta. El uso de CS-BLAST duplica la sensibilidad y mejora significativamente la calidad de alineación sin una pérdida de velocidad en comparación con BLAST. CSI-BLAST (BLAST iterado específico de contexto) es el análogo específico de contexto de PSI-BLAST [ 5 ] (BLAST iterado específico de posición), que calcula el perfil de mutación con probabilidades de sustitución y lo mezcla con el perfil de consulta. CSI-BLAST (BLAST iterado específico de contexto) es el análogo específico de contexto de PSI-BLAST (BLAST iterado específico de posición). Ambos programas están disponibles como servidor web y se pueden descargar gratuitamente.

Fondo

La homología es la relación entre estructuras o secuencias biológicas derivadas de un ancestro común. Las proteínas homólogas (proteínas que tienen un ancestro común) se infieren a partir de su similitud de secuencia. Inferir relaciones homólogas implica calcular puntuaciones de pares alineados menos penalizaciones por huecos. Alinear pares de proteínas identifica regiones de similitud que indican una relación entre las dos o más proteínas. Para que exista una relación homóloga, la suma de las puntuaciones de todos los pares alineados de aminoácidos o nucleótidos debe ser suficientemente alta [2]. Los métodos estándar de comparación de secuencias utilizan una matriz de sustitución para lograr esto [4]. Las similitudes entre aminoácidos o nucleótidos se cuantifican en estas matrices de sustitución. La puntuación de sustitución (S{\displaystyle S}) de aminoácidosa{\displaystyle a}yb{\displaystyle b}¿Podemos escribirlo de la siguiente manera?

S(a,b)=doonortest×registro(PAG(a|b)PAG(a)){\displaystyle S(a,b)=const\times \log \left({\frac {P(a|b)}{P(a)}}\right)}

dóndePAG(a|b){\displaystyle P(a|b)}denota la probabilidad de aminoácidoa{\displaystyle a}mutando en aminoácidob{\displaystyle b}[2]. En un conjunto grande de alineamientos de secuencias, contar el número de aminoácidos así como el número de pares alineados(a,b){\displaystyle (a,b)}te permitirá derivar las probabilidadesPAG(a|b){\displaystyle P(a|b)}yPAG(a){\displaystyle P(a)}.

Dado que las secuencias de proteínas necesitan mantener una estructura estable, las probabilidades de sustitución de un residuo están determinadas en gran medida por el contexto estructural en el que se encuentra. Por consiguiente, las matrices de sustitución se entrenan para contextos estructurales. Dado que la información de contexto se codifica en las probabilidades de transición entre estados, la combinación de probabilidades de mutación de matrices de sustitución ponderadas para los estados correspondientes logra una mejor calidad de alineación en comparación con las matrices de sustitución estándar. CS-BLAST perfecciona aún más este concepto. La figura ilustra la equivalencia secuencia a secuencia y perfil a secuencia con la matriz de alineación. El perfil de consulta resulta de las mutaciones artificiales en las que la altura de las barras es proporcional a las probabilidades de aminoácidos correspondientes.

(AQUÍ DEBE IR UNA FIGURA, ESTE ES EL PIE DE FOTO) “Los algoritmos de búsqueda/alineación de secuencias encuentran la ruta que maximiza la suma de las puntuaciones de similitud (codificadas por colores de azul a rojo). Las puntuaciones de la matriz de sustitución son equivalentes a las puntuaciones del perfil si el perfil de secuencia (histograma de color) se genera a partir de la secuencia de consulta mediante la adición de mutaciones artificiales con el esquema de pseudoconteo de la matriz de sustitución. Las alturas de las barras del histograma representan la fracción de aminoácidos en las columnas del perfil”.

Actuación

CS-BLAST mejora notablemente la calidad de la alineación en todo el rango de identidades de secuencia, especialmente para alineaciones difíciles, en comparación con BLAST convencional y PSI-BLAST. PSI-BLAST (BLAST iterativo específico de posición) se ejecuta a una velocidad similar por iteración que BLAST convencional, pero es capaz de detectar similitudes de secuencia más débiles que aún son biológicamente relevantes. La calidad de la alineación se basa en la sensibilidad y la precisión de la misma.

Calidad de alineación

La sensibilidad de alineación se mide comparando correctamente las alineaciones predichas de pares de residuos con el número total de pares alineables posibles. Esto se calcula con la fracción: (pares correctamente alineados)/(pares estructuralmente alineables).

La precisión de la alineación se mide por la corrección de los pares de residuos alineados. Esto se calcula con la fracción: (pares correctamente alineados)/(pares alineados).

Rendimiento de búsqueda

El gráfico representa el punto de referencia que Biegert y Söding utilizaron para evaluar la detección de homología. Este punto de referencia compara CS-BLAST con BLAST, utilizando verdaderos positivos de la misma superfamilia frente a falsos positivos de pares de diferentes pliegues. (AQUÍ DEBE IR UN GRÁFICO)

El otro gráfico detecta los verdaderos positivos (con una escala diferente a la del gráfico anterior) y los falsos positivos de PSI-BLAST y CSI-BLAST, y compara ambos durante entre una y cinco iteraciones. (Aquí debe ir otro gráfico).

CS-BLAST ofrece una sensibilidad y calidad de alineación mejoradas en la comparación de secuencias. Las búsquedas de secuencias con CS-BLAST son más del doble de sensibles que BLAST. Produce alineaciones de mayor calidad y genera valores E fiables sin pérdida de velocidad. CS-BLAST detecta un 139 % más de proteínas homólogas con una tasa de error acumulada del 20 %. Con una tasa de error del 10 %, se detectan un 138 % más de homólogos, y en los casos más sencillos, con una tasa de error del 1 %, CS-BLAST sigue siendo un 96 % más eficaz que BLAST. Además, CS-BLAST en 2 iteraciones es más sensible que PSI-BLAST en 5 iteraciones. Se detectaron aproximadamente un 15 % más de homólogos en comparación.

Método

El método CS-BLAST identifica similitudes entre aminoácidos específicos del contexto de la secuencia en ventanas de 13 residuos centradas en cada residuo. CS-BLAST funciona generando un perfil de secuencia para una secuencia de consulta mediante mutaciones específicas del contexto y, a continuación, iniciando un método de búsqueda de perfil a secuencia.

CS-BLAST comienza prediciendo las probabilidades de mutación esperadas para cada posición. Para un residuo determinado, se selecciona una ventana de secuencia de diez residuos circundantes, como se muestra en la imagen. A continuación, Biegert y Söding compararon la ventana de secuencia con una biblioteca de miles de perfiles de contexto. Esta biblioteca se genera agrupando un conjunto representativo de ventanas de perfiles de secuencia. La predicción de las probabilidades de mutación se logra mediante la mezcla ponderada de las columnas centrales de los perfiles de contexto más similares. Esto alinea perfiles cortos no homólogos y sin huecos, lo que otorga mayor peso a los perfiles que mejor coinciden, facilitando su detección. Un perfil de secuencia representa una alineación múltiple de secuencias homólogas y describe qué aminoácidos es probable que aparezcan en cada posición de secuencias relacionadas. Con este método, las matrices de sustitución son innecesarias. Además, no se requieren probabilidades de transición, ya que la información de contexto está codificada en los perfiles de contexto. Esto simplifica el cálculo y permite que el tiempo de ejecución se escale linealmente en lugar de cuadráticamente.

La probabilidad de mutación específica del contexto, es decir, la probabilidad de observar un aminoácido específico en una secuencia homóloga dado un contexto, se calcula mediante una mezcla ponderada de los aminoácidos en las columnas centrales de los perfiles de contexto más similares. La imagen ilustra el cálculo de las probabilidades de mutación esperadas para un residuo específico en una posición determinada. Como se observa en la imagen, la biblioteca de perfiles de contexto contribuye en función de su similitud con el perfil de secuencia específico del contexto para la secuencia de consulta.

Modelos

Al predecir las probabilidades de sustitución utilizando únicamente el contexto de secuencia local del aminoácido, se obtiene la ventaja de no necesitar conocer la estructura de la proteína de consulta, al tiempo que se permite la detección de más proteínas homólogas que con las matrices de sustitución estándar [4]. El enfoque de Bigert y Söding para predecir las probabilidades de sustitución se basó en un modelo generativo. En otro artículo, en colaboración con Angermüller, desarrollan un método de aprendizaje automático discriminativo que mejora la precisión de la predicción [2].

Modelo generativo

Dada una variable observadaincógnita{\displaystyle x}y una variable objetivoy{\displaystyle y}, un modelo generativo define las probabilidadesPAG(incógnita,y){\displaystyle P(x,y)}yPAG(y){\displaystyle P(y)}por separado. Para predecir la variable objetivo no observada,y{\displaystyle y}, teorema de Bayes,PAG(y|incógnita)=(PAG(incógnita|y)PAG(y)[yPAG(incógnita|y)PAG(y)]){\displaystyle P(y|x)=\left({\frac {P(x|y)P(y)}{[\textstyle \sum _{y}P(x|y)P(y)\displaystyle ]}}\right)}

Se utiliza. Un modelo generativo, como su nombre lo indica, permite generar nuevos puntos de datos.(incógnita,y){\displaystyle (x,y)}La distribución conjunta se describe comoPAG(incógnita,y)=PAG(incógnita|y)PAG(y){\displaystyle P(x,y)=P(x|y)P(y)}Para entrenar un modelo generativo, se utiliza la siguiente ecuación para maximizar la probabilidad conjunta.(PAG(incógnitanorte,ynorte)trainorteinortegramoData(incógnitanorte,ynorte)){\displaystyle \prod \left({\frac {P(x_{n},y_{n})}{trainingData(x_{n},y_{n})}}\right)}.

Modelo discriminativo

El modelo discriminativo es un clasificador de máxima entropía de regresión logística . Con el modelo discriminativo, el objetivo es predecir una probabilidad de sustitución específica del contexto dada una secuencia de consulta. El enfoque discriminativo para modelar probabilidades de sustitución,PAG(a|dol){\displaystyle P(a|C_{l})}dóndedol{\displaystyle C_{l}}describe una secuencia de aminoácidos alrededor de la posiciónl{\displaystyle l}de una secuencia, se basa enK{\displaystyle K}estados de contexto. Los estados de contexto se caracterizan por parámetros de peso de emisión (vk(a){\displaystyle v_{k}(a)}), peso de sesgo (πk{\displaystyle \pi _{k}}), y peso del contexto (λk(j,a){\displaystyle \lambda _{k}(j,a)}) [2]. Las probabilidades de emisión desde un estado de contexto vienen dadas por los pesos de emisión de la siguiente manera:d=1{\displaystyle d=1}a20{\displaystyle 20}:PAG(a|k)=(miincógnitapag(vk(a))miincógnitapag(vk(a))){\displaystyle P(a|k)=\left({\frac {exp(v_{k}(a))}{\sum exp(v_{k}(a'))}}\right)}

dóndePAG(a|k){\displaystyle P(a|k)}es la probabilidad de emisión y es el estado del contexto. En el enfoque discriminativo, la probabilidad para un estado del contextok{\displaystyle k}contexto dadodol{\displaystyle C_{l}}se modela directamente mediante la exponencial de una función afín del perfil de cuenta de contexto dondedol(j,a){\displaystyle C_{l}(j,a)}es el perfil de recuento de contexto con una constante de normalizaciónZ(dol){\displaystyle Z(C_{l})}normaliza la probabilidad a 1. Esta ecuación es la siguiente, donde la primera sumatoria tomaj=d{\displaystyle j=-d}ad{\displaystyle d}y la segunda suma tomaa=1{\displaystyle a=1}a20{\displaystyle 20}:PAG(k|dol)=(1Z(dol)miincógnitapag(πk+πλk(j,a)(dol(j,a))){\displaystyle P(k|C_{l})=\left({\frac {1}{Z(C_{l})}}exp(\pi _{k}+\pi \sum \sum \lambda _{k}(j,a)(C_{l}(j,a))\right)}.

Al igual que con el modelo generativo, la distribución objetivo se obtiene mezclando las probabilidades de emisión de cada estado de contexto ponderadas por la similitud.

Utilizando CS-BLAST

El conjunto de herramientas bioinformáticas del MPI es un sitio web y servicio interactivo que permite realizar análisis de proteínas completos y colaborativos con diversas herramientas, como CS-BLAST y PSI-BLAST [1]. Esta herramienta permite introducir una proteína y seleccionar opciones para personalizar el análisis. Además, puede enviar los resultados a otras herramientas.

Véase también

Referencias

  1. Angermüller, C.; Biegert, A.; Söding, J. (dic. 2012). "Modelado discriminativo de probabilidades de sustitución de aminoácidos específicas del contexto" . Bioinformatics . 28 (24): 3240–7 . doi : 10.1093/bioinformatics/bts622 . hdl : 11858/00-001M-0000-0015-8D22-F . PMID 23080114 . 
  2. Biegert, A.; Söding, J. (marzo de 2009). "Perfiles específicos del contexto de secuencia para la búsqueda de homología" ( PDF) . Proc Natl Acad Sci USA . 106 (10): 3770–5 . Bibcode : 2009PNAS..106.3770B . doi : 10.1073/pnas.0810767106 . PMC 2645910. PMID 19234132 .  
  3. "Se han ideado mejores métodos de búsqueda de secuencias de genes y proteínas" . ScienceDaily. 7 de marzo de 2009. Consultado el 14 de agosto de 2009 .
  4. Altschul SF, Gish W, Miller W, Myers EW, Lipman DJ (1990). "Herramienta básica de búsqueda de alineación local". J Mol Biol . 215 (3): 403– 410. doi : 10.1016/S0022-2836(05)80360-2 . PMID 2231712 . 
  5. Altschul SF; Madden TL; Schäffer AA; Zhang J; Zhang Z; Miller W; Lipman DJ. (1997). "Gapped BLAST y PSI-BLAST: una nueva generación de programas de búsqueda en bases de datos de proteínas" . Nucleic Acids Res . 25 (17): 3389– 3402. doi : 10.1093/nar/25.17.3389 . PMC 146917. PMID 9254694 .  

[1] Alva, Vikram, Seung-Zin Nam, Johannes Söding y Andrei N. Lupas. «El kit de herramientas bioinformáticas del MPI como plataforma integradora para el análisis avanzado de secuencias y estructuras de proteínas». Nucleic Acids Research 44. Número especial del servidor web (2016): W410-415. NCBI . Web. 2 de noviembre de 2016.

[2] Angermüller, Christof, Andreas Biegert y Johannes Söding. “Modelado discriminativo de las propiedades de sustitución de aminoácidos específicas del contexto” BIOINFORMATICS 28.24 (2012): 3240-247. Oxford Journals . Web. 2 de noviembre de 2016.

[3] Astschul, Stephen F., et al. “Gapped BLAST y PSI-BLAST: Una nueva generación de programas de búsqueda en bases de datos de proteínas”. Nucleic Acids Research 25.17 (1997): 3389-402. Oxford University Press. Impreso

[4] Bigert, A., y J. Söding. “Perfiles específicos del contexto de secuencia para la búsqueda de homología”. Actas de la Academia Nacional de Ciencias 106.10 (2009): 3770-3775. PNAS. Web. 23 de octubre de 2016.

  • CS-BLAST : servidor gratuito en LMU Múnich.
  • CS-BLAST : servidor gratuito en el Instituto Max Planck de Tubinga.
  • Código fuente de CS-BLAST