La correlación horizontal es una metodología para el análisis de secuencias genéticas . En lugar de referirse a una técnica específica, la correlación horizontal abarca una variedad de enfoques para el análisis de secuencias que se unifican mediante dos temas específicos:
- El análisis de secuencias se realiza mediante comparaciones horizontales , a lo largo de una única secuencia genética; esto contrasta con los métodos verticales , que realizan comparaciones entre varias secuencias genéticas diferentes.
- Las comparaciones que se realizan generalmente miden cantidades de la teoría de la información, como el valor de la función de información mutua entre dos regiones de la secuencia.
Las ideas centrales del enfoque de correlación horizontal fueron presentadas por primera vez en un artículo del año 2000 por Grosse, Herzel, Buldyrev y Stanley (Grosse et al., 2000). En esta primera formulación, Grosse y sus colegas buscaron caracterizar una secuencia genética extensa dividiéndola en regiones codificantes y no codificantes. Mientras que los enfoques tradicionales para el problema de codificación vs. no codificación generalmente se basaban en sofisticados sistemas de reconocimiento de patrones que primero se entrenaban con entradas pequeñas y luego se ejecutaban sobre toda la secuencia (Ohler et al., 1999), el enfoque de correlación horizontal de Grosse y sus colegas funcionó dividiendo la secuencia en muchos fragmentos relativamente cortos, cada uno de solo 500 pares de bases de longitud. Luego buscaron caracterizar cada uno de estos fragmentos como codificante o no codificante. Esto se logró comparando cada ventana de tamaño 3 a lo largo de un fragmento con la primera ventana de tamaño 3 en ese fragmento, y luego midiendo el valor de la función de información mutua entre las dos ventanas. Se observó que las secuencias codificantes presentaban un patrón estilizado de periodicidad 3, a diferencia de las secuencias no codificantes. Este patrón era fácil de reconocer y permitía una identificación de regiones codificantes significativamente más rápida e independiente de la especie (Grosse et al., 2000).
Desde el año 2000, las metodologías de correlación horizontal que enfatizan la medición de cantidades teóricas de la información a lo largo de la longitud de una secuencia genética se han utilizado ampliamente e incluso han encontrado aplicación en el ensamblaje de fragmentos de secuenciación de escopeta (Otu y Sayood, 2004).
Referencias
- Grosse, Ivo; Herzel, Hanspeter; Buldyrev, Sergey V.; Stanley, H. Eugene (2000-05-01). "Independencia de especies de la información mutua en el ADN codificante y no codificante". Physical Review E . 61 (5). American Physical Society (APS): 5624– 5629. Bibcode : 2000PhRvE..61.5624G . doi : 10.1103/physreve.61.5624 . ISSN 1063-651X . PMID 11031617 .
- Ohler, U.; Harbeck, S.; Niemann, H.; Noth, E.; Reese, MG (1999-05-01). "Cadenas de Markov interpoladas para el reconocimiento de promotores eucariotas" . Bioinformatics . 15 (5). Oxford University Press (OUP): 362– 369. doi : 10.1093/bioinformatics/15.5.362 . ISSN 1367-4803 . PMID 10366656 .
- Otu, HH; Sayood, K. (2003-01-01). "Un enfoque de divide y vencerás para el ensamblaje de fragmentos". Bioinformatics . 19 (1). Oxford University Press (OUP): 22– 29. doi : 10.1093/bioinformatics/19.1.22 . ISSN 1367-4803 . PMID 12499289 .
- Bioinformática