La base de datos de Anotación del Genoma de Vertebrados ( VEGA ) es una base de datos biológica dedicada a ayudar a los investigadores a localizar áreas específicas del genoma y anotar genes o regiones de genomas de vertebrados. [ 1 ] El navegador VEGA se basa en el código y la infraestructura web de Ensembl y proporciona una curación pública de genes de vertebrados conocidos para la comunidad científica. [ 2 ] [ 3 ] El sitio web de VEGA se actualiza con frecuencia para mantener la información más reciente sobre genomas de vertebrados y procura presentar una anotación de alta calidad de todos sus genomas o regiones genómicas de vertebrados publicados. [ 4 ] VEGA fue desarrollada por el Wellcome Trust Sanger Institute y está estrechamente asociada con otras bases de datos de anotación, como ZFIN (The Zebrafish Information Network), el Havana Group y GenBank . [ 1 ] [ 5 ] La anotación manual es actualmente más precisa para identificar variantes de empalme, pseudogenes , características de poliadenilación , regiones no codificantes y arreglos genéticos complejos que los métodos automatizados. [ 5 ]
Historia
La base de datos Vertebrate Genome Annotation (VEGA) fue publicada por primera vez en 2004 por el Wellcome Trust Sanger Institute. Fue diseñada para visualizar anotaciones manuales de secuencias genómicas humanas, de ratón y de pez cebra, y es el repositorio central para que los centros de secuenciación genómica depositen sus anotaciones de cromosomas humanos . [ 6 ] La anotación manual de datos genómicos es extremadamente valiosa para producir un conjunto de genes de referencia preciso, pero es costosa en comparación con los métodos automáticos y, por lo tanto, se ha limitado a organismos modelo. Las herramientas de anotación que se han desarrollado en el Wellcome Trust Sanger Institute (WTSI) [ 7 ] se están utilizando ahora para llenar ese vacío, ya que se pueden usar de forma remota y, por lo tanto, abren colaboraciones viables de anotación comunitaria. [ 8 ] Los proyectos HAVANA y VEGA fueron dirigidos por la Dra. Jennifer Harrow del Wellcome Sanger Institute. VEGA se archivó en febrero de 2017 y el equipo de HAVANA se trasladó al EMBL-EBI en junio de 2017.
genoma humano
La base de datos Vega es el repositorio central para que la mayoría de los centros de secuenciación del genoma depositen su anotación de los cromosomas humanos. [ 6 ] Desde la publicación original de VEGA, el número de loci de genes humanos anotados se ha duplicado con creces a más de 49 000 (versión de septiembre de 2012), de los cuales se predice que más de 20 000 son codificantes de proteínas . [ 6 ] [ 9 ] El Grupo Havana como parte de la colaboración de secuencias codificantes de consenso (CCDS) y extensión del genoma completo del proyecto ENCODE ha anotado completamente de forma manual el genoma humano, que está disponible para referencia, análisis comparativo y búsquedas de secuencias en la base de datos VEGA. [ 10 ] [ 11 ] La versión final de VEGA fue en febrero de 2017 (versión 68) y VEGA ahora es un sitio archivado que ya no se actualizará.
Otros vertebrados
La base de datos VEGA combina la información de bases de datos de genomas de vertebrados individuales y las reúne para facilitar el acceso y el análisis comparativo a los investigadores. El equipo de análisis y anotación de genomas humanos y de vertebrados (Havana) del Wellcome Trust Sanger Institute (WTSI) anota manualmente los genomas humano, de ratón y de pez cebra utilizando la herramienta de anotación genómica Otterlace/ZMap. [ 12 ] El sistema de anotación manual Otterlace comprende una base de datos relacional que almacena datos de anotación manual y admite la interfaz gráfica Zmap, y se basa en el esquema Ensembl. [ 8 ]
pez cebra
El genoma del pez cebra, que se está secuenciando completamente y anotando manualmente. [ 13 ] El genoma del pez cebra actualmente tiene 18.454 genes VEGA anotados, de los cuales 16.588 son genes codificadores de proteínas proyectados (septiembre de 2012, lanzamiento). [ 14 ]
Ratón
El genoma del ratón actualmente tiene 23.322 genes VEGA anotados, de los cuales 14.805 son genes codificadores de proteínas proyectados (junio de 2012, versión). [ 15 ] Los loci elegidos para la anotación manual están distribuidos por todo el genoma, pero algunas regiones han recibido más atención que otras: los cromosomas 2, 4, 11 y X, que han sido anotados completamente. La anotación que se muestra en esta versión de Vega proviene de una congelación de datos realizada el 19 de marzo de 2012 y las estructuras genéticas se presentan en el conjunto de genes del ratón fusionado que se muestra en la versión 67 de Ensembl. Vega también muestra loci artificiales generados por los programas de inactivación génica del ratón . [ 15 ]
Cerdo
El genoma del cerdo actualmente tiene 2842 genes VEGA anotados, de los cuales 2264 son genes codificadores de proteínas proyectados (septiembre de 2012, lanzamiento). [ 16 ] El complejo mayor de histocompatibilidad (MHC) del cerdo, también conocido como complejo de antígeno leucocitario porcino (SLA), abarca una región de 2,4 Mb del cromosoma 7 submetacéntrico (SSC7p1.1-q1.1). Implicado en el control de la respuesta inmune y la susceptibilidad a una variedad de enfermedades, el MHC del cerdo juega un papel único en la histocompatibilidad. [ 16 ] Los cromosomas X-WTSI e Y-WTSI están siendo anotados actualmente por Havana. [ 16 ]
perro, chimpancé, ualabí y gorila
El genoma del perro actualmente tiene 45 genes VEGA anotados, de los cuales 29 son genes codificadores de proteínas proyectados (febrero de 2005, lanzamiento). [ 17 ] El genoma del chimpancé actualmente tiene 124 genes VEGA anotados, de los cuales 52 son genes codificadores de proteínas proyectados (enero de 2012, lanzamiento). [ 18 ] El genoma del ualabí actualmente tiene 193 genes VEGA anotados, de los cuales 76 son genes codificadores de proteínas proyectados (marzo de 2009, lanzamiento). [ 19 ] El genoma del gorila actualmente tiene 324 genes VEGA anotados, de los cuales 176 son genes codificadores de proteínas proyectados (marzo de 2009, lanzamiento). [ 20 ]
Análisis comparativo
Además de genomas completos, y a diferencia de otros navegadores, VEGA también muestra pequeñas regiones de interés terminadas de genomas de otros vertebrados, haplotipos humanos y cepas de ratón. Actualmente, esto comprende la secuencia terminada y la anotación del complejo mayor de histocompatibilidad (MHC) de diferentes haplotipos humanos, y de perro y cerdo [este último actualmente solo está disponible de forma muy limitada en Ensembl Pre!. [ 21 ] Adicionalmente, hay anotación de la cepa NOD (diabetes no obesa) de ratón de regiones candidatas a IDD (diabetes insulinodependiente) y dos regiones más de cerdo. [ 6 ]
Vega contiene análisis comparativos por pares entre regiones genómicas específicas de diferentes especies o de diferentes haplotipos/cepas. Esto contrasta con Ensembl, donde se realizan muchas comparaciones de genoma completo contra genoma completo. [ 22 ] El análisis en Vega incluye:
1. Identificación de alineamientos genómicos mediante LastZ. 2. Predicción de pares de ortólogos mediante la herramienta de árbol genético de Ensembl. Cabe destacar que, si bien esta herramienta genera árboles filogenéticos , el alcance limitado del análisis comparativo de Vega implica que estos serán necesariamente incompletos y, por consiguiente, solo se mostrarán los ortólogos en el sitio web. 3. Identificación manual de alelos en diferentes haplotipos humanos o cepas de ratón.
Hay cinco conjuntos de análisis: [ 22 ]
1. La región MHC se ha comparado entre perro, cerdo (dos ensamblajes), gorila, chimpancé, wallaby, ratón y ocho haplotipos humanos:
- cromosoma 12-MHC del perro
- cromosoma 6-MHC del gorila
- cromosoma 6-MHC del chimpancé
- cromosoma 2-MHC del ualabí
- Cromosoma 7 del cerdo en Sscrofa10.2 (24,7 Mb a 29,8 Mbp)
- cromosoma 7-MHC del cerdo
- Cromosoma 17 del ratón (33,3 Mbp a 38,9 Mbp)
- cromosoma 6 en el ensamblaje de referencia humano (28 Mbp a 34 Mbp)
- Región MHC del cromosoma 6 en los haplotipos humanos COX, QBL, APD, DBB, MANN, MCF y SSTO (fragmentos cromosómicos completos)
2. Comparaciones entre las regiones LRC del cerdo, el gorila y el ser humano (nueve haplotipos):
- Cromosoma 6 del cerdo (53,6 Mbp a 54,0 Mbp)
- cromosoma 19-LRC del gorila
- Cromosoma humano 19q13.4 (54,6 Mbp a 55,6 Mbp) en el ensamblaje de referencia.
- Región LRC del cromosoma 19 en los haplotipos COX_1, COX_2, PGF_1, PGF_2, DM1A, DM1B, MC1A y MC1B (fragmentos cromosómicos de longitud completa).
- Se han comparado las regiones de diabetes insulinodependiente (Idd) en seis cromosomas de ratón (1, 3, 4, 6, 11 y 17) entre la cepa de referencia CL57BL/6 y una o más de las cepas DIL Non-Obese Diabetic (NOD), CHORI-29 NOD y 129. Se describen más detalles aquí.
3. Las regiones del conjunto de referencia CL57BL/6 utilizadas en estas comparaciones son:
- Idd3.1: cromosoma 3, clones AC117584.11 a AC115749.12
- Idd4.1: cromosoma 11, clones AL596185.12 a AL663042.5
- Idd4.2: cromosoma 11, clones AL663082.5 a AL604065.7
- Idd4.2Q: cromosoma 11, clones AL596111.7 a AL645695.18
- Idd5.1: cromosoma 1, clones AL683804.15 a AL645534.20
- Idd5.3: cromosoma 1, clones AC100180.12 a AC101699.9
- Idd5.4: cromosoma 1, clones AC123760.9 a AC109283.8
- Idd6.1 + Idd6.2: cromosoma 6, clones AC164704.4 a AC164090.3
- Idd6.3: cromosoma 6, clones AC171002.2 a AC163356.2
- Idd9.1: cromosoma 4, clones AL627093.17 a AL670959.8
- Idd9.1M: cromosoma 4, clones AL611963.24 a AL669936.12
- Idd9.2: cromosoma 4, clones CR788296.8 a AL626808.28
- Idd9.3: cromosoma 4, clones AL607078.26 a AL606967.14
- Idd10.1: cromosoma 3, clones AC167172.3 a AC131184.4
- Idd16.1: cromosoma 17, clones AC125141.4 a AC167363.3
- Idd18.1: cromosoma 3, clones AL845310.4 a AL683824.8
- Idd18.2: cromosoma 3, clones AC123057.4 a AC129293.9
4. Comparaciones entre tres regiones específicas:
- Cromosoma 17 del cerdo (58,2 Mbp a 67,4 Mbp)
- Cromosoma humano 20q13.13-q13.33 (45,8 Mbp a 62,4 Mbp)
- Cromosoma 2 del ratón (168,3 Mbp a 179,0 Mbp)
5. Comparaciones por pares entre tres pares de cromosomas completos de ratón y humanos:
- cromosoma 1 humano y cromosoma 4 del ratón
- cromosoma humano 17 y cromosoma de ratón 11
- cromosoma X humano y cromosoma X del ratón
Referencias
- 1 2 "Navegador del genoma Vega" . Instituto Wellcome Sanger . Consultado el 30 de octubre de 2012 .
- ↑ Searle, SMJ; Gilbert, J; Iyer, V; Clamp, M (1 de mayo de 2004). "El sistema de anotación Otter" . Genome Research . 14 (5): 963– 970. doi : 10.1101/gr.1864804 . PMC 479127. PMID 15123593 .
- ↑ Hubbard, T.; Barker, D; Birney, E; Cameron, G; Chen, Y; Clark, L; Cox, T; Cuff, J; Curwen, V (1 de enero de 2002). "El proyecto de base de datos del genoma Ensembl" . Nucleic Acids Research . 30 (1): 38– 41. doi : 10.1093/nar/30.1.38 . PMC 99161. PMID 11752248 .
- ↑ Loveland, J. (1 de enero de 2005). "VEGA, el navegador de genomas con una diferencia" . Briefings in Bioinformatics . 6 (2): 189– 193. doi : 10.1093/bib/6.2.189 . PMID 15975227 .
- 1 2 Ashurst, JL; Chen, CK; Gilbert, JG; Jekosch, K; Keenan, S; Meidl, P; Searle, SM; Stalker, J; Storey, R (17 de diciembre de 2004). "La base de datos de anotación del genoma de vertebrados (Vega)" . Nucleic Acids Research . 33 (número especial de bases de datos): D459– D465. doi : 10.1093/nar/gki135 . PMC 540089. PMID 15608237 .
- 1 2 3 4 Wilming, LG; Gilbert, JGR; Howe, K.; Trevanion, S.; Hubbard, T.; Harrow, JL (23 de diciembre de 2007). "La base de datos de anotación del genoma de vertebrados (Vega)" . Nucleic Acids Research . 36 (Base de datos): D753– D760. doi : 10.1093 / nar/gkm987 . PMC 2238886. PMID 18003653 .
- ↑ "Instituto Wellcome Trust Sanger" .
- 1 2 Loveland, JE; Gilbert, JGR; Griffiths, E.; Harrow, JL (20 de marzo de 2012). "Anotación de genes comunitarios en la práctica" . Base de datos . 2012 bas009. doi : 10.1093/database/bas009 . PMC 3308165. PMID 22434843 .
- ↑ "Genoma humano" .
- ↑ Birney, Ewan; et al. (14 de junio de 2007). "Identificación y análisis de elementos funcionales en el 1% del genoma humano mediante el proyecto piloto ENCODE" . Nature . 447 ( 7146): 799–816 . Bibcode : 2007Natur.447..799B . doi : 10.1038/nature05874 . PMC 2212820. PMID 17571346 .
- ↑ Ashurst, Jennifer L.; Collins, John E. (1 de septiembre de 2003). "Anotación genética: predicción y pruebas" . Annual Review of Genomics and Human Genetics . 4 (1): 69– 88. doi : 10.1146/annurev.genom.4.070802.110300 . PMID 14527297 .
- ↑ "Proyecto La Habana" .
- ↑ Sprague, J. (1 de enero de 2006). " La red de información del pez cebra: la base de datos del organismo modelo pez cebra" . Nucleic Acids Research . 34 (90001): D581– D585. doi : 10.1093/nar/gkj086 . PMC 1347449. PMID 16381936 .
- ↑ "Genoma del pez cebra" .
- 1 2 "Genoma del ratón" .
- 1 2 3 "Genoma del cerdo" .
- ↑ "Genoma del perro" .
- ↑ "Genoma del chimpancé" .
- ↑ "Genoma del ualabí" .
- ↑ "Genoma del gorila" .
- ↑ "Pre!Ensembl" .
- 1 2 "Análisis comparativo" .
Enlaces externos
- Página principal de VEGA
- Página principal de WTSI
- Página principal de ENCODE
- Página principal de ZFIN
- Genoma de la cepa silvestre del pez cebra
- bases de datos genéticas
- Ingeniería genética en el Reino Unido
- bases de datos médicas
- Genética médica en el Reino Unido
- Ciencia y tecnología en Cambridgeshire
- Distrito de South Cambridgeshire
- Wellcome Trust