El Instituto Europeo de Bioinformática ( EMBL-EBI ) es una organización intergubernamental (OIG) que, como parte de la familia del Laboratorio Europeo de Biología Molecular (EMBL), se centra en la investigación y los servicios en bioinformática . Está ubicado en el Wellcome Genome Campus en Hinxton , cerca de Cambridge , y emplea a más de 600 personas a tiempo completo (equivalente a jornada completa). [ 4 ]
Además, el EMBL-EBI ofrece programas de formación que enseñan a los científicos los fundamentos del trabajo con datos biológicos y promueven la gran cantidad de herramientas bioinformáticas disponibles para su investigación, tanto las desarrolladas por el EMBL-EBI como las que no lo son.
Servicios bioinformáticos


Una de las funciones del EMBL-EBI es indexar y mantener datos biológicos en un conjunto de bases de datos, que incluyen Ensembl (que alberga datos de secuencias del genoma completo), UniProt (base de datos de secuencias y anotaciones de proteínas) y Protein Data Bank (base de datos de estructura terciaria de proteínas y ácidos nucleicos). Se proporcionan diversos servicios y herramientas en línea, como la herramienta de búsqueda de alineación local básica (BLAST) o la herramienta de alineación de secuencias Clustal Omega, que permiten un análisis de datos más profundo.
EXPLOSIÓN
BLAST [ 5 ] es un algoritmo para comparar la estructura primaria de biomacromoléculas, generalmente la secuencia de nucleótidos de ADN /ARN y la secuencia de aminoácidos de proteínas, almacenadas en bases de datos bioinformáticas, con la secuencia de consulta. El algoritmo utiliza una matriz de puntuación, como BLOSUM 62, para comparar las secuencias disponibles con la de consulta. Las secuencias con mayor puntuación representan los parientes más cercanos de la de consulta, en términos de similitud funcional y evolutiva. [ 6 ]
La búsqueda en bases de datos mediante BLAST requiere que los datos de entrada estén en un formato correcto (por ejemplo , FASTA , GenBank, PIR o EMBL). Los usuarios también pueden especificar las bases de datos que se van a buscar, seleccionar las matrices de puntuación que se van a utilizar y otros parámetros antes de ejecutar la herramienta. Los mejores resultados de BLAST se ordenan según su valor E calculado (la probabilidad de que exista por casualidad un resultado con una puntuación similar o superior en la base de datos). [ 7 ]
Clustal Omega
Clustal Omega [ 8 ] es una herramienta de alineación de secuencias múltiples (MSA) que permite encontrar una alineación óptima de al menos tres y un máximo de 4000 secuencias de ADN y proteínas de entrada. [ 9 ] El algoritmo de Clustal Omega emplea dos modelos ocultos de Markov (HMM) de perfil para derivar la alineación final de las secuencias. La salida de Clustal Omega se puede visualizar en un árbol guía (la relación filogenética de las secuencias que mejor se emparejan) o se puede ordenar por la similitud de secuencia mutua entre las consultas. [ 10 ] La principal ventaja de Clustal Omega sobre otras herramientas de MSA (Muscle, ProbCons ) es su eficiencia, manteniendo una precisión significativa de los resultados.
Ensembl
Ensembl, con sede en el EMBL-EBI [ 11 ] , es una base de datos organizada en torno a datos genómicos y mantenida por el Proyecto Ensembl . Encargada de la anotación continua de los genomas de organismos modelo , Ensembl proporciona a los investigadores un recurso integral de información biológica relevante sobre cada genoma específico. La anotación de los genomas de referencia almacenados es automática y se basa en secuencias. Ensembl comprende una base de datos genómica de acceso público a la que se puede acceder mediante un navegador web. Se puede interactuar con los datos almacenados mediante una interfaz gráfica de usuario (UI) que permite visualizar los datos en múltiples niveles de resolución, desde el cariotipo, pasando por genes individuales, hasta la secuencia de nucleótidos. [ 12 ]
Originalmente centrado en animales vertebrados como su principal campo de interés, desde 2009 Ensembl proporciona datos anotados sobre los genomas de plantas, hongos, invertebrados, bacterias y otras especies, en el proyecto hermano Ensembl Genomes . A partir de 2020,Las diversas bases de datos del proyecto Ensembl albergan en conjunto más de 50.000 genomas de referencia. [ 13 ]
PDB
El Protein Data Bank (PDB) [ 14 ] es una base de datos de estructuras tridimensionales de macromoléculas biológicas, como proteínas y ácidos nucleicos. Los datos se obtienen generalmente mediante cristalografía de rayos X o espectroscopia de resonancia magnética nuclear (RMN) y son enviados manualmente por biólogos estructurales de todo el mundo a través de las organizaciones miembros del PDB: PDBe , RCSB, PDBj y BMRB. Se puede acceder a la base de datos a través de las páginas web de sus miembros, incluido PDBe (ubicado en el EMBL-EBI). Como miembro del consorcio Worldwide Protein Data Bank (wwPDB), PDBe contribuye a la misión conjunta de archivar y mantener datos de estructuras macromoleculares. [ 15 ]
UniProt
UniProt es un repositorio en línea de datos de secuencias y anotaciones de proteínas, distribuido en las bases de datos UniProt Knowledgebase (UniProt KB), UniProt Reference Clusters (UniRef) y UniProt Archive (UniParc). Originalmente concebida como una iniciativa individual del EMBL-EBI, el Instituto Suizo de Bioinformática (SIB) (que mantienen conjuntamente Swiss-Prot y TrEMBL) y el Protein Information Resource (PIR) (que alberga la base de datos de secuencias de proteínas), el aumento en la generación global de datos de proteínas llevó a su colaboración en la creación de UniProt en 2002. [ 16 ]
Las entradas de proteínas almacenadas en UniProt se catalogan mediante un identificador único de UniProt. Los datos de anotación recopilados para cada entrada se organizan en secciones lógicas (por ejemplo, función de la proteína, estructura, expresión, secuencia o publicaciones relevantes), lo que permite una visión general coordinada de la proteína de interés. También se proporcionan enlaces a bases de datos externas y fuentes de datos originales. Además de la búsqueda estándar por nombre/identificador de la proteína, la página web de UniProt incluye herramientas para búsquedas BLAST, alineación de secuencias o búsqueda de proteínas que contienen péptidos específicos. [ 17 ]
Base de datos AlphaFold
La base de datos de estructuras proteicas AlphaFold (AlphaFold DB) es un proyecto colaborativo con Google DeepMind para poner a disposición de la comunidad científica, de forma gratuita, las estructuras proteicas predichas por el sistema de IA AlphaFold . [ 18 ] La primera versión de la base de datos fue en 2021; a partir de 2024AlphaFold DB proporciona acceso a más de 214 millones de estructuras de proteínas. [ 19 ]
Otras organizaciones de bioinformática

- Centro Nacional de Información Biotecnológica (NCBI), Biblioteca Nacional de Medicina de los Estados Unidos
- Instituto Nacional de Genética ( Banco de Datos de ADN de Japón )
- Instituto Suizo de Bioinformática (SIB: Expasy )
- Recursos bioinformáticos de Australia
- Centro de Big Data (Centro Nacional de Datos Genómicos), Instituto de Genómica de Pekín , Academia China de Ciencias
Véase también
Referencias
- ↑ "Antecedentes | Instituto Europeo de Bioinformática" . Ebi.ac.uk. 16 de mayo de 2018. Consultado el 29 de octubre de 2019 .
- 1 2 "Liderazgo" . www.ebi.ac.uk. Consultado el 21 de agosto de 2024 .
- ↑ "Aspectos destacados del EMBL-EBI 2023" (PDF) (Comunicado de prensa). EMBL-EBI. 8 de abril de 2024. pág. 4.
- ↑ "Informe científico" (PDF) . www.embl.de. 2017. Consultado el 29 de octubre de 2019 .
- ↑ "NCBI BLAST en EMBL-EBI" . www.ebi.ac.uk. Consultado el 3 de noviembre de 2021 .
- ↑ Altschul SF, Gish W, Miller W, Myers EW, Lipman DJ (octubre de 1990). "Herramienta básica de búsqueda de alineación local". Journal of Molecular Biology . 215 (3): 403– 410. doi : 10.1016/S0022-2836(05)80360-2 . PMID 2231712. S2CID 14441902 .
- ↑ Wheeler D , Bhagwat M (2007). BLAST QuickStart . Methods in Molecular Biology. Vol. 395. Humana Press. pp. 149–176 . PMC 4780883. PMID 17993672 .
- ↑ "Clustal Omega en EMBL-EBI" . ebi.ac.uk. Consultado el 3 de noviembre de 2021 .
- ↑ "Documentación de Clustal Omega en EMBL-EBI" . ebi.ac.uk. Consultado el 3 de noviembre de 2021 .
- ↑ Sievers F, Higgins DG (enero de 2018). " Clustal Omega para realizar alineaciones precisas de muchas secuencias de proteínas" . Protein Science . 27 (1): 135– 145. doi : 10.1002/pro.3290 . PMC 5734385. PMID 28884485 .
- ↑ "Página principal de Ensembl" . ensembl.org . Consultado el 3 de noviembre de 2021 .
- ^ Howe KL, Achuthan P, Allen J, Allen J, Álvarez-Jarreta J, Amode MR, et al. (enero de 2021). «Conjunto 2021» . Investigación de ácidos nucleicos . 49 (D1): D884– D891. doi : 10.1093/nar/gkaa942 . PMC 7778975 . PMID 33137190 .
- ↑ "Acerca del Proyecto Ensembl" . ensembl.org . Consultado el 3 de noviembre de 2021 .
- ↑ Burley, Stephen K.; et al. (enero de 2019). "Protein Data Bank: el único archivo global para datos de estructura macromolecular 3D" . Nucleic Acids Research . 47 (D1): D520– D528. doi : 10.1093/nar/gky949 . PMC 6324056. PMID 30357364 .
- ↑ "Acerca de PDBe" . ebi.ac.uk. Consultado el 3 de noviembre de 2021 .
- ↑ "Acerca de UniProt" . uniprot.org . Consultado el 3 de noviembre de 2021 .
- ↑ Bateman, Alex; et al. (enero de 2021). "UniProt: la base de datos universal de conocimiento de proteínas en 2021" . Nucleic Acids Research . 49 (D1): D480– D489. doi : 10.1093 / nar/gkaa1100 . PMC 7778908. PMID 33237286 .
- ↑ "Base de datos de estructura de proteínas AlphaFold" . alphafold.ebi.ac.uk . Consultado el 22 de agosto de 2024 .
- ↑ Varadi, Mihaly; Bertoni, Damián; Magaña, Paulyna; Paramval, Urmila; Pidruchna, Ivanna; Radhakrishnan, Malarvizhi; Tsenkov, Maxim; Nair, Sreenath; Mirdita, Milot; Sí, Jingi; Kovalevskiy, Oleg; Tunyasuvunakool, Kathryn; Laydon, Ágata; Žídek, Agustín; Tomlinson, Hamish; Hariharan, Dhavanthi; Abrahamson, Josh; Verde, Tim; Saltador, John; Birney, Ewan; Steinegger, Martín; Hassabis, Demis; Velankar, Sameer (5 de enero de 2024). "Base de datos de estructura de proteínas AlphaFold en 2024: proporciona cobertura estructural para más de 214 millones de secuencias de proteínas" . Investigación de ácidos nucleicos . 52 (D1): D368– D375. doi : 10.1093/nar/gkad1011 . PMC 10767828 .
- Organizaciones de bioinformática
- Institutos de investigación biológica en el Reino Unido
- Edificios y estructuras en el distrito de South Cambridgeshire
- Hinxton
- Organizaciones de tecnología de la información con sede en Europa
- institutos de investigación internacionales
- Institutos de biología molecular
- Instituciones asociadas a la Universidad de Cambridge
- Institutos de investigación establecidos en 1992
- Institutos de investigación en Cambridgeshire
- Ciencia y tecnología en Europa
- institutos de ciencia de sistemas
- Establecimientos en Inglaterra en 1992