UniProt es una base de datos de acceso libre que contiene información funcional y de secuencias de proteínas , muchas de cuyas entradas provienen de proyectos de secuenciación del genoma . Contiene una gran cantidad de información sobre la función biológica de las proteínas, obtenida de la literatura científica. Su mantenimiento corre a cargo del consorcio UniProt, integrado por varias organizaciones europeas de bioinformática y una fundación de Washington D. C. , EE. UU .
El consorcio UniProt
El consorcio UniProt está formado por el Instituto Europeo de Bioinformática (EBI), el Instituto Suizo de Bioinformática (SIB) y el Recurso de Información de Proteínas (PIR). El EBI, ubicado en el Wellcome Trust Genome Campus en Hinxton, Reino Unido, alberga una amplia colección de bases de datos y servicios bioinformáticos. El SIB, ubicado en Ginebra, Suiza, mantiene los servidores ExPASy (Expert Protein Analysis System), que constituyen un recurso central para herramientas y bases de datos de proteómica. El PIR, alojado por la National Biomedical Research Foundation (NBRF) en el Centro Médico de la Universidad de Georgetown en Washington, D.C., EE. UU., es el heredero de la base de datos de secuencias de proteínas más antigua , el Atlas de Secuencias y Estructuras de Proteínas de Margaret Dayhoff , publicado por primera vez en 1965. [ 2 ] En 2002, el EBI, el SIB y el PIR unieron fuerzas para formar el consorcio UniProt. [ 3 ]
Los orígenes de las bases de datos UniProt
Cada miembro del consorcio participa activamente en el mantenimiento y la anotación de bases de datos de proteínas. Hasta hace poco, EBI y SIB producían conjuntamente las bases de datos Swiss-Prot y TrEMBL, mientras que PIR producía la base de datos de secuencias de proteínas (PIR-PSD). [ 4 ] [ 5 ] [ 6 ] Estas bases de datos coexistían con diferentes coberturas de secuencias de proteínas y prioridades de anotación.
Swiss-Prot fue creado en 1986 por Amos Bairoch durante su doctorado y desarrollado por el Instituto Suizo de Bioinformática y posteriormente desarrollado por Rolf Apweiler en el Instituto Europeo de Bioinformática . [ 7 ] [ 8 ] [ 9 ] Swiss-Prot tenía como objetivo proporcionar secuencias de proteínas fiables asociadas con un alto nivel de anotación (como la descripción de la función de una proteína, su estructura de dominio , modificaciones postraduccionales , variantes, etc.), un nivel mínimo de redundancia y un alto nivel de integración con otras bases de datos. Reconociendo que los datos de secuencia se estaban generando a un ritmo que superaba la capacidad de Swiss-Prot para mantenerse al día, se creó TrEMBL (Translated EMBL Nucleotide Sequence Data Library) para proporcionar anotaciones automatizadas para aquellas proteínas que no estaban en Swiss-Prot. Mientras tanto, PIR mantenía PIR-PSD y bases de datos relacionadas, incluyendo iProClass , una base de datos de secuencias de proteínas y familias curadas.
Los miembros del consorcio aunaron sus recursos y experiencia superpuestos y lanzaron UniProt en diciembre de 2003. [ 10 ]
Organización de las bases de datos UniProt
UniProt ofrece cuatro bases de datos principales: UniProtKB (con las subbases Swiss-Prot y TrEMBL), UniParc, UniRef y Proteome.
UniProtKB
UniProt Knowledgebase (UniProtKB) es una base de datos de proteínas parcialmente curada por expertos, que consta de dos secciones: UniProtKB/Swiss-Prot (que contiene entradas revisadas y anotadas manualmente) y UniProtKB/TrEMBL (que contiene entradas no revisadas y anotadas automáticamente). [ 11 ] A fecha de 22 de febrero de 2023 La versión "2023_01" de UniProtKB/Swiss-Prot contiene 569.213 entradas de secuencia (que comprenden 205.728.242 aminoácidos extraídos de 291.046 referencias) y la versión "2023_01" de UniProtKB/TrEMBL contiene 245.871.724 entradas de secuencia (que comprenden 85.739.380.194 aminoácidos). [ 12 ]
UniProtKB/Swiss-Prot
UniProtKB/Swiss-Prot es una base de datos de secuencias de proteínas no redundantes y anotadas manualmente. Combina información extraída de la literatura científica y análisis computacional evaluado por bioconservadores . El objetivo de UniProtKB/Swiss-Prot es proporcionar toda la información relevante conocida sobre una proteína en particular. La anotación se revisa periódicamente para mantenerse al día con los hallazgos científicos actuales. La anotación manual de una entrada implica un análisis detallado de la secuencia de la proteína y de la literatura científica. [ 13 ]
Las secuencias del mismo gen y de la misma especie se fusionan en la misma entrada de la base de datos. Se identifican las diferencias entre las secuencias y se documenta su causa (por ejemplo , empalme alternativo , variación natural , sitios de inicio incorrectos, límites de exones incorrectos , cambios de marco de lectura , conflictos no identificados). Se utiliza una variedad de herramientas de análisis de secuencias en la anotación de las entradas de UniProtKB/Swiss-Prot. Las predicciones informáticas se evalúan manualmente y se seleccionan los resultados relevantes para su inclusión en la entrada. Estas predicciones incluyen modificaciones postraduccionales, dominios transmembrana y topología , péptidos señal , identificación de dominios y clasificación de familias de proteínas . [ 13 ] [ 14 ]
Las publicaciones relevantes se identifican mediante búsquedas en bases de datos como PubMed . Se lee el texto completo de cada artículo, se extrae la información y se añade a la entrada. La anotación derivada de la literatura científica incluye, entre otros: [ 10 ] [ 13 ] [ 14 ]
- Nombres de proteínas y genes
- Función
- Información específica de la enzima , como la actividad catalítica , los cofactores y los residuos catalíticos.
- ubicación subcelular
- Interacciones proteína-proteína
- Patrón de expresión
- Ubicación y funciones de dominios y sitios importantes
- Sitios de unión de iones , sustratos y cofactores
- Variantes proteicas producidas por variación genética natural, edición de ARN , empalme alternativo, procesamiento proteolítico y modificación postraduccional.
Las entradas anotadas se someten a un control de calidad antes de su inclusión en UniProtKB/Swiss-Prot. Cuando hay nuevos datos disponibles, las entradas se actualizan.
UniProtKB/TrEMBL
UniProtKB/TrEMBL contiene registros de alta calidad analizados computacionalmente, enriquecidos con anotaciones automáticas. Se introdujo en respuesta al aumento del flujo de datos resultante de los proyectos genómicos, ya que el proceso de anotación manual de UniProtKB/Swiss-Prot, que consumía mucho tiempo y esfuerzo, no podía ampliarse para incluir todas las secuencias de proteínas disponibles. [ 10 ] Las traducciones de secuencias codificantes anotadas en la base de datos de secuencias de nucleótidos EMBL-Bank/GenBank/DDBJ se procesan automáticamente y se introducen en UniProtKB/TrEMBL. UniProtKB/TrEMBL también contiene secuencias de PDB y de predicción de genes, incluyendo Ensembl , RefSeq y CCDS . [ 15 ] Desde el 22 de julio de 2021 también incluye estructuras predichas con AlphaFold2 . [ 16 ]
UniParc
UniProt Archive (UniParc) es una base de datos completa y no redundante que contiene todas las secuencias de proteínas de las principales bases de datos de secuencias de proteínas disponibles públicamente. [ 17 ] Las proteínas pueden existir en varias bases de datos de origen diferentes y en múltiples copias dentro de la misma base de datos. Para evitar la redundancia, UniParc almacena cada secuencia única solo una vez. Las secuencias idénticas se fusionan, independientemente de si pertenecen a la misma o a diferentes especies. A cada secuencia se le asigna un identificador estable y único (UPI), lo que permite identificar la misma proteína en diferentes bases de datos de origen. UniParc contiene únicamente secuencias de proteínas, sin anotaciones. Las referencias cruzadas a bases de datos en las entradas de UniParc permiten recuperar información adicional sobre la proteína de las bases de datos de origen. Cuando las secuencias en las bases de datos de origen cambian, UniParc realiza un seguimiento de estos cambios y archiva el historial de todos ellos.
Bases de datos de origen
Actualmente, UniParc contiene secuencias de proteínas procedentes de las siguientes bases de datos públicas:
- Bases de datos de secuencias de nucleótidos INSDC EMBL -Bank/ DDBJ / GenBank
- Ensembl
- Oficina Europea de Patentes (EPO)
- FlyBase: el repositorio principal de datos genéticos y moleculares para la familia de insectos Drosophilidae (FlyBase)
- Base de datos H-Invitacional (H-Inv)
- Índice Internacional de Proteínas (IPI)
- Oficina de Patentes de Japón (JPO)
- Recurso de información sobre proteínas (PIR-PSD)
- Banco de Datos de Proteínas (PDB)
- Fundación para la Investigación de Proteínas (PRF) [ 18 ]
- RefSeq
- Base de datos del genoma de Saccharomyces (SGD)
- El Recurso de Información sobre Arabidopsis (TAIR)
- TROME [ 19 ]
- Oficina de Patentes de los Estados Unidos (USPTO)
- UniProtKB/Swiss-Prot, isoformas de proteínas UniProtKB/Swiss-Prot, UniProtKB/TrEMBL
- Base de datos de anotación de genomas y vertebrados (VEGA)
- Base de gusanos
UniRef
Los clústeres de referencia UniProt (UniRef) constan de tres bases de datos de conjuntos agrupados de secuencias de proteínas de UniProtKB y registros seleccionados de UniParc. [ 20 ] La base de datos UniRef100 combina secuencias idénticas y fragmentos de secuencia (de cualquier organismo ) en una única entrada UniRef. Se muestra la secuencia de una proteína representativa, los números de acceso de todas las entradas fusionadas y enlaces a los registros correspondientes de UniProtKB y UniParc. Las secuencias de UniRef100 se agrupan utilizando el algoritmo CD-HIT para construir UniRef90 y UniRef50. [ 20 ] [ 21 ] Cada clúster está compuesto por secuencias que tienen al menos un 90 % o un 50 % de identidad de secuencia, respectivamente, con la secuencia más larga. La agrupación de secuencias reduce significativamente el tamaño de la base de datos, lo que permite búsquedas de secuencias más rápidas.
UniRef está disponible en el sitio FTP de UniProt. Archivado el 15/04/2024 en Wayback Machine .
Fondos
UniProt está financiado por subvenciones del Instituto Nacional de Investigación del Genoma Humano , los Institutos Nacionales de Salud (NIH), la Comisión Europea , el Gobierno Federal Suizo a través de la Oficina Federal de Educación y Ciencia, NCI-caBIG y el Departamento de Defensa de los Estados Unidos. [ 11 ]
Referencias
- ↑ UniProt, Consorcio. (enero de 2015). "UniProt: un centro de información sobre proteínas" . Nucleic Acids Research . 43 (número especial de bases de datos): D204–12. doi : 10.1093/nar/gku989 . PMC 4384041. PMID 25348405 .
- ↑ Dayhoff, Margaret O. (1965). Atlas de secuencia y estructura de proteínas . Silver Spring, Md: National Biomedical Research Foundation.
- ↑ "Comunicado de 2002: El NHGRI financia la base de datos global de proteínas" . Instituto Nacional de Investigación del Genoma Humano (NHGRI) . Archivado del original el 24 de septiembre de 2015. Consultado el 14 de abril de 2018 .
- ↑ O'Donovan, C.; Martin, MJ; Gattiker, A.; Gasteiger, E.; Bairoch, A.; Apweiler, R. (2002). "Recurso de conocimiento de proteínas de alta calidad: SWISS-PROT y TrEMBL" . Briefings in Bioinformatics . 3 (3): 275– 284. doi : 10.1093/bib/3.3.275 . PMID 12230036. Archivado del original el 24-01-2024 . Recuperado el 24-01-2024 .
- ^ Wu, CH; Sí, LS; Huang, H.; Arminski, L.; Castro-Alvear, J.; Chen, Y.; Hu, Z.; Kurtesis, P.; Ledley, RS; Suzek, BE; Vinayaka, CR; Zhang, J.; Barker, WC (2003). "El recurso de información sobre proteínas" . Investigación de ácidos nucleicos . 31 (1): 345– 347. doi : 10.1093/nar/gkg040 . PMC 165487 . PMID 12520019 .
- ↑ Boeckmann, B.; Bairoch, A.; Apweiler, R.; Blatter, MC; Estreicher, A.; Gasteiger, E.; Martin, MJ; Michoud, K.; O'Donovan, C.; Phan, I.; Pilbout, S.; Schneider, M. (2003). "La base de datos de conocimiento de proteínas SWISS-PROT y su suplemento TrEMBL en 2003" . Nucleic Acids Research . 31 (1): 365– 370. doi : 10.1093/nar/gkg095 . PMC 165542. PMID 12520024 .
- ↑ Bairoch, A.; Apweiler, R. (1996). "El banco de datos de secuencias de proteínas SWISS-PROT y su nuevo suplemento TREMBL" . Nucleic Acids Research . 24 (1): 21– 25. doi : 10.1093/nar/24.1.21 . PMC 145613. PMID 8594581 .
- ↑ Bairoch, A. (2000). "Serendipia en bioinformática: ¡las tribulaciones de un bioinformático suizo en tiempos apasionantes!" . Bioinformática . 16 (1): 48– 64. doi : 10.1093/bioinformatics/16.1.48 . PMID 10812477. Archivado del original el 5 de febrero de 2024. Consultado el 5 de febrero de 2024 .
- ↑ Séverine Altairac, " Naissance d'une banque de données: Interview du prof. Amos Bairoch Archivado el 12 de julio de 2010 en la Wayback Machine ". Protéines à la Une Archivado el 21 de junio de 2011 en Wayback Machine , agosto de 2006. ISSN 1660-9824 .
- 1 2 3 Apweiler, R.; Bairoch, A.; Wu, CH (2004). "Bases de datos de secuencias de proteínas". Current Opinion in Chemical Biology . 8 (1): 76– 80. doi : 10.1016/j.cbpa.2003.12.004 . PMID 15036160 .
- 1 2 Uniprot, C. (2009). " El recurso universal de proteínas (UniProt) en 2010" . Nucleic Acids Research . 38 (número especial de bases de datos): D142– D148. doi : 10.1093/nar/gkp846 . PMC 2808944. PMID 19843607 .
- ↑ "Estadísticas de UniProtKB/Swiss-Prot Release 2023_01" . web.expasy.org . Archivado del original el 4 de abril de 2023. Consultado el 31 de marzo de 2023 .
- 1 2 3 "¿Cómo anotamos manualmente una entrada de UniProtKB?" . UniProt . 21 de septiembre de 2011. Archivado del original el 13 de diciembre de 2013. Recuperado el 14 de abril de 2018 .
- 1 2 Apweiler, R.; Bairoch, A.; Wu, CH; Barker, WC; Boeckmann, B.; Ferro, S.; Gasteiger, E.; Huang, H.; López, R.; Magrané, M.; Martín, MJ; Natale, DA; o'Donovan, C.; Redaschi, N.; Sí, LS (2004). "UniProt: la base de conocimientos de proteínas universales" . Investigación de ácidos nucleicos . 32 (90001): 115D-1119. doi : 10.1093/nar/gkh131 . PMC 308865 . PMID 14681372 .
- ↑ "¿De dónde provienen las secuencias de proteínas de UniProtKB?" . UniProt . 21 de septiembre de 2011. Archivado del original el 15 de diciembre de 2013. Consultado el 14 de abril de 2018 .
- ↑ Hassabis, Demis (22 de julio de 2022). "Poniendo el poder de AlphaFold en manos del mundo" . Deepmind . Archivado del original el 24 de julio de 2021. Recuperado el 24 de julio de 2021 .
- ^ Leinonen, R.; Díez, FG; Binns, D.; Fleischmann, W.; López, R.; Apweiler, R. (2004). "Archivo UniProt" . Bioinformática . 20 (17): 3236– 3237. doi : 10.1093/bioinformatics/bth191 . PMID 15044231 .
- ↑ "Fundación para la Investigación de Proteínas" . Archivado del original el 30 de agosto de 2010. Consultado el 25 de agosto de 2010 .
- ↑ "Enlace FTP" . ftp.isrec.isb-sib.ch ( FTP ).(Para ver los documentos, consulte Ayuda:FTP )
- 1 2 Suzek, BE; Huang, H.; McGarvey, P.; Mazumder, R.; Wu, CH (2007). "UniRef: Clústeres de referencia UniProt completos y no redundantes" . Bioinformatics . 23 (10): 1282– 1288. doi : 10.1093/bioinformatics/btm098 . PMID 17379688 .
- ↑ Li, W.; Jaroszewski, L.; Godzik, A. (2001). "Agrupación de secuencias altamente homólogas para reducir el tamaño de grandes bases de datos de proteínas". Bioinformatics . 17 (3): 282– 283. doi : 10.1093/bioinformatics/17.3.282 . PMID 11294794 .
Enlaces externos
- UniProt
- bases de datos de proteínas
- bases de datos en línea
- Proteómica
- Ciencia y tecnología en Cambridgeshire
- Distrito de South Cambridgeshire
- Bioinformática
- Biología computacional