KEGG ( Kyoto Encyclopedia of Genes and Genomes ) es una colección de bases de datos que tratan sobre genomas , vías biológicas , enfermedades , fármacos y sustancias químicas . KEGG se utiliza para la investigación y la enseñanza de la bioinformática , incluyendo el análisis de datos en genómica , metagenómica , metabolómica y otros estudios ómicos , el modelado y la simulación en biología de sistemas , y la investigación traslacional en el desarrollo de fármacos .
El proyecto de base de datos KEGG fue iniciado en 1995 por Minoru Kanehisa , profesor del Instituto de Investigación Química de la Universidad de Kioto , en el marco del entonces Programa Japonés del Genoma Humano . [ 1 ] [ 2 ] Anticipando la necesidad de un recurso informatizado que pudiera utilizarse para la interpretación biológica de los datos de secuencias genómicas , comenzó a desarrollar la base de datos KEGG PATHWAY. Se trata de una colección de mapas de vías metabólicas KEGG dibujados manualmente que representan el conocimiento experimental sobre el metabolismo y diversas funciones de la célula y el organismo . Cada mapa de vía metabólica contiene una red de interacciones y reacciones moleculares y está diseñado para vincular los genes del genoma con los productos génicos (principalmente proteínas ) de la vía. Esto ha permitido el análisis denominado mapeo de vías metabólicas KEGG, mediante el cual el contenido genético del genoma se compara con la base de datos KEGG PATHWAY para examinar qué vías y funciones asociadas probablemente estén codificadas en el genoma.
Según los desarrolladores, KEGG es una "representación computacional" del sistema biológico . [ 3 ] Integra los componentes básicos y los diagramas de conexión del sistema; más específicamente, los componentes genéticos de genes y proteínas, los componentes químicos de moléculas pequeñas y reacciones, y los diagramas de conexión de las redes de interacción y reacción molecular. Este concepto se materializa en las siguientes bases de datos de KEGG, que se clasifican en información sobre sistemas, genómica, química y salud. [ 4 ]
- Información de sistemas
- VÍA: mapas de vías para funciones celulares y orgánicas
- MÓDULO: módulos o unidades funcionales de genes
- BRITE: clasificaciones jerárquicas de entidades biológicas
- Información genómica
- GENOMA: genomas completos
- GENES: genes y proteínas en los genomas completos
- ORTHOLOGÍA: grupos de genes ortólogos en los genomas completos.
- Información química
- COMPUESTO, GLICANO: compuestos químicos y glicanos
- REACCIÓN, RPAIR, RCLASS: reacciones químicas
- ENZIMA: nomenclatura de enzimas
- Información sobre salud
- ENFERMEDAD: enfermedades humanas
- MEDICAMENTO: medicamentos aprobados
- MEDIO AMBIENTE: drogas crudas y sustancias relacionadas con la salud
Bases de datos
Información de sistemas
La base de datos KEGG PATHWAY, la base de datos de diagramas de conexiones, es el núcleo del recurso KEGG. Es una colección de mapas de vías metabólicas que integran numerosas entidades, incluyendo genes, proteínas, ARN, compuestos químicos, glicanos y reacciones químicas, así como genes relacionados con enfermedades y dianas farmacológicas, que se almacenan como entradas individuales en las demás bases de datos de KEGG. Los mapas de vías metabólicas se clasifican en las siguientes secciones:
- Metabolismo
- Procesamiento de la información genética ( transcripción , traducción , replicación y reparación , etc.)
- Procesamiento de información ambiental ( transporte a través de la membrana , transducción de señales , etc.)
- Procesos celulares ( crecimiento celular , muerte celular , funciones de la membrana celular , etc.)
- Sistemas orgánicos ( sistema inmunitario , sistema endocrino , sistema nervioso , etc.)
- Enfermedades humanas
- Desarrollo de fármacos
La sección de metabolismo contiene mapas globales con un diseño estético que muestran una visión general del metabolismo, además de los mapas de rutas metabólicas habituales. Estos mapas globales de baja resolución pueden utilizarse, por ejemplo, para comparar las capacidades metabólicas de diferentes organismos en estudios genómicos y de diferentes muestras ambientales en estudios metagenómicos. En cambio, los módulos KEGG de la base de datos KEGG MODULE son diagramas de cableado localizados de mayor resolución que representan unidades funcionales más específicas dentro de un mapa de rutas metabólicas, como subrutas conservadas entre grupos de organismos y complejos moleculares concretos. Los módulos KEGG se definen como conjuntos de genes característicos que pueden vincularse a capacidades metabólicas específicas y otras características fenotípicas , lo que permite su uso para la interpretación automática de datos genómicos y metagenómicos.
Otra base de datos que complementa KEGG PATHWAY es KEGG BRITE. Se trata de una base de datos ontológica que contiene clasificaciones jerárquicas de diversas entidades, como genes, proteínas, organismos, enfermedades, fármacos y compuestos químicos. Mientras que KEGG PATHWAY se limita a las interacciones y reacciones moleculares de estas entidades, KEGG BRITE incorpora muchos tipos diferentes de relaciones.
Información genómica
Varios meses después de que se iniciara el proyecto KEGG en 1995, se publicó el primer informe del genoma bacteriano completamente secuenciado. [ 5 ] Desde entonces, todos los genomas completos publicados se acumulan en KEGG tanto para eucariotas como para procariotas . La base de datos KEGG GENES contiene información a nivel de gen/proteína y la base de datos KEGG GENOME contiene información a nivel de organismo para estos genomas. La base de datos KEGG GENES consta de conjuntos de genes para los genomas completos, y los genes en cada conjunto tienen anotaciones en forma de correspondencias establecidas con los diagramas de cableado de los mapas de rutas KEGG, los módulos KEGG y las jerarquías BRITE.
Estas correspondencias se realizan utilizando el concepto de ortólogos . Los mapas de vías metabólicas de KEGG se elaboran a partir de evidencia experimental en organismos específicos, pero están diseñados para ser aplicables también a otros organismos, ya que diferentes organismos, como el ser humano y el ratón, suelen compartir vías idénticas que constan de genes funcionalmente idénticos, denominados genes ortólogos u ortólogos. Todos los genes de la base de datos KEGG GENES se agrupan en dichos ortólogos en la base de datos KEGG ORTHOLOGY (KO). Dado que a los nodos (productos génicos) de los mapas de vías metabólicas de KEGG, así como a los módulos KEGG y las jerarquías BRITE, se les asignan identificadores KO, las correspondencias se establecen una vez que los genes del genoma se anotan con identificadores KO mediante el procedimiento de anotación del genoma en KEGG. [ 4 ]
Información química
Los mapas de vías metabólicas KEGG se dibujan para representar los aspectos duales de la red metabólica: la red genómica que describe cómo las enzimas codificadas en el genoma se conectan para catalizar reacciones consecutivas y la red química que describe cómo las estructuras químicas de los sustratos y productos se transforman mediante estas reacciones. [ 6 ] Un conjunto de genes enzimáticos en el genoma identificará redes de relación enzimática al superponerse a los mapas de vías KEGG, que a su vez caracterizan las redes de transformación de la estructura química, lo que permite interpretar el potencial biosintético y de biodegradación del organismo. Alternativamente, un conjunto de metabolitos identificados en el metaboloma conducirá a la comprensión de las vías enzimáticas y los genes enzimáticos involucrados.
Las bases de datos en la categoría de información química, que se denominan colectivamente KEGG LIGAND, están organizadas para capturar el conocimiento de la red química. Al comienzo del proyecto KEGG, KEGG LIGAND constaba de tres bases de datos: KEGG COMPOUND para compuestos químicos, KEGG REACTION para reacciones químicas y KEGG ENZYME para reacciones en la nomenclatura enzimática. [ 7 ] Actualmente, existen bases de datos adicionales: KEGG GLYCAN para glicanos [ 8 ] y dos bases de datos de reacciones auxiliares llamadas RPAIR (alineaciones de pares de reactivos) y RCLASS (clase de reacción). [ 9 ] KEGG COMPOUND también se ha ampliado para contener varios compuestos como xenobióticos , además de metabolitos.
Información sobre salud
En KEGG, las enfermedades se consideran estados alterados del sistema biológico causados por perturbadores de factores genéticos y ambientales, y los fármacos se consideran diferentes tipos de perturbadores. [ 10 ] La base de datos KEGG PATHWAY incluye no solo los estados normales, sino también los estados alterados de los sistemas biológicos. Sin embargo, no es posible elaborar mapas de vías de enfermedades para la mayoría de ellas, ya que los mecanismos moleculares no se comprenden bien. En la base de datos KEGG DISEASE se adopta un enfoque alternativo, que simplemente cataloga los factores genéticos y ambientales conocidos de las enfermedades. Estos catálogos podrían, con el tiempo, dar lugar a diagramas de conexiones más completos de las enfermedades.
La base de datos KEGG DRUG contiene los principios activos de los medicamentos aprobados en Japón, Estados Unidos y Europa. Estos se distinguen por sus estructuras químicas y/o componentes químicos, y se asocian con moléculas diana , enzimas metabolizadoras y otra información de la red de interacción molecular en los mapas de vías metabólicas de KEGG y las jerarquías BRITE. Esto permite un análisis integrado de las interacciones farmacológicas con la información genómica. Los fármacos crudos y otras sustancias relacionadas con la salud, que no pertenecen a la categoría de medicamentos aprobados, se almacenan en la base de datos KEGG ENVIRON. Las bases de datos de la categoría de información sanitaria se denominan colectivamente KEGG MEDICUS, que también incluye los prospectos de todos los medicamentos comercializados en Japón.
Modelo de suscripción
En julio de 2011, KEGG introdujo un modelo de suscripción para la descarga FTP debido a un recorte significativo en la financiación gubernamental. KEGG sigue estando disponible gratuitamente a través de su sitio web, pero el modelo de suscripción ha generado debates sobre la sostenibilidad de las bases de datos bioinformáticas. [ 11 ] [ 12 ]
Véase también
- Base de datos de toxicogenómica comparativa (CTD): integra las vías metabólicas de KEGG con datos toxicogenómicos y de enfermedades.
- ConsensusPathDB , una base de datos de interacciones funcionales moleculares, que integra información de KEGG.
- Ontología genética (GO)
- PubMed
- Uniprot
- Base de datos de enfermedades genéticas
Referencias
- ↑ Kanehisa M, Goto S (2000). "KEGG: Kyoto Encyclopedia of Genes and Genomes" . Nucleic Acids Res . 28 (1): 27– 30. doi : 10.1093/nar/28.1.27 . PMC 102409. PMID 10592173 .
- ↑ Kanehisa M (1997). "Una base de datos para el análisis postgenómico". Trends Genet . 13 (9): 375– 6. doi : 10.1016/S0168-9525(97)01223-7 . PMID 9287494 .
- ↑ Kanehisa M, Goto S, Hattori M, Aoki-Kinoshita KF, Itoh M, Kawashima S, Katayama T, Araki M, Hirakawa M (2006). " De la genómica a la genómica química: nuevos desarrollos en KEGG" . Nucleic Acids Res . 34 (número especial de bases de datos): D354–7. doi : 10.1093/nar/gkj102 . PMC 1347464. PMID 16381885 .
- 1 2 Kanehisa M, Goto S, Sato Y, Kawashima M, Furumichi M, Tanabe M (2014). "Datos, información, conocimiento y principio: de vuelta al metabolismo en KEGG" . Nucleic Acids Res . 42 (número especial de bases de datos): D199–205. doi : 10.1093/nar/ gkt1076 . PMC 3965122. PMID 24214961 .
- ↑ Fleischmann RD, Adams MD, White O, Clayton RA, Kirkness EF, Kerlavage AR, Bult CJ, Tomb JF, Dougherty BA, Merrick JM, et al. (1995). "Secuenciación aleatoria y ensamblaje del genoma completo de Haemophilus influenzae Rd". Science . 269 (5223): 496– 512. Bibcode : 1995Sci...269..496F . doi : 10.1126/science.7542800 . PMID 7542800 . S2CID 10423613 .
- ↑ Kanehisa M (2013). "Evolución química y genómica de redes de reacciones catalizadas por enzimas". FEBS Lett . 587 (17): 2731– 7. doi : 10.1016/j.febslet.2013.06.026 . hdl : 2433/178762 . PMID 23816707. S2CID 40074657 .
- ↑ Goto S, Nishioka T, Kanehisa M (1999). " Base de datos de ligandos para enzimas, compuestos y reacciones" . Nucleic Acids Res . 27 (1): 377–9 . doi : 10.1093/nar/27.1.377 . PMC 148189. PMID 9847234 .
- ↑ Hashimoto K, Goto S, Kawano S, Aoki-Kinoshita KF, Ueda N, Hamajima M, Kawasaki T, Kanehisa M (2006). "KEGG como recurso de informática del glicoma" . Glycobiology . 16 (5): 63R– 70R. doi : 10.1093/glycob/cwj010 . PMID 16014746 .
- ↑ Muto A, Kotera M, Tokimatsu T, Nakagawa Z, Goto S, Kanehisa M (2013). "Arquitectura modular de las vías metabólicas revelada por secuencias de reacciones conservadas" . J Chem Inf Model . 53 (3): 613–22 . doi : 10.1021/ci3005379 . PMC 3632090. PMID 23384306 .
- ↑ Kanehisa M, Goto S, Furumichi M, Tanabe M, Hirakawa M (2010). "KEGG para la representación y el análisis de redes moleculares que involucran enfermedades y fármacos" . Nucleic Acids Res . 38 (número especial de bases de datos): D355–60. doi : 10.1093/nar/gkp896 . PMC 2808910. PMID 19880382 .
- ↑ Galperin MY, Fernández-Suárez XM (2012). "El número especial de 2012 de Nucleic Acids Research Database y la colección de bases de datos de biología molecular en línea" . Nucleic Acids Res . 40 (número especial de bases de datos): D1–8. doi : 10.1093/nar/gkr1196 . PMC 3245068. PMID 22144685 .
- ↑ Hayden, EC (2013). "Base de datos de plantas populares se prepara para cobrar a los usuarios" . Nature . doi : 10.1038/nature.2013.13642 . S2CID 211729309 .
Enlaces externos
- Sitio web de KEGG
- Sitio espejo de GenomeNet
- La entrada de KEGG en MetaBase
- Bases de datos biológicas
- Ingeniería genética en Japón
- bases de datos en línea
- Biología de sistemas
- enciclopedias del siglo XXI