Articulo de referencia

Centro Nacional de Información Biotecnológica

Coordenadas : 38°59′45″N 77°05′56″W / 38.9959°N 77.0989°W / 38.9959; -77.0989 El Centro Nacional de Información Biotecnológica ( NCBI ) [ 1 ] [ 2 ] forma parte de la Biblioteca ...

Coordenadas : 38°59′45″N 77°05′56″W / 38.9959°N 77.0989°W / 38.9959; -77.0989

El Centro Nacional de Información Biotecnológica ( NCBI ) [ 1 ] [ 2 ] forma parte de la Biblioteca Nacional de Medicina (NLM), una rama de los Institutos Nacionales de Salud (NIH). Está aprobado y financiado por el gobierno de los Estados Unidos . El NCBI está ubicado en Bethesda, Maryland , y fue fundado en 1988 mediante una ley impulsada por el congresista estadounidense Claude Pepper .

El NCBI alberga una serie de bases de datos relevantes para la biotecnología y la biomedicina , y es un recurso importante para herramientas y servicios bioinformáticos. Entre las principales bases de datos se encuentran GenBank para secuencias de ADN y PubMed , una base de datos bibliográfica para literatura biomédica. Otras bases de datos incluyen la base de datos de epigenómica del NCBI . Todas estas bases de datos están disponibles en línea a través del motor de búsqueda Entrez . El NCBI fue dirigido por David Lipman , [ 2 ] uno de los autores originales del programa de alineación de secuencias BLAST [ 3 ] y una figura ampliamente respetada en bioinformática .

Historia

Propuesta y establecimiento

La Biblioteca Nacional de Medicina de EE. UU. realizó una excursión de planificación entre 1985 y 1986 para desarrollar planes a largo plazo para la agencia, que puso de manifiesto inconsistencias en los esquemas de nomenclatura utilizados y la falta de conexiones entre las bases de datos de conocimiento biotecnológico existentes creadas por diferentes organizaciones que investigan la genética. [ 4 ] Estas inconsistencias crearon obstáculos para los investigadores que utilizaban múltiples bases de datos en tándem en sus estudios, ya que la información relacionada en diferentes bases de datos era difícil de integrar y dificultaba el uso de información de una base de datos como evidencia para explicar información en otra base de datos. [ 4 ] Esto llevó a la NLM a proponer la creación del NCBI para liderar la estandarización entre las bases de datos biotecnológicas para promover una recuperación de información más fácil por parte de los usuarios y permitir la interconexión de bases de datos para el estudio. [ 5 ] La propuesta para el NCBI también buscaba que actuara como repositorio de almacenamiento y centro de distribución de información biotecnológica, así como desarrollador de herramientas de análisis de información. [ 6 ] El congresista Claude Pepper, defensor de la investigación médica, presentó varios proyectos de ley al Congreso entre 1986 y 1988 proponiendo la creación del NCBI antes de que la propuesta fuera aprobada el 4 de noviembre de 1988, estableciendo el NCBI dentro de la NLM. [ 5 ]

El Centro Lister Hill, el edificio del campus de los NIH que ha albergado el NCBI desde su creación en 1988.

Nuevos desarrollos

En 1990, un equipo del NCBI, incluido el matemático Stephen Altschul, desarrolló la herramienta BLAST para comparar secuencias biológicas, basándose en el programa FASTA preexistente . [ 6 ] El NCBI también asumió la responsabilidad de la base de datos preexistente GenBank de secuencias de ADN y aminoácidos, permitiendo inicialmente el acceso a Internet a través de correo electrónico en 1992. [ 7 ] En 1994, el NCBI estableció un sitio web para facilitar el acceso en línea a sus servicios, a saber, la herramienta BLAST, la base de datos GenBank y el sistema de recuperación Entrez para buscar en bases de datos biomédicas. [ 6 ] Posteriormente, en el año 2000, el NCBI pasó a alojar el acceso al genoma humano, mapeado por el Proyecto Genoma Humano , así como PubMed Central, un archivo en línea gratuito de literatura biomédica de revistas científicas. [ 6 ] El Congreso de los Estados Unidos ordenó posteriormente en 2008 que los artículos resultantes de investigaciones proporcionadas por fondos de los NIH que aparecieran en revistas científicas se pusieran a disposición del público en PubMed dentro de los 12 meses posteriores a su publicación, ampliando aún más los artículos alojados. [ 6 ]

Recursos clave del NCBI

El sitio web del NCBI ofrece una amplia gama de bases de datos y herramientas para la investigación biomédica y genómica.

Recursos literarios

  • PubMed : Una base de datos para buscar citas y resúmenes de diversa literatura de investigación biomédica.
  • Estantería : Una colección de libros sobre ciencias de la vida y atención médica.
  • PubMed Central (PMC): Un archivo gratuito de texto completo de literatura científica de revistas biomédicas y de ciencias de la vida que puede utilizarse para investigación, publicación y minería de texto.

Herramientas de análisis

  • BLAST : Una herramienta utilizada para encontrar similitudes entre secuencias biológicas.

Bases de datos moleculares y genómicas

  • Base de datos de nucleótidos : Una base de datos de secuencias de nucleótidos .
  • Base de datos de proteínas : Una base de datos de secuencias de proteínas .
  • Base de datos genómica : Una base de datos que te da acceso a más de 3,45 millones de genomas a partir de 2026.
  • Base de datos genética : Una base de datos que contiene información sobre genes de diferentes especies.
  • dbSNP : Una base de datos que contiene variaciones de un solo nucleótido, microsatélites, inserciones a pequeña escala y deleciones humanas.
  • PubChem : Una base de datos de información química de acceso libre.
  • Archivo de lectura de secuencias : El SRA almacena datos de secuenciación de la próxima generación de plataformas de secuenciación, incluyendo el sistema Roche 454 GS, el analizador genómico Illumina, el sistema SOLiD de Life Technologies AB, el Heliscope de Helicos Biosciences, Complete Genomics y el SMRT de Pacific Biosciences.
  • ClinVar : Una base de datos que recopila información sobre variaciones genómicas y su relación con la salud humana.

Puede encontrar una lista completa de los recursos disponibles en la página Todos los recursos. [ 8 ]

Página principal del sitio web del NCBI que muestra el acceso a las principales bases de datos y herramientas, incluyendo el panel de "Recursos populares" y el menú de navegación.

Estantería de libros del NCBI

Interfaz de la página principal de NCBI Bookshelf que muestra el acceso a la literatura biomédica, las herramientas de búsqueda y la navegación integrada de la base de datos.
Interfaz de exploración de títulos en la Biblioteca del NCBI, que muestra las publicaciones disponibles y opciones de filtrado por categoría, editorial y fecha.

La Biblioteca del NCBI es un repositorio digital de acceso libre que ofrece a investigadores, educadores y al público en general acceso a libros y documentos biomédicos. El repositorio es mantenido por el Centro Nacional de Información Biotecnológica (NCBI), que apoya la amplia difusión del conocimiento científico.

La biblioteca digital contiene diversos tipos de publicaciones, como libros de texto, manuales clínicos, guías y monografías. Estos recursos provienen de agencias gubernamentales, instituciones académicas y editoriales científicas, lo que garantiza su fiabilidad y relevancia para el campo biomédico.

El acceso a la Biblioteca del NCBI se proporciona a través de la interfaz web del NCBI, que permite a los usuarios buscar y navegar mediante filtros en bases de datos biomédicas integradas. La interfaz incorpora funciones de búsqueda que admiten consultas por palabras clave y filtrado para una recuperación de información eficiente.

La integración de Bookshelf con otros recursos del NCBI constituye una ventaja clave que facilita la navegación entre la literatura científica y los datos biológicos. Las entradas pueden vincularse a registros relacionados en las bases de datos PubMed y Gene, lo que mejora la accesibilidad y la productividad de la investigación.

Las editoriales pueden enviar materiales a la Biblioteca mediante un proceso estructurado que exige rigor científico, revisión por pares y relevancia para temas biomédicos. Los materiales aceptados se someten a un formato estandarizado y a la indexación de metadatos, lo que facilita la búsqueda y la consulta de referencias cruzadas.

La Biblioteca del NCBI desempeña un papel importante en el apoyo a la educación, la práctica clínica y la investigación, ya que proporciona acceso gratuito a literatura científica de alta calidad. Esta disponibilidad fomenta la toma de decisiones basada en la evidencia y contribuye a la difusión del conocimiento y al avance de la investigación dentro de la comunidad biomédica global. [ 9 ]

Herramienta básica de búsqueda de alineación local (BLAST)

BLAST (Basic Local Alignment Search Tool) es un algoritmo y un conjunto de programas que se utilizan para realizar búsquedas de similitud de secuencias entre una secuencia de consulta y secuencias en una base de datos seleccionada, [ 10 ] como GenBank. Se utiliza comúnmente para comparar secuencias de nucleótidos y proteínas mediante la identificación de regiones de similitud local.

BLAST opera mediante métodos heurísticos , tomando atajos para obtener una respuesta más rápidamente. BLAST debe leer una secuencia de consulta ingresada por el usuario, seguida de la secuencia de la base de datos seleccionada y los parámetros de búsqueda. Luego, analiza la secuencia de consulta para detectar secuencias de baja complejidad y repeticiones dentro de esta secuencia, con el fin de producir un conjunto de caracteres que se utilizará para comparar la secuencia de consulta con las secuencias de la base de datos. Primero, la base de datos busca secuencias cortas coincidentes utilizando el conjunto de caracteres, las cuales luego se extienden, sin permitir huecos, para encontrar alineaciones iniciales. Si estas alineaciones sin huecos alcanzan un cierto umbral de puntuación, se utilizan para iniciar una extensión con huecos que estima la puntuación y la longitud de la alineación sin calcular aún las inserciones o eliminaciones, que son computacionalmente más costosas. Para evitar un proceso computacionalmente costoso, solo se conservan las alineaciones con huecos que cumplen con una puntuación específica, y se descartan las alineaciones con puntuaciones más bajas. Finalmente, BLAST realiza un rastreo inverso, lo que significa que las alineaciones retenidas se extienden completamente de nuevo, esta vez incluyendo inserciones y eliminaciones, así como parámetros más sensibles para producir las alineaciones finales y detalladas. [ 11 ]

Las secuencias de entrada suelen proporcionarse en formato FASTA o GenBank, y los resultados pueden devolverse en varios formatos, incluidos HTML, XML y texto plano. La salida predeterminada de la página web presenta los resultados en formato de tabla, junto con gráficos de las secuencias coincidentes en una pestaña aparte, valores de significación estadística y alineaciones detalladas entre la secuencia de consulta y la secuencia de referencia.

Programas BLAST

Existen varios programas BLAST disponibles en la página principal de NCBI BLAST , que difieren en los tipos de secuencias que analizan. La imagen a continuación muestra uno de estos programas, blastp, con la interfaz general.

Ejemplo de la interfaz de blastp que muestra los campos para introducir una secuencia de consulta, seleccionar una base de datos y ajustar los parámetros de búsqueda.

Estos programas incluyen:

  • blastn : Compara secuencias de nucleótidos con secuencias de nucleótidos en una base de datos seleccionada; se utiliza a menudo para identificar relaciones más distantes.
  • blastp : Compara secuencias de proteínas con secuencias de proteínas en una base de datos seleccionada; su algoritmo constituye la base de otros programas BLAST como blastx y tblastn.
  • blastx : Compara secuencias de nucleótidos traducidas con secuencias de proteínas en una base de datos seleccionada.
  • tblastn : Compara secuencias de proteínas con secuencias de nucleótidos traducidas en una base de datos seleccionada.

Entrez

El sistema de búsqueda entre bases de datos Entrez Global Query se utiliza en el NCBI para todas las bases de datos principales, como secuencias de nucleótidos y proteínas, estructuras de proteínas, PubMed, taxonomía, genomas completos, OMIM y varias otras. [ 12 ] Entrez es un sistema de indexación y recuperación que contiene datos de diversas fuentes para la investigación biomédica. El NCBI distribuyó la primera versión de Entrez en 1991, compuesta por secuencias de nucleótidos de PDB y GenBank , secuencias de proteínas de SWISS-PROT, GenBank traducido, PIR, PRF, PDB y resúmenes y citas asociados de PubMed. Entrez está especialmente diseñado para integrar datos de varias fuentes, bases de datos y formatos diferentes en un modelo de información uniforme y un sistema de recuperación que puede recuperar eficientemente las referencias, secuencias y estructuras relevantes. [ 13 ]

Bases de datos

NCBI alberga muchas bases de datos diferentes asociadas con información biotecnológica, que van desde compuestos químicos hasta secuencias de genes y proteínas. [ 8 ]

Banco GenBank

GenBank es la base de datos de secuencias genéticas de los NIH, una colección anotada de todas las secuencias de ADN disponibles públicamente. [ 8 ] Los recursos de la base de datos han sido mantenidos por el NCBI desde 1992, cuando la organización tuvo la responsabilidad de poner a disposición la base de datos de secuencias de ADN GenBank . [ 14 ] GenBank se coordina con laboratorios individuales y otras bases de datos de secuencias, como las del Laboratorio Europeo de Biología Molecular (EMBL) y el Banco de Datos de ADN de Japón (DDBJ). [ 14 ] Desde 1992, el NCBI ha crecido para proporcionar otras bases de datos además de GenBank.

Gene

La base de datos Gene es una colección de información organizada y caracterizada sobre genes. Sirve como un nodo principal en la interconexión del mapa genómico, la expresión, la secuencia, la función proteica, la estructura y los datos de homología. A cada registro de gen se le asigna un GeneID único que puede seguirse a través de los ciclos de revisión. Aquí se establecen los registros de genes conocidos o predichos, delimitados por posiciones en el mapa o secuencias de nucleótidos. Gene presenta varias ventajas sobre su predecesor, LocusLink, incluyendo una mejor integración con otras bases de datos del NCBI, un alcance taxonómico más amplio y opciones mejoradas de consulta y recuperación proporcionadas por el sistema Entrez. [ 15 ]

Proteína

La base de datos Protein es una colección de registros de texto para secuencias de proteínas individuales, derivadas de muchos recursos diferentes como el proyecto NCBI Reference Sequence (RefSeq), GenBank, PDB y UniProtKB/SWISS-Prot. Los registros de Protein están presentes en diferentes formatos, incluidos FASTA y XML , y están vinculados a otros recursos de NCBI. Protein proporciona a los usuarios datos relevantes como genes, secuencias de ADN/ARN, vías biológicas, datos de expresión y variación, y literatura. También proporciona conjuntos predeterminados de proteínas similares e idénticas para cada secuencia según lo calculado por BLAST. La base de datos Structure de NCBI contiene conjuntos de coordenadas 3D para estructuras determinadas experimentalmente en PDB que son importadas por NCBI. La base de datos Conserved Domain ( CDD ) de proteínas contiene perfiles de secuencia que caracterizan dominios altamente conservados dentro de las secuencias de proteínas. También tiene registros de recursos externos como SMART y Pfam . Existe otra base de datos de proteínas conocida como Protein Clusters, que contiene conjuntos de secuencias de proteínas que se agrupan según los alineamientos máximos entre las secuencias individuales según lo calculado por BLAST. [ 16 ]

Química pública

Diagrama que ejemplifica cómo las diferentes bases de datos que componen PubChem interactúan entre sí y con el usuario, como lo representan Rosania et al., 2007 [ 17 ].

La base de datos PubChem del NCBI es un recurso público para moléculas y sus actividades contra ensayos biológicos. PubChem es consultable y accesible mediante el sistema de recuperación de información Entrez . [ 18 ] Además, PubChem consta de tres bases de datos principales: [ 8 ]

  • La sustancia almacena descripciones de muestras químicas de diversas fuentes. [ 19 ]
  • Compound es una base de datos que almacena representaciones químicas validadas. Dichas estructuras están preagrupadas y referenciadas mediante grupos de similitud. [ 20 ]
  • BioAssay es una base de datos de PubChem que almacena la bioactividad de sustancias químicas. [ 21 ]

Los datos almacenados en las bases de datos BioAssay y Compound describen datos de la base de datos Substance de PubChem. [ 19 ] [ 20 ] [ 21 ]

Otras bases de datos

Algunas de las otras bases de datos proporcionadas por NCBI incluyen Online Mendelian Inheritance in Man , la Molecular Modeling Database (estructuras de proteínas 3D), dbSNP (una base de datos de polimorfismos de un solo nucleótido ), Reference Sequence Collection, un mapa del genoma humano y un navegador de taxonomía , y coordina con el Instituto Nacional del Cáncer para proporcionar el Cancer Genome Anatomy Project. El NCBI asigna un identificador único (número de identificación de taxonomía) a cada especie de organismo. [ 22 ] El NCBI tiene herramientas de software que están disponibles a través de navegadores web o por protocolo de transferencia de archivos (FTP) .

Véase también

Referencias

  1. "El Proyecto Genoma Humano" . The New York Times .
  2. 1 2 "Instituto de investigación publica datos genéticos en Internet" . The New York Times . 26 de junio de 1997.
  3. "Sentido a partir de secuencias: Stephen F. Altschul sobre cómo mejorar BLAST" . 2000. Archivado del original el 7 de octubre de 2007.
  4. 1 2 "Plan a largo plazo - Colecciones digitales - Biblioteca Nacional de Medicina" . collections.nlm.nih.gov . Consultado el 23 de abril de 2026 .
  5. 1 2 Masys, Daniel R.; Benson, Dennis A. (2022). "Don Lindberg y la creación del Centro Nacional de Información Biotecnológica" . Information Services & Use . 42 (1): 107– 115. doi : 10.3233/ISU-210139 . PMC 9108602. PMID 35600117 .  
  6. 1 2 3 4 5 Smith, Kent (2013), "Una breve historia de la formación y el crecimiento del NCBI" , Manual del NCBI [Internet]. 2.ª edición , Centro Nacional de Información Biotecnológica (EE. UU.) , consultado el 21 de abril de 2026 .
  7. "Noticias del NCBI | Verano de 1999" . www.ncbi.nlm.nih.gov . Consultado el 23 de abril de 2026 .
  8. 1 2 3 4 "Todos los recursos - Guía del sitio - NCBI" . www.ncbi.nlm.nih.gov . Consultado el 20 de abril de 2026 .
  9. "Información para autores y editores" , Acerca de Bookshelf [Internet] , Centro Nacional de Información Biotecnológica (EE. UU.), 24 de noviembre de 2025 , consultado el 20 de abril de 2026.
  10. "Cómo usar BLAST: Guía de inicio rápido" (PDF) . Centro Nacional de Información Biotecnológica (NCBI), Biblioteca Nacional de Medicina de EE . UU . Consultado el 21 de abril de 2026 .
  11. Madden, T. (2013). "La herramienta de análisis de secuencias BLAST". Manual del NCBI (2.ª ed.). Bethesda, MD: Centro Nacional de Información Biotecnológica. 
  12. Coordinadores de recursos del NCBI (2012). "Recursos de bases de datos del Centro Nacional de Información Biotecnológica". Nucleic Acids Research 41 (Número especial sobre bases de datos): D8–D20.
  13. Ostell J. (2002). Manual del NCBI, 2.ª edición, Capítulo 15, El sistema de búsqueda y recuperación Entrez.
  14. 1 2 Mizrachi, Ilene (22 de agosto de 2007). "GenBank: La base de datos de secuencias de nucleótidos" . Manual del NCBI . Centro Nacional de Información Biotecnológica (EE. UU.). Archivado del original el 18 de mayo de 2023.
  15. Maglott D. , Pruitt K. y Tatusova T. (2005). El manual del NCBI, 2.ª edición, capítulo 19, Gen: un directorio de genes.
  16. Sayers E. (2013). El manual del NCBI, 2.ª edición, Recursos de proteínas del NCBI
  17. Rosania; Crippen; Woolf (2007). "Un conjunto de herramientas quimioinformáticas para la extracción de conocimiento biomédico" . SpringerNature . 24 : 1791–1802 .
  18. Wang Y. y Bryant S H. (2014). El manual del NCBI, 2.ª edición, base de datos de bioensayos PubChem del NCBI.
  19. 1 2 "Inicio - Sustancia PubChem - NCBI" . www.ncbi.nlm.nih.gov . Consultado el 20 de abril de 2026 .
  20. 1 2 "Inicio - Compuesto PubChem - NCBI" . www.ncbi.nlm.nih.gov . Consultado el 20 de abril de 2026 .
  21. 1 2 "Inicio - PubChem BioAssay - NCBI" . www.ncbi.nlm.nih.gov . Consultado el 20 de abril de 2026 .
  22. "Inicio - Taxonomía" . NCBI . Archivado del original el 16 de febrero de 2024.
  • Sitio web oficial
  • Sitio web oficial de la Biblioteca Nacional de Medicina
  • Sitio web oficial de los Institutos Nacionales de Salud