Articulo de referencia

Bioinformática

Bioinformática temprana: alineación computacional de secuencias determinadas experimentalmente de una clase de proteínas relacionadas; consulte el apartado Análisis de secuenc...

Listen to this article

Bioinformática temprana: alineación computacional de secuencias determinadas experimentalmente de una clase de proteínas relacionadas; consulte el apartado  Análisis de secuencias para obtener más información.
Mapa del cromosoma X humano (del sitio web del Centro Nacional de Información Biotecnológica (NCBI))

Bioinformática ( / ˌ b . ˌ ɪ n f ər ˈ m æ t ɪ k s / ) es uncampocientíficointerdisciplinarioque desarrolla métodos computacionales yherramientas de softwarepara comprenderbiológicos, especialmente cuando los conjuntos de datos son grandes y complejos. La bioinformática integra principios debiología,química,física,informática,ciencia de datos,programación informática,ingeniería de la información,matemáticasyestadísticapara analizar e interpretardatos biológicos. [ 1 ] Este proceso a veces se denominabiología computacional; sin embargo, la distinción entre ambos términos suele ser objeto de debate. El términobiología computacionalpuede referirse a la construcción y el uso de modelos desistemas biológicos.

Se han utilizado técnicas computacionales, estadísticas y de programación informática para el análisis mediante simulación computacional de consultas biológicas. Estas incluyen la reutilización de "pipelines" de análisis específicos, particularmente en el campo de la genómica , como la identificación de genes y polimorfismos de un solo nucleótido ( SNP ). Estos pipelines se utilizan para comprender mejor la base genética de las enfermedades, las adaptaciones únicas, las propiedades deseables (especialmente en especies agrícolas) o las diferencias entre poblaciones. La bioinformática también incluye la proteómica , cuyo objetivo es comprender los principios organizativos dentro de las secuencias de ácidos nucleicos y proteínas . [ 2 ]

El procesamiento de imágenes y señales permite extraer resultados útiles de grandes cantidades de datos brutos. Ayuda en la secuenciación y anotación de genomas y sus mutaciones observadas . La bioinformática incluye la minería de texto de la literatura biológica y el desarrollo de ontologías biológicas y genéticas para organizar y consultar datos biológicos. También desempeña un papel en el análisis de la expresión y regulación de genes y proteínas. Las herramientas bioinformáticas ayudan a comparar, analizar e interpretar datos genéticos y genómicos y a comprender los aspectos evolutivos de la biología molecular. A un nivel más integrador, ayuda a analizar y catalogar las vías y redes biológicas que son una parte importante de la biología de sistemas . En biología estructural , ayuda en la simulación y modelado de ADN, [ 3 ] ARN, [ 3 ] [ 1 ] proteínas [ 4 ] así como interacciones biomoleculares. [ 5 ] [ 6 ] [ 7 ] [ 8 ]

Historia

La primera definición del término bioinformática fue acuñada por Paulien Hogeweg y Ben Hesper en 1970, para referirse al estudio de los procesos de información en sistemas bióticos. [ 9 ] [ 10 ] [ 11 ] [ 12 ] [ 13 ] Esta definición situó a la bioinformática como un campo paralelo a la bioquímica (el estudio de los procesos químicos en sistemas biológicos). [ 10 ]

La bioinformática y la biología computacional implican el análisis de datos biológicos, en particular secuencias de ADN, ARN y proteínas. El campo de la bioinformática experimentó un crecimiento explosivo a partir de mediados de la década de 1990, impulsado en gran medida por el Proyecto Genoma Humano y por los rápidos avances en la tecnología de secuenciación de ADN. [ 14 ]

El análisis de datos biológicos para generar información útil implica la creación y ejecución de programas informáticos que utilizan algoritmos de la teoría de grafos , la inteligencia artificial , la computación blanda , la minería de datos , el procesamiento de imágenes y la simulación por ordenador . Estos algoritmos, a su vez, dependen de fundamentos teóricos como las matemáticas discretas , la teoría de control , la teoría de sistemas , la teoría de la información y la estadística .

Secuencias

Las secuencias de material genético se utilizan con frecuencia en bioinformática y son más fáciles de gestionar mediante ordenadores que manualmente.
Estas son secuencias que se comparan en un alineamiento múltiple de secuencias (MSA) de MUSCLE. El nombre de cada secuencia (columna de la izquierda) corresponde a diferentes especies de piojos, mientras que las secuencias en sí se encuentran en la segunda columna.

Se ha producido un avance tremendo en velocidad y reducción de costos desde la finalización del Proyecto Genoma Humano, con algunos laboratorios capaces de secuenciar más de 100 000 billones de bases cada año, y un genoma completo puede secuenciarse por $1000 o menos. [ 15 ]

Las computadoras se volvieron esenciales en biología molecular cuando las secuencias de proteínas estuvieron disponibles después de que Frederick Sanger determinara la secuencia de la insulina a principios de la década de 1950. [ 16 ] [ 17 ] Comparar múltiples secuencias manualmente resultó ser poco práctico. Margaret Oakley Dayhoff , una pionera en el campo, [ 18 ] compiló una de las primeras bases de datos de secuencias de proteínas, publicada inicialmente como libros [ 19 ] así como métodos de alineación de secuencias y evolución molecular . [ 20 ] Otro contribuyente temprano a la bioinformática fue Elvin A. Kabat , quien fue pionero en el análisis de secuencias biológicas en 1970 con sus volúmenes completos de secuencias de anticuerpos publicados en línea con Tai Te Wu entre 1980 y 1991. [ 21 ]

En la década de 1970, se aplicaron nuevas técnicas de secuenciación de ADN a los bacteriófagos MS2 y øX174, y las secuencias de nucleótidos extendidas se analizaron mediante algoritmos estadísticos e informativos. Estos estudios demostraron que características bien conocidas, como los segmentos codificantes y el código de tripletes, se revelan en análisis estadísticos sencillos y fueron la prueba del concepto de que la bioinformática sería útil. [ 22 ] [ 23 ]

Objetivos

Para estudiar cómo se alteran las actividades celulares normales en diferentes estados patológicos, es necesario combinar datos biológicos brutos para obtener una visión integral de dichas actividades. Por lo tanto , el campo de la bioinformática ha evolucionado de tal manera que la tarea más urgente ahora implica el análisis e interpretación de diversos tipos de datos. Esto incluye secuencias de nucleótidos y aminoácidos , dominios proteicos y estructuras proteicas . [ 24 ]

Entre las subdisciplinas importantes dentro de la bioinformática y la biología computacional se incluyen:

  • Desarrollo e implementación de programas informáticos para acceder, gestionar y utilizar de forma eficiente diversos tipos de información.
  • Desarrollo de nuevos algoritmos matemáticos y medidas estadísticas para evaluar las relaciones entre los elementos de grandes conjuntos de datos. Por ejemplo, existen métodos para localizar un gen dentro de una secuencia, predecir la estructura y/o función de una proteína y agrupar secuencias de proteínas en familias de secuencias relacionadas.

El objetivo principal de la bioinformática es aumentar la comprensión de los procesos biológicos. Lo que la distingue de otros enfoques es su énfasis en el desarrollo y la aplicación de técnicas computacionalmente intensivas para lograr este objetivo. Algunos ejemplos son: el reconocimiento de patrones , la minería de datos , los algoritmos de aprendizaje automático y la visualización . Las principales líneas de investigación en este campo incluyen el alineamiento de secuencias , la identificación de genes , el ensamblaje del genoma , el diseño de fármacos , el descubrimiento de fármacos , el alineamiento de la estructura de proteínas , la predicción de la estructura de proteínas , la predicción de la expresión génica y las interacciones proteína-proteína , los estudios de asociación del genoma completo , el modelado de la evolución y la división/mitosis celular.

La bioinformática implica la creación y el avance de bases de datos, algoritmos, técnicas computacionales y estadísticas, y teoría para resolver problemas formales y prácticos derivados de la gestión y el análisis de datos biológicos.

En las últimas décadas, los rápidos avances en las tecnologías de investigación genómica y molecular, junto con los avances en las tecnologías de la información, han generado una enorme cantidad de información relacionada con la biología molecular. La bioinformática es el nombre que reciben estos enfoques matemáticos y computacionales utilizados para comprender los procesos biológicos.

Entre las actividades comunes en bioinformática se incluyen el mapeo y análisis de secuencias de ADN y proteínas, la alineación de secuencias de ADN y proteínas para compararlas, y la creación y visualización de modelos 3D de estructuras proteicas.

Análisis de secuencias

Desde que se secuenció el bacteriófago Phage Φ-X174 en 1977, [ 25 ] las secuencias de ADN de miles de organismos se han decodificado y almacenado en bases de datos. Esta información de secuencia se analiza para determinar genes que codifican proteínas , genes de ARN, secuencias reguladoras, motivos estructurales y secuencias repetitivas. Una comparación de genes dentro de una especie o entre diferentes especies puede mostrar similitudes entre las funciones de las proteínas o relaciones entre especies (el uso de la sistemática molecular para construir árboles filogenéticos ). Con la creciente cantidad de datos, hace mucho tiempo que se volvió impracticable analizar secuencias de ADN manualmente. Los programas informáticos como BLAST se utilizan de forma rutinaria para buscar secuencias; a fecha de 2008, de más de 260 000 organismos, que contienen más de 190 000 millones de nucleótidos . [ 26 ]

secuenciación de ADN

Antes de poder analizar las secuencias, estas se obtienen de un banco de datos, como GenBank. La secuenciación de ADN sigue siendo un problema complejo, ya que los datos brutos pueden contener ruido o verse afectados por señales débiles. Se han desarrollado algoritmos para la identificación de bases en los diversos enfoques experimentales de la secuenciación de ADN.

Image: 450 pixels Sequencing analysis steps
Imagen: 450 píxeles. Pasos del análisis de secuenciación.

Ensamblaje de secuencias

La mayoría de las técnicas de secuenciación de ADN producen fragmentos cortos de secuencia que deben ensamblarse para obtener secuencias completas de genes o genomas. La técnica de secuenciación de escopeta (utilizada por el Instituto de Investigación Genómica (TIGR) para secuenciar el primer genoma bacteriano, Haemophilus influenzae ) [ 27 ] genera secuencias de miles de pequeños fragmentos de ADN (de entre 35 y 900 nucleótidos de longitud, según la tecnología de secuenciación). Los extremos de estos fragmentos se superponen y, cuando se alinean correctamente mediante un programa de ensamblaje de genomas, pueden utilizarse para reconstruir el genoma completo. La secuenciación de escopeta proporciona datos de secuencia rápidamente, pero la tarea de ensamblar los fragmentos puede ser bastante compleja para genomas grandes. Para un genoma tan grande como el humano , puede requerir muchos días de tiempo de CPU en ordenadores multiprocesador con gran capacidad de memoria para ensamblar los fragmentos, y el ensamblaje resultante suele contener numerosos huecos que deben rellenarse posteriormente. La secuenciación aleatoria es el método preferido para prácticamente todos los genomas secuenciados (en lugar de los métodos de terminación de cadena o degradación química), y los algoritmos de ensamblaje de genomas son un área crítica de la investigación bioinformática.

Anotación del genoma

En genómica , la anotación se refiere al proceso de marcar las regiones de inicio y fin de los genes y otras características biológicas en una secuencia de ADN. Muchos genomas son demasiado grandes para ser anotados manualmente. Dado que la tasa de secuenciación supera la de anotación genómica, esta última se ha convertido en el principal obstáculo en bioinformática.

La anotación del genoma se puede clasificar en tres niveles: el de nucleótidos , el de proteínas y el de procesos.

La identificación de genes es un aspecto fundamental de la anotación a nivel de nucleótidos. Para genomas complejos, una combinación de predicción genética ab initio y comparación de secuencias con bases de datos de secuencias expresadas y otros organismos puede resultar eficaz. La anotación a nivel de nucleótidos también permite integrar la secuencia del genoma con otros mapas genéticos y físicos del mismo.

El objetivo principal de la anotación a nivel de proteínas es asignar una función a las proteínas del genoma. Para este tipo de anotación se utilizan bases de datos de secuencias de proteínas, dominios funcionales y motivos. Aproximadamente la mitad de las proteínas predichas en una nueva secuencia genómica tienden a no tener una función evidente.

El objetivo de la anotación a nivel de proceso es comprender la función de los genes y sus productos en el contexto de la fisiología celular y orgánica. Un obstáculo para la anotación a nivel de proceso ha sido la inconsistencia de los términos utilizados por diferentes sistemas modelo. El Consorcio de Ontología Génica está ayudando a resolver este problema. [ 28 ]

The first description of a comprehensive annotation system was published in 1995[27] by The Institute for Genomic Research, which performed the first complete sequencing and analysis of the genome of a free-living (non-symbiotic) organism, the bacterium Haemophilus influenzae.[27] The system identifies the genes encoding all proteins, transfer RNAs, ribosomal RNAs, in order to make initial functional assignments. The GeneMark program trained to find protein-coding genes in Haemophilus influenzae is constantly changing and improving.

Following the goals that the Human Genome Project left to achieve after its closure in 2003, the ENCODE project was developed by the National Human Genome Research Institute. This project is a collaborative data collection of the functional elements of the human genome that uses next-generation DNA-sequencing technologies and genomic tiling arrays, technologies able to automatically generate large amounts of data at a dramatically reduced per-base cost but with the same accuracy (base call error) and fidelity (assembly error).

Gene function prediction

While genome annotation is primarily based on sequence similarity (and thus homology), other properties of sequences can be used to predict the function of genes. In fact, most gene function prediction methods focus on protein sequences as they are more informative and more feature-rich. For instance, the distribution of hydrophobic amino acids predicts transmembrane segments in proteins. However, protein function prediction can also use external information such as gene (or protein) expression data, protein structure, or protein–protein interactions.[29]

Computational evolutionary biology

Evolutionary biology is the study of the origin and descent of species, as well as their change over time. Informatics has assisted evolutionary biologists by enabling researchers to:

  • trace the evolution of a large number of organisms by measuring changes in their DNA, rather than through physical taxonomy or physiological observations alone,
  • compare entire genomes, which permits the study of more complex evolutionary events, such as gene duplication, horizontal gene transfer, and the prediction of factors important in bacterial speciation,
  • build complex computational population genetics models to predict the outcome of the system over time[30]
  • track and share information on an increasingly large number of species and organisms

Comparative genomics

The core of comparative genome analysis is the establishment of the correspondence between genes (orthology analysis) or other genomic features in different organisms. Intergenomic maps are made to trace the evolutionary processes responsible for the divergence of two genomes. A multitude of evolutionary events acting at various organizational levels shape genome evolution. At the lowest level, point mutations affect individual nucleotides. At a higher level, large chromosomal segments undergo duplication, lateral transfer, inversion, transposition, deletion and insertion.[31] Entire genomes are involved in processes of hybridization, polyploidization and endosymbiosis that lead to rapid speciation. The complexity of genome evolution poses many exciting challenges to developers of mathematical models and algorithms, who have recourse to a spectrum of algorithmic, statistical and mathematical techniques, ranging from exact, heuristics, fixed parameter and approximation algorithms for problems based on parsimony models to Markov chain Monte Carlo algorithms for Bayesian analysis of problems based on probabilistic models.

Many of these studies are based on the detection of sequence homology to assign sequences to protein families.[32]

Pan genomics

Pan genomics is a concept introduced in 2005 by Tettelin and Medini. Pan genome is the complete gene repertoire of a particular monophyletic taxonomic group. Although initially applied to closely related strains of a species, it can be applied to a larger context like genus, phylum, etc. It is divided in two parts: the Core genome, a set of genes common to all the genomes under study (often housekeeping genes vital for survival), and the Dispensable/Flexible genome: a set of genes not present in all but one or some genomes under study. A bioinformatics tool BPGA can be used to characterize the Pan Genome of bacterial species.[33]

Genetics of disease

Desde 2013, la existencia de tecnología de secuenciación de próxima generación de alto rendimiento permite la identificación de la causa de muchos trastornos humanos diferentes. Se ha observado herencia mendeliana simple para más de 3000 trastornos que se han identificado en la base de datos Online Mendelian Inheritance in Man , pero las enfermedades complejas son más difíciles. Los estudios de asociación han encontrado muchas regiones genéticas individuales que individualmente están débilmente asociadas con enfermedades complejas (como infertilidad , [ 34 ] cáncer de mama [ 35 ] y enfermedad de Alzheimer [ 36 ] ), en lugar de una sola causa. [ 37 ] [ 38 ] Actualmente existen muchos desafíos para el uso de genes para diagnóstico y tratamiento, como el hecho de que no sabemos qué genes son importantes o cuán estables son las opciones que proporciona un algoritmo. [ 39 ]

Los estudios de asociación de genoma completo han identificado con éxito miles de variantes genéticas comunes para enfermedades y rasgos complejos; sin embargo, estas variantes comunes solo explican una pequeña fracción de la heredabilidad. [ 40 ] Las variantes raras pueden explicar parte de la heredabilidad faltante . [ 41 ] Los estudios de secuenciación de genoma completo a gran escala han secuenciado rápidamente millones de genomas completos, y dichos estudios han identificado cientos de millones de variantes raras . [ 42 ] Las anotaciones funcionales predicen el efecto o la función de una variante genética y ayudan a priorizar las variantes funcionales raras, y la incorporación de estas anotaciones puede aumentar eficazmente el poder de la asociación genética de análisis de variantes raras de estudios de secuenciación de genoma completo. [ 43 ] Se han desarrollado algunas herramientas para proporcionar un análisis de asociación de variantes raras todo en uno para datos de secuenciación de genoma completo, incluyendo la integración de datos de genotipo y sus anotaciones funcionales, análisis de asociación, resumen de resultados y visualización. [ 44 ] [ 45 ] El metaanálisis de estudios de secuenciación del genoma completo proporciona una solución atractiva al problema de recolectar grandes tamaños de muestra para descubrir variantes raras asociadas con fenotipos complejos. [ 46 ]

Análisis de mutaciones en el cáncer

En el cáncer , los genomas de las células afectadas se reorganizan de maneras complejas o impredecibles. Además de los microarrays de polimorfismos de un solo nucleótido que identifican mutaciones puntuales que causan cáncer, los microarrays de oligonucleótidos se pueden usar para identificar ganancias y pérdidas cromosómicas (denominadas hibridación genómica comparativa ). Estos métodos de detección generan terabytes de datos por experimento. [ 47 ] A menudo se encuentra que los datos contienen una variabilidad considerable, o ruido , por lo que se están desarrollando métodos de análisis de puntos de cambio y modelos ocultos de Markov para inferir cambios reales en el número de copias . [ 48 ]

Se pueden utilizar dos principios importantes para identificar el cáncer mediante mutaciones en el exoma . Primero, el cáncer es una enfermedad causada por la acumulación de mutaciones somáticas en los genes. Segundo, el cáncer contiene mutaciones impulsoras que deben distinguirse de las mutaciones pasajeras. [ 49 ]

Futuras mejoras en bioinformática podrían permitir clasificar los tipos de cáncer mediante el análisis de mutaciones genéticas que impulsan el cáncer. Además, en el futuro podría ser posible realizar un seguimiento de los pacientes a medida que la enfermedad progresa, gracias a la secuenciación de muestras de cáncer. Otro tipo de datos que requiere un desarrollo bioinformático innovador es el análisis de lesiones recurrentes en diversos tumores. [ 50 ]

Expresión génica y proteica

Análisis de la expresión génica

La expresión de muchos genes puede determinarse midiendo los niveles de ARNm con múltiples técnicas que incluyen microarrays , secuenciación de etiquetas de secuencia de ADNc expresado (EST), secuenciación de etiquetas de análisis serial de expresión génica (SAGE), secuenciación de firmas masivamente paralela (MPSS), RNA-Seq , también conocido como "secuenciación de escopeta de transcriptoma completo" (WTSS), o varias aplicaciones de hibridación in situ multiplexada. Todas estas técnicas son extremadamente propensas al ruido y/o sujetas a sesgos en la medición biológica, y un área importante de investigación en biología computacional implica el desarrollo de herramientas estadísticas para separar la señal del ruido en estudios de expresión génica de alto rendimiento. [ 51 ] Estos estudios se utilizan a menudo para determinar los genes implicados en un trastorno: se podrían comparar datos de microarrays de células epiteliales cancerosas con datos de células no cancerosas para determinar los transcritos que están regulados al alza y a la baja en una población particular de células cancerosas.

MIcroarray vs RNA-Seq

Analysis of protein expression

Protein microarrays and high throughput (HT) mass spectrometry (MS) can provide a snapshot of the proteins present in a biological sample. The former approach faces similar problems as with microarrays targeted at mRNA, the latter involves the problem of matching large amounts of mass data against predicted masses from protein sequence databases, and the complicated statistical analysis of samples when multiple incomplete peptides from each protein are detected. Cellular protein localization in a tissue context can be achieved through affinity proteomics displayed as spatial data based on immunohistochemistry and tissue microarrays.[52]

Analysis of regulation

Gene regulation is a complex process where a signal, such as an extracellular signal such as a hormone, eventually leads to an increase or decrease in the activity of one or more proteins. Bioinformatics techniques have been applied to explore various steps in this process.

For example, gene expression can be regulated by nearby elements in the genome. Promoter analysis involves the identification and study of sequence motifs in the DNA surrounding the protein-coding region of a gene. These motifs influence the extent to which that region is transcribed into mRNA. Enhancer elements far away from the promoter can also regulate gene expression, through three-dimensional looping interactions. These interactions can be determined by bioinformatic analysis of chromosome conformation capture experiments.

Expression data can be used to infer gene regulation: one might compare microarray data from a wide variety of states of an organism to form hypotheses about the genes involved in each state. In a single-cell organism, one might compare stages of the cell cycle, along with various stress conditions (heat shock, starvation, etc.). Clustering algorithms can be then applied to expression data to determine which genes are co-expressed. For example, the upstream regions (promoters) of co-expressed genes can be searched for over-represented regulatory elements. Examples of clustering algorithms applied in gene clustering are k-means clustering, self-organizing maps (SOMs), hierarchical clustering, and consensus clustering methods.

Analysis of cellular organization

Se han desarrollado varios enfoques para analizar la ubicación de orgánulos, genes, proteínas y otros componentes dentro de las células. Se ha ideado una categoría de ontología genética , componente celular , para capturar la localización subcelular en muchas bases de datos biológicas .

Microscopía y análisis de imágenes

Las imágenes microscópicas permiten localizar orgánulos y moléculas que pueden ser la fuente de anomalías en las enfermedades.

localización de proteínas

Determinar la ubicación de las proteínas nos permite predecir su función. Esto se conoce como predicción de la función proteica . Por ejemplo, si una proteína se encuentra en el núcleo , podría estar implicada en la regulación génica o el empalme de ARN . En cambio, si se encuentra en las mitocondrias , podría estar implicada en la respiración u otros procesos metabólicos . Existen recursos bien desarrollados para la predicción de la localización subcelular de proteínas , incluyendo bases de datos y herramientas de predicción. [ 53 ] [ 54 ]

Organización nuclear de la cromatina

Los datos de experimentos de captura de conformación cromosómica de alto rendimiento , como Hi-C (experimento) y ChIA-PET , pueden proporcionar información sobre la estructura tridimensional y la organización nuclear de la cromatina . Los desafíos bioinformáticos en este campo incluyen la partición del genoma en dominios, como los Dominios de Asociación Topológica (TAD), que se organizan juntos en el espacio tridimensional. [ 55 ]

Bioinformática estructural

Las estructuras proteicas tridimensionales como esta son temas habituales en los análisis bioinformáticos.

Determinar la estructura de las proteínas es una aplicación importante de la bioinformática. La Evaluación Crítica de la Predicción de la Estructura de las Proteínas (CASP) es una competición abierta en la que grupos de investigación de todo el mundo presentan modelos de proteínas para evaluar modelos de proteínas desconocidas. [ 56 ] [ 57 ]

Secuencia de aminoácidos

La secuencia lineal de aminoácidos de una proteína se denomina estructura primaria . Esta estructura se puede determinar fácilmente a partir de la secuencia de codones del gen de ADN que la codifica. En la mayoría de las proteínas, la estructura primaria determina de forma unívoca la estructura tridimensional de la proteína en su entorno natural. Una excepción es la proteína priónica mal plegada implicada en la encefalopatía espongiforme bovina . Esta estructura está ligada a la función de la proteína. La información estructural adicional incluye la estructura secundaria , terciaria y cuaternaria . Una solución general viable para predecir la función de una proteína sigue siendo un problema abierto. Hasta ahora, la mayoría de los esfuerzos se han dirigido hacia heurísticas que funcionan la mayor parte del tiempo.

Homología

En la rama genómica de la bioinformática, la homología se utiliza para predecir la función de un gen: si la secuencia del gen A , cuya función se conoce, es homóloga a la secuencia del gen B, cuya función se desconoce, se podría inferir que B comparte la función de A. En bioinformática estructural, la homología se utiliza para determinar qué partes de una proteína son importantes en la formación de su estructura y en su interacción con otras proteínas. El modelado por homología se utiliza para predecir la estructura de una proteína desconocida a partir de proteínas homólogas ya existentes.

Un ejemplo de esto es la hemoglobina en los humanos y la hemoglobina en las legumbres ( leghemoglobina ), que son parientes lejanos de la misma superfamilia de proteínas . Ambas cumplen la misma función de transportar oxígeno en el organismo. Aunque estas dos proteínas tienen secuencias de aminoácidos muy diferentes, sus estructuras proteicas son muy similares, lo que refleja su función y ancestro comunes. [ 58 ]

Otras técnicas para predecir la estructura de las proteínas incluyen el enhebrado de proteínas y el modelado físico de novo (desde cero).

Otro aspecto de la bioinformática estructural incluye el uso de estructuras proteicas para modelos de cribado virtual , como los modelos de relación cuantitativa estructura-actividad y los modelos proteoquimiométricos (PCM). Además, la estructura cristalina de una proteína puede utilizarse en la simulación de, por ejemplo, estudios de unión a ligandos y estudios de mutagénesis in silico .

Un software basado en algoritmos de aprendizaje profundo de 2021 llamado AlphaFold , desarrollado por DeepMind de Google , supera ampliamente a todos los demás métodos de software de predicción, [ 59 ] y ha publicado estructuras predichas para cientos de millones de proteínas en la base de datos de estructuras de proteínas AlphaFold. [ 60 ]

Biología de redes y sistemas

El análisis de redes busca comprender las relaciones dentro de las redes biológicas, como las redes metabólicas o las de interacción proteína-proteína . Si bien las redes biológicas pueden construirse a partir de un solo tipo de molécula o entidad (como los genes), la biología de redes a menudo intenta integrar muchos tipos de datos diferentes, como proteínas, moléculas pequeñas, datos de expresión génica y otros, que están conectados física, funcional o ambas.

La biología de sistemas implica el uso de simulaciones por computadora de subsistemas celulares (como las redes de metabolitos y enzimas que componen el metabolismo , las vías de transducción de señales y las redes de regulación génica ) para analizar y visualizar las complejas conexiones de estos procesos celulares. La vida artificial o evolución virtual intenta comprender los procesos evolutivos mediante la simulación por computadora de formas de vida simples (artificiales).

Redes de interacción molecular

Las interacciones entre proteínas se visualizan y analizan frecuentemente mediante redes. Esta red está compuesta por interacciones proteína-proteína de Treponema pallidum , el agente causal de la sífilis y otras enfermedades. [ 61 ]

Se han determinado decenas de miles de estructuras tridimensionales de proteínas mediante cristalografía de rayos X y espectroscopia de resonancia magnética nuclear de proteínas (RMN de proteínas). Una cuestión fundamental en bioinformática estructural es si resulta práctico predecir posibles interacciones proteína-proteína basándose únicamente en estas formas tridimensionales, sin realizar experimentos de interacción proteína-proteína . Se han desarrollado diversos métodos para abordar el problema del acoplamiento proteína-proteína , aunque parece que aún queda mucho trabajo por hacer en este campo.

Otras interacciones que se encuentran en este campo incluyen las interacciones proteína-ligando (incluidos los fármacos) y proteína-péptido . La simulación de dinámica molecular del movimiento de los átomos alrededor de enlaces rotatorios es el principio fundamental de los algoritmos computacionales , denominados algoritmos de acoplamiento, para el estudio de las interacciones moleculares .

Informática de la biodiversidad

La bioinformática se ocupa de la recopilación y el análisis de datos de biodiversidad , como bases de datos taxonómicas o datos de microbiomas . Algunos ejemplos de estos análisis incluyen la filogenética , el modelado de nichos ecológicos , el mapeo de la riqueza de especies , la identificación mediante códigos de barras de ADN o las herramientas de identificación de especies . Un área en auge es también la macroecología , es decir, el estudio de cómo la biodiversidad se relaciona con la ecología y el impacto humano, como el cambio climático .

Otros

Análisis de la literatura

La enorme cantidad de literatura publicada hace prácticamente imposible que una persona lea todos los artículos, lo que da lugar a subcampos de investigación inconexos. El análisis de la literatura busca emplear la lingüística computacional y estadística para extraer información de esta creciente biblioteca de recursos textuales. Por ejemplo:

  • Reconocimiento de abreviaturas: identificar la forma completa y la abreviatura de términos biológicos.
  • Reconocimiento de entidades nombradas : reconocimiento de términos biológicos como nombres de genes.
  • Interacción proteína-proteína: identifica qué proteínas interactúan con qué proteínas a partir del texto.

Esta área de investigación se basa en la estadística y la lingüística computacional .

Análisis de imágenes de alto rendimiento

Las tecnologías computacionales se utilizan para automatizar el procesamiento, la cuantificación y el análisis de grandes cantidades de imágenes biomédicas con alto contenido informativo . Los sistemas modernos de análisis de imágenes pueden mejorar la precisión , la objetividad y la velocidad del observador . El análisis de imágenes es importante tanto para el diagnóstico como para la investigación. Algunos ejemplos son:

  • Cuantificación de alto rendimiento y alta fidelidad y localización subcelular ( cribado de alto contenido , citohistopatología, bioinformática de imágenes )
  • morfometría
  • Análisis y visualización de imágenes clínicas
  • Determinación de los patrones de flujo de aire en tiempo real en los pulmones respiratorios de animales vivos.
  • Cuantificación del tamaño de la oclusión en imágenes en tiempo real desde el desarrollo hasta la recuperación durante una lesión arterial.
  • realizar observaciones del comportamiento a partir de grabaciones de vídeo prolongadas de animales de laboratorio
  • mediciones infrarrojas para la determinación de la actividad metabólica
  • inferir solapamientos de clones en el mapeo de ADN , por ejemplo, la puntuación de Sulston.

Análisis de datos de células individuales de alto rendimiento

Se utilizan técnicas computacionales para analizar datos de células individuales de alto rendimiento y baja resolución, como los obtenidos mediante citometría de flujo . Estos métodos suelen consistir en identificar poblaciones de células relevantes para una enfermedad o condición experimental específica.

Ontologías e integración de datos

Las ontologías biológicas son grafos acíclicos dirigidos de vocabularios controlados . Crean categorías para conceptos y descripciones biológicas, lo que permite analizarlas fácilmente con ordenadores. Al categorizarlas de esta manera, es posible obtener un valor añadido mediante un análisis holístico e integrado. [ 62 ]

La OBO Foundry fue un proyecto para estandarizar ciertas ontologías. Una de las más extendidas es la ontología genética , que describe la función de los genes. También existen ontologías que describen fenotipos.

Bases de datos

Las bases de datos son esenciales para la investigación y las aplicaciones bioinformáticas. Existen bases de datos para diversos tipos de información, como secuencias de ADN y proteínas, estructuras moleculares, fenotipos y biodiversidad. Pueden contener tanto datos empíricos (obtenidos directamente de experimentos) como datos predictivos (obtenidos del análisis de datos existentes). Pueden ser específicas de un organismo, vía metabólica o molécula de interés. También pueden incorporar datos recopilados de múltiples bases de datos. Las bases de datos pueden tener diferentes formatos, mecanismos de acceso y ser públicas o privadas.

A continuación se enumeran algunas de las bases de datos más utilizadas:

  • Utilizado en el análisis de secuencias biológicas: GenBank , UniProt
  • Utilizado en el análisis de estructuras: Protein Data Bank (PDB)
  • Utilizado para encontrar familias de proteínas y motivos : InterPro , Pfam
  • Utilizado para la secuenciación de próxima generación: Archivo de lectura de secuencias
  • Utilizado en análisis de redes: bases de datos de vías metabólicas ( KEGG , BioCyc ), bases de datos de análisis de interacciones, redes funcionales.
  • Utilizado en el diseño de circuitos genéticos sintéticos: GenoCAD

Software y herramientas

Las herramientas de software para bioinformática incluyen desde sencillas herramientas de línea de comandos hasta programas gráficos más complejos y servicios web independientes. Estas herramientas son desarrolladas por empresas de bioinformática o por instituciones públicas.

Software bioinformático de código abierto

Desde la década de 1980, han existido y se han desarrollado numerosas herramientas de software libre y de código abierto . [ 63 ] La combinación de la necesidad constante de nuevos algoritmos para el análisis de nuevos tipos de lecturas biológicas, el potencial para experimentos in silico innovadores y la disponibilidad gratuita de bases de código abierto ha creado oportunidades para que los grupos de investigación contribuyan a la bioinformática independientemente de la financiación . Las herramientas de código abierto suelen funcionar como incubadoras de ideas o como complementos con soporte comunitario en aplicaciones comerciales. También pueden proporcionar estándares de facto y modelos de objetos compartidos para facilitar la integración de la bioinformación.

El software bioinformático de código abierto incluye Bioconductor , BioPerl , Biopython , BioJava , BioJS , BioRuby , Bioclipse , EMBOSS , .NET Bio, Orange con su complemento bioinformático, Apache Taverna , UGENE y GenoCAD .

La Fundación Open Bioinformatics, sin fines de lucro [ 63 ] , y la Conferencia anual de Bioinformática de Código Abierto promueven el software bioinformático de código abierto. [ 64 ]

Servicios web en bioinformática

Se han desarrollado interfaces basadas en SOAP y REST para permitir que los ordenadores cliente utilicen algoritmos, datos y recursos informáticos de servidores ubicados en otras partes del mundo. La principal ventaja es que los usuarios finales no tienen que ocuparse de los costes de mantenimiento del software y las bases de datos.

Los servicios bioinformáticos básicos son clasificados por el EBI en tres categorías: SSS (Servicios de búsqueda de secuencias), MSA (Alineamiento de secuencias múltiples) y BSA (Análisis de secuencias biológicas). [ 65 ] La disponibilidad de estos recursos bioinformáticos orientados a servicios demuestra la aplicabilidad de las soluciones bioinformáticas basadas en la web, y abarcan desde una colección de herramientas independientes con un formato de datos común bajo una única interfaz web, hasta sistemas de gestión de flujos de trabajo bioinformáticos integradores, distribuidos y extensibles .

Sistemas de gestión de flujos de trabajo bioinformáticos

Un sistema de gestión de flujos de trabajo bioinformáticos es una forma especializada de un sistema de gestión de flujos de trabajo diseñado específicamente para componer y ejecutar una serie de pasos computacionales o de manipulación de datos, o un flujo de trabajo, en una aplicación bioinformática. Dichos sistemas están diseñados para

  • proporcionar un entorno fácil de usar para que los propios científicos de aplicaciones individuales puedan crear sus propios flujos de trabajo,
  • proporcionar herramientas interactivas para que los científicos puedan ejecutar sus flujos de trabajo y ver sus resultados en tiempo real,
  • simplificar el proceso de compartir y reutilizar flujos de trabajo entre los científicos, y
  • Permite a los científicos realizar un seguimiento de la procedencia de los resultados de la ejecución del flujo de trabajo y de los pasos de creación del mismo.

Algunas de las plataformas que ofrecen este servicio: Galaxy , Kepler , Taverna , UGENE , Anduril , HIVE .

BioCompute y objetos BioCompute

En 2014, la Administración de Alimentos y Medicamentos de los Estados Unidos patrocinó una conferencia celebrada en el Campus Bethesda de los Institutos Nacionales de la Salud para discutir la reproducibilidad en bioinformática. [ 66 ] Durante los siguientes tres años, un consorcio de partes interesadas se reunió regularmente para discutir lo que se convertiría en el paradigma BioCompute. [ 67 ] Estas partes interesadas incluyeron representantes de entidades gubernamentales, industriales y académicas. Los líderes de las sesiones representaron numerosas ramas de la FDA y los Institutos y Centros de los NIH, entidades sin fines de lucro como el Proyecto Varioma Humano y la Federación Europea de Informática Médica , e instituciones de investigación como Stanford , el Centro del Genoma de Nueva York y la Universidad George Washington .

Se decidió que el paradigma BioCompute se basaría en "cuadernos de laboratorio" digitales que permiten la reproducibilidad, replicación, revisión y reutilización de protocolos bioinformáticos. Esto se propuso para facilitar una mayor continuidad dentro de un grupo de investigación durante los periodos de rotación de personal habituales, a la vez que se fomenta el intercambio de ideas entre grupos. La FDA de EE. UU. financió este trabajo para que la información sobre los flujos de trabajo fuera más transparente y accesible para su personal regulador. [ 68 ]

En 2016, el grupo se reunió nuevamente en los NIH en Bethesda y discutió el potencial de un objeto BioCompute , una instancia del paradigma BioCompute. Este trabajo se copió como un documento de "uso estándar para ensayos" y como un artículo preimpreso subido a bioRxiv. El objeto BioCompute permite compartir el registro en formato JSON entre empleados, colaboradores y reguladores. [ 69 ] [ 70 ]

Plataformas educativas

Aunque la bioinformática se imparte como máster presencial en muchas universidades, existen muchos otros métodos y tecnologías disponibles para aprender y obtener la certificación en la materia. La naturaleza computacional de la bioinformática la hace apta para el aprendizaje asistido por ordenador y en línea . [ 71 ] [ 72 ] Las plataformas de software diseñadas para enseñar conceptos y métodos de bioinformática incluyen Rosalind y los cursos en línea ofrecidos a través del Portal de Formación del Instituto Suizo de Bioinformática . Los Talleres Canadienses de Bioinformática proporcionan vídeos y diapositivas de talleres de formación en su sitio web bajo una licencia Creative Commons . El proyecto 4273π o proyecto 4273pi [ 73 ] también ofrece materiales educativos de código abierto de forma gratuita. El curso se ejecuta en ordenadores Raspberry Pi de bajo coste y se ha utilizado para enseñar a adultos y alumnos. [ 74 ] [ 75 ] 4273 es desarrollado activamente por un consorcio de académicos e investigadores que han llevado a cabo proyectos de bioinformática de nivel de investigación utilizando ordenadores Raspberry Pi y el sistema operativo 4273π. [ 76 ] [ 77 ]

Las plataformas MOOC también ofrecen certificaciones en línea en bioinformática y disciplinas relacionadas, como la Especialización en Bioinformática de Coursera en la Universidad de California, San Diego , la Especialización en Ciencia de Datos Genómicos en la Universidad Johns Hopkins y la Serie XSeries de Análisis de Datos para Ciencias de la Vida de EdX en la Universidad de Harvard .

Conferencias

Existen varias conferencias importantes relacionadas con la bioinformática. Algunos de los ejemplos más destacados son la Conferencia Europea de Biología Computacional (ECCB), Sistemas Inteligentes para la Biología Molecular (ISMB), Simposio del Pacífico sobre Biocomputación (PSB) e Investigación en Biología Molecular Computacional (RECOMB).

Véase también

Referencias

  1. 1 2 Welch L, Lewitter F, Schwartz R (2014). "Directrices curriculares de bioinformática: hacia una definición de competencias básicas" . PLOS Comput Biol . 10 (3) e1003496. Bibcode : 2014PLSCB..10E3496W . doi : 10.1371/journal.pcbi.1003496 . PMC 3945096. PMID 24603430 .  
  2. Lesk AM (26 de julio de 2013). "Bioinformática" . Encyclopaedia Britannica . Archivado del original el 14 de abril de 2021. Recuperado el 17 de abril de 2017 .
  3. 1 2 Sim AY, Minary P, Levitt M (junio de 2012). "Modelado de ácidos nucleicos" . Current Opinion in Structural Biology . 22 (3): 273– 8. doi : 10.1016/j.sbi.2012.03.012 . PMC 4028509. PMID 22538125 .  
  4. ^ Kmiecik S, Gront D, Kolinski M, Wieteska L, Dawid AE, Kolinski A (julio de 2016). "Modelos de proteínas de grano grueso y sus aplicaciones" . Reseñas químicas . 116 (14): 7898– 936. Código bibliográfico : 2016ChRv..116.7898K . doi : 10.1021/acs.chemrev.6b00163 . PMID 27333362 . 
  5. Wong KC (2016). Biología Computacional y Bioinformática: Regulación Génica . CRC Press/Taylor & Francis Group. ISBN 978-1-4987-2497-5.
  6. Joyce AP, Zhang C, Bradley P, Havranek JJ (enero de 2015). "Modelado basado en la estructura de la especificidad proteína-ADN" . Briefings in Functional Genomics . 14 (1): 39– 49. doi : 10.1093/bfgp/elu044 . PMC 4366589. PMID 25414269 .  
  7. Spiga E, Degiacomi MT, Dal Peraro M (2014). "Nuevas estrategias para el modelado dinámico integrador del ensamblaje macromolecular". En Karabencheva-Christova T (ed.). Modelado y simulaciones biomoleculares . Avances en química de proteínas y biología estructural. Vol. 96. Academic Press. pp. 77–111 . doi : 10.1016/bs.apcsb.2014.06.008 . ISBN   978-0-12-800013-7. PMID 25443955 . 
  8. Ciemny M, Kurcinski M, Kamel K, Kolinski A, Alam N, Schueler-Furman O, et al. (agosto de 2018). "Acoplamiento proteína-péptido: oportunidades y desafíos" . Drug Discovery Today . 23 (8): 1530– 1537. doi : 10.1016/j.drudis.2018.05.006 . PMID 29733895 .  
  9. Ouzounis CA, Valencia A (2003). "Bioinformática temprana: el nacimiento de una disciplina: una visión personal" . Bioinformática . 19 (17): 2176– 2190. doi : 10.1093/bioinformatics/btg309 . PMID 14630646 . 
  10. 1 2 Hogeweg P (2011). "Las raíces de la bioinformática en la biología teórica" . PLOS Computational Biology . 7 (3) e1002021. Bibcode : 2011PLSCB...7E2021H . doi : 10.1371/journal.pcbi.1002021 . PMC 3068925. PMID 21483479 .  
  11. ^ Hesper B, Hogeweg P (1970). "BIO-INFORMATICA: een werkconcept" [ BIO-INFORMATICA: un concepto de trabajo ] . Het Kameleon (en holandés). 1 (6): 28-29 .
  12. Hesper B, Hogeweg P (2021). "Bioinformática: un concepto de trabajo. Una traducción de" Bio-informatica: een werkconcept "de B. Hesper y P. Hogeweg". arXiv : 2111.11832v1 [ q-bio.OT ].
  13. Hogeweg P (1978). "Simulación del crecimiento de formas celulares". Simulation . 31 (3): 90– 96. doi : 10.1177/003754977803100305 . S2CID 61206099 . 
  14. Gauthier J, Vincent AT, Charette SJ, Derome N (27 de noviembre de 2019). "Una breve historia de la bioinformática" . Briefings in Bioinformatics . 20 (6): 1981– 1996. doi : 10.1093/bib/bby063 . PMID 30084940 . 
  15. Colby B (2022). "Costo de la secuenciación del genoma completo" . Sequencing.com . Archivado del original el 15 de marzo de 2022. Recuperado el 8 de abril de 2022 .
  16. Sanger F, Tuppy H (1951). "La secuencia de aminoácidos en la cadena fenilalanina de la insulina. I. La identificación de péptidos inferiores a partir de hidrolizados parciales" . Biochemical Journal . 49 (4): 463–81 . doi : 10.1042/bj0490463 . PMC 1197535. PMID 14886310 .  
  17. Sanger F, Thompson EO (1953). "La secuencia de aminoácidos en la cadena glicílica de la insulina. I. La identificación de péptidos inferiores a partir de hidrolizados parciales" . Biochemical Journal . 53 (3): 353– 66. doi : 10.1042/bj0530353 . PMC 1198157. PMID 13032078 .  
  18. Moody G (2004). El código digital de la vida: cómo la bioinformática está revolucionando la ciencia, la medicina y los negocios . Hoboken, NJ, EE. UU.: John Wiley & Sons. ISBN 978-0-471-32788-2.
  19. Dayhoff MO, Eck RV, Chang MA, Sochard MR (1965). ATLAS de SECUENCIA Y ESTRUCTURA DE PROTEÍNAS (PDF) . Silver Spring, MD, EE. UU.: National Biomedical Research Foundation. LCCN 65-29342 . 
  20. Eck RV, Dayhoff MO (abril de 1966). "Evolución de la estructura de la ferredoxina basada en reliquias vivientes de secuencias de aminoácidos primitivas". Science . 152 ( 3720): 363– 6. Bibcode : 1966Sci...152..363E . doi : 10.1126/science.152.3720.363 . PMID 17775169. S2CID 23208558 .  
  21. Johnson G, Wu TT (enero de 2000). "Base de datos Kabat y sus aplicaciones: 30 años después del primer gráfico de variabilidad" . Nucleic Acids Research . 28 (1): 214–8 . doi : 10.1093/nar/28.1.214 . PMC 102431. PMID 10592229 .  
  22. Erickson JW, Altman GG (1979). "Una búsqueda de patrones en la secuencia de nucleótidos del genoma MS2". Journal of Mathematical Biology . 7 (3): 219– 230. doi : 10.1007/BF00275725 . S2CID 85199492 . 
  23. Shulman MJ, Steinberg CM, Westmoreland N (febrero de 1981). "La función codificante de las secuencias de nucleótidos se puede discernir mediante análisis estadístico". Journal of Theoretical Biology . 88 (3): 409–20 . Bibcode : 1981JThBi..88..409S . doi : 10.1016/0022-5193(81)90274-5 . PMID 6456380 . 
  24. Xiong J (2006). Essential Bioinformatics . Cambridge, Reino Unido: Cambridge University Press. pp . 4. ISBN  978-0-511-16815-4 vía Internet Archive.
  25. Sanger F, Air GM, Barrell BG, Brown NL, Coulson AR, Fiddes CA, et al. (febrero de 1977). "Secuencia de nucleótidos del ADN del bacteriófago phi X174". Nature . 265 ( 5596): 687– 95. Bibcode : 1977Natur.265..687S . doi : 10.1038/265687a0 . PMID 870828. S2CID 4206886 .   
  26. Benson DA, Karsch-Mizrachi I, Lipman DJ, Ostell J, Wheeler DL (enero de 2008). "GenBank" . Nucleic Acids Research . 36 (número especial de bases de datos): D25-30. doi : 10.1093 / nar/gkm929 . PMC 2238942. PMID 18073190 .  
  27. 123Fleischmann RD, Adams MD, White O, Clayton RA, Kirkness EF, Kerlavage AR, et al. (July 1995). "Whole-genome random sequencing and assembly of Haemophilus influenzae Rd". Science. 269 (5223): 496–512. Bibcode:1995Sci...269..496F. doi:10.1126/science.7542800. PMID 7542800.
  28. Stein L (2001). "Genome annotation: from sequence to biology". Nature. 2 (7): 493–503. doi:10.1038/35080529. PMID 11433356. S2CID 12044602.
  29. Erdin S, Lisewski AM, Lichtarge O (April 2011). "Protein function prediction: towards integration of similarity metrics". Current Opinion in Structural Biology. 21 (2): 180–8. doi:10.1016/j.sbi.2011.02.001. PMC 3120633. PMID 21353529.
  30. Carvajal-Rodríguez A (March 2010). "Simulation of genes and genomes forward in time". Current Genomics. 11 (1): 58–61. doi:10.2174/138920210790218007. PMC 2851118. PMID 20808525.
  31. Brown TA (2002). "Mutation, Repair and Recombination". Genomes (2nd ed.). Manchester (UK): Oxford.
  32. Carter NP, Fiegler H, Piper J (October 2002). "Comparative analysis of comparative genomic hybridization microarray technologies: report of a workshop sponsored by the Wellcome Trust". Cytometry. 49 (2): 43–8. doi:10.1002/cyto.10153. PMID 12357458.
  33. Chaudhari NM, Gupta VK, Dutta C (April 2016). "BPGA- an ultra-fast pan-genome analysis pipeline". Scientific Reports. 6 24373. Bibcode:2016NatSR...624373C. doi:10.1038/srep24373. PMC 4829868. PMID 27071527.
  34. Aston KI (May 2014). "Genetic susceptibility to male infertility: news from genome-wide association studies". Andrology. 2 (3): 315–21. doi:10.1111/j.2047-2927.2014.00188.x. PMID 24574159. S2CID 206007180.
  35. Véron A, Blein S, Cox DG (2014). "Genome-wide association studies and the clinic: a focus on breast cancer". Biomarkers in Medicine. 8 (2): 287–96. doi:10.2217/bmm.13.121. PMID 24521025.
  36. Tosto G, Reitz C (October 2013). "Genome-wide association studies in Alzheimer's disease: a review". Current Neurology and Neuroscience Reports. 13 (10) 381. doi:10.1007/s11910-013-0381-0. PMC 3809844. PMID 23954969.
  37. Londin E, Yadav P, Surrey S, Kricka LJ, Fortina P (2013). "Use of linkage analysis, genome-wide association studies, and next-generation sequencing in the identification of disease-causing mutations". Pharmacogenomics. Methods in Molecular Biology. Vol. 1015. pp. 127–46. doi:10.1007/978-1-62703-435-7_8. ISBN 978-1-62703-434-0. PMID 23824853.
  38. Hindorff LA, Sethupathy P, Junkins HA, Ramos EM, Mehta JP, Collins FS, et al. (June 2009). "Potential etiologic and functional implications of genome-wide association loci for human diseases and traits". Proceedings of the National Academy of Sciences of the United States of America. 106 (23): 9362–7. Bibcode:2009PNAS..106.9362H. doi:10.1073/pnas.0903103106. PMC 2687147. PMID 19474294.
  39. Hall LO (2010). "Finding the right genes for disease and prognosis prediction". 2010 International Conference on System Science and Engineering. pp. 1–2. doi:10.1109/ICSSE.2010.5551766. ISBN 978-1-4244-6472-2. S2CID 21622726.
  40. Manolio TA, Collins FS, Cox NJ, Goldstein DB, Hindorff LA, Hunter DJ, et al. (octubre de 2009). "Encontrando la heredabilidad faltante de las enfermedades complejas" . Nature . 461 ( 7265): 747–753 . Bibcode : 2009Natur.461..747M . doi : 10.1038/nature08494 . PMC 2831613. PMID 19812666 .   
  41. Wainschtein P, Jain D, Zheng Z, Aslibekyan S, Becker D, Bi W, et al. (marzo de 2022). "Evaluación de la contribución de variantes raras a la heredabilidad de rasgos complejos a partir de datos de secuenciación del genoma completo" . Nature Genetics . 54 (3): 263– 273. doi : 10.1038/s41588-021-00997-7 . PMC 9119698. PMID 35256806 .   
  42. Taliun D, ​​Harris DN, Kessler MD, Carlson J, Szpiech ZA, Torres R, et al. (febrero de 2021). " Secuenciación de 53.831 genomas diversos del programa NHLBI TOPMed" . Nature . 590 (7845): 290–299 . Bibcode : 2021Natur.590..290T . doi : 10.1038/s41586-021-03205-y . PMC 7875770. PMID 33568819 .   {{cite journal}}: Mantenimiento de CS1: configuración sobrescrita ( enlace )
  43. Li X, Li Z, Zhou H, Gaynor SM, Liu Y, Chen H, et al. (septiembre de 2020). "La incorporación dinámica de múltiples anotaciones funcionales in silico potencia el análisis de asociación de variantes raras de grandes estudios de secuenciación del genoma completo a escala" . Nature Genetics . 52 (9): 969–983 . doi : 10.1038/s41588-020-0676-4 . PMC 7483769. PMID 32839606 .   
  44. Li Z, Li X, Zhou H, Gaynor SM, Selvaraj MS, Arapoglou T, et al. (diciembre de 2022). " Un marco para detectar asociaciones de variantes raras no codificantes de estudios de secuenciación de genoma completo a gran escala" . Nature Methods . 19 (12): 1599– 1611. doi : 10.1038/s41592-022-01640- x . PMC 10008172. PMID 36303018. S2CID 243873361 .    
  45. "STAARpipeline: una herramienta integral para variantes raras en datos de secuenciación del genoma completo a escala de biobanco". Nature Methods . 19 (12): 1532– 1533. Diciembre de 2022. doi : 10.1038 /s41592-022-01641-w . PMID 36316564. S2CID 253246835 .  
  46. Li X, Quick C, Zhou H, Gaynor SM, Liu Y, Chen H, et al. (enero de 2023). " Metaanálisis potente, escalable y eficiente en recursos de asociaciones de variantes raras en grandes estudios de secuenciación del genoma completo" . Nature Genetics . 55 (1): 154–164 . doi : 10.1038/s41588-022-01225-6 . PMC 10084891. PMID 36564505. S2CID 255084231 .    
  47. Tsourakakis CE, Tolliver D, Tsiarli MA, Shackney S, Schwartz R (2010). "CGHTRIMMER: Discretización de datos CGH de matriz ruidosos". arXiv : 1002.4438 [ q-bio.GN ].
  48. Yau C, Mouradov D, Jorissen RN, Colella S, Mirza GK, Steers G, et al. (2010). " Un enfoque estadístico para detectar aberraciones genómicas en muestras tumorales heterogéneas a partir de datos de genotipado de polimorfismos de un solo nucleótido" . Genome Biology . 11 (9): R92. doi : 10.1186/gb-2010-11-9-r92 . PMC 2941741. PMID 20804551 .   
  49. Vazquez M, de la Torre V, Valencia A (27 de diciembre de 2012). "Capítulo 14: Análisis del genoma del cáncer" . PLOS Computational Biology . 8 (12) e1002824. Bibcode : 2012PLSCB...8E2824V . doi : 10.1371/journal.pcbi.1002824 . PMC 3531315. PMID 23300415 .  
  50. Hye-Jung EC, Jaswinder K, Martin K, Samuel AA, Marco AM (2014). «Secuenciación de segunda generación para el análisis del genoma del cáncer». En Dellaire G, Berman JN, Arceci RJ (eds.). Genómica del cáncer . Boston (EE. UU.): Academic Press. págs. 13–30 . doi : 10.1016/B978-0-12-396967-5.00002-5 . ISBN  978-0-12-396967-5.
  51. Grau J, Ben-Gal I, Posch S, Grosse I (julio de 2006). "VOMBAT: predicción de sitios de unión de factores de transcripción mediante árboles bayesianos de orden variable" . Nucleic Acids Research . 34 (número especial de servidores web): W529-33. doi : 10.1093/nar/gkl212 . PMC 1538886. PMID 16845064 .  
  52. "El Atlas de Proteínas Humanas" . www.proteinatlas.org . Archivado del original el 4 de marzo de 2020. Consultado el 2 de octubre de 2017 .
  53. "La célula humana" . www.proteinatlas.org . Archivado del original el 2 de octubre de 2017. Consultado el 2 de octubre de 2017 .
  54. Thul PJ, Åkesson L, Wiking M, Mahdessian D, Geladaki A, Ait Blal H, et al. (mayo de 2017). "Un mapa subcelular del proteoma humano". Science . 356 (6340) eaal3321. Bibcode : 2017Sci...356l3321T . doi : 10.1126/science.aal3321 . PMID 28495876. S2CID 10744558 .   
  55. Ay F, Noble WS (septiembre de 2015). " Métodos de análisis para estudiar la arquitectura 3D del genoma" . Genome Biology . 16 (1) 183. doi : 10.1186/s13059-015-0745-7 . PMC 4556012. PMID 26328929 .  
  56. Kryshtafovych A, Schwede T, Topf M, Fidelis K, Moult J (2019). "Evaluación crítica de los métodos de predicción de la estructura de proteínas (CASP) – Ronda XIII" . Proteins . 87 ( 12): 1011– 1020. doi : 10.1002/prot.25823 . PMC 6927249. PMID 31589781 .  
  57. "Inicio - CASP14" . predictioncenter.org . Archivado del original el 30 de enero de 2023. Consultado el 12 de junio de 2023 .
  58. Hoy JA, Robinson H, Trent JT, Kakar S, Smagghe BJ, Hargrove MS (agosto de 2007). "Hemoglobinas vegetales: un registro fósil molecular para la evolución del transporte de oxígeno". Journal of Molecular Biology . 371 (1): 168– 79. doi : 10.1016/j.jmb.2007.05.029 . PMID 17560601 . 
  59. Jumper J, Evans R, Pritzel A, Green T, Figurnov M, Ronneberger O, et al. (agosto de 2021). "Predicción de estructura proteica de alta precisión con AlphaFold" . Nature . 596 (7873): 583– 589. Bibcode : 2021Natur.596..583J . doi : 10.1038/s41586-021-03819-2 . ISSN 1476-4687 . PMC 8371605. PMID 34265844 .    
  60. "Base de datos de estructura de proteínas AlphaFold" . alphafold.ebi.ac.uk . Archivado del original el 24 de julio de 2021. Consultado el 10 de octubre de 2022 .
  61. Titz B, Rajagopala SV, Goll J, Häuser R, McKevitt MT, Palzkill T, et al. (mayo de 2008). Hall N (ed.). "El interactoma de proteínas binarias de Treponema pallidum: la espiroqueta de la sífilis" . PLOS ONE . 3 (5) e2292. Bibcode : 2008PLoSO...3.2292T . doi : 10.1371/ journal.pone.0002292 . PMC 2386257. PMID 18509523 .   
  62. Groß A, Pruski C, Rahm E (1 de enero de 2016). "Evolución de las ontologías y mapeos biomédicos: panorama general de los enfoques recientes" . Computational and Structural Biotechnology Journal . 14 : 333–340 . doi : 10.1016/j.csbj.2016.08.002 . ISSN 2001-0370 . PMC 5018063 .  
  63. 1 2 "Fundación de Bioinformática Abierta: Sobre nosotros" . Sitio web oficial . Fundación de Bioinformática Abierta . Archivado del original el 12 de mayo de 2011. Recuperado el 10 de mayo de 2011 .
  64. "Fundación de Bioinformática Abierta: BOSC" . Sitio web oficial . Fundación de Bioinformática Abierta . Archivado del original el 18 de julio de 2011. Consultado el 10 de mayo de 2011 .
  65. Nisbet R, Elder IV J, Miner G (2009). "Bioinformática" . Manual de análisis estadístico y aplicaciones de minería de datos . Academic Press. pág. 328. ISBN  978-0-08-091203-5.
  66. Oficina del Comisionado. "Avances en la ciencia regulatoria: Taller público del 24 al 25 de septiembre de 2014: Estándares de secuenciación de próxima generación" . www.fda.gov . Archivado del original el 14 de noviembre de 2017. Consultado el 30 de noviembre de 2017 .
  67. Simonyan V, Goecks J, Mazumder R (2017). "Objetos biocomputacionales: un paso hacia la evaluación y validación de cálculos científicos biomédicos" . PDA Journal of Pharmaceutical Science and Technology . 71 (2): 136– 146. doi : 10.5731/pdajpst.2016.006734 . PMC 5510742. PMID 27974626 .  
  68. Oficina del Comisionado. «Promoción de la ciencia regulatoria: desarrollo comunitario de estándares HTS para la validación de datos y computación y el fomento de la interoperabilidad» . www.fda.gov . Archivado del original el 26 de enero de 2018. Consultado el 30 de noviembre de 2017 .
  69. Alterovitz G, Dean D, Goble C, Crusoe MR, Soiland-Reyes S, Bell A, et al. (diciembre de 2018). "Habilitando la medicina de precisión a través de la comunicación estándar de la procedencia, el análisis y los resultados de HTS" . PLOS Biology . 16 (12) e3000099. doi : 10.1371/journal.pbio.3000099 . PMC 6338479. PMID 30596645 .   
  70. El proyecto BioCompute Object (BCO) es un marco colaborativo e impulsado por la comunidad para estandarizar los datos computacionales de HTS. 1. Documento de especificación de BCO: manual de usuario para comprender y crear B. , biocompute-objects, 3 de septiembre de 2017, archivado del original el 27 de junio de 2018 , recuperado el 30 de noviembre de 2017
  71. Campbell AM (1 June 2003). "Public Access for Teaching Genomics, Proteomics, and Bioinformatics". Cell Biology Education. 2 (2): 98–111. doi:10.1187/cbe.03-02-0007. PMC 162192. PMID 12888845.
  72. Arenas M (September 2021). "General considerations for online teaching practices in bioinformatics in the time of COVID -19". Biochemistry and Molecular Biology Education. 49 (5): 683–684. doi:10.1002/bmb.21558. ISSN 1470-8175. PMC 8426940. PMID 34231941.
  73. Barker D, Ferrier DE, Holland PW, Mitchell JB, Plaisier H, Ritchie MG, et al. (August 2013). "4273π: bioinformatics education on low cost ARM hardware". BMC Bioinformatics. 13 243: 522. doi:10.1186/1471-2105-14-243. PMC 3751261. PMID 23937194.
  74. Barker D, Alderson RG, McDonagh JL, Plaisier H, Comrie MM, Duncan L, et al. (2015). "University-level practical activities in bioinformatics benefit voluntary groups of pupils in the last 2 years of school". International Journal of STEM Education. 2 (17) 17. doi:10.1186/s40594-015-0030-z. hdl:10023/7704. S2CID 256396656.
  75. McDonagh JL, Barker D, Alderson RG (2016). "Bringing computational science to the public". SpringerPlus. 5 (259) 259. doi:10.1186/s40064-016-1856-7. PMC 4775721. PMID 27006868.
  76. Robson JF, Barker D (October 2015). "Comparison of the protein-coding gene content of Chlamydia trachomatis and Protochlamydia amoebophila using a Raspberry Pi computer". BMC Research Notes. 8 (561) 561. doi:10.1186/s13104-015-1476-2. PMC 4604092. PMID 26462790.
  77. Wreggelsworth KM, Barker D (octubre de 2015). "Una comparación de los genomas codificadores de proteínas de dos bacterias verdes del azufre, Chlorobium tepidum TLS y Pelodictyon phaeoclathratiforme BU-1" . BMC Research Notes . 8 (565) 565. doi : 10.1186/s13104-015-1535-8 . PMC 4606965. PMID 26467441 .  

Lecturas adicionales

  • Sehgal et al.:  Estudios estructurales, filogenéticos y de acoplamiento del activador de la D-aminoácido oxidasa (DAOA), un gen candidato para la esquizofrenia. Theoretical Biology and Medical Modelling 2013 10:3.
  • Achuthsankar S Nair, Biología Computacional y Bioinformática: Una Introducción. Archivado el 16 de diciembre de 2008 en Wayback Machine , Communications of Computer Society of India, enero de 2007.
  • Aluru, Srinivas , ed. Manual de biología molecular computacional . Chapman & Hall/CRC, 2006. ISBN 1-58488-406-1(Serie de Ciencias de la Computación e Información de Chapman & Hall/CRC)
  • Baldi, P y Brunak , S, Bioinformática: El enfoque del aprendizaje automático , 2.ª edición. MIT Press, 2001. ISBN 0-262-02506-X
  • Barnes, MR y Gray, IC, eds., Bioinformática para genetistas , primera edición. Wiley, 2003. ISBN 0-470-84394-2
  • Baxevanis, AD y Ouellette , BFF, eds., Bioinformática: Una guía práctica para el análisis de genes y proteínas , tercera edición. Wiley, 2005. ISBN 0-471-47878-4
  • Baxevanis, AD, Petsko, GA, Stein, LD y Stormo, GD, eds., Current Protocols in Bioinformatics . Wiley, 2007. ISBN 0-471-25093-7
  • Cristianini, N. y Hahn, M. Introducción a la genómica computacional. Archivado el 4 de enero de 2009 en Wayback Machine , Cambridge University Press, 2006. ( ISBN) 9780521671910| ISBN 0-521-67191-4)
  • Durbin, R., S. Eddy, A. Krogh y G. Mitchison, Análisis de secuencias biológicas . Cambridge University Press, 1998. ISBN 0-521-62971-3
  • Gilbert D (septiembre de 2004). "Recursos de software de bioinformática" . Briefings in Bioinformatics . 5 (3): 300–4 . doi : 10.1093/bib/5.3.300 . PMID 15383216 . 
  • Keedwell, E., Bioinformática inteligente: La aplicación de técnicas de inteligencia artificial a problemas bioinformáticos . Wiley, 2005. ISBN 0-470-02175-6
  • Kohane, et al. Microarrays for an Integrative Genomics. The MIT Press, 2002. ISBN 0-262-11271-X
  • Lund, O. et al. Immunological Bioinformatics. The MIT Press, 2005. ISBN 0-262-12280-4
  • Pachter, Lior and Sturmfels, Bernd. "Algebraic Statistics for Computational Biology" Cambridge University Press, 2005. ISBN 0-521-85700-7
  • Pevzner, Pavel A. Computational Molecular Biology: An Algorithmic Approach The MIT Press, 2000. ISBN 0-262-16197-4
  • Soinov, L. Bioinformatics and Pattern Recognition Come TogetherArchived 10 May 2013 at the Wayback Machine Journal of Pattern Recognition Research (JPRRArchived 8 September 2008 at the Wayback Machine), Vol 1 (1) 2006 p. 37–41
  • Stevens, Hallam, Life Out of Sequence: A Data-Driven History of Bioinformatics, Chicago: The University of Chicago Press, 2013, ISBN 9780226080208
  • Tisdall, James. "Beginning Perl for Bioinformatics" O'Reilly, 2001. ISBN 0-596-00080-4
  • Catalyzing Inquiry at the Interface of Computing and Biology (2005) CSTB reportArchived 28 January 2007 at the Wayback Machine
  • Calculating the Secrets of Life: Contributions of the Mathematical Sciences and computing to Molecular Biology (1995)Archived 6 July 2008 at the Wayback Machine
  • Foundations of Computational and Systems Biology MIT Course
  • Computational Biology: Genomes, Networks, Evolution Free MIT CourseArchived 8 April 2013 at the Wayback Machine
  • Bioinformatics Resource Portal (SIB)