Articulo de referencia

Bioinformática

Bioinformática temprana: alineación computacional de secuencias determinadas experimentalmente de una clase de proteínas relacionadas; consulte el apartado Análisis de secuenc...

Escucha este artículo

Bioinformática temprana: alineación computacional de secuencias determinadas experimentalmente de una clase de proteínas relacionadas; consulte el apartado  Análisis de secuencias para obtener más información.
Mapa del cromosoma X humano (del sitio web del Centro Nacional de Información Biotecnológica (NCBI))

Bioinformática ( / ˌ b . ˌ ɪ n f ər ˈ m æ t ɪ k s / ) es uncampocientíficointerdisciplinarioque desarrolla métodos computacionales yherramientas de softwarepara comprenderbiológicos, especialmente cuando los conjuntos de datos son grandes y complejos. La bioinformática integra principios debiología,química,física,informática,ciencia de datos,programación informática,ingeniería de la información,matemáticasyestadísticapara analizar e interpretardatos biológicos. [ 1 ] Este proceso a veces se denominabiología computacional; sin embargo, la distinción entre ambos términos suele ser objeto de debate. El términobiología computacionalpuede referirse a la construcción y el uso de modelos desistemas biológicos.

Se han utilizado técnicas computacionales, estadísticas y de programación informática para el análisis mediante simulación computacional de consultas biológicas. Estas incluyen la reutilización de "pipelines" de análisis específicos, particularmente en el campo de la genómica , como la identificación de genes y polimorfismos de un solo nucleótido ( SNP ). Estos pipelines se utilizan para comprender mejor la base genética de las enfermedades, las adaptaciones únicas, las propiedades deseables (especialmente en especies agrícolas) o las diferencias entre poblaciones. La bioinformática también incluye la proteómica , cuyo objetivo es comprender los principios organizativos dentro de las secuencias de ácidos nucleicos y proteínas . [ 2 ]

El procesamiento de imágenes y señales permite extraer resultados útiles de grandes cantidades de datos brutos. Ayuda en la secuenciación y anotación de genomas y sus mutaciones observadas . La bioinformática incluye la minería de texto de la literatura biológica y el desarrollo de ontologías biológicas y genéticas para organizar y consultar datos biológicos. También desempeña un papel en el análisis de la expresión y regulación de genes y proteínas. Las herramientas bioinformáticas ayudan a comparar, analizar e interpretar datos genéticos y genómicos y a comprender los aspectos evolutivos de la biología molecular. A un nivel más integrador, ayuda a analizar y catalogar las vías y redes biológicas que son una parte importante de la biología de sistemas . En biología estructural , ayuda en la simulación y modelado de ADN, [ 3 ] ARN, [ 3 ] [ 1 ] proteínas [ 4 ] así como interacciones biomoleculares. [ 5 ] [ 6 ] [ 7 ] [ 8 ]

Historia

La primera definición del término bioinformática fue acuñada por Paulien Hogeweg y Ben Hesper en 1970, para referirse al estudio de los procesos de información en sistemas bióticos. [ 9 ] [ 10 ] [ 11 ] [ 12 ] [ 13 ] Esta definición situó a la bioinformática como un campo paralelo a la bioquímica (el estudio de los procesos químicos en sistemas biológicos). [ 10 ]

La bioinformática y la biología computacional implican el análisis de datos biológicos, en particular secuencias de ADN, ARN y proteínas. El campo de la bioinformática experimentó un crecimiento explosivo a partir de mediados de la década de 1990, impulsado en gran medida por el Proyecto Genoma Humano y por los rápidos avances en la tecnología de secuenciación de ADN. [ 14 ]

El análisis de datos biológicos para generar información útil implica la creación y ejecución de programas informáticos que utilizan algoritmos de la teoría de grafos , la inteligencia artificial , la computación blanda , la minería de datos , el procesamiento de imágenes y la simulación por ordenador . Estos algoritmos, a su vez, dependen de fundamentos teóricos como las matemáticas discretas , la teoría de control , la teoría de sistemas , la teoría de la información y la estadística .

Secuencias

Las secuencias de material genético se utilizan con frecuencia en bioinformática y son más fáciles de gestionar mediante ordenadores que manualmente.
Estas son secuencias que se comparan en un alineamiento múltiple de secuencias (MSA) de MUSCLE. El nombre de cada secuencia (columna de la izquierda) corresponde a diferentes especies de piojos, mientras que las secuencias en sí se encuentran en la segunda columna.

Se ha producido un avance tremendo en velocidad y reducción de costos desde la finalización del Proyecto Genoma Humano, con algunos laboratorios capaces de secuenciar más de 100 000 billones de bases cada año, y un genoma completo puede secuenciarse por $1000 o menos. [ 15 ]

Las computadoras se volvieron esenciales en biología molecular cuando las secuencias de proteínas estuvieron disponibles después de que Frederick Sanger determinara la secuencia de la insulina a principios de la década de 1950. [ 16 ] [ 17 ] Comparar múltiples secuencias manualmente resultó ser poco práctico. Margaret Oakley Dayhoff , una pionera en el campo, [ 18 ] compiló una de las primeras bases de datos de secuencias de proteínas, publicada inicialmente como libros [ 19 ] así como métodos de alineación de secuencias y evolución molecular . [ 20 ] Otro contribuyente temprano a la bioinformática fue Elvin A. Kabat , quien fue pionero en el análisis de secuencias biológicas en 1970 con sus volúmenes completos de secuencias de anticuerpos publicados en línea con Tai Te Wu entre 1980 y 1991. [ 21 ]

En la década de 1970, se aplicaron nuevas técnicas de secuenciación de ADN a los bacteriófagos MS2 y øX174, y las secuencias de nucleótidos extendidas se analizaron mediante algoritmos estadísticos e informativos. Estos estudios demostraron que características bien conocidas, como los segmentos codificantes y el código de tripletes, se revelan en análisis estadísticos sencillos y fueron la prueba del concepto de que la bioinformática sería útil. [ 22 ] [ 23 ]

Objetivos

Para estudiar cómo se alteran las actividades celulares normales en diferentes estados patológicos, es necesario combinar datos biológicos brutos para obtener una visión integral de dichas actividades. Por lo tanto , el campo de la bioinformática ha evolucionado de tal manera que la tarea más urgente ahora implica el análisis e interpretación de diversos tipos de datos. Esto incluye secuencias de nucleótidos y aminoácidos , dominios proteicos y estructuras proteicas . [ 24 ]

Entre las subdisciplinas importantes dentro de la bioinformática y la biología computacional se incluyen:

  • Desarrollo e implementación de programas informáticos para acceder, gestionar y utilizar de forma eficiente diversos tipos de información.
  • Desarrollo de nuevos algoritmos matemáticos y medidas estadísticas para evaluar las relaciones entre los elementos de grandes conjuntos de datos. Por ejemplo, existen métodos para localizar un gen dentro de una secuencia, predecir la estructura y/o función de una proteína y agrupar secuencias de proteínas en familias de secuencias relacionadas.

El objetivo principal de la bioinformática es aumentar la comprensión de los procesos biológicos. Lo que la distingue de otros enfoques es su énfasis en el desarrollo y la aplicación de técnicas computacionalmente intensivas para lograr este objetivo. Algunos ejemplos son: el reconocimiento de patrones , la minería de datos , los algoritmos de aprendizaje automático y la visualización . Las principales líneas de investigación en este campo incluyen el alineamiento de secuencias , la identificación de genes , el ensamblaje del genoma , el diseño de fármacos , el descubrimiento de fármacos , el alineamiento de la estructura de proteínas , la predicción de la estructura de proteínas , la predicción de la expresión génica y las interacciones proteína-proteína , los estudios de asociación del genoma completo , el modelado de la evolución y la división/mitosis celular.

La bioinformática implica la creación y el avance de bases de datos, algoritmos, técnicas computacionales y estadísticas, y teoría para resolver problemas formales y prácticos derivados de la gestión y el análisis de datos biológicos.

En las últimas décadas, los rápidos avances en las tecnologías de investigación genómica y molecular, junto con los avances en las tecnologías de la información, han generado una enorme cantidad de información relacionada con la biología molecular. La bioinformática es el nombre que reciben estos enfoques matemáticos y computacionales utilizados para comprender los procesos biológicos.

Entre las actividades comunes en bioinformática se incluyen el mapeo y análisis de secuencias de ADN y proteínas, la alineación de secuencias de ADN y proteínas para compararlas, y la creación y visualización de modelos 3D de estructuras proteicas.

Análisis de secuencias

Desde que se secuenció el bacteriófago Phage Φ-X174 en 1977, [ 25 ] las secuencias de ADN de miles de organismos se han decodificado y almacenado en bases de datos. Esta información de secuencia se analiza para determinar genes que codifican proteínas , genes de ARN, secuencias reguladoras, motivos estructurales y secuencias repetitivas. Una comparación de genes dentro de una especie o entre diferentes especies puede mostrar similitudes entre las funciones de las proteínas o relaciones entre especies (el uso de la sistemática molecular para construir árboles filogenéticos ). Con la creciente cantidad de datos, hace mucho tiempo que se volvió impracticable analizar secuencias de ADN manualmente. Los programas informáticos como BLAST se utilizan de forma rutinaria para buscar secuencias; a fecha de 2008, de más de 260 000 organismos, que contienen más de 190 000 millones de nucleótidos . [ 26 ]

secuenciación de ADN

Antes de poder analizar las secuencias, estas se obtienen de un banco de datos, como GenBank. La secuenciación de ADN sigue siendo un problema complejo, ya que los datos brutos pueden contener ruido o verse afectados por señales débiles. Se han desarrollado algoritmos para la identificación de bases en los diversos enfoques experimentales de la secuenciación de ADN.

Imagen: 450 píxeles. Pasos del análisis de secuenciación.
Imagen: 450 píxeles. Pasos del análisis de secuenciación.

Ensamblaje de secuencias

La mayoría de las técnicas de secuenciación de ADN producen fragmentos cortos de secuencia que deben ensamblarse para obtener secuencias completas de genes o genomas. La técnica de secuenciación de escopeta (utilizada por el Instituto de Investigación Genómica (TIGR) para secuenciar el primer genoma bacteriano, Haemophilus influenzae ) [ 27 ] genera secuencias de miles de pequeños fragmentos de ADN (de entre 35 y 900 nucleótidos de longitud, según la tecnología de secuenciación). Los extremos de estos fragmentos se superponen y, cuando se alinean correctamente mediante un programa de ensamblaje de genomas, pueden utilizarse para reconstruir el genoma completo. La secuenciación de escopeta proporciona datos de secuencia rápidamente, pero la tarea de ensamblar los fragmentos puede ser bastante compleja para genomas grandes. Para un genoma tan grande como el humano , puede requerir muchos días de tiempo de CPU en ordenadores multiprocesador con gran capacidad de memoria para ensamblar los fragmentos, y el ensamblaje resultante suele contener numerosos huecos que deben rellenarse posteriormente. La secuenciación aleatoria es el método preferido para prácticamente todos los genomas secuenciados (en lugar de los métodos de terminación de cadena o degradación química), y los algoritmos de ensamblaje de genomas son un área crítica de la investigación bioinformática.

Anotación del genoma

En genómica , la anotación se refiere al proceso de marcar las regiones de inicio y fin de los genes y otras características biológicas en una secuencia de ADN. Muchos genomas son demasiado grandes para ser anotados manualmente. Dado que la tasa de secuenciación supera la de anotación genómica, esta última se ha convertido en el principal obstáculo en bioinformática.

La anotación del genoma se puede clasificar en tres niveles: el de nucleótidos , el de proteínas y el de procesos.

La identificación de genes es un aspecto fundamental de la anotación a nivel de nucleótidos. Para genomas complejos, una combinación de predicción genética ab initio y comparación de secuencias con bases de datos de secuencias expresadas y otros organismos puede resultar eficaz. La anotación a nivel de nucleótidos también permite integrar la secuencia del genoma con otros mapas genéticos y físicos del mismo.

El objetivo principal de la anotación a nivel de proteínas es asignar una función a las proteínas del genoma. Para este tipo de anotación se utilizan bases de datos de secuencias de proteínas, dominios funcionales y motivos. Aproximadamente la mitad de las proteínas predichas en una nueva secuencia genómica tienden a no tener una función evidente.

El objetivo de la anotación a nivel de proceso es comprender la función de los genes y sus productos en el contexto de la fisiología celular y orgánica. Un obstáculo para la anotación a nivel de proceso ha sido la inconsistencia de los términos utilizados por diferentes sistemas modelo. El Consorcio de Ontología Génica está ayudando a resolver este problema. [ 28 ]

La primera descripción de un sistema de anotación integral fue publicada en 1995 [ 27 ] por el Instituto de Investigación Genómica , que realizó la primera secuenciación y análisis completos del genoma de un organismo de vida libre (no simbiótico ), la bacteria Haemophilus influenzae . [ 27 ] El sistema identifica los genes que codifican todas las proteínas, ARN de transferencia y ARN ribosómicos, con el fin de realizar asignaciones funcionales iniciales. El programa GeneMark, entrenado para encontrar genes codificadores de proteínas en Haemophilus influenzae , está en constante evolución y mejora.

Tras los objetivos que el Proyecto Genoma Humano dejó pendientes después de su cierre en 2003, el Instituto Nacional de Investigación del Genoma Humano desarrolló el proyecto ENCODE . Este proyecto consiste en la recopilación colaborativa de datos sobre los elementos funcionales del genoma humano, utilizando tecnologías de secuenciación de ADN de última generación y matrices de mosaico genómico. Estas tecnologías permiten generar automáticamente grandes cantidades de datos a un coste por base drásticamente reducido, pero con la misma precisión (error de identificación de bases) y fidelidad (error de ensamblaje).

predicción de la función genética

Si bien la anotación del genoma se basa principalmente en la similitud de secuencias (y, por lo tanto, en la homología ), otras propiedades de las secuencias pueden utilizarse para predecir la función de los genes. De hecho, la mayoría de los métodos de predicción de la función génica se centran en las secuencias de proteínas , ya que son más informativas y contienen más características. Por ejemplo, la distribución de aminoácidos hidrofóbicos predice los segmentos transmembrana en las proteínas. Sin embargo, la predicción de la función proteica también puede utilizar información externa, como datos de expresión génica (o proteica) , estructura proteica o interacciones proteína-proteína . [ 29 ]

Biología evolutiva computacional

La biología evolutiva es el estudio del origen y la descendencia de las especies , así como de su cambio a lo largo del tiempo. La informática ha ayudado a los biólogos evolutivos al permitir a los investigadores:

  • rastrear la evolución de un gran número de organismos midiendo los cambios en su ADN , en lugar de hacerlo únicamente a través de la taxonomía física o las observaciones fisiológicas,
  • comparar genomas completos , lo que permite el estudio de eventos evolutivos más complejos, como la duplicación de genes , la transferencia horizontal de genes y la predicción de factores importantes en la especiación bacteriana ,
  • construir modelos complejos de genética de poblaciones computacionales para predecir el resultado del sistema a lo largo del tiempo [ 30 ]
  • rastrear y compartir información sobre un número cada vez mayor de especies y organismos.

Genómica comparativa

El núcleo del análisis comparativo del genoma es el establecimiento de la correspondencia entre genes ( análisis de ortología ) u otras características genómicas en diferentes organismos. Los mapas intergenómicos se crean para rastrear los procesos evolutivos responsables de la divergencia de dos genomas. Una multitud de eventos evolutivos que actúan en varios niveles organizativos dan forma a la evolución del genoma. En el nivel más bajo, las mutaciones puntuales afectan a nucleótidos individuales. En un nivel superior, grandes segmentos cromosómicos sufren duplicación, transferencia lateral, inversión, transposición, deleción e inserción. [ 31 ] Genomas enteros están involucrados en procesos de hibridación, poliploidización y endosimbiosis que conducen a una especiación rápida. La complejidad de la evolución del genoma plantea muchos desafíos apasionantes para los desarrolladores de modelos y algoritmos matemáticos, quienes recurren a un espectro de técnicas algorítmicas, estadísticas y matemáticas, que van desde algoritmos exactos, heurísticos , de parámetros fijos y de aproximación para problemas basados ​​en modelos de parsimonia hasta algoritmos de Monte Carlo de cadena de Markov para el análisis bayesiano de problemas basados ​​en modelos probabilísticos.

Muchos de estos estudios se basan en la detección de homología de secuencias para asignar secuencias a familias de proteínas . [ 32 ]

Pangenómica

La pangenómica es un concepto introducido en 2005 por Tettelin y Medini. El pangenoma es el repertorio genético completo de un grupo taxonómico monofilético particular . Aunque inicialmente se aplicó a cepas estrechamente relacionadas de una especie, puede aplicarse a un contexto más amplio como el género, el filo, etc. Se divide en dos partes: el genoma central, un conjunto de genes comunes a todos los genomas en estudio (a menudo genes constitutivos vitales para la supervivencia), y el genoma prescindible/flexible: un conjunto de genes que no están presentes en todos los genomas en estudio, excepto en uno o algunos. La herramienta bioinformática BPGA puede utilizarse para caracterizar el pangenoma de especies bacterianas. [ 33 ]

Genética de las enfermedades

Desde 2013, la existencia de tecnología de secuenciación de próxima generación de alto rendimiento permite la identificación de la causa de muchos trastornos humanos diferentes. Se ha observado herencia mendeliana simple para más de 3000 trastornos que se han identificado en la base de datos Online Mendelian Inheritance in Man , pero las enfermedades complejas son más difíciles. Los estudios de asociación han encontrado muchas regiones genéticas individuales que individualmente están débilmente asociadas con enfermedades complejas (como infertilidad , [ 34 ] cáncer de mama [ 35 ] y enfermedad de Alzheimer [ 36 ] ), en lugar de una sola causa. [ 37 ] [ 38 ] Actualmente existen muchos desafíos para el uso de genes para diagnóstico y tratamiento, como el hecho de que no sabemos qué genes son importantes o cuán estables son las opciones que proporciona un algoritmo. [ 39 ]

Los estudios de asociación de genoma completo han identificado con éxito miles de variantes genéticas comunes para enfermedades y rasgos complejos; sin embargo, estas variantes comunes solo explican una pequeña fracción de la heredabilidad. [ 40 ] Las variantes raras pueden explicar parte de la heredabilidad faltante . [ 41 ] Los estudios de secuenciación de genoma completo a gran escala han secuenciado rápidamente millones de genomas completos, y dichos estudios han identificado cientos de millones de variantes raras . [ 42 ] Las anotaciones funcionales predicen el efecto o la función de una variante genética y ayudan a priorizar las variantes funcionales raras, y la incorporación de estas anotaciones puede aumentar eficazmente el poder de la asociación genética de análisis de variantes raras de estudios de secuenciación de genoma completo. [ 43 ] Se han desarrollado algunas herramientas para proporcionar un análisis de asociación de variantes raras todo en uno para datos de secuenciación de genoma completo, incluyendo la integración de datos de genotipo y sus anotaciones funcionales, análisis de asociación, resumen de resultados y visualización. [ 44 ] [ 45 ] El metaanálisis de estudios de secuenciación del genoma completo proporciona una solución atractiva al problema de recolectar grandes tamaños de muestra para descubrir variantes raras asociadas con fenotipos complejos. [ 46 ]

Análisis de mutaciones en el cáncer

En el cáncer , los genomas de las células afectadas se reorganizan de maneras complejas o impredecibles. Además de los microarrays de polimorfismos de un solo nucleótido que identifican mutaciones puntuales que causan cáncer, los microarrays de oligonucleótidos se pueden usar para identificar ganancias y pérdidas cromosómicas (denominadas hibridación genómica comparativa ). Estos métodos de detección generan terabytes de datos por experimento. [ 47 ] A menudo se encuentra que los datos contienen una variabilidad considerable, o ruido , por lo que se están desarrollando métodos de análisis de puntos de cambio y modelos ocultos de Markov para inferir cambios reales en el número de copias . [ 48 ]

Se pueden utilizar dos principios importantes para identificar el cáncer mediante mutaciones en el exoma . Primero, el cáncer es una enfermedad causada por la acumulación de mutaciones somáticas en los genes. Segundo, el cáncer contiene mutaciones impulsoras que deben distinguirse de las mutaciones pasajeras. [ 49 ]

Futuras mejoras en bioinformática podrían permitir clasificar los tipos de cáncer mediante el análisis de mutaciones genéticas que impulsan el cáncer. Además, en el futuro podría ser posible realizar un seguimiento de los pacientes a medida que la enfermedad progresa, gracias a la secuenciación de muestras de cáncer. Otro tipo de datos que requiere un desarrollo bioinformático innovador es el análisis de lesiones recurrentes en diversos tumores. [ 50 ]

Expresión génica y proteica

Análisis de la expresión génica

La expresión de muchos genes puede determinarse midiendo los niveles de ARNm con múltiples técnicas que incluyen microarrays , secuenciación de etiquetas de secuencia de ADNc expresado (EST), secuenciación de etiquetas de análisis serial de expresión génica (SAGE), secuenciación de firmas masivamente paralela (MPSS), RNA-Seq , también conocido como "secuenciación de escopeta de transcriptoma completo" (WTSS), o varias aplicaciones de hibridación in situ multiplexada. Todas estas técnicas son extremadamente propensas al ruido y/o sujetas a sesgos en la medición biológica, y un área importante de investigación en biología computacional implica el desarrollo de herramientas estadísticas para separar la señal del ruido en estudios de expresión génica de alto rendimiento. [ 51 ] Estos estudios se utilizan a menudo para determinar los genes implicados en un trastorno: se podrían comparar datos de microarrays de células epiteliales cancerosas con datos de células no cancerosas para determinar los transcritos que están regulados al alza y a la baja en una población particular de células cancerosas.

Microarrays frente a secuenciación de ARN

Análisis de la expresión de proteínas

Los microarrays de proteínas y la espectrometría de masas de alto rendimiento (EM-TR) pueden proporcionar una instantánea de las proteínas presentes en una muestra biológica. El primer enfoque presenta problemas similares a los de los microarrays dirigidos al ARNm; el segundo implica el problema de comparar grandes cantidades de datos de masas con las masas predichas a partir de bases de datos de secuencias de proteínas, y el complejo análisis estadístico de muestras cuando se detectan múltiples péptidos incompletos de cada proteína. La localización de proteínas celulares en un contexto tisular se puede lograr mediante proteómica de afinidad, que se muestra como datos espaciales basados ​​en inmunohistoquímica y microarrays de tejidos . [ 52 ]

Análisis de la regulación

La regulación genética es un proceso complejo en el que una señal, como una señal extracelular tipo hormona , conduce finalmente a un aumento o disminución de la actividad de una o más proteínas . Se han aplicado técnicas bioinformáticas para explorar las distintas etapas de este proceso.

Por ejemplo, la expresión génica puede ser regulada por elementos cercanos en el genoma. El análisis de promotores implica la identificación y el estudio de motivos de secuencia en el ADN que rodea la región codificante de proteínas de un gen. Estos motivos influyen en la cantidad de ARNm que transcribe dicha región. Los elementos potenciadores alejados del promotor también pueden regular la expresión génica mediante interacciones de bucle tridimensionales. Estas interacciones pueden determinarse mediante análisis bioinformáticos de experimentos de captura de la conformación cromosómica .

Los datos de expresión génica pueden utilizarse para inferir la regulación genética: se pueden comparar datos de microarrays de diversos estados de un organismo para formular hipótesis sobre los genes implicados en cada estado. En un organismo unicelular, se pueden comparar las fases del ciclo celular , junto con diversas condiciones de estrés (choque térmico, inanición, etc.). Posteriormente, se pueden aplicar algoritmos de agrupamiento a los datos de expresión para determinar qué genes se coexpresan. Por ejemplo, se pueden buscar elementos reguladores sobrerrepresentados en las regiones promotoras de los genes coexpresados . Algunos ejemplos de algoritmos de agrupamiento aplicados en la agrupación de genes son el agrupamiento k-means , los mapas autoorganizados (SOM), el agrupamiento jerárquico y los métodos de agrupamiento por consenso .

Análisis de la organización celular

Se han desarrollado varios enfoques para analizar la ubicación de orgánulos, genes, proteínas y otros componentes dentro de las células. Se ha ideado una categoría de ontología genética , componente celular , para capturar la localización subcelular en muchas bases de datos biológicas .

Microscopía y análisis de imágenes

Las imágenes microscópicas permiten localizar orgánulos y moléculas que pueden ser la fuente de anomalías en las enfermedades.

localización de proteínas

Determinar la ubicación de las proteínas nos permite predecir su función. Esto se conoce como predicción de la función proteica . Por ejemplo, si una proteína se encuentra en el núcleo , podría estar implicada en la regulación génica o el empalme de ARN . En cambio, si se encuentra en las mitocondrias , podría estar implicada en la respiración u otros procesos metabólicos . Existen recursos bien desarrollados para la predicción de la localización subcelular de proteínas , incluyendo bases de datos y herramientas de predicción. [ 53 ] [ 54 ]

Organización nuclear de la cromatina

Los datos de experimentos de captura de conformación cromosómica de alto rendimiento , como Hi-C (experimento) y ChIA-PET , pueden proporcionar información sobre la estructura tridimensional y la organización nuclear de la cromatina . Los desafíos bioinformáticos en este campo incluyen la partición del genoma en dominios, como los Dominios de Asociación Topológica (TAD), que se organizan juntos en el espacio tridimensional. [ 55 ]

Bioinformática estructural

Las estructuras proteicas tridimensionales como esta son temas habituales en los análisis bioinformáticos.

Determinar la estructura de las proteínas es una aplicación importante de la bioinformática. La Evaluación Crítica de la Predicción de la Estructura de las Proteínas (CASP) es una competición abierta en la que grupos de investigación de todo el mundo presentan modelos de proteínas para evaluar modelos de proteínas desconocidas. [ 56 ] [ 57 ]

Secuencia de aminoácidos

La secuencia lineal de aminoácidos de una proteína se denomina estructura primaria . Esta estructura se puede determinar fácilmente a partir de la secuencia de codones del gen de ADN que la codifica. En la mayoría de las proteínas, la estructura primaria determina de forma unívoca la estructura tridimensional de la proteína en su entorno natural. Una excepción es la proteína priónica mal plegada implicada en la encefalopatía espongiforme bovina . Esta estructura está ligada a la función de la proteína. La información estructural adicional incluye la estructura secundaria , terciaria y cuaternaria . Una solución general viable para predecir la función de una proteína sigue siendo un problema abierto. Hasta ahora, la mayoría de los esfuerzos se han dirigido hacia heurísticas que funcionan la mayor parte del tiempo.

Homología

En la rama genómica de la bioinformática, la homología se utiliza para predecir la función de un gen: si la secuencia del gen A , cuya función se conoce, es homóloga a la secuencia del gen B, cuya función se desconoce, se podría inferir que B comparte la función de A. En bioinformática estructural, la homología se utiliza para determinar qué partes de una proteína son importantes en la formación de su estructura y en su interacción con otras proteínas. El modelado por homología se utiliza para predecir la estructura de una proteína desconocida a partir de proteínas homólogas ya existentes.

Un ejemplo de esto es la hemoglobina en los humanos y la hemoglobina en las legumbres ( leghemoglobina ), que son parientes lejanos de la misma superfamilia de proteínas . Ambas cumplen la misma función de transportar oxígeno en el organismo. Aunque estas dos proteínas tienen secuencias de aminoácidos muy diferentes, sus estructuras proteicas son muy similares, lo que refleja su función y ancestro comunes. [ 58 ]

Otras técnicas para predecir la estructura de las proteínas incluyen el enhebrado de proteínas y el modelado físico de novo (desde cero).

Otro aspecto de la bioinformática estructural incluye el uso de estructuras proteicas para modelos de cribado virtual , como los modelos de relación cuantitativa estructura-actividad y los modelos proteoquimiométricos (PCM). Además, la estructura cristalina de una proteína puede utilizarse en la simulación de, por ejemplo, estudios de unión a ligandos y estudios de mutagénesis in silico .

Un software basado en algoritmos de aprendizaje profundo de 2021 llamado AlphaFold , desarrollado por DeepMind de Google , supera ampliamente a todos los demás métodos de software de predicción, [ 59 ] y ha publicado estructuras predichas para cientos de millones de proteínas en la base de datos de estructuras de proteínas AlphaFold. [ 60 ]

Biología de redes y sistemas

El análisis de redes busca comprender las relaciones dentro de las redes biológicas, como las redes metabólicas o las de interacción proteína-proteína . Si bien las redes biológicas pueden construirse a partir de un solo tipo de molécula o entidad (como los genes), la biología de redes a menudo intenta integrar muchos tipos de datos diferentes, como proteínas, moléculas pequeñas, datos de expresión génica y otros, que están conectados física, funcional o ambas.

La biología de sistemas implica el uso de simulaciones por computadora de subsistemas celulares (como las redes de metabolitos y enzimas que componen el metabolismo , las vías de transducción de señales y las redes de regulación génica ) para analizar y visualizar las complejas conexiones de estos procesos celulares. La vida artificial o evolución virtual intenta comprender los procesos evolutivos mediante la simulación por computadora de formas de vida simples (artificiales).

Redes de interacción molecular

Las interacciones entre proteínas se visualizan y analizan frecuentemente mediante redes. Esta red está compuesta por interacciones proteína-proteína de Treponema pallidum , el agente causal de la sífilis y otras enfermedades. [ 61 ]

Se han determinado decenas de miles de estructuras tridimensionales de proteínas mediante cristalografía de rayos X y espectroscopia de resonancia magnética nuclear de proteínas (RMN de proteínas). Una cuestión fundamental en bioinformática estructural es si resulta práctico predecir posibles interacciones proteína-proteína basándose únicamente en estas formas tridimensionales, sin realizar experimentos de interacción proteína-proteína . Se han desarrollado diversos métodos para abordar el problema del acoplamiento proteína-proteína , aunque parece que aún queda mucho trabajo por hacer en este campo.

Otras interacciones que se encuentran en este campo incluyen las interacciones proteína-ligando (incluidos los fármacos) y proteína-péptido . La simulación de dinámica molecular del movimiento de los átomos alrededor de enlaces rotatorios es el principio fundamental de los algoritmos computacionales , denominados algoritmos de acoplamiento, para el estudio de las interacciones moleculares .

Informática de la biodiversidad

La bioinformática se ocupa de la recopilación y el análisis de datos de biodiversidad , como bases de datos taxonómicas o datos de microbiomas . Algunos ejemplos de estos análisis incluyen la filogenética , el modelado de nichos ecológicos , el mapeo de la riqueza de especies , la identificación mediante códigos de barras de ADN o las herramientas de identificación de especies . Un área en auge es también la macroecología , es decir, el estudio de cómo la biodiversidad se relaciona con la ecología y el impacto humano, como el cambio climático .

Otros

Análisis de la literatura

La enorme cantidad de literatura publicada hace prácticamente imposible que una persona lea todos los artículos, lo que da lugar a subcampos de investigación inconexos. El análisis de la literatura busca emplear la lingüística computacional y estadística para extraer información de esta creciente biblioteca de recursos textuales. Por ejemplo:

  • Reconocimiento de abreviaturas: identificar la forma completa y la abreviatura de términos biológicos.
  • Reconocimiento de entidades nombradas : reconocimiento de términos biológicos como nombres de genes.
  • Interacción proteína-proteína: identifica qué proteínas interactúan con qué proteínas a partir del texto.

Esta área de investigación se basa en la estadística y la lingüística computacional .

Análisis de imágenes de alto rendimiento

Las tecnologías computacionales se utilizan para automatizar el procesamiento, la cuantificación y el análisis de grandes cantidades de imágenes biomédicas con alto contenido informativo . Los sistemas modernos de análisis de imágenes pueden mejorar la precisión , la objetividad y la velocidad del observador . El análisis de imágenes es importante tanto para el diagnóstico como para la investigación. Algunos ejemplos son:

  • Cuantificación de alto rendimiento y alta fidelidad y localización subcelular ( cribado de alto contenido , citohistopatología, bioinformática de imágenes )
  • morfometría
  • Análisis y visualización de imágenes clínicas
  • Determinación de los patrones de flujo de aire en tiempo real en los pulmones respiratorios de animales vivos.
  • Cuantificación del tamaño de la oclusión en imágenes en tiempo real desde el desarrollo hasta la recuperación durante una lesión arterial.
  • realizar observaciones del comportamiento a partir de grabaciones de vídeo prolongadas de animales de laboratorio
  • mediciones infrarrojas para la determinación de la actividad metabólica
  • inferir solapamientos de clones en el mapeo de ADN , por ejemplo, la puntuación de Sulston.

Análisis de datos de células individuales de alto rendimiento

Se utilizan técnicas computacionales para analizar datos de células individuales de alto rendimiento y baja resolución, como los obtenidos mediante citometría de flujo . Estos métodos suelen consistir en identificar poblaciones de células relevantes para una enfermedad o condición experimental específica.

Ontologías e integración de datos

Las ontologías biológicas son grafos acíclicos dirigidos de vocabularios controlados . Crean categorías para conceptos y descripciones biológicas, lo que permite analizarlas fácilmente con ordenadores. Al categorizarlas de esta manera, es posible obtener un valor añadido mediante un análisis holístico e integrado. [ 62 ]

La OBO Foundry fue un proyecto para estandarizar ciertas ontologías. Una de las más extendidas es la ontología genética , que describe la función de los genes. También existen ontologías que describen fenotipos.

Bases de datos

Las bases de datos son esenciales para la investigación y las aplicaciones bioinformáticas. Existen bases de datos para diversos tipos de información, como secuencias de ADN y proteínas, estructuras moleculares, fenotipos y biodiversidad. Pueden contener tanto datos empíricos (obtenidos directamente de experimentos) como datos predictivos (obtenidos del análisis de datos existentes). Pueden ser específicas de un organismo, vía metabólica o molécula de interés. También pueden incorporar datos recopilados de múltiples bases de datos. Las bases de datos pueden tener diferentes formatos, mecanismos de acceso y ser públicas o privadas.

A continuación se enumeran algunas de las bases de datos más utilizadas:

  • Utilizado en el análisis de secuencias biológicas: GenBank , UniProt
  • Utilizado en el análisis de estructuras: Protein Data Bank (PDB)
  • Utilizado para encontrar familias de proteínas y motivos : InterPro , Pfam
  • Utilizado para la secuenciación de próxima generación: Archivo de lectura de secuencias
  • Utilizado en análisis de redes: bases de datos de vías metabólicas ( KEGG , BioCyc ), bases de datos de análisis de interacciones, redes funcionales.
  • Utilizado en el diseño de circuitos genéticos sintéticos: GenoCAD

Software y herramientas

Las herramientas de software para bioinformática incluyen desde sencillas herramientas de línea de comandos hasta programas gráficos más complejos y servicios web independientes. Estas herramientas son desarrolladas por empresas de bioinformática o por instituciones públicas.

Software bioinformático de código abierto

Desde la década de 1980, han existido y se han desarrollado numerosas herramientas de software libre y de código abierto . [ 63 ] La combinación de la necesidad constante de nuevos algoritmos para el análisis de nuevos tipos de lecturas biológicas, el potencial para experimentos in silico innovadores y la disponibilidad gratuita de bases de código abierto ha creado oportunidades para que los grupos de investigación contribuyan a la bioinformática independientemente de la financiación . Las herramientas de código abierto suelen funcionar como incubadoras de ideas o como complementos con soporte comunitario en aplicaciones comerciales. También pueden proporcionar estándares de facto y modelos de objetos compartidos para facilitar la integración de la bioinformación.

El software bioinformático de código abierto incluye Bioconductor , BioPerl , Biopython , BioJava , BioJS , BioRuby , Bioclipse , EMBOSS , .NET Bio, Orange con su complemento bioinformático, Apache Taverna , UGENE y GenoCAD .

La Fundación Open Bioinformatics, sin fines de lucro [ 63 ] , y la Conferencia anual de Bioinformática de Código Abierto promueven el software bioinformático de código abierto. [ 64 ]

Servicios web en bioinformática

Se han desarrollado interfaces basadas en SOAP y REST para permitir que los ordenadores cliente utilicen algoritmos, datos y recursos informáticos de servidores ubicados en otras partes del mundo. La principal ventaja es que los usuarios finales no tienen que ocuparse de los costes de mantenimiento del software y las bases de datos.

Los servicios bioinformáticos básicos son clasificados por el EBI en tres categorías: SSS (Servicios de búsqueda de secuencias), MSA (Alineamiento de secuencias múltiples) y BSA (Análisis de secuencias biológicas). [ 65 ] La disponibilidad de estos recursos bioinformáticos orientados a servicios demuestra la aplicabilidad de las soluciones bioinformáticas basadas en la web, y abarcan desde una colección de herramientas independientes con un formato de datos común bajo una única interfaz web, hasta sistemas de gestión de flujos de trabajo bioinformáticos integradores, distribuidos y extensibles .

Sistemas de gestión de flujos de trabajo bioinformáticos

Un sistema de gestión de flujos de trabajo bioinformáticos es una forma especializada de un sistema de gestión de flujos de trabajo diseñado específicamente para componer y ejecutar una serie de pasos computacionales o de manipulación de datos, o un flujo de trabajo, en una aplicación bioinformática. Dichos sistemas están diseñados para

  • proporcionar un entorno fácil de usar para que los propios científicos de aplicaciones creen sus propios flujos de trabajo,
  • proporcionar herramientas interactivas para que los científicos puedan ejecutar sus flujos de trabajo y ver sus resultados en tiempo real,
  • simplificar el proceso de compartir y reutilizar flujos de trabajo entre los científicos, y
  • Permite a los científicos realizar un seguimiento de la procedencia de los resultados de la ejecución del flujo de trabajo y de los pasos de creación del mismo.

Algunas de las plataformas que ofrecen este servicio: Galaxy , Kepler , Taverna , UGENE , Anduril , HIVE .

BioCompute y objetos BioCompute

En 2014, la Administración de Alimentos y Medicamentos de los Estados Unidos patrocinó una conferencia celebrada en el Campus Bethesda de los Institutos Nacionales de la Salud para discutir la reproducibilidad en bioinformática. [ 66 ] Durante los siguientes tres años, un consorcio de partes interesadas se reunió regularmente para discutir lo que se convertiría en el paradigma BioCompute. [ 67 ] Estas partes interesadas incluyeron representantes de entidades gubernamentales, industriales y académicas. Los líderes de las sesiones representaron numerosas ramas de la FDA y los Institutos y Centros de los NIH, entidades sin fines de lucro como el Proyecto Varioma Humano y la Federación Europea de Informática Médica , e instituciones de investigación como Stanford , el Centro del Genoma de Nueva York y la Universidad George Washington .

Se decidió que el paradigma BioCompute se basaría en "cuadernos de laboratorio" digitales que permiten la reproducibilidad, replicación, revisión y reutilización de protocolos bioinformáticos. Esto se propuso para facilitar una mayor continuidad dentro de un grupo de investigación durante los periodos de rotación de personal habituales, a la vez que se fomenta el intercambio de ideas entre grupos. La FDA de EE. UU. financió este trabajo para que la información sobre los flujos de trabajo fuera más transparente y accesible para su personal regulador. [ 68 ]

En 2016, el grupo se reunió nuevamente en los NIH en Bethesda y discutió el potencial de un objeto BioCompute , una instancia del paradigma BioCompute. Este trabajo se copió como un documento de "uso estándar para ensayos" y como un artículo preimpreso subido a bioRxiv. El objeto BioCompute permite compartir el registro en formato JSON entre empleados, colaboradores y reguladores. [ 69 ] [ 70 ]

Plataformas educativas

Aunque la bioinformática se imparte como máster presencial en muchas universidades, existen muchos otros métodos y tecnologías disponibles para aprender y obtener la certificación en la materia. La naturaleza computacional de la bioinformática la hace apta para el aprendizaje asistido por ordenador y en línea . [ 71 ] [ 72 ] Las plataformas de software diseñadas para enseñar conceptos y métodos de bioinformática incluyen Rosalind y los cursos en línea ofrecidos a través del Portal de Formación del Instituto Suizo de Bioinformática . Los Talleres Canadienses de Bioinformática proporcionan vídeos y diapositivas de talleres de formación en su sitio web bajo una licencia Creative Commons . El proyecto 4273π o proyecto 4273pi [ 73 ] también ofrece materiales educativos de código abierto de forma gratuita. El curso se ejecuta en ordenadores Raspberry Pi de bajo coste y se ha utilizado para enseñar a adultos y alumnos. [ 74 ] [ 75 ] 4273 es desarrollado activamente por un consorcio de académicos e investigadores que han llevado a cabo proyectos de bioinformática de nivel de investigación utilizando ordenadores Raspberry Pi y el sistema operativo 4273π. [ 76 ] [ 77 ]

Las plataformas MOOC también ofrecen certificaciones en línea en bioinformática y disciplinas relacionadas, como la Especialización en Bioinformática de Coursera en la Universidad de California, San Diego , la Especialización en Ciencia de Datos Genómicos en la Universidad Johns Hopkins y la Serie XSeries de Análisis de Datos para Ciencias de la Vida de EdX en la Universidad de Harvard .

Conferencias

Existen varias conferencias importantes relacionadas con la bioinformática. Algunos de los ejemplos más destacados son la Conferencia Europea de Biología Computacional (ECCB), Sistemas Inteligentes para la Biología Molecular (ISMB), Simposio del Pacífico sobre Biocomputación (PSB) e Investigación en Biología Molecular Computacional (RECOMB).

Véase también

Referencias

  1. 1 2 Welch L, Lewitter F, Schwartz R (2014). "Directrices curriculares de bioinformática: hacia una definición de competencias básicas" . PLOS Comput Biol . 10 (3) e1003496. Bibcode : 2014PLSCB..10E3496W . doi : 10.1371/journal.pcbi.1003496 . PMC 3945096. PMID 24603430 .  
  2. Lesk AM (26 de julio de 2013). "Bioinformática" . Encyclopaedia Britannica . Archivado del original el 14 de abril de 2021. Recuperado el 17 de abril de 2017 .
  3. 1 2 Sim AY, Minary P, Levitt M (junio de 2012). "Modelado de ácidos nucleicos" . Current Opinion in Structural Biology . 22 (3): 273– 8. doi : 10.1016/j.sbi.2012.03.012 . PMC 4028509. PMID 22538125 .  
  4. ^ Kmiecik S, Gront D, Kolinski M, Wieteska L, Dawid AE, Kolinski A (julio de 2016). "Modelos de proteínas de grano grueso y sus aplicaciones" . Reseñas químicas . 116 (14): 7898– 936. Código bibliográfico : 2016ChRv..116.7898K . doi : 10.1021/acs.chemrev.6b00163 . PMID 27333362 . 
  5. Wong KC (2016). Biología Computacional y Bioinformática: Regulación Génica . CRC Press/Taylor & Francis Group. ISBN 978-1-4987-2497-5.
  6. Joyce AP, Zhang C, Bradley P, Havranek JJ (enero de 2015). "Modelado basado en la estructura de la especificidad proteína-ADN" . Briefings in Functional Genomics . 14 (1): 39– 49. doi : 10.1093/bfgp/elu044 . PMC 4366589. PMID 25414269 .  
  7. Spiga E, Degiacomi MT, Dal Peraro M (2014). "Nuevas estrategias para el modelado dinámico integrador del ensamblaje macromolecular". En Karabencheva-Christova T (ed.). Modelado y simulaciones biomoleculares . Avances en química de proteínas y biología estructural. Vol. 96. Academic Press. pp. 77–111 . doi : 10.1016/bs.apcsb.2014.06.008 . ISBN   978-0-12-800013-7. PMID 25443955 . 
  8. Ciemny M, Kurcinski M, Kamel K, Kolinski A, Alam N, Schueler-Furman O, et al. (agosto de 2018). "Acoplamiento proteína-péptido: oportunidades y desafíos" . Drug Discovery Today . 23 (8): 1530– 1537. doi : 10.1016/j.drudis.2018.05.006 . PMID 29733895 .  
  9. Ouzounis CA, Valencia A (2003). "Bioinformática temprana: el nacimiento de una disciplina: una visión personal" . Bioinformática . 19 (17): 2176– 2190. doi : 10.1093/bioinformatics/btg309 . PMID 14630646 . 
  10. 1 2 Hogeweg P (2011). "Las raíces de la bioinformática en la biología teórica" . PLOS Computational Biology . 7 (3) e1002021. Bibcode : 2011PLSCB...7E2021H . doi : 10.1371/journal.pcbi.1002021 . PMC 3068925. PMID 21483479 .  
  11. ^ Hesper B, Hogeweg P (1970). "BIO-INFORMATICA: een werkconcept" [ BIO-INFORMATICA: un concepto de trabajo ] . Het Kameleon (en holandés). 1 (6): 28-29 .
  12. Hesper B, Hogeweg P (2021). "Bioinformática: un concepto de trabajo. Una traducción de" Bio-informatica: een werkconcept "de B. Hesper y P. Hogeweg". arXiv : 2111.11832v1 [ q-bio.OT ].
  13. Hogeweg P (1978). "Simulación del crecimiento de formas celulares". Simulation . 31 (3): 90– 96. doi : 10.1177/003754977803100305 . S2CID 61206099 . 
  14. Gauthier J, Vincent AT, Charette SJ, Derome N (27 de noviembre de 2019). "Una breve historia de la bioinformática" . Briefings in Bioinformatics . 20 (6): 1981– 1996. doi : 10.1093/bib/bby063 . PMID 30084940 . 
  15. Colby B (2022). "Costo de la secuenciación del genoma completo" . Sequencing.com . Archivado del original el 15 de marzo de 2022. Recuperado el 8 de abril de 2022 .
  16. Sanger F, Tuppy H (1951). "La secuencia de aminoácidos en la cadena fenilalanina de la insulina. I. La identificación de péptidos inferiores a partir de hidrolizados parciales" . Biochemical Journal . 49 (4): 463–81 . doi : 10.1042/bj0490463 . PMC 1197535. PMID 14886310 .  
  17. Sanger F, Thompson EO (1953). "La secuencia de aminoácidos en la cadena glicílica de la insulina. I. La identificación de péptidos inferiores a partir de hidrolizados parciales" . Biochemical Journal . 53 (3): 353– 66. doi : 10.1042/bj0530353 . PMC 1198157. PMID 13032078 .  
  18. Moody G (2004). El código digital de la vida: cómo la bioinformática está revolucionando la ciencia, la medicina y los negocios . Hoboken, NJ, EE. UU.: John Wiley & Sons. ISBN 978-0-471-32788-2.
  19. Dayhoff MO, Eck RV, Chang MA, Sochard MR (1965). ATLAS de SECUENCIA Y ESTRUCTURA DE PROTEÍNAS (PDF) . Silver Spring, MD, EE. UU.: National Biomedical Research Foundation. LCCN 65-29342 . 
  20. Eck RV, Dayhoff MO (abril de 1966). "Evolución de la estructura de la ferredoxina basada en reliquias vivientes de secuencias de aminoácidos primitivas". Science . 152 ( 3720): 363– 6. Bibcode : 1966Sci...152..363E . doi : 10.1126/science.152.3720.363 . PMID 17775169. S2CID 23208558 .  
  21. Johnson G, Wu TT (enero de 2000). "Base de datos Kabat y sus aplicaciones: 30 años después del primer gráfico de variabilidad" . Nucleic Acids Research . 28 (1): 214–8 . doi : 10.1093/nar/28.1.214 . PMC 102431. PMID 10592229 .  
  22. Erickson JW, Altman GG (1979). "Una búsqueda de patrones en la secuencia de nucleótidos del genoma MS2". Journal of Mathematical Biology . 7 (3): 219– 230. doi : 10.1007/BF00275725 . S2CID 85199492 . 
  23. Shulman MJ, Steinberg CM, Westmoreland N (febrero de 1981). "La función codificante de las secuencias de nucleótidos se puede discernir mediante análisis estadístico". Journal of Theoretical Biology . 88 (3): 409–20 . Bibcode : 1981JThBi..88..409S . doi : 10.1016/0022-5193(81)90274-5 . PMID 6456380 . 
  24. Xiong J (2006). Essential Bioinformatics . Cambridge, Reino Unido: Cambridge University Press. pp . 4. ISBN  978-0-511-16815-4 vía Internet Archive.
  25. Sanger F, Air GM, Barrell BG, Brown NL, Coulson AR, Fiddes CA, et al. (febrero de 1977). "Secuencia de nucleótidos del ADN del bacteriófago phi X174". Nature . 265 ( 5596): 687– 95. Bibcode : 1977Natur.265..687S . doi : 10.1038/265687a0 . PMID 870828. S2CID 4206886 .   
  26. Benson DA, Karsch-Mizrachi I, Lipman DJ, Ostell J, Wheeler DL (enero de 2008). "GenBank" . Nucleic Acids Research . 36 (número especial de bases de datos): D25-30. doi : 10.1093 / nar/gkm929 . PMC 2238942. PMID 18073190 .  
  27. 1 2 3 Fleischmann RD, Adams MD, White O, Clayton RA, Kirkness EF, Kerlavage AR, et al. (julio de 1995). "Secuenciación aleatoria y ensamblaje del genoma completo de Haemophilus influenzae Rd". Science . 269 (5223): 496– 512. Bibcode : 1995Sci...269..496F . doi : 10.1126/science.7542800 . PMID 7542800 .  
  28. Stein L (2001). " Anotación del genoma: de la secuencia a la biología". Nature . 2 (7): 493– 503. doi : 10.1038/35080529 . PMID 11433356. S2CID 12044602 .  
  29. Erdin S, Lisewski AM, Lichtarge O (abril de 2011). "Predicción de la función de las proteínas: hacia la integración de métricas de similitud" . Current Opinion in Structural Biology . 21 (2): 180– 8. doi : 10.1016/j.sbi.2011.02.001 . PMC 3120633. PMID 21353529 .  
  30. Carvajal-Rodríguez A (marzo de 2010). "Simulación de genes y genomas hacia el futuro" . Current Genomics . 11 (1): 58– 61. doi : 10.2174/138920210790218007 . PMC 2851118. PMID 20808525 .  
  31. Brown TA (2002). "Mutación, reparación y recombinación". Genomas (2.ª ed.). Manchester (Reino Unido): Oxford. 
  32. Carter NP, Fiegler H, Piper J (octubre de 2002). "Análisis comparativo de tecnologías de microarrays de hibridación genómica comparativa: informe de un taller patrocinado por Wellcome Trust". Cytometry . 49 (2): 43–8 . doi : 10.1002/cyto.10153 . PMID 12357458 . 
  33. Chaudhari NM, Gupta VK, Dutta C (abril de 2016). "BPGA: una plataforma ultrarrápida para el análisis de todo el genoma" . Scientific Reports . 6 24373. Bibcode : 2016NatSR...624373C . doi : 10.1038/srep24373 . PMC 4829868. PMID 27071527 .  
  34. Aston KI (mayo de 2014). "Susceptibilidad genética a la infertilidad masculina: novedades de estudios de asociación de todo el genoma" . Andrología . 2 (3): 315–21 . doi : 10.1111/j.2047-2927.2014.00188.x . PMID 24574159. S2CID 206007180 .  
  35. Véron A, Blein S, Cox DG (2014). "Estudios de asociación de todo el genoma y la clínica: un enfoque en el cáncer de mama". Biomarkers in Medicine . 8 (2): 287– 96. doi : 10.2217/bmm.13.121 . PMID 24521025 . 
  36. Tosto G, Reitz C (octubre de 2013). "Estudios de asociación de todo el genoma en la enfermedad de Alzheimer: una revisión" . Current Neurology and Neuroscience Reports . 13 (10) 381. doi : 10.1007/s11910-013-0381-0 . PMC 3809844. PMID 23954969 .  
  37. Londin E, Yadav P, Surrey S, Kricka LJ, Fortina P (2013). "Uso del análisis de ligamiento, estudios de asociación de genoma completo y secuenciación de próxima generación en la identificación de mutaciones causantes de enfermedades". Farmacogenómica . Métodos en Biología Molecular. Vol. 1015. págs. 127–46 . doi : 10.1007/978-1-62703-435-7_8 . ISBN   978-1-62703-434-0. PMID 23824853 . 
  38. Hindorff LA, Sethupathy P, Junkins HA, Ramos EM, Mehta JP, Collins FS, et al. (junio de 2009). "Posibles implicaciones etiológicas y funcionales de los loci de asociación de todo el genoma para enfermedades y rasgos humanos" . Actas de la Academia Nacional de Ciencias de los Estados Unidos de América . 106 (23): 9362– 7. Bibcode : 2009PNAS..106.9362H . doi : 10.1073/pnas.0903103106 . PMC 2687147. PMID 19474294 .   
  39. Hall LO (2010). "Encontrar los genes adecuados para la predicción de enfermedades y pronósticos". Conferencia Internacional de 2010 sobre Ciencia e Ingeniería de Sistemas . págs. 1–2 . doi : 10.1109/ICSSE.2010.5551766 . ISBN  978-1-4244-6472-2. S2CID 21622726 . 
  40. Manolio TA, Collins FS, Cox NJ, Goldstein DB, Hindorff LA, Hunter DJ, et al. (octubre de 2009). "Encontrando la heredabilidad faltante de las enfermedades complejas" . Nature . 461 ( 7265): 747–753 . Bibcode : 2009Natur.461..747M . doi : 10.1038/nature08494 . PMC 2831613. PMID 19812666 .   
  41. Wainschtein P, Jain D, Zheng Z, Aslibekyan S, Becker D, Bi W, et al. (marzo de 2022). "Evaluación de la contribución de variantes raras a la heredabilidad de rasgos complejos a partir de datos de secuenciación del genoma completo" . Nature Genetics . 54 (3): 263– 273. doi : 10.1038/s41588-021-00997-7 . PMC 9119698. PMID 35256806 .   
  42. Taliun D, ​​Harris DN, Kessler MD, Carlson J, Szpiech ZA, Torres R, et al. (febrero de 2021). " Secuenciación de 53.831 genomas diversos del programa NHLBI TOPMed" . Nature . 590 (7845): 290–299 . Bibcode : 2021Natur.590..290T . doi : 10.1038/s41586-021-03205-y . PMC 7875770. PMID 33568819 .   {{cite journal}}: Mantenimiento de CS1: configuración sobrescrita ( enlace )
  43. Li X, Li Z, Zhou H, Gaynor SM, Liu Y, Chen H, et al. (septiembre de 2020). "La incorporación dinámica de múltiples anotaciones funcionales in silico potencia el análisis de asociación de variantes raras de grandes estudios de secuenciación del genoma completo a escala" . Nature Genetics . 52 (9): 969–983 . doi : 10.1038/s41588-020-0676-4 . PMC 7483769. PMID 32839606 .   
  44. Li Z, Li X, Zhou H, Gaynor SM, Selvaraj MS, Arapoglou T, et al. (diciembre de 2022). " Un marco para detectar asociaciones de variantes raras no codificantes de estudios de secuenciación de genoma completo a gran escala" . Nature Methods . 19 (12): 1599– 1611. doi : 10.1038/s41592-022-01640- x . PMC 10008172. PMID 36303018. S2CID 243873361 .    
  45. "STAARpipeline: una herramienta integral para variantes raras en datos de secuenciación del genoma completo a escala de biobanco". Nature Methods . 19 (12): 1532– 1533. Diciembre de 2022. doi : 10.1038 /s41592-022-01641-w . PMID 36316564. S2CID 253246835 .  
  46. Li X, Quick C, Zhou H, Gaynor SM, Liu Y, Chen H, et al. (enero de 2023). " Metaanálisis potente, escalable y eficiente en recursos de asociaciones de variantes raras en grandes estudios de secuenciación del genoma completo" . Nature Genetics . 55 (1): 154–164 . doi : 10.1038/s41588-022-01225-6 . PMC 10084891. PMID 36564505. S2CID 255084231 .    
  47. Tsourakakis CE, Tolliver D, Tsiarli MA, Shackney S, Schwartz R (2010). "CGHTRIMMER: Discretización de datos CGH de matriz ruidosos". arXiv : 1002.4438 [ q-bio.GN ].
  48. Yau C, Mouradov D, Jorissen RN, Colella S, Mirza GK, Steers G, et al. (2010). " Un enfoque estadístico para detectar aberraciones genómicas en muestras tumorales heterogéneas a partir de datos de genotipado de polimorfismos de un solo nucleótido" . Genome Biology . 11 (9): R92. doi : 10.1186/gb-2010-11-9-r92 . PMC 2941741. PMID 20804551 .   
  49. Vazquez M, de la Torre V, Valencia A (27 de diciembre de 2012). "Capítulo 14: Análisis del genoma del cáncer" . PLOS Computational Biology . 8 (12) e1002824. Bibcode : 2012PLSCB...8E2824V . doi : 10.1371/journal.pcbi.1002824 . PMC 3531315. PMID 23300415 .  
  50. Hye-Jung EC, Jaswinder K, Martin K, Samuel AA, Marco AM (2014). «Secuenciación de segunda generación para el análisis del genoma del cáncer». En Dellaire G, Berman JN, Arceci RJ (eds.). Genómica del cáncer . Boston (EE. UU.): Academic Press. págs. 13–30 . doi : 10.1016/B978-0-12-396967-5.00002-5 . ISBN  978-0-12-396967-5.
  51. Grau J, Ben-Gal I, Posch S, Grosse I (julio de 2006). "VOMBAT: predicción de sitios de unión de factores de transcripción mediante árboles bayesianos de orden variable" . Nucleic Acids Research . 34 (número especial de servidores web): W529-33. doi : 10.1093/nar/gkl212 . PMC 1538886. PMID 16845064 .  
  52. "El Atlas de Proteínas Humanas" . www.proteinatlas.org . Archivado del original el 4 de marzo de 2020. Consultado el 2 de octubre de 2017 .
  53. "La célula humana" . www.proteinatlas.org . Archivado del original el 2 de octubre de 2017. Consultado el 2 de octubre de 2017 .
  54. Thul PJ, Åkesson L, Wiking M, Mahdessian D, Geladaki A, Ait Blal H, et al. (mayo de 2017). "Un mapa subcelular del proteoma humano". Science . 356 (6340) eaal3321. Bibcode : 2017Sci...356l3321T . doi : 10.1126/science.aal3321 . PMID 28495876. S2CID 10744558 .   
  55. Ay F, Noble WS (septiembre de 2015). " Métodos de análisis para estudiar la arquitectura 3D del genoma" . Genome Biology . 16 (1) 183. doi : 10.1186/s13059-015-0745-7 . PMC 4556012. PMID 26328929 .  
  56. Kryshtafovych A, Schwede T, Topf M, Fidelis K, Moult J (2019). "Evaluación crítica de los métodos de predicción de la estructura de proteínas (CASP) – Ronda XIII" . Proteins . 87 ( 12): 1011– 1020. doi : 10.1002/prot.25823 . PMC 6927249. PMID 31589781 .  
  57. "Inicio - CASP14" . predictioncenter.org . Archivado del original el 30 de enero de 2023. Consultado el 12 de junio de 2023 .
  58. Hoy JA, Robinson H, Trent JT, Kakar S, Smagghe BJ, Hargrove MS (agosto de 2007). "Hemoglobinas vegetales: un registro fósil molecular para la evolución del transporte de oxígeno". Journal of Molecular Biology . 371 (1): 168– 79. doi : 10.1016/j.jmb.2007.05.029 . PMID 17560601 . 
  59. Jumper J, Evans R, Pritzel A, Green T, Figurnov M, Ronneberger O, et al. (agosto de 2021). "Predicción de estructura proteica de alta precisión con AlphaFold" . Nature . 596 (7873): 583– 589. Bibcode : 2021Natur.596..583J . doi : 10.1038/s41586-021-03819-2 . ISSN 1476-4687 . PMC 8371605. PMID 34265844 .    
  60. "Base de datos de estructura de proteínas AlphaFold" . alphafold.ebi.ac.uk . Archivado del original el 24 de julio de 2021. Consultado el 10 de octubre de 2022 .
  61. Titz B, Rajagopala SV, Goll J, Häuser R, McKevitt MT, Palzkill T, et al. (mayo de 2008). Hall N (ed.). "El interactoma de proteínas binarias de Treponema pallidum: la espiroqueta de la sífilis" . PLOS ONE . 3 (5) e2292. Bibcode : 2008PLoSO...3.2292T . doi : 10.1371/ journal.pone.0002292 . PMC 2386257. PMID 18509523 .   
  62. Groß A, Pruski C, Rahm E (1 de enero de 2016). "Evolución de las ontologías y mapeos biomédicos: panorama general de los enfoques recientes" . Computational and Structural Biotechnology Journal . 14 : 333–340 . doi : 10.1016/j.csbj.2016.08.002 . ISSN 2001-0370 . PMC 5018063 .  
  63. 1 2 "Fundación de Bioinformática Abierta: Sobre nosotros" . Sitio web oficial . Fundación de Bioinformática Abierta . Archivado del original el 12 de mayo de 2011. Recuperado el 10 de mayo de 2011 .
  64. "Fundación de Bioinformática Abierta: BOSC" . Sitio web oficial . Fundación de Bioinformática Abierta . Archivado del original el 18 de julio de 2011. Consultado el 10 de mayo de 2011 .
  65. Nisbet R, Elder IV J, Miner G (2009). "Bioinformática" . Manual de análisis estadístico y aplicaciones de minería de datos . Academic Press. pág. 328. ISBN  978-0-08-091203-5.
  66. Oficina del Comisionado. "Avances en la ciencia regulatoria: Taller público del 24 al 25 de septiembre de 2014: Estándares de secuenciación de próxima generación" . www.fda.gov . Archivado del original el 14 de noviembre de 2017. Consultado el 30 de noviembre de 2017 .
  67. Simonyan V, Goecks J, Mazumder R (2017). "Objetos biocomputacionales: un paso hacia la evaluación y validación de cálculos científicos biomédicos" . PDA Journal of Pharmaceutical Science and Technology . 71 (2): 136– 146. doi : 10.5731/pdajpst.2016.006734 . PMC 5510742. PMID 27974626 .  
  68. Oficina del Comisionado. «Promoción de la ciencia regulatoria: desarrollo comunitario de estándares HTS para la validación de datos y computación y el fomento de la interoperabilidad» . www.fda.gov . Archivado del original el 26 de enero de 2018. Consultado el 30 de noviembre de 2017 .
  69. Alterovitz G, Dean D, Goble C, Crusoe MR, Soiland-Reyes S, Bell A, et al. (diciembre de 2018). "Habilitando la medicina de precisión a través de la comunicación estándar de la procedencia, el análisis y los resultados de HTS" . PLOS Biology . 16 (12) e3000099. doi : 10.1371/journal.pbio.3000099 . PMC 6338479. PMID 30596645 .   
  70. El proyecto BioCompute Object (BCO) es un marco colaborativo e impulsado por la comunidad para estandarizar los datos computacionales de HTS. 1. Documento de especificación de BCO: manual de usuario para comprender y crear B. , biocompute-objects, 3 de septiembre de 2017, archivado del original el 27 de junio de 2018 , recuperado el 30 de noviembre de 2017
  71. Campbell AM (1 de junio de 2003). "Acceso público para la enseñanza de genómica, proteómica y bioinformática" . Educación en biología celular . 2 (2): 98– 111. doi : 10.1187/cbe.03-02-0007 . PMC 162192. PMID 12888845 .  
  72. Arenas M (septiembre de 2021). "Consideraciones generales para las prácticas de enseñanza en línea en bioinformática en tiempos de COVID-19" . Biochemistry and Molecular Biology Education . 49 (5): 683– 684. doi : 10.1002/bmb.21558 . ISSN 1470-8175 . PMC 8426940. PMID 34231941 .   
  73. Barker D, Ferrier DE, Holland PW, Mitchell JB, Plaisier H, Ritchie MG, et al. (agosto de 2013). "4273π: educación en bioinformática sobre hardware ARM de bajo costo" . BMC Bioinformatics . 13 243: 522. doi : 10.1186/1471-2105-14-243 . PMC 3751261. PMID 23937194 .   
  74. Barker D, Alderson RG, McDonagh JL, Plaisier H, Comrie MM, Duncan L, et al. (2015). "Las actividades prácticas de nivel universitario en bioinformática benefician a grupos voluntarios de alumnos en los últimos 2 años de la escuela" . International Journal of STEM Education . 2 (17) 17. doi : 10.1186/s40594-015-0030-z . hdl : 10023/7704 . S2CID 256396656 .  
  75. McDonagh JL, Barker D, Alderson RG (2016). "Llevando la ciencia computacional al público" . SpringerPlus . 5 (259) 259. doi : 10.1186/s40064-016-1856-7 . PMC 4775721. PMID 27006868 .  
  76. Robson JF, Barker D (octubre de 2015). "Comparación del contenido de genes codificadores de proteínas de Chlamydia trachomatis y Protochlamydia amoebophila utilizando una computadora Raspberry Pi" . BMC Research Notes . 8 (561) 561. doi : 10.1186/s13104-015-1476-2 . PMC 4604092. PMID 26462790 .  
  77. Wreggelsworth KM, Barker D (octubre de 2015). "Una comparación de los genomas codificadores de proteínas de dos bacterias verdes del azufre, Chlorobium tepidum TLS y Pelodictyon phaeoclathratiforme BU-1" . BMC Research Notes . 8 (565) 565. doi : 10.1186/s13104-015-1535-8 . PMC 4606965. PMID 26467441 .  

Lecturas adicionales

  • Sehgal et al.:  Estudios estructurales, filogenéticos y de acoplamiento del activador de la D-aminoácido oxidasa (DAOA), un gen candidato para la esquizofrenia. Theoretical Biology and Medical Modelling 2013 10:3.
  • Achuthsankar S Nair, Biología Computacional y Bioinformática: Una Introducción. Archivado el 16 de diciembre de 2008 en Wayback Machine , Communications of Computer Society of India, enero de 2007.
  • Aluru, Srinivas , ed. Manual de biología molecular computacional . Chapman & Hall/CRC, 2006. ISBN 1-58488-406-1(Serie de Ciencias de la Computación e Información de Chapman & Hall/CRC)
  • Baldi, P y Brunak , S, Bioinformática: El enfoque del aprendizaje automático , 2.ª edición. MIT Press, 2001. ISBN 0-262-02506-X
  • Barnes, MR y Gray, IC, eds., Bioinformática para genetistas , primera edición. Wiley, 2003. ISBN 0-470-84394-2
  • Baxevanis, AD y Ouellette , BFF, eds., Bioinformática: Una guía práctica para el análisis de genes y proteínas , tercera edición. Wiley, 2005. ISBN 0-471-47878-4
  • Baxevanis, AD, Petsko, GA, Stein, LD y Stormo, GD, eds., Current Protocols in Bioinformatics . Wiley, 2007. ISBN 0-471-25093-7
  • Cristianini, N. y Hahn, M. Introducción a la genómica computacional. Archivado el 4 de enero de 2009 en Wayback Machine , Cambridge University Press, 2006. ( ISBN) 9780521671910| ISBN 0-521-67191-4)
  • Durbin, R., S. Eddy, A. Krogh y G. Mitchison, Análisis de secuencias biológicas . Cambridge University Press, 1998. ISBN 0-521-62971-3
  • Gilbert D (septiembre de 2004). "Recursos de software de bioinformática" . Briefings in Bioinformatics . 5 (3): 300–4 . doi : 10.1093/bib/5.3.300 . PMID 15383216 . 
  • Keedwell, E., Bioinformática inteligente: La aplicación de técnicas de inteligencia artificial a problemas bioinformáticos . Wiley, 2005. ISBN 0-470-02175-6
  • Kohane, et al. Microarrays para una genómica integrativa. The MIT Press, 2002. ISBN 0-262-11271-X
  • Lund, O. et al. Bioinformática inmunológica. The MIT Press, 2005. ISBN 0-262-12280-4
  • Pachter, Lior y Sturmfels, Bernd . «Estadística algebraica para la biología computacional». Cambridge University Press, 2005. ISBN 0-521-85700-7
  • Pevzner, Pavel A. Biología molecular computacional: un enfoque algorítmico. The MIT Press, 2000. ISBN 0-262-16197-4
  • Soinov, L. La bioinformática y el reconocimiento de patrones se unen. Archivado el 10 de mayo de 2013 en Wayback Machine. Journal of Pattern Recognition Research ( JPRR, archivado el 8 de septiembre de 2008 en Wayback Machine ), vol. 1 (1), 2006, págs.  37-41.
  • Stevens, Hallam, Vida fuera de secuencia: Una historia de la bioinformática basada en datos , Chicago: The University of Chicago Press, 2013, ISBN 9780226080208
  • Tisdall, James. "Introducción a Perl para bioinformática". O'Reilly, 2001. ISBN 0-596-00080-4
  • Catalizando la investigación en la interfaz de la informática y la biología (2005) Informe del CSTB Archivado el 28 de enero de 2007 en Wayback Machine
  • Calculando los secretos de la vida: Contribuciones de las ciencias matemáticas y la computación a la biología molecular (1995). Archivado el 6 de julio de 2008 en Wayback Machine.
  • Curso del MIT sobre Fundamentos de Biología Computacional y de Sistemas
  • Biología Computacional: Genomas, Redes, Evolución. Curso gratuito del MIT. Archivado el 8 de abril de 2013 en Wayback Machine.
  • Portal de Recursos Bioinformáticos (SIB)