

Una secuencia de ácido nucleico es una sucesión de bases dentro de los nucleótidos que forman alelos dentro de una molécula de ADN (usando GACT) o ARN (GACU). Esta sucesión se denota mediante una serie de cinco letras diferentes que indican el orden de los nucleótidos. Por convención, las secuencias se presentan generalmente desde el extremo 5' hasta el extremo 3' . Para el ADN, con su doble hélice, existen dos direcciones posibles para la secuencia anotada; de estas dos, se utiliza la hebra codificante . Dado que los ácidos nucleicos son normalmente polímeros lineales (no ramificados) , especificar la secuencia equivale a definir la estructura covalente de toda la molécula. Por esta razón, la secuencia de ácido nucleico también se denomina estructura primaria .
La secuencia representa información genética . El ácido desoxirribonucleico biológico representa la información que dirige las funciones de un organismo .
Los ácidos nucleicos también poseen una estructura secundaria y una estructura terciaria . A veces, la estructura primaria se denomina erróneamente "secuencia primaria". Sin embargo, no existe un concepto equivalente de secuencia secundaria o terciaria.
Nucleótidos

Los ácidos nucleicos consisten en una cadena de unidades enlazadas llamadas nucleótidos. Cada nucleótido consta de tres subunidades: un grupo fosfato y un azúcar ( ribosa en el caso del ARN , desoxirribosa en el ADN ) que forman la estructura principal de la cadena de ácido nucleico, y al azúcar se une una de las nucleobases . Las nucleobases son importantes para el apareamiento de bases de las cadenas, lo que permite la formación de estructuras secundarias y terciarias de nivel superior, como la famosa doble hélice .
Las letras posibles son A , C , G y T , que representan las cuatro bases nucleotídicas de una cadena de ADN ( adenina , citosina , guanina y timina ) unidas covalentemente a un esqueleto fosfodiéster . En el caso típico, las secuencias se imprimen contiguas sin espacios, como en la secuencia AAAGTCTGAC, que se lee de izquierda a derecha en dirección 5' a 3' . En cuanto a la transcripción , una secuencia se encuentra en la cadena codificante si tiene el mismo orden que el ARN transcrito.
Una secuencia puede ser complementaria a otra, lo que significa que tienen la base en cada posición en el orden complementario (es decir, A a T, C a G) y en el orden inverso. Por ejemplo, la secuencia complementaria a TTAC es GTAA. Si una de las hebras del ADN de doble cadena se considera la hebra codificante, entonces la otra hebra, considerada la hebra no codificante, tendrá la secuencia complementaria a la hebra codificante.
Notación
Si bien A, T, C y G representan un nucleótido particular en una posición, también hay letras que representan ambigüedad y que se utilizan cuando puede haber más de un tipo de nucleótido en esa posición. Las reglas de la Unión Internacional de Química Pura y Aplicada ( IUPAC ) son las siguientes: [ 1 ]
Por ejemplo, W significa que en esa posición podría aparecer una adenina o una timina sin que ello afecte a la funcionalidad de la secuencia.
Estos símbolos también son válidos para el ARN, excepto que U (uracilo) reemplaza a T (timina). [ 1 ]
Además de adenina (A), citosina (C), guanina (G), timina (T) y uracilo (U), el ADN y el ARN también contienen bases que han sido modificadas después de que se ha formado la cadena de ácido nucleico. En el ADN, la base modificada más común es la 5-metilcitidina (m5C). En el ARN, hay muchas bases modificadas, incluyendo pseudouridina (Ψ), dihidrouridina (D), inosina (I), ribotimidina (rT) y 7-metilguanosina (m7G). [ 3 ] [ 4 ] La hipoxantina y la xantina son dos de las muchas bases creadas por la presencia de mutágenos , ambas por desaminación (reemplazo del grupo amino por un grupo carbonilo). La hipoxantina se produce a partir de la adenina y la xantina a partir de la guanina . [ 5 ] De manera similar, la desaminación de la citosina da como resultado uracilo .
- Ejemplo de comparación y determinación del porcentaje de diferencia entre dos secuencias de nucleótidos.
- AA T CC GC TAG
- AA A CC CT TAG
Dadas las dos secuencias de 10 nucleótidos, alinéelas y compare las diferencias entre ellas. Calcule el porcentaje de diferencia dividiendo el número de diferencias entre las bases de ADN entre el número total de nucleótidos. En este caso, hay tres diferencias en la secuencia de 10 nucleótidos. Por lo tanto, la diferencia es del 30 %.
Importancia biológica

En los sistemas biológicos, los ácidos nucleicos contienen información que la célula viva utiliza para sintetizar proteínas específicas . La secuencia de nucleobases en una cadena de ácido nucleico es traducida por la maquinaria celular a una secuencia de aminoácidos que conforman una cadena proteica. Cada grupo de tres bases, denominado codón , corresponde a un aminoácido específico, y existe un código genético determinado mediante el cual cada combinación posible de tres bases corresponde a un aminoácido específico.
El dogma central de la biología molecular describe el mecanismo por el cual se construyen las proteínas utilizando la información contenida en los ácidos nucleicos. El ADN se transcribe en moléculas de ARNm , que viajan al ribosoma donde el ARNm se utiliza como molde para la construcción de la cadena proteica. Dado que los ácidos nucleicos pueden unirse a moléculas con secuencias complementarias , existe una distinción entre las secuencias " sentido ", que codifican proteínas, y la secuencia "antisentido" complementaria, que por sí misma no es funcional, pero puede unirse a la cadena sentido.
Determinación de la secuencia

La secuenciación del ADN es el proceso de determinar la secuencia de nucleótidos de un fragmento de ADN . La secuencia del ADN de un ser vivo codifica la información necesaria para su supervivencia y reproducción. Por lo tanto, determinar la secuencia es útil tanto en la investigación fundamental sobre el porqué y el cómo de la vida de los organismos como en disciplinas aplicadas. Dada la importancia del ADN para los seres vivos, el conocimiento de su secuencia puede ser útil en prácticamente cualquier investigación biológica . Por ejemplo, en medicina se puede utilizar para identificar, diagnosticar y, potencialmente, desarrollar tratamientos para enfermedades genéticas . Del mismo modo, la investigación sobre patógenos puede conducir al desarrollo de tratamientos para enfermedades contagiosas. La biotecnología es una disciplina en auge, con un gran potencial para generar numerosos productos y servicios útiles.
El ARN no se secuencia directamente. En cambio, la transcriptasa inversa lo copia a una molécula de ADN , y luego se secuencia este ADN.
Los métodos de secuenciación actuales se basan en la capacidad discriminatoria de las ADN polimerasas y, por lo tanto, solo pueden distinguir cuatro bases. La inosina (generada a partir de adenosina durante la edición del ARN ) se lee como una G, y la 5-metilcitosina (generada a partir de citosina mediante metilación del ADN ) se lee como una C. Con la tecnología actual, es difícil secuenciar pequeñas cantidades de ADN, ya que la señal es demasiado débil para medirla. Esto se soluciona mediante la amplificación por reacción en cadena de la polimerasa (PCR).
Representación digital

Una vez obtenida una secuencia de ácido nucleico de un organismo, se almacena in silico en formato digital. Las secuencias genéticas digitales pueden almacenarse en bases de datos de secuencias , analizarse (véase Análisis de secuencias más adelante), modificarse digitalmente y utilizarse como plantillas para crear nuevo ADN real mediante síntesis genética artificial .
Análisis de secuencias
Las secuencias genéticas digitales pueden analizarse utilizando herramientas bioinformáticas para intentar determinar su función.
Pruebas genéticas
El ADN del genoma de un organismo se puede analizar para diagnosticar vulnerabilidades a enfermedades hereditarias y también para determinar la paternidad (padre genético) o la ascendencia de una persona . Normalmente, cada persona porta dos variantes de cada gen : una heredada de la madre y otra del padre. Se cree que el genoma humano contiene entre 20 000 y 25 000 genes. Además del estudio de los cromosomas a nivel de genes individuales, las pruebas genéticas, en un sentido más amplio, incluyen análisis bioquímicos para detectar la posible presencia de enfermedades genéticas o mutaciones genéticas asociadas a un mayor riesgo de desarrollar trastornos genéticos.
Las pruebas genéticas identifican cambios en los cromosomas, genes o proteínas. [ 6 ] Generalmente, se utilizan para detectar cambios asociados con trastornos hereditarios. Los resultados de una prueba genética pueden confirmar o descartar una posible afección genética o ayudar a determinar la probabilidad de que una persona desarrolle o transmita un trastorno genético. Actualmente se utilizan varios cientos de pruebas genéticas y se están desarrollando más. [ 7 ] [ 8 ]
Alineación de secuencias
En bioinformática, un alineamiento de secuencias es una forma de organizar las secuencias de ADN , ARN o proteínas para identificar regiones de similitud que pueden deberse a relaciones funcionales, estructurales o evolutivas entre las secuencias. [ 9 ] Si dos secuencias en un alineamiento comparten un ancestro común, las discrepancias pueden interpretarse como mutaciones puntuales y los huecos como mutaciones de inserción o deleción ( indels ) introducidas en uno o ambos linajes en el tiempo transcurrido desde que divergieron entre sí. En los alineamientos de secuencias de proteínas, el grado de similitud entre los aminoácidos que ocupan una posición particular en la secuencia puede interpretarse como una medida aproximada de cuán conservada está una región o motivo de secuencia particular entre los linajes. La ausencia de sustituciones, o la presencia de solo sustituciones muy conservadoras (es decir, la sustitución de aminoácidos cuyas cadenas laterales tienen propiedades bioquímicas similares) en una región particular de la secuencia, sugiere [ 10 ] que esta región tiene importancia estructural o funcional. Aunque las bases nucleotídicas del ADN y del ARN son más similares entre sí que los aminoácidos, la conservación de los pares de bases puede indicar una función estructural o funcional similar. [ 11 ]
La filogenética computacional utiliza ampliamente alineamientos de secuencias en la construcción e interpretación de árboles filogenéticos , que se emplean para clasificar las relaciones evolutivas entre genes homólogos representados en los genomas de especies divergentes. El grado de diferencia entre las secuencias de un conjunto de consulta se relaciona cualitativamente con la distancia evolutiva entre ellas. En términos generales, una alta identidad de secuencia sugiere que las secuencias en cuestión tienen un ancestro común más reciente relativamente joven , mientras que una baja identidad sugiere que la divergencia es más antigua. Esta aproximación, que refleja la hipótesis del " reloj molecular " según la cual una tasa de cambio evolutivo aproximadamente constante puede utilizarse para extrapolar el tiempo transcurrido desde la primera divergencia de dos genes (es decir, el tiempo de coalescencia ), asume que los efectos de la mutación y la selección son constantes en todos los linajes de secuencias. Por lo tanto, no tiene en cuenta las posibles diferencias entre organismos o especies en las tasas de reparación del ADN ni la posible conservación funcional de regiones específicas en una secuencia. (En el caso de las secuencias de nucleótidos, la hipótesis del reloj molecular en su forma más básica también descarta la diferencia en las tasas de aceptación entre las mutaciones silenciosas que no alteran el significado de un codón determinado y otras mutaciones que dan como resultado la incorporación de un aminoácido diferente a la proteína). Los métodos estadísticamente más precisos permiten que la tasa de evolución varíe en cada rama del árbol filogenético, lo que produce mejores estimaciones de los tiempos de coalescencia de los genes.
Motivos de secuencia
Con frecuencia, la estructura primaria codifica motivos de importancia funcional. Algunos ejemplos de motivos de secuencia son: las cajas C/D [ 12 ] y H/ACA [ 13 ] de los snoRNA , el sitio de unión de Sm que se encuentra en los ARN espliceosomales como U1 , U2 , U4 , U5 , U6 , U12 y U3 , la secuencia de Shine-Dalgarno [ 14 ] , la secuencia consenso de Kozak [ 15 ] y el terminador de la ARN polimerasa III [ 16 ] .
Entropía de secuencia
En bioinformática , la entropía de secuencia, también conocida como complejidad de secuencia o perfil de información, [ 17 ] es una secuencia numérica que proporciona una medida cuantitativa de la complejidad local de una secuencia de ADN, independientemente de la dirección del procesamiento. La manipulación de los perfiles de información permite el análisis de las secuencias mediante técnicas sin alineación, como por ejemplo en la detección de motivos y reordenamientos. [ 17 ] [ 18 ] [ 19 ]
Véase también
Referencias
- 1 2 "Nomenclatura para bases incompletamente especificadas en secuencias de ácidos nucleicos. Recomendaciones 1984. Comité de Nomenclatura de la Unión Internacional de Bioquímica (NC-IUB)" . Actas de la Academia Nacional de Ciencias . 83 (1): 4–8 . 1986. doi : 10.1073/pnas.83.1.4 . ISSN 0027-8424 . PMC 322779. PMID 2417239 .
- ↑ Comité de Nomenclatura de la Unión Internacional de Bioquímica (NC-IUB) (1984). "Nomenclatura para bases incompletamente especificadas en secuencias de ácidos nucleicos" . Recuperado el 4 de febrero de 2008 .
- ↑ "BIOL2060: Traducción" . mun.ca .
- ↑ "Investigación" . uw.edu.pl .
- ↑ Nguyen, T; Brunson, D; Crespi, CL; Penman, BW; Wishnok, JS; Tannenbaum, SR (abril de 1992). "Daño y mutación del ADN en células humanas expuestas a óxido nítrico in vitro" . Proc Natl Acad Sci USA . 89 (7): 3030–034 . Bibcode : 1992PNAS...89.3030N . doi : 10.1073 / pnas.89.7.3030 . PMC 48797. PMID 1557408 .
- ↑ "¿Qué son las pruebas genéticas?" . Genetics Home Reference . 16 de marzo de 2015. Archivado del original el 29 de mayo de 2006. Consultado el 19 de mayo de 2010 .
- ↑ "Pruebas genéticas" . nih.gov .
- ↑ «Definiciones de Pruebas Genéticas» . Definiciones de Pruebas Genéticas (Jorge Sequeiros y Bárbara Guimarães) . Proyecto Red de Excelencia EuroGentest. 2008-09-11. Archivado desde el original el 4 de febrero de 2009 . Consultado el 10 de agosto de 2008 .
- ↑ Mount DM. (2004). Bioinformática: Análisis de secuencias y genomas (2.ª ed.). Cold Spring Harbor Laboratory Press: Cold Spring Harbor, NY. ISBN 0-87969-608-7.
- ↑ Ng, PC; Henikoff, S. (2001). "Predicción de sustituciones de aminoácidos perjudiciales" . Genome Research . 11 (5): 863– 74. doi : 10.1101/gr.176601 . PMC 311071. PMID 11337480 .
- ↑ Witzany, G (2016). "Pasos cruciales para la vida: De las reacciones químicas al código mediante agentes" . Biosystems . 140 : 49–57 . Bibcode : 2016BiSys.140 ...49W . doi : 10.1016/j.biosystems.2015.12.007 . PMID 26723230. S2CID 30962295 .
- ↑ Samarsky, DA; Fournier MJ; Singer RH; Bertrand E (1998). "El motivo C/D de la caja del snoRNA dirige la localización nucleolar y también acopla la síntesis y localización del snoRNA" . The EMBO Journal . 17 (13): 3747– 57. doi : 10.1093/emboj/17.13.3747 . PMC 1170710. PMID 9649444 .
- ↑ Ganot, Philippe; Caizergues-Ferrer, Michèle; Kiss, Tamás (1 de abril de 1997). "La familia de ARN nucleolares pequeños de caja ACA se define por una estructura secundaria conservada evolutivamente y elementos de secuencia ubicuos esenciales para la acumulación de ARN" . Genes & Development . 11 (7): 941– 56. doi : 10.1101/gad.11.7.941 . PMID 9106664 .
- ↑ Shine J, Dalgarno L (1975). "Determinante de la especificidad del cistrón en los ribosomas bacterianos". Nature . 254 (5495): 34– 38. Bibcode : 1975Natur.254...34S . doi : 10.1038/254034a0 . PMID 803646. S2CID 4162567 .
- ↑ Kozak M (octubre de 1987). " Análisis de secuencias no codificantes 5' de 699 ARN mensajeros de vertebrados" . Nucleic Acids Res . 15 (20): 8125–48 . doi : 10.1093/nar/15.20.8125 . PMC 306349. PMID 3313277 .
- ↑ Bogenhagen DF, Brown DD (1981) . "Secuencias de nucleótidos en el ADN 5S de Xenopus necesarias para la terminación de la transcripción". Cell . 24 (1): 261–70 . doi : 10.1016/0092-8674(81)90522-5 . PMID 6263489. S2CID 9982829 .
- 1 2 Pinho, A; García, S; Pratas, D; Ferreira, P (21 de noviembre de 2013). "Secuencias de ADN de un vistazo" . MÁS UNO . 8 (11) e79922. Código Bib : 2013PLoSO...879922P . doi : 10.1371/journal.pone.0079922 . PMC 3836782 . PMID 24278218 .
- ↑ Pratas, D; Silva, R; Pinho, A; Ferreira, P (18 de mayo de 2015). "Un método sin alineación para encontrar y visualizar reordenamientos entre pares de secuencias de ADN" . Informes científicos . 5 10203. Código Bib : 2015NatSR...510203P . doi : 10.1038/srep10203 . PMC 4434998 . PMID 25984837 .
- ↑ Troyanskaya, O; Arbell, O; Koren, Y; Landau, G; Bolshoy, A (2002). "Perfiles de complejidad de secuencias de secuencias genómicas procariotas: Un algoritmo rápido para calcular la complejidad lingüística" . Bioinformatics . 18 (5): 679–88 . doi : 10.1093/bioinformatics/18.5.679 . PMID 12050064 .
Enlaces externos
- Una bibliografía sobre características, patrones y correlaciones en textos sobre ADN y proteínas.
- ADN
- Biología molecular
- Ácidos nucleicos
- ARN