Articulo de referencia

k -mero

La secuencia ATGG tiene dos trímeros: ATG y TGG. En bioinformática , los k -meros son subcadenas de longitud k {\displaystyle k} contenido dentro de una secuencia biológica. Uti...

La secuencia ATGG tiene dos trímeros: ATG y TGG.

En bioinformática , los k -meros son subcadenas de longitudk{\displaystyle k}contenido dentro de una secuencia biológica. Utilizado principalmente en el contexto de la genómica computacional y el análisis de secuencias , en el que los k -meros están compuestos de nucleótidos ( es decir , A, T, G y C), los k -meros se aprovechan para ensamblar secuencias de ADN , [ 1 ] mejorar la expresión de genes heterólogos , [ 2 ] [ 3 ] identificar especies en muestras metagenómicas , [ 4 ] y crear vacunas atenuadas . [ 5 ] Por lo general, el término k -mero se refiere a todas las subsecuencias de una secuencia de longitudk{\displaystyle k}, de modo que la secuencia AGAT tendría cuatro monómeros (A, G, A y T), tres 2-meros (AG, GA, AT), dos 3-meros (AGA y GAT) y un 4-mero (AGAT). De forma más general, una secuencia de longitudL{\displaystyle L}tendráLk+1{\displaystyle L-k+1}k -meros y existennortek{\displaystyle n^{k}}total posible k -meros, dondenorte{\displaystyle n}es el número de monómeros posibles (por ejemplo, cuatro en el caso del ADN ).

Introducción

Los k -meros son simplemente longitudk{\displaystyle k}subsecuencias. Por ejemplo, a continuación se muestran todos los k -meros posibles de una secuencia de ADN:

Un ejemplo de espectro de 8-meros para E. coli que compara la frecuencia de los 8-meros ( es decir, las multiplicidades) con su número de ocurrencias.

Un método para visualizar k -meros, el espectro de k -meros , muestra la multiplicidad de cada k -mero en una secuencia frente al número de k -meros con esa multiplicidad. [ 6 ] El número de modos en un espectro de k -meros para el genoma de una especie varía, y la mayoría de las especies tienen una distribución unimodal. [ 7 ] Sin embargo, todos los mamíferos tienen una distribución multimodal. El número de modos dentro de un espectro de k -meros también puede variar entre regiones de los genomas: los humanos tienen espectros de k -meros unimodales en las UTR 5' y los exones , pero espectros multimodales en las UTR 3' y los intrones .

Fuerzas que afectan la frecuencia de los k -meros del ADN

La frecuencia de uso de k -meros se ve afectada por numerosas fuerzas que actúan en múltiples niveles y que a menudo entran en conflicto. Los k -meros con valores altos de k también se ven afectados por las fuerzas que afectan a valores bajos de k . Por ejemplo, si el mono-mero A no aparece en una secuencia, tampoco aparecerán los di-meros que contienen A (AA, AT, AG y AC), lo que vincula los efectos de las diferentes fuerzas.

k = 1

Cuando k = 1, hay cuatro k- meros de ADN, es decir , A, T, G y C. A nivel molecular, hay tres enlaces de hidrógeno entre G y C, mientras que solo hay dos entre A y T. Los enlaces GC, como resultado del enlace de hidrógeno adicional (y las interacciones de apilamiento más fuertes), son más estables térmicamente que los enlaces AT. [ 8 ] Los mamíferos y las aves tienen una mayor proporción de G y C con respecto a A y T ( contenido de GC ), lo que llevó a la hipótesis de que la estabilidad térmica era un factor determinante de la variación del contenido de GC. [ 9 ] Sin embargo, aunque prometedora, esta hipótesis no se sostuvo tras un análisis riguroso: el análisis entre una variedad de procariotas no mostró evidencia de que el contenido de GC se correlacionara con la temperatura como predeciría la hipótesis de adaptación térmica. [ 10 ] De hecho, si la selección natural fuera la fuerza impulsora detrás de la variación del contenido de GC, eso requeriría que cambios de un solo nucleótido , que a menudo son silenciosos , alteraran la aptitud de un organismo. [ 11 ]

Más bien, la evidencia actual sugiere que la conversión génica sesgada por GC (gBGC) es un factor determinante de la variación en el contenido de GC. [ 11 ] La gBGC es un proceso que ocurre durante la recombinación que reemplaza As y Ts con Gs y Cs. [ 12 ] Este proceso, aunque distinto de la selección natural, puede ejercer presión selectiva sobre el ADN sesgada hacia la fijación de reemplazos de GC en el genoma. Por lo tanto, la gBGC puede considerarse un "impostor" de la selección natural. Como era de esperar, el contenido de GC es mayor en los sitios que experimentan mayor recombinación. [ 13 ] Además, los organismos con tasas más altas de recombinación exhiben un mayor contenido de GC, en consonancia con los efectos predichos por la hipótesis de la gBGC. [ 14 ] Curiosamente, la gBGC no parece limitarse a los eucariotas . [ 15 ] Los organismos asexuales como las bacterias y las arqueas también experimentan recombinación mediante conversión génica, un proceso de reemplazo de secuencia homóloga que resulta en múltiples secuencias idénticas a lo largo del genoma. [ 16 ] El hecho de que la recombinación pueda aumentar el contenido de GC en todos los dominios de la vida sugiere que el gBGC está universalmente conservado. Aún no se ha determinado si el gBGC es un subproducto (en su mayoría) neutro de la maquinaria molecular de la vida o si está sujeto a selección. El mecanismo exacto y la ventaja o desventaja evolutiva del gBGC son actualmente desconocidos. [ 17 ]

k = 2

A pesar de la considerable cantidad de literatura que analiza los sesgos del contenido de GC, se ha escrito relativamente poco sobre los sesgos de los dinucleótidos. Se sabe que estos sesgos de dinucleótidos son relativamente constantes en todo el genoma, a diferencia del contenido de GC, que, como se mencionó anteriormente, puede variar considerablemente. [ 18 ] Esta es una observación importante que no debe pasarse por alto. Si el sesgo de dinucleótidos estuviera sujeto a presiones derivadas de la traducción , habría diferentes patrones de sesgo de dinucleótidos en las regiones codificantes y no codificantes , impulsados ​​por la menor eficiencia de traducción de algunos dinucleótidos. [ 19 ] Dado que no es así, se puede inferir que las fuerzas que modulan el sesgo de dinucleótidos son independientes de la traducción. Otra evidencia en contra de que las presiones traslacionales afecten el sesgo de dinucleótidos es el hecho de que los sesgos de dinucleótidos de los virus, que dependen en gran medida de la eficiencia de traducción, están determinados más por su familia viral que por sus huéspedes, cuya maquinaria de traducción secuestran los virus. [ 20 ]

En contraposición al aumento del contenido de GC de gBGC, se produce la supresión de CG , que reduce la frecuencia de CG 2-meros debido a la desaminación de los dinucleótidos CG metilados , lo que da lugar a sustituciones de CG por TG, reduciendo así el contenido de GC. [ 21 ] Esta interacción pone de relieve la interrelación entre las fuerzas que afectan a los k -meros para distintos valores de k.

Un dato interesante sobre el sesgo de dinucleótidos es que puede servir como medida de "distancia" entre genomas filogenéticamente similares. Los genomas de pares de organismos estrechamente relacionados comparten sesgos de dinucleótidos más similares que los de pares de organismos más distantemente relacionados. [ 18 ]

k = 3

Hay veinte aminoácidos naturales que se utilizan para construir las proteínas que codifica el ADN. Sin embargo, solo hay cuatro nucleótidos. Por lo tanto, no puede haber una correspondencia uno a uno entre nucleótidos y aminoácidos. De manera similar, hay 16 2-meros, lo cual tampoco es suficiente para representar inequívocamente cada aminoácido. Sin embargo, hay 64 3-meros distintos en el ADN, lo cual es suficiente para representar de forma única cada aminoácido. Estos 3-meros no superpuestos se llaman codones . Si bien cada codón se asigna solo a un aminoácido, cada aminoácido puede estar representado por múltiples codones . Por lo tanto, la misma secuencia de aminoácidos puede tener múltiples representaciones de ADN. Curiosamente, cada codón para un aminoácido no se usa en proporciones iguales. [ 22 ] Esto se llama sesgo de uso de codones (CUB). Cuando k = 3, se debe hacer una distinción entre la frecuencia real de 3-meros y el CUB. Por ejemplo, la secuencia ATGGCA contiene cuatro palabras de 3 nucleótidos (ATG, TGG, GGC y GCA), mientras que solo contiene dos codones (ATG y GCA). Sin embargo, el sesgo de uso de nucleótidos (CUB) es un factor determinante del sesgo de uso de 3 nucleótidos (que representa hasta un tercio del mismo, ya que un tercio de los k- nucleótidos en una región codificante son codones) y será el tema central de esta sección.

La causa exacta de la variación entre las frecuencias de los distintos codones no se comprende del todo. Se sabe que la preferencia de codones está correlacionada con la abundancia de ARNt, de modo que los codones que coinciden con los ARNt más abundantes son correspondientemente más frecuentes [ 22 ] y que las proteínas con mayor expresión presentan una mayor CUB [ 23 ] . Esto sugiere que la selección para la eficiencia o precisión traslacional es el factor determinante de la variación de la CUB.

k = 4

De forma similar al efecto observado en el sesgo de dinucleótidos, los sesgos de tetranucleótidos de organismos filogenéticamente similares son más parecidos que entre organismos menos emparentados. [ 4 ] La causa exacta de la variación en el sesgo de tetranucleótidos no se comprende bien, pero se ha planteado la hipótesis de que es el resultado del mantenimiento de la estabilidad genética a nivel molecular. [ 24 ]

Aplicaciones

La frecuencia de un conjunto de k -meros en el genoma de una especie, en una región genómica o en una clase de secuencias puede utilizarse como una "firma" de la secuencia subyacente. Comparar estas frecuencias es computacionalmente más sencillo que el alineamiento de secuencias y constituye un método importante en el análisis de secuencias sin alineamiento . También puede utilizarse como análisis preliminar antes del alineamiento.

Ensamblaje de secuencias

Esta figura muestra el proceso de división de lecturas en k- meros más pequeños (cuatrimeros en este caso) para poder utilizarlos en un grafo de De Bruijn. (A) Muestra el segmento inicial de ADN que se está secuenciando. (B) Muestra las lecturas obtenidas de la secuenciación y su alineación. El problema con esta alineación es que se superponen en k-2 en lugar de k-1 (lo cual es necesario en los grafos de De Bruijn). (C) Muestra las lecturas divididas en cuádruples más pequeños. (D) Descarta los cuádruples repetidos y muestra su alineación. Nótese que estos k -meros se superponen en k-1 y pueden utilizarse en un grafo de De Bruijn.

En el ensamblaje de secuencias, los k -meros se utilizan durante la construcción de grafos de De Bruijn . [ 25 ] [ 26 ] Para crear un grafo de De Bruijn, los k -meros se almacenan en cada arista con longitudL{\displaystyle L}debe superponerse a otra cadena en otro borde porL1{\displaystyle L-1}Para crear un vértice , las lecturas generadas por la secuenciación de próxima generación suelen tener diferentes longitudes. Por ejemplo, las lecturas de la tecnología de secuenciación de Illumina capturan lecturas de 100-meros. Sin embargo, el problema con la secuenciación es que solo se generan pequeñas fracciones de todos los posibles 100-meros presentes en el genoma. Esto se debe a errores de lectura, pero, más importante aún, a simples agujeros de cobertura que ocurren durante la secuenciación. El problema es que estas pequeñas fracciones de los posibles k -meros violan la suposición clave de los grafos de De Bruijn de que todas las lecturas de k -meros deben superponerse a su k -mero adyacente en el genoma.k1{\displaystyle k-1}(lo cual no puede ocurrir cuando no están presentes todos los k- meros posibles).

La solución a este problema consiste en dividir estas lecturas de tamaño k -mer en k- mers más pequeños, de modo que los k -mers resultantes representen todos los posibles k -mers de ese tamaño menor presentes en el genoma. [ 27 ] Además, dividir los k -mers en tamaños más pequeños también ayuda a mitigar el problema de las diferentes longitudes de lectura iniciales. En este ejemplo, las cinco lecturas no abarcan todos los posibles 7-mers del genoma y, por lo tanto, no se puede crear un grafo de De Bruijn. Pero, cuando se dividen en 4-mers, las subsecuencias resultantes son suficientes para reconstruir el genoma utilizando un grafo de De Bruijn.

Además de utilizarse directamente para el ensamblaje de secuencias, los k -meros también pueden emplearse para detectar errores en el ensamblaje del genoma mediante la identificación de k -meros sobrerrepresentados, lo que sugiere la presencia de secuencias de ADN repetidas que se han combinado. [ 28 ] Asimismo, los k -meros se utilizan para detectar la contaminación bacteriana durante el ensamblaje del genoma eucariota, un enfoque tomado del campo de la metagenómica . [ 29 ] [ 30 ]

Elección del tamaño del k -mero

La elección del tamaño del k -mero tiene diversos efectos en el ensamblaje de la secuencia. Estos efectos varían considerablemente entre k -meros de menor y mayor tamaño. Por lo tanto, es fundamental comprender las diferencias en el tamaño del k -mero para seleccionar un tamaño adecuado que equilibre dichos efectos. A continuación, se describen los efectos de cada tamaño.

Tamaños de k -meros más bajos
  • Un tamaño de k -mero menor disminuirá la cantidad de aristas almacenadas en el grafo y, como tal, ayudará a disminuir la cantidad de espacio necesario para almacenar la secuencia de ADN.
  • Tener tamaños más pequeños aumentará la probabilidad de que todos los k -meros se superpongan y, como tal, tengan las subsecuencias necesarias para construir el grafo de De Bruijn. [ 31 ]
  • Sin embargo, al utilizar k -meros de menor tamaño, también se corre el riesgo de que muchos vértices del grafo converjan en un único k-mero. Por lo tanto, esto dificultará la reconstrucción del genoma, ya que existe un mayor grado de ambigüedad en las rutas debido a la mayor cantidad de vértices que deberán recorrerse.
  • Se pierde información a medida que los k -meros se hacen más pequeños.
    • Por ejemplo, la posibilidad de AGTCGTAGATGCTG es menor que la de ACGT y, como tal, contiene una mayor cantidad de información (consulte la entropía (teoría de la información) para obtener más información).
  • Los k -meros más pequeños también presentan el problema de no poder resolver las áreas del ADN donde se encuentran pequeños microsatélites o repeticiones. Esto se debe a que los k -meros más pequeños tienden a ubicarse completamente dentro de la región de repetición, lo que dificulta determinar la cantidad de repetición que realmente ha ocurrido.
    • Por ejemplo, para la subsecuencia ATGTGTGTGTGTGTACG, la cantidad de repeticiones de TG se perderá si se elige un tamaño de k -mero menor que 16. Esto se debe a que la mayoría de los k -meros se ubicarán en la región repetida y podrían descartarse como repeticiones del mismo k -mero en lugar de referirse a la cantidad de repeticiones.
Tamaños de k -meros más altos
  • Tener k -meros de mayor tamaño aumentará el número de aristas en el grafo, lo que a su vez, aumentará la cantidad de memoria necesaria para almacenar la secuencia de ADN.
  • Al aumentar el tamaño de los k -meros, el número de vértices también disminuirá. Esto ayudará en la construcción del genoma, ya que habrá menos caminos que recorrer en el grafo. [ 31 ]
  • Los k -meros más grandes también corren un mayor riesgo de no tener vértices externos desde cada k-mero. Esto se debe a que los k -meros más grandes aumentan el riesgo de que no se superpongan con otro k -mero.k1{\displaystyle k-1}. Por lo tanto, esto puede provocar disyunciones en las lecturas y, como tal, puede generar una mayor cantidad de contigs más pequeños .
  • Los k -meros de mayor tamaño ayudan a mitigar el problema de las regiones repetitivas pequeñas. Esto se debe a que el k -mero contiene un equilibrio entre la región repetitiva y las secuencias de ADN adyacentes (siempre que tenga un tamaño suficientemente grande), lo que permite determinar la cantidad de repetición en esa área específica.

Genética y Genómica

Con respecto a las enfermedades, el sesgo de dinucleótidos se ha aplicado a la detección de islas genéticas asociadas con la patogenicidad. [ 11 ] Trabajos previos también han demostrado que los sesgos de tetranucleótidos pueden detectar eficazmente la transferencia horizontal de genes tanto en procariotas [ 32 ] como en eucariotas. [ 33 ]

Otra aplicación de los k -meros se encuentra en la taxonomía basada en la genómica. Por ejemplo, el contenido de GC se ha utilizado para distinguir entre especies de Erwinia con un éxito moderado. [ 34 ] Similar al uso directo del contenido de GC con fines taxonómicos es el uso de T m , la temperatura de fusión del ADN. Debido a que los enlaces GC son más estables térmicamente, las secuencias con mayor contenido de GC exhiben una T m más alta . En 1987, el Comité Ad Hoc sobre la Reconciliación de Enfoques para la Sistemática Bacteriana propuso el uso de ΔT m como factor para determinar los límites de las especies como parte del concepto filogenético de especie , aunque esta propuesta no parece haber ganado adeptos dentro de la comunidad científica. [ 35 ]

Otras aplicaciones dentro de la genética y la genómica incluyen:

Metagenómica

La variación de frecuencia y espectro de k -meros se utiliza ampliamente en metagenómica tanto para el análisis [ 47 ] [ 48 ] como para la clasificación. En la clasificación, el desafío es separar las lecturas de secuenciación en "grupos" de lecturas para cada organismo (o unidad taxonómica operativa ), que luego se ensamblarán. TETRA es una herramienta destacada que toma muestras metagenómicas y las clasifica en organismos según sus frecuencias de tetranucleótidos ( k = 4). [ 49 ]  Otras herramientas que dependen de manera similar de la frecuencia de k -meros para la clasificación metagenómica son CompostBin ( k = 6), [ 50 ] PCAHIER, [ 51 ] PhyloPythia (5 ≤ k ≤ 6), [ 52 ] CLARK ( k ≥ 20), [ 53 ] y TACOA (2 ≤  k  ≤ 6). [ 54 ] Desarrollos recientes también han aplicado aprendizaje profundo a la clasificación metagenómica utilizando k -meros. [ 55 ]

Otras aplicaciones dentro de la metagenómica incluyen:

Biotecnología 

La modificación de las frecuencias de k -meros en secuencias de ADN se ha utilizado ampliamente en aplicaciones biotecnológicas para controlar la eficiencia de la traducción. En concreto, se ha empleado para regular tanto al alza como a la baja las tasas de producción de proteínas.

Con respecto al aumento de la producción de proteínas, se ha utilizado la reducción de la frecuencia de dinucleótidos desfavorables para obtener mayores tasas de síntesis de proteínas. [ 61 ] Además, se ha modificado el sesgo en el uso de codones para crear secuencias sinónimas con mayores tasas de expresión de proteínas. [ 2 ] [ 3 ] De manera similar, la optimización de pares de codones, una combinación de optimización de dinucleótidos y codones, también se ha utilizado con éxito para aumentar la expresión. [ 62 ]

La aplicación más estudiada de los k -meros para disminuir la eficiencia traslacional es la manipulación de pares de codones para atenuar virus con el fin de crear vacunas. Los investigadores lograron recodificar el virus del dengue , el virus que causa la fiebre del dengue , de manera que su sesgo de pares de codones fuera más diferente a la preferencia de uso de codones de los mamíferos que el tipo salvaje . [ 63 ] Aunque contenía una secuencia de aminoácidos idéntica, el virus recodificado demostró una patogenicidad significativamente debilitada al tiempo que provocaba una fuerte respuesta inmune. Este enfoque también se ha utilizado eficazmente para crear una vacuna contra la influenza [ 64 ] así como una vacuna contra el herpesvirus de la enfermedad de Marek (MDV). [ 5 ] Cabe destacar que la manipulación del sesgo de pares de codones empleada para atenuar el MDV no redujo eficazmente la oncogenicidad del virus, lo que resalta una posible debilidad en las aplicaciones biotecnológicas de este enfoque. Hasta la fecha, ninguna vacuna desoptimizada de pares de codones ha sido aprobada para su uso.

Dos artículos posteriores ayudan a explicar el mecanismo real subyacente a la desoptimización de pares de codones: el sesgo de pares de codones es el resultado del sesgo de dinucleótidos. [ 65 ] [ 66 ] Al estudiar los virus y sus huéspedes, ambos grupos de autores pudieron concluir que el mecanismo molecular que resulta en la atenuación de los virus es un aumento de dinucleótidos poco adecuados para la traducción.

El contenido de GC, debido a su efecto sobre el punto de fusión del ADN , se utiliza para predecir la temperatura de hibridación en la PCR , otra herramienta importante de la biotecnología.

Implementación

Pseudocódigo

La determinación de los posibles k -meros de una lectura se puede realizar simplemente recorriendo la longitud de la cadena en uno y tomando cada subcadena de longitudk{\displaystyle k}El pseudocódigo para lograr esto es el siguiente:

procedimiento k-mers(cadena seq, entero k) es L ← longitud(seq) arr ← nuevo arreglo de L − k + 1 cadenas vacías // iterar sobre el número de k-meros en seq, // almacenando el n-ésimo k-mero en el array de salida para n ← 0 a L − k + 1 exclusivo hacer arr[n] ← subsecuencia de seq desde la letra n inclusive hasta la letra n + k excluyendo regreso arr

En flujos de trabajo bioinformáticos

Debido a que el número de k -meros crece exponencialmente para valores de k , contar k -meros para valores grandes de k (generalmente >10) es una tarea computacionalmente difícil. Si bien las implementaciones simples, como el pseudocódigo anterior, funcionan para valores pequeños de k , deben adaptarse para aplicaciones de alto rendimiento o cuando k es grande. Para resolver este problema, se han desarrollado varias herramientas:

  • Jellyfish utiliza una tabla hash multihilo y sin bloqueo para el conteo de k -meros y tiene enlaces para Python , Ruby y Perl [ 67 ].
  • KMC es una herramienta para el conteo de k -meros que utiliza una arquitectura de discos múltiples para una velocidad optimizada [ 68 ].
  • Gerbil utiliza un enfoque de tabla hash pero con soporte adicional para aceleración por GPU [ 69 ]
  • K-mer Analysis Toolkit (KAT) utiliza una versión modificada de Jellyfish para analizar recuentos de k -meros [ 6 ].

Véase también

Referencias

  • Parte del contenido de este artículo fue copiado de K-mer Archived 2019-06-24 en Wayback Machine en la wiki de PLOS, que está disponible bajo una licencia Creative Commons Attribution 2.5 Generic (CC BY 2.5) .
  1. Compeau, Phillip EC; Pevzner, Pavel A; Tesler, Glenn (noviembre de 2011). "Cómo aplicar los grafos de De Bruijn al ensamblaje del genoma" . Nature Biotechnology . 29 (11): 987–991 . doi : 10.1038/nbt.2023 . ISSN 1087-0156 . PMC 5531759. PMID 22068540 .   
  2. 1 2 Welch, Mark; Govindarajan, Sridhar; Ness, Jon E.; Villalobos, Alan; Gurney, Austin; Minshull, Jeremy; Gustafsson, Claes (2009-09-14). Kudla, Grzegorz (ed.). "Parámetros de diseño para controlar la expresión génica sintética en Escherichia coli" . PLOS ONE . 4 (9) e7002. Bibcode : 2009PLoSO...4.7002W . doi : 10.1371/journal.pone.0007002 . ISSN 1932-6203 . PMC 2736378. PMID 19759823 .   
  3. 1 2 Gustafsson, Claes; Govindarajan, Sridhar; Minshull, Jeremy (julio de 2004). "Sesgo de codones y expresión de proteínas heterólogas". Trends in Biotechnology . 22 (7): 346– 353. doi : 10.1016/j.tibtech.2004.04.006 . PMID 15245907 . 
  4. 1 2 Perry, Scott C.; Beiko, Robert G. (2010-01-01). "Distinción de fragmentos del genoma microbiano según su composición: perspectivas genómicas evolutivas y comparativas" . Genome Biology and Evolution . 2 : 117–131 . doi : 10.1093/gbe/evq004 . ISSN 1759-6653 . PMC 2839357. PMID 20333228 .   
  5. 1 2 Eschke, Kathrin; Trimpert, Jakob; Osterrieder, Nikolaus; Kunec, Dusan (2018-01-29). Mocarski, Edward (ed.). "Atenuación de un herpesvirus de la enfermedad de Marek (MDV) muy virulento mediante la desoptimización del sesgo de pares de codones" . PLOS Pathogens . 14 (1) e1006857. doi : 10.1371/journal.ppat.1006857 . ISSN 1553-7374 . PMC 5805365. PMID 29377958 .   
  6. 1 2 Mapleson, Daniel; Garcia Accinelli, Gonzalo; Kettleborough, George; Wright, Jonathan; Clavijo, Bernardo J. (2016-10-22). " KAT: un conjunto de herramientas de análisis de K-meros para el control de calidad de conjuntos de datos NGS y ensamblajes de genomas" . Bioinformatics . 33 (4): 574– 576. doi : 10.1093/bioinformatics/btw663 . ISSN 1367-4803 . PMC 5408915. PMID 27797770 .   
  7. 1 2 Chor, Benny ; Horn, David; Goldman, Nick; Levy, Yaron; Massingham, Tim (2009). " Espectros de k-meros de ADN genómico: modelos y modalidades" . Genome Biology . 10 (10): R108. doi : 10.1186/gb-2009-10-10-r108 . ISSN 1465-6906 . PMC 2784323. PMID 19814784 .   
  8. Yakovchuk, P. (30 de enero de 2006). "Contribuciones del apilamiento y el emparejamiento de bases a la estabilidad térmica de la doble hélice del ADN" . Nucleic Acids Research . 34 (2): 564– 574. doi : 10.1093/nar/gkj454 . ISSN 0305-1048 . PMC 1360284. PMID 16449200 .   
  9. Bernardi, Giorgio (enero de 2000). "Isocoras y la genómica evolutiva de los vertebrados". Gene . 241 (1): 3– 17. doi : 10.1016/S0378-1119(99)00485-0 . PMID 10607893 . 
  10. Hurst, Laurence D.; Merchant, Alexa R. (2001-03-07). "El alto contenido de guanina-citosina no es una adaptación a la alta temperatura: un análisis comparativo entre procariotas" . Proceedings of the Royal Society B: Biological Sciences . 268 (1466): 493– 497. doi : 10.1098/rspb.2000.1397 . ISSN 1471-2954 . PMC 1088632. PMID 11296861 .   
  11. 1 2 3 Mugal, Carina F.; Weber, Claudia C.; Ellegren, Hans (diciembre de 2015). "La conversión génica sesgada por GC vincula el panorama de recombinación y la demografía con la composición de bases genómicas: la conversión génica sesgada por GC impulsa la composición de bases genómicas en una amplia gama de especies". BioEssays . 37 (12): 1317– 1326. doi : 10.1002/bies.201500058 . PMID 26445215 . S2CID 21843897 .  
  12. Romiguier, Jonathan; Roux, Camille (15 de febrero de 2017). " Sesgos analíticos asociados con el contenido de GC en la evolución molecular" . Frontiers in Genetics . 8 : 16. doi : 10.3389/fgene.2017.00016 . ISSN 1664-8021 . PMC 5309256. PMID 28261263 .   
  13. Spencer, CCA (1 de agosto de 2006). "Polimorfismo humano en torno a puntos calientes de recombinación: Figura 1". Biochemical Society Transactions . 34 (4): 535– 536. doi : 10.1042/BST0340535 . ISSN 0300-5127 . PMID 16856853 .  
  14. Weber, Claudia C; Boussau, Bastien; Romiguier, Jonathan; Jarvis, Erich D; Ellegren, Hans (diciembre de 2014). "Evidencia de conversión génica sesgada por GC como impulsor de diferencias entre linajes en la composición de bases aviares" . Genome Biology . 15 (12): 549. doi : 10.1186/s13059-014-0549-1 . ISSN 1474-760X . PMC 4290106. PMID 25496599 .   
  15. Lassalle, Florent; Périan, Séverine; Bataillon, Thomas; Nesme, Xavier; Duret, Laurent; Daubin, Vincent (2015-02-06). Petrov, Dmitri A. (ed.). "Evolución del contenido de GC en genomas bacterianos: la hipótesis de conversión génica sesgada se expande" . PLOS Genetics . 11 (2) e1004941. doi : 10.1371/journal.pgen.1004941 . ISSN 1553-7404 . PMC 4450053. PMID 25659072 .   
  16. Santoyo, G; Romero, D (abril de 2005). "Conversión genética y evolución concertada en genomas bacterianos". FEMS Microbiology Reviews . 29 (2): 169– 183. doi : 10.1016/j.femsre.2004.10.004 . PMID 15808740 . 
  17. Bhérer, Claude; Auton, Adam (16 de junio de 2014), "Conversión genética sesgada y su impacto en la evolución del genoma", en John Wiley & Sons Ltd (ed.), eLS , John Wiley & Sons, Ltd, doi : 10.1002/9780470015902.a0020834.pub2 , ISBN 978-0-470-01590-2
  18. 1 2 Karlin, Samuel (octubre de 1998). "Firmas de dinucleótidos globales y análisis de la heterogeneidad genómica" . Current Opinion in Microbiology . 1 (5): 598– 610. doi : 10.1016/S1369-5274(98)80095-7 . PMID 10066522 . 
  19. Beutler, E.; Gelbart, T.; Han, JH; Koziol, JA; Beutler, B. (1989-01-01). "Evolución del genoma y el código genético: selección a nivel de dinucleótidos por metilación y escisión de polirribonucleótidos" . Actas de la Academia Nacional de Ciencias . 86 (1): 192– 196. Bibcode : 1989PNAS...86..192B . doi : 10.1073/pnas.86.1.192 . ISSN 0027-8424 . PMC 286430. PMID 2463621 .   
  20. Di Giallonardo, Francesca; Schlub, Timothy E.; Shi, Mang; Holmes, Edward C. (2017-04-15). Dermody, Terence S. (ed.). "La composición de dinucleótidos en los virus de ARN animales está más determinada por la familia del virus que por la especie huésped" . Journal of Virology . 91 (8). doi : 10.1128/JVI.02381-16 . ISSN 0022-538X . PMC 5375695. PMID 28148785 .   
  21. Żemojtel, Tomasz; kiełbasa, Szymon M.; Arndt, Peter F.; Behrens, Sarah; Bourque, Guillaume; Vingron, Martin (2011-01-01). "La desaminación de CpG crea sitios de unión de factores de transcripción con alta eficiencia" . Genome Biology and Evolution . 3 : 1304–1311 . doi : 10.1093/gbe/evr107 . ISSN 1759-6653 . PMC 3228489. PMID 22016335 .   
  22. 1 2 Hershberg, R; Petrov, DA (2008). "Selección basada en el sesgo de codones". Annual Review of Genetics . 42 : 287–299 . doi : 10.1146/annurev.genet.42.110807.091442 . PMID 18983258 . 
  23. Sharp, Paul M.; Li, Wen-Hsiung (1987). "El índice de adaptación de codones: una medida del sesgo en el uso de codones sinónimos direccionales y sus posibles aplicaciones" . Nucleic Acids Research . 15 (3): 1281– 1295. doi : 10.1093/nar/15.3.1281 . ISSN 0305-1048 . PMC 340524. PMID 3547335 .   
  24. Noble, Peter A.; Citek, Robert W.; Ogunseitan, Oladele A. (abril de 1998). "Frecuencias de tetranucleótidos en genomas microbianos". Electrophoresis . 19 ( 4): 528– 535. doi : 10.1002/elps.1150190412 . ISSN 0173-0835 . PMID 9588798. S2CID 9539686 .   
  25. Nagarajan, Niranjan; Pop, Mihai (2013). "El ensamblaje de secuencias desmitificado". Nature Reviews Genetics . 14 (3): 157– 167. doi : 10.1038/nrg3367 . ISSN 1471-0056 . PMID 23358380 . S2CID 3519991 .   
  26. ^ Li, Ruiqiang; Zhu, Hongmei; Ruan, Jue; Qian, Wubin; Colmillo, Xiaodong; Shi, Zhongbin; Li, Yingrui; Li, Shengting; Shan, Gao; Kristiansen, Karsten; Li, Songgang; Yang, Huanming; Wang, Jian; Wang, Jun (febrero de 2010). "Ensamblaje de novo de genomas humanos con secuenciación de lectura corta masivamente paralela" . Investigación del genoma . 20 (2): 265– 272. doi : 10.1101/gr.097261.109 . PMC 2813482 . PMID 20019144 .  
  27. Compeau, P.; Pevzner, P.; Teslar, G. (2011). "Cómo aplicar los grafos de De Bruijn al ensamblaje del genoma" . Nature Biotechnology . 29 (11): 987– 991. doi : 10.1038/nbt.2023 . PMC 5531759. PMID 22068540 .  
  28. Phillippy, Adam M; Schatz, Michael C; Pop, Mihai (2008). "Análisis forense del ensamblaje del genoma: encontrando el escurridizo error de ensamblaje" . Genome Biology . 9 (3): R55. doi : 10.1186 / gb-2008-9-3-r55 . PMC 2397507. PMID 18341692 .  
  29. Delmont, Tom O.; Eren, A. Murat (29 de marzo de 2016). "Identificación de la contaminación con prácticas avanzadas de visualización y análisis: enfoques metagenómicos para ensamblajes de genomas eucariotas" . PeerJ . 4 e1839 . doi : 10.7717/peerj.1839 . PMC 4824900. PMID 27069789 .  
  30. Bemm, Felix; Weiß, Clemens Leonard; Schultz, Jörg; Förster, Frank (31 de mayo de 2016). "Genoma de un tardígrado: ¿Transferencia horizontal de genes o contaminación bacteriana?" . Actas de la Academia Nacional de Ciencias . 113 (22): E3054-6. Bibcode : 2016PNAS..113E3054B . doi : 10.1073/pnas.1525116113 . PMC 4896698 . PMID 27173902 .  
  31. 1 2 Zerbino, Daniel R.; Birney, Ewan (mayo de 2008). "Velvet: Algoritmos para el ensamblaje de lecturas cortas de novo utilizando grafos de De Bruijn" . Genome Research . 18 (5): 821– 829. doi : 10.1101/gr.074492.107 . PMC 2336801. PMID 18349386 .  
  32. Goodur, Haswanee D.; Ramtohul, Vyasanand; Baichoo, Shakuntala (11 de noviembre de 2012). "GIDT : una herramienta para la identificación y visualización de islas genómicas en organismos procariotas". 2012 IEEE 12.ª Conferencia Internacional sobre Bioinformática y Bioingeniería (BIBE) . págs. 58-63 . doi : 10.1109/bibe.2012.6399707 . ISBN  978-1-4673-4358-9. S2CID 6368495 . 
  33. Jaron, KS; Moravec, JC; Martinkova, N. (2014-04-15). "SigHunt: buscador de transferencia horizontal de genes optimizado para genomas eucariotas" . Bioinformatics . 30 (8): 1081– 1086. doi : 10.1093/bioinformatics/btt727 . hdl : 11104/0228726 . ISSN 1367-4803 . PMID 24371153 .  
  34. Starr, MP; Mandel, M. (1969-04-01). "Composición de bases de ADN y taxonomía de enterobacterias fitopatógenas y otras" . Journal of General Microbiology . 56 (1): 113– 123. doi : 10.1099/00221287-56-1-113 . ISSN 0022-1287 . PMID 5787000 .  
  35. Moore, WEC; Stackebrandt, E.; Kandler, O.; Colwell, RR; Krichevsky, MI; Truper, HG; Murray, RGE; Wayne, LG; Grimont, PAD (1987-10-01). "Informe del Comité Ad Hoc sobre la Reconciliación de Enfoques para la Sistemática Bacteriana" . Revista Internacional de Microbiología Sistemática y Evolutiva . 37 (4): 463– 464. doi : 10.1099/00207713-37-4-463 . ISSN 1466-5026 . 
  36. Patro, Rob; Mount, Stephen M; Kingsford, Carl (mayo de 2014). "Sailfish permite la cuantificación de isoformas sin alineación a partir de lecturas de RNA-seq utilizando algoritmos ligeros" . Nature Biotechnology . 32 (5): 462– 464. arXiv : 1308.3700 . doi : 10.1038/nbt.2862 . PMC 4077321. PMID 24752080 .  
  37. Navarro-Gomez, Daniel; Leipzig, Jeremy; Shen, Lishuang; Lott, Marie; Stassen, Alphons P.M.; Wallace, Douglas C.; Wiggs, Janey L.; Falk, Marni J.; van Oven, Mannis; Gai, Xiaowu (15 April 2015). "Phy-Mer: a novel alignment-free and reference-independent mitochondrial haplogroup classifier". Bioinformatics. 31 (8): 1310–1312. doi:10.1093/bioinformatics/btu825. PMC 4393525. PMID 25505086.
  38. Karikari, Benjamin; Lemay, Marc-André; Belzile, François (13 July 2023). "k-mer-Based Genome-Wide Association Studies in Plants: Advances, Challenges, and Perspectives". Genes. 14 (7): 1439. doi:10.3390/genes14071439. PMC 10379394. PMID 37510343.
  39. Hozza, Michal; Vinař, Tomáš; Brejová, Broňa (2015), "How Big is that Genome? Estimating Genome Size and Coverage from k-mer Abundance Spectra", in Iliopoulos, Costas; Puglisi, Simon; Yilmaz, Emine (eds.), String Processing and Information Retrieval, Lecture Notes in Computer Science, vol. 9309, Springer International Publishing, pp. 199–209, doi:10.1007/978-3-319-23826-5_20, ISBN 978-3-319-23825-8
  40. Lamichhaney, Sangeet; Fan, Guangyi; Widemo, Fredrik; Gunnarsson, Ulrika; Thalmann, Doreen Schwochow; Hoeppner, Marc P; Kerje, Susanne; Gustafson, Ulla; Shi, Chengcheng (2016). "Structural genomic changes underlie alternative reproductive strategies in the ruff (Philomachus pugnax)". Nature Genetics. 48 (1): 84–88. doi:10.1038/ng.3430. ISSN 1061-4036. PMID 26569123.
  41. Chae, H.; Park, J.; Lee, S.-W.; Nephew, K. P.; Kim, S. (1 May 2013). "Comparative analysis using K-mer and K-flank patterns provides evidence for CpG island sequence evolution in mammalian genomes". Nucleic Acids Research. 41 (9): 4783–4791. doi:10.1093/nar/gkt144. PMC 3643570. PMID 23519616.
  42. Mohamed Hashim, Ezzeddin Kamil; Abdullah, Rosni (diciembre de 2015). "ADN k-mer raro: identificación de motivos de secuencia y predicción de isla CpG y promotor". Journal of Theoretical Biology . 387 : 88–100 . Bibcode : 2015JThBi.387...88M . doi : 10.1016/j.jtbi.2015.09.014 . PMID 26427337 . 
  43. Price, Jones, Pevzner (2005). "Identificación de novo de familias repetitivas en genomas grandes" . Bioinformatics . 21(supl. 1): i351–8. doi : 10.1093/bioinformatics/bti1018 . PMID 15961478 . {{cite journal}}: CS1 maint: varios nombres: lista de autores ( enlace )
  44. Meher, Prabina Kumar; Sahu, Tanmaya Kumar; Rao, AR (2016). "Identificación de especies basada en código de barras de ADN utilizando vector de características k-mer y clasificador de bosque aleatorio". Gene . 592 (2): 316– 324. doi : 10.1016/j.gene.2016.07.010 . PMID 27393648 . 
  45. Newburger, DE; Bulyk, ML (1 de enero de 2009). "UniPROBE: una base de datos en línea de datos de microarrays de unión de proteínas sobre interacciones proteína-ADN" . Nucleic Acids Research . 37 (Base de datos): D77– D82. doi : 10.1093/nar/gkn660 . PMC 2686578. PMID 18842628 .  
  46. ^ Nordström, Karl JV; Albani, María C; James, Geo Velikkakam; Gutjahr, Carolina; Hartwig, Benjamín; Turck, Franziska; Paszkowski, Uta; Coupland, George; Schneeberger, Korbinian (abril de 2013). "Identificación de mutaciones mediante comparación directa de datos de secuenciación del genoma completo de individuos mutantes y de tipo salvaje utilizando k-mers" . Biotecnología de la Naturaleza . 31 (4): 325– 330. doi : 10.1038/nbt.2515 . PMID 23475072 . 
  47. Zhu, Jianfeng; Zheng, Wei-Mou (2014). "Enfoque autoorganizado para metagenomas". Computational Biology and Chemistry . 53 : 118–124 . doi : 10.1016/j.compbiolchem.2014.08.016 . PMID 25213854 . 
  48. Dubinkina, Veronika B.; Ischenko, Dmitry S.; Ulyantsev, Vladimir I.; Tyakht, Alexander V.; Alexeev, Dmitry G. (diciembre de 2016). " Evaluación de la aplicabilidad del espectro de k-meros para el análisis de disimilitud metagenómica" . BMC Bioinformatics . 17 (1): 38. doi : 10.1186/s12859-015-0875-7 . PMC 4715287. PMID 26774270 .  
  49. Teeling, H; Waldmann, J; Lombardot, T; Bauer, M; Glöckner, F (2004). "TETRA: un servicio web y un programa independiente para el análisis y la comparación de patrones de uso de tetranucleótidos en secuencias de ADN" . BMC Bioinformatics . 5 : 163. doi : 10.1186/1471-2105-5-163 . PMC 529438. PMID 15507136 .  
  50. Chatterji, Sourav; Yamazaki, Ichitaro; Bai, Zhaojun; Eisen, Jonathan A. (2008), "CompostBin: Un algoritmo basado en la composición del ADN para la clasificación de lecturas ambientales de secuenciación masiva", en Vingron, Martin; Wong, Limsoon (eds.), Investigación en biología molecular computacional , Lecture Notes in Computer Science, vol. 4955, Springer Berlin Heidelberg, pp. 17–28 , arXiv : 0708.3098 , doi : 10.1007/978-3-540-78839-3_3 , ISBN   978-3-540-78838-6, S2CID 7832512 
  51. Zheng, Hao; Wu, Hongwei (2010). "Clasificación de fragmentos cortos de ADN procariota mediante un clasificador jerárquico basado en análisis discriminante lineal y análisis de componentes principales". Journal of Bioinformatics and Computational Biology . 08 (6): 995– 1011. doi : 10.1142/S0219720010005051 . ISSN 0219-7200 . PMID 21121023 .  
  52. McHardy, Alice Carolyn; Martín, Héctor García; Tsirigos, Aristotelis; Hugenholtz, Philip; Rigoutsos, Isidore (2007). "Clasificación filogenética precisa de fragmentos de ADN de longitud variable". Nature Methods . 4 (1): 63– 72. doi : 10.1038/nmeth976 . ISSN 1548-7091 . PMID 17179938 . S2CID 28797816 .   
  53. Ounit, Rachid; Wanamaker, Steve; Close, Timothy J; Lonardi, Stefano (2015). "CLARK: clasificación rápida y precisa de secuencias metagenómicas y genómicas mediante k-meros discriminativos" . BMC Genomics . 16 (1): 236. doi : 10.1186/ s12864-015-1419-2 . ISSN 1471-2164 . PMC 4428112. PMID 25879410 .   
  54. Diaz, Naryttza N; Krause, Lutz; Goesmann, Alexander; Niehaus, Karsten; Nattkemper, Tim W (2009). "TACOA – Clasificación taxonómica de fragmentos genómicos ambientales mediante un enfoque de vecino más cercano kernelizado" . BMC Bioinformatics . 10 (1): 56. doi : 10.1186/1471-2105-10-56 . ISSN 1471-2105 . PMC 2653487. PMID 19210774 .   
  55. ^ Fiannaca, Antonino; La Paglia, Laura; La Rosa, Máximo; Lo Bosco, Giosue'; Renda, Giovanni; Rizzo, Ricardo; Gaglio, Salvatore; Urso, Alfonso (2018). "Modelos de aprendizaje profundo para la clasificación taxonómica de datos metagenómicos de bacterias" . Bioinformática BMC . 19 (T7): 198.doi : 10.1186 /s12859-018-2182-6 . ISSN 1471-2105 . PMC 6069770 . PMID 30066629 .   
  56. Zhu, Jianfeng; Zheng, Wei-Mou (diciembre de 2014). "Enfoque autoorganizado para metagenomas". Computational Biology and Chemistry . 53 : 118–124 . doi : 10.1016/j.compbiolchem.2014.08.016 . PMID 25213854 . 
  57. Lu, Jennifer; Breitwieser, Florian P.; Thielen, Peter; Salzberg, Steven L. (2017-01-02). "Bracken: estimación de la abundancia de especies en datos metagenómicos" . PeerJ Computer Science . 3 e104. doi : 10.7717/peerj-cs.104 . ISSN 2376-5992 . PMC 12016282 .  
  58. Wood, Derrick E; Salzberg, Steven L (2014). "Kraken: clasificación ultrarrápida de secuencias metagenómicas mediante alineamientos exactos" . Genome Biology . 15 (3): R46. doi : 10.1186/gb-2014-15-3-r46 . ISSN 1465-6906 . PMC 4053813. PMID 24580807 .   
  59. Rosen, Gail; Garbarine, Elaine; Caseiro, Diamantino; Polikar, Robi; Sokhansanj, Bahrad (2008). "Clasificación de fragmentos de metagenoma mediante perfiles de frecuencia -Mer" . Advances in Bioinformatics . 2008 205969. doi : 10.1155/2008/205969 . ISSN 1687-8027 . PMC 2777009. PMID 19956701 .   
  60. Wang, Ying; Fu, Lei; Ren, Jie; Yu, Zhaoxia; Chen, Ting; Sun, Fengzhu (2018-05-03). "Identificación de secuencias específicas de grupos para comunidades microbianas mediante firmas de secuencias k-mer largas" . Frontiers in Microbiology . 9 : 872. doi : 10.3389/fmicb.2018.00872 . ISSN 1664-302X . PMC 5943621. PMID 29774017 .   
  61. Al-Saif, Maher; Khabar, Khalid SA (2012). "La reducción de la frecuencia del dinucleótido UU/UA en las regiones codificantes resulta en una mayor estabilidad del ARNm y expresión de proteínas" . Molecular Therapy . 20 (5): 954– 959. doi : 10.1038/mt.2012.29 . PMC 3345983. PMID 22434136 .  
  62. Trinh, R; Gurbaxani, B; Morrison, SL; Seyfzadeh, M (2004). "La optimización del uso de pares de codones dentro de la secuencia enlazadora (GGGGS)3 da como resultado una expresión proteica mejorada". Molecular Immunology . 40 (10): 717– 722. doi : 10.1016/j.molimm.2003.08.006 . PMID 14644097 . S2CID 36734007 .  
  63. Shen, Sam H.; Stauft, Charles B.; Gorbatsevych, Oleksandr; Song, Yutong; Ward, Charles B.; Yurovsky, Alisa; Mueller, Steffen; Futcher, Bruce; Wimmer, Eckard (2015-04-14). "Recodificación a gran escala de un genoma de arbovirus para reequilibrar su preferencia por insectos frente a mamíferos" . Actas de la Academia Nacional de Ciencias . 112 (15): 4749– 4754. Bibcode : 2015PNAS..112.4749S . doi : 10.1073/pnas.1502864112 . ISSN 0027-8424 . PMC 4403163. PMID 25825721 .   
  64. Kaplan, Bryan S.; Souza, Carine K.; Gauger, Phillip C.; Stauft, Charles B.; Robert Coleman, J.; Mueller, Steffen; Vincent, Amy L. (2018). "La vacunación de cerdos con una vacuna atenuada viva de influenza con sesgo de pares de codones desoptimizada protege contra el desafío homólogo" . Vaccine . 36 (8): 1101– 1107. doi : 10.1016/j.vaccine.2018.01.027 . PMID 29366707 . 
  65. Kunec, Dusan; Osterrieder, Nikolaus (2016). "El sesgo de pares de codones es una consecuencia directa del sesgo de dinucleótidos" . Cell Reports . 14 (1): 55– 67. doi : 10.1016/j.celrep.2015.12.011 . PMID 26725119 . 
  66. Tulloch, Fiona; Atkinson, Nicky J; Evans, David J; Ryan, Martin D; Simmonds, Peter (2014-12-09). " La atenuación del virus de ARN por desoptimización de pares de codones es un artefacto de los aumentos en las frecuencias de dinucleótidos CpG/UpA" . eLife . 3 e04531. doi : 10.7554/eLife.04531 . ISSN 2050-084X . PMC 4383024. PMID 25490153 .   
  67. Marçais, Guillaume; Kingsford, Carl (2011-03-15). "Un enfoque rápido y sin bloqueo para el conteo paralelo eficiente de ocurrencias de k-meros" . Bioinformatics . 27 ( 6): 764– 770. doi : 10.1093/bioinformatics/btr011 . ISSN 1460-2059 . PMC 3051319. PMID 21217122 .   
  68. ^ Deorowicz, Sebastián; Kokot, Marek; Grabowski, Szymon; Debudaj-Grabysz, Agnieszka (15 de mayo de 2015). "KMC 2: conteo de k-mer rápido y ahorrador de recursos" . Bioinformática . 31 (10): 1569-1576 . arXiv : 1407,1507 . doi : 10.1093/bioinformática/btv022 . ISSN 1460-2059 . PMID 25609798 .  
  69. Erbert, Marius; Rechner, Steffen; Müller-Hannemann, Matthias (2017). "Gerbil: un contador de k-meros rápido y eficiente en memoria con soporte para GPU" . Algorithms for Molecular Biology . 12 (1): 9. doi : 10.1186/s13015-017-0097-9 . ISSN 1748-7188 . PMC 5374613. PMID 28373894 .   
  • bioXriv:k-mero
  • arXiv: k-mer