Articulo de referencia

Metabarcoding

Diferencias entre los métodos estándar de código de barras de ADN y metabarcoding. Mientras que el código de barras de ADN se centra en una especie específica, el metabarcoding ...

Diferencias entre los métodos estándar de código de barras de ADN y metabarcoding. Mientras que el código de barras de ADN se centra en una especie específica, el metabarcoding examina comunidades enteras.

El metabarcoding consiste en la codificación de ADN / ARN (o ADN / ARN ambiental ) de manera que permita la identificación simultánea de múltiples taxones en una misma muestra. La principal diferencia entre la codificación de barras y el metabarcoding radica en que este último no se centra en un organismo específico, sino que busca determinar la composición de especies dentro de una muestra.

Un código de barras consiste en una región génica variable corta (por ejemplo, ver diferentes marcadores/códigos de barras ) que es útil para la asignación taxonómica, flanqueada por regiones génicas altamente conservadas que pueden usarse para el diseño de cebadores . [ 1 ] Esta idea de código de barras general se originó en 2003 de investigadores de la Universidad de Guelph . [ 2 ]

El procedimiento de metabarcoding, al igual que el código de barras general, se desarrolla en etapas de extracción de ADN , amplificación por PCR , secuenciación y análisis de datos . Se utilizan diferentes genes según el objetivo sea codificar una sola especie o realizar metabarcoding de varias especies. En este último caso, se utiliza un gen más universal. El metabarcoding no utiliza ADN/ARN de una sola especie como punto de partida, sino ADN/ARN de varios organismos diferentes derivados de una misma muestra ambiental o de una muestra a granel.

ADN ambiental

El ADN ambiental o ADNe describe el material genético presente en muestras ambientales como sedimentos, agua y aire, incluyendo células enteras, ADN extracelular y potencialmente organismos completos. [ 3 ] [ 4 ] El ADNe puede capturarse de muestras ambientales y conservarse , extraerse , amplificarse , secuenciarse y categorizarse según su secuencia. [ 5 ] A partir de esta información, es posible la detección y clasificación de especies. El ADNe puede provenir de piel, mucosidad, saliva, esperma, secreciones, huevos, heces, orina, sangre, raíces, hojas, frutos, polen y cuerpos en descomposición de organismos más grandes, mientras que los microorganismos pueden obtenerse en su totalidad. [ 6 ] [ 7 ] [ 4 ] La producción de ADNe depende de la biomasa , la edad y la actividad alimentaria del organismo, así como de la fisiología, el ciclo de vida y el uso del espacio. [ 4 ] [ 8 ] [ 9 ] [ 10 ]

Para 2019, los métodos en la investigación de ADN ambiental se habían ampliado para poder evaluar comunidades enteras a partir de una sola muestra. Este proceso implica metabarcoding, que puede definirse con precisión como el uso de cebadores de reacción en cadena de la polimerasa (PCR) generales o universales en muestras de ADN mixtas de cualquier origen, seguido de secuenciación de próxima generación (NGS) de alto rendimiento para determinar la composición de especies de la muestra. Este método ha sido común en microbiología durante años, pero, a partir de 2020, apenas está encontrando su lugar en la evaluación de macroorganismos. [ 11 ] [ 12 ] [ 13 ] Las aplicaciones de metabarcoding de ADN ambiental a nivel de ecosistema tienen el potencial no solo de describir comunidades y biodiversidad, sino también de detectar interacciones y ecología funcional en grandes escalas espaciales, aunque puede verse limitado por lecturas falsas debido a contaminación u otros errores. [ 7 ] [ 14 ] [ 12 ] [ 9 ] En conjunto, el metabarcoding de ADN ambiental aumenta la velocidad, la precisión y la identificación en comparación con el código de barras tradicional y disminuye el costo, pero necesita ser estandarizado y unificado, integrando la taxonomía y los métodos moleculares para un estudio ecológico completo. [ 11 ] [ 15 ] [ 16 ] [ 17 ] [ 9 ] [ 10 ]

Aplicaciones del metabarcoding de ADN ambiental en ecosistemas acuáticos y terrestres [ 10 ]
Fuentes emergentes de ADN de insectos utilizadas en metabarcoding [ 18 ]
Monitoreo global de ecosistemas y biodiversidad con metabarcoding de ADN ambiental [ 10 ]

El metabarcoding de ADN ambiental tiene aplicaciones en el monitoreo de la diversidad en todos los hábitats y grupos taxonómicos, la reconstrucción de ecosistemas antiguos, las interacciones planta-polinizador, el análisis de la dieta, la detección de especies invasoras, las respuestas a la contaminación y el monitoreo de la calidad del aire. El metabarcoding de ADN ambiental es un método único que aún está en desarrollo y probablemente seguirá evolucionando durante algún tiempo a medida que la tecnología avance y los procedimientos se estandaricen. Sin embargo, a medida que el metabarcoding se optimice y su uso se generalice, es probable que se convierta en una herramienta esencial para el monitoreo ecológico y el estudio de la conservación global. [ 10 ]

ADN comunitario

Desde el inicio de la secuenciación de alto rendimiento ( HTS ), [ 19 ] el uso del metabarcoding como herramienta de detección de biodiversidad ha generado un enorme interés. [ 12 ] [ 20 ] Sin embargo, aún no hay claridad sobre qué material de origen se utiliza para realizar análisis de metabarcoding (por ejemplo, ADN ambiental versus ADN de la comunidad ). Sin claridad entre estos dos materiales de origen, las diferencias en el muestreo, así como las diferencias en los procedimientos de laboratorio, pueden afectar los flujos de trabajo bioinformáticos posteriores utilizados para el procesamiento de datos y complicar la interpretación de los patrones de biodiversidad espacial y temporal. Aquí, buscamos diferenciar claramente entre los materiales de origen predominantes utilizados y su efecto en el análisis e interpretación posteriores para el metabarcoding de ADN ambiental de animales y plantas en comparación con el metabarcoding de ADN de la comunidad. [ 13 ]

Con el metabarcoding de ADN comunitario de animales y plantas, los grupos objetivo se recolectan con mayor frecuencia en masa (p. ej., suelo, trampa Malaise o red), y los individuos se separan de otros restos de la muestra y se agrupan antes de la extracción de ADN en masa. [ 12 ] En contraste, el ADN ambiental de macroorganismos se aísla directamente de un material ambiental (p. ej., suelo o agua) sin una segregación previa de organismos individuales o material vegetal de la muestra, y asume implícitamente que el organismo completo no está presente en la muestra. Por supuesto, las muestras de ADN comunitario pueden contener ADN de partes de tejidos, células y orgánulos de otros organismos (p. ej., contenido intestinal, ADN intracelular o extracelular cutáneo). Del mismo modo, las muestras de ADN ambiental de macroorganismos pueden capturar inadvertidamente organismos microscópicos completos no objetivo (p. ej., protistas, bacterias). Por lo tanto, la distinción puede, al menos parcialmente, romperse en la práctica. [ 13 ]

Otra distinción importante entre el ADN comunitario y el ADN ambiental de macroorganismos es que las secuencias generadas a partir del metabarcoding de ADN comunitario pueden verificarse taxonómicamente cuando los especímenes no se destruyen en el proceso de extracción. En este caso, las secuencias pueden generarse a partir de especímenes de referencia mediante secuenciación Sanger. Como las muestras para el metabarcoding de ADN ambiental carecen de organismos completos, no se pueden realizar tales comparaciones in situ. Por lo tanto, las afinidades taxonómicas solo pueden establecerse comparando directamente las secuencias obtenidas (o a través de unidades taxonómicas operativas (MOTU) generadas bioinformáticamente) con secuencias que están anotadas taxonómicamente, como la base de datos de nucleótidos GenBank del NCBI, [ 21 ] BOLD , [ 22 ] o con bases de datos de referencia autogeneradas a partir de ADN secuenciado Sanger. [ 23 ] [ 24 ] [ 25 ] (La unidad taxonómica operativa molecular (MOTU) es un grupo identificado mediante el uso de algoritmos de agrupamiento y un porcentaje de similitud de secuencia predefinido, por ejemplo, 97%)). [ 26 ] [ 13 ] Luego, para corroborar al menos parcialmente la lista de taxones resultante, se realizan comparaciones con métodos de muestreo físicos, acústicos o visuales convencionales realizados al mismo tiempo o se comparan con registros históricos de muestreos para una ubicación (véase la Tabla 1). [ 13 ]

La diferencia en el material de origen entre el ADN comunitario y el ADN ambiental tiene, por lo tanto, ramificaciones distintas para interpretar la escala de inferencia en el tiempo y el espacio sobre la biodiversidad detectada. A partir del ADN comunitario, es claro que las especies individuales se encontraron en ese tiempo y lugar, pero para el ADN ambiental, el organismo que produjo el ADN puede estar río arriba de la ubicación muestreada, [ 27 ] o el ADN puede haber sido transportado en las heces de una especie depredadora más móvil (por ejemplo, aves que depositan ADN ambiental de peces, [ 28 ] o estuvo presente previamente, pero ya no está activo en la comunidad y la detección proviene de ADN que fue liberado años o décadas antes. [ 29 ] Esto último significa que la escala de inferencia tanto en el espacio como en el tiempo debe considerarse cuidadosamente al inferir la presencia de la especie en la comunidad basándose en el ADN ambiental. [ 13 ]

etapas de metabarcoding

Seis pasos en el código de barras de ADN y el metabarcoding [ 30 ]

El código de barras de ADN y el metabarcoding constan de seis etapas o pasos. El código de barras de ADN de animales (y específicamente de murciélagos ) se utiliza como ejemplo en el diagrama de la derecha y en la explicación que aparece a continuación.

Primero, se eligen regiones de código de barras de ADN adecuadas para responder a alguna pregunta de investigación específica. La región de código de barras de ADN más utilizada para animales es un segmento de aproximadamente 600 pares de bases de longitud del gen mitocondrial citocromo oxidasa I (CO1). [ 2 ] Este locus proporciona una gran variación de secuencia entre especies, pero una cantidad relativamente pequeña de variación dentro de las especies. [ 31 ] Otras regiones de código de barras comúnmente utilizadas para la identificación de especies de animales son las regiones de ADN ribosómico (ADNr) como 16S , 18S y 12S y regiones mitocondriales como el citocromo B . [ 32 ] [ 33 ] [ 34 ] [ 35 ] Estos marcadores tienen ventajas y desventajas y se utilizan para diferentes propósitos. [ 36 ] [ 37 ] A menudo se necesitan regiones de código de barras más largas (de al menos 600 pares de bases de longitud) para una delimitación precisa de especies, especialmente para diferenciar parientes cercanos. La identificación del productor de los restos de un organismo, como heces, pelos y saliva, puede utilizarse como medida indirecta para verificar la ausencia o presencia de una especie en un ecosistema. El ADN presente en estos restos suele ser de baja calidad y cantidad, por lo que en estos casos se utilizan códigos de barras más cortos, de aproximadamente 100 pares de bases. Del mismo modo, los restos de ADN en el estiércol también suelen estar degradados, por lo que se necesitan códigos de barras cortos para identificar las presas consumidas. [ 30 ]

En segundo lugar, es necesario crear una base de datos de referencia con todos los códigos de barras de ADN que probablemente aparezcan en un estudio. Idealmente, estos códigos de barras deberían generarse a partir de especímenes de referencia depositados en un lugar de acceso público, como por ejemplo un museo de historia natural u otro instituto de investigación. [ 30 ] Actualmente, la creación de dichas bases de datos de referencia se está llevando a cabo en todo el mundo. Organizaciones asociadas colaboran en proyectos internacionales como el Proyecto Internacional del Código de Barras de la Vida (iBOL) y el Consorcio para el Código de Barras de la Vida (CBOL), con el objetivo de construir una referencia de códigos de barras de ADN que sirva de base para la identificación basada en ADN de los biomas del mundo . Los repositorios de códigos de barras más conocidos son NCBI GenBank y el Sistema de Datos del Código de Barras de la Vida (BOLD). [ 30 ]

En tercer lugar, las células que contienen el ADN de interés deben romperse para exponerlo. Este paso, la extracción y purificación del ADN , debe realizarse a partir del sustrato en estudio. Existen varios procedimientos disponibles para ello. [ 38 ] Deben elegirse técnicas específicas para aislar el ADN de sustratos con ADN parcialmente degradado, por ejemplo, muestras fósiles, y muestras que contengan inhibidores, como sangre, heces y suelo. Las extracciones en las que se espera un bajo rendimiento o calidad del ADN deben llevarse a cabo en un laboratorio de ADN antiguo , junto con protocolos establecidos para evitar la contaminación con ADN moderno. [ 39 ] [ 40 ] Los experimentos siempre deben realizarse por duplicado [ 41 ] e incluir controles positivos. [ 30 ]

En cuarto lugar, se deben generar amplicones a partir de ADN extraído, ya sea de una sola muestra o de mezclas complejas con cebadores basados ​​en códigos de barras de ADN seleccionados en el paso 1. Para rastrear su origen, se deben agregar nucleótidos marcados (identificadores moleculares o etiquetas MID) en caso de metabarcoding. Estas etiquetas son necesarias posteriormente en los análisis para rastrear las lecturas de un conjunto de datos masivo hasta su origen. [ 30 ]

Historia de la tecnología de secuenciación [ 42 ]

En quinto lugar, se deben elegir las técnicas apropiadas para la secuenciación de ADN . El método clásico de terminación de cadena de Sanger se basa en la incorporación selectiva de inhibidores de la elongación de cadena de la ADN polimerasa durante la replicación del ADN . Estas cuatro bases se separan por tamaño mediante electroforesis y posteriormente se identifican mediante detección láser. El método de Sanger es limitado y solo puede producir una lectura a la vez, por lo que es adecuado para generar códigos de barras de ADN a partir de sustratos que contienen una sola especie. [ 30 ] Las tecnologías emergentes, como la secuenciación de nanoporos, han reducido el costo de la secuenciación de ADN de aproximadamente 30 000 USD por megabyte en 2002 a aproximadamente 0,60 USD en 2016. [ 43 ] [ 44 ] Las modernas tecnologías de secuenciación de próxima generación (NGS) pueden manejar miles o millones de lecturas en paralelo y, por lo tanto, son adecuadas para la identificación masiva de una mezcla de diferentes especies presentes en un sustrato, lo que se resume como metabarcoding. [ 30 ]

Finalmente, es necesario realizar análisis bioinformáticos para hacer coincidir los códigos de barras de ADN obtenidos con los números de índice de códigos de barras (BIN) en las bibliotecas de referencia. [ 45 ] Cada BIN, o grupo de BIN, puede identificarse a nivel de especie cuando muestra una alta (>97%) concordancia con los códigos de barras de ADN vinculados a una especie presente en una biblioteca de referencia, o cuando aún falta la identificación taxonómica a nivel de especie, una unidad taxonómica operativa (OTU), que se refiere a un grupo de especies (es decir, género, familia o rango taxonómico superior ). [ 30 ] (Ver binning (metagenómica) ). Los resultados del flujo de trabajo bioinformático deben podarse, por ejemplo, filtrando singletons poco fiables, duplicados superfluos, lecturas de baja calidad y/o lecturas quiméricas . Esto generalmente se hace realizando búsquedas BLAST en serie en combinación con scripts de filtrado y recorte automáticos. [ 46 ] Se necesitan umbrales estandarizados para discriminar entre diferentes especies o una identificación correcta y una incorrecta. [ 30 ]

Flujo de trabajo de metabarcoding

A pesar del poder evidente del enfoque, el metabarcoding de eDNA se ve afectado por desafíos de precisión y exactitud distribuidos a lo largo del flujo de trabajo en el campo, en el laboratorio y en el teclado. [ 47 ] Como se establece en el diagrama de la derecha, siguiendo el diseño inicial del estudio (hipótesis/pregunta, grupo taxonómico objetivo, etc.), el flujo de trabajo actual de eDNA consta de tres componentes: campo, laboratorio y bioinformática. [ 13 ] El componente de campo consiste en la recolección de muestras (por ejemplo, agua, sedimento, aire) que se conservan o congelan antes de la extracción de ADN. El componente de laboratorio tiene cuatro pasos básicos: (i) el ADN se concentra (si no se realiza en el campo) y se purifica, (ii) se utiliza PCR para amplificar un gen o región objetivo, (iii) las secuencias de nucleótidos únicas llamadas "índices" (también denominadas "códigos de barras") se incorporan mediante PCR o se ligan (unen) a diferentes productos de PCR, creando una "biblioteca" en la que se pueden agrupar múltiples muestras, y (iv) las bibliotecas agrupadas se secuencian en una máquina de alto rendimiento . El paso final después del procesamiento de muestras en el laboratorio es procesar computacionalmente los archivos de salida del secuenciador utilizando una sólida plataforma bioinformática. [ 13 ]

Cuestiones a considerar en las fases de diseño e implementación de un estudio de metabarcoding de ADN ambiental [ 13 ]
Decisiones involucradas en un flujo de trabajo de ecología molecular [ 12 ]