El Proyecto de Anatomía del Genoma del Cáncer ( CGAP ), creado por el Instituto Nacional del Cáncer (NCI) en 1997 e introducido por Al Gore , es una base de datos en línea sobre genomas normales, precancerosos y cancerosos. También proporciona herramientas para la visualización y el análisis de los datos, lo que permite la identificación de genes involucrados en diversos aspectos de la progresión tumoral . El objetivo de CGAP es caracterizar el cáncer a nivel molecular, proporcionando una plataforma con datos actualizados de fácil acceso y un conjunto de herramientas que permitan a los investigadores relacionar fácilmente sus hallazgos con el conocimiento existente. Asimismo, se centra en el desarrollo de herramientas de software que mejoran el uso de conjuntos de datos grandes y complejos. [ 1 ] [ 2 ] El proyecto está dirigido por Daniela S. Gerhard e incluye subproyectos o iniciativas, entre las que destacan el Proyecto de Aberración Cromosómica del Cáncer (CCAP) y la Iniciativa de Anotación Genética (GAI). CGAP contribuye a numerosas bases de datos y organizaciones como el NCBI contribuyen a las bases de datos de CGAP.
Los resultados finales del proyecto CGAP incluyen establecer una correlación entre la progresión de un cáncer específico y su respuesta terapéutica, mejorar la evaluación del tratamiento y desarrollar nuevas técnicas para la prevención, la detección y el tratamiento. Esto se logra mediante la caracterización de los productos de ARNm de los tejidos biológicos.
Investigación
Fondo
La causa fundamental del cáncer es la incapacidad de una célula para regular su expresión génica. Para caracterizar un tipo específico de cáncer, se pueden examinar las proteínas que se producen a partir de la expresión génica alterada o el ARNm precursor de la proteína. CGAP trabaja para asociar el perfil de expresión , la firma molecular o el transcriptoma de una célula en particular , que es esencialmente la huella dactilar de la célula, con su fenotipo. Por lo tanto, existen perfiles de expresión que consideran el tipo de cáncer y la etapa de progresión. [ 3 ]
Secuenciación
El objetivo inicial de CGAP era establecer un Índice de Genes Tumorales (TGI) para almacenar los perfiles de expresión. Esto contribuiría tanto a bases de datos nuevas como existentes. [ 4 ] Esto contribuyó a dos tipos de bibliotecas, dbEST y posteriormente dbSAGE . Esto se realizó en una serie de pasos: [ 3 ]
- El contenido celular se lava sobre placas con secuencias de poli-T. Esto permite la unión de las colas de poli-A , presentes únicamente en las moléculas de ARNm, reteniendo así selectivamente el ARNm.
- El ARNm aislado se procesa para convertirlo en un transcrito de ADNc mediante reacciones de transcripción inversa y polimerización del ADN.
- El ADN bicatenario resultante se incorpora a los plásmidos de E. coli . Cada bacteria contiene ahora un ADNc único que se replica para producir clones con la misma información genética. Esto se denomina biblioteca de ADNc .
- Posteriormente, la biblioteca se puede secuenciar mediante técnicas de secuenciación de alto rendimiento . Esto permite caracterizar tanto los diferentes genes expresados por la célula original como el nivel de expresión de cada gen.
Inicialmente, el TGI se centró en los cánceres de próstata, mama, ovario, pulmón y colon, mientras que el CGAP amplió su investigación a otros tipos de cáncer. En la práctica, surgieron problemas que el CGAP abordó a medida que se disponía de nuevas tecnologías.
Muchos cánceres se originan en tejidos con múltiples tipos celulares. Las técnicas tradicionales tomaban la muestra de tejido completa y producían bibliotecas de ADNc de tejido masivo. Esta heterogeneidad celular hacía que la información sobre la expresión génica en términos de biología del cáncer fuera menos precisa. Un ejemplo es el tejido de cáncer de próstata, donde las células epiteliales, que se ha demostrado que son el único tipo celular que da origen al cáncer, constituyen solo el 10 % del recuento celular. Esto llevó al desarrollo de la microdisección por captura láser (LCM), una técnica que puede aislar tipos celulares individuales, lo que dio lugar a bibliotecas de ADNc de tipos celulares específicos. [ 4 ]
La secuenciación del ADNc produce la transcripción completa del ARNm que lo generó. En la práctica, solo se requiere una parte de la secuencia para identificar de forma unívoca el ARNm o la proteína asociada. La parte resultante de la secuencia se denomina etiqueta de secuencia expresada (EST) y siempre se encuentra al final de la secuencia, cerca de la cola de poli-A. Los datos de EST se almacenan en una base de datos llamada dbEST . Las EST solo necesitan tener alrededor de 400 bases de longitud, pero con las técnicas de secuenciación NGS, esto aún produce lecturas de baja calidad. Por lo tanto, también se utiliza un método mejorado llamado análisis serial de la expresión génica (SAGE). Este método identifica, para cada molécula de transcripción de ADNc producida a partir de la expresión génica de una célula, regiones de solo 10 a 14 bases de longitud en cualquier punto de la secuencia de lectura, suficientes para identificar de forma unívoca esa transcripción de ADNc. Estas bases se cortan y se unen, y luego se incorporan a plásmidos bacterianos como se mencionó anteriormente. Las bibliotecas SAGE tienen mejor calidad de lectura y generan una mayor cantidad de datos cuando se secuencian, y dado que los transcritos se comparan en niveles absolutos en lugar de relativos, SAGE tiene la ventaja de no requerir la normalización de los datos mediante la comparación con una referencia. [ 1 ] [ 4 ]
Recursos
Tras la secuenciación y el establecimiento de las bibliotecas, CGAP integra los datos con las fuentes de datos existentes y proporciona diversas bases de datos y herramientas para el análisis. En el sitio web de CGAP del NCI se puede encontrar una descripción detallada de las herramientas y bases de datos creadas o utilizadas por CGAP. A continuación, se presentan algunas de las iniciativas o herramientas de investigación que ofrece CGAP.
Iniciativa de Anotación Genómica
El objetivo de la Iniciativa de Anotación Genómica del Proyecto de Anatomía del Genoma del Cáncer (CGAP-GAI) es descubrir y catalogar polimorfismos de un solo nucleótido (SNP) que se correlacionan con el inicio y la progresión del cáncer. [ 4 ] CGAP-GAI ha creado diversas herramientas para el descubrimiento, análisis y visualización de SNP. Los SNP son valiosos en la investigación del cáncer, ya que pueden utilizarse en varios estudios genéticos diferentes, comúnmente para rastrear la transmisión, identificar formas alternativas de genes y analizar vías moleculares complejas que regulan el metabolismo, el crecimiento o la diferenciación celular. [ 5 ]
Los SNP en CGAP-GAI se encuentran como resultado de la resecuenciación de genes de interés en diferentes individuos o mediante la búsqueda en bases de datos de EST humanas existentes y la realización de comparaciones. [ 2 ] Examina transcripciones de individuos sanos, individuos con enfermedades, tejido tumoral y líneas celulares de un gran conjunto de individuos; por lo tanto, es más probable que la base de datos incluya mutaciones de enfermedades raras además de variantes de alta frecuencia. [ 6 ] Un desafío común en la detección de SNP es la diferenciación entre errores de secuenciación y polimorfismos reales. Los SNP encontrados se someten a un análisis estadístico utilizando el pipeline de SNP de CGAP para calcular la probabilidad de que la variante sea de hecho un polimorfismo. Los SNP de alta probabilidad se validan y existen herramientas disponibles que hacen predicciones sobre si la función está alterada. [ 2 ]
Para facilitar el acceso a los datos, CGAP-GAI cuenta con varias herramientas que permiten visualizar tanto la alineación de secuencias como la descripción general del ensamblaje, con el contexto de las secuencias a partir de las cuales se predijeron. Los SNP se anotan y, a menudo, se determinan mapas genéticos/físicos integrados. [ 6 ]
Proyecto de Aberraciones Cromosómicas del Cáncer (CCAP)
La inestabilidad genómica es una característica común del cáncer; por lo tanto, comprender las anomalías estructurales y cromosómicas puede brindar información sobre la progresión de la enfermedad. El Proyecto de Aberración Cromosómica del Cáncer (cCAP) es una iniciativa apoyada por CGAP que se utiliza para definir la estructura cromosómica y caracterizar los reordenamientos que están asociados con la transformación maligna. [ 4 ] [ 7 ] Incorpora la versión en línea de la base de datos de Mitelman, creada por Felix Mitelman, Bertil Johansson y Fredrik Mertens antes de la creación de CGAP, otra compilación de reordenamientos cromosómicos conocidos. El cCAP tiene varios objetivos: [ 7 ]
- Integración de mapas citogenéticos y físicos del genoma humano.
- Generar un repositorio de clones BAC en todo el genoma que estén mapeados genética y físicamente.
- Desarrollar una plataforma para la correlación paralela de bases de datos de aberraciones asociadas al cáncer (base de datos de clones BAC mapeados mediante hibridación fluorescente in situ (FISH)).
- Integración de tres técnicas de análisis citogenético (cariotipado espectral, hibridación genómica comparativa y FISH) para refinar la nomenclatura definitoria de las aberraciones cariotípicas.
La base de datos contiene información citogenética de más de 64.000 casos de pacientes, incluyendo más de 2000 fusiones genéticas. [ 1 ]
Como parte de este proyecto, existe un repositorio de clones BAC mapeados física y citogenéticamente para el genoma humano , disponibles físicamente a través de una red de distribuidores. [ 1 ] Los mapas de clones CCAP se han mapeado citogenéticamente mediante FISH con una resolución de 1-2 Mb en todo el genoma humano, y físicamente mediante sitios marcados por secuencia (STS). [ 8 ] Los datos de los clones BAC también están disponibles a través de las bases de datos CGAP y NCBI.
Otros recursos
A continuación se enumeran otros recursos disponibles a través de CGAP. [ 1 ]
Visualización diferencial digital
Una técnica temprana utilizada por CGAP es la visualización diferencial digital (DDD), que utiliza la prueba exacta de Fisher para comparar bibliotecas entre sí, con el fin de encontrar una diferencia significativa entre poblaciones. CGAP se aseguró de que DDD pudiera comparar todas las bibliotecas de ADNc en dbEST , y no solo las generadas por CGAP. [ 4 ]
Colección de Genes de Mamíferos (MGC)
El MGC proporciona a los investigadores información completa sobre proteínas a partir de ADNc, a diferencia de las bases de datos EST o SAGE, que solo proporcionan la etiqueta de identificación. El proyecto incluye genes humanos y de ratón, y posteriormente se añadieron ADNc de vaca generados por Genome Canada . [ 9 ]
Mapa SAGE
SAGEmap es la base de datos utilizada para almacenar bibliotecas SAGE. En 2001, existían más de 3,4 millones de etiquetas SAGE. Se pueden utilizar herramientas para mapear las etiquetas SAGE a clústeres UniGene , una base de datos que almacena transcriptomas. Esto permite una identificación más sencilla de la secuencia correspondiente a una etiqueta SAGE. Además, existen herramientas asociadas a SAGEmap: [ 10 ]
- El Northern digital se utiliza para medir el nivel de expresión de genes específicos, [ 1 ]
- SAGE Anatomic Viewer muestra esta información visualmente y la compara entre células normales y cancerosas.
- El visor de transcripciones de Ludwig (LT) muestra transcripciones alternativas y sus posibles etiquetas SAGE asociadas,
- La matriz de expresión mSAGE ( mSEM ) muestra los niveles de expresión genética a lo largo del desarrollo del ratón para diferentes tipos de tejido.
Buscador de genes
El CGAP localiza un gen o una lista de genes según criterios de búsqueda específicos y proporciona enlaces a diferentes bases de datos del NCI y el NCBI. Se puede buscar un gen específicamente mediante un identificador único, como símbolos genéticos y el número de gen Entrez, así como de forma general por función, tejido o palabra clave. [ 11 ]
Otras herramientas genéticas accesibles a través de la interfaz web de CGAP incluyen el Navegador de Ontología Génica (GO) y la herramienta BLAST de Nucleótidos.
Herramientas de expresión genética
cDNA xProfiler y cDNA Digital gene expression displayer (DGED) se utilizan conjuntamente para encontrar genes de interés estadísticamente significativos que se expresan diferencialmente dentro de dos grupos de bibliotecas de cDNA; normalmente se realiza una comparación entre tejidos normales y cancerosos. [ 12 ] La significación estadística la determina DGED utilizando una combinación de estadística bayesiana y una razón de probabilidades de secuencia para calcular una probabilidad. cDNA DGED se basa en la base de datos relacional UniGene, mientras que cDNA xProfilerUtiliza una base de datos de archivo plano que no está disponible en línea. [ 13 ]
Resultados y futuro
CGAP es ahora una ubicación centralizada para varias herramientas genómicas y bases de datos genéticas, y se utiliza ampliamente en la investigación del cáncer y la biología molecular. Las bases de datos establecidas por CGAP continúan contribuyendo al conocimiento de los cánceres en términos de sus vías y progresión. Las bases de datos de transcriptoma también se pueden utilizar en investigaciones no relacionadas con el cáncer, ya que contienen información que permite identificar de forma rápida y sencilla genes secuenciados específicos. Los datos también tienen un impacto clínico, ya que los ADNc se pueden utilizar para crear microarrays con fines de diagnóstico y comparación de tratamientos. CGAP se ha utilizado en muchos estudios, con ejemplos que incluyen: [ 1 ] [ 4 ]
- Caracterización de las diferencias en la expresión génica de células endoteliales normales y cancerosas [ 14 ]
- Identificación de la expresión génica irregular como marcadores de glioblastomas [ 15 ] y cáncer de ovario [ 16 ].
- Identificación de la expresión génica específica del tejido prostático [ 17 ]
- Comparación de proteínas expresadas en tejido reproductivo normal y canceroso [ 18 ]
Además, la gran cantidad de datos generados por CGAP ha impulsado la mejora de las técnicas de análisis y minería de datos, con ejemplos que incluyen: [ 1 ]
Véase también
Referencias
- 1 2 3 4 5 6 7 8 Riggins, GJ (2001). "Genoma y recursos genéticos del Proyecto de Anatomía del Genoma del Cáncer". Human Molecular Genetics . 10 (7): 663– 667. doi : 10.1093/hmg/10.7.663 . ISSN 1460-2083 . PMID 11257097 .
- 1 2 3 Strausberg, Robert L.; Buetow, Kenneth H.; Emmert-Buck, Michael R.; Klausner, Richard D. (2000). "The Cancer Genome Anatomy Project: building an annotated gene index". Trends in Genetics . 16 (3): 103– 106. doi : 10.1016/S0168-9525(99)01937-X . ISSN 0168-9525 . PMID 10689348 .
- 1 2 "Comprendiendo el cáncer" . Archivado del original el 5 de agosto de 2014. Consultado el 4 de septiembre de 2014 .
- 1 2 3 4 5 6 7 Krizman, David B.; Wagner, Lukas; Lash, Alex; Strausberg, Robert L.; Emmert-Buck, Michael R. (1999). "The Cancer Genome Anatomy Project: EST Sequencing and the Genetics of Cancer Progression" . Neoplasia . 1 ( 2): 101– 106. doi : 10.1038/sj.neo.7900002 . ISSN 1476-5586 . PMC 1508126. PMID 10933042 .
- ↑ Clifford, R. (2000). "Mapas genéticos/físicos basados en la expresión de polimorfismos de un solo nucleótido identificados por el Proyecto de Anatomía del Genoma del Cáncer" . Genome Research . 10 (8): 1259– 1265. doi : 10.1101/gr.10.8.1259 . ISSN 1088-9051 . PMC 310932. PMID 10958644 .
- 1 2 Clifford, Robert J.; Edmonson, Michael N.; Nguyen, Cu; Scherpbier, Titia; Hu, Ying; Buetow, Kenneth H. (2004). "Herramientas bioinformáticas para el descubrimiento y análisis de polimorfismos de un solo nucleótido". Anales de la Academia de Ciencias de Nueva York . 1020 ( 1): 101– 109. Bibcode : 2004NYASA1020..101C . doi : 10.1196/annals.1310.011 . ISSN 0077-8923 . PMID 15208187. S2CID 19088027 .
- 1 2 "El Proyecto de Aberración Cromosómica del Cáncer (CCAP)" . Consultado el 5 de septiembre de 2014 .
- ↑ "Todo acerca de los BAC mapeados con FISH" . Consultado el 7 de septiembre de 2014 .
- ↑ "Colección de genes de mamíferos" . Archivado del original el 25 de febrero de 2015. Consultado el 7 de septiembre de 2014 .
- ↑ "SAGE genie" . Consultado el 7 de septiembre de 2014 .
- ↑ "Gene Finder" . Consultado el 7 de septiembre de 2014 .
- ↑ "CGAP Cómo hacerlo: Herramientas" . Consultado el 7 de septiembre de 2014 .
- ↑ Milnthorpe, Andrew T; Soloviev, Mikhail (2011). "Errores en CGAP xProfiler y cDNA DGED: la importancia del análisis de bibliotecas y los algoritmos de selección de genes" . BMC Bioinformatics . 12 (1): 97. doi : 10.1186/1471-2105-12-97 . ISSN 1471-2105 . PMC 3094240. PMID 21496233 .
- ↑ Croix, B. St. (2000). "Genes expresados en el endotelio tumoral humano". Science . 289 (5482): 1197– 1202. Bibcode : 2000Sci...289.1197S . doi : 10.1126/science.289.5482.1197 . ISSN 0036-8075 . PMID 10947988 .
- ↑ Loging, WT (2000). "Identificación de posibles marcadores tumorales y antígenos mediante minería de bases de datos y cribado rápido de expresión" . Genome Research . 10 (9): 1393– 1402. doi : 10.1101/gr.138000 . ISSN 1088-9051 . PMC 310902. PMID 10984457 .
- ↑ CD Hough; CA Sherman-Baust; ES Pizer; FJ Montz; DD Im; NB Rosenshein; KR Cho; GJ Riggins; PJ Morin (noviembre de 2000). "Análisis serial a gran escala de la expresión génica revela genes expresados diferencialmente en el cáncer de ovario". Cancer Research . 60 (22): 6281– 6287. PMID 11103784 .
- ↑ G. Vasmatzis; M. Essand; U. Brinkmann; B. Lee; I. Pastan (enero de 1998). "Descubrimiento de tres genes expresados específicamente en la próstata humana mediante análisis de bases de datos de etiquetas de secuencias expresadas" . Actas de la Academia Nacional de Ciencias de los Estados Unidos de América . 95 (1): 300–304 . Bibcode : 1998PNAS...95..300V . doi : 10.1073/pnas.95.1.300 . PMC 18207. PMID 9419370 .
- ↑ U. Brinkmann; G. Vasmatzis; B. Lee; N. Yerushalmi; M. Essand; I. Pastan (septiembre de 1998). "PAGE-1, un gen similar a GAGE ligado al cromosoma X que se expresa en próstata, testículo y útero normales y neoplásicos" . Actas de la Academia Nacional de Ciencias de los Estados Unidos de América . 95 (18): 10757– 10762. Bibcode : 1998PNAS...9510757B . doi : 10.1073/pnas.95.18.10757 . PMC 27968. PMID 9724777 .
- ↑ DJ Stekel; Y. Git; F. Falciani (diciembre de 2000). "La comparación de la expresión génica de múltiples bibliotecas de ADNc" . Genome Research . 10 (12): 2055–2061 . doi : 10.1101/gr.gr-1325rr . PMC 313085. PMID 11116099 .
- ↑ Schmitt, AO; Specht, T.; Beckmann, G.; Dahl, E.; Pilarsky, CP; Hinzmann, B.; Rosenthal, A. (1999). "Exhaustive mining of EST libraries for genes differentially expressed in normal and tumour tissues" . Nucleic Acids Research . 27 (21): 4251– 4260. doi : 10.1093/nar/27.21.4251 . ISSN 0305-1048 . PMC 148701 . PMID 10518618 .
- ↑ VE Velculescu; SL Madden; L. Zhang; AE Latigazo; J. Yu; C. Rago; A. Lal; CJ Wang; GA Beaudry; KM Ciriello; cocinero de BP; Señor Dufault; EN Ferguson; Y. Gao; TC Él; H. Hermeking; SK Hiraldo; el primer ministro Hwang; MA López; HF Lüderer; B. Mateo; JM Petroziello; K. Polyak; L. Zawel; KW Kinzler (diciembre de 1999). "Análisis de transcriptomas humanos". Genética de la Naturaleza . 23 (4): 387– 388. doi : 10.1038/70487 . PMID 10581018 . S2CID 29173492 .
Enlaces externos
- Presentación de diapositivas de CGAP
- Catálogo de recursos de CGAP
- bases de datos del genoma del cáncer
- Organizaciones de genómica
- genética médica