Articulo de referencia

Familia de proteínas

La familia de ciclofilinas humanas , representada por las estructuras de los dominios isomerasa de algunos de sus miembros. Una familia de proteínas es un grupo de proteínas rel...

La familia de ciclofilinas humanas , representada por las estructuras de los dominios isomerasa de algunos de sus miembros.

Una familia de proteínas es un grupo de proteínas relacionadas evolutivamente . En muchos casos, una familia de proteínas tiene una familia de genes correspondiente , en la que cada gen codifica una proteína correspondiente con una relación 1:1. El término "familia de proteínas" no debe confundirse con " familia " tal como se usa en taxonomía.

Las proteínas de una familia descienden de un ancestro común y suelen tener estructuras tridimensionales , funciones y similitud de secuencia significativas similares . [ 1 ] [ 2 ] La similitud de secuencia (generalmente de aminoácidos) es uno de los indicadores más comunes de homología o ascendencia evolutiva común. [ 3 ] [ 4 ] Algunos marcos para evaluar la significancia de la similitud entre secuencias utilizan métodos de alineación de secuencias . Es poco probable que las proteínas que no comparten un ancestro común muestren una similitud de secuencia estadísticamente significativa, lo que convierte a la alineación de secuencias en una herramienta poderosa para identificar a los miembros de familias de proteínas. [ 3 ] [ 4 ] A veces, las familias se agrupan en clados más grandes llamados superfamilias en función de la similitud estructural, incluso si no hay homología de secuencia identificable.

Actualmente, se han definido más de 60.000 familias de proteínas, [ 5 ] aunque la ambigüedad en la definición de "familia de proteínas" lleva a diferentes investigadores a cifras muy variables.

Terminología y uso

El término familia de proteínas tiene un uso amplio y puede aplicarse a grandes grupos de proteínas con una similitud de secuencia apenas detectable, así como a grupos reducidos de proteínas con secuencia, función y estructura casi idénticas. Para distinguir entre estos casos, se utiliza una terminología jerárquica. En el nivel más alto de clasificación se encuentran las superfamilias de proteínas , que agrupan proteínas distantemente relacionadas, a menudo en función de su similitud estructural. [ 6 ] [ 7 ] [ 8 ] [ 9 ] A continuación están las familias de proteínas, que se refieren a proteínas con un origen evolutivo compartido exhibido por una similitud de secuencia significativa . [ 2 ] [ 10 ] Se pueden definir subfamilias dentro de las familias para denotar proteínas estrechamente relacionadas que tienen funciones similares o idénticas. [ 11 ] Por ejemplo, una superfamilia como el clan PA de proteasas tiene menos conservación de secuencia que la familia C04 dentro de ella.

Arriba, conservación de secuencia de 250 miembros de las proteasas del clan PA ( superfamilia ). Abajo, conservación de secuencia de 70 miembros de la familia de proteasas C04: las flechas indican residuos de la tríada catalítica , alineados en base a la estructura por DALI .

Dominios y motivos de proteínas

Las familias de proteínas se reconocieron por primera vez cuando la mayoría de las proteínas cuya estructura se comprendía eran pequeñas y de un solo dominio, como la mioglobina , la hemoglobina y el citocromo c . Desde entonces, se han descubierto muchas proteínas con múltiples unidades estructurales y funcionales independientes llamadas dominios . Debido a la reorganización evolutiva, los diferentes dominios de una proteína han evolucionado de forma independiente. Esto ha llevado a centrarse en las familias de dominios proteicos. Existen varios recursos en línea dedicados a la identificación y catalogación de estos dominios. [ 12 ] [ 13 ]

Different regions of a protein have differing functional constraints. For example, the active site of an enzyme requires certain amino-acid residues to be precisely oriented. A protein–protein binding interface may consist of a large surface with constraints on the hydrophobicity or polarity of the amino-acid residues. Functionally constrained regions of proteins evolve more slowly than unconstrained regions such as surface loops, giving rise to blocks of conserved sequence when the sequences of a protein family are compared (see multiple sequence alignment). These blocks are most commonly referred to as motifs, although many other terms are used (blocks, signatures, fingerprints, etc.). Several online resources are devoted to identifying and cataloging protein motifs.[14]

Evolution of protein families

According to current consensus, protein families arise in two ways. First, the separation of a parent species into two genetically isolated descendant species allows a gene/protein to independently accumulate variations (mutations) in these two lineages. This results in a family of orthologous proteins, usually with conserved sequence motifs. Second, a gene duplication may create a second copy of a gene (termed a paralog). Because the original gene is still able to perform its function, the duplicated gene is free to diverge and may acquire new functions (by random mutation).

Certain gene/protein families, especially in eukaryotes, undergo extreme expansions and contractions in the course of evolution, sometimes in concert with whole genome duplications. Expansions are less likely, and losses more likely, for intrinsically disordered proteins and for protein domains whose hydrophobic amino acids are further from the optimal degree of dispersion along the primary sequence.[15] This expansion and contraction of protein families is one of the salient features of genome evolution, but its importance and ramifications are currently unclear.

Phylogenetic tree of RAS superfamily: This tree was created using FigTree (free online software).

Use and importance of protein families

A medida que aumenta el número total de proteínas secuenciadas y crece el interés en el análisis del proteoma , se está trabajando para organizar las proteínas en familias y describir sus dominios y motivos componentes. La identificación fiable de familias de proteínas es fundamental para el análisis filogenético , la anotación funcional y la exploración de la diversidad de la función proteica en una rama filogenética determinada. La Iniciativa de Función Enzimática utiliza familias y superfamilias de proteínas como base para el desarrollo de una estrategia basada en secuencia/estructura para la asignación funcional a gran escala de enzimas de función desconocida. [ 16 ] Los métodos algorítmicos para establecer familias de proteínas a gran escala se basan en una noción de similitud.

Recursos de la familia de las proteínas

Muchas bases de datos biológicas catalogan familias de proteínas y permiten a los usuarios relacionar secuencias de consulta con familias conocidas. Estas incluyen:

  • Pfam - Base de datos de familias de proteínas con alineamientos y HMM
  • PROSITE - Base de datos de dominios, familias y sitios funcionales de proteínas
  • PIRSF - Sistema de Clasificación de Superfamilias
  • PASS2 - Alineación de proteínas como superfamilias estructurales v2 - PASS2@NCBS [ 17 ]
  • SUPERFAMILIA - Biblioteca de HMM que representan superfamilias y base de datos de anotaciones (de superfamilia y familia) para todos los organismos completamente secuenciados.
  • SCOP y CATH : clasificaciones de estructuras proteicas en superfamilias, familias y dominios.

Del mismo modo, existen muchos algoritmos de búsqueda en bases de datos, por ejemplo:

  • BLAST - Búsqueda de similitud de secuencias de ADN
  • BLASTp - Búsqueda de similitud de secuencias de proteínas
  • OrthoFinder - Método para agrupar proteínas en familias (ortogrupos) [ 18 ] [ 19 ]

Véase también

Familias de proteínas

Referencias

  1. "¿Qué son las familias de proteínas? Clasificación de proteínas" . EMBL-EBI . Consultado el 14 de noviembre de 2023 .
  2. 1 2 Orengo, Christine; Bateman, Alex (2013). «Introducción». En Orengo, Christine; Bateman, Alex (eds.). Familias de proteínas: Relación entre la secuencia, la estructura y la función de las proteínas . Hoboken, Nueva Jersey: John Wiley & Sons, Inc. pp. vii– xi. doi : 10.1002/9781118743089.fmatter . ISBN  978-1-118-74308-9.
  3. 1 2 Pearson, William R. (2013). "Una introducción a la búsqueda de similitud de secuencias ("homología")" . Current Protocols in Bioinformatics . 3 : 3.1.1–3.1.8. doi : 10.1002/0471250953.bi0301s42 . ISSN 1934-3396 . PMC 3820096. PMID 23749753 .   
  4. 1 2 Chen, Junjie; Guo, Mingyue; Wang, Xiaolong; Liu, Bin (2018-03-01). "Una revisión exhaustiva y una comparación de diferentes métodos computacionales para la detección de homología remota de proteínas". Briefings in Bioinformatics . 19 (2): 231– 244. doi : 10.1093/bib/bbw108 . ISSN 1477-4054 ​​. PMID 27881430 .  
  5. ^ Kunin, Víctor; Casos, Ildefonso; Bien, Antón J.; de Lorenzo, Víctor; Ouzounis, Christos A. (2003). "Innumerables familias de proteínas, y seguimos contando" . Biología del genoma . 4 (2): 401. doi : 10.1186/gb-2003-4-2-401 . ISSN 1474-760X . PMC 151299 . PMID 12620116 .   
  6. Dayhoff, MO (diciembre de 1974). "Análisis computacional de secuencias de proteínas". Federation Proceedings . 33 (12): 2314– 6. PMID 4435228 . 
  7. ^ Dayhoff, Missouri; McLaughlin, PJ; Barker, WC; Cazar, LT (1975). "Evolución de secuencias dentro de superfamilias de proteínas". Die Naturwissenschaften . 62 (4): 154– 161. Bibcode : 1975NW.....62..154D . doi : 10.1007/BF00608697 . S2CID 40304076 . 
  8. Dayhoff, MO (agosto de 1976). "El origen y la evolución de las superfamilias de proteínas". Federation Proceedings . 35 (10): 2132– 8. PMID 181273 . 
  9. Orengo, Christine A.; Thornton, Janet M. (1 de junio de 2005). "Familias de proteínas y su evolución: una perspectiva estructural" . Annual Review of Biochemistry . 74 (1): 867–900 . doi : 10.1146/annurev.biochem.74.082803.133029 . ISSN 0066-4154 . PMID 15954844 .  
  10. Veeramachaneni, Vamsi; Makałowski, Wojciech (2004). " Visualizing Sequence Similarity of Protein Families" . Genome Research . 14 (6): 1160– 1169. doi : 10.1101/gr.2079204 . ISSN 1088-9051 . PMC 419794. PMID 15140831 .   
  11. Holm, Liisa; Heger, Andreas (2013). «Enfoques automatizados basados ​​en secuencias para la identificación de familias de dominios». En Orengo, Christine; Bateman, Alex (eds.). Familias de proteínas: Relación entre secuencia, estructura y función de las proteínas . Hoboken, Nueva Jersey: John Wiley & Sons, Inc. pp. 1–24 . doi : 10.1002/9781118743089.ch1 . ISBN  978-1-118-74308-9. S2CID 85641264 . 
  12. Wang, Yan; Zhang, Hang; Zhong, Haolin; Xue, Zhidong (2021-01-01). "Métodos de identificación de dominios proteicos y recursos en línea" . Computational and Structural Biotechnology Journal . 19 : 1145–1153 . doi : 10.1016/j.csbj.2021.01.041 . ISSN 2001-0370 . PMC 7895673. PMID 33680357 .   
  13. Bateman, Alex (2013). «Clasificación de secuencias de familias de proteínas: Pfam y otros recursos». En Orengo, Christine; Bateman, Alex (eds.). Familias de proteínas: Relación entre secuencia, estructura y función de las proteínas . Hoboken, Nueva Jersey: John Wiley & Sons, Inc. pp. 25–36 . doi : 10.1002/9781118743089.ch2 . ISBN  978-1-118-74308-9.
  14. Mulder, Nicola J.; Apweiler, Rolf (19 de diciembre de 2001). "Herramientas y recursos para identificar familias de proteínas, dominios y motivos" . Genome Biology . 3 (1): reviews2001.1. doi : 10.1186/gb-2001-3-1-reviews2001 . ISSN 1474-760X . PMC 150457. PMID 11806833 .   
  15. James, Jennifer E; Nelson, Paul G; Masel, Joanna (4 de abril de 2023). "La retención diferencial de dominios Pfam contribuye a las tendencias evolutivas a largo plazo" . Biología molecular y evolución . 40 (4) msad073. doi : 10.1093/molbev/msad073 . PMC 10089649. PMID 36947137 .  
  16. Gerlt, John A.; Allen, Karen N.; Almo, Steven C.; Armstrong, Richard N.; Babbitt, Patricia C.; Cronan, John E.; Dunaway-Mariano, Debra; Imker, Heidi J.; Jacobson, Matthew P.; Minor, Wladek; Poulter, C. Dale; Raushel, Frank M.; Sali, Andrej; Shoichet, Brian K.; Sweedler, Jonathan V. (2011-11-22). "The Enzyme Function Initiative" . Biochemistry . 50 ( 46): 9950– 9962. doi : 10.1021/bi201312u . ISSN 0006-2960 . PMC 3238057. PMID 21999478 .   
  17. Gandhimathi, A.; Nair, Anu G.; Sowdhamini, R. (2012). "PASS2 versión 4: Una actualización de la base de datos de alineamientos de secuencias basados ​​en la estructura de superfamilias de dominios estructurales" . Nucleic Acids Research . 40 (D1): D531– D534. doi : 10.1093/nar/gkr1096 . ISSN 1362-4962 . PMC 3245109. PMID 22123743 .   
  18. Emms, David M.; Kelly, Steven (2015-08-06). "OrthoFinder: La solución de sesgos fundamentales en comparaciones de genomas completos mejora drásticamente la precisión de la inferencia de ortogrupos" . Genome Biology . 16 (1): 157. doi : 10.1186/s13059-015-0721-2 . ISSN 1474-760X . PMC 4531804. PMID 26243257 .   
  19. Emms, David M.; Kelly, Steven (14 de noviembre de 2019). "OrthoFinder: Inferencia de ortología filogenética para genómica comparativa" . Genome Biology . 20 (1): 238. doi : 10.1186/s13059-019-1832-y . ISSN 1474-760X . PMC 6857279. PMID 31727128 .   
  • Logotipo de Wikimedia CommonsContenido multimedia relacionado con las familias de proteínas en Wikimedia Commons.