Base de senyes biològica
Una base de senyes biològica és una colecció d'informació sobre ciències de la vida, recollida d'experiments científics, lliteratura publicada, tecnologia d'experimentació d'alt rendiment, i anàlisis computacional.[1] Conté informació d'àrees d'investigació incloent genómica, proteómica, metabolómica, expressió gènica per mig de microarrays, i filogenético.[2] L'informació continguda en bases de senyes biològiques inclou funcions, estructura i localisació (tant celular com a cromosòmica) de gens i efectes clínics de mutacions, aixina com similituts de seqüències i estructures biològiques.
En els últims anys, per la ràpida evolució de les tècniques experimentals d'alt rendiment (Seqüenciació de el ADN, Cristalografia de rajos X, Microarreglo de ADN) es va generar un creiximent exponencial en la cantitat de senyes biològiques (seqüències genómicas i de proteïnes, estructures de proteïnes, expressió gènica, mutacions, etc) que varen generar la necessitat de contar en formes eficients d'almagasenar l'informació.
Descripció
[editar | editar còdic]Les bases de senyes biològiques constituïxen una ferramenta essencial per a almagasenar, estructurar, organisar, actualisar i manipular senyes biològiques. La varietat d'estos senyes, aixina com també el seu ràpit creiximent, fan a les bases de senyes una ferramenta clau. S'han convertit en un instrument indispensable per als científics experimentals del camp de la biologia, com per a aquells científics de l'àrea de la bioinformática que desenrollen experiments in silico.
Les bases de senyes biològiques sorgixen a partir dels conceptes de bases de senyes relacionals de les ciències de la computació, i els conceptes de recuperació d'informació de les biblioteques digitals. El disseny d'estes bases de senyes, el seu desenroll i la seua gestió a llarc determini, formen un àrea nuclear dins de la bioinformática.[3] El contingut de les senyes inclou seqüències gèniques, descripcions textuals, atributs i classificacions ontològiques, estructures de proteïnes, anotacions, entre unes atres. Estos són descrits a sovint com a senyes semi-estructurades, i es poden representar com a taules, registres delimitats per claus i estructures XML. Són comuns les referències creuades entre les diferents bases de senyes biològiques usant els números d'accés (identificadors únics dels registres en una base de senyes, o també coneguts com Clau primària).
Les bases de senyes para ajuden als científics a comprendre i explicar una série de fenomens biològics des de l'estructura biomolecular d'una proteïna i la seua interacció, fins al metabolisme complet dels organismes i a la comprensió de l'evolució de les espècies.
Un recurs important per a la busca de bases de senyes biològiques és l'edició anual de la revista Nucleic Acids Research (NAR). Una edició de bases de senyes en NAR està disponible gratuïtament tots els anys, a on es publiquen noves base de senyes i algunes actualisacions de les ya conegudes. Es troben classificades d'acort a la seua temàtica i estan en llínea a disposició de tota la comunitat científica.
Classificació de bases de senyes biològiques
[editar | editar còdic]Les bases de senyes biològiques s'han desenrollat per a diversos propòsits, almagasenen varis tipos de senyes heterogénees i són curades a distints nivells en diferents métodos, per lo tant hi ha diferents criteris per a la seua classificació.[4][5]
Alcanç i cobertura de les senyes
[editar | editar còdic]Segons este criteri, les bases de senyes poden classificar-se en exhaustives o especialisades:
- Exhaustives: comprenen diferents tipos de senyes de moltes espècies. Eixemples típics són GenBank la base de senyes moleculars mantingudes pel European Bioinformatics Institute European Molecular Biology Laboratory (EMBL-EBI) i DNA Data Bank of Japan (DDJB). Estes tres bases de senyes varen ser establides com una Colaboració Internacional de Bases de Senyes de Seqüències de Nucleòtits en 1988, per a colectar i compartir seqüències d'ADN i ARN
- Especialisades: contenen informació específica o d'espècies particulars. Per eixemple WormBase que conté informació biològica i genómica de nemátodos.
Segons la font de les senyes
[editar | editar còdic]D'acort a este criteri, les bases de senyes poden classificar-se com a primàries, secundàries i combinades:
- Primàries: Contenen informació solament de la seqüència o l'estructura, és dir que les senyes experimentals són directament pujats a la base de senyes. En esta categoria trobem les bases de senyes GenBank, DNA Data Bank of Japan (DDJB)], UniProtKB/TrEMBL i Protein Data Bank (PDB)
- Secundàries: Contenen informació derivada de les bases de senyes primàries. Una base de senyes secundària de seqüència conté informació de la conservació de la seqüència, patrons de seqüència i residus del lloc actiu de famílies de proteïnes derivats de alineamientos múltiples entre seqüències evolutivamente relacionades. Una base de senyes secundària d'estructures organisa les entrades de PDB classificant-les, per eixemple, d'acort a la seua estructura com totes alfa, totes beta, alfa-beta, etc. Alguns eixemples d'estes bases de senyes són: CATH i SCOP
- Compostes: combinen una varietat de fonts primàries de senyes, com per eixemple, el National Center for Biotechnology Information (NCBI) que alberga un conjunt de bases de senyes de seqüència, taxonomia, genomes, mutacions, entre unes atres i ademés ferramentes com BLAST per a busques per similitut de seqüència.
Nivell de curació
[editar | editar còdic]D'acort al nivell de curació, poden classificar-se en bases de senyes primàries, secundàries o derivades:
- Primàries: contenen senyes “crues” a modo de repositori d'archius com NCBI Sequence Read Archive (SRA)
- Secundàries o derivades: almagasena informació que té un valor agregat per ser curada, per eixemple NCBI RefSeq
Método de conservació
[editar | editar còdic]El creiximent explosiu de la cantitat de senyes disponibles requerix de curació, integració i anotació, que es conseguix per mig de la colaboració colectiva. Des d'este punt de vista, les bases de senyes biològiques poden classificar-se com:
- Conservades per experts, per eixemple RefSeq i The Arabidopsis Information Resource (TAIR)
- Conservades per una comunitat d'investigadors, de forma colectiva i colaborativa, per eixemple LncRNA Wiki i GeneWiki
Tipo de senyes almagasenades
[editar | editar còdic]D'acort al tipo de senyes almagasenades en cada base de senyes, les bases de senyes biològiques poden classificar-se de forma genèrica en alguna de les següents categories (es llisten alguns eixemples de bases de senyes): Seqüències nucleotídicas (ADN i ARN): la colaboració de les tres bases de senyes més importants fa possible accedir a casi tota l'informació de seqüències de nucleòtits des de qualsevol de les seues tres sèus
Bases de senyes de EMBL en el European Bioinformatics Institute (EMBL-EBI). Enllaç extern base de senyes de nucleòtits de EMBL-EBI
DNA Data Bank of Japan (DDJB). Enllaç extern DDJB
GenBank en el National Center for Biological Information (NCBI). Enllaç extern GenBank
Si be són mantingudes per distints organismes en distints països, existix una coordinació entre les distintes bases. Una seqüència enviada a qualsevol de les bases es vorà reflectida en les atres dos en aproximadament una semana, ya que eixa és la freqüència d'actualisació entre les distintes bases genètiques. Per este motiu és indistint que base s'use per a enviar noves seqüències, encara que normalment els europeus utilisen EMBL i els americans GenBank.
- Proteïnes: bases de senyes de seqüències, estructures, i informació relacionada
UniProtKB/Swiss-Prot conté seqüències anotades o comentades, és dir, cada seqüència ha segut revisada, documentada i enllaçada a atres bases de senyes. Enllaços externs UniProtKB, Swissprot en el EBI UniProtKB/TrEMBL per Translation of EMBL Nucleotide Sequence Database inclou la traducció de totes les seqüències codificantes derivades del (EMBL) i que encara no han pogut ser anotades en Swiss-Prot. Enllaços externs TrEMBL, UniProtKB 'PIR per Protein Information Resource està dividida en quatre sub-bases que tenen un nivell d'anotació decreixent. Enllaç extern PIR
'ENZYME enllaça la classificació d'activitats enzimàtiques completa a les seqüències de Swiss-Prot. Enllaç extern ENZYME
'PROSITE conté informació sobre l'estructura secundària de proteïnes, famílies, dominis, etc. Enllaç extern PROSITE
'InterPro integra l'informació de diverses bases de senyes d'estructura secundària com PROSITE, proporcionant enllaços a atres bases de senyes i informació més extensa. Enllaç extern INTERPRO
'Protein Data Bank (PDB) és la base de senyes d'estructura terciaria 3D de proteïnes que han segut cristalizadas. Enllaç extern PDB
El portal d'EMBL-EBI oferix una varietat de bases de senyes d'expressió gènica. Enllaç extern a bases de senyes d'expressió de EMBL-EBI
- Interactomas, reactomas i rutes metabòliques
Reactome és una base de senyes curada i revisada d'EMBL-EBI de rutes d'interacció i reacció de proteïnes i enzimes. Enllaç extern a Reactome
APID[6] és una base de senyes d'interaccions proteïna-proteïna que inclou interactomas complets per a múltiples espècies. Enllaç extern a APID
Variació genètica (SNPs) i malaltia
dbSNP de NCBI, oferix un repositori central de variacions genètiques que comprenen substitucions simples de nucleòtits i polimorfisme d'insercions i deleciones curtes. Enllaç a dbSNP
COSMIC és un catàlec de mutacions somàtiques en càncer, mantinguda pel Wellcome Trust Sanger Institute. Enllaç extern a COSMIC
'OMIM per Online Mendelian Inheritance in Man és un catàlec de gens humans relacionats en desórdens genètics. Enllaç extern OMIM
Lliteratura
Pubmed dona accés gratuït a l'índex de publicacions de la Biblioteca Nacional de Medicina (NLM), en enllaços a artículs complets. Enllaç extern PubMed
Ontologia
El proyecte d'Ontologia Gènica (GO) és un esforç colaboratiu que va sorgir de la necessitat de tindre descriptores consistents dels productes de gens depositats en distintes bases de senyes. Enllaç extern a Gene Ontology Consortium
Ensembl integra genomes eucariota grans, pel moment conté genoma humà, rata, rata, fugu, zebrafish, mosquit, Drosophila, C. elegans, i C. briggsae. Enllaç extern Ensembl
Genomes server i TIGR són portals en informació o enllaços de tots els genomes secuenciados pel moment, des de virus a humans. Enllaç extern Genome Server, enllaç extern TIGR
Wormbase és el portal del genoma de cuc C. elegans. Enllaç extern Wormbase
Flybase és el portal de la mosca de la fruta Drosophila melanogaster. Enllaç extern Flybase
- Unes atres
Taxonomy és el portal de classificació taxonómica d'organismes. Enllaç extern Taxonomy Browser
Xenobase és el portal de l'organisme modele Xenopus laevis. Enllaç extern: Xenbase
TAIR (The Arabidopsis Information Resource) és el portal de la planta modele Arabidopsis thaliana. Enllaç extern Arabidopsis
GYPSY, base de senyes d'elements genètics mòvils. Enllaç extern The GYPSY Database of Mobile Genetic Elements
Referències
[editar | editar còdic]- ↑ Attwood T.K., Gisel A., Eriksson N-E. and Bongcam-Rudloff E.. «Concepts, Historical Milestones and the Central Plau of Bioinformatics in Modern Biology: A European Perspective». Bioinformatics - Trends and Methodologies. InTech. Archivat des d'el original, el 25 de giner de 2012. Consultat el 8 de giner de 2012.
- ↑ Altman RB5(1)
- 4–5.
- ↑ Bourne P1(3)
- 179–81.doi:10.1371/journal.pcbi.0010034.
- ↑ Genomics, Proteomics & Bioinformatics.13(1)
- 55-63.ISSN 2210-3244.doi:10.1016/j.gpb.2015.01.006.Consultat el 4 de decembre de 2015.
- ↑ «Copia archivada». Archivat des d'el original, el 4 de març de 2016. Consultat el 5 de decembre de 2015.
- ↑ Nucleic Acids Research.
- gkw363.ISSN 0305-1048.doi:10.1093/nar/gkw363.Consultat el 25 de maig de 2016.
- Este artícul conté una traducció derivada de «Base de datos biológica» de Wikipedia en castellà publicada baix la Llicència de documentació lliure de GNU i la Llicència Creative Commons Reconeiximent-CompartirIgual 4.0 Internacional.