RefSeq
RefSeq (de The Reference Sequence en Inglés) és la base de senyes pública de seqüències de àcit nucleicos (ADN i ARN) i proteïnes, anotades i curades, del Centre Nacional per a l'Informació Biotecnológica (NCBI).[1] RefSeq va començar a funcionar en l'any 2000[2][3] i, a diferència de GenBank, solament oferix un registre per cada biomolécula, ya siga ADN, ARN o proteïna, per als organismes més rellevants des de virus fins a bactèries i eucariota. Per a cada organisme modele, RefSeq guarda registres separats i enllaçats per a el ADN genómico, els transcritos i les proteïnes resultants d'estos. Esta base de senyes està llimitada als organismes més importants, per als que hi ha disponible la suficient informació (121 461 organismes diferents a data de juliol de 2022),[4] mentres que GenBank inclou seqüències per a qualsevol organisme pujat a la base de senyes (aproximadament 504 000 espècies formalment descrites).[5]
Categories de senyes
[editar | editar còdic]RefSeq inclou diferents tipos de senyes, en diferents orígens, per lo que és necessari establir categories i identificadors per a cada u. Les categories més importants en RefSeq són:
| Categoria | Descripció |
|---|---|
| NC | Regions genómicas completes |
| NG | Regions genómicas incompletes |
| NM | ARNm |
| NR | ARNnc |
| NP | Proteïna |
| XM | Model d'ARNm (predicció) |
| XR | Model d'ARNnc (predicció) |
| XP | Model de proteïna (predicció de seqüències eucariota) |
| WP | Model de proteïna (predicció de seqüències procariota) |
Per a més detalls i més categories, es pot consultar la Taula 1 en el Capítul 18 del manual d'us de la base de senyes RefSeq.[6]
Proyectes
[editar | editar còdic]Varis proyectes per a millorar els servicis de RefSeq es troben actualment en desenroll per el NCBI, freqüentment en colaboració en atres centres d'investigació com el EMBL-EBI:
- Consensus CDS (CCDS): Este proyecte té com a objectiu l'identificació del conjunt central de regions codificantes de proteïnes en humans i rates estandardisar gens en una anotació genómica consistent i d'alta calitat. Este proyecte va ser anunciat en 2009 i actualment seguix en desenroll.[7][8]
- RefSeq Functional Elements (RefSeqFE): Se centra en descriure elements funcionals que siguen regions reguladors no codificantes: enhancers, silenciadors, regions de hipersensibilidad a la DNasa I, orígens de replicació de el ADN etc.). L'alcanç d'este proyecte està actualment restringit als genomes humà i murino.[9]
- RefSeqGene: El principal objectiu és definir seqüències genómicas per a ser usades com a estàndars de referència de gens altament caracterisats. Seqüències de ARNm, proteïnes i cromosomes prèviament descrites tenen la desventaja de no incloure coordenades genómicas de gens propencs i regions intrónicas de manera explícita, aixina com mostrar coordenades anormalment grans i en canvis pels canvis introduïts per les successives versions publicades del genoma de referència. El proyecte RefSeqGene pretén eliminar estos errors.[10]
- Targeted Loci: Este proyecte recopila marcadors moleculars, especialment loci d'ARN ribosómico i codificantes de proteïnes, els quals són utilisats para anàlisis filogenético i identificació d'espècies. L'alcanç d'este proyecte inclou seqüències d'Archaea, Bactèria i Fungi, accessibles via consulta en Entrez i BLAST. També inclou seqüències de GenBank para Animals, Plantes i Protistas, accessibles via consulta en BLAST.[11]
- Virus Variation (ViV): Es tracta d'un repositori específic de pipelines i ferramentes d'anàlisis de senyes per a obtindre i visualisar seqüències de diferents grups virals com Influenzavirus, ebolavirus, coronavirus MERS-CoV o el virus del Zika. S'afigen nous virus, pipelines, ferramentes i més funcionalitats al proyecte regularment.[12]
- RefSeq Select: Este proyecte busca seleccionar conjunts de senyes de transcritos (denominats RefSeq Select), que siguen els més representatius de cada gen codificante de proteïnes segons múltiples criteris: us previ en bases de senyes clíniques, expressió del transcrito, regió conservada evolutivamente etc. Molts gens en RefSeq són representats per múltiples transcritos/proteïnes pel procés biològic del splicing alternatiu. Este nivell de complexitat és problemàtic per a estudis de genómica comparativa o anàlisis de variants genètiques d'interés clínic.[13]
- MANE (Matched Annotation from the NCBI and IMBL-EBI): És un proyecte colaboratiu entre el NCBI i EMBL-EBI, el principal proyecte del qual és definir un conjunt de transcritos i les seues proteïnes per a tots els gens codificantes de proteïnes en el genoma humà. Es busca reduir les diferències entre els sistemes d'anotació de RefSeq i Ensembl/GENCODE. En este proyecte s'identifiquen una série de transcritos MANE Select com a estàndarts universals per a estudis clínics i de genómica comparativa i evolutiva. Un segon de transcritos MANE Plus Clinical també s'identifiquen com transcritos adicionals per a reportar variants clíniques "patogénicas" (P) o "provablement patogénicas" (LP) disponibles en bases de senyes públiques. Este proyecte va ser anunciat en 2018 i s'espera que finalise en 2022.[14]
Referències
[editar | editar còdic]- ↑ Nucleic Acids Research.33(Database issue)
- D501–504.ISSN 1362-4962.doi:10.1093/nar/gki025.Consultat el 2022-07-22.
- ↑ Nucleic Acids Research.28(1)
- 126–128.ISSN 0305-1048.doi:10.1093/nar/28.1.126.Consultat el 2022-07-22.
- ↑ Trends in Genetics.16(1)
- 44–47.ISSN 0168-9525.doi:10.1016/S0168-9525(99)01882-X.Consultat el 2022-07-22.
- ↑ «RefSeq Release 213 Statistics (Report)». ftp.ncbi.nlm.nih.gov. Consultat el 2022-07-22.
- ↑ Nucleic Acids Research.50(D1)
- D161–D164.ISSN 0305-1048.doi:10.1093/nar/gkab1135.Consultat el 2022-07-22.
- ↑ Pruitt, Kim; Brown, Garth; Tatusova, {{{nom3}}}; Maglott, {{{nom4}}} (2012-04-06). The Reference Sequence (RefSeq) Database (en en), National Center for Biotechnology Information (US).
- ↑ Genome Research.19(7)
- 1316–1323.ISSN 1088-9051.doi:10.1101/gr.080531.108.Consultat el 2022-07-31.
- ↑ Nucleic Acids Research.46(D1)
- D221–D228.ISSN 0305-1048.doi:10.1093/nar/gkx1031.Consultat el 2022-07-31.
- ↑ Genome Research.32(1)
- 175–188.ISSN 1088-9051.doi:10.1101/gr.275819.121.Consultat el 2022-07-31.
- ↑ Archives of Pathology & Laboratory Medicine.131(6)
- 852–863.ISSN 0003-9985.doi:10.5858/2007-131-852-CLRIMP.Consultat el 2022-07-31.
- ↑ «NCBI RefSeq Targeted Loci Project» (en anglés). www.ncbi.nlm.nih.gov. Consultat el 2022-07-31.
- ↑ Nucleic Acids Research.45(D1)
- D482–D490.ISSN 0305-1048.doi:10.1093/nar/gkw1065.Consultat el 2022-07-31.
- ↑ «NCBI RefSeq Select» (en anglés). www.ncbi.nlm.nih.gov. Consultat el 2022-07-31.
- ↑ Nature.604(7905)
- 310–315.ISSN 1476-4687.doi:10.1038/s41586-022-04558-8.Consultat el 2022-07-31.
- Este artícul conté una traducció derivada de «RefSeq» de Wikipedia en castellà publicada baix la Llicència de documentació lliure de GNU i la Llicència Creative Commons Reconeiximent-CompartirIgual 4.0 Internacional.