Anar al contingut

RefSeq

De L'Enciclopèdia, la wikipedia en valencià

RefSeq (de The Reference Sequence en Inglés) és la base de senyes pública de seqüències de àcit nucleicos (ADN i ARN) i proteïnes, anotades i curades, del Centre Nacional per a l'Informació Biotecnológica (NCBI).[1] RefSeq va començar a funcionar en l'any 2000[2][3] i, a diferència de GenBank, solament oferix un registre per cada biomolécula, ya siga ADN, ARN o proteïna, per als organismes més rellevants des de virus fins a bactèries i eucariota. Per a cada organisme modele, RefSeq guarda registres separats i enllaçats per a el ADN genómico, els transcritos i les proteïnes resultants d'estos. Esta base de senyes està llimitada als organismes més importants, per als que hi ha disponible la suficient informació (121 461 organismes diferents a data de juliol de 2022),[4] mentres que GenBank inclou seqüències per a qualsevol organisme pujat a la base de senyes (aproximadament 504 000 espècies formalment descrites).[5]

Categories de senyes

[editar | editar còdic]

RefSeq inclou diferents tipos de senyes, en diferents orígens, per lo que és necessari establir categories i identificadors per a cada u. Les categories més importants en RefSeq són:

Categoria Descripció
NC Regions genómicas completes
NG Regions genómicas incompletes
NM ARNm
NR ARNnc
NP Proteïna
XM Model d'ARNm (predicció)
XR Model d'ARNnc (predicció)
XP Model de proteïna (predicció de seqüències eucariota)
WP Model de proteïna (predicció de seqüències procariota)

Per a més detalls i més categories, es pot consultar la Taula 1 en el Capítul 18 del manual d'us de la base de senyes RefSeq.[6]

Proyectes

[editar | editar còdic]

Varis proyectes per a millorar els servicis de RefSeq es troben actualment en desenroll per el NCBI, freqüentment en colaboració en atres centres d'investigació com el EMBL-EBI:

  • Consensus CDS (CCDS): Este proyecte té com a objectiu l'identificació del conjunt central de regions codificantes de proteïnes en humans i rates estandardisar gens en una anotació genómica consistent i d'alta calitat. Este proyecte va ser anunciat en 2009 i actualment seguix en desenroll.[7][8]
  • RefSeq Functional Elements (RefSeqFE): Se centra en descriure elements funcionals que siguen regions reguladors no codificantes: enhancers, silenciadors, regions de hipersensibilidad a la DNasa I, orígens de replicació de el ADN etc.). L'alcanç d'este proyecte està actualment restringit als genomes humà i murino.[9]
  • RefSeqGene: El principal objectiu és definir seqüències genómicas per a ser usades com a estàndars de referència de gens altament caracterisats. Seqüències de ARNm, proteïnes i cromosomes prèviament descrites tenen la desventaja de no incloure coordenades genómicas de gens propencs i regions intrónicas de manera explícita, aixina com mostrar coordenades anormalment grans i en canvis pels canvis introduïts per les successives versions publicades del genoma de referència. El proyecte RefSeqGene pretén eliminar estos errors.[10]
  • Targeted Loci: Este proyecte recopila marcadors moleculars, especialment loci d'ARN ribosómico i codificantes de proteïnes, els quals són utilisats para anàlisis filogenético i identificació d'espècies. L'alcanç d'este proyecte inclou seqüències d'Archaea, Bactèria i Fungi, accessibles via consulta en Entrez i BLAST. També inclou seqüències de GenBank para Animals, Plantes i Protistas, accessibles via consulta en BLAST.[11]
  • Virus Variation (ViV): Es tracta d'un repositori específic de pipelines i ferramentes d'anàlisis de senyes per a obtindre i visualisar seqüències de diferents grups virals com Influenzavirus, ebolavirus, coronavirus MERS-CoV o el virus del Zika. S'afigen nous virus, pipelines, ferramentes i més funcionalitats al proyecte regularment.[12]
  • RefSeq Select: Este proyecte busca seleccionar conjunts de senyes de transcritos (denominats RefSeq Select), que siguen els més representatius de cada gen codificante de proteïnes segons múltiples criteris: us previ en bases de senyes clíniques, expressió del transcrito, regió conservada evolutivamente etc. Molts gens en RefSeq són representats per múltiples transcritos/proteïnes pel procés biològic del splicing alternatiu. Este nivell de complexitat és problemàtic per a estudis de genómica comparativa o anàlisis de variants genètiques d'interés clínic.[13]
  • MANE (Matched Annotation from the NCBI and IMBL-EBI): És un proyecte colaboratiu entre el NCBI i EMBL-EBI, el principal proyecte del qual és definir un conjunt de transcritos i les seues proteïnes per a tots els gens codificantes de proteïnes en el genoma humà. Es busca reduir les diferències entre els sistemes d'anotació de RefSeq i Ensembl/GENCODE. En este proyecte s'identifiquen una série de transcritos MANE Select com a estàndarts universals per a estudis clínics i de genómica comparativa i evolutiva. Un segon de transcritos MANE Plus Clinical també s'identifiquen com transcritos adicionals per a reportar variants clíniques "patogénicas" (P) o "provablement patogénicas" (LP) disponibles en bases de senyes públiques. Este proyecte va ser anunciat en 2018 i s'espera que finalise en 2022.[14]


Referències

[editar | editar còdic]
  1. Nucleic Acids Research.33(Database issue)
    D501–504.ISSN 1362-4962.doi:10.1093/nar/gki025.Consultat el 2022-07-22.
  2. Nucleic Acids Research.28(1)
    126–128.ISSN 0305-1048.doi:10.1093/nar/28.1.126.Consultat el 2022-07-22.
  3. Trends in Genetics.16(1)
    44–47.ISSN 0168-9525.doi:10.1016/S0168-9525(99)01882-X.Consultat el 2022-07-22.
  4. «RefSeq Release 213 Statistics (Report)». ftp.ncbi.nlm.nih.gov. Consultat el 2022-07-22.
  5. Nucleic Acids Research.50(D1)
    D161–D164.ISSN 0305-1048.doi:10.1093/nar/gkab1135.Consultat el 2022-07-22.
  6. Pruitt, Kim; Brown, Garth; Tatusova, {{{nom3}}}; Maglott, {{{nom4}}} (2012-04-06). The Reference Sequence (RefSeq) Database (en en), National Center for Biotechnology Information (US).
  7. Genome Research.19(7)
    1316–1323.ISSN 1088-9051.doi:10.1101/gr.080531.108.Consultat el 2022-07-31.
  8. Nucleic Acids Research.46(D1)
    D221–D228.ISSN 0305-1048.doi:10.1093/nar/gkx1031.Consultat el 2022-07-31.
  9. Genome Research.32(1)
    175–188.ISSN 1088-9051.doi:10.1101/gr.275819.121.Consultat el 2022-07-31.
  10. Archives of Pathology & Laboratory Medicine.131(6)
    852–863.ISSN 0003-9985.doi:10.5858/2007-131-852-CLRIMP.Consultat el 2022-07-31.
  11. «NCBI RefSeq Targeted Loci Project» (en anglés). www.ncbi.nlm.nih.gov. Consultat el 2022-07-31.
  12. Nucleic Acids Research.45(D1)
    D482–D490.ISSN 0305-1048.doi:10.1093/nar/gkw1065.Consultat el 2022-07-31.
  13. «NCBI RefSeq Select» (en anglés). www.ncbi.nlm.nih.gov. Consultat el 2022-07-31.
  14. Nature.604(7905)
    310–315.ISSN 1476-4687.doi:10.1038/s41586-022-04558-8.Consultat el 2022-07-31.