Anar al contingut

Format FASTA

De L'Enciclopèdia, la wikipedia en valencià

En bioinformática, el format FASTA és un format d'archiu informàtic basat en text, utilisat per a representar seqüències de nucleòtits o d'aminoàcits (constituents d'àcits nucleicos i proteïnes, respectivament), i en el que estos es representen usant còdics d'una única lletra.

El format també permet incloure noms de seqüències i comentaris que precedixen a les seqüències en sí.[1] Es va originar a partir del software d'alineamiento de seqüències FASTA, creat en 1985.[2][3] La simplicitat del format FASTA fa fàcil el manipular i analisar seqüències usant ferramentes de processat de texts i llenguages de guion com Python i PERL.

Una seqüència baix format FASTA comença en una descripció en una única llínea (llínea de capçalera), seguida per llínees de senyes de seqüència. La llínea de descripció es distinguix de les senyes de seqüència per un símbol '>' (major que) en la primera columna. La paraula següent a este símbol és l'identificador de la seqüència, i el restant de la llínea és la descripció (abdós són opcionals). No deuria existir espai entre el '>' i la primera lletra de l'identificador. Es recomana que totes les llínees de text siguen menors de 80 caràcters. La seqüència termina si apareix una atra llínea començant en el símbol '>'; açò indica el començ d'una atra seqüència. Un eixemple simple d'una seqüència en el format FASTA pot ser:

>gi|5524211|gb|AAD44166.1| cytochrome b [Elephas maximus maximus]
 LCLYTHIGRNIYYGSYLYSETWNTGIMLLLITMATAFMGYVLPWGQMSFWGATVITNLFSAIPYIGTNLV
 EWIWGGFSVDKATLNRFFAFHFILPFTMVALAGVHLTFLHETGSNNPLGLTSDSDKIPFHPYYTIKDFLG
 LLILILLLLLLALLSPDMLGDPDNHMPADPLNTPLHIKPEWYFLFAYAILRSVPNKLGGVLALFLSIVIL
 GLMPFLHTSKHRSMMLRPLSQALFWTLTMDLLTLTWIGSQPVEYPYTIIGQMASILYFSIILAFLPIAGX
 IENY

Llínea de capçalera

[editar | editar còdic]

La llínea de capçalera, que comença en '>', proporciona un nom i/o un identificador únic a la seqüència, i a sovint prou informació adicional. Molt diferents bases de senyes de seqüències usen capçaleres estandardisades, lo que ajuda a l'extracció automàtica d'informació des de la capçalera. La llínea de capçalera pot contindre més d'una capçalera, separades per un caràcter ^A (Control-A). En el format FASTA Pearson original, un o més comentaris, distinguits per un caràcter ';' (punt i menge) al començ de la llínea, podien aparéixer despuix de la capçalera. La majoria de les bases de senyes i aplicacions bioinformáticas no reconeixen tals comentaris i seguixen la especificació FASTA de el NCBI. Un eixemple d'archiu en una seqüència múltiple baix FASTA podria ser:

>SECUENCIA_1
MTEITAAMVKELRESTGAGMMDCKNALSETNGDFDKAVQLLREKGLGKAAKKADRLAAEG
LVSVKVSDDFTIAAMRPSYLSYEDLDMTFVENEYKALVAELEKENEERRRLKDPNKPEHK
IPQFASRKQLSDAILKEAEEKIKEELKAQGKPEKIWDNIIPGKMNSFIADNSQLDSKLTL
MGQFYVMDDKKTVEQVIAEKEKEFGGKIKIVEFICFEVGEGLEKKTEDFAAEVAAQL
>SECUENCIA_2
SATVSEINSETDFVAKNDQFIALTKDTTAHIQSNSLQSVEELHSSTINGVKFEEYLKSQI
ATIGENLVVRRFATLKAGANGVVNGYIHTNGRVGVVIAAACDSAEVASKSRDLLRQICMH

Representació de la seqüència

[editar | editar còdic]

Despuix de la llínea de capçalera i els comentaris, una o més llínees poden seguir per a descriure la seqüència: cada llínea d'una seqüència deuria tindre menys de 80 caràcters. Les seqüències poden correspondre a seqüències de proteïnes (estructura primària de les proteïnes) o d'àcits nucleicos, i poden contindre buits (en anglés, gaps) o caràcters d'alineamiento. Normalment s'espera que les seqüències es representen en els còdics estàndar IUB/IUPAC per a aminoàcits i àcits nucleicos, en les següents excepcions: s'accepten lletres minúscules, les quals es transformen en mayúscules; un únic guion o ralla pot usar-se per a representar un buit; i en seqüències d'aminoàcits, 'O' i '*' són caràcters acceptables (vore més avall). No s'admeten dígits numèrics, pero s'utilisen en algunes bases de senyes per a indicar la posició en la seqüència.[4][5][6]

Els còdics d'àcits nucleicos utilisats són:

Còdic d'àcit nucleico Significat

Adenosina

C Citosina
G Guanina
T Timidina
O Oracilo
R G A (puRina)
I T C (pirimidina/pIrimidine)
K G T (cetona/Ketone)
M A C (grup aMino)
S G C (interacció forta/Strong interaction)
W A T (interacció dèbil/Weak interaction)
B G T C (no A) (B ve despuix de la A)
D G A T (no C) (D ve despuix de la C)
H A C T (no G) (H ve despuix de la G)
V G C A (no T, no O) (V ve despuix de l'O)
N A G C T (qualsevol/aNi)
X caraça
- buit (gap) de llongitut indeterminada

Els còdics d'aminoàcits són:

Còdic d'aminoàcit Significat

Alanina

B Àcit aspártico o Asparagina
C Cisteína
D Àcit aspártico
I Àcit glutámico
F Fenilalanina
G Glicina
H Histidina
I Isoleucina
K Lisina
L Leucina
M Metionina
N Asparagina
O Pirrolisina
P Prolina
Q Glutamina
R Arginina
S Serina
T Treonina
O Selenocisteína
V Valina
W Triptófano
I Tirosina
Z Àcit glutámico o Glutamina
X qualsevol
* parada de traducció
- buit (gap) de llongitut indeterminada

Identificadors de seqüència

[editar | editar còdic]

El NCBI va definir un estàndart per a l'identificador únic usat per a les seqüències (terme original en anglés, SeqID) en la llínea de capçalera. Paquets de software, com makeblastdb i table2asn, reconeixen automàticament els identificadors i la seua base de senyes d'orige, sempre que es corresponguen en els establits oficialment per el NCBI.[7][8][9]

Tipo Format/s Eixemple/s
Local (ej.: sense referència a bases de senyes) lcl&#;número entero

lcl&#;seqüència de caràcters

lcl&#;123

lcl&#;hmm271

Geninfo (backbone seqid)[nota 1] bbs&#;número entero bbs&#;123
Geninfo (backbone moltype)[nota 2] bbm&#;número entero bbm&#;123
Geninfo (import ID)[nota 3] gim&#;número entero gim&#;123
GenBank gb&#;identificació&#;locus gb&#;M73307&#;AGMA13GT
EMBL emb&#;identificació&#;locus emb&#;CAM43271.1&#;
PIR pir&#;identificació&#;nom pir&#;&#;G36364
Swiss-Prot sp&#;identificació&#;nom sp&#;P01013&#;OVAX_CHICK
palés pat&#;país&#;palés&#;número de seqüència pat&#;US&#;RE33188&#;1
palés preconcedida pgp&#;country&#;número de solicitut&#;número de seqüència pgp&#;EP&#;0238993&#;7
RefSeq ref&#;identificació&#;nom ref&#;NM_010450.1&#;
Referència general a qualsevol base de senyes

no present en esta llista

gnl&#;base de senyes&#;número entero

gnl&#;base de senyes&#;seqüència de caràcters

gnl&#;taxon&#;9606

gnl&#;PID&#;i1632

Geninfo Integrated Database gi&#;número entero gi&#;21434723
DDBJ dbj&#;identificació&#;locus dbj&#;BAC85684.1&#;
PRF prf&#;identificació&#;nom prf&#;&#;0806162C
PDB pdb&#;identificació&#;cadena pdb&#;1I4L&#;D
Genbank (de tercers) tpg&#;identificació&#;nom tpg&#;BK003456&#;
EMBL (de tercers) tpe&#;identificació&#;nom tpe&#;BN000123&#;
DDBJ (de tercers) tpd&#;identificació&#;nom tpd&#;FAA00017&#;
TrEMBL tr&#;identificació&#;nom tr&#;Q90RT2&#;Q90RT2_9HIV1

Extensions d'archiu

[editar | editar còdic]

No hi ha una extensió d'archiu estàndar per a un ficher de text contenint seqüències formateadas en FASTA. La següent taula inclou les diferents extensions utilisades en archius FASTA en funció del seu contingut.

Extensió Us
.fasta, .fas, .fa Qualsevol archiu FASTA
.fna Archiu FASTA que conté seqüències de àcit nucleicos
.ffn Conté seqüències de regions codificantes d'un genoma
.faa Conté seqüències d'aminoàcits
.mpfa Conté seqüències de múltiples proteïnes
.frn Conté seqüències d'ARNs no codificantes (ej.: ARN ribosómico)

Convertidors de format

[editar | editar còdic]

Els archius FASTA poden ser convertits per lots a, o des de, el format MultiFASTA usant ferramentes lliures com FASTA to multi-FASTA converter i multi-FASTA to FASTA converter. També poden conseguir-se atres ferramentes lliures per a conversió per lots des de formats d'cromatograma (ABI/SCF) a FASTA: ABI2FASTA converter i Chromatogram explorer.

Format HUPO-PSI

[editar | editar còdic]

Este format pretén resoldre prou problemes del format tradicional FASTA:

  • Les llínees de definició varien àmpliament sense una bona raó. Açò causa problemes als usuaris finals que volen usar estos archius en ferramentes d'identificació de proteïnes. Els creadors d'estes ferramentes s'enfronten a un desafiu important: o be soportar totes estes variacions, o be permetre a l'usuari fer front a les mateixes.
  • La mateixa base de senyes és processada en diferents motors de busca -> identificadors diferents -> dificultats per a mapear (P00761 vs. ALBU_HUMAN).
  • La mateixa proteïna en diferents bases de senyes pot tindre identificadors molt diferents (P00761 vs gi|3446572|sp|p00761 vs. IPI:12345678).
  • L'informació extreta dels formats FASTA és heterogénea, lo que provoca problemes d'anàlisis sintàctic.
  • Descripció i disponibilitat de la taxonomia (noms lationos, noms comuns, TaxID de el NCBI=

Bloc de capçalera

[editar | editar còdic]

Inclou informació sobre la/s base/s de senyes inclosa/s. Totes les llínees del bloc escomencen en el caràcter '#'. Un terme de capçalera de la llista següent per llínea:

Térmens per a la capçalera Descripció Valor
DbComponent= Increment en el conte Sancer
Name= Nom de la base de senyes CV segons proveïdor de la base de senyes (UniprotKnowledgeBase)
PrimaryIdentifierType= Identificador per a ser usat com a prefix per a entrades de proteïnes individuals CV
Decoy= ¿És una base de senyes enza? ?: true/false or description
Version= Versió de la base de senyes, d'acort al seu proveïdor D'acort al proveïdor de la base de datosAccording to the database provider
ReleaseDate= Data de la base de senyes font
NumberOfEntries= Número d'entrades Sancer
Sequence_type= Tipo de seqüència DNA (ADN), AA, RNA (ARN), EST, etc.

Eixemple de bloc capçalera:

 Dbcomponent=1
 Name=UniProt_SwissProt
 PrimaryIdentifierType=sp_ac
 Version=52.3
 ReleaseDate=20070425
 NumberOfEntries=248942
 Sequence_type=Protein_sequence
 
 Dbcomponent=2
 Name=ENSEMBL
 PrimaryIdentifierType=sp_ac
 Version=12.45.3.2
 ReleaseDate=20070425
 NumberOfEntries=1234567
 Sequence_type=Protein_sequence

Llínea de capçalera de seqüència

[editar | editar còdic]
Descripció de la llínea de capçalera de l'entrada individual Eixemple
La capçalera escomença en >, seguit per la AC primària, precedida en el prefix de la base de senyes (útil si hi ha concatenades més d'una base de senyes). Camp obligatori. >sp_ac|P000761
Descripció de tota l'informació a banda de la seqüència erm=valor (els términosterms són descriptores de vocabulari controlat) ID=ALBU_HUMAN
L'orde dels camps adicionals no és important
Valor pot ser una llista. Els elements de la llista són representat com (valor_1)(valor_2) ALTERNATE_AC=(P00786)(Q22222)
Valor pot estar entre " ", si és necessari DE="Human serum albumin"
' pot usar-se com separador para tots els camps individuals MODRES=(1|Acetyl)
¿Ctrl-A com separador per a entrades multi-capçalera? (Cas d'us NCBInr) (Cas d'us NCBInr)
Terme de camp capçalera Definició Format
ALT_AC AC alternativa
ID SwissProt_ID
DE Descripció de la proteïna
ALT_DE Descripció alternativa
NCBITAXID Identificador de taxonomia NCBI (9606) Sancer
TAX_LATIN Taxonomia en nom en llatí (Homo sapiens)
TAX_COM Taxonomia en format de nom comú (human)
MODRES Residu modificat (PTM) (posició|modificació) (PSI_MOD)
VARIANT Mutació de residu (posició|residu original|residu final)

Eixemple d'entrada de proteïna:

 >sp_ac|P02769_WOSIG0 ID=ALBU_BOVIN DE="Serum albumin precursor (Allergen Bos d 6) (BSA)"NCBITAXID=9913 MODRES=(1|Acetyl) VARIANT=(196|A|T) LENGTH=589
 RGVFRRDTHKSEIAHRFKDLGEEHFKGLVLIAFSQYLQQCPFDEHVKLVNELTEFAKTCV
 ADESHAGCEKSLHTLFGDELCKVASLRETYGDMADCCEKQEPERNECFLSHKDDSPDLPK
 LKPDPNTLCDEFKADEKKFWGKYLYEIARRHPYFYAPELLYYANKYNGVFQECCQAEDKG
 ACLLPKIETMREKVLASSARQRLRCASIQKFGERALKAWSVARLSQKFPKAEFVEVTKLV
 TDLTKVHKECCHGDLLECADDRADLAKYICDNQDTISSKLKECCDKPLLEKSHCIAEVEK
 DAIPENLPPLTADFAEDKDVCKNYQEAKDAFLGSFLYEYSRRHPEYAVSVLLRLAKEYEA
 TLEECCAKDDPHACYSTVFDKLKHLVDEPQNLIKQNCDQFEKLGEYGFQNALIVRYTRKV
 PQVSTPTLVEVSRSLGKVGTRCCTKPESERMPCTEDYLSLILNRLCVLHEKTPVSEKVTK
 CCTESLVNRRPCFSALTPDETYVPKAFDEKLFTFHADICTLPDTEKQIKKQTALVELLKH
 KPKATEEQLKTVMENFVAFVDKCCAADDKEACFAVEGPKLVVSTQTALA

Referències

[editar | editar còdic]
  1. «FASTA Format for Nucleotide Sequences». www.ncbi.nlm.nih.gov. Archivat des d'el original, el 19 de febrer de 2024. Consultat el 2025-02-02.
  2. Science (New York, N.Y.).227(4693)
    1435–1441.ISSN 0036-8075.doi:10.1126/science.2983426.Consultat el 2025-02-02.
  3. Proceedings of the National Academy of Sciences of the United States of America.85(8)
    2444–2448.ISSN 0027-8424.doi:10.1073/pnas.85.8.2444.Consultat el 2025-02-02.
  4. Biochemistry.9(20)
    4022–4027.ISSN 0006-2960.doi:10.1021/bi00822a023.Consultat el 2025-02-02.
  5. «Nomenclature and Symbolism for Amino Acids and Peptides. 3AA-1. Names of Common α-Amino Acids». iupac.qmul.ac.uk. Archivat des d'el original, el 26 de decembre de 2022. Consultat el 2025-02-02.
  6. «Abbreviations and Symbols for Nucleic Acids, Polynucleotides and their Constituents». iupac.qmul.ac.uk. Archivat des d'el original, el 13 de decembre de 2024. Consultat el 2025-02-02.
  7. Madden, Tom; Camacho, Christiam (2021-03-14). BLAST+ features (en en), National Center for Biotechnology Information (US).
  8. «Table C8: [Makeblastdb application options. This application....]» (en en). www.ncbi.nlm.nih.gov. Consultat el 2025-02-02.
  9. «NCBI C++ Toolkit Book». ncbi.github.io. Consultat el 2025-02-02.
  10. «GenBank: Sequence Identifiers» (en en). Consultat el 9 de febrer de 2025.
  11. 11,0 11,1 11,2 «NCBI ToolBox: Sequence Locations and Identifiers» (en en). Consultat el 9 de febrer de 2025.


Erro en la cita: Existixen etiquetes <ref> per a un grup nomenat "nota", pero no es trobà una etiqueta <references group="nota"/>