Format FASTA
En bioinformática, el format FASTA és un format d'archiu informàtic basat en text, utilisat per a representar seqüències de nucleòtits o d'aminoàcits (constituents d'àcits nucleicos i proteïnes, respectivament), i en el que estos es representen usant còdics d'una única lletra.
El format també permet incloure noms de seqüències i comentaris que precedixen a les seqüències en sí.[1] Es va originar a partir del software d'alineamiento de seqüències FASTA, creat en 1985.[2][3] La simplicitat del format FASTA fa fàcil el manipular i analisar seqüències usant ferramentes de processat de texts i llenguages de guion com Python i PERL.
Format
[editar | editar còdic]Una seqüència baix format FASTA comença en una descripció en una única llínea (llínea de capçalera), seguida per llínees de senyes de seqüència. La llínea de descripció es distinguix de les senyes de seqüència per un símbol '>' (major que) en la primera columna. La paraula següent a este símbol és l'identificador de la seqüència, i el restant de la llínea és la descripció (abdós són opcionals). No deuria existir espai entre el '>' i la primera lletra de l'identificador. Es recomana que totes les llínees de text siguen menors de 80 caràcters. La seqüència termina si apareix una atra llínea començant en el símbol '>'; açò indica el començ d'una atra seqüència. Un eixemple simple d'una seqüència en el format FASTA pot ser:
>gi|5524211|gb|AAD44166.1| cytochrome b [Elephas maximus maximus]
LCLYTHIGRNIYYGSYLYSETWNTGIMLLLITMATAFMGYVLPWGQMSFWGATVITNLFSAIPYIGTNLV
EWIWGGFSVDKATLNRFFAFHFILPFTMVALAGVHLTFLHETGSNNPLGLTSDSDKIPFHPYYTIKDFLG
LLILILLLLLLALLSPDMLGDPDNHMPADPLNTPLHIKPEWYFLFAYAILRSVPNKLGGVLALFLSIVIL
GLMPFLHTSKHRSMMLRPLSQALFWTLTMDLLTLTWIGSQPVEYPYTIIGQMASILYFSIILAFLPIAGX
IENYLlínea de capçalera
[editar | editar còdic]La llínea de capçalera, que comença en '>', proporciona un nom i/o un identificador únic a la seqüència, i a sovint prou informació adicional. Molt diferents bases de senyes de seqüències usen capçaleres estandardisades, lo que ajuda a l'extracció automàtica d'informació des de la capçalera. La llínea de capçalera pot contindre més d'una capçalera, separades per un caràcter ^A (Control-A). En el format FASTA Pearson original, un o més comentaris, distinguits per un caràcter ';' (punt i menge) al començ de la llínea, podien aparéixer despuix de la capçalera. La majoria de les bases de senyes i aplicacions bioinformáticas no reconeixen tals comentaris i seguixen la especificació FASTA de el NCBI. Un eixemple d'archiu en una seqüència múltiple baix FASTA podria ser:
>SECUENCIA_1
MTEITAAMVKELRESTGAGMMDCKNALSETNGDFDKAVQLLREKGLGKAAKKADRLAAEG
LVSVKVSDDFTIAAMRPSYLSYEDLDMTFVENEYKALVAELEKENEERRRLKDPNKPEHK
IPQFASRKQLSDAILKEAEEKIKEELKAQGKPEKIWDNIIPGKMNSFIADNSQLDSKLTL
MGQFYVMDDKKTVEQVIAEKEKEFGGKIKIVEFICFEVGEGLEKKTEDFAAEVAAQL
>SECUENCIA_2
SATVSEINSETDFVAKNDQFIALTKDTTAHIQSNSLQSVEELHSSTINGVKFEEYLKSQI
ATIGENLVVRRFATLKAGANGVVNGYIHTNGRVGVVIAAACDSAEVASKSRDLLRQICMHRepresentació de la seqüència
[editar | editar còdic]Despuix de la llínea de capçalera i els comentaris, una o més llínees poden seguir per a descriure la seqüència: cada llínea d'una seqüència deuria tindre menys de 80 caràcters. Les seqüències poden correspondre a seqüències de proteïnes (estructura primària de les proteïnes) o d'àcits nucleicos, i poden contindre buits (en anglés, gaps) o caràcters d'alineamiento. Normalment s'espera que les seqüències es representen en els còdics estàndar IUB/IUPAC per a aminoàcits i àcits nucleicos, en les següents excepcions: s'accepten lletres minúscules, les quals es transformen en mayúscules; un únic guion o ralla pot usar-se per a representar un buit; i en seqüències d'aminoàcits, 'O' i '*' són caràcters acceptables (vore més avall). No s'admeten dígits numèrics, pero s'utilisen en algunes bases de senyes per a indicar la posició en la seqüència.[4][5][6]
Els còdics d'àcits nucleicos utilisats són:
| Còdic d'àcit nucleico | Significat |
|---|---|
| C | Citosina |
| G | Guanina |
| T | Timidina |
| O | Oracilo |
| R | G A (puRina) |
| I | T C (pirimidina/pIrimidine) |
| K | G T (cetona/Ketone) |
| M | A C (grup aMino) |
| S | G C (interacció forta/Strong interaction) |
| W | A T (interacció dèbil/Weak interaction) |
| B | G T C (no A) (B ve despuix de la A) |
| D | G A T (no C) (D ve despuix de la C) |
| H | A C T (no G) (H ve despuix de la G) |
| V | G C A (no T, no O) (V ve despuix de l'O) |
| N | A G C T (qualsevol/aNi) |
| X | caraça |
| - | buit (gap) de llongitut indeterminada |
Els còdics d'aminoàcits són:
| Còdic d'aminoàcit | Significat |
|---|---|
| B | Àcit aspártico o Asparagina |
| C | Cisteína |
| D | Àcit aspártico |
| I | Àcit glutámico |
| F | Fenilalanina |
| G | Glicina |
| H | Histidina |
| I | Isoleucina |
| K | Lisina |
| L | Leucina |
| M | Metionina |
| N | Asparagina |
| O | Pirrolisina |
| P | Prolina |
| Q | Glutamina |
| R | Arginina |
| S | Serina |
| T | Treonina |
| O | Selenocisteína |
| V | Valina |
| W | Triptófano |
| I | Tirosina |
| Z | Àcit glutámico o Glutamina |
| X | qualsevol |
| * | parada de traducció |
| - | buit (gap) de llongitut indeterminada |
Identificadors de seqüència
[editar | editar còdic]El NCBI va definir un estàndart per a l'identificador únic usat per a les seqüències (terme original en anglés, SeqID) en la llínea de capçalera. Paquets de software, com makeblastdb i table2asn, reconeixen automàticament els identificadors i la seua base de senyes d'orige, sempre que es corresponguen en els establits oficialment per el NCBI.[7][8][9]
| Tipo | Format/s | Eixemple/s |
|---|---|---|
| Local (ej.: sense referència a bases de senyes) | lcl&#;número entero
|
lcl&#;123
|
| Geninfo (backbone seqid)[nota 1] | bbs&#;número entero
|
bbs&#;123
|
| Geninfo (backbone moltype)[nota 2] | bbm&#;número entero
|
bbm&#;123
|
| Geninfo (import ID)[nota 3] | gim&#;número entero
|
gim&#;123
|
| GenBank | gb&#;identificació&#;locus
|
gb&#;M73307&#;AGMA13GT
|
| EMBL | emb&#;identificació&#;locus
|
emb&#;CAM43271.1&#;
|
| PIR | pir&#;identificació&#;nom
|
pir&#;&#;G36364
|
| Swiss-Prot | sp&#;identificació&#;nom
|
sp&#;P01013&#;OVAX_CHICK
|
| palés | pat&#;país&#;palés&#;número de seqüència
|
pat&#;US&#;RE33188&#;1
|
| palés preconcedida | pgp&#;country&#;número de solicitut&#;número de seqüència
|
pgp&#;EP&#;0238993&#;7
|
| RefSeq | ref&#;identificació&#;nom
|
ref&#;NM_010450.1&#;
|
| Referència general a qualsevol base de senyes
no present en esta llista |
gnl&#;base de senyes&#;número entero
|
gnl&#;taxon&#;9606
|
| Geninfo Integrated Database | gi&#;número entero
|
gi&#;21434723
|
| DDBJ | dbj&#;identificació&#;locus
|
dbj&#;BAC85684.1&#;
|
| PRF | prf&#;identificació&#;nom
|
prf&#;&#;0806162C
|
| PDB | pdb&#;identificació&#;cadena
|
pdb&#;1I4L&#;D
|
| Genbank (de tercers) | tpg&#;identificació&#;nom
|
tpg&#;BK003456&#;
|
| EMBL (de tercers) | tpe&#;identificació&#;nom
|
tpe&#;BN000123&#;
|
| DDBJ (de tercers) | tpd&#;identificació&#;nom
|
tpd&#;FAA00017&#;
|
| TrEMBL | tr&#;identificació&#;nom
|
tr&#;Q90RT2&#;Q90RT2_9HIV1
|
Extensions d'archiu
[editar | editar còdic]No hi ha una extensió d'archiu estàndar per a un ficher de text contenint seqüències formateadas en FASTA. La següent taula inclou les diferents extensions utilisades en archius FASTA en funció del seu contingut.
| Extensió | Us |
|---|---|
| .fasta, .fas, .fa | Qualsevol archiu FASTA |
| .fna | Archiu FASTA que conté seqüències de àcit nucleicos |
| .ffn | Conté seqüències de regions codificantes d'un genoma |
| .faa | Conté seqüències d'aminoàcits |
| .mpfa | Conté seqüències de múltiples proteïnes |
| .frn | Conté seqüències d'ARNs no codificantes (ej.: ARN ribosómico) |
Convertidors de format
[editar | editar còdic]Els archius FASTA poden ser convertits per lots a, o des de, el format MultiFASTA usant ferramentes lliures com FASTA to multi-FASTA converter i multi-FASTA to FASTA converter. També poden conseguir-se atres ferramentes lliures per a conversió per lots des de formats d'cromatograma (ABI/SCF) a FASTA: ABI2FASTA converter i Chromatogram explorer.
Format HUPO-PSI
[editar | editar còdic]Este format pretén resoldre prou problemes del format tradicional FASTA:
- Les llínees de definició varien àmpliament sense una bona raó. Açò causa problemes als usuaris finals que volen usar estos archius en ferramentes d'identificació de proteïnes. Els creadors d'estes ferramentes s'enfronten a un desafiu important: o be soportar totes estes variacions, o be permetre a l'usuari fer front a les mateixes.
- La mateixa base de senyes és processada en diferents motors de busca -> identificadors diferents -> dificultats per a mapear (P00761 vs. ALBU_HUMAN).
- La mateixa proteïna en diferents bases de senyes pot tindre identificadors molt diferents (P00761 vs gi|3446572|sp|p00761 vs. IPI:12345678).
- L'informació extreta dels formats FASTA és heterogénea, lo que provoca problemes d'anàlisis sintàctic.
- Descripció i disponibilitat de la taxonomia (noms lationos, noms comuns, TaxID de el NCBI=
Bloc de capçalera
[editar | editar còdic]Inclou informació sobre la/s base/s de senyes inclosa/s. Totes les llínees del bloc escomencen en el caràcter '#'. Un terme de capçalera de la llista següent per llínea:
| Térmens per a la capçalera | Descripció | Valor |
|---|---|---|
| DbComponent= | Increment en el conte | Sancer |
| Name= | Nom de la base de senyes | CV segons proveïdor de la base de senyes (UniprotKnowledgeBase) |
| PrimaryIdentifierType= | Identificador per a ser usat com a prefix per a entrades de proteïnes individuals | CV |
| Decoy= | ¿És una base de senyes enza? | ?: true/false or description |
| Version= | Versió de la base de senyes, d'acort al seu proveïdor | D'acort al proveïdor de la base de datosAccording to the database provider |
| ReleaseDate= | Data de la base de senyes font | |
| NumberOfEntries= | Número d'entrades | Sancer |
| Sequence_type= | Tipo de seqüència | DNA (ADN), AA, RNA (ARN), EST, etc. |
Eixemple de bloc capçalera:
Dbcomponent=1
Name=UniProt_SwissProt
PrimaryIdentifierType=sp_ac
Version=52.3
ReleaseDate=20070425
NumberOfEntries=248942
Sequence_type=Protein_sequence
Dbcomponent=2
Name=ENSEMBL
PrimaryIdentifierType=sp_ac
Version=12.45.3.2
ReleaseDate=20070425
NumberOfEntries=1234567
Sequence_type=Protein_sequenceLlínea de capçalera de seqüència
[editar | editar còdic]| Descripció de la llínea de capçalera de l'entrada individual | Eixemple |
|---|---|
| La capçalera escomença en >, seguit per la AC primària, precedida en el prefix de la base de senyes (útil si hi ha concatenades més d'una base de senyes). Camp obligatori. | >sp_ac|P000761 |
| Descripció de tota l'informació a banda de la seqüència erm=valor (els términosterms són descriptores de vocabulari controlat) | ID=ALBU_HUMAN |
| L'orde dels camps adicionals no és important | |
| Valor pot ser una llista. Els elements de la llista són representat com (valor_1)(valor_2) | ALTERNATE_AC=(P00786)(Q22222) |
| Valor pot estar entre " ", si és necessari | DE="Human serum albumin" |
| ' pot usar-se com separador para tots els camps individuals | MODRES=(1|Acetyl) |
| ¿Ctrl-A com separador per a entrades multi-capçalera? (Cas d'us NCBInr) | (Cas d'us NCBInr) |
| Terme de camp capçalera | Definició | Format |
|---|---|---|
| ALT_AC | AC alternativa | |
| ID | SwissProt_ID | |
| DE | Descripció de la proteïna | |
| ALT_DE | Descripció alternativa | |
| NCBITAXID | Identificador de taxonomia NCBI (9606) | Sancer |
| TAX_LATIN | Taxonomia en nom en llatí (Homo sapiens) | |
| TAX_COM | Taxonomia en format de nom comú (human) | |
| MODRES | Residu modificat (PTM) | (posició|modificació) (PSI_MOD) |
| VARIANT | Mutació de residu | (posició|residu original|residu final) |
Eixemple d'entrada de proteïna:
>sp_ac|P02769_WOSIG0 ID=ALBU_BOVIN DE="Serum albumin precursor (Allergen Bos d 6) (BSA)"NCBITAXID=9913 MODRES=(1|Acetyl) VARIANT=(196|A|T) LENGTH=589
RGVFRRDTHKSEIAHRFKDLGEEHFKGLVLIAFSQYLQQCPFDEHVKLVNELTEFAKTCV
ADESHAGCEKSLHTLFGDELCKVASLRETYGDMADCCEKQEPERNECFLSHKDDSPDLPK
LKPDPNTLCDEFKADEKKFWGKYLYEIARRHPYFYAPELLYYANKYNGVFQECCQAEDKG
ACLLPKIETMREKVLASSARQRLRCASIQKFGERALKAWSVARLSQKFPKAEFVEVTKLV
TDLTKVHKECCHGDLLECADDRADLAKYICDNQDTISSKLKECCDKPLLEKSHCIAEVEK
DAIPENLPPLTADFAEDKDVCKNYQEAKDAFLGSFLYEYSRRHPEYAVSVLLRLAKEYEA
TLEECCAKDDPHACYSTVFDKLKHLVDEPQNLIKQNCDQFEKLGEYGFQNALIVRYTRKV
PQVSTPTLVEVSRSLGKVGTRCCTKPESERMPCTEDYLSLILNRLCVLHEKTPVSEKVTK
CCTESLVNRRPCFSALTPDETYVPKAFDEKLFTFHADICTLPDTEKQIKKQTALVELLKH
KPKATEEQLKTVMENFVAFVDKCCAADDKEACFAVEGPKLVVSTQTALAReferències
[editar | editar còdic]- ↑ «FASTA Format for Nucleotide Sequences». www.ncbi.nlm.nih.gov. Archivat des d'el original, el 19 de febrer de 2024. Consultat el 2025-02-02.
- ↑ Science (New York, N.Y.).227(4693)
- 1435–1441.ISSN 0036-8075.doi:10.1126/science.2983426.Consultat el 2025-02-02.
- ↑ Proceedings of the National Academy of Sciences of the United States of America.85(8)
- 2444–2448.ISSN 0027-8424.doi:10.1073/pnas.85.8.2444.Consultat el 2025-02-02.
- ↑ Biochemistry.9(20)
- 4022–4027.ISSN 0006-2960.doi:10.1021/bi00822a023.Consultat el 2025-02-02.
- ↑ «Nomenclature and Symbolism for Amino Acids and Peptides. 3AA-1. Names of Common α-Amino Acids». iupac.qmul.ac.uk. Archivat des d'el original, el 26 de decembre de 2022. Consultat el 2025-02-02.
- ↑ «Abbreviations and Symbols for Nucleic Acids, Polynucleotides and their Constituents». iupac.qmul.ac.uk. Archivat des d'el original, el 13 de decembre de 2024. Consultat el 2025-02-02.
- ↑ Madden, Tom; Camacho, Christiam (2021-03-14). BLAST+ features (en en), National Center for Biotechnology Information (US).
- ↑ «Table C8: [Makeblastdb application options. This application....]» (en en). www.ncbi.nlm.nih.gov. Consultat el 2025-02-02.
- ↑ «NCBI C++ Toolkit Book». ncbi.github.io. Consultat el 2025-02-02.
- ↑ «GenBank: Sequence Identifiers» (en en). Consultat el 9 de febrer de 2025.
- ↑ 11,0 11,1 11,2 «NCBI ToolBox: Sequence Locations and Identifiers» (en en). Consultat el 9 de febrer de 2025.
- Este artícul conté una traducció derivada de «Formato FASTA» de Wikipedia en castellà publicada baix la Llicència de documentació lliure de GNU i la Llicència Creative Commons Reconeiximent-CompartirIgual 4.0 Internacional.
Erro en la cita: Existixen etiquetes <ref> per a un grup nomenat "nota", pero no es trobà una etiqueta <references group="nota"/>