SMILES

En química, Simplified Molecular Input Line Entry System (sistema d'introducció llineal molecular simplificada o SMILES) és una especificació per a descriure sense ambigüitats l'estructura d'una molècula usant cadenas ASCII curtes. Les cadenes SMILES poden ser importades per la majoria d'editors moleculars per a la seua conversió en dibuixos bidimensionalés o models tridimensionalés de les molècules.
L'especificació original de SMILES va ser desenrollada per Arthur Weininger i David Weininger a fins de la década de 1980. Ha segut modificada i estesa per uns atres, destacant Daylight Chemical Information Systems Inc. En 2007 va ser desenrollat un estàndart obert cridat "OpenSMILES" per la comunitat de química de còdic obert Blue Obelisk. Atres notacions llineals inclouen a la notació llineal Wiswesser (WLN), ROSDAL i SLN (Tripos Inc.)
En agost de 2006, l'IUPAC va introduir l'InChI com un estàndart per a la representació d'estructures moleculars. Sol considerar-se que SMILES té la ventaja de ser més inteligible a la llectura humana que el InChI; també té una base més àmplia de soport de software fonamentats en teoria de grafos.
Terminologia
[editar | editar còdic]El terme SMILES es referix a una notació llineal per a codificar estructures moleculars, mentres que les instàncies específiques deurien cridar-se cadenes SMILES. No obstant, el terme SMILES també s'usa comunament per a referir-se, tant a una sola cadena SMILES com a un número de cadenes SMILES, i el significat exacte es fa evident a partir del context. Els térmens canònic i isomérico poden dur a alguna confusió quan s'apliquen a SMILES. Els térmens descriuen atributs diferents de les cadenes SMILES i no són mútuament excloents.
Generalment es pot escriure un número de cadenes SMILES igualment vàlides per a una molècula. Per eixemple, CCO, OCC i C(O)C especifiquen per igual al etanol. S'han desenrollat algoritmes per a assegurar que es genera la mateixa cadena SMILES per a una molècula, sense importar l'orde dels àtoms en l'estructura. Esta cadena SMILES és única per a cada estructura, encara que és depenent de l'algoritme de "canonicalización" usat per a generar-ho, i es denomina SMILES canònic. Estos algoritmes convertixen primer el SMILES a una representació interna de l'estructura molecular i no simplement manipulen les cadenes com es pensa algunes voltes. Els algoritmes per a generar SMILES canònics varen ser desenrollats en Daylight Chemical Information Systems, OpenEye Scientific Software i Chemical Computing Group. Una aplicació comuna dels SMILES canònics és per a l'indexat i per a assegurar l'unicitat de les molècules en una base de senyes.
La notació SMILES permet l'especificació d'estereoisómeros. Estes característiques estructures no poden ser especificades solament per mig de conectivitat, aixina que les cadenes SMILES que codifiquen esta informació es denominen SMILES isoméricos. Una característica notable d'estes regles és que permeten l'especificació parcial rigorosa de la quiralidad. El terme "SMILES isomérico" també se sol aplicar a les cadenes SMILES en les quals s'especifiquen isòtops.
Eixemples
[editar | editar còdic]Àtoms
[editar | editar còdic]Els àtoms estan representats per l'abreviatura estàndar de cada element químic, entre corchetes, tals com [Au] per al or. Els corchetes poden ser omesos per a "subconjunts orgànics" de B, C, N, O, P, S, F, Cl, Br, i I. Tots els demés elements deuen estar tancats en corchetes. Si els corchetes són omesos, s'assumix el número propi d'àtoms d'hidrogen implícits; per eixemple, la cadena SMILES per al aigua és simplement O.
Un àtom que du una o vàries càrrega(s) elèctrica(s) és tancat en corchetes (qualsevol que siga), seguit del símbol H si és lligat a un o varis àtom(s) d'hidrogen (estos són llavors seguits del seu número, excepto si no cal un: NH4 per al amoni), després del signe '+' per a una càrrega positiva, o del signe '-' per a una càrrega negativa. El número de les càrregues és llavors especificat despuix del signe (excepto si no cal un); no obstant, és aixina possible d'escriure el signe de la(s) càrrega(s) tantes voltes que el ion té d'ella(s): en lloc de "Tu+4", poden molt ben escriure "Tu++++" (Titano IV, Tu4+). Aixina, l'anión hidròxit és representat per [OH-], el catión oxonio per [OH3+], i el catión cobalt III (Co3+) per [Co+3] o per [Co+++].
Enllaços
[editar | editar còdic]S'assumix que els enllaços entre àtoms d'alifáticos són simples, llevat que s'especifique lo contrari, i estan implicats per adyacencia en les cadenes SMILES. Per eixemple, la cadena SMILES per al etanol pot ser escrita com CCO. Les etiquetes de tancament d'anells poden usar-se per a indicar conectivitat entre àtoms no adjacents en la cadena SMILES, lo que per al ciclohexano i el dioxano és C1CCCCC1 i O1CCOCC1 respectivament. En un segon cicle, l'etiqueta serà 2 (naftaleno: c1cccc2c1cccc2); més allà de 9, és menester afegir el signe '%' davant l'etiqueta, a fi de diferenciar-la de dos etiquetes distintes lligats al mateix àtom (C12 significarà que l'àtom de carbono du les enllaces de tancament d'anells 1 i 2, encara que C%12 indicarà una sola etiqueta, la 12). Els enllaços dobles i triples poden ser representats pels símbols '=' i '#' respectivament, com s'ilustra en la cadena SMILES O=C=O (diòxit de carbono) i CN (cianur d'hidrogen).
Aromaticidad
[editar | editar còdic]Els àtoms aromàtics C, O, S i N es representen per la seua lletra minúscula 'c', 'o', 's' i 'n' respectivament. El benceno, la piridina i el furano poden ser representats per les cadenes SMILES c1ccccc1, n1ccccc1 i o1cccc1, respectivament. Els enllaços entre àtoms aromàtics són, per defecte, aromàtics, encara que poden explicitar-se usant el símbol ':'. Els àtoms aromàtics poden estar units per enllaç simple a uns atres, en lo que el bifenilo pot ser representat per c1ccccc1-c2ccccc2. L'àtom de nitrogen aromàtic unit a l'hidrogen, com es troba en el pirrol deu ser presentat per [nH], i l'imidazol s'escriu en la notació SMILES n1c[nH]cc1.
Els algoritmes de Daylight i OpenEye per a generar cadenes SMILES canòniques diferixen en el seu tractament de la aromaticidad.
Ramificacions
[editar | editar còdic]Les ramificacions es descriuen en paréntesis, com en CCC(=O)O per al àcit propiónico, i C(F)(F)F per al fluoroformo. Els anells substituïts poden ser escrits en el punt de ramificació en l'anell, com s'ilustra en les cadenes SMILES COc(c1)cccc1CN (vore representació) i COc(cc1)ccc1CN (vore representació), que codifiquen els isòmers 3-cianoanisol i 4-cianoanisol. En escriure les cadenes SMILES per a anells substituïts en esta forma es poden fer-les més llegibles.
Estereoquímica
[editar | editar còdic]La configuració dels enllaços dobles s'especifica usant els caràcters "/" i "". Per eixemple, F/C=C/F (vore representació) és una representació del I-difluoroeteno, en el que els àtoms de flúor estan en costats oposts de l'enllaç doble, mentres que F/C=CF (vore representació) és una representació possible para Z-difluoroeteno, en el que els àtoms de flúor estan al mateix costat del doble enllaç, com es mostra en la figura.
La configuració de l'àtom de carbono tetraèdric s'especifica per mig de o . La L-alanina, l'enantiómero més comú del aminoàcit alanina, pot escriure's com a N[CH](C)C(=O)O (vore representació). L'especificador indica que, quan es veu des de l'àtom de nitrogen a lo llarc de l'enllaç al centre quiral, la seqüència de sustituyentes d'hidrogen (H), metilo (C) i carboxilato (C(=O)O) apareix en sentit horari. La D-alanina pot ser escrita com a N[CH](C)C(=O)O (vore representació). L'orde dels sustituyentes en la cadena SMILES és molt important, i la D-alanina pot ser codificada com a N[CH](C(=O)O)C (vore representació).
Isòtops
[editar | editar còdic]Els isòtops s'especifiquen en un número igual a l'número de l'isòtop precedint al símbol de l'àtoms. El benceno, en el que un àtom de carbono estiguera substituït per carbono-14, s'escriu com [14c]1ccccc1, i el deuteriocloroformo és [2H]C(Cl)(Cl)Cl.
Aplicació
[editar | editar còdic]| Molècula | Estructura | Cadena SMILES |
|---|---|---|
| Dinitrógeno | N≡N | NN |
| Isocianato de metilo (MIC) | CH3–N=C=O | CN=C=O |
| Sulfat de coure (II) | Cu2+ SO42- | [Cu+2].[O-]S(=O)(=O)[O-] |
| Enantotoxina (C17H22O2) | CCC[CH](O)CCC=CC=CC#CCCC=CCO | |
| Piretrina II (C21H28O5) | Estructura molecular de la piretrina II | COC(=O)C(C)=CC1C(C)(C)[CH]1C(=O)O[CH]2C(C)=C(C(=O)C2)CC=CC=C |
| Aflatoxina B1 (C17H12O6) | Estructura molecular de la aflatoxina B1 | O1C=C[CH]([CH]1O2)c3c2cc(OC)c4c3OC(=O)C5=C4CCC(=O)5 |
| Glucosa (glucopyranosa) (C6H12O6) | Estructura molecular de la glucopyranosa | OC[CH](O1)[CH](O)[CH](O)[CH](O)[CH](O)1 |
| Cuscutina àlies Bergenin (resina) (C14H16O9) | OC[CH](O1)[CH](O)[CH](O)[CH]2[CH]1c3c(O)c(OC)c(O)cc3C(=O)O2 | |
| Una feromona de la cochinilla californiana | CC(=O)OCCC(/C)=CC[CH](C(C)=C)CCC=C | |
| 2S,5R-Chalcogran: feromona del barrenillo Pityogenes chalcographus[1] | CC[CH](O1)CC[C]12CCCO2 | |
| Vanilina | O=Cc1ccc(O)c(OC)c1 | |
| Melatonina (C13H16N2O2) | Erro al crear miniatura: | CC(=O)NCCC1=CNc2c1cc(OC)cc2 |
| Flavopereirina (C17H15N2) | Estructura molecular de la flavopereirina | CCc(c1)ccc2[n+]1ccc3c2Nc4c3cccc4 |
| Nicotina (C10H14N2) | Estructura molecular de la nicotina | CN1CCC[CH]1c2cccnc2 |
| α-tujona (C10H16O) | Estructura molecular de la tujona | CC(C)[C]12C[CH]1[CH](C)C(=O)C2 |
| Tiamina (C12H17N4OS+) (vitamine B1) |
Estructura molecular de la tiamina | OCCc1c(C)[n+](=cs1)Cc2cnc(C)nc(N)2 |
Ilustració en una molècula de més de 9 cicles, la Cefalostatina-1[2] (molècula esteroidica de fòrmula empírica C54H74N2O10 eixida d'un cuc marí de la família de les Hydrophiloidea, Cephalodiscus gilchristi):
Estructura molecular de la cefalostatina-1
Donarà, partint del radical metilo més a l'esquerra en la figura:
C[C](C)(O1)C[CH](O)[C]1(O2)[CH](C)[CH]3CC=C4[C]3(C2)C(=O)C[CH]5[CH]4CC[CH](C6)[C]5(C)Cc(n7)c6nc(C[C]89(C))c7C[CH]8CC[CH]%10[CH]9C[CH](O)[C]%11(C)C%10=C[CH](O%12)[C]%11(O)[CH](C)[C]%12(O%13)[CH](O)C[C]%13(C)CO
(Noteu els '%' davant de l'índex de les etiquetes de tancament d'anells superior a 9, referir-se a la secció "Enllaços", més alt).
Atres eixemples de SMILES
[editar | editar còdic]La notació SMILES està descrita extensament en el SMILES theory manual proveït per Daylight Chemical Information Systems i estan presents una cantitat important d'eixemples ilustrativos. La depict utility de Daylight proveïx als usuaris en els mijos de comprovar els seus propis eixemples de SMILES i és una valiosa ferramenta educacional.
Referències
[editar | editar còdic]- Este artícul conté una traducció derivada de «SMILES» de Wikipedia en castellà publicada baix la Llicència de documentació lliure de GNU i la Llicència Creative Commons Reconeiximent-CompartirIgual 4.0 Internacional.