Anar al contingut

Programa Automatizado de Juí de Similitut

De L'Enciclopèdia, la wikipedia en valencià

El Programa Automatizado de Juí de Similitut (anglés ASJP, Automated Similarity Judgment Program) és un proyecte colaboratiu que aplica enfocaments computacionals a llingüística comparativa utilisant una base de senyes de llestes de vocabulari. La base de senyes és d'accés obert i consta de llistes de vocabulari bàsic de 40 elements, per a més de la mitat dels idiomes del món.[1] Cada nova versió ha inclós una expansió contínua de dita base de senyes. Ademés de llengües aïllades i llengües de grups filogenético demostrats, la base de senyes inclou ara pidgins, llengües criollas, llengües mixtes i llengües construïdes. les paraules de la base de senyes es transcriben en una ortografia estàndar simplificada (ASJPcode).[2] La base de senyes s'ha utilisat per a estimar les dates en les que les famílies llingüístiques han divergit a partir de la proto-llengua (llengua mare) original en els seus diversos descencientes moderns (llengües filles) per un método relacionat pero encara diferent de glotocronología,[3] determinar la pàtria (Urheimat) d'una proto-llengua,[4] investigar simbolisme sonor,[5] per a evaluar diferents métodos filogenético,[6] i varis atres propòsits.


La classificació de ASJP no és àmpliament acceptada pels llingüistes històrics, i per tant, no es considera que per sí mateixa proporcione un método suficientment adequat per a establir o evaluar per sí mateixa les relacions entre les famílies llingüístiques.[7][8] No obstant, algunes de les relacions trobades originalment, posteriorment despuix d'una inspecció minuciosa usant el método comparatiu ortodox s'ha vist que eren identificacions correctes.

Història

[editar | editar còdic]

Objtivos originals

[editar | editar còdic]

ASJP es va desenrollar originalment com un mig per a evaluar objectivament la similitut de paraules en el mateix significat de diferents idiomes, en l'objectiu final de classificar els idiomes computacionalment, en funció de les similituts lèxiques observades. En el primer artícul de ASJP[2] dos paraules d'idiomes presumiblement relacionats es varen considerar similars si mostraven a lo manco dos segments de sò idèntics. La similitut entre els dos idiomes es va calcular com un percentage del número total de paraules comparades que es varen considerar similars. Este método es va aplicar a llistes de paraules de 100 elements per a 250 idiomes de vàries famílies llingüístiques, que incloïen l'austroasiática, l'indoeuropea, la mayance i la muskogee.

Consorci ASJP

[editar | editar còdic]

El Consorci ASJP, fundat en 2008, va aplegar a involucrar a al voltant de 25 llingüistes professionals i atres parts interessades que treballen com transcriptores voluntaris i / o estenen l'ajuda al proyecte d'atres maneres. La principal força impulsora darrere de la fundació del consorci va ser Cecil H. Brown. Søren Wichmann és l'encarregat usual de mantindre el proyecte. Un tercer membre central del consorci és Eric W. Holman, qui va crear la major part del software utilisat en el proyecte.

Llistes de paraules més curtes

[editar | editar còdic]

Si be les llistes de paraules utilisades es varen basar originalment en la llista de 100 elements, es va determinar estadísticament que un subconjunt de 40 dels 100 elements inicials produïa resultats clasificatorios tan bons, i inclús llaugerament millors, que tota la llista completa.[9] Açò es deu en part a que la llista de Swadesh que era altament semblada a la llista inicial, conté elements més estables que uns atres, per tant en reduir la llista als elements més estables es disminuïx el soroll estadístic i la classificació pot aplegar a ser millor. Per eixa raó, posteriorment les llistes de paraules reunides contenien només 40 elements (o menys, quan falten atestació documentals per a alguns dels ítems lèxics).

Distància de Levenshtein

[editar | editar còdic]

En artículs publicats des de 2008, ASJP ha amprat un programa de juí de similitut basat en la distància de Levenshtein (DL). Es va trobar que este enfocament produïx millors resultats clasificatorios, medits per comparació en les classificacions estàndar donades pels especialistes en diferents famílies, que el método utilisat inicialment per Brown. La DL es definix com el número mínim de canvis successius necessaris per a convertir una paraula en una atra, a on cada canvi és l'inserció, eliminació o substitució d'un símbol. Dins de l'enfocament de Levenshtein, les diferències en la llongitut de les paraules es poden corregir dividint DL pel número de símbols de la més llarga de les dos paraules comparades. Açò produïx DL normalisada (DLN). Un DLN dividit (DLND) entre els dos idiomes es calcula dividint el DLN promig per a tots els parells de paraules que involucren el mateix significat per el DLN promig per a tots els parells de paraules que involucren diferents significats. Esta segona normalisació pretén corregir la similitut fortuïta.[10]

Llista de paraules

[editar | editar còdic]

El ASJP utilisa la següent llista de 40 paraules.[11] És similar a la llista de Swadesh-Yakhontov, pero té algunes diferències. Els térmens originals en anglés són:

Parts del cos
  • eye 'ull'
  • ear 'orella'
  • nose 'nas'
  • tongue 'llengua'
  • tooth 'dent'
  • hand 'mà'
  • knee 'genoll'
  • blood 'sanc'
  • bone 'os'
  • breast 'sens'
  • liver 'fege'
  • skin 'pell'
Animals i plantes
  • louse 'poll'
  • dog 'gos'
  • fish 'peix'
  • horn 'banya'
  • tree 'arbre'
  • leaf'full'
Persones
  • person 'ser humà'
  • name 'nom'
Objectes i fenomens naturals
  • sun 'sol'
  • star 'estrela'
  • water 'aigua'
  • fire 'fòc'
  • stone 'pedra'
  • path 'camí'
  • mountain 'montanya'
  • night 'nit'
Verps i adjectivos
  • drink 'beure'
  • die 'morir'
  • see 'vore'
  • hear 'sentir'

menja 'vindre'

  • new 'nou'
  • full 'ple'
Numerals i pronoms
  • one 'un'
  • two 'dos'

I 'yo'

  • you 'tu'
  • we 'nosatres'

Vore també

[editar | editar còdic]

Referències

[editar | editar còdic]
  1. Wichmann, Søren, André Müller, Annkathrin Wett, Viveka Velupillai, Julia Bischoffberger, Cecil H. Brown, Eric W. Holman, Sebastian Sauppe, Sarina Molochieva, Pamela Brown, Harald Hammarström, Oleg Belyaev, Johann-Mattis List, Dik Bakker, Dmitry Egorov, Matthias Urban, Robert Mailhammer, Agustina Carrizo, Matthew S. Dryer, Evgenia Korovina, David Beck, Helen Geyer, Patience Epps, Anthony Grant i Pilar Valenzuela. 2013. The ASJP Database (versió 16). http://asjp.clld.org/
  2. 2,0 2,1 Brown, Cecil H., Eric W. Holman, Søren Wichmann i Viveka Velupillai. Classificació automatizado de les llengües del món: una descripció del método i resultats preliminars. STUF – Language Typology and Universals 61.4: 285-308.
  3. Holman, Eric W., Cecil H. Brown, Søren Wichmann, André Müller, Viveka Velupillai, Harald Hammarström, Sebastian Sauppe, Hagen Jung, Dik Bakker, Pamela Brown, Oleg Belyaev, Matthias Urban, Robert Mailhammer, Johann-Mattis List i Dmitry Egorov. Datació automatizado de les famílies llingüístiques del món basades en la similitut lèxica. Current Anthropology 52.6: 841-875.
  4. Wichmann, Søren, André Müller i Viveka Velupillai. 2010. Homelands of the world's language families: A quantitative approach. Diachronica 27.2: 247-276.
  5. Wichmann, Søren, Holman, Eric W., i Cecil H. Brown. 2010. Simbolisme sonor en vocabulari bàsic. Entropía 12.4: 844-858.
  6. Pompeya, Simone, Vittorio Loreto i Francesca Tria. 2011. Sobre la precisió dels arbres llingüístics. PLoS ONE 6: i20109.
  7. Cf. comentaris de Adelaar, Blust i Campbell en Holman, Eric W., et al. (2011) "Automated Dating of the World's Language Families Based on Lexical Similarity". Current Anthropology, vol. 52, no. 6, pp. 841–875.
  8. «Cross-Linguistic Linked Data».
  9. Holman, Eric W., Søren Wichmann, Cecil H. Brown, Viveka Velupillai, André Müller i Dik Bakker. 2008. Explorations in automated language classification. Folia Linguistica 42.2: 331-354.
  10. Wichmann, Søren, Eric W. Holman, Dik Bakker i Cecil H. Brown. 2010. Evaluació de mides de distància llingüística. Physica A 389: 3632-3639 (doi:10.1016/j.physa.2010.05.011).
  11. http://asjp.clld.org/static/guidelines.pdf

Bibliografia

[editar | editar còdic]

Søren Wichmann, Jeff Good (eds). 2014. Quantifying Language Dynamics: On the Cutting edge of Areal and Phylogenetic Linguistics, p. 203. Leiden: Brill. Brown, Cecil H., et al. 2008. Automated Classification of the World's Languages: A Description of the Method and Preliminary Results. Language Typology and Universals 61(4). November 2008. doi:10.1524/stuf.2008.0026

  • Wichmann, Søren, Eric W. Holman, and Cecil H. Brown (eds.). 2018. The ASJP Database (version 18).

Enllaços exteriors

[editar | editar còdic]


Referències

[editar | editar còdic]