Anar al contingut

AlphaGo

De L'Enciclopèdia, la wikipedia en valencià
Archiu:Alphago logo Reversed.svg

AlphaGo és un programa informàtic d'inteligència artificial desenrollat per Google DeepMind per a jugar al joc de taula Go. En octubre de 2015 es va convertir en la primera màquina de Go en guanyar a un jugador professional sense amprar pedres de handicap en un tauler de 19x19.

Es va enfrontar contra el jugador chinenc Fan Hui 2p en una série de 5 partides oficials, les quals AlphaGo va guanyar, seguides per unes partides informals que varen acabar 3-2 a favor de l'inteligència artificial. En març de 2016, es va enfrontar a un dels millors jugadors, Llig Sedol 9p. El 9 de març de 2016, AlphaGo va guanyar la primera partida d'este enfrontament.[1][2] Fins a març del 2016, AlphaGo estava classificat com a número dos del món en el rànquing no oficial de Rémi Coulom, en un elo de 3611 fins a juliol del 2016.[3] En reconeiximent per véncer a Lee Sedol, AlphaGo va ser guardonat en un honorari 9-donen per l'Associació Coreana de Baduk.

En 2017, AlphaZero, del propi DeepMind, va superar a la versió AlphaGo Zero i atres programes d'escacs i Shōgi despuix de sol 24 hores de joc. Despuix de 4 hores de jocs va adquirir un nivell superhumano.[4][5]

Hardware

[editar | editar còdic]

AlphaGo es va posar a prova en hardware en varis números de CPU s i GPU s, que s'eixecuta en modo asíncrono o distribuït. Dos segons de temps de pensar es dona a cada moviment. l'Elo resultant s'enumera a continuació[6]

Configuració i rendiment
Configuració Fils de
busca
N.º de CPU N.º de GPU Rànquing de Elo
Asíncrono 40 48 1 2,151
Asíncrono 40 48 2 2,738
Asíncrono 40 48 4 2,850
Asíncrono 40 48 8 2,890
Distribuït 12 428 64 2,937
Distribuït 24 764 112 3,079
Distribuït 40 1,202 176 3,140
Distribuït 64 1,920 280 3,168
Configuració i força[7]
Versions Hardwares Elo Partits
AlphaGo Fan 176 GPUs, distribuït 3.144 5:0 contra Fan Hui
AlphaGo Lee 48 TPUs, distribuït 3.739 4:1 contra Llig Sedol
AlphaGo Master Una sola màquina en 4 TPU v2 4.858 60:0 contra jugadors professionals;

Cim del Futur de Go

AlphaGo Zero Una sola màquina en 4 TPUs[8] v2 5.185[9] 100:0 contra AlphaGo Lee

89:11 contra AlphaGo Master

AlphaGo Zero

[editar | editar còdic]

L'equip de AlphaGo va publicar un artícul en la revista Nature el 19 d'octubre de 2017, presentant AlphaGo Zero, una versió sense senyes humanes i més sòlida que qualsevol atra versió humana anterior que derrotara al campeó.[9] En jugar jocs contra sí mateixa, AlphaGo Zero va superar la força de AlphaGo Lee en tres dies en guanyar 100 jocs a 0, va alcançar el nivell de AlphaGo Master en 21 dies i va superar totes les versions anteriors en 40 dies.[8]

Algoritme

[editar | editar còdic]

L'algoritme de AlphaGo utilisa una combinació de tècniques d'aprenentage automàtic i arbre de busca, combinades en una àmplia formació, tant des del joc humà i com de l'ordenador. Utilisa arbre de busca Monte Carlo, guiada per una «ret de valor» i una «ret de polítiques», abdós implementades per mig de la tecnologia de rets neuronals d'aprenentage profunt.[6] Una cantitat llimitada de detecció de característiques pre-processament-jugue específic s'utilisa per a generar les entrades a les rets neuronals.[6]

Les rets neuronals del sistema varen ser inicialment bootstrapeadas a partir de l'experiència de joc humà. AlphaGo va ser entrenat inicialment per a imitar el joc humà, tractant d'igualar els moviments dels jugadors experts de jocs històrics registrats, utilisant una base de senyes d'al voltant de 30 millons de moviments. Una volta que havia alcançat un cert grau d'habilitat, era entrenat encara més en ser cridat a eixercitar un gran número de partits contra atres instàncies de sí mateixa, usant aprenentage per reforç per a millorar el seu joc.

Referències

[editar | editar còdic]
  1. «[1]», BBC Online. Consultat el 9 de març de 2016.
  2. «1 Enfrontament Youtube». Consultat el 8 de març de 2016.
  3. http://www.goratings.org/ goratings.org
  4. «Mastering Chess and Shogi by Self-Play with a General Reinforcement Learning Algorithm».
  5. «Entire human chess knowledge learned and surpassed by DeepMind's AlphaZero in four hours».
  6. 6,0 6,1 6,2 Nature.529(7587)
    484–489.doi:10.1038/nature16961.
  7. «【柯洁战败解密】AlphaGo Master最新架构和算法,谷歌云与TPU拆解» (en chinenc). Sohu. Consultat el 1 de juny de 2017.
  8. 8,0 8,1 «AlphaGo Zero: Learning from scratch». DeepMind official website. Archivat des d'el original, el 19 d'octubre de 2017. Consultat el 19 d'octubre de 2017.
  9. 9,0 9,1 «Mastering the game of Go without human knowledge». Nature. Consultat el 19 d'octubre de 2017.

Vore també

[editar | editar còdic]


Referències

[editar | editar còdic]