• [^] # Re: Machine Learning

    Posté par . En réponse au journal AlphaGo remporte le premier match contre Lee Sedol. Évalué à 2.

    En particulier, AlphaGo n'a pas appris à jouer au Go tout seul, il a juste ingurgité des millions de parties jouées par des experts humains, joué des millions de parties contre lui-même, et reste capable de parcourir des arbres de possibilité plusieurs milliers de fois plus vite qu'un humain.

    Effectivement d'après ce que j'ai lu AlphaGo dispose de deux réseaux de neurones : le policy network et le value network. Il a donc appris deux choses : envisager les séquences importantes dans une position donnée et évaluer la probabilité de gagner dans une position donnée. Les deux sont combinés pour faire une recherche arborescente de Monte-Carlo. Et pourtant quand on le regarde jouer on voit qu'il ne se contente pas d'imiter les humains, qu'il innove, on lui attribue une "intuition" potentiellement meilleure que celle des humains, il a joué des coups qui ont réussi à surprendre les experts. C'est probablement quelque chose qu'il a appris en se battant contre des variantes de lui-même, sinon il ne jouerait pas aussi bien, il jouerait plus comme un humain. S'il n'avait pas appris à jouer à partir de parties d'experts, saurait-il jouer contre des humains ? C'est une excellente question. Lee Sedol à cherché à exploiter des failles typiques des bots dans les deux premières parties en jouant des coups ou ouvertures atypiques (ça correspond à son style de jeu), et a essayé de menacer de tuer un grand groupe qui est une faiblesse des stratégies basées sur Monte-Carlo search tree, mais sans succès.

    Il ne fait aucun doute qu'un humain capable de disposer d'autant d'informations serait bien meilleur qu'AlphaGo.

    Admettons qu'un humain ait cette information, comment fait-il pour l'améliorer sans se faire un nœud au cerveau ?

    Qu'est-ce qu'AlphaGo fait de moins bien qu'un humain (à part ressentir la beauté du jeu) ? :-)