Dans un article sur medium, François Chollet, lui, dit que c'est linéaire (c'est une opinion, pas plus, mais d'un spécialiste du domaine quand même).
Mais en tout cas dans Alpha Zero, même s'il apprend la stratégie tout seul, les règles sont hard-codés. (il me semble qu'on est en plein dans le théorème de "no free lunch": on a un problème très spécifique à régler).
[^] # Re: On va tous mourir ... (voix de Homer Simpson)
Posté par Alex G. . En réponse au journal Les échecs en échec. Évalué à 2.
Dans un article sur medium, François Chollet, lui, dit que c'est linéaire (c'est une opinion, pas plus, mais d'un spécialiste du domaine quand même).
Mais en tout cas dans Alpha Zero, même s'il apprend la stratégie tout seul, les règles sont hard-codés. (il me semble qu'on est en plein dans le théorème de "no free lunch": on a un problème très spécifique à régler).
Ce qui n'empêche que , cet algorithme a sûrement plein d'applications à découvrir. Comme l'apprentissage par renforcement a fait un retour fulgurant grâce à l'apprentissage profond en 2015 (voir Human-level control through Deep Reinforcement Learning et les travaux de OpenAI), les algos bayésiens reviennent sur le devant de la scène et semblent "motorisés" par l'apprentissage profond.
Il y a l'air d'y avoir un foisonnement avec de nouvelles librairies dans ce sens comme pyro ou pomegranata.