• [^] # Re: Encore un!

    Posté par . En réponse à la dépêche Sony massacre son Aïbo à grand coup de DMCA.. Évalué à 10.

    L'attaque de Sony contre ce site est plus une dissimulation sous un DMCA epouvantail des futures versions d'Aibo.

    Je m'explique: dans la première version d'Aibo, le système fonctionne sur le principe de l'apprentissage: à chaque fois que notre chien à l'intelligence de métal effectue une action convenable alors le(s) maître(s) peuvent indiquer sa validité (l'action est bonne à leurs yeux) en donnant un récompense (une caresse sur la tête par exemple).

    Bizarement un certain nombre de robot ont commencé à devenir paresseux ou désobéissant: si un maître appelait son Aibo alors celui-ci allait dans la direction opposée.

    Pourquoi ? Le robot fonctionne sur l'apprentissage par renforcement(1). Lors des toutes premières activités le robot effectue des actions complétements aléatoires(2) récompensées ou punies par le maître. Si il récompense les mauvais comportement alors le droppy en fer blanc va associer aux mauvais comportements de plus grandes probabilités d'exécution.

    Prenons un exemple simple: le robot décide d'aller dans le coin opposé de la pièce par rapport au maître. Celui-ci le rejoint,le saisit puis le caresse. Le robot va comprendre que la fuite envers le maître donne une meilleure probabilité de recevoir une récompense. Un autre exemple ? si vous passez votre temps à le caresser et à le tenir dans vos bras alors comment pourra t'il distinguer les bonnes des mauvaises actions ? Il comprendra alors qu'il suffit de ne pas bouger pour être pris dans les bras et obtenir une récompense. Il bougera donc de moins en moins. (3)

    Pour en revenir à nos moutons, la prochaine gamme de AIBO possédera des comportements personnalisés avec des cartouches format SONY (4) directement enfichables dans un orifice quelconque du toutou en polymère(5). Chaque propriétaire pourra avoir à sa disposition des comportements tout prêts, standardisés pour que le chien-chien à sa mémêre n'aille plus renifler une prise de courant femelle devant les invités (ce qui je le convient est un manque de savoir vivre). Pourquoi donc laisser ce site qui pourraît diffuser gratuitement des comportements copyrightés ou des outils pour les modifier (voir pire: des comportements non standardisés tels que traverser un champ de mine ou siffler les filles à jupes courtes) ???

    Mais c'est encore plus triste que l'on peut imaginer: l'AIBO, cette petite merveille va devenir un bête jouet qui aura déjà un comportement défini et peu modifiable; La veritable utilité de ce jouet disparaît alors à mes yeux. Je ne parle même pas du rôle éducatif que possedait la version actuelle de l'Aibo: les utilisateurs pouvaient comprendre l'association action/récompense. C'est amusant car l'AIBO est utilisé par certains universitaires en psychologie pour étudier le comportement des humains envers ces machines. On observe alors des similarités entre les méthodes d'apprentissage par les adultes des Aibo ou des enfants . Aibo pouvait alors faire comprendre à certains parents des principes d'éducations. (6)

    Pour finir, une petite sortie avec une question ouverte(7): De plus en plus on essaye d'abaisser la complexité de la technologie pour l'homme mais l'homme essaye aussi d'abaisser la complexité de la nature en offrant des comportements stéréotypes ou des representations standards. L'effort que l'homme doit fournir pour apprendre, comprendre et étudier est necessaire pour construire la propre logique de chaque être humain. Si l'on enleve cette difficulté, ne risque t'on pas de plus en plus de sombrer dans un certaine fainéantise ravalant l'homme à celui d'un animal décadent omnubilé par la simplicité des choses ???? (8)

    (1) J'en déjà parlé dans plusieurs de mes commentaires. Plus de renseignements sur http://www-anw.cs.umass.edu/~rich/book/the-book.html(...) (un bouquin en ligne sur ce sujet) ou http://www.cs.washington.edu/research/jair/volume4/kaelbling96a-htm(...) (un papier présentant les méthodes de "reinforcement learning" existant). J'ai aussi écrit un papier en français sur l'apprentissage par renforcement pendant mon DEA. Un de ces jours j'essayerai de mettre celui-ci sur mon site.
    (2) On dit aussi "émet des actions aléatoires"
    (3) Le principe de la bonne action/récompense provient de la psychologie comportementaliste (ou "behaviorisme). C'est un domaine récent de la psychologie mais assez peu développé en France pour des question de lobbysme de la psychologie cognitive (Freud et tout ça).
    (4) Une sorte de "Memory Stick" (je crois que c'est le nom officiel) universel que Sony essaye de propager à travers toute sa gamme de produit: du portable au baladeur MP3 en passant par le canidé à la truffe de plastique.
    (5) Le choix de l'orifice est laissé à votre discretion.
    (6) La psychologie comportementaliste propose comme modèle que l'éducation s'effectue sur le modèle de renforcement (récompenser) des bonnes actions. Des méthodes d'éducations des enfants ont été basées sur ce type d'approche. L'utilité de ses travaux a surtout été démontré pour l'éducation d'enfants avec des problèmes de Trisomie 21 ou d'autisme.
    (7) Je sais, ça a peu de rapport avec la news officiel mais il est toujours intéressant de discuter, de poser ses remarques et d'argumenter, surtout si l'on a une biere dans la main et qu'on se trouve dans un bon café entre amis (ce ne sera pas le cas içi mais n'hesitez pas pour m'envoyer un chèque dans le but de m'offrir un coup).
    (8) Ouaih, moi aussi je trouve ma dernière phrase un peu bizarre. Mais j'ai envie d'aller roupiller. Désolé...

    P.S: pour les francophones extrémistes: oui, il doit rester des fautes mais Morphée m'attire dans mon plumard.