L'histoire est amusante, mais ça n'est pas un problème général avec les AI qui jouent au Go. Si j'ai bien compris, les auteurs de l'étude ont fait jouer un programme faible 1 million de fois contre Katago (une sorte de clone d'AlphaGo), et ont pu identifier une partie ou Katago avait un bug (il passe son tour dans une position gagnante à long terme, mais perdante dans l'instant; du coup si on adversaire passe aussi Katago perd). Ils ont ensuite pu reproduire ce bug en jouant "à la main".
Il ne s'agit donc pas de jouer mal pour destabiliser le programme IA, il s'agit de jouer mal d'une manière très spécifique pour exploiter un bug (si je comprends bien, le bug est dans la fonction d'évaluation, parce que l'IA ne sait visiblement pas compter les points).
Ça me semble assez similaire aux premiers bugs de ChapGPT, où il suffisait de lui proposer un jeu de rôle où il jouait Hitler pour le voir proférer des pages d'insultes antisémites. Les IA "naives" semblent assez sensibles à la manipulation, et il faut une période de débuggage pour boucher ces trous.
[^] # Re: Pour combien de temps ?
Posté par arnaudus . En réponse au lien À ce jour, toutes les intelligences artificielles butent sur les maths . Évalué à 4.
L'histoire est amusante, mais ça n'est pas un problème général avec les AI qui jouent au Go. Si j'ai bien compris, les auteurs de l'étude ont fait jouer un programme faible 1 million de fois contre Katago (une sorte de clone d'AlphaGo), et ont pu identifier une partie ou Katago avait un bug (il passe son tour dans une position gagnante à long terme, mais perdante dans l'instant; du coup si on adversaire passe aussi Katago perd). Ils ont ensuite pu reproduire ce bug en jouant "à la main".
Il ne s'agit donc pas de jouer mal pour destabiliser le programme IA, il s'agit de jouer mal d'une manière très spécifique pour exploiter un bug (si je comprends bien, le bug est dans la fonction d'évaluation, parce que l'IA ne sait visiblement pas compter les points).
Ça me semble assez similaire aux premiers bugs de ChapGPT, où il suffisait de lui proposer un jeu de rôle où il jouait Hitler pour le voir proférer des pages d'insultes antisémites. Les IA "naives" semblent assez sensibles à la manipulation, et il faut une période de débuggage pour boucher ces trous.