• [^] # Re: Clair depuis le début ?

    Posté par . En réponse au lien Github a utilisé tout le contenu public de github pour entrainer Copilot. Évalué à 3.

    Le développement des IA va de toutes manières rendre ce type de plaintes régulières. Il va y avoir des IA capables d'écrire des livres; certains passages vont ressembler à des œuvres existantes et ça va poser problème, etc. Sans modification de la loi, j'ai l'impression que ça ne pas pas aller très loin. une IA bien conçue (donc pas le truc de GitHub, on est d'accord) ne peut pas ressortir les données qu'elle a ingurgitées lors de son entrainement. Les concepteurs de l'IA pourront d'ailleurs facilement prouver leur bonne foi, par exemple par de la validation croisée (on ne propose à l'utilisateur que du code consensuellement proposé par deux IA entrainées avec des bases de codes indépendantes).

    Bref, avec des fausses IA moisies, oui, il y a un risque de contrefaçon. Avec de vraies IA, il sera facile de prouver l'absence de contrefaçon.

    Si la loi évolue pour qualifier la production d'une IA de travail dérivé par le simple fait que l'œuvre originale faisait partie du jeu de données d'entrainement, alors la situation sera différente. Mais je doute qu'une telle évolution soit possible (ni souhaitable), et je doute que ça change quoi que ce soit. Par exemple, les meilleurs IA aux échecs ne sont plus entrainées à partir de parties entre humains (imparfaites), mais sur la base de parties jouées contre elle-même. Je ne vois pas ce qui empêcherait une vraie IA d'apprendre à coder elle-même plutôt que de s'entrainer sur des bouts de code de qualité douteuse.