Pour un truc comme Copilot, il faut donc prouver que le code issu du logiciel est dérivé d'un bout de code de la base de données.
Même pas dans la BDD.
Copilot reproduit par accident un bout de code identique qui n'était pas dans son apprentissage, cela violerait la loi. De la même façon que si par hasard Midjourney reproduit une oeuvre de pop culture sans pour autant l'avoir dans son entrainement aurait le même problème. C'est peu probable, mais ça montre qu'on n'a pas besoin d'avoir les données d'apprentissage pour faire condamner. Le fait que ce soit dans l'apprentissage ou non pourrait influer probablement la sanction mais ne change pas la violation de la loi.
Ça me semble impossible avec un LLM correctement paramétré.
Je te trouve bien confiant sur ce point quand on voit justement ce que tous les LLM font à ce sujet jusqu'à aujourd'hui. En dehors de supprimer toute référence lors de l'apprentissage c'est difficile à éviter en tout cas à ce jour.
Encore une fois, la propriété intellectuelle ne se dilue pas, la contrefaçon est binaire : 1% de contrefaçon, ça n'existe pas; il existe un seuil de divergence au-delà duquel l'auteur initial n'a plus de droits à faire valoir.
Si si.
Prends une image couverte par le droit d'auteur, prends en 50% à l'identique ou presque et change le reste. Tu tomberas sous le coup de la loi même si 50% est de toi. De même pour un morceau de films, livres, musique, etc.
Le code n'est pas différent, si tu prends quelques fonctions non triviales directement d'ailleurs, tu peux avoir des problèmes même si le reste de ton code est fait maison.
Au passage, il y a aussi une bizarrerie à résoudre : dans oeuvre dérivée, il y a "oeuvre". Or, il est admis que la sortie d'un LLM n'ouvre pas de droits d'auteurs parce que ça n'est pas une oeuvre de l'esprit. Il n'y a donc pas d'appropriation des droits d'auteurs par quiconque.
Il n'y a pas besoin, cela n'autorise pas les LLM à générer tout ce qu'ils veulent et on le voit bien avec les affaires en cours.
[^] # Re: superbe initiative de huggingface
Posté par Renault (site web personnel) . En réponse au journal Votre code dans un modèle d'IA. Évalué à 7.
Même pas dans la BDD.
Copilot reproduit par accident un bout de code identique qui n'était pas dans son apprentissage, cela violerait la loi. De la même façon que si par hasard Midjourney reproduit une oeuvre de pop culture sans pour autant l'avoir dans son entrainement aurait le même problème. C'est peu probable, mais ça montre qu'on n'a pas besoin d'avoir les données d'apprentissage pour faire condamner. Le fait que ce soit dans l'apprentissage ou non pourrait influer probablement la sanction mais ne change pas la violation de la loi.
Je te trouve bien confiant sur ce point quand on voit justement ce que tous les LLM font à ce sujet jusqu'à aujourd'hui. En dehors de supprimer toute référence lors de l'apprentissage c'est difficile à éviter en tout cas à ce jour.
Si si.
Prends une image couverte par le droit d'auteur, prends en 50% à l'identique ou presque et change le reste. Tu tomberas sous le coup de la loi même si 50% est de toi. De même pour un morceau de films, livres, musique, etc.
Le code n'est pas différent, si tu prends quelques fonctions non triviales directement d'ailleurs, tu peux avoir des problèmes même si le reste de ton code est fait maison.
Il n'y a pas besoin, cela n'autorise pas les LLM à générer tout ce qu'ils veulent et on le voit bien avec les affaires en cours.