Ce qui est sûr c'est que si le modèle recrache tel quel du contenu sous copyright, alors il y a violation de droit d'auteur même si la phase d'entrainement est valide juridiquement (en admettant qu'elle le soit).
C'est une grosse limitation pour ces outils qui vont devoir y mettre des moyens de dingue pour s'assurer qu'ils ne violent pas le droit d'auteur dans ces conditions. Le plus simple est effectivement de limiter les données d'entrainement à ce qui est permis, cela limite les risques et en cas de coïncidence (sortir un code protégé mais qui n'est pas dans les données d'entrainement) ils pourraient démontrer que c'est une coïncidence et non une violation de copyright.
[^] # Re: superbe initiative de huggingface
Posté par Renault (site web personnel) . En réponse au journal Votre code dans un modèle d'IA. Évalué à 8.
Ce qui est sûr c'est que si le modèle recrache tel quel du contenu sous copyright, alors il y a violation de droit d'auteur même si la phase d'entrainement est valide juridiquement (en admettant qu'elle le soit).
C'est une grosse limitation pour ces outils qui vont devoir y mettre des moyens de dingue pour s'assurer qu'ils ne violent pas le droit d'auteur dans ces conditions. Le plus simple est effectivement de limiter les données d'entrainement à ce qui est permis, cela limite les risques et en cas de coïncidence (sortir un code protégé mais qui n'est pas dans les données d'entrainement) ils pourraient démontrer que c'est une coïncidence et non une violation de copyright.