Comme mentionné dans le journal, ils expliquent que les utilisateurs doivent respecter les clauses d'attribution donc voilà, que les utilisateurs se démerdent. Leur position semble être que c'est pas trop risqué de faire un dataset basé sur du code avec des licences permissives (MIT, BSD) avec cette contrainte, et d'ailleurs ils ont exclu tout repository sous licence copyleft (GPL, LGPL, MPL, etc.). Par contre ils ont inclus les repositories sans aucune licence, alors que paradoxalement pas de licence veut dire "All rights reserved" en Français dans le texte. Donc ce choix me semble un peu douteux ?
Sinon, outre le fait qu'il est probablement légitime de faire du code dérivé de licences libres et permissives et idéalement sans clause d'attribution (BSD-0, MIT-0, WTFPL et similaire), mon journal pose la question des données personnelles incluses dans le dataset. Il y en a une multitude, à commencer par le nom d'utilisateur github, les noms et les e-mails dans les blocs de copyright, etc. C'est le point principal que je fais dans le journal mais bizarrement vous ne réagissez pas sur celui-ci bien que vous "comprenez bien" le post ?
Enfin, pourriez-vous expliquer ce qu'est l'"innovation responsable en IA"?
[^] # Re: superbe initiative de huggingface
Posté par nud . En réponse au journal Votre code dans un modèle d'IA. Évalué à 4.
Comme mentionné dans le journal, ils expliquent que les utilisateurs doivent respecter les clauses d'attribution donc voilà, que les utilisateurs se démerdent. Leur position semble être que c'est pas trop risqué de faire un dataset basé sur du code avec des licences permissives (MIT, BSD) avec cette contrainte, et d'ailleurs ils ont exclu tout repository sous licence copyleft (GPL, LGPL, MPL, etc.). Par contre ils ont inclus les repositories sans aucune licence, alors que paradoxalement pas de licence veut dire "All rights reserved" en Français dans le texte. Donc ce choix me semble un peu douteux ?
Sinon, outre le fait qu'il est probablement légitime de faire du code dérivé de licences libres et permissives et idéalement sans clause d'attribution (BSD-0, MIT-0, WTFPL et similaire), mon journal pose la question des données personnelles incluses dans le dataset. Il y en a une multitude, à commencer par le nom d'utilisateur github, les noms et les e-mails dans les blocs de copyright, etc. C'est le point principal que je fais dans le journal mais bizarrement vous ne réagissez pas sur celui-ci bien que vous "comprenez bien" le post ?
Enfin, pourriez-vous expliquer ce qu'est l'"innovation responsable en IA"?