La problématique de confidentialité me semble assez proche d’une pratique antérieur à l’IA : le crowd sourcing. J’entends par-là le recours à des sites tel que stackoverflow.com : il devrait être évident qu’exposer un problème aux yeux de milliers voir millions de ses pairs implique 1. Un effort de synthèse pour isoler le point précis sur lequel on attend que la « magie » opère, avec les éléments contextuels éventuels les plus signifiants, en ôtant les secondaires et suivants. 2. Une réflexion sur les informations potentiellement sensibles qu’on expose dans l’exercice, directes, mais aussi déductibles par interpolation.
De loin on pourrait le croire, mais de près il y a des différences fondamentaux. Je vais expliciter ce que j'entends par là.
Avec un site tel que SO, certes tu peux poser des questions en lien avec ton travail mais :
Si tu n'es pas un manche, en théorie tu fais ça de temps en temps sur une faible partie du code sur lequel tu travailles. Par exemple en 10 ans de carrière, j'ai du le faire 2-3 fois seulement.
De même éventuellement pour de la doc ou des démarches admins, etc.
La grande majorité du temps tu lis ce qui a été produit par d'autre, mais personne ne sait réellement qui a lu quoi et peut en déduire quoique ce soit. Google est peut être l'acteur qui en sait le plus et honnêtement vu ce qu'on balance à un moteur de recherches je doute que Google ait une vue complète d'un projet entier ainsi.
Le soucis de confidentialité existe mais est relativement faible par ce genre d'usage.
Ce qui est le plus comparable en terme de confidentialité est au niveau du Cloud. Tu héberges ton code, ta documentation, toutes les données de la boîte etc. chez Google par exemple. Là Google a une vue complète sur ce qui se passe. Ce qui peut selon le domaine d'activité et le contrat / confiance que tu as avec le fournisseur peut être un soucis.
Mais l'IA ici va même potentiellement plus loin par l'apprentissage qu'il peut faire sur ses interactions. Tous ne le font pas, mais il n'y a pas de raison de croire qu'aucun ne le fait ou ne le fera.
Tu as une IA pour coder, tu vas le prompter pour savoir ce que tu vas faire, ton code sera envoyé à l'IA pour effectuer les changements nécessaires. Si tu l'utilises sur un temps long pour beaucoup de fonctionnalités, à la fin l'IA aura une vue d'ensemble du projet, doc + code. Comme un fournisseur de Cloud expliqué plus haut.
Mais le fournisseur de cloud ne permet pas en théorie à une personne extérieure d'extraire des données d'un client quelconque. Si EDF héberge toutes ses données chez Google, en tant que non employé EDF je n'ai aucun moyen d'y accéder sauf potentiellement si je trouve une faille béante l'autorisant.
Si l'IA apprend du code + doc privé, la situation est tout autre. Par accident ou avec un prompt bien ciblé par une personne extérieure, des informations privées peuvent fuiter. Alors pour l'immense majorité du code c'est probablement insignifiant, mais si tu travailles dans un secteur critique avec peu de concurrents, le risque augmente car il y a plus de chance que l'IA recrache tout ou partie de ce qu'il a analysé chez un autre.
De même que des couples logins / mdp de certains services courants qui pourraient ressortir aussi si jamais les personnes n'ont pas protégées ces données (et comme certains les mettent dans leur dépôt git, c'est déjà arrivé et arrivera encore).
Bref, cela pose des défis nouveaux dans certains cas et il faut en avoir conscience. Il faut donc être attentif à l'IA et à son fournisseur :
Possibilité d'usage en local pur ?
Fournisseur qui garanti qu'il n'analyse pas les prompts ni fait d'apprentissage dessus + code / doc envoyés ?
[^] # Re: Marre
Posté par Renault (site web personnel) . En réponse au journal LLM (encore), effondrement et travail humain. Évalué à 5.
De loin on pourrait le croire, mais de près il y a des différences fondamentaux. Je vais expliciter ce que j'entends par là.
Avec un site tel que SO, certes tu peux poser des questions en lien avec ton travail mais :
Le soucis de confidentialité existe mais est relativement faible par ce genre d'usage.
Ce qui est le plus comparable en terme de confidentialité est au niveau du Cloud. Tu héberges ton code, ta documentation, toutes les données de la boîte etc. chez Google par exemple. Là Google a une vue complète sur ce qui se passe. Ce qui peut selon le domaine d'activité et le contrat / confiance que tu as avec le fournisseur peut être un soucis.
Mais l'IA ici va même potentiellement plus loin par l'apprentissage qu'il peut faire sur ses interactions. Tous ne le font pas, mais il n'y a pas de raison de croire qu'aucun ne le fait ou ne le fera.
Tu as une IA pour coder, tu vas le prompter pour savoir ce que tu vas faire, ton code sera envoyé à l'IA pour effectuer les changements nécessaires. Si tu l'utilises sur un temps long pour beaucoup de fonctionnalités, à la fin l'IA aura une vue d'ensemble du projet, doc + code. Comme un fournisseur de Cloud expliqué plus haut.
Mais le fournisseur de cloud ne permet pas en théorie à une personne extérieure d'extraire des données d'un client quelconque. Si EDF héberge toutes ses données chez Google, en tant que non employé EDF je n'ai aucun moyen d'y accéder sauf potentiellement si je trouve une faille béante l'autorisant.
Si l'IA apprend du code + doc privé, la situation est tout autre. Par accident ou avec un prompt bien ciblé par une personne extérieure, des informations privées peuvent fuiter. Alors pour l'immense majorité du code c'est probablement insignifiant, mais si tu travailles dans un secteur critique avec peu de concurrents, le risque augmente car il y a plus de chance que l'IA recrache tout ou partie de ce qu'il a analysé chez un autre.
De même que des couples logins / mdp de certains services courants qui pourraient ressortir aussi si jamais les personnes n'ont pas protégées ces données (et comme certains les mettent dans leur dépôt git, c'est déjà arrivé et arrivera encore).
Bref, cela pose des défis nouveaux dans certains cas et il faut en avoir conscience. Il faut donc être attentif à l'IA et à son fournisseur :