• [^] # Re: Marre

    Posté par (site web personnel) . En réponse au journal LLM (encore), effondrement et travail humain. Évalué à 2.

    Si d'un côté du as des gros tas de $$ économisés en salaire de programmeur,

    Note, il n'y a pas que les programmeurs qui s'en servent et l'impact potentiel varie de poste en poste.

    et de l'autre côté tu as peut-être des risques virtuels pas très bien définis et au final peu inquiétants, il est probable que l'analyse soit quand même assez rapide.

    Tu juges que c'est peu inquiétant mais il y a de vraies questions derrière, surtout étant donné le capital investi dedans et les pratiques passées de la plupart de ces entreprises.

    Comme Amazon qui a analysé les ventes de son marketplace pour vendre sous son nom certains de ces produits au détriment des vendeurs, des fuites divers et variés de données personnelles notamment via des LLMs. Et avec la politique actuelle des USA et de la Chine qui hébergent de nombreux services de ce genre il y a de quoi se méfier de ce qui peut être fait de certaines de ces données que ce soit en terme de vol de propriété intellectuelle, analyse de données personnelles, etc.

    Tu peux dire que tu t'en fous, tu peux considérer que par exemple certains patrons s'en foutent et donne libre accès à leurs employés sans y réfléchir, très bien, mais ce n'est pas le cas de tout le monde et trouver un intérêt à ces outils ne doit pas être une justification à accepter de le faire à n'importe quel prix et sana analyse aussi des impacts négatifs.

    De la même façon que de nombreux chercheurs en IA travaillent ou essayent en tout cas de sensibiliser le monde sur certains de ces risques que ce soit avec la techno actuelle comme à venir. On ne doit pas mettre ça sous le tapis car osef ça rend service à pas cher. Ce sont des questions qu'on a avec d'autres technologies, l'IA n'y fait pas exception.

    C'est manquer de recul et d'esprit critique de ne voir que les biens faits mais pas les méfaits ou risques potentiels. Alors oui, il ne faut pas faire l'extrême inverse et ne pas voir le positif aussi (et je peux voir ces effets positifs, je ne remets pas cela en cause, bien au contraire).

    D'ailleurs j'en ai parlé avec mon client par exemple et il n'est en effet pas très chaud par exemple qu'on se serve de ces outils s'il n'y a pas un minimum de garanti concernant la confidentialité des données envoyées. La solution pourrait être de faire un système en local aussi mais ça doit s'évaluer et cela bloque certains usages aussi car cela reste gourmand en ressources et tous les modèles ne sont pas accessibles ainsi (loin de là même).

    Imagine que tu balances un truc confidentiel dans le prompt (un cahier des charges, ou un bout de code "maison"), et même que ce truc rentre dans la base d'apprentissage pour la version suivante de l'AI, quelles sont les chances pour que quelqu'un s'en aperçoive et qu'il puisse se passer quelque chose de réellement nuisible?

    Au hasard tu travailles dans un secteur confidentiel (défense, énergie, etc.) tu demandes à la machine de te pondre des documents ou afférents, si toute l'industrie balance ses méthodes, son code, ses documents internes à ce genre d'outils et qu'ils gardent ou s'entrainent dessus bah cela ne sera pas très difficile avec des prompts bien fichus de récupérer ces informations confidentielles et stratégiques depuis l'extérieur car la quantité de données du domaine sont limités à quelques acteurs.

    Ou tu es journaliste et tu travailles avec ces données et le nom de tes sources sont dans les échanges avec les serveurs lors de ta préparation des articles et qui pourraient être rebalancées si jamais la source est conservée et est associée à ces articles, nom qui pourrait ressortir si quelqu'un demande un résumé ou une traduction de l'article. Ce sont des problématiques réels concernant ces outils.

    Avec les états comme la Chine, la Russie ou les USA ce sont des questions sérieuses à se poser. De la même façon qu'ils n'hésitent pas à exploiter les données collectées par les entreprises dans leur objectif de renseignement politique comme économique.

    De la même façon que dans de nombreux dépôts internes comme publics il y a ou il y aura des couples login / mots de passe enregistrés par erreurs et qui pourraient par hasard se retrouver dans la nature aussi. Je ne doute pas que les acteurs malveillants vont travailler ce genre de questions. De même pour certaines données personnelles qui pouvaient entrer en conflit avec le droit à l'oubli européen.

    Après la problématique du droit d'auteur est un vrai merdier mais on voit que c'est un sujet complexe autour de ces technos et que pour l'instant on ne sait pas trop comment ça va se dégoupiller. Et il n'y a pas que le code là dedans qui est concerné mais ça pourrait avoir un impact si jamais la justice exige que les LLMs doivent s'assurer de ne jamais recracher tout ou partie d'un code de ses données d'entrainement (peut être que ça n'arrivera pas, mais on ne sait pas).

    Et reste également la question de la fiabilité, si demain les grands acteurs ont une panne (et l'histoire récente a montré que Google, Microsoft, etc. pouvaient avoir des pannes sérieuses), comment tu travailles ?

    Alors peut être que des solutions seront trouvés à tout cela et que tout ira bien mais il y a clairement du travail sur ces questions et des incertitudes aussi. Et que de foncer tête baisser sans y réfléchir un minimum ne me semble pas spécialement être malin.

    Après il y a outre la question de l'alignement de l'IA, l'alignement des développeurs de ces IA. Imaginer que demain pour des questions de rentabilités ils augmentent régulièrement les tarifs ou introduisent des publicités très ciblées dans les réponses n'est pas un scénario de SF étant donné le modèle économiques de la plupart des acteurs du secteurs aujourd'hui.

    D'où l'importance de la transparence, de la possibilité de tourner ces modèles en local, et si possible de ne pas avoir que les USA ou la Chine qui développent ces solutions. Et qu'on doit aussi se poser la question des risques concernant ces outils de la même façon qu'il faut se poser cette question pour d'autres technos par ailleurs, sans renier leur intérêt par ailleurs.