la révolution elle est déjà là. pas pour les défis de l'humanité (j'y crois pas une seule seconde), mais pour énormément de métiers. pas forcément une bonne révolution (seul le temps nous le dira), mais dès aujourd'hui, passer 3h à chercher ce qu'une IA peux te pointer du doigt en 5mn, c'est très mal vu en général.
Le souci, c'est que toutes les recherches ne sont pas égales (premier souci), et que les réponses ne sont pas toujours exhaustives (second souci), et que ça dérive (troisieme souci). Quand il s'agit d'un fait facile à vérifier, je pense que ça va. Par exemple, quelle est la capitale de la Mongolie, ça devrait aller.
Quand c'est sur un sujet moins présent dans le corpus (soit parce que c'est trop neuf, soit parce que c'est un sujet peu exploré), les risques d'halluciner augmentent. Par exemple, je suis sur que demander un résumé sur les lois autour du droit d'auteur en Afrique du Sud va donner un truc qui semble correct, mais qui va pas rentrer trop dans les détails, car les autres pays dominent sans doute le corpus, et les lois se ressemblent beaucoup. Mais peut être qu'il y a des documents et je suis pas tombé dessus.
Pour la dérive et les hallucinations, c'est facile à voir.
Par exemple, j'ai demandé une liste de films en abusant de Gemini de mon employeur (littéralement "j'ai besoin d'un liste de 10 films parlant de la GPA en vue d'organiser une rétrospective pour un club ciné."). Au début, je me suis planté, j'ai mis "PMA" au lieu de "GPA" et "Pro" au lieu de "Flash", et ça tourne encore.
J'ai pris ça parce que j'ai une idée assez précise des films sur le sujet sorti en France. J'avais en tête La Petite, il est pas dans la liste (ou La Fête des pères. Par contre, la réponse contient Gestación qui ne parle pas de GPA.
Donc hop, 10% d'hallucination.
J'ai refait une demande de ciné club sur un autre sujet (la bisexualité masculine au cinéma), la réponse est un chouia plus correct car il y a moins de films dans ma demande (6 au lieu de 10) et il y a plus de listes sur le web.
Par contre, j'ai aussi demandé des films en français, et dans la liste, il y a Cabaret (1972) qui est non dispo en streaming d'après allociné, et dont le dvd n'a pas de doublage français (vu que c'est une comédie musicale, c'est sans doute trop cher à doubler).
Encore une fois, j'ai du vérifier pour trouver ce qui va pas.
Et ça, c'est sans parler des autres soucis. Par exemple, la recherche est partie sans demander plus de détails (contrairement à un humain). J'ai eu plus qu'une liste à chaque fois (avec des explications, le titre du ciné club, les sujets à aborder, etc). J'ai eu des refs sans rapport avec les affirmations auquel elles sont attachés (vu que j'ai eu 6 fois le même article sur medium, qui ne parle que de la moitié des films de la liste...). Et à la fin, le système m'incite à continuer à utiliser Gemini en proposant d'autres requêtes, comme "faire les fiches du ciné club" ou "trouver des trucs plus expérimentaux ou plus anciens" (comprendre, avant les années 80...).
Pour le fun, j'ai cliqué sur le second, et la, le modèle s'éloigne en proposant Un chant d'amour, de Genet, qui est en effet ancien et plus expérimental, mais qui dérive du sujet de la bisexualité masculine.
Et même si j'ai pas les chiffres pour le vérifier, j'ai le sentiment que les résultats du modèle soit "culturellement aplatis". Vu que le LLM stocke tout sans trop de considération de langue (eg les tokens pour "chien" sont grosso modo au même endroit dans la matrice du LLM que "dog" ou "hund"), il me semble logique (et visiblement, d'autres personnes aussi, vu que quelqu'un a écrit sur le concept avant que je me pose la question) que si tu as peu de textes dans une langue sur un sujet (genre le français), mais beaucoup dans une autre (anglais), le modèle va tout prendre la ou un moteur de recherche ne va pas traverser la barrière de la langue. Et je me suis poser la question car sur les films sur la GPA de mon exemple, il y en avait 5 des USA, et 2 venant de l'Inde, 2 pays anglophones. Une fois que j'ai demandé spécifiquement en français, ça a pris plus de films français (et pas juste traduit).
Donc ouais, ça prends 5 minutes et pas 3h, mais le résultat est parfois subtilement faux, parfois à coté de la plaque, et sans doute subtilement biaisé
perso moi ce que je vois c'est que Claude génère du code meilleur que 90% que ce que je vois autour (et je suis gentil).
sans doute parce que le code qui a servi pour claude est du code libre (vu que c'est le code publique) qui est sans doute moins moche que les trucs horribles en internes fait par l'industrie au sens large. Ça me semble être un cas assez particulier car je ne suis pas sur qu'on retrouve une tel dichotomie dans d'autres secteurs de la société/partie du corpus (cad ou la majorité des données publiques sont de meilleurs qualités que les données privés).
[^] # Re: Ça vous sert à quoi au quotidien ?
Posté par Misc (site web personnel) . En réponse au journal Auto-héberger ses LLM (IA) : Débordement CPU+RAM, Mixture-of-Experts et Benchmarks. Évalué à 4 (+2/-1).
Le souci, c'est que toutes les recherches ne sont pas égales (premier souci), et que les réponses ne sont pas toujours exhaustives (second souci), et que ça dérive (troisieme souci). Quand il s'agit d'un fait facile à vérifier, je pense que ça va. Par exemple, quelle est la capitale de la Mongolie, ça devrait aller.
Quand c'est sur un sujet moins présent dans le corpus (soit parce que c'est trop neuf, soit parce que c'est un sujet peu exploré), les risques d'halluciner augmentent. Par exemple, je suis sur que demander un résumé sur les lois autour du droit d'auteur en Afrique du Sud va donner un truc qui semble correct, mais qui va pas rentrer trop dans les détails, car les autres pays dominent sans doute le corpus, et les lois se ressemblent beaucoup. Mais peut être qu'il y a des documents et je suis pas tombé dessus.
Pour la dérive et les hallucinations, c'est facile à voir.
Par exemple, j'ai demandé une liste de films en abusant de Gemini de mon employeur (littéralement "j'ai besoin d'un liste de 10 films parlant de la GPA en vue d'organiser une rétrospective pour un club ciné."). Au début, je me suis planté, j'ai mis "PMA" au lieu de "GPA" et "Pro" au lieu de "Flash", et ça tourne encore.
J'ai pris ça parce que j'ai une idée assez précise des films sur le sujet sorti en France. J'avais en tête La Petite, il est pas dans la liste (ou La Fête des pères. Par contre, la réponse contient Gestación qui ne parle pas de GPA.
Donc hop, 10% d'hallucination.
J'ai refait une demande de ciné club sur un autre sujet (la bisexualité masculine au cinéma), la réponse est un chouia plus correct car il y a moins de films dans ma demande (6 au lieu de 10) et il y a plus de listes sur le web.
Par contre, j'ai aussi demandé des films en français, et dans la liste, il y a Cabaret (1972) qui est non dispo en streaming d'après allociné, et dont le dvd n'a pas de doublage français (vu que c'est une comédie musicale, c'est sans doute trop cher à doubler).
Encore une fois, j'ai du vérifier pour trouver ce qui va pas.
Et ça, c'est sans parler des autres soucis. Par exemple, la recherche est partie sans demander plus de détails (contrairement à un humain). J'ai eu plus qu'une liste à chaque fois (avec des explications, le titre du ciné club, les sujets à aborder, etc). J'ai eu des refs sans rapport avec les affirmations auquel elles sont attachés (vu que j'ai eu 6 fois le même article sur medium, qui ne parle que de la moitié des films de la liste...). Et à la fin, le système m'incite à continuer à utiliser Gemini en proposant d'autres requêtes, comme "faire les fiches du ciné club" ou "trouver des trucs plus expérimentaux ou plus anciens" (comprendre, avant les années 80...).
Pour le fun, j'ai cliqué sur le second, et la, le modèle s'éloigne en proposant Un chant d'amour, de Genet, qui est en effet ancien et plus expérimental, mais qui dérive du sujet de la bisexualité masculine.
Et même si j'ai pas les chiffres pour le vérifier, j'ai le sentiment que les résultats du modèle soit "culturellement aplatis". Vu que le LLM stocke tout sans trop de considération de langue (eg les tokens pour "chien" sont grosso modo au même endroit dans la matrice du LLM que "dog" ou "hund"), il me semble logique (et visiblement, d'autres personnes aussi, vu que quelqu'un a écrit sur le concept avant que je me pose la question) que si tu as peu de textes dans une langue sur un sujet (genre le français), mais beaucoup dans une autre (anglais), le modèle va tout prendre la ou un moteur de recherche ne va pas traverser la barrière de la langue. Et je me suis poser la question car sur les films sur la GPA de mon exemple, il y en avait 5 des USA, et 2 venant de l'Inde, 2 pays anglophones. Une fois que j'ai demandé spécifiquement en français, ça a pris plus de films français (et pas juste traduit).
Donc ouais, ça prends 5 minutes et pas 3h, mais le résultat est parfois subtilement faux, parfois à coté de la plaque, et sans doute subtilement biaisé
sans doute parce que le code qui a servi pour claude est du code libre (vu que c'est le code publique) qui est sans doute moins moche que les trucs horribles en internes fait par l'industrie au sens large. Ça me semble être un cas assez particulier car je ne suis pas sur qu'on retrouve une tel dichotomie dans d'autres secteurs de la société/partie du corpus (cad ou la majorité des données publiques sont de meilleurs qualités que les données privés).