• [^] # Re: Oups.

    Posté par . En réponse au lien LUCIE — l'IA véritablement open source construite sur la transparence, la confiance et l'efficacité.. Évalué à 3.

    Je ne suis pas sûr que ça soit possible d'avoir un bon benchmark sans qu'il soit sauvagement abusé par la loi de Goodhart.

    Il existe toutefois la possibilité de mettre en place des benchmarks à usage unique, par exemple dans un programme de recherche. Une fois publié, le benchmark n'a plus aucune utilité, mais il a permis de quantifier la pertinence des algorithmes concurrents à un instant t.

    Je vois des gens des gens autour de moi, j'ai l'impression que c'est leur seul usage de l'outil, juste pour me démontrer par A + B que c'est de la merde

    Parce qu'on est entourés de vieux grincheux et/ou des gens qui ont peur pour leur job. Les perfs des meilleurs LLM sont assez bluffantes, et je trouve qu'il est difficile de trouver une tâche qu'un LLM fait moins bien qu'un humain moyen.

    Y'aura toujours des agents malveillants pour tenter d'abuser les outils à leur disposition.

    C'est peut-être là aussi que l'idée d'un LLM universel est foireuse. La tolérance aux erreurs et aux approximations est très différente en fonction de l'objectif.

    La seule bonne manière de coder, c'est la mienne.©

    Si ça compile et que ça suit le cahier des charges, c'est déja bien mieux qu'avec la plupart des humains :-)

    Je n'ai jamais essayé de tester un LLM dans un test de programmation, je ne sais pas quel niveau il peut avoir.