Ça serait intéressant d'avoir des benchmarks bien fichus pour les LLM. Pendant très longtemps il a été facile de piéger chatGPT, même si maintenant c'est beaucoup plus dur. La qualité d'un LLM n'est pas forcément liée à sa capacité à échapper aux pièges, parce que quand on l'utilise comme un outil, on n'essaye pas de le piéger.
Pour certaines tâches, des tests objectifs sont probablement possibles (par exemple quand il s'agit de programmation), pour d'autres tâches c'est plus compliqué.
[^] # Re: Oups.
Posté par arnaudus . En réponse au lien LUCIE — l'IA véritablement open source construite sur la transparence, la confiance et l'efficacité.. Évalué à 4.
Ça serait intéressant d'avoir des benchmarks bien fichus pour les LLM. Pendant très longtemps il a été facile de piéger chatGPT, même si maintenant c'est beaucoup plus dur. La qualité d'un LLM n'est pas forcément liée à sa capacité à échapper aux pièges, parce que quand on l'utilise comme un outil, on n'essaye pas de le piéger.
Pour certaines tâches, des tests objectifs sont probablement possibles (par exemple quand il s'agit de programmation), pour d'autres tâches c'est plus compliqué.