• [^] # Re: Et Mistral ?

    Posté par . En réponse à la dépêche Nouvelles sur l’IA de mars 2025. Évalué à 0. Dernière modification le 10 avril 2025 à 18:11.

    Je me suis peut être mal exprimé, mais j'ai l'impression qu'on ne parle pas de la même chose.

    Évidemment que les llms s'améliorent par itération.
    Ils ont toujours plus de connaissance et font moins d'erreurs qu’auparavant.

    Par contre, de par leur nature probabiliste, ils ne seront jamais totalement fiables (encore une fois, à moins de changer de techno).
    Et surtout, une hallucination peut intoxiquer le contexte à tout moment et rendre les générations suivantes caduques, si bien que plus le contexte traîne en longueur, moins c'est fiable. Et ce ne sont pas des bugs, c'est directement induit par la techno.

    En vérité, les llms se sont améliorés sur tous les aspects qui ont rendu ChatGPT révolutionnaire (relative compréhension d'instructions, extraction de données et génération de réponses plausibles, etc...).
    Mais n'ont pas vraiment avancés sur le reste (planification et vision à long terme, raisonnement abstrait, etc...).

    Je pense que ces limites vont obliger à utiliser des applications chargées de fiabiliser les modèles génératifs.
    Si tu prends par exemple Whisper, qui est un des meilleurs modèles voix vers texte actuel et que tu fais une inférence avec du bruit blanc (ou du silence capté par un micro), il te génère quelque chose du genre "Sous-titrage Société Radio-Canada", ce qui est correct en soit (exemple type d'un problème d'alignement).

    Le seul moyen de fiabiliser la génération en pratique est de supprimer logiciellement ces blancs (éventuellement en découpant l'audio et en envoyant plusieurs générations).

    Pour les llm, tout un tas de systèmes agentiques sont en cours de développement avec des boucles récursives types génération -> contrôle -> action et les modèles de Rerank.

    Du coup je vois les IA comme des moteurs, mais un moteur seul sert pas à grand chose tant que tu peux pas le mettre dans une voiture.

    Pour l'effet de plateau, il est à mon sens indéniable que les meilleurs modèles ont des performances proches entre eux, avec une division en deux groupes (ceux qui raisonnent" comme les GPT o1 et DeepSeek-r1 et les autres, qui font du chat).
    Dans la seconde catégorie, discute avec QwQ 32B, GPT-4 et Mistral-Small. Si il ne s'agit que de discussion et de suivre des instructions, je vois pas de différence en pratique. Pas plus qu'il n'y en a entre eux et les 30 premières entrées du lmarena (pour le dire vite).
    Certains s'en sortiront mieux que d'autres pour certaines tâches (génération de code par exemple avec Claude), sans que ça soit non plus extraordinaire.

    Bref, tout ce que je voulais signifier, c'est qu'on ne parle toujours que des modèles alors qu'il faudrait à mon avis un peu plus parler d'applications pratiques.

    Par exemple aucune entreprise ne confierait sa comptabilité à la meilleure des IA les yeux fermés sans aucun contrôle.
    Par contre, le jour où une entreprise propose ce service via des IA et s'engage juridiquement pour en assurer la fiabilité, là il y aura un changement de paradigme. Et je suis certain que si c'est possible avec la techno actuelle, c'est uniquement avec des modèles modeste mais spécialisés, et pilotés par des logiciels qui contrôlent absolument tout.
    Dans cet exemple, l'IA est le moteur, sans elle rien ne se fait, mais tu n'as une application pratique que par le logiciel qui l'englobe.

    Et ça ne passera pas à mon avis par les gros modèles généralistes comme GPT-4.5, peu importe leur score sur MMLU-Pro et autre comparatif à la mode.