• [^] # Re: Et Mistral ?

    Posté par . En réponse à la dépêche Nouvelles sur l’IA de mars 2025. Évalué à 2.

    Par contre, de par leur nature probabiliste, ils ne seront jamais totalement fiables (encore une fois, à moins de changer de techno).

    Et surtout, une hallucination peut intoxiquer le contexte à tout moment et rendre les générations suivantes caduques, si bien que plus le contexte traîne en longueur, moins c'est fiable. Et ce ne sont pas des bugs, c'est directement induit par la techno.

    1. Les humains ne sont très probablement pas purement déterministes non plus. Ne serait-ce que pour pouvoir joueur à pierre-feuille-ciseaux.
    2. Un LLM peut être rendu déterministe. Il suffit de mettre la température à 0.
    3. Tu n’as pas besoin d’être totalement fiable, juste plus fiable. Plus tu es fiable, plus tu peux faire des tâches à horizons longs sans te planter
    4. Tu n’as pas même besoin d’être fiable, tu as juste besoin de dire oups, je me suis planté il y a 3 paragraphes. Un truc sur lequel les modèles actuels ont beaucoup de mal, mais qui n’est pas impossible de manière inhérente, et qui va probablement s’améliorer avec plus de RL/CoT.

    Si tu prends par exemple Whisper, qui est un des meilleurs modèles voix vers texte actuel et que tu fais une inférence avec du bruit blanc (ou du silence capté par un micro), il te génère quelque chose du genre "Sous-titrage Société Radio-Canada", ce qui est correct en soit (exemple type d'un problème d'alignement).

    Pour moi c’est clairement incorrect en soit ? Je serai modérément surpris que les modèles multimodaux récents (type Gemini 2.5) fassent la même erreur. Je serai très surpris que les modèles multimodaux de la prochaine génération la fassent.

    Pour l'effet de plateau, il est à mon sens indéniable que les meilleurs modèles ont des performances proches entre eux, avec une division en deux groupes (ceux qui raisonnent" comme les GPT o1 et DeepSeek-r1 et les autres, qui font du chat).

    Je pense que tu observes un phénomène réel qui est la saturation des benchmarks, et que les benchmarks se concentrent presque tous sur des tâches à horizon temporel court. Ajoute à ça contamination des données (les benchmarks discutés qui se retrouvent dans les données d’entraînement)

    Que les modèles soient suffisamment bons pour que tu aies du mal à discerner les différences de capacité en une discussion de 10 minutes ne signifie pas que cette différence de capacité n’existe pas ou n’est pas importante en pratique pour des "agents" réalisant des tâches pouvant durer 5-10 heures !

    (c’est soit dit en passant pour ça que Zvi se concentre de plus en plus sur les benchmarks privés pour rapporter les performances des modèles)

    Bref, tout ce que je voulais signifier, c'est qu'on ne parle toujours que des modèles alors qu'il faudrait à mon avis un peu plus parler d'applications pratiques.

    Et à mon sens, c’est tout à fait correct. Je pense qu’au final l’application importe peu.

    J’ai fait un équivalent perso (pour jouer) à Claude Code en un week end. Par "je", je veux dire Claude. Bien sûr, j’ai dû le guider, je suis repassé sur certaines parties du code, mais le résultat est entièrement utilisable.

    Plus le modèle est capable, plus créer l’application est à la portée du modèle lui même. Et moins le modèle a besoin des "rails" de l’application. À terme je ne vois pas comment l’application peut être un avantage compétitif fiable.

    Après, si dans "application" tu mets tout l’aspect juridique/commercial/etc... là oui, on va être d’accord. Mais le code du wrapper en lui-même ? non.