• [^] # Re: Et Mistral ?

    Posté par . En réponse à la dépêche Nouvelles sur l’IA de mars 2025. Évalué à 0.

    Cette discussion m'a permis d'élargir un peu ma perspective.

    J'ai un peu la flemme de lire toutes les sources, mais j'ai fais des essais piégeux sur Claude (que je n'avais jamais trop utilisé avant).
    J'ai pu lui faire dire des choses imprécises, (qu'il corrigeait rapidement au message suivant) mais je n'ai pas réussi à le faire dérailler.

    Après faudrait voir avec un contexte beaucoup très long.

    Donc oui, la qualité du modèle a une énorme influence sur l’horizon temporel des tâches qu’il est capable d’effectuer, bien plus qu’on ne le penserait en évaluant naïvement sur une étape unique.

    Là je suis vraiment sceptique.
    Peut importe quand survient l'erreur si elle survient fatalement, en particulier dans l'idée de rendre les IA autonomes.
    Imaginerait on un serveur en production qu'il tendrait à faire des choses incohérentes passé un certain temps ?
    La question de savoir si cela prendra un minute ou une heure importe peu à mon sens.

    Dans ce contexte, la priorité ne serait elle pas de repérer l'erreur avant de déclencher une action ?
    Si les erreurs soient inévitables, la seul chose à faire est de les rendre inoffensives.

    Exactement comme les humains ? Je vois rarement des programmeurs dire "je me suis planté" avant que le compilateur / les tests unitaires / les tests manuels / la revue de code révèlent un problème. [...] Et de même que mes juniors finiront par s’améliorer, je ne vois aucune raison de supposer que ces problèmes sont inhérents aux LLMs en général et que la prochaine génération ne fera pas mieux à ce niveau.
    Les créateurs sont régulièrement surpris par certains aspects de leur création [...], ce qui est pour moi pile poil dans la définition de "propriété émergente" ? Ou tu penses à autre chose ?

    L'article d'Anthopic est très intéressant.
    J'ai lu en diagonale et ils semblent aborder des phénomènes émergents intéressants, mais assez évidents puisque cela correspond à l'observation (les llm apprennent dans toute langue et restituent la connaissance indépendamment de la langue, les llm planifient leur réponses, etc...).
    C'est fascinant à observer, mais ça reste assez limité, ils semblent toujours incapables de dépasser leur données d’entraînement.
    Si tu prends par exemple la distillation comme méthode d'apprentissage, ça a permis de très largement améliorer les performances des petits modèles ces derniers mois (avec des modèles de 7 à 14 milliards de paramètres loin d'être ridicules et un rapport capacités/coûts incroyables).
    Par contre il y a toujours un plafond de verre.
    Plus le modèle maître est performant, plus l'élève l'est, mais l'élève fait toujours moins bien que le maître.

    C'est à mon avis parce que les IA apprennent par induction et font au mieux quelques déductions et c'est là où le parallèle avec l'humain atteint ses limites à mon sens.

    Je ne dis pas que les wrappers sont entièrement inutiles. Je dis qu’ils sont destinés à être de plus en plus triviaux et comparativement (entre eux) peu impactants à mesure que la qualité des modèles progresse. [...] Si tu préfères tourné comme ça : les modèles sont le facteur limitant (et donc critique), pas les wrappers. [...] Si tu préfères tourné comme ça : les modèles sont le facteur limitant (et donc critique), pas les wrappers.

    Tourné comme ça, tu as raison, c'est implacable.
    Par contre je ne dirais pas que la mise en place d'un système expert permettant de valider ce que produit un llm (surtout sur le long terme) soit un problème résolu.
    Précisément parce que la validation passe par les llm eux même.

    As-tu connaissance de https://arxiv.org/abs/2503.14499, présenté informellement ici : https://x.com/METR_Evals/status/1902384481111322929 ?

    Non, je n'avais jamais entendu parler de ce genre de métrique.
    C'est ce qui m'a fait changer de point de vu sur les capacités des modèles à long terme (souvent un simple graphique vaut mieux que 1000 mots), et surtout sur les perspectives que ça nous ouvre.
    Je continuerai de suivre ça, merci.