• [^] # Re: TL;DR de ce texte savoureux, équilibré, mais pas exactement concis.

    Posté par . En réponse au lien Innover sans les « marchés », ou l’IA autrement - Lordon. Évalué à -1 (+0/-3).

    C'est un peu péremptoire.

    2 + 2 = 4 est péremptoire, ce n’est pas pour autant faux.

    De nombreux LLM, tant open-source, open-weight (et peut être proprio), existent sans pré-entrainement sur des données volées, ni sur un volume aussi conséquent que les ténors pour arriver à une performance à peine moindre.

    Tu connais beaucoup de carré à 3 côtés ? D’après toi ça veut dire quoi le large de LLM ? Il n’y a pas de LLM sans données massives par définition. Tu peut trouver ça péremptoire mais c’est juste un fait. Tu as par contre les SLM qui tentent d’utiliser moins de données d’entraînement, mais ils ne concurrencent les LLM que sur des tâches bien précises.

    DeepMind a amélioré le ratio données d’entraînement par paramètre avec Chinchilla de manière théorique.

    Maintenant prenons ces valeureux modèles chinois. Deepseek V1 qui avait impressionné parce qu’il utilisait peu de données. C’est 2 000 milliard de tokens d’entraînement soit 15 000 milliard de mots. Ça parle pas beaucoup si je prends le premier lien que je trouve, prenons 1 livre = 75 000 mots. C’est 200 millions de livres. La BNF c’est 17 millions de livres, la plus grande bibliothèque du monde c’est 22 millions de livre (celle du congrès américain). Je ne compte que les livres ils ont beaucoup d’autres choses comme des coupures des journaux, etc qui sont plus petits si tu veut les compter ça fait 170 millions de trucs à comparer à 200 millions de livres.

    Mais c’est la V1 aujourd’hui ils sont à 14 000 milliards de tokens d’entraînement donc 7 fois plus (source).

    Il faut savoir que dans ceux qui tentent de réduire certains utilisent la distillation qui consiste à utiliser un gros LLM pour créer des données d’entraînement de meilleur qualité. L’honnêteté intellectuelle nous interdit de considérer ça comme déconnecter de la rapace-rie dont on parlait.

    Allait regardons les autres :

    Note que rien ne dit qu’on peut faire la même chose que les LLM avec des SLM, il ne faut pas confondre augmenter le nombre de paramètre n’est pas pertinent avec réduire le nombre de paramètres produit mieux.

    Rien que l’origine théorique de tout ça vient de chez Google.

    Oui, grâce à la recherche (le "jus de cerveau") sans dépenser des milliards pour cela.

    Lordon t’expliquerait qu’on ne peut pas retirer la matérialité à ces recherches. Il faut créer un contexte pour que ça advienne. Ce n’est pas un chercheur dans sa chambre. C’est un employé de DeepMind qui s’appuie sur 20 ans de travail dans un laboratoire qui a pu avoir accès à des ressources monstrueuses. Est-ce que les LLM existeraient sans le travail que DeepMind a fait pour comprendre les réseaux de neurones profond ? C’est à prouver.

    Quant au modèle de la Chine, Lordon indique bien les limites du modèle

    Et moi je dit que ce n’est pas une limite mais que c’est fondamentalement problématique.

    Il aurait été beaucoup moins évident de démonter l'argumentation d'Arthur Mensch avec un modèle économique théorique plus vertueux ... mais qui n'existe pas !

    Mais il ne la démonte pas. Il dit qu’à la place de la peste on pourrait passer au cholera. Ces technologies sont intrinsèquement ultra capitaliste. Tu peut vouloir déréguler ou au contraire être autoritaire ça ne change pas ce que c’est.

    https://linuxfr.org/users/barmic/journaux/y-en-a-marre-de-ce-gros-troll