• [^] # Re: ia routeur

    Posté par . En réponse au lien Une IA conçoit un ordinateur Linux fonctionnel en une semaine. Évalué à 4.

    C'est de l'apprentissage par renforcement ça, pas vraiment des TRM si je ne m'abuse. Les TRM c'est une optimisation de l'apprentissage.

    Il y a une réponse attendue et il y plusieurs passe ou le réseau essaye d'améliorer sa réponse, puis modifie les poids des neurones de manière plus maligne que habituellement ou tu calcules juste un gradient pour aller davantage vers la bonne réponse avec une seule passe dans le réseau.

    Il y a une histoire de calcul de point fixe dans l'histoire, à priori l'algo d'apprentissage fait modifier les poids des neurones de manière optimale (ou quasi) étant donné l'exemple, là ou la descente de gradient classique ne fait qu'un tout petit pas : https://github.com/SamsungSAILMontreal/TinyRecursiveModels

    Là on sait pas grand chose de si des TRM sont utilisés ou comment ils ont appris. C'est pas des LLMs certes, mais c'est plus qu'au lieux de connaître à l'avance tout le jeu d'apprentissage, une solution est générée, est évaluée pour savoir si elle est physiquement correct, et en fonction de l'évaluation soit tu tires les poids des neurones pour générer plus des solutions qui ressemblent, soit tu pénalises (?) ou truc du genre. Et tu répètes. Le fait d'avoir une fonction d'évaluation des solutions permet de ne pas forcément avoir besoin d'un gros jeu d'apprentissage, c'est la différence avec les LLMs. Et c'est indépendant de l'algorithme utilisé pour la modification des poids du réseau : descente de gradient stochastique "classique" pour les LLMs et minimiser les erreurs de prédiction sur le jeu d'apprentissage, a priori pareil pour les TRMs on minimise les erreurs de prédiction mais ce n'est pas du tout une bête descente de gradient, et les réseaux sont utilisés différemment (ils ont une phase de "raisonnement" "récursive" pendant l'apprentissage).