• [^] # Re: Effondrement ?

    Posté par . En réponse au journal LLM (encore), effondrement et travail humain. Évalué à 3.

    Parce que si c’est mesurable, c’est détectable, et c’est mesurable ? Regarde la définition sur la page Wikipedia en anglais :

    Shumailov et al.[9] coined the term and described two specific stages to the degradation: early model collapse and late model collapse. In early model collapse, the model begins losing information about the tails of the distribution – mostly affecting minority data. Later work highlighted that early model collapse is hard to notice, since overall performance may appear to improve, while the model loses performance on minority data.[13] In late model collapse, the model loses a significant proportion of its performance, confusing concepts and losing most of its variance.

    Donc, procédure simple : avant d’intégrer une nouvelle page dans ton corpus d’entraînement pour ton prochaine modèle, fine-tuner le modèle existant sur la nouvelle page, et voir si la variance baisse (regarder le kurtosis aussi pour détecter le premier stade).

    Cette procédure exacte est probablement bien trop prohibitivement coûteuse, mais ça montre que c’est probablement solvable en principe.

    En pratique ?

    • Il y a déjà un processus de filtrage, cf le papier de Llama3 : « These improvements include the development of more careful pre-processing and curation pipelines for pre-training data »
      • Une méthode stupide et qui fonctionne plutôt bien (relativement à la stupidité) est de demander au modèle actuel de juger de la qualité des données (même papier de Llama 3) : « To train a quality classifier based on Llama 2, we create a training set of cleaned web documents, describe the quality requirements, and instruct Llama 2’s chat model to determine if the documents meets these requirements »
    • Ce papier semble dire que ce n’est pas un problème si les données originelles sont toujours présentes ? L’article cité par Wikipedia, par exemple, considère le cas où on entraîne les données du modèle n+1 par des données générées pas le modèle n, alors qu’en pratique on entraîne le modèle n+1 par les données initiales + des données générées par le modèle n (si ce n’est pas claire : la figure 1 du papier illustre bien la différence). À prendre avec quelques pincettes toutefois, le phénomène de model collapse a été observé dans d’autres circonstances (RLHF par exemple). La réalité est probablement entre les deux, où garder les données initiales permet de mitiger mais pas éliminer le phénomène.
    • Il y a probablement d’autres méthodes. Par exemple, publiquement, il y a ça. Ce n’est pas un domaine sur lequel je m’attend à voir les gros labos (DeepMind/Anthropic/OpenAI) publier leurs méthodes toutefois, tout ce qui concerne le pre-training est généralement jalousement gardé depuis 2-3 ans.
    • Solution non-technique : ne garder que des sources à peu près sûres sur les nouvelles données (Wikipedia, journaux).

    Autre point extrêmement important : le model collapse n’arrive que lors de l’ingestion indiscriminée de données générées par un autre modèle. Dès lors qu’il y a curation par une méthode de validation externe (par exemple, un humain), une décision binaire (incorporer le texte dans le corpus ou non) suffit.

    C’est connu depuis AlphaZero, où le modèle s’est entraîné avec lui-même (des parties générées par lui-même). L’ingrédient « secret » dans ce cas est le bit « quel côté a gagné la partie ? » fourni par un validateur externe. Ce papier explore la même question par l’angle explicite du "model collapse".

    Pourquoi est-ce important ? Parce que ça fait un moment que les labos prévoient exactement ce problème de non pas vraiment de "l’internet est pollué" mais "on va arriver à court de données de qualité". La solution est de "générer des données à partir des modèles existants". Le problème est maintenant "model collapse". La solution est "validateur externe", préférablement automatisé, par exemple : AlphaProof. Les modèles de raisonnement actuels sont très probablement une variante plus ou moins directe de ça (c’est explicitement le cas de DeepSeek R1).