• [^] # Re: Fil mastodon qui discute le papier

    Posté par . En réponse au lien AI Cannot Self Improve and Math behind PROVES IT!. Évalué à 3 (+1/-1).

    Faut faire attention, je pense que le scraping constants c'est pas forcément pour constituer les jeux de données, il doit y avoir une part d'agents qui font des recherches sur le net pour faire des synthèses en fonction des requêtes des utilisateurs, et intuitivement ça doit être largement plus ce style de requêtes qu'on voit que celles pour la constitution de jeux de données.

    Sinon je crois qu'il existe quand même des modèles qui détectent les générations. Je sais pas s'ils sont utilisés, mais je pense que maintenant la qualité du jeu de données et que des filtres sophistiqués sont mis en œuvre pour scorer et filtrer : https://www.catalyzex.com/paper/lp-data-pipeline-lightweight-purpose-driven

    Qui peuvent eux même utiliser des modèles pour détecter des trucs. Il existe des modèles qui sont spécifiquement entraînés pour détecter les textes générés par d'autres modèles : https://github.com/TAL-auroraX/ResoFilter (on sait que les modèles ont des biais ou des tics qu'il est possible de détecter par apprentissage spécifique, on doit pouvoir faire ça pour les modèles principaux)