Faut du courage et se boucher le nez pour lire les commentaires. On le sait bien, pourtant ... c'est un festival. Entre les (paraphrase) « mais les arabes ils ont des esclaves » « c'était les africains qui les vendaient eux même » c'est un festival de clichés de wannabe esclavagistes.
Pour la référence que Maderieros semble avoir raté, le journal Je hais les thèmes sombres, et je peux l'expliquer ou on peut plutôt lire que pour les malvoyants en général, c'est plutôt mieux pour la lisibilité, le blanc partout.
Faut faire attention, je pense que le scraping constants c'est pas forcément pour constituer les jeux de données, il doit y avoir une part d'agents qui font des recherches sur le net pour faire des synthèses en fonction des requêtes des utilisateurs, et intuitivement ça doit être largement plus ce style de requêtes qu'on voit que celles pour la constitution de jeux de données.
Sinon je crois qu'il existe quand même des modèles qui détectent les générations. Je sais pas s'ils sont utilisés, mais je pense que maintenant la qualité du jeu de données et que des filtres sophistiqués sont mis en œuvre pour scorer et filtrer : https://www.catalyzex.com/paper/lp-data-pipeline-lightweight-purpose-driven
Qui peuvent eux même utiliser des modèles pour détecter des trucs. Il existe des modèles qui sont spécifiquement entraînés pour détecter les textes générés par d'autres modèles : https://github.com/TAL-auroraX/ResoFilter (on sait que les modèles ont des biais ou des tics qu'il est possible de détecter par apprentissage spécifique, on doit pouvoir faire ça pour les modèles principaux)
Alors on pouvait déjà s'inquiéter pour le climat avec le boom de l'IA quand les GAFAMS ont dit "fuck la neutralité carbone". Ce n'est que la suite logique du déroulement des opérations. Non seulement ça fout en l'air leurs objectifs en propre mais aussi ça rentre en concurrence (financière par ex.) avec les potentiels efforts de décarbonation des autres.
L'argent d'abord, toujours, et l'argent vite. Pour la transition de l'énergie ça marche quand c'est vraiment la merde genre "il n'y a plus du tout de pétrole" ou "oups c'est la guerre et on bouffe du pétrole vraiment trop vite, quand ça s'arrête tout s'arrête, on a vraiment besoin d'une alternative". Mais on peut craindre que quand ça va repartir ... ben le pétrole sera cramé quand même, on profitera juste de plus d'énergie sous forme d'électricité, ptete pour l'IA pour ... whatever. Faire de l'argent à court terme.
Ben quoi, l'industrie pétrolière fait d'énorme profits, on va quand même pas faire une croix sur tout cet argent en investissant dans les renouvelables !
les données initiales non synthétiques c'est le jeu de donnée d'apprentissage initial. Par exemple une banque d'image, ou un ensemble de texte écrits par des humains, utilisé pour l'apprentissage du modèle.
synthetic_data(model) c'est des données synthétiques, c'est à dire générées en utilisant le modèle, d'une manière ou d'une autre. Dans son algorithmes ces données générées en utilisant le modèle sont ajoutées au jeu de donnée initial pour faire apprendre la génération suivante de modèle.
Si ça laisse pas un nuage de poussière qui va tout masquer et mettre de l'aluminium qui va déstabiliser la chimie de l'atmosphère pendant des plombes ...
On peut pas non plus imaginer augmenter les données d'apprentissage à l'infini, c'est raisonnable d'introduire une limite à la quantité de données. Dans ce contexte, le papier du lien implique une perte de diversité dans la distribution initiale si les données synthétiques remplacent progressivement les donnée.
La méthode de génération des données synthétiques importe peu dans les hypothèses du papier. Et par exemple ça semble évident que si le modèle émet des hypothèses scientifiques et crée des expériences, à la manière d'un scientifique, il n'a pas la possibilité de les tester, il lui faudrait de vraies données pour réellement avancer.
Dernière chose, ce que le papier veut réfuter c'est un peu l'émergence d'une AGI simplement par réapprentissage et croissance exponentielle rapide des performances dans un cadre "on reste dans les datacenter en circuit fermé" je pense, là ou tu peux avoir des boucles rapides.
Je ne le connaissais pas encore, donc j'ai pas utilisé, mais il suffit de préfixer le "bsky" de l'url par un "t" pour l'utiliser.
Le ciel bleu n'est pas vraiment en silo, c'est plus compliqué que ça. Dans le protocole AT il y a des serveurs, les PDS, qui détiennent les données des comptes, et qu'on peut tout à fait héberger, des relais qui peuvent faire de l'agrégation de données, de l'étiquetage (spam, nsfw ...), et des "appviews" pour les présenter (le dérouleur de fil tbsky en est un).
Maintenant il y a un peu tout ça de dispo je crois. Eurosky est un serveur de PDS (pas autohébergé) récemment créé par exemple, alternatif à bsky et pas mal de personnes ont migré, blacksky est un relay / appview alternatif il me semble.
C'est dans l'ordre, numéroté et le dernier post du fil est indiqué comme tel ( genre c'est numéroté 10/n dans le corps et le dernier est indiqué à n=63 qqch comme ça) le seul piège c'est que tout n'est pas chargé d'un coup et qu'il 'aut cliquer sur "charger la suite/les autres réponses" une ou deux fois.
Le point principal du papier n'est pas inattendu évidemment, c'est juste une preuve mathématique que faire réapprendre un LLM à partir de données générées par un ou d'autres LLM mène inévitablement à un effondrement. C'est valable aussi si la proportion de "nouveauté" d'information correcte injectée à chaque réapprentissage est trop faible.
Je note notamment ce commentairece commentaire de Dan Piponi qui pointe que les modèles récent n'ont pas pour but de reproduire la distribution d'apprentissage initial mais aussi de réaliser des tâches hors distribution, et cite le papier
From Entropy to Epiplexity: Rethinking Information for Computationally Bounded Intelligence, qui discute entre autre de comment maximiser l'utilité du modèle à ressource computationnelle contrainte étant donné les jeux d'apprentissages, en disant dépasser les pures notion de théorie de la complexité de l'information utilisées dans l'autre papier.
Ça peut avoir du sens de maintenir un maillage territorial. Sinon si tu vis dans un désert, que t'es vieux et que tu peux plus trop conduire, tu seras bien content d'avoir une bagnole et 150 km à faire pour tous trajets médicaux.
Par ailleurs, c'est une question d'aménagement du territoire et ça marche dans les deux sens : tu supprimes les infrastructures, les emplois associés, les gens vont se barrer. À l'inverse, dans le cadre d'une politique de territoire, ça peut avoir du sens de maintenir des infras dans des coins peu denses, autours de villes moyennes par exemple, et ça peut générer de l'activité et donc rentabiliser les infras, ça attire des gens. Contrairement à laisser des coins à l'abandon ou plus personne ne va vouloir s'installer.
Les grandes villes ont aussi un coût écologique, densifier des villes moyennes peut aussi avoir un sens écologique dans le sens optimisation des ressources. Justement pour alimenter les grandes villes il faut ... cultiver les campagnes et faire venir la nourriture dedans. Et ne pas abandonner ces gens en rase campagne (lol) en gardant des infras dans ces coins n'est sans doute pas idiot.
Il y a plein de trucs qui vont pas dans ton commentaire, mais j'en relève quand même un : tu veux vraiment argumenter qu'avoir un bon réseau cyclable séparé de la circulation auto est un problèmes pour les livreurs à vélo et que leurs besoins ne sont pas pris en compte ?
Alors taper un mot de passe grub on est pas sur du besoin "un manchot sur le bureau pour les masses" par contre, c'est un "détail" pour gens qui bidouillent déjà pas mal non ?
Ça implémente pas tout à fait tes opérations et c'est très très largement plus étendu en fonctionnalité et en ambition par contre. Apparemment multiplier des "Series" calcule un produit scalaire.
Par un espace de dimension infinie, ça c'est les espaces de fonctions (voir Espace Lp). Si l'ensemble des clés est effectivement infini, c'est pas vraiment calculable de manière générique avec une boucle "for" en tout cas, il faut des opérations d'intégrations spécifiques pour un certain espace vectoriel.
C'est plus des opérations génériques sur des espaces vectoriels de dimensions arbitraires, mais finie, sans regarder le code.
[^] # Re: Les commentaires
Posté par thoasm . En réponse au lien La nouvelle municipalité d'extrême droite de Vierzon (Cher) annule la commémoration de l'abolition de l'esclavage du 10 mai. Évalué à 9.
Plus que la qualité de l'argumentaire, ca montre qu'il existe en France une frange de racistes n'ayant aucun problème moral avec l'esclavage.
# Les commentaires
Posté par thoasm . En réponse au lien La nouvelle municipalité d'extrême droite de Vierzon (Cher) annule la commémoration de l'abolition de l'esclavage du 10 mai. Évalué à 4.
Faut du courage et se boucher le nez pour lire les commentaires. On le sait bien, pourtant ... c'est un festival. Entre les (paraphrase) « mais les arabes ils ont des esclaves » « c'était les africains qui les vendaient eux même » c'est un festival de clichés de wannabe esclavagistes.
# Rappel, la pétition à l'assemblée pour que l'état quitte X
Posté par thoasm . En réponse au lien Elon Musk insulte les magistrats français chargés d’enquêter sur de possibles abus de son réseau social X. Évalué à 10.
https://petitions.assemblee-nationale.fr/initiatives/i-2610
[^] # Re: Ne tirez pas sur le pianiste !
Posté par thoasm . En réponse au lien Annonce du nouveau site de LibreOffice. Évalué à 2.
Pour la référence que Maderieros semble avoir raté, le journal Je hais les thèmes sombres, et je peux l'expliquer ou on peut plutôt lire que pour les malvoyants en général, c'est plutôt mieux pour la lisibilité, le blanc partout.
[^] # Re: Paradoxal
Posté par thoasm . En réponse au lien Infographies concernant les symboles d'extrême-droite. Évalué à 4.
https://indextreme.fr/a-propos/
[^] # Re: Ce mec est un génie !
Posté par thoasm . En réponse au lien iPhone : John Ternus tranche entre réparabilité et longévité. Évalué à 4.
Je me demande aussi quelle est la part d'obsolescence logicielle dans le fait qu'un tel soit remplacé ...
[^] # Re: Inventer plutôt que saboter
Posté par thoasm . En réponse au lien Faut-il saboter les datacenters ? (entretien avec Thomas Dekeyser). Évalué à 8.
Si les adversaires sont des drones armés le mot "lutte" risque de prendre un sens un peu différent, cela dit.
[^] # Re: La machine
Posté par thoasm . En réponse au lien Plaques astronomiques : le retour à la lumière (Sciences chrono, France Culture). Évalué à 2.
Chaque tartiflette est unique de ce point de vue en plus. Voire dynamique, faut faire des vidéos.
[^] # Re: Un appel en régie
Posté par thoasm . En réponse au journal Les IA sont-elles courtoises ?. Évalué à 5.
Qui plus est ... ça n'a aucun rapport avec le contenu du journal. Ce n'est en rien un résumé.
[^] # Re: Fil mastodon qui discute le papier
Posté par thoasm . En réponse au lien AI Cannot Self Improve and Math behind PROVES IT!. Évalué à 3.
Faut faire attention, je pense que le scraping constants c'est pas forcément pour constituer les jeux de données, il doit y avoir une part d'agents qui font des recherches sur le net pour faire des synthèses en fonction des requêtes des utilisateurs, et intuitivement ça doit être largement plus ce style de requêtes qu'on voit que celles pour la constitution de jeux de données.
Sinon je crois qu'il existe quand même des modèles qui détectent les générations. Je sais pas s'ils sont utilisés, mais je pense que maintenant la qualité du jeu de données et que des filtres sophistiqués sont mis en œuvre pour scorer et filtrer : https://www.catalyzex.com/paper/lp-data-pipeline-lightweight-purpose-driven
Qui peuvent eux même utiliser des modèles pour détecter des trucs. Il existe des modèles qui sont spécifiquement entraînés pour détecter les textes générés par d'autres modèles : https://github.com/TAL-auroraX/ResoFilter (on sait que les modèles ont des biais ou des tics qu'il est possible de détecter par apprentissage spécifique, on doit pouvoir faire ça pour les modèles principaux)
[^] # Re: Il ne nous reste plus qu'un mème à sortir
Posté par thoasm . En réponse au journal La crise économique qui vient. Évalué à 7.
Alors on pouvait déjà s'inquiéter pour le climat avec le boom de l'IA quand les GAFAMS ont dit "fuck la neutralité carbone". Ce n'est que la suite logique du déroulement des opérations. Non seulement ça fout en l'air leurs objectifs en propre mais aussi ça rentre en concurrence (financière par ex.) avec les potentiels efforts de décarbonation des autres.
L'argent d'abord, toujours, et l'argent vite. Pour la transition de l'énergie ça marche quand c'est vraiment la merde genre "il n'y a plus du tout de pétrole" ou "oups c'est la guerre et on bouffe du pétrole vraiment trop vite, quand ça s'arrête tout s'arrête, on a vraiment besoin d'une alternative". Mais on peut craindre que quand ça va repartir ... ben le pétrole sera cramé quand même, on profitera juste de plus d'énergie sous forme d'électricité, ptete pour l'IA pour ... whatever. Faire de l'argent à court terme.
[^] # Re: Il ne nous reste plus qu'un mème à sortir
Posté par thoasm . En réponse au journal La crise économique qui vient. Évalué à 7.
Ben quoi, l'industrie pétrolière fait d'énorme profits, on va quand même pas faire une croix sur tout cet argent en investissant dans les renouvelables !
[^] # Re: Fil mastodon qui discute le papier
Posté par thoasm . En réponse au lien AI Cannot Self Improve and Math behind PROVES IT!. Évalué à 4.
les données initiales non synthétiques c'est le jeu de donnée d'apprentissage initial. Par exemple une banque d'image, ou un ensemble de texte écrits par des humains, utilisé pour l'apprentissage du modèle.
synthetic_data(model) c'est des données synthétiques, c'est à dire générées en utilisant le modèle, d'une manière ou d'une autre. Dans son algorithmes ces données générées en utilisant le modèle sont ajoutées au jeu de donnée initial pour faire apprendre la génération suivante de modèle.
[^] # Re: Nuit des étoiles filantes
Posté par thoasm . En réponse au lien Dans pas longtemps sur vos écrans : « OMG, Starlink is down ! ». Évalué à 5.
Si ça laisse pas un nuage de poussière qui va tout masquer et mettre de l'aluminium qui va déstabiliser la chimie de l'atmosphère pendant des plombes ...
[^] # Re: Fil mastodon qui discute le papier
Posté par thoasm . En réponse au lien AI Cannot Self Improve and Math behind PROVES IT!. Évalué à 4. Dernière modification le 29 avril 2026 à 12:06.
On peut pas non plus imaginer augmenter les données d'apprentissage à l'infini, c'est raisonnable d'introduire une limite à la quantité de données. Dans ce contexte, le papier du lien implique une perte de diversité dans la distribution initiale si les données synthétiques remplacent progressivement les donnée.
La méthode de génération des données synthétiques importe peu dans les hypothèses du papier. Et par exemple ça semble évident que si le modèle émet des hypothèses scientifiques et crée des expériences, à la manière d'un scientifique, il n'a pas la possibilité de les tester, il lui faudrait de vraies données pour réellement avancer.
Dernière chose, ce que le papier veut réfuter c'est un peu l'émergence d'une AGI simplement par réapprentissage et croissance exponentielle rapide des performances dans un cadre "on reste dans les datacenter en circuit fermé" je pense, là ou tu peux avoir des boucles rapides.
[^] # Re: Difficile à lire
Posté par thoasm . En réponse au lien [fil] Panorama de la philosophie des sciences contemporaine. Évalué à 3.
Il y a un "dérouleur de fil" : https://tbsky.app/profile/cedricbrun.bsky.social/post/3mkikisbqvc2i
Je ne le connaissais pas encore, donc j'ai pas utilisé, mais il suffit de préfixer le "bsky" de l'url par un "t" pour l'utiliser.
Le ciel bleu n'est pas vraiment en silo, c'est plus compliqué que ça. Dans le protocole AT il y a des serveurs, les PDS, qui détiennent les données des comptes, et qu'on peut tout à fait héberger, des relais qui peuvent faire de l'agrégation de données, de l'étiquetage (spam, nsfw ...), et des "appviews" pour les présenter (le dérouleur de fil tbsky en est un).
Maintenant il y a un peu tout ça de dispo je crois. Eurosky est un serveur de PDS (pas autohébergé) récemment créé par exemple, alternatif à bsky et pas mal de personnes ont migré, blacksky est un relay / appview alternatif il me semble.
[^] # Re: Difficile à lire
Posté par thoasm . En réponse au lien [fil] Panorama de la philosophie des sciences contemporaine. Évalué à 3.
C'est dans l'ordre, numéroté et le dernier post du fil est indiqué comme tel ( genre c'est numéroté 10/n dans le corps et le dernier est indiqué à n=63 qqch comme ça) le seul piège c'est que tout n'est pas chargé d'un coup et qu'il 'aut cliquer sur "charger la suite/les autres réponses" une ou deux fois.
# Fil mastodon qui discute le papier
Posté par thoasm . En réponse au lien AI Cannot Self Improve and Math behind PROVES IT!. Évalué à 6.
Le point principal du papier n'est pas inattendu évidemment, c'est juste une preuve mathématique que faire réapprendre un LLM à partir de données générées par un ou d'autres LLM mène inévitablement à un effondrement. C'est valable aussi si la proportion de "nouveauté" d'information correcte injectée à chaque réapprentissage est trop faible.
Ce fil Mastodon discute de tout ça.
Je note notamment ce commentairece commentaire de Dan Piponi qui pointe que les modèles récent n'ont pas pour but de reproduire la distribution d'apprentissage initial mais aussi de réaliser des tâches hors distribution, et cite le papier
From Entropy to Epiplexity: Rethinking Information for Computationally Bounded Intelligence, qui discute entre autre de comment maximiser l'utilité du modèle à ressource computationnelle contrainte étant donné les jeux d'apprentissages, en disant dépasser les pures notion de théorie de la complexité de l'information utilisées dans l'autre papier.
[^] # Re: de toute facon
Posté par thoasm . En réponse au lien Oui, la France peut vivre sans voiture (cette étude le prouve). Évalué à 5. Dernière modification le 21 avril 2026 à 13:06.
Ça peut avoir du sens de maintenir un maillage territorial. Sinon si tu vis dans un désert, que t'es vieux et que tu peux plus trop conduire, tu seras bien content d'avoir une bagnole et 150 km à faire pour tous trajets médicaux.
Par ailleurs, c'est une question d'aménagement du territoire et ça marche dans les deux sens : tu supprimes les infrastructures, les emplois associés, les gens vont se barrer. À l'inverse, dans le cadre d'une politique de territoire, ça peut avoir du sens de maintenir des infras dans des coins peu denses, autours de villes moyennes par exemple, et ça peut générer de l'activité et donc rentabiliser les infras, ça attire des gens. Contrairement à laisser des coins à l'abandon ou plus personne ne va vouloir s'installer.
Les grandes villes ont aussi un coût écologique, densifier des villes moyennes peut aussi avoir un sens écologique dans le sens optimisation des ressources. Justement pour alimenter les grandes villes il faut ... cultiver les campagnes et faire venir la nourriture dedans. Et ne pas abandonner ces gens en rase campagne (lol) en gardant des infras dans ces coins n'est sans doute pas idiot.
[^] # Re: de toute facon
Posté par thoasm . En réponse au lien Oui, la France peut vivre sans voiture (cette étude le prouve). Évalué à 6.
Il y a plein de trucs qui vont pas dans ton commentaire, mais j'en relève quand même un : tu veux vraiment argumenter qu'avoir un bon réseau cyclable séparé de la circulation auto est un problèmes pour les livreurs à vélo et que leurs besoins ne sont pas pris en compte ?
[^] # Re: Alors non
Posté par thoasm . En réponse au journal Des ciseaux à bouts ronds pour gérer nos ordis - Wrappers on Linux Workstations. Évalué à 5.
Alors taper un mot de passe grub on est pas sur du besoin "un manchot sur le bureau pour les masses" par contre, c'est un "détail" pour gens qui bidouillent déjà pas mal non ?
[^] # Re: Ceci n'est pas un journal
Posté par thoasm . En réponse au lien Remise en service d'une chaîne hifi de 1990. Évalué à 7.
La traduction intégrée à FF c'est pas des modèles en lignes, c'est des modèles locaux. Cf. https://www.firefox.com/fr/features/translate/
[^] # Re: Il dit qu'il n'a plus de genou
Posté par thoasm . En réponse au journal PoC : Transformer les tableaux associatifs (dict/map) en vecteur algébrique. Évalué à 3.
Ni l'inspiration avec d'autres projets !
[^] # Re: Il dit qu'il n'a plus de genou
Posté par thoasm . En réponse au journal PoC : Transformer les tableaux associatifs (dict/map) en vecteur algébrique. Évalué à 4. Dernière modification le 16 avril 2026 à 20:52.
Sinon les opérations algébriques sur des vecteurs avec des "noms de colonne" ça fait aussi penser aux "DataFrame" de pandas pour les stats : https://pandas.pydata.org/docs/reference/frame.html
Ça implémente pas tout à fait tes opérations et c'est très très largement plus étendu en fonctionnalité et en ambition par contre. Apparemment multiplier des "Series" calcule un produit scalaire.
Comment calculer une matrice de similarité d'un ensemble de vecteurs avec cette librairie combinée avec d'autres en quelques ligne : https://stackoverflow.com/questions/45387476/cosine-similarity-between-each-row-in-a-dataframe-in-python
[^] # Re: Il dit qu'il n'a plus de genou
Posté par thoasm . En réponse au journal PoC : Transformer les tableaux associatifs (dict/map) en vecteur algébrique. Évalué à 5.
Par un espace de dimension infinie, ça c'est les espaces de fonctions (voir Espace Lp). Si l'ensemble des clés est effectivement infini, c'est pas vraiment calculable de manière générique avec une boucle "for" en tout cas, il faut des opérations d'intégrations spécifiques pour un certain espace vectoriel.
C'est plus des opérations génériques sur des espaces vectoriels de dimensions arbitraires, mais finie, sans regarder le code.