C'est moins il a un modèle du monde que ce que l'on a formalisé textuellement et dont on lui donne suffisamment de contenu il saura le reproduire (en même temps ça a était fait pour ça).
Ben trivialement non puisque si c'était simplement ça il n'y aurait rien qui ressorte en dehors de son corpus original, juste de l'apprentissage par coeur. Donc si il ressort des trucs qui ne sont pas dans son corpus c'est parce qu'il y a une forme de généralisation, plus ou moins poussée. Les échecs montrent qu'il est largement capable, cf. Mr. Phi justement, de sortir des parties correctes avec des coups qui ne sont pas dans son corpus, donc il généralise, et c'est un début de modèle des échecs, faut compresser l'info dans quelque chose qui ressemblent àdes règles dans le réseau pour faire ça (je suis pas en train de dire qu'il est capable de jouer juste avec une description textuelle des règles ou qu'il peut sortir une description textuelle quand il avale pleins de parties)
Pou la formalisation textuelle, oui c'est le principe des modèles de langue, mais on peut capturer beaucoup du monde avec des textes. Après le problème de correspondance image / description textuelle, donc si on imagine qu'il a quelque representation du monde "linguistique" et celui de la représentation des images c'est intéressant et pas forcément concluant de ce que j'ai pu voir.
On suppute qu'il a, pour les images, en interne, des modèles hiérarchiques des objets a dessiner (ça permet de gérer l'affichage à différentes échelles avec plus ou moins de détails), on sait qu'il y a correspondance avec des étiquettes linguistiques, faut voir jusqu'où on peut combiner une généralisation de structure linguistique genre "la robe de la femme est rouge" ou le réseau a tout a fait pu apprendre qu'elle aurait pu être verte ou que les deux sont des couleurs, avec ce que le reseau d'image a pu apprendre de comment structurer une image. il sait probablement colorer des objets. Pour aller beaucoup plus loin et avoir des descriptions riches faut généraliser des informations de positions, les combiner avec des infos de couleur et des informations culturelles, d'époque ...) souplesse que permet le langage facilement, pouvoir combiner des prompts, avec des combinaisons a l'infini. Un réseau qui généralise correctement aura "compris" ou au moins isolé toutes ces caractéristique et saura faire des combinaisons. Voire évaluer les combinaisons les plus plausibles.
[^] # Re: enthousiasme
Posté par thoasm . En réponse au journal décrire une une image avec une iA locale. Évalué à 2.
Ben trivialement non puisque si c'était simplement ça il n'y aurait rien qui ressorte en dehors de son corpus original, juste de l'apprentissage par coeur. Donc si il ressort des trucs qui ne sont pas dans son corpus c'est parce qu'il y a une forme de généralisation, plus ou moins poussée. Les échecs montrent qu'il est largement capable, cf. Mr. Phi justement, de sortir des parties correctes avec des coups qui ne sont pas dans son corpus, donc il généralise, et c'est un début de modèle des échecs, faut compresser l'info dans quelque chose qui ressemblent àdes règles dans le réseau pour faire ça (je suis pas en train de dire qu'il est capable de jouer juste avec une description textuelle des règles ou qu'il peut sortir une description textuelle quand il avale pleins de parties)
Pou la formalisation textuelle, oui c'est le principe des modèles de langue, mais on peut capturer beaucoup du monde avec des textes. Après le problème de correspondance image / description textuelle, donc si on imagine qu'il a quelque representation du monde "linguistique" et celui de la représentation des images c'est intéressant et pas forcément concluant de ce que j'ai pu voir.
On suppute qu'il a, pour les images, en interne, des modèles hiérarchiques des objets a dessiner (ça permet de gérer l'affichage à différentes échelles avec plus ou moins de détails), on sait qu'il y a correspondance avec des étiquettes linguistiques, faut voir jusqu'où on peut combiner une généralisation de structure linguistique genre "la robe de la femme est rouge" ou le réseau a tout a fait pu apprendre qu'elle aurait pu être verte ou que les deux sont des couleurs, avec ce que le reseau d'image a pu apprendre de comment structurer une image. il sait probablement colorer des objets. Pour aller beaucoup plus loin et avoir des descriptions riches faut généraliser des informations de positions, les combiner avec des infos de couleur et des informations culturelles, d'époque ...) souplesse que permet le langage facilement, pouvoir combiner des prompts, avec des combinaisons a l'infini. Un réseau qui généralise correctement aura "compris" ou au moins isolé toutes ces caractéristique et saura faire des combinaisons. Voire évaluer les combinaisons les plus plausibles.