• [^] # Re: Any purpose

    Posté par . En réponse au journal L'OSI publie une définition de l'IA "opensource"... mais pas trop?. Évalué à 4.

    une IA ne sait que recracher les données qu'on lui a fourni en les réarrangeant ou réoragnisant de manière plus ou moins convenable.

    Le réseau de neurones est un "modèle" des données, l'idée c'est plus de faire de la "compression" : un modèle doit capturer l'information utile sans tout apprendre par cœur : on essaye de le faire "généraliser" au dela des exemples d'apprentissage, en utilisant moins de mémoire.

    Une intuition autour de ça c'est la notion d'auto-encodeur : c'est un réseau de neurones multicouche avec un goulot d'étranglement d'information au milieu (une couche avec moins de neurones, donc moins de capacités de mémorisation "brute", qui force a sélectionner les infos, qu'on entraîne en essayant de lui faire reconstruire les informations originales. Il doit donc obtenir les meilleures performances en moyenne sur tous le corpus. En faisant ça on essaye donc de lui faire généraliser un maximum en compressant l'information (mon correcteur auto me fait une blague lapsus, il a mis "comprenant" compresser= comprendre ?)

    On peut imaginer qu'en le "poussant" ainsi a sélectionner l'info on aille plus loin que de lui faire recracher des bouts, mais plus au minimum apprendre des motifs pertinents : a quoi ressemble un chien morphologiquement, a quoi ressemble une fourrure animale, par exemple, avec comme preuve de "séparation" des deux notions qu'on peut demander a dessiner un chien à fourrure d'ours ou un chien à plume.

    Les modèles y arrivent dans une certaine mesure. En passant cette logique au max on peut se demander si il y a moyen de les faire raisonner mathématiquement, en poussant l'abstraction bien plus loin et apprendre des règles de raisonnement correctesqui s'appliquent a de larges classes de problemes mathématiques. Il y a des résultats quand on les spécialisent sur une tâche en particulier, mais les modèles généralistes c'est plus dur (cf. par exemple une vidéo de mathématicien Tom Crawford sur YT "chatgpt (still) can't do maths", ou la on voit clairement qu'il ne raisonne pas (il prend les problèmes d'un concours de maths) mais prend l'apparence d'un raisonnement, éventuellement des arguments qui pourraient être pertinents, puis se vautre dans l'erreur et le non sens en élaborant avant de potentiellement miraculeusement retomber sur ses pattes, ou se vautrer sur la conclusion (plus souvent)

    Mais le truc c'est qu'il y a un continuum : pour recracher des trucs "plausibles" faut sélectionner l'info pertinente, et en faisant ça tu n'est pas a l'abri de cacher suffisamment de structuration dans cette sélection d'info pour avoir capture la structure sous-jacente de ce qu'on attend du résultat. C'est un pré-requis en fait, sinon on dit que le modèle fait du "sur-apprentissage". Il y a un genre de continuum entre apprendre par coeur et recracher, avec toute l'info dans le modele, autant de bits d'info dedans que dans le corpus, et un modèle qui aurait appris a exécuter un algorithme qui ne retient rien des données mais qui donne le bon résultat en extrapolant sur n'importe quoi.