Je m'étais posé la question, j'avais trouvé ça (je précise que j'y entrave pas grand chose à l'ia et que ce domaine particulier me semble encore plus hermétique) :
PaLM pourrait surpasser GPT-3, cependant, avant de vous enthousiasmer pour cette variante open source et de courir la télécharger, vous devez savoir quelque chose. Le système n’a pas encore été formé, il n’est donc pas capable d’établir une conversation avec vous comme le ChatGPT. Selon son créateur, PaLM + RLHF n’est qu’un bateau et une carte générale, car il faut des millions de dollars de calculs et de données pour naviguer au bon endroit dans un espace de paramètres à haute dimension.
Quand Wang parle de millions de dollars, il ne plaisante pas. Selon une étude publiée par l’université de Cornell pour former un modèle de 1,5 milliard de paramètres coûterait 1,6 million de dollars.
Bloom, un modèle de source ouverte qui possède un nombre de paramètres similaire à celui de GPT-3, a nécessité trois mois d’entraînement en utilisant 384 cartes NVIDIA A1000, d’une valeur estimée à 32 200 dollars chacune. À titre de référence, le PaLM compte 540 milliards de paramètres.
Philip Wang mentionne que même avec le navire et la carte en main – comme il définit le PaLM + RLHF – il faut encore des marins professionnels pour le guider jusqu’au port. D’autres experts affirment qu’il faut non seulement un matériel puissant, mais aussi une infrastructure adéquate et des logiciels capables de mener à bien la tâche de formation.
Le vrai frein c'est le pognon.
Après je sais pas ce que ça vaut, mais étonnement y a Meta qui fait un équivalent opensource et qui publie le modèle entraîné : https://github.com/facebookresearch/metaseq
J'ai fais des recherches sur les issue, (toujours à prendre avec des pincette) apparemment le plus important c'est la vram qui doit pouvoir contenir le modèle et faire de l'inférence dessus :
30B parameter models are already large enough to exhibit some of the more interesting emergent phenomena of LLMs. Quantized to 8 bits, it might be possible to squeeze into 2, better three 3090s. But the models also seem undercooked, slightly to strongly under-performing GPT-3 in a lot of tasks. To further train the same model is now looking at > 100 GB, possibly 200GB of VRAM.
Donc pour avoir chatPGT dans une tour il faudrait en gros une machine puissante, en adéquation avec les cartes graphiques qu'elle contient (et sûrement un paquet de stockage aussi). Donc une archi serveur et potentiellement des grappes de GPU.
Avec des A100 80 Go de nvidia on pourrait en avoir juste 2 pour commencer.
[^] # Re: Microsoft - comment dire -
Posté par Aldebaran (site web personnel) . En réponse au lien « Nous avions tort » : en dévoilant GPT-4, OpenAI dit rejeter l’open source désormais . Évalué à 5.
Je m'étais posé la question, j'avais trouvé ça (je précise que j'y entrave pas grand chose à l'ia et que ce domaine particulier me semble encore plus hermétique) :
https://github.com/lucidrains/PaLM-rlhf-pytorch
Un truc dont je ne trouve plus la source :
Le vrai frein c'est le pognon.
Après je sais pas ce que ça vaut, mais étonnement y a Meta qui fait un équivalent opensource et qui publie le modèle entraîné : https://github.com/facebookresearch/metaseq
J'ai fais des recherches sur les issue, (toujours à prendre avec des pincette) apparemment le plus important c'est la vram qui doit pouvoir contenir le modèle et faire de l'inférence dessus :
Donc pour avoir chatPGT dans une tour il faudrait en gros une machine puissante, en adéquation avec les cartes graphiques qu'elle contient (et sûrement un paquet de stockage aussi). Donc une archi serveur et potentiellement des grappes de GPU.
Avec des A100 80 Go de nvidia on pourrait en avoir juste 2 pour commencer.
Elles sont à 20K l'une sur aliexpress.