j'y ai appris l'existence de Qwen 3.6 MTP... C'est le prochain que je teste.
Alors, ça vaut le coup de l'essayer. Mais je ne veux pas non plus te donner de faux espoirs.
MTP, c'est vraiment quitte ou double. Sur certaines configurations (logiciel, matériel, en fonction du LLM, etc.), ça détériore salement les performances, et sur d'autres, ça double la vitesse de génération des tokens ̄\_(ツ)_/ ̄. Dans tous les cas, ça n'améliore pas la vitesse de préremplissage.
[^] # Re: très éclairant
Posté par Jérôme Flesch (site web personnel) . En réponse au journal Auto-héberger ses LLM (IA) : Débordement CPU+RAM, Mixture-of-Experts et Benchmarks. Évalué à 2 (+0/-0).
Alors, ça vaut le coup de l'essayer. Mais je ne veux pas non plus te donner de faux espoirs.
MTP, c'est vraiment quitte ou double. Sur certaines configurations (logiciel, matériel, en fonction du LLM, etc.), ça détériore salement les performances, et sur d'autres, ça double la vitesse de génération des tokens ̄\_(ツ)_/ ̄. Dans tous les cas, ça n'améliore pas la vitesse de préremplissage.