• [^] # Re: Dense ?

    Posté par (site web personnel) . En réponse au journal Auto-héberger ses LLM (IA) : Interfaces utilisateur. Évalué à 4 (+2/-0). Dernière modification le 20 septembre 2026 à 16:51.

    Cela signifie-t-il qu’on peut utiliser un modèle qui nécessite davantage que 16GB de RAM, mais n’est pas dense et donc se contenterait quand même de mes 16GB ?

    Attention à la confusion entre VRAM (la RAM de la carte graphique) et la RAM (la RAM du CPU) !

    Si tu veux effectivement dire que tu n'as que 16 Go de RAM (et, je suppose, encore moins de VRAM), tu vas avoir du mal à faire tourner quoique ce soit de correct (dense ou non). Tu vas être restreint aux très petits LLM (denses) qui sont bêtes comme des caillous.

    Si tu voulais dire que tu as 16 Go de VRAM (et, je suppose, assez de RAM), alors oui : les modèles "pas denses", ce sont les MoE (Mixture-of-Experts). Et ils permettent justement ça.

    Avec l'option --cpu-moe, les éléments du MoE qui sont systématiquement sollicités à chaque token sont gérés par la carte graphique et sont mis en VRAM. Les autres (les experts) sont gérés par le CPU et sont en RAM classique. Et en terme d'occupation mémoire, les experts représentent la plus grosse partie d'un modèle MoE. Mais comme un seul expert est sollicité à chaque token (simplification), ils sont plus rapides à traiter, et le CPU seul peut s'en occuper.

    Grâce à ça, avec tes 16 Go de VRAM, si tu as assez de RAM, tu peux faire tourner un MoE comme qwen 3.6 35b par exemple sans problème, même si il occupe plus de 20 Go de RAM/VRAM.

    Voir:

    (Initialement, avec les MoE, je pensais que la vitesse de génération était OK, mais que la vitesse de preremplissage allait pêcher quand même ; d'où mon corrigendum : en fait, le préremplissage peut être optimisé et arriver à un niveau tout à fait satisfaisant).