j'ai lu tout le journal, et maintenant je suis obligé de lire les précédents...
Tes chiffres confirment ce que Claude avait fini par conclure quand j'ai envisagé d'acheter une RTX 3060 d'occasion.
Pour faire court : Ma config est limitée par la quantité de VRAM et la bande passante de la RAM. Une 3060 n'y changera presque rien, à part peut être une occupation VRAM légèrement inférieure à cause de certaines instructions inexistantes sur les GPU de génération Pascal.
J'ai un i7-7700k 32Go/2400 et une Titan Xp Pascal 12GB ~540GB/s
J'ai fait faire des tests à mon Qwen3.6 35B A3B_Q4K en mode agent, avec les même valeurs de contexte (hors scaffolding ~2450tk), et j'obtiens les résultats suivants :
Palier visé │ Tok utiles │ Prefill tok/s │ Prédiction tok/s │ Tok générés
1 000 │ 1 084 │ 352.6 │ 22.3 │ 227
2 000 │ 2 161 │ 367.9 │ 23.1 │ 256
4 000 │ 4 334 │ 383.7 │ 23.0 │ 161
8 000 │ 8 659 │ 373.3 │ 21.9 │ 204
16 000 │ 17 375 │ 358.8 │ 21.7 │ 256
32 000 │ 34 810 │ 320.2 │ 21.2 │ 171
Je me permet de faire une suggestion.
J'ai découvert récemment que la vitesse de prefill pouvait être améliorée en jouant sur un paramètre. J'ai obtenu ces résultats avec la valeur modifiée, qui a tout changé au prix d'une légère augmentation de l'occupation VRAM :
--ubatch-size, passé de 512 (défaut) à 1536. Gain mesuré : +91% sur le prefill de Qwen3.6, un peu moins pour Gemma 4 26B A4B.
Tu l'as sûrement déjà fait au vu de tes résultats, mais comme tu n'en fais pas mention j'ai jugé utile de le mentionner.
# très éclairant
Posté par mmarc67 . En réponse au journal Auto-héberger ses LLM (IA) : Débordement CPU+RAM, Mixture-of-Experts et Benchmarks. Évalué à 3 (+4/-1).
j'ai lu tout le journal, et maintenant je suis obligé de lire les précédents...
Tes chiffres confirment ce que Claude avait fini par conclure quand j'ai envisagé d'acheter une RTX 3060 d'occasion.
Pour faire court : Ma config est limitée par la quantité de VRAM et la bande passante de la RAM. Une 3060 n'y changera presque rien, à part peut être une occupation VRAM légèrement inférieure à cause de certaines instructions inexistantes sur les GPU de génération Pascal.
J'ai un i7-7700k 32Go/2400 et une Titan Xp Pascal 12GB ~540GB/s
J'ai fait faire des tests à mon Qwen3.6 35B A3B_Q4K en mode agent, avec les même valeurs de contexte (hors scaffolding ~2450tk), et j'obtiens les résultats suivants :
Palier visé │ Tok utiles │ Prefill tok/s │ Prédiction tok/s │ Tok générés
1 000 │ 1 084 │ 352.6 │ 22.3 │ 227
2 000 │ 2 161 │ 367.9 │ 23.1 │ 256
4 000 │ 4 334 │ 383.7 │ 23.0 │ 161
8 000 │ 8 659 │ 373.3 │ 21.9 │ 204
16 000 │ 17 375 │ 358.8 │ 21.7 │ 256
32 000 │ 34 810 │ 320.2 │ 21.2 │ 171
Je me permet de faire une suggestion.
J'ai découvert récemment que la vitesse de prefill pouvait être améliorée en jouant sur un paramètre. J'ai obtenu ces résultats avec la valeur modifiée, qui a tout changé au prix d'une légère augmentation de l'occupation VRAM :
--ubatch-size, passé de 512 (défaut) à 1536. Gain mesuré : +91% sur le prefill de Qwen3.6, un peu moins pour Gemma 4 26B A4B.
Tu l'as sûrement déjà fait au vu de tes résultats, mais comme tu n'en fais pas mention j'ai jugé utile de le mentionner.