Points clés :
- Binaire : ./build/bin/llama-server
- Config preset : llama.cpp-router-config-llm.ini (définit les modèles disponibles)
- Mode routeur : activé via --models-preset avec un fichier INI listant les modèles
- GPU : toutes les couches sur GPU (-1), GPU principal 0
- Flash attention : activée
- Cache KV : type-k q8_0, type-v q5_1, réutilisation 256 (dans les versions commentées)
- Mise en veille : 60s d'inactivité avant libération
- Logs : verbosité 4, couleurs désactivées, écrit dans /tmp/llama.cpp-router.log
Le fichier .ini :
; https://github.com/ggml-org/llama.cpp/pull/17859version=1; Global presets[*]fit=onjinja=oncpu-moe=falsespec-draft-cpu-moe=falseno-cache-idle-slots=truekeep=4096ctx-checkpoints=12checkpoint-min-step=1024spec-draft-type-k=q8_0spec-draft-type-v=q5_1cache-type-k=q8_0cache-type-v=q5_1kv-unified=truereasoning-budget=2048reasoning-budget-message=... okay, now here is the answer.; Preset for Qwen3.5-4B-MTP-Q4_K_M.gguf[Qwen3.5-4B-MTP-Q4_K_M]model=/chemin/vers/Qwen3.5-4B-MTP-Q4_K_M.gguffit-ctx=0temp=0.7top-p=0.95top-k=20min-p=0.0presence-penalty=1.5repeat-penalty=1.0spec-type=draft-mtpspec-draft-n-max=2chat-template-file=/chemin/vers/Qwen3.5-4B.jinja; Preset for Qwen3.6-35B-A3B-MXFP4.gguf[Qwen3.6-35B-A3B-MXFP4]model=/chemin/vers/Qwen3.6-35B-A3B-MXFP4.gguffit-ctx=0temp=0.6top-p=0.95top-k=20min-p=0.0presence-penalty=0.9repeat-penalty=1.0no-context-shift=truechat-template-kwargs="{'preserve_thinking': true}"chat-template-file=/chemin/vers/Qwen3.6-35B-A3B.jinja; Preset for Qwen3.6-27B-Q4_K_M.gguf[Qwen3.6-27B-Q4_K_M]model=/chemin/vers/Qwen3.6-27B-Q4_K_M.gguffit-ctx=131072temp=0.6top-p=0.95top-k=20min-p=0.0presence-penalty=0.9repeat-penalty=1.0no-context-shift=truespec-type=nonechat-template-kwargs="{'preserve_thinking': true}"chat-template-file=/chemin/vers/Qwen3.6-27B.jinja
La documentation sur le mode routeur se trouve principalement dans ces fichiers :
Les options principales :
- --models-preset PATH — fichier INI avec les presets modèles
- --models-dir PATH — dossier contenant les GGUF (auto-découverte)
- --models-max N — nombre max de modèles chargés simultanément
- --models-autoload — auto-chargement des modèles (activé par défaut)
[^] # Re: llama.cpp router mode
Posté par i M@N (site web personnel) . En réponse au journal 'gégé' : enfin de l'IA dans ton shell !. Évalué à 6 (+5/-0).
Oui, c'est comme ça que je l'utilise avec un fichier .ini :
La commande pour lancer llama.cpp en mode routeur :
Points clés :
- Binaire :
./build/bin/llama-server- Config preset :
llama.cpp-router-config-llm.ini(définit les modèles disponibles)- Mode routeur : activé via
--models-presetavec un fichier INI listant les modèles- GPU : toutes les couches sur GPU (
-1), GPU principal0- Flash attention : activée
- Cache KV : type-k
q8_0, type-vq5_1, réutilisation256(dans les versions commentées)- Mise en veille : 60s d'inactivité avant libération
- Logs : verbosité 4, couleurs désactivées, écrit dans
/tmp/llama.cpp-router.logLe fichier .ini :
La documentation sur le mode routeur se trouve principalement dans ces fichiers :
[*],[model_name], etc.)--models-preset,--models-max,--models-dir, API/v1/models, etc.Les options principales :
-
--models-preset PATH— fichier INI avec les presets modèles-
--models-dir PATH— dossier contenant les GGUF (auto-découverte)-
--models-max N— nombre max de modèles chargés simultanément-
--models-autoload— auto-chargement des modèles (activé par défaut)wind0w$ suxX, GNU/Linux roxX!