• # llama.cpp router mode

    Posté par (site web personnel) . En réponse au journal 'gégé' : enfin de l'IA dans ton shell !. Évalué à 4 (+3/-0).

    Intéressant article, merci pour le partage du script.

    Une remarque technique : ton stack avec llama-swap est un peu lourde pour l'usage que tu en fais. llama-server dispose depuis quelques versions d'un mode router intégré (--router) qui gère le chargement/déchargement dynamique des modèles sans redémarrage, sans dépendance externe.

    Pour ton cas d'usage (un modèle, usage local, expérimentation), un simple :

    llama-server --models-dir /chemin/vers/models --host 127.0.0.1 --port 8080 --models-max 1

    suffirait ... ou via un fichier preset INI avec --models-preset.

    Ton script gégé fonctionne identiquement sur le port 8080, avec un seul processus et aucune couche intermédiaire.

    llama-swap apporte de la valeur quand on mixe plusieurs backends (vLLM, SGLang, etc.) ou qu'on a besoin de supervision de processus en production. Pour bricoter et apprendre, ça ajoute une abstraction inutile qui complexifie le débug.

    wind0w$ suxX, GNU/Linux roxX!