Intéressant article, merci pour le partage du script.
Une remarque technique : ton stack avec llama-swap est un peu lourde pour l'usage que tu en fais. llama-server dispose depuis quelques versions d'un mode router intégré (--router) qui gère le chargement/déchargement dynamique des modèles sans redémarrage, sans dépendance externe.
Pour ton cas d'usage (un modèle, usage local, expérimentation), un simple :
suffirait ... ou via un fichier preset INI avec --models-preset.
Ton script gégé fonctionne identiquement sur le port 8080, avec un seul processus et aucune couche intermédiaire.
llama-swap apporte de la valeur quand on mixe plusieurs backends (vLLM, SGLang, etc.) ou qu'on a besoin de supervision de processus en production. Pour bricoter et apprendre, ça ajoute une abstraction inutile qui complexifie le débug.
# llama.cpp router mode
Posté par i M@N (site web personnel) . En réponse au journal 'gégé' : enfin de l'IA dans ton shell !. Évalué à 4 (+3/-0).
Intéressant article, merci pour le partage du script.
Une remarque technique : ton stack avec llama-swap est un peu lourde pour l'usage que tu en fais.
llama-serverdispose depuis quelques versions d'un mode router intégré (--router) qui gère le chargement/déchargement dynamique des modèles sans redémarrage, sans dépendance externe.Pour ton cas d'usage (un modèle, usage local, expérimentation), un simple :
suffirait ... ou via un fichier preset INI avec
--models-preset.Ton script
gégéfonctionne identiquement sur le port 8080, avec un seul processus et aucune couche intermédiaire.llama-swap apporte de la valeur quand on mixe plusieurs backends (vLLM, SGLang, etc.) ou qu'on a besoin de supervision de processus en production. Pour bricoter et apprendre, ça ajoute une abstraction inutile qui complexifie le débug.
wind0w$ suxX, GNU/Linux roxX!