Alors justement j'utilise plusieurs modèles en parallèle (pas tous en même temps, mais d'une requête à l'autre c'est pas forcément le même que je vais utiliser). Un tout petit (le qwen 0.7B) sur ma carte graphique, le même en pure CPU (histoire de pas raconter des craques), et un plus large sur la CG (histoire d'avoir un truc réellement utilisable).
Donc pour ce style d'utilisation (mono utilisateur, mono modèle à un instant T, mais une base de plusieurs modèles), llama-server suffirait ?
En théorie, la théorie et la pratique c'est pareil. En pratique c'est pas vrai.
[^] # Re: llama.cpp router mode
Posté par gUI (Mastodon) . En réponse au journal 'gégé' : enfin de l'IA dans ton shell !. Évalué à 5 (+2/-0).
Alors justement j'utilise plusieurs modèles en parallèle (pas tous en même temps, mais d'une requête à l'autre c'est pas forcément le même que je vais utiliser). Un tout petit (le qwen 0.7B) sur ma carte graphique, le même en pure CPU (histoire de pas raconter des craques), et un plus large sur la CG (histoire d'avoir un truc réellement utilisable).
Donc pour ce style d'utilisation (mono utilisateur, mono modèle à un instant T, mais une base de plusieurs modèles), llama-server suffirait ?
En théorie, la théorie et la pratique c'est pareil. En pratique c'est pas vrai.