• [^] # Re: Mode RPC de llamacpp

    Posté par . En réponse au journal Auto-héberger ses IA. Évalué à 1 (+1/-0).

    Je l'ai fait tourner chez moi avec une nvidia 4060 Ti 16GB sur le serveur principal et une 3070 Ti 8 GB en distant par rpc avec le modèle gemma-4-26B-A4B-it-UD-Q4_K_XL.gguf , j'ai ma réponse en 15 secondes environ sur open webui.L'ihm de llama-server indique que j'étais à une production de 51 token/s, ce qui me parait très bien.
    De toute façon, sans la carte graphique distante, le modèle ne pourrait pas tourner et encore moins avec le contexte de 64k que j'ai mis.