Si c'est possible dans Docker, ça l'est forcément sans.
En ce qui me concerne, je l'utilise dans mon cluster Kubernetes donc dans son image Docker mais sur un Linux avec un environnement Nvidia correctement configuré ça devrait tourner sans problèmes.
Comme dans l'issue ci-dessus, les fois où j'ai constaté qu'un modèle utilisait mon CPU au lieu du GPU c'était en effet lié à la taille du modèle (ou la longueur du contexte).
[^] # Re: Support des GPU
Posté par Poulpatine (site web personnel) . En réponse au journal Introduction pratique aux grands modèles de langage / LLM. Évalué à 3. Dernière modification le 03 mars 2024 à 17:17.
Si c'est possible dans Docker, ça l'est forcément sans.
En ce qui me concerne, je l'utilise dans mon cluster Kubernetes donc dans son image Docker mais sur un Linux avec un environnement Nvidia correctement configuré ça devrait tourner sans problèmes.
Les issues du projet pourraient t'aiguiller. Ce commentaire par exemple : https://github.com/ollama/ollama/issues/2826#issuecomment-1970562656
Comme dans l'issue ci-dessus, les fois où j'ai constaté qu'un modèle utilisait mon CPU au lieu du GPU c'était en effet lié à la taille du modèle (ou la longueur du contexte).