Suite à la présentation d'un collègue sur l'utilisation de Ollama et d'autres outils d'IA open source, je me suis laissée tenter par l'installation de Ollama avec un jeu de données de 65Go (model 120b .....)
J'ai voulu me rendre compte si cela était réellement multithread, donc j'ai mis ça dans une vm sur mon homelab. C'est un vieux Prolian DL360G9, avec bi CPU E5-2695 V4. 77 thread alloué à la vm et 150 Go de ram (je croyais que le modèle 120b prenait 120Go de ram).
J'ai lancé quelques prompt et là, je me suis dit : ok c'est bien joli tout ça, ça turbine sur tous les thread, mais le retour est-il réellement rapide (c'est juste un serveur avec du cpu). Ce type de serveur peut-il me rendre service avec de l'utilisation d'IA ponctuellement ?
Et donc mon questionnement est : c'est quoi que l'on entend par "rapidement" sur le retour d'une IA ? Y a t-il une valeur que l'on peut utiliser pour comparer des machines/services, que ce soit dans le cloud ou en local.
A une époque, on faisait des benchmark de CPU, on regardait la rapidité de calcul de Pi, on regardait le nombre de fps, etc (surtout quand on cherchait les limites d'overcloaking, le bon vieux temps).
Mais là, pour l'IA c'est quoi la valeur à suivre ? La rapidité à laquelle l'IA répond, rapidité d'affichage des caractères dans la formulation de la réponse ? Le nombre de token utilisé ? (je vois qu'en local, en verbeux, ollama donne ce type d'info en fin de réponse).
Je suis preneur de vos réponses, et ça aidera peut être à répondre au sujet par ricochets 🤓🤓
# Benchmark possible ? Valeur indicative de vitesse ?
Posté par xandercagexxx . En réponse au message Quels outils utilisez-vous pour générer du code rapidement grâce à l’IA ?. Évalué à 4.
Suite à la présentation d'un collègue sur l'utilisation de Ollama et d'autres outils d'IA open source, je me suis laissée tenter par l'installation de Ollama avec un jeu de données de 65Go (model 120b .....)
J'ai voulu me rendre compte si cela était réellement multithread, donc j'ai mis ça dans une vm sur mon homelab. C'est un vieux Prolian DL360G9, avec bi CPU E5-2695 V4. 77 thread alloué à la vm et 150 Go de ram (je croyais que le modèle 120b prenait 120Go de ram).
J'ai lancé quelques prompt et là, je me suis dit : ok c'est bien joli tout ça, ça turbine sur tous les thread, mais le retour est-il réellement rapide (c'est juste un serveur avec du cpu). Ce type de serveur peut-il me rendre service avec de l'utilisation d'IA ponctuellement ?
Et donc mon questionnement est : c'est quoi que l'on entend par "rapidement" sur le retour d'une IA ? Y a t-il une valeur que l'on peut utiliser pour comparer des machines/services, que ce soit dans le cloud ou en local.
A une époque, on faisait des benchmark de CPU, on regardait la rapidité de calcul de Pi, on regardait le nombre de fps, etc (surtout quand on cherchait les limites d'overcloaking, le bon vieux temps).
Mais là, pour l'IA c'est quoi la valeur à suivre ? La rapidité à laquelle l'IA répond, rapidité d'affichage des caractères dans la formulation de la réponse ? Le nombre de token utilisé ? (je vois qu'en local, en verbeux, ollama donne ce type d'info en fin de réponse).
Je suis preneur de vos réponses, et ça aidera peut être à répondre au sujet par ricochets 🤓🤓