Super, merci pour les retours et les explications, je n'avais pas en tête que c'était potentiellement des experts différents pour chaque token, c'est vrai que c'est de réseau auto régressif et donc tout se rejoue à chaque fois. J'imagine que dans la pratique c'est peu ou prou les mêmes experts quand on est sur une même tâche, mais que ça peut en effet bouger.
Bon, donc ces modèles ne sont pas encore pleinement utilisable sur du matériel "normal"... peut-être qu'un jour ça le sera ? Ou peut-être que les prix des composants vont baisser un jour et se spécialiser de plus en plus pour exécuter des modèles de ce genre ?
Ça me fait bizarre car pendant 15 ans j'ai quelque part lutter contre cette course à la performance, au renouvellement des machines etc. Et j'en viens à souhaiter qu'on fasse de nouvelles machines plus performantes et moins chères... je crois que je suis tombé dans le piège de l'IA...
[^] # Re: T'as testé une conf hybride CPU/GPU
Posté par Andréas Livet . En réponse au journal Auto-héberger ses IA : Matériel et optimisation de l'inférence. Évalué à 3 (+1/-0).
Super, merci pour les retours et les explications, je n'avais pas en tête que c'était potentiellement des experts différents pour chaque token, c'est vrai que c'est de réseau auto régressif et donc tout se rejoue à chaque fois. J'imagine que dans la pratique c'est peu ou prou les mêmes experts quand on est sur une même tâche, mais que ça peut en effet bouger.
Bon, donc ces modèles ne sont pas encore pleinement utilisable sur du matériel "normal"... peut-être qu'un jour ça le sera ? Ou peut-être que les prix des composants vont baisser un jour et se spécialiser de plus en plus pour exécuter des modèles de ce genre ?
Ça me fait bizarre car pendant 15 ans j'ai quelque part lutter contre cette course à la performance, au renouvellement des machines etc. Et j'en viens à souhaiter qu'on fasse de nouvelles machines plus performantes et moins chères... je crois que je suis tombé dans le piège de l'IA...