Des métriques, il y a en a tout un tas, ça dépends de ce que tu cherches.
Tu prends l'exemple des FPS, mais avec les llm le nombre de tokens par secondes est tout aussi pertinent.
Maintenant le temps de génération global est également dépendant de la longueur de la génération, surtout que tu as l'air d'utiliser gpt-oss (déduction puisque 120b et dernier modèle à la mode...), qui est un modèle de raisonnement.
Ce genre de modèle a une première étape de génération de "raisonnement" et ensuite de génération de la réponse finale, qui peut potentiellement n'être générée qu'à partir de 200, 300 tokens ou plus. Donc c'est certain que ça créé de la latence.
Le truc c'est que c'est spécifique à chaque modèle (la verbosité du raisonnement de gpt-oss peut être configuré, mais c'est le seul à faire ça, Qwen3 à côté est soit hyper verbeux, soit répond directement sans raisonnement). Et les instructions que tu spécifies au modèle ont également une incidence.
Donc non, il n'y a pas de barème magique pour comparer simplement tout ce monde là, car tous les modèles sont différents et beaucoup de modèles ont des domaines d'application privilégiés (dans l'absolu un modèle petit et performant mais verbeux pourrait donner des réponses plus lentement qu'un modèle plus lourd mais concis).
On compare généralement la qualité des réponses par domaines plus ou moins généraux, les capacités linguistiques, techniques, et la factualités.
Et pour la performance brute, le nombre de tokens à la seconde suffit, même si c'est pas forcément mis en avant parce que quand tu as l'habitude, le simple fait de connaître le nombre de paramètres actifs suffit à en avoir une idée approximative (en l’occurrence gpt-oss-120b, c'est 5,1 milliards de paramètres actifs par tokens, donc en théorie plus rapide qu'un modèle de seulement 8 milliards de paramètres tel que Llama-3.1-8B, même si des détails architecturaux et d'implémentation peuvent varier, dans les grandes lignes ça marche).
J'ai par contre je n'ai jamais entendu parler d'un comparatif qui notait la concision des réponses.
C'est dommage parce que ça serait une bonne chose que les llm soient les plus concis possible, le problème est qu'ils tendent à être moins précis et moins qualitatifs quand on leur impose d'écourter les réponses via des instructions...
[^] # Re: Benchmark possible ? Valeur indicative de vitesse ?
Posté par Florian.J . En réponse au message Quels outils utilisez-vous pour générer du code rapidement grâce à l’IA ?. Évalué à 3.
Des métriques, il y a en a tout un tas, ça dépends de ce que tu cherches.
Tu prends l'exemple des FPS, mais avec les llm le nombre de tokens par secondes est tout aussi pertinent.
Maintenant le temps de génération global est également dépendant de la longueur de la génération, surtout que tu as l'air d'utiliser gpt-oss (déduction puisque 120b et dernier modèle à la mode...), qui est un modèle de raisonnement.
Ce genre de modèle a une première étape de génération de "raisonnement" et ensuite de génération de la réponse finale, qui peut potentiellement n'être générée qu'à partir de 200, 300 tokens ou plus. Donc c'est certain que ça créé de la latence.
Le truc c'est que c'est spécifique à chaque modèle (la verbosité du raisonnement de gpt-oss peut être configuré, mais c'est le seul à faire ça, Qwen3 à côté est soit hyper verbeux, soit répond directement sans raisonnement). Et les instructions que tu spécifies au modèle ont également une incidence.
Donc non, il n'y a pas de barème magique pour comparer simplement tout ce monde là, car tous les modèles sont différents et beaucoup de modèles ont des domaines d'application privilégiés (dans l'absolu un modèle petit et performant mais verbeux pourrait donner des réponses plus lentement qu'un modèle plus lourd mais concis).
On compare généralement la qualité des réponses par domaines plus ou moins généraux, les capacités linguistiques, techniques, et la factualités.
Et pour la performance brute, le nombre de tokens à la seconde suffit, même si c'est pas forcément mis en avant parce que quand tu as l'habitude, le simple fait de connaître le nombre de paramètres actifs suffit à en avoir une idée approximative (en l’occurrence gpt-oss-120b, c'est 5,1 milliards de paramètres actifs par tokens, donc en théorie plus rapide qu'un modèle de seulement 8 milliards de paramètres tel que Llama-3.1-8B, même si des détails architecturaux et d'implémentation peuvent varier, dans les grandes lignes ça marche).
J'ai par contre je n'ai jamais entendu parler d'un comparatif qui notait la concision des réponses.
C'est dommage parce que ça serait une bonne chose que les llm soient les plus concis possible, le problème est qu'ils tendent à être moins précis et moins qualitatifs quand on leur impose d'écourter les réponses via des instructions...