Dans ma description, c'est un frontend. Au même titre que opencode ou openclaw (que j'ai oublié de mentionner d'ailleurs). Il interface le LLM avec le reste du monde, et lui met à disposition des outils.
Avec une bande passante de 120Go/s, il y a deux points qui vont déterminer la vitesse du LLM:
La taille du LLM: un 20b en q4, c'est tout à fait modeste, sans non plus être tout petit.
La taille du contexte / de la discussion : si le fonctionnement de Hermes Agent fait qu'il n'a pas à relire régulièrement une grosse discussion, ça peut fonctionner relativement vite.
Il faut aussi voir ce qu'on entend par "vitesse acceptable". Pour certaines utilisations, une lecture à 100 tokens/s et une génération à 3 tokens/s suffisent largement (ceux qui s'en servent dans des batchs par exemple). Pour d'autres utilisations comme la programmation agentique, ça serait totalement insuffisant.
[^] # Re: Complement d’information
Posté par Jérôme Flesch (site web personnel) . En réponse au journal Auto-héberger ses IA. Évalué à 3 (+1/-0).
Intéressant. Je ne connaissais pas Hermes Agent.
Dans ma description, c'est un frontend. Au même titre que opencode ou openclaw (que j'ai oublié de mentionner d'ailleurs). Il interface le LLM avec le reste du monde, et lui met à disposition des outils.
Avec une bande passante de 120Go/s, il y a deux points qui vont déterminer la vitesse du LLM:
Il faut aussi voir ce qu'on entend par "vitesse acceptable". Pour certaines utilisations, une lecture à 100 tokens/s et une génération à 3 tokens/s suffisent largement (ceux qui s'en servent dans des batchs par exemple). Pour d'autres utilisations comme la programmation agentique, ça serait totalement insuffisant.