• [^] # Re: très éclairant

    Posté par . En réponse au journal Auto-héberger ses LLM (IA) : Débordement CPU+RAM, Mixture-of-Experts et Benchmarks. Évalué à 2 (+2/-0).

    Mon setup ne supporterait pas une 3060 de plus. 750W 80+ silver et la titanXp consomme déjà 250W.
    En plus je serai obligé de la brider avec Cuda 12 si j'ai bien compris, parce que la titanXp est dépréciée et ne supporte pas Cuda 13.
    Je pourrai toujours brider les tdp, mais je suis plutôt satisfait de la version de Qwen/Ornith que j'utilise.

    La profondeur de raisonnement et les compétences en codage et sysadmin me permettent de faire des choses inespérées.
    Pour l'instant je l'ai scaffoldé pour du python, pour le tester il a résolu AoC 2025, m'a fait un démo level type super mario fonctionnel et un tetris à partir d'un layout PNG (mmproj).
    Une fois au point, je l'ai mis au travail sur le frontend d'inférence pour qu'il refactore une copie de lui-même dont le code est validé pydantic et vérifié ruff avec des conventions de nommage et placement strictes.
    Ca me semblait ambitieux pour un A3B scaffoldé par un newbie, alors je me suis morigéné pour ne rien espérer, mais il a réussi.

    Pour moi sa principale limite est dans le contexte réellement utile. Au delà de 40k il se perd en temps qu'orchestrateur, même si en tant qu'agent il semble pouvoir en gérer plus ; mais le prefill devient le problème de toutes façons.
    C'est en partie pour ça que les sessions de mon agent sont limitées à 20min, s'il les atteint c'est le fallback avec synthèse par llm (toujours le même pour éviter le swap) qui est renvoyé en retour d'outil au modèle du chat et qui remplace son rapport.

    J'ai lu ton précédent journal, et j'y ai appris l'existence de Qwen 3.6 MTP... C'est le prochain que je teste.

    S'il est aussi bon que celui que j'ai tout en étant plus rapide, c'est vraiment super !