• [^] # Re: Meilleurs modèles ?

    Posté par . En réponse au journal Anti-Vocale, transcription hors ligne des messages vocaux sur Android (libre). Évalué à 5 (+6/-1).

    Merci pour ce commentaire : c'est exactement le type de retour que j'espérais. Je travaille sur des modèles pour des langues que je ne parle pas, donc un peu à l'aveugle, guidé par les retours d'utilisateurs et par les chiffres des benchmarks. Or ces chiffres se sont révélés peu fiables pour la parole réelle : audio enregistré en mouvement, comme le sont les messages vocaux. Et l'accent, national ou régional, change le résultat, certains modèles s'en sortent nettement mieux que d'autres. C'est pour ça que l'application permet de retranscrire un message déjà transcrit avec un autre modèle, pour comparer facilement lequel se comporte le mieux sur un cas donné.

    Mon cas d'usage reste la transcription hors ligne sur téléphone (sherpa-onnx, CPU), pas le sous-titrage en direct, donc ma comparaison ne répond qu'en partie à votre besoin. Ce que j'ai mesuré sur l'italien :

    • Parakeet TDT 0.6B (NVIDIA, 25 langues européennes dont le français) est mon modèle par défaut. Sur mon jeu de test italien il est légèrement derrière distil-whisper-large-v3 en WER, environ 5 % contre 4 %, mais environ 17 fois plus rapide. Ce n'est pas un modèle streaming, mais il transcrit nettement plus vite que le temps réel, donc avec des segments de quelques secondes la latence reste raisonnable.
    • Le seul modèle streaming que je livre est Nemotron 3.5 ASR 0.6B int8 (45 langues dont le français, segments de 1120 ms). La latence est bonne, mais sur mes tests italiens la qualité est nettement derrière Parakeet. Je ne l'ai pas encore évalué sur le français.
    • J'ai aussi dans le catalogue communautaire un petit modèle français : canary-180m-flash (en/es/de/fr, environ 180 M de paramètres). Non streaming, mais très léger. Qwen3-ASR 0.6B (59 langues) occupe le même créneau hors ligne que Parakeet.

    Pour galene-stt, sherpa-onnx expose une API C, donc une intégration à côté de whisper.cpp est envisageable. Si la latence est la priorité, le Nemotron streaming est la piste la plus directe pour le français ; si quelques secondes de délai sont acceptables, je testerais Parakeet TDT en segments courts, c'est pour moi le meilleur rapport qualité / vitesse sur CPU. Je n'ai aucune donnée sur l'anglais parlé avec l'accent français, je ne peux donc rien affirmer.

    La collection de modèles proposée dépend des statistiques publiées en ligne, et je suis très intéressé par l'étendre à partir des retours. Un utilisateur suisse m'a par exemple signalé que les modèles d'allemand géraient mal le suisse-allemand et m'a demandé d'en soutenir un spécialisé : il est maintenant au catalogue communautaire.

    Le projet étant entièrement libre, quiconque a les compétences, ou veut y lancer un agent de codage, peut expérimenter. Mais comme la plupart des utilisateurs ne sont pas techniques, l'application accepte aussi des catalogues de modèles externes : des listes pré-validées par des utilisateurs avancés, que les autres chargent en configurant simplement une URL. Elle s'étend ainsi sans changer une ligne de code, un mécanisme pensé justement pour les langues et les variantes régionales.