risorseartificiali a écrit 4 commentaires

  • [^] # Re: FUTO

    Posté par . En réponse au journal Anti-Vocale, transcription hors ligne des messages vocaux sur Android (libre). Évalué à 1 (+2/-1).

    Pour Anti-Vocale, oui : on partage le vocal depuis WhatsApp, Telegram ou Signal, et le texte arrive dans une notification, puis dans l'historique, avec export TXT/SRT/VTT (un bug sur l'export de fichiers est en cours de correction pour la prochaine version). Il y a aussi un bouton pour importer et transcrire un fichier audio choisi sur le téléphone, et un support partiel de Tasker pour les utilisateurs avancés. Je n'ai pas testé les applis FUTO, je ne peux pas dire si elles acceptent un vocal partagé depuis une autre application ; jch indique qu'elles sont basées sur Whisper. La différence qui compte pour ce site est la licence : Anti-Vocale est GPL et sur F-Droid, les applications FUTO sont distribuées sous une licence source-available qui restreint les projets dérivés.

  • [^] # Re: Pourquoi ce spam ?

    Posté par . En réponse au journal Anti-Vocale, transcription hors ligne des messages vocaux sur Android (libre). Évalué à 3 (+3/-0).

    Merci pour le retour et pour les chiffres. La difficulté de ce genre d'application, c'est le nombre de dimensions qui conditionnent le résultat : le matériel, la charge du téléphone au moment de la reconnaissance, le modèle choisi, la longueur du message, et sans doute d'autres paramètres encore.

    Un défi supplémentaire : la couche de transcription est sherpa-onnx, en C, et elle ne propage pas toujours ses erreurs à la couche Android ; elle peut échouer silencieusement. Je continue d'améliorer l'application pour tracer ces situations, les journaliser et les signaler à l'utilisateur, et je contribue aussi des correctifs au moteur en amont.

    Je ne conteste pas votre constat, mais deux éléments de contexte. Jusqu'à la 1.13.0 incluse, un bug faisait surestimer la mémoire nécessaire au modèle et bloquait des reconnaissances que le téléphone aurait pu mener à bien ; c'est corrigé depuis, et le réglage de protection mémoire reste désactivable pour forcer un essai. Par ailleurs, des utilisateurs ont signalé réussir des transcriptions sur des téléphones à 3 ou 4 Go de RAM.

    Si vous voulez expérimenter : Nemotron 0.6B int8 est le plus léger des modèles intégrés, le catalogue communautaire contient un Whisper Tiny multilingue étiqueté faible en mémoire, et dans les réglages vous pouvez désactiver la protection mémoire pour tenter un essai même quand l'application se montre prudente. Un ticket GitHub avec le modèle utilisé et la durée du vocal me permettrait de regarder votre cas précis.

  • [^] # Re: Meilleurs modèles ?

    Posté par . En réponse au journal Anti-Vocale, transcription hors ligne des messages vocaux sur Android (libre). Évalué à 4 (+5/-1).

    Merci pour ce commentaire : c'est exactement le type de retour que j'espérais. Je travaille sur des modèles pour des langues que je ne parle pas, donc un peu à l'aveugle, guidé par les retours d'utilisateurs et par les chiffres des benchmarks. Or ces chiffres se sont révélés peu fiables pour la parole réelle : audio enregistré en mouvement, comme le sont les messages vocaux. Et l'accent, national ou régional, change le résultat, certains modèles s'en sortent nettement mieux que d'autres. C'est pour ça que l'application permet de retranscrire un message déjà transcrit avec un autre modèle, pour comparer facilement lequel se comporte le mieux sur un cas donné.

    Mon cas d'usage reste la transcription hors ligne sur téléphone (sherpa-onnx, CPU), pas le sous-titrage en direct, donc ma comparaison ne répond qu'en partie à votre besoin. Ce que j'ai mesuré sur l'italien :

    • Parakeet TDT 0.6B (NVIDIA, 25 langues européennes dont le français) est mon modèle par défaut. Sur mon jeu de test italien il est légèrement derrière distil-whisper-large-v3 en WER, environ 5 % contre 4 %, mais environ 17 fois plus rapide. Ce n'est pas un modèle streaming, mais il transcrit nettement plus vite que le temps réel, donc avec des segments de quelques secondes la latence reste raisonnable.
    • Le seul modèle streaming que je livre est Nemotron 3.5 ASR 0.6B int8 (45 langues dont le français, segments de 1120 ms). La latence est bonne, mais sur mes tests italiens la qualité est nettement derrière Parakeet. Je ne l'ai pas encore évalué sur le français.
    • J'ai aussi dans le catalogue communautaire un petit modèle français : canary-180m-flash (en/es/de/fr, environ 180 M de paramètres). Non streaming, mais très léger. Qwen3-ASR 0.6B (59 langues) occupe le même créneau hors ligne que Parakeet.

    Pour galene-stt, sherpa-onnx expose une API C, donc une intégration à côté de whisper.cpp est envisageable. Si la latence est la priorité, le Nemotron streaming est la piste la plus directe pour le français ; si quelques secondes de délai sont acceptables, je testerais Parakeet TDT en segments courts, c'est pour moi le meilleur rapport qualité / vitesse sur CPU. Je n'ai aucune donnée sur l'anglais parlé avec l'accent français, je ne peux donc rien affirmer.

    La collection de modèles proposée dépend des statistiques publiées en ligne, et je suis très intéressé par l'étendre à partir des retours. Un utilisateur suisse m'a par exemple signalé que les modèles d'allemand géraient mal le suisse-allemand et m'a demandé d'en soutenir un spécialisé : il est maintenant au catalogue communautaire.

    Le projet étant entièrement libre, quiconque a les compétences, ou veut y lancer un agent de codage, peut expérimenter. Mais comme la plupart des utilisateurs ne sont pas techniques, l'application accepte aussi des catalogues de modèles externes : des listes pré-validées par des utilisateurs avancés, que les autres chargent en configurant simplement une URL. Elle s'étend ainsi sans changer une ligne de code, un mécanisme pensé justement pour les langues et les variantes régionales.

  • [^] # Re: Pourquoi ce spam ?

    Posté par . En réponse au journal Anti-Vocale, transcription hors ligne des messages vocaux sur Android (libre). Évalué à 1 (+1/-0).

    Bonjour, et désolé pour le manque de réactivité : j'avais perdu de vue ce journal et je n'ai reçu aucune notification. J'y suis revenu aujourd'hui, presque par hasard.

    Sur le débat soulevé par votre commentaire : en parcourant les autres journaux du site, j'avais compris qu'on pouvait y signaler des logiciels libres d'utilité publique. Si je me suis trompé, toutes mes excuses, et je n'ai aucun problème à ce que le journal soit supprimé ; ce n'était pas mon intention de créer des problèmes.

    Je me présente : Paolo Antinori, ingénieur italien (github.com/paoloantinori). J'ai écrit cette application pour un usage personnel, je reçois beaucoup de messages vocaux et je préfère les lire. Le développement est assisté par IA, c'est déclaré dans le README ; ce journal aussi a été rédigé avec une aide IA, parce que je ne maîtrise pas assez le français pour l'écrire seul.

    Si j'ai posté ici, c'est pour faire connaître l'application sur un canal francophone. Comme pour l'italien et l'allemand, la transcription intégrée de WhatsApp ne couvre pas le français, donc j'ai pensé qu'elle pouvait être utile ici ; elle a d'autres atouts, mais c'est la motivation de départ.

    Je réponds maintenant aux questions techniques, en commençant par celle de jch.