• [^] # Re: Intégration dans Mageia

    Posté par (site web personnel) . En réponse à la dépêche NoComprendo, version 1.0. Évalué à 5.

    Je n'ai pas reçu de mail pour l'instant (2h30 après ce commentaire).

    CMU_Cam_Toolkit est l'outil qui permet de fabriquer le "language model", c'est le fichier "corpus.lm" dans le répertoire ~/.config/nocomprendo/fr_FR.
    Il existait une version 3 en ligne (mon lien semble mort) mais le code n'était pas disponible. J'ai trouvé la version 2 ici.

    C'est composé d'une série d'outils (installés dans /usr/share/nocomprendo) et d'un script qui enchaîne tout ça. Ces outils prennent en entrée le fichier corpus.txt qui contient les mots et les énoncés et produit corpus.lm, le fichier statistique utilisé par pocketsphinx.
    Je ne comprends pas bien le contenu de ce fichier, il fabrique d'autres énoncés qu'on ne lui a pas fourni, mais ça marche bien.

    À chaque modification du vocabulaire, des énoncés ou changement de sélection des groupes de commandes, ce fichier est régénéré automatiquement. Ça permet d'avoir toujours un "language model" à jour, concis et rapide à l'exécution.