[cite]J'ai essayé Ekho, mais sur ma machine le résultat produit est bien faible.[/cite]
Il m'a fallu lutter un peu pour l'installer, je me suis ramassé pas mal d'erreurs à l'utilisation (accès impossible au périphérique audio), mais j'ai finalement réussi à le faire marcher. Il me supprimait toujours le dernier caractère et le débit n'était pas très naturel. Si je comprends bien leur site et le manuel, le logiciel semble plutôt mettre l'accent sur le cantonais (c'est du moins le mode par défaut dans la ligne de commande et dans la démo sur leur site).
J'ai également essayé zhspeak, qui est leur solution "plus légère" en python (8M contre 70). Le résultat me paraît équivalent, c'est rapide mais il m'enlève toujours plusieurs caractères au moment de parler, alors même qu'il a bien fait l'interpretation caractères à pinyin. Il semble que dès qu'il comprend que deux caractères forment un même mot, s'il n'a pas ce mot d'enregistré (même en ayant un enregistrement des phonèmes qui le constituent), il ne le prononcera pas.
Le problème, c'est principalement qu'ils utilisent une base de tous les phonèmes disponibles en chionois et qu'ensuite ils les alignent après avoir fait une romanisation des caractères. Ekho et Zhspeak se débrouillent pas mal pour ce type de fonctionnement, les caractères lus ont un volume et une qualité sonore identiques. Ça peut dépanner, mais ça n'est pas naturel.
Je ne m'y connais pas plus que ça, mais dans une langue qui ne fonctionne pas par caractères et qui aurait un nombre de phonèmes beaucoup plus importants (genre l'anglais?), on ne fonctionne pas en enregistrant tous les sons qui existent. Je crois qu'ils font de l'apprentissage, basé sur l'enregistrement de quelques centaines de phrases prononcées par une même personne (quelques centaines semblant être assez peu en terme d'apprentissage) et qu'ensuite ils font une synthèse vocale. Ça m'intéresse beaucoup mais pour l'instant je n'y connais rien.
[^] # Re: Et...
Posté par vermillon . En réponse au message Text-to-speech chinois. Évalué à 2.
Il m'a fallu lutter un peu pour l'installer, je me suis ramassé pas mal d'erreurs à l'utilisation (accès impossible au périphérique audio), mais j'ai finalement réussi à le faire marcher. Il me supprimait toujours le dernier caractère et le débit n'était pas très naturel. Si je comprends bien leur site et le manuel, le logiciel semble plutôt mettre l'accent sur le cantonais (c'est du moins le mode par défaut dans la ligne de commande et dans la démo sur leur site).
J'ai également essayé zhspeak, qui est leur solution "plus légère" en python (8M contre 70). Le résultat me paraît équivalent, c'est rapide mais il m'enlève toujours plusieurs caractères au moment de parler, alors même qu'il a bien fait l'interpretation caractères à pinyin. Il semble que dès qu'il comprend que deux caractères forment un même mot, s'il n'a pas ce mot d'enregistré (même en ayant un enregistrement des phonèmes qui le constituent), il ne le prononcera pas.
Le problème, c'est principalement qu'ils utilisent une base de tous les phonèmes disponibles en chionois et qu'ensuite ils les alignent après avoir fait une romanisation des caractères. Ekho et Zhspeak se débrouillent pas mal pour ce type de fonctionnement, les caractères lus ont un volume et une qualité sonore identiques. Ça peut dépanner, mais ça n'est pas naturel.
Je ne m'y connais pas plus que ça, mais dans une langue qui ne fonctionne pas par caractères et qui aurait un nombre de phonèmes beaucoup plus importants (genre l'anglais?), on ne fonctionne pas en enregistrant tous les sons qui existent. Je crois qu'ils font de l'apprentissage, basé sur l'enregistrement de quelques centaines de phrases prononcées par une même personne (quelques centaines semblant être assez peu en terme d'apprentissage) et qu'ensuite ils font une synthèse vocale. Ça m'intéresse beaucoup mais pour l'instant je n'y connais rien.