Un outil qui s'appelle CMU-Toolkit (sous Linux) http://mi.eng.cam.ac.uk/~prc14/toolkit.html(...) permet de faire une analyse de texte, comme c'est evoque plus haut a partir de n-gramme.
J'ai pas essaye sur des textes de differentes langues, mais le fonctionnement est le suivant, tu prends un texte qui servira de reference (un par langue) puis tu compare ton nouveau texte avec ton model et ca te donne des valeurs notamment la complexite du model, qui devrait te permettre d'etablir la langue. Ceci est au conditionelle car je ne l'ai pas teste, mais etant donne le fonctionnement il n'y a pas de raison que ca ne marche pas. En plus vu qu'il fonctionne par module, tu peux utiliser selon ton besoin.
Sous windows, j'ai vu un truc qui s'appelle Monkey, mais c'est plutot chaud a trouver, enfin une bonne recherche te le donne. Ca te donne une valeur d'entropie, que je pense il est possible d'interpreter car elle devrait etre differente selon les langues.
Enfin la technique avec les algos de compression me semble une res bonne idee car elle se base sur le meme principe. Au changement de langue, la compression devrait etre moins bonne, donc ca te confirme si les textes sont bien de la meme langue. Reste a verifier les resultats.
# Re: trouver la langue d'un texte
Posté par squall . En réponse au journal trouver la langue d'un texte. Évalué à 1.
J'ai pas essaye sur des textes de differentes langues, mais le fonctionnement est le suivant, tu prends un texte qui servira de reference (un par langue) puis tu compare ton nouveau texte avec ton model et ca te donne des valeurs notamment la complexite du model, qui devrait te permettre d'etablir la langue. Ceci est au conditionelle car je ne l'ai pas teste, mais etant donne le fonctionnement il n'y a pas de raison que ca ne marche pas. En plus vu qu'il fonctionne par module, tu peux utiliser selon ton besoin.
Sous windows, j'ai vu un truc qui s'appelle Monkey, mais c'est plutot chaud a trouver, enfin une bonne recherche te le donne. Ca te donne une valeur d'entropie, que je pense il est possible d'interpreter car elle devrait etre differente selon les langues.
Enfin la technique avec les algos de compression me semble une res bonne idee car elle se base sur le meme principe. Au changement de langue, la compression devrait etre moins bonne, donc ca te confirme si les textes sont bien de la meme langue. Reste a verifier les resultats.