• # pas de pbs avec gorc

    Posté par . En réponse au journal Scanner & OCR. Évalué à 2.

    J'utilise assez souvent gorc ai j'ai pas eut bcp de problèmes. Il nous de mande de taper une fois chaque lettre pour contruire sa base de donnée, puis reconnait a peut près tout le reste. gorc en chie vraiment seulement si les charactère se touchent.

    Le pricipal inconvéniant à gorc, c'est qu'il n'utilise pas de dictionnaire en interne, il a donc du mal à différencier certaine lettre tel que 'I' (i majuscule)
    ou 'l' (L minuscule) , voir même 't'

    Il apprait donc que beaucoup de mots sont incorrect, mais deux méthode combinés permettent de corriger ça assez rapidement :

    1) Utiliser un script sed qui, en fonction de la langue, remplace les choses très improbable. Par exemple en français, le mot 'll' (deux L minsucule) est très peu probable, le mot correct est surement 'Il' (i majuscule, L minuscule).
    Ce soit être en fonction de la langue car par exemple, en anglais, l'interprétation ci-dessus est inversé ( you'll <=> you will)

    2) utiliser un dictionnaire tel que aspell ou ispell.

    Pour automatiser tout ça, rien ne vaut un petit script. Le boulo de l'utilisateur consistera ensuite à taper une fois chaque lettre, puis à piloter ispell pour finir les dernières corrections.


    Note pour gorc: il y a un paramêtre important qui définit une estimation de la taille des caractères, en bidouillant ce paramètre, on améliore nettement les résultats. Mais je ne peut donner de méthode pour optimser ce paramêtre :-(