Je ne les sélectionne pas :)
En fait je passe le texte tel-quel à Whoosh. C'est lui qui se charge de l'indexation, de la recherche et des suggestions.
Pour Scribo, je ne connaissais pas. Je vais voir pour l'intégrer à PyOCR. Pour ce qui est de l'interaction, actuellement, c'est fait de façon relativement crade: Paperwork (via PyOCR) exécute tout simplement Tesseract comme commande shell. Je suppose que Scribo peut aussi être lancé depuis le shell, donc je ne devrais pas avoir de soucis pour l'intégrer.
En fait, Tesseract fournit aussi une librairie C++, mais du coup ce n'est pas simple à binder sur du Python (du moins sans rajouter une autre dépendance), et je n'ai trouvé aucune documentation expliquant comment l'utiliser. Donc j'ai juste laissé tombé (pour le moment)
[^] # Re: Comment ca marche ?
Posté par Jérôme Flesch (site web personnel) . En réponse au journal Paperwork : Besoin de testeurs. Évalué à 2.
Je ne les sélectionne pas :)
En fait je passe le texte tel-quel à Whoosh. C'est lui qui se charge de l'indexation, de la recherche et des suggestions.
Pour Scribo, je ne connaissais pas. Je vais voir pour l'intégrer à PyOCR. Pour ce qui est de l'interaction, actuellement, c'est fait de façon relativement crade: Paperwork (via PyOCR) exécute tout simplement Tesseract comme commande shell. Je suppose que Scribo peut aussi être lancé depuis le shell, donc je ne devrais pas avoir de soucis pour l'intégrer.
En fait, Tesseract fournit aussi une librairie C++, mais du coup ce n'est pas simple à binder sur du Python (du moins sans rajouter une autre dépendance), et je n'ai trouvé aucune documentation expliquant comment l'utiliser. Donc j'ai juste laissé tombé (pour le moment)