• # petits retours rapides

    Posté par . En réponse à la dépêche Paperwork : besoin de testeurs. Évalué à 4.

    C'est un beau projet.

    Je l'ai testé rapidement, à partir de PDF scannés, et bien que les pdf soit de taille assez réduite, l'OCR était potable.

    Quelques commentaires en vrac :

    • les 13 dépendances, dont la plupart en en python, font un peu peur : on se dit par exemple que si l'une d'elle n'est plus supportée dans le futur, il sera difficile de péréniser la base de données que l'on se constitue grâce à cet outil.

    • je n'ai pas vu le nom d'origine des fichiers pdf importés, dans la liste des documents (juste l'image de la page) : or j'essaye justement d'avoir le nom le plus parlant possible pour m'y retrouver (par exemple avec locate si je fais une recherche sur le nom "edf" + "2013-01" je sais que ça va me retourner la ou les factures edf de janvier 2013)

    • Ça utilise gtk3, sur mon bureau xfce le rendu du toolkit est plutôt moche mais tu n'y peux rien (dans le style de ça https://bbs.archlinux.org/viewtopic.php?id=118078)

    • je n'ai pas testé le scan, uniquement l'import de PDF (je n'ai pas de scanner fonctionnel pour le moment) : j'ai essayé de faire un export ensuite de mon résultat avec OCR, ça m'a proposé une boîte de dialogue avec le nom du fichier à exporter, mais ensuite il n'y a rien sous ce nom dans le dossier que j'ai choisi.

    En fait, peut-être que j'utilise ton logiciel pour autre chose que ce dont il est conçu : j'aime l'idée de pouvoir avec un PDF mixe avec à la fois l'image et le texte OCRisé, et j'ai commencé par regarder de ce côté, mais peut-être que je devrais plutôt voir du côté de pdfsandwich

    « I approve of any development that makes it more difficult for governments and criminals to monopolize the use of force. » Eric Raymond