Je l'ai testé rapidement, à partir de PDF scannés, et bien que les pdf soit de taille assez réduite, l'OCR était potable.
Quelques commentaires en vrac :
les 13 dépendances, dont la plupart en en python, font un peu peur : on se dit par exemple que si l'une d'elle n'est plus supportée dans le futur, il sera difficile de péréniser la base de données que l'on se constitue grâce à cet outil.
je n'ai pas vu le nom d'origine des fichiers pdf importés, dans la liste des documents (juste l'image de la page) : or j'essaye justement d'avoir le nom le plus parlant possible pour m'y retrouver (par exemple avec locate si je fais une recherche sur le nom "edf" + "2013-01" je sais que ça va me retourner la ou les factures edf de janvier 2013)
je n'ai pas testé le scan, uniquement l'import de PDF (je n'ai pas de scanner fonctionnel pour le moment) : j'ai essayé de faire un export ensuite de mon résultat avec OCR, ça m'a proposé une boîte de dialogue avec le nom du fichier à exporter, mais ensuite il n'y a rien sous ce nom dans le dossier que j'ai choisi.
En fait, peut-être que j'utilise ton logiciel pour autre chose que ce dont il est conçu : j'aime l'idée de pouvoir avec un PDF mixe avec à la fois l'image et le texte OCRisé, et j'ai commencé par regarder de ce côté, mais peut-être que je devrais plutôt voir du côté de pdfsandwich
« I approve of any development that makes it more difficult for governments and criminals to monopolize the use of force. » Eric Raymond
# petits retours rapides
Posté par fravashyo . En réponse à la dépêche Paperwork : besoin de testeurs. Évalué à 4.
C'est un beau projet.
Je l'ai testé rapidement, à partir de PDF scannés, et bien que les pdf soit de taille assez réduite, l'OCR était potable.
Quelques commentaires en vrac :
les 13 dépendances, dont la plupart en en python, font un peu peur : on se dit par exemple que si l'une d'elle n'est plus supportée dans le futur, il sera difficile de péréniser la base de données que l'on se constitue grâce à cet outil.
je n'ai pas vu le nom d'origine des fichiers pdf importés, dans la liste des documents (juste l'image de la page) : or j'essaye justement d'avoir le nom le plus parlant possible pour m'y retrouver (par exemple avec locate si je fais une recherche sur le nom "edf" + "2013-01" je sais que ça va me retourner la ou les factures edf de janvier 2013)
Ça utilise gtk3, sur mon bureau xfce le rendu du toolkit est plutôt moche mais tu n'y peux rien (dans le style de ça https://bbs.archlinux.org/viewtopic.php?id=118078)
je n'ai pas testé le scan, uniquement l'import de PDF (je n'ai pas de scanner fonctionnel pour le moment) : j'ai essayé de faire un export ensuite de mon résultat avec OCR, ça m'a proposé une boîte de dialogue avec le nom du fichier à exporter, mais ensuite il n'y a rien sous ce nom dans le dossier que j'ai choisi.
En fait, peut-être que j'utilise ton logiciel pour autre chose que ce dont il est conçu : j'aime l'idée de pouvoir avec un PDF mixe avec à la fois l'image et le texte OCRisé, et j'ai commencé par regarder de ce côté, mais peut-être que je devrais plutôt voir du côté de pdfsandwich
« I approve of any development that makes it more difficult for governments and criminals to monopolize the use of force. » Eric Raymond