Parce qu'on a des normes qui sont bien documentées, supportées par plein de libs/outils/langages et utilisées dans des milliers de logiciels ?
Oui, par exemple, on a le CSV. Il se trouve que c'est le format que j'utilise pour les fichiers contenant les labels des documents. Je n'utilise juste pas de parseur CSV (c'est bon vieux bête et méchant line.split(",") sur chaque ligne, avec une interdiction d'utiliser les virgules dans les noms de labels).
Ou bien parce que c'est directement inclus dans le fichier, ce qui est pratique lors de copie, transfert, etc.
Oui, parce-que copier ou transférer un dossier est clairement plus difficile qu'un seul fichier, c'est sûr ...
Juste pour info, dans le future, je pense utiliser le format DjVu pour les scans. Ça permettra de justement stocker images et textes dans un même document. Par contre, vu comment le format est peu supporté par d'autres applications, ça réduira la portabilité de ces documents.
Les labels seront eux stockés dans un seul fichier (sqlite ?) pour des questions d'atomicité des opérations.
Quoiqu'il en soit, cette discussion relève pour moi clairement du troll technique (quitte à perdre du temps, on pourrait se faire un bon vieux Emacs VS Vim ?). Je ne compte pas la poursuivre plus loin.
Si le PDF contient déjà du texte sous une forme parsable, qu'apporte l'OCR ?
J'ai déjà eut le cas d'une facture de téléphone mobile où le texte visible était en fait une image. Un texte aléatoire avait été mis en dessous des images pour faire croire qu'il y avait effectivement du texte dans le PDF (ne me demandez pas pourquoi, j'en ai aucune idée, je n'ai fait que constater et halluciner). D'où le fait que Paperwork permet de repasser un coup d'OCR dessus.
On peut imaginer d'autre cas : certains personnes font leur scan au boulot. Certains scanner pro proposent de générer des PDFs avec texte issu de l'OCR inclu. Pour peu qu'ils ne soient pas satisfait du résultat de l'OCR du scanner, ils peuvent vouloir essayer Tesseract.
[^] # Re: Stocker en ligne pour partage sur plusieurs PC
Posté par Jérôme Flesch (site web personnel) . En réponse à la dépêche Sortie de Paperwork 0.2. Évalué à 1. Dernière modification le 27 septembre 2014 à 20:03.
Oui, par exemple, on a le CSV. Il se trouve que c'est le format que j'utilise pour les fichiers contenant les labels des documents. Je n'utilise juste pas de parseur CSV (c'est bon vieux bête et méchant line.split(",") sur chaque ligne, avec une interdiction d'utiliser les virgules dans les noms de labels).
Oui, parce-que copier ou transférer un dossier est clairement plus difficile qu'un seul fichier, c'est sûr ...
Juste pour info, dans le future, je pense utiliser le format DjVu pour les scans. Ça permettra de justement stocker images et textes dans un même document. Par contre, vu comment le format est peu supporté par d'autres applications, ça réduira la portabilité de ces documents.
Les labels seront eux stockés dans un seul fichier (sqlite ?) pour des questions d'atomicité des opérations.
Quoiqu'il en soit, cette discussion relève pour moi clairement du troll technique (quitte à perdre du temps, on pourrait se faire un bon vieux Emacs VS Vim ?). Je ne compte pas la poursuivre plus loin.
J'ai déjà eut le cas d'une facture de téléphone mobile où le texte visible était en fait une image. Un texte aléatoire avait été mis en dessous des images pour faire croire qu'il y avait effectivement du texte dans le PDF (ne me demandez pas pourquoi, j'en ai aucune idée, je n'ai fait que constater et halluciner). D'où le fait que Paperwork permet de repasser un coup d'OCR dessus.
On peut imaginer d'autre cas : certains personnes font leur scan au boulot. Certains scanner pro proposent de générer des PDFs avec texte issu de l'OCR inclu. Pour peu qu'ils ne soient pas satisfait du résultat de l'OCR du scanner, ils peuvent vouloir essayer Tesseract.