pourquoi ne pas les stocker dans les champs IPTC/XMP ?
Meh. Pourquoi IPTC/XMP ? Pourquoi pas des fichiers JSON ? Pourquoi pas des fichiers de config Python ? Pourquoi pas XYZ ?
Au final, je voulais stocker une liste de labels dans un fichier. Je n'ai pas cherché plus loin.
Pareil pour l'OCR, le résultat ne peut-il pas être sauvegardé dans le pdf lui-même ?
J'ai pris l'approche la plus safe (et la plus simple) que je pouvais : Paperwork ne touche jamais au PDF original. Donc la sortie de l'OCR (s'il y en a une), est stockée à coté du PDF.
De plus, si on réécrit le PDF pour y inclure la sortie de l'OCR, que faire du texte déjà existant dans le PDF s'il y en a ? On le bazarde ? Et si on se rend compte ensuite que le texte original était finalement meilleur que l'OCR ?
[^] # Re: Stocker en ligne pour partage sur plusieurs PC
Posté par Jérôme Flesch (site web personnel) . En réponse à la dépêche Sortie de Paperwork 0.2. Évalué à 3.
Meh. Pourquoi IPTC/XMP ? Pourquoi pas des fichiers JSON ? Pourquoi pas des fichiers de config Python ? Pourquoi pas XYZ ?
Au final, je voulais stocker une liste de labels dans un fichier. Je n'ai pas cherché plus loin.
J'ai pris l'approche la plus safe (et la plus simple) que je pouvais : Paperwork ne touche jamais au PDF original. Donc la sortie de l'OCR (s'il y en a une), est stockée à coté du PDF.
De plus, si on réécrit le PDF pour y inclure la sortie de l'OCR, que faire du texte déjà existant dans le PDF s'il y en a ? On le bazarde ? Et si on se rend compte ensuite que le texte original était finalement meilleur que l'OCR ?