Forum général.cherche-logiciel Numériser en PDF comme en DjVu

PostĂ© par (site web personnel) . Licence CC By‐SA.
Étiquettes : aucune
8
13
juil.
2021

Bonjour,

Rappel sur le format DjVu

Vous connaissez peut-ĂȘtre le format DjVu, conçu pour stocker des documents numĂ©risĂ©s. À la lecture, c'est un peu semblable Ă  du PDF, ça s'ouvre dans un lecteur comme Evince ou Okular, et ça se lit pareil.

En revanche, c'est, ou du moins, c'était beaucoup plus efficace que PDF en terme de stockage. En effet, DjVu permet de stocker un document sous forme d'une pile de trois images :

  • un arriĂšre-plan et un avant-plan, en couleur, potentiellement en assez basse rĂ©solution, codĂ©s avec une compression par ondelettes ;
  • un masque, concrĂštement l'image du texte du document, bitonal, en haute rĂ©solution, codĂ© en JBIG2.

Avec ça, vous pouvez numériser une page en trÚs haute résolution, et utiliser didjvu pour la stocker dans un document DjVu de moins de 100 kio. Et, comme avec PDF, vous pouvez ajouter une couche d'OCR, invisible, mais qui contient du texte sélectionnable, pour pouvoir faire des recherches et des copier-coller.

Le problĂšme

Mais bref, venons-en à l'argument de ce message. Le problÚme du format DjVu, c'est que si efficace soit-il, ne s'est pas franchement imposé. Oh, ça se lit sans problÚme avec les lecteurs PDF libres, qui le prennent aussi en charge, mais les utilisateurs de logiciels propriétaires n'y arriveront pas. Je sais qu'ils sont capables d'installer un logiciel pour lire le PDF, mais allez savoir pourquoi, installer un logiciel pour lire du DjVu, c'est généralement au-dessus de leur force.

Une recherche de solution

Depuis l'invention du format DjVu, de l'eau a coulé sous les ponts, et le format PDF a pas mal évolué. En particulier, on peut maintenant y stocker des images bitonales en JBIG2 et des images couleur en JPEG-2000. Vu la richesse du format, je m'attends à ce qu'il soit techniquement tout à fait possible de superposer dans un document PDF :

  • un arriĂšre-plan en JPEG-2000 ;
  • un masque, concrĂštement, l'image du texte du document, en JBIG, les zones blanches Ă©tant affichĂ©es comme transparentes et laissant voir l'arriĂšre-plan ;
  • un avant-plan en JPEG-2000, avec un masque de transparence en JPEG-2000 aussi, ou en JBIG2, ou en un Ă©quivalent de PNG...

Bref, et c'est lĂ  que je veux en venir, j'ai bien l'impression que le format PDF permet aujourd'hui de stocker un document numĂ©risĂ© de façon aussi efficace que DjVu. D'oĂč mon interrogation, connaissez-vous un logiciel libre qui permette d'exploiter cette possibilitĂ© :
* soit en convertissant un document DjVu en PDF de façon efficace, c'est à dire sans aplatir les trois couches, mais en les conservant et en les stockant avec une compression appropriée ;
* soit en séparant une image sortie d'un scanner en couches, pour les stocker dans un document PDF avec une compression appropriée ?

  • # IntĂ©rĂȘt

    PostĂ© par (site web personnel) . ÉvaluĂ© Ă  7.

    Pour info, l'intĂ©rĂȘt que je porte Ă  DjVu vient de ce que je n'aime pas me sĂ©parer des documents originaux que je reçois sous forme papier. Or, certains interlocuteurs accordent une certaine importance Ă  ce qu'on leur transmette des originaux.

    J'ai donc pris pour habitude de numĂ©riser mes documents en trĂšs haute rĂ©solution – 1200 dpi, ce qui va au-delĂ  des besoins du thĂ©orĂšme d'Ă©chantillonage pour un document qui sort probablement d'une impression en 300 dpi. Lorsqu'on me demande ce document, je l'imprime simplement, et c'est cette copie que je fournis.

    Jamais je ne prĂ©tends fournir l'original, ce serait mentir, simplement je ne le prĂ©cise pas. À moins que mon interlocuteur n'ait assez de temps Ă  perdre pour chercher si par hasard, ce ne serait pas une copie, ça passe.

    Seulement, pour stocker, et surtout pour transmettre des documents numérisés avec une telle résolution, mieux vaut avoir un format de compression efficace !

  • # Je ne sais pas vraiment t'aider, mais j'ai appris des choses

    PostĂ© par (site web personnel, Mastodon) . ÉvaluĂ© Ă  2.

    Tout est dans le titre ;-) Donc merci pour ces trĂšs bonnes explications.

    Pour néanmoins trouver une piste de solution :
    - Chercher dans les bugtrackers et mailing lists de diffĂ©rents logiciels libres relatifs au scannage de documents (sane et simple-scan me viennent Ă  l'esprit) ou alors les logiciels qui travaillent directement avec le format PDF (donc s'adresser aux dĂ©veloppeurs upstream qui connaissent et ont touchĂ© Ă  la spec PDF). Si aucune info trouvĂ©e, rapporter un bug / demande de fonctionnalitĂ© en espĂ©rant avoir une rĂ©ponse (mĂȘme si la rĂ©ponse ne vient que 5 ans plus tard, avec la fonctionnalitĂ© implĂ©mentĂ©e dans un autre logiciel 5 ans encore aprĂšs, c'est mieux que rien (expĂ©rience typique)).
    - Avec peut-ĂȘtre une chance de trouver un bout de script quelque part bien cachĂ© au fin fond du web^W^W de GitHub ;-)

Suivre le flux des commentaires

Note : les commentaires appartiennent Ă  celles et ceux qui les ont postĂ©s. Nous n’en sommes pas responsables.