Bonjour,
Rappel sur le format DjVu
Vous connaissez peut-ĂȘtre le format DjVu, conçu pour stocker des documents numĂ©risĂ©s. Ă la lecture, c'est un peu semblable Ă du PDF, ça s'ouvre dans un lecteur comme Evince ou Okular, et ça se lit pareil.
En revanche, c'est, ou du moins, c'était beaucoup plus efficace que PDF en terme de stockage. En effet, DjVu permet de stocker un document sous forme d'une pile de trois images :
- un arriÚre-plan et un avant-plan, en couleur, potentiellement en assez basse résolution, codés avec une compression par ondelettes ;
- un masque, concrÚtement l'image du texte du document, bitonal, en haute résolution, codé en JBIG2.
Avec ça, vous pouvez numériser une page en trÚs haute résolution, et utiliser didjvu pour la stocker dans un document DjVu de moins de 100 kio. Et, comme avec PDF, vous pouvez ajouter une couche d'OCR, invisible, mais qui contient du texte sélectionnable, pour pouvoir faire des recherches et des copier-coller.
Le problĂšme
Mais bref, venons-en à l'argument de ce message. Le problÚme du format DjVu, c'est que si efficace soit-il, ne s'est pas franchement imposé. Oh, ça se lit sans problÚme avec les lecteurs PDF libres, qui le prennent aussi en charge, mais les utilisateurs de logiciels propriétaires n'y arriveront pas. Je sais qu'ils sont capables d'installer un logiciel pour lire le PDF, mais allez savoir pourquoi, installer un logiciel pour lire du DjVu, c'est généralement au-dessus de leur force.
Une recherche de solution
Depuis l'invention du format DjVu, de l'eau a coulé sous les ponts, et le format PDF a pas mal évolué. En particulier, on peut maintenant y stocker des images bitonales en JBIG2 et des images couleur en JPEG-2000. Vu la richesse du format, je m'attends à ce qu'il soit techniquement tout à fait possible de superposer dans un document PDF :
- un arriĂšre-plan en JPEG-2000 ;
- un masque, concrÚtement, l'image du texte du document, en JBIG, les zones blanches étant affichées comme transparentes et laissant voir l'arriÚre-plan ;
- un avant-plan en JPEG-2000, avec un masque de transparence en JPEG-2000 aussi, ou en JBIG2, ou en un équivalent de PNG...
Bref, et c'est lĂ que je veux en venir, j'ai bien l'impression que le format PDF permet aujourd'hui de stocker un document numĂ©risĂ© de façon aussi efficace que DjVu. D'oĂč mon interrogation, connaissez-vous un logiciel libre qui permette d'exploiter cette possibilitĂ© :
* soit en convertissant un document DjVu en PDF de façon efficace, c'est à dire sans aplatir les trois couches, mais en les conservant et en les stockant avec une compression appropriée ;
* soit en séparant une image sortie d'un scanner en couches, pour les stocker dans un document PDF avec une compression appropriée ?
# IntĂ©rĂȘt
PostĂ© par đČ Tanguy Ortolo (site web personnel) . ĂvaluĂ© Ă 7.
Pour info, l'intĂ©rĂȘt que je porte Ă DjVu vient de ce que je n'aime pas me sĂ©parer des documents originaux que je reçois sous forme papier. Or, certains interlocuteurs accordent une certaine importance Ă ce qu'on leur transmette des originaux.
J'ai donc pris pour habitude de numĂ©riser mes documents en trĂšs haute rĂ©solution â 1200 dpi, ce qui va au-delĂ des besoins du thĂ©orĂšme d'Ă©chantillonage pour un document qui sort probablement d'une impression en 300 dpi. Lorsqu'on me demande ce document, je l'imprime simplement, et c'est cette copie que je fournis.
Jamais je ne prétends fournir l'original, ce serait mentir, simplement je ne le précise pas. à moins que mon interlocuteur n'ait assez de temps à perdre pour chercher si par hasard, ce ne serait pas une copie, ça passe.
Seulement, pour stocker, et surtout pour transmettre des documents numérisés avec une telle résolution, mieux vaut avoir un format de compression efficace !
[^] # Re: IntĂ©rĂȘt
PostĂ© par ted (site web personnel) . ĂvaluĂ© Ă 3.
Le lien Wikipédia ne renvoie vers aucune page, mais je pense que celle-ci serait adaptée: Fréquence d'échantillonage
Un LUG en Lorraine : https://enunclic-cappel.fr
[^] # Re: IntĂ©rĂȘt
PostĂ© par đČ Tanguy Ortolo (site web personnel) . ĂvaluĂ© Ă 4.
Pardon, c'est le théorÚme d'échantillonnage, avec deux ennes.
# Je ne sais pas vraiment t'aider, mais j'ai appris des choses
PostĂ© par SĂ©bastien Wilmet (site web personnel, Mastodon) . ĂvaluĂ© Ă 2.
Tout est dans le titre ;-) Donc merci pour ces trĂšs bonnes explications.
Pour néanmoins trouver une piste de solution :
- Chercher dans les bugtrackers et mailing lists de diffĂ©rents logiciels libres relatifs au scannage de documents (sane et simple-scan me viennent Ă l'esprit) ou alors les logiciels qui travaillent directement avec le format PDF (donc s'adresser aux dĂ©veloppeurs upstream qui connaissent et ont touchĂ© Ă la spec PDF). Si aucune info trouvĂ©e, rapporter un bug / demande de fonctionnalitĂ© en espĂ©rant avoir une rĂ©ponse (mĂȘme si la rĂ©ponse ne vient que 5 ans plus tard, avec la fonctionnalitĂ© implĂ©mentĂ©e dans un autre logiciel 5 ans encore aprĂšs, c'est mieux que rien (expĂ©rience typique)).
- Avec peut-ĂȘtre une chance de trouver un bout de script quelque part bien cachĂ© au fin fond du web
^W^Wde GitHub ;-)Suivre le flux des commentaires
Note : les commentaires appartiennent Ă celles et ceux qui les ont postĂ©s. Nous nâen sommes pas responsables.