• # DjVu

    Posté par (site web personnel) . En réponse au journal manipuler des PDF. Évalué à 10.

    Pour les documents numérisés, le format DjVu est particulièrement utile, parce qu'il permet de stocker des documents, même en très haute définition, avec un poids modéré. Pour cela, un document y est stocké en trois ou quatre couches superposées :

    • un arrière-plan en couleur, en définition plutôt faible, compressé genre JPEG-2000 ;
    • un « masque » bitonal (noir ou blanc, pas de gris), en haute définition, compressé genre JBIG2 ;
    • un premier-plan en couleur, en définition plutôt faible, compressé genre JPEG-2000 ;
    • au besoin, une couche invisible de caractères issus d'une OCR.

    Pour stocker un document numérisé en DjVu, l'étape cruciale est donc celle qui fera cette séparation en couches. Jusqu'à présent, j'utilisais didjvu. Malheureusement, comme pas mal d'outils liés à ce format, ce n'est que moyennement maintenu, et en particulier, c'est resté en Python 2 pour le moment.

    C'est tout de même très efficace, je stocke sans problème des documents numérisés en 1200 points par pouce dans moins de 100 kio par page. Et pour ceux qui ne lisent pas le PDF, pas de problème, on peut exporter un document DjVu en PDF, ce qui prend beaucoup plus de place, ou même n'exporter que son « masque » bitonal en PDF, pour un poids à peu près identique au DjVu.

    Ce qui se fait en DjVu pourrait maintenant se faire en PDF, vu que ce format prend en charge les images en JPEG-2000 et en JBIG2, et qu'on doit bien pouvoir leur associer un masque alpha pour les superposer. Seulement, il n'y a aucun outil, libre en tout cas, pour faire ça en PDF.