• # À décomposer

    Posté par (site web personnel) . En réponse au message Solution libre pour PDF "cherchable" (OCR) ?. Évalué à 2.

    Il y a deux besoins dans ta demande :

    • faire de l'extraction de données
    • construire le calque

    Pour la partie extraction je laisse ceux qui en savent plus que moi parler. Le second point dépend bien sûr de la qualité de l'extraction, mais est parfaitement possible avec les réserves suivantes :

    • jeu de police ttf pour lequel tu disposes d'un jeu complet
    • perte des notions de souligné dans le texte (dans un pdf, c'est un graphique en plus, mais est extérieur à la police)
    • positionnement approximatif des lettres : pas de crénage
    • Je suppose que le calque devrait effacer l'image en dessous pour éviter que la lettre ne se superpose ? Dans ce cas, il ne faut pas de font de page sur tes documents...

    À noter qu'il est possible de reproduire l'italique (c'est une transformation à appliquer au texte), mais c'est à tester au cas par cas.

    C'est parfaitement possible avec pdfbox (licence apache), mais demande beaucoup de boulot dans tous les cas. Je crois que tu ne trouveras pas de solution toute faite pour ça.