URL: https://linuxfr.org/forums/linux-general/posts/solution-libre-pour-pdf-cherchable-ocr Title: Solution libre pour PDF "cherchable" (OCR) ? Authors: Space_e_man Date: 2014年11月18日T16:59:36+01:00 License: CC By-SA Tags: tesseract, ocropus, gocr, searchable, reconnaissance_caractères, pdf et ocr Score: 2 Bonjour, Je cherche à savoir s'il est raisonnable d'espérer pouvoir compter sur une solution à base de logiciel libre pour ajouter automatiquement (traitement par lot) un calque textuel (via OCR) dans un PDF. En gros, c'est une option que propose certains multifonction, nommé Searchable PDF. Cette option à un coût et ici, nous pension l'avoir négociée dans l'offre mais ce n'est pas le cas. Le prestataire demande un supplément, etc. Lorsque nous scannons, un fichier PDF est placé dans un dossier partagé (Samba) sur un serveur GNU/Linux Debian. Et donc, je me disais qu'il y avait peut-être déjà une solution à base de logiciel libre pour passer l'image matricielles contenue dans le PDF dans un OCR (genre Tesseract, OCRopus ou GOCR) et ajouterait le texte obtenu au bon endroit comme un calque (layer en anglais) dans un nouveau fichier PDF, en plus de l'image (nouveau fichier). C'est ce que fait l'option payant dans le multifonction, sauf qu'ici, ça se ferait au niveau du multifonction. Je cherche également par moi-même sur le web mais je trouve rien pour l'instant..., sauf les certaines pièces du puzzle (poppler-utils → pdfimage pour extraire l'image ; Tesseract pour l'OCR ; ...) dans l'idée de créer un nouveau logiciel... Mais peut-être existe-t-il déjà ?

AltStyle によって変換されたページ (->オリジナル) /