Je suis intéressé sur la manière dont est effectué la détection de tableau dans le pdf, et j'ai beau chercher dans le repo où est chargé le pdf, mais je suis un peu perdu. Je trouve un jar avec les dépendances dans le répertoire jar, mais je ne sais pas où trouver les sources de celui-ci...
Est-ce que tu peux détailler (vite fait) comment tu extrait le tableau ? Pour ceux qui ne connaissent pas le pdf, le langage ne garantie pas que le texte est présent de manière séquentielle dans le fichier, c'est plutôt :
va aux coordonnées X1,Y1; affiche le texte "..."
va au coordonnées X2, Y2; affiche le texte "..."
avec tous les problèmes que cela peut poser (l'espace peut ne pas être représentée etc)
(Au passage, puisque ça fonctionne dans une jvm, est-ce que vous avez choisi d'utiliser pdfbox ?)
# Extraction de données ?
Posté par chimrod (site web personnel) . En réponse à la dépêche Sortie de Tabula 1.0.1 - Extraction de données tabulaires dans des pdfs. Évalué à 2.
Je suis intéressé sur la manière dont est effectué la détection de tableau dans le pdf, et j'ai beau chercher dans le repo où est chargé le pdf, mais je suis un peu perdu. Je trouve un jar avec les dépendances dans le répertoire jar, mais je ne sais pas où trouver les sources de celui-ci...
Est-ce que tu peux détailler (vite fait) comment tu extrait le tableau ? Pour ceux qui ne connaissent pas le pdf, le langage ne garantie pas que le texte est présent de manière séquentielle dans le fichier, c'est plutôt :
avec tous les problèmes que cela peut poser (l'espace peut ne pas être représentée etc)
(Au passage, puisque ça fonctionne dans une jvm, est-ce que vous avez choisi d'utiliser pdfbox ?)