Je ne suis pas dans l'équipe de dev, juste un utilisateur de la première heure, donc mon expertise technique est limitée sur ce sujet. Je vais essayer de ne pas dire trop de bétises.
Le rendering et tout ce qui tourne autour du pdf (parsing) est géré par PDF.js depuis la version 1.0. Par le passé, c'était JPedal qui fait tout cela mais le changement a eu lieu récemment.
[^] # Re: Extraction de données ?
Posté par toctoc1 . En réponse à la dépêche Sortie de Tabula 1.0.1 - Extraction de données tabulaires dans des pdfs. Évalué à 8.
Je ne suis pas dans l'équipe de dev, juste un utilisateur de la première heure, donc mon expertise technique est limitée sur ce sujet. Je vais essayer de ne pas dire trop de bétises.
Le rendering et tout ce qui tourne autour du pdf (parsing) est géré par PDF.js depuis la version 1.0. Par le passé, c'était JPedal qui fait tout cela mais le changement a eu lieu récemment.
Pour la partie extraction du tableau, Tabula utilise deux algorithmes maisons et effectivement PDFBox.
Plutôt que de reformuler maladroitement l'aspect technique du fonctionnement de Tabula, je préfère te renvoyer vers cette page : https://github.com/tabulapdf/tabula-extractor#how-does-this-work-like-theoretically
Ces deux algo sont basés notamment sur cette publication universitaire.