Pour les documents Office, c'est essentiellement le format OLE2, et ce format est le plus complexe de tous les formats qui existent sur Terre. Un parseur a été entamé mais c'est pas encore ça. Aujourd'hui la meilleure bibliothèque pour lire ces informations est libgsf. Plus d'info par ici : http://hachoir.org/wiki/MicrosoftOffice
Pour OpenOffice, rien n'a été fait pour l'instant, bien qu'un parseur ZIP existe et que Python a tout le nécessaire pour manipuler du XML.
Pour PDF, un parseur existait il y a bien longtemps, mais depuis il n'a pas été récupéré.
[^] # Re: Documents bureautique
Posté par Victor STINNER (site web personnel) . En réponse à la dépêche Faites parler vos fichiers avec hachoir-metadata. Évalué à 4.
http://hachoir.org/wiki/MicrosoftOffice
Pour OpenOffice, rien n'a été fait pour l'instant, bien qu'un parseur ZIP existe et que Python a tout le nécessaire pour manipuler du XML.
Pour PDF, un parseur existait il y a bien longtemps, mais depuis il n'a pas été récupéré.