Retourner au contenu associé (entrée de forum : Extraction de données de CV)
Posté par Atem18 le 24 mars 2014 à 13:09. En réponse au message Extraction de données de CV. Évalué à 2. Dernière modification le 24 mars 2014 à 13:14.
Etant donné que l'ODT et le DOCX sont du XML, et que tu peux convertir du PDF en XML, j'imagine qu'une lib de parsing XML sera ton allié.
Le plus simple pour moi, est d'utiliser le Python et il existe justement une lib pour ça : http://docs.python.org/2/library/xml.etree.elementtree.html
Sinon, tu peux aussi utiliser BeautifulSoup : http://www.crummy.com/software/BeautifulSoup/bs4/doc/
Et enfin, si tu galère à ouvrir l'odt, une personne de stack overflow donne un code pour récupérer le content.xml : https://stackoverflow.com/questions/15629408/how-to-retrive-data-from-odt-xml-file-in-python
AltStyle によって変換されたページ (->オリジナル) / アドレス: モード: デフォルト 音声ブラウザ ルビ付き 配色反転 文字拡大 モバイル
# Parsing XML ?
Posté par Atem18 . En réponse au message Extraction de données de CV. Évalué à 2. Dernière modification le 24 mars 2014 à 13:14.
Etant donné que l'ODT et le DOCX sont du XML, et que tu peux convertir du PDF en XML, j'imagine qu'une lib de parsing XML sera ton allié.
Le plus simple pour moi, est d'utiliser le Python et il existe justement une lib pour ça : http://docs.python.org/2/library/xml.etree.elementtree.html
Sinon, tu peux aussi utiliser BeautifulSoup : http://www.crummy.com/software/BeautifulSoup/bs4/doc/
Et enfin, si tu galère à ouvrir l'odt, une personne de stack overflow donne un code pour récupérer le content.xml : https://stackoverflow.com/questions/15629408/how-to-retrive-data-from-odt-xml-file-in-python