J'ai eu à faire ça pour le boulot: j'utilise libxml2 et le module HTMLparser
J'avais déjà du code présent pour parser du xml en sax avec libxml2, je l'ai adapté pour utiliser les fonctions html.
Je parse en SAX mais tu peux aussi parser en DOM.
Regarde les fonctions readFile, htmlSAXParseDoc, etc.
Mon programme scanne un paquet d'URL, j'ai pas tout vérifié, mais il me semble que libxml s'en sort dans le cas d'un document mal formé.
# libxml
Posté par Sphax . En réponse au message Analyser un fichier html. Évalué à 1.
J'avais déjà du code présent pour parser du xml en sax avec libxml2, je l'ai adapté pour utiliser les fonctions html.
Je parse en SAX mais tu peux aussi parser en DOM.
Regarde les fonctions readFile, htmlSAXParseDoc, etc.
Mon programme scanne un paquet d'URL, j'ai pas tout vérifié, mais il me semble que libxml s'en sort dans le cas d'un document mal formé.