Si tu veux le faire en Python, tu as le module htmllib pour parser du HTML. Pas compliqué à utiliser, tu fais une classe fille de HTMLparser dont tu redéfinis la méthode starttag. C'est 3 lignes de codes, le parser digère bien le HTML non conforme, et y'a un exemple tout prêt dans la doc.
# Re: Traitement de page HTML
Posté par __caffeine__ . En réponse au journal Traitement de page HTML. Évalué à 1.