Parser du HTML "à la mano" n'est pas forcément très fiable. Il suffit qu'un site ajoute un retour chariot pour les lignes trop longues, pour que le parser foire sur certaines news.
Et pour certains sites bourrés de tags identiques, mais dans des contextes différents, le parsage n'est pas évident.
Donc le mieux est de créer un arbre d'après le document HTML. En Perl, les modules XML::Driver::HTML et HTML::TreeBuilder sont géniaux pour ce genre d'opération.
En C, une interface SAX comme Gnome-XML (libxml) est aussi très pratique pour construire facilement cet arbre, à condition que le HTML ne soit pas trop pourri.
[^] # Re: Mouais...
Posté par j . En réponse à la dépêche Les news de linuxfr sous gnome. Évalué à 1.
Et pour certains sites bourrés de tags identiques, mais dans des contextes différents, le parsage n'est pas évident.
Donc le mieux est de créer un arbre d'après le document HTML. En Perl, les modules XML::Driver::HTML et HTML::TreeBuilder sont géniaux pour ce genre d'opération.
En C, une interface SAX comme Gnome-XML (libxml) est aussi très pratique pour construire facilement cet arbre, à condition que le HTML ne soit pas trop pourri.