• [^] # Re: Aaaaaahhhhh chouette: une nouvelle version !

    Posté par . En réponse à la dépêche Weboob atteint le .g. Évalué à 3.

    2/ y a t il une méthode particulière employée pour limiter l'impact de ces changements dans la manière dont sont "scrapés" les sites web ?

    J'ai pas compris la question je crois. Peut-être une piste de réponse serait cependant le module Cragr, qui vu la multiplicité des sites régionaux du crédit agricole, tente de deviner la structure de la page.

    Donc il n'y a pas de méthode imposée pour le scraping.
    Je vois deux moyens de récupérer les données, en prenant l'exemple body>table[class=superdata]>tr>td>donnée

    • le parcours depuis le haut de l'arborescence jusqu'à la donnée elle même: on cherche body, puis l'élément table, puis tr, puis td puis on récupère notre donnée
    • la récupération de l'élément identifiable le plus proche de la donnée, puis on vérifie qu'il est bien dans le contexte requis: on cherche tous les td, puis on ne garde que ceux qui sont dans une table ayant un attribut class=superdata

    la première méthode sera très sensible aux changements
    la deuxième méthode permet de résister à tout déplacement de la table dans la page, ou à l'ajout de ligne supplémentaire dans la table etc...

    est ce qu'il serait intéressant de mettre en place des bonnes pratiques de scraping, comme il peut en exister pour le style du code ?