• [^] # Re: Weboob

    Posté par (site web personnel, Mastodon) . En réponse au journal Extraction de données du web - introduction à Scrapy (journal bookmark). Évalué à 6.

    scrapy est assez proche de ce que fait weboob.browser.

    De ce que je comprends de weboob, le périmètre de Scrapy m'a l'air beaucoup plus large que weboob.browser. Tu peux notamment gérer une ferme de spiders, avec une API pour les monitorer / piloter.

    À ma connaissance je n'ai pas trouvé d'équivalent des pages, filtres ou même d'une gestion des formulaires. En revanche il gère de base l'exportation des objets capturés ("pipeline").

    Qu'appelles-tu les filtres ? Scrapy est architecturé pour extraire des données (là où Weboob est architecturé pour proposer des applications). Scrapy se décompose en 3 couches :

    1. la couche de "crawling" qui va extraire des données brutes et gérer la navigation entre pages et le "pool" d'urls ou plus exactement de requêtes à effectuer.
    2. la couche de traitement des données qui permet de transformer les données brutes extraites durant le crawling en données structurées
    3. la modélisation des données recherchées.

    Le pipeline de Scrapy est extrêmement puissant, tu peux facilement chaîner les opérations (exemple : filtrage des données incomplètes, ou encore on peut imaginer une couche de "filtrage" qui va enrichir les données en corrélant ce qu'on extrait du crawling avec des données déjà en base, la suppression des doublons, etc, etc). Je ne connais pas Weboob sur cet aspect-là.

    Il faudrait que je me penche un peu plus sur la question (notamment faire un comparatif de fonctionnalités car la question revient souvent) mais de loin scrapy m'apparait plein de suppositions sur la façon de gérer un site

    Quel genre de supposition ?

    et semble surtout adapté au « scraping » plutôt qu'à l'interaction dynamique avec un site. À noter que j'utilise déjà weboob.browser pour aspirer des sites énormes ; je n'ai pas l'impression que certaines de mes problématiques soient gérées, comme récupérer les mises à jour de façon efficace, ce qui implique de repasser sur certaines URLs.

    Comment tu fais pour récupérer les mises à jour sans repasser sur les URLs ?

    #tracim pour la collaboration d'équipe __ #galae pour la messagerie email __ dirigeant @ algoo