Les personnes (prospects) avec qui j'ai pu échanger sur des problématiques de scraping / crawling. A part sur LinuxFR, je n'ai jamais entendu parler de weboob.
Je me demande toujours pourquoi weboob ne s'est pas basé dessus
Scrappy ne fournit pas grand-chose par dessus requests et lxml,
Scrappy a de gros avantages sur des fonctionnalités "plus bas niveau" que weboob :
il est basé sur twister pour l'ordonancement des requêtes, la gestion asynchrone des requêtes ce qui est très puissant pour les problématiques de crawling.
il propose un mécanisme de pipeline hyper souple qui te permet par exemple d'enchaîner les traitements pour dire "je prends l'information à tel endroit. Si elle n'est pas disponible ou pas conforme, je vais la chercher à tel endroit. etc, etc", et ce en gardant un code propre et clair (en gros, pas en faisant des if, elif, else comme on le ferait si on codait bêtement)
il propose une architecture distribuable pour faire tourner des crawlers sur plusieurs machines et les alimenter gérer à partir d'un "master"
il s'installe comem n'importe quel module python, donc compatible avec venv et la "généricité" associée. Weboob est un outil "à installer", moins intégré dans un tel contexte (c'est pas mieux ou moins bien, c'est différent)
que weboob utilise aussi tout en proposant beaucoup plus de choses pour faciliter le développement. Il y avait plutôt « à faire » que « à refaire ».
Scrapy n'est pas un outil de traitement de flux HTML mais un frameword de crawling. Par dessus, il faut de l'intelligence de traitement de flux HTML - ce qu'implémente très bien weboob. Mais Weboob aurait très bien pu s'appuyer sur la puissance de Scrapy ; ce n'est pas exclusif car les métiers sont différents.
il faut lutter pour trouver le code
Je ne comprends pas trop vu qu'il y a bien plus de modules libres pour weboob que pour scrapy et que c'est une grande ressource de problèmes déjà résolus.
Réutiliser les modules weboob serait une bonne idée. Mais comme on touche directement au métier, la visibilité sur le code est importante. J'aimerais pouvoir faire un "pip install weboob_apec" par exemple.
La manière dont Scrapy est intégrée dans pyjobs, c'est juste une brique techno, on utilise l'API et puis c'est tout. Et pour l'installer c'est facile : pip install scrapy.
Je considère que weboob est un outil "clé en main" donc pas conçu pour être réutilisé ; scrapy c'est plutôt un "toolkit" qui est concçu pour être réutilisé (mais en contrepartie de quoi il n'est pas tout à fait "clé en main")
#tracim pour la collaboration d'équipe __ #galae pour la messagerie email __ dirigeant @ algoo
[^] # Re: Dépêche ?
Posté par LeBouquetin (site web personnel, Mastodon) . En réponse au journal pyjobs - un job-board pour les agréger tous.. Évalué à 10.
Les personnes (prospects) avec qui j'ai pu échanger sur des problématiques de scraping / crawling. A part sur LinuxFR, je n'ai jamais entendu parler de weboob.
Scrappy a de gros avantages sur des fonctionnalités "plus bas niveau" que weboob :
Scrapy n'est pas un outil de traitement de flux HTML mais un frameword de crawling. Par dessus, il faut de l'intelligence de traitement de flux HTML - ce qu'implémente très bien weboob. Mais Weboob aurait très bien pu s'appuyer sur la puissance de Scrapy ; ce n'est pas exclusif car les métiers sont différents.
Réutiliser les modules weboob serait une bonne idée. Mais comme on touche directement au métier, la visibilité sur le code est importante. J'aimerais pouvoir faire un "pip install weboob_apec" par exemple.
La manière dont Scrapy est intégrée dans pyjobs, c'est juste une brique techno, on utilise l'API et puis c'est tout. Et pour l'installer c'est facile : pip install scrapy.
Je considère que weboob est un outil "clé en main" donc pas conçu pour être réutilisé ; scrapy c'est plutôt un "toolkit" qui est concçu pour être réutilisé (mais en contrepartie de quoi il n'est pas tout à fait "clé en main")
#tracim pour la collaboration d'équipe __ #galae pour la messagerie email __ dirigeant @ algoo