En gros, Scrapy est plus « connu », ils ont un marketing hype et corporate, ce que l'on a pas (et qu'on ne sait pas faire). J'en suis bien conscient, mais ce n'est pas vraiment ce que j'ai en tête par référence.
il est basé sur twister pour l'ordonancement des requêtes, la gestion asynchrone des requêtes ce qui est très puissant pour les problématiques de crawling.
On a ça aussi, avec concurrent.futures.
il propose un mécanisme de pipeline hyper souple qui te permet par exemple d'enchaîner les traitements pour dire "je prends l'information à tel endroit. Si elle n'est pas disponible ou pas conforme, je vais la chercher à tel endroit. etc, etc",
On a ça aussi, fillobj, qui permet de remplir un objet à la demande. Suivant la manière dont il a été obtenu, ou du besoin, on économise des requêtes.
il propose une architecture distribuable pour faire tourner des crawlers sur plusieurs machines et les alimenter gérer à partir d'un "master"
On a pas, probablement jamais chez nous sauf à circonscrire les modules dans un mode de fonctionnement comme Scrapy (i.e. uniquement parcours de site et sans côté stateful du Browser). Ceci dit, je ne sais pas trop quelle est l'utilisation (c'est plutôt moi qui met le site à genoux avec une seule machine, du coup je mets des délais, d'ailleurs c'est quelque chose que l'on a pas nativement dans Weboob et qui a l'air bien faite chez Scrapy).
il s'installe comem n'importe quel module python, donc compatible avec venv et la "généricité" associée
On peut faire import weboob, et éventuellement utiliser WebNip pour initialiser les modules sans aucun fichier de config nécessaire. Ou si on veut utiliser seulement l'équivalent de Scrapy, on peut se cantonner à weboob.Browser, ce que je fais souvent pour des scripts jetables.
J'aimerais pouvoir faire un "pip install weboob_apec" par exemple.
On peut installer les modules via pip, ceux livrés avec weboob sont distribués via https://git.symlink.me/?p=weboob/modules.git;a=tree
On a peu communiqué dessus et à ma connaissance il n'y a qu'un seul utilisateur.
Rien n'empêche de faire la même chose avec les siens.
[^] # Re: Dépêche ?
Posté par laurentb . En réponse au journal pyjobs - un job-board pour les agréger tous.. Évalué à 3. Dernière modification le 05 février 2016 à 14:29.
En gros, Scrapy est plus « connu », ils ont un marketing hype et corporate, ce que l'on a pas (et qu'on ne sait pas faire). J'en suis bien conscient, mais ce n'est pas vraiment ce que j'ai en tête par référence.
On a ça aussi, avec
concurrent.futures.On a ça aussi,
fillobj, qui permet de remplir un objet à la demande. Suivant la manière dont il a été obtenu, ou du besoin, on économise des requêtes.On a pas, probablement jamais chez nous sauf à circonscrire les modules dans un mode de fonctionnement comme Scrapy (i.e. uniquement parcours de site et sans côté stateful du Browser). Ceci dit, je ne sais pas trop quelle est l'utilisation (c'est plutôt moi qui met le site à genoux avec une seule machine, du coup je mets des délais, d'ailleurs c'est quelque chose que l'on a pas nativement dans Weboob et qui a l'air bien faite chez Scrapy).
On peut faire
import weboob, et éventuellement utiliserWebNippour initialiser les modules sans aucun fichier de config nécessaire. Ou si on veut utiliser seulement l'équivalent de Scrapy, on peut se cantonner àweboob.Browser, ce que je fais souvent pour des scripts jetables.On peut installer les modules via pip, ceux livrés avec weboob sont distribués via https://git.symlink.me/?p=weboob/modules.git;a=tree
On a peu communiqué dessus et à ma connaissance il n'y a qu'un seul utilisateur.
Rien n'empêche de faire la même chose avec les siens.