n'est il pas possible d'avoir accès à la source qui génère les pages (genre une base de données)
Il faut pour ça que les admins de linuxfr nettoient la base de données. Ils peuvent le faire, mais ça prend du temps (et ce n'est pas particulièrement amusant).
mieux à l'application qui écrit ces données en base ?
L'objectif c'est d'avoir des données, le code qui les produit ne sert à rien dans ce contexte.
Pour répondre à la dépêche, je ne trouve pas que le problème est pris dans le bon sens. AMHA il faut limiter le crawling de linuxfr.
Il vaut mieux le faire une fois et fournir une archive (ça pourrait même être mis à dispo par l'équipe de manière (bi ?)mensuelle). À partir de là tout ceux que ça intéresse peuvent monter leur propre solution.
[^] # Re: Source des données
Posté par barmic . En réponse au journal Crowd sourcing pour le nouveau data pipeline de linuxfr. Évalué à 1.
Il faut pour ça que les admins de linuxfr nettoient la base de données. Ils peuvent le faire, mais ça prend du temps (et ce n'est pas particulièrement amusant).
L'objectif c'est d'avoir des données, le code qui les produit ne sert à rien dans ce contexte.
Pour répondre à la dépêche, je ne trouve pas que le problème est pris dans le bon sens. AMHA il faut limiter le crawling de linuxfr.
Il vaut mieux le faire une fois et fournir une archive (ça pourrait même être mis à dispo par l'équipe de manière (bi ?)mensuelle). À partir de là tout ceux que ça intéresse peuvent monter leur propre solution.