• [^] # Re: Source des données

    Posté par . En réponse au journal Crowd sourcing pour le nouveau data pipeline de linuxfr. Évalué à 2. Dernière modification le 23 juillet 2018 à 20:13.

    Pour répondre à la dépêche, je ne trouve pas que le problème est pris dans le bon sens. AMHA il faut limiter le crawling de linuxfr.

    Je suis d'accord. J'ai commence la premiere partie, qui doit downloader les pages de linuxfr et je fais mes tests de parsing localement sur une copie de page qui est dans le repertoire resources de mes unit tests.

    Si quelqu'un d'autre travaille sur cette partie, j'espere qu'elle fait de meme.

    Il vaut mieux le faire une fois et fournir une archive (ça pourrait même être mis à dispo par l'équipe de manière (bi ?)mensuelle). À partir de là tout ceux que ça intéresse peuvent monter leur propre solution.

    Oui, parser une fois, pour avoir des donnees de test ca sera bon.