Tu récupères l'index avec urllib2 et ensuite tu parses le contenu, non ?
Les cibles des liens sont entourés de guillemets et commencent par "http://", ça devrait suffire pour construire une belle regexp. Ensuite tu lui applique la méthode findall() et ça devrait être bon.
Fais gaffe à bien compiler ta regexp en "non-greedy" mais sinon je pense que ça devrait bien se passer
# urllib + regexp
Posté par Aurélien Bompard (site web personnel) . En réponse au message récupérer la liste d'un répertoire web. Évalué à 2.
Les cibles des liens sont entourés de guillemets et commencent par "http://", ça devrait suffire pour construire une belle regexp. Ensuite tu lui applique la méthode findall() et ça devrait être bon.
Fais gaffe à bien compiler ta regexp en "non-greedy" mais sinon je pense que ça devrait bien se passer