C'est une piste. D-autant que si j'utilise le fichier provurl1 :
pop
http:\/\/www.geographiques.com\/spip\/article.php3?id_article=18
platsch
J'ai :
$ old=$(sed -n 2p provurl1)
$ echo $old
http:\/\/www.geographiques.com\/spip\/article.php3?id_article=18
$ sed -n "/$old/=" provht1
1 # ca marche
Tandis que si j'utilise mon provurl1, j'ai :
$ old=$(sed -n 33p provurl1)
$ echo $old
http:\/\/www.geographiques.com\/spip\/article.php3?id_article=18
$ sed -n "/$old/=" provht1
0 # ca ne marche pas
Et sur le terminal, je ne vois pas la différence entre les deux lignes :
http:\/\/www.geographiques.com\/spip\/article.php3?id_article=18
http:\/\/www.geographiques.com\/spip\/article.php3?id_article=18
On va voir avec od... demain. Là, je n'en peux plus : dodo !
C'est curieux parce que mon fichier provurl1 a été fabriqué par un script bash qui extrait les url à partir de href="http://etc". En principe, c'est de l'ASCII de base et pour toutes les url extraites, aucun problème sauf celle-là et même une partie de celle-là 'spip... etc' Une scorie se serait donc glissée dans cette partie lors de l'opération d'extraction ? Possible, mais inquiétant car c'est une centaine de pages que je voudrais vérifier
[^] # Re: Encodage ? Je vais voir
Posté par Christian Prior . En réponse au message Pb d'extraction d'une url. Évalué à 1.
pop
http:\/\/www.geographiques.com\/spip\/article.php3?id_article=18
platsch
J'ai :
$ old=$(sed -n 2p provurl1)
$ echo $old
http:\/\/www.geographiques.com\/spip\/article.php3?id_article=18
$ sed -n "/$old/=" provht1
1 # ca marche
Tandis que si j'utilise mon provurl1, j'ai :
$ old=$(sed -n 33p provurl1)
$ echo $old
http:\/\/www.geographiques.com\/spip\/article.php3?id_article=18
$ sed -n "/$old/=" provht1
0 # ca ne marche pas
Et sur le terminal, je ne vois pas la différence entre les deux lignes :
http:\/\/www.geographiques.com\/spip\/article.php3?id_article=18
http:\/\/www.geographiques.com\/spip\/article.php3?id_article=18
On va voir avec od... demain. Là, je n'en peux plus : dodo !
C'est curieux parce que mon fichier provurl1 a été fabriqué par un script bash qui extrait les url à partir de href="http://etc". En principe, c'est de l'ASCII de base et pour toutes les url extraites, aucun problème sauf celle-là et même une partie de celle-là 'spip... etc' Une scorie se serait donc glissée dans cette partie lors de l'opération d'extraction ? Possible, mais inquiétant car c'est une centaine de pages que je voudrais vérifier