• [^] # Re: [PBM UNICODE] Quelqu'un pour me confirmer?

    Posté par (site web personnel) . En réponse au journal [PBM UNICODE] Quelqu'un pour me confirmer?. Évalué à 1.

    Bin il existe des algos pour deviner l'encodage du fichier (ce que fait mozilla assez bien d'ailleurs).

    En cherchant "guess charset" dans google notre ami (mais pas sûr qu'il nous veuille toujours du bien) on trouve des infos. Il existe un port de l'algo de Mozilla en java (trouvé sur sf.net, mais pas le lien sous la main, la flemme de chercher).

    Sinon Groovy intègre un "Charset Detector" aussi. En regardant comment il fonctionne : il regarde si il y a un BOM, dans ce cas il retourne le charset unicode correspondant, sinon il considère que c'est de l'utf8 et il parcourt un extrait du fichier jusqu'à rencontrer un caractère qui ne correspond pas à de l'utf8. Si il en trouve un, il retourne le charset par défault (ca vaut ce que ca vaut).

    ps : je n'ai pas craché directement sur MS, je me suis posé la question de savoir si c'etait prévu. Apparement il n'y a qu'eux qui le font. Car ca brise la compatibilité latin/utf8 pour les char <= 127