La reconnaissance ne se fait effectivement que sur les 128 derniers caractères.
Pour l'utf, même l'utf8 est facilement reconnaissable, car tous les chars>128
doivent être ordonnés de manière particulière. Le problème est effectivement
pour les autre charsets, et il n'y a sûrement pas d'algo magique (car plusieurs
charsets possible dans les cas particuliers), mais il est possible de noter chaque
version d'un document source dans les différents charsets et d'en choisir le
meilleur... et si il n'est pas possible de départager dans les cas particuliers, on
doit alors laisser l'utilisateur se débrouiller avec ces noms barbares :)
Maintenant je cherche l'algo (ou les algos) permettant sans trop se compliquer la
vie de noter avec une exactitude satisfaisante.
Si j'arrive à quelque chose de concluant, je diffuserais la bibliothèque, bien que vu
comme c'est parti l'api risque d'être assez bordélique...
[^] # Re: Comment identifier un encodage?
Posté par calandoa . En réponse au journal Comment identifier un encodage?. Évalué à 2.
Pour l'utf, même l'utf8 est facilement reconnaissable, car tous les chars>128
doivent être ordonnés de manière particulière. Le problème est effectivement
pour les autre charsets, et il n'y a sûrement pas d'algo magique (car plusieurs
charsets possible dans les cas particuliers), mais il est possible de noter chaque
version d'un document source dans les différents charsets et d'en choisir le
meilleur... et si il n'est pas possible de départager dans les cas particuliers, on
doit alors laisser l'utilisateur se débrouiller avec ces noms barbares :)
Maintenant je cherche l'algo (ou les algos) permettant sans trop se compliquer la
vie de noter avec une exactitude satisfaisante.
Si j'arrive à quelque chose de concluant, je diffuserais la bibliothèque, bien que vu
comme c'est parti l'api risque d'être assez bordélique...