• [^] # Re: Comment identifier un encodage?

    Posté par . En réponse au journal Comment identifier un encodage?. Évalué à 2.

    La reconnaissance ne se fait effectivement que sur les 128 derniers caractères.

    Pour l'utf, même l'utf8 est facilement reconnaissable, car tous les chars>128
    doivent être ordonnés de manière particulière. Le problème est effectivement
    pour les autre charsets, et il n'y a sûrement pas d'algo magique (car plusieurs
    charsets possible dans les cas particuliers), mais il est possible de noter chaque
    version d'un document source dans les différents charsets et d'en choisir le
    meilleur... et si il n'est pas possible de départager dans les cas particuliers, on
    doit alors laisser l'utilisateur se débrouiller avec ces noms barbares :)
    Maintenant je cherche l'algo (ou les algos) permettant sans trop se compliquer la
    vie de noter avec une exactitude satisfaisante.

    Si j'arrive à quelque chose de concluant, je diffuserais la bibliothèque, bien que vu
    comme c'est parti l'api risque d'être assez bordélique...