• [^] # Re: UTF-8 le standard des noms de fichier

    Posté par . En réponse à la dépêche GTK+ 2.6 est disponible. Évalué à 10.

    Je fournis mes propres connaissances qui sont loins d'être complètes...

    UTF-8 est un codage à longueur variable. Les 7 premiers bits du premier octet sont les caractères ASCII-7bits standards. Donc tous les caractères alphanumériques de base s'écrivent de la même façon en UTF-8 et en ASCII (et donc LATIN-*). Le 8ème bit permet d'indiquer si le caractère est codé sur 1 ou plusieurs octets. Les lettres accentués sont codés en UTF-8 sur 2 octets. Et on continue, s'il y a besoin de plus de deux octets, le dernier bit sert à indiquer qu'on passe au troisième octet...

    Du coup, pour les langues asiatiques, on a besoin de beaucoup d'octets pour chaque lettre. Du coup, on a :
    UTF-16 : tous les caractères sont codés sur 2 octets. Comme ça les caractères asiatiques sont toujours codés sur 2 caractères plutôt que sur 4 caractères en UTF-8, ce qui divise la taille des fichiers par 2. Et on s'est rendu compte que 65000 caractères, c'était peut-être pas suffisant du coup :
    UTF-32...

    Conclusion, tout le monde ne jure que par l'UTF-8 parce que c'est le plus pratique pour les américains (leurs caractères ASCII-7 bits resent inchangés !), c'est presque aussi pratique pour les européens (quelques caractèrse à mettre sur 2 octets seulement). Pour les asiatiques, ce n'est pas encore la panacée puisque leurs documents prennent plus de place qu'ils ne pourraient en prendre avec de l'UTF-16.