• [^] # Re: la lenteur extraordinaire d'utf8

    Posté par . En réponse au journal L'utf-8 et les décideurs. Évalué à 1.

    > suivant les cas, un caractère fait 1 2 ou 4 octets

    ucs2 tient sur 2 octets.ucs4 (supporté depuis assez longtemps par la glibc) tient sur 4 octets. Par contre le codage de usc4 en utf-8 tient sur 1 à 6 octets. Si c'est de l'ASCII, ça tient sur 1 octet et c'est la même valeur que ASCII.

    > l'UTF-8 est juste là pour éviter de doubler la taile de fichiers qui contiennent essentiellement de l'ASCII.

    Voir quadripler.

    En passant, UTF-16 ne code pas forcément les caractères sur 2 octets. Pour le codage de usc2 c'est le cas, ce n'est plus le cas pour usc4.