• [^] # Re: la lenteur extraordinaire d'utf8

    Posté par (Mastodon) . En réponse au journal L'utf-8 et les décideurs. Évalué à 2.

    Tu confonds encore point de code et représentation informatique de ces points de code. Alors on va recommencer...

    UCS-{2,4} définissent des points de codes, c'est à dire qu'ils assignent à chaque caractère des numéros, rien de plus. UCS-2 (sur 2 octets) ne contient que les points de codes inférieurs à 65535, logique, donc pas tous les caractères. UCS-4 (sur 4 octets) contient plus plus de points de codes, logique aussi, et même tous les points de codes.

    UTF-{8,16,32} est une manière de représenter les points de code informatiquement. Les caractères en UTF-8 peut avoir 4 octets au maximum, pas 6. En UTF-16, c'est 4 octets maximum aussi et en UTF-32, c'est 4 octets tout le temps.