• [^] # Re: Nom moche

    Posté par . En réponse au journal Areva → New Areva → Orano ? Vérifions ça.... Évalué à 2. Dernière modification le 02 février 2018 à 14:15.

    Techniquement, rien n'empêche d'encoder 'w' sur 4 octets avec la méthode d'encodage d'UTF-8, sauf le fait que la norme dise qu'il faut pas (c'est une règle pour éviter que des gens fassent n'imp, pas une règle imposée par la méthode d'encodage).

    C'est à ceci que je faisais référence:

    In principle, it would be possible to inflate the number of bytes in an encoding by padding the code point with leading 0s. To encode the Euro sign € from the above example in four bytes instead of three, it could be padded with leading 0s until it was 21 bits long – 000 000010 000010 101100, and encoded as 11110000 10000010 10000010 10101100 (or F0 82 82 AC in hexadecimal). This is called an overlong encoding.

    The standard specifies that the correct encoding of a code point use only the minimum number of bytes required to hold the significant bits of the code point. Longer encodings are called overlong and are not valid UTF-8 representations of the code point.

    Donc, non, ce n'est pas standard, mais techniquement ce serait faisable sans péter les parseurs.
    Et mon point c'était que, de toute façon prétendre que 3 (pardon, 4, j'ai oublié le .) caractères c'est pas à franchement parler la mer à boire à écrire, surtout qu'ils ne sont pas nécessairement écrits (redirection du domaine example.com vers le sous-domaine www.example.com) et que l'argument du poids des requêtes est totalement débile compte tenu du simple fait qu'utiliser le world wide web se base à priori sur le protocole http, qui rien qu'avec son en-tête dépassera allègrement en poids le worst-case (d'un www. encode en «utf-8» non standard, qui consommerait donc 16 octets)