• [^] # Re: capabilities

    Posté par . En réponse à la dépêche FreeBSD 9.0 est disponible. Évalué à 2.

    Surtout qu'utf-8, précisément, a été conçu pour qu'un algorithme de recherche sur des données binaires garde sa pertinence en utf-8.

    Il doit me manquer quelque chose, parce que je n'arrive pas à la bonne conclusion. En UTF-8, il est possible de sauter au caractère suivant sans passer sur tous les octets. L'algorithme décrit dans le fil demande de sauter plusieurs caractères, ce qui est particulièrement efficace si l'on est certain qu'un caractère fera un octet. Avec UTF-8, il faudra donc tout de même passer sur chaque caractère, et dans le cas précis où le texte ne contient que des caractères n'utilisant qu'un octet, il faudra passer sur chaque octet, ce que l'on voulait éviter.
    On peut aussi sauter quand même N octets, mais on ne saura pas combien de caractères on a sauté.