Je sais pas, sans vouloir être pour la domination d'une langue en particulier, lire du code dans un alphabet utf-8, peut s'avérer ardu, surtout si le jeu de caractère n'est pas présent/dispo sur la machine.
L'alphabet latin est connu d'à peu près tout le monde (les japonais l’apprennent, même s'il n'est pas le leur), il à l'intérêt de ne pas avoir de collision ou peu (i, 1 I l |, qui sont facilement visible avec les polices de codage)
Pour les url, je serai pour avoir un indicateur visuel dès que des caractères sortent du groupement majoritaire, et un indicateur différent selon l'origine du caractère, on a je ne sais combien de a en utf-8, mais cela ne s'arrête pas la, on peut jouer avec les . les / et autre éléments constitutifs des url.
D'un point de vue purement codage, sémantique et autre, se limiter a 255 caractère simplifie beaucoup l'écriture des lexeurs et on à moins de cas particulier à gérer (et encore, si on se limite à l'ascii commun (sans accent)), on simplifie encore plus, un nom de fonction/variable c'est [a-zA-Z0-9_]+; si on se met à gérer tous les alphabet existant, on doit gérer les espaces (quadratin, insécable, autre), les barres obliques, séparateurs, mais bon c'est mon coté flémouille qui s'y colle...
Le soucis c'est qu'en jouant assez bien on doit très facilement pouvoir ajouter des backdoor rien, qu'en trichant sur les héritages ou affectation de variable à la graphie similaire.
Ensuite on pourrait limiter les fichiers de code à un ensemble de caractère correspondant à une langue; pour les url colorier les caractères des url en fonction des risque des confusion (latin, hiragana, katakana => bleu; arabe, grec => vert...)
On est dans un monde Unicode
nan utf-8 et c'est la chianli, impossible de savoir facilement combien d'octet fait ta chaine de 15 caractères, la différence de perf entre un LANG=C grep et grep tout court est assez impressionnante; on devrait utiliser du utf-16 ou utf-32; où les caractères sont de taille fixe.
Il ne faut pas décorner les boeufs avant d'avoir semé le vent
[^] # Re: Microsоft.com, Faςebook.com
Posté par fearan . En réponse à la dépêche confusable-homoglyphs : une bibliothèque pour gérer les caractères qui se ressemblent. Évalué à 1.
Je sais pas, sans vouloir être pour la domination d'une langue en particulier, lire du code dans un alphabet utf-8, peut s'avérer ardu, surtout si le jeu de caractère n'est pas présent/dispo sur la machine.
L'alphabet latin est connu d'à peu près tout le monde (les japonais l’apprennent, même s'il n'est pas le leur), il à l'intérêt de ne pas avoir de collision ou peu (i, 1 I l |, qui sont facilement visible avec les polices de codage)
Pour les url, je serai pour avoir un indicateur visuel dès que des caractères sortent du groupement majoritaire, et un indicateur différent selon l'origine du caractère, on a je ne sais combien de a en utf-8, mais cela ne s'arrête pas la, on peut jouer avec les . les / et autre éléments constitutifs des url.
D'un point de vue purement codage, sémantique et autre, se limiter a 255 caractère simplifie beaucoup l'écriture des lexeurs et on à moins de cas particulier à gérer (et encore, si on se limite à l'ascii commun (sans accent)), on simplifie encore plus, un nom de fonction/variable c'est [a-zA-Z0-9_]+; si on se met à gérer tous les alphabet existant, on doit gérer les espaces (quadratin, insécable, autre), les barres obliques, séparateurs, mais bon c'est mon coté flémouille qui s'y colle...
Le soucis c'est qu'en jouant assez bien on doit très facilement pouvoir ajouter des backdoor rien, qu'en trichant sur les héritages ou affectation de variable à la graphie similaire.
Ensuite on pourrait limiter les fichiers de code à un ensemble de caractère correspondant à une langue; pour les url colorier les caractères des url en fonction des risque des confusion (latin, hiragana, katakana => bleu; arabe, grec => vert...)
nan utf-8 et c'est la chianli, impossible de savoir facilement combien d'octet fait ta chaine de 15 caractères, la différence de perf entre un LANG=C grep et grep tout court est assez impressionnante; on devrait utiliser du utf-16 ou utf-32; où les caractères sont de taille fixe.
Il ne faut pas décorner les boeufs avant d'avoir semé le vent