• [^] # Re: Merci et unicode

    Posté par . En réponse au journal Memoire, une classe LaTeX pour les études littéraires.. Évalué à 2.

    Je voulais dire que les fichiers de bibliographie comme tous les fichiers dont el contenu va à un moment ou l'autre être inputé par TeX et non produits par l'utilisateur devraient se comporter de la même façon quelque soit le codage de document choisi par l'utilisateur ... sinon c'est la cagate assurrée.

    Quelle importance ? C’est mon fichier de bibliographie que j’utilise dans mes documents, je maîtrise la chaîne de bout en bout.

    Si je récupère une bibliographie venue d’ailleurs, je la transcode en UTF-8 et il n’y a ps de problème. Si je dois passer ma bibliographie à une tierce personne, je peux la lui fournir en UTF-8 et il peut la transcoder dans l’encodage qu’il veut (s’il me le demande gentiment je peux mêmer effectuer le transcodage moi-même).

    Pourtant le codage ASCII-7 pour les fichiers de bibliographie et utilisé par plusieurs grosses bases de données bibligraphiques (pour les fichiers BibTeX) comme mathscinet ou citeseer.

    LE 7-bits + séquences d’échappements à la TeX n’est pas proposé comme encodage d’export par PubMed ; c’est soit du 7-bits tout court (autrement dit, avec tous les caractères hors ASCII remplacés par des caractères ASCII, genre tous les e accentués remplacés par un e normal, etc.) soit du XML encodé en UTF-8. C’est ce dernier format que je récupère, et que je convertis en BibTeX toujours encodé en UTF-8.

    À mon avis, la bonne approche est de générer le fichier BibTeX à partir d'une autre donnée qui, elle, est en unicode si tu aimes bien unicode.

    Oui, c’est ce que je fais. mais je génère le fichier BibTeX en UTF-8. Pourquoi ? Cf. plus haut : c’est mon fichier que j’utilise avec mes documents.

    En fait, pendant un temps j’ai généré un fichier BibTeX en 7-bits + séquences d’échappements à la TeX. Comme je ne connais pas d’outils permettant de transcoder directment dans ce pseudo-encodage, j’avais un script sed tout con qui remplaçaient tous les caractères exotiques par des séquences d’échappement. Ça marchait bien au début, jusqu’à ce que j’en ai marre de devoir ajouter une ligne dans le script à chaque fois que je tombais sur une entrée bibliographique contenant un caractère que je n’avais encore jamais vu. Et puis j’ai tout simplment fini par en avoir marre de ce que je prenais fondamentalement pour un bricolage bancal alors que l’UTF-8 permet précisément d’éviter tous ces problèmes.

    Ça a l’air difficile à croire par ici, mais personnellement l’UTF-8 me simplifie la tâche au lieu de me la compliquer.

    Qu'est-ce que tu utilises pour faire tes recherches bibliographiques dans ta base de données?

    JabRef.