le script Parse_Thes.awk donne des indices sur le format de fichier .idx et .dat:
fichier .dat : suite de nombre en big endian sur 16bit,
1er nombre : Nb synomyme
ensuite : id synonyme+
id synonyme : index du mot dans le .idx
fichier .idx: nom, offset en byte dans le fichier .dat
de la on peut faire un prog en (C,CAML, java, whatever) ou touver le bout de code OO qui fait ca (en utilisant seulement les site web c'est pas top, il faudrait prendre le CVS) en faisant un grep sur les sources et trouver le bout de code qui ouvre ca, pour le sortir en format "simple"
a priori il y a une "source" pour ce thesaurus, dans un format plus facile a traiter.
néanmoins le thesaurus n'est pas vraiement un dico, c'est just un dictionnaire de synonyme.
[^] # Re: PS
Posté par ham . En réponse au message Convertir les dictionnaires OOo vers dict. Évalué à 1.
le format de openoffice: voir
http://cvs.sourceforge.net/viewcvs.py/openthesaurus/openthesaurus/w(...)
le script Parse_Thes.awk donne des indices sur le format de fichier .idx et .dat:
fichier .dat : suite de nombre en big endian sur 16bit,
1er nombre : Nb synomyme
ensuite : id synonyme+
id synonyme : index du mot dans le .idx
fichier .idx: nom, offset en byte dans le fichier .dat
de la on peut faire un prog en (C,CAML, java, whatever) ou touver le bout de code OO qui fait ca (en utilisant seulement les site web c'est pas top, il faudrait prendre le CVS) en faisant un grep sur les sources et trouver le bout de code qui ouvre ca, pour le sortir en format "simple"
a priori il y a une "source" pour ce thesaurus, dans un format plus facile a traiter.
néanmoins le thesaurus n'est pas vraiement un dico, c'est just un dictionnaire de synonyme.