• [^] # Re: Absence de filtre et mots rares

    Posté par . En réponse à la dépêche muttum, un nouveau jeu de devinette de mots pour Linux. Évalué à 5.

    Il y a moyen d'utiliser les données lexicographiques de Wikidata. On peut récupérer une liste de mots dans virtuellement n'importe quelle langue (dépendante de la couverture sur WD évidemment, qui est loin d'être complète pour l'instant) donc y compris le breton, basque, créole haïtien, virtuellement n'importe quel élément Wikidata peut être utilisé ... Évidemment ça dépend de la couverture des langues sur Wikidata qui est variable.

    Une requête interactive (langue sélectionnable) pour générer une liste de mots : https://w.wiki/EoUX On récupère facile une liste

    Double effet kiss-cool, ma requête filtre en principe les flexions ! Wikidata les regroupe dans un unique "lemme" qui a plusieurs "formes" (pluriel, conjugaisons, ...) dont une principale, la requête ne récupère que la forme principale. Ça prend quelques secondes pour exécuter la requête en anglais. C'est donc faisable au chargement, et cachable dans les données du programme.

    Évidemment l'ouverture peut poser problème et pour les langues des signes ça va pas marcher hors de la boîte vu que les lemmes sont codés et que de toute façon c'est pas évident de savoir quoi faire de ces lemmes. Et pour les langues avec des alphabets syllabaires et des idéogrammes, comme le japonais, faudrait filtrer pour n'avoir que les syllabaires (taper "japonais" dans ma requête interactive, on voit le problème). C'est gérable je pense en
    compliquant un peu la requête, il devrait y avoir les données sur WD pour faire ça, voir si c'est performant), ça nécessite de filtrer un peu plus les données (les lemmes ont des codes de langue différent, "ja" et "ja-hira", le second est pour le syllabaire). Pas sur que le jeu fonctionne pour les idéogrammes.

    Il y a aussi des extensions envisageables avec ces données, comme filtrer sur un niveau de langue, par exemple ici pour n'inclure que du "slang" en anglais : https://w.wiki/EoUo

    Doit y avoir moyen de filtrer aussi par domaine d'usage : https://w.wiki/EoUv ici les termes en anglais utilisé en informatique (il y en a encore peu).

    Il n'y a pas par contre à l'heure actuelles de données sur la fréquence des lexèmes dans Wikidata. Ça pourrait changer si la communauté s'y met, le modèle est extensible il "suffit" de proposer de nouvelles propriété pour les ajouter (et d'avoir des données utilisables évidemment).