• [^] # Re: je demande au grand méchant

    Posté par . En réponse au journal Recherche sur DLFP. Évalué à 2. Dernière modification le 23 juillet 2018 à 19:57.

    est ce qu'elastisearch permet de modifier l'algo de scoring?

    oui

    Ok si c'était simple, ca serait déjà fait. d'autant plus qu'il y a sans doute des spécialistes du domaine qui fréquentent linuxfr.

    Je ne sais pas a quel niveau on peut parler de specialiste, mais c'est assez proche de mon domaine de travail.

    • les dates étaient elles intégrées au score de pertinence?

    Je ne sais si c'etait les cas, mais c'est possible.

    • les notes (ne pas indexer les articles avec un score négatif, déjà)?

    c'est possible aussi. Mais il faut tester pour voir si ca donne de bon resultat

    • elastisearch construit il automatiquement un début d ontologie, une reconnaissance lexicale? (je suis en train de me documenter sur le sujet et de rtfm)

    Je ne sais pas ce qu'est une ontologie.

    Mais si tu veux extraire une semantique des textes, extraire une semantique similaire de la requete et faire un matching de la requete contre les documents dans ce nouvel espace semantique ben alors il faudra sans doute passer par d'autres outils. Ca sera plutot keras et autre outils de machine learning. Ce sont des choses interessantes que j'aimerai essayer mais je n'y connais encore rien.

    Mais je pense qu'on commencer par qc chose de plus simple.

    Moi ce que j'ai penser c'est de faire un version proche de la configuration de base de ElasticSearch, c'est-a-dire ou l'importance des termes est pondere par un score de type tf-idf et d'ajouter un score lie a la date.

    Une deuxieme version pourrait etre de considere la requete de l'utilisateur comme une requete booleenne. Ce sont des OU et des ET logique, ca permet d'etre tres selectifs et de retourner tres peu de resultat. On pourrait ensuite trouver un moyen d'ordonner le resultat par date.

    Ca ca va etre facile. Ce que je ne sais pas encore comment on va faire, c'est pour gerer les synonymes ou des choses comme ca.

    je suis en train de me documenter sur le sujet et de rtfm

    Moi, je lis ca en ce moment, c'est gratuit: https://nlp.stanford.edu/IR-book/

    où pourrait on discuter du sujet sans polluer ?

    J'ai commence ce journal pour la partie scraping web: crowd-sourcing-pour-le-nouveau-data-pipeline-de-linuxfr

    J'ai divise ca en trois partie pour que chacun puisse developer des morcaux independemment des autres, dans le language de son choix. J'ai commence la premiere partie en Scala. Mais peut-etre que je la reecrirais en Haskell, ca peut etre marrant.

    Tu peux partir sur autre chose, ou donner ton avis sur le plan.