• # Web sémantique

    Posté par (site web personnel, Mastodon) . En réponse à la dépêche Google et PageRank... L'avenir passe par le libre?. Évalué à 1.

    Salut,

    bon l'article est un peu vieux apparemment donc il est peut-être normal que le gars n'ait pas approfondi ce bouleversement dans les manières de penser le web. Mais, bien que je ne me tiens pas particulièrement au courant des avancées dans le domaine de la recherche massive, j'ai cru comprendre que le web sémantique commence à prendre de l'importance et que tous les labos de recherche planche là-dessus, sur les moyens d'améliorer la pertinence de recherche web en fonction du contenu et surtout "de son sens".

    Le gars évoque un peu ces points en survol sur la partie sur le contenu:

    [quote]
    Une autre conséquence importante de la définition de PageRank est que le contenu des pages, à l'exception des liens qui y apparaissent, n'a aucune importance pour sa notation et que cette notation est globale
    ...
    [/quote]

    Mais ça m'a vraiment déçu qu'il n'approfondisse pas plus ça, qui est ce qui est vraiment intéressant dans l'avenir de la recherche sur le web, je trouve.

    Clairement il est clair que la méthode selon laquelle il suffit de trouver des mots recherchés répartis dans une page (et de préférence proches), couplée au pagerank, est insuffisante.
    Le web sémantique, ça sert à organiser, et surtout donner un sens aux partis d'un texte web. Ainsi si on cherche des infos sur un gars dont on donne le nom au moteur de recherche, il y a fort à parier que si le nom du gars est dans un titre du texte, il y a des chances pr que ce dernier texte soit plus pertinent sur cette personne que dans un autre où on trouve le nom mélangé à d'autres noms dans un paragraphe par ex.
    C'est pourquoi le web sémantique, ça consiste par exemple à donner de la pertinence si on trouve le nom entre des balises hx (et h1 plus pertinent que h2, plus que h3, etc.) que dans une balise p.

    De même, ça arrive souvent qu'on recherche l'auteur d'une citation (genre on l'a vu sur un site mais le gars a pas précisé son auteur), ben le web sémantique permet de préciser que ce qu'on cherche est une citation et il va donner priorité à des pages où on trouve les mots cherchés entre des balises "quote".

    Au final on devrait même être capable de préciser en recherche avancés nos critères, genre "une page avec tel mot, mais je veux qu'il soit dans un titre de section au moins", etc.

    Enfin voilà, pour moi c'est ce genre de truc l'avenir de la recherche web. Si le moteur de recherche a le moyen de connaître le "sens" d'une page, il peut donner des résultats bien plus pertinents.
    Evidemment ça implique de devoir bien structurer ses pages (utiliser donc les bonnes balises, séparer fond/forme avec css, etc.), donc un webmaster utilisant simplement les bonnes normes w3c devrait déjà avoir un avantage sur les autres. ;-)

    Sinon, je trouve le gars parfois un peu dur avec Google, surtout sur la fin où on dirait qu'il a une dent contre Google. Ceci dit, sur le fond et idéalement, il a pas toujours tort et c'est sûr que si on avait à dispo un moteur de recherche aussi performant (ou presque) et au développement entièrement transparent et Libre, je dirais pas non et serai le premier à me jeter dessus.

    Je pense aussi qu'un système qui fait intervenir l'humain pour "noter" la pertinence des sites, et en plus en fonction de "tag" (les mots clés html un peu) en particulier pour dire que c'est en particulier pertinent sur tel ou tel sujet, ça peut rendre bien. Ca permettrait de faire descendre "manuellement" aux oubliettes du web un mauvais site qui aurait une trop bonne position dans le moteur de recherche ou au contraire de pousser au cul un site de qualité mais mal placé.

    Bon ça pose qques problèmes et faudra avoir des systèmes pour empêcher les abus. Par ex, des "commerces" de placement pourrait se créer (enfin... ça existe déjà ceci dit, mais là ça crée de nvelles possibilités) avec des gars qui créent des bots qui vont voter en continu pr des sites. Donc faut des scripts pr empêcher les votes multiples venant d'un même ip ou bien qui puisse reconnaître des bots (sans trucs illisibles à recopier par contre!).
    Et pis aussi, un bon site mal placé, ça peut aussi être dû au fait qu'il soit mal foutu, codé avec les pieds. Mais qd le contenu est intéressant qd même, la question à se poser reste de savoir si ça vaut le coup de l'aider au référencement, ce qui risque de conforter le webmaster dans la médiocrité d'un code mal écrit s'il voit que ça l'empêche pas de référencer bien.

    Enfin bon, y a plein de questions à se poser sur la recherche web et le référencement, et je crois qu'il y a plusieurs chemins très intéressants (à essayer au moins pour certains qui sont peut-être de fausses bonnes idées) à l'heure actuelle. Je trouve vraiment que cet article ne va pas au fond des vraies choses intéressantes dans le monde et l'avenir du référencement web. Il reste très superficiel avec un peu trop de véhémence à l'égard de Google à mon avis.
    Bye.

    Film d'animation libre en CC by-sa/Art Libre, fait avec GIMP et autre logiciels libres: ZeMarmot [ http://film.zemarmot.net ]