La fiabilité des moteurs a toujours reposé sur le fait que le contenu est sites est pertinent.
Pas seulement, justement. Si dans mon site, je met "vélo vélo vélo" et qu'on y voit des photos de Pamela Anderson, personne ne va faire de liens dessus. C'est pour ça que l'analyse du contenu n'était pas fiable, alors que l'analyse des liens vers le site l'était plus. Le principe, c'est que l'ensemble du web est pertinent, et que cette pertinence permet de trier les sites qui ne le sont pas.
On ne fait que diminuer la quantité globale des liens pris en compte.
Soit 1000 sites de blogs, qui contiennent chacun 1000 liens, dont 10% de non pertinents. 999 sites jouent le jeu, un seul ne le fait pas. Il va attirer tous les "grugeurs de liens", et va vite contenir 50% de liens non pertinents. Résultat : google s'est privé d'une source potientielle de liens pertinents, et a focalisé l'activité des tricheurs sur les quelques sites qui n'ont pas mis ce système en place.
Difficile de faire un algo baeysien qui après avoir été entrainé sur le lien "golf" et "viagra" filtre le lien "PHP".
Je pense qu'il serait très facile de classer les sites par la pertinence potentielle des liens qu'il contient. Une page qui contient 3 liens a
plus de chances qu'ils soient pertinents qu'une page qui contient 1000 liens. Une page dont le contenu change en moyenne toutes les 10 minutes est un blog ou un wiki, la proba de liens non pertinents augmente, etc. Il suffit de dissocier "pertinence de la page" et "pertinence des liens de la page" (même si les deux peuvent être corrélés).
De plus, Google peut très bien trier les liens par le succès relatif qu'ils ont après une recherche. Une IP qui clique sur 3 liens en 30s après une recherche, ça veut certainement dire que les 2 premiers ne lui ont pas plu.
Enfin, l'approche bayesienne pourrait servir à analyser le contenu des sites, l'adéquation des termes contenus avec les pages sur lesquelles il est lié, etc. Tous les sites X par exemple doivent avoir des tonnes de caractéristiques communes, et chaque URL pourrait se voir attribuer une probabilité de tomber dans des catégories (site perso, X, arnaque, entreprise, annuaire, pub etc etc), et ainsi permettre d'affiner la recherche.
Tout ça pour dire que si google est le moteur de recherche n°1, c'est qu'il a su affiner les résultats des requêtes grâce à un algo ingénieux. Apparemment, ils consédèrent qu'ils sont incapables de fonctionner comme ça, et je ne suis pas d'accord. Evidemment, ça demande des moyens en serveur, en développement logiciel, etc. Mais l'innovation est à ce prix là...
> et très facilement contournable
comment ?
Simplement en trouvant des niches qui dédaignent la balise en question. Parmi les millions de forums, wiki, blogs, serveurs ftp publics, pages perso, livres d'or, etc etc etc, imaginons dans un avenir radieux que 99% d'entre eux utilisent le système (à mon avis beaucoup moins, parce qu'ils n'ont aucun intérêt de le faire s'ils ne sont pas énormément pollués). Il restera des milliers de sites potentiels où balancer des robots, avec un poids des liens potentiellement plus fort à cause de la suppression des liens taggués. Et même s'il n'était plus possible de mettre aucun lien nulle part, je fais confiance à l'ingéniosité des gens qui se font payer des fortunes pour référencer les sites pour trouver d'autres moyens, ils auront toujours une longueur d'avance à moins qu'en face, on ait un système beaucoup plus réactif. Et à mon avis "eh les mecs soyez gentils, bossez gratuitement pour google en taggant les liens des sites éditables", c'est pas très réactif...
[^] # Re: Bonne méthode?
Posté par arnaudus . En réponse à la dépêche Google contre la pollution des sites web. Évalué à 6.
Pas seulement, justement. Si dans mon site, je met "vélo vélo vélo" et qu'on y voit des photos de Pamela Anderson, personne ne va faire de liens dessus. C'est pour ça que l'analyse du contenu n'était pas fiable, alors que l'analyse des liens vers le site l'était plus. Le principe, c'est que l'ensemble du web est pertinent, et que cette pertinence permet de trier les sites qui ne le sont pas.
On ne fait que diminuer la quantité globale des liens pris en compte.
Soit 1000 sites de blogs, qui contiennent chacun 1000 liens, dont 10% de non pertinents. 999 sites jouent le jeu, un seul ne le fait pas. Il va attirer tous les "grugeurs de liens", et va vite contenir 50% de liens non pertinents. Résultat : google s'est privé d'une source potientielle de liens pertinents, et a focalisé l'activité des tricheurs sur les quelques sites qui n'ont pas mis ce système en place.
Difficile de faire un algo baeysien qui après avoir été entrainé sur le lien "golf" et "viagra" filtre le lien "PHP".
Je pense qu'il serait très facile de classer les sites par la pertinence potentielle des liens qu'il contient. Une page qui contient 3 liens a
plus de chances qu'ils soient pertinents qu'une page qui contient 1000 liens. Une page dont le contenu change en moyenne toutes les 10 minutes est un blog ou un wiki, la proba de liens non pertinents augmente, etc. Il suffit de dissocier "pertinence de la page" et "pertinence des liens de la page" (même si les deux peuvent être corrélés).
De plus, Google peut très bien trier les liens par le succès relatif qu'ils ont après une recherche. Une IP qui clique sur 3 liens en 30s après une recherche, ça veut certainement dire que les 2 premiers ne lui ont pas plu.
Enfin, l'approche bayesienne pourrait servir à analyser le contenu des sites, l'adéquation des termes contenus avec les pages sur lesquelles il est lié, etc. Tous les sites X par exemple doivent avoir des tonnes de caractéristiques communes, et chaque URL pourrait se voir attribuer une probabilité de tomber dans des catégories (site perso, X, arnaque, entreprise, annuaire, pub etc etc), et ainsi permettre d'affiner la recherche.
Tout ça pour dire que si google est le moteur de recherche n°1, c'est qu'il a su affiner les résultats des requêtes grâce à un algo ingénieux. Apparemment, ils consédèrent qu'ils sont incapables de fonctionner comme ça, et je ne suis pas d'accord. Evidemment, ça demande des moyens en serveur, en développement logiciel, etc. Mais l'innovation est à ce prix là...
> et très facilement contournable
comment ?
Simplement en trouvant des niches qui dédaignent la balise en question. Parmi les millions de forums, wiki, blogs, serveurs ftp publics, pages perso, livres d'or, etc etc etc, imaginons dans un avenir radieux que 99% d'entre eux utilisent le système (à mon avis beaucoup moins, parce qu'ils n'ont aucun intérêt de le faire s'ils ne sont pas énormément pollués). Il restera des milliers de sites potentiels où balancer des robots, avec un poids des liens potentiellement plus fort à cause de la suppression des liens taggués. Et même s'il n'était plus possible de mettre aucun lien nulle part, je fais confiance à l'ingéniosité des gens qui se font payer des fortunes pour référencer les sites pour trouver d'autres moyens, ils auront toujours une longueur d'avance à moins qu'en face, on ait un système beaucoup plus réactif. Et à mon avis "eh les mecs soyez gentils, bossez gratuitement pour google en taggant les liens des sites éditables", c'est pas très réactif...