Rien de spécialement avancé on dirait. Il y a des balises "header" qui ont l'air de masquer tout ce qui n'est pas spécialement du contenu sur la page, une pour encadrer le titre de l'article, sinon c'est que des "div". Il y a des méta données dans l'en tête par contre :
<metaproperty="og:type"content="article"/><metaproperty="og:title"content="Le rôle du député - Marion Maréchal-Le Pen"/>
Du coup google peut savoir sait que c'est un article, connaît son titre. En virant tout ce qui est "header" il doit relativement facilement deviner ou est le début du vrai contenu, soit par là dans cet extrait de code :
<headerclass="page-header pt-style-2"><h1class="page-title"><span>Le rôle du député</span></h1><divclass="entry-meta"></div></header><!-- .page-header --></div><divclass="grid-100 mobile-grid-100 tablet-grid-100"><divclass="entry-content clearfix"><pstyle="text-align: justify;"><divclass="su-row"><divclass="su-column su-column-size-1-2"><divclass="su-column-inner su-clearfix"><pstyle="text-align: justify;"><strong>Les députés sont élus pour 5 ans au suffrage universel direct, au scrutin uninominal majoritaire à deux tours.</strong></p><pstyle="text-align: justify;">Ils sont les représentants de la Nation et participent à l’expression de la volonté générale. Ils sont également, de fait, représentants dans l’hémicycle de leur circonscription, chargé de se faire l’écho des préoccupations propres à leurs territoires.</p>
par contre rien dans ce code qui annote spécifiquement le deuxième paragraphe, donc il y a forcément une bonne dose d'heuristique pour le choisir. Sûrement quelque chose basé sur du traitement de la langue et/ou des stats.
[^] # Re: Algo
Posté par thoasm . En réponse au journal Du choix discutable des sources de Google pour ses définitions automatiques. Évalué à 4. Dernière modification le 15 janvier 2017 à 12:11.
Non, c'est juste une hypothèse en fait.
Du coup j'ai regardé le code de view-source:http://marionlepen.fr/action-parlementaire/le-role-du-depute/
Rien de spécialement avancé on dirait. Il y a des balises "header" qui ont l'air de masquer tout ce qui n'est pas spécialement du contenu sur la page, une pour encadrer le titre de l'article, sinon c'est que des "div". Il y a des méta données dans l'en tête par contre :
Le préfix "og" correspond à the open graph protocol que je ne connaissait pas.
Du coup google peut savoir sait que c'est un article, connaît son titre. En virant tout ce qui est "header" il doit relativement facilement deviner ou est le début du vrai contenu, soit par là dans cet extrait de code :
par contre rien dans ce code qui annote spécifiquement le deuxième paragraphe, donc il y a forcément une bonne dose d'heuristique pour le choisir. Sûrement quelque chose basé sur du traitement de la langue et/ou des stats.
Rien de bien concluant.