• [^] # Re: Version 0.3

    Posté par . En réponse au journal Analyse de texte. Évalué à 2.

    En modifiant un peu le code voilà ce que ça donne sur un extrait de bouchot standard :

    self.start = re.compile(r'^(\n|)[\-–—<«ÉÀÇÔÎÖÏA-Za-z]$')
    if self.sb == ' ' or self.sb == '\n' or self.sb == '«' or self.sb == '»' or self.sb == '<' or self.sb == '>':
     self.sb = ''
    
    sqlite> select * from sentences order by freq desc limit 40;
    ..|1704
    <a href="http:|818
    <a href="https:|361
    youtube.|359
    com/watch?|356
    imgur.|259
    [:|211
    pr0gramm.|193
    !!|158
    wikipedia.|154
    lemonde.|115
    twimg.|114
    moul.|92
    lefigaro.|66
    20minutes.|62
    )
    22:|55
    o
    20:|52
    programme.|48
    /
    20:|48
    /
    21:|46
    )
    20:|46
    yahoo.|45
    o
    21:|43
    o
    17:|42
    news.|42
    co.|42
    google.|42
    ??|41
    nouvelobs.|41
    -C'est quoi ça ?|39
    )
    16:|35
    liberation.|35
    o
    16:|35
    /
    22:|34
    /
    17:|33
    o
    22:|33
    pan !|32
    php?|32
    gouv.|32
    02 [:|31
    

    Ça donne des informations intéressantes sur les domaines des liens POSTé :)