• [^] # Re: pas de shell...

    Posté par . En réponse au message grep et recherche approximative. Évalué à 4.

    Par curiosité, quels logiciels bioinfo as-tu essayés pour dire que grep est plus puissant pour faire ce que tu veux ?

    A vue de nez, j'aurais rapidement utilisé un outil d'alignement local genre blast, blat et dérivés qui sont optimisés pour la recherche de bouts de séquences par alignement local ou tout autre logiciel implémentant l'algo de Swith et Waterman (qui sera d'ailleurs potentiellement plus précis mais plus lent que les heuristiques de blast ou blat - en passant, l'algo est assez simple à coder si tu veux l'implémenter).

    Ils font a peu près ce que te suggèrent d'ailleurs certains posts pour chercher ton motifs et ses approximations sur la base contenant l'ensemble de tes séquences.

    https://fr.wikipedia.org/wiki/Basic_Local_Alignment_Search_Tool
    https://en.wikipedia.org/wiki/BLAT_(bioinformatics)
    https://fr.wikipedia.org/wiki/Algorithme_de_Smith-Waterman
    https://www.ensembl.org/Help/Faq?id=429
    https://sequencebase.com/smith-waterman-vs-blast/

    Il faut bien paramétrer le logiciel pour favoriser ce que tu cherches coté motif et nombre d'erreurs autorisées (favoriser/pénaliser les mistmatches, les gaps etc).
    Il faudra un peu scripter pour extraire les séquences pertinentes de tes alignements finaux selon le pourcentage de similarité et leur longueur.

    Je ne critique pas l'idée de te servir de grep/agrep/awk/sed et consorts, je les utilise pour fouiller des séquences tout les jours mais les logiciels spécialisés sont quand même plus puissants à grande échelle.