• [^] # Re: Le sens des priorités

    Posté par (site web personnel) . En réponse au lien UE : l'IA doit s'afficher. Évalué à 1 (+0/-1).

    Je ne crois pas que Lolita soit obligatoire à inclure dans le corpus pour qu'un LLM apprenne à faire des phrases qui sont syntaxiquement correcte.

    Si tu crois que Lolita est un problème, tu es très loin d'être au bout de tes surprise ;)
    Je ne suis pas certain que ce soit possible de supprimer des données d’entraînement les textes qui ne vont pas.
    Certes, on peut supprimer «à la main» le texte intégral de Lolita, Juliette ou Justine (et aussi quelques autres moins connu).
    Mais tu ne va pas enlever tous les textes qui en parlent, qui citent des extraits, ou font des hommages etc.

    Ça me semble être à la limite de l'impossible d'éviter que le LLM ait une montagne d'exemples de textes «qui ne vont pas».

    Si filtrage il faut, il me semple plus efficace de le mettre à deux endroits :

    1. En sortie de LLM. Quand j'ai écrit ma nouvelle hommage à Sade avec chatGPT, il m'est arrivé qu'il écrive des trucs, puis une fois le texte terminé, qu'il disparaisse. Manifestement il y a un mécanisme qui relit la sortie du LLM et qui la supprime si ça ne va pas.

    2. Mettre la responsabilité du contenu publié à la personne qui publie. Si quelqu'un crée avec un LLM un texte «qui ne va pas», et qu'il le publie, c'est sa responsabilité, pas celle du fournisseur de LLM.