• [^] # Re: Question IA

    Posté par . En réponse au journal Armée et IA, un projet "SkyNet" ?. Évalué à 3.

    En tout cas, je sais pas ce qui est implémenté dans les systèmes en ligne mais en cherchant viteuf' on trouve des papiers sur l'autoévaluation : https://arxiv.org/abs/2312.09300

    Ça semble dans cette technique

    L'état de l'art l'an dernier (fin 2023) semble être :

    Extending this work to large language models is challenging because their training distribution is too large to estimate and extracting embeddings from well-integrated LLM systems requires significant engineering effort.

    Il semble dire que c'est assez simple dans les cas que tu as indiqué pour tes exemples (au hasard?), plutôt des QCM, quand la réponse tient en un seul token (ça ressemble à une tâche de classification supervisée, on a un ensemble de classe bien déterminé) et c'est beaucoup plus facile que d'évaluer un paragraphe, forcément.

    Although sequence-level scores have weak predictive power, the previous results show that LLMs are well-calibrated on multiple choice question answer tasks and true/false evaluation tasks [Kadavath et al., 2022, OpenAI, 2023], suggesting the model has better calibration on token-level scores

    J'ai aussi noté

    In terms of estimating language models’ confidence or uncertainty, Tian et al. [2023], Lin et al. [2022] propose to ask model to express uncertainty in words along with the generated answer, but it is shown that LLMs often exhibit a high degree of overconfidence when verbalizing their confidence [Xiong et al., 2023].

    Les LLMs auraient tendance à largement avoir largement trop confiance en eux si on leur demande directement.

    J'ai l'impression? en lisant viteuf' que leur approche c'est de faire générer plusieurs réponse, de transformer ça en QCM en demandant "quelle est plus probablement la bonne réponse", et que finalement ça puisse améliorer les réponse. Mais que ce ne soit pas vraiment une panacée.