Posté par arnaudus .
En réponse au journal npm et badaboum.
Évalué à 2.
Dernière modification le 22 septembre 2025 à 17:23.
expliquez-moi comment ça trouve la réponse
Il donne la réponse la plus vraisemblable d'après la sortie d'un réseau de neurones dont les poids ont été ajustés par une procédure d'apprentissage à partir d'un corpus de données aussi grand que possible.
Une sorte de "jus de connaissance" qui n'a pas grand chose à voir avec une recherche dans une base de données. D'où la complémentarité avec une recherche web, que beaucoup de modèles proposent maintenant.
En effet, comment tu mesures le « rarement » ?
C'est pas moi qui le mesure, le benchmarking de LLMs est réalisé par des laboratoires de recherche publics ou privés, c'est un domaine technique qui ne peut pas être discuté dans un forum à base d'anecdotes. Ça dépend du domaine, du modèle, de la manière dont la question est posée, et de la bonne volonté de l'utilisateur pour guider le modèle vers la compréhension de la question.
Parce-que chacun peut aussi facilement sortir des anecdotes d’erreurs (qui pourtant sont supposément rares)
Quel modèle, quelle date, quel prompt? Parce que dans ChatGPT j'ai "The HP-16C "Computer Scientist" calculator does not actually have the π (pi) constant built in. Unlike models like the HP-15C or HP-41, which include π on a key, the HP-16C was designed specifically for programmers and focuses on integer math, bit manipulation, base conversions, and logical operations—not floating-point scientific math."
Personne ne nie que certains modèles sont plus performants que d'autres, et nombreux sont ceux qui sont intéressés à pousser ces modèles à leurs limites (combien de temps mettent 9 femmes à faire un enfant, etc), ce qui augmente évidemment le taux d'erreur.
Le truc est hélas que que si on n’a pas un certain niveau dans certains domaines on ne peut pas se rendre compte de certaines erreurs (et se conforter dans l’idée que c’est encore plus rare)
Quel est ta référence? La vérité divine? Le meilleur spécialiste humain? Une recherche Google? Un humain moyen?
Peut-être qu'en 2025, un niveau d'exigence raisonnable (avoir une réponse équivalente à ce qu'on peut avoir auprès d'un professionnel standard, ou avoir en moins de 10 secondes une réponse équivalente à ce qu'on pourrait obtenir en 2 heures de recherche standard) permettrait déja de réaliser à quel point ces outils peuvent être utiles.
J'ai parfois l'impression qu'on attend de ces systèmes des performances infaillibles littéralement surhumaines, ce dont ils sont capables dans certains domaines, mais certainement pas dans tous. La communication en langage naturel est dans tous les cas suffisamment ambigüe pour que même un LLM infaillible ne puisse toujours donner la réponse attendue.
[^] # Re: Je me demande
Posté par arnaudus . En réponse au journal npm et badaboum. Évalué à 2. Dernière modification le 22 septembre 2025 à 17:23.
Il donne la réponse la plus vraisemblable d'après la sortie d'un réseau de neurones dont les poids ont été ajustés par une procédure d'apprentissage à partir d'un corpus de données aussi grand que possible.
Une sorte de "jus de connaissance" qui n'a pas grand chose à voir avec une recherche dans une base de données. D'où la complémentarité avec une recherche web, que beaucoup de modèles proposent maintenant.
C'est pas moi qui le mesure, le benchmarking de LLMs est réalisé par des laboratoires de recherche publics ou privés, c'est un domaine technique qui ne peut pas être discuté dans un forum à base d'anecdotes. Ça dépend du domaine, du modèle, de la manière dont la question est posée, et de la bonne volonté de l'utilisateur pour guider le modèle vers la compréhension de la question.
Quel modèle, quelle date, quel prompt? Parce que dans ChatGPT j'ai "The HP-16C "Computer Scientist" calculator does not actually have the π (pi) constant built in. Unlike models like the HP-15C or HP-41, which include π on a key, the HP-16C was designed specifically for programmers and focuses on integer math, bit manipulation, base conversions, and logical operations—not floating-point scientific math."
Personne ne nie que certains modèles sont plus performants que d'autres, et nombreux sont ceux qui sont intéressés à pousser ces modèles à leurs limites (combien de temps mettent 9 femmes à faire un enfant, etc), ce qui augmente évidemment le taux d'erreur.
Quel est ta référence? La vérité divine? Le meilleur spécialiste humain? Une recherche Google? Un humain moyen?
Peut-être qu'en 2025, un niveau d'exigence raisonnable (avoir une réponse équivalente à ce qu'on peut avoir auprès d'un professionnel standard, ou avoir en moins de 10 secondes une réponse équivalente à ce qu'on pourrait obtenir en 2 heures de recherche standard) permettrait déja de réaliser à quel point ces outils peuvent être utiles.
J'ai parfois l'impression qu'on attend de ces systèmes des performances infaillibles littéralement surhumaines, ce dont ils sont capables dans certains domaines, mais certainement pas dans tous. La communication en langage naturel est dans tous les cas suffisamment ambigüe pour que même un LLM infaillible ne puisse toujours donner la réponse attendue.