• [^] # Re: Réaction à un tweet : est-ce bien raisonnable ?

    Posté par . En réponse au journal Pass Covid, une liste noire ?. Évalué à 4.

    Dès que tu as plusieurs proportions, il faut appliquer https://en.wikipedia.org/wiki/Bonferroni_correction.

    Non. La correction de Bonferroni s'applique aux tests qui sont indépendants, ce qui n'est pas le cas ici (c'est même la conclusion de l'article).

    N=1000 pour des tableaux aussi détaillés, c’est totalement risible.

    Aucune taille d'échantillon n'est risible du moment qu'on reporte les erreurs associées. Et comme déja discuté plus haut, N=1000 aura assez de puissance pour distinguer sans ambiguité les différences reportées (35% vs 49%), donc la taille d'échantillon est adaptée à la question.

    N=30 pour estimer le paramètre d’une bernouilli c’est de la merde

    Tout dépend du niveau de précision souhaité. Si c'est pour un ordre de grandeur, c'est suffisant. Si la question est "j'ai joué 30 fois à un jeu de hasard et j'ai gagné 5 fois", alors c'est compatible avec un lancer de dé à 6 faces, et ça n'est pas compatible avec pile ou face.

    L'objectif des statistiques n'est pas de déterminer si le jeu de données "est de la merde" ou pas. L'objectif des statistiques est de déterminer ce qu'on peut dire ou non à partir des données. Si tu as des données sur 20 animaux super-rares, tu vas faire tes stats avec N=20. Tu ne pourras pas attraper un signal subtil, mais ça peut être suffisant pour une conclusion solide si les effets sont grands.

    Et de toutes manières ça ne sert à rien d'améliorer la précision jusqu'à l'infini quand il y a des biais potentiels. Les sondages sur N=1000, c'est largement accepté, et c'est largement acceptable; comme je l'ai dit plus haut, préjugé < sondage < étude scientifique, et c'est vrai quelle que soit la taille du sondage. Épistémologiquement, on ne peut pas accepter l'idée que l'absence de données est plus informative que des données imparfaites. Dans un mode de pensée Bayesien, les données imparfaites permettent de tirer des conclusions dont la crédence est potentiellement limitée, mais si des données nouvelles ne modifient pas votre point de vue, c'est qu'il n'y a aucune variance à votre a-priori (et donc que rien ne peut vous faire changer d'avis).