La correction de Bonferonni est la plus "conservatrice" et s’applique dans tous les cas.
Le but, c'est quand même de corriger quelque chose. Si tu veux juste être conservateur, tu dis que ton estimation est entre 0% et 100%, tu ne peux pas te tromper.
L'exemple extrême, c'est quand deux variables sont identiques (parmi 100 merles, 45 sont des mâles et 55 sont des femelles, 45 sont noirs et 55 sont marron): tu crois faire deux tests mais tu n'en fais qu'un. À force d'être conservatif, tu vas être amené à demander des tailles d'échantillon beaucoup trop grandes, et c'est parfois impossibles (raisons éthiques, financières, logistiques...).
Dans tous les cas, c'est mathématiquement possible de calculer un CI avec n'importe quel risque alpha. Mais je ne comprends pas bien de toutes manières ce que veut dire un CI corrigé par Bonferroni. Quand tu dis "50% des sondés aiment la vanille (CI 95% 45-55) et 30% des sondés aiment la crème de marron (CI 95% 27-33)", les deux représentent bien des CI 95%, et je ne vois pas pourquoi faire deux tests devraient les modifier. Il n'est pas question ici de la probabilité que les deux proportions tombent en même temps dans l'intervalle. Si c'est le 95% qui pose problème, on peut juste reporter estimation et écart-type, ou fournir la distribution de l'erreur. L'écart type ne change pas quel que soit le nombre de tests...
Et ce que ma disgression rappelait, c’est que cette règle de N=30 elle-même a quelques conditions
De toutes manières, il ne se passe rien de spécial entre 29 et 31, donc c'est assez arbitraire (et je ne suis même pas sûr que ça soit une "règle"). De mémoire, c'est autour de 30 qu'on peut assimiler la loi de Student à une loi Normale, et qu'on peut appliquer le théorème central limite; c'est le genre de choses qui facilitaient les calculs avant les années 1990, quand on n'avait que des calculatrices non-programmables. J'avais uniquement avancé cet argument pour montrer ma désapprobation à l'idée que N=1000 était un petit échantillon, ce qui me semble absurde : de tous les points de vue, et même pour une binomiale, N=1000 est un gros échantillon, et les méthodes qu'on va utiliser sont les méthodes statistiques destinées à traiter les gros échantillons. Je ne voulais pas dire plus que ça. On ne va pas non plus appliquer les méthodes du "big data" (FDR, etc).
Avec l'utilisation des outils informatiques, de toutes manières, les approximations normales ne servent qu'à des discussions informelles. On peut calculer l'intervalle de confiance d'une binomiale même avec N=1000, et c'est même plus facile que de passer par une loi normale.
[^] # Re: Réaction à un tweet : est-ce bien raisonnable ?
Posté par arnaudus . En réponse au journal Pass Covid, une liste noire ?. Évalué à 3.
Le but, c'est quand même de corriger quelque chose. Si tu veux juste être conservateur, tu dis que ton estimation est entre 0% et 100%, tu ne peux pas te tromper.
L'exemple extrême, c'est quand deux variables sont identiques (parmi 100 merles, 45 sont des mâles et 55 sont des femelles, 45 sont noirs et 55 sont marron): tu crois faire deux tests mais tu n'en fais qu'un. À force d'être conservatif, tu vas être amené à demander des tailles d'échantillon beaucoup trop grandes, et c'est parfois impossibles (raisons éthiques, financières, logistiques...).
Dans tous les cas, c'est mathématiquement possible de calculer un CI avec n'importe quel risque alpha. Mais je ne comprends pas bien de toutes manières ce que veut dire un CI corrigé par Bonferroni. Quand tu dis "50% des sondés aiment la vanille (CI 95% 45-55) et 30% des sondés aiment la crème de marron (CI 95% 27-33)", les deux représentent bien des CI 95%, et je ne vois pas pourquoi faire deux tests devraient les modifier. Il n'est pas question ici de la probabilité que les deux proportions tombent en même temps dans l'intervalle. Si c'est le 95% qui pose problème, on peut juste reporter estimation et écart-type, ou fournir la distribution de l'erreur. L'écart type ne change pas quel que soit le nombre de tests...
De toutes manières, il ne se passe rien de spécial entre 29 et 31, donc c'est assez arbitraire (et je ne suis même pas sûr que ça soit une "règle"). De mémoire, c'est autour de 30 qu'on peut assimiler la loi de Student à une loi Normale, et qu'on peut appliquer le théorème central limite; c'est le genre de choses qui facilitaient les calculs avant les années 1990, quand on n'avait que des calculatrices non-programmables. J'avais uniquement avancé cet argument pour montrer ma désapprobation à l'idée que N=1000 était un petit échantillon, ce qui me semble absurde : de tous les points de vue, et même pour une binomiale, N=1000 est un gros échantillon, et les méthodes qu'on va utiliser sont les méthodes statistiques destinées à traiter les gros échantillons. Je ne voulais pas dire plus que ça. On ne va pas non plus appliquer les méthodes du "big data" (FDR, etc).
Avec l'utilisation des outils informatiques, de toutes manières, les approximations normales ne servent qu'à des discussions informelles. On peut calculer l'intervalle de confiance d'une binomiale même avec N=1000, et c'est même plus facile que de passer par une loi normale.