Comment l’Intervalle de Confiance Est Calculé
Un intervalle de confiance est une plage de valeurs, construite autour de la propre moyenne d’un échantillon, qui contient probablement la vraie moyenne de population. Saisissez la moyenne, l’écart-type, et la taille d’un échantillon, choisissez un niveau de confiance, et ce calculateur trouve la plage dans laquelle la vraie moyenne de population tombe probablement.
Un « intervalle de confiance de 95% », par exemple, signifie que si vous répétiez le même processus d’échantillonnage de nombreuses fois, environ 95% des intervalles qu’il produirait contiendraient la vraie moyenne de population. Cela ne signifie pas qu’il y a 95% de chance que la vraie moyenne tombe dans cet intervalle spécifique — une façon courante et techniquement incorrecte de le formuler. Un intervalle plus large (niveau de confiance plus élevé) jette un filet plus large et est plus susceptible de contenir la vraie moyenne ; un intervalle plus étroit est plus précis mais moins certain.
La Formule
Où est l’écart-type de l’échantillon, est la taille de l’échantillon, est la valeur critique pour le niveau de confiance choisi (recherchée dans la distribution normale standard), et est la moyenne de l’échantillon. Une taille d’échantillon plus grande réduit l’erreur standard — et donc tout l’intervalle — puisque plus de données donnent une estimation plus précise de la vraie moyenne.
Exemple Concret
Un échantillon de 25 éléments a une moyenne de 100 et un écart-type de 15, à un niveau de confiance de 95% (une valeur critique de z = 1,96) :
- Erreur standard : .
- Marge d’erreur : .
- Intervalle de confiance : .
Donc la vraie moyenne de population se situe probablement (avec 95% de confiance) quelque part entre 94,12 et 105,88.
Facteurs Clés à Considérer
- Un intervalle de confiance ne dit rien sur la façon dont l’échantillon a été collecté. Les calculs ici supposent que l’échantillon est un échantillon véritablement aléatoire et représentatif de la population — une méthode d’échantillonnage biaisée ou non aléatoire peut produire un intervalle de confiance qui semble précis mais qui est centré sur une valeur entièrement erronée, un problème que cette formule ne peut ni détecter ni corriger.
- L’intervalle suppose que les données sous-jacentes sont au moins approximativement distribuées normalement, ou que l’échantillon est assez grand pour que le théorème central limite s’applique. Pour un petit échantillon issu d’une distribution fortement asymétrique, les approximations par distribution z et par distribution t deviennent toutes deux moins fiables.
- Un intervalle de confiance et une marge d’erreur rapportée dans un sondage décrivent la même idée sous-jacente. Un reportage citant « une marge d’erreur de plus ou moins 3 points de pourcentage » à un niveau de confiance indiqué (souvent 95%) décrit exactement l’intervalle que ce calculateur calcule, juste formulé différemment.
- Plus étroit n’est pas toujours meilleur si cela se fait au prix de la confiance. Un intervalle plus serré à un niveau de confiance plus bas (disons 80% au lieu de 95%) est plus précis mais moins susceptible de contenir réellement la vraie valeur — le bon compromis entre précision et confiance dépend de l’usage prévu de l’estimation.
Erreurs Courantes
- Interpréter « 95% de confiance » comme « 95% de probabilité que la vraie moyenne soit dans cet intervalle ». Une fois qu’un échantillon a réellement été collecté et l’intervalle calculé, la vraie moyenne de population y est ou n’y est pas — il n’y a plus de probabilité dont parler. Les 95% décrivent le comportement à long terme de la MÉTHODE à travers de nombreux échantillons répétés, pas ce résultat spécifique unique.
- Appliquer cette formule basée sur la distribution z à un petit échantillon sans vérifier les hypothèses. La distribution z suppose soit un grand échantillon (conventionnellement n d’environ 30 ou plus), soit un écart-type de population connu. Un petit échantillon avec seulement un écart-type estimé devrait techniquement utiliser la distribution t à la place, qui produit un intervalle un peu plus large — et plus honnête.
- Confondre l’intervalle de confiance avec l’étendue des données brutes. L’intervalle décrit l’incertitude sur la moyenne de la population, pas où se situent les points de données individuels — un jeu de données peut avoir des valeurs dispersées bien plus largement que son intervalle de confiance, tandis que l’intervalle sur la moyenne elle-même reste étroit, particulièrement avec un grand échantillon.
Bon à Savoir
Comme l’erreur standard diminue avec la racine carrée de la taille de l’échantillon plutôt qu’avec la taille de l’échantillon elle-même, réduire de moitié une marge d’erreur signifie généralement quadrupler la taille de l’échantillon, pas simplement la doubler — un détail important lors de la planification de la taille réelle d’une enquête ou d’une expérience. C’est aussi pourquoi les sondages avec seulement quelques centaines de répondants peuvent encore rapporter une marge d’erreur raisonnablement étroite : une fois qu’un échantillon atteint quelques centaines, la relation en racine carrée signifie que chaque répondant supplémentaire apporte progressivement moins de précision, donc les sondeurs voient rarement l’intérêt de pousser les tailles d’échantillon à des dizaines de milliers juste pour gratter une fraction de point sur la marge.