Statistiques inférentielles exercices corrigés

Les statistiques inférentielles constituent le socle de toute démarche scientifique rigoureuse : elles permettent de tirer des conclusions sur une population entière à partir de l'observation d'un échantillon aléatoire. Cette page regroupe des exercices corrigés de statistiques inférentielles progressifs, couvrant l'estimation ponctuelle, les propriétés des estimateurs (sans biais, convergence, efficacité), la construction d'intervalles de confiance pour une moyenne ou une proportion, ainsi que les grands tests d'hypothèses paramétriques ; test de Student, test sur une proportion, test du khi-deux d'adéquation et d'indépendance. Chaque exercice est accompagné d'une indication pédagogique et d'un corrigé rédigé étape par étape, avec les formules en LaTeX pour faciliter la compréhension. La progression va du niveau facile au niveau difficile, afin de consolider les bases avant d'aborder des situations complexes rencontrées en licence, en BTS, à l'IUT ou en préparation au CAPES.

Estimation ponctuelle et propriétés des estimateurs

L'estimation ponctuelle consiste à proposer une valeur unique (appelée estimateur) pour approcher un paramètre inconnu d'une population (moyenne μ\mu, proportion pp, variance σ2\sigma^2). Un bon estimateur doit être sans biais, convergent et, idéalement, efficace. Les exercices ci-dessous vous entraînent à vérifier ces propriétés et à construire des estimateurs à partir d'un échantillon aléatoire.

Exercice 1 : Estimateur de la moyenne (vérification du caractère sans biais)

Facile

Soit (X1,X2,,Xn)(X_1, X_2, \ldots, X_n) un échantillon aléatoire simple de taille nn issu d'une population d'espérance μ\mu et de variance σ2\sigma^2 finies. On considère la moyenne empirique Xˉn=1ni=1nXi\bar{X}_n = \dfrac{1}{n}\displaystyle\sum_{i=1}^{n} X_i.

  1. Montrer que Xˉn\bar{X}_n est un estimateur sans biais de μ\mu.
  2. Calculer Var(Xˉn)\mathrm{Var}(\bar{X}_n) en supposant les observations indépendantes. Qu'observe-t-on lorsque n+n \to +\infty ?
  3. On définit également l'estimateur Tn=1n+1i=1nXiT_n = \dfrac{1}{n+1}\displaystyle\sum_{i=1}^{n} X_i. Cet estimateur est-il sans biais ? Calculer son biais.
Indication

Pour la question 1, utiliser la linéarité de l'espérance. Pour la question 2, exploiter l'indépendance des XiX_i pour calculer la variance d'une somme. Pour la question 3, calculer E(Tn)μ\mathbb{E}(T_n) - \mu.

Voir le corrigé
Solution de la question 1 :

Par linéarité de l'espérance :

E(Xˉn)=1ni=1nE(Xi)=1nnμ=μ \mathbb{E}(\bar{X}_n) = \frac{1}{n}\sum_{i=1}^{n}\mathbb{E}(X_i) = \frac{1}{n} \cdot n\mu = \mu

Xˉn\bar{X}_n est donc bien un estimateur sans biais de μ\mu.

Solution de la question 2 :

Les XiX_i étant indépendantes et de même variance σ2\sigma^2 :

Var(Xˉn)=1n2i=1nVar(Xi)=nσ2n2=σ2n \mathrm{Var}(\bar{X}_n) = \frac{1}{n^2}\sum_{i=1}^{n}\mathrm{Var}(X_i) = \frac{n\sigma^2}{n^2} = \frac{\sigma^2}{n}

Lorsque n+n \to +\infty, Var(Xˉn)0\mathrm{Var}(\bar{X}_n) \to 0 : l'estimateur est convergent (consistent).

Solution de la question 3 : E(Tn)=1n+1i=1nE(Xi)=nμn+1 \mathbb{E}(T_n) = \frac{1}{n+1}\sum_{i=1}^{n}\mathbb{E}(X_i) = \frac{n\mu}{n+1}

Le biais est donc :

b(Tn)=E(Tn)μ=nμn+1μ=μn+1 b(T_n) = \mathbb{E}(T_n) - \mu = \frac{n\mu}{n+1} - \mu = -\frac{\mu}{n+1}

TnT_n est biaisé, sauf si μ=0\mu = 0. Son biais tend vers 0 quand n+n\to+\infty, ce qui en fait un estimateur asymptotiquement sans biais.

Exercice 2 : Estimateur de la variance (biais de la variance empirique non corrigée)

Facile

Soit (X1,,Xn)(X_1, \ldots, X_n) un échantillon i.i.d. d'espérance μ\mu et de variance σ2\sigma^2. On définit deux statistiques :

Sn2=1ni=1n(XiXˉn)2etSn2=1n1i=1n(XiXˉn)2 S_n^2 = \frac{1}{n}\sum_{i=1}^{n}(X_i - \bar{X}_n)^2 \quad \text{et} \quad S_n^{*2} = \frac{1}{n-1}\sum_{i=1}^{n}(X_i - \bar{X}_n)^2
  1. Montrer que E(Sn2)=n1nσ2\mathbb{E}(S_n^2) = \dfrac{n-1}{n}\sigma^2. En déduire que Sn2S_n^2 est biaisé.
  2. Vérifier que Sn2S_n^{*2} est un estimateur sans biais de σ2\sigma^2. Pourquoi lui préfère-t-on Sn2S_n^{*2} en pratique ?
Indication

Écrire (XiXˉn)2=((Xiμ)(Xˉnμ))2(X_i - \bar{X}_n)^2 = \bigl((X_i - \mu) - (\bar{X}_n - \mu)\bigr)^2 puis développer et prendre l'espérance. Se rappeler que Var(Xˉn)=σ2/n\mathrm{Var}(\bar{X}_n) = \sigma^2/n.

Voir le corrigé
Solution de la question 1 :

On pose Yi=XiμY_i = X_i - \mu. Alors Yˉn=Xˉnμ\bar{Y}_n = \bar{X}_n - \mu et :

i=1n(XiXˉn)2=i=1nYi2nYˉn2 \sum_{i=1}^n (X_i - \bar{X}_n)^2 = \sum_{i=1}^n Y_i^2 - n\bar{Y}_n^2

En prenant l'espérance :

E ⁣[i=1nYi2]=nσ2,E[nYˉn2]=nσ2n=σ2 \mathbb{E}\!\left[\sum_{i=1}^n Y_i^2\right] = n\sigma^2, \quad \mathbb{E}[n\bar{Y}_n^2] = n \cdot \frac{\sigma^2}{n} = \sigma^2 E(Sn2)=nσ2σ2n=n1nσ2 \therefore \quad \mathbb{E}(S_n^2) = \frac{n\sigma^2 - \sigma^2}{n} = \frac{n-1}{n}\sigma^2

Sn2S_n^2 est biaisé (il sous-estime σ2\sigma^2).

Solution de la question 2 : E(Sn2)=nn1E(Sn2)=nn1n1nσ2=σ2 \mathbb{E}(S_n^{*2}) = \frac{n}{n-1} \cdot \mathbb{E}(S_n^2) = \frac{n}{n-1} \cdot \frac{n-1}{n}\sigma^2 = \sigma^2

Sn2S_n^{*2} est sans biais. On lui préfère Sn2S_n^{*2} car il fournit une estimation corrigée, particulièrement importante pour de petits échantillons où le biais de Sn2S_n^2 est significatif.

Exercice 3 : Maximum de vraisemblance pour une loi exponentielle

Moyen

On observe un échantillon (x1,x2,,xn)(x_1, x_2, \ldots, x_n) de réalisations indépendantes d'une loi exponentielle de paramètre λ>0\lambda > 0, dont la densité est :

f(x;λ)=λeλx1x0 f(x;\lambda) = \lambda e^{-\lambda x} \mathbf{1}_{x \geq 0}
  1. Écrire la fonction de vraisemblance L(λ)L(\lambda) et la log-vraisemblance (λ)\ell(\lambda).
  2. Déterminer l'estimateur du maximum de vraisemblance λ^n\hat{\lambda}_n de λ\lambda.
  3. Montrer que λ^n\hat{\lambda}_n est sans biais. Est-il convergent ?
Indication

La log-vraisemblance est plus facile à maximiser que la vraisemblance. Dériver (λ)\ell(\lambda) par rapport à λ\lambda et annuler. Se rappeler que l'espérance d'une loi exponentielle de paramètre λ\lambda vaut 1/λ1/\lambda.

Voir le corrigé
Solution de la question 1 : L(λ)=i=1nλeλxi=λnexp ⁣(λi=1nxi) L(\lambda) = \prod_{i=1}^n \lambda e^{-\lambda x_i} = \lambda^n \exp\!\left(-\lambda \sum_{i=1}^n x_i\right) (λ)=nlnλλi=1nxi \ell(\lambda) = n\ln\lambda - \lambda\sum_{i=1}^n x_i Solution de la question 2 :

On dérive et on annule :

ddλ=nλi=1nxi=0    λ^n=ni=1nxi=1xˉn \frac{d\ell}{d\lambda} = \frac{n}{\lambda} - \sum_{i=1}^n x_i = 0 \implies \hat{\lambda}_n = \frac{n}{\displaystyle\sum_{i=1}^n x_i} = \frac{1}{\bar{x}_n}

La dérivée seconde n/λ2<0-n/\lambda^2 < 0 confirme qu'il s'agit bien d'un maximum.

Solution de la question 3 :

Puisque E(Xi)=1/λ\mathbb{E}(X_i) = 1/\lambda, par la loi des grands nombres XˉnP1/λ\bar{X}_n \xrightarrow{P} 1/\lambda, donc λ^nPλ\hat{\lambda}_n \xrightarrow{P} \lambda : l'estimateur est convergent. Cependant, E(λ^n)=nn1λ\mathbb{E}(\hat{\lambda}_n) = \dfrac{n}{n-1}\lambda (résultat classique pour la loi exponentielle), donc il est légèrement biaisé à distance finie, mais asymptotiquement sans biais.

Intervalles de confiance pour une moyenne

Un intervalle de confiance au niveau 1α1-\alpha est un intervalle aléatoire qui contient le paramètre inconnu avec la probabilité 1α1-\alpha. La construction repose sur la connaissance de la loi de l'estimateur : loi normale si nn est grand (théorème central limite), ou loi de Student à n1n-1 degrés de liberté si la population est gaussienne et la variance inconnue. Les exercices suivants couvrent les deux situations, de la formule de base à la détermination de la taille d'échantillon minimale.

Exercice 4 : Intervalle de confiance pour la moyenne (variance connue)

Facile

Un service de livraison enregistre les délais de traitement (en heures) d'un grand nombre de commandes. On sait, d'après une longue étude historique, que l'écart-type est σ=3,2\sigma = 3{,}2 heures. On prélève un échantillon de n=64n = 64 commandes et on obtient une moyenne empirique xˉ=14,5\bar{x} = 14{,}5 heures.

  1. Construire un intervalle de confiance bilatéral de niveau 95%95\,\% pour la moyenne μ\mu du délai de traitement. On rappelle que u0,025=1,96u_{0{,}025} = 1{,}96.
  2. Le responsable affirme que le délai moyen est de 15 heures. Cette affirmation est-elle compatible avec l'intervalle obtenu ?
  3. Quelle taille d'échantillon faudrait-il pour que la demi-largeur de l'intervalle de confiance à 95%95\,\% soit inférieure à 0,50{,}5 heure ?
Indication

Comme n30n \geq 30 et σ\sigma est connu, la variable pivotale est Z=Xˉnμσ/nN(0,1)Z = \dfrac{\bar{X}_n - \mu}{\sigma/\sqrt{n}} \sim \mathcal{N}(0,1). La demi-largeur vaut uα/2σ/nu_{\alpha/2}\,\sigma/\sqrt{n}.

Voir le corrigé
Solution de la question 1 :

La demi-largeur est :

e=uα/2σn=1,96×3,264=1,96×0,4=0,784 e = u_{\alpha/2}\cdot\frac{\sigma}{\sqrt{n}} = 1{,}96 \times \frac{3{,}2}{\sqrt{64}} = 1{,}96 \times 0{,}4 = 0{,}784

L'intervalle de confiance à 95%95\,\% est :

IC95%(μ)=[xˉe    xˉ+e]=[14,50,784    14,5+0,784]=[13,716    15,284] IC_{95\%}(\mu) = \left[\bar{x} - e \; \; \bar{x} + e\right] = \left[14{,}5 - 0{,}784 \; \; 14{,}5 + 0{,}784\right] = \left[13{,}716 \; \; 15{,}284\right] Solution de la question 2 :

La valeur 1515 appartient à l'intervalle [13,716    15,284]\left[13{,}716 \; \; 15{,}284\right]. L'affirmation du responsable est donc compatible avec les données à un seuil de 5%5\,\%.

Solution de la question 3 :

On cherche nn tel que e<0,5e < 0{,}5 :

1,96×3,2n<0,5    n>1,96×3,20,5=12,544    n>157,35 1{,}96 \times \frac{3{,}2}{\sqrt{n}} < 0{,}5 \implies \sqrt{n} > \frac{1{,}96 \times 3{,}2}{0{,}5} = 12{,}544 \implies n > 157{,}35

Il faut donc un échantillon d'au moins n=158n = 158 commandes.

Exercice 5 : Intervalle de confiance pour la moyenne (variance inconnue, loi de Student)

Moyen

Un pharmacien mesure la concentration (en mg/L) d'un principe actif dans 12 flacons prélevés aléatoirement dans une production. Il obtient :

xˉ=48,3  mg/L,s=2,1  mg/L(s : eˊcart-type corrigeˊ) \bar{x} = 48{,}3 \;\text{mg/L}, \quad s^* = 2{,}1 \;\text{mg/L} \quad (s^* \text{ : écart-type corrigé})

On suppose que la concentration suit une loi normale dans la population.

  1. Justifier l'utilisation de la loi de Student plutôt que de la loi normale centrée réduite.
  2. Construire un intervalle de confiance bilatéral de niveau 95%95\,\% pour la concentration moyenne μ\mu. On rappelle que t11;0,025=2,201t_{11;\,0{,}025} = 2{,}201.
  3. La norme impose une concentration comprise entre 4545 et 5252 mg/L. L'intervalle obtenu est-il entièrement dans cette plage ? Que peut-on conclure ?
Indication

Lorsque σ\sigma est inconnu et nn est petit, la variable pivotale T=XˉnμS/nT = \dfrac{\bar{X}_n - \mu}{S^*/\sqrt{n}} suit une loi de Student à n1n-1 degrés de liberté. Ici n=12n = 12, donc ν=11\nu = 11.

Voir le corrigé
Solution de la question 1 :

L'écart-type de la population σ\sigma est inconnu et l'échantillon est de petite taille (n=12<30n = 12 < 30). On ne peut pas invoquer le théorème central limite pour utiliser la loi normale. Sous l'hypothèse de normalité de la population, la statistique T=XˉnμS/nT = \dfrac{\bar{X}_n - \mu}{S^*/\sqrt{n}} suit exactement une loi de Student à n1=11n-1 = 11 degrés de liberté.

Solution de la question 2 :

La demi-largeur est :

e=t11;0,025×sn=2,201×2,112=2,201×0,60621,334 e = t_{11;\,0{,}025} \times \frac{s^*}{\sqrt{n}} = 2{,}201 \times \frac{2{,}1}{\sqrt{12}} = 2{,}201 \times 0{,}6062 \approx 1{,}334 IC95%(μ)=[48,31,334    48,3+1,334]=[46,97    49,63]  mg/L IC_{95\%}(\mu) = \left[48{,}3 - 1{,}334 \; \; 48{,}3 + 1{,}334\right] = \left[46{,}97 \; \; 49{,}63\right] \;\text{mg/L} Solution de la question 3 :

L'intervalle [46,97    49,63]\left[46{,}97 \; \; 49{,}63\right] est entièrement inclus dans la plage normative [45    52]\left[45 \; \; 52\right]. On peut donc conclure, avec un niveau de confiance de 95%95\,\%, que la concentration moyenne μ\mu respecte les exigences de la norme.

Exercice 6 : Comparaison de deux moyennes indépendantes

Difficile

Un chercheur compare le temps de réaction (en millisecondes) de deux groupes de sujets soumis à des conditions différentes. Les données sont :

GroupeTaille nnMoyenne xˉ\bar{x}Écart-type corrigé ss^*
A (contrôle)20310 ms28 ms
B (traitement)18285 ms31 ms

On suppose les temps de réaction normalement distribués dans chaque groupe et on admet l'égalité des variances des deux populations.

  1. Calculer la variance poolée Sp2S_p^2.
  2. Construire un intervalle de confiance bilatéral à 95%95\,\% pour la différence des moyennes μAμB\mu_A - \mu_B. On utilisera t36;0,0252,028t_{36;\,0{,}025} \approx 2{,}028.
  3. Peut-on conclure à une différence significative entre les deux groupes ?
Indication

La variance poolée combine les deux variances échantillonnales pondérées par leurs degrés de liberté respectifs : Sp2=(nA1)sA2+(nB1)sB2nA+nB2S_p^2 = \dfrac{(n_A-1)s_A^{*2} + (n_B-1)s_B^{*2}}{n_A+n_B-2}. La statistique pivotale suit une loi de Student à nA+nB2n_A+n_B-2 degrés de liberté.

Voir le corrigé
Solution de la question 1 : Sp2=(nA1)sA2+(nB1)sB2nA+nB2=19×784+17×96136=14896+1633736=3123336867,6  ms2 S_p^2 = \frac{(n_A-1)s_A^{*2}+(n_B-1)s_B^{*2}}{n_A+n_B-2} = \frac{19\times 784 + 17\times 961}{36} = \frac{14\,896 + 16\,337}{36} = \frac{31\,233}{36} \approx 867{,}6 \;\text{ms}^2

Soit Sp29,45S_p \approx 29{,}45 ms.

Solution de la question 2 :

L'erreur standard de la différence des moyennes est :

SE=Sp1nA+1nB=29,45120+118=29,450,105629,45×0,32499,57  ms \mathrm{SE} = S_p\sqrt{\frac{1}{n_A}+\frac{1}{n_B}} = 29{,}45\sqrt{\frac{1}{20}+\frac{1}{18}} = 29{,}45\sqrt{0{,}1056} \approx 29{,}45 \times 0{,}3249 \approx 9{,}57 \;\text{ms}

L'intervalle de confiance à 95%95\,\% pour μAμB\mu_A - \mu_B est :

IC95%(μAμB)=[(xˉAxˉB)±t36;0,025×SE]=[25±2,028×9,57]=[25±19,41] IC_{95\%}(\mu_A-\mu_B) = \left[(\bar{x}_A-\bar{x}_B) \pm t_{36;\,0{,}025}\times\mathrm{SE}\right] = \left[25 \pm 2{,}028\times9{,}57\right] = \left[25 \pm 19{,}41\right] IC95%(μAμB)=[5,59    44,41]  ms IC_{95\%}(\mu_A-\mu_B) = \left[5{,}59 \; \; 44{,}41\right] \;\text{ms} Solution de la question 3 :

L'intervalle [5,59    44,41]\left[5{,}59 \; \; 44{,}41\right] ne contient pas la valeur 00. On peut donc conclure, au seuil de 5%5\,\%, qu'il existe une différence significative entre les temps de réaction moyens des deux groupes : le groupe traitement (B) réagit significativement plus vite que le groupe contrôle (A).

Intervalles de confiance pour une proportion

Estimer une proportion inconnue pp dans une population est l'une des applications les plus fréquentes de la statistique inférentielle : sondages d'opinion, contrôle qualité, épidémiologie. La méthode repose sur l'approximation normale de la loi binomiale via le théorème central limite, valable dès que np^5n\hat{p} \geq 5 et n(1p^)5n(1-\hat{p}) \geq 5. Les exercices ci-dessous traitent la construction de l'intervalle, la détermination de la taille d'échantillon et la comparaison de deux proportions.

Exercice 7 : Intervalle de confiance pour une proportion (sondage d’opinion)

Facile

Lors d'un sondage réalisé auprès de n=400n = 400 personnes, 220220 déclarent être favorables à une mesure environnementale.

  1. Calculer la fréquence observée p^\hat{p} et vérifier les conditions d'application de l'approximation normale.
  2. Construire un intervalle de confiance au niveau 95%95\,\% pour la proportion pp dans la population. On rappelle u0,025=1,96u_{0{,}025} = 1{,}96.
  3. Peut-on affirmer, au seuil de 5%5\,\%, que la majorité (plus de 50%50\,\%) est favorable à cette mesure ?
Indication

L'intervalle de confiance pour une proportion est centré en p^\hat{p} avec demi-largeur uα/2p^(1p^)/nu_{\alpha/2}\sqrt{\hat{p}(1-\hat{p})/n}. Pour conclure sur la majorité, vérifier si la borne inférieure de l'IC est strictement supérieure à 0,50{,}5.

Voir le corrigé
Solution de la question 1 : p^=220400=0,55 \hat{p} = \frac{220}{400} = 0{,}55

Vérification des conditions : np^=2205n\hat{p} = 220 \geq 5 et n(1p^)=1805n(1-\hat{p}) = 180 \geq 5. Les conditions sont satisfaites.

Solution de la question 2 : e=1,960,55×0,45400=1,960,2475400=1,96×0,024880,0488 e = 1{,}96\sqrt{\frac{0{,}55 \times 0{,}45}{400}} = 1{,}96\sqrt{\frac{0{,}2475}{400}} = 1{,}96 \times 0{,}02488 \approx 0{,}0488 IC95%(p)=[0,550,049    0,55+0,049]=[0,501    0,599] IC_{95\%}(p) = \left[0{,}55 - 0{,}049 \; \; 0{,}55 + 0{,}049\right] = \left[0{,}501 \; \; 0{,}599\right] Solution de la question 3 :

La borne inférieure de l'intervalle est 0,501>0,50{,}501 > 0{,}5. On peut donc conclure, au seuil de 5%5\,\%, que la proportion de personnes favorables est significativement supérieure à 50%50\,\%, c'est-à-dire que la majorité est favorable.

Exercice 8 : Taille d’échantillon pour un intervalle de confiance sur une proportion

Moyen

Un directeur qualité souhaite estimer la proportion pp de pièces défectueuses dans la production d'une usine. Il veut que son intervalle de confiance à 95%95\,\% ait une demi-largeur inférieure à 0,030{,}03 (soit 33 points de pourcentage).

  1. Sans hypothèse préalable sur pp, quelle taille d'échantillon minimale doit-il prélever ?
  2. Un technicien estime que pp ne dépasse pas 10%10\,\%. Quelle taille d'échantillon suffit dans ce cas ?
  3. Comparer les deux résultats et commenter.
Indication

La demi-largeur est e=uα/2p(1p)/ne = u_{\alpha/2}\sqrt{p(1-p)/n}. Pour la majorer sans connaître pp, utiliser le fait que p(1p)1/4p(1-p) \leq 1/4 pour tout p[0,1]p \in [0,1], avec le maximum atteint en p=1/2p = 1/2.

Voir le corrigé
Solution de la question 1 :

On majore p(1p)14p(1-p) \leq \frac{1}{4} et on impose e0,03e \leq 0{,}03 :

1,961/4n0,03    n1,962×0,03=1,960,0632,67    n32,6721067,1 1{,}96\sqrt{\frac{1/4}{n}} \leq 0{,}03 \implies \sqrt{n} \geq \frac{1{,}96}{2 \times 0{,}03} = \frac{1{,}96}{0{,}06} \approx 32{,}67 \implies n \geq 32{,}67^2 \approx 1\,067{,}1

Il faut donc au moins n=1068n = \mathbf{1\,068} pièces.

Solution de la question 2 :

Avec p0,1p \leq 0{,}1, la valeur de p(1p)p(1-p) est maximale en p=0,1p = 0{,}1 : 0,1×0,9=0,090{,}1 \times 0{,}9 = 0{,}09.

1,960,09n0,03    n1,96×0,30,03=19,6    n384,16 1{,}96\sqrt{\frac{0{,}09}{n}} \leq 0{,}03 \implies \sqrt{n} \geq \frac{1{,}96 \times 0{,}3}{0{,}03} = 19{,}6 \implies n \geq 384{,}16

Il suffit de n=385n = \mathbf{385} pièces.

Solution de la question 3 :

L'utilisation d'une information préalable sur pp réduit considérablement la taille nécessaire : de 10681\,068 à seulement 385385 échantillons, soit une réduction de 64%64\,\%. En pratique, si une estimation grossière de pp est disponible (essai pilote, données historiques), il est toujours préférable de l'exploiter pour optimiser le coût de l'étude.

Tests d’hypothèses paramétriques

Un test d'hypothèse est une procédure décisionnelle permettant de choisir entre deux hypothèses statistiques (l'hypothèse nulle H0H_0 et l'hypothèse alternative H1H_1) à partir des données d'un échantillon. On distingue le risque de première espèce α\alpha (rejeter H0H_0 à tort) et le risque de deuxième espèce β\beta (accepter H0H_0 à tort). Les exercices suivants couvrent les tests sur une moyenne (loi normale et Student), les tests sur une proportion, ainsi que le calcul de la p-valeur.

Exercice 9 : Test unilatéral sur une moyenne (loi normale, variance connue)

Facile

Un fabricant prétend que la durée de vie moyenne de ses ampoules LED est de μ0=15000\mu_0 = 15\,000 heures, avec un écart-type connu de σ=600\sigma = 600 heures. Un laboratoire indépendant teste n=36n = 36 ampoules et mesure une durée de vie moyenne de xˉ=14780\bar{x} = 14\,780 heures.

  1. Formuler les hypothèses H0H_0 et H1H_1 pour tester si la durée de vie est inférieure à ce qu'annonce le fabricant (test unilatéral gauche, seuil α=5%\alpha = 5\,\%).
  2. Calculer la statistique de test ZobsZ_{\mathrm{obs}} et prendre la décision. On rappelle que u0,05=1,645u_{0{,}05} = 1{,}645.
  3. Calculer la p-valeur et interpréter.
Indication

Sous H0H_0, la statistique Z=Xˉnμ0σ/nZ = \dfrac{\bar{X}_n - \mu_0}{\sigma/\sqrt{n}} suit N(0,1)\mathcal{N}(0,1). Pour un test unilatéral gauche, on rejette H0H_0 si Zobs<uαZ_{\mathrm{obs}} < -u_\alpha. La p-valeur est P(ZZobs)P(Z \leq Z_{\mathrm{obs}}) sous H0H_0.

Voir le corrigé
Solution de la question 1 : H0:μ=15000contreH1:μ<15000 H_0 : \mu = 15\,000 \quad \text{contre} \quad H_1 : \mu < 15\,000 Solution de la question 2 : Zobs=xˉμ0σ/n=1478015000600/36=220100=2,20 Z_{\mathrm{obs}} = \frac{\bar{x} - \mu_0}{\sigma/\sqrt{n}} = \frac{14\,780 - 15\,000}{600/\sqrt{36}} = \frac{-220}{100} = -2{,}20

La zone de rejet est ]    1,645[\left]-\infty \; \; -1{,}645\right[. Comme Zobs=2,20<1,645Z_{\mathrm{obs}} = -2{,}20 < -1{,}645, on rejette H0H_0 au seuil de 5%5\,\%. Les données indiquent que la durée de vie réelle est significativement inférieure à 1500015\,000 heures.

Solution de la question 3 : p-valeur=P(Z2,20)=Φ(2,20)0,0139 \text{p-valeur} = P(Z \leq -2{,}20) = \Phi(-2{,}20) \approx 0{,}0139

La p-valeur est 1,39%\approx 1{,}39\,\%, bien inférieure au seuil α=5%\alpha = 5\,\%. Cela confirme le rejet de H0H_0 et indique que si la durée de vie était vraiment de 1500015\,000 heures, on n'observerait une telle valeur (ou plus extrême) que dans 1,39%1{,}39\,\% des cas.

Exercice 10 : Test bilatéral sur une moyenne (loi de Student)

Moyen

Un nutritionniste souhaite vérifier si un régime alimentaire particulier modifie le taux de cholestérol (en mmol/L) par rapport à la norme de μ0=5,2\mu_0 = 5{,}2 mmol/L. Il suit n=15n = 15 patients et relève, après le régime :

xˉ=4,9  mmol/L,s=0,7  mmol/L \bar{x} = 4{,}9 \;\text{mmol/L}, \quad s^* = 0{,}7 \;\text{mmol/L}

On suppose la distribution du taux de cholestérol normale dans la population. On utilise un seuil α=5%\alpha = 5\,\%.

  1. Formuler H0H_0 et H1H_1 pour un test bilatéral.
  2. Calculer la statistique de Student TobsT_{\mathrm{obs}} et conclure. On rappelle que t14;0,025=2,145t_{14;\,0{,}025} = 2{,}145.
  3. Quel est le lien entre ce test et l'intervalle de confiance construit à partir des mêmes données ?
Indication

Sous H0H_0, la statistique T=Xˉnμ0S/nT = \dfrac{\bar{X}_n - \mu_0}{S^*/\sqrt{n}} suit une loi de Student à n1=14n-1 = 14 degrés de liberté. Pour le lien avec l'IC, rappeler que H0H_0 est rejetée si et seulement si μ0\mu_0 n'appartient pas à l'IC au même niveau.

Voir le corrigé
Solution de la question 1 : H0:μ=5,2contreH1:μ5,2 H_0 : \mu = 5{,}2 \quad \text{contre} \quad H_1 : \mu \neq 5{,}2 Solution de la question 2 : Tobs=4,95,20,7/15=0,30,18071,660 T_{\mathrm{obs}} = \frac{4{,}9 - 5{,}2}{0{,}7/\sqrt{15}} = \frac{-0{,}3}{0{,}1807} \approx -1{,}660

La zone de rejet bilatérale est ]    2,145[]2,145    +[\left]-\infty \; \; -2{,}145\right[ \cup \left]2{,}145 \; \; +\infty\right[. Comme Tobs=1,660<2,145|T_{\mathrm{obs}}| = 1{,}660 < 2{,}145, on ne rejette pas H0H_0 au seuil de 5%5\,\%. On ne peut pas conclure à une modification significative du taux de cholestérol.

Solution de la question 3 :

L'intervalle de confiance bilatéral à 95%95\,\% pour μ\mu est :

IC95%(μ)=[4,92,145×0,715    4,9+2,145×0,715]=[4,513    5,287] IC_{95\%}(\mu) = \left[4{,}9 - 2{,}145\times\frac{0{,}7}{\sqrt{15}} \; \; 4{,}9 + 2{,}145\times\frac{0{,}7}{\sqrt{15}}\right] = \left[4{,}513 \; \; 5{,}287\right]

La valeur μ0=5,2\mu_0 = 5{,}2 appartient à [4,513    5,287]\left[4{,}513 \; \; 5{,}287\right], ce qui est équivalent à ne pas rejeter H0H_0. Il y a une dualité parfaite entre le test et l'intervalle de confiance au même niveau.

Test du khi-deux : adéquation et indépendance

Le test du khi-deux (χ2\chi^2) est un outil non paramétrique polyvalent. Il sert, d'une part, à tester l'adéquation d'un échantillon à une loi théorique (loi uniforme, loi de Poisson, loi normale…) et, d'autre part, à tester l'indépendance entre deux variables qualitatives observées dans un tableau de contingence. La condition d'application (effectifs théoriques tous supérieurs ou égaux à 5) doit toujours être vérifiée avant de conclure.

Exercice 11 : Test d’adéquation à une loi uniforme (dé équilibré)

Facile

On lance un dé à six faces N=300N = 300 fois et on observe les fréquences suivantes :

Face123456
Effectif observé nin_i584255475345
  1. Calculer les effectifs théoriques sous l'hypothèse que le dé est équilibré.
  2. Calculer la statistique de test χobs2\chi^2_{\mathrm{obs}}.
  3. Conclure au seuil α=5%\alpha = 5\,\%. On rappelle que χ5;0,052=11,07\chi^2_{5;\,0{,}05} = 11{,}07.
Indication

Sous l'hypothèse nulle d'équilibre, chaque face a la probabilité 1/61/6. L'effectif théorique pour chaque face est ei=N/6e_i = N/6. La statistique de test est χobs2=i=16(niei)2ei\chi^2_{\mathrm{obs}} = \sum_{i=1}^{6}\dfrac{(n_i - e_i)^2}{e_i} et suit asymptotiquement un χ2\chi^2 à 61=56-1 = 5 degrés de liberté.

Voir le corrigé
Solution de la question 1 : ei=3006=50pour chaque face e_i = \frac{300}{6} = 50 \quad \text{pour chaque face}

Tous les effectifs théoriques valent 50550 \geq 5 : la condition d'application est satisfaite.

Solution de la question 2 : χobs2=(5850)250+(4250)250+(5550)250+(4750)250+(5350)250+(4550)250 \chi^2_{\mathrm{obs}} = \frac{(58-50)^2}{50}+\frac{(42-50)^2}{50}+\frac{(55-50)^2}{50}+\frac{(47-50)^2}{50}+\frac{(53-50)^2}{50}+\frac{(45-50)^2}{50} =64+64+25+9+9+2550=19650=3,92 = \frac{64+64+25+9+9+25}{50} = \frac{196}{50} = 3{,}92 Solution de la question 3 :

Comme χobs2=3,92<χ5;0,052=11,07\chi^2_{\mathrm{obs}} = 3{,}92 < \chi^2_{5;\,0{,}05} = 11{,}07, on ne rejette pas H0H_0. Les données sont compatibles avec l'hypothèse que le dé est équilibré, au seuil de 5%5\,\%.

Exercice 12 : Test d’indépendance par tableau de contingence

Moyen

Une enquête portant sur 350350 salariés croise leur niveau de formation et leur satisfaction au travail. Le tableau de contingence est le suivant :

SatisfaitNeutreInsatisfaitTotal
Bac ou moins603050140
Bac+2 à Bac+3802535140
Bac+4 et plus50101070
Total1906595350
  1. Calculer les effectifs théoriques sous l'hypothèse d'indépendance entre formation et satisfaction.
  2. Calculer la statistique χobs2\chi^2_{\mathrm{obs}} et conclure au seuil α=5%\alpha = 5\,\%. On rappelle que χ4;0,052=9,49\chi^2_{4;\,0{,}05} = 9{,}49.
  3. Quel est le nombre de degrés de liberté, et comment est-il déterminé pour un tableau de contingence r×cr \times c ?
Indication

L'effectif théorique de la cellule (i,j)(i,j) est eij=(total ligne i)×(total colonne j)Ne_{ij} = \dfrac{(\text{total ligne } i) \times (\text{total colonne } j)}{N}. Le nombre de degrés de liberté est (r1)(c1)(r-1)(c-1), ici (31)(31)=4(3-1)(3-1) = 4.

Voir le corrigé
Solution de la question 1 :

Effectifs théoriques eij=ni×njNe_{ij} = \dfrac{n_{i\cdot} \times n_{\cdot j}}{N} :

SatisfaitNeutreInsatisfait
Bac ou moins140×190350=76\frac{140\times190}{350}=76140×65350=26\frac{140\times65}{350}=26140×95350=38\frac{140\times95}{350}=38
Bac+2 à Bac+3140×190350=76\frac{140\times190}{350}=76140×65350=26\frac{140\times65}{350}=26140×95350=38\frac{140\times95}{350}=38
Bac+4 et plus70×190350=38\frac{70\times190}{350}=3870×65350=13\frac{70\times65}{350}=1370×95350=19\frac{70\times95}{350}=19

Tous les effectifs théoriques sont 5\geq 5 : la condition d'application est respectée.

Solution de la question 2 : χobs2=(6076)276+(3026)226+(5038)238+(8076)276+(2526)226+(3538)238 \chi^2_{\mathrm{obs}} = \frac{(60-76)^2}{76}+\frac{(30-26)^2}{26}+\frac{(50-38)^2}{38}+\frac{(80-76)^2}{76}+\frac{(25-26)^2}{26}+\frac{(35-38)^2}{38} +(5038)238+(1013)213+(1019)219 +\frac{(50-38)^2}{38}+\frac{(10-13)^2}{13}+\frac{(10-19)^2}{19} =25676+1626+14438+1676+126+938+14438+913+8119 = \frac{256}{76}+\frac{16}{26}+\frac{144}{38}+\frac{16}{76}+\frac{1}{26}+\frac{9}{38}+\frac{144}{38}+\frac{9}{13}+\frac{81}{19} 3,368+0,615+3,789+0,211+0,038+0,237+3,789+0,692+4,26317,00 \approx 3{,}368+0{,}615+3{,}789+0{,}211+0{,}038+0{,}237+3{,}789+0{,}692+4{,}263 \approx 17{,}00

Comme χobs217,00>χ4;0,052=9,49\chi^2_{\mathrm{obs}} \approx 17{,}00 > \chi^2_{4;\,0{,}05} = 9{,}49, on rejette H0H_0 au seuil de 5%5\,\%. Il existe une liaison significative entre le niveau de formation et la satisfaction au travail.

Solution de la question 3 :

Pour un tableau r×cr \times c, le nombre de degrés de liberté est (r1)(c1)(r-1)(c-1). Ici r=3r = 3 lignes et c=3c = 3 colonnes, donc ν=2×2=4\nu = 2 \times 2 = 4. Ce résultat traduit le nombre de cellules libres une fois que les marges (totaux lignes et colonnes) sont fixées.

Théorème central limite et convergence des estimateurs

Le théorème central limite (TCL) est le résultat fondamental qui justifie l'approximation normale utilisée dans la quasi-totalité des tests et intervalles de confiance. Il énonce que, sous des conditions très générales, la moyenne d'un grand nombre d'observations indépendantes et identiquement distribuées tend vers une loi normale, quelle que soit la loi mère. Les exercices suivants permettent d'appliquer ce résultat à des situations concrètes et d'en comprendre les conditions d'utilisation.

Exercice 13 : Application directe du théorème central limite

Facile

Le temps de service (en minutes) d'un client dans un guichet bancaire suit une loi d'espérance μ=4\mu = 4 min et d'écart-type σ=1,5\sigma = 1{,}5 min (loi non précisée). On observe un échantillon de n=100n = 100 clients.

  1. D'après le théorème central limite, quelle est la loi approchée de la moyenne empirique Xˉ100\bar{X}_{100} ?
  2. Calculer P(Xˉ100>4,25)P(\bar{X}_{100} > 4{,}25) grâce à cette approximation.
  3. Calculer P(3,8Xˉ1004,2)P(3{,}8 \leq \bar{X}_{100} \leq 4{,}2).
Indication

Par le TCL, XˉnN ⁣(μ,σ2/n)\bar{X}_n \approx \mathcal{N}\!\left(\mu, \sigma^2/n\right). Standardiser en posant Z=Xˉnμσ/nZ = \dfrac{\bar{X}_n - \mu}{\sigma/\sqrt{n}} pour utiliser la table de la loi normale centrée réduite.

Voir le corrigé
Solution de la question 1 :

Par le TCL (avec n=10030n=100 \geq 30) :

Xˉ100N ⁣(μ,σ2n)=N ⁣(4,1,52100)=N(4,  0,0225) \bar{X}_{100} \approx \mathcal{N}\!\left(\mu,\,\frac{\sigma^2}{n}\right) = \mathcal{N}\!\left(4,\,\frac{1{,}5^2}{100}\right) = \mathcal{N}(4,\;0{,}0225)

L'écart-type de Xˉ100\bar{X}_{100} est σ/n=1,5/10=0,15\sigma/\sqrt{n} = 1{,}5/10 = 0{,}15 min.

Solution de la question 2 : P(Xˉ100>4,25)=P ⁣(Z>4,2540,15)=P(Z>1,667)=1Φ(1,667)10,9525=0,0475 P(\bar{X}_{100} > 4{,}25) = P\!\left(Z > \frac{4{,}25-4}{0{,}15}\right) = P(Z > 1{,}667) = 1 - \Phi(1{,}667) \approx 1 - 0{,}9525 = 0{,}0475 Solution de la question 3 : P(3,8Xˉ1004,2)=P ⁣(3,840,15Z4,240,15)=P(1,333Z1,333) P(3{,}8 \leq \bar{X}_{100} \leq 4{,}2) = P\!\left(\frac{3{,}8-4}{0{,}15} \leq Z \leq \frac{4{,}2-4}{0{,}15}\right) = P(-1{,}333 \leq Z \leq 1{,}333) =2Φ(1,333)12×0,90881=0,8176 = 2\Phi(1{,}333) - 1 \approx 2 \times 0{,}9088 - 1 = 0{,}8176

Il y a environ 81,8%81{,}8\,\% de chances que la moyenne d'un échantillon de 100 clients soit comprise entre 3,83{,}8 et 4,24{,}2 minutes.

Exercice 14 : Approximation de la loi binomiale par la loi normale et intervalle de confiance

Difficile

Une chaîne de production génère des pièces dont la probabilité de défaut est p=0,08p = 0{,}08. On prélève un lot de n=500n = 500 pièces et on note XX le nombre de pièces défectueuses dans ce lot.

  1. Vérifier que l'approximation normale de la loi binomiale est justifiée. Donner la loi approchée de XX.
  2. Calculer P(30X50)P(30 \leq X \leq 50) grâce à l'approximation normale (avec correction de continuité).
  3. En supposant que le lot observé donne p^=46/500=0,092\hat{p} = 46/500 = 0{,}092, construire un intervalle de confiance asymptotique à 99%99\,\% pour pp. On rappelle que u0,005=2,576u_{0{,}005} = 2{,}576.
Indication

La correction de continuité remplace P(aXb)P(a \leq X \leq b) par P(a0,5Xb+0,5)P(a - 0{,}5 \leq X \leq b + 0{,}5) pour une variable entière approchée par une variable continue. Pour l'IC à 99%99\,\%, utiliser u0,005=2,576u_{0{,}005} = 2{,}576.

Voir le corrigé
Solution de la question 1 :

XB(500,0,08)X \sim \mathcal{B}(500, 0{,}08). Conditions : np=405np = 40 \geq 5 et n(1p)=4605n(1-p) = 460 \geq 5. ✓

XN(np,np(1p))=N(40,36,8)σX=36,86,066 X \approx \mathcal{N}(np,\, np(1-p)) = \mathcal{N}(40,\, 36{,}8) \quad\Rightarrow\quad \sigma_X = \sqrt{36{,}8} \approx 6{,}066 Solution de la question 2 :

Avec correction de continuité :

P(30X50)P(29,5X50,5)=P ⁣(29,5406,066Z50,5406,066) P(30 \leq X \leq 50) \approx P(29{,}5 \leq X \leq 50{,}5) = P\!\left(\frac{29{,}5-40}{6{,}066} \leq Z \leq \frac{50{,}5-40}{6{,}066}\right) =P(1,731Z1,731)=2Φ(1,731)12×0,95831=0,9166 = P(-1{,}731 \leq Z \leq 1{,}731) = 2\Phi(1{,}731) - 1 \approx 2\times 0{,}9583 - 1 = 0{,}9166 Solution de la question 3 : e=2,5760,092×0,908500=2,5760,083536500=2,576×0,012930,0333 e = 2{,}576\sqrt{\frac{0{,}092\times0{,}908}{500}} = 2{,}576\sqrt{\frac{0{,}083536}{500}} = 2{,}576\times 0{,}01293 \approx 0{,}0333 IC99%(p)=[0,0920,033    0,092+0,033]=[0,059    0,125] IC_{99\%}(p) = \left[0{,}092 - 0{,}033 \; \; 0{,}092 + 0{,}033\right] = \left[0{,}059 \; \; 0{,}125\right]

On estime, avec un niveau de confiance de 99%99\,\%, que la proportion réelle de pièces défectueuses se situe entre 5,9%5{,}9\,\% et 12,5%12{,}5\,\%. La valeur nominale p0=8%p_0 = 8\,\% appartient à cet intervalle : aucune dérive significative n'est détectée au seuil de 1%1\,\%.