Chapitre 1 - Echantillonnage et distributions

40 cartes

Ce document couvre l'échantillonnage, les distributions d'échantillons, les estimateurs et les rappels sur la loi normale. Il aborde les concepts d'inférence statistique et leurs propriétés.

20 cartes

Réviser
Question

Que signifie l'acronyme i.i.d.?

Retourner la carte
Réponse

Indépendantes et identiquement distribuées.

Question

Qu'est-ce qu'une erreur-type (standard error)?

Retourner la carte
Réponse

Écart-type de la distribution d'échantillonnage d'un estimateur. Pour xˉ\bar{x} : σ/n\sigma/\sqrt{n}.

Question

Si X∼N(μ;σ2)X \sim N(\mu; \sigma^2), quelle est la distribution de l'estimateur xˉ\bar{x}?

Retourner la carte
Réponse

xˉ∼N(μ;σ2/n)\bar{x} \sim N(\mu ; \sigma^2/n)

Question

Donnez un exemple d'estimateur ponctuel pour la moyenne (μ\mu).

Retourner la carte
Réponse

La moyenne d'échantillon xˉ\bar{x}.

Question

Qu'est-ce que l'inférence statistique?

Retourner la carte
Réponse

Méthode qui consiste à généraliser les informations d'un échantillon à l'ensemble de la population.

Question

Comment est calculée la variance d'échantillon S2S^2 par rapport à la variance de la population σ2\sigma^2?

Retourner la carte
Réponse

S2S^2 se divise par (n−1)(n-1), σ2\sigma^2 par NN, rendant S2S^2 sans biais.

Question

Quel est le tableau des estimateurs ponctuels usuels pour la moyenne, la proportion et la variance?

Retourner la carte
Réponse

Moyenne μ\mu : xˉ\bar{x} ; Proportion π\pi : P^\hat{P} ; Variance σ2\sigma^2 : S2S^2.

Question

Quelle loi suit (n−1)S2/σ2(n-1)S^2/\sigma^2?

Retourner la carte
Réponse

Loi du χ2\chi^2 à (n−1)(n-1) degrés de liberté.

Question

Qu'est-ce que le biais d'un estimateur B(T)B(T)?

Retourner la carte
Réponse

Écart entre l'espérance de l'estimateur et la vraie valeur du paramètre : B(T)=E(T)−θB(T) = E(T) - \theta.

Question

Qu'est-ce que la consistance d'un estimateur?

Retourner la carte
Réponse

Propriété selon laquelle l'estimateur se rapproche de la vraie valeur du paramètre à mesure que la taille d'échantillon nn augmente : T→θT \to \theta quand n→∞n \to \infty.

Question

Comment l'efficacité d'un estimateur est-elle mesurée?

Retourner la carte
Réponse

Par la Mean Squared Error (MSE) : MSE(T)=Var(T)+B(T)2MSE(T) = Var(T) + B(T)^2. Pour deux estimateurs sans biais, on compare leur variance.

Question

Quel est le rôle d'un estimateur?

Retourner la carte
Réponse

Une fonction des données d'échantillon utilisée pour estimer un paramètre inconnu de la population, par exemple xˉ\bar{x} pour μ\mu.

Question

Qu'est-ce qu'une distribution d'échantillonnage?

Retourner la carte
Réponse

Distribution de probabilité d'une statistique d'échantillon (ex. xˉ\bar{x}) calculée sur tous les échantillons possibles de taille nn.

Question

Qu'est-ce que la fonction de répartition de la loi normale centrée réduite?

Retourner la carte
Réponse

Φ(z)=P(Z<z)\Phi(z) = P(Z < z), donnant l'aire sous la courbe à gauche de zz.

Question

Quelles sont les trois conditions d'un bon échantillonnage?

Retourner la carte
Réponse

Aléatoire (non biaisé), représentatif de la population, et de taille adaptée (arbitrage coût/précision).

Question

Comment est notée la loi normale centrée réduite et quels sont ses paramètres?

Retourner la carte
Réponse

Z∼N(0;1)Z \sim N(0;1), avec μ=0\mu = 0 et σ2=1\sigma^2 = 1.

Question

Quelles sont les trois propriétés d'un bon estimateur?

Retourner la carte
Réponse

Absence de biais (E(T)=θE(T) = \theta), efficacité (variance minimale), consistance (T→θT \to \theta quand n→∞n \to \infty).

Question

Quelle est la notation pour la variance d'échantillon et la variance de la population?

Retourner la carte
Réponse

s2s^2 pour l'échantillon (division par n−1n-1) et σ2\sigma^2 pour la population (division par NN).

Question

Qu'est-ce que la population en statistique?

Retourner la carte
Réponse

L'ensemble des unités étudiées (individus, entreprises…) sur lequel porte l'inférence.

Question

Qu'est-ce que le Théorème Central Limite (TCL)?

Retourner la carte
Réponse

La distribution de la somme ou de la moyenne d'un grand nombre de variables i.i.d. tend vers une loi Normale, quelle que soit la loi d'origine.

1 / 20

Fiche de révision

Concepts fondamentaux et notations

L'inférence statistique est essentielle pour généraliser des informations d'un échantillon à l'ensemble d'une population. Ce processus implique de bien comprendre les définitions clés et de s'assurer de la qualité de l'échantillonnage pour des résultats fiables à l'examen.

Population et paramètres

Populationnom féminin

L'ensemble de tous les individus ou éléments étudiés, dont on cherche à connaître les caractéristiques.

« Pour une étude sur le chômage, la population peut être l'ensemble des habitants d'un pays. »

Une population est caractérisée par des paramètres fixes mais généralement inconnus. Les trois principaux paramètres sont la moyenne (μ), la proportion (π) et la variance (σ²). Ces valeurs sont l'objectif de l'inférence statistique, car elles décrivent les caractéristiques réelles de l'ensemble étudié.

μ=(1/N)⋅Σxiσ2=(1/N)⋅Σ(xi−μ)2\mu = (1/N) \cdot \Sigma x_i \\ \sigma^2 = (1/N) \cdot \Sigma (x_i - \mu)^2

Ces formules définissent la moyenne (μ) et la variance (σ²) d'une population finie. **Paramètres :** - $N$ : nombre d'unités dans la population. - $x_i$ : valeur de la variable pour l'individu $i$. - $\mu$ : moyenne de la population. **Interprétation :** La moyenne est la somme des valeurs divisée par le nombre d'individus. La variance mesure la dispersion des valeurs autour de cette moyenne.

Estimateurs et estimations

Estimateurnom masculin

Une fonction des observations d'un échantillon utilisée pour approcher un paramètre inconnu de la population. Il s'agit d'une variable aléatoire avant le tirage de l'échantillon.

« La moyenne d'échantillon ($\bar{x}$) est un estimateur de la moyenne de la population (μ). »

L'estimation est la valeur numérique obtenue lorsque l'estimateur est appliqué à un échantillon concret. Il est crucial de ne pas confondre le paramètre (valeur vraie et fixe de la population), l'estimateur (formule aléatoire) et l'estimation (résultat numérique obtenu). Une erreur fréquente aux examens est de mélanger ces trois notions. Par exemple, θ^\hat{\theta} (thêta chapeau) est la notation générique pour un estimateur.

Conventions de notation

Caractéristique Population Échantillon
Taille NN nn
Moyenne μ\mu xˉ\bar{x}
Proportion π\pi P^\hat{P}
Variance σ2\sigma^2 S2S^2
Écart-type σ\sigma SS

Cette distinction est fondamentale et souvent source d'erreurs. Les symboles grecs (μ, π, σ) sont réservés à la population, tandis que les lettres latines (n, xˉ\bar{x}, SS) désignent les statistiques d'échantillon. Ne jamais mélanger ces notations est un impératif pour la clarté et la justesse des calculs.

Conditions d'un bon échantillonnage

Un bon échantillonnage est la pierre angulaire d'une inférence valide. Il doit être aléatoire pour éviter les biais, représentatif de la population pour que les conclusions soient généralisables, et de taille adaptée. La taille optimale résulte d'un arbitrage entre le coût et la précision attendue de l'estimation. Une taille d'échantillon trop faible peut entraîner des estimations imprécises.

Types d'extraction d'échantillons

L'extraction peut se faire avec ou sans remise, et être ordonnée ou non. Ces choix influencent le nombre total d'échantillons possibles et les propriétés statistiques. L'échantillonnage aléatoire simple sans remise, par exemple, rend les variables XiX_i dépendantes, un point à ne pas oublier dans certains contextes d'examen.

Ordonnés Non ordonnés
Avec remise NnN^n (N+n−1)!/[n!(N−1)!](N + n - 1)! / [n!(N - 1)!]
Sans remise N!/(N−n)!N! / (N - n)! N!/[n!(N−n)!]N! / [n!(N - n)!]

Distribution d'échantillonnage de la moyenne et théorème central limite

Distribution d'échantillonnage de la moyenne

Lorsqu'on extrait plusieurs échantillons d'une population, la moyenne xˉ\bar{x} de chaque échantillon varie. La distribution de ces moyennes d'échantillon s'appelle la distribution d'échantillonnage de la moyenne. C'est une distribution de probabilité qui décrit toutes les valeurs possibles de xˉ\bar{x} et leurs probabilités.

Propriétés de l'estimateur $\bar{x}$

E(xˉ)=μE(\bar{x}) = \mu

Cette formule indique que l'espérance mathématique de la moyenne d'échantillon $\bar{x}$ est égale à la moyenne de la population $\mu$. **Paramètres :** - $E(\bar{x})$ : espérance de la moyenne d'échantillon. - $\mu$ : moyenne de la population. **Interprétation :** Cela signifie que $\bar{x}$ est un estimateur sans biais de $\mu$. En moyenne, si l'on tirait un grand nombre d'échantillons, la moyenne de leurs moyennes serait égale à la vraie moyenne de la population.

V(xˉ)=σ2/nV(\bar{x}) = \sigma^2/n

Cette formule donne la variance de la moyenne d'échantillon $\bar{x}$. **Paramètres :** - $V(\bar{x})$ : variance de la moyenne d'échantillon. - $\sigma^2$ : variance de la population. - $n$ : taille de l'échantillon. **Interprétation :** La variance de la moyenne d'échantillon diminue à mesure que la taille de l'échantillon $n$ augmente, ce qui signifie que les moyennes d'échantillon sont plus concentrées autour de la vraie moyenne de la population. Le terme $\sigma/\sqrt{n}$ est appelé l'<mark>erreur-type</mark> (standard error).

Si les variables XiX_i de l'échantillon sont indépendantes et identiquement distribuées (i.i.d.), la loi de xˉ\bar{x} peut être déterminée. Si XX suit une distribution N(μ;σ2)N(\mu ; \sigma^2), alors xˉ\bar{x} suit également une loi normale : xˉ∼N(μ;σ2/n)\bar{x} \sim N(\mu ; \sigma^2 / n). Dans ce cas, l'estimateur xˉ\bar{x} est sans biais et efficace.

Théorème Central Limite (TCL)

Théorème Central Limitenom masculin

Énonce que la somme ou la moyenne d'un grand nombre de variables aléatoires indépendantes et identiquement distribuées tend vers une distribution normale, quelle que soit la distribution d'origine des variables.

« Le Théorème Central Limite est fondamental pour l'inférence statistique car il justifie l'utilisation de la loi normale pour les moyennes d'échantillon même lorsque la population d'origine n'est pas normale. »

Même si la distribution de la variable XX dans la population n'est pas normale, le Théorème Central Limite (TCL) garantit que la distribution des moyennes d'échantillon xˉ\bar{x} tend vers une loi normale à mesure que la taille de l'échantillon nn augmente. Une règle pratique courante est d'appliquer cette approximation lorsque n>30n > 30.

lim⁡(n→∞)P((Xˉn−μ)/(σ/n)≤z)=P(Z≤z)\lim_{(n \to \infty)} P\left(\left(\bar{X}_n - \mu\right) / \left(\sigma / \sqrt{n}\right) \leq z\right) = P(Z \leq z)

Cette formule formelle du TCL montre qu'à mesure que $n$ tend vers l'infini, la variable centrée-réduite des moyennes d'échantillon tend vers une loi normale centrée réduite $N(0;1)$. **Paramètres :** - $\bar{X}_n$ : moyenne de l'échantillon de taille $n$. - $\mu$ : moyenne de la population. - $\sigma$ : écart-type de la population. - $z$ : valeur quelconque pour laquelle on calcule la probabilité. - $Z$ : variable aléatoire suivant une loi normale centrée réduite $N(0;1)$. **Interprétation :** Le TCL permet de standardiser la moyenne d'échantillon pour utiliser les tables de la loi normale, même si la distribution originale n'est pas normale, à condition que l'échantillon soit suffisamment grand.

Variance d'échantillon $s^2$

S2=1/(n−1)⋅Σ(Xi−Xˉ)2S^2 = 1 / (n - 1) \cdot \Sigma (X_{i} - \bar{X})^{2}

Cette formule définit la variance d'échantillon corrigée. **Paramètres :** - $S^2$ : variance d'échantillon. - $n$ : taille de l'échantillon. - $X_i$ : observation individuelle. - $\bar{X}$ : moyenne de l'échantillon. **Interprétation :** Contrairement à la variance de la population ($\sigma^2$) qui divise par $N$, la variance d'échantillon $S^2$ divise par $(n-1)$. Cette <mark>correction par $(n-1)$</mark> rend $S^2$ un estimateur sans biais de $\sigma^2$, ce qui est crucial pour l'estimation ponctuelle.

Loi normale et calculs de probabilités

Loi normale centrée réduite

La loi normale centrée réduite, notée Z, suit une distribution N(0; 1), ce qui signifie qu'elle a une moyenne (espérance) de 0 et une variance de 1. C'est une loi fondamentale en statistique car elle permet de standardiser n'importe quelle variable normale pour faciliter les calculs de probabilités.

Standardisation et changement de variable

Toute variable aléatoire X qui suit une loi normale N(μ; σ²) peut être transformée en une variable centrée réduite Z. Cette transformation s'effectue grâce à la formule de standardisation, qui soustrait la moyenne et divise par l'écart-type. Cela permet de ramener tout problème de probabilité à une table unique.

Z=X−μσZ = \frac{X - \mu}{\sigma}

Cette formule permet de transformer une variable aléatoire X suivant une loi normale quelconque N(μ; σ²) en une variable Z suivant une loi normale centrée réduite N(0; 1). - $Z$ : la variable aléatoire normale centrée réduite. - $X$ : la variable aléatoire normale d'origine. - $\mu$ : la moyenne (espérance) de la variable X. - $\sigma$ : l'écart-type de la variable X. **Interprétation :** Z mesure le nombre d'écarts-types qui séparent une observation X de sa moyenne. Elle est utilisée pour calculer des probabilités standardisées, car la distribution N(0;1) est tabulée.

Fonction de répartition Φ et table de la loi normale

La fonction de répartition de la loi normale centrée réduite, notée Φ(z), donne la probabilité que la variable Z soit inférieure ou égale à une valeur z, c'est-à-dire P(Z < z). La table de la loi normale fournit ces valeurs, qui représentent l'aire sous la courbe de densité à gauche de z. Il est crucial de savoir l'utiliser pour trouver les probabilités associées à des valeurs de Z.

Calculs de probabilités

Une fois la variable X standardisée en Z, les calculs de probabilités deviennent directs :

  • P(X < x) se transforme en P(Z < z) et se lit directement dans la table Φ(z).
  • P(X > x) devient P(Z > z), ce qui est égal à 1 - P(Z < z) = 1 - Φ(z).
  • P(a < X < b) est équivalent à P(z_a < Z < z_b), soit Φ(z_b) - Φ(z_a). Ces techniques sont des classiques d'examen et doivent être maîtrisées.

Symétrie et propriétés de la loi normale

La loi normale est symétrique autour de sa moyenne μ. Pour la loi centrée réduite, elle est symétrique autour de 0. Cette propriété est très utile pour les calculs : P(Z < -z) = P(Z > z) = 1 - P(Z < z). Cela signifie que la probabilité d'être en dessous d'une valeur négative est la même que la probabilité d'être au-dessus de sa valeur positive correspondante. Autre point important : P(X = x) pour une loi continue est toujours nulle.

Règle empirique

Estimation ponctuelle : propriétés des estimateurs et comparaison

Propriétés d'un bon estimateur

Trois propriétés principales permettent d'évaluer la qualité d'un estimateur : l'absence de biais, l'efficacité et la consistance. Ces critères sont souvent évalués à l'examen pour justifier le choix d'un estimateur.

Absence de biais

Un estimateur TT est dit sans biais si son espérance est égale à la vraie valeur du paramètre θ\theta qu'il est censé estimer. Le biais B(T)B(T) mesure l'écart moyen entre l'estimateur et le paramètre. L'absence de biais est une propriété fondamentale, car elle garantit que, en moyenne, l'estimateur ne sous-estime ni ne surestime le paramètre.

B(T)=E(T)−θB(T) = E(T) - \theta

Cette formule définit le biais d'un estimateur $T$. - $B(T)$ : Le biais de l'estimateur $T$. - $E(T)$ : L'espérance mathématique de l'estimateur $T$. - $\theta$ : La vraie valeur du paramètre de population à estimer. **Interprétation :** Si $B(T) = 0$, l'estimateur est sans biais. Un biais positif signifie que l'estimateur surestime en moyenne le paramètre, et un biais négatif qu'il le sous-estime.

Efficacité (variance minimale) et MSE

L'efficacité d'un estimateur sans biais est mesurée par sa variance : plus la variance est faible, plus l'estimateur est efficace, car ses estimations sont plus concentrées autour du paramètre. Pour comparer des estimateurs qui peuvent être biaisés, on utilise l'erreur quadratique moyenne (MSE, Mean Squared Error), qui combine la variance et le carré du biais.

MSE(T)=Var(T)+B(T)2\text{MSE}(T) = \text{Var}(T) + B(T)^2

Cette formule définit l'erreur quadratique moyenne d'un estimateur $T$. - $\text{MSE}(T)$ : L'erreur quadratique moyenne de l'estimateur $T$. - $\text{Var}(T)$ : La variance de l'estimateur $T$. - $B(T)$ : Le biais de l'estimateur $T$. **Interprétation :** Un MSE faible indique un estimateur de bonne qualité. Si l'estimateur est sans biais, $B(T)=0$, donc $\text{MSE}(T) = \text{Var}(T)$. Dans ce cas, on choisit l'estimateur avec la plus petite variance.

Consistance

Un estimateur est consistant s'il se rapproche de la vraie valeur du paramètre à mesure que la taille de l'échantillon (nn) augmente indéfiniment. Cette propriété est souhaitable car elle assure que, avec suffisamment de données, l'estimation convergera vers le paramètre réel.

T→n→∞θT \xrightarrow{n \to \infty} \theta

Cette notation symbolise la propriété de consistance d'un estimateur $T$. - $T$ : L'estimateur. - $\theta$ : Le paramètre de population à estimer. - $n \to \infty$ : La taille de l'échantillon tend vers l'infini. **Interprétation :** À mesure que la taille de l'échantillon augmente, la probabilité que l'estimateur $T$ soit proche du vrai paramètre $\theta$ tend vers 1. C'est une propriété asymptotique.

Estimateurs usuels et leurs distributions

Il est essentiel de connaître les estimateurs ponctuels usuels et leurs distributions d'échantillonnage, souvent dérivées des propriétés de la population ou du Théorème Central Limite. Cela permet de construire des intervalles de confiance et d'effectuer des tests statistiques.

Paramètre θ\theta Estimateur TT Espérance, variance et distribution
Moyenne, μ\mu xˉ\bar{x} E(xˉ)=μE(\bar{x}) = \mu; V(xˉ)=σ2/n\text{V}(\bar{x}) = \sigma^2/n
Proportion, π\pi P^\hat{P} E(P^)=πE(\hat{P}) = \pi; V(P^)=π(1−π)/n\text{V}(\hat{P}) = \pi(1-\pi)/n; P^≈N(π;π(1−π)/n)\hat{P} \approx N(\pi ; \pi(1-\pi)/n)
Variance, σ2\sigma^2 S2S^2 S2=1/(n−1)⋅Σ(xi−xˉ)2S^2 = 1/(n-1) \cdot \Sigma(x_i - \bar{x})^2; E(S2)=σ2E(S^2) = \sigma^2; (n−1)S2/σ2∼χ2(n−1 dl)(n-1)S^2/\sigma^2 \sim \chi^2(n-1\text{ dl})

L'estimateur de la proportion P^\hat{P} est assimilable à une moyenne de variables de Bernoulli, et donc sa distribution d'échantillonnage tend vers une loi Normale pour nn suffisamment grand, en vertu du Théorème Central Limite. La correction (n−1)(n-1) pour la variance échantillon S2S^2 garantit qu'il est un estimateur sans biais de σ2\sigma^2. La quantité (n−1)S2/σ2(n-1)S^2/\sigma^2 suit une loi du χ2\chi^2 (khi-deux) à (n−1)(n-1) degrés de liberté, un résultat fondamental pour l'inférence sur la variance.

Comparaison d'estimateurs par variance

Lorsque plusieurs estimateurs sont sans biais, le critère de choix est l'efficacité, c'est-à-dire l'estimateur ayant la plus petite variance. Il est crucial, lors d'un examen, de bien détailler le calcul de l'espérance et de la variance de chaque estimateur, comme illustré dans l'exemple de comparaison de T1=xˉT_1 = \bar{x} et T2=(x1+x2)/2T_2 = (x_1 + x_2)/2 pour la moyenne μ\mu.

Var(T1)=σ2/ncontreVar(T2)=2σ2/nsi T2 ne prenait que 2 observations\text{Var}(T_1) = \sigma^2 / n \quad \text{contre} \quad \text{Var}(T_2) = 2\sigma^2 / n \quad \text{si } T_2 \text{ ne prenait que 2 observations}

Cette formule compare la variance de deux estimateurs de la moyenne, $\bar{x}$ et un estimateur basé sur seulement deux observations. - $\text{Var}(T_1) = \sigma^2 / n$ : Variance de la moyenne échantillon $T_1 = \bar{x}$, basée sur $n$ observations. - $\text{Var}(T_2) = 2\sigma^2 / n$ : Variance d'un estimateur $T_2$ prenant uniquement 2 observations (exemple simplifié, pour $n=4$, il serait $\sigma^2/2$). **Interprétation :** Cet exemple montre qu'un estimateur utilisant plus d'informations (plus d'observations, comme $\bar{x}$) aura généralement une variance plus faible, et sera donc plus efficace.

Teste ta compréhension

1 / 10

La population désigne l'ensemble étudié. Vrai ou Faux ?

Texte à trous

  • Une statistique d'échantillon est une fonction des observations de l'échantillon et est associée à une distribution de probabilité appelée distribution d'échantillon.
  • Un bon échantillonnage doit être aléatoire, représentatif et de taille adaptée.
  • Le biais $B(T)$ mesure l'écart entre l'espérance de l'estimateur et la vraie valeur du paramètre.
  • Le MSE (Mean Squared Error) combine variance et biais.
  • Les variables aléatoires indépendantes et identiquement distribuées sont désignées par l'acronyme i.i.d..
  • Un estimateur consistant se rapproche de la vraie valeur du paramètre à mesure que la taille de l'échantillon augmente.
  • Le terme $\sigma/\sqrt{n}$ est appelé l'erreur-type.

Continue avec ces leçons