L’essentiel
Définitions et propriétés du cours, pour s’y retrouver
Cette page rassemble les énoncés du cours, sans les activités qui leur donnent du sens, sans les justifications, les exemples ni les méthodes vues en classe. Connaître ces énoncés ne suffit pas : l’essentiel, c’est de savoir les utiliser, et cela s’apprend avec les exemples et les exercices.
Sers-t’en pour retrouver un énoncé ou vérifier que tu peux le redire sans regarder, puis retourne au cours (lien « dans le cours » sous chaque encadré) et aux exercices.
Chapitre 1 — Deux variables, un nuage de points
Réactiver : une variable, une moyenne
Définition 1.1 — moyenne
La moyenne d’une série de \(N\) valeurs \(x_{1}, x_{2}, \ldots, x_{N}\) est
\[ \overline{x} = \frac{x_{1} + x_{2} + \ldots + x_{N}}{N}. \]
C’est la valeur qui résume la série : si toutes les valeurs étaient identiques, ce serait celle-là.
Une série statistique à deux variables
Définition 1.2 — série statistique à deux variables
On étudie une population (ici : des pays). Sur chaque individu de cette population, on relève deux caractères chiffrés, notés \(x\) et \(y\). À chaque individu correspond alors un couple \((x_{i} ; y_{i})\). L’ensemble de ces couples est une série statistique à deux variables.
Le nuage de points
Définition 1.3 — nuage de points
Le nuage de points d’une série \((x_{i} ; y_{i})\) est l’ensemble des points de coordonnées \((x_{i} ; y_{i})\) placés dans un repère. Chaque point représente un individu. On ne relie pas les points : ils ne forment pas une courbe, mais un semis que l’on interprète globalement.
Le point moyen
Définition 1.4 — point moyen
Le point moyen d’une série à deux variables est le point \(G\) de coordonnées
\[ G(\overline{x} ; \overline{y}), \]
où \(\overline{x}\) et \(\overline{y}\) sont les moyennes des deux variables. Il marque le centre du nuage : c’est le « pays moyen » de la série.
Chapitre 2 — Ajuster un nuage par une droite
Le point moyen, pivot de l’ajustement
Propriété 2.1 — le point moyen est sur la droite
Toute droite d’ajustement raisonnable — qu’on la construise par la méthode de Mayer ou par celle des moindres carrés — passe par le point moyen \(G\). C’est le point d’équilibre du nuage.
La droite de Mayer
Définition 2.1 — droite de Mayer
On range les points par abscisse croissante et on les partage en deux sous-séries de même taille. On calcule le point moyen \(G_{1}\) de la première et \(G_{2}\) de la seconde. La droite de Mayer est la droite \((G_{1} G_{2})\).
Faire parler les écarts à la moyenne
Définition 2.2 — covariance
La covariance de \(x\) et \(y\) est la moyenne des produits des écarts à leurs moyennes :
\[ \text{cov}(x, y) = \frac{1}{N} \sum (x_{i} - \overline{x})(y_{i} - \overline{y}). \]
Son signe donne le sens du lien : positive si \(x\) et \(y\) augmentent ensemble, négative s’ils varient en sens contraire, proche de \(0\) s’il n’y a pas de tendance nette.
La méthode des moindres carrés
Définition 2.3 — droite de régression (moindres carrés)
La droite de régression par la méthode des moindres carrés est l’unique droite \(y = a x + b\) qui rend la plus petite possible la somme des carrés des résidus. On élève les écarts au carré pour que les écarts positifs et négatifs ne se compensent pas, et pour pénaliser les gros écarts. Cette droite passe elle aussi par le point moyen \(G\).
Propriété 2.2 — pente de la droite de régression
\[ a = \frac{\text{cov}(x, y)}{\text{variance}(x)} = \frac{\sum (x_{i} - \overline{x})(y_{i} - \overline{y})}{\sum (x_{i} - \overline{x})^{2}}, \quad \quad b = \overline{y} - a \overline{x}. \]
Au numérateur, la co-variation de \(x\) et \(y\) (leur tendance à bouger ensemble, que tu viens de mesurer) ; au dénominateur, l’étalement de \(x\) seul. La pente dit donc « de combien \(y\) bouge quand \(x\) bouge ». Et comme \(b = \overline{y} - a \overline{x}\), la droite passe par le point moyen \(G\).
Propriété 2.3 — formules de calcul
\[ \text{variance}(x) = \frac{1}{N} \sum x_{i}^{2} - (\overline{x})^{2} \quad \quad \text{cov}(x, y) = \frac{1}{N} \sum x_{i} y_{i} - \overline{x} \ \overline{y}. \]
En mots : moyenne des carrés \(-\) carré de la moyenne pour la variance ; moyenne des produits \(-\) produit des moyennes pour la covariance. L’écart-type \(\sigma_{x} = \sqrt{\text{variance}(x)}\) mesure la dispersion de \(x\).
Chapitre 3 — Mesurer la liaison : le coefficient de corrélation
Un nombre entre \(-1\) et \(1\)
Définition 3.1 — coefficient de corrélation linéaire
Le coefficient de corrélation linéaire, noté \(r\), est un nombre toujours compris entre \(-1\) et \(1\) qui mesure à quel point les points d’un nuage sont proches d’une droite.
- le signe de \(r\) donne le sens : \(r > 0\) pour un nuage croissant, \(r < 0\) pour un nuage décroissant ;
- \(|r|\) proche de 1 : les points sont presque alignés (lien fort) ; \(|r|\) proche de 0 : aucun alignement (lien linéaire faible ou nul).
On le calcule par \(r = \frac{\text{covariance}(x, y)}{\sigma_{x} \sigma_{y}}\), mais en pratique c’est la calculatrice qui le donne, en même temps que la droite de régression.
Chapitre 4 — Utiliser un ajustement, et le critiquer
Prévoir : interpolation et extrapolation
Définition 4.1 — interpolation, extrapolation
À partir de la droite de régression \(y = a x + b\), on peut estimer un \(y\) pour une valeur de \(x\) non mesurée.
- Interpoler, c’est estimer à l’intérieur de l’intervalle des données observées : assez sûr.
- Extrapoler, c’est estimer à l’extérieur (avant la première donnée ou après la dernière) : beaucoup plus risqué.
Un vrai document à critiquer
Propriété 4.1 — quand la corrélation devient une cause
Un simple nuage ne prouve pas la causalité (chapitre 3). Mais un testing est une expérience : comme les deux CV sont identiques et que seule l’origine change, il n’y a plus de variable cachée possible. La différence observée peut alors être attribuée à l’origine. C’est la force d’une expérience bien construite sur une simple observation.