KlarIA
📐 Maths (enseignement scientifique)1ereCours

Statistiques à deux variables

📖

Cours

Statistiques à deux variables

En seconde, on a appris à décrire un caractère à la fois : la moyenne des notes d'une classe, la médiane des salaires, l'étendue des températures. Mais les questions intéressantes portent presque toujours sur deux caractères en même temps : les habitants des villes se déplacent-ils autrement que ceux des campagnes ? La concentration de CO₂ dans l'air augmente-t-elle régulièrement avec le temps ? Un pays plus riche est-il un pays où l'on vit plus longtemps ?

Ce chapitre donne les outils pour croiser deux caractères : un tableau croisé et ses diagrammes quand les caractères sont qualitatifs, un nuage de points et une droite d'ajustement quand ils sont quantitatifs. Les données étudiées sont réelles ou réalistes, comme celles publiées par l'Insee, l'Ined, le Giec ou data.gouv.fr.

1. Croiser deux caractères qualitatifs

1.1 Le tableau croisé d'effectifs

Un caractère est qualitatif quand ses valeurs, appelées modalités, ne sont pas des nombres : le genre, le mode de transport, la mention au bac.

Exemple. On interroge 400400 lycéens sur leur lieu d'habitation (ville ou périphérie) et sur leur mode de transport principal pour venir au lycée. Les réponses sont rangées dans un tableau croisé d'effectifs :

Marche ou véloTransports en communVoitureTotal
Ville10810884844848240240
Périphérie242464647272160160
Total132132148148120120400400

Chaque case intérieure compte les lycéens qui ont les deux modalités à la fois : 8484 lycéens habitent en ville et viennent en transports en commun. La dernière ligne et la dernière colonne, appelées marges, donnent les effectifs de chaque caractère pris séparément ; la case en bas à droite est l'effectif total.

Pour vérifier un tableau, on contrôle que chaque ligne et chaque colonne s'additionnent bien jusqu'à sa marge : 108+84+48=240108 + 84 + 48 = 240 et 108+24=132108 + 24 = 132.

1.2 Fréquences : la question « parmi qui ? »

Une même case peut se lire de trois façons, selon la population de référence choisie.

  • Fréquence globale : 84400=0,21\dfrac{84}{400} = 0{,}21, soit 21%21\,\% des lycéens interrogés habitent en ville et prennent les transports en commun.
  • Fréquence conditionnelle en ligne : 84240=0,35\dfrac{84}{240} = 0{,}35, soit 35%35\,\% des citadins prennent les transports en commun.
  • Fréquence conditionnelle en colonne : 841480,57\dfrac{84}{148} \approx 0{,}57, soit 57%57\,\% des usagers des transports en commun habitent en ville.

Le numérateur est toujours la case ; c'est le dénominateur qui change : le total général, le total de la ligne ou le total de la colonne. On retrouve exactement la distinction entre P(AB)P(A \cap B), PA(B)P_A(B) et PB(A)P_B(A) du chapitre de probabilités.

Pour comparer les deux groupes d'habitants, on calcule le profil de chaque ligne, c'est-à-dire ses fréquences conditionnelles :

Marche ou véloTransports en communVoitureTotal
Ville45%45\,\%35%35\,\%20%20\,\%100%100\,\%
Périphérie15%15\,\%40%40\,\%45%45\,\%100%100\,\%

🎯 Le piège classique. Dans le tableau d'effectifs, 8484 citadins prennent les transports en commun contre 6464 habitants de la périphérie : on serait tenté de dire que les citadins les utilisent davantage. Mais les deux groupes n'ont pas la même taille (240240 contre 160160). En proportion, c'est l'inverse : 35%35\,\% contre 40%40\,\%. Pour comparer des groupes de tailles différentes, on compare toujours des fréquences, jamais des effectifs.


1.3 Représenter le croisement

Trois diagrammes sont au programme.

  • Le diagramme en barres groupées représente les effectifs : pour chaque lieu d'habitation, trois barres côte à côte, une par mode de transport. Il montre les quantités, mais rend la comparaison des profils difficile quand les groupes n'ont pas la même taille.
  • Le diagramme en barres empilées à 100%100\,\% représente les profils : une barre par groupe, découpée selon les fréquences conditionnelles. C'est le meilleur outil pour comparer des répartitions.
  • Le diagramme circulaire représente la répartition d'un seul groupe : un disque pour la ville, un autre pour la périphérie, chaque secteur ayant un angle proportionnel à la fréquence (35%35\,\% de 360°360° donne 126°126°).
Barres groupées et barres empilées à 100 %

Pour lire un diagramme, on commence toujours par les axes : que représente la hauteur des barres, des effectifs ou des pourcentages ? Quelle est l'unité de graduation ? Une barre deux fois plus haute ne signifie « deux fois plus » que si l'axe part de 00.

2. Croiser deux caractères quantitatifs

2.1 Série à deux variables et nuage de points

Un caractère est quantitatif quand ses valeurs sont des nombres : une année, une température, un revenu. Une série statistique à deux variables est une liste de couples (xi;yi)(x_i\,;\,y_i) : à chaque individu (ou à chaque date) correspondent deux nombres.

Exemple. Concentration moyenne de dioxyde de carbone dans l'atmosphère, mesurée à l'observatoire de Mauna Loa (Hawaï), en parties par million (ppm). Pour simplifier les calculs, on note xx le rang de l'année à partir de 19901990 et yy la concentration arrondie à l'unité.

Année19901990199519952000200020052005201020102015201520202020
Rang xix_i005510101515202025253030
Concentration yiy_i (ppm)354354361361370370380380390390401401414414

Le nuage de points est l'ensemble des points Mi(xi;yi)M_i(x_i\,;\,y_i) placés dans un repère. On ne relie pas les points : chacun est une mesure. La première chose à faire est de décrire la forme du nuage : ici, les points sont presque alignés le long d'une droite qui monte, la concentration augmente régulièrement avec le temps.

Nuage de points, point moyen et ajustement affine

Quand l'un des caractères est le temps, on parle de série chronologique. Choisir comme abscisse le rang de l'année (0,5,10,0, 5, 10, \ldots) plutôt que l'année elle-même (1990,1995,1990, 1995, \ldots) évite de manipuler de grands nombres sans rien changer à la forme du nuage.

2.2 Le point moyen

Le point moyen du nuage est le point G(xˉ;yˉ)G(\bar{x}\,;\,\bar{y}) dont l'abscisse est la moyenne des xix_i et l'ordonnée la moyenne des yiy_i :

xˉ=x1+x2++xnnyˉ=y1+y2++ynn\bar{x} = \frac{x_1 + x_2 + \cdots + x_n}{n} \qquad \bar{y} = \frac{y_1 + y_2 + \cdots + y_n}{n}

Pour la série du CO₂ :

xˉ=0+5+10+15+20+25+307=1057=15yˉ=354+361+370+380+390+401+4147=26707381,4\bar{x} = \frac{0 + 5 + 10 + 15 + 20 + 25 + 30}{7} = \frac{105}{7} = 15 \qquad \bar{y} = \frac{354 + 361 + 370 + 380 + 390 + 401 + 414}{7} = \frac{2670}{7} \approx 381{,}4

Donc G(15;381,4)G(15\,;\,381{,}4). Le point moyen est le « centre de gravité » du nuage : il ne coïncide généralement avec aucun point de la série, mais il en résume la position. Toutes les droites d'ajustement usuelles passent par lui.

2.3 Ajustement affine

Quand le nuage est allongé autour d'une droite, on peut remplacer les points par une droite d'équation y=ax+by = ax + b : c'est un ajustement affine. Cette droite est un modèle qui décrit approximativement le lien entre xx et yy et permet de faire des estimations. Si le nuage est en forme de courbe ou sans forme particulière, un ajustement affine n'a pas de sens.

Trois nuages : quand ajuster par une droite

Le programme propose trois façons d'obtenir cette droite ; aucune théorie n'est attendue, il faut savoir les utiliser.

Ajustement au jugé. On trace à la règle une droite qui passe par GG et laisse à peu près autant de points de chaque côté, aussi près d'eux que possible. Pour obtenir son équation, on lit les coordonnées de deux points de la droite (pas forcément des points du nuage) et l'on calcule a=yByAxBxAa = \dfrac{y_B - y_A}{x_B - x_A}, puis bb à l'aide de l'un des deux points.

Droite de Mayer. On partage le nuage en deux sous-nuages de tailles voisines, en suivant l'ordre des abscisses ; on calcule le point moyen de chacun, G1G_1 et G2G_2 ; la droite de Mayer est la droite (G1G2)(G_1G_2). Pour le CO₂, avec les quatre premiers points puis les trois derniers :

G1(0+5+10+154;354+361+370+3804)=G1(7,5;366,25)G2(20+25+303;390+401+4143)G2(25;401,7)G_1\left(\frac{0 + 5 + 10 + 15}{4}\,;\,\frac{354 + 361 + 370 + 380}{4}\right) = G_1(7{,}5\,;\,366{,}25) \qquad G_2\left(\frac{20 + 25 + 30}{3}\,;\,\frac{390 + 401 + 414}{3}\right) \approx G_2(25\,;\,401{,}7)

a=401,7366,25257,52,02b=366,252,02×7,5351,1a = \frac{401{,}7 - 366{,}25}{25 - 7{,}5} \approx 2{,}02 \qquad b = 366{,}25 - 2{,}02 \times 7{,}5 \approx 351{,}1

La droite de Mayer a pour équation y2,02x+351,1y \approx 2{,}02x + 351{,}1. Elle passe par GG, qui est toujours situé sur le segment [G1G2][G_1G_2].

Construction de la droite de Mayer

Droite des moindres carrés. C'est l'ajustement que donnent la calculatrice (mode statistiques à deux variables, « régression linéaire ») et le tableur (courbe de tendance). Pour le CO₂, on obtient y=2x+351,4y = 2x + 351{,}4 (coefficients arrondis). On n'a pas à savoir comment elle est calculée, seulement à saisir correctement les deux listes et à lire aa et bb.

Les trois méthodes donnent des droites très proches : ici, une pente d'environ 22 ppm par an. Le coefficient directeur aa a toujours une interprétation concrète : c'est l'augmentation moyenne de yy quand xx augmente de 11. Dire « la concentration augmente d'environ 22 ppm par an » est une lecture attendue.


🎯 Savoir présenter un ajustement. On précise toujours : la méthode utilisée (« au jugé », « droite de Mayer », « obtenue à la calculatrice »), l'équation avec des coefficients arrondis de façon raisonnable, et ce que représentent xx et yy avec leurs unités. Une équation sans contexte ne vaut rien.


2.4 Interpoler, extrapoler

Une fois l'équation obtenue, on l'utilise pour estimer des valeurs inconnues.

  • Interpolation : estimer une valeur entre deux données connues. En 20082008, x=18x = 18 et y=2×18+351,4=387,4y = 2 \times 18 + 351{,}4 = 387{,}4 : d'après le modèle, la concentration valait environ 387387 ppm. La valeur réellement mesurée est 386386 ppm : l'estimation est excellente.
  • Extrapolation : estimer une valeur en dehors de la plage des données, le plus souvent dans le futur. En 20302030, x=40x = 40 et y=2×40+351,4=431,4y = 2 \times 40 + 351{,}4 = 431{,}4 ppm.
  • Problème de seuil : à partir de quelle année dépasserait-on 450450 ppm ? On résout 2x+351,4=4502x + 351{,}4 = 450, soit x=98,62=49,3x = \dfrac{98{,}6}{2} = 49{,}3. Le seuil serait franchi au cours de la 50e50^{\text{e}} année après 19901990, donc vers 20402040.

L'interpolation est en général fiable, car le modèle est utilisé là où il a été construit. L'extrapolation suppose que la tendance se poursuit, ce qui n'est jamais garanti : plus on s'éloigne des données, moins l'estimation est sûre. Pour le CO₂, la valeur mesurée en 20232023 est 421421 ppm alors que le modèle donne 2×33+351,44172 \times 33 + 351{,}4 \approx 417 ppm : la croissance réelle s'accélère, la droite sous-estime déjà légèrement.

2.5 Une droite décrit, elle n'explique pas

Un ajustement met en évidence un lien statistique entre deux caractères, pas une cause. Dans une station balnéaire, les ventes de glaces et le nombre de noyades sont liés par une belle droite croissante : ce n'est pas la glace qui noie, c'est la chaleur qui fait à la fois vendre des glaces et remplir les plages. Face à un nuage bien aligné, la bonne question est toujours : quel mécanisme relie les deux caractères, et existe-t-il un troisième facteur caché ?

3. Avec un tableur

Le programme demande de savoir utiliser un tableur pour représenter les données et obtenir l'ajustement. Avec les rangs en colonne A (cellules A2 à A8) et les concentrations en colonne B :

ObjectifCe que l'on fait
Coordonnées du point moyen=MOYENNE(A2:A8) et =MOYENNE(B2:B8)
Nuage de pointsSélectionner A1:B8, insérer un graphique de type « nuage de points (XY) »
Droite des moindres carrésClic droit sur le nuage, « ajouter une courbe de tendance », type linéaire, cocher « afficher l'équation »
Coefficients sans le graphique=PENTE(B2:B8;A2:A8) pour aa et =ORDONNEE.ORIGINE(B2:B8;A2:A8) pour bb
Estimation pour x=40x = 40=2*40+351,4, ou directement =PREVISION(40;B2:B8;A2:A8)

Attention à l'ordre des arguments : les fonctions PENTE et ORDONNEE.ORIGINE prennent d'abord les yy, puis les xx.

4. Exemple résolu pas à pas

Énoncé. Le tableau donne la population d'une commune, en milliers d'habitants, tous les deux ans.

Année2014201420162016201820182020202020222022
Rang xix_i0022446688
Population yiy_i (milliers)12,412{,}412,912{,}913,313{,}313,913{,}914,414{,}4

a) Représenter le nuage de points et calculer les coordonnées du point moyen. b) La calculatrice donne la droite des moindres carrés y=0,25x+12,38y = 0{,}25x + 12{,}38. Vérifier qu'elle passe par GG et interpréter le coefficient 0,250{,}25. c) Estimer la population en 20302030. d) À partir de quelle année la population dépasserait-elle 1500015\,000 habitants ?

a) Les points sont presque alignés le long d'une droite croissante : un ajustement affine est justifié.

xˉ=0+2+4+6+85=4yˉ=12,4+12,9+13,3+13,9+14,45=66,95=13,38\bar{x} = \frac{0 + 2 + 4 + 6 + 8}{5} = 4 \qquad \bar{y} = \frac{12{,}4 + 12{,}9 + 13{,}3 + 13{,}9 + 14{,}4}{5} = \frac{66{,}9}{5} = 13{,}38

Le point moyen est G(4;13,38)G(4\,;\,13{,}38).

rang xpopulation (milliers)012345678910111213141516171212,51313,51414,51515,51616,517dG2030
Nuage de points de la population (en milliers) selon le rang de l'année, point moyen GG et droite d'ajustement y=0,25x+12,38y = 0{,}25x + 12{,}38. Le point de 20302030 (x=16x = 16) est obtenu par extrapolation.

b) Pour x=4x = 4 : 0,25×4+12,38=13,38=yˉ0{,}25 \times 4 + 12{,}38 = 13{,}38 = \bar{y}. La droite passe bien par GG. Le coefficient directeur 0,250{,}25 signifie que, d'après le modèle, la population augmente en moyenne de 0,250{,}25 millier, soit 250250 habitants, par an.

c) En 20302030, x=20302014=16x = 2030 - 2014 = 16 et y=0,25×16+12,38=16,38y = 0{,}25 \times 16 + 12{,}38 = 16{,}38. Le modèle prévoit environ 1640016\,400 habitants. C'est une extrapolation à huit ans des dernières données : une estimation, pas une certitude.

d) On cherche xx tel que 0,25x+12,38150{,}25x + 12{,}38 \geqslant 15, soit 0,25x2,620{,}25x \geqslant 2{,}62, donc x10,48x \geqslant 10{,}48. Comme xx est un nombre entier d'années, le seuil est franchi pour x=11x = 11, c'est-à-dire en 2014+11=20252014 + 11 = 2025. Vérification : 0,25×10+12,38=14,88<150{,}25 \times 10 + 12{,}38 = 14{,}88 < 15 et 0,25×11+12,38=15,13>150{,}25 \times 11 + 12{,}38 = 15{,}13 > 15.


🎯 Rédiger un problème de seuil. Trois étapes attendues : écrire l'inéquation à partir du modèle, la résoudre, puis revenir au contexte (année entière, unité, phrase de conclusion). Oublier la dernière étape coûte des points même quand le calcul est juste.


📌 À retenir

  1. Un tableau croisé d'effectifs croise deux caractères qualitatifs ; ses marges donnent les effectifs de chaque caractère. Une case se lit avec trois dénominateurs possibles : le total général (fréquence globale), le total de la ligne ou de la colonne (fréquences conditionnelles).
  2. Pour comparer des groupes de tailles différentes, on compare des fréquences, jamais des effectifs. Le diagramme en barres empilées à 100%100\,\% est fait pour cela.
  3. Deux caractères quantitatifs se représentent par un nuage de points ; le point moyen est G(xˉ;yˉ)G(\bar{x}\,;\,\bar{y}).
  4. Si le nuage est allongé, un ajustement affine y=ax+by = ax + b le résume : au jugé, par la droite de Mayer (G1G2)(G_1G_2) ou par la calculatrice (moindres carrés). Toutes passent par GG ; aa est la variation moyenne de yy quand xx augmente de 11.
  5. Interpoler (entre les données) est fiable ; extrapoler (au-delà) suppose que la tendance continue. Un problème de seuil se résout par une inéquation, puis on revient au contexte.
  6. Un lien statistique n'est pas une cause : toujours chercher le mécanisme ou le facteur caché.

Révise ce chapitre avec KlarIA

Tuteur qui t'explique pas à pas, quiz pour t'entraîner, flashcards pour mémoriser. Gratuit.

Créer mon compte gratuitement