{
 "meta": {
   "fichier": "context_discipline_statistiques.json",
   "projet": "PrivateTeacher",
   "version": "1.0",
   "date": "2026-02-26",
   "perimetre": "Logique épistémique propre aux statistiques. Ne couvre pas le ton général, les attentes facultaires, ni le niveau de maturité conceptuelle."
 },

 "epistemologie": {
   "nature_de_la_connaissance": "Les statistiques produisent des inférences probabilistes sur des populations à partir d'échantillons. Toute conclusion statistique est assortie d'une incertitude quantifiée — elle ne constitue pas une certitude.",
   "mode_de_validation": "La validité d'une inférence statistique dépend de la vérification des hypothèses du modèle utilisé. Un résultat numériquement correct produit par un modèle inadapté est une conclusion invalide.",
   "rapport_aux_modeles": "Un modèle statistique est une représentation probabiliste de la réalité. Il repose sur des hypothèses explicites (normalité, indépendance, homoscédasticité) dont la violation change la nature des conclusions."
 },

 "structure_du_raisonnement": {
   "progression_logique": "Du problème empirique vers la décision : formulation de la question → choix du modèle → vérification des hypothèses → estimation ou test → interprétation en langage non technique.",
   "role_des_hypotheses_du_modele": "Les hypothèses statistiques (H₀, H₁) et les hypothèses du modèle (normalité, indépendance) sont de nature différente et ne doivent pas être confondues. Le contenu les distingue explicitement.",
   "interpretation_vs_calcul": "Le calcul d'une statistique (p-value, R², intervalle de confiance) n'est pas une fin en soi. L'interprétation en termes de la question initiale est obligatoire.",
   "inference_vs_description": "La statistique descriptive décrit un échantillon. La statistique inférentielle généralise à une population. Le contenu précise toujours dans quel registre il opère."
 },

 "langage_statistique": {
   "p_value": "La p-value est la probabilité d'observer un résultat au moins aussi extrême sous H₀. Elle n'est pas la probabilité que H₀ soit vraie. Cette distinction est systématiquement rappelée.",
   "significativite": "Significatif statistiquement ne signifie pas significatif pratiquement. La taille d'effet doit accompagner le test d'hypothèse lorsque c'est pertinent.",
   "intervalle_de_confiance": "Un intervalle de confiance à 95 % ne signifie pas que le paramètre a 95 % de chance d'être dans l'intervalle. La formulation correcte est explicitée à chaque introduction du concept.",
   "notation": "Les paramètres de population sont notés en lettres grecques (μ, σ, β). Les estimateurs d'échantillon sont notés en lettres latines (x̄, s, b). Cette convention est respectée systématiquement."
 },

 "pieges_epistemiques_frequents": [
   "Interpréter la p-value comme la probabilité que H₀ soit vraie",
   "Confondre absence de preuve et preuve d'absence (test non significatif ≠ H₀ vraie)",
   "Appliquer un test paramétrique sans vérifier ses hypothèses",
   "Confondre corrélation et causalité",
   "Généraliser à une population à partir d'un échantillon non représentatif"
 ]
}

HEG Genève

Cours privés de statistiques pour le Bachelor HEG Genève (HES-SO) : comprendre les concepts, appliquer la méthode et se préparer aux examens de chaque module.

Sciences Infirmières

Des cours privés de statistiques pour les étudiants en sciences infirmières à l'IUFRS Lausanne : Interpréter les sorties STATA et réussir sont master MScSI.

Comment choisir la mesure d'association adaptée au type de variable

Illustration pédagogique PrivateTeacher: une table des valeurs brutes et un profil des rangs

Comment choisir la mesure d'association adaptée au type de variable

Pearson, Spearman ou Kendall : le bon coefficient selon le type de variables et la forme de la relation.

Présentation — choisir la mesure d'association adaptée

Le choix d'une mesure d'association dépend du type de variables en présence et de la forme de la relation entre elles. Pour des variables quantitatives à relation linéaire, Pearson est adapté. Pour des données ordinales ou une relation monotone non linéaire, Spearman ou Kendall prennent le relais. Lorsque l'une des variables est dichotomique, la bisériale de point ou phi sont utilisés. L'analyse commence par un diagramme de dispersion, qui oriente ce choix avant tout calcul.

Pourquoi savoir choisir la bonne mesure d'association

Appliquer Pearson à des données ordinales, ou ignorer la non-linéarité d'une relation, produit une mesure invalide — numériquement calculable, mais interprétée à tort. Les questions de recherche en psychologie exigent de répondre d'abord à deux questions : quels types de variables ai-je ? La relation est-elle linéaire ou seulement monotone ? Ces deux décisions déterminent le coefficient adapté. Une erreur à ce stade invalide l'ensemble de la conclusion, même si le calcul est impeccable.

A qui s'adresse ce document

Ce contenu s'adresse aux étudiants du Bachelor en Psychologie d'UniDistance FernUni Schweiz. La psychologie scientifique formule des hypothèses sur des liens entre variables — comportement, émotion, cognition, santé — et chaque hypothèse de ce type requiert un coefficient d'association adapté pour être testée. Le choix du bon coefficient est une compétence d'examen explicitement évaluée, avec des résultats à rapporter selon les normes APA 7e édition. Les modules de méthodes en font un prérequis à toute analyse bivariée.

Prérequis

Ce sujet est abordé au niveau Bachelor 1. Aucune exposition préalable aux mesures d'association n'est supposée. Les prérequis sont : la connaissance des statistiques descriptives de base (moyenne, écart-type), la capacité à lire un tableau de données et à distinguer une variable quantitative d'une variable ordinale. La notion de distribution normale est utile pour comprendre les conditions d'application de Pearson, mais elle est rappelée dans le contenu. Aucune maîtrise préalable de JASP n'est requise.

Questions courantes FAQ

Comment choisir entre Pearson, Spearman et Kendall ?

Le choix dépend de deux critères. Premier critère : le type de variables. Si les deux sont quantitatives, Pearson est candidat. Si l'une est ordinale, Spearman ou Kendall s'imposent. Deuxième critère : la forme de la relation, lue sur le diagramme de dispersion. Si la relation est linéaire et les conditions d'application respectées, Pearson est retenu. Si elle est monotone mais non linéaire, Spearman ou Kendall remplacent Pearson.

Quelle est la différence entre covariance et corrélation de Pearson ?

La covariance mesure comment deux variables varient ensemble, mais sa valeur dépend des unités de mesure et n'est pas directement interprétable. La corrélation de Pearson r standardise la covariance en la divisant par le produit des écarts-types des deux variables. Le résultat est toujours compris entre −1 et +1, interprétable quelle que soit l'unité : −1 indique une relation linéaire négative parfaite, +1 une relation positive parfaite, 0 l'absence de relation linéaire.

Pourquoi faut-il toujours commencer par un diagramme de dispersion ?

Le diagramme de dispersion révèle la forme de la relation avant tout calcul. Si la relation est curvilinéaire (en U, par exemple), un coefficient de Pearson proche de 0 n'indique pas l'absence de lien, mais simplement que le lien n'est pas linéaire. Lire le graphique en premier évite d'appliquer un coefficient inadapté à la structure des données, ce qui produirait une conclusion invalide. C'est l'étape de décision non négociable de l'analyse bivariée.

Quand utilise-t-on Kendall plutôt que Spearman ?

Les deux coefficients s'appliquent dans les mêmes situations (données ordinales ou relation monotone non linéaire). Kendall repose sur le décompte de paires concordantes et discordantes, ce qui le rend plus robuste avec les petits échantillons et les données comportant des ex aequo. Spearman calcule r de Pearson sur les rangs et est plus répandu dans la littérature. En pratique, les deux sont souvent calculés en parallèle pour vérifier la convergence des conclusions.

Une corrélation forte prouve-t-elle une causalité ?

Non. Une corrélation forte indique que deux variables covarient, pas que l'une cause l'autre. Une troisième variable non mesurée (variable confondante) peut expliquer la covariation observée. Établir la causalité requiert un plan expérimental avec manipulation de la variable indépendante et contrôle des variables parasites. Cette confusion entre corrélation et causalité est l'une des erreurs épistémiques les plus fréquentes en psychologie et une cible explicite des examens d'UniDistance.

Introduction Regression Logistique

Illustration pédagogique PrivateTeacher montrant la transition de données entre deux catégories caractéristique du modèle logistique

Faire une régression logistique sur une variable dichotomique: Introduction

Apprends à utiliser la fonction logistique pour modéliser une transition entre deux états.

Présentation de la régression logistique

Les êtres humains sommes parfois sujets à des changements d’humeur. Si nous recevons une bonne nouvelle par exemple, cela peut transformer notre journée et nous faire passer d’un état morose à un état joyeux et enjoué. Dans cet exemple, le changement de notre état d'humeur est immédiat, mais on peut aussi changer d'humeur progressivement. Si on s’intéresse à savoir comment les êtres humaine change d'humeur en fonctions du nombre de bonne nouvelles qu'il recoivent. La fonction logistique présente alors un modèle aproprié. On placera alors sur l'axe des Y les deux modalité de notre humeurs possible (morose et joyeux) On parle alors de variables dichotomiques. On place ensuite sur l'axe des X la quantité de bonne nouvelle que l'on est susecptible de recevoir. La fonction logistique est un modèle qui permet d'étudier une transition entre un état morose et un état joyeux en fonction du nombre de bonnes nouvelles recues

Pourquoi utiliser la régression logistique

On utilise les régressions logistiques pour comprendre une transition non linéaire entre deux modalités d’une variable dichotomique. Le modèle que l'on utilise dans ce type de cas de figure est donc une équation logistique. La forme de a courbe logistique se prête bien pour modéliser des situations dans lesquelle une transition se produit entre deux états limité par des valeur fixe: pas plus haut qu'une valeur plafond et pas plus bas qu'une valeur plancher. Cette équation possède également une propriété intéressante: on peut la linéariser facilement. On peut donc réaliser une regression linéaire pour trouver les paramètres de la droite correspondante, puis convertir ces paramètres (ceux de la fonction linéaire) en paramètre de la fonction logistique. On bénéficie ainsi de tous les avantages: Une équation qui nous permet de modéliser une transition progressive entre deux états ET l'utilisation de la méthode robuste et bien connue que l'on connait pour les régressions linéaires.

A qui s'adresse ce document

Ce document s’adresse aux étudiants-es qui rencontre la fonction logistique pour la première fois et qui doivent savoir lire et interpréter les résultats d’une régression logistique. Les documents proposé sur cette page constitue une introduction générale et n'est donc pas spécifique à un logiciel en particulier. Elle permettra donc de comprendre et interpréter les résultats donnée par tous les logiciel de statistiques: R, STATA ou SPSS. Le cours contient également les détails du processus de linéarisation de l'équation logistique. Ce document sera donc utile à toute personne cherchant à perfectionner ses connaissances dans l’utilisation des modèles avancés tels que les régressions logistiques multinomiales. 

Prérequis

Le document suppose une première exposition à la régression linéaire simple. Les concepts suivants doivent être connus : significativité statistique d'un coefficient, résidu d'un modèle, coefficient de détermination R². La régression logistique en est une extension directe : le passage d'une variable continue à une variable dichotomique introduit la transformation logit, mais la logique d'interprétation des coefficients reste comparable. Aucune dérivation mathématique n'est requise — l'objectif est la compréhension conceptuelle et la lecture des sorties logicielles.

Questions courantes FAQ

Qu'est-ce que la régression logistique ?

La régression logistique est un modèle statistique utilisé lorsque la variable dépendante est une variable dichotomique. Elle prédit la probabilité de se trouver dans un état correpondant à l'une ou l'autre des deux modalité de la variable dichotomique. La fonction logistique ne modélise pas directement cette probabilité. C'est le logarithme des cotes qui permet donne la probabilité et qui garantit que les modalité de la variable dichotomique soit comprise dans l'intervalle [0, 1]. C'est grâce à la fonction logit également que l'on linéarise la relation comme cela est expliqué dans le cours.

Qu'est-ce que la fonction logit ?

De manière générale, on appel "cote" le rapport p / (1 − p). Avec p la probabilité de l'événement qui nous intéresse. La fonction logit est le logarithme naturel de la cote. On écrit donc: logit(p) = ln(p / (1 − p)). Pour notre modèle, plutot que d'écrire les deux états de la variable dichotomique y comme une fonction logistique de X: Y = logistique(X) on écrira plutot la probabilité de se trouver dans un état ou dans l'autre comme une fonction linéaire de la fonction logit:  logit(p) = linéaire(x) Il s'agit donc d'une opération de linéarisation, tel que cela est décrit dans le document.

Qu'est-ce qu'un rapport de cotes (Odds Ratio) ?

Le rapport de cotes (OR) mesure l'association entre un prédicteur et la variable dépendante. Un OR = 1 indique aucune association. Un OR = 2 signifie que la cote est deux fois plus élevée pour une unité supplémentaire du prédicteur ; un OR = 0,5 la divise par deux. L'OR est l'indice d'effet standard rapporté pour un modèle logistique.

Comment interpréter un coefficient de régression logistique ?

Un coefficient b exprime le changement du logit pour une augmentation d'une unité du prédicteur, toutes choses égales par ailleurs. Avant de l'interpréter, on calcule donc d'abord l'exponentielle de b pour obtenir le rapport de cotes: p / (1 − p). On appel se rapport de cote Odd Ration: OR et on a OR = e^b = p / (1 − p). le rapport de cote OR indique combien de fois la cote est multipliée par unité supplémentaire du prédicteur X. Un OR supérieur à 1 augmente la probabilité de l'événement ; un OR inférieur à 1 la diminue.

Quelle est la différence entre régression linéaire et régression logistique ?

La régression linéaire modélise une variable dépendante continue. La régression logistique quant à elle, modélise la probabilité d'appartenir à l'une ou l'autre catégorie d'une variable dépendante dichotomique. La régression linéaire peut produire des valeures hors de l'intervalle [0, 1], ce qui n'est pas raisonnable si l'on cherche à modéliser la probabilité. La fonction logistique résout ce problème en limitant les valeurs possibles entre 0 et 1 ce qui permet de prédire la probabilité d'apartenir à un état donné.

Regression Lineaire Simple

Scatterplot illustrant la relation linéaire entre les heures d'étude et le score à l'examen accompagné des histogrammes et boxplots des deux variables

Comment lire et interpréter les paramètres d'une régression linéaire simple.

Comprendre les modèle linéaires, savoir lire les coefficients de la droite et distinguer les valeurs observées des valeurs estimées.

Présentation de la régression linéaire simple

La régression linéaire simple est un modèle statistique qui met en relation deux variables quantitatives. Il s'exprime par une droite d'équation ŷ = b₀ + b₁x, où b₀ est l'ordonnée à l'origine et b₁ est la pente — le coefficient de proportionnalité entre le prédicteur et la variable dépendante. En psychologie, ce modèle permet de quantifier une association empirique, d'évaluer sa significativité et de produire des prédictions. La distinction entre valeurs observées (y) et valeurs estimées par le modèle (ŷ) est centrale à toute interprétation correcte.

Pourquoi utiliser la régression linéaire simple

La régression linéaire simple répond à des questions du type : le nombre d'heures d'étude permet-il de prédire le score à un examen ? La consommation d'alcool est-elle associée à la qualité du sommeil ? Le coefficient b₁ quantifie l'ampleur et la direction de l'association. La pente est le coefficient de proportionnalité entre les deux variables : c'est le paramètre clé du modèle. Le R² indique la part de variance expliquée. Le test de significativité détermine si l'association dépasse le bruit aléatoire attendu sous H₀.

À qui s'adresse ce document

Ce document cible les étudiants du Bachelor en Psychologie (filière francophone) à UniDistance FernUni Schweiz, en première année (BA1). À UniDistance, les méthodes quantitatives représentent 29 à 30 ECTS sur l'ensemble du Bachelor, ce qui traduit une priorité institutionnelle explicite pour la rigueur empirique. La régression linéaire est un outil évalué aux examens de méthodes : l'étudiant doit savoir lire une sortie JASP, interpréter les coefficients et formuler une conclusion conforme aux normes APA 7.

Prérequis

Ce document suppose une familiarité avec les notions de variable dépendante (VD) et de variable indépendante (VI), et avec la corrélation de Pearson. La lecture d'un nuage de points (scatterplot) dans JASP est un prérequis opérationnel. Le niveau visé est celui du BA1 : aucune connaissance antérieure du modèle linéaire ou du calcul des coefficients de régression n'est supposée. Tous les éléments nouveaux sont introduits à partir de l'intuition avant la formule, avec la définition explicite de chaque symbole.

Questions courantes FAQ

Quelle est la différence entre un modèle linéaire et une régression linéaire ?

Un modèle linéaire est une représentation mathématique de la relation entre deux variables sous la forme d'une droite (ŷ = b₀ + b₁x). La régression linéaire est la procédure statistique qui estime les paramètres de ce modèle à partir des données observées. Le modèle est une abstraction ; la régression est la méthode d'estimation. Cette distinction de terminologie est fondamentale pour une lecture précise des résultats.

Que signifie la pente b₁ dans un modèle de régression ?

La pente b₁ est le coefficient de proportionnalité entre le prédicteur et la variable dépendante. Elle indique de combien varie la valeur estimée de y lorsque x augmente d'une unité, toutes choses égales par ailleurs. Une pente de 2,25 signifie qu'une heure supplémentaire d'étude est associée à une augmentation estimée de 2,25 points au score. C'est le paramètre central du modèle, et son interprétation doit toujours être rapportée dans les unités des variables.

Quelle est la différence entre une valeur observée et une valeur estimée ?

Une valeur observée (y) est une donnée réelle mesurée sur le terrain. Une valeur estimée (ŷ) est celle que le modèle prédit à partir de l'équation de régression. La différence entre ces deux valeurs est le résidu : ε = y − ŷ. Le résidu mesure l'écart entre la réalité et ce que le modèle prédit. Cette distinction est fondamentale : confondre y et ŷ revient à confondre le réel et sa représentation modélisée.

Que mesure le R² et comment l'interpréter ?

Le R² (coefficient de détermination) mesure la proportion de la variance de la variable dépendante expliquée par le prédicteur. Un R² de 0,563 signifie que 56,3 % de la variance du score est associée aux heures d'étude. Les 43,7 % restants correspondent à des sources de variation non captées par le modèle. Un R² élevé n'implique pas une relation causale et ne garantit pas que le modèle est bien spécifié.

Comment interpréter l'ordonnée à l'origine b₀ ?

L'ordonnée à l'origine b₀ est la valeur estimée de y lorsque x est égal à zéro. Son interprétation substantielle n'est pertinente que si x = 0 a un sens dans la réalité étudiée. Si ce n'est pas le cas — par exemple si aucun participant de l'étude n'étudie zéro heure — b₀ reste un paramètre technique de l'équation sans interprétation directement applicable au contexte de la recherche.

Distribution Normale et score Z

Représentation de la correspondance entre une distribution nornalet et une distribution centrée réduite

Distribution Normale Centrée Réduite et Score Z

Apprendre à calculer des probabilités dans la distribution normale grâce au score z et à la table des quantile

Présentation de la distribution normale et du score z

La distribution normale est une distribution de probabilité que l'on utilise très souvent en psychologie quantitative. Elle décrit la distribution d'un certain nombre de variables continues telle que le QI, le temps de réaction, les scores de personnalité ou encore le niveau d'anxiété. On la rencontre donc dans de nombreuse applications pratiques et c'est pourquoi on l'utilise si souvent. La distribution normale est caractérisée par deux paramètres qui lui donne sa forme caractéristique: la moyenne μ et l'écart-type σ. Lorsqu'une variable aléatoire X se distribue normalement, on note: X~N(μ,σ) ce qui signifie: la variable aléatoier X suit une loi normale de parametre mu et sigma. Chaque distribution normale est unique selon ces deux paramètres. Le calcul du score Z est une transformation qui consiste à centrer les valeurs de X sur 0 et à réduire son écart type à 1. Les valeurs de Z suivent alors une distribution normale dite centrée réduite: Z~N(0, 1).

Pourquoi utiliser le score z

Le score z permet de calculer la probabilité cumulée de toutes les distributions normales, quelle que soit sa forme. Le score Z en effet est une variable X transformée qui permet de rapporter toute les les distribution normale particulière à une seule distribution centrée réduite. La vérité est que l'on utilise plus aujourd'hui le score Z pour calculer des probabilité d'une variable aléatoir en passant par une table. Nos ordinateur sont capable aujoudh'hui de faire le calcul directement.  Le calcul du score Z répondait surtout à la nécessité de calculer des proabilité à une époque ou le temps de calcul était considérable et coutait cher. Plutot que de calculer les probabilité à chaque fois qu'on rencontrait un nouveau problème, on avait choisi de les calculer une seule fois et d'imprimer les résultats dans une table. C'est la l'origine de la table des quantiles. Plus personne ne l'utilise aujourd'hui. On continue a s'en servire cependant dans un cadre pédagogique car elle permet à l'étudiant de comprendre les notions qui lui seront utile pour comprendre la notion de distribution de probabilité.

A qui s'adresse ce document

Ce document s'adresse aux étudiants du Bachelor en Psychologie à UniDistance FernUni Schweiz. La distribution normale est le fondement de la plupart des tests paramétriques enseignés dans ce cursus. La maîtrise du score z est une compétence préalable aux tests t de Student, aux intervalles de confiance et aux analyses de régression. Il s'agit donc d'un sujet central dans le cursus UniDistance aussi bien que dans toutes formations sérieuses au sujet des statistiques. A UniDistance, les modules statistiques représentent 29 à 30 ECTS et constitue souvent un point d'accroche. Comprendre la logique de la distribution normale est donc une étape importante du cursus.

Prérequis

Pour aborder ces exercices, l'étudiant doit maîtriser les notions de moyenne (μ) et d'écart-type (σ). Une représentation intuitive de la courbe en cloche est suffisante. aucun calcul d'intégrale n'est requis. La seule opération technique est la transformation z = (x − μ) / σ et son inverse x = μ + z × σ. La lecture d'une table des probabilités cumulées de la loi normale standard est la compétence centrale visée par ces exercices. Seules les notions de l'algèbre élémentaire sont nécessaire pour aborder ce cours et les exercices.

Questions courantes FAQ

Pourquoi passer par la distribution centrée réduite N(0, 1) ?

Il existe une infinité de distributions normales, chacune définie par ses propres valeur de mu μ et sigma σ. La distribution centrée réduite N(0, 1) elle aussi est une distribution normale. Ses valeur de mu et sigma cependant sont particulilère. Dans une distribution normale centrée réduite en effet les valeur des paramètre mu et sigma sont: μ = 0, σ = 1.  la distribution centrée réduite est unique. Une seule table de probabilités suffit donc pour lire les probabilités cumulées de toutes les distributions normales. 

Comment lire une probabilité dans la table de la loi normale ?

La table donne la probabilité cumulée à gauche d'une valeur de z. On note cette probabilité P(Z ≤ z) et on dit: Probabilité que la valeur de la variable aléatoir Z prenne une valeur plus petite ou égale à la valeur particulière z. Pour lire P(Z ≤ 1.23) par exemple, on cherchera la ligne 1.2 et la colonne 0.03 : on trouve 0.8907. Cela signifie que 89.07 % des valeurs de la distribution sont inférieures à z = 1.23. Pour des valeurs négatives, on utilise la propriété de symétrie : P(Z ≤ −z) = 1 − P(Z ≤ z).

Comment calculer P(X > x) à partir de la table ?

La table donne la probabilité cumulée P(Z ≤ z)  à gauche de z. Pour obtenir la probabilité P(Z > z) à droite de z, on utilise la probabilité complémentaire: La somme de toute les probabilités en effet étant égale à 1, on peut écrire l'égalité suivante: P(Z > z) = 1 − P(Z ≤ z). Si P(Z ≤ 1.5) = 0.9332, alors P(Z > 1.5) = 1 − 0.9332 = 0.0668. Ce réflexe de est l'une des raison pour laquelle on encourage les étudiants.es à travailler avec la table: elle permet de développer le raisonnement propre à l'utilisation des distributions normales.

Que signifie la propriété de symétrie de la loi normale ?

La distribution normale est symétrique autour de sa moyenne. Pour tout z, P(Z ≤ −z) = P(Z ≥ z) = 1 − P(Z ≤ z). Cette symétrie permet de déduire les probabilités pour les valeurs négatives à partir des probabilités des valeurs positives. Certaine table se présentent sous la forme de deux colonnes, l'une indiquant la probabilité à gauche d'une valeur de z et l'autre colonne indiquant la probabilité à droite. Dans ces tables, les deux colonnes s'additionnent à 1. Pour cette raison, ces tables sont redondantes. D'autres tables telle que celle proposée ici sont plus compact ne donne que la probabilité à gauche, invitant l'utilisateur à déduire l'aire à droite. Ces tables commence en milieu de distribution (en z=0) là ou la probabilité cumulée est la moitié (1/2) de la probabilité totale. Ces tables commencent donc typiquement a une probabilité égale à 0.5.

Pourquoi ce calcul manuel n'est-il plus utilisé en pratique ?

Les logiciels statistiques — JASP, R, SPSS — calculent directement les probabilités pour n'importe quelle distribution normale sans passer par la transformation z. La table de la loi normale standard est un outil de l'ère pré-informatique. Son utilisation dans ce document est exclusivement pédagogique : elle oblige à poser explicitement les propriétés de la distribution et à raisonner sur les probabilités complémentaires, la symétrie et l'aire sous la courbe.

Test du Chi2 Adequation et Independance

histogramme des fréquences observées avec proportions inégales et histogramme des fréquences espérées sous H0 avec trois barres de hauteur égales

Test du Chi2: Indépendance et Adéquation

Maîtriser le raisonnement du test du chi2 — indépendance et adéquation — à travers des scénarios en psychologie.

Présentation du test

Le test du chi2 est un test d'hypothèse non paramétrique. Il mesure l'écart entre une distribution observée sur un échantillon et une distribution théorique de référence. La statistique χ² quantifie cet écart : χ² = Σ (O − E)² / E, où O désigne les fréquences observées et E les fréquences attendues. Un χ² proche de zéro indique que les deux distributions sont similaires. Un χ² supérieur à la valeur critique conduit au rejet de H₀. Ce test s'applique exclusivement à des variables catégorielles.

Pourquoi utiliser le test du Chi2

Le test du chi2 répond à deux types de questions. Dans sa forme d'indépendance, il teste si deux variables catégorielles sont liées : le statut occupationnel est-il associé au niveau de stress perçu ? Dans sa forme d'adéquation, il vérifie si une distribution observée correspond à une distribution théorique connue. Les deux formes reposent sur la même statistique de test — la différence réside dans la manière dont les fréquences théoriques sont calculées, pas dans le calcul de χ² lui-même.

A qui s'adresse ce document

Ce document s'adresse aux étudiants du Bachelor en Psychologie à UniDistance FernUni Schweiz. Le test du chi2 fait partie du curriculum de méthodes quantitatives, qui représente 29 à 30 ECTS sur l'ensemble du cursus. Il est enseigné parce que la psychologie travaille fréquemment avec des variables catégorielles — diagnostic, groupe, genre, modalités de réponse. Tester des hypothèses sur des distributions de fréquences et interpréter des tableaux de contingence sont des compétences directement évaluées aux examens selon les normes APA 7.

Prérequis

Pour aborder ces exercices, l'étudiant doit maîtriser la notion de variable catégorielle et de fréquence. Une première exposition aux concepts d'hypothèse nulle (H₀) et alternative (H₁) est nécessaire, ainsi qu'à la notion de seuil α et de valeur critique. La formule χ² = Σ (O − E)² / E est appliquée pas à pas — aucun prérequis en calcul avancé n'est requis. La lecture d'une table des valeurs critiques du chi2 et l'identification des degrés de liberté sont les compétences techniques à acquérir.

Questions courantes FAQ

Qu'est-ce que la statistique chi2 mesure exactement ?

La statistique χ² mesure l'écart global entre une distribution observée et une distribution théorique. Pour chaque catégorie, elle calcule la différence au carré entre fréquence observée et fréquence attendue, divisée par la fréquence attendue. Ces écarts sont ensuite sommés. Un χ² de zéro signifie que les distributions sont identiques. Plus χ² est grand, plus les distributions divergent. La p-valeur indique si cet écart est attribuable au hasard d'échantillonnage.

Quelle est la différence entre le test d'indépendance et le test d'adéquation ?

Dans le test d'indépendance, on dispose de deux variables catégorielles et on teste si elles sont liées. Les fréquences attendues sont calculées à partir des totaux marginaux du tableau de contingence. Dans le test d'adéquation, on dispose d'une seule variable catégorielle et on teste si sa distribution correspond à une distribution théorique connue. Dans les deux cas, la formule χ² = Σ (O − E)² / E est identique.

Que sont les degrés de liberté dans un test du chi2 ?

Pour un test d'indépendance, les degrés de liberté sont ddl = (nombre de lignes − 1) × (nombre de colonnes − 1). Pour un test d'adéquation à k catégories, ddl = k − 1. Les degrés de liberté déterminent quelle distribution chi2 est utilisée pour lire la valeur critique dans la table. Une table 2×3 produit donc ddl = (2−1) × (3−1) = 2.

Pourquoi le test du chi2 est-il toujours unilatéral droit ?

La statistique χ² est une somme de carrés : elle ne peut pas être négative. Un écart entre distributions observées et attendues augmente toujours la valeur de χ², quel que soit le sens de l'écart. Le rejet de H₀ se produit uniquement quand χ² est suffisamment grand — c'est-à-dire dans la queue droite de la distribution. Il n'existe donc pas de version bilatérale ou unilatérale gauche du test du chi2.

Quelles sont les conditions d'application du test du chi2 ?

Deux conditions doivent être vérifiées. Première condition : l'indépendance des observations — chaque participant contribue à une seule cellule du tableau. Deuxième condition : les fréquences attendues sont suffisamment grandes — au moins 5 par cellule selon la règle courante. Si une cellule présente une fréquence attendue inférieure à 5, le test du chi2 standard n'est pas approprié. Ces deux conditions doivent être vérifiées et justifiées explicitement dans la réponse.

Introduction Analyse de Variance ANOVA

Illustration pédagogique PrivateTeacher représentant trois distributions en bâtons colorées

Introduction à l'analyse de variance ANOVA

Comprends la statistique F pour comparer des moyennes entre plusieurs groupes simultanément et interpréter le résultat.

Présentation

L’analyse de variance ANOVA est une méthode qui permet de quantifier une différence de moyenne entre plusieurs groupes d’individus. Là ou un test-t permet de tester la différence de moyenne entre deux groupes seulement, le test ANOVA permet de tester plusieurs groupes simultanément. Le test repose sur l’utilisation de la statistique F. Cette statistique est un rapport entre la variance des groupes et la moyenne des variances au sein des groupes. Dans ce document, tu apprendras comment calculer la statistique F et à interpréter le résultat.

Pourquoi utiliser l'analyse de variance ANOVA

S’il est utile de savoir qu’il existe une différence entre plusieurs groupes, il est tout aussi utile de connaître les raisons qui ont causé cette différence. Or, les causes sont souvent multiples et les raisons qui ont causé la différence sont parfois difficiles à identifier. L’analyse de variance ANOVA permet non seulement d’identifier une différence entre des groupes, mais aussi de connaître quels sont les facteurs qui ont le plus d’influence dans cette différence. Si l’on ne s’intéresse qu’à un seul facteur, on parlera alors d’une analyse de variance à un facteur (one-way) ANOVA.

Questions courantes FAQ

Quelle est la différence entre un test t et l'ANOVA ?

Le test t compare les moyennes de deux groupes. L'ANOVA compare les moyennes de trois groupes ou plus en une seule procédure. Multiplier les tests t pour comparer plusieurs groupes augmente mécaniquement le risque de conclure à tort à une différence. L'ANOVA maintient ce risque sous contrôle en évaluant toutes les différences simultanément via la statistique F.

Qu'est-ce que la statistique F ?

La statistique F est le rapport entre deux estimations de la variance : la variance entre les groupes (ce qu'on cherche à expliquer) et la variance à l'intérieur des groupes (le bruit résiduel). Si les groupes ont des moyennes très différentes, la variance inter-groupes est grande, F est élevé, et H₀ est rejetée. Une valeur de F proche de 1 indique que les groupes ne se distinguent pas au-delà du hasard.

Que signifie H₀ dans une ANOVA ?

Dans une ANOVA, H₀ affirme que toutes les moyennes de groupe sont égales : μ₁ = μ₂ = ... = μₖ. H₁ affirme qu'au moins une paire de moyennes diffère. Un test significatif conduit à rejeter H₀, mais ne précise pas quelles paires diffèrent. Des tests post-hoc (Tukey, Bonferroni) sont nécessaires pour identifier les différences spécifiques.

Quelles sont les hypothèses du modèle ANOVA ?

Trois hypothèses du modèle doivent être vérifiées avant d'appliquer une ANOVA : la normalité des résidus dans chaque groupe, l'homogénéité des variances entre les groupes (homoscédasticité), et l'indépendance des observations. La violation de ces hypothèses remet en cause la validité du résultat. Leur vérification fait partie de la procédure standard avant toute interprétation de la statistique F.

Un F significatif signifie-t-il que tous les groupes diffèrent entre eux ?

Non. Un F significatif signifie qu'au moins une paire de moyennes diffère. Il ne précise ni quelles paires ni combien. Pour identifier les différences spécifiques, il faut recourir à des tests de comparaisons multiples post-hoc. Cette étape est distincte du test ANOVA lui-même et ne se réalise qu'après un résultat significatif.

Qu'est-ce que la variance inter-groupes et la variance intra-groupes ?

La variance inter-groupes mesure à quel point les moyennes des groupes s'écartent de la moyenne générale. La variance intra-groupes mesure la dispersion des observations autour de leur propre moyenne de groupe. L'ANOVA compare ces deux sources : si la variabilité entre groupes est grande par rapport à la variabilité interne, l'effet du facteur est détectable et F prend une valeur élevée.

Quelle est la différence entre ANOVA à un facteur et ANOVA à deux facteurs ?

L'ANOVA à un facteur (one-way) teste l'effet d'une seule variable explicative sur la variable dépendante. L'ANOVA à deux facteurs (two-way) teste simultanément l'effet de deux variables explicatives et leur interaction éventuelle. Ce document couvre uniquement le cas à un facteur. La two-way ANOVA est une extension directe dont la logique repose sur les mêmes bases formelles.