Probabilités
Sommaire du cours
#### 1. Probabilité, $\sigma$-additivité, espace probabilisé
Soient $\Omega$ un univers (l'ensemble des issues) et $\mathcal{A}$ une tribu sur $\Omega$ (l'ensemble
des événements). Une **probabilité** $P$ sur $(\Omega, \mathcal{A})$ est une application
$P : \mathcal{A} \to [0, 1]$ telle que :
1. $P(\Omega) = 1$ ;
2. **$\sigma$-additivité** : pour toute suite $(A_n)_{n \in \mathbb{N}}$ d'événements **deux à deux
incompatibles** ($A_i \cap A_j = \emptyset$ si $i \neq j$) :
$$P\left(\bigcup_{n \in \mathbb{N}} A_n\right) = \sum_{n \in \mathbb{N}} P(A_n).$$
Pour $A \in \mathcal{A}$, $P(A)$ est la **probabilité de l'événement $A$**. Le triplet
$(\Omega, \mathcal{A}, P)$ est un **espace probabilisé**. La $\sigma$-additivité généralise
l'additivité finie : pour deux événements incompatibles $A, B$, $P(A \cup B) = P(A) + P(B)$.
#### 2. Réunion, différence, contraire ; croissance
Pour tous événements $A, B$ :
- **Événement contraire** : $P(\bar{A}) = 1 - P(A)$ ;
- **Différence** : $P(A \setminus B) = P(A) - P(A \cap B)$ (car $A = (A \setminus B) \sqcup
(A \cap B)$) ; en particulier $B \subset A \Rightarrow P(A \setminus B) = P(A) - P(B)$ ;
- **Réunion** : $P(A \cup B) = P(A) + P(B) - P(A \cap B)$ (formule du crible à deux termes) ;
- **Croissance** : si $A \subset B$, alors $P(A) \leq P(B)$ (car $P(B) = P(A) + P(B \setminus A)
\geq P(A)$). Plus généralement $P(A \setminus B) \geq 0$ redonne la croissance.
Exemple : $P(A) = 0{,}3$, $P(B) = 0{,}4$, $P(A \cap B) = 0{,}1$ donnent $P(A \cup B) = 0{,}6$,
$P(\bar{A} \cap \bar{B}) = P(\overline{A \cup B}) = 0{,}4$.
#### 3. Continuité croissante, continuité décroissante
- **Continuité croissante** : si $(A_n)$ est une suite **croissante** d'événements ($A_n \subset
A_{n+1}$), alors
$$P\left(\bigcup_{n \in \mathbb{N}} A_n\right) = \lim_{n \to +\infty} P(A_n).$$
*Preuve* : poser $B_0 = A_0$, $B_n = A_n \setminus A_{n-1}$ (incompatibles) ; par $\sigma$-additivité,
$P(\bigcup A_n) = \sum P(B_n) = \lim_N \sum_{n \leq N} P(B_n) = \lim_N P(A_N)$ (télescopicité via
Chasles).
- **Continuité décroissante** : si $(A_n)$ est **décroissante** ($A_{n+1} \subset A_n$), alors
$$P\left(\bigcap_{n \in \mathbb{N}} A_n\right) = \lim_{n \to +\infty} P(A_n).$$
*Preuve* : appliquer la continuité croissante aux complémentaires $\bar{A}_n$ (croissants) et passer
au complémentaire.
**Application (suite non nécessairement monotone)** : pour une suite quelconque $(A_n)$
d'événements, les suites $\left(\bigcup_{k=0}^{n} A_k\right)$ et $\left(\bigcap_{k=0}^{n}
A_k\right)$ sont croissante et décroissante, donc :
$$P\left(\bigcup_{k=0}^{n} A_k\right) \xrightarrow[n \to +\infty]{} P\left(\bigcup_{k \in
\mathbb{N}} A_k\right), \qquad P\left(\bigcap_{k=0}^{n} A_k\right) \xrightarrow[n \to +\infty]{}
P\left(\bigcap_{k \in \mathbb{N}} A_k\right).$$
#### 4. Sous-additivité
**Théorème** : pour toute suite $(A_n)$ d'événements (pas nécessairement incompatibles) :
$$P\left(\bigcup_{n \in \mathbb{N}} A_n\right) \leq \sum_{n \in \mathbb{N}} P(A_n).$$
*Preuve* : poser $B_0 = A_0$ et $B_n = A_n \setminus (A_0 \cup \cdots \cup A_{n-1})$ : les $B_n$
sont incompatibles, de réunion $\bigcup A_n$, et $B_n \subset A_n$ donne $P(B_n) \leq P(A_n)$
(croissance) ; la $\sigma$-additivité et la comparaison des séries à termes positifs concluent.
**Remarque de l'énoncé** : la série à termes positifs $\sum P(A_n)$ a toujours une somme dans
$[0, +\infty]$ ; en cas de **divergence**, on convient que $\sum_n P(A_n) = +\infty$ et
l'inégalité est triviale. Corollaire utile : si $\sum_n P(A_n) < +\infty$, alors
$P(\bigcup_{n \geq N} A_n) \leq \sum_{n \geq N} P(A_n) \to 0$ (queue de suite négligeable).
#### 5. Événement presque sûr, événement négligeable, système quasi-complet
- Un événement $A$ est **presque sûr** si $P(A) = 1$ ; il est **négligeable** si $P(A) = 0$. (Par
le complémentaire : $A$ presque sûr $\iff \bar{A}$ négligeable.)
- **Système quasi-complet d'événements** : une suite $(A_n)_{n \in \mathbb{N}}$ d'événements **deux
à deux incompatibles** est un système quasi-complet si sa réunion est **presque sûre** :
$$P\left(\bigsqcup_{n \in \mathbb{N}} A_n\right) = 1.$$
**Conséquence (probabilités totales dénombrables)** : pour tout événement $B \in \mathcal{A}$,
$$P(B) = P\left(B \cap \bigsqcup_n A_n\right) = \sum_{n \in \mathbb{N}} P(B \cap A_n),$$
et pour toute variable aléatoire, les calculs se ramènent aux contributions sur chaque $A_n$.
C'est la version dénombrable du « système complet d'événements » (partition finie) de première
année.
*Exemple* : lancer répété d'une pièce équilibrée, $A_n$ = « les $n$ premiers lancers sont face » :
$P(A_n) = 2^{-n}$. La suite est décroissante et $P(\bigcap_n A_n) = \lim 2^{-n} = 0$
(continuité décroissante) : l'événement « tous les lancers sont face » est **négligeable**. La
suite $(\{$n-ième lancer est pile$\}, \{$face$\})$... plus simplement : $B_n$ = « premier face au
$n$-ième lancer » forme un système quasi-complet ($P(B_n) = 2^{-n}$, $\sum P(B_n) = 1$).
#### 6. Exemple récapitulatif
Sur $\Omega = \mathbb{N}^*$ (lancer d'un dé équilibré jusqu'au premier $6$, $A_k$ = « premier $6$
au lancer $k$ »), $P(A_k) = \left(\frac{5}{6}\right)^{k-1}\frac{1}{6}$ : les $A_k$ forment un
système quasi-complet ($\sum_k P(A_k) = 1$, géométrique). Pour $B$ = « le nombre de lancers est
pair » : $P(B) = \sum_{p \geq 1} P(A_{2p}) = \sum_{p \geq 1} \left(\frac{5}{6}\right)^{2p-1}
\frac{1}{6} = \frac{5}{11}$ (série géométrique de raison $\frac{25}{36}$) — calcul effectué grâce
au système quasi-complet. La sous-additivité donne aussi directement
$P(\bigcup_k A_{2k}) \leq \sum_k P(A_{2k})$, ici avec égalité (événements incompatibles).
#### 1. Univers, tribu, espace probabilisable
- L'**univers** $\Omega$ est l'ensemble des issues (résultats) de l'expérience aléatoire.
- Une **tribu** $\mathcal{A}$ sur $\Omega$ est une partie de $\mathcal{P}(\Omega)$ telle que :
1. $\Omega \in \mathcal{A}$ (donc $\emptyset \in \mathcal{A}$) ;
2. $\mathcal{A}$ est stable par **complémentaire** : $A \in \mathcal{A} \Rightarrow \bar{A} \in
\mathcal{A}$ ;
3. $\mathcal{A}$ est stable par **réunion et intersection dénombrables** : pour toute suite
$(A_n)_{n \in \mathbb{N}}$ d'éléments de $\mathcal{A}$, $\bigcup_{n} A_n \in \mathcal{A}$ et
$\bigcap_n A_n \in \mathcal{A}$.
(On se limite ici à la définition et à ces stabilités par les opérations ensemblistes finies ou
dénombrables.) Le couple $(\Omega, \mathcal{A})$ est un **espace probabilisable** : c'est le cadre
dans lequel on définira les probabilités.
- **Traduction des réalisations par les quantificateurs** : pour une suite d'événements $(A_n)$ :
$$\bigcup_{n \in \mathbb{N}} A_n = \{\omega \in \Omega \mid \exists\, n \in \mathbb{N},\,
\omega \in A_n\} \quad (\text{« il existe } n \text{ tel que } A_n \text{ se réalise »}),$$
$$\bigcap_{n \in \mathbb{N}} A_n = \{\omega \in \Omega \mid \forall\, n \in \mathbb{N},\,
\omega \in A_n\} \quad (\text{« pour tout } n, \text{ } A_n \text{ se réalise »}).$$
Exemple : « obtenir au moins un $6$ en $n$ lancers » $= \bigcup_{k=1}^{n} A_k$ où $A_k$ = « le
$k$-ième lancer donne $6$ » ; « obtenir que des $6$ » $= \bigcap_{k \geq 1} A_k$.
#### 2. Événements
Les éléments de $\mathcal{A}$ sont les **événements**. Le vocabulaire de première année se
généralise au cadre dénombrable :
- $\emptyset$ : événement **impossible** ; $\Omega$ : événement **certain** ;
- $A \cap B = \emptyset$ : événements **incompatibles** (disjoints) ;
- $A \subset B$ : $A$ **implique** $B$ ; $\bar{A}$ : événement **contraire** ;
- **système complet d'événements** : partition finie $(A_1, \ldots, A_p)$ de $\Omega$ (incompatibles
deux à deux, de réunion $\Omega$) — généralisé en partition **dénombrable** et, avec une réunion
seulement presque sûre, en **système quasi-complet** ;
- les singletons $\{\omega\}$ (lorsqu'ils sont dans $\mathcal{A}$) sont les **événements
élémentaires**.
#### 3. Variable aléatoire discrète
**Définition** : une **variable aléatoire discrète** (VAD) $X$ est une application $X : \Omega \to
E$ (où $E$ est un ensemble, typiquement $\mathbb{R}$, $\mathbb{N}$ ou un ensemble de mots) telle
que :
1. $X(\Omega)$ est **au plus dénombrable** ;
2. pour tout $x \in X(\Omega)$, l'image réciproque $X^{-1}(\{x\})$ est un **événement** (élément de
$\mathcal{A}$).
Cette seconde condition (de « mesurabilité ») est ce qui permet de parler de la probabilité que
$X$ prenne la valeur $x$.
**Remarque importante** : l'univers $\Omega$ n'est **en général pas explicité** — on travaille
directement avec la loi de $X$ (les valeurs $x$ et leurs probabilités) sans décrire $\Omega$ ni les
$\omega$.
**Notations** (pour $x \in X(\Omega)$ et $A \subset E$) :
- $(X = x)$ ou $\{X = x\}$ désigne l'événement $X^{-1}(\{x\}) = \{\omega \in \Omega \mid
X(\omega) = x\}$ ;
- $(X \in A) = \{\omega \mid X(\omega) \in A\} = \bigsqcup_{x \in A \cap X(\Omega)} (X = x)$
(réunion dénombrable d'événements incompatibles) ;
- si $X$ est à valeurs réelles : $(X \geq x) = \{\omega \mid X(\omega) \geq x\}$, et les analogues
$(X > x)$, $(X \leq x)$, $(X < x)$ — tous sont des événements (réunions ou intersections
dénombrables des $(X = x)$).
*Exemple* : lancer de deux dés équilibrés, $X$ = somme des deux dés : $X(\Omega) = \{2, \ldots,
12\}$ est dénombrable (fini) ; $(X = 4) = X^{-1}(\{4\})$ contient les triplets... les couples
$(1,3), (2,2), (3,1)$ ; $(X \geq 11) = (X = 11) \sqcup (X = 12)$ ; l'univers $\Omega = \{1,
\ldots, 6\}^2$ n'a pas besoin d'être détaillé pour calculer les probabilités des $(X = x)$.
#### 4. Exemple récapitulatif
Dé à trois faces étiquetées $-1, 0, 1$ équilibré : $\Omega = \{-1, 0, 1\}$, $\mathcal{A} =
\mathcal{P}(\Omega)$ (tribu : contient $\Omega$, stable par complémentaire et réunions
dénombrables — ici trivialement car finie). $X : \Omega \to \mathbb{R}$, $X(\omega) = \omega^2$ :
$X(\Omega) = \{0, 1\}$ au plus dénombrable, $X^{-1}(\{0\}) = \{0\} \in \mathcal{A}$,
$X^{-1}(\{1\}) = \{-1, 1\} \in \mathcal{A}$ : $X$ est une VAD. L'événement $(X \geq 1) =
\{-1, 1\} = (X = 1)$ ; la « réalisation » de $\bigcup_{n}(X = n)$ pour $n$ entier se traduit par
« il existe $n$ tel que $X = n$ », ici réduit à $\{0, 1\}$.
#### 1. Ensembles (au plus) dénombrables
Un ensemble $E$ est **dénombrable** s'il est en bijection avec $\mathbb{N}$, et **au plus
dénombrable** s'il est en bijection avec **une partie de** $\mathbb{N}$ — autrement dit s'il peut
être décrit en extension sous la forme $\{x_i \mid i \in I\}$ avec $I = \mathbb{N}$
(dénombrable) ou $I \subset \mathbb{N}$ (au plus dénombrable) et des $x_i$ **deux à deux
distincts**<br>
**Ensembles dénombrables** :
- $\mathbb{N}$ et $\mathbb{Z}$ ($\mathbb{Z} = \{0, 1, -1, 2, -2, \ldots\}$) ;
- un **produit cartésien d'un nombre fini** d'ensembles dénombrables ($\mathbb{N}^2$, $\mathbb{Z}
\times \mathbb{N}$, etc. — via le codage par les nombres premiers ou le parcours en diagonale) ;
- une **union au plus dénombrable d'ensembles au plus dénombrables** (par exemple
$\mathbb{Q} = \bigcup_{b \geq 1} \{p/b \mid p \in \mathbb{Z}\}$) ;
- toute **partie** d'un ensemble dénombrable est au plus dénombrable.
*Contre-exemple (admis)* : $\mathbb{R}$ n'est pas dénombrable.
<br>
#### 2. Familles d'éléments de $[0, +\infty]$ : somme et sommabilité
En vue de généraliser les sommes finies et les sommes de séries de réels positifs, on sait associer
à **toute famille au plus dénombrable** $(x_i)_{i \in I}$ d'éléments de $[0, +\infty]$ sa somme
$$\sum_{i \in I} x_i \in [0, +\infty]$$
(définie comme la somme de la série obtenue par une énumération ; pour des termes positifs, le
résultat ne dépend pas de l'énumération). **Sommation par paquets** : pour tout découpage $I =
\bigsqcup_{n \in \mathbb{N}} I_n$ de $I$ en paquets au plus dénombrables :
$$\sum_{i \in I} x_i = \sum_{n \in \mathbb{N}} \left(\sum_{i \in I_n} x_i\right).$$
La famille $(x_i)_{i \in I}$ est dite **sommable** si $\sum_{i \in I} x_i < +\infty$.
**En pratique (cas positif)** : les étudiants peuvent **découper, calculer et majorer** leurs
sommes directement ; la **finitude de la somme** vaut preuve de sommabilité — pas de difficulté
d'ordre ni de convergence conditionnelle dans le cas positif.
*Exemple* : $\sum_{(i,j) \in \mathbb{N}^2} 2^{-(i+j)} = \sum_{i,j \geq 0} 2^{-i} 2^{-j} =
\left(\sum_i 2^{-i}\right)\left(\sum_j 2^{-j}\right) = 4 < +\infty$ : la famille est sommable.
#### 3. Familles sommables de nombres complexes
- **Définition** : une famille $(x_i)_{i \in I}$ au plus dénombrable de nombres complexes est
**sommable** si la famille positive $(|x_i|)_{i \in I}$ est sommable ($\sum_{i \in I} |x_i| <
+\infty$).
- **Cas $I = \mathbb{N}$** : la sommabilité de la suite $(x_n)$ équivaut à la **convergence
absolue** de la série $\sum x_n$ — les deux notions coïncident.
- **Domination** : si $|x_i| \leq y_i$ pour tout $i \in I$ et si $(y_i)_{i \in I}$ (à valeurs
positives) est sommable, alors $(x_i)_{i \in I}$ est sommable.
- **Manipulations en cas de sommabilité** : les sommes se traitent comme des sommes finies :
- **croissance** : si $|x_i| \leq y_i$ avec $(y_i)$ sommable, alors $\sum_I |x_i| \leq \sum_I
y_i$ ;
- **linéarité** : si $(x_i)$ et $(y_i)$ sont sommables et $\lambda, \mu \in \mathbb{C}$, alors
$(\lambda x_i + \mu y_i)$ est sommable et $\sum_I (\lambda x_i + \mu y_i) = \lambda \sum_I x_i
+ \mu \sum_I y_i$ ;
- **sommation par paquets** : pour tout découpage $I = \bigsqcup_n I_n$, $\sum_{i \in I} x_i =
\sum_n \sum_{i \in I_n} x_i$ (valable car la famille des modules est sommable) ;
- **théorème de Fubini** (discret) : si $(x_{i,j})_{(i,j) \in \mathbb{N}^2}$ est sommable, alors
$\sum_{(i,j)} x_{i,j} = \sum_i \left(\sum_j x_{i,j}\right) = \sum_j \left(\sum_i x_{i,j}\right)$
— les trois sommes coïncident ;
- **produit de deux sommes** : si $(x_i)_{i \in I}$ et $(y_j)_{j \in J}$ sont sommables, alors la
famille produit $(x_i y_j)_{(i,j) \in I \times J}$ est sommable et
$$\left(\sum_{i \in I} x_i\right)\left(\sum_{j \in J} y_j\right) = \sum_{(i,j) \in I \times J}
x_i\, y_j.$$
**Lien avec les probabilités** : si $(A_n)$ est un système quasi-complet, $P\left(\bigsqcup_n
A_n\right) = \sum_n P(A_n)$ est exactement une somme de famille positive sommable (somme $= 1$).
#### 4. Exemple récapitulatif
Soit la famille $(x_{i,j})_{(i,j) \in \mathbb{N}^2}$ définie par $x_{i,j} = 2^{-i}\,3^{-j}$.
- **Sommabilité** : $|x_{i,j}| = 2^{-i} 3^{-j}$ et
$$\sum_{(i,j) \in \mathbb{N}^2} 2^{-i} 3^{-j} = \left(\sum_{i \geq 0} 2^{-i}\right)
\left(\sum_{j \geq 0} 3^{-j}\right) = 2 \times \frac{3}{2} = 3 < +\infty$$
(produit de deux sommes géométriques) : la famille est **sommable**.
- **Fubini** : $\sum_{(i,j)} x_{i,j} = \sum_{i \geq 0} \left(\sum_{j \geq 0} 2^{-i} 3^{-j}\right) =
\sum_{i \geq 0} \frac{3}{2} \cdot 2^{-i} = 3$, et de même en sommant d'abord en $i$ : les deux
ordres donnent $3$.
- **Sommation par paquets** : en regroupant selon $i + j = n$ (paquets $D_n$ = diagonales), chaque
paquet a pour somme $\sum_{i=0}^{n} 2^{-i} 3^{-(n-i)}$, et $\sum_n \left(\sum_{i=0}^{n}
2^{-i}3^{-(n-i)}\right) = 3$ : le découpage en diagonales donne la même somme totale.
#### 1. Loi d'une variable aléatoire discrète
Soit $X$ une variable aléatoire discrète (VAD) de valeurs $x_0, x_1, \ldots$ ($X(\Omega)$ au plus
dénombrable). La **loi** de $X$, notée $P_X$, est la donnée des probabilités
$$P_X(x) = P(X = x) \quad \text{pour tout } x \in X(\Omega).$$
La **distribution de probabilités** $(P(X = x))_{x \in X(\Omega)}$ détermine entièrement $P_X$ :
- c'est une famille **sommable** de $[0, 1]$ : $\sum_{x \in X(\Omega)} P(X = x) = 1$ ;
- pour toute partie $A \subset X(\Omega)$ : $P(X \in A) = \sum_{x \in A} P(X = x)$ (sommation par
paquets sur la famille sommable).
**Notation** : on écrit $X \sim Y$ lorsque $X$ et $Y$ suivent la **même loi** (à valeurs dans le
même ensemble, $P(X = x) = P(Y = x)$ pour tout $x$).
#### 2. Variable aléatoire $f(X)$
**Théorème** : si $X$ est une VAD et $f : X(\Omega) \to \mathbb{K}$ une application quelconque,
alors $f(X)$ est une **variable aléatoire discrète** (au plus dénombrable, et les images réciproques
sont des événements : $f(X)^{-1}(\{y\}) = \bigsqcup_{x \in f^{-1}(\{y\})} (X = x)$, union
dénombrable d'événements).
**Loi de $f(X)$** : pour $y \in f(X(\Omega))$,
$$P(f(X) = y) = \sum_{x \in f^{-1}(\{y\}) \cap X(\Omega)} P(X = x)$$
(sommation par paquets sur la famille sommable $(P(X=x))$).
**Théorème** : si $X \sim Y$, alors $f(X) \sim f(Y)$ — la loi de $f(X)$ ne dépend que de la loi de
$X$ (et de $f$), pas de l'univers. Exemple : si $X \sim Y$ à valeurs dans $\mathbb{N}$, alors
$X^2 \sim Y^2$ et $e^{X}$... (selon $f$ définie sur les valeurs).
#### 3. Variable géométrique de paramètre $p$
**Définition** : pour $p \in \,]0, 1[$, une VAD $X$ suit la **loi géométrique** de paramètre $p$
(noté $X \sim \mathcal{G}(p)$) si
$$P(X = k) = p\,(1 - p)^{k-1} \quad \text{pour tout } k \in \mathbb{N}^*.$$
Vérifications : $\sum_{k \geq 1} p(1-p)^{k-1} = p \cdot \frac{1}{p} = 1$ (série géométrique).
**Relation caractéristique** : pour tout $k \in \mathbb{N}$,
$$P(X > k) = (1 - p)^k$$
(via $\sum_{j=k+1}^{+\infty} p(1-p)^{j-1}$, ou : « les $k$ premiers essais ont tous échoué »).
**Interprétation** : $X$ est le **rang du premier succès** dans une suite illimitée d'**épreuves de
Bernoulli indépendantes et de même paramètre $p$** (succès de probabilité $p$ à chaque épreuve) :
$P(X = k)$ = succès au $k$-ième essai et échecs avant ; $P(X > k)$ = échec sur les $k$ premiers
essais.
#### 4. Variable de Poisson de paramètre $\lambda$
**Définition** : pour $\lambda > 0$, une VAD $X$ suit la **loi de Poisson** de paramètre $\lambda$
(noté $X \sim \mathcal{P}(\lambda)$) si
$$P(X = k) = e^{-\lambda}\, \frac{\lambda^k}{k!} \quad \text{pour tout } k \in \mathbb{N}.$$
Vérifications : $\sum_{k \geq 0} e^{-\lambda} \frac{\lambda^k}{k!} = e^{-\lambda} e^{\lambda} = 1$
(série exponentielle).
**Interprétation (événements rares)** : la loi de Poisson est la **loi des événements rares** —
elle approche la loi binomiale $\mathcal{B}(n, p_n)$ lorsque $n \to +\infty$ et $n p_n \to
\lambda$ (nombre d'occurrences d'un événement de petite probabilité parmi un grand nombre d'essais
indépendants : appels téléphoniques par minute, désintégrations radioactives par seconde, fautes
d'impression par page). Elle est déterminée par le seul paramètre $\lambda$ (qui est son espérance).
#### 5. Couple de variables aléatoires discrètes
Un **couple** $(X, Y)$ de VAD est la variable aléatoire à valeurs dans le **produit**
$X(\Omega) \times Y(\Omega)$ (au plus dénombrable, produit fini de dénombrables) définie par
$(X, Y)(\omega) = (X(\omega), Y(\omega))$ ; c'est bien une VAD (les images réciproques des singletons
sont des événements). Notation :
$$P(X = x, Y = y) = P\big((X = x) \cap (Y = y)\big) = P(\{\omega \mid X(\omega) = x \text{ et }
Y(\omega) = y\}).$$
**Extension aux $n$-uplets** : $(X_1, \ldots, X_n)$ est une VAD à valeurs dans le produit des
$X_i(\Omega)$, avec les notations $P(X_1 = x_1, \ldots, X_n = x_n)$.
#### 6. Loi conjointe, lois marginales
- **Loi conjointe** du couple $(X, Y)$ : la famille $(P(X = x, Y = y))_{(x, y) \in X(\Omega)
\times Y(\Omega)}$, sommable de somme $1$.
- **Lois marginales** : elles se déduisent de la loi conjointe par sommation :
$$P(X = x) = \sum_{y \in Y(\Omega)} P(X = x, Y = y), \qquad P(Y = y) = \sum_{x \in X(\Omega)}
P(X = x, Y = y).$$
*Attention* : la connaissance des lois marginales ne suffit **pas** en général à reconstituer la
loi conjointe (il faut connaître la dépendance entre $X$ et $Y$).
#### 7. Loi conditionnelle de $Y$ sachant un événement $A$
Si $A$ est un événement de probabilité non nulle, la **loi conditionnelle de $Y$ sachant $A$** est
$$P(Y = y \mid A) = \frac{P((Y = y) \cap A)}{P(A)} \quad \text{pour } y \in Y(\Omega),$$
qui définit bien une loi (famille sommable de somme $1$). On l'utilise notamment avec $A$ de la
forme $(X = x)$ : $P(Y = y \mid X = x) = \frac{P(X = x, Y = y)}{P(X = x)}$ (si $P(X = x) > 0$).
#### 8. Exemple récapitulatif
Deux pièces équilibrées : $\Omega = \{P, F\}^2$, $X$ = nombre de piles, $Y$ = nombre de faces
($X + Y = 2$). Loi conjointe : $P(X = 0, Y = 2) = \frac{1}{4}$, $P(X = 1, Y = 1) = \frac{1}{2}$,
$P(X = 2, Y = 0) = \frac{1}{4}$. **Marginales** : $P(X = 0) = \frac{1}{4}$, $P(X = 1) = \frac{1}{2}$,
$P(X = 2) = \frac{1}{4}$ ; idem pour $Y$ ($X \sim Y$, les deux sont $\mathcal{B}(2, \frac{1}{2})$).
**Loi conditionnelle** : $P(Y = 1 \mid X = 1) = \frac{P(X=1, Y=1)}{P(X=1)} = 1$ : sachant $X = 1$,
$Y$ est presque sûrement $1$ (déterminée). Avec une pièce truquée, les marginales restent semblables
mais la conjointe change : les marginales ne suffisent pas.
#### 1. Indépendance de deux événements
**Définition** : deux événements $A$ et $B$ sont **indépendants** si
$$P(A \cap B) = P(A)\, P(B).$$
**Lien avec la probabilité conditionnelle** : si $P(B) > 0$, l'indépendance de $A$ et $B$ équivaut
à
$$P(A \mid B) = \frac{P(A \cap B)}{P(B)} = P(A),$$
c'est-à-dire : savoir que $B$ est réalisé **ne modifie pas** la probabilité de $A$. La définition
est **symétrique** en $A$ et $B$ (alors que la conditionnelle ne l'est pas), et elle garde un sens
même si $P(B) = 0$ ou $P(B) = 1$.
Exemples : événements incompatibles ≠ indépendants — si $A \cap B = \emptyset$ avec $P(A), P(B) >
0$, alors $P(A \cap B) = 0 \neq P(A)P(B)$ : des événements incompatibles de probabilité non nulle
sont **dépendants**.
#### 2. Indépendance et passage au complémentaire
**Théorème** : si $A$ et $B$ sont indépendants, alors $A$ et $\bar{B}$ le sont aussi :
$$P(A \cap \bar{B}) = P(A) - P(A \cap B) = P(A) - P(A)P(B) = P(A)\left(1 - P(B)\right) =
P(A)\,P(\bar{B}).$$
De même, $\bar{A}$ et $B$ sont indépendants, ainsi que $\bar{A}$ et $\bar{B}$ : **l'indépendance
est préservée par complémentaires** (dans les quatre combinaisons).
#### 3. Indépendance d'une famille finie d'événements
**Définition** : les événements $A_1, \ldots, A_n$ sont (**mutuellement**) **indépendants** si pour
toute **sous-famille** non vide $J \subset \{1, \ldots, n\}$ :
$$P\left(\bigcap_{j \in J} A_j\right) = \prod_{j \in J} P(A_j).$$
Pour $n = 3$, cela signifie que **toutes** les relations suivantes ont lieu :
$$P(A_1 \cap A_2) = P(A_1)P(A_2), \quad P(A_1 \cap A_3) = P(A_1)P(A_3), \quad P(A_2 \cap A_3) =
P(A_2)P(A_3),$$
$$P(A_1 \cap A_2 \cap A_3) = P(A_1)P(A_2)P(A_3).$$
**Attention : l'indépendance deux à deux n'entraîne pas l'indépendance.** Contre-exemple classique
: lancer d'un dé équilibré, $\Omega = \{1, 2, 3, 4\}$, avec
$$A_1 = \{1, 2\}, \quad A_2 = \{1, 3\}, \quad A_3 = \{1, 4\} \quad (P(A_i) = \tfrac{1}{2}).$$
Les trois sont **deux à deux indépendants** ($P(A_i \cap A_j) = P(\{1\}) = \frac{1}{4} =
P(A_i)P(A_j)$ pour $i \neq j$), mais
$$P(A_1 \cap A_2 \cap A_3) = P(\{1\}) = \frac{1}{4} \neq \frac{1}{8} = P(A_1)P(A_2)P(A_3) :$$
ils ne sont **pas** indépendants.
#### 4. Extension au cas de $n$ événements
La définition de la section 3 est celle des $n$ événements indépendants ; elle implique que toute
sous-famille est indépendante (au sens fort). Conséquences utiles :
- si $(A_1, \ldots, A_n)$ sont indépendants, il en est de même des événements obtenus en remplaçant
certains $A_i$ par leur complémentaire $\bar{A}_i$ (théorème de la section 2, itéré) ;
- **épreuves de Bernoulli indépendantes** : l'indépendance des événements « succès au $i$-ième
essai » donne $P(X_1 = \epsilon_1, \ldots, X_n = \epsilon_n) = \prod_{i=1}^{n} p^{\epsilon_i}
(1-p)^{1-\epsilon_i}$ pour les n-uplets de réalisations — c'est le socle des lois binomiale,
géométrique, etc. ;
- pour une **suite infinie** d'événements, on exige l'indépendance de toute sous-famille finie
(c'est ce qui fonde l'interprétation de la variable géométrique comme rang du premier succès).
#### 5. Exemple récapitulatif
Deux dés équilibrés : $A$ = « le premier dé donne $6$ », $B$ = « la somme vaut au moins $11$ ».
$P(A) = \frac{1}{6}$, $P(B) = \frac{3}{36} = \frac{1}{12}$, $P(A \cap B) = P(\{(6,5), (6,6)\}) =
\frac{2}{36} = \frac{1}{18}$. On a $P(A)P(B) = \frac{1}{72} \neq \frac{1}{18}$ : $A$ et $B$ ne sont
**pas** indépendants (savoir que $A$ est réalisé double presque la probabilité de $B$ :
$P(B \mid A) = \frac{1}{3}$). En revanche, « le premier dé donne $6$ » et « le second dé donne
$6$ » sont indépendants, et avec $n$ dés, les événements « le $i$-ième dé donne $6$ » ($1 \leq i
\leq n$) sont mutuellement indépendants : $P(\text{tous les dés donnent } 6) = 6^{-n}$.
#### 1. Définition de la probabilité conditionnelle
Soit $(\Omega, \mathcal{A}, P)$ un espace probabilisé et $B$ un événement de probabilité **non
nulle** ($P(B) > 0$). Pour tout événement $A$, la **probabilité conditionnelle de $A$ sachant
$B$** est
$$P(A \mid B) = P_B(A) = \frac{P(A \cap B)}{P(B)}.$$
C'est la probabilité que $A$ se réaliste, « rapportée » au nouvel univers $B$ : on refroidit
l'univers en $B$. Si $P(B) = 0$, la notation $P(A \mid B)$ n'a pas de sens par cette formule.
#### 2. L'application $P_B$ définit une probabilité
**Théorème** : si $P(B) > 0$, l'application $P_B : \mathcal{A} \to [0, 1]$, $A \mapsto
P_B(A) = P(A \mid B)$, est une **probabilité** sur $(\Omega, \mathcal{A})$ :
- $P_B(\Omega) = \frac{P(\Omega \cap B)}{P(B)} = 1$ ;
- **$\sigma$-additivité** : pour toute suite $(A_n)$ d'événements deux à deux incompatibles,
$$P_B\left(\bigsqcup_n A_n\right) = \frac{P\left((\bigsqcup_n A_n) \cap B\right)}{P(B)} =
\frac{\sum_n P(A_n \cap B)}{P(B)} = \sum_n P_B(A_n).$$
**Conséquences** : toutes les formules de la théorie des probabilités valent pour $P_B$
($P_B(\bar{A}) = 1 - P_B(A)$, croissance, formule du crible, continuités croissante et
décroissante, etc.), et deux événements indépendants au sens $P(A \cap B) = P(A)P(B)$ vérifient
$P(A \mid B) = P(A)$.
#### 3. Formule des probabilités composées
Pour tous événements $A, B$ avec $P(B) > 0$ (resp. $P(A) > 0$) :
$$P(A \cap B) = P(B)\, P(A \mid B) = P(A)\, P(B \mid A).$$
**Généralisation** : pour $A_1, \ldots, A_n$ tels que $P(A_1 \cap \cdots \cap A_{n-1}) > 0$,
$$P(A_1 \cap A_2 \cap \cdots \cap A_n) = P(A_1)\, P(A_2 \mid A_1)\, P(A_3 \mid A_1 \cap A_2)
\cdots P(A_n \mid A_1 \cap \cdots \cap A_{n-1}).$$
*Exemple* : tirages sans remise — probabilité de tirer trois boules rouges dans une urne de $5$
rouges et $5$ noires : $\frac{5}{10} \cdot \frac{4}{9} \cdot \frac{3}{8} = \frac{1}{12}$.
#### 4. Formule des probabilités totales
**Théorème** : si $(A_n)_{n \geq 0}$ est un **système complet** (partition finie ou dénombrable de
$\Omega$) ou **quasi-complet** d'événements, alors pour tout événement $B$ :
$$P(B) = \sum_{n \geq 0} P(B \cap A_n) = \sum_{n \geq 0} P(B \mid A_n)\, P(A_n),$$
avec la **convention** $P(B \mid A_n)\, P(A_n) = 0$ lorsque $P(A_n) = 0$ (l'égalité
$P(B \cap A_n) = P(B \mid A_n) P(A_n)$ reste vraie trivialement : les deux membres sont nuls).
*Preuve* : les $B \cap A_n$ sont deux à deux incompatibles et de réunion $B$ (ou de réunion
presque sûre $B$, auquel cas $B = \bigsqcup (B \cap A_n) \sqcup (B \cap N)$ avec $N$ négligeable) ;
la $\sigma$-additivité donne la première égalité, et $P(B \cap A_n) = P(B \mid A_n)P(A_n)$ la
seconde.
C'est l'outil de base pour calculer $P(B)$ en « décomposant » selon les scénarios $A_n$.
*Exemple* : deux urnes ($U_1$ : $7$ blanches, $3$ noires ; $U_2$ : $2$ blanches, $8$ noires), on
choisit l'urne au hasard puis une boule : $P(\text{blanche}) = \frac{1}{2}\cdot\frac{7}{10} +
\frac{1}{2}\cdot\frac{2}{10} = \frac{9}{20}$.
#### 5. Formule de Bayes
**Théorème** : si $P(B) > 0$ et si $(A_n)$ est un système complet (ou quasi-complet), alors pour
tout $k$ :
$$P(A_k \mid B) = \frac{P(B \mid A_k)\, P(A_k)}{P(B)} = \frac{P(B \mid A_k)\, P(A_k)}
{\sum_{n \geq 0} P(B \mid A_n)\, P(A_n)}.$$
La formule de Bayes permet d'**inverser le conditionnement** : passer des causes aux effets ($P(B
\mid A_k)$) aux effets observés vers les causes ($P(A_k \mid B)$).
*Exemple (test de dépistage)* : maladie touchant $1\%$ de la population ($P(M) = 0{,}01$), test
positif avec probabilité $0{,}95$ si malade et probabilité $0{,}02$ si sain. Alors
$$P(M \mid T_+) = \frac{0{,}95 \times 0{,}01}{0{,}95 \times 0{,}01 + 0{,}02 \times 0{,}99}
\approx 0{,}324 :$$
un test positif ne signifie pas être malade avec probabilité $95\%$ — la faible prévalence domine
(c'est l'erreur du procureur).
#### 6. Exemple récapitulatif
Urne $U_1$ : $7$ blanches, $3$ noires ; urne $U_2$ : $2$ blanches, $8$ noires. On choisit une urne
au hasard ($P(U_1) = P(U_2) = \frac{1}{2}$, système complet), puis deux boules avec remise.
- **Probabilités composées** : $P(\text{deux blanches et } U_1) = P(U_1)\,P(B_1|U_1)\,P(B_2|U_1,
B_1) = \frac{1}{2} \cdot \frac{7}{10} \cdot \frac{7}{10} = \frac{49}{200}$.
- **Probabilités totales** : $P(\text{deux blanches}) = \frac{1}{2}\left(\frac{7}{10}\right)^2 +
\frac{1}{2}\left(\frac{2}{10}\right)^2 = \frac{53}{200}$.
- **Bayes** : sachant que les deux boules sont blanches, la probabilité que l'urne choisie soit
$U_1$ vaut $\frac{49/200}{53/200} = \frac{49}{53}$ : l'observation « deux blanches » rend $U_1$
très probable (a priori $\frac{1}{2}$).
#### 1. Indépendance de deux variables aléatoires discrètes
**Définition** : deux VAD $X$ et $Y$ définies sur $\Omega$ sont **indépendantes** (noté
$X \perp Y$) si, pour tout $A \subset X(\Omega)$ et tout $B \subset Y(\Omega)$, les événements
$(X \in A)$ et $(Y \in B)$ sont **indépendants** :
$$P((X \in A) \cap (Y \in B)) = P(X \in A)\, P(Y \in B).$$
**Caractérisation pratique** : $X \perp Y$ si et seulement si la distribution de probabilités du
couple $(X, Y)$ est le **produit des distributions marginales** :
$$P(X = x, Y = y) = P(X = x)\, P(Y = y) \quad \text{pour tous } x \in X(\Omega),\, y \in
Y(\Omega).$$
*(sens direct immédiat ; réciproque par sommation par paquets : pour $A \subset X(\Omega)$,
$P((X \in A) \cap (Y = y)) = \sum_{x \in A} P(X = x, Y = y) = P(X \in A)P(Y = y)$, puis même
argument pour $B$ quelconque.)*
**Extension aux $n$ variables** : $X_1, \ldots, X_n$ sont **indépendantes** si pour tous
$A_i \subset X_i(\Omega)$ (ou pour tous $x_i \in X_i(\Omega)$) :
$$P(X_1 \in A_1, \ldots, X_n \in A_n) = \prod_{i=1}^{n} P(X_i \in A_i), \qquad
P(X_1 = x_1, \ldots, X_n = x_n) = \prod_{i=1}^{n} P(X_i = x_i).$$
Comme pour les événements, l'indépendance deux à deux ne suffit pas.
#### 2. Suites de variables aléatoires indépendantes, suites i.i.d.
Une suite $(X_n)_{n \in \mathbb{N}}$ de VAD est **indépendante** si toute sous-famille finie
$(X_{i_1}, \ldots, X_{i_k})$ est indépendante ; elle est **i.i.d.** (**indépendantes et
identiquement distribuées**) si de plus les $X_n$ ont **même loi**.
**Existence** : il existe un espace probabilisé portant une suite i.i.d. de loi donnée (théorème
admis) : c'est ce qui autorise la modélisation d'une infinité d'expériences indépendantes.
**Modélisation du jeu de pile ou face infini** : on prend $\Omega = \{P, F\}^{\mathbb{N}}$
(l'ensemble des suites infinies de piles et de faces), muni d'une probabilité telle que pour tout
mot fini $\epsilon_1, \ldots, \epsilon_n \in \{P, F\}^n$ :
$$P(\text{le jeu commence par } \epsilon_1, \ldots, \epsilon_n) = 2^{-n},$$
et l'on définit $X_n(\omega) = 1$ si $\omega_n = P$, $0$ sinon : la suite $(X_n)$ est i.i.d. de loi
de Bernoulli $\mathcal{B}(1/2)$. C'est le cadre du jeu de pile ou face infini (événement « le
premier pile apparaît au $k$-ième lancer », « obtenir une infinité de piles », etc.).
#### 3. Fonctions de variables indépendantes
**Théorème** : si $X \perp Y$, alors pour toutes applications $f, g$ quelconques :
$$f(X) \perp g(Y).$$
*Preuve* : $f(X)$ et $g(Y)$ sont des VAD (composition) ; pour $A' \subset f(X(\Omega))$ et $B'
\subset g(Y(\Omega))$ :
$$(f(X) \in A') = (X \in f^{-1}(A')), \qquad (g(Y) \in B') = (Y \in g^{-1}(B')),$$
et l'indépendance de $X$ et $Y$ appliquée aux parties $f^{-1}(A')$ et $g^{-1}(B')$ donne
l'indépendance. En particulier si $X \perp Y$ alors $X^2 \perp Y^2$, $\ln|X| \perp \ldots$, etc.
#### 4. Lemme des coalitions
**Théorème** : si les variables aléatoires $X_1, \ldots, X_n$ sont indépendantes, alors pour tout
découpage en deux blocs, les variables
$$f(X_1, \ldots, X_m) \quad \text{et} \quad g(X_{m+1}, \ldots, X_n)$$
sont **indépendantes** (pour toutes applications $f$, $g$).
*Preuve* : on introduit la variable $Z_1 = (X_1, \ldots, X_m)$ (couple n-uplet, VAD à valeurs dans
le produit dénombrable) et $Z_2 = (X_{m+1}, \ldots, X_n)$ ; l'indépendance des $X_i$ donne
$P(Z_1 \in C_1, Z_2 \in C_2) = P(Z_1 \in C_1)P(Z_2 \in C_2)$ pour tous $C_1, C_2$ (produit des
probabilités par factorisation), donc $Z_1 \perp Z_2$, et l'on conclut par la section 3.
**Extensions** :
- à **plus de deux coalitions** : les $k$ blocs $(X_1, \ldots, X_{m_1})$, $(X_{m_1+1}, \ldots,
X_{m_2})$, \ldots, $(X_{m_{k-1}+1}, \ldots, X_n)$ sont mutuellement indépendants ;
- à **plus de deux variables** : en particulier $X_1 + X_2 \perp X_3$, $\max(X_1, X_2) \perp
\min(X_3, X_4)$, etc. dès que les blocs portent sur des variables indépendantes distinctes.
#### 5. Exemple récapitulatif
Dans le jeu de pile ou face infini, soit $(X_n)$ i.i.d. de Bernoulli $\mathcal{B}(1/2)$ ($X_n = 1$
si pile au $n$-ième lancer). Alors :
- $S_2 = X_1 + X_2$ (nombre de piles dans les deux premiers lancers) et $S'_2 = X_3 + X_4$ sont
indépendantes (lemme des coalitions, blocs $\{1,2\}$ et $\{3,4\}$) ;
- de même $S_2 \perp X_5$ ; et pour toute fonction $f$ (par exemple $f = $ « nombre de transitions
$P \to F$ » sur un mot fini), $f(X_1, \ldots, X_{10}) \perp g(X_{11}, X_{12}, \ldots)$ ;
- le rang du premier pile, $T = \min\{n \geq 1 \mid X_n = 1\}$, suit la loi géométrique
$\mathcal{G}(1/2)$, et les événements « $X_n = 1$ » pour $n > T$ restent indépendants de $T$
( propriété de régénération).
#### 1. Espérance d'une VAD positive
Pour une VAD $X$ à valeurs dans $[0, +\infty]$ (au plus dénombrables), on définit
$$E(X) = \sum_{x \in X(\Omega)} x\, P(X = x) \;\in\; [0, +\infty],$$
avec la **convention** $x\,P(X = x) = 0$ lorsque $x = +\infty$ et $P(X = +\infty) = 0$. La somme
est celle d'une famille positive (bien définie, indépendante de l'ordre). $E(X)$ peut être **infinie**
même si $X$ ne prend jamais la valeur $+\infty$.
#### 2. Espérance finie, variable centrée
Une VAD $X$ à valeurs réelles (resp. complexes) est **d'espérance finie** si la famille
$\big(x\,P(X = x)\big)_{x \in X(\Omega)}$ est **sommable**. Dans ce cas, la somme de cette famille
est l'**espérance** de $X$ :
$$E(X) = \sum_{x \in X(\Omega)} x\, P(X = x) \in \mathbb{K}.$$
Pour $X$ réelle, cela signifie $\sum_x |x| P(X = x) < +\infty$. On dit que $X$ est **centrée** si
$E(X) = 0$. *Attention* : $E(X)$ finie n'entraîne pas $E(X^2)$ finie.
#### 3. Relation $E(X) = \sum_{n \geq 1} P(X \geq n)$ pour $X \in \mathbb{N} \cup \{+\infty\}$
**Théorème** : si $X$ est une VAD positive à valeurs dans $\mathbb{N} \cup \{+\infty\}$, alors
$$E(X) = \sum_{n=1}^{+\infty} P(X \geq n).$$
*Preuve* : les deux membres valent $\sum_{n \geq 1} \sum_{k \geq n} P(X = k)$ (avec $n \leq X(\omega)$
compté par les $n$)... en sommant par **paquets diagonaux** sur la famille positive $(P(X = k))$ :
$$\sum_{n \geq 1} P(X \geq n) = \sum_{n \geq 1} \sum_{k \geq n} P(X = k) = \sum_{k \geq 1}
k\,P(X = k) = E(X),$$
l'égalité $\sum_{k \geq 1} k\, \mathbb{1}_{k \geq n} = k$ justifiant le regroupement (cas positif :
tout est permis). Si $X$ peut prendre la valeur $+\infty$ avec $P(X = +\infty) > 0$, les deux
membres valent $+\infty$.
#### 4. Espérance des variables géométrique et de Poisson
- **Géométrique** : si $X \sim \mathcal{G}(p)$, alors $E(X) = \frac{1}{p}$. Preuve via la relation
caractéristique : $E(X) = \sum_{n \geq 1} P(X \geq n) = \sum_{n \geq 1} (1-p)^n =
\frac{1-p}{p} \cdot \frac{1}{1-(1-p)}$... plus précisément $\sum_{n \geq 1} (1-p)^n =
\frac{1}{p}$ (série géométrique de raison $1 - p < 1$).
- **Poisson** : si $X \sim \mathcal{P}(\lambda)$, alors $E(X) = \lambda$ :
$$E(X) = \sum_{k \geq 0} k\, e^{-\lambda}\frac{\lambda^k}{k!} = e^{-\lambda}
\sum_{k \geq 1} \frac{\lambda^k}{(k-1)!} = \lambda\, e^{-\lambda} \sum_{j \geq 0}
\frac{\lambda^j}{j!} = \lambda.$$
(Pour $k = 0$ le terme est nul ; changement d'indice $j = k - 1$.)
#### 5. Formule de transfert
**Théorème** : soit $X$ une VAD et $f : X(\Omega) \to \mathbb{K}$ une application. Alors $f(X)$
est **d'espérance finie** si et seulement si la famille $\big(f(x)\,P(X = x)\big)_{x \in
X(\Omega)}$ est **sommable**. Dans ce cas :
$$E(f(X)) = \sum_{x \in X(\Omega)} f(x)\, P(X = x).$$
La formule s'applique **aux couples et aux $n$-uplets** : si $(X, Y)$ est un couple de VAD et $g :
X(\Omega) \times Y(\Omega) \to \mathbb{K}$, alors
$$E(g(X, Y)) = \sum_{(x, y) \in X(\Omega) \times Y(\Omega)} g(x, y)\, P(X = x, Y = y)$$
lorsque la famille correspondante est sommable (par exemple si $g \geq 0$, ou par domination).
C'est la formule de travail pour calculer espérances de transformations, variances, covariances.
#### 6. Linéarité de l'espérance
**Théorème** : si $X$ et $Y$ sont des VAD **d'espérance finie** (réelles ou complexes) et $\lambda
\in \mathbb{K}$, alors $X + \lambda Y$ est d'espérance finie et
$$E(X + \lambda Y) = E(X) + \lambda\, E(Y).$$
*Preuve* : par sommabilité de $\big(x P(X=x)\big)$ et $\big(y P(Y=y)\big)$, la famille
$\big((x + \lambda y) P(X = x, Y = y)\big)$ est sommable (domination par $|x|P(X=x,Y=y) +
|\lambda||y|P(\ldots)$ et Fubini sur les marginales), et la somme se factorise.
**Domination** : si $|X| \leq Y$ (inégalité presque sûre) et $E(Y) < +\infty$ avec $Y \geq 0$,
alors $X$ est **d'espérance finie** et $|E(X)| \leq E(|X|) \leq E(Y)$ (sommabilité par domination
des familles).
#### 7. Positivité, croissance ; espérance nulle
**Théorème** :
- **Positivité** : si $X \geq 0$ (a.s.), alors $E(X) \geq 0$ ;
- **Croissance** : si $X \leq Y$ et $X, Y$ d'espérances finies, alors $E(X) \leq E(Y)$ ;
- **Espérance nulle** : si $X$ est **positive** et $E(X) = 0$, alors $(X = 0)$ est **presque sûr**.
*Preuve du dernier point* : si $P(X > 0) > 0$, alors il existe $k \geq 1$ tel que
$P(X \geq \frac{1}{k}) > 0$ (sinon $P(X > 0) = \lim_m P(X \geq \frac{1}{m}) = 0$, continuité
croissante en $-\frac{1}{m}$), et
$$E(X) \geq \sum_{x \geq 1/k} x\,P(X = x) \geq \frac{1}{k}\, P\left(X \geq \frac{1}{k}\right) > 0,$$
contradiction. Corollaire : $|E(X)| \leq E(|X|)$ avec égalité ssi $X$ est de signe constant (a.s.),
et $E(|X|) = 0 \iff X = 0$ (a.s.).
#### 8. Indépendance et produit
**Théorème** : si $X$ et $Y$ sont des VAD **indépendantes** et **d'espérance finie**, alors $XY$
est d'**espérance finie** et
$$E(XY) = E(X)\, E(Y).$$
*Preuve (idée)* : la famille $\big(x y\, P(X = x, Y = y)\big) = \big(x y\, P(X=x)P(Y=y)\big)$ est
sommable comme **produit de deux sommes** ($\sum_{x,y} |x||y|P(X=x)P(Y=y) = E(|X|)E(|Y|) <
+\infty$), et la somme se factorise : $E(XY) = \left(\sum_x xP(X=x)\right)\left(\sum_y
yP(Y=y)\right)$ (produit de deux sommes sommables).
**Attention** : la réciproque est fausse — $E(XY) = E(X)E(Y)$ n'implique pas l'indépendance (la
nullité de la covariance ne suffit pas). **Extension à $n$ variables** : si $X_1, \ldots, X_n$
sont indépendantes d'espérances finies, alors $E(X_1 \cdots X_n) = E(X_1) \cdots E(X_n)$
(récurrence et lemme des coalitions).
#### 9. Exemple récapitulatif
Deux dés équilibrés **indépendants** : $X$ et $Y$ uniformes sur $\{1, \ldots, 6\}$, $E(X) = E(Y) =
\frac{7}{2}$ (formule de transfert). Alors :
- $E(X + 2Y) = E(X) + 2E(Y) = \frac{21}{2}$ (linéarité, sans hypothèse d'indépendance) ;
- $E(XY) = E(X)E(Y) = \frac{49}{4}$ (indépendance ; par transfert sur le couple :
$\sum_{x,y} \frac{xy}{36} = \left(\frac{21}{6}\right)^2$) ;
- $E(|X - Y|) = \frac{35}{18}$ par transfert sur le couple (les valeurs $|x - y|$ pondérées par
$\frac{1}{36}$).
#### 1. De $X^2$ d'espérance finie à $X$ d'espérance finie
**Théorème** : si $X$ est une VAD réelle telle que $X^2$ soit d'**espérance finie**, alors $X$ est
d'**espérance finie**.
*Preuve* : pour tout réel $x$, $|x| \leq \frac{x^2 + 1}{2}$ (car $x^2 - 2|x| + 1 = (|x| - 1)^2
\geq 0$). Par la formule de transfert appliquée à $f(t) = \frac{t^2 + 1}{2}$ : $E(|X|) \leq
\frac{E(X^2) + 1}{2} < +\infty$. La réciproque est **fausse** ($X$ d'espérance finie n'a pas
forcément $X^2$ d'espérance finie).
#### 2. Inégalité de Cauchy-Schwarz
**Théorème** : si $X^2$ et $Y^2$ sont d'**espérance finie**, alors $XY$ est aussi d'espérance
finie et
$$\big(E(XY)\big)^2 \leq E(X^2)\, E(Y^2).$$
*Preuve (idée)* : le polynôme en $\lambda$, $E((X + \lambda Y)^2) = E(X^2) + 2\lambda E(XY) +
\lambda^2 E(Y^2) \geq 0$, a un discriminant $\leq 0$ (traiter d'abord le cas $E(Y^2) > 0$, puis
conclure si $E(Y^2) = 0$ que $Y = 0$ a.s. et $XY = 0$).
**Cas d'égalité** : il y a égalité si et seulement si $X$ et $Y$ sont **linéairement liées** (il
existe $(a, b) \neq (0,0)$ avec $aX = bY$ presque sûrement) — le polynôme admet une racine double
réelle dans ce cas.
Corollaire : $|XY| \leq \frac{X^2 + Y^2}{2}$ (borne grossière) et $E(XY)^2$ est finie dès que les
carrés le sont.
#### 3. Variance, écart type, variable réduite
Pour $X$ réelle telle que $X^2$ soit d'espérance finie (on dit que $X$ est de **carré sommable**) :
$$V(X) = E\left((X - E(X))^2\right) = E(X^2) - E(X)^2 \;\geq\; 0, \qquad \sigma(X) = \sqrt{V(X)}.$$
*Preuve de la relation* : $V(X) = E(X^2 - 2E(X)X + E(X)^2) = E(X^2) - 2E(X)E(X) + E(X)^2$ par
linéarité (les constantes $E(X)$ sortent de l'espérance).
**Notations** : $V(X)$, $\sigma(X)$. La variance mesure la **dispersion** de $X$ autour de son
espérance ; c'est l'espérance du carré de la variable **centrée** $X - E(X)$, qui est elle-même de
carré sommable si $X$ l'est.
#### 4. Variance d'une transformation affine ; variable centrée réduite
**Théorème** : pour $a, b \in \mathbb{R}$ (avec $X$ de carré sommable) :
$$V(aX + b) = a^2\, V(X).$$
*Preuve* : $E(aX + b) = aE(X) + b$, donc $aX + b - E(aX + b) = a(X - E(X))$ et
$V(aX+b) = E(a^2 (X - E(X))^2) = a^2 V(X)$.
Conséquences : $V(b) = 0$ pour une constante ; $V(-X) = V(X)$.
**Variable centrée réduite** : si $\sigma(X) > 0$, la variable
$$X^* = \frac{X - E(X)}{\sigma(X)}$$
est **centrée** ($E(X^*) = 0$) et **réduite** ($V(X^*) = 1$, car $V(X^*) = \frac{1}{\sigma(X)^2}
V(X) = 1$).
#### 5. Variance des lois géométrique et de Poisson
- **Géométrique** : si $X \sim \mathcal{G}(p)$, alors $E(X) = \frac{1}{p}$ et $E(X^2) = \frac{2 -
p}{p^2}$ (par formule de transfert et sommation par paquets / dérivation de la série génératrice),
d'où
$$V(X) = \frac{2 - p}{p^2} - \frac{1}{p^2} = \frac{1 - p}{p^2}, \qquad \sigma(X) =
\frac{\sqrt{1 - p}}{p}.$$
- **Poisson** : si $X \sim \mathcal{P}(\lambda)$, alors $E(X) = \lambda$ et $E(X(X-1)) =
\lambda^2$ (formule de transfert : $\sum_{k \geq 2} k(k-1) e^{-\lambda} \lambda^k / k! =
\lambda^2 \sum_{j \geq 0} e^{-\lambda} \lambda^j / j! = \lambda^2$), donc
$$V(X) = E(X(X-1)) + E(X) - E(X)^2 = \lambda^2 + \lambda - \lambda^2 = \lambda :$$
pour une loi de Poisson, **l'espérance et la variance valent toutes deux $\lambda$**.
#### 6. Covariance de deux variables aléatoires
Pour $X, Y$ réelles de carrés sommables, la **covariance** est
$$\mathrm{Cov}(X, Y) = E\left((X - E(X))(Y - E(Y))\right).$$
Elle est bien définie (Cauchy-Schwarz garantit que $(X - E(X))(Y - E(Y))$ est d'espérance finie),
et elle est **bilinéaire** :
$$\mathrm{Cov}(X_1 + X_2, Y) = \mathrm{Cov}(X_1, Y) + \mathrm{Cov}(X_2, Y), \qquad
\mathrm{Cov}(\lambda X, Y) = \lambda\, \mathrm{Cov}(X, Y),$$
symétrique ($\mathrm{Cov}(X, Y) = \mathrm{Cov}(Y, X)$), et $\mathrm{Cov}(X, X) = V(X)$.
Interprétation : mesure la dépendance **linéaire** entre $X$ et $Y$ (positive : elles varient dans
le même sens).
#### 7. Relation $\mathrm{Cov}(X, Y) = E(XY) - E(X)E(Y)$ ; cas indépendant
**Théorème** : si $X, Y$ sont de carrés sommables,
$$\mathrm{Cov}(X, Y) = E(XY) - E(X)\, E(Y).$$
*Preuve* : développer $E((X - E(X))(Y - E(Y))) = E(XY) - E(X)E(Y) - E(X)E(Y) + E(X)E(Y)$ par
linéarité.
**Cas des variables indépendantes** : si $X \perp Y$, alors $E(XY) = E(X)E(Y)$ (théorème sur les
variables indépendantes), donc
$$X \perp Y \implies \mathrm{Cov}(X, Y) = 0.$$
**Attention** : la réciproque est **fausse** — une covariance nulle (décorrélation) n'implique pas
l'indépendance (exemple : $X$ uniforme sur $\{-1, 0, 1\}$, $Y = X^2$ : $\mathrm{Cov}(X, Y) =
E(X^3) - E(X)E(X^2) = 0$, mais $Y$ est fonction de $X$, donc fortement dépendante).
#### 8. Variance d'une somme finie
**Théorème** : pour $X_1, \ldots, X_n$ réelles de carrés sommables :
$$V\left(\sum_{i=1}^{n} X_i\right) = \sum_{i=1}^{n} V(X_i) + 2 \sum_{1 \leq i < j \leq n}
\mathrm{Cov}(X_i, X_j).$$
*Preuve* : par bilinéarité de la covariance, $V(\sum X_i) = \mathrm{Cov}(\sum X_i, \sum X_j) =
\sum_{i,j} \mathrm{Cov}(X_i, X_j)$ ; les termes diagonaux donnent les variances, les termes croisés
se regroupent deux à deux par symétrie.
**Cas des variables deux à deux indépendantes** (ou simplement deux à deux non corrélées,
$\mathrm{Cov}(X_i, X_j) = 0$) :
$$V\left(\sum_{i=1}^{n} X_i\right) = \sum_{i=1}^{n} V(X_i).$$
*Application* : si $X_i$ sont des Bernoulli $\mathcal{B}(p)$ **indépendantes**, $S_n = \sum X_i
\sim \mathcal{B}(n, p)$ et $V(S_n) = n\, p(1 - p)$ — la variance de la binomiale. De même
$V(\text{moyenne empirique}) = \frac{V(X)}{n}$ : la moyenne se concentre autour de l'espérance
(germe de la loi des grands nombres).
#### 9. Exemple récapitulatif
Soient $X$ et $Y$ les résultats de deux dés équilibrés **indépendants** ($E(X) = E(Y) =
\frac{7}{2}$, $V(X) = V(Y) = E(X^2) - \frac{49}{4} = \frac{91}{6} - \frac{49}{4} = \frac{35}{12}$).
- $V(X + Y) = V(X) + V(Y) = \frac{35}{6}$ (indépendance) ;
- $V(2X - 3) = 4\,V(X) = \frac{35}{3}$ ;
- $\mathrm{Cov}(X, Y) = 0$ (indépendance) et $\mathrm{Cov}(X, X) = V(X) = \frac{35}{12}$ ;
- $X^* = \frac{X - 7/2}{\sqrt{35/12}}$ est centrée réduite.
#### 1. Inégalité de Markov
**Théorème** : soit $X$ une VAD **positive** (a.s.) d'espérance finie $E(X)$. Alors, pour tout
$c > 0$ :
$$P(X \geq c) \;\leq\; \frac{E(X)}{c}.$$
*Preuve* : sur l'événement $(X \geq c)$, on a $c\,\mathbb{1}_{(X \geq c)} \leq X$ (et l'inégalité
reste vraie ailleurs car le membre de gauche est nul). Par **croissance de l'espérance** :
$$c\,P(X \geq c) = E\big(c\,\mathbb{1}_{(X \geq c)}\big) \leq E(X).$$
La borne ne nécessite que $E(X)$ (pas de variance) ; elle est utile pour majorer la probabilité de
grandes valeurs d'une variable positive dont on ne connaît que l'espérance. Exemple : $E(X) = 1$
donne $P(X \geq 100) \leq \frac{1}{100}$.
*Variante* : pour $X$ quelconque et $c > 0$ : $P(|X| \geq c) \leq \frac{E(|X|)}{c}$.
#### 2. Inégalité de Bienaymé-Tchebychev
**Théorème** : soit $X$ une VAD de **carré sommable** ($E(X^2) < +\infty$). Alors, pour tout $c >
0$ :
$$P\big(|X - E(X)| \geq c\big) \;\leq\; \frac{V(X)}{c^2}.$$
*Preuve* : on applique l'inégalité de Markov à la variable **positive**
$Y = (X - E(X))^2$ avec $c^2$ :
$$P\big(|X - E(X)| \geq c\big) = P\big((X - E(X))^2 \geq c^2\big) \leq \frac{E\big((X - E(X))^2\big)}{c^2} = \frac{V(X)}{c^2}.$$
**Interprétation** : la probabilité que $X$ s'écarte de son espérance de plus de $c$ est majorée
par le quotient de sa variance par $c^2$ — une variable de faible variance est **concentrée** autour
de son espérance. *Attention* : la version avec inégalité stricte $P(|X - E(X)| > c) \leq
\frac{V(X)}{c^2}$ est également vraie (même démonstration).
#### 3. Loi faible des grands nombres
**Théorème (loi faible des grands nombres)** : soit $(X_n)_{n \geq 1}$ une suite de variables
aléatoires **i.i.d.** (indépendantes et identiquement distribuées) de **variance finie**. On note
$$S_n = \sum_{k=1}^{n} X_k, \qquad m = E(X_1).$$
Alors, pour tout $\varepsilon > 0$ :
$$P\left(\left|\frac{S_n}{n} - m\right| \geq \varepsilon\right) \xrightarrow[n \to +\infty]{} 0.$$
La **moyenne empirique** $\frac{S_n}{n}$ converge en probabilité vers l'espérance commune $m$.
**Retrouver la borne explicite** : la variable $\frac{S_n}{n}$ a pour espérance
$$E\left(\frac{S_n}{n}\right) = \frac{1}{n}\sum_{k=1}^{n} E(X_k) = m$$
(linéarité, sans hypothèse d'indépendance), et pour variance
$$V\left(\frac{S_n}{n}\right) = \frac{1}{n^2} V(S_n) = \frac{n\, \sigma^2}{n^2} = \frac{\sigma^2}{n},$$
où $\sigma = \sigma(X_1)$ : la linéarité de la variance avec le terme croisé nul exige
l'**indépendance** (ou au minimum la non-corrélation deux à deux) des $X_k$. L'inégalité de
Bienaymé-Tchebychev appliquée à $\frac{S_n}{n}$ donne alors, pour tout $\varepsilon > 0$ :
$$\boxed{\;P\left(\left|\frac{S_n}{n} - m\right| \geq \varepsilon\right) \;\leq\;
\frac{\sigma^2}{n\,\varepsilon^2}\;}$$
qui tend vers $0$ quand $n \to +\infty$, ce qui prouve la loi faible des grands nombres.
**Interprétation** : en répétant $n$ fois la même expérience, la fréquence (ou la moyenne) observée
se concentre autour de l'espérance théorique — c'est le fondement de l'**ajustement
expérimental** des probabilités (avec des bornes quantitatives : par exemple, pour une pièce
équilibrée ($m = \frac{1}{2}$, $\sigma^2 = \frac{1}{4}$), la probabilité que la fréquence de pile
s'écarte de $\frac{1}{2}$ de plus de $0{,}01$ est majorée par $\frac{2500}{n}$).
#### 4. Exemple récapitulatif
Dé équilibré : $X_1, \ldots, X_n$ i.i.d. uniformes sur $\{1, \ldots, 6\}$, avec $m = E(X_1) =
\frac{7}{2}$ et $\sigma^2 = V(X_1) = \frac{35}{12}$.
- Loi faible des grands nombres : $\frac{S_n}{n} \to \frac{7}{2}$ en probabilité.
- Borne explicite : $P\left(\left|\frac{S_n}{n} - \frac{7}{2}\right| \geq 1\right) \leq
\frac{35/12}{n} = \frac{35}{12\,n}$ ; pour $n = 350$ : au plus $\frac{1}{120} \approx 0{,}8\%$.
- Comparaison : la majoration est grossière mais **quantitative** et ne requiert que la variance.
#### 1. Définition, rayon, convergence normale, continuité
Soit $X$ une VAD **à valeurs dans $\mathbb{N}$**. Sa **fonction génératrice** est
$$G_X(t) = E\left(t^X\right) = \sum_{n \geq 0} P(X = n)\, t^n \qquad (t \in \mathbb{R}),$$
la dernière égalité venant de la **formule de transfert** (pour $t$ tel que la famille
$(t^n P(X = n))$ soit sommable ; pour $|t| \leq 1$ elle l'est toujours).
**Propriétés** :
- c'est une série entière dont les coefficients vérifient $0 \leq P(X = n) \leq 1$ : son rayon de
convergence $R$ vérifie $R \geq 1$ ;
- elle **converge normalement sur $[-1, 1]$** : $\sum_n |P(X = n)| \cdot |t|^n \leq \sum_n P(X = n)
= 1$ pour $|t| \leq 1$ ;
- par conséquent $G_X$ est **continue sur $[-1, 1]$** (limite uniforme de polynômes), et même de
classe $\mathcal{C}^{\infty}$ sur $]-1, 1[$.
#### 2. Fonctions génératrices des lois usuelles
- **Bernoulli** $\mathcal{B}(p)$ : $X \in \{0, 1\}$, donc $G_X(t) = P(X = 0) + t\,P(X = 1) = 1 - p
+ p\,t$ (polynôme de degré $1$).
- **Binomiale** $\mathcal{B}(n, p)$ : par le binôme de Newton,
$$G_X(t) = \sum_{k=0}^{n} \binom{n}{k} p^k (1-p)^{n-k} t^k = \left((1 - p) + p\,t\right)^n.$$
- **Géométrique** $\mathcal{G}(p)$ : $G_X(t) = \sum_{k \geq 1} p(1-p)^{k-1} t^k =
\frac{p\,t}{1 - (1 - p)\,t}$ pour $|t| < \frac{1}{1-p}$ (rayon $\frac{1}{1-p} > 1$).
- **Poisson** $\mathcal{P}(\lambda)$ : $G_X(t) = \sum_{k \geq 0} e^{-\lambda} \frac{(\lambda
t)^k}{k!} = e^{\lambda(t - 1)}$ (rayon $+\infty$).
#### 3. La fonction génératrice caractérise la loi
**Théorème** : la loi d'une VAD $X$ à valeurs dans $\mathbb{N}$ est **caractérisée** par sa
fonction génératrice : si $X$ et $Y$ sont deux VAD à valeurs dans $\mathbb{N}$ et si $G_X = G_Y$
sur un intervalle ouvert contenant $0$ (par exemple sur $]-1, 1[$), alors $X \sim Y$.
*Preuve* : deux séries entières égales au voisinage de $0$ ont des coefficients égaux (unicité du
développement en série entière) : $P(X = n) = P(Y = n)$ pour tout $n$.
Conséquence pratique : pour montrer qu'une variable suit une loi usuelle, il suffit d'identifier sa
fonction génératrice à celle de la loi usuelle.
#### 4. Espérance et variance via $G_X$
**Théorème (espérance)** : $X$ est **d'espérance finie** si et seulement si $G_X$ est **dérivable
en $1$** (limite à gauche du taux d'accroissement finie). Dans ce cas :
$$E(X) = G_X'(1) \qquad \left(G_X'(1) = \lim_{t \to 1^-} \frac{G_X(t) - G_X(1)}{t - 1} =
\sum_{n \geq 1} n\,P(X = n)\right).$$
*Preuve (idée)* : sur tout $[0, r]$ avec $r < 1$, la série dérivée $\sum n P(X = n) t^{n-1}$
converge normalement ; la dérivation terme à terme donne $G_X'(t) = \sum n P(X=n) t^{n-1}$ pour $t
\in [0, 1[$, et $G_X'(1^-) = E(X)$ par convergence croissante de la série des termes positifs
$n P(X = n)$ vers $E(X)$ (cas positif, tout est permis).
**Utilisation pour $V(X)$** : par la formule de transfert, $G_X''(1) = E(X(X - 1))$ lorsque $X^2$
est sommable, d'où
$$V(X) = E(X^2) - E(X)^2 = G_X''(1) + G_X'(1) - \big(G_X'(1)\big)^2.$$
**Vérifications** : $\mathcal{P}(\lambda)$ : $G_X'(t) = \lambda e^{\lambda(t-1)}$, $G_X''(t) =
\lambda^2 e^{\lambda(t-1)}$, donc $E(X) = \lambda$ et $V(X) = \lambda^2 + \lambda - \lambda^2 =
\lambda$ ; $\mathcal{B}(n, p)$ : $G'(1) = np$, $G''(1) = n(n-1)p^2$, donc $V(X) = n(n-1)p^2 + np -
n^2p^2 = np(1-p)$.
#### 5. Fonction génératrice d'une somme de variables indépendantes
**Théorème** : si $X$ et $Y$ sont des VAD à valeurs dans $\mathbb{N}$ **indépendantes**, alors
$$G_{X + Y}(t) = G_X(t)\, G_Y(t) \qquad (\text{au moins pour } |t| \leq 1).$$
*Preuve* : par indépendance, $E(t^{X + Y}) = E(t^X\, t^Y) = E(t^X)\,E(t^Y)$ (le théorème
$E(XY) = E(X)E(Y)$ pour variables indépendantes s'applique aux variables $t^X$ et $t^Y$ bornées) ;
on retrouve aussi le produit de Cauchy des séries entières $\sum_n P(X=n)t^n \sum_m P(Y=m)t^m$.
**Extension** : pour $X_1, \ldots, X_k$ indépendantes à valeurs dans $\mathbb{N}$ :
$$G_{X_1 + \cdots + X_k}(t) = \prod_{i=1}^{k} G_{X_i}(t).$$
**Application (stabilité des lois)** : la somme de $n$ Bernoulli $\mathcal{B}(p)$ indépendantes a
pour fonction génératrice $(1 - p + pt)^n$ : c'est une **binomiale** $\mathcal{B}(n, p)$ ; la somme
de $k$ Poisson $\mathcal{P}(\lambda_i)$ indépendantes a pour fonction génératrice
$e^{(\sum \lambda_i)(t-1)}$ : c'est une **Poisson** $\mathcal{P}(\sum \lambda_i)$.
#### 6. Exemple récapitulatif
Soit $(X_k)_{1 \leq k \leq n}$ une suite i.i.d. de Bernoulli $\mathcal{B}(p)$ et $S_n = X_1 +
\cdots + X_n$.
- **Fonction génératrice** : chaque $G_{X_k}(t) = 1 - p + pt$, donc par indépendance
$G_{S_n}(t) = (1 - p + pt)^n$ : par caractérisation, $S_n \sim \mathcal{B}(n, p)$.
- **Espérance** : $G_{S_n}'(t) = np(1 - p + pt)^{n-1}$ donne $E(S_n) = np$.
- **Variance** : $G_{S_n}''(t) = n(n-1)p^2(1 - p + pt)^{n-2}$ donne $E(S_n(S_n - 1)) = n(n-1)p^2$
et $V(S_n) = n(n-1)p^2 + np - n^2p^2 = np(1-p)$.
- **Limite de Poisson** : si $n \to +\infty$ et $p \to 0$ avec $np \to \lambda$, alors
$G_{S_n}(t) = (1 + \frac{\lambda(t-1) + o(1)}{n})^n \to e^{\lambda(t-1)} = G_{\mathcal{P}(\lambda)}
(t)$ : $S_n$ converge en loi vers $\mathcal{P}(\lambda)$ (loi des événements rares).
#### 1. Univers, événements, vocabulaire ensembliste
L'**univers** $\Omega$ est l'ensemble des **issues** (résultats possibles) d'une expérience aléatoire ; on se limite ici au cas d'un univers **fini**. Un **événement** est une partie de $\Omega$. Le lien avec le vocabulaire ensembliste :
- l'événement **certain** est $\Omega$ ; l'événement **impossible** est $\emptyset$ ;
- $A \cap B$ : « $A$ **et** $B$ » (réalisé si les deux le sont) ;
- $A \cup B$ : « $A$ **ou** $B$ » (réalisé si au moins l'un l'est) ;
- $\bar{A}$ : événement **contraire** de $A$ (« non $A$ ») ;
- $A \subset B$ : « $A$ **implique** $B$ » (si $A$ se réalise, $B$ aussi).
#### 2. Événements élémentaires ; disjoints ; système complet
- Un événement **élémentaire** est un **singleton** $\{\omega\}$ : il se réalise si l'issue est exactement $\omega$.
- Des événements $A_1, \ldots, A_r$ sont **disjoints** (ou **incompatibles**) si $A_i \cap A_j = \emptyset$ pour $i \neq j$ : deux d'entre eux ne peuvent pas se réaliser simultanément.
- Un **système complet d'événements** est une famille d'événements **non vides**, **disjoints deux à deux**, et dont la **réunion** vaut $\Omega$ : toute issue réalise exactement un des événements du système (comme des « branches » d'un arbre).
#### 3. Variable aléatoire ; notations
Une **variable aléatoire** $X$ est une **application** définie sur l'univers $\Omega$ à valeurs dans un ensemble $E$ (souvent $\mathbb{R}$) : elle associe à chaque issue $\omega$ la valeur $X(\omega)$. Pour $A \subset E$, l'événement
$$\{X \in A\} = \{\omega \in \Omega : X(\omega) \in A\} = X^{-1}(A)$$
(se note aussi $(X \in A)$) est « $X$ prend ses valeurs dans $A$ ». De même, $\{X = x\}$, $\{X \leq x\}$, $\{X > x\}$, etc. sont des **événements** de $\Omega$ — on peut donc leur appliquer une probabilité. Exemple : pour un lancer de dé, $X(\omega) = \omega^2$ et $\{X \leq 9\} = \{1, 2, 3\}$.
#### 1. Définition ; convention
Soit $B$ un événement de probabilité **non nulle** ($P(B) > 0$). La **probabilité conditionnelle de $A$ sachant $B$** est définie par
$$P(A \mid B) = P_B(A) = \frac{P(A \cap B)}{P(B)}.$$
C'est la probabilité que $A$ se réalise « vu que $B$ s'est réalisé » (l'univers est restreint à $B$). **Convention** : par convention, $P(A \mid B)\,P(B) = 0$ lorsque $P(B) = 0$ — autrement dit, le produit $P(A \mid B)\,P(B)$ vaut toujours $P(A \cap B)$, même si $P(B) = 0$.
#### 2. $P_B$ est une probabilité
Pour $P(B) > 0$, l'application $P_B : A \mapsto P_B(A) = \dfrac{P(A \cap B)}{P(B)}$ est une **probabilité** sur $\Omega$ :
- $P_B(\Omega) = \dfrac{P(\Omega \cap B)}{P(B)} = \dfrac{P(B)}{P(B)} = 1$ ;
- $P_B$ est additive sur les événements disjoints (la division par $P(B)$ conserve l'additivité).
Elle se représente comme une probabilité sur l'univers **restreint** à $B$ : les issues de $B$, renormalisées par $P(B)$.
#### 3. Probabilités composées
La définition se réécrit sous la forme (**probabilités composées**) :
$$P(A \cap B) = P(B)\, P(A \mid B),$$
et, en généralisant à trois événements (on part de l'événement « le plus tôt ») :
$$P(A \cap B \cap C) = P(A)\, P(B \mid A)\, P(C \mid A \cap B).$$
#### 4. Formule des probabilités totales
Si $(B_1, \ldots, B_r)$ est un **système complet** d'événements de probabilités non nulles, alors pour tout événement $A$ :
$$P(A) = \sum_{i=1}^{r} P(A \cap B_i) = \sum_{i=1}^{r} P(B_i)\, P(A \mid B_i).$$
On découpe $A$ selon les branches du système complet et on pondère chaque branche par sa probabilité.
#### 5. Formule de Bayes
Pour $P(A) > 0$ et $P(B) > 0$ :
$$P(B \mid A) = \frac{P(A \mid B)\, P(B)}{P(A)}.$$
Avec un système complet $(B_1, \ldots, B_r)$ et $P(A) > 0$ :
$$P(B_i \mid A) = \frac{P(A \mid B_i)\, P(B_i)}{\displaystyle\sum_{j=1}^{r} P(A \mid B_j)\, P(B_j)},$$
ce qui permet d'« inverser » le conditionnement (des causes vers les effets et retour).
#### 1. Définition
Les variables aléatoires $X$ et $Y$, définies sur $\Omega$ et à valeurs dans $E$ et $F$, sont **indépendantes** si pour tous $A \subset E$ et $B \subset F$, les événements $(X \in A)$ et $(Y \in B)$ sont **indépendants** :
$$P\big((X \in A) \cap (Y \in B)\big) = P(X \in A)\, P(Y \in B).$$
On le note simplement « $X$ et $Y$ sont indépendantes ».
#### 2. Équivalence par la loi conjointe
Il suffit de tester les singletons : $X$ et $Y$ sont indépendantes **si et seulement si** la loi conjointe **se factorise** :
$$P\big((X, Y) = (x, y)\big) = P(X = x)\, P(Y = y) \qquad \forall (x, y) \in E \times F.$$
C'est la caractérisation pratique : la distribution conjointe est le **produit** des lois marginales.
#### 3. Extension aux $n$-uplets ; expériences répétées
Les variables $X_1, \ldots, X_n$ sont **indépendantes** si, pour tous $x_1, \ldots, x_n$,
$$P(X_1 = x_1, \ldots, X_n = x_n) = P(X_1 = x_1) \cdots P(X_n = x_n).$$
Cela permet de **modéliser $n$ expériences aléatoires indépendantes** par une suite finie $(X_i)_{1 \leq i \leq n}$ de variables aléatoires indépendantes : $X_i$ décrit la $i$-ème expérience, et les issues des expériences ne s'influencent pas.
#### 4. Somme de Bernoulli indépendantes
Si $X_1, \ldots, X_n$ sont **indépendantes** et de loi $\mathcal{B}(p)$, alors
$$X_1 + \cdots + X_n \sim \mathcal{B}(n, p).$$
Interprétation : $X_1 + \cdots + X_n$ est le **nombre de succès** lors de la répétition de $n$ expériences indépendantes ayant chacune la probabilité $p$ de succès ; en effet $P(\sum X_i = k) = \binom{n}{k} p^k (1 - p)^{n-k}$ (choisir les $k$ expériences qui réussissent).
#### 5. Stabilité par fonctions ; lemme des coalitions
- Si $X$ et $Y$ sont indépendantes, alors $f(X)$ et $g(Y)$ sont indépendantes (pour $f$, $g$ quelconques) : l'indépendance se **transmet aux fonctions**.
- **Lemme des coalitions** : si $X_1, \ldots, X_n$ sont indépendantes, alors les variables $f(X_1, \ldots, X_m)$ et $g(X_{m+1}, \ldots, X_n)$ sont indépendantes : deux fonctions portant sur des **blocs disjoints** de variables indépendantes restent indépendantes. Extension : pour plus de deux coalitions formant des blocs disjoints, les variables images sont encore indépendantes.
#### 1. Définition ; lien avec la probabilité conditionnelle
Deux événements $A$ et $B$ sont **indépendants** si
$$P(A \cap B) = P(A)\, P(B).$$
**Attention** : indépendants $\neq$ incompatibles. Si $A \cap B = \emptyset$ avec $P(A) > 0$ et $P(B) > 0$, alors $P(A \cap B) = 0 \neq P(A)P(B)$ : des événements incompatibles de probabilités strictement positives ne sont **jamais** indépendants. Si $P(B) > 0$, l'indépendance de $A$ et $B$ équivaut à
$$P(A \mid B) = P(A) :$$
la réalisation de $B$ ne modifie pas la probabilité de $A$.
#### 2. Famille finie d'événements indépendants
Une famille finie $(A_1, \ldots, A_n)$ est une famille d'événements **indépendants** si, pour **toute** sous-famille $A_{i_1}, \ldots, A_{i_k}$ ($1 \leq i_1 < \cdots < i_k \leq n$),
$$P(A_{i_1} \cap \cdots \cap A_{i_k}) = P(A_{i_1}) \cdots P(A_{i_k}).$$
La condition porte sur toutes les sous-familles (pas seulement l'intersection totale). **Point essentiel** : l'**indépendance deux à deux n'implique pas l'indépendance** d'une famille — il existe des familles de trois événements vérifiant les trois conditions par paires mais pas la condition sur le triplet.
#### 3. Stabilité par passage au contraire
Si $A$ et $B$ sont indépendants, alors $A$ et $\bar{B}$ sont indépendants (et de même $\bar{A}$ avec $B$, ainsi que $\bar{A}$ avec $\bar{B}$) :
$$P(A \cap \bar{B}) = P(A) - P(A \cap B) = P(A) - P(A)P(B) = P(A)\big(1 - P(B)\big) = P(A)\, P(\bar{B}).$$
**Extension** à une famille de $n$ événements indépendants : en remplaçant une partie quelconque de ses membres par leurs événements contraires, on obtient encore une famille d'événements indépendants.
#### 1. Inégalité de Markov
Pour $X$ variable aléatoire réelle **positive** et tout $\alpha > 0$ :
$$P(X \geq \alpha) \ \leq\ \frac{E(X)}{\alpha}.$$
Preuve : $\alpha\, \mathbf{1}_{\{X \geq \alpha\}} \leq X$ (inégalité ponctuelle) ; en prenant l'espérance (croissance) : $\alpha\, P(X \geq \alpha) \leq E(X)$. C'est l'inégalité la plus brute : elle ne requiert que la **positivité** de $X$.
#### 2. Application : inégalités de concentration
L'inégalité de Markov fournit des **inégalités de concentration** : la probabilité que $X$ s'écarte beaucoup de $0$ est contrôlée par son espérance. Si $X \geq 0$ est d'espérance $\mu$ petite, alors $P(X \geq \alpha)$ est petite pour $\alpha \gg \mu$ — une variable d'espérance faible est **rarement grande**.
#### 3. Inégalité de Bienaymé-Tchebychev
Pour $X$ variable aléatoire réelle d'espérance $E(X)$ et de variance $V(X)$, et tout $\alpha > 0$ :
$$P\big(|X - E(X)| \geq \alpha\big) \ \leq\ \frac{V(X)}{\alpha^2}.$$
Preuve : appliquer Markov à la variable **positive** $(X - E(X))^2$ avec le seuil $\alpha^2$ :
$$P\big(|X - E(X)| \geq \alpha\big) = P\big((X - E(X))^2 \geq \alpha^2\big) \leq \frac{E\big((X - E(X))^2\big)}{\alpha^2} = \frac{V(X)}{\alpha^2}.$$
Elle contrôle la **déviation** de $X$ autour de son espérance, en fonction de la variance (une variance petite interdit les grandes déviations).
#### 4. Moyenne de variables indépendantes de même loi ; interprétation fréquentiste
Soient $X_1, \ldots, X_n$ des variables aléatoires **indépendantes** de même loi que $X$ (espérance $\mu$, variance $\sigma^2$), et
$$\bar{X}_n = \frac{1}{n} \sum_{i=1}^n X_i$$
la **moyenne empirique**. Alors $E(\bar{X}_n) = \mu$ (linéarité) et $V(\bar{X}_n) = \frac{\sigma^2}{n}$ (indépendance), d'où par Bienaymé-Tchebychev :
$$P\big(|\bar{X}_n - \mu| \geq \alpha\big) \ \leq\ \frac{\sigma^2}{n\, \alpha^2} \ \xrightarrow[n \to \infty]{}\ 0.$$
**Interprétation fréquentiste** : la moyenne empirique de $n$ répétitions indépendantes se **concentre** autour de l'espérance quand $n$ grandit — c'est le fondement de la loi (faible) des grands nombres : la **fréquence** observée d'un succès tend vers sa probabilité $p$.
Sur un ensemble $I$ **au plus dénombrable**, une famille $(x_i)_{i\in I}$ de réels (ou complexes) est **sommable** si $\sup_{J\subset I,\ \text{fini}}\sum_{i\in J}|x_i|<+\infty$.
- **Sommabilité** : bornitude des sommes finies $\sup\sum_{J}|x_i|<\infty$.
- **CNS (positifs)** : $\sum_i x_i<+\infty$ ($x_i\geq0$).
- **Propriétés** : commutativité (somme indépendante de l'ordre) ; sommation par paquets.
- **Lien** : $L^1$ sur un espace dénombrable $\leftrightarrow$ familles sommables.
1. **Tester** la sommabilité (bornitude ou positivité).
2. **Utiliser** la commutativité pour réordonner/paqueter.
3. **Appliquer** aux espérances discrètes.
- **Piège classique** : convergence simple $\neq$ sommabilité ; réordonner une série semi-convergente (interdit).
- $\sum_{n\geq1}1/n^2$ sommable ; $\sum(-1)^n/n$ converge mais non sommable.
```mermaid
graph TD
F["Famille sur I denombrable"] --> S["Sommable : sup des sommes finies fini"]
S --> C["Commutativite (ordre indifferent)"]
S --> P["Sommation par paquets"]
```
Chapitre : **probabilité conditionnelle** $P(A|B)=\frac{P(A\cap B)}{P(B)}$ et ses conséquences (probabilités composées, totales, Bayes), modélisant l'information partielle.
- **Conditionnement** : $P(A|B)=\frac{P(A\cap B)}{P(B)}$.
- **Composées** : $P(\bigcap A_i)=\prod P(A_i\mid\ldots)$.
- **Totales** : $P(A)=\sum_iP(B_i)P(A|B_i)$ (partition).
- **Bayes** : inversion du conditionnement.
1. **Représenter** par un arbre pondéré.
2. **Appliquer** totales/composées.
3. **Inverser** par Bayes.
- **Piège classique** : $P(B)>0$ ; confondre $P(A|B)$ et $P(B|A)$.
- $P(A)=\sum_iP(B_i)P(A|B_i)$ (système complet $(B_i)$).
```mermaid
graph TD
C["Probabilites conditionnelles"] --> D["P(A|B) = P(A inter B)/P(B)"]
C --> CO["Composees"]
C --> TO["Totales"]
C --> BA["Bayes"]
```
Chapitre : **espérance** $E(X)=\sum_x x\,P(X=x)$ d'une variable aléatoire **discrète** (réelle ou complexe), lorsqu'elle est d'espérance finie (sommabilité).
- **Définition** : $E(X)=\sum_x x p_x$ (sommable).
- **Linéarité** : $E(aX+bY)=aE(X)+bE(Y)$.
- **Transfert** : $E(f(X))=\sum_x f(x)p_x$.
- **Moments** : $E(X^n)$, variance, génératrice.
1. **Vérifier** la sommabilité.
2. **Calculer** $E(X)$ (loi ou transfert).
3. **Utiliser** la linéarité.
- **Piège classique** : sommabilité absolue ; espérance infinie possible pour $X\geq0$.
- $X\sim\mathcal{P}(\lambda)$ : $E(X)=\lambda$.
```mermaid
graph TD
E["Esperance d'une VA discrete"] --> D["E(X) = sum x P(X=x) (sommable)"]
E --> L["Lineaire"]
E --> T["Transfert"]
```
Chapitre : **variance** $V(X)=E(X^2)-E(X)^2$, **écart type** $\sigma(X)=\sqrt{V(X)}$, **covariance** $\mathrm{Cov}(X,Y)=E(XY)-E(X)E(Y)$.
- **Variance** : $V(X)=E[(X-E(X))^2]\geq0$.
- **Écart type** : $\sigma=\sqrt{V}$.
- **Covariance** : $\mathrm{Cov}=E(XY)-E(X)E(Y)$.
- **Somme** : $V(X+Y)=V(X)+V(Y)+2\mathrm{Cov}$.
1. **Calculer** $E(X)$, $E(X^2)$.
2. **Appliquer** $V=E(X^2)-E(X)^2$.
3. **Utiliser** Cov pour les sommes.
- **Piège classique** : $V(X+Y)$ sans décorrélation ; confondre variance et écart type.
- $X\sim\mathcal{B}(n,p)$ : $V=np(1-p)$, $\sigma=\sqrt{np(1-p)}$.
```mermaid
graph TD
V["Variance / ecart type / covariance"] --> A["V(X) = E(X^2)-E(X)^2"]
V --> S["sigma = sqrt(V)"]
V --> C["Cov(X,Y) = E(XY)-E(X)E(Y)"]
```
Teste-toi : 3 questions
Question 1/3
Définitions liées
🎯 Créez votre boîte de Leitner pour revoir ces cartes au bon moment
Révisions espacées, QCM corrigés, suivi de progression — gratuit pendant la bêta.
Créer mon compte