Calcul différentiel
Sommaire du cours
#### 1. Dérivée en un point selon un vecteur
Soit $\Omega$ un ouvert de $\mathbb{R}^p$, $f : \Omega \to \mathbb{R}$, $a \in \Omega$ et $v \in
\mathbb{R}^p$ (avec $a + tv \in \Omega$ pour $t$ voisin de $0$). La **dérivée de $f$ en $a$ selon
le vecteur $v$** est, lorsqu'elle existe,
$$D_v f(a) = \lim_{h \to 0} \frac{f(a + h v) - f(a)}{h} \in \mathbb{R}.$$
Elle se calcule en restreignant $f$ à la droite affine $a + \mathbb{R}v$ : c'est la dérivée usuelle
de la fonction d'une variable $t \mapsto f(a + tv)$ en $t = 0$. Remarque : $D_v f(a)$ est
**homogène en $v$** lorsque la différentielle existe ($D_{\lambda v} f(a) = \lambda D_v f(a)$),
mais l'existence de $D_v f(a)$ pour tout $v$ ne suffit pas à faire de $v \mapsto D_v f(a)$ une
forme linéaire.
#### 2. Dérivées partielles d'ordre 1
Pour $v = e_i$ ($i$-ième vecteur de la base canonique de $\mathbb{R}^p$), la dérivée selon $e_i$
s'appelle la **dérivée partielle d'ordre 1** de $f$ en $a$ (par rapport à la $i$-ème variable) :
$$\frac{\partial f}{\partial x_i}(a) = \partial_i f(a) = D_{e_i} f(a) = \lim_{h \to 0}
\frac{f(a_1, \ldots, a_i + h, \ldots, a_p) - f(a)}{h}.$$
Concrètement, on **gèle** les autres variables et on dérive la fonction d'une variable obtenue.
Exemple : pour $f(x, y) = x^2 y + e^{xy}$ : $\frac{\partial f}{\partial x}(x, y) = 2xy + y
e^{xy}$, $\frac{\partial f}{\partial y}(x, y) = x^2 + x e^{xy}$.
#### 3. Classe $\mathcal{C}^1$ sur $\Omega$
Une fonction $f : \Omega \to \mathbb{R}$ est de **classe $\mathcal{C}^1$ sur $\Omega$** si ses
dérivées partielles d'ordre $1$ **existent** en tout point de $\Omega$ et sont **continues** sur
$\Omega$. On note $\mathcal{C}^1(\Omega, \mathbb{R})$ l'ensemble de ces fonctions. Exemples :
toute fonction polynomiale ou rationnelle (définie là où le dénominateur ne s'annule pas) est de
classe $\mathcal{C}^{\infty}$ donc $\mathcal{C}^1$ ; les restrictions de telles fonctions aussi.
#### 4. Opérations sur les fonctions de classe $\mathcal{C}^1$
L'ensemble $\mathcal{C}^1(\Omega, \mathbb{R})$ est stable par :
- **combinaisons linéaires** : $\lambda f + \mu g$ ;
- **produit** : $\frac{\partial (fg)}{\partial x_i} = \frac{\partial f}{\partial x_i} g +
f\,\frac{\partial g}{\partial x_i}$ (règle de Leibniz, variable par variable) ;
- **quotient** : $f/g$ est de classe $\mathcal{C}^1$ là où $g \neq 0$ ;
- **composition « chaîne simple »** : si $\varphi : J \to \mathbb{R}^p$ est de classe
$\mathcal{C}^1$ sur l'intervalle $J$ et $f$ de classe $\mathcal{C}^1$ sur un ouvert contenant
$\varphi(J)$, alors $f \circ \varphi$ est de classe $\mathcal{C}^1$ sur $J$ et
$$(f \circ \varphi)'(t) = \sum_{i=1}^{p} \frac{\partial f}{\partial x_i}(\varphi(t))\,
\varphi_i'(t).$$
#### 5. Développement limité d'ordre 1 ; continuité
**Théorème** : si $f$ est de classe $\mathcal{C}^1$ sur $\Omega$ et $a \in \Omega$, alors $f$ admet
en $a$ un **développement limité d'ordre $1$** :
$$f(a + h) = f(a) + \sum_{i=1}^{p} \frac{\partial f}{\partial x_i}(a)\, h_i + o\big(\|h\|\big)
\quad (h \to 0, \ h \text{ petit}).$$
*Preuve (esquisse)* : par le théorème des accroissements finis à plusieurs variables — écrire
$f(a + h) - f(a)$ comme somme des variations le long des axes (chemin en escalier), chaque
variation étant contrôlée par une dérivée partielle continue.
**Conséquence** : une fonction de classe $\mathcal{C}^1$ sur $\Omega$ est **continue sur
$\Omega$** (le DL d'ordre 1 donne $f(a + h) \to f(a)$ quand $h \to 0$).
*Attention* : l'existence des dérivées partielles en un point ne suffit pas — la fonction $g(x, y)
= \frac{xy}{x^2 + y^2}$ prolongée par $g(0,0) = 0$ admet des dérivées partielles en $(0,0)$ (toutes
nulles) mais n'y est pas continue.
#### 6. Différentielle de $f$ en $a$
**Définition** : si $f$ est de classe $\mathcal{C}^1$ sur $\Omega$ et $a \in \Omega$, la
**différentielle de $f$ en $a$**, notée $\mathrm{d}f(a)$, est la **forme linéaire** sur
$\mathbb{R}^p$ :
$$\mathrm{d}f(a) : h = (h_1, \ldots, h_p) \longmapsto \sum_{i=1}^{p} \frac{\partial
f}{\partial x_i}(a)\, h_i,$$
c'est-à-dire $\mathrm{d}f(a) \cdot h = \langle \nabla f(a), h \rangle$ où $\nabla f(a) =
\left(\frac{\partial f}{\partial x_1}(a), \ldots, \frac{\partial f}{\partial x_p}(a)\right)$ est
le **gradient** de $f$ en $a$.
Avec cette notation, le DL d'ordre 1 s'écrit $f(a + h) = f(a) + \mathrm{d}f(a)\cdot h +
o(\|h\|)$, et $D_v f(a) = \mathrm{d}f(a)\cdot v$ pour tout vecteur $v$.
*Exemple* : pour $f(x, y) = x^2 y$ en $a = (1, 0)$ : $\mathrm{d}f(a)\cdot(h_1, h_2) = 2xy|_a
h_1 + x^2|_a h_2 = 0 \cdot h_1 + 1 \cdot h_2 = h_2$.
#### 7. Exemple récapitulatif
Soit $f(x, y) = x^2 y + e^{xy}$ sur $\Omega = \mathbb{R}^2$.
- Dérivées partielles : $\partial_x f = 2xy + y e^{xy}$, $\partial_y f = x^2 + x e^{xy}$,
continues sur $\mathbb{R}^2$ : $f$ est de classe $\mathcal{C}^1$ (même $\mathcal{C}^{\infty}$).
- Différentielle en $a = (1, 0)$ : $\partial_x f(1,0) = 0$, $\partial_y f(1,0) = 1 + e^0 = 1 + 1
= 2$... par le calcul : $\partial_y f(1, 0) = 1^2 + 1 \cdot e^{0} = 2$. Donc
$\mathrm{d}f(1, 0)\cdot(h_1, h_2) = 2 h_2$, et
$$f(1 + h_1, h_2) = 1 + 2 h_2 + o(\|(h_1, h_2)\|).$$
- Dérivée selon $v = (1, 1)$ en $(1, 0)$ : $D_v f(1, 0) = \mathrm{d}f(1,0)\cdot(1,1) = 2$.
#### 1. Dérivabilité en un point
Soient $I$ un intervalle de $\mathbb{R}$, $a \in I$ et $f : I \to \mathbb{R}^n$ (ou à valeurs dans
un espace vectoriel normé). On dit que $f$ est **dérivable en $a$** si le **taux d'accroissement**
$$\frac{f(t) - f(a)}{t - a}$$
admet une **limite finie** dans $\mathbb{R}^n$ lorsque $t \to a$, $t \neq a$ ; cette limite est la
**dérivée** $f'(a)$ de $f$ en $a$.
**Caractérisation par le DL d'ordre un** : $f$ est dérivable en $a$ si et seulement s'il existe un
vecteur $v \in \mathbb{R}^n$ tel que
$$f(t) = f(a) + (t - a)\, v + o(t - a) \quad (t \to a),$$
et alors $v = f'(a)$. (Le « $o$ » est pris pour la norme de $\mathbb{R}^n$.)
**Traduction par les coordonnées** (dans la base canonique) : en notant $f = (f_1, \ldots, f_n)$,
$$f \text{ dérivable en } a \iff f_1, \ldots, f_n \text{ dérivables en } a,
\qquad \text{et alors } f'(a) = \begin{pmatrix} f_1'(a) \\ \vdots \\ f_n'(a) \end{pmatrix}.$$
La dérivation des fonctions vectorielles est donc une dérivation **coordonnée par coordonnée**.
#### 2. Dérivabilité sur un intervalle ; interprétation cinématique
$f$ est **dérivable sur $I$** si elle est dérivable en tout point de $I$ (dérivabilité à droite et
à gauche aux extrémités le cas échéant) ; la fonction $t \mapsto f'(t)$ est la fonction dérivée.
**Interprétation cinématique** : si $f(t)$ est la position à l'instant $t$ d'un point mobile dans
l'espace, alors $f'(t)$ est le **vecteur vitesse** à l'instant $t$, et $\|f'(t)\|$ est la **vitesse
scalaire**. Exemple : $f(t) = (R\cos(\omega t), R\sin(\omega t))$ (mouvement circulaire de rayon
$R$, vitesse angulaire $\omega$) : $f'(t) = R\omega(-\sin(\omega t), \cos(\omega t))$ et
$\|f'(t)\| = R\omega$ (vitesse constante).
#### 3. Combinaison linéaire de fonctions dérivables
Si $f, g : I \to \mathbb{R}^n$ sont dérivables en $a$ et $\lambda, \mu \in \mathbb{R}$, alors
$\lambda f + \mu g$ est dérivable en $a$ et
$$(\lambda f + \mu g)'(a) = \lambda f'(a) + \mu g'(a).$$
Les fonctions dérivables de $I$ dans $\mathbb{R}^n$ forment donc un sous-espace vectoriel de
l'espace des fonctions, et la dérivation est une application **linéaire** sur cet espace (vers les
fonctions dérivées).
#### 4. Dérivée de $L(f)$, $L$ linéaire
**Théorème** : si $L : \mathbb{R}^p \to \mathbb{R}^n$ est **linéaire** et si $f : I \to
\mathbb{R}^p$ est dérivable en $a$, alors $L \circ f$ est dérivable en $a$ et
$$(L \circ f)'(a) = L\big(f'(a)\big).$$
*Preuve* : le DL de $f$ en $a$, combiné à la linéarité (qui transforme le $o(t-a)$ par linéarité et
donne $L(hv) = h\,L(v)$), donne $L(f(t)) = L(f(a)) + (t - a)\, L(f'(a)) + o(t - a)$.
*Exemple* : pour $f(t) = (x(t), y(t))$ et $L = $ produit par une matrice fixe $A$ : $(Af)'(t) =
A\,f'(t)$.
#### 5. Dérivée d'une expression bilinéaire ou $p$-linéaire
**Théorème** : si $B : \mathbb{R}^p \times \mathbb{R}^q \to \mathbb{R}^r$ est **bilinéaire** (ou
**continument bilinéaire**) et si $f : I \to \mathbb{R}^p$, $g : I \to \mathbb{R}^q$ sont
dérivables en $a$, alors $B(f, g)$ est dérivable en $a$ et
$$\big(B(f, g)\big)'(a) = B\big(f'(a), g(a)\big) + B\big(f(a), g'(a)\big).$$
*Preuve (idée)* : écrire $B(f(t), g(t)) - B(f(a), g(a)) = B(f(t) - f(a), g(t)) + B(f(a), g(t) -
g(a))$ et diviser par $t - a$ en utilisant la bilinéarité et la bornitude locale.
**Cas $p$-linéaire** : pour $M$ **$p$-linéaire** et $f_1, \ldots, f_p$ dérivables :
$$\big(M(f_1, \ldots, f_p)\big)' = \sum_{i=1}^{p} M(f_1, \ldots, f_i', \ldots, f_p)$$
(dérivée « à la Leibniz », une dérivée par emplacement).
**Applications** :
- **Produit scalaire** : si $f, g : I \to \mathbb{R}^n$ sont dérivables,
$$\big(\langle f, g \rangle\big)' = \langle f', g \rangle + \langle f, g' \rangle ;$$
en particulier $\big(\|f\|^2\big)' = 2\langle f', f \rangle$ : si $\|f\|$ est constante (mouvement
circulaire), alors $f'(t) \perp f(t)$ pour tout $t$.
- **Déterminant** : si $f_1, \ldots, f_n : I \to \mathbb{R}^n$ sont dérivables,
$$\big(\det(f_1, \ldots, f_n)\big)' = \sum_{i=1}^{n} \det(f_1, \ldots, f_i', \ldots, f_n)$$
(dérivée du **wronskien**). Exemple : pour un système fondamental de solutions d'une équation
différentielle linéaire, $\det(f_1, \ldots, f_n)$ est soit constamment nul, soit jamais nul
(formule de Liouville).
#### 6. Dérivée de $f \circ \varphi$ (composée scalaire-vectorielle)
**Théorème** : si $\varphi : I \to \mathbb{R}$ est dérivable en $t_0$ (à valeurs **réelles**) et si
$f : J \to \mathbb{R}^n$ est dérivable en $\varphi(t_0)$ (avec $\varphi(I) \subset J$), alors
$f \circ \varphi : I \to \mathbb{R}^n$ est dérivable en $t_0$ et
$$(f \circ \varphi)'(t_0) = \varphi'(t_0)\, f'\big(\varphi(t_0)\big).$$
La dérivée de la composée est le produit de la dérivée scalaire par le vecteur dérivé.
*Preuve* : composer les DL $f(y) = f(y_0) + (y - y_0) f'(y_0) + o(y - y_0)$ et $\varphi(t) =
\varphi(t_0) + (t - t_0)\varphi'(t_0) + o(t - t_0)$.
*Exemple* : $f(t) = (\cos t, \sin t)$ et $\varphi(u) = u^2$ : $(f \circ \varphi)(u) = (\cos u^2,
\sin u^2)$ et $(f \circ \varphi)'(u) = 2u\,(-\sin u^2, \cos u^2)$.
#### 7. Fonction de classe $\mathcal{C}^k$ sur un intervalle
$f : I \to \mathbb{R}^n$ est de **classe $\mathcal{C}^1$** sur $I$ si $f$ est dérivable sur $I$ et
si $f'$ est **continue** sur $I$ ; de classe $\mathcal{C}^k$ si les dérivées successives
$f', f'', \ldots, f^{(k)}$ existent et sont continues sur $I$ ; $\mathcal{C}^{\infty}$ si c'est
vrai pour tout $k$.
**Caractérisation par les coordonnées** : $f$ est de classe $\mathcal{C}^k$ sur $I$ si et seulement
si ses fonctions coordonnées $f_1, \ldots, f_n$ sont de classe $\mathcal{C}^k$ sur $I$ (les
dérivées se calculant coordonnée par coordonnée).
Tous les théorèmes ci-dessus (combinaisons linéaires, $L(f)$, $B(f,g)$, $M(f_1, \ldots, f_p)$,
$f \circ \varphi$) restent valables en remplaçant « dérivable » par « de classe $\mathcal{C}^k$ ».
#### 8. Exemple récapitulatif
Soit $f(t) = (\cos t, \sin t)$ et $g(t) = (\cos 2t, \sin 2t)$ sur $\mathbb{R}$.
- $f$ et $g$ sont de classe $\mathcal{C}^{\infty}$ (coordonnées $\mathcal{C}^{\infty}$), avec
$f'(t) = (-\sin t, \cos t)$, $g'(t) = (-2\sin 2t, 2\cos 2t)$.
- **Produit scalaire** : $\langle f(t), g(t) \rangle = \cos t \cos 2t + \sin t \sin 2t =
\cos t$ (formule de linéarisation). Par la formule bilinéaire :
$\big(\langle f, g \rangle\big)'(t) = \langle f'(t), g(t) \rangle + \langle f(t), g'(t) \rangle = (-\sin t \cos 2t + \cos t \sin 2t) + (-2\cos t \sin 2t + 2\sin t \cos 2t) =$
$\sin t \cos 2t - \cos t \sin 2t = \sin(t - 2t) = -\sin t$, cohérent avec $(\cos t)' = -\sin t$.
- **Déterminant** : $\det(f(t), f'(t)) = \cos^2 t + \sin^2 t = 1$ (aire algébrique du parallélogramme
position-vitesse, constante pour un cercle parcouru à vitesse unitaire).
- **Composée** : $f \circ (t \mapsto 2t) = g$, et $(f \circ (2\,\mathrm{id}))'(t) = 2\,f'(2t) =
g'(t)$ : on retrouve la dérivée de $g$.
#### 1. Dérivée de $t \mapsto f(x_1(t), \ldots, x_p(t))$
Soit $f$ de classe $\mathcal{C}^1$ sur un ouvert $\Omega$ de $\mathbb{R}^p$, et $x_1, \ldots, x_p$
des fonctions dérivables sur un intervalle $I$ telles que $x(t) = (x_1(t), \ldots, x_p(t)) \in
\Omega$ pour tout $t \in I$. Alors la composée $g = f \circ x$ est **dérivable** sur $I$ et
$$g'(t) = \sum_{i=1}^{p} \frac{\partial f}{\partial x_i}\big(x(t)\big)\, x_i'(t) = \mathrm{d}f\big(x(t)\big) \cdot x'(t).$$
*Preuve* : le développement limité d'ordre 1 de $f$ en $x(t)$ donne $f(x(t + h)) - f(x(t)) =
\mathrm{d}f(x(t))\big(x(t+h) - x(t)\big) + o(\|x(t+h) - x(t)\|)$, et $x(t+h) - x(t) = h\,x'(t) +
o(h)$, d'où le résultat en divisant par $h$.
#### 2. Application : dérivées partielles de la composée
Soient $\Omega \subset \mathbb{R}^p$ ouvert, $f$ de classe $\mathcal{C}^1$ sur $\Omega$, et
$x_1, \ldots, x_p$ des fonctions de classe $\mathcal{C}^1$ sur un ouvert $\Omega'$ de
$\mathbb{R}^n$ à valeurs dans un domaine où $f$ est définie. La fonction
$$g : (u_1, \ldots, u_n) \longmapsto f\big(x_1(u_1, \ldots, u_n), \ldots, x_p(u_1, \ldots, u_n)\big)$$
est de **classe $\mathcal{C}^1$** sur $\Omega'$ et ses dérivées partielles s'obtiennent par
$$\frac{\partial g}{\partial u_j}(u) = \sum_{i=1}^{p} \frac{\partial f}{\partial x_i}\big(x(u)\big)\,
\frac{\partial x_i}{\partial u_j}(u), \qquad 1 \leq j \leq n.$$
En termes matriciels, la jacobienne de $g \circ x$ est le **produit des jacobiennes** de $f$ et de
$x$ (on dérive par rapport à chaque variable $u_j$, les autres étant gelées).
#### 3. Cas particulier des coordonnées polaires
Pour $x = r\cos\theta$, $y = r\sin\theta$ ($r > 0$, $\theta \in \mathbb{R}$), posons $g(r, \theta) =
f(r\cos\theta, r\sin\theta)$. La règle de la chaîne donne
$$\frac{\partial g}{\partial r} = \cos\theta\,\frac{\partial f}{\partial x} + \sin\theta\,\frac{\partial f}{\partial y},
\qquad
\frac{\partial g}{\partial \theta} = -r\sin\theta\,\frac{\partial f}{\partial x} + r\cos\theta\,\frac{\partial f}{\partial y},$$
et en inversant le système (pour $r > 0$) :
$$\frac{\partial f}{\partial x} = \cos\theta\,\frac{\partial g}{\partial r} - \frac{\sin\theta}{r}\,\frac{\partial g}{\partial \theta},
\qquad
\frac{\partial f}{\partial y} = \sin\theta\,\frac{\partial g}{\partial r} + \frac{\cos\theta}{r}\,\frac{\partial g}{\partial \theta}.$$
On en déduit notamment
$$\left(\frac{\partial f}{\partial x}\right)^2 + \left(\frac{\partial f}{\partial y}\right)^2 =
\left(\frac{\partial g}{\partial r}\right)^2 + \frac{1}{r^2}\left(\frac{\partial g}{\partial \theta}\right)^2.$$
#### 4. Caractérisation des fonctions constantes sur un ouvert convexe
**Théorème** : soit $f$ de classe $\mathcal{C}^1$ sur un ouvert **convexe** $\Omega$ de
$\mathbb{R}^p$. Alors
$$f \text{ est constante sur } \Omega \iff \mathrm{d}f(a) = 0 \text{ pour tout } a \in \Omega
\iff \frac{\partial f}{\partial x_i}(a) = 0 \ \forall i, \forall a.$$
*Preuve* : pour $a, b \in \Omega$, le segment $[a, b]$ est inclus dans $\Omega$ (convexité) ; la
fonction $\varphi(t) = f(a + t(b - a))$ est de classe $\mathcal{C}^1$ sur $[0, 1]$ avec
$\varphi'(t) = \mathrm{d}f(a + t(b-a)) \cdot (b - a)$ (règle de la chaîne). Si $\mathrm{d}f \equiv
0$, alors $\varphi' \equiv 0$, donc $f(b) - f(a) = \varphi(1) - \varphi(0) = 0$ : $f$ est constante.
Réciproquement, une fonction constante a toutes ses dérivées nulles.
**Attention** : la convexité est essentielle — sur l'ouvert non convexe $\mathbb{R}^2 \setminus
\{0\}$, la fonction $f(x, y) = \arctan(y/x)$ (argument) a toutes ses dérivées partielles nulles
localement... (elle est localement constante sur chaque demi-droite mais pas globalement constante).
#### 5. Exemple récapitulatif
Soit $f(x, y) = x^2 y$ et $x(t) = t^2$, $y(t) = t$ : $g(t) = f(x(t), y(t)) = t^4 \cdot t = t^5$ et
$g'(t) = 5t^4$. La règle de la chaîne donne $g'(t) = 2x(t)y(t)\cdot 2t + x(t)^2 \cdot 1 = 4t^4 + t^4
= 5t^4$ : cohérent. Pour les polaires : $f(x, y) = x^2 + y^2$ devient $g(r, \theta) = r^2$, donc
$\frac{\partial g}{\partial r} = 2r$, $\frac{\partial g}{\partial \theta} = 0$, et les formules
inverses redonnent $\frac{\partial f}{\partial x} = \cos\theta \cdot 2r = 2x$ : cohérent avec
$\frac{\partial f}{\partial x} = 2x$.
#### 1. Définition du gradient par ses coordonnées
Dans $\mathbb{R}^p$ muni de sa **structure euclidienne canonique** (produit scalaire $\langle x, y
\rangle = \sum_{i=1}^{p} x_i y_i$), toute forme linéaire sur $\mathbb{R}^p$ s'écrit de manière unique
$h \mapsto \langle v, h \rangle$ pour un vecteur $v$. Pour $f$ de classe $\mathcal{C}^1$ sur un
ouvert $\Omega$ de $\mathbb{R}^p$ et $a \in \Omega$, la différentielle $\mathrm{d}f(a)$ étant une
forme linéaire, il existe un unique vecteur $v$ tel que $\mathrm{d}f(a)\cdot h = \langle v, h
\rangle$ pour tout $h$ : c'est le **gradient** de $f$ en $a$, défini par ses coordonnées
$$\nabla f(a) = \left(\frac{\partial f}{\partial x_1}(a), \; \frac{\partial f}{\partial
x_2}(a), \; \ldots, \; \frac{\partial f}{\partial x_p}(a)\right).$$
On note $\nabla f(a)$ (ou $\overrightarrow{\mathrm{grad}}\, f(a)$) ce vecteur de $\mathbb{R}^p$.
#### 2. Relation $\mathrm{d}f(a)\cdot h = \langle \nabla f(a), h \rangle$
Par définition du gradient, pour tout $h = (h_1, \ldots, h_p) \in \mathbb{R}^p$ :
$$\mathrm{d}f(a)\cdot h = \sum_{i=1}^{p} \frac{\partial f}{\partial x_i}(a)\, h_i = \langle \nabla
f(a), h \rangle.$$
En particulier, pour $h = v$ : $D_v f(a) = \mathrm{d}f(a)\cdot v = \langle \nabla f(a), v \rangle$ —
la dérivée selon un vecteur quelconque s'obtient par produit scalaire avec le gradient.
#### 3. Interprétation géométrique
Si $\nabla f(a) \neq 0$, alors pour tout vecteur unitaire $v$ ($\|v\| = 1$) :
$$D_v f(a) = \langle \nabla f(a), v \rangle = \|\nabla f(a)\| \cos(\widehat{\nabla f(a), v}) \leq
\|\nabla f(a)\|,$$
avec **égalité si et seulement si $v = \frac{\nabla f(a)}{\|\nabla f(a)\|}$**. Autrement dit :
- la dérivée de $f$ en $a$ est **maximale** selon le vecteur unitaire **colinéaire et de même sens**
que $\nabla f(a)$, la valeur maximale étant $\|\nabla f(a)\|$ ;
- elle est **minimale** (valeur $-\|\nabla f(a)\|$) selon le vecteur opposé ;
- elle est **nulle** selon les vecteurs orthogonaux à $\nabla f(a)$ : la droite de direction
orthogonale au gradient est la tangente à la **courbe (ou surface) de niveau** $\{x \mid f(x) =
f(a)\}$.
Si $\nabla f(a) = 0$ ($a$ point critique), toutes les dérivées directionnelles sont nulles.
#### 4. Exemple récapitulatif
Soit $f(x, y) = x^2 + y^2$ sur $\mathbb{R}^2$ : $\nabla f(x, y) = (2x, 2y)$, donc $\nabla f(1, 1) =
(2, 2)$. La dérivée en $(1, 1)$ selon $v = (0, 1)$ vaut $D_v f(1,1) = \langle (2,2), (0,1) \rangle =
2$ ; elle est maximale selon $v = \frac{1}{\sqrt{2}}(1, 1)$ (valeur $\|\nabla f(1,1)\| = 2\sqrt{2}$)
et nulle selon $v = \frac{1}{\sqrt{2}}(1, -1)$, orthogonal au gradient — cohérent : $v$ est tangent
au cercle de niveau $x^2 + y^2 = 2$ passant par $(1, 1)$.
#### 1. Dérivées partielles d'ordre 2 et notations
Soit $\Omega$ un ouvert de $\mathbb{R}^p$ et $f : \Omega \to \mathbb{R}$ admettant des dérivées
partielles d'ordre 1. Les **dérivées partielles d'ordre 2** de $f$ en $a$ sont les dérivées
partielles en $a$ des fonctions $\partial_j f$, lorsqu'elles existent :
$$\frac{\partial^2 f}{\partial x_i \partial x_j}(a) = \frac{\partial}{\partial x_i}\left(\frac{\partial
f}{\partial x_j}\right)(a), \qquad 1 \leq i, j \leq p.$$
La notation $\frac{\partial^2 f}{\partial x_i \partial x_j}(a)$ se lit « dérivée de $\frac{\partial
f}{\partial x_j}$ par rapport à $x_i$ » : on dérive d'abord selon $x_j$, puis selon $x_i$. Les
dérivées avec $i = j$ sont $\frac{\partial^2 f}{\partial x_i^2}(a)$ ; les autres sont dites
**croisées**. On note aussi $\partial_{ij}^2 f(a)$ ou $\partial_{i,j} f(a)$.
#### 2. Fonction de classe $\mathcal{C}^2$ sur un ouvert
$f$ est de **classe $\mathcal{C}^2$ sur $\Omega$** si ses dérivées partielles d'ordre 2 existent en
tout point de $\Omega$ et sont **continues** sur $\Omega$ (ce qui équivaut à : toutes les dérivées
partielles d'ordres $1$ et $2$ existent et sont continues). Les fonctions de classe $\mathcal{C}^2$
sont stables par combinaisons linéaires, produit, quotient (dénominateur non nul) et composition
chaîne simple.
#### 3. Théorème de Schwarz
**Théorème** : si $f$ est de classe $\mathcal{C}^2$ sur $\Omega$, alors pour tous $i, j$ et tout $a
\in \Omega$ :
$$\frac{\partial^2 f}{\partial x_i \partial x_j}(a) = \frac{\partial^2 f}{\partial x_j \partial
x_i}(a),$$
c'est-à-dire que les dérivées croisées **ne dépendent pas de l'ordre des dérivations**. Ce théorème
garantit la symétrie de la matrice hessienne (section 4) et se généralise aux fonctions de classe
$\mathcal{C}^k$.
#### 4. Matrice hessienne en un point
Pour $f$ de classe $\mathcal{C}^2$ sur $\Omega$ et $a \in \Omega$, la **matrice hessienne** de $f$
en $a$ est la matrice des dérivées partielles secondes, notée
$$\mathrm{H}_f(a) = \left(\frac{\partial^2 f}{\partial x_i \partial x_j}(a)\right)_{1 \leq i, j
\leq p}.$$
Elle est **symétrique** (théorème de Schwarz). Sa forme quadratique associée est $h \mapsto
h^{\mathsf{T}}\, \mathrm{H}_f(a)\, h = \mathrm{d}^2 f(a)(h, h)$.
#### 5. Formule de Taylor-Young à l'ordre 2
**Théorème** : si $f$ est de classe $\mathcal{C}^2$ sur $\Omega$ et $a \in \Omega$, alors pour $h$
petit :
$$f(a + h) = f(a) + \mathrm{d}f(a)(h) + \frac{1}{2}\, \mathrm{d}^2 f(a)(h, h) + o(\|h\|^2) \quad (h
\to 0).$$
**Expression en termes de produit scalaire** : en notant $\nabla f(a)$ le gradient de $f$ en $a$,
$$\mathrm{d}f(a)(h) = \langle \nabla f(a), h \rangle \quad \text{et} \quad \frac{1}{2}\,
\mathrm{d}^2 f(a)(h, h) = \frac{1}{2}\, \langle \mathrm{H}_f(a)\, h, h \rangle =
\frac{1}{2}\, \langle h, \mathrm{H}_f(a)\, h \rangle,$$
de sorte que la formule s'écrit
$$f(a + h) = f(a) + \langle \nabla f(a), h \rangle + \frac{1}{2}\, \langle \mathrm{H}_f(a)\, h, h
\rangle + o(\|h\|^2).$$
#### 6. Exemple récapitulatif
Soit $f(x, y) = x^3 + y^3 - 3xy$ sur $\mathbb{R}^2$. Dérivées partielles d'ordre 1 :
$\partial_x f = 3x^2 - 3y$, $\partial_y f = 3y^2 - 3x$ ; d'ordre 2 : $\partial_{xx}^2 f = 6x$,
$\partial_{xy}^2 f = -3$, $\partial_{yy}^2 f = 6y$, toutes continues : $f$ est de classe
$\mathcal{C}^2$. En $a = (1, 1)$ (point critique : $\nabla f(1, 1) = 0$) : $\mathrm{H}_f(1, 1) =
\begin{pmatrix} 6 & -3 \\ -3 & 6 \end{pmatrix}$, symétrique (Schwarz), définie positive (valeurs
propres $3$ et $9$), et Taylor-Young donne $f(1 + h, 1 + k) = -1 + \frac{1}{2}(6h^2 - 6hk + 6k^2) +
o(h^2 + k^2) = -1 + 3h^2 - 3hk + 3k^2 + o(\|(h,k)\|^2)$ : minimum local strict.
#### 1. Extremum local, extremum global
Soient $\Omega$ un ouvert de $\mathbb{R}^p$, $f : \Omega \to \mathbb{R}$ et $a \in \Omega$. $f$
admet en $a$ un **maximum local** (resp. **minimum local**) s'il existe un voisinage $V$ de $a$ dans
$\Omega$ tel que $f(x) \leq f(a)$ (resp. $f(x) \geq f(a)$) pour tout $x \in V$ ; l'extremum est
**strict** si l'inégalité est stricte pour $x \neq a$. Si $D \subset \Omega$, $f$ admet un
**maximum global** (resp. **minimum global**) sur $D$ en $a \in D$ si $f(x) \leq f(a)$ (resp.
$\geq$) pour tout $x \in D$.
#### 2. Point critique d'une application de classe $\mathcal{C}^1$
Pour $f$ de classe $\mathcal{C}^1$ sur l'ouvert $\Omega$, un point $a \in \Omega$ est un **point
critique** de $f$ si $\mathrm{d}f(a) = 0$, de manière équivalente si $\nabla f(a) = 0$ (toutes les
dérivées partielles sont nulles en $a$).
#### 3. Condition nécessaire : extremum implique point critique
**Théorème** : si $f$ est de classe $\mathcal{C}^1$ sur l'ouvert $\Omega$ et admet un **extremum
local** en $a \in \Omega$, alors $a$ est un **point critique** de $f$.
*Preuve* : $D_{e_i} f(a) = 0$ pour chaque dérivée partielle, car $t \mapsto f(a + t e_i)$ admet un
extremum en $t = 0$ (dérivée nulle d'une fonction d'une variable en un extremum intérieur).
**Attention** : la réciproque est fausse (un point critique peut être un point col, par exemple
$f(x, y) = x^2 - y^2$ en $(0, 0)$).
#### 4. Conditions du second ordre via la hessienne
Soit $f$ de **classe $\mathcal{C}^2$** sur $\Omega$ et $a$ un **point critique** de $f$. On note
$\mathrm{H}_f(a)$ la hessienne de $f$ en $a$, $\mathcal{S}_p^{++}(\mathbb{R})$ l'ensemble des
matrices symétriques réelles **définies positives** et $\mathcal{S}_p^{+}(\mathbb{R})$ celles
**positives** (semi-définies positives) :
- **Si $\mathrm{H}_f(a) \in \mathcal{S}_p^{++}(\mathbb{R})$** (définie positive), alors $f$ atteint
un **minimum local strict** en $a$ ;
- **Si $\mathrm{H}_f(a) \notin \mathcal{S}_p^{+}(\mathbb{R})$** (non positive), alors $f$ **n'a pas
de minimum local** en $a$.
**Adaptation à un maximum local** : si $\mathrm{H}_f(a) \in \mathcal{S}_p^{--}(\mathbb{R})$ (définie
négative), $f$ atteint un **maximum local strict** en $a$ ; si $\mathrm{H}_f(a) \notin
\mathcal{S}_p^{-}(\mathbb{R})$ (non négative), $f$ **n'a pas de maximum local** en $a$. Lorsque la
hessienne est semi-définie sans être définie, **on ne peut pas conclure** par ce critère.
*Preuve (cas du minimum strict)* : le DL d'ordre 2 donne $f(a + h) = f(a) + \frac{1}{2}\, h^{\mathsf{T}}
\mathrm{H}_f(a)\, h + o(\|h\|^2)$ ; si $\mathrm{H}_f(a)$ est définie positive, $h^{\mathsf{T}}
\mathrm{H}_f(a) h \geq \lambda_{\min}\|h\|^2$ avec $\lambda_{\min} > 0$, donc $f(a + h) \geq f(a) +
\frac{\lambda_{\min}}{2}\|h\|^2 - \varepsilon(h)\|h\|^2 > f(a)$ pour $h$ petit non nul.
#### 5. Explicitation pour $p = 2$ (trace et déterminant)
Pour $p = 2$, avec $\mathrm{H}_f(a) = \begin{pmatrix} r & s \\ s & t \end{pmatrix}$ symétrique, on
note $\mathrm{tr} = r + t$ (trace) et $\Delta = rt - s^2$ (déterminant). Les valeurs propres sont
réelles de produit $\Delta$ et de somme $\mathrm{tr}$, d'où :
- $\Delta > 0$ et $\mathrm{tr} > 0$ : valeurs propres $> 0$, hessienne définie positive
$\Rightarrow$ **minimum local strict** ;
- $\Delta > 0$ et $\mathrm{tr} < 0$ : valeurs propres $< 0$, hessienne définie négative
$\Rightarrow$ **maximum local strict** ;
- $\Delta < 0$ : valeurs propres de signes opposés, point **col** (pas d'extremum) ;
- $\Delta = 0$ : **on ne peut pas conclure** par ce critère (étude directe nécessaire).
#### 6. Exemples de recherche d'extremums globaux sur une partie de $\mathbb{R}^p$
**Méthode** : pour chercher les extremums globaux de $f$ sur une partie $D$ (par exemple fermée
bornée), on (1) résout $\nabla f = 0$ à l'intérieur de $D$ et discute les points critiques via la
hessienne, (2) étudie $f$ sur le **bord** de $D$ (paramétrage ou réduction à des fonctions d'une
variable), (3) compare les valeurs obtenues (le théorème des bornes atteintes garantit l'existence
sur un fermé borné).
*Exemple* : $f(x, y) = x^2 + y^2 - xy$ sur $D = [0, 1] \times [0, 1]$. Points critiques :
$\partial_x f = 2x - y = 0$, $\partial_y f = 2y - x = 0$ donnent $(0, 0)$ ; hessienne
$\begin{pmatrix} 2 & -1 \\ -1 & 2 \end{pmatrix}$ : $\Delta = 3 > 0$, $\mathrm{tr} = 4 > 0$
$\Rightarrow$ **minimum local strict**, $f(0, 0) = 0$. Sur le bord de $D$ : $f \in [0, 1]$ avec
maxima $f(1, 0) = f(1, 1) = 1$. **Conclusion** : minimum global $0$ en $(0, 0)$, maximum global $1$
en $(1, 0)$ et $(1, 1)$ (théorème des bornes atteintes : $D$ est fermé borné).
Si $f$ est différentiable en $a$ et $g$ en $f(a)$, alors $g\circ f$ est différentiable en $a$ et $d(g\circ f)(a)=dg(f(a))\circ df(a)$ (composition des différentielles).
- **Énoncé** : $d(g\circ f)(a)=dg(f(a))\circ df(a)$.
- **Matriciel** : $J_{g\circ f}(a)=J_g(f(a))\cdot J_f(a)$ (produit des jacobiennes).
- **Cas $\mathbb{R}\to\mathbb{R}$** : $(g\circ f)'=g'(f)\cdot f'$.
- **Hypothèse** : différentiabilité de $f$ en $a$, $g$ en $f(a)$.
1. **Composer** les différentielles.
2. **Multiplier** les jacobiennes.
3. **Appliquer** aux fonctions composées.
1. **Calculer** $df(a)$, $dg(f(a))$.
2. **Composer** (produit matriciel).
- **Piège classique** : ordre de composition ; $g$ évaluée en $f(a)$ ; $\mathbb{R}\to\mathbb{R}$ (facteur $f'$).
- $\frac{d}{dt}g(f(t))=g'(f(t))f'(t)$.
```mermaid
graph TD
C["Regle de la chaine"] --> D["d(g o f)(a) = dg(f(a)) o df(a)"]
C --> J["J_{g o f}(a) = J_g(f(a)) . J_f(a)"]
```
$f$ est de **classe $C^2$** sur un ouvert si elle est **deux fois différentiable** et si ses **dérivées partielles secondes sont continues**. Alors $H_f$ (hessienne) est **symétrique** (Schwarz).
- **Définition** : $C^2$ = dérivées partielles d'ordre $2$ continues.
- **Symétrie** : $\partial_{ij}f=\partial_{ji}f$ (Schwarz).
- **Hessienne** : $H_f(x)$ symétrique.
- **Usage** : optimisation (ordre 2), Taylor-Young.
1. **Calculer** les dérivées secondes.
2. **Vérifier** leur continuité.
3. **Utiliser** la hessienne.
1. **Calculer** les dérivées secondes.
2. **Étudier** la continuité.
- **Piège classique** : $C^2$ (continuité) ; symétrie de la hessienne (Schwarz).
- $f(x,y)=x^2y$ $C^2$ : $\partial_{xy}=\partial_{yx}=2x$.
```mermaid
graph TD
C2["Classe C^2"] --> D["Derivees partielles d'ordre 2 continues"]
C2 --> S["Hessienne symetrique (Schwarz)"]
```
Pour $f:\mathbb{R}^p\to\mathbb{R}$ : **minimum global** en $a$ si $f(a)\leq f(x)$ partout ; **local** si au voisinage. Condition nécessaire intérieure : $\nabla f(a)=0$ ; classification par la **hessienne**.
- **Global/local** : inégalité partout/au voisinage.
- **Nécessaire** : $\nabla f(a)=0$ (intérieur).
- **Suffisant (2nd ordre)** : $H_f(a)\succ0$ min, $\prec0$ max.
- **Existence** : continue sur compact (bornes atteintes).
1. **Résoudre** $\nabla f=0$.
2. **Calculer** $H_f$ et son spectre.
3. **Étudier** le bord si nécessaire.
1. **Étudier** $H_f$ (spectre/signe).
2. **Paramétrer** le bord.
- **Piège classique** : point critique $\neq$ extremum (selle) ; cas $H_f$ singulière ; oublier le bord.
- $f(x,y)=\sin x\cos y$ : extrema via points critiques et hessienne.

Le **gradient** de $f:E\to\mathbb{R}$ différentiable en $a$ (E euclidien) est l'unique $\nabla f(a)$ vérifiant $df(a)\cdot h=\langle\nabla f(a),h\rangle$ ; en BON, $\nabla f(a)=(\partial_1f,\dots,\partial_nf)$.
- **Définition** : $df(a)\cdot h=\langle\nabla f(a),h\rangle$.
- **BON** : $\nabla f=\sum_i\partial_if\,e_i$.
- **Propriété** : $D_vf=\langle\nabla f,v\rangle$ ; orientation de croissance maximale.
- **Orthogonal** aux lignes de niveau.
1. **Calculer** les dérivées partielles.
2. **Former** le gradient.
3. **Utiliser** pour dérivées directionnelles.
1. **Calculer** $\partial_if$ (BON).
2. **Assembler** $\nabla f$.
- **Piège classique** : dépend du produit scalaire ; $\nabla f$ vs $df$.
- $f(x,y)=xy$ : $\nabla f=(y,x)$.
```mermaid
graph TD
G["Gradient"] --> D["df(a).h = <grad f, h>"]
G --> B["BON : grad f = (d_i f)"]
G --> O["Orthogonal aux niveaux"]
```
$f$ est de **classe $C^1$** sur un intervalle si elle est **dérivable** et si $f'$ est **continue** ; stable par opérations.
- **Définition** : $f'$ existe et continue.
- **Stabilité** : $+$, $\times$, $\circ$, $/$ ($\neq0$).
- **Hiérarchie** : $C^1\Rightarrow$ dérivable $\Rightarrow$ continue.
- **Usage** : théorèmes (TAF, IAF, prolongement).
1. **Calculer** $f'$.
2. **Étudier** sa continuité.
3. **Conclure** $C^1$.
1. **Vérifier** la continuité de $f'$.
2. **Utiliser** la stabilité.
- **Piège classique** : dérivable $\neq$ $C^1$ ($f'$ non continue) ; opérations ; $x^2\sin(1/x)$.
- $f(x)=x^m$ ($m\geq1$) : $C^1$ ; $x\mapsto|x|$ non dérivable en $0$.
```mermaid
graph TD
C["Classe C^1"] --> D["Derivable"]
C --> DC["f' continue"]
C --> S["Stable par +, x, o, /"]
```
Teste-toi : 3 questions
Question 1/3
🎯 Créez votre boîte de Leitner pour revoir ces cartes au bon moment
Révisions espacées, QCM corrigés, suivi de progression — gratuit pendant la bêta.
Créer mon compte