Ce cours de calcul différentiel définit la différentielle comme la meilleure approximation linéaire d’une fonction de plusieurs variables. Vous y verrez la matrice jacobienne, la règle de la chaîne et le critère pratique selon lequel une fonction de classe C1 est différentiable. Ensuite viennent l’inégalité des accroissements finis, les dérivées secondes et le théorème de Schwarz.
La seconde moitié traite les extrema L2 : la formule de Taylor-Young à l’ordre 2, les points critiques, la classification par la matrice hessienne et la recherche des extrema sur un compact. Ce chapitre du troisième semestre prolonge l’étude de la topologie de R^n. Il prépare directement les fonctions implicites, l’optimisation sous contrainte, les intégrales multiples et les équations aux dérivées partielles. Chaque résultat important est démontré, puis illustré par des exemples et des figures.
Pour vous entraîner ensuite, travaillez les exercices de maths en L2 sur différentielle et extrema.
I. Différentiabilité et différentielle
Dans tout le chapitre, \(U\) désigne un ouvert de \(\mathbb{R}^n\) et \(f : U \to \mathbb{R}^p\) une application. On munit \(\mathbb{R}^n\) d’une norme \(\|\cdot\|\). En dimension finie, toutes les normes sont équivalentes : les notions qui suivent ne dépendent donc pas de ce choix. Pour une fonction d’une variable, la dérivée donne la meilleure approximation affine au voisinage d’un point. Nous allons généraliser cette idée. Autrement dit, nous cherchons une application linéaire qui approche l’accroissement \(f(a+h)-f(a)\) à un reste négligeable devant \(\|h\|\).
On dit que \(f\) est différentiable en \(a \in U\) s’il existe une application linéaire \(L : \mathbb{R}^n \to \mathbb{R}^p\) telle que \[f(a+h) = f(a) + L(h) + o(\|h\|) \quad \text{quand } h \to 0.\] Autrement dit, \(\dfrac{\|f(a+h)-f(a)-L(h)\|}{\|h\|} \to 0\) quand \(h \to 0\), \(h \neq 0\). Cette application \(L\) est unique. On l’appelle la différentielle de \(f\) en \(a\) et on la note \(\mathrm{d}f_a\) ou \(\mathrm{d}f(a)\).
L’unicité se prouve simplement. Si \(L_1\) et \(L_2\) conviennent, alors \((L_1-L_2)(h) = o(\|h\|)\). Fixons un vecteur \(v\) et posons \(h = tv\) avec \(t \to 0^+\). Par linéarité, \(t(L_1-L_2)(v) = o(t)\), donc \((L_1-L_2)(v) = 0\). Ainsi \(L_1 = L_2\).
Géométriquement, pour \(n = 2\) et \(p = 1\), le graphe de \(f\) est une surface. Le graphe de \(h \mapsto f(a)+\mathrm{d}f_a(h)\) est alors le plan tangent à cette surface au point \((a, f(a))\). Comme le montre la figure ci-dessous, ce plan colle à la surface au voisinage du point de contact.
Si \(f\) est différentiable en \(a\), alors \(f\) est continue en \(a\). De plus, pour tout vecteur \(v\), \(f\) admet une dérivée en \(a\) selon \(v\) et \[D_v f(a) = \lim_{t \to 0} \frac{f(a+tv)-f(a)}{t} = \mathrm{d}f_a(v).\]
D’abord, \(\mathrm{d}f_a\) est linéaire sur un espace de dimension finie, donc continue. Ainsi \(f(a+h)-f(a) = \mathrm{d}f_a(h) + o(\|h\|)\) tend vers \(0\). Ensuite, pour \(t \neq 0\) petit, \(f(a+tv) – f(a) = t\,\mathrm{d}f_a(v) + o(t)\). On divise par \(t\) et on fait tendre \(t\) vers \(0\).
En particulier, les dérivées partielles \(\partial_j f(a) = D_{e_j} f(a)\) existent, où \((e_1, \ldots, e_n)\) est la base canonique. Par linéarité, pour \(h = (h_1, \ldots, h_n)\), on obtient \[\mathrm{d}f_a(h) = \sum_{j=1}^{n} h_j\, \partial_j f(a).\]
Soit \(f(x,y) = xy\). En \((a,b)\), on a \(f(a+h, b+k) – f(a,b) = bh + ak + hk\). L’application \(L(h,k) = bh + ak\) est linéaire. De plus, \(|hk| \leq\, \|(h,k)\|_\infty^2 = o(\|(h,k)\|_\infty)\). Donc \(f\) est différentiable en \((a,b)\) et \(\mathrm{d}f_{(a,b)}(h,k) = bh + ak\).
L’existence des dérivées partielles, et même de toutes les dérivées directionnelles, n’entraîne pas la différentiabilité. Par exemple, posons \(f(x,y) = \dfrac{xy}{x^2+y^2}\) si \((x,y) \neq (0,0)\) et \(f(0,0) = 0\). Alors \(f(x,0) = f(0,y) = 0\), donc \(\partial_1 f(0,0) = \partial_2 f(0,0) = 0\). Cependant \(f(t,t) = \tfrac{1}{2}\) pour tout \(t \neq 0\) : la fonction n’est même pas continue en \((0,0)\).
La figure ci-dessous représente les valeurs de ce contre-exemple. En effet, en coordonnées polaires, \(f(r\cos\theta, r\sin\theta) = \tfrac{1}{2}\sin(2\theta)\) : la fonction est constante sur chaque droite issue de l’origine. Elle prend donc toutes les valeurs de \([-\tfrac12, \tfrac12]\) dans tout voisinage de \((0,0)\).
1. Montrer la différentiabilité en un point
En pratique, on connaît le seul candidat possible pour la différentielle : c’est \(h \mapsto \sum_j h_j\, \partial_j f(a)\). Il suffit alors de contrôler le reste.
Pour étudier la différentiabilité de \(f\) en \(a\) : d’abord, calculer les dérivées partielles en \(a\) (souvent par la définition, avec un taux d’accroissement) ; si l’une n’existe pas, \(f\) n’est pas différentiable. Ensuite, poser \(L(h) = \sum_j h_j\, \partial_j f(a)\) et étudier \[\varepsilon(h) = \frac{f(a+h) – f(a) – L(h)}{\|h\|}.\] Enfin, montrer que \(\varepsilon(h) \to 0\) par une majoration (inégalités \(|h_j| \leq\, \|h\|_2\), passage en polaires), ou exhiber une direction le long de laquelle \(\varepsilon\) ne tend pas vers \(0\).
II. Matrice jacobienne et règles de calcul
Une application linéaire de \(\mathbb{R}^n\) dans \(\mathbb{R}^p\) est représentée par une matrice. Pour la différentielle, cette matrice s’exprime avec les dérivées partielles des composantes \(f_1, \ldots, f_p\) de \(f\).
Si \(f = (f_1, \ldots, f_p)\) est différentiable en \(a\), la matrice jacobienne de \(f\) en \(a\) est la matrice de \(\mathrm{d}f_a\) dans les bases canoniques : \[J_f(a) = \big(\partial_j f_i(a)\big)_{1 \leq\, i \leq\, p,\ 1 \leq\, j \leq\, n} \in \mathcal{M}_{p,n}(\mathbb{R}).\] La ligne \(i\) contient les dérivées partielles de \(f_i\) ; la colonne \(j\) contient les dérivées par rapport à \(x_j\). Lorsque \(n = p\), son déterminant s’appelle le jacobien.
Si \(p = 1\), le gradient de \(f\) en \(a\) est le vecteur \(\nabla f(a) = (\partial_1 f(a), \ldots, \partial_n f(a))\). On a alors \(\mathrm{d}f_a(h) = \langle \nabla f(a), h \rangle\) pour le produit scalaire canonique.
Considérons le passage en coordonnées polaires \(\varphi(r, \theta) = (r\cos\theta, r\sin\theta)\). Ses composantes sont de classe \(C^1\) et \[J_\varphi(r,\theta) = \begin{pmatrix} \cos\theta -r\sin\theta \\ \sin\theta r\cos\theta \end{pmatrix}, \qquad \det J_\varphi(r, \theta) = r.\]
Le gradient a une interprétation géométrique utile. D’une part, par l’inégalité de Cauchy-Schwarz, \(|D_u f(a)| \leq\, \|\nabla f(a)\|_2\) pour tout vecteur unitaire \(u\). L’égalité a lieu pour \(u\) colinéaire au gradient. Ainsi, le gradient indique la direction de plus forte pente. D’autre part, il est orthogonal aux lignes de niveau, comme on le voit sur la figure suivante pour \(f(x,y) = x^2 + 2y^2\).
Soient \(f : U \to \mathbb{R}^p\) différentiable en \(a\) et \(g : V \to \mathbb{R}^q\) différentiable en \(f(a)\), avec \(f(U) \subset V\). Alors \(g \circ f\) est différentiable en \(a\) et \[\mathrm{d}(g \circ f)_a = \mathrm{d}g_{f(a)} \circ \mathrm{d}f_a, \qquad J_{g \circ f}(a) = J_g(f(a))\, J_f(a).\]
Ce résultat s’appelle la règle de la chaîne. On l’admet ici ; sa preuve consiste à composer les deux développements et à contrôler les restes. Concrètement, si \(g(r, \theta) = f(r\cos\theta, r\sin\theta)\), le produit matriciel donne : \[\frac{\partial g}{\partial r} = \cos\theta\, \partial_1 f + \sin\theta\, \partial_2 f, \qquad \frac{\partial g}{\partial \theta} = -r\sin\theta\, \partial_1 f + r\cos\theta\, \partial_2 f.\] De même, les sommes, produits et quotients (à dénominateur non nul) de fonctions différentiables sont différentiables.
III. Fonctions de classe C1
Vérifier la définition à la main devient vite lourd. Heureusement, un critère simple couvre la plupart des fonctions usuelles : la continuité des dérivées partielles.
On dit que \(f\) est de classe \(C^1\) sur \(U\) si ses dérivées partielles \(\partial_j f\) existent en tout point de \(U\) et sont continues sur \(U\).
Si \(f\) est de classe \(C^1\) sur l’ouvert \(U\), alors \(f\) est différentiable en tout point de \(U\), et \(a \mapsto \mathrm{d}f_a\) est continue.
On traite \(n = 2\) et \(p = 1\) ; le cas général est identique. Soit \(a = (a_1, a_2)\) et \(h = (h_1, h_2)\) assez petit pour que le rectangle de sommets \(a\) et \(a+h\) soit dans \(U\). On découpe l’accroissement en deux étapes : \[f(a+h) – f(a) = \big[f(a_1+h_1, a_2+h_2) – f(a_1, a_2+h_2)\big] + \big[f(a_1, a_2+h_2) – f(a_1,a_2)\big].\] D’abord, la fonction \(t \mapsto f(t, a_2+h_2)\) est dérivable. Le théorème des accroissements finis fournit \(c_1\) entre \(a_1\) et \(a_1 + h_1\) tel que le premier crochet vaille \(h_1\, \partial_1 f(c_1, a_2+h_2)\). De même, le second vaut \(h_2\, \partial_2 f(a_1, c_2)\). Par conséquent, \[|f(a+h) – f(a) – h_1 \partial_1 f(a) – h_2 \partial_2 f(a)| \leq\, \|h\|_\infty \big(|\partial_1 f(c_1, a_2+h_2) – \partial_1 f(a)| + |\partial_2 f(a_1, c_2) – \partial_2 f(a)|\big).\] Enfin, les points \((c_1, a_2+h_2)\) et \((a_1, c_2)\) tendent vers \(a\) quand \(h \to 0\). Par continuité des dérivées partielles, la parenthèse tend vers \(0\). Le reste est donc un \(o(\|h\|_\infty)\).
La réciproque est fausse. La fonction \(f(x,y) = (x^2+y^2)\sin\big(1/\sqrt{x^2+y^2}\big)\), prolongée par \(0\) en l’origine, est différentiable en \((0,0)\) sans que ses dérivées partielles y soient continues. En résumé : \(C^1\) implique différentiable, qui implique l’existence des dérivées partielles et la continuité.
La fonction \(f(x,y) = e^{x}\cos(y) + x^2 y\) a pour dérivées partielles \(\partial_1 f = e^x\cos y + 2xy\) et \(\partial_2 f = -e^x \sin y + x^2\). Elles sont continues sur \(\mathbb{R}^2\). Donc \(f\) est \(C^1\), donc différentiable partout, et \(\mathrm{d}f_{(0,0)}(h,k) = h\).
IV. Inégalité des accroissements finis
En une variable, l’égalité des accroissements finis permet de majorer \(|f(b)-f(a)|\) grâce à la dérivée. Pour une fonction à valeurs réelles de plusieurs variables, on se ramène à une variable en suivant un segment.
Soit \(f : U \to \mathbb{R}\) de classe \(C^1\) et \(a, b \in U\) tels que le segment \([a,b]\) soit inclus dans \(U\). On suppose que \(\|\nabla f(x)\|_2 \leq\, M\) pour tout \(x \in [a,b]\). Alors \[|f(b) – f(a)| \leq\, M\, \|b – a\|_2.\] C’est l’inégalité des accroissements finis.
Posons \(\gamma(t) = a + t(b-a)\) et \(\phi(t) = f(\gamma(t))\) pour \(t \in [0,1]\). Par la règle de la chaîne, \(\phi\) est dérivable et \(\phi^{\prime}(t) = \langle \nabla f(\gamma(t)), b – a \rangle\). D’après Cauchy-Schwarz, \(|\phi^{\prime}(t)| \leq\, M \|b-a\|_2\). Ensuite, le théorème des accroissements finis en une variable donne \(|\phi(1) – \phi(0)| \leq\, M\|b-a\|_2\), ce qui est le résultat.
Le même argument s’étend aux fonctions à valeurs dans \(\mathbb{R}^p\), avec la norme subordonnée de la différentielle. En revanche, l’égalité des accroissements finis devient fausse pour \(p \geq\, 2\). Par exemple, \(t \mapsto (\cos t, \sin t)\) prend la même valeur en \(0\) et en \(2\pi\), mais sa dérivée ne s’annule jamais.
Si \(U\) est un ouvert convexe et si \(\mathrm{d}f_x = 0\) pour tout \(x \in U\), alors \(f\) est constante sur \(U\). Le résultat reste vrai sur un ouvert connexe par arcs.
Soit \(f(x,y) = \sin(x+y)\). Son gradient vaut \((\cos(x+y), \cos(x+y))\), de norme au plus \(\sqrt{2}\). Ainsi, pour tous \(a, b \in \mathbb{R}^2\), \(|f(b) – f(a)| \leq\, \sqrt{2}\, \|b – a\|_2\) : la fonction est lipschitzienne.
V. Dérivées d’ordre 2 et formule de Taylor-Young
Pour décrire la position du graphe par rapport à son plan tangent, l’ordre 1 ne suffit plus. Nous introduisons donc les dérivées partielles secondes.
Si \(\partial_j f\) admet elle-même une dérivée partielle par rapport à \(x_i\), on note \(\partial_i \partial_j f = \dfrac{\partial^2 f}{\partial x_i \partial x_j}\). On dit que \(f\) est de classe \(C^2\) sur \(U\) si toutes les dérivées partielles d’ordre 2 existent et sont continues sur \(U\). La matrice hessienne de \(f : U \to \mathbb{R}\) en \(a\) est \[H_f(a) = \big(\partial_i \partial_j f(a)\big)_{1 \leq\, i, j \leq\, n}.\]
Théorème de Schwarz. Si \(f\) est de classe \(C^2\) sur \(U\), alors pour tous \(i, j\) et tout \(a \in U\), \[\partial_i \partial_j f(a) = \partial_j \partial_i f(a).\] Par conséquent, la matrice hessienne est symétrique.
On se place en dimension 2, en \(a = (0,0)\) pour simplifier. Pour \(t \neq 0\) petit, posons \(\Delta(t) = f(t,t) – f(t,0) – f(0,t) + f(0,0)\). D’une part, avec \(u(x) = f(x,t) – f(x,0)\), on a \(\Delta(t) = u(t) – u(0)\). Deux applications du théorème des accroissements finis donnent \(\Delta(t) = t^2\, \partial_2\partial_1 f(c, d)\) avec \(c, d\) entre \(0\) et \(t\). D’autre part, en échangeant les rôles de \(x\) et \(y\), on obtient \(\Delta(t) = t^2\, \partial_1 \partial_2 f(c^{\prime}, d^{\prime})\). On divise par \(t^2\), puis on fait tendre \(t\) vers \(0\). La continuité des dérivées secondes conclut.
L’hypothèse \(C^2\) est essentielle. Pour \(f(x,y) = \dfrac{xy(x^2-y^2)}{x^2+y^2}\), prolongée par \(0\), on trouve \(\partial_2\partial_1 f(0,0) = -1\) et \(\partial_1 \partial_2 f(0,0) = 1\). Ce calcul est détaillé dans les exercices.
Formule de Taylor-Young à l’ordre 2. Si \(f : U \to \mathbb{R}\) est de classe \(C^2\) et \(a \in U\), alors, quand \(h \to 0\), \[f(a+h) = f(a) + \langle \nabla f(a), h \rangle + \frac{1}{2}\, h^{\top} H_f(a)\, h + o(\|h\|^2).\] En dimension 2, avec \(h = (h,k)\) et les notations de Monge \(p = \partial_1 f(a)\), \(q = \partial_2 f(a)\), \(r = \partial_1^2 f(a)\), \(s = \partial_1\partial_2 f(a)\), \(t = \partial_2^2 f(a)\) : \[f(a_1+h, a_2+k) = f(a) + ph + qk + \frac{1}{2}\big(rh^2 + 2shk + tk^2\big) + o(h^2+k^2).\]
Fixons \(h\) tel que le segment \([a, a+h]\) soit dans \(U\), et posons \(\phi(t) = f(a+th)\). Par la règle de la chaîne, \(\phi^{\prime}(t) = \sum_j h_j\, \partial_j f(a+th)\) et \(\phi^{\prime\prime}(t) = h^{\top} H_f(a+th)\, h\). La formule de Taylor-Lagrange en une variable fournit \(\theta \in \,]0,1[\) tel que \(\phi(1) = \phi(0) + \phi^{\prime}(0) + \tfrac12 \phi^{\prime\prime}(\theta)\). Ainsi, l’écart avec le terme d’ordre 2 attendu vaut \(\tfrac12 h^{\top}(H_f(a+\theta h) – H_f(a))h\). Il est majoré par \(\tfrac12 \|H_f(a+\theta h) – H_f(a)\|\, \|h\|^2\), qui est un \(o(\|h\|^2)\) par continuité de la hessienne.
Pour \(f(x,y) = \ln(1 + x + y^2)\) en \((0,0)\) : \(\partial_1 f = \dfrac{1}{1+x+y^2}\), \(\partial_2 f = \dfrac{2y}{1+x+y^2}\). En \((0,0)\), le gradient vaut \((1, 0)\). Ensuite, \(r = -1\), \(s = 0\) et \(t = 2\). Donc \(f(x,y) = x + \tfrac12(-x^2 + 2y^2) + o(x^2+y^2) = x – \tfrac{x^2}{2} + y^2 + o(x^2+y^2)\).
VI. Points critiques et extrema
1. Condition nécessaire du premier ordre
On dit que \(f : U \to \mathbb{R}\) admet un minimum local en \(a\) s’il existe une boule \(B\) centrée en \(a\) telle que \(f(x) \geq\, f(a)\) pour tout \(x \in B \cap U\). On définit de même un maximum local. Un extremum est dit global si l’inégalité vaut sur tout le domaine.
Un point \(a \in U\) est un point critique de \(f\) si \(f\) est différentiable en \(a\) et \(\mathrm{d}f_a = 0\), c’est-à-dire \(\nabla f(a) = 0\).
Si \(f : U \to \mathbb{R}\) est différentiable en \(a\), avec \(U\) ouvert, et admet un extremum local en \(a\), alors \(a\) est un point critique de \(f\).
Supposons un minimum local en \(a\). Pour un indice \(j\), la fonction d’une variable \(t \mapsto f(a + te_j)\) est définie sur un intervalle ouvert contenant \(0\), car \(U\) est ouvert. Elle admet un minimum local en \(0\). Donc sa dérivée en \(0\), qui vaut \(\partial_j f(a)\), est nulle.
La condition n’est pas suffisante. Pour \(f(x,y) = x^2 – y^2\), l’origine est critique. Cependant \(f(x, 0) > 0\) et \(f(0, y) < 0\) pour \(x, y \neq 0\) : c’est un point col (ou point selle). De plus, l’hypothèse « \(U\) ouvert » est cruciale : sur un fermé, un extremum peut être atteint au bord en un point non critique.
2. Nature d’un point critique par la hessienne
En un point critique, la formule de Taylor-Young se réduit à \(f(a+h) – f(a) = \tfrac12 h^{\top} H_f(a) h + o(\|h\|^2)\). Le signe de la forme quadratique \(q(h) = h^{\top} H_f(a) h\) gouverne donc, en général, le signe de l’accroissement.
Soit \(f\) de classe \(C^2\) sur \(U\) et \(a\) un point critique. Notons \(\lambda_1, \ldots, \lambda_n\) les valeurs propres (réelles) de la matrice symétrique \(H_f(a)\).
- Si toutes les \(\lambda_i\) sont strictement positives, \(f\) admet un minimum local strict en \(a\).
- Si toutes sont strictement négatives, \(f\) admet un maximum local strict en \(a\).
- Si deux valeurs propres sont de signes stricts opposés, \(a\) n’est pas un extremum : c’est un point col.
Si une valeur propre est nulle sans que le troisième cas s’applique, on ne peut pas conclure à l’ordre 2 : le point est dit dégénéré.
Traitons le premier cas. Soit \(m = \min_i \lambda_i > 0\). La matrice étant symétrique réelle, on peut la diagonaliser dans une base orthonormée, ce qui donne \(q(h) \geq\, m\|h\|_2^2\). Ainsi, \(f(a+h) – f(a) \geq\, \tfrac{m}{2}\|h\|_2^2 + o(\|h\|_2^2)\). Pour \(\|h\|_2\) assez petit, le reste est inférieur à \(\tfrac{m}{4}\|h\|_2^2\) en valeur absolue. Donc \(f(a+h) – f(a) \geq\, \tfrac{m}{4}\|h\|_2^2 > 0\) pour \(h \neq 0\) petit. Pour le troisième cas, on prend \(h = tv\) avec \(v\) vecteur propre de valeur propre \(\lambda > 0\), puis \(\mu < 0\) : l’accroissement change de signe.
En dimension 2, les valeurs propres ont pour produit \(\det H_f(a) = rt – s^2\) et pour somme \(r + t\). On en déduit le critère pratique suivant, illustré par la figure ci-dessous.
Pour classer un point critique \(a\) d’une fonction \(C^2\) de deux variables, calculez \(r, s, t\) en \(a\).
- Si \(rt – s^2 > 0\) et \(r > 0\) : minimum local strict.
- Si \(rt – s^2 > 0\) et \(r < 0\) : maximum local strict.
- Si \(rt – s^2 < 0\) : point col.
- Si \(rt – s^2 = 0\) : cas douteux ; étudiez directement le signe de \(f(a+h) – f(a)\), par exemple le long de droites ou de courbes bien choisies.
Soit \(f(x,y) = x^2 + xy + y^2 – 3x\). Le gradient \((2x + y – 3,\ x + 2y)\) s’annule seulement en \((2, -1)\). Ensuite, \(r = 2\), \(s = 1\), \(t = 2\), donc \(rt – s^2 = 3 > 0\) et \(r > 0\). Par conséquent, \(f\) admet un minimum local strict en \((2,-1)\), de valeur \(4 – 2 + 1 – 6 = -3\).
Le cas dégénéré est réellement indécidable à l’ordre 2. En effet, \(x^4 + y^4\), \(-x^4 – y^4\) et \(x^4 – y^4\) ont toutes une hessienne nulle en l’origine. Pourtant, la première y admet un minimum, la deuxième un maximum et la troisième un col.
3. Extrema sur un compact
Le théorème des bornes atteintes garantit qu’une fonction continue sur un compact non vide \(K\) de \(\mathbb{R}^n\) y admet un minimum et un maximum. Reste à les localiser. Soit un extremum est atteint à l’intérieur de \(K\), et c’est alors un point critique ; soit il est atteint sur la frontière.
Pour trouver les extrema globaux de \(f\) continue sur un compact \(K\), différentiable sur l’intérieur :
- justifier l’existence par le théorème des bornes atteintes ;
- chercher les points critiques de \(f\) dans l’intérieur de \(K\) ;
- étudier \(f\) sur la frontière, souvent paramétrée (segment, cercle \((\cos\theta, \sin\theta)\)) pour se ramener à une variable ;
- comparer toutes les valeurs obtenues : la plus grande est le maximum, la plus petite le minimum.
Il est inutile de classer les points critiques intérieurs par la hessienne.
Cherchons les extrema de \(f(x,y) = x + y\) sur le disque fermé \(D\) de centre \(O\) et de rayon \(1\). Le gradient \((1,1)\) ne s’annule jamais : aucun extremum n’est intérieur. Sur le cercle, \(f(\cos\theta, \sin\theta) = \cos\theta + \sin\theta = \sqrt{2}\cos(\theta – \pi/4)\). Donc le maximum vaut \(\sqrt{2}\) en \((\tfrac{\sqrt2}{2}, \tfrac{\sqrt2}{2})\) et le minimum vaut \(-\sqrt{2}\) au point opposé.
Comme le montre la figure ci-dessous, les lignes de niveau de \(f\) sont des droites parallèles. Les extrema correspondent aux deux droites de niveau tangentes au cercle.
Ce qu’il faut retenir
- \(f\) est différentiable en \(a\) si \(f(a+h) = f(a) + \mathrm{d}f_a(h) + o(\|h\|)\), avec \(\mathrm{d}f_a\) linéaire : c’est la meilleure approximation linéaire de l’accroissement.
- Différentiable implique continue et dérivable selon tout vecteur, avec \(\mathrm{d}f_a(h) = \sum_j h_j\, \partial_j f(a)\) ; la réciproque est fausse.
- La matrice jacobienne \(J_f(a) = (\partial_j f_i(a))\) représente \(\mathrm{d}f_a\), et \(J_{g\circ f}(a) = J_g(f(a))\,J_f(a)\).
- Une fonction de classe \(C^1\) est différentiable ; c’est le critère le plus utilisé.
- Inégalité des accroissements finis : \(|f(b) – f(a)| \leq\, \sup_{[a,b]} \|\nabla f\|_2 \cdot \|b-a\|_2\) ; différentielle nulle sur un ouvert convexe implique fonction constante.
- Théorème de Schwarz : pour \(f\) de classe \(C^2\), les dérivées croisées commutent et la hessienne est symétrique.
- Taylor-Young à l’ordre 2 : \(f(a+h) = f(a) + \langle \nabla f(a), h\rangle + \tfrac12 h^{\top}H_f(a)h + o(\|h\|^2)\).
- Sur un ouvert, un extremum local d’une fonction différentiable est un point critique ; la réciproque est fausse (point col).
- En dimension 2 : \(rt – s^2 > 0\) donne un extremum (minimum si \(r > 0\)), \(rt – s^2 < 0\) un col, \(rt – s^2 = 0\) un cas douteux.
- Sur un compact, les extrema existent : on compare les valeurs aux points critiques intérieurs et sur la frontière.
Questions fréquentes sur différentielle et extrema
Quelle est la différence entre dérivées partielles et différentielle ?
Les dérivées partielles décrivent la variation de f le long des seuls axes de coordonnées. La différentielle exige une approximation linéaire valable dans toutes les directions à la fois, avec un reste en o(‖h‖). Une fonction peut avoir des dérivées partielles en un point sans y être différentiable, ni même continue, comme xy/(x²+y²) en l’origine.
Comment montrer rapidement qu'une fonction est différentiable ?
Le plus souvent, on montre qu’elle est de classe C1 : ses dérivées partielles existent et sont continues, ce qui entraîne la différentiabilité. En un point singulier, on calcule les dérivées partielles par des taux d’accroissement, puis on vérifie que le reste divisé par ‖h‖ tend vers 0.
Que faire quand rt − s² = 0 en un point critique ?
La hessienne ne permet pas de conclure : le point est dégénéré. Il faut alors étudier directement le signe de f(a+h) − f(a), par exemple le long de droites ou de courbes passant par a. Si ce signe change, le point n’est pas un extremum ; sinon, une minoration globale peut prouver un minimum.
Faut-il classer les points critiques pour trouver les extrema sur un compact ?
Non. Le théorème des bornes atteintes garantit l’existence du minimum et du maximum. Il suffit de comparer les valeurs de f aux points critiques intérieurs et sur la frontière : la plus grande valeur est le maximum, la plus petite le minimum.
Pour aller plus loin en L2
- Les énoncés : exercices de maths en L2 sur différentielle et extrema
- À maîtriser avant : Plusieurs variables : limites et dérivées partielles
- Chapitre précédent : Plusieurs variables : limites et dérivées partielles
- Chapitre suivant : Espaces probabilisés et conditionnement
- Tester vos connaissances : QCM de maths en L2 par chapitre
- Le sommaire : tous les chapitres de maths de L2 et la licence de maths de L1 à L3


























