Dérivées partielles : définition et calcul

Imaginez que vous gravissez une montagne. La pente que vous ressentez dépend de la direction dans laquelle vous marchez. Si vous avancez vers le nord, la montée sera peut-être douce ; si vous partez vers l'est, elle sera abrupte. C'est exactement l'idée qui se cache derrière les dérivées partielles : mesurer le taux de variation d'une fonction de plusieurs variables lorsque l'on fait varier une seule variable à la fois, toutes les autres étant maintenues constantes.

Les dérivées partielles constituent l'outil fondamental de l'analyse multivariable. Elles interviennent en physique (thermodynamique, mécanique des fluides), en économie (fonctions d'utilité), en optimisation, et dans toute la théorie des équations aux dérivées partielles (EDP). Ce cours vous guide pas à pas, de la définition rigoureuse jusqu'aux exercices corrigés, en passant par l'interprétation géométrique, le théorème de Schwarz et les fonctions de classe C1 \mathcal{C}^1 .

Définition des dérivées partielles

Soit f:URnR f : U \subset \mathbb{R}^n \to \mathbb{R} une fonction de n n variables définie sur un ouvert U U , et soit a=(a1,,an)U a = (a_1, \dots, a_n) \in U . On dit que f f admet une dérivée partielle par rapport à la i i -ème variable au point a a si la limite suivante existe et est finie :

fxi(a)=limh0f(a1,,ai1,ai+h,ai+1,,an)f(a1,,an)h\frac{\partial f}{\partial x_i}(a) = \lim_{h \to 0} \frac{f(a_1, \dots, a_{i-1},\, a_i + h,\, a_{i+1}, \dots, a_n) - f(a_1, \dots, a_n)}{h}

Cette limite, lorsqu'elle existe, est appelée la dérivée partielle de f f en a a par rapport à xi x_i . On la note aussi if(a) \partial_i f(a) , ou encore fxi(a) f_{x_i}(a) selon les conventions.

En pratique, calculer fxi\frac{\partial f}{\partial x_i} revient à dériver f f par rapport à xi x_i comme si toutes les autres variables étaient des constantes. C'est une réduction élégante : on ramène un problème à plusieurs variables à un problème de dérivation ordinaire.

Notations usuelles

Pour une fonction f(x,y) f(x, y) de deux variables, on rencontre couramment les notations suivantes pour la dérivée partielle par rapport à x x :

fx(x,y)  =  xf(x,y)  =  1f(x,y)  =  fx(x,y)\frac{\partial f}{\partial x}(x,y) \;=\; \partial_x f(x,y) \;=\; \partial_1 f(x,y) \;=\; f_x(x,y)

Le symbole \partial (appelé « d rond ») est réservé aux dérivées partielles pour les distinguer visuellement des dérivées ordinaires ddx \frac{d}{dx} . Cette distinction est importante : on n'écrit jamais dfdx \frac{df}{dx} pour une dérivée partielle.

Exemple fondamental

Soit f(x,y)=x3y+sin(xy2) f(x, y) = x^3 y + \sin(xy^2) . Calculons ses deux dérivées partielles.

Dérivée partielle par rapport à x x (on traite y y comme une constante) :

fx(x,y)=3x2y+y2cos(xy2)\frac{\partial f}{\partial x}(x,y) = 3x^2 y + y^2 \cos(xy^2)

Dérivée partielle par rapport à y y (on traite x x comme une constante) :

fy(x,y)=x3+2xycos(xy2)\frac{\partial f}{\partial y}(x,y) = x^3 + 2xy \cos(xy^2)

Interprétation géométrique des dérivées partielles

Pour une fonction f(x,y) f(x,y) de deux variables, le graphe de f f est une surface dans l'espace R3 \mathbb{R}^3 . Fixons un point (a,b) (a, b) dans le plan Oxy Oxy .

  • La dérivée partielle fx(a,b) \frac{\partial f}{\partial x}(a, b) est la pente de la tangente à la courbe obtenue en intersectant la surface z=f(x,y) z = f(x,y) avec le plan vertical y=b y = b , au point (a,b,f(a,b)) \bigl(a,\, b,\, f(a,b)\bigr) . On se déplace dans la direction des x x et on mesure la pente à cet instant.
  • De même, fy(a,b) \frac{\partial f}{\partial y}(a, b) est la pente de la tangente à la courbe d'intersection de la surface avec le plan vertical x=a x = a . On se déplace cette fois dans la direction des y y .

Géométriquement, calculer une dérivée partielle revient à couper la surface par un plan vertical parallèle à l'un des axes de coordonnées, puis à mesurer la pente de la courbe obtenue. Chaque dérivée partielle capture ainsi une tranche différente de l'information sur la surface.

Dérivées partielles d’ordre supérieur

Puisque fx \frac{\partial f}{\partial x} et fy \frac{\partial f}{\partial y} sont elles-mêmes des fonctions de (x,y) (x,y) , on peut les dériver à nouveau. On obtient ainsi les dérivées partielles d'ordre 2 (ou dérivées secondes). Pour une fonction f(x,y) f(x,y) , il y en a quatre :

2fx2=fxx,2fy2=fyy,2fyx=fxy,2fxy=fyx\frac{\partial^2 f}{\partial x^2} = f_{xx}, \quad \frac{\partial^2 f}{\partial y^2} = f_{yy}, \quad \frac{\partial^2 f}{\partial y \partial x} = f_{xy}, \quad \frac{\partial^2 f}{\partial x \partial y} = f_{yx}

Les deux dernières, 2fyx \frac{\partial^2 f}{\partial y \partial x} et 2fxy \frac{\partial^2 f}{\partial x \partial y} , sont appelées dérivées partielles mixtes. La notation 2fyx \frac{\partial^2 f}{\partial y \partial x} signifie : dériver d'abord par rapport à x x , puis le résultat par rapport à y y . L'ordre de lecture se fait de droite à gauche.

On définit par récurrence les dérivées partielles d'ordre k k : ce sont les dérivées partielles des dérivées partielles d'ordre k1 k-1 .

Théorème de Schwarz (symétrie des dérivées mixtes)

Théorème de Schwarz (aussi appelé théorème de Clairaut)

Soit f:URnR f : U \subset \mathbb{R}^n \to \mathbb{R} une fonction de classe C2 \mathcal{C}^2 sur l'ouvert U U . Alors, pour tous indices ij i \neq j et pour tout point aU a \in U :

2fxixj(a)  =  2fxjxi(a)\frac{\partial^2 f}{\partial x_i \, \partial x_j}(a) \;=\; \frac{\partial^2 f}{\partial x_j \, \partial x_i}(a)

Plus généralement, si f f est de classe Ck \mathcal{C}^k , on peut calculer ses dérivées partielles jusqu'à l'ordre k k dans n'importe quel ordre : le résultat ne dépend pas de l'ordre de dérivation.

Hypothèses du théorème

L'hypothèse classe C2 \mathcal{C}^2 signifie que toutes les dérivées partielles d'ordre 2 de f f existent et sont continues sur U U . Cette condition ne peut pas être allégée à la légère.

⚠ Attention : Contre-exemple de Peano

Sans l'hypothèse de continuité, le théorème devient faux. La fonction

f(x,y)={xy(x2y2)x2+y2si (x,y)(0,0)0si (x,y)=(0,0)f(x,y) = \begin{cases} \dfrac{xy(x^2 - y^2)}{x^2 + y^2} & \text{si } (x,y) \neq (0,0) \\[8pt] 0 & \text{si } (x,y) = (0,0) \end{cases}

admet bien des dérivées partielles secondes en (0,0) (0,0) , mais on a :

2fxy(0,0)=1et2fyx(0,0)=1\frac{\partial^2 f}{\partial x \, \partial y}(0,0) = 1 \qquad \text{et} \qquad \frac{\partial^2 f}{\partial y \, \partial x}(0,0) = -1

Les dérivées mixtes ne sont donc pas égales. L'hypothèse de classe C2 \mathcal{C}^2 est donc indispensable.

Preuve du théorème de Schwarz (cas n=2 n = 2 , ordre 1)

Donnons une idée de la démonstration dans le cas de deux variables x x et y y . Soit a=(x0,y0)U a = (x_0, y_0) \in U et δ0>0 \delta_0 > 0 tel que le carré [x0,x0+h]×[y0,y0+k]U [x_0, x_0 + h] \times [y_0, y_0 + k] \subset U pour h,k[0,δ0] h, k \in [0, \delta_0] . On pose la quantité auxiliaire :

Δ(h,k)=f(x0+h,y0+k)f(x0,y0+k)f(x0+h,y0)+f(x0,y0)\Delta(h,k) = f(x_0+h, y_0+k) - f(x_0, y_0+k) - f(x_0+h, y_0) + f(x_0, y_0)

On peut écrire Δ(h,k)=g(y0+k)g(y0) \Delta(h,k) = g(y_0 + k) - g(y_0) g(y)=f(x0+h,y)f(x0,y) g(y) = f(x_0 + h, y) - f(x_0, y) . Par le théorème des accroissements finis appliqué à g g , il existe θ1]0,1[ \theta_1 \in ]0,1[ tel que :

Δ(h,k)=kg(y0+θ1k)=k[fy(x0+h,y0+θ1k)fy(x0,y0+θ1k)]\Delta(h,k) = k \cdot g'(y_0 + \theta_1 k) = k \left[ \frac{\partial f}{\partial y}(x_0 + h, y_0 + \theta_1 k) - \frac{\partial f}{\partial y}(x_0, y_0 + \theta_1 k) \right]

On applique à nouveau le théorème des accroissements finis par rapport à x x , faisant intervenir la dérivée mixte 2fxy \frac{\partial^2 f}{\partial x \partial y} . Un raisonnement symétrique en échangeant les rôles de x x et y y fait apparaître 2fyx \frac{\partial^2 f}{\partial y \partial x} . La continuité des dérivées secondes permet de passer à la limite lorsque h0 h \to 0 et k0 k \to 0 , et d'en conclure l'égalité des deux dérivées mixtes en (x0,y0) (x_0, y_0) .

Fonctions de classe C1 \mathcal{C}^1 et différentiabilité

Définition : Classe C1 \mathcal{C}^1

On dit que f:UR f : U \to \mathbb{R} est de classe C1 \mathcal{C}^1 sur U U (ou C1(U) \mathcal{C}^1(U) ) si toutes ses dérivées partielles d'ordre 1 existent et sont continues sur U U .

De même, f f est de classe Ck \mathcal{C}^k si toutes ses dérivées partielles jusqu'à l'ordre k k existent et sont continues. On dit que f f est de classe C \mathcal{C}^\infty (ou lisse) si elle est de classe Ck \mathcal{C}^k pour tout entier k1 k \geq 1 .

Lien entre dérivées partielles et différentiabilité

Propriété fondamentale

Si f f est de classe C1 \mathcal{C}^1 au voisinage d'un point aU a \in U , alors f f est différentiable en a a .

La réciproque est fausse en général : la différentiabilité n'implique pas la continuité des dérivées partielles. Mais la condition C1 \mathcal{C}^1 garantit la différentiabilité.

⚠ Piège classique : existence des dérivées partielles ≠ continuité

L'existence des dérivées partielles en un point n'implique pas la continuité de la fonction en ce point, et encore moins sa différentiabilité. Il existe des fonctions dont les dérivées partielles existent en (0,0) (0,0) mais qui ne sont pas continues en ce point. La régularité des dérivées partielles (i.e. leur continuité) est l'ingrédient clé.

La différentielle totale

Lorsque f f est différentiable en a a , sa différentielle (ou différentielle totale) est l'application linéaire dfa:RnR df_a : \mathbb{R}^n \to \mathbb{R} définie par :

dfa(h1,,hn)=i=1nfxi(a)hidf_a(h_1, \dots, h_n) = \sum_{i=1}^{n} \frac{\partial f}{\partial x_i}(a) \cdot h_i

En notation différentielle, on écrit souvent :

df=fx1dx1+fx2dx2++fxndxndf = \frac{\partial f}{\partial x_1} \, dx_1 + \frac{\partial f}{\partial x_2} \, dx_2 + \cdots + \frac{\partial f}{\partial x_n} \, dx_n

La différentielle totale quantifie la meilleure approximation affine de f f au voisinage de a a . C'est la généralisation en dimension n n de la notion de tangente.

Le gradient d’une fonction de plusieurs variables

Lorsque f:URnR f : U \subset \mathbb{R}^n \to \mathbb{R} admet des dérivées partielles en tout point aU a \in U , on appelle gradient de f f en a a le vecteur :

f(a)=gradf(a)=(fx1(a)fxn(a))\nabla f(a) = \overrightarrow{\text{grad}}\, f(a) = \begin{pmatrix} \dfrac{\partial f}{\partial x_1}(a) \\[6pt] \vdots \\[6pt] \dfrac{\partial f}{\partial x_n}(a) \end{pmatrix}

Le symbole \nabla se prononce « nabla ».

Le gradient porte une information géométrique précieuse : lorsqu'il est non nul, il indique la direction de plus grande pente de f f au point a a , c'est-à-dire la direction dans laquelle la fonction croît le plus vite. Par ailleurs, le gradient est toujours orthogonal aux lignes de niveau de f f (les courbes f(x,y)=c f(x,y) = c dans le cas de deux variables).

C'est cette propriété qui est exploitée dans les algorithmes de descente de gradient, omniprésents en optimisation et en apprentissage automatique : pour minimiser une fonction, on se déplace dans la direction opposée au gradient.

Opérations sur les dérivées partielles

Si f f et g g admettent des dérivées partielles par rapport à xi x_i en a a , et si λ,μR \lambda, \mu \in \mathbb{R} , alors les règles habituelles s'appliquent composante par composante. Pour la dérivation par rapport à xi x_i :

OpérationDérivée partielle i \partial_i
Combinaison linéaire : λf+μg \lambda f + \mu g λif(a)+μig(a) \lambda \, \partial_i f(a) + \mu \, \partial_i g(a)
Produit : fg f \cdot g if(a)g(a)+f(a)ig(a) \partial_i f(a) \cdot g(a) + f(a) \cdot \partial_i g(a)
Quotient : f/g f / g (g(a)0 g(a) \neq 0 )if(a)g(a)f(a)ig(a)g(a)2 \dfrac{\partial_i f(a) \cdot g(a) - f(a) \cdot \partial_i g(a)}{g(a)^2}
Composition : φf \varphi \circ f if(a)φ(f(a)) \partial_i f(a) \cdot \varphi'(f(a))

Ces formules sont exactement les mêmes que pour les dérivées ordinaires, ce qui rend le calcul des dérivées partielles très naturel dès que l'on sait dériver des fonctions d'une variable.

Applications : vers les équations aux dérivées partielles

Les dérivées partielles sont l'ingrédient de base des équations aux dérivées partielles (EDP), qui décrivent une grande partie des phénomènes naturels. Quelques exemples emblématiques :

  • Équation de la chaleur : ut=k2ux2 \frac{\partial u}{\partial t} = k \, \frac{\partial^2 u}{\partial x^2} . Elle modélise la diffusion de la chaleur dans un milieu conducteur.
  • Équation des ondes : 2ut2=c22ux2 \frac{\partial^2 u}{\partial t^2} = c^2 \, \frac{\partial^2 u}{\partial x^2} . Elle décrit la propagation des ondes sonores ou lumineuses.
  • Équation de Laplace : 2ux2+2uy2=0 \frac{\partial^2 u}{\partial x^2} + \frac{\partial^2 u}{\partial y^2} = 0 , fondamentale en électrostatique et en mécanique des fluides.

En thermodynamique, le théorème de Schwarz permet d'établir les relations de Maxwell, qui relient les dérivées partielles des fonctions d'état (énergie interne, enthalpie, etc.). La maîtrise des dérivées partielles est donc indispensable bien au-delà des mathématiques pures.