이 장에서는 유클리드 공간 \(\mathbb{R}^n\)에서 \(\mathbb{R}^m\)으로의 함수의 미분을 다룬다. 편미분과 전미분의 개념을 정의하고, 연쇄법칙, 평균값 정리, 음함수 정리 등 중요한 결과들을 살펴본다.
편미분과 전미분
점 \(a=(a_1,\ldots,a_n)\)이 함수 \(f\colon\mathbb{R}^n\to\mathbb{R}\)의 정의역의 내점이라고 하자. 이때 점 \(a\)에서 함수 \(f\)의 \(x_i\)에 대한 편미분(partial derivative)을 \[ \frac{\partial f}{\partial x_i}(a) = \lim_{h\to0} \frac{f(a_1,\ldots,a_i+h,\ldots,a_n)-f(a)}{h} \] 로 정의한다. 위 편미분을 \(f_{x_i}(a)\)로 나타내기도 한다.
모든 변수에 대한 편미분이 존재해도 함수가 연속일 필요는 없다. 예를 들어, \[ f(x,y)= \begin{cases} \dfrac{xy}{x^2+y^2} & \text{if }\;(x,y)\ne(0,0),\\[8pt] 0 & \text{if }\;(x,y)=(0,0) \end{cases} \] 이라고 정의된 함수 \(f\)는 \((0,0)\)에서 두 편미분계수가 모두 \(0\)이지만, \(f(t,t)=1/2\)이므로 원점에서 연속이 아니다.
함수 \(f\colon\mathbb{R}^n\to\mathbb{R}^m\)이 점 \(a\)에서 전미분 가능하다(differentiable), 또는 프레셰 미분 가능하다는 것은 선형변환 \(L\colon\mathbb{R}^n\to\mathbb{R}^m\)이 존재하여 \[ \lim_{h\to0} \frac{\|f(a+h)-f(a)-L(h)\|}{\|h\|} =0 \] 인 것을 의미한다. 이러한 \(L\)은 유일하다. 실제로 \(L_1,L_2\)가 모두 위 조건을 만족시키고 \(v\in\mathbb{R}^n\)이면 \(h=tv\)를 대입하여 \(t\to0\)으로 보낼 때 \[ \|(L_1-L_2)v\| \le \frac{\|f(a+tv)-f(a)-L_1(tv)\|}{|t|} + \frac{\|f(a+tv)-f(a)-L_2(tv)\|}{|t|} \to0 \] 이므로 \(L_1v=L_2v\)이다. 이 유일한 선형변환을 \(a\)에서 \(f\)의 미분(differential) 또는 도함수라고 부르고 \(Df(a)\) 또는 \(f'(a)\)로 나타낸다.
함수 \(f\)가 \(a\)에서 전미분 가능하다는 조건은 \[ f(a+h)=f(a)+Df(a)(h)+r(h), \qquad \frac{\|r(h)\|}{\|h\|}\to0 \] 으로 쓸 수도 있다. 마지막 항을 간단히 \(o(\|h\|)\)로 나타낸다.
선형변환 \(T\colon\mathbb{R}^n\to\mathbb{R}^m\)에 대하여 \[ \|T\|=\sup_{\|v\|=1}\|T(v)\| \] 를 \(T\)의 연산자 노름(operator norm)이라고 한다. 유한차원에서는 이 상한이 유한하며, 모든 \(v\)에 대하여 \(\|T(v)\|\le\|T\|\|v\|\)가 성립한다.
정리 9.1. (미분 가능성과 연속성의 관계)
전미분 가능한 함수는 연속이다.
증명 \(f(a+h)=f(a)+Df(a)(h)+r(h)\)이고 \(\|r(h)\|/\|h\|\to0\)이므로 \[ \|f(a+h)-f(a)\| \le \|Df(a)\|\,\|h\|+\|r(h)\| \to0. \] 따라서 \(f\)는 \(a\)에서 연속이다.
함수 \(f\colon\mathbb{R}^n\to\mathbb{R}^m\)이 \(a\)에서 전미분 가능하면 \(a\)에서 \(f\)의 모든 편미분이 존재하고, \(Df(a)\)의 행렬 표현은 편미분들로 이루어진다. 실제로 \(e_i\)를 \(i\)번째 표준기저벡터라고 하면 \[ Df(a)e_i = \lim_{t\to0}\frac{f(a+te_i)-f(a)}{t}, \] 이므로 \(Df(a)e_i\)는 각 성분의 \(x_i\)에 대한 편미분을 모은 열벡터이다. 따라서 \(f=(f_1,\ldots,f_m)\)일 때 \[ Df(a)= \begin{pmatrix} \dfrac{\partial f_1}{\partial x_1}(a) & \cdots & \dfrac{\partial f_1}{\partial x_n}(a)\\ \vdots & \ddots & \vdots\\ \dfrac{\partial f_m}{\partial x_1}(a) & \cdots & \dfrac{\partial f_m}{\partial x_n}(a) \end{pmatrix}. \] \(a\)에서 모든 일계편미분계수가 존재할 때 위 행렬을 야코비 행렬(Jacobian matrix)이라고 부른다. 특히 \(a\)에서 \(f\)가 전미분 가능할 때 이 행렬이 선형변환 \(Df(a)\)를 나타낸다.
모든 편미분이 존재해도 전미분 가능할 필요는 없다. 예를 들어 \[ f(x,y)= \begin{cases} \dfrac{x^3-xy^2}{x^2+y^2} & \text{if }\;(x,y)\ne(0,0),\\[6pt] 0 & \text{if }\;(x,y)=(0,0) \end{cases} \] 이라고 하자. 이때 \(f_x(0,0)=1\), \(f_y(0,0)=0\)이므로 미분 가능하다면 \(Df(0,0)(h_1,h_2)=h_1\)이어야 한다. 그러나 \(f(t,t)=0\)이므로 \[ \frac{|f(t,t)-Df(0,0)(t,t)|}{\sqrt2|t|} = \frac1{\sqrt2} \] 이다. 따라서 \(f\)는 \((0,0)\)에서 전미분 가능하지 않다.
다변수함수 \(f\)가 점 \(a\)에서 전미분 가능하기 위한 충분조건은 다음과 같다.
정리 9.2. (전미분 가능 조건)
함수 \(f\colon\mathbb{R}^n\to\mathbb{R}^m\)의 모든 편미분이 점 \(a\)의 근방에서 존재하고 \(a\)에서 연속이면, \(f\)는 \(a\)에서 전미분 가능하다.
증명 \(f=(f_1,\ldots,f_m)\)이라고 하고 \(h=(h_1,\ldots,h_n)\)이라 하자. \(j=0,1,\ldots,n\)에 대하여 \[ x^{(j)}=a+h_1e_1+\cdots+h_je_j \] 로 두면 \(x^{(0)}=a\), \(x^{(n)}=a+h\)이다. \(h\)가 충분히 작으면 이 점들을 잇는 모든 좌표방향 선분이 주어진 근방 안에 놓인다.
각 성분 \(f_\ell\)에 대하여 일변수 평균값 정리를 좌표별로 적용하면, \(h_j\ne0\)일 때 \(x^{(j-1)}\)와 \(x^{(j)}\) 사이의 어떤 점 \(\xi_{\ell j}\)가 존재하여 \[ f_\ell(x^{(j)})-f_\ell(x^{(j-1)}) = \frac{\partial f_\ell}{\partial x_j}(\xi_{\ell j})h_j \] 가 된다. \(h_j=0\)인 항은 \(0\)이므로 따로 고려할 필요가 없다. 따라서 \[ \begin{aligned} &f_\ell(a+h)-f_\ell(a) -\sum_{j=1}^n \frac{\partial f_\ell}{\partial x_j}(a)h_j\\ &\quad= \sum_{j=1}^n \left( \frac{\partial f_\ell}{\partial x_j}(\xi_{\ell j}) - \frac{\partial f_\ell}{\partial x_j}(a) \right)h_j. \end{aligned} \] 모든 \(\xi_{\ell j}\to a\)이고 편미분들이 \(a\)에서 연속이므로, 임의의 \(\varepsilon>0\)에 대하여 \(h\)가 충분히 작으면 우변의 절댓값은 \[ \varepsilon\sum_{j=1}^n|h_j| \le \varepsilon\sqrt n\,\|h\| \] 보다 작다. 성분의 수가 유한하므로 벡터 전체의 나머지도 \(o(\|h\|)\)이다. 따라서 \(f\)는 \(a\)에서 전미분 가능하고 그 미분은 야코비 행렬로 주어진다.
문제 9.1. 함수 \(f\colon\mathbb{R}^2\to\mathbb{R}^3\)가 다음과 같이 주어졌을 때, \(f\)의 전미분 행렬을 구하시오. \[ f(x,y)= (a_{11}x+a_{12}y,\, a_{21}x+a_{22}y,\, a_{31}x+a_{32}y). \]
문제 9.2. 다음 물음에 답하시오.
- 함수 \(f(x,y)=(\cos xy,\,e^y-\ln y)\)가 점 \((1,1)\)에서 미분 가능한지 판별하시오.
- 다음 함수가 \((0,0)\)에서 미분 가능한지 판별하시오. \[ f(x,y)= \begin{cases} \dfrac{y^2}{x^2+y^2} & \text{if }\;(x,y)\ne(0,0),\\[8pt] 0 & \text{if }\;(x,y)=(0,0). \end{cases} \]
문제 9.3. \(k\in\mathbb{R}\), \(D\subseteq\mathbb{R}^n\), \(a\in D^o\)이고 두 함수 \(f\colon D\to\mathbb{R}^m\)과 \(g\colon D\to\mathbb{R}^m\)이 \(a\)에서 미분 가능하다고 하자. 다음을 증명하시오.
- 두 함수의 합 \(f+g\)는 \(a\)에서 미분 가능하고 \(D(f+g)(a)=Df(a)+Dg(a)\)이다.
- 함수의 실수배 \(kf\)는 \(a\)에서 미분 가능하고 \(D(kf)(a)=kDf(a)\)이다.
- 두 함수의 내적 \(f\cdot g\)는 \(a\)에서 미분 가능하고 \[ D(f\cdot g)(a) = g(a)^{\top}Df(a)+f(a)^{\top}Dg(a) \] 이다.
미분의 계산
실함수에서 합성함수의 미분 공식이 존재하듯 다변수함수에서도 합성함수의 미분 공식이 존재한다.
정리 9.3. (연쇄법칙)
함수 \(f\colon\mathbb{R}^n\to\mathbb{R}^m\)이 \(a\)에서 미분 가능하고 \(g\colon\mathbb{R}^m\to\mathbb{R}^p\)가 \(f(a)\)에서 미분 가능하면, \(g\circ f\)는 \(a\)에서 미분 가능하고 다음이 성립한다. \[ D(g\circ f)(a)=Dg(f(a))Df(a). \]
증명 \(u(h)=f(a+h)-f(a)\)라고 하자. \(f\)가 \(a\)에서 미분 가능하므로 \[ u(h)=Df(a)h+r_f(h), \qquad r_f(h)=o(\|h\|), \] 이고 특히 \(\|u(h)\|=O(\|h\|)\)이다. 또한 \(g\)의 미분 가능성에 의해 \[ g(f(a)+u)-g(f(a)) = Dg(f(a))u+r_g(u), \qquad r_g(u)=o(\|u\|). \] 따라서 \[ \begin{aligned} g(f(a+h))-g(f(a)) &=Dg(f(a))Df(a)h +Dg(f(a))r_f(h) +r_g(u(h))\\ &=Dg(f(a))Df(a)h+o(\|h\|). \end{aligned} \] 마지막 등식에서는 \(r_g(u(h))=o(\|u(h)\|)=o(\|h\|)\)을 사용했다.
문제 9.4. \(w=f(x,y,z)\), \(x=x(r,s)\), \(y=y(r,s)\), \(z=z(r,s)\)가 모두 미분 가능한 함수일 때, 정리 9.3을 사용하여 다음 공식을 유도하시오. \[ \frac{\partial w}{\partial r} = \frac{\partial w}{\partial x}\frac{\partial x}{\partial r} + \frac{\partial w}{\partial y}\frac{\partial y}{\partial r} + \frac{\partial w}{\partial z}\frac{\partial z}{\partial r}, \quad \frac{\partial w}{\partial s} = \frac{\partial w}{\partial x}\frac{\partial x}{\partial s} + \frac{\partial w}{\partial y}\frac{\partial y}{\partial s} + \frac{\partial w}{\partial z}\frac{\partial z}{\partial s}. \]
점 \(a\)에서 미분 가능한 실함수 \(f\colon\mathbb{R}^n\to\mathbb{R}\)를 생각하자. 이때 \(Df(a)\)의 행렬은 한 행으로 이루어지며, 그 전치벡터 \[ \nabla f(a) = \left( \frac{\partial f}{\partial x_1}(a), \ldots, \frac{\partial f}{\partial x_n}(a) \right) \] 를 \(a\)에서 \(f\)의 기울기 벡터(gradient vector)라고 부른다.
문제 9.5. \(f\)와 \(g\)가 \(D\subseteq\mathbb{R}^n\)으로부터 \(\mathbb{R}\)로의 미분 가능한 함수일 때 다음을 보이시오.
- \(\nabla(f+g)=\nabla f+\nabla g\).
- \(\nabla(f-g)=\nabla f-\nabla g\).
- \(k\)가 실수인 상수일 때 \(\nabla(kf)=k\nabla f\).
- \(\nabla(fg)=f\nabla g+g\nabla f\).
- \(g\ne0\)인 점에서 \[ \nabla(f/g) = \frac{g\nabla f-f\nabla g}{g^2}. \]
\(v\)가 단위벡터일 때, \(v\) 방향으로의 \(f\)의 방향도함수(directional derivative)를 \[ D_vf(a) = \lim_{t\to0} \frac{f(a+tv)-f(a)}{t} \] 로 정의한다. 모든 방향도함수가 존재하더라도 전미분 가능할 필요는 없지만, 전미분 가능하면 방향도함수는 기울기로 계산된다.
정리 9.4. (방향도함수와 기울기)
함수 \(f\colon\mathbb{R}^n\to\mathbb{R}\)가 \(a\)에서 전미분 가능하고 \(v\)가 단위벡터이면 \[ D_vf(a)=\nabla f(a)\cdot v.\tag{9.1} \] 특히 \(\nabla f(a)\ne0\)이면 단위벡터 가운데 방향도함수가 가장 큰 방향은 \[ v=\frac{\nabla f(a)}{\|\nabla f(a)\|} \] 이고, 가장 작은 방향은 그 반대방향이다. 최댓값과 최솟값은 각각 \(\|\nabla f(a)\|\)와 \(-\|\nabla f(a)\|\)이다.
증명 \(h=tv\)를 전미분의 정의에 대입하면 \[ f(a+tv)-f(a) = t\,Df(a)v+o(|t|). \] 양변을 \(t\)로 나누고 \(t\to0\)으로 보내면 \[ D_vf(a) = Df(a)v = \nabla f(a)\cdot v \] 이다. 나머지는 코시–슈바르츠 부등식 \[ |\nabla f(a)\cdot v| \le \|\nabla f(a)\|\|v\| \] 과 등호 조건에서 따른다.
문제 9.6. \(f(x,y)=x^2y+e^{xy}\), \(a=(1,0)\), \(v=(3/5,4/5)\)라고 하자. \(D_vf(a)\)를 구하고, \(a\)에서 방향도함수가 가장 큰 단위방향과 가장 작은 단위방향 및 그 값을 각각 구하시오.
\(x\), \(y\), \(z\)가 구간 \(I\)에서 미분 가능한 실함수이고 곡선 \(C\)가 \[ r(t)=(x(t),y(t),z(t)), \qquad t\in I \] 와 같은 함수로 표현된다고 하자. 이때 점 \(t_0\)에서 \(r\)의 미분계수를 \[ r'(t_0) = \left( \frac{d}{dt}x(t_0), \frac{d}{dt}y(t_0), \frac{d}{dt}z(t_0) \right) \] 로 정의한다. 곡선 \(C\) 위의 점에서 정의된 함수 \(w=f(r(t))\)에 대하여 \[ \frac{dw}{dt} = \frac{\partial w}{\partial x}\frac{dx}{dt} + \frac{\partial w}{\partial y}\frac{dy}{dt} + \frac{\partial w}{\partial z}\frac{dz}{dt} \] 가 성립한다. 이것을 기울기 연산자를 사용하여 나타내면 \[ \frac{d}{dt}f(r(t)) = \nabla f(r(t))\cdot r'(t) \] 이다.
문제 9.7. 미분 가능한 함수 \(F\colon\mathbb{R}^2\to\mathbb{R}\)과 상수 \(c\)에 대하여 등위곡선 \(F(x,y)=c\)를 생각하자.
- 이 등위곡선의 일부가 미분 가능한 매개화 \(r(t)=(u(t),v(t))\)로 주어지고 \(r'(t_0)\ne0\)이라고 하자. \(\nabla F(r(t_0))\)와 \(r'(t_0)\)가 서로 수직임을 보이시오.
- \((a,b)\)가 등위곡선 위의 점이고 \(\nabla F(a,b)\ne0\)이며, 이 점을 지나는 위와 같은 정칙 매개화가 존재한다고 하자. 이때 접선의 방정식이 \[ \frac{\partial F}{\partial x}(a,b)(x-a) + \frac{\partial F}{\partial y}(a,b)(y-b) = 0 \] 임을 보이시오.
함수 \(f\colon\mathbb{R}^n\to\mathbb{R}\)을 변수 \(x_i\)에 대하여 미분한 뒤 다시 변수 \(x_j\)에 대하여 미분한 이계 편도함수를 \[ f_{x_ix_j} \quad\text{또는}\quad \frac{\partial^2}{\partial x_j\,\partial x_i}f \] 로 나타낸다. 함수 \(f\)가 적절한 조건을 만족시키면 \(f\)의 이계편미분의 미분 순서를 바꾸어도 동일한 도함수를 얻는다.
정리 9.5. (클레로 정리)
함수 \(f\colon\mathbb{R}^n\to\mathbb{R}\)의 두 혼합 이계편미분 \[ \frac{\partial^2f}{\partial x_i\partial x_j}, \qquad \frac{\partial^2f}{\partial x_j\partial x_i} \] 가 점 \(c\)의 근방에서 존재하고 \(c\)에서 연속이면 \[ \frac{\partial^2f}{\partial x_i\,\partial x_j}(c) = \frac{\partial^2f}{\partial x_j\,\partial x_i}(c) \] 이다.
증명 다른 좌표를 고정하면 되므로 \(n=2\)인 경우만 증명하면 충분하다. \(c=(a,b)\)라고 하자. 충분히 작은 \(0\ne h,k\)에 대하여 \[ \Delta(h,k) = f(a+h,b+k)-f(a+h,b)-f(a,b+k)+f(a,b) \] 로 둔다.
먼저 \(g(x)=f(x,b+k)-f(x,b)\)라고 하면 일변수 평균값 정리에 의해 \(a\)와 \(a+h\) 사이의 어떤 \(\xi\)가 존재하여 \[ \Delta(h,k) = h\bigl[f_x(\xi,b+k)-f_x(\xi,b)\bigr]. \] 다시 \(y\)에 대한 평균값 정리를 적용하면 \(b\)와 \(b+k\) 사이의 어떤 \(\eta_1\)이 존재하여 \[ \Delta(h,k) = hk\,f_{xy}(\xi,\eta_1) \] 이다. 같은 방식으로 \(\phi(y)=f(a+h,y)-f(a,y)\)에 먼저 \(y\)에 대한 평균값 정리를 적용한 뒤 \(x\)에 대한 평균값 정리를 적용하면 \[ \Delta(h,k) = hk\,f_{yx}(\xi_1,\eta) \] 인 \(\xi_1,\eta\)를 얻는다. 따라서 \[ f_{xy}(\xi,\eta_1) = f_{yx}(\xi_1,\eta). \] \(h,k\to0\)이면 \(\xi,\xi_1\to a\), \(\eta,\eta_1\to b\)이므로 두 혼합 편미분의 \(c\)에서의 연속성에 의해 \[ f_{xy}(a,b) = f_{yx}(a,b) \] 이다.
문제 9.8. 함수 \(f\)가 다음과 같을 때, \(f\)의 이계편도함수를 모두 구하시오.
- \(f(x,y)=xe^y\)
- \(f(x,y)=\cos xy\)
- \(f(x,y)=\dfrac{x+y}{x^2+1}\)
문제 9.9. \(H=[a,b]\times[c,d]\)이고 \(f\colon H\to\mathbb{R}\)이 연속함수라고 하자. 이때 \[ F(y)=\int_a^b f(x,y)\,dx \] 라고 정의된 함수 \(F\)가 \([c,d]\)에서 연속임을 보이시오.
문제 9.10. \(H=[a,b]\times[c,d]\)이고 함수 \(f\colon H\to\mathbb{R}\)이 주어졌다고 하자. 각 \(y\in[c,d]\)에 대하여 \(x\mapsto f(x,y)\)가 \([a,b]\)에서 적분 가능하고, 각 \(x\in[a,b]\)에 대하여 \(y\mapsto f(x,y)\)가 \((c,d)\)에서 미분 가능하며, 편도함수 \(f_y\)가 \(H\)에서 연속이라고 하자. 이때 \(y\in(c,d)\)에 대하여 \[ \frac{d}{dy}\int_a^b f(x,y)\,dx = \int_a^b\frac{\partial f}{\partial y}(x,y)\,dx \] 가 성립함을 보이시오. 끝점에서는 해당하는 한방향 미분으로 같은 식이 성립한다. 이 공식을 편적분의 미분에 대한 라이프니츠 공식이라고 부른다.
평균값 정리와 테일러 정리
정리 9.6. (평균값 정리)
\(f\colon U\to\mathbb{R}\)가 열린 볼록집합 \(U\subseteq\mathbb{R}^n\)에서 미분 가능하다고 하자. 서로 다른 \(a,b\in U\)에 대하여 두 점을 잇는 열린 선분 위의 어떤 \(c\)가 존재하여 \[ f(b)-f(a) = \nabla f(c)\cdot(b-a) \] 를 만족시킨다.
증명 \[ \phi(t)=f(a+t(b-a)), \qquad 0\le t\le1 \] 로 두면 연쇄법칙에 의해 \[ \phi'(t) = \nabla f(a+t(b-a))\cdot(b-a). \] 일변수 평균값 정리를 \(\phi\)에 적용하면 어떤 \(\theta\in(0,1)\)에 대하여 \(\phi(1)-\phi(0)=\phi'(\theta)\)이다. \(c=a+\theta(b-a)\)로 두면 결론을 얻는다.
이로부터 다음과 같은 중요한 결과를 얻는다.
문제 9.11. 함수 \(f\colon\mathbb{R}^n\to\mathbb{R}\)에 대하여 상수 \(M\)이 존재하여 \(\|\nabla f\|\le M\)이면 \(f\)가 립시츠 연속임을 보이시오.
문제 9.12. 연결된 열린집합 \(U\subseteq\mathbb{R}^n\)에서 미분 가능한 함수 \(f\colon U\to\mathbb{R}\)가 \(\nabla f=0\)을 만족시키면 \(f\)가 상수함수임을 보이시오. 열린 연결집합에서 임의의 두 점을 유한 개의 선분으로 이루어진 경로로 이을 수 있음을 먼저 보여도 좋다.
고계미분과 관련된 내용을 기술할 때 다중지표 표기법(multi-index notation)을 사용하면 편리하다.
\(\alpha_1,\alpha_2,\ldots,\alpha_n\)이 \(0\) 이상인 정수일 때, \[ \alpha=(\alpha_1,\alpha_2,\ldots,\alpha_n) \] 에 대하여 다음과 같이 정의한다.
- \(|\alpha|=\alpha_1+\cdots+\alpha_n\)
- \(\alpha!=\alpha_1!\cdots\alpha_n!\)
- \(x^\alpha=x_1^{\alpha_1}\cdots x_n^{\alpha_n}\)
- \(\displaystyle D^\alpha= \frac{\partial^{|\alpha|}} {\partial x_1^{\alpha_1}\cdots\partial x_n^{\alpha_n}}\)
열린집합 \(U\subseteq\mathbb{R}^n\)에서 정의된 함수 \(f\)의 모든 \(|\alpha|\le k\)인 편도함수 \(D^\alpha f\)가 존재하고 연속일 때 \(f\in C^k(U)\)라고 쓴다. 모든 차수에 대하여 이 조건을 만족시키는 함수를 매끄러운 함수(smooth function)라고 하고 \(f\in C^\infty(U)\)라고 쓴다.
정리 9.7. (테일러 정리)
열린집합 \(U\subseteq\mathbb{R}^n\)에서 \(f\in C^{k+1}(U)\)이고 선분 \([a,a+h]\)가 \(U\)에 포함된다고 하자. 그러면 어떤 \(\theta\in(0,1)\)에 대하여 \[ f(a+h) = \sum_{|\alpha|\le k} \frac{D^\alpha f(a)}{\alpha!}h^\alpha + R_k(h), \] \[ R_k(h) = \sum_{|\alpha|=k+1} \frac{D^\alpha f(a+\theta h)}{\alpha!}h^\alpha \] 가 성립한다. 특히 \(h\to0\)일 때 \(R_k(h)=O(\|h\|^{k+1})\)이다.
증명 \[ \phi(t)=f(a+th), \qquad 0\le t\le1 \] 로 두자. 연쇄법칙과 다항정리에 의해 \[ \phi^{(m)}(t) = \sum_{|\alpha|=m} \frac{m!}{\alpha!} D^\alpha f(a+th)h^\alpha. \] \(\phi\)에 정리 5.9의 테일러 정리를 적용하면 어떤 \(\theta\in(0,1)\)에 대하여 \[ \phi(1) = \sum_{m=0}^{k}\frac{\phi^{(m)}(0)}{m!} + \frac{\phi^{(k+1)}(\theta)}{(k+1)!} \] 가 성립한다. 위의 \(\phi^{(m)}\) 공식을 대입하면 두 식의 명시된 전개와 나머지 공식을 얻는다.
이제 \(h\to0\)으로 보자. \(|\alpha|=k+1\)인 다중지표는 유한 개이고 각 \(D^\alpha f\)는 \(a\)의 근방에서 유계이다. 또한 \(|h^\alpha|\le\|h\|^{k+1}\)이므로 어떤 상수 \(C>0\)가 존재하여 충분히 작은 \(h\)에 대해 \[ |R_k(h)| \le C\|h\|^{k+1}. \] 따라서 \(R_k(h)=O(\|h\|^{k+1})\)이다.
문제 9.13. 점 \(a\)와 함수 \(f\)가 다음과 같을 때, \(a\)를 중심으로 하는 \(f\)의 \(3\)차 테일러 다항식을 구하시오.
- \(f(x,y)=\sqrt{x}+\sqrt{y}\), \(a=(1,4)\).
- \(f(x,y)=e^{xy}\), \(a=(0,0)\).
점 \(a\)의 근방에서 \(f\in C^2\)이면 2차 테일러 전개는 \[ f(a+h) = f(a) + \nabla f(a)\cdot h + \frac12h^{\top}H_f(a)h + o(\|h\|^2) \] 이다. 여기서 \[ H_f(a) = \left( \frac{\partial^2f}{\partial x_i\partial x_j}(a) \right)_{i,j}\tag{9.2} \] 를 헤세 행렬(Hessian matrix)이라고 부른다. 클레로 정리(정리 9.5)에 의해 \(H_f(a)\)는 대칭행렬이다.
실대칭행렬 \(H\)에 대하여 모든 \(0\ne v\in\mathbb{R}^n\)에서 \(v^{\top}Hv>0\)이면 양의 정부호(positive definite), 항상 \(v^{\top}Hv<0\)이면 음의 정부호(negative definite)라고 한다. 양수와 음수 값을 모두 취하면 부정부호(indefinite)라고 한다.
함수 \(f\colon\mathbb{R}^n\to\mathbb{R}\)가 \(a\)에서 국소극값을 가지고 미분 가능하면 모든 방향도함수가 \(0\)이므로 \(\nabla f(a)=0\)이다. 미분 가능한 함수에서 \(\nabla f(a)=0\)인 점을 임계점(critical point)이라고 부른다. 2차 테일러 전개는 임계점의 성질을 판정하는 다음 결과를 준다.
정리 9.8. (이계도함수 판정법)
함수 \(f\)가 \(a\)의 근방에서 \(C^2\)이고 \(\nabla f(a)=0\)이라고 하자. 이때 다음이 성립한다.
- \(H_f(a)\)가 양의 정부호이면 \(f\)는 \(a\)에서 극솟값을 가진다.
- \(H_f(a)\)가 음의 정부호이면 \(f\)는 \(a\)에서 극댓값을 가진다.
- \(H_f(a)\)가 부정부호이면 \(f\)는 \(a\)에서 안장점을 가진다.
증명 \(q(v)=v^{\top}H_f(a)v\)라고 하자. \(\nabla f(a)=0\)이므로 \[ f(a+h)-f(a) = \frac12q(h)+o(\|h\|^2). \]
먼저 \(H_f(a)\)가 양의 정부호라고 하자. 단위구면 \[ S^{n-1}=\{v:\|v\|=1\} \] 은 컴팩트하고 \(q\)는 연속이므로 \(q\)는 \(S^{n-1}\)에서 최솟값 \(\mu\)를 가진다. 양의 정부호성에 의해 \(\mu>0\)이다. \(h\ne0\)이면 \[ q(h) = \|h\|^2 q\left(\frac{h}{\|h\|}\right) \ge \mu\|h\|^2. \] 따라서 충분히 작은 \(h\ne0\)에 대하여 \[ f(a+h)-f(a) \ge \frac{\mu}{2}\|h\|^2 - \frac{\mu}{4}\|h\|^2 >0, \] 이므로 \(a\)는 국소극솟값이다. 음의 정부호인 경우에는 \(-f\)에 같은 논증을 적용하면 국소극댓값을 얻는다.
마지막으로 \(H_f(a)\)가 부정부호이면 \(q(u)>0\), \(q(v)<0\)인 단위벡터 \(u,v\)가 존재한다. 따라서 충분히 작은 \(t\ne0\)에 대하여 \[ f(a+tu)-f(a)>0, \qquad f(a+tv)-f(a)<0. \] 그러므로 \(a\)의 임의의 근방에는 \(f(a)\)보다 큰 값과 작은 값을 모두 주는 점이 존재하며, \(a\)는 안장점이다.
문제 9.14. 다음과 같은 함수 \(f\)의 극값을 모두 구하시오.
- \(f(x,y)=x^2-xy^3-y\)
- \(f(x,y,z)=e^{x+y}\cos z\)
문제 9.15. 함수 \(f\)와 집합 \(H\)가 다음과 같이 주어졌을 때, \(H\) 위에서 \(f\)의 최댓값과 최솟값을 구하시오.
- \(f(x,y)=x^2+2x-y^2\), \(H=\{(x,y)\mid x^2+4y^2\le4\}\).
- \(f(x,y)=x^2+2xy+3y^2\), \(H\)는 세 점 \((1,0)\), \((1,2)\), \((3,0)\)을 잇는 삼각형의 경계와 내부.
- \(f(x,y)=x^3+3xy-y^3\), \(H=[-1,1]^2\).
이계도함수 판정법에서 헤세 행렬이 양의 준정부호(positive semidefinite) 또는 음의 준정부호(negative semidefinite)인 경우에는 이 판정법만으로 결론을 내릴 수 없다. 다음 예를 살펴보자.
- \(f(x,y)=x^4+y^4\)는 원점에서 \(H_f(0,0)=0\)이지만 극솟값을 가진다.
- \(f(x,y)=x^4-y^4\)는 원점에서 \(H_f(0,0)=0\)이고, 원점은 곡면 \(z=f(x,y)\)의 안장점이다.
- \(f(x,y)=x^3+y^3\)은 원점에서 \(H_f(0,0)=0\)이고, 원점은 곡면 \(z=f(x,y)\)의 안장점이다.
음함수 정리와 역함수 정리
\(F(x,y)=x^2+y^2-25\)라고 하면 원의 방정식 \(F(x,y)=0\)에서 \(y\)는 \(x\)의 함수가 아니다. 그러나 원 위의 점 \((3,-4)\)를 포함하는 \(y<0\)인 범위를 취하면, \(F(x,y)=0\)는 \[ y=-\sqrt{25-x^2} \] 으로 나타낼 수 있으며, \(y\)는 \(x\)에 대하여 미분 가능한 함수가 된다.
이러한 결과를 더 높은 차원으로 일반화하면 다음과 같다.
정리 9.9. (음함수 정리)
함수 \(F\colon\mathbb{R}^{n+m}\to\mathbb{R}^m\)이 점 \((a,b)\in\mathbb{R}^n\times\mathbb{R}^m\)의 근방에서 \(C^1\)이고 \(F(a,b)=0\)이라고 하자. \(y\)에 대한 야코비 행렬 \[ F_y(a,b) = \left( \frac{\partial F_i}{\partial y_j}(a,b) \right) \] 가 가역이면, \(a\)의 근방 \(U\)와 \(b\)의 근방 \(V\), 그리고 유일한 \(C^1\) 함수 \(g\colon U\to V\)가 존재하여 \[ (x,y)\in U\times V \quad\Longrightarrow\quad F(x,y)=0 \ \Longleftrightarrow\ y=g(x) \] 가 성립한다. 또한 \[ Dg(x) = -\bigl[F_y(x,g(x))\bigr]^{-1}F_x(x,g(x)). \]
증명 \(A=F_y(a,b)\)라고 하고 \[ \Phi(x,y) = y-A^{-1}F(x,y) \] 로 두자. 그러면 \(F(x,y)=0\)이기 위한 필요충분조건은 \(y=\Phi(x,y)\)이다. 또한 \[ D_y\Phi(a,b) = I-A^{-1}F_y(a,b) = 0. \] \(D_y\Phi\)의 연속성에 의해 충분히 작은 닫힌 공들의 곱 \[ Q = \overline B(a,\delta) \times \overline B(b,\varepsilon) \] 에서 \[ \|D_y\Phi(x,y)\| \le\frac12 \] 가 되게 할 수 있다. \(\delta\)를 더 작게 잡으면 \[ \|\Phi(x,b)-b\| < \frac{\varepsilon}{2} \qquad (\|x-a\|\le\delta) \] 도 성립한다.
\(x\)를 고정하자. 선분을 따라 미적분의 기본정리를 성분별로 적용하면 \[ \|\Phi(x,y_1)-\Phi(x,y_2)\| \le \frac12\|y_1-y_2\| \] 이고, \(\|y-b\|\le\varepsilon\)이면 \[ \|\Phi(x,y)-b\| \le \frac12\|y-b\| + \frac{\varepsilon}{2} \le \varepsilon. \] 정리 3.2의 유클리드 공간의 완비성에 의해 \(\mathbb{R}^m\)은 완비이고, 그 닫힌부분집합 \(\overline B(b,\varepsilon)\)도 완비이다. 따라서 \(\Phi_x(y)=\Phi(x,y)\)는 완비거리공간 \(\overline B(b,\varepsilon)\)을 자기 자신으로 보내는 축소사상이다. 문제 4.23의 바나흐 고정점 정리에 의해 각 \(x\in B(a,\delta)\)에 대하여 유일한 고정점 \(g(x)\in\overline B(b,\varepsilon)\)이 존재한다. 곧 \[ F(x,g(x))=0 \] 이고, 같은 공 안의 다른 \(y\)가 \(F(x,y)=0\)을 만족시키면 고정점의 유일성에 의해 \(y=g(x)\)이다.
이제 \(g\)의 정칙성을 보이자. \(Q\)에서 \(D_x\Phi\)는 유계이므로 어떤 \(M>0\)에 대하여 \[ \|\Phi(x_1,y)-\Phi(x_2,y)\| \le M\|x_1-x_2\| \] 이다. 고정점 방정식을 이용하면 \[ \|g(x_1)-g(x_2)\| \le M\|x_1-x_2\| + \frac12\|g(x_1)-g(x_2)\|, \] 따라서 \[ \|g(x_1)-g(x_2)\| \le 2M\|x_1-x_2\|. \] 즉 \(g\)는 국소적으로 립시츠 연속이다. 특히 \(g(a)=b\)이므로 \(a\)의 근방을 더 작게 잡으면 \(g(U)\subseteq B(b,\varepsilon)\)이 되게 할 수 있다. 이제 \(V=B(b,\varepsilon)\)로 두면 \(U\times V\)에서 \(F(x,y)=0\)이기 위한 필요충분조건은 \(y=g(x)\)이다.
고정된 \(x\in U\)에서 \(y=g(x)\)라 하고, \[ k=g(x+h)-g(x) \] 로 두자. 위 추정에 의해 \(\|k\|=O(\|h\|)\)이다. \(F\)의 전미분 가능성을 \((x,y)\)에서 사용하면 \[ 0 = F(x+h,y+k)-F(x,y) = F_x(x,y)h+F_y(x,y)k+r(h,k), \] 여기서 \[ \|r(h,k)\| = o\left(\sqrt{\|h\|^2+\|k\|^2}\right) = o(\|h\|) \] 이다. 한편 \(Q\)를 충분히 작게 잡았으므로 \[ \|I-A^{-1}F_y(x,y)\|<1. \] 만약 \(F_y(x,y)v=0\)이면 \[ \|v\| = \|(I-A^{-1}F_y(x,y))v\| < \|v\| \] 가 되어 모순이므로, \(F_y(x,y)\)는 일대일이고 따라서 가역이다. 그러므로 \[ k = -F_y(x,y)^{-1}F_x(x,y)h + o(\|h\|). \] 즉 \(g\)는 미분 가능하고 \[ Dg(x) = -F_y(x,g(x))^{-1}F_x(x,g(x)). \] 가역행렬 \(B\)에 대한 공식 \[ B^{-1} = \frac{\operatorname{adj}(B)}{\det B} \] 에서 행렬의 역연산은 가역행렬들의 집합에서 연속임을 알 수 있다. 따라서 우변은 \(x\)에 대하여 연속이고 \(g\in C^1\)이다.
음함수 정리를 사용할 때 염두에 둘 점은 다음과 같다.
- 음함수 정리는 국소적 결과이다. 즉 전역적으로는 여러 개의 해가 존재할 수 있다. 예를 들어, \(x^2+y^2=25\)에서 \(y\)를 \(x\)의 함수로 나타내면 국소적으로만 가능하다.
- \(F_y\)가 가역이 아니면 음함수가 존재하지 않거나 유일하지 않을 수 있다. 예를 들어 \(F(x,y)=x^2-y^2\)에서는 \((0,0)\)에서 \(F_y=0\)이고, 해가 \(y=x\)와 \(y=-x\) 두 가지 가지를 가지므로 원점 근처에서 \(y\)를 \(x\)의 함수로 유일하게 나타낼 수 없다.
- 더 일반적으로 \(k\ge1\)이고 \(F\)가 \(C^k\)이면 \(g\)도 \(C^k\)이다. 이는 위 미분 공식을 반복하여 적용하면 얻을 수 있으며, 여기서는 별도로 증명하지 않는다.
보기 9.10.
방정식 \[ x^3+y^3+xy-3=0 \] 이 점 \((1,1)\) 근처에서 \(y=g(x)\) 형태로 유일하게 풀 수 있는지 확인해보자.
\(F(x,y)=x^3+y^3+xy-3\)이라 하면 \[ \begin{aligned} F(1,1)&=1+1+1-3=0,\\ \frac{\partial F}{\partial y}(x,y)&=3y^2+x, & \frac{\partial F}{\partial x}(x,y)&=3x^2+y,\\ \frac{\partial F}{\partial y}(1,1)&=4\ne0, & \frac{\partial F}{\partial x}(1,1)&=4 \end{aligned} \] 이다. 따라서 음함수 정리에 의해 \((1,1)\) 근처에서 주어진 방정식을 \(y=g(x)\)로 유일하게 나타낼 수 있으며, \[ g'(1) = -\frac{\partial F/\partial x(1,1)} {\partial F/\partial y(1,1)} = -\frac44 = -1. \]
정리 9.11. (역함수 정리)
함수 \(f\colon\mathbb{R}^n\to\mathbb{R}^n\)이 점 \(a\)의 근방에서 \(C^1\)이고 \(Df(a)\)가 가역이면, \(a\)의 근방 \(U\)와 \(f(a)\)의 근방 \(V\)가 존재하여 \(f\colon U\to V\)는 일대일대응이다. 역함수 \(f^{-1}\colon V\to U\)도 \(C^1\)이고 \[ D(f^{-1})(y) = \bigl[Df(f^{-1}(y))\bigr]^{-1} \] 을 만족시킨다.
증명 독립변수를 \(y\), 풀어야 할 변수를 \(x\)로 보고 \[ F(y,x)=f(x)-y \] 라고 하자. 그러면 \(F(f(a),a)=0\)이고 \[ F_x(f(a),a)=Df(a) \] 가 가역이다. 음함수 정리에 의해 \(f(a)\)의 근방 \(V_0\), \(a\)의 근방 \(U_0\), 그리고 \(C^1\) 함수 \(g\colon V_0\to U_0\)가 존재하여 \[ f(g(y))=y \qquad (y\in V_0) \] 이고, \(x\in U_0\)에서 \(f(x)=y\)인 해는 \(x=g(y)\)로 유일하다.
\(f\)의 연속성에 의해 \(a\)의 열린근방 \(W\subseteq U_0\)를 충분히 작게 잡아 \(f(W)\subseteq V_0\)이 되게 할 수 있다. 그러면 \(x\in W\)에 대하여 \(x\)와 \(g(f(x))\)는 모두 \(U_0\) 안에서 방정식 \(f(z)=f(x)\)의 해이므로 국소 유일성에 의해 \[ g(f(x))=x. \] 따라서 \(f\)는 \(W\)에서 일대일이다.
이제 \(g\)의 연속성을 이용하여 \(f(a)\)의 더 작은 열린근방 \(V\subseteq V_0\)를 잡아 \(g(V)\subseteq W\)가 되게 하고 \[ U=W\cap f^{-1}(V) \] 로 둔다. 그러면 \(U\)는 \(a\)의 열린근방이고, \(f\colon U\to V\)는 일대일대응이며 역함수는 \(g|_V\)이다. 음함수 정리의 미분 공식에서 \[ \begin{aligned} Dg(y) &= -[F_x(y,g(y))]^{-1}F_y(y,g(y))\\ &= [Df(g(y))]^{-1} \end{aligned} \] 이므로 원하는 공식을 얻는다.
함수 \(f\colon U\to V\)가 일대일대응이고 \(f\)와 \(f^{-1}\)가 모두 \(C^1\)이면 \(f\)를 미분동형사상(diffeomorphism)이라고 한다. 모든 점이 어떤 근방에서 이러한 성질을 가지면 국소 미분동형사상(local diffeomorphism)이라고 한다.
따름정리 9.12.
함수 \(f\colon\mathbb{R}^n\to\mathbb{R}^n\)이 열린집합 \(\Omega\)에서 \(C^1\)이고 모든 점에서 \(Df(x)\)가 가역이면 다음이 성립한다.
- \(f\)는 국소 미분동형사상이다.
- \(f(\Omega)\)는 열린집합이다.
- \(f\)가 일대일이면 \(f\colon\Omega\to f(\Omega)\)는 미분동형사상이다.
증명 첫 번째 명제는 역함수 정리에서 바로 따른다. 각 \(x\in\Omega\)에 대하여 \(f(x)\)는 어떤 열린근방 \(V_x\subseteq f(\Omega)\)를 가지므로 \[ f(\Omega) = \bigcup_{x\in\Omega}V_x \] 는 열린집합이다. 마지막으로 \(f\)가 일대일이면 국소역함수들은 전역적인 역함수 \(f^{-1}\)의 제한이며, 각 점에서 \(C^1\)이므로 \(f^{-1}\)도 \(C^1\)이다.
역함수 정리는 비선형 함수가 국소적으로 선형변환처럼 행동함을 보여준다. 점 \(a\) 근처에서 \(f\)는 근사적으로 \[ f(x) \approx f(a)+Df(a)(x-a) \] 이고, \(Df(a)\)가 가역이면 이 선형근사가 국소적으로 일대일대응이 된다.
보기 9.13.
극좌표 변환 \[ f(r,\theta) = (r\cos\theta,r\sin\theta) \] 를 생각하자. \(f\)의 야코비 행렬은 \[ Df(r,\theta) = \begin{pmatrix} \cos\theta & -r\sin\theta\\ \sin\theta & r\cos\theta \end{pmatrix} \] 이다. 이 행렬의 행렬식이 \(\det(Df)=r\)이므로 \(r\ne0\)인 모든 점에서 역함수 정리가 적용된다. 실제로 \(r>0\)인 영역에서 극좌표 변환은 국소적으로 가역이다.
\(r=0\)인 점들에서는 역함수 정리를 적용할 수 없고, 실제로 모든 \((0,\theta)\)가 원점으로 보내지므로 그 점들에서 국소적으로 가역이 아니다.
문제 9.16. 다음 각 함수와 점 \(p\)에 대하여 \(Df(p)\)가 가역임을 확인하고, \(f(p)\)의 적당한 열린근방에서 \(p\)에 대응하는 국소역함수의 미분 \(D(f^{-1})(f(p))\)을 구하시오.
- \(f(u,v)=(3u-v,\,2u+5v)\), \(p\in\mathbb{R}^2\)는 임의의 점.
- \(f(u,v)=(u+v,\,\sin u+\cos v)\), \(p=(0,0)\).
- \(f(u,v)=(uv,\,u^2+v^2)\), \(p=(1,2)\).
- \(f(u,v)=(u^3-v^2,\,\sin u-\ln v)\), \(p=(0,1)\).
문제 9.17. 다음 각 등식에 대하여 점 \((0,0,0)\)의 열린근방 \(V\)가 존재하여 주어진 등식을 \(V\)에서 \(z\)에 대하여 풀 수 있는지 판별하시오. 또한 \(z\)에 대하여 푼 식이 \((0,0)\)의 근방에서 미분 가능한지 판별하시오.
- \(xyz+\sin(x+y+z)=0\)
- \(x^2+y^2+z^2+\sqrt{\sin(x^2+y^2)+3z+4}=2\)
- \(xyz(2\cos y-\cos z)+(z\cos x-x\cos y)=0\)
문제 9.18. 함수 \(F\colon\mathbb{R}^2\to\mathbb{R}\)가 \((a,b)\)에서 미분 가능하고 \(F_y(a,b)\ne0\)이며 \(I\)가 \(a\)의 열린근방이라고 하자. 또한 함수 \(f\colon I\to\mathbb{R}\)이 \(a\)에서 미분 가능하고 \(f(a)=b\)이며 임의의 \(x\in I\)에 대하여 \(F(x,f(x))=0\)이라고 하자. 이때 \[ \frac{d}{dx}f(a) = -\frac{\dfrac{\partial F}{\partial x}(a,b)} {\dfrac{\partial F}{\partial y}(a,b)} \] 임을 증명하시오.
라그랑주 승수법
현실의 문제를 모델링한 최적화 문제는 제약조건을 동반하는 경우가 많다. 예를 들어, 둘레의 길이가 고정되어 있을 때 넓이가 최대인 직사각형을 구하거나, 겉넓이가 고정되어 있을 때 부피가 최대인 원기둥을 구하는 문제 등을 생각할 수 있다. 이처럼 제약조건 아래에서 극값을 구하는 방법 중 하나가 라그랑주 승수법(Lagrange multiplier method)이다.
먼저 기하학적 관점에서 라그랑주 승수법을 살펴보자. 제약조건 \(g(x)=c\) 아래에서 함수 \(f\colon\mathbb{R}^n\to\mathbb{R}\)의 극값을 구하는 상황을 생각하자. \(g\)가 \(C^1\)이고 제약집합의 점 \(a\)에서 \(\nabla g(a)\ne0\)이면, 음함수 정리에 의해 \(a\) 근처의 제약집합은 \((n-1)\)차원 곡면으로 나타난다. 만약 \(a\)가 이 곡면 위에서 \(f\)의 극값이라면, \(f\)의 등위면 \(f(x)=f(a)\)와 제약곡면 \(g(x)=c\)의 접방향이 \(a\)에서 일치하므로 두 법벡터 \(\nabla f(a)\)와 \(\nabla g(a)\)가 평행해야 한다.
정리 9.14. (라그랑주 승수법—제약조건이 하나인 경우)
함수 \(f,g\colon\mathbb{R}^n\to\mathbb{R}\)이 \(C^1\)이고, \(a\)가 제약조건 \(g(x)=c\) 아래에서 \(f\)의 국소극값이며 \(\nabla g(a)\ne0\)이라고 하자. 그러면 어떤 실수 \(\lambda\)가 존재하여 \[ \nabla f(a) = \lambda\nabla g(a) \] 를 만족시킨다.
증명 좌표의 순서를 바꾸어 \(g_{x_n}(a)\ne0\)이라고 해도 된다. \(a=(a',a_n)\)으로 쓰자. 음함수 정리에 의해 \(a'\)의 근방에서 \(C^1\) 함수 \(\varphi\)가 존재하여 \(a\) 근처의 제약집합은 \[ x_n = \varphi(x_1,\ldots,x_{n-1}) \] 로 나타난다. 함수 \[ \psi(u) = f(u,\varphi(u)) \] 는 \(u=a'\)에서 국소극값을 가지므로 \[ \frac{\partial\psi}{\partial u_j}(a')=0. \] 연쇄법칙에 의해 \[ f_{x_j}(a) + f_{x_n}(a)\varphi_{x_j}(a') = 0. \] 한편 \(g(u,\varphi(u))=c\)이므로 \[ g_{x_j}(a) + g_{x_n}(a)\varphi_{x_j}(a') = 0. \] 따라서 \[ \lambda = \frac{f_{x_n}(a)}{g_{x_n}(a)} \] 로 두면 \(j<n\)에 대하여 \(f_{x_j}(a)=\lambda g_{x_j}(a)\)이고, \(j=n\)에서도 정의에 의해 같은 식이 성립한다. 즉 \[ \nabla f(a) = \lambda\nabla g(a) \] 이다.
이 정리에서 \(\lambda\)를 라그랑주 승수(Lagrange multiplier)라고 부른다. 실제 계산에서는 다음 연립방정식을 푼다. \[ \begin{cases} \nabla f(x)=\lambda\nabla g(x),\\ g(x)=c. \end{cases} \] 이것은 \(n+1\)개의 방정식과 \(n+1\)개의 미지수 \((x_1,\ldots,x_n,\lambda)\)를 가진 연립방정식이다.
라그랑주 승수법을 제약조건이 여러 개 있는 경우로 확장하면 다음과 같다.
정리 9.15. (라그랑주 승수법: 제약조건이 여러 개인 경우)
함수 \(f,g_1,\ldots,g_k\colon\mathbb{R}^n\to\mathbb{R}\)이 \(C^1\)이고, \(a\)가 제약조건 \(g_i(x)=c_i\) \((i=1,\ldots,k)\) 아래에서 \(f\)의 국소극값이라고 하자. 벡터 \(\nabla g_1(a),\ldots,\nabla g_k(a)\)가 일차독립이면, 실수 \(\lambda_1,\ldots,\lambda_k\)가 존재하여 \[ \nabla f(a) = \sum_{i=1}^k\lambda_i\nabla g_i(a) \] 를 만족시킨다.
증명 \[ G=(g_1,\ldots,g_k) \colon \mathbb{R}^n\to\mathbb{R}^k \] 라고 하자. 가정에 의해 \(DG(a)\)의 계수는 \(k\)이다. 좌표를 재배열하여 \[ x=(u,v) \in \mathbb{R}^{n-k}\times\mathbb{R}^k \] 로 쓸 때 \[ B=G_v(a) \] 가 가역이 되게 할 수 있다. 음함수 정리에 의해 제약집합은 \(a\) 근처에서 \(v=\varphi(u)\)로 나타난다. \(A=G_u(a)\)라고 하면 \[ A+B\,D\varphi(a_u)=0, \qquad D\varphi(a_u)=-B^{-1}A. \]
\(Df(a)=(p\ q)\)로 쓰자. 제약집합에 제한한 함수 \(u\mapsto f(u,\varphi(u))\)가 \(a_u\)에서 국소극값을 가지므로 \[ 0 = p+qD\varphi(a_u) = p-qB^{-1}A. \] \[ \lambda^{\top} = qB^{-1} \] 로 두면 \(p=\lambda^{\top}A\), \(q=\lambda^{\top}B\)이므로 \[ Df(a) = \lambda^{\top}DG(a). \] 이를 전치하면 \[ \nabla f(a) = \sum_{i=1}^k\lambda_i\nabla g_i(a) \] 이다.
실제로 계산할 때는 다음과 같은 라그랑주 함수(Lagrangian)를 정의하는 것이 편리하다. \[ L(x,\lambda) = f(x) - \sum_{i=1}^k\lambda_i(g_i(x)-c_i). \] 정리의 정칙성 가정 아래 제약된 극값 \(a\)가 존재하면 적당한 \(\lambda=(\lambda_1,\ldots,\lambda_k)\)가 존재하여 \((a,\lambda)\)에서 \(L\)의 모든 편미분이 \(0\)이다. \[ \frac{\partial L}{\partial x_j}=0 \quad (j=1,\ldots,n), \qquad \frac{\partial L}{\partial\lambda_i}=0 \quad (i=1,\ldots,k). \]
보기 9.16.
\(a>b>0\)일 때, 타원 \[ \frac{x^2}{a^2} + \frac{y^2}{b^2} = 1 \] 위의 점 중 원점에서 가장 먼 점과 가장 가까운 점을 구해보자.
목적함수는 \(f(x,y)=x^2+y^2\)이고, 제약조건은 \[ g(x,y) = \frac{x^2}{a^2} + \frac{y^2}{b^2} - 1 = 0 \] 이다.
라그랑주 조건 \(\nabla f=\lambda\nabla g\)는 \[ (2x,2y) = \lambda \left( \frac{2x}{a^2}, \frac{2y}{b^2} \right) \] 이다. 이 식으로부터 \[ x\left(1-\frac{\lambda}{a^2}\right)=0, \qquad y\left(1-\frac{\lambda}{b^2}\right)=0 \] 을 얻는다.
\(x=0\) 또는 \(y=0\)인 경우를 검토하면, 함수 \(f\)는 \((\pm a,0)\)에서 최댓값 \(a^2\)을 가지며, \((0,\pm b)\)에서 최솟값 \(b^2\)을 가진다.
라그랑주 승수법을 활용하여 잘 알려진 부등식을 증명해 보자.
보기 9.17. (산술-기하 평균 부등식)
양수 \(x_1,\ldots,x_n\)에 대하여 \[ \frac{x_1+\cdots+x_n}{n} \ge \sqrt[n]{x_1\cdots x_n} \] 임을 라그랑주 승수법으로 보이자. \(c=(x_1\cdots x_n)^{1/n}\)을 고정하고 제약조건 \(x_1\cdots x_n=c^n\) 아래에서 \[ f(x_1,\ldots,x_n) = x_1+\cdots+x_n \] 의 최솟값을 생각한다. 점 \((c,\ldots,c)\)에서 \(f=nc\)이므로 최솟값을 찾을 때 \(f\le nc\)인 부분만 보면 충분하다. 이 부분에서는 각 \(x_i\le nc\)이고 \[ x_i = \frac{c^n}{\prod_{j\ne i}x_j} \ge \frac{c^n}{(nc)^{n-1}}, \] 이므로 해당 제약집합은 컴팩트하다. 따라서 최솟값이 존재한다.
제약함수 \(g=x_1\cdots x_n\)의 기울기는 양의 영역에서 \(0\)이 아니므로 라그랑주 승수법을 적용할 수 있다. 조건 \[ 1 = \lambda\frac{c^n}{x_i} \qquad (i=1,\ldots,n) \] 에서 모든 \(x_i\)가 같고, 곱이 \(c^n\)이므로 \[ x_1=\cdots=x_n=c \] 이다. 따라서 최솟값은 \(nc\)이고 원하는 부등식을 얻는다.
라그랑주 승수법은 극값의 필요조건만을 제공한다는 점을 유념해야 한다. 구한 점에서 함수가 실제로 극값을 갖는지 여부는 직접 확인해야 한다.
문제 9.19. 제약조건 \(x^2+y^2+z^2=1\) 아래에서 \(f(x,y,z)=x+2y+3z\)의 최댓값과 최솟값을 구하시오.
문제 9.20. 구 \(x^2+y^2+z^2=1\) 위에서 함수 \(f(x,y,z)=xyz\)의 극값을 구하시오.
문제 9.21. \(S>0\)일 때 표면적이 \(S\)인 직육면체 중 부피가 최대인 것의 세 모서리의 길이를 구하시오.
문제 9.22. \(a,b,c>0\)일 때 타원체 \[ \frac{x^2}{a^2} + \frac{y^2}{b^2} + \frac{z^2}{c^2} = 1 \] 에 내접하고 중심이 원점이며 모서리가 좌표축에 평행한 직육면체의 최대 부피를 구하시오.
문제 9.23. 다음 물음에 답하시오. 제약조건 아래 극값이 존재하지 않으면 그 사실도 보이시오.
- 원 \(x^2+y^2=4\) 위에서 함수 \(f(x,y)=x+y^2\)의 극값을 구하시오.
- \(x^2+y^2+z^2=1\)과 \(x+y+z=0\)을 모두 만족시키는 범위에서 함수 \(f(x,y,z)=xy\)의 극값을 구하시오.
- \(3x^2+y+4z^3=1\)과 \(-x^3+3z^4+w=0\)을 모두 만족시키는 범위에서 함수 \(f(x,y,z,w)=3x+y+w\)의 극값을 구하시오.
