SASA Math
  • Introduction
  • Recent Articles
  • Topic Index
  • Tag Cloud
  • Links

다변수 함수의 미분

by I Seul Bee

이 장에서는 유클리드 공간 \(\mathbb{R}^n\)에서 \(\mathbb{R}^m\)으로의 함수의 미분을 다룬다. 편미분과 전미분의 개념을 정의하고, 연쇄법칙, 평균값 정리, 음함수 정리 등 중요한 결과들을 살펴본다.

편미분과 전미분

점 \(a=(a_1,\ldots,a_n)\)이 함수 \(f\colon\mathbb{R}^n\to\mathbb{R}\)의 정의역의 내점이라고 하자. 이때 점 \(a\)에서 함수 \(f\)의 \(x_i\)에 대한 편미분(partial derivative)을 \[ \frac{\partial f}{\partial x_i}(a) = \lim_{h\to0} \frac{f(a_1,\ldots,a_i+h,\ldots,a_n)-f(a)}{h} \] 로 정의한다. 위 편미분을 \(f_{x_i}(a)\)로 나타내기도 한다.

모든 변수에 대한 편미분이 존재해도 함수가 연속일 필요는 없다. 예를 들어, \[ f(x,y)= \begin{cases} \dfrac{xy}{x^2+y^2} & \text{if }\;(x,y)\ne(0,0),\\[8pt] 0 & \text{if }\;(x,y)=(0,0) \end{cases} \] 이라고 정의된 함수 \(f\)는 \((0,0)\)에서 두 편미분계수가 모두 \(0\)이지만, \(f(t,t)=1/2\)이므로 원점에서 연속이 아니다.

함수 \(f\colon\mathbb{R}^n\to\mathbb{R}^m\)이 점 \(a\)에서 전미분 가능하다(differentiable), 또는 프레셰 미분 가능하다는 것은 선형변환 \(L\colon\mathbb{R}^n\to\mathbb{R}^m\)이 존재하여 \[ \lim_{h\to0} \frac{\|f(a+h)-f(a)-L(h)\|}{\|h\|} =0 \] 인 것을 의미한다. 이러한 \(L\)은 유일하다. 실제로 \(L_1,L_2\)가 모두 위 조건을 만족시키고 \(v\in\mathbb{R}^n\)이면 \(h=tv\)를 대입하여 \(t\to0\)으로 보낼 때 \[ \|(L_1-L_2)v\| \le \frac{\|f(a+tv)-f(a)-L_1(tv)\|}{|t|} + \frac{\|f(a+tv)-f(a)-L_2(tv)\|}{|t|} \to0 \] 이므로 \(L_1v=L_2v\)이다. 이 유일한 선형변환을 \(a\)에서 \(f\)의 미분(differential) 또는 도함수라고 부르고 \(Df(a)\) 또는 \(f'(a)\)로 나타낸다.

함수 \(f\)가 \(a\)에서 전미분 가능하다는 조건은 \[ f(a+h)=f(a)+Df(a)(h)+r(h), \qquad \frac{\|r(h)\|}{\|h\|}\to0 \] 으로 쓸 수도 있다. 마지막 항을 간단히 \(o(\|h\|)\)로 나타낸다.

선형변환 \(T\colon\mathbb{R}^n\to\mathbb{R}^m\)에 대하여 \[ \|T\|=\sup_{\|v\|=1}\|T(v)\| \] 를 \(T\)의 연산자 노름(operator norm)이라고 한다. 유한차원에서는 이 상한이 유한하며, 모든 \(v\)에 대하여 \(\|T(v)\|\le\|T\|\|v\|\)가 성립한다.

정리 9.1. (미분 가능성과 연속성의 관계)

전미분 가능한 함수는 연속이다.

증명 \(f(a+h)=f(a)+Df(a)(h)+r(h)\)이고 \(\|r(h)\|/\|h\|\to0\)이므로 \[ \|f(a+h)-f(a)\| \le \|Df(a)\|\,\|h\|+\|r(h)\| \to0. \] 따라서 \(f\)는 \(a\)에서 연속이다.

함수 \(f\colon\mathbb{R}^n\to\mathbb{R}^m\)이 \(a\)에서 전미분 가능하면 \(a\)에서 \(f\)의 모든 편미분이 존재하고, \(Df(a)\)의 행렬 표현은 편미분들로 이루어진다. 실제로 \(e_i\)를 \(i\)번째 표준기저벡터라고 하면 \[ Df(a)e_i = \lim_{t\to0}\frac{f(a+te_i)-f(a)}{t}, \] 이므로 \(Df(a)e_i\)는 각 성분의 \(x_i\)에 대한 편미분을 모은 열벡터이다. 따라서 \(f=(f_1,\ldots,f_m)\)일 때 \[ Df(a)= \begin{pmatrix} \dfrac{\partial f_1}{\partial x_1}(a) & \cdots & \dfrac{\partial f_1}{\partial x_n}(a)\\ \vdots & \ddots & \vdots\\ \dfrac{\partial f_m}{\partial x_1}(a) & \cdots & \dfrac{\partial f_m}{\partial x_n}(a) \end{pmatrix}. \] \(a\)에서 모든 일계편미분계수가 존재할 때 위 행렬을 야코비 행렬(Jacobian matrix)이라고 부른다. 특히 \(a\)에서 \(f\)가 전미분 가능할 때 이 행렬이 선형변환 \(Df(a)\)를 나타낸다.

모든 편미분이 존재해도 전미분 가능할 필요는 없다. 예를 들어 \[ f(x,y)= \begin{cases} \dfrac{x^3-xy^2}{x^2+y^2} & \text{if }\;(x,y)\ne(0,0),\\[6pt] 0 & \text{if }\;(x,y)=(0,0) \end{cases} \] 이라고 하자. 이때 \(f_x(0,0)=1\), \(f_y(0,0)=0\)이므로 미분 가능하다면 \(Df(0,0)(h_1,h_2)=h_1\)이어야 한다. 그러나 \(f(t,t)=0\)이므로 \[ \frac{|f(t,t)-Df(0,0)(t,t)|}{\sqrt2|t|} = \frac1{\sqrt2} \] 이다. 따라서 \(f\)는 \((0,0)\)에서 전미분 가능하지 않다.

다변수함수 \(f\)가 점 \(a\)에서 전미분 가능하기 위한 충분조건은 다음과 같다.

정리 9.2. (전미분 가능 조건)

함수 \(f\colon\mathbb{R}^n\to\mathbb{R}^m\)의 모든 편미분이 점 \(a\)의 근방에서 존재하고 \(a\)에서 연속이면, \(f\)는 \(a\)에서 전미분 가능하다.

증명 \(f=(f_1,\ldots,f_m)\)이라고 하고 \(h=(h_1,\ldots,h_n)\)이라 하자. \(j=0,1,\ldots,n\)에 대하여 \[ x^{(j)}=a+h_1e_1+\cdots+h_je_j \] 로 두면 \(x^{(0)}=a\), \(x^{(n)}=a+h\)이다. \(h\)가 충분히 작으면 이 점들을 잇는 모든 좌표방향 선분이 주어진 근방 안에 놓인다.

각 성분 \(f_\ell\)에 대하여 일변수 평균값 정리를 좌표별로 적용하면, \(h_j\ne0\)일 때 \(x^{(j-1)}\)와 \(x^{(j)}\) 사이의 어떤 점 \(\xi_{\ell j}\)가 존재하여 \[ f_\ell(x^{(j)})-f_\ell(x^{(j-1)}) = \frac{\partial f_\ell}{\partial x_j}(\xi_{\ell j})h_j \] 가 된다. \(h_j=0\)인 항은 \(0\)이므로 따로 고려할 필요가 없다. 따라서 \[ \begin{aligned} &f_\ell(a+h)-f_\ell(a) -\sum_{j=1}^n \frac{\partial f_\ell}{\partial x_j}(a)h_j\\ &\quad= \sum_{j=1}^n \left( \frac{\partial f_\ell}{\partial x_j}(\xi_{\ell j}) - \frac{\partial f_\ell}{\partial x_j}(a) \right)h_j. \end{aligned} \] 모든 \(\xi_{\ell j}\to a\)이고 편미분들이 \(a\)에서 연속이므로, 임의의 \(\varepsilon>0\)에 대하여 \(h\)가 충분히 작으면 우변의 절댓값은 \[ \varepsilon\sum_{j=1}^n|h_j| \le \varepsilon\sqrt n\,\|h\| \] 보다 작다. 성분의 수가 유한하므로 벡터 전체의 나머지도 \(o(\|h\|)\)이다. 따라서 \(f\)는 \(a\)에서 전미분 가능하고 그 미분은 야코비 행렬로 주어진다.

문제 9.1. 함수 \(f\colon\mathbb{R}^2\to\mathbb{R}^3\)가 다음과 같이 주어졌을 때, \(f\)의 전미분 행렬을 구하시오. \[ f(x,y)= (a_{11}x+a_{12}y,\, a_{21}x+a_{22}y,\, a_{31}x+a_{32}y). \]

문제 9.2. 다음 물음에 답하시오.

  1. 함수 \(f(x,y)=(\cos xy,\,e^y-\ln y)\)가 점 \((1,1)\)에서 미분 가능한지 판별하시오.
  2. 다음 함수가 \((0,0)\)에서 미분 가능한지 판별하시오. \[ f(x,y)= \begin{cases} \dfrac{y^2}{x^2+y^2} & \text{if }\;(x,y)\ne(0,0),\\[8pt] 0 & \text{if }\;(x,y)=(0,0). \end{cases} \]

문제 9.3. \(k\in\mathbb{R}\), \(D\subseteq\mathbb{R}^n\), \(a\in D^o\)이고 두 함수 \(f\colon D\to\mathbb{R}^m\)과 \(g\colon D\to\mathbb{R}^m\)이 \(a\)에서 미분 가능하다고 하자. 다음을 증명하시오.

  1. 두 함수의 합 \(f+g\)는 \(a\)에서 미분 가능하고 \(D(f+g)(a)=Df(a)+Dg(a)\)이다.
  2. 함수의 실수배 \(kf\)는 \(a\)에서 미분 가능하고 \(D(kf)(a)=kDf(a)\)이다.
  3. 두 함수의 내적 \(f\cdot g\)는 \(a\)에서 미분 가능하고 \[ D(f\cdot g)(a) = g(a)^{\top}Df(a)+f(a)^{\top}Dg(a) \] 이다.

미분의 계산

실함수에서 합성함수의 미분 공식이 존재하듯 다변수함수에서도 합성함수의 미분 공식이 존재한다.

정리 9.3. (연쇄법칙)

함수 \(f\colon\mathbb{R}^n\to\mathbb{R}^m\)이 \(a\)에서 미분 가능하고 \(g\colon\mathbb{R}^m\to\mathbb{R}^p\)가 \(f(a)\)에서 미분 가능하면, \(g\circ f\)는 \(a\)에서 미분 가능하고 다음이 성립한다. \[ D(g\circ f)(a)=Dg(f(a))Df(a). \]

증명 \(u(h)=f(a+h)-f(a)\)라고 하자. \(f\)가 \(a\)에서 미분 가능하므로 \[ u(h)=Df(a)h+r_f(h), \qquad r_f(h)=o(\|h\|), \] 이고 특히 \(\|u(h)\|=O(\|h\|)\)이다. 또한 \(g\)의 미분 가능성에 의해 \[ g(f(a)+u)-g(f(a)) = Dg(f(a))u+r_g(u), \qquad r_g(u)=o(\|u\|). \] 따라서 \[ \begin{aligned} g(f(a+h))-g(f(a)) &=Dg(f(a))Df(a)h +Dg(f(a))r_f(h) +r_g(u(h))\\ &=Dg(f(a))Df(a)h+o(\|h\|). \end{aligned} \] 마지막 등식에서는 \(r_g(u(h))=o(\|u(h)\|)=o(\|h\|)\)을 사용했다.

문제 9.4. \(w=f(x,y,z)\), \(x=x(r,s)\), \(y=y(r,s)\), \(z=z(r,s)\)가 모두 미분 가능한 함수일 때, 정리 9.3을 사용하여 다음 공식을 유도하시오. \[ \frac{\partial w}{\partial r} = \frac{\partial w}{\partial x}\frac{\partial x}{\partial r} + \frac{\partial w}{\partial y}\frac{\partial y}{\partial r} + \frac{\partial w}{\partial z}\frac{\partial z}{\partial r}, \quad \frac{\partial w}{\partial s} = \frac{\partial w}{\partial x}\frac{\partial x}{\partial s} + \frac{\partial w}{\partial y}\frac{\partial y}{\partial s} + \frac{\partial w}{\partial z}\frac{\partial z}{\partial s}. \]

점 \(a\)에서 미분 가능한 실함수 \(f\colon\mathbb{R}^n\to\mathbb{R}\)를 생각하자. 이때 \(Df(a)\)의 행렬은 한 행으로 이루어지며, 그 전치벡터 \[ \nabla f(a) = \left( \frac{\partial f}{\partial x_1}(a), \ldots, \frac{\partial f}{\partial x_n}(a) \right) \] 를 \(a\)에서 \(f\)의 기울기 벡터(gradient vector)라고 부른다.

문제 9.5. \(f\)와 \(g\)가 \(D\subseteq\mathbb{R}^n\)으로부터 \(\mathbb{R}\)로의 미분 가능한 함수일 때 다음을 보이시오.

  1. \(\nabla(f+g)=\nabla f+\nabla g\).
  2. \(\nabla(f-g)=\nabla f-\nabla g\).
  3. \(k\)가 실수인 상수일 때 \(\nabla(kf)=k\nabla f\).
  4. \(\nabla(fg)=f\nabla g+g\nabla f\).
  5. \(g\ne0\)인 점에서 \[ \nabla(f/g) = \frac{g\nabla f-f\nabla g}{g^2}. \]

\(v\)가 단위벡터일 때, \(v\) 방향으로의 \(f\)의 방향도함수(directional derivative)를 \[ D_vf(a) = \lim_{t\to0} \frac{f(a+tv)-f(a)}{t} \] 로 정의한다. 모든 방향도함수가 존재하더라도 전미분 가능할 필요는 없지만, 전미분 가능하면 방향도함수는 기울기로 계산된다.

정리 9.4. (방향도함수와 기울기)

함수 \(f\colon\mathbb{R}^n\to\mathbb{R}\)가 \(a\)에서 전미분 가능하고 \(v\)가 단위벡터이면 \[ D_vf(a)=\nabla f(a)\cdot v.\tag{9.1} \] 특히 \(\nabla f(a)\ne0\)이면 단위벡터 가운데 방향도함수가 가장 큰 방향은 \[ v=\frac{\nabla f(a)}{\|\nabla f(a)\|} \] 이고, 가장 작은 방향은 그 반대방향이다. 최댓값과 최솟값은 각각 \(\|\nabla f(a)\|\)와 \(-\|\nabla f(a)\|\)이다.

증명 \(h=tv\)를 전미분의 정의에 대입하면 \[ f(a+tv)-f(a) = t\,Df(a)v+o(|t|). \] 양변을 \(t\)로 나누고 \(t\to0\)으로 보내면 \[ D_vf(a) = Df(a)v = \nabla f(a)\cdot v \] 이다. 나머지는 코시–슈바르츠 부등식 \[ |\nabla f(a)\cdot v| \le \|\nabla f(a)\|\|v\| \] 과 등호 조건에서 따른다.

문제 9.6. \(f(x,y)=x^2y+e^{xy}\), \(a=(1,0)\), \(v=(3/5,4/5)\)라고 하자. \(D_vf(a)\)를 구하고, \(a\)에서 방향도함수가 가장 큰 단위방향과 가장 작은 단위방향 및 그 값을 각각 구하시오.

\(x\), \(y\), \(z\)가 구간 \(I\)에서 미분 가능한 실함수이고 곡선 \(C\)가 \[ r(t)=(x(t),y(t),z(t)), \qquad t\in I \] 와 같은 함수로 표현된다고 하자. 이때 점 \(t_0\)에서 \(r\)의 미분계수를 \[ r'(t_0) = \left( \frac{d}{dt}x(t_0), \frac{d}{dt}y(t_0), \frac{d}{dt}z(t_0) \right) \] 로 정의한다. 곡선 \(C\) 위의 점에서 정의된 함수 \(w=f(r(t))\)에 대하여 \[ \frac{dw}{dt} = \frac{\partial w}{\partial x}\frac{dx}{dt} + \frac{\partial w}{\partial y}\frac{dy}{dt} + \frac{\partial w}{\partial z}\frac{dz}{dt} \] 가 성립한다. 이것을 기울기 연산자를 사용하여 나타내면 \[ \frac{d}{dt}f(r(t)) = \nabla f(r(t))\cdot r'(t) \] 이다.

문제 9.7. 미분 가능한 함수 \(F\colon\mathbb{R}^2\to\mathbb{R}\)과 상수 \(c\)에 대하여 등위곡선 \(F(x,y)=c\)를 생각하자.

  1. 이 등위곡선의 일부가 미분 가능한 매개화 \(r(t)=(u(t),v(t))\)로 주어지고 \(r'(t_0)\ne0\)이라고 하자. \(\nabla F(r(t_0))\)와 \(r'(t_0)\)가 서로 수직임을 보이시오.
  2. \((a,b)\)가 등위곡선 위의 점이고 \(\nabla F(a,b)\ne0\)이며, 이 점을 지나는 위와 같은 정칙 매개화가 존재한다고 하자. 이때 접선의 방정식이 \[ \frac{\partial F}{\partial x}(a,b)(x-a) + \frac{\partial F}{\partial y}(a,b)(y-b) = 0 \] 임을 보이시오.

함수 \(f\colon\mathbb{R}^n\to\mathbb{R}\)을 변수 \(x_i\)에 대하여 미분한 뒤 다시 변수 \(x_j\)에 대하여 미분한 이계 편도함수를 \[ f_{x_ix_j} \quad\text{또는}\quad \frac{\partial^2}{\partial x_j\,\partial x_i}f \] 로 나타낸다. 함수 \(f\)가 적절한 조건을 만족시키면 \(f\)의 이계편미분의 미분 순서를 바꾸어도 동일한 도함수를 얻는다.

정리 9.5. (클레로 정리)

함수 \(f\colon\mathbb{R}^n\to\mathbb{R}\)의 두 혼합 이계편미분 \[ \frac{\partial^2f}{\partial x_i\partial x_j}, \qquad \frac{\partial^2f}{\partial x_j\partial x_i} \] 가 점 \(c\)의 근방에서 존재하고 \(c\)에서 연속이면 \[ \frac{\partial^2f}{\partial x_i\,\partial x_j}(c) = \frac{\partial^2f}{\partial x_j\,\partial x_i}(c) \] 이다.

증명 다른 좌표를 고정하면 되므로 \(n=2\)인 경우만 증명하면 충분하다. \(c=(a,b)\)라고 하자. 충분히 작은 \(0\ne h,k\)에 대하여 \[ \Delta(h,k) = f(a+h,b+k)-f(a+h,b)-f(a,b+k)+f(a,b) \] 로 둔다.

먼저 \(g(x)=f(x,b+k)-f(x,b)\)라고 하면 일변수 평균값 정리에 의해 \(a\)와 \(a+h\) 사이의 어떤 \(\xi\)가 존재하여 \[ \Delta(h,k) = h\bigl[f_x(\xi,b+k)-f_x(\xi,b)\bigr]. \] 다시 \(y\)에 대한 평균값 정리를 적용하면 \(b\)와 \(b+k\) 사이의 어떤 \(\eta_1\)이 존재하여 \[ \Delta(h,k) = hk\,f_{xy}(\xi,\eta_1) \] 이다. 같은 방식으로 \(\phi(y)=f(a+h,y)-f(a,y)\)에 먼저 \(y\)에 대한 평균값 정리를 적용한 뒤 \(x\)에 대한 평균값 정리를 적용하면 \[ \Delta(h,k) = hk\,f_{yx}(\xi_1,\eta) \] 인 \(\xi_1,\eta\)를 얻는다. 따라서 \[ f_{xy}(\xi,\eta_1) = f_{yx}(\xi_1,\eta). \] \(h,k\to0\)이면 \(\xi,\xi_1\to a\), \(\eta,\eta_1\to b\)이므로 두 혼합 편미분의 \(c\)에서의 연속성에 의해 \[ f_{xy}(a,b) = f_{yx}(a,b) \] 이다.

문제 9.8. 함수 \(f\)가 다음과 같을 때, \(f\)의 이계편도함수를 모두 구하시오.

  1. \(f(x,y)=xe^y\)
  2. \(f(x,y)=\cos xy\)
  3. \(f(x,y)=\dfrac{x+y}{x^2+1}\)

문제 9.9. \(H=[a,b]\times[c,d]\)이고 \(f\colon H\to\mathbb{R}\)이 연속함수라고 하자. 이때 \[ F(y)=\int_a^b f(x,y)\,dx \] 라고 정의된 함수 \(F\)가 \([c,d]\)에서 연속임을 보이시오.

문제 9.10. \(H=[a,b]\times[c,d]\)이고 함수 \(f\colon H\to\mathbb{R}\)이 주어졌다고 하자. 각 \(y\in[c,d]\)에 대하여 \(x\mapsto f(x,y)\)가 \([a,b]\)에서 적분 가능하고, 각 \(x\in[a,b]\)에 대하여 \(y\mapsto f(x,y)\)가 \((c,d)\)에서 미분 가능하며, 편도함수 \(f_y\)가 \(H\)에서 연속이라고 하자. 이때 \(y\in(c,d)\)에 대하여 \[ \frac{d}{dy}\int_a^b f(x,y)\,dx = \int_a^b\frac{\partial f}{\partial y}(x,y)\,dx \] 가 성립함을 보이시오. 끝점에서는 해당하는 한방향 미분으로 같은 식이 성립한다. 이 공식을 편적분의 미분에 대한 라이프니츠 공식이라고 부른다.

평균값 정리와 테일러 정리

정리 9.6. (평균값 정리)

\(f\colon U\to\mathbb{R}\)가 열린 볼록집합 \(U\subseteq\mathbb{R}^n\)에서 미분 가능하다고 하자. 서로 다른 \(a,b\in U\)에 대하여 두 점을 잇는 열린 선분 위의 어떤 \(c\)가 존재하여 \[ f(b)-f(a) = \nabla f(c)\cdot(b-a) \] 를 만족시킨다.

증명 \[ \phi(t)=f(a+t(b-a)), \qquad 0\le t\le1 \] 로 두면 연쇄법칙에 의해 \[ \phi'(t) = \nabla f(a+t(b-a))\cdot(b-a). \] 일변수 평균값 정리를 \(\phi\)에 적용하면 어떤 \(\theta\in(0,1)\)에 대하여 \(\phi(1)-\phi(0)=\phi'(\theta)\)이다. \(c=a+\theta(b-a)\)로 두면 결론을 얻는다.

이로부터 다음과 같은 중요한 결과를 얻는다.

문제 9.11. 함수 \(f\colon\mathbb{R}^n\to\mathbb{R}\)에 대하여 상수 \(M\)이 존재하여 \(\|\nabla f\|\le M\)이면 \(f\)가 립시츠 연속임을 보이시오.

문제 9.12. 연결된 열린집합 \(U\subseteq\mathbb{R}^n\)에서 미분 가능한 함수 \(f\colon U\to\mathbb{R}\)가 \(\nabla f=0\)을 만족시키면 \(f\)가 상수함수임을 보이시오. 열린 연결집합에서 임의의 두 점을 유한 개의 선분으로 이루어진 경로로 이을 수 있음을 먼저 보여도 좋다.

고계미분과 관련된 내용을 기술할 때 다중지표 표기법(multi-index notation)을 사용하면 편리하다.

\(\alpha_1,\alpha_2,\ldots,\alpha_n\)이 \(0\) 이상인 정수일 때, \[ \alpha=(\alpha_1,\alpha_2,\ldots,\alpha_n) \] 에 대하여 다음과 같이 정의한다.

  • \(|\alpha|=\alpha_1+\cdots+\alpha_n\)
  • \(\alpha!=\alpha_1!\cdots\alpha_n!\)
  • \(x^\alpha=x_1^{\alpha_1}\cdots x_n^{\alpha_n}\)
  • \(\displaystyle D^\alpha= \frac{\partial^{|\alpha|}} {\partial x_1^{\alpha_1}\cdots\partial x_n^{\alpha_n}}\)

열린집합 \(U\subseteq\mathbb{R}^n\)에서 정의된 함수 \(f\)의 모든 \(|\alpha|\le k\)인 편도함수 \(D^\alpha f\)가 존재하고 연속일 때 \(f\in C^k(U)\)라고 쓴다. 모든 차수에 대하여 이 조건을 만족시키는 함수를 매끄러운 함수(smooth function)라고 하고 \(f\in C^\infty(U)\)라고 쓴다.

정리 9.7. (테일러 정리)

열린집합 \(U\subseteq\mathbb{R}^n\)에서 \(f\in C^{k+1}(U)\)이고 선분 \([a,a+h]\)가 \(U\)에 포함된다고 하자. 그러면 어떤 \(\theta\in(0,1)\)에 대하여 \[ f(a+h) = \sum_{|\alpha|\le k} \frac{D^\alpha f(a)}{\alpha!}h^\alpha + R_k(h), \] \[ R_k(h) = \sum_{|\alpha|=k+1} \frac{D^\alpha f(a+\theta h)}{\alpha!}h^\alpha \] 가 성립한다. 특히 \(h\to0\)일 때 \(R_k(h)=O(\|h\|^{k+1})\)이다.

증명 \[ \phi(t)=f(a+th), \qquad 0\le t\le1 \] 로 두자. 연쇄법칙과 다항정리에 의해 \[ \phi^{(m)}(t) = \sum_{|\alpha|=m} \frac{m!}{\alpha!} D^\alpha f(a+th)h^\alpha. \] \(\phi\)에 정리 5.9의 테일러 정리를 적용하면 어떤 \(\theta\in(0,1)\)에 대하여 \[ \phi(1) = \sum_{m=0}^{k}\frac{\phi^{(m)}(0)}{m!} + \frac{\phi^{(k+1)}(\theta)}{(k+1)!} \] 가 성립한다. 위의 \(\phi^{(m)}\) 공식을 대입하면 두 식의 명시된 전개와 나머지 공식을 얻는다.

이제 \(h\to0\)으로 보자. \(|\alpha|=k+1\)인 다중지표는 유한 개이고 각 \(D^\alpha f\)는 \(a\)의 근방에서 유계이다. 또한 \(|h^\alpha|\le\|h\|^{k+1}\)이므로 어떤 상수 \(C>0\)가 존재하여 충분히 작은 \(h\)에 대해 \[ |R_k(h)| \le C\|h\|^{k+1}. \] 따라서 \(R_k(h)=O(\|h\|^{k+1})\)이다.

문제 9.13. 점 \(a\)와 함수 \(f\)가 다음과 같을 때, \(a\)를 중심으로 하는 \(f\)의 \(3\)차 테일러 다항식을 구하시오.

  1. \(f(x,y)=\sqrt{x}+\sqrt{y}\), \(a=(1,4)\).
  2. \(f(x,y)=e^{xy}\), \(a=(0,0)\).

점 \(a\)의 근방에서 \(f\in C^2\)이면 2차 테일러 전개는 \[ f(a+h) = f(a) + \nabla f(a)\cdot h + \frac12h^{\top}H_f(a)h + o(\|h\|^2) \] 이다. 여기서 \[ H_f(a) = \left( \frac{\partial^2f}{\partial x_i\partial x_j}(a) \right)_{i,j}\tag{9.2} \] 를 헤세 행렬(Hessian matrix)이라고 부른다. 클레로 정리(정리 9.5)에 의해 \(H_f(a)\)는 대칭행렬이다.

실대칭행렬 \(H\)에 대하여 모든 \(0\ne v\in\mathbb{R}^n\)에서 \(v^{\top}Hv>0\)이면 양의 정부호(positive definite), 항상 \(v^{\top}Hv<0\)이면 음의 정부호(negative definite)라고 한다. 양수와 음수 값을 모두 취하면 부정부호(indefinite)라고 한다.

함수 \(f\colon\mathbb{R}^n\to\mathbb{R}\)가 \(a\)에서 국소극값을 가지고 미분 가능하면 모든 방향도함수가 \(0\)이므로 \(\nabla f(a)=0\)이다. 미분 가능한 함수에서 \(\nabla f(a)=0\)인 점을 임계점(critical point)이라고 부른다. 2차 테일러 전개는 임계점의 성질을 판정하는 다음 결과를 준다.

정리 9.8. (이계도함수 판정법)

함수 \(f\)가 \(a\)의 근방에서 \(C^2\)이고 \(\nabla f(a)=0\)이라고 하자. 이때 다음이 성립한다.

  1. \(H_f(a)\)가 양의 정부호이면 \(f\)는 \(a\)에서 극솟값을 가진다.
  2. \(H_f(a)\)가 음의 정부호이면 \(f\)는 \(a\)에서 극댓값을 가진다.
  3. \(H_f(a)\)가 부정부호이면 \(f\)는 \(a\)에서 안장점을 가진다.

증명 \(q(v)=v^{\top}H_f(a)v\)라고 하자. \(\nabla f(a)=0\)이므로 \[ f(a+h)-f(a) = \frac12q(h)+o(\|h\|^2). \]

먼저 \(H_f(a)\)가 양의 정부호라고 하자. 단위구면 \[ S^{n-1}=\{v:\|v\|=1\} \] 은 컴팩트하고 \(q\)는 연속이므로 \(q\)는 \(S^{n-1}\)에서 최솟값 \(\mu\)를 가진다. 양의 정부호성에 의해 \(\mu>0\)이다. \(h\ne0\)이면 \[ q(h) = \|h\|^2 q\left(\frac{h}{\|h\|}\right) \ge \mu\|h\|^2. \] 따라서 충분히 작은 \(h\ne0\)에 대하여 \[ f(a+h)-f(a) \ge \frac{\mu}{2}\|h\|^2 - \frac{\mu}{4}\|h\|^2 >0, \] 이므로 \(a\)는 국소극솟값이다. 음의 정부호인 경우에는 \(-f\)에 같은 논증을 적용하면 국소극댓값을 얻는다.

마지막으로 \(H_f(a)\)가 부정부호이면 \(q(u)>0\), \(q(v)<0\)인 단위벡터 \(u,v\)가 존재한다. 따라서 충분히 작은 \(t\ne0\)에 대하여 \[ f(a+tu)-f(a)>0, \qquad f(a+tv)-f(a)<0. \] 그러므로 \(a\)의 임의의 근방에는 \(f(a)\)보다 큰 값과 작은 값을 모두 주는 점이 존재하며, \(a\)는 안장점이다.

문제 9.14. 다음과 같은 함수 \(f\)의 극값을 모두 구하시오.

  1. \(f(x,y)=x^2-xy^3-y\)
  2. \(f(x,y,z)=e^{x+y}\cos z\)

문제 9.15. 함수 \(f\)와 집합 \(H\)가 다음과 같이 주어졌을 때, \(H\) 위에서 \(f\)의 최댓값과 최솟값을 구하시오.

  1. \(f(x,y)=x^2+2x-y^2\), \(H=\{(x,y)\mid x^2+4y^2\le4\}\).
  2. \(f(x,y)=x^2+2xy+3y^2\), \(H\)는 세 점 \((1,0)\), \((1,2)\), \((3,0)\)을 잇는 삼각형의 경계와 내부.
  3. \(f(x,y)=x^3+3xy-y^3\), \(H=[-1,1]^2\).

이계도함수 판정법에서 헤세 행렬이 양의 준정부호(positive semidefinite) 또는 음의 준정부호(negative semidefinite)인 경우에는 이 판정법만으로 결론을 내릴 수 없다. 다음 예를 살펴보자.

  • \(f(x,y)=x^4+y^4\)는 원점에서 \(H_f(0,0)=0\)이지만 극솟값을 가진다.
  • \(f(x,y)=x^4-y^4\)는 원점에서 \(H_f(0,0)=0\)이고, 원점은 곡면 \(z=f(x,y)\)의 안장점이다.
  • \(f(x,y)=x^3+y^3\)은 원점에서 \(H_f(0,0)=0\)이고, 원점은 곡면 \(z=f(x,y)\)의 안장점이다.

음함수 정리와 역함수 정리

\(F(x,y)=x^2+y^2-25\)라고 하면 원의 방정식 \(F(x,y)=0\)에서 \(y\)는 \(x\)의 함수가 아니다. 그러나 원 위의 점 \((3,-4)\)를 포함하는 \(y<0\)인 범위를 취하면, \(F(x,y)=0\)는 \[ y=-\sqrt{25-x^2} \] 으로 나타낼 수 있으며, \(y\)는 \(x\)에 대하여 미분 가능한 함수가 된다.

이러한 결과를 더 높은 차원으로 일반화하면 다음과 같다.

정리 9.9. (음함수 정리)

함수 \(F\colon\mathbb{R}^{n+m}\to\mathbb{R}^m\)이 점 \((a,b)\in\mathbb{R}^n\times\mathbb{R}^m\)의 근방에서 \(C^1\)이고 \(F(a,b)=0\)이라고 하자. \(y\)에 대한 야코비 행렬 \[ F_y(a,b) = \left( \frac{\partial F_i}{\partial y_j}(a,b) \right) \] 가 가역이면, \(a\)의 근방 \(U\)와 \(b\)의 근방 \(V\), 그리고 유일한 \(C^1\) 함수 \(g\colon U\to V\)가 존재하여 \[ (x,y)\in U\times V \quad\Longrightarrow\quad F(x,y)=0 \ \Longleftrightarrow\ y=g(x) \] 가 성립한다. 또한 \[ Dg(x) = -\bigl[F_y(x,g(x))\bigr]^{-1}F_x(x,g(x)). \]

증명 \(A=F_y(a,b)\)라고 하고 \[ \Phi(x,y) = y-A^{-1}F(x,y) \] 로 두자. 그러면 \(F(x,y)=0\)이기 위한 필요충분조건은 \(y=\Phi(x,y)\)이다. 또한 \[ D_y\Phi(a,b) = I-A^{-1}F_y(a,b) = 0. \] \(D_y\Phi\)의 연속성에 의해 충분히 작은 닫힌 공들의 곱 \[ Q = \overline B(a,\delta) \times \overline B(b,\varepsilon) \] 에서 \[ \|D_y\Phi(x,y)\| \le\frac12 \] 가 되게 할 수 있다. \(\delta\)를 더 작게 잡으면 \[ \|\Phi(x,b)-b\| < \frac{\varepsilon}{2} \qquad (\|x-a\|\le\delta) \] 도 성립한다.

\(x\)를 고정하자. 선분을 따라 미적분의 기본정리를 성분별로 적용하면 \[ \|\Phi(x,y_1)-\Phi(x,y_2)\| \le \frac12\|y_1-y_2\| \] 이고, \(\|y-b\|\le\varepsilon\)이면 \[ \|\Phi(x,y)-b\| \le \frac12\|y-b\| + \frac{\varepsilon}{2} \le \varepsilon. \] 정리 3.2의 유클리드 공간의 완비성에 의해 \(\mathbb{R}^m\)은 완비이고, 그 닫힌부분집합 \(\overline B(b,\varepsilon)\)도 완비이다. 따라서 \(\Phi_x(y)=\Phi(x,y)\)는 완비거리공간 \(\overline B(b,\varepsilon)\)을 자기 자신으로 보내는 축소사상이다. 문제 4.23의 바나흐 고정점 정리에 의해 각 \(x\in B(a,\delta)\)에 대하여 유일한 고정점 \(g(x)\in\overline B(b,\varepsilon)\)이 존재한다. 곧 \[ F(x,g(x))=0 \] 이고, 같은 공 안의 다른 \(y\)가 \(F(x,y)=0\)을 만족시키면 고정점의 유일성에 의해 \(y=g(x)\)이다.

이제 \(g\)의 정칙성을 보이자. \(Q\)에서 \(D_x\Phi\)는 유계이므로 어떤 \(M>0\)에 대하여 \[ \|\Phi(x_1,y)-\Phi(x_2,y)\| \le M\|x_1-x_2\| \] 이다. 고정점 방정식을 이용하면 \[ \|g(x_1)-g(x_2)\| \le M\|x_1-x_2\| + \frac12\|g(x_1)-g(x_2)\|, \] 따라서 \[ \|g(x_1)-g(x_2)\| \le 2M\|x_1-x_2\|. \] 즉 \(g\)는 국소적으로 립시츠 연속이다. 특히 \(g(a)=b\)이므로 \(a\)의 근방을 더 작게 잡으면 \(g(U)\subseteq B(b,\varepsilon)\)이 되게 할 수 있다. 이제 \(V=B(b,\varepsilon)\)로 두면 \(U\times V\)에서 \(F(x,y)=0\)이기 위한 필요충분조건은 \(y=g(x)\)이다.

고정된 \(x\in U\)에서 \(y=g(x)\)라 하고, \[ k=g(x+h)-g(x) \] 로 두자. 위 추정에 의해 \(\|k\|=O(\|h\|)\)이다. \(F\)의 전미분 가능성을 \((x,y)\)에서 사용하면 \[ 0 = F(x+h,y+k)-F(x,y) = F_x(x,y)h+F_y(x,y)k+r(h,k), \] 여기서 \[ \|r(h,k)\| = o\left(\sqrt{\|h\|^2+\|k\|^2}\right) = o(\|h\|) \] 이다. 한편 \(Q\)를 충분히 작게 잡았으므로 \[ \|I-A^{-1}F_y(x,y)\|<1. \] 만약 \(F_y(x,y)v=0\)이면 \[ \|v\| = \|(I-A^{-1}F_y(x,y))v\| < \|v\| \] 가 되어 모순이므로, \(F_y(x,y)\)는 일대일이고 따라서 가역이다. 그러므로 \[ k = -F_y(x,y)^{-1}F_x(x,y)h + o(\|h\|). \] 즉 \(g\)는 미분 가능하고 \[ Dg(x) = -F_y(x,g(x))^{-1}F_x(x,g(x)). \] 가역행렬 \(B\)에 대한 공식 \[ B^{-1} = \frac{\operatorname{adj}(B)}{\det B} \] 에서 행렬의 역연산은 가역행렬들의 집합에서 연속임을 알 수 있다. 따라서 우변은 \(x\)에 대하여 연속이고 \(g\in C^1\)이다.

음함수 정리를 사용할 때 염두에 둘 점은 다음과 같다.

  1. 음함수 정리는 국소적 결과이다. 즉 전역적으로는 여러 개의 해가 존재할 수 있다. 예를 들어, \(x^2+y^2=25\)에서 \(y\)를 \(x\)의 함수로 나타내면 국소적으로만 가능하다.
  2. \(F_y\)가 가역이 아니면 음함수가 존재하지 않거나 유일하지 않을 수 있다. 예를 들어 \(F(x,y)=x^2-y^2\)에서는 \((0,0)\)에서 \(F_y=0\)이고, 해가 \(y=x\)와 \(y=-x\) 두 가지 가지를 가지므로 원점 근처에서 \(y\)를 \(x\)의 함수로 유일하게 나타낼 수 없다.
  3. 더 일반적으로 \(k\ge1\)이고 \(F\)가 \(C^k\)이면 \(g\)도 \(C^k\)이다. 이는 위 미분 공식을 반복하여 적용하면 얻을 수 있으며, 여기서는 별도로 증명하지 않는다.

보기 9.10.

방정식 \[ x^3+y^3+xy-3=0 \] 이 점 \((1,1)\) 근처에서 \(y=g(x)\) 형태로 유일하게 풀 수 있는지 확인해보자.

\(F(x,y)=x^3+y^3+xy-3\)이라 하면 \[ \begin{aligned} F(1,1)&=1+1+1-3=0,\\ \frac{\partial F}{\partial y}(x,y)&=3y^2+x, & \frac{\partial F}{\partial x}(x,y)&=3x^2+y,\\ \frac{\partial F}{\partial y}(1,1)&=4\ne0, & \frac{\partial F}{\partial x}(1,1)&=4 \end{aligned} \] 이다. 따라서 음함수 정리에 의해 \((1,1)\) 근처에서 주어진 방정식을 \(y=g(x)\)로 유일하게 나타낼 수 있으며, \[ g'(1) = -\frac{\partial F/\partial x(1,1)} {\partial F/\partial y(1,1)} = -\frac44 = -1. \]

정리 9.11. (역함수 정리)

함수 \(f\colon\mathbb{R}^n\to\mathbb{R}^n\)이 점 \(a\)의 근방에서 \(C^1\)이고 \(Df(a)\)가 가역이면, \(a\)의 근방 \(U\)와 \(f(a)\)의 근방 \(V\)가 존재하여 \(f\colon U\to V\)는 일대일대응이다. 역함수 \(f^{-1}\colon V\to U\)도 \(C^1\)이고 \[ D(f^{-1})(y) = \bigl[Df(f^{-1}(y))\bigr]^{-1} \] 을 만족시킨다.

증명 독립변수를 \(y\), 풀어야 할 변수를 \(x\)로 보고 \[ F(y,x)=f(x)-y \] 라고 하자. 그러면 \(F(f(a),a)=0\)이고 \[ F_x(f(a),a)=Df(a) \] 가 가역이다. 음함수 정리에 의해 \(f(a)\)의 근방 \(V_0\), \(a\)의 근방 \(U_0\), 그리고 \(C^1\) 함수 \(g\colon V_0\to U_0\)가 존재하여 \[ f(g(y))=y \qquad (y\in V_0) \] 이고, \(x\in U_0\)에서 \(f(x)=y\)인 해는 \(x=g(y)\)로 유일하다.

\(f\)의 연속성에 의해 \(a\)의 열린근방 \(W\subseteq U_0\)를 충분히 작게 잡아 \(f(W)\subseteq V_0\)이 되게 할 수 있다. 그러면 \(x\in W\)에 대하여 \(x\)와 \(g(f(x))\)는 모두 \(U_0\) 안에서 방정식 \(f(z)=f(x)\)의 해이므로 국소 유일성에 의해 \[ g(f(x))=x. \] 따라서 \(f\)는 \(W\)에서 일대일이다.

이제 \(g\)의 연속성을 이용하여 \(f(a)\)의 더 작은 열린근방 \(V\subseteq V_0\)를 잡아 \(g(V)\subseteq W\)가 되게 하고 \[ U=W\cap f^{-1}(V) \] 로 둔다. 그러면 \(U\)는 \(a\)의 열린근방이고, \(f\colon U\to V\)는 일대일대응이며 역함수는 \(g|_V\)이다. 음함수 정리의 미분 공식에서 \[ \begin{aligned} Dg(y) &= -[F_x(y,g(y))]^{-1}F_y(y,g(y))\\ &= [Df(g(y))]^{-1} \end{aligned} \] 이므로 원하는 공식을 얻는다.

함수 \(f\colon U\to V\)가 일대일대응이고 \(f\)와 \(f^{-1}\)가 모두 \(C^1\)이면 \(f\)를 미분동형사상(diffeomorphism)이라고 한다. 모든 점이 어떤 근방에서 이러한 성질을 가지면 국소 미분동형사상(local diffeomorphism)이라고 한다.

따름정리 9.12.

함수 \(f\colon\mathbb{R}^n\to\mathbb{R}^n\)이 열린집합 \(\Omega\)에서 \(C^1\)이고 모든 점에서 \(Df(x)\)가 가역이면 다음이 성립한다.

  1. \(f\)는 국소 미분동형사상이다.
  2. \(f(\Omega)\)는 열린집합이다.
  3. \(f\)가 일대일이면 \(f\colon\Omega\to f(\Omega)\)는 미분동형사상이다.

증명 첫 번째 명제는 역함수 정리에서 바로 따른다. 각 \(x\in\Omega\)에 대하여 \(f(x)\)는 어떤 열린근방 \(V_x\subseteq f(\Omega)\)를 가지므로 \[ f(\Omega) = \bigcup_{x\in\Omega}V_x \] 는 열린집합이다. 마지막으로 \(f\)가 일대일이면 국소역함수들은 전역적인 역함수 \(f^{-1}\)의 제한이며, 각 점에서 \(C^1\)이므로 \(f^{-1}\)도 \(C^1\)이다.

역함수 정리는 비선형 함수가 국소적으로 선형변환처럼 행동함을 보여준다. 점 \(a\) 근처에서 \(f\)는 근사적으로 \[ f(x) \approx f(a)+Df(a)(x-a) \] 이고, \(Df(a)\)가 가역이면 이 선형근사가 국소적으로 일대일대응이 된다.

보기 9.13.

극좌표 변환 \[ f(r,\theta) = (r\cos\theta,r\sin\theta) \] 를 생각하자. \(f\)의 야코비 행렬은 \[ Df(r,\theta) = \begin{pmatrix} \cos\theta & -r\sin\theta\\ \sin\theta & r\cos\theta \end{pmatrix} \] 이다. 이 행렬의 행렬식이 \(\det(Df)=r\)이므로 \(r\ne0\)인 모든 점에서 역함수 정리가 적용된다. 실제로 \(r>0\)인 영역에서 극좌표 변환은 국소적으로 가역이다.

\(r=0\)인 점들에서는 역함수 정리를 적용할 수 없고, 실제로 모든 \((0,\theta)\)가 원점으로 보내지므로 그 점들에서 국소적으로 가역이 아니다.

문제 9.16. 다음 각 함수와 점 \(p\)에 대하여 \(Df(p)\)가 가역임을 확인하고, \(f(p)\)의 적당한 열린근방에서 \(p\)에 대응하는 국소역함수의 미분 \(D(f^{-1})(f(p))\)을 구하시오.

  1. \(f(u,v)=(3u-v,\,2u+5v)\), \(p\in\mathbb{R}^2\)는 임의의 점.
  2. \(f(u,v)=(u+v,\,\sin u+\cos v)\), \(p=(0,0)\).
  3. \(f(u,v)=(uv,\,u^2+v^2)\), \(p=(1,2)\).
  4. \(f(u,v)=(u^3-v^2,\,\sin u-\ln v)\), \(p=(0,1)\).

문제 9.17. 다음 각 등식에 대하여 점 \((0,0,0)\)의 열린근방 \(V\)가 존재하여 주어진 등식을 \(V\)에서 \(z\)에 대하여 풀 수 있는지 판별하시오. 또한 \(z\)에 대하여 푼 식이 \((0,0)\)의 근방에서 미분 가능한지 판별하시오.

  1. \(xyz+\sin(x+y+z)=0\)
  2. \(x^2+y^2+z^2+\sqrt{\sin(x^2+y^2)+3z+4}=2\)
  3. \(xyz(2\cos y-\cos z)+(z\cos x-x\cos y)=0\)

문제 9.18. 함수 \(F\colon\mathbb{R}^2\to\mathbb{R}\)가 \((a,b)\)에서 미분 가능하고 \(F_y(a,b)\ne0\)이며 \(I\)가 \(a\)의 열린근방이라고 하자. 또한 함수 \(f\colon I\to\mathbb{R}\)이 \(a\)에서 미분 가능하고 \(f(a)=b\)이며 임의의 \(x\in I\)에 대하여 \(F(x,f(x))=0\)이라고 하자. 이때 \[ \frac{d}{dx}f(a) = -\frac{\dfrac{\partial F}{\partial x}(a,b)} {\dfrac{\partial F}{\partial y}(a,b)} \] 임을 증명하시오.

라그랑주 승수법

현실의 문제를 모델링한 최적화 문제는 제약조건을 동반하는 경우가 많다. 예를 들어, 둘레의 길이가 고정되어 있을 때 넓이가 최대인 직사각형을 구하거나, 겉넓이가 고정되어 있을 때 부피가 최대인 원기둥을 구하는 문제 등을 생각할 수 있다. 이처럼 제약조건 아래에서 극값을 구하는 방법 중 하나가 라그랑주 승수법(Lagrange multiplier method)이다.

먼저 기하학적 관점에서 라그랑주 승수법을 살펴보자. 제약조건 \(g(x)=c\) 아래에서 함수 \(f\colon\mathbb{R}^n\to\mathbb{R}\)의 극값을 구하는 상황을 생각하자. \(g\)가 \(C^1\)이고 제약집합의 점 \(a\)에서 \(\nabla g(a)\ne0\)이면, 음함수 정리에 의해 \(a\) 근처의 제약집합은 \((n-1)\)차원 곡면으로 나타난다. 만약 \(a\)가 이 곡면 위에서 \(f\)의 극값이라면, \(f\)의 등위면 \(f(x)=f(a)\)와 제약곡면 \(g(x)=c\)의 접방향이 \(a\)에서 일치하므로 두 법벡터 \(\nabla f(a)\)와 \(\nabla g(a)\)가 평행해야 한다.

정리 9.14. (라그랑주 승수법—제약조건이 하나인 경우)

함수 \(f,g\colon\mathbb{R}^n\to\mathbb{R}\)이 \(C^1\)이고, \(a\)가 제약조건 \(g(x)=c\) 아래에서 \(f\)의 국소극값이며 \(\nabla g(a)\ne0\)이라고 하자. 그러면 어떤 실수 \(\lambda\)가 존재하여 \[ \nabla f(a) = \lambda\nabla g(a) \] 를 만족시킨다.

증명 좌표의 순서를 바꾸어 \(g_{x_n}(a)\ne0\)이라고 해도 된다. \(a=(a',a_n)\)으로 쓰자. 음함수 정리에 의해 \(a'\)의 근방에서 \(C^1\) 함수 \(\varphi\)가 존재하여 \(a\) 근처의 제약집합은 \[ x_n = \varphi(x_1,\ldots,x_{n-1}) \] 로 나타난다. 함수 \[ \psi(u) = f(u,\varphi(u)) \] 는 \(u=a'\)에서 국소극값을 가지므로 \[ \frac{\partial\psi}{\partial u_j}(a')=0. \] 연쇄법칙에 의해 \[ f_{x_j}(a) + f_{x_n}(a)\varphi_{x_j}(a') = 0. \] 한편 \(g(u,\varphi(u))=c\)이므로 \[ g_{x_j}(a) + g_{x_n}(a)\varphi_{x_j}(a') = 0. \] 따라서 \[ \lambda = \frac{f_{x_n}(a)}{g_{x_n}(a)} \] 로 두면 \(j<n\)에 대하여 \(f_{x_j}(a)=\lambda g_{x_j}(a)\)이고, \(j=n\)에서도 정의에 의해 같은 식이 성립한다. 즉 \[ \nabla f(a) = \lambda\nabla g(a) \] 이다.

이 정리에서 \(\lambda\)를 라그랑주 승수(Lagrange multiplier)라고 부른다. 실제 계산에서는 다음 연립방정식을 푼다. \[ \begin{cases} \nabla f(x)=\lambda\nabla g(x),\\ g(x)=c. \end{cases} \] 이것은 \(n+1\)개의 방정식과 \(n+1\)개의 미지수 \((x_1,\ldots,x_n,\lambda)\)를 가진 연립방정식이다.

라그랑주 승수법을 제약조건이 여러 개 있는 경우로 확장하면 다음과 같다.

정리 9.15. (라그랑주 승수법: 제약조건이 여러 개인 경우)

함수 \(f,g_1,\ldots,g_k\colon\mathbb{R}^n\to\mathbb{R}\)이 \(C^1\)이고, \(a\)가 제약조건 \(g_i(x)=c_i\) \((i=1,\ldots,k)\) 아래에서 \(f\)의 국소극값이라고 하자. 벡터 \(\nabla g_1(a),\ldots,\nabla g_k(a)\)가 일차독립이면, 실수 \(\lambda_1,\ldots,\lambda_k\)가 존재하여 \[ \nabla f(a) = \sum_{i=1}^k\lambda_i\nabla g_i(a) \] 를 만족시킨다.

증명 \[ G=(g_1,\ldots,g_k) \colon \mathbb{R}^n\to\mathbb{R}^k \] 라고 하자. 가정에 의해 \(DG(a)\)의 계수는 \(k\)이다. 좌표를 재배열하여 \[ x=(u,v) \in \mathbb{R}^{n-k}\times\mathbb{R}^k \] 로 쓸 때 \[ B=G_v(a) \] 가 가역이 되게 할 수 있다. 음함수 정리에 의해 제약집합은 \(a\) 근처에서 \(v=\varphi(u)\)로 나타난다. \(A=G_u(a)\)라고 하면 \[ A+B\,D\varphi(a_u)=0, \qquad D\varphi(a_u)=-B^{-1}A. \]

\(Df(a)=(p\ q)\)로 쓰자. 제약집합에 제한한 함수 \(u\mapsto f(u,\varphi(u))\)가 \(a_u\)에서 국소극값을 가지므로 \[ 0 = p+qD\varphi(a_u) = p-qB^{-1}A. \] \[ \lambda^{\top} = qB^{-1} \] 로 두면 \(p=\lambda^{\top}A\), \(q=\lambda^{\top}B\)이므로 \[ Df(a) = \lambda^{\top}DG(a). \] 이를 전치하면 \[ \nabla f(a) = \sum_{i=1}^k\lambda_i\nabla g_i(a) \] 이다.

실제로 계산할 때는 다음과 같은 라그랑주 함수(Lagrangian)를 정의하는 것이 편리하다. \[ L(x,\lambda) = f(x) - \sum_{i=1}^k\lambda_i(g_i(x)-c_i). \] 정리의 정칙성 가정 아래 제약된 극값 \(a\)가 존재하면 적당한 \(\lambda=(\lambda_1,\ldots,\lambda_k)\)가 존재하여 \((a,\lambda)\)에서 \(L\)의 모든 편미분이 \(0\)이다. \[ \frac{\partial L}{\partial x_j}=0 \quad (j=1,\ldots,n), \qquad \frac{\partial L}{\partial\lambda_i}=0 \quad (i=1,\ldots,k). \]

보기 9.16.

\(a>b>0\)일 때, 타원 \[ \frac{x^2}{a^2} + \frac{y^2}{b^2} = 1 \] 위의 점 중 원점에서 가장 먼 점과 가장 가까운 점을 구해보자.

목적함수는 \(f(x,y)=x^2+y^2\)이고, 제약조건은 \[ g(x,y) = \frac{x^2}{a^2} + \frac{y^2}{b^2} - 1 = 0 \] 이다.

라그랑주 조건 \(\nabla f=\lambda\nabla g\)는 \[ (2x,2y) = \lambda \left( \frac{2x}{a^2}, \frac{2y}{b^2} \right) \] 이다. 이 식으로부터 \[ x\left(1-\frac{\lambda}{a^2}\right)=0, \qquad y\left(1-\frac{\lambda}{b^2}\right)=0 \] 을 얻는다.

\(x=0\) 또는 \(y=0\)인 경우를 검토하면, 함수 \(f\)는 \((\pm a,0)\)에서 최댓값 \(a^2\)을 가지며, \((0,\pm b)\)에서 최솟값 \(b^2\)을 가진다.

라그랑주 승수법을 활용하여 잘 알려진 부등식을 증명해 보자.

보기 9.17. (산술-기하 평균 부등식)

양수 \(x_1,\ldots,x_n\)에 대하여 \[ \frac{x_1+\cdots+x_n}{n} \ge \sqrt[n]{x_1\cdots x_n} \] 임을 라그랑주 승수법으로 보이자. \(c=(x_1\cdots x_n)^{1/n}\)을 고정하고 제약조건 \(x_1\cdots x_n=c^n\) 아래에서 \[ f(x_1,\ldots,x_n) = x_1+\cdots+x_n \] 의 최솟값을 생각한다. 점 \((c,\ldots,c)\)에서 \(f=nc\)이므로 최솟값을 찾을 때 \(f\le nc\)인 부분만 보면 충분하다. 이 부분에서는 각 \(x_i\le nc\)이고 \[ x_i = \frac{c^n}{\prod_{j\ne i}x_j} \ge \frac{c^n}{(nc)^{n-1}}, \] 이므로 해당 제약집합은 컴팩트하다. 따라서 최솟값이 존재한다.

제약함수 \(g=x_1\cdots x_n\)의 기울기는 양의 영역에서 \(0\)이 아니므로 라그랑주 승수법을 적용할 수 있다. 조건 \[ 1 = \lambda\frac{c^n}{x_i} \qquad (i=1,\ldots,n) \] 에서 모든 \(x_i\)가 같고, 곱이 \(c^n\)이므로 \[ x_1=\cdots=x_n=c \] 이다. 따라서 최솟값은 \(nc\)이고 원하는 부등식을 얻는다.

라그랑주 승수법은 극값의 필요조건만을 제공한다는 점을 유념해야 한다. 구한 점에서 함수가 실제로 극값을 갖는지 여부는 직접 확인해야 한다.

문제 9.19. 제약조건 \(x^2+y^2+z^2=1\) 아래에서 \(f(x,y,z)=x+2y+3z\)의 최댓값과 최솟값을 구하시오.

문제 9.20. 구 \(x^2+y^2+z^2=1\) 위에서 함수 \(f(x,y,z)=xyz\)의 극값을 구하시오.

문제 9.21. \(S>0\)일 때 표면적이 \(S\)인 직육면체 중 부피가 최대인 것의 세 모서리의 길이를 구하시오.

문제 9.22. \(a,b,c>0\)일 때 타원체 \[ \frac{x^2}{a^2} + \frac{y^2}{b^2} + \frac{z^2}{c^2} = 1 \] 에 내접하고 중심이 원점이며 모서리가 좌표축에 평행한 직육면체의 최대 부피를 구하시오.

문제 9.23. 다음 물음에 답하시오. 제약조건 아래 극값이 존재하지 않으면 그 사실도 보이시오.

  1. 원 \(x^2+y^2=4\) 위에서 함수 \(f(x,y)=x+y^2\)의 극값을 구하시오.
  2. \(x^2+y^2+z^2=1\)과 \(x+y+z=0\)을 모두 만족시키는 범위에서 함수 \(f(x,y,z)=xy\)의 극값을 구하시오.
  3. \(3x^2+y+4z^3=1\)과 \(-x^3+3z^4+w=0\)을 모두 만족시키는 범위에서 함수 \(f(x,y,z,w)=3x+y+w\)의 극값을 구하시오.

해석학 강의노트

  1. 실수계의 성질
  2. 거리공간
  3. 수열의 극한과 위상적 성질
  4. 함수의 극한과 연속성
  5. 일변수 함수의 미분
  6. 일변수 함수의 적분
  7. 무한급수
  8. 실해석적 함수
  9. 다변수 함수의 미분
  10. 중적분
  11. 벡터장과 적분 정리

Search

Categories

  • Abstract Algebra (3)
  • Analytic Geometry (1)
  • Applied Activity (1)
  • Basic Mathematics (6)
  • Calculus (49)
  • Classical Geometry (1)
  • Complex Analysis (2)
  • Differential Equation (1)
  • Differential Geometry (1)
  • Functional Analysis (2)
  • General Topology (3)
  • Linear Algebra (32)
  • Mathematical Analysis (4)
  • Mathematical Logic (1)
  • Probability & Statistics (1)
  • Real Analysis (1)
  • Sets and Logic (4)

Statistics

  • 42
  • 81
  • 609
  • 2,935
  • 320,445

Sejong Academy of Science and Arts

  • Introduction
  • Recent Articles
  • Topic Index
  • Tag Cloud
  • Links