10 多元微分、梯度与链式法则
先修内容为第4章的一元微分、第9章的多元极限与连续,以及向量、矩阵乘法和欧氏范数。学完本章,应能用余项验证多元可微性,区分偏导数存在与可微;从可微性推出方向导数公式;按输入、输出维度组织Jacobian与链式法则;对参数化曲线、隐式关系和二阶复合函数正确求导。人工智能联系限于有限维参数模型,不要求神经网络软件或概率论先修。
一个模型常由多个参数共同决定。例如函数 \(f(a,b)=a\mathrm e^b\) 中,单独改变 \(a\) 与同时改变 \(a,b\) 是不同的问题。偏导数描述沿坐标轴的变化;全微分则要求一个线性映射同时描述全部充分小的扰动。后者是计算复合模型敏感性所需的基本结构。本章把”求出各个偏导数”与”证明可以使用线性近似”分开处理,再将一元链式法则推广到向量映射。
10.1 从偏导数到全微分
定义 10.1 (偏导数与可微). 设 \(U\subset\mathbb{R}^n\) 为开集,\(a\in U\),\(e_j\) 为第 \(j\) 个坐标单位向量。若 \[\partial_jf(a)=\lim_{t\to0}\frac{f(a+te_j)-f(a)}{t}\] 存在,称它为第 \(j\) 个偏导数。若存在一个线性映射 \(A:\mathbb{R}^n\to\mathbb{R}\),使 \[\begin{equation} \label{eq:10-diff} f(a+h)=f(a)+Ah+r(h),\qquad \lim_{h\to0}\frac{r(h)}{\left\lVert h\right\rVert}=0, \end{equation}\] 则称 \(f\) 在 \(a\) 可微,\(A\) 称为导数,记作 \(Df(a)\),\(Df(a)h\) 称为全微分在增量 \(h\) 上的值。
这里的极限要求对任意趋近于零的向量 \(h\) 成立,不能只检查有限条直线。记号 \(r(h)=o(\left\lVert h\right\rVert)\) 表示误差与扰动长度之比趋于零;它并不要求误差恒等于零。若函数值有物理单位,全微分的每一项仍具有与函数值相同的单位。
命题 10.2 (导数的唯一性及必要条件). 若 \(f\) 在 \(a\) 可微,则式[eq:10-diff]中的线性映射唯一,\(f\) 在 \(a\) 连续,各偏导数存在,而且 \[Df(a)h=\sum_{j=1}^n\partial_jf(a)h_j.\]
证明. Proof. 若 \(A,B\) 都满足可微展开,取 \(h=te_j\),两式相减并除以 \(t\ne0\),令 \(t\to0\),得 \((A-B)e_j=0\)。线性映射在一组基上的值确定该映射,故 \(A=B\)。有限维线性映射有界,即存在 \(C\) 使 \(\left\lvert Ah\right\rvert\le C\left\lVert h\right\rVert\),于是 \(f(a+h)-f(a)\to0\)。再将 \(h=te_j\) 代入一个展开式,除以 \(t\),余项的绝对值不超过 \(\left\lvert r(te_j)\right\rvert/\left\lvert t\right\rvert\to0\),所以 \(\partial_jf(a)=Ae_j\),最后利用线性性即得结论。 ◻
例 10.3 (直接识别线性部分). 求 \(f(x,y)=x^2y\) 在 \((1,2)\) 的全微分,并估计一次近似的误差。令 \(x=1+h,y=2+k\),则 \[(1+h)^2(2+k)-2=4h+k+2h^2+2hk+h^2k.\] 线性部分为 \(4h+k\)。设 \(\rho=(h^2+k^2)^{1/2}\le1\),利用 \(2\left\lvert hk\right\rvert\le h^2+k^2\),有 \[\left\lvert 2h^2+2hk+h^2k\right\rvert\le 2\rho^2+\rho^2+\rho^3\le4\rho^2.\] 故余项除以 \(\rho\) 后趋于零,函数可微,\(\mathop{}\!\mathrm{d}f=4\mathop{}\!\mathrm{d}x+\mathop{}\!\mathrm{d}y\)。在 \((1.02,1.97)\),线性近似给出 \(2+4(0.02)-0.03=2.05\);精确值为 \(2.049588\)。上述估计保证绝对误差不超过 \(4(0.02^2+0.03^2)=0.0052\)。估计不必紧,但必须有适用范围和可验证的依据。
例 10.4 (偏导数齐全仍不能线性近似). 令 \[f(x,y)=\begin{cases}\dfrac{xy}{\sqrt{x^2+y^2}},&(x,y)\ne(0,0),\\0,&(x,y)=(0,0).\end{cases}\] 因 \(\left\lvert xy\right\rvert\le(x^2+y^2)/2\),有 \(\left\lvert f(x,y)\right\rvert\le\sqrt{x^2+y^2}/2\),所以 \(f\) 在原点连续。两条坐标轴上的函数值均为零,故 \(f_x(0,0)=f_y(0,0)=0\)。若可微,其线性部分只能为零。然而取 \((x,y)=(t,t)\),得到 \[\frac{f(t,t)}{\sqrt{2t^2}}=\frac12\qquad(t\ne0),\] 不趋于零。因此”连续且所有偏导数存在”仍不足以推出可微。
直接估计余项适合结构简单的函数。通常可以用偏导函数的连续性把逐坐标的变化连接起来。
定理 10.5 (连续偏导数保证可微). 设 \(f\) 在 \(a\) 的某邻域内各一阶偏导数存在,并且这些偏导函数在 \(a\) 连续,则 \(f\) 在 \(a\) 可微。
证明. Proof. 记 \(a^{(0)}=a\),\(a^{(j)}=a+(h_1,\ldots,h_j,0,\ldots,0)\)。当 \(h\) 足够小时,连接相邻两点的坐标线段均位于给定邻域。将增量写成望远镜和,对每段应用一元中值定理,可得 \[f(a+h)-f(a)=\sum_{j=1}^n\partial_j f(\xi_j)h_j,\] 其中 \(\xi_j\) 位于 \(a^{(j-1)}\) 与 \(a^{(j)}\) 之间;若 \(h_j=0\),对应项直接记为零。由于 \(\left\lVert \xi_j-a\right\rVert\le\left\lVert h\right\rVert\),偏导函数的连续性给出 \[\left\lvert r(h)\right\rvert\le\max_j\left\lvert \partial_jf(\xi_j)-\partial_jf(a)\right\rvert\sum_j\left\lvert h_j\right\rvert \le\sqrt n\left\lVert h\right\rVert\max_j\left\lvert \partial_jf(\xi_j)-\partial_jf(a)\right\rvert.\] 最后一个最大值随 \(h\to0\) 趋于零,即满足可微定义。 ◻
具有连续一阶偏导数的函数称为 \(C^1\) 函数。定理给出的是充分条件,可微函数的偏导函数未必连续。实际计算应先检查公式的定义域:含对数、分母或平方根的表达式,只能在相应运算有意义并满足光滑条件的开集内直接调用此定理。
10.2 方向导数、梯度与等值面的法向
定义 10.6 (方向导数与梯度). 对单位向量 \(u\),若双侧极限 \[D_uf(a)=\lim_{t\to0}\frac{f(a+tu)-f(a)}t\] 存在,则称为沿 \(u\) 的方向导数。若各偏导数存在,按列向量约定定义 \[\nabla f(a)=\bigl(\partial_1f(a),\ldots,\partial_nf(a)\bigr)^{\mathsf T}.\] 对任意非零向量 \(v\),曲线 \(t\mapsto f(a+tv)\) 的导数按参数 \(t\) 计量;它与单位方向 \(v/\left\lVert v\right\rVert\) 的方向导数相差因子 \(\left\lVert v\right\rVert\)。
定理 10.7 (可微函数的方向变化). 若 \(f\) 在 \(a\) 可微,则任意单位向量 \(u\) 均满足 \[D_uf(a)=\nabla f(a)^{\mathsf T}u.\] 若 \(\nabla f(a)\ne0\),欧氏单位方向中的最大、最小方向导数分别为 \(\left\lVert \nabla f(a)\right\rVert\) 与 \(-\left\lVert \nabla f(a)\right\rVert\),分别在与梯度同向、反向的唯一单位向量处取得。若梯度为零,所有方向导数均为零。
证明. Proof. 在式[eq:10-diff]中取 \(h=tu\),余项除以 \(t\) 的绝对值趋于零,遂得第一式。由Cauchy–Schwarz不等式, \(\left\lvert \nabla f(a)^{\mathsf T}u\right\rvert\le\left\lVert \nabla f(a)\right\rVert\)。当梯度非零时,等号条件分别要求 \(u\) 与梯度同向或反向。梯度为零的情形直接由第一式得到。 ◻
例 10.8 (单位方向与参数速度). 对 \(f(x,y,z)=xe^y+yz^2\),在 \(a=(1,0,2)\) 有 \(\nabla f(a)=(1,5,0)^{\mathsf T}\)。沿向量 \(v=(2,-1,2)^{\mathsf T}\) 所指的单位方向为 \(u=v/3\),所以 \[D_uf(a)=\frac{2-5}{3}=-1.\] 但若位置按 \(\gamma(t)=a+tv\) 变化,则 \(\frac{\mathop{}\!\mathrm{d}}{\mathop{}\!\mathrm{d}t}f(\gamma(t))|_{t=0}=-3\)。前者是单位位移引起的一阶变化,后者是每单位参数时间的变化。把 \(v\) 不经归一化直接代入单位方向公式,会混淆这两种量。
方向导数仍然只逐条考察直线。即使全部方向导数存在,也可能无法拼成一个线性映射。例如定义 \[g(x,y)=\begin{cases}\dfrac{x^3}{x^2+y^2},&(x,y)\ne0,\\0,&(x,y)=0.\end{cases}\] 对单位向量 \(u=(a,b)\),直接计算得 \(D_ug(0)=a^3\)。它不是关于方向向量的线性表达式,而 \(g_x(0)=1,g_y(0)=0\) 所预测的可微方向公式应为 \(a\)。故 \(g\) 在原点不可微。这一反例说明,拥有各方向上的一维导数,尚不等于拥有一个统一的多元导数。
命题 10.9 (等值曲线的切向与梯度). 设 \(f\) 在 \(a\) 可微,\(\gamma:(-\delta,\delta)\to\mathbb{R}^n\) 在零点可导,\(\gamma(0)=a\),且 \(f(\gamma(t))\) 为常数,则 \[\nabla f(a)^{\mathsf T}\gamma'(0)=0.\] 因而在 \(\nabla f(a)\ne0\) 时,梯度垂直于通过该点的所有可微等值曲线的切向量。
证明. Proof. 由 \(\gamma(t)=a+t\gamma'(0)+o(|t|)\),代入可微展开,得到 \(f(\gamma(t))-f(a)=t\nabla f(a)^{\mathsf T}\gamma'(0)+o(|t|)\)。左端恒为零,除以 \(t\) 并取极限即得。 ◻
10.3 Jacobian矩阵与复合映射
若模型输出多个数,例如同时输出位置、亮度和误差指标,导数的自然对象就是矩阵。
定义 10.10 (向量映射的导数). 设 \(F:U\subset\mathbb{R}^n\to\mathbb{R}^m\)。若存在 \(m\times n\) 矩阵 \(A\),使 \[F(a+h)=F(a)+Ah+o(\left\lVert h\right\rVert),\] 其中余项按 \(\mathbb{R}^m\) 中的范数计量,则称 \(F\) 在 \(a\) 可微。其导数矩阵为 \[J_F(a)=\left(\frac{\partial F_i}{\partial x_j}(a)\right)_{m\times n}.\] 每一行对应一个输出分量,每一列对应一个输入变量。标量函数的Jacobian是行向量,满足 \(J_f=(\nabla f)^{\mathsf T}\)。
向量映射可微当且仅当每个分量可微。必要性由取坐标分量得到,充分性则由有限个分量余项的平方和估计得到。因此连续偏导数的充分条件也适用于向量映射。
定理 10.11 (多元链式法则). 设 \(F:U\subset\mathbb{R}^n\to\mathbb{R}^m\) 在 \(a\) 可微,\(G:V\subset\mathbb{R}^m\to\mathbb{R}^p\) 在 \(b=F(a)\) 可微,其中 \(U,V\) 为开集,且 \(F\) 在 \(a\) 的某邻域取值于 \(V\)。则 \(G\circ F\) 在 \(a\) 可微,且 \[\begin{equation} \label{eq:10-chain} J_{G\circ F}(a)=J_G(F(a))J_F(a). \end{equation}\]
证明. Proof. 写成 \(F(a+h)=b+Ah+r(h)\) 与 \(G(b+k)=G(b)+Bk+s(k)\),其中 \(r(h)=o(\left\lVert h\right\rVert)\),\(s(k)=o(\left\lVert k\right\rVert)\)。令 \(k=Ah+r(h)\),则存在常数 \(C\) 使充分小时 \(\left\lVert k\right\rVert\le C\left\lVert h\right\rVert\)。代入得 \[G(F(a+h))=G(b)+BAh+Br(h)+s(k).\] 第一项误差 \(Br(h)=o(\left\lVert h\right\rVert)\)。对第二项,给定 \(\varepsilon>0\),当 \(k\) 足够小时有 \(\left\lVert s(k)\right\rVert\le\varepsilon\left\lVert k\right\rVert\),故 \(\left\lVert s(k)\right\rVert\le C\varepsilon\left\lVert h\right\rVert\);\(k=0\) 时该式同样成立。因此总误差为 \(o(\left\lVert h\right\rVert)\),导数为 \(BA\)。 ◻
例 10.12 (非方阵链式法则). 令 \[F(s,t)=(s+t,st,\mathrm e^s),\qquad G(u,v,w)=(uv+w,u^2-v).\] 这里 \(F:\mathbb{R}^2\to\mathbb{R}^3\),\(G:\mathbb{R}^3\to\mathbb{R}^2\)。在 \((s,t)=(0,1)\),有 \(F(0,1)=(1,0,1)\), \[J_F(0,1)=\begin{pmatrix}1&1\\1&0\\1&0\end{pmatrix},\qquad J_G(1,0,1)=\begin{pmatrix}0&1&1\\2&-1&0\end{pmatrix}.\] 所以 \[J_{G\circ F}(0,1)=\begin{pmatrix}2&0\\1&2\end{pmatrix}.\] 独立核对:复合映射为 \(((s+t)st+e^s,(s+t)^2-st)\),逐项求偏导得到相同结果。矩阵乘法的顺序由 \((2\times3)(3\times2)\) 决定,逆序既不符合输入输出关系,也不会得到需要的导数。
当外层为标量函数 \(L:\mathbb{R}^m\to\mathbb{R}\) 时,将式[eq:10-chain]转置即得 \[\nabla_x(L\circ F)(x)=J_F(x)^{\mathsf T}\nabla L(F(x)).\] 这一形式解释了复合模型中标量目标对原始参数的敏感性如何由中间变量传回。第14章将按计算图组织该运算。本章先保持线性映射与矩阵维度明确:转置源于梯度采用列向量的约定,并非额外的求导规则。
10.4 参数曲线、全导数与隐式关系
10.4.1 显式参数化中的全部变化来源
设 \(H(t,x)\) 同时显含时间 \(t\) 与状态 \(x\in\mathbb{R}^n\),而 \(x=x(t)\)。沿轨迹观察到的是一元函数 \(t\mapsto H(t,x(t))\)。由链式法则, \[\begin{equation} \label{eq:10-total} \frac{\mathop{}\!\mathrm{d}}{\mathop{}\!\mathrm{d}t}H(t,x(t))=H_t(t,x(t))+\nabla_xH(t,x(t))^{\mathsf T}x'(t). \end{equation}\] 右端第一项表示固定状态时的显式变化,第二项表示状态运动所产生的变化,两项不能相互替代。
例 10.13 (显含参数与状态同时变化). 设 \(H(t,x,y)=tx^2+e^y\),\(x(t)=\cos t\),\(y(t)=t^2\)。先按中间变量求偏导, \[H_t=x^2,\quad H_x=2tx,\quad H_y=e^y.\] 因此沿曲线有 \[\frac{\mathop{}\!\mathrm{d}H}{\mathop{}\!\mathrm{d}t}=\cos^2t-2t\cos t\sin t+2t e^{t^2}.\] 如果只写后两项,会漏掉 \(H\) 对 \(t\) 的显式依赖。将 \(H\) 直接写成 \(t\cos^2t+e^{t^2}\) 再求导,提供了独立核验方式。
10.4.2 隐函数的局部存在与导数
关系 \(\Phi(x,y)=0\) 不一定在整个平面上决定唯一的 \(y\)。圆 \(x^2+y^2=1\) 在多数横坐标处有两个分支,在 \((1,0)\) 附近还不能作为光滑的 \(y=y(x)\) 图像。导数公式必须建立在一个确实存在的局部分支之上。
定理 10.14 (二变量隐函数定理的局部形式). 设 \(\Phi\) 在 \((a,b)\) 的邻域为 \(C^1\) 函数,\(\Phi(a,b)=0\),且 \(\Phi_y(a,b)\ne0\)。则存在 \(a,b\) 的开区间邻域 \(I,J\),使对每个 \(x\in I\),方程 \(\Phi(x,y)=0\) 在 \(J\) 中有唯一解 \(y=\varphi(x)\)。函数 \(\varphi\) 为 \(C^1\),并满足 \[\varphi'(x)=-\frac{\Phi_x(x,\varphi(x))}{\Phi_y(x,\varphi(x))}.\]
证明. Proof. 必要时将 \(\Phi\) 换为 \(-\Phi\),可设 \(\Phi_y(a,b)>0\)。缩小矩形邻域后,由连续性有 \(\Phi_y\ge m>0\),故对固定 \(x\),\(\Phi(x,y)\) 关于 \(y\) 严格递增。选择 \(b_-<b<b_+\),使 \(\Phi(a,b_-)<0<\Phi(a,b_+)\);再缩小 \(x\) 区间,使两端符号保持不变。介值定理与严格单调性给出唯一根 \(\varphi(x)\)。
在这个矩形内设 \(|\Phi_x|\le M\)。分别对 \(x\)、\(y\) 使用一元中值定理,利用两点均为根,可得 \[m|\varphi(x')-\varphi(x)|\le M|x'-x|.\] 所以 \(\varphi\) 连续且局部Lipschitz。令 \(h=x'-x\),\(k=\varphi(x+h)-\varphi(x)=O(|h|)\)。在 \((x,\varphi(x))\) 处用 \(\Phi\) 的可微展开,得 \[0=\Phi_x h+\Phi_y k+o(|h|+|k|)=\Phi_x h+\Phi_y k+o(|h|).\] 除以 \(h\) 并令 \(h\to0\),便得到导数公式。分子、分母及 \(\varphi\) 均连续,且分母不为零,故 \(\varphi'\) 连续。 ◻
例 10.15 (不必先解出显函数). 在方程 \(y+\sin y=x\) 中,点 \((0,0)\) 满足等式,且 \(\Phi_y=1+\cos y\) 在该点为 \(2\)。隐函数定理保证原点附近存在唯一 \(C^1\) 分支,并有 \[y'(x)=\frac1{1+\cos y(x)},\qquad y'(0)=\frac12.\] 继续求导得到 \[y''(x)=\frac{\sin y(x)}{(1+\cos y(x))^3},\qquad y''(0)=0.\] 这说明局部线性近似为 \(y\approx x/2\)。在 \(y=\pi\) 对应的点,分母为零,不能继续直接引用同一结论;定理条件失效只表示此定理不作保证,仍须另行研究方程的局部性质。
10.5 高阶偏导数与二阶链式法则
约定 \(f_{xy}=\partial_y(\partial_x f)\),即先对 \(x\) 再对 \(y\) 求导。二阶偏导数在适当连续性条件下相等,但求导顺序本身不能无条件交换。
定理 10.16 (混合偏导数的对称性). 若 \(f\) 在 \((a,b)\) 的一个开矩形邻域内为 \(C^2\) 函数,则 \(f_{xy}(a,b)=f_{yx}(a,b)\)。
证明. Proof. 对充分小的非零 \(h,k\),考察矩形增量 \[\Delta=f(a+h,b+k)-f(a+h,b)-f(a,b+k)+f(a,b).\] 先对 \(x\) 再对 \(y\) 使用中值定理,得 \(\Delta=hk f_{xy}(a+\theta h,b+\eta k)\),其中 \(0<\theta,\eta<1\)。交换使用顺序,又有 \(\Delta=hk f_{yx}(a+\widetilde\theta h,b+\widetilde\eta k)\)。两式除以 \(hk\),令 \((h,k)\to(0,0)\),由两个混合偏导函数的连续性得到相等结论。 ◻
作为反例,令 \(q(0,0)=0\),其余点令 \[q(x,y)=\frac{xy(x^2-y^2)}{x^2+y^2}.\] 固定 \(y\) 求原点所在纵轴上的 \(x\) 偏导,得到 \(q_x(0,y)=-y\);同理 \(q_y(x,0)=x\)。所以 \(q_{xy}(0,0)=-1\),\(q_{yx}(0,0)=1\)。两个混合偏导数在一点都存在,并不是交换顺序的充分条件。
若 \(f:\mathbb{R}^n\to\mathbb{R}\) 为 \(C^2\),将二阶偏导数排成Hessian矩阵 \(H_f=(\partial_i\partial_jf)\)。对 \(C^2\) 曲线 \(\gamma\),两次使用链式法则可得 \[\begin{equation} \label{eq:10-secondcurve} \frac{\mathop{}\!\mathrm{d}^2}{\mathop{}\!\mathrm{d}t^2}f(\gamma(t))= \gamma'(t)^{\mathsf T}H_f(\gamma(t))\gamma'(t) +\nabla f(\gamma(t))^{\mathsf T}\gamma''(t). \end{equation}\] 第二项来自曲线自身的加速度。只有直线参数化,或者该内积恰为零时,才能省去。
例 10.17 (非线性参数化产生额外二阶项). 取 \(f(x,y)=x^2+y^2\),\(\gamma(t)=(t,t^2)\)。直接复合得到 \(f(\gamma(t))=t^2+t^4\),二阶导数为 \(2+12t^2\)。矩阵计算中 \(H_f=2I\),\(\gamma'=(1,2t)^{\mathsf T}\),\(\gamma''=(0,2)^{\mathsf T}\),于是 \[\gamma'^{\mathsf T}H_f\gamma'=2+8t^2,\qquad \nabla f(\gamma)^{\mathsf T}\gamma''=4t^2.\] 两部分之和才与直接求导一致。这个额外项也是二阶微分不能照搬一阶微分形式不变性的重要原因。
更一般地,若 \(F:\mathbb{R}^n\to\mathbb{R}^m\) 与 \(g:\mathbb{R}^m\to\mathbb{R}\) 均为 \(C^2\),则逐坐标求导给出 \[H_{g\circ F}=J_F^{\mathsf T}H_g(F)J_F+ \sum_{i=1}^m(\partial_i g)(F)H_{F_i}.\] 第一项反映外层函数的曲率,第二项反映内层映射的非线性。若 \(F(x)=Ax+b\) 为仿射映射,所有 \(H_{F_i}\) 为零,公式才简化为 \(A^{\mathsf T}H_g(Ax+b)A\)。
10.6 融合阅读:归一化映射与敏感性
许多有限维模型先将输入向量除以自身长度,再比较方向。考虑 \[N(x)=\frac{x}{\left\lVert x\right\rVert},\qquad x\in\mathbb{R}^n\setminus\{0\}.\] 这是一个确定性的几何变换,不需要概率解释。记 \(r=\left\lVert x\right\rVert\),则 \(\partial_jr=x_j/r\)。逐分量求导可得 \[\begin{equation} \label{eq:10-normalize} J_N(x)=\frac1rI-\frac1{r^3}xx^{\mathsf T} =\frac1r\bigl(I-uu^{\mathsf T}\bigr),\qquad u=x/r. \end{equation}\] 矩阵 \(I-uu^{\mathsf T}\) 把扰动投影到与 \(u\) 垂直的子空间。若 \(h=\alpha u+v\) 且 \(u^{\mathsf T}v=0\),则 \(J_N(x)h=v/r\)。沿径向的小变化不会改变归一化后的方向;横向变化按 \(1/r\) 放大。这是公式中每一部分的几何意义。
例 10.18 (归一化后的匹配量). 设二维向量 \(c=(1,0)^{\mathsf T}\) 固定,\(S(x)=c^{\mathsf T}N(x)\)。在 \(x=(3,4)^{\mathsf T}\), \[J_N(x)=\frac1{125}\begin{pmatrix}16&-12\\-12&9\end{pmatrix},\qquad \nabla S(x)=\frac1{125}\begin{pmatrix}16\\-12\end{pmatrix}.\] 对径向扰动 \(h=\varepsilon(3,4)^{\mathsf T}\),一阶变化为零;事实上,只要 \(1+\varepsilon>0\),归一化方向完全不变。对横向扰动 \(h=\varepsilon(-4,3)^{\mathsf T}\),一阶变化为 \(-4\varepsilon/5\)。这两个结论表明,同样长度的扰动是否重要,取决于它与输入方向的关系。
| 输入长度 \(r\) | 径向单位扰动的增益 | 横向单位扰动的增益 |
|---|---|---|
| \(2\) | \(0\) | \(1/2\) |
| \(1\) | \(0\) | \(1\) |
| \(1/10\) | \(0\) | \(10\) |
式[eq:10-normalize]只在 \(x\ne0\) 成立。输入长度接近零时,导数增大,说明小的横向扰动可能带来明显方向变化。在分母中加入常数或将小向量截断,会定义另一个函数;应对实际使用的表达式重新求导。局部导数界也不能直接跨越含原点的线段使用。
若 \(F\) 在开凸集 \(U\) 上为 \(C^1\),且所有点的算子范数满足 \(\left\lVert J_F(x)\right\rVert\le M\),则对 \(a,b\in U\),对每个分量应用微积分基本定理, \[F(b)-F(a)=\int_0^1J_F(a+t(b-a))(b-a)\,\mathop{}\!\mathrm{d}t,\] 从而 \(\left\lVert F(b)-F(a)\right\rVert\le M\left\lVert b-a\right\rVert\)。这里的矩阵范数定义为 \(\sup_{\left\lVert v\right\rVert=1}\left\lVert J_Fv\right\rVert\)。一个点的导数描述无穷小变化;整条线段上的统一导数界,才能控制两点之间的有限变化。
10.7 习题、知识回顾与选题解答
分层习题
(基础)求 \(f(x,y)=\ln(1+x^2+y^2)\) 在 \((1,0)\) 的全微分,并用它估计 \(f(1.01,-0.02)-f(1,0)\)。
(基础)用定义证明 \(f(x,y)=xy\) 在原点可微,并给出余项关于 \(\sqrt{x^2+y^2}\) 的界。
(基础)求 \(f(x,y,z)=xy+z^2\) 在 \((1,2,-1)\) 沿 \((1,2,2)\) 所指单位方向的方向导数,以及所有单位方向中的最大方向导数。
(基础)设 \(F(s,t)=(s^2+t,s-t)\),\(g(u,v)=u e^v\)。求 \(J_F(1,0)\) 与 \(\nabla(g\circ F)(1,0)\)。
(基础)设 \(H(t,x)=t^2x\),\(x(t)=e^t\)。分别求 \(H_t(t,x)\) 与 \(\frac{\mathop{}\!\mathrm{d}}{\mathop{}\!\mathrm{d}t}H(t,x(t))\),说明两式的变量约定。
(基础)方程 \(x^2+xy+y^2=3\) 在 \((1,1)\) 附近确定 \(y=y(x)\)。求该点的 \(y'\) 与 \(y''\)。
(推理)设 \(f\) 在开凸集 \(U\) 上可微,且 \(\nabla f\equiv0\)。证明 \(f\) 在 \(U\) 上为常数。若删除凸性并允许 \(U\) 不连通,结论是否仍成立?
(推理)定义 \(f(0,0)=0\),其余点 \(f(x,y)=x^2y/(x^2+y^2)\)。证明它连续且所有方向导数存在,但在原点不可微。
(推理)设 \(f\) 为 \(C^1\),\(\nabla f(a)\ne0\)。证明对固定方向 \(v\),若 \(\nabla f(a)^{\mathsf T}v<0\),则存在 \(\delta>0\),使 \(0<t<\delta\) 时 \(f(a+tv)<f(a)\)。
(推理)推导 \(f(r\cos\theta,r\sin\theta)\) 对 \(r,\theta\) 的一阶偏导数,并在 \(r>0\) 时证明 \(f_x^2+f_y^2=f_r^2+r^{-2}f_\theta^2\)。右端的记号指复合函数的偏导。
(拓展)对 \(N(x)=x/\left\lVert x\right\rVert\),证明 \(J_N(x)x=0\),且当 \(n\ge2\) 时 \(\left\lVert J_N(x)\right\rVert=1/\left\lVert x\right\rVert\)。说明 \(n=1\) 时为何不同。
(拓展)设 \(F:\mathbb{R}^n\to\mathbb{R}^m\) 为 \(C^2\),\(L(x)=\frac12\left\lVert F(x)\right\rVert^2\)。推导 \(\nabla L\) 与 \(H_L\),说明在 \(F(x)=0\) 的点为何 \(H_L\) 半正定。
知识回顾
可微性是一阶线性近似加上统一的小量余项;偏导数和方向导数分别是对特殊路径的限制。梯度是标量函数导数在欧氏内积下的向量表示,Jacobian是一般导数的矩阵表示。链式法则将复合变化写为线性映射的复合,二阶复合求导还必须计入中间映射的曲率。使用任何公式之前,应明确函数的定义域、求导变量及连续性条件。
选题解答
\(\nabla f(x,y)=(2x,2y)^{\mathsf T}/(1+x^2+y^2)\),在 \((1,0)\) 为 \((1,0)^{\mathsf T}\),所以全微分为 \(\mathop{}\!\mathrm{d}x\),所求增量约为 \(0.01\)。由于函数在该点邻域为 \(C^2\),近似误差为 \(O(0.01^2+0.02^2)\);这里没有把一阶近似写成精确等式。
候选线性映射为零,且 \(|xy|\le(x^2+y^2)/2\)。故当 \(\rho=\sqrt{x^2+y^2}>0\) 时,\(|xy|/\rho\le\rho/2\to0\),这直接满足可微定义。
梯度为 \((y,x,2z)^{\mathsf T}\),在给定点为 \((2,1,-2)^{\mathsf T}\)。方向向量长度为 \(3\),方向导数为 \((2+2-4)/3=0\);最大方向导数为梯度长度 \(3\)。
\(J_F(1,0)=\begin{pmatrix}2&1\\1&-1\end{pmatrix}\),且 \(F(1,0)=(1,1)\),\(\nabla g(1,1)=(e,e)^{\mathsf T}\)。相乘得到 \(\nabla(g\circ F)(1,0)=(3e,0)^{\mathsf T}\)。
在固定 \(x\) 的约定下,\(H_t=2tx\);沿指定轨迹的全导数为 \(2te^t+t^2e^t\)。第二项来自 \(x\) 对 \(t\) 的依赖。
一次求导得 \(2x+y+(x+2y)y'=0\),代入 \((1,1)\) 得 \(y'=-1\)。再次求导得 \(2+2y'+2(y')^2+(x+2y)y''=0\),故 \(y''=-2/3\)。隐函数存在由 \(x+2y=3\ne0\) 保证。
题7. 对 \(a,b\in U\),令 \(\psi(t)=f(a+t(b-a))\)。凸性保证线段在 \(U\) 内,链式法则给出 \(\psi'(t)=0\),一元中值定理遂得 \(f(a)=f(b)\)。若 \(U\) 是两个不相交开球的并,在两个球上分别取常数 \(0,1\),梯度处处为零而函数不是同一常数。
题8. 有 \(|f(x,y)|\le|y|\),所以原点连续。对单位向量 \((a,b)\),\(f(ta,tb)=ta^2b\),方向导数为 \(a^2b\)。原点两偏导均为零,但在 \(a=b=1/\sqrt2\) 的方向上方向导数非零,与可微时的方向导数公式矛盾。
题11. 由 \(J_N=r^{-1}(I-uu^{\mathsf T})\),且 \(x=ru\),立即得到 \(J_Nx=0\)。任意 \(v\) 分解为平行与垂直于 \(u\) 的两部分后,\(\left\lVert J_Nv\right\rVert\le\left\lVert v\right\rVert/r\);当 \(n\ge2\) 时选取与 \(u\) 垂直的单位向量,等号成立。\(n=1\) 时定义域分为正、负两个区间,\(N\) 在每段为常数,其导数为零。
题12. 逐分量求导得 \[\nabla L=J_F^{\mathsf T}F,\qquad H_L=J_F^{\mathsf T}J_F+\sum_{i=1}^mF_iH_{F_i}.\] 若 \(F(x)=0\),第二项消失,任意 \(v\) 满足 \(v^{\mathsf T}H_Lv=\left\lVert J_Fv\right\rVert^2\ge0\)。若要得到正定,还需要 \(J_F\) 的列向量线性无关。
