11 极值、凸性与二阶信息
先修内容为第5章的Taylor公式、第9章的紧集与连续函数,以及第10章的梯度、链式法则和二阶偏导数。本章要求区分极值存在、驻点定位、局部判别与全局最优四类问题;用二阶展开证明Hessian判别法;用线段限制理解凸性,掌握一阶与二阶判据;解释参数冗余和曲率尺度。涉及矩阵时,主要使用对称二次型及二维配方法。
求解方程 \(\nabla f=0\) 只完成了寻找内部极值候选点的一步。要说明某个点确实最优,还要回答:目标函数是否能取到下确界;附近是否存在使函数值减小的方向;远处是否存在更小的值;不同参数是否代表同一个模型。本章围绕这些问题组织一阶条件、二阶信息与凸性,不将数值迭代停止视为数学上的最优性证明。
11.1 极值、驻点与最小值的存在
定义 11.1 (局部极小与全局极小). 设 \(f:D\subset\mathbb{R}^n\to\mathbb{R}\),\(a\in D\)。若存在 \(r>0\),使 \(x\in D\cap B(a,r)\) 时均有 \(f(x)\ge f(a)\),则 \(a\) 为局部极小点;若对其中一切 \(x\ne a\) 都有严格不等式,则称严格局部极小点。若不等式对全部 \(x\in D\) 成立,则为全局极小点。极大点通过反向不等式定义。若 \(a\) 是可微点且 \(\nabla f(a)=0\),则称为驻点。
局部极小的比较范围是邻域,全局极小的比较范围是整个定义域。“极小值”是数 \(f(a)\),“极小点”是向量 \(a\)。多个不同的极小点可以有相同的函数值,严格局部极小也不意味着只有一个全局候选点。
定理 11.2 (内部极值的一阶必要条件). 设 \(U\subset\mathbb{R}^n\) 为开集,\(a\in U\) 是 \(f\) 的局部极值点。若各偏导数在 \(a\) 存在,则 \(\partial_jf(a)=0\) 对所有 \(j\) 成立。
证明. Proof. 固定坐标方向 \(e_j\)。因 \(a\) 是内点,函数 \(t\mapsto f(a+te_j)\) 在零点两侧都有定义,且在零点取得局部极值。一元Fermat定理给出其导数为零,该导数正是 \(\partial_jf(a)\)。 ◻
这里不必假设全部可微,偏导数存在已足够推出必要条件。内点条件则不能省略:\(f(x)=x\) 在 \([0,1]\) 上的最小值位于 \(0\),而右侧导数为 \(1\)。不可微极小点也可能没有梯度,例如 \(|x|+|y|\) 在原点取得严格全局最小值。本章先研究内部光滑极值,约束与非光滑情形见第15章。
例 11.3 (驻点、下确界与最小值是不同概念). 函数 \(f(x,y)=x^3+y^2\) 在原点的梯度为零,但沿 \((t,0)\) 的函数值为 \(t^3\),在任意小邻域内同时出现正值和负值,所以原点不是极值点。函数 \(g(x,y)=e^x+y^2\) 的下确界为零,因为 \(g(-k,0)\to0\);然而 \(g(x,y)>0\) 对每个有限点成立,因此最小值不存在。函数 \(h(x,y)=x^2+y^2\) 则在原点取到唯一最小值。寻找驻点之前,先分析定义域与函数在边界、无穷远处的行为,可避免把不存在的最优点当作计算目标。
定理 11.4 (紧集与强制增长保证最小值存在). 连续函数在非空紧集上取到最大值和最小值。特别地,若连续函数 \(f:\mathbb{R}^n\to\mathbb{R}\) 满足 \[f(x)\longrightarrow+\infty\qquad(\left\lVert x\right\rVert\to\infty),\] 则 \(f\) 至少有一个全局极小点。上述增长性质称为强制性。
证明. Proof. 对紧集 \(K\),连续性首先保证有界。设 \(m=\inf_K f\),取 \(x_k\in K\) 使 \(m\le f(x_k)<m+1/k\)。紧性给出收敛子列 \(x_{k_j}\to a\in K\),连续性给出 \(f(a)=m\)。最大值同理。
对第二个结论,固定 \(x_0\)。由强制性存在 \(R>\left\lVert x_0\right\rVert\),使 \(\left\lVert x\right\rVert>R\) 时 \(f(x)>f(x_0)+1\)。在闭球 \(\overline B(0,R)\) 内,第一部分保证存在最小值点 \(a\),且 \(f(a)\le f(x_0)\)。球外函数值均大于 \(f(a)\),所以 \(a\) 也是全空间上的最小值点。 ◻
例 11.5 (先证存在,再求候选点). 考虑 \(f(x,y)=(x^2-1)^2+(y-x)^2\)。若 \(f(x,y)\le M\),则 \(|x^2-1|\le\sqrt M\),从而 \(x\) 有界;又有 \(|y-x|\le\sqrt M\),从而 \(y\) 有界。因此各有限水平集有界,结合连续性可知 \(f\) 为强制函数,最小值存在。进一步,两个平方项同时为零当且仅当 \((x,y)=(1,1)\) 或 \((-1,-1)\),所以全局最小值为零,且恰有两个最小值点。这里用非负结构比求解梯度方程更直接;求导可以用于检查其他驻点,但不是唯一的论证手段。
11.2 二阶展开与对称二次型
定义 11.6 (Hessian与二次型). 对 \(C^2\) 函数 \(f\),定义 \(H_f(x)=(\partial_i\partial_jf(x))_{n\times n}\)。混合偏导的对称性保证它是实对称矩阵。实对称矩阵 \(A\) 若对所有 \(v\ne0\) 满足 \(v^{\mathsf T}Av>0\),则称正定;将 \(>\) 换为 \(\ge\) 得到半正定。负定、半负定分别对应反向不等式。若该二次型既取正值又取负值,则称不定。
正定是对全部非零方向的条件,不能只检查矩阵的对角元。对角元为正的矩阵 \(\begin{pmatrix}1&2\\2&1\end{pmatrix}\),在方向 \((1,-1)\) 上的二次型为 \(-2\),因此不是半正定。
定理 11.7 (多元二阶Taylor公式). 若 \(f\) 在 \(a\) 的某开球邻域内为 \(C^2\),则对球内的 \(a+h\), \[\begin{align} f(a+h)&=f(a)+\nabla f(a)^{\mathsf T}h +\int_0^1(1-t)h^{\mathsf T}H_f(a+th)h\,\mathop{}\!\mathrm{d}t,\label{eq:11-integral}\\ &=f(a)+\nabla f(a)^{\mathsf T}h+\frac12h^{\mathsf T}H_f(a)h+o(\left\lVert h\right\rVert^2).\label{eq:11-taylor} \end{align}\]
证明. Proof. 令 \(\varphi(t)=f(a+th)\)。链式法则给出 \(\varphi'(0)=\nabla f(a)^{\mathsf T}h\) 和 \(\varphi''(t)=h^{\mathsf T}H_f(a+th)h\)。对 \(\varphi\) 分部积分可得 \(\int_0^1(1-t)\varphi''(t)\,\mathop{}\!\mathrm{d}t=\varphi(1)-\varphi(0)-\varphi'(0)\),从而得到第一式。从积分项中减去 \(\frac12h^{\mathsf T}H_f(a)h\),所得余项 \(R(h)\) 满足 \[|R(h)|\le\frac12\left\lVert h\right\rVert^2\sup_{0\le t\le1}\left\lVert H_f(a+th)-H_f(a)\right\rVert.\] Hessian连续使上式中的上确界随 \(h\to0\) 趋于零,因而得到第二式。 ◻
在二维中,令 \(h=(u,v)^{\mathsf T}\),二阶项为 \[\frac12\bigl(f_{xx}(a)u^2+2f_{xy}(a)uv+f_{yy}(a)v^2\bigr).\] 混合项系数为 \(2\),来自对称矩阵中两个非对角位置。漏写这个系数会同时影响近似值、二次型与极值判别。
命题 11.8 (二维正定判据). 实对称矩阵 \(A=\begin{pmatrix}a&b\\b&c\end{pmatrix}\) 正定,当且仅当 \(a>0\) 且 \(ac-b^2>0\);若 \(ac-b^2<0\),则 \(A\) 不定。
证明. Proof. 若正定,则取 \((1,0)\) 得 \(a>0\)。配方得 \[a u^2+2buv+cv^2=a\left(u+\frac ba v\right)^2+\frac{ac-b^2}{a}v^2.\] 取 \(u=-bv/a,v\ne0\),得 \(ac-b^2>0\);反之两个系数均正时,非零向量对应的二次型必为正。若行列式为负且 \(a\ne0\),配方中两个系数符号相反,故二次型不定;若 \(a=0\),则 \(b\ne0\),固定 \(v=1\) 后表达式 \(2bu+c\) 可取正负值。 ◻
例 11.9 (二阶近似包含耦合项). 对 \(f(x,y)=e^{x+y}+x^2\),在原点有 \(f(0)=1\),\(\nabla f(0)=(1,1)^{\mathsf T}\), \[H_f(0)=\begin{pmatrix}3&1\\1&1\end{pmatrix}.\] 因此 \[f(h,k)=1+h+k+\frac32h^2+hk+\frac12k^2+o(h^2+k^2).\] 沿方向 \(k=-h\),指数项恰为 \(1\),函数增量为 \(h^2\),上式的一阶项消失,二阶项也恰好给出 \(h^2\)。沿 \(k=h\) 时,指数项的一阶与二阶变化均保留。这说明曲率既取决于位置,也取决于扰动方向。
11.3 二阶判别与退化驻点
定理 11.10 (二阶必要条件与充分条件). 设 \(f\) 在内点 \(a\) 的邻域为 \(C^2\)。
若 \(a\) 为局部极小点,则 \(\nabla f(a)=0\) 且 \(H_f(a)\) 半正定。
若 \(\nabla f(a)=0\) 且 \(H_f(a)\) 正定,则 \(a\) 为严格局部极小点;负定时为严格局部极大点。
若 \(\nabla f(a)=0\) 且 \(H_f(a)\) 不定,则任意充分小邻域内既有函数值大于 \(f(a)\) 的点,也有小于 \(f(a)\) 的点,因而 \(a\) 不是极值点。
证明. Proof. 第一项中梯度为零已证。任取 \(v\),一元函数 \(t\mapsto f(a+tv)\) 在零点局部极小,故其二阶导数 \(v^{\mathsf T}H_f(a)v\ge0\)。
对于第二项,单位球面上的连续函数 \(v\mapsto v^{\mathsf T}H_f(a)v\) 取到正的最小值 \(m\),所以 \(h^{\mathsf T}H_f(a)h\ge m\left\lVert h\right\rVert^2\)。在式[eq:11-taylor]中把余项控制为 \(|R(h)|\le m\left\lVert h\right\rVert^2/4\),得到 \(0<\left\lVert h\right\rVert<\delta\) 时 \[f(a+h)-f(a)\ge\frac m4\left\lVert h\right\rVert^2>0.\] 负定情形对 \(-f\) 使用同一结论。
对于第三项,选取单位向量 \(u,v\) 使对应二次型一正一负。沿 \(tu,tv\) 分别应用二阶展开,非零二次项在 \(t\) 充分小时支配余项,故函数增量分别为正、负。 ◻
例 11.11 (同一函数中的极小点与鞍点). 对 \(f(x,y)=x^3-3x+y^2\),梯度方程为 \(3x^2-3=0,2y=0\),得到两个驻点 \((1,0)\) 与 \((-1,0)\)。Hessian为 \(\mathop{\mathrm{diag}}(6x,2)\)。在 \((1,0)\) 正定,因此该点严格局部极小,函数值为 \(-2\);在 \((-1,0)\) 不定,因此不是极值点。由于沿 \((x,0)\) 令 \(x\to-\infty\) 时 \(f\to-\infty\),该函数没有全局最小值。局部判别正确,并不能补足缺失的全局下界。
例 11.12 (相同的退化Hessian,不同的极值性质). 考虑 \[f_1=x^2+y^4,\qquad f_2=x^2-y^4,\qquad f_3=x^2.\] 三者在原点都为驻点,Hessian均为 \(\mathop{\mathrm{diag}}(2,0)\)。但 \(f_1\) 在原点严格全局极小;\(f_2\) 沿 \(x\) 轴取正值、沿 \(y\) 轴取负值,原点不是极值点;\(f_3\) 在整条 \(y\) 轴上均取最小值零,原点是非严格极小点。半正定Hessian只说明二阶项不向下弯曲,零曲率方向上的高阶项仍可能决定最终性质。
函数 \(p(x,y)=(y-x^2)^2-x^6\) 在原点的Hessian半正定。沿任意固定直线 \(y=mx\),若 \(m\ne0\),最低次项为 \(m^2x^2>0\);若 \(m=0\),则 \(p=x^4-x^6>0\) 对充分小的非零 \(x\) 成立;沿竖直线 \(x=0\) 也有 \(p=y^2>0\)。然而沿曲线 \(y=x^2\),有 \(p=-x^6<0\)。各直线上的”充分小”范围可以随方向变化,不能替代对整个邻域的统一判断。
实对称矩阵正定等价于其全部特征值为正。二维判别可化为两个标量条件,高维则不能只凭行列式:\(\mathop{\mathrm{diag}}(-1,-1,1)\) 的行列式为正,却是不定矩阵。实际使用二阶信息时,应写出二次型符号或明确的正定性依据,避免把某个矩阵指标误当完整判据。
11.4 凸性把局部信息连接到全局
定义 11.13 (凸函数、严格凸函数与强凸函数). 设 \(C\subset\mathbb{R}^n\) 为凸集,即任意两点间的线段仍在 \(C\) 内。函数 \(f:C\to\mathbb{R}\) 若满足 \[f((1-t)x+ty)\le(1-t)f(x)+tf(y)\qquad(0\le t\le1),\] 则为凸函数;对 \(x\ne y\) 且 \(0<t<1\) 恒为严格不等式时称严格凸。若存在 \(m>0\),使 \(x\mapsto f(x)-\frac m2\left\lVert x\right\rVert^2\) 为凸函数,则称 \(f\) 为 \(m\) 强凸函数。
凸性比较一条弦与函数图像;严格凸排除非平凡线段上的线性部分;强凸进一步给出统一的二次弯曲下界。强凸必然严格凸,但严格凸未必强凸。例如 \(x^4\) 在实轴严格凸,然而原点二阶导数为零,不具有正的全局曲率下界。
定理 11.14 (可微凸函数的一阶判据). 设 \(U\) 为开凸集,\(f:U\to\mathbb{R}\) 可微。则 \(f\) 凸,当且仅当任意 \(x,y\in U\) 都满足 \[\begin{equation} \label{eq:11-support} f(y)\ge f(x)+\nabla f(x)^{\mathsf T}(y-x). \end{equation}\]
证明. Proof. 若 \(f\) 凸,则对 \(0<t<1\), \[\frac{f(x+t(y-x))-f(x)}t\le f(y)-f(x).\] 令 \(t\downarrow0\),由可微性得到支撑不等式。
反之,令 \(z=(1-t)x+ty\)。分别将 \(x,y\) 代入以 \(z\) 为基点的支撑不等式,再分别乘以 \(1-t,t\) 并相加。梯度项因 \((1-t)(x-z)+t(y-z)=0\) 消失,得到 \((1-t)f(x)+tf(y)\ge f(z)\),即凸性。 ◻
推论 11.15 (凸性下的最优性与唯一性). 可微凸函数在开凸集内的任一驻点都是全局极小点。凸函数的任一局部极小点都是全局极小点,即使函数不可微亦成立。严格凸函数至多有一个全局极小点,但不一定能取到最小值。
证明. Proof. 第一项在式[eq:11-support]中代入零梯度即可。第二项若不成立,存在 \(y\) 使 \(f(y)<f(a)\),则凸性给出 \(f((1-t)a+ty)<f(a)\) 对所有 \(0<t<1\) 成立,与 \(t\) 足够小时的局部极小矛盾。第三项若存在不同极小点 \(a,b\),严格凸性使其中点的函数值严格小于最小值,矛盾。存在性不由这些比较关系保证,例如实轴上的 \(e^x\) 严格凸而没有最小值点。 ◻
定理 11.16 (二阶凸性判据). 设 \(f\) 在开凸集 \(U\) 上为 \(C^2\)。则 \(f\) 凸当且仅当 \(H_f(x)\) 在每个 \(x\in U\) 半正定;\(f\) 为 \(m\) 强凸当且仅当 \(H_f(x)-mI\) 处处半正定。若 \(H_f(x)\) 处处正定,则 \(f\) 严格凸。
证明. Proof. 若凸,沿任意直线的限制 \(\varphi(t)=f(x+tv)\) 为一元凸函数,故 \(\varphi''(0)=v^{\mathsf T}H_f(x)v\ge0\)。反之,若Hessian处处半正定,对线段限制有 \(\varphi''(t)\ge0\),一元凸性推出所需线段不等式。强凸结论对 \(f-m\left\lVert x\right\rVert^2/2\) 应用同一等价关系即可。若Hessian处处正定,任意非零线段方向上的二阶导数严格为正,线段限制严格凸,因此 \(f\) 严格凸。 ◻
11.5 凸性运算与有限参数模型
命题 11.17 (非负求和、仿射复合与有限Jensen不等式). 设 \(f_i\) 为同一凸集上的凸函数,\(\alpha_i\ge0\),则 \(\sum_i\alpha_if_i\) 凸。若 \(f\) 凸且仿射映射 \(x\mapsto Ax+b\) 的值位于其定义域,则 \(f(Ax+b)\) 凸。若 \(\lambda_i\ge0\)、\(\sum_{i=1}^N\lambda_i=1\),则 \[f\left(\sum_{i=1}^N\lambda_ix_i\right)\le\sum_{i=1}^N\lambda_if(x_i).\]
证明. Proof. 前两项分别由将凸性不等式非负加权相加,以及恒等式 \(A((1-t)x+ty)+b=(1-t)(Ax+b)+t(Ay+b)\) 得到。有限Jensen不等式对 \(N\) 归纳。\(N=2\) 即凸性定义;若 \(0<\lambda_N<1\),令 \(z=\sum_{i<N}\lambda_ix_i/(1-\lambda_N)\),先对 \((1-\lambda_N)z+\lambda_Nx_N\) 用二点凸性,再对 \(z\) 用归纳假设。权重为零或一的边界情形直接删去零权项即可。 ◻
例 11.18 (凸外层配非线性内层可能失去凸性). 函数 \(g(u)=u^2\) 凸,但与 \(F(x)=x^2-1\) 复合得到 \((x^2-1)^2\),其二阶导数为 \(12x^2-4\),在原点附近为负,因此不凸。仿射复合定理中的”仿射”条件不能任意替换为”可微”。对于参数模型,某个误差函数关于预测值凸,并不自动意味着它关于模型全部参数也凸。
例 11.19 (对数指数和的曲率). 令 \(a_i\in\mathbb{R}^d,b_i\in\mathbb{R}\) 固定,定义光滑函数 \[F(x)=\ln\left(\sum_{i=1}^N e^{a_i^{\mathsf T}x+b_i}\right),\qquad p_i(x)=\frac{e^{a_i^{\mathsf T}x+b_i}}{\sum_j e^{a_j^{\mathsf T}x+b_j}}.\] 权重 \(p_i>0\) 且 \(\sum_i p_i=1\),这里只是有限代数权重。求导得 \(\nabla F=\sum_i p_i a_i=\bar a\),进一步得到 \[H_F=\sum_i p_i a_i a_i^{\mathsf T}-\bar a\bar a^{\mathsf T}.\] 对任意 \(v\),令 \(s_i=a_i^{\mathsf T}v\)、\(\bar s=\sum_i p_is_i\),则 \[v^{\mathsf T}H_Fv=\sum_i p_is_i^2-\bar s^2 =\sum_i p_i(s_i-\bar s)^2\ge0.\] 因此 \(F\) 凸。等号当且仅当所有 \(a_i^{\mathsf T}v\) 相同;若存在非零的此类方向,就不能从本式得到严格正定性。这个证明完全建立在有限和与平方非负性上,不依赖概率论解释。
强凸性给出的信息比唯一性更定量。若 \(f\) 为 \(m\) 强凸且可微,则对 \(f-m\left\lVert x\right\rVert^2/2\) 使用支撑不等式,整理得 \[f(y)\ge f(x)+\nabla f(x)^{\mathsf T}(y-x)+\frac m2\left\lVert y-x\right\rVert^2.\] 若 \(x_*\) 是内部最小值点,则 \[f(x)-f(x_*)\ge\frac m2\left\lVert x-x_*\right\rVert^2.\] 因此已知函数值与最小值的差,可以得到位置误差的上界 \[\left\lVert x-x_*\right\rVert\le\sqrt{2(f(x)-f(x_*))/m}.\] 没有统一正数 \(m\) 时,不能直接使用这一误差换算。
11.6 曲率尺度、参数冗余与诊断
11.6.1 坐标单位会改变Hessian的数值
对仿射换元 \(x=Sz+b\),第10章的二阶链式法则给出 \[H_{f\circ(S\cdot+b)}(z)=S^{\mathsf T}H_f(Sz+b)S.\] 若 \(S\) 可逆,二次型的正定、负定和不定性质保持,但特征值的具体数值通常改变。因此”同一目标曲率很大”只有在变量单位与坐标约定明确后才有可比意义。
例 11.20 (椭圆等值线中的两个尺度). 取 \(f(x,y)=\frac12(x^2+16y^2)\)。在所有点,Hessian为 \(\mathop{\mathrm{diag}}(1,16)\)。固定小增量的欧氏长度为 \(\delta\),沿 \(x\) 方向的二次变化为 \(\delta^2/2\),沿 \(y\) 方向为 \(8\delta^2\),相差 \(16\) 倍。换元 \(z_1=x,z_2=4y\) 后,函数变为 \(\frac12(z_1^2+z_2^2)\),Hessian为单位阵。两个表达式描述相同的函数值关系,但长度的度量改变了。变量缩放可以改善数值尺度,却不等于改变原问题的最优解集合。
| 已知信息 | 可支持的结论 |
|---|---|
| 某驻点Hessian正定 | 该点严格局部极小 |
| 凸定义域上Hessian处处半正定 | 函数凸,驻点若存在则全局极小 |
| Hessian处处不小于 \(mI\),\(m>0\) | 强凸,最小值点至多一个,且有二次误差下界 |
11.6.2 平方残差的二阶信息
设 \(r_i(\theta)\) 为有限个 \(C^2\) 残差,目标为 \[L(\theta)=\frac12\sum_{i=1}^Nr_i(\theta)^2.\] 将残差向量记为 \(r\),其Jacobian为 \(J_r\),则 \[\begin{equation} \label{eq:11-residual} \nabla L=J_r^{\mathsf T}r,\qquad H_L=J_r^{\mathsf T}J_r+\sum_{i=1}^Nr_iH_{r_i}. \end{equation}\] 第一项总是半正定;第二项可能不定。对非线性参数化,即使每一项都是平方,整体也未必凸。若残差在某点恰好全为零,则第二项消失。该点必然是全局最小值点,但Hessian仍可能退化,是否唯一还须考察参数化本身。
例 11.21 (模型相同导致参数不唯一). 模型只通过 \(a+b\) 参与一个标量输出,目标为 \(L(a,b)=\frac12(a+b-2)^2\)。有 \[\nabla L=(a+b-2)\begin{pmatrix}1\\1\end{pmatrix},\qquad H_L=\begin{pmatrix}1&1\\1&1\end{pmatrix}.\] 方向 \((1,-1)\) 的二次型为零,且沿该方向函数值完全不变。全部最小值点构成直线 \(a+b=2\)。这时平坦方向反映两参数对输出的作用无法区分;它不是求导失败,也不是小数误差导致的现象。若增加额外限制以选定某组参数,应说明所增加的选择原则,不能将其归结为原目标已有的唯一性。
先说明候选点是否属于定义域内部、函数是否满足所用可微条件;再检查梯度与Hessian,遇到退化方向则回到原函数或高阶项。若要声称全局最优,需补充凸性、平方非负分解或其他全局下界;若要声称唯一,还需排除不同点取得同一最小值。数值上接近零的梯度只能作为候选证据,必须同时说明误差尺度,不能替代上述逻辑条件。
11.7 习题、知识回顾与选题解答
分层习题
(基础)求 \(f(x,y)=2x^2+2xy+2y^2-6x\) 的驻点、极值及全局最优性。
(基础)判断矩阵 \(\begin{pmatrix}2&-1\\-1&3\end{pmatrix}\) 与 \(\begin{pmatrix}1&3\\3&1\end{pmatrix}\) 的二次型性质,写出具体依据。
(基础)求 \(f(x,y)=\sin x+y^2\) 的所有驻点,并分类。
(基础)将 \(f(x,y)=\ln(1+x+y)\) 在原点展开至二阶,并说明展开的局部定义域。
(基础)判断原点分别是否为 \(x^4+y^4\)、\(x^4-y^4\)、\((x-y)^4\) 的严格或非严格极小点。
(基础)证明 \(f(x,y)=e^x+y^2\) 严格凸,并说明为何没有全局最小值点。
(推理)设 \(A\) 为对称正定矩阵,\(f(x)=\frac12x^{\mathsf T}Ax-b^{\mathsf T}x\)。证明其唯一最小值点为 \(A^{-1}b\),并推导 \(f(x)-f(x_*)=\frac12(x-x_*)^{\mathsf T}A(x-x_*)\)。
(推理)证明凸函数的任意水平下集 \(\{x:f(x)\le c\}\) 为凸集。反过来,全部水平下集凸是否保证函数凸?用 \(f(x)=x^3\) 检验。
(推理)证明:若 \(f\) 在开凸集上为 \(C^1\) 且凸,则 \((\nabla f(x)-\nabla f(y))^{\mathsf T}(x-y)\ge0\)。
(推理)设 \(f\) 在 \(\mathbb{R}^n\) 上为 \(C^2\) 且 \(H_f(x)\succeq mI\),\(m>0\)。证明 \(f\) 强制,并由此证明其有且仅有一个全局最小值点。符号 \(\succeq\) 表示两矩阵之差半正定。
(拓展)求 \(L(a,b)=\frac12(ab-1)^2\) 的全部驻点,分类原点,并说明该函数为何不是凸函数、为何仍有全局最小值点。
(拓展)在对数指数和例题中,证明Hessian正定当且仅当不存在非零向量 \(v\) 使全部 \(a_i^{\mathsf T}v\) 相同;将这个条件解释为向量 \(a_i-a_1\) 张成 \(\mathbb{R}^d\)。
知识回顾
存在性由紧性或无穷远处的增长控制;一阶必要条件定位内部光滑候选点;二阶展开以二次型判断局部性质,退化时须保留高阶信息。凸性是定义域上全部线段的比较关系,能将驻点提升为全局最小值点。严格凸支持至多一个最小值点,强凸进一步提供统一的二次误差界。参数尺度与参数冗余分别影响曲率数值和最优参数的可辨识性。
选题解答
题1. 梯度方程为 \(4x+2y-6=0,2x+4y=0\),解得 \((2,-1)\)。Hessian为 \(\begin{pmatrix}4&2\\2&4\end{pmatrix}\),首元为正且行列式为 \(12>0\),处处正定。因此函数严格凸,该驻点是唯一全局最小值点,最小值为 \(-6\)。也可直接以 \((2,-1)\) 为中心完成平方核对。
题2. 第一矩阵的首元 \(2>0\)、行列式 \(5>0\),故正定。第二矩阵行列式为 \(-8<0\),故不定;具体取 \((1,1)\) 得二次型 \(8\),取 \((1,-1)\) 得 \(-4\)。
题3. 驻点为 \((\pi/2+k\pi,0)\),\(k\in\mathbb{Z}\)。Hessian为 \(\mathop{\mathrm{diag}}(-\sin x,2)\)。\(k\) 偶数时不定,故为鞍点;\(k\) 奇数时正定,为严格局部极小点,且函数值为 \(-1\),同时是全局最小值。全局最小值点有无穷多个,不违反每一点的严格局部极小性。
题4. 原点附近须满足 \(1+x+y>0\)。有 \[\ln(1+x+y)=x+y-\frac12x^2-xy-\frac12y^2+o(x^2+y^2).\] 由于 \((x+y)^2\le2(x^2+y^2)\),从一元对数展开也能推出相同余项量级。
题5. 第一函数在任意非零点均为正,所以原点严格全局极小。第二函数沿两坐标轴分别为正、负,原点不是极值点。第三函数非负,但整条 \(x=y\) 上均为零,故原点为非严格全局极小点。
题7. 梯度为 \(Ax-b\),正定性保证 \(A\) 可逆,唯一驻点为 \(x_*=A^{-1}b\)。将 \(x=x_*+h\) 代入并展开,利用 \(Ax_*=b\) 消去一次项,得到差值 \(h^{\mathsf T}Ah/2\),当 \(h\ne0\) 时严格为正,故结论成立。
题8. 若 \(f(x),f(y)\le c\),凸性给出 \(f((1-t)x+ty)\le(1-t)c+tc=c\),故水平下集凸。反例 \(f(x)=x^3\) 的水平下集为 \((-\infty,\sqrt[3]c]\),全部为区间;但 \(f''(x)=6x\) 在负半轴为负,函数在全实轴不凸。
题9. 支撑不等式分别给出 \(f(y)\ge f(x)+\nabla f(x)^{\mathsf T}(y-x)\) 与 \(f(x)\ge f(y)+\nabla f(y)^{\mathsf T}(x-y)\)。相加整理即为所求。
题10. 强凸支撑不等式以零点为基点,给出 \[f(x)\ge f(0)+\nabla f(0)^{\mathsf T}x+\frac m2\left\lVert x\right\rVert^2 \ge f(0)-\left\lVert \nabla f(0)\right\rVert\left\lVert x\right\rVert+\frac m2\left\lVert x\right\rVert^2.\] 右端随 \(\left\lVert x\right\rVert\to\infty\) 趋于正无穷,故函数强制,连续性保证最小值存在。强凸蕴含严格凸,因此最小值点唯一。
题11. 梯度为 \(((ab-1)b,(ab-1)a)^{\mathsf T}\)。驻点由双曲线 \(ab=1\) 上全部点及原点组成。原点Hessian为 \(\begin{pmatrix}0&-1\\-1&0\end{pmatrix}\),不定,故原点是鞍点,也表明函数不凸。双曲线上 \(L=0\),由平方非负性知这些点均为全局最小值点。
