15  约束、正则化与模型诊断

能够区分可行域约束与目标中的惩罚项;由一阶变化推导凸约束最优性条件;手算区间投影、二维配比约束和投影梯度的一步更新;说明平方正则项怎样改变唯一性与敏感性;结合残差、优化残差和未参与拟合的有限检查点判断模型。先修内容为第11章的极值与凸性、第13章的有限数据拟合,以及第14章的梯度核验。

15.1 可行域改变最优性条件

无约束优化允许参数沿任意足够小的方向变化。许多模型的参数却有明确限制:配比系数不能为负,两个权重之和固定为\(1\),函数斜率需要保持非负,或者参数必须落在预先指定的区间内。这些要求应写为集合\(C\subset\mathbb{R}^p\),优化问题变为 \[\begin{equation} \label{eq:15-constrained} \min_{\theta\in C}J(\theta). \end{equation}\] 集合\(C\)称为可行域,其中的点称为可行点。目标值很低但不在\(C\)中的参数,并不是这一问题的解。

定义 15.1 (凸可行域). 若任意\(x,y\in C\)及\(t\in[0,1]\)均满足\((1-t)x+ty\in C\),则称\(C\)为凸集。区间、闭球、半空间及它们的交集都是凸集。等式约束也可以形成凸集,例如\(\{(a,b):a+b=1\}\)。

非空紧集上的连续目标必有最小点,这是第9章中紧性结论的直接应用。可行域闭而无界时,仅有连续性则不足以保证最小点存在,例如\(J(t)=e^{-t}\)在\([0,\infty)\)上趋近于零却永不取零。可行域非闭时,即使有界也可能丢失最小点,例如\(J(t)=t\)在\((0,1)\)上没有最小值。

例 15.2 (边界最优点的梯度可以非零). 考虑\(J(t)=\frac12(t+1)^2\)及约束\(t\ge0\)。无约束最小点为\(-1\),但它不可行。对\(t\ge0\),有\(J'(t)=t+1>0\),故约束最小点为\(t_*=0\),且\(J'(0)=1\)。在该点,负梯度指向不可行的左侧;所有可行的小位移都向右,目标随之增大。因此不能继续把\(J'(t_*)=0\)作为边界最优点的必要条件。

定理 15.3 (凸可行域上的一阶条件). 设\(C\)为非空凸集,\(J\)在包含\(C\)的开集上可微。若\(x_*\)是\(C\)上的局部最小点,则 \[\begin{equation} \label{eq:15-vi} \left\langle \nabla J(x_*),y-x_*\right\rangle\ge0,\qquad y\in C. \end{equation}\] 若进一步\(J\)在\(C\)上为凸函数,则该条件也是\(x_*\)为全局最小点的充分条件。

证明. Proof. 固定\(y\in C\),凸性保证\(x_*+t(y-x_*)\in C\),\(0\le t\le1\)。局部最优性使\(t=0\)成为这一线段上一元函数的单侧局部最小点,故右导数非负,即得到[eq:15-vi]。反之,若\(J\)凸,第11章的切平面不等式给出 \(J(y)\ge J(x_*)+\left\langle \nabla J(x_*),y-x_*\right\rangle\ge J(x_*)\),于是全局最优。 ◻

这一条件把”所有方向导数为零”改成”所有指向可行点的方向上一阶变化非负”。当\(x_*\)是\(C\)的内点时,正反两个方向都可取,条件退化为\(\nabla J(x_*)=0\)。当可行域位于低维平面上时,则只约束沿该平面的分量。

例 15.4 (两个权重的配比约束). 设参数满足\(a\ge0,b\ge0,a+b=1\),目标为 \[Q(a,b)=\frac12[(a-1.4)^2+(b-0.6)^2].\] 代入\(b=1-a\),得到\(Q(a,1-a)=\frac12[(a-1.4)^2+(0.4-a)^2]\)。其导数为\(2a-1.8\),故最小点为\((0.9,0.1)\),位于线段内部。此点原空间梯度为\((-0.5,-0.5)\),并不为零;可行方向具有形式\((s,-s)\),与该梯度的内积恒为零。梯度的法向分量不改变沿配比线段的目标一阶变化。

15.2 投影与投影梯度法

当普通梯度更新越出可行域时,可以把更新结果映回距离最近的可行点。这个操作必须根据可行域的几何定义,而不能任意修改某些坐标后就称为投影。

定义 15.5 (欧氏投影). 对非空集合\(C\)及\(z\in\mathbb{R}^p\),若存在唯一点\(x\in C\)使\(\left\lVert z-x\right\rVert\)最小,记\(x=P_C(z)\),称为\(z\)在\(C\)上的欧氏投影。

定理 15.6 (闭凸集投影的存在、唯一性与判别). 设\(C\subset\mathbb{R}^p\)非空、闭且凸。则每个\(z\in\mathbb{R}^p\)都有唯一投影,而且 \[\begin{equation} \label{eq:15-proj-character} x=P_C(z)\quad\Longleftrightarrow\quad x\in C,\quad \left\langle z-x,y-x\right\rangle\le0\ \text{对所有 }y\in C. \end{equation}\] 此外,\(\left\lVert P_C(z)-P_C(w)\right\rVert\le\left\lVert z-w\right\rVert\)。

证明. Proof. 固定\(c_0\in C\),选择半径\(R>\left\lVert z-c_0\right\rVert\)。落在以\(z\)为中心的闭球外的点比\(c_0\)更远,因此最小化距离可限制在非空紧集\(C\cap\overline B(z,R)\)上,连续性保证最小值存在。距离平方是严格凸函数,若有两个不同最小点,则其中点距离平方严格更小,矛盾,故唯一。

若\(x\)最小,沿\(x+t(y-x)\)对距离平方求右导数,得到\(\left\langle x-z,y-x\right\rangle\ge0\)。反之,利用 \[\left\lVert z-y\right\rVert^2=\left\lVert z-x\right\rVert^2+\left\lVert y-x\right\rVert^2-2\left\langle z-x,y-x\right\rangle\] 可知任意\(y\in C\)均不比\(x\)更近。

令\(x=P_C(z),y=P_C(w)\)。分别使用判别式并相加,得到 \(\left\lVert x-y\right\rVert^2\le\left\langle z-w,x-y\right\rangle\le\left\lVert z-w\right\rVert\left\lVert x-y\right\rVert\)。 若\(x=y\)结论显然,否则约去\(\left\lVert x-y\right\rVert\)即可。 ◻

对闭区间\([l,u]\),投影是截断函数\(P_{[l,u]}(z)=\min\{u,\max\{l,z\}\}\)。对盒形集合\(\prod_j[l_j,u_j]\),距离平方分解为各坐标的独立和,故逐坐标截断即可。若约束包含\(a+b=1\),两个坐标彼此关联,分别截断不一定保留等式约束。

例 15.7 (二维配比线段的显式投影). 设\(C=\{(a,b):a,b\ge0,a+b=1\}\),给定\(z=(z_1,z_2)\)。代入\(b=1-a\),最小化 \(\frac12[(a-z_1)^2+(1-a-z_2)^2]\),无约束驻点为\((z_1-z_2+1)/2\)。所以 \[a=\min\left\{1,\max\left\{0,\frac{z_1-z_2+1}{2}\right\}\right\}, \qquad b=1-a.\] 对\(z=(1.4,0.6)\)得\((0.9,0.1)\);对\(z=(2,-1)\)得端点\((1,0)\)。两种情况分别体现投影落在线段内部与端点上。

投影梯度法定义为 \[\begin{equation} \label{eq:15-pgd} x_{k+1}=P_C(x_k-\eta\nabla J(x_k)),\qquad x_0\in C. \end{equation}\] 每步输出都可行,但投影后的位移通常不等于负梯度乘以步长。为了衡量约束下的一阶残差,定义 \[G_\eta(x)=\frac{x-P_C(x-\eta\nabla J(x))}{\eta}.\] 称其为投影梯度映射。该向量为零表示一次更新不再移动;在凸目标下,它恰好刻画最优点。

命题 15.8 (不动点条件与下降估计). 在闭凸可行域上,对任意\(\eta>0\),\(G_\eta(x)=0\)等价于[eq:15-vi]。若\(\nabla J\)为\(L\)-Lipschitz连续,\(x^+=P_C(x-\eta\nabla J(x))\),则 \[\begin{equation} \label{eq:15-pgd-descent} J(x^+)\le J(x)-\left(\frac1\eta-\frac L2\right)\left\lVert x^+-x\right\rVert^2. \end{equation}\]

证明. Proof. 将\(z=x-\eta\nabla J(x)\)代入投影判别式,\(P_C(z)=x\)等价于\(\left\langle -\eta\nabla J(x),y-x\right\rangle\le0\),即得第一结论。对一般\(x^+\),在投影判别式中取可行点\(y=x\),得 \[\left\langle \nabla J(x),x^+-x\right\rangle\le-\frac1\eta\left\lVert x^+-x\right\rVert^2.\] 再将此式代入光滑函数的下降引理 \(J(x^+)\le J(x)+\left\langle \nabla J(x),x^+-x\right\rangle+\frac L2\left\lVert x^+-x\right\rVert^2\) 即可。 ◻

若\(0<\eta<2/L\)且\(J\)在\(C\)上有下界,逐步求和可得\(\left\lVert G_\eta(x_k)\right\rVert\to0\)。如参数序列有收敛子列,则连续性保证其极限满足一阶条件。只有在进一步具有凸性时,才由此推出该极限是全局最小点。

例 15.9 (原梯度不小而约束残差为零). 对\(J(t)=\frac12(t+1)^2\)、\(C=[0,\infty)\),在\(t=0\)处任意\(\eta>0\)均有\(P_C(-\eta)=0\),故\(G_\eta(0)=0\),而\(J'(0)=1\)。若把无约束梯度范数作为唯一停止标准,算法会被误判为尚未收敛。取\(\eta=1/2,t_0=2\),得到\(t_1=1/2,t_2=0\),此后保持不变。

15.3 平方正则项、唯一性与敏感性

约束直接排除某些参数;正则化则在目标中加入对参数结构的偏好。给定拟合损失\(J\)与惩罚函数\(R\ge0\),构造 \[\begin{equation} \label{eq:15-reg} J_\lambda(\theta)=J(\theta)+\lambda R(\theta),\qquad\lambda\ge0. \end{equation}\] 这一定义并不说明任何非零\(\lambda\)都更好。它明确了拟合误差与惩罚量的相对权重,并改变了所求解的数学问题。

定理 15.10 (平方正则化的唯一解与扰动界). 设\(J(\theta)=\left\lVert A\theta-y\right\rVert^2/(2m)\),对全部参数取\(R(\theta)=\left\lVert \theta\right\rVert^2/2\)且\(\lambda>0\)。则正则目标有唯一最小点,满足 \[\begin{equation} \label{eq:15-ridge} (A^{\mathsf T}A/m+\lambda I)\theta_\lambda=A^{\mathsf T}y/m. \end{equation}\] 若\(y\)变为\(y+\Delta y\),对应参数变化满足 \[\left\lVert \Delta\theta_\lambda\right\rVert\le \frac{\left\lVert A\right\rVert}{m\lambda}\left\lVert \Delta y\right\rVert,\] 其中\(\left\lVert A\right\rVert\)是欧氏诱导矩阵范数。

证明. Proof. Hessian为\(H_\lambda=A^{\mathsf T}A/m+\lambda I\)。对非零\(v\),有 \(v^{\mathsf T}H_\lambda v=\left\lVert Av\right\rVert^2/m+\lambda\left\lVert v\right\rVert^2>0\),故正定并可逆;驻点存在且唯一,并为全局最小点。扰动前后的方程相减得\(H_\lambda\Delta\theta=A^{\mathsf T}\Delta y/m\)。\(H_\lambda\)的最小特征值至少为\(\lambda\),故\(\left\lVert H_\lambda^{-1}\right\rVert\le1/\lambda\)。再使用矩阵范数的乘积不等式和\(\left\lVert A^{\mathsf T}\right\rVert=\left\lVert A\right\rVert\)即得结论。 ◻

该上界给出一个保守但明确的敏感性保证。若原数据已经充分约束参数,利用\(A^{\mathsf T}A/m\)的最小特征值还能得到更好的界。若只惩罚部分参数,则\(\lambda I\)应换成相应的半正定矩阵,不能不加检查就沿用全部参数情形的唯一性结论。

例 15.11 (重复参数的对称选择). 设一个输出为\(a+b\),目标值为\(2\),考虑 \[J_\lambda(a,b)=\frac12(a+b-2)^2+\frac\lambda2(a^2+b^2).\] 当\(\lambda=0\)时,所有\(a+b=2\)都是最小点。当\(\lambda>0\)时,两条驻点方程相减得\(\lambda(a-b)=0\),于是 \[a_\lambda=b_\lambda=\frac2{2+\lambda},\qquad a_\lambda+b_\lambda=\frac4{2+\lambda}.\] 正则项既消除了参数表示的任意性,也使拟合输出小于目标值\(2\)。当\(\lambda\downarrow0\)时,参数趋于\((1,1)\),这是未正则化最小点中范数最小的一点;有限正\(\lambda\)的最小点则已不在原最小点直线上。

命题 15.12 (正则强度的单调权衡). 设\(0\le\lambda_1<\lambda_2\),\(\theta_1,\theta_2\)分别是\(J+\lambda_1R\)与\(J+\lambda_2R\)的全局最小点。则 \[R(\theta_2)\le R(\theta_1),\qquad J(\theta_2)\ge J(\theta_1).\] 此结论不要求\(J,R\)可微,也不要求最小点唯一。

证明. Proof. 由两次最优性, \[J(\theta_1)+\lambda_1R(\theta_1)\le J(\theta_2)+\lambda_1R(\theta_2),\] \[J(\theta_2)+\lambda_2R(\theta_2)\le J(\theta_1)+\lambda_2R(\theta_1).\] 相加并整理得\((\lambda_2-\lambda_1)[R(\theta_2)-R(\theta_1)]\le0\)。再代回第一式,利用\(\lambda_1\ge0\),得到\(J(\theta_1)\le J(\theta_2)\)。 ◻

所以在各问题都得到全局最小点的前提下,增大正则强度会降低惩罚量,却不会降低原拟合损失。实际有限迭代若尚未求到最小点,观测数值未必满足这一单调关系;此时应先检查优化误差,再讨论模型效应。

对输入重新缩放后,同一函数的斜率参数也会改变。直接惩罚新斜率平方通常不等于惩罚原斜率平方。若截距不受惩罚,应明确写出\(R(a,b)=a^2/2\);若截距同样受惩罚,则是\(R(a,b)=(a^2+b^2)/2\)。两种目标具有不同偏好,不能在文字与程序间默默切换。

15.4 绝对值惩罚与提前停止的比较

平方惩罚连续地缩小参数,但通常不会把非零参数精确变为零。绝对值惩罚在零点具有折角,可以产生精确的零解。为了理解这一现象,只需研究一个能够完整求解的一元目标。

定理 15.13 (一元绝对值惩罚的阈值解). 给定\(s\in\mathbb{R}\)、\(\lambda\ge0\),函数 \(Q(t)=\frac12(t-s)^2+\lambda|t|\) 有唯一最小点 \[\begin{equation} \label{eq:15-soft} t_*= \begin{cases} s-\lambda,&s>\lambda,\\ 0,&|s|\le\lambda,\\ s+\lambda,&s<-\lambda. \end{cases} \end{equation}\]

证明. Proof. 在\(t>0\)上有\(Q'(t)=t-s+\lambda\),正半轴内驻点存在当且仅当\(s>\lambda\)。在\(t<0\)上有\(Q'(t)=t-s-\lambda\),负半轴内驻点存在当且仅当\(s<-\lambda\)。当\(|s|\le\lambda\)时,零点左导数为\(-s-\lambda\le0\),右导数为\(-s+\lambda\ge0\),且各半轴导数随\(t\)严格增加,故最小点为零。二次项严格凸,绝对值项凸,因此目标严格凸,最小点唯一。 ◻

例 15.14 (平方惩罚与绝对值惩罚的区别). 取\(s=0.3,\lambda=0.5\)。平方惩罚目标\(\frac12(t-s)^2+\frac\lambda2t^2\)的最小点为\(s/(1+\lambda)=0.2\);绝对值惩罚的最小点为\(0\)。若\(s=2\),两者分别给出\(4/3\)与\(1.5\)。参数的缩小方式不同,并不是把两种惩罚强度设成同一个数就具有同样作用。

多元绝对值惩罚\(\sum_j|\theta_j|\)同样不可在零坐标处使用普通导数。但不能由一元阈值公式直接宣称任意多元目标都逐坐标阈值即可求解;只有二次拟合部分在这些坐标上分离时,整体问题才分解成独立的一元问题。

提前停止则保持原目标,减少迭代次数。它可能保留某些初始偏好,但与显式加入某个固定正则项并不总是等价。

例 15.15 (一元二次目标中提前停止的精确等价). 对\(J(t)=\frac12(t-s)^2\),从\(t_0=0\)出发,用固定\(0<\eta<1\)迭代。令\(q=1-\eta\),则\(t_k=(1-q^k)s\)。平方正则目标的最小点为\(s/(1+\lambda)\)。因此对\(k\ge1\),取 \[\lambda_k=\frac{q^k}{1-q^k}\] 可使两者相等。随着迭代次数增加,\(\lambda_k\downarrow0\)。这种等价依赖同一个一元曲率和零初值,不能省略这些条件。

对二维目标\(J(u,v)=\frac12(u-s_1)^2+\frac c2(v-s_2)^2\),两方向的迭代因子分别为\(1-\eta\)和\(1-c\eta\),一般对应不同的收缩量。单个固定\(\lambda\)的平方惩罚则产生另两种特定倍率。因此某一步迭代偶然与某个正则解相同,不足以推出两套方法在所有数据上等价。

15.5 从残差结构到模型诊断

求解器是否完成当前优化问题,与当前模型是否适合数据,是两个不同问题。前者主要检查目标变化、梯度或投影梯度映射;后者需要返回每个数据点的残差,查看其随输入的分布,并在没有参与参数求解的有限检查点上考察输出。这里的检查仍是确定性比较,不要求概率统计知识。

例 15.16 (零训练误差无法确定点间行为). 给定三个点\((-1,1),(0,0),(1,1)\)。所有函数 \[q_M(x)=x^2+M x(x^2-1),\qquad M\in\mathbb{R},\] 都在这三个点上完全插值,因为新增项在\(-1,0,1\)处均为零。在\(x=1/2\)处却有\(q_M(1/2)=1/4-3M/8\)。当\(M=4\)时输出为\(-5/4\),当\(M=0\)时为\(1/4\)。因此同一组零残差数据能够对应差异很大的点间行为。

这一例子没有证明所有高次模型都不好。它证明有限插值条件本身不足以限制未观测位置上的函数值。要形成更强结论,可以增加数据、限制允许的模型族、控制导数或引入有明确含义的惩罚。采取哪种方式,应由问题中的结构信息决定。

两条曲线在给定数据上完全一致,在点间明显不同。

若使用直线拟合这三个点,最优模型为\(\widehat f(x)=2/3\),残差为\(-1/3,2/3,-1/3\)。残差随输入呈现结构性弯曲,提示直线族未能表达数据中的曲率。改用\(x^2\)后这三个残差为零。在额外的检查点\((-1/2,1/4),(1/2,1/4)\)上,直线残差均为\(5/12\),\(q_0\)残差为零,\(q_4\)残差分别为\(3/2,-3/2\)。这些数值支持在这五个指定输入上选择\(q_0\),却没有证明未知全部输入上的误差均为零。

诊断对象 代表量 可以支持的判断
优化过程 目标变化、\(\left\lVert G_\eta\right\rVert\)、可行性误差 当前参数是否接近当前问题的一阶条件
拟合结构 逐点残差、分段残差图、最大绝对残差 哪些输入位置出现系统偏差或个别大误差
有限检查 未参与求解的检查点误差 当前模型在这些指定点的迁移表现
敏感性 数据扰动后的参数和输出差 当前数据、模型与参数设置下的稳定程度

平均平方误差可能掩盖个别较大残差。例如残差\((0,0,0,2)\)与\((1,1,1,1)\)的平方和都为\(4\),前者最大绝对残差为\(2\),后者为\(1\)。二者的偏差分布并不相同。反之,残差和为零也可能只是含截距最小二乘的正规方程结果,而不是模型充分适合数据的独立证据。

先写清数据、参数单位、目标、正则项及可行域,再核对梯度与投影;同时列出原拟合损失\(J\)和惩罚量\(R\),避免把不同\(\lambda\)下的总目标当成同一标尺;检查可行性和约束一阶残差后,再比较逐点残差及固定检查点。对任何修改保留修改前后的同一组数值,结论限定在所比较的数据范围和模型族内。

人工智能工具可以帮助检查代数、绘制残差或生成候选代码,但这些输出仍需回到数学定义核对。若模型输出违反已经明确的约束,应首先判断约束是否被正确编码;若梯度核验通过而结果不合理,则需检查目标与数据是否真正表达原问题。诊断的目的在于定位哪一层假设或运算失效,而不是对单一终值作抽象评价。

15.6 本章回顾与分层习题

约束改变允许的移动方向,正则项改变目标的偏好,提前停止改变实际求解程度。三者可以同时使用,但各自作用应分别描述。凸性使一阶条件成为全局判据,投影保持可行性,正定性提供唯一性和误差界;残差及固定检查点则揭示有限拟合之外仍未被解决的问题。

基础题

  1. 求\(J(t)=(t-3)^2\)在\([-1,1]\)上的最小点,检验该点的一阶可行方向条件。

  2. 求\((2,-1)\)在盒形集合\([0,1]^2\)与线段\(\{(a,b):a,b\ge0,a+b=1\}\)上的投影。再对\((0.8,0.8)\)重复计算并比较。

  3. 对\(J(t)=\frac12(t+1)^2\)、\(C=[0,\infty)\)、\(\eta=1/2\),写出投影梯度映射的分段公式。

  4. 求\(\frac12(t-4)^2+\frac\lambda2t^2\)的最小点,并计算\(\lambda=0,1,3\)时的拟合损失与惩罚量\(t^2/2\)。

  5. 求\(\frac12(t+0.7)^2+0.4|t|\)的最小点,说明该点在哪一光滑区间内。

  6. 对残差\((1,-1,1,-1)\)与\((0,0,0,2)\),分别计算残差平均、平均平方和与最大绝对残差。

推理题

  1. 用投影判别式证明:若\(x\in C\),则\(P_C(x)=x\)。说明\(C\)非凸时最近点可能不唯一,并给出例子。

  2. 设仅惩罚线性参数模型的部分参数,目标为\(\left\lVert A\theta-y\right\rVert^2/(2m)+\lambda\left\lVert B\theta\right\rVert^2/2\),\(\lambda>0\)。证明Hessian正定当且仅当\(\ker A\cap\ker B=\{0\}\)。

  3. 设\(\theta_\lambda\)全局最小化\(J+\lambda R\),其中\(R\ge0\)。证明\(R(\theta_\lambda)\)非增并不保证每个坐标的绝对值都非增。

  4. 对\(q_M(x)\),计算\(x=\pm1/2\)处残差的平方和,目标值均取\(1/4\)。求使两点检查误差最小的\(M\)。

拓展题

  1. 对\(J(u,v)=\frac12(u-1)^2+(v-1)^2\),从原点以\(\eta=1/4\)迭代一步。是否存在同一\(\lambda\ge0\),使该点是\(J+\lambda(u^2+v^2)/2\)的最小点?

  2. 假设\(J\)为凸光滑函数,\(C\)为非空紧凸集,固定步长\(0<\eta<2/L\)。利用本章下降估计证明投影梯度迭代的每个聚点都是全局最小点,并说明若最小点唯一为什么整个序列收敛。

15.7 本章选题解答

  1. 最小点为\(t_*=1\)。有\(J'(1)=-4\),任意\(y\in[-1,1]\)满足\(y-1\le0\),故\(J'(1)(y-1)\ge0\)。非零梯度与边界最优性相容。

  2. 对\((2,-1)\)两种投影均为\((1,0)\)。对\((0.8,0.8)\),盒形投影仍为\((0.8,0.8)\),配比线段投影为\((0.5,0.5)\)。前者已经满足各坐标区间,却不满足和为\(1\)。

  3. 先算\(t-\eta J'(t)=(t-1)/2\)。对可行的\(t\ge0\),有 \[G_{1/2}(t)=\begin{cases}2t,&0\le t\le1,\\t+1,&t\ge1.\end{cases}\] 两式在\(t=1\)处均为\(2\),映射连续,且仅在\(t=0\)处为零。

  4. 最小点\(t_\lambda=4/(1+\lambda)\)。\(\lambda=0,1,3\)时,参数依次为\(4,2,1\),原拟合损失依次为\(0,2,9/2\),惩罚量依次为\(8,2,1/2\)。拟合损失与惩罚量呈相反方向变化。

  5. 此时\(s=-0.7\)、\(\lambda=0.4\),故\(t_*=-0.3\)。它落在负半轴,直接代入该半轴导数\(t+0.7-0.4\)也得零。

  6. 第一组平均残差为\(0\)、平均平方为\(1\)、最大绝对残差为\(1\);第二组依次为\(1/2,1,2\)。这里平均平方没有前置\(1/2\),若按本书损失约定,两组平均平方损失均为\(1/2\)。

  1. 取\(z=x\),判别式左端恒为零,故\(P_C(x)=x\)。非凸例可取\(C=\{-1,1\}\)和\(z=0\),两个可行点距离都为\(1\),最近点不唯一。

  2. Hessian为\(H=A^{\mathsf T}A/m+\lambda B^{\mathsf T}B\),且\(v^{\mathsf T}Hv=\left\lVert Av\right\rVert^2/m+\lambda\left\lVert Bv\right\rVert^2\)。非负两项同时为零当且仅当\(v\)在两个核的交集中。因此对所有非零\(v\)该二次型严格为正,恰好等价于交集只有零向量。

  3. 单调权衡命题控制的是整体\(R\)。给出平方正则的反例:令 \[J(a,b)=\tfrac12(a,b)\begin{pmatrix}1&1\\1&2\end{pmatrix}\binom ab-(a+2b), \qquad R=(a^2+b^2)/2.\] 未正则化最小点为\((0,1)\);正则后解为\(a_\lambda=\lambda/(1+3\lambda+\lambda^2)\)、\(b_\lambda=(1+2\lambda)/(1+3\lambda+\lambda^2)\)。任意\(\lambda>0\)都使第一个坐标绝对值从零增大,虽然总平方范数非增。

  4. 两残差分别为\(3M/8\)与\(-3M/8\),平方和为\(9M^2/32\),唯一最小点为\(M=0\)。此结论针对指定两个检查点,使用检查点选择\(M\)以后,它们已经参与模型选择,不能再当成全新的独立检查。

  5. 梯度在原点为\((-1,-2)\),一步得到\((1/4,1/2)\)。正则最小点满足\(u=1/(1+\lambda)\)、\(v=2/(2+\lambda)\)。第一坐标要求\(\lambda=3\),第二坐标要求\(\lambda=2\),不能同时成立。

  6. 紧集上的连续目标有下界。下降估计求和表明\(\left\lVert x_{k+1}-x_k\right\rVert\to0\),即\(\left\lVert G_\eta(x_k)\right\rVert\to0\)。紧性保证任一子列存在收敛子列。投影非扩张和梯度连续保证\(G_\eta\)连续,因此每个聚点\(x_*\)满足\(G_\eta(x_*)=0\),由凸一阶条件即为全局最小点。若最小点唯一而原序列不收敛于它,则存在距它至少\(\varepsilon>0\)的子列;紧性使该子列还有一个聚点,既必须为唯一最小点又保持距离至少\(\varepsilon\),矛盾。