附录 C: 综合自测与解答
C.1 自测一:从极限到一元积分
本组题可在完成第1—8章后使用。先独立作答,再对照解答分析错误类型。计算题应保留关键推导;证明题应明确使用的定义或定理。
设\(A=\{1-1/n:n\ge1\}\)。求\(\inf A,\sup A\),判断它们是否属于\(A\),并用确界定义说明结论。
设\(a_0=0\)、\(a_{n+1}=(a_n+2)/3\)。求通项及极限,并求保证\(|a_n-1|\le10^{-4}\)的最小整数\(n\)。
构造一个有界且不收敛的数列,使相邻项之差趋零。说明其不收敛的理由。
判断\(f(x)=\sqrt{x}\)在\([0,1]\)上是否一致连续、是否Lipschitz连续。给出证明或反例。
设\(f(0)=0\),\(x\ne0\)时\(f(x)=x^2\sin(1/x)\)。求\(f'(0)\),并判断\(f'\)在0处是否连续。
用中值定理证明\(x>0\)时\(\log(1+x)<x\);再证明\(x/(1+x)<\log(1+x)\)。
用二阶Taylor多项式近似\(\exp(0.1)\),给出能直接计算的余项上界。无需输出超出上界支持的小数精度。
求\(\int_0^1 x\log(1+x)\mathop{}\!\mathrm{d}x\)。说明所选积分方法。
判断\(\int_1^\infty x^{-p}\mathop{}\!\mathrm{d}x\)的收敛条件,并说明\(p=1\)处为何需要单独处理。
求\(\sum_{n=1}^\infty x^n/n\)的收敛半径,分别判断两端点;在\(|x|<1\)内求和。
在\([0,1]\)上,\(f_n(x)=x/(1+nx)\)是否一致趋于零?若是,给出误差界;若否,构造反例。
设连续函数\(f_n\)在\([0,1]\)上一致收敛到\(f\),且\(\int_0^1f_n(x)\mathop{}\!\mathrm{d}x=0\)。证明\(f\)在\([0,1]\)上至少有一个零点。
C.2 自测一解答
第1—3题:数集与迭代
1. \(\inf A=0\in A\),\(\sup A=1\notin A\)。所有元素不小于0,且\(n=1\)时取0,故0为最小值。所有元素小于1;任取\(\varepsilon>0\),选\(n>1/\varepsilon\)就有\(1-1/n>1-\varepsilon\),故任何小于1的数都不是上界。
2. 令\(e_n=a_n-1\),则\(e_{n+1}=e_n/3\),\(e_0=-1\),故\(a_n=1-3^{-n}\to1\)。由\(3^8=6561<10^4<19683=3^9\),最小\(n=9\)。这里使用通项误差而非程序中相邻项差作为误差保证。
3. 可取\(a_n=\sin(\log n)\)。由中值定理和\(\log(1+1/n)\le1/n\),有\(|a_{n+1}-a_n|\le1/n\to0\)。令\(n_k\)为距\(\exp(2k\pi+\pi/2)\)最近的正整数,则\(\log n_k-(2k\pi+\pi/2)\to0\),故\(a_{n_k}\to1\);同理在\(\exp(2k\pi+3\pi/2)\)附近取整数得到趋于\(-1\)的子列。原数列不收敛。相邻差趋零并不保证所有足够靠后的两项接近。
第4—7题:连续性与局部近似
4. 对非负\(x,y\),有\(|\sqrt x-\sqrt y|\le\sqrt{|x-y|}\)。取\(\delta=\varepsilon^2\)即可得到一致连续。若存在有限Lipschitz常数\(L\),令\(y=0\),则\(\sqrt x\le Lx\),即\(1/\sqrt x\le L\),与\(x\to0^+\)矛盾。也可由闭区间连续性推出一致连续,但此处的直接估计还给出了模量。
5. 差商为\(h\sin(1/h)\to0\),故\(f'(0)=0\)。对\(x\ne0\), \(f'(x)=2x\sin(1/x)-\cos(1/x)\)。取\(x_n=1/(2n\pi)\),得\(f'(x_n)=-1\),故\(f'\)不连续。函数在一点可导不要求导函数在该点连续。
6. 在\([0,x]\)对\(g(t)=\log(1+t)\)用Lagrange中值定理,存在\(c\in(0,x)\)使\(\log(1+x)=x/(1+c)\)。因\(1<1+c<1+x\),立得\(x/(1+x)<\log(1+x)<x\)。
7. \(P_2(0.1)=1+0.1+0.1^2/2=1.105\)。余项为\(e^\xi0.1^3/6\),其中\(0<\xi<0.1\)。可用\(e^{0.1}<1/(1-0.1)=10/9\)得到 \(0<R_2<1/5400\approx1.852\times10^{-4}\)。此上界来自\(e^t=\sum t^k/k!\le\sum t^k\),\(0\le t<1\);若尚未学习级数,也可选较粗的\(e^{0.1}<3\)得到\(R_2<0.0005\)。
第8—12题:积分与无穷过程
8. 分部积分给出 \[\begin{align*} \int_0^1x\log(1+x)\mathop{}\!\mathrm{d}x &=\tfrac12\log2-\tfrac12\int_0^1\frac{x^2}{1+x}\mathop{}\!\mathrm{d}x\\ &=\tfrac12\log2-\tfrac12\int_0^1\left(x-1+\frac1{1+x}\right)\mathop{}\!\mathrm{d}x =\frac14. \end{align*}\]
9. \(p\ne1\)时,截断积分为\((R^{1-p}-1)/(1-p)\),故当且仅当\(p>1\)收敛,值为\(1/(p-1)\)。\(p=1\)时原函数为\(\log x\),截断值\(\log R\to\infty\),不能把\(p=1\)直接代入分母为零的公式。
10. 比值判别给出收敛半径1。\(x=1\)时为调和级数,发散;\(x=-1\)时为交错调和级数,收敛。在任意\([-r,r]\)、\(r<1\)上可逐项求导,得\(S'(x)=\sum_{n=1}^\infty x^{n-1}=1/(1-x)\),由\(S(0)=0\)得\(S(x)=-\log(1-x)\)。端点的函数值若需由内部极限得到,须另用相应定理;端点收敛性已独立判断。
11. \(f_n\ge0\)且对\(x\)单调增加,故\(\sup_{[0,1]}|f_n|=1/(n+1)\to0\),从而一致收敛。该界同时控制全部\(x\)。
12. 一致极限\(f\)连续,且 \(|\int_0^1f-\int_0^1f_n|\le\sup|f-f_n|\to0\),故\(\int_0^1f=0\)。若\(f\)无零点,由介值性它在整个区间同号;由紧致性,若\(f>0\),则有正最小值\(m\),从而积分不小于\(m>0\),矛盾。\(f<0\)类似。因此\(f\)有零点。
C.3 自测二:从多元分析到模型诊断
定义\(f(0,0)=0\),其余点\(f(x,y)=x^2y/(x^4+y^2)\)。判断原点连续性,并解释仅沿坐标轴检查的不足。
设\(f(x,y)=\exp(xy)+x^2\)。求\(\nabla f(1,0)\),写出该点的线性近似,并求沿单位向量\((3/5,4/5)\)的方向导数。
设\(x(t)=t^2\)、\(y(t)=\sin t\)、\(z(t)=x(t)\exp(y(t))\)。用链式法则求\(z'(0),z''(0)\),再用局部展开核对。
求\(f(x,y)=x^4+y^4-2x^2\)的全部驻点并分类;说明原点Hessian是否足以直接判定。
证明\(f(x,y)=x^2+2xy+3y^2\)严格凸,求其唯一极小点,并给出一个定量下界\(f(x,y)\ge c(x^2+y^2)\)。
计算三角形\(D=\{x\ge0,y\ge0,x+y\le1\}\)上的\(\iint_D(x+2y)\mathop{}\!\mathrm{d}x\mathop{}\!\mathrm{d}y\),并交换积分次序核对。
对\(a>0\),设\(I(a)=\int_0^1\log(1+ax)\mathop{}\!\mathrm{d}x\)。说明积分下求导的条件,计算\(I'(a)\)。
对目标\(F(w)=\tfrac12\{(w-1)^2+(2w-1)^2\}\),求最优参数及梯度迭代误差的递推式;确定固定步长的收敛区间。
计算图为\(u=ab\)、\(v=u+a\)、\(F=\tfrac12v^2\)。求\(a=b=1\)处\(\partial F/\partial a\)和\(\partial F/\partial b\),说明共享路径如何处理。
对\(G(w)=\tfrac12(w-2)^2+\lambda|w|\),\(\lambda\ge0\),求最小点关于\(\lambda\)的表达式,并检查不可导点。
在约束\(x+y=1\)、\(x,y\ge0\)下最小化\(x^2+4y^2\)。用消元求解,并验证端点。
两个参数预测器给出\(\widehat y_i=a+b\),观测值为\(1,2,3\)。证明无正则化时参数不唯一;增加\(\tfrac\lambda2(a^2+b^2)\)、\(\lambda>0\)后求唯一最优参数。平方误差规定为\(\tfrac12\sum_{i=1}^3(\widehat y_i-y_i)^2\)。
C.4 自测二解答
第1—4题:多元局部结构
1. 沿\(y=0\)或\(x=0\)函数恒为0;沿\(y=x^2\)且\(x\ne0\),有\(f(x,x^2)=1/2\),故原点极限不存在,函数不连续。沿有限条直线或曲线所得极限相同,通常只能作为必要条件的检查;一个反例路径足以否定极限。
2. \(\nabla f=(ye^{xy}+2x,xe^{xy})^{\mathsf T}\),故在\((1,0)\)处为\((2,1)^{\mathsf T}\),函数值为2。线性近似为 \(f(1+h,k)=2+2h+k+o(\sqrt{h^2+k^2})\)。指定方向导数为\(2(3/5)+4/5=2\)。
3. \(z'=e^y(x'+xy')\),进一步 \(z''=e^y[x''+2x'y'+x(y')^2+xy'']\)。 在0处\(x=0,x'=0,x''=2,y=0,y'=1,y''=0\),故\(z'(0)=0,z''(0)=2\)。直接展开\(t^2e^{\sin t}=t^2+t^3+O(t^4)\)得到相同结论。
4. 驻点满足\(4x(x^2-1)=0\)、\(4y^3=0\),故为\((0,0),(1,0),(-1,0)\)。在\((\pm1,0)\), \(f+1=(x^2-1)^2+y^4\ge0\)且等号仅在这两个点取到,因此二者均为严格局部极小点,也是全局最小点。原点沿\(y=0\)且\(0<|x|<1\)时\(f<0\),沿\(x=0\)且\(y\ne0\)时\(f>0\),故为鞍点。原点Hessian为\(\mathop{\mathrm{diag}}(-4,0)\),是退化负半定矩阵,单用二阶充分判据不能完成分类;方向上的高阶项解决了问题。
第5—8题:整体估计与迭代
5. Hessian为\(H=\bigl(\begin{smallmatrix}2&2\\2&6\end{smallmatrix}\bigr)\),首顺序主子式为2与8,正定,故严格凸。梯度为零仅给出\(x=y=0\)。可用\(2|xy|\le\tfrac12x^2+2y^2\)得到 \(f\ge\tfrac12x^2+y^2\ge\tfrac12(x^2+y^2)\),故可取\(c=1/2\)。最优的\(c\)可由二次型矩阵最小特征值\(2-\sqrt2\)得到,但证明严格极小并不需要最优常数。
6. 先对\(y\)积分: \[\int_0^1\int_0^{1-x}(x+2y)\mathop{}\!\mathrm{d}y\mathop{}\!\mathrm{d}x =\int_0^1(1-x)\mathop{}\!\mathrm{d}x=\frac12.\] 交换次序后为\(\int_0^1\int_0^{1-y}(x+2y)\mathop{}\!\mathrm{d}x\mathop{}\!\mathrm{d}y\),内层结果是\(\tfrac12(1-y)^2+2y(1-y)\),积分仍为\(1/2\)。
7. 固定\(a_0>0\),选含\(a_0\)的紧区间\([a_0/2,3a_0/2]\)。被积函数与参数偏导\(x/(1+ax)\)在该参数区间与\([0,1]\)的乘积上连续,满足有限区间含参求导的充分条件。因此 \[I'(a)=\int_0^1\frac{x}{1+ax}\mathop{}\!\mathrm{d}x =\frac1a-\frac{\log(1+a)}{a^2}.\] 局部参数区间足以保证每个\(a>0\)处的导数,无需假设整个无界参数域紧致。
8. \(F'(w)=5w-3\),最优参数\(w_*=3/5\)。梯度法\(w_{k+1}=w_k-\alpha(5w_k-3)\)给出\(e_{k+1}=(1-5\alpha)e_k\)。对任意初值都收敛到最优点的固定正步长范围为\(0<\alpha<2/5\)。\(\alpha=2/5\)时误差变号而绝对值不变,除非初值已最优;\(\alpha=1/5\)时一步到达最优点。
第9—12题:复合求导与约束
9. 在\(a=b=1\)处有\(u=1,v=2\)。反向传递\(\overline v=v=2\)、\(\overline u=\overline v=2\)。变量\(a\)分别经\(u=ab\)和\(v=u+a\)影响目标,故 \(\partial_aF=2b+2=4\);变量\(b\)只经\(u\)影响目标,故\(\partial_bF=2a=2\)。漏掉\(a\)的直接路径将得到错误结果2。
10. 当\(w>0\)时\(G'=w-2+\lambda\),候选点\(w=2-\lambda\)仅在\(\lambda<2\)时落在该区间;当\(w<0\)时\(G'=w-2-\lambda<0\),无负侧最小点。\(w=0\)处左导数为\(-2-\lambda\),右导数为\(-2+\lambda\),当且仅当\(\lambda\ge2\)时左右导数跨越零。故唯一最小点为\(w_*=\max(2-\lambda,0)\)。平方项严格凸保证唯一性。
11. 消元\(y=1-x\),\(0\le x\le1\),目标为\(5x^2-8x+4\),导数\(10x-8=0\)给出\(x=4/5,y=1/5\),值\(4/5\)。端点目标分别为4和1,均大于\(4/5\);二阶导数10也说明区间内严格凸。
12. 令\(s=a+b\),无惩罚目标为\(\tfrac12[(s-1)^2+(s-2)^2+(s-3)^2]\),对\(s\)求导得\(3s-6=0\),故任意\(a+b=2\)均最优。加入惩罚后,驻点方程为 \[3(a+b)-6+\lambda a=0,\qquad 3(a+b)-6+\lambda b=0.\] 相减得\(a=b\),从而\(a=b=6/(6+\lambda)\)。Hessian为\(\bigl(\begin{smallmatrix}3+\lambda&3\\3&3+\lambda\end{smallmatrix}\bigr)\),特征值为\(\lambda\)与\(6+\lambda\),均为正,故解唯一。正则化不仅选定一个参数分解,还使预测和从2收缩为\(12/(6+\lambda)\)。
C.5 错题归因与补学定位
| 错误表现 | 优先检查 | 返回阅读 |
|---|---|---|
| 会代数运算但不会写证明 | 量词顺序、定义中的对象范围 | 第1—3章;附录B |
| 求导结果维数不对 | 自变量数量、链式法则和转置 | 第10、14章 |
| 找到驻点即停止 | 内点与边界、二阶退化和全局比较 | 第11、15章 |
| 数值稳定便宣称收敛 | 参数序列、目标值序列、停止判据的区别 | 第2、13章 |
| 把近似值当成精确值 | 余项、截断误差、有限精度 | 第5—8章 |
| 拟合良好却参数不稳定 | 数据是否约束各方向、尺度与惩罚 | 第13、15章 |
补学时应选取一题重新独立完成,并另构造一个与原错因相关的反例。订正记录要说明推理哪里发生改变,而不只是把答案替换为正确数值。