附录 A: 符号、矩阵与计算约定
A.1 集合、极限与微积分符号
同一符号在不同语境下可能承担不同角色。阅读公式时应首先确定变量、参数、指标和常量。下表给出全书的主要约定;局部章节有特别约定时,以该处定义为准。
| 符号 | 含义 | 使用要点 |
|---|---|---|
| \(\mathbb{N},\mathbb{Z},\mathbb{Q},\mathbb{R}\) | 自然数、整数、有理数、实数集合 | 若需从1开始,正文明确写\(n\ge1\) |
| \(D\subset\mathbb{R}^d\) | 函数定义域 | 边界点、内点与聚点的作用不同 |
| \(\sup A,\inf A\) | 上确界、下确界 | 非空且有上界保证有限上确界;下确界对应下有界条件 |
| \(x_n\to x\) | 数列趋于\(x\) | \(N\)可依赖误差要求\(\varepsilon\) |
| \(f(x)\to A\) | 自变量趋近某点时的函数极限 | 点值与去心邻域中的极限分别讨论 |
| \(o(g),O(g)\) | 高阶小量、有界比值量级 | 应注明趋近过程及比较量非零范围 |
| \(f'(x),\mathop{}\!\mathrm{d}f\) | 导数、一阶微分 | 微分是关于增量的线性表达式 |
| \(\partial_i f,\nabla f\) | 偏导数、梯度 | 梯度通常按列向量书写 |
| \(D f,J_f\) | 导数线性映射、Jacobian矩阵 | 矩阵尺寸由输入输出维数决定 |
| \(H_f,\nabla^2f\) | Hessian矩阵 | 对称性需要相应的正则性条件 |
| \(\int_a^b f(x)\mathop{}\!\mathrm{d}x\) | 定积分 | 区分积分变量与上下限中的参数 |
| \(\sum_{n=1}^\infty a_n\) | 数项级数 | 收敛指部分和数列存在有限极限 |
| \(f_n\rightrightarrows f\) | 一致收敛 | 一次选择的\(N\)适用于整个定义域 |
| \(\mathop{\mathrm{arg\,min}}_{x\in D} f(x)\) | 最小点的集合 | 与最小值\(\min f\)不同,可能为空集 |
A.2 向量、矩阵与维数核查
对\(x=(x_1,\ldots,x_d)^{\mathsf T}\)、\(y\in\mathbb{R}^d\),规定 \[\left\langle x,y\right\rangle=x^{\mathsf T}y=\sum_{j=1}^d x_jy_j, \qquad \left\lVert x\right\rVert_2=\sqrt{\sum_{j=1}^d x_j^2}.\] 转置将列向量变为行向量。矩阵\(A\in\mathbb{R}^{m\times d}\)表示从\(\mathbb{R}^d\)到\(\mathbb{R}^m\)的线性映射,乘积\(Ax\)的第\(i\)个分量为\(\sum_j A_{ij}x_j\)。矩阵乘法一般不可交换。对标量函数\(f:\mathbb{R}^d\to\mathbb{R}\),采用列梯度后,线性近似写成 \[f(x+h)=f(x)+\nabla f(x)^{\mathsf T}h+o(\left\lVert h\right\rVert).\] 若\(g:\mathbb{R}^d\to\mathbb{R}^m\),另设\(f:\mathbb{R}^m\to\mathbb{R}\),则\(J_g(x)\)为\(m\times d\)矩阵。复合函数\(f\circ g\)的梯度为\(J_g(x)^{\mathsf T}\nabla f(g(x))\),结果必须为\(d\)维列向量。维数检查能发现转置与乘法顺序错误,但维数相符并不足以证明公式正确。
例 16.1 (从维数回到分量). 设\(g(x_1,x_2)=(x_1+x_2,x_1x_2,x_2^2)\),\(f(u)=u_1+u_2^2+3u_3\)。有 \[J_g=\begin{pmatrix}1&1\\x_2&x_1\\0&2x_2\end{pmatrix},\qquad \nabla f=\begin{pmatrix}1\\2u_2\\3\end{pmatrix}.\] 因而 \[\nabla(f\circ g)= \begin{pmatrix}1+2x_1x_2^2\\1+2x_1^2x_2+6x_2\end{pmatrix}.\] 将\(f\circ g=x_1+x_2+x_1^2x_2^2+3x_2^2\)展开后直接求偏导,得到相同结果。两种路线使用同一链式法则,展开核查在小模型中尤其方便。
实对称矩阵\(H\)称为正定,若对所有非零\(v\)都有\(v^{\mathsf T}Hv>0\);将\(>\)改为\(\ge\)得到半正定。二维对称矩阵 \(H=\bigl(\begin{smallmatrix}a&b\\b&c\end{smallmatrix}\bigr)\)正定当且仅当\(a>0\)且\(ac-b^2>0\)。只有行列式为正不能判断正定,例如\(-I\)的二维行列式为1,但所有非零方向曲率均为负。
A.3 误差、有效数字与结果记录
对近似值\(\widehat q\)和真值\(q\),绝对误差为\(|\widehat q-q|\);当\(q\ne0\)时,相对误差为\(|\widehat q-q|/|q|\)。真值接近零时,相对误差可能很大,应结合问题尺度解释。常用的混合判据为 \[|\widehat q-q|\le \tau_{\rm abs}+\tau_{\rm rel}|q|,\] 其中两个容差应在比较前明确,不能根据输出是否”好看”反复修改。
数值误差至少包括模型误差、离散或截断误差、迭代误差与浮点舍入误差。增加迭代次数主要影响迭代误差,缩小网格主要影响离散误差;改变这些参数不能消除不恰当模型本身造成的偏差。
例 16.2 (误差来源的分离). 用有限差分\([\exp(h)-1]/h\)近似\(\exp'(0)=1\)。精确算术下,Taylor展开给出误差\(h/2+O(h^2)\)。浮点计算还包含两个接近数相减后的有效数字损失;对常见误差模型,其量级可写为\(O(u/|h|)\),\(u\)是单位舍入误差。总误差的估计式\(C_1|h|+C_2u/|h|\)说明步长不能无限缩小。常数与实现有关,不能把这一量级模型当作每个具体运算的严格逐次误差等式。
记录数学表达式、定义域、输入数据、算法及停止条件;保留环境版本、主要参数和原始输出;另写一段数学解释。报告中的小数位数不应超过证据支持的精度。图表需有坐标含义、单位或无量纲说明;不同设置应使用一致的比较尺度。