1. 案例与正则化沙盒 2. 最优性条件全景 (FONC/SONC/SOSC) 3. 经典考点三大陷阱展台 4. 凸函数无约束最优充要性 5. 课件例题与驻点判别器 6. 闭式解与正规方程实战

第 4-1 章 无约束规划:案例及最优性条件

从工程应用与机器学习案例启程,跨越微积分极值分析的必要与充分界限,深入探讨驻点几何与凸性保障,掌握正规方程闭式解与 Hessian 判定法。

🎯 最小二乘法 MSE 💎 Lasso ($L_1$) 稀疏性 vs 岭回归 ($L_2$) ⚡ 一阶 FONC 与二阶 SONC / SOSC ⚠️ 三大经典反例陷阱 📐 课件 Slide 17 驻点求解器 🚀 正规方程闭式解
🤖

1. 无约束优化工程与 AI 案例:回归与正则化对比沙盒

从统计预测到机器学习,理解均方误差 MSE 损失曲面,以及 $L_1$ 菱形尖角稀疏解与 $L_2$ 光滑圆环收缩的几何本质。

📊 线性回归最小二乘法 (MSE)

给定数据集 $\{(\mathbf{x}^{(i)}, y_i)\}_{i=1}^m$,构造预测模型 $h_{\mathbf{w}, b}(\mathbf{x}) = \mathbf{w}^T \mathbf{x} + b$。通过均方误差衡量拟合损失:

$$MSE(\mathbf{w}, b) = \frac{1}{m} \sum_{i=1}^m \left(\mathbf{w}^T \mathbf{x}^{(i)} + b - y_i\right)^2$$

将偏置 $b$ 吸收进权重令 $\hat{\mathbf{w}} = [\mathbf{w}^T, b]^T$,特征矩阵增广一列全 1 得 $X \in \mathbb{R}^{m \times (l+1)}$,目标函数简化为优雅的矩阵 2-范数无约束优化:

$$\min_{\hat{\mathbf{w}} \in \mathbb{R}^{l+1}} \frac{1}{m} \|X \hat{\mathbf{w}} - \mathbf{y}\|_2^2$$
💡 几何直觉与其它范数准则

• 最小二乘 ($L_2$ 平方):几何上试图找到超平面使所有点到平面纵向差的平方和最小。
• 绝对值和 ($L_1$ 损失):$\min \sum |\mathbf{w}^T \mathbf{x}^{(i)} + b - y_i|$,对异常离群值 (outliers) 具有更强鲁棒性。
• 最大偏差最小化 ($L_\infty$ 损失):$\min \max_i |\mathbf{w}^T \mathbf{x}^{(i)} + b - y_i|$,切比雪夫准则保证最坏情况误差可控。

⚖️ 为什么需要正则化?Lasso vs Ridge

当特征维度高、样本数不足或特征间存在强多重共线性时,$X^TX$ 奇异或接近病态,普通最小二乘解极不稳定、方差爆炸且易过拟合。

Lasso ($L_1$ 正则化,$\mu \ge 0$):

$$\min_{\mathbf{w}} \|X\mathbf{w} - \mathbf{y}\|_2^2 + \mu \|\mathbf{w}\|_1 = \min_{\mathbf{w}} \|X\mathbf{w} - \mathbf{y}\|_2^2 + \mu \sum_j |w_j|$$

✦ 促使部分参数严格为 0,自动完成特征选择,得到稀疏解 (Sparsity)!

岭回归 Ridge ($L_2$ 正则化,$\mu \ge 0$):

$$\min_{\mathbf{w}} \|X\mathbf{w} - \mathbf{y}\|_2^2 + \mu \|\mathbf{w}\|_2^2 = \min_{\mathbf{w}} \|X\mathbf{w} - \mathbf{y}\|_2^2 + \mu \sum_j w_j^2$$

✦ 平滑收缩所有权重,当 $\mu > 0$ 时恒有唯一严格凸全局最优闭式解!

🔬 【实时交互沙盒】Lasso 与 Ridge 约束等高线切点动力学

拖动下方滑块调节正则化惩罚强度 $\mu$(也可单指/鼠标在画布上拖拽蓝色 OLS 极小点 $w^*$)。观察:MSE 损失的椭圆等高线与 $L_1$ 菱形约束集首次相交于坐标轴尖角 ($w_2=0$),导致参数精确为 0;而与 $L_2$ 正圆约束集首次相交于光滑弧面,参数仅被平滑按比例衰减!

1.80
OLS 无约束解 $w^*$ (可拖动) Lasso 解 (菱形接触) Ridge 解 (圆环接触)
💎 Lasso 当前解状态:
$w_1 = 1.250, \quad w_2 = 0.000$ (已稀疏化截断至 0!)
⚪ Ridge 当前解状态:
$w_1 = 1.341, \quad w_2 = 0.428$ (平滑收缩,非严格零)
📐

2. 最优性条件全景沙盒:FONC · SONC · SOSC

微积分无约束极值判定圣杯:一阶导数探查驻点斜率,二阶导数与 Hessian 曲率揭示凹凸凹陷。

一阶条件 必要条件

一阶必要条件 (FONC)

设 $f \in C^1$。若 $\mathbf{x}^*$ 是局部极小点,则梯度必然为零:

$$\nabla f(\mathbf{x}^*) = \mathbf{0}$$

驻点 (平稳点):满足 $\nabla f = 0$ 的点统称为驻点。
⚠️ 驻点可能为局部极小、局部极大或鞍点!

查看反证法证明

假设 $\nabla f(\mathbf{x}^*) \ne 0$。令下降方向 $\mathbf{d} = -\nabla f(\mathbf{x}^*)$。对于充分小的 $\alpha > 0$,由一阶泰勒展开: $$\phi(\alpha) = f(\mathbf{x}^* + \alpha \mathbf{d}) = f(\mathbf{x}^*) + \alpha \mathbf{d}^T \nabla f(\mathbf{x}^*) + o(\alpha)$$ $$= f(\mathbf{x}^*) - \alpha \|\nabla f(\mathbf{x}^*)\|^2 + o(\alpha) < f(\mathbf{x}^*)$$ 与 $\mathbf{x}^*$ 为局部极小点矛盾!

二阶条件 必要条件

二阶必要条件 (SONC)

设 $f \in C^2$。若 $\mathbf{x}^*$ 是局部极小点,则梯度为零且 Hessian 矩阵半正定:

$$\nabla f(\mathbf{x}^*) = \mathbf{0} \quad \text{且} \quad \nabla^2 f(\mathbf{x}^*) \succeq 0$$

即所有特征值 $\lambda_i \ge 0$。曲面在任何方向上的局部曲率均不能向下弯曲。

查看反证法证明

假设 $\nabla^2 f(\mathbf{x}^*)$ 非半正定,即存在非零向量 $\mathbf{d}$ 使 $\mathbf{d}^T \nabla^2 f(\mathbf{x}^*) \mathbf{d} < 0$。由二阶泰勒展开: $$f(\mathbf{x}^* + \alpha \mathbf{d}) = f(\mathbf{x}^*) + 0 + \frac{1}{2} \alpha^2 \mathbf{d}^T \nabla^2 f(\mathbf{x}^*) \mathbf{d} + o(\alpha^2) < f(\mathbf{x}^*)$$ 与局部极小矛盾!故 $\nabla^2 f \succeq 0$ 必然成立。

二阶条件 充分条件 ★

二阶充分条件 (SOSC)

设 $f \in C^2$。若驻点处 Hessian 矩阵严格正定:

$$\nabla f(\mathbf{x}^*) = \mathbf{0} \quad \text{且} \quad \nabla^2 f(\mathbf{x}^*) \succ 0$$

则 $\mathbf{x}^*$ 必然是一个严格局部极小点!所有特征值 $\lambda_i > 0$。

查看瑞利商严格证明 (Slide 23)
设 $F = \nabla^2 f(\mathbf{x}^*) \succ 0$,最小特征值 $\lambda_{min} > 0$。
根据瑞利商定理,对任意扰动 $\mathbf{h}$,有 $\mathbf{h}^T F \mathbf{h} \ge \lambda_{min} \|\mathbf{h}\|_2^2$。
二阶泰勒展开式:$f(\mathbf{x}^* + \mathbf{h}) - f(\mathbf{x}^*) = \frac{1}{2} \mathbf{h}^T F \mathbf{h} + r(\mathbf{h})$,其中 $r(\mathbf{h}) = o(\|\mathbf{h}\|_2^2)$。
根据高阶无穷小定义,存在邻域半径 $\delta > 0$,使得当 $0 < \|\mathbf{h}\|_2 < \delta$ 时,$|r(\mathbf{h})| \le \frac{\lambda_{min}}{4} \|\mathbf{h}\|_2^2$。
代入整理得: $$f(\mathbf{x}^* + \mathbf{h}) - f(\mathbf{x}^*) \ge \frac{\lambda_{min}}{2} \|\mathbf{h}\|_2^2 - \frac{\lambda_{min}}{4} \|\mathbf{h}\|_2^2 = \frac{\lambda_{min}}{4} \|\mathbf{h}\|_2^2 > 0$$ 因此 $\mathbf{x}^*$ 必然是严格局部极小点!证毕。
🌲 驻点分类全景判定树 (Stationary Point Decision Flow)
步骤 1:求解方程组

令 $\nabla f(\mathbf{x}) = \mathbf{0}$,求出所有的候选点 $\mathbf{x}^*$(驻点)。若无实数解,则无内部极值。

步骤 2:代入 Hessian 矩阵

计算 $\nabla^2 f(\mathbf{x}^*)$,通过顺序主子式 (Sylvester 准则) 或特征值 $\lambda_1, \dots, \lambda_n$ 判定定性。

步骤 3:结论分类

• $\lambda_i > 0$(正定):严格局部极小 (SOSC)
• $\lambda_i < 0$(负定):严格局部极大
• 异号(不定):鞍点,非极值点
• 含 0 且同号(半定):失效,需高阶项探查

⚠️

3. 经典考点三大陷阱展台 (Traps & Counterexamples)

“必要”与“充分”不可轻易混淆!深入探索课件必考的三大反例,交互式 3D 曲面与切片剖析其内在机理。

🖱️/👆 鼠标或单指拖动旋转 3D 视角 · 滚轮/双指缩放
探测原点 (0,0) 处导数特性
陷阱 1:$f(x) = x^3$ SONC 不是充分条件

在 $x = 0$ 处: $$f'(0) = 3(0)^2 = 0, \quad f''(0) = 6(0) = 0 \ge 0$$

核心要点:该点满足一阶条件 $f'=0$,也满足二阶半正定必要条件 $f'' \ge 0$。但对任意微小邻域,当 $x < 0$ 时 $f(x) = x^3 < 0 = f(0)$,当 $x > 0$ 时 $f(x) > 0$。它只是一个拐点 (Inflection Point),根本不是局部极值点!

✦ 结论:满足二阶必要条件 (SONC),绝对推不出是极值点!
陷阱 2:双曲抛物面(马鞍面)$f(x_1, x_2) = x_1^2 - x_2^2$ FONC 不是充分条件

在原点 $\mathbf{x}^* = (0, 0)^T$ 处: $$\nabla f(0, 0) = \begin{bmatrix} 2x_1 \\ -2x_2 \end{bmatrix} = \begin{bmatrix} 0 \\ 0 \end{bmatrix}, \quad \nabla^2 f(0, 0) = \begin{bmatrix} 2 & 0 \\ 0 & -2 \end{bmatrix}$$

核心要点:梯度为零,满足 FONC。然而 Hessian 特征值为 $\lambda_1 = +2, \lambda_2 = -2$(一正一负,不定)。沿 $x_1$ 轴切片是下凹抛物线(极小点),沿 $x_2$ 轴切片是上凸抛物线(极大点),整体形成马鞍形。

✦ 结论:驻点可能是鞍点!必须借助二阶特征值或子式才能下结论。
陷阱 3:平坦极小 $f(x) = x^4$ SOSC 不是必要条件

在 $x = 0$ 处:显然对所有 $x \ne 0$ 恒有 $x^4 > 0 = f(0)$,故 $x=0$ 是无可置疑的严格局部(及全局)极小点。

然而二阶导数:$f''(x) = 12x^2 \implies f''(0) = 0$(非严格正定)。因此在 $x=0$ 处并不满足 SOSC 充分条件!

✦ 结论:二阶充分条件 (SOSC) 要求过于严格,若不满足 SOSC,该点依然完全可能是严格局部极小!
🌐

4. 凸函数无约束最优性充要条件

凸优化何以成为工程界与学术界的黄金标杆?驻点即全局最优,但切莫忽略“最优解是否存在”的前提!

🏆 凸函数一阶最优性充要条件定理 (Slide 18)

设 $f: \mathbb{R}^n \to \mathbb{R}$ 是连续可微凸函数。对于任意给定的 $\mathbf{x}^* \in \mathbb{R}^n$:

$$\nabla f(\mathbf{x}^*) = \mathbf{0} \iff \mathbf{x}^* \text{ 是 } \min_{\mathbf{x} \in \mathbb{R}^n} f(\mathbf{x}) \text{ 的全局最优解}$$

充要性双向推导:
• 充分性 ($\implies$):因为 $f$ 是凸函数,由凸函数一阶支撑切超平面性质,对任意 $\mathbf{x} \in \mathbb{R}^n$,恒有: $$f(\mathbf{x}) - f(\mathbf{x}^*) \ge \nabla f(\mathbf{x}^*)^T (\mathbf{x} - \mathbf{x}^*)$$ 代入 $\nabla f(\mathbf{x}^*) = \mathbf{0}$,立刻得到 $f(\mathbf{x}) - f(\mathbf{x}^*) \ge 0 \implies f(\mathbf{x}) \ge f(\mathbf{x}^*)$,因此 $\mathbf{x}^*$ 是全局最小解!
• 必要性 ($\impliedby$):$\mathbf{x}^*$ 是全局最优解 $\implies \mathbf{x}^*$ 必然是局部最优解 $\implies$ 根据无约束 FONC,必有 $\nabla f(\mathbf{x}^*) = \mathbf{0}$。

⚠️ 易错思辨:凸函数一定存在最优解吗?

反思案例:考察一元指数函数 $f(x) = e^x$

• 二阶导数 $f''(x) = e^x > 0$ 恒成立,因此 $f(x) = e^x$ 是 $\mathbb{R}$ 上的严格凸函数。
• 但其一阶导数 $f'(x) = e^x = 0$ 在实数集 $\mathbb{R}$ 上无解!
• 当 $x \to -\infty$ 时,$e^x \to 0$。下确界 $\inf_{x \in \mathbb{R}} f(x) = 0$,但在有限实数域上根本取不到最小值,即最优解不存在!

📌 重要启示:凸优化充要条件用于判定一个候选点是否最优,但并不保证最优解的存在性(需配合强制性 coercive 或有界闭集魏尔斯特拉斯定理)。
📈 指数函数渐近线交互探针
滑动 $x$ 探查:$x =$ -1.5 $f'(x) = e^x > 0$ 恒无零点
⚡

5. 课件经典例题深度拆解与驻点判别交互求解器

完全还原 Slide 17 经典考题,提供因式分解推演、Hessian 特征值分解、2D 等高线地貌及自定义系数判别器。

📖 课件 Slide 17 原题重现

考试高频题型

考虑以下二元多项式无约束优化问题:

$$\min_{\mathbf{x} \in \mathbb{R}^2} f(x_1, x_2) = \frac{1}{3} x_1^3 + \frac{1}{2} x_1^2 + 2 x_1 x_2 + \frac{1}{2} x_2^2 - x_2 + 9$$

【求解目标】:求出目标函数所有的驻点,并通过 Hessian 矩阵判定它们是局部极小点、局部极大点还是鞍点。

1 建立一阶偏导方程组 (FONC)
▼
分别对 $x_1$ 和 $x_2$ 求偏导并令其为 0: $$\frac{\partial f}{\partial x_1} = x_1^2 + x_1 + 2 x_2 = 0 \quad \cdots \text{(式 1)}$$ $$\frac{\partial f}{\partial x_2} = 2 x_1 + x_2 - 1 = 0 \quad \cdots \text{(式 2)}$$
2 代数消元因式分解求驻点
▼
由线性方程 (式 2) 可得:$x_2 = 1 - 2 x_1$。
代入非线性方程 (式 1): $$x_1^2 + x_1 + 2(1 - 2 x_1) = 0 \implies x_1^2 - 3 x_1 + 2 = 0$$ 因式分解:$(x_1 - 1)(x_1 - 2) = 0$。解得两个根:
• 当 $x_1 = 2$ 时,$x_2 = 1 - 2(2) = -3$ $\implies$ 驻点 $\mathbf{x}^{(1)} = (2, -3)^T$
• 当 $x_1 = 1$ 时,$x_2 = 1 - 2(1) = -1$ $\implies$ 驻点 $\mathbf{x}^{(2)} = (1, -1)^T$
3 计算黑塞矩阵 Hessian $\nabla^2 f(\mathbf{x})$
▼
求二阶偏导数组成的对称矩阵: $$\nabla^2 f(\mathbf{x}) = \begin{bmatrix} \frac{\partial^2 f}{\partial x_1^2} & \frac{\partial^2 f}{\partial x_1 \partial x_2} \\ \frac{\partial^2 f}{\partial x_2 \partial x_1} & \frac{\partial^2 f}{\partial x_2^2} \end{bmatrix} = \begin{bmatrix} 2 x_1 + 1 & 2 \\ 2 & 1 \end{bmatrix}$$
4 驻点极值判别结论
▼
① 检验驻点 $\mathbf{x}^{(1)} = (2, -3)^T$: $$\nabla^2 f(\mathbf{x}^{(1)}) = \begin{bmatrix} 2(2) + 1 & 2 \\ 2 & 1 \end{bmatrix} = \begin{bmatrix} 5 & 2 \\ 2 & 1 \end{bmatrix}$$ • 顺序主子式:$\Delta_1 = 5 > 0$,$\Delta_2 = 5 \times 1 - 2 \times 2 = 1 > 0$。
• 特征方程:$\lambda^2 - 6\lambda + 1 = 0 \implies \lambda = 3 \pm \sqrt{8} > 0$(严格正定 $\succ 0$)。
✔ 根据 SOSC,$\mathbf{x}^{(1)} = (2, -3)^T$ 是严格局部极小点!

② 检验驻点 $\mathbf{x}^{(2)} = (1, -1)^T$: $$\nabla^2 f(\mathbf{x}^{(2)}) = \begin{bmatrix} 2(1) + 1 & 2 \\ 2 & 1 \end{bmatrix} = \begin{bmatrix} 3 & 2 \\ 2 & 1 \end{bmatrix}$$ • 顺序主子式:$\Delta_1 = 3 > 0$,$\Delta_2 = 3 \times 1 - 2 \times 2 = -1 < 0$。
• 特征方程:$\lambda^2 - 4\lambda - 1 = 0 \implies \lambda = 2 \pm \sqrt{5}$(特征值一正一负,不定)。
✖ 矩阵不定,不满足 SONC,$\mathbf{x}^{(2)} = (1, -1)^T$ 是鞍点(非极值点)!
🗺️ Slide 17 等高线地形图与驻点探针
👆/🖱️ 点击或滑动探查任意坐标点梯度向量与函数值
x=(2.0, -3.0): 极小点 f=9.17
🧮 【通用工具箱】二次型与多项式驻点快速判别求解器
支持自定义系数

输入二次函数 $f(x_1, x_2) = \frac{1}{2} (a x_1^2 + 2b x_1 x_2 + c x_2^2) - (d x_1 + e x_2) + f_0$ 的各项系数,一键计算梯度、Hessian、主子式、特征值并输出极值性质:

🚀

6. 闭式解实战:正规方程与 Ridge 回归解析推导

无需迭代搜索即可一步到位的解析解:深入二次型极小化 $Q\mathbf{x} = \mathbf{b}$ 与最小二乘正规方程矩阵求导。

1. 二次函数闭式解:$\frac{1}{2}\mathbf{x}^T Q \mathbf{x} - \mathbf{b}^T \mathbf{x}$

设 $Q = Q^T \succ 0$ 为对称正定矩阵,优化问题: $$\min_{\mathbf{x} \in \mathbb{R}^n} f(\mathbf{x}) = \frac{1}{2} \mathbf{x}^T Q \mathbf{x} - \mathbf{b}^T \mathbf{x}$$

一阶求导 (FONC):

$$\nabla f(\mathbf{x}) = Q \mathbf{x} - \mathbf{b} = \mathbf{0} \implies Q \mathbf{x} = \mathbf{b}$$

由于 $Q$ 正定,其行列式 $\det(Q) \ne 0$ 且必然可逆。两边左乘 $Q^{-1}$ 即得唯一闭式解:

$$\mathbf{x}^* = Q^{-1} \mathbf{b}$$

• 二阶 Hessian 矩阵 $\nabla^2 f(\mathbf{x}) = Q \succ 0$ 恒正定,函数为严格凸函数,故该驻点必然是唯一的全局最小值点!

2. 最小二乘正规方程:$A^T A \mathbf{x} = A^T \mathbf{b}$

设 $A \in \mathbb{R}^{m \times n}$ ($m \ge n$) 且 $\text{rank}(A) = n$(列满秩),最小二乘问题: $$\min_{\mathbf{x} \in \mathbb{R}^n} \frac{1}{2} \|A\mathbf{x} - \mathbf{b}\|_2^2 = \frac{1}{2} (A\mathbf{x} - \mathbf{b})^T (A\mathbf{x} - \mathbf{b})$$

展开得:$\frac{1}{2} \mathbf{x}^T A^T A \mathbf{x} - \mathbf{b}^T A \mathbf{x} + \frac{1}{2} \mathbf{b}^T \mathbf{b}$。
令梯度为零: $$\nabla f(\mathbf{x}) = A^T A \mathbf{x} - A^T \mathbf{b} = \mathbf{0} \implies A^T A \mathbf{x} = A^T \mathbf{b}$$ 当 $A$ 列满秩时,$A^T A$ 为严格正定对称阵,存在逆矩阵,解得:
$$\mathbf{x}^* = (A^T A)^{-1} A^T \mathbf{b}$$

• 几何意义:残差向量 $A\mathbf{x}^* - \mathbf{b}$ 与 $A$ 的列空间 $\text{col}(A)$ 严格正交,实现欧氏空间正交投影!

3. 岭回归 (Ridge Regression) 闭式解与数值稳定性革命

目标函数添加 $L_2$ 正则项:$\min_{\mathbf{w}} \|X\mathbf{w} - \mathbf{y}\|_2^2 + \mu \|\mathbf{w}\|_2^2$($\mu > 0$)。

求梯度并置零: $$2 X^T (X\mathbf{w} - \mathbf{y}) + 2\mu \mathbf{w} = \mathbf{0}$$ $$(X^T X + \mu I) \mathbf{w} = X^T \mathbf{y}$$ 闭式解为:
$$\mathbf{w}_{ridge}^* = (X^T X + \mu I)^{-1} X^T \mathbf{y}$$

为什么加 $\mu I$ 能起死回生?
若 $X^T X$ 的特征值为 $\sigma_1 \ge \sigma_2 \ge \dots \ge \sigma_n \ge 0$。当特征多重共线性时,$\sigma_n \approx 0$,条件数 $\kappa = \sigma_1 / \sigma_n \to \infty$(矩阵病态奇异)。
加入 $\mu I$ 后,新矩阵特征值变为 $\sigma_i + \mu \ge \mu > 0$!恒定严格正定,绝对可逆,数值鲁棒性得到质的飞跃!

📊 拟合实测:普通最小二乘 vs 岭回归稳定性对比
2.0
OLS 斜率: 1.82, Ridge 斜率: 1.21 (条件数改善)