从统计预测到机器学习,理解均方误差 MSE 损失曲面,以及 $L_1$ 菱形尖角稀疏解与 $L_2$ 光滑圆环收缩的几何本质。
给定数据集 $\{(\mathbf{x}^{(i)}, y_i)\}_{i=1}^m$,构造预测模型 $h_{\mathbf{w}, b}(\mathbf{x}) = \mathbf{w}^T \mathbf{x} + b$。通过均方误差衡量拟合损失:
$$MSE(\mathbf{w}, b) = \frac{1}{m} \sum_{i=1}^m \left(\mathbf{w}^T \mathbf{x}^{(i)} + b - y_i\right)^2$$将偏置 $b$ 吸收进权重令 $\hat{\mathbf{w}} = [\mathbf{w}^T, b]^T$,特征矩阵增广一列全 1 得 $X \in \mathbb{R}^{m \times (l+1)}$,目标函数简化为优雅的矩阵 2-范数无约束优化:
$$\min_{\hat{\mathbf{w}} \in \mathbb{R}^{l+1}} \frac{1}{m} \|X \hat{\mathbf{w}} - \mathbf{y}\|_2^2$$
• 最小二乘 ($L_2$ 平方):几何上试图找到超平面使所有点到平面纵向差的平方和最小。
• 绝对值和 ($L_1$ 损失):$\min \sum |\mathbf{w}^T \mathbf{x}^{(i)} + b - y_i|$,对异常离群值 (outliers) 具有更强鲁棒性。
• 最大偏差最小化 ($L_\infty$ 损失):$\min \max_i |\mathbf{w}^T \mathbf{x}^{(i)} + b - y_i|$,切比雪夫准则保证最坏情况误差可控。
当特征维度高、样本数不足或特征间存在强多重共线性时,$X^TX$ 奇异或接近病态,普通最小二乘解极不稳定、方差爆炸且易过拟合。
Lasso ($L_1$ 正则化,$\mu \ge 0$):
$$\min_{\mathbf{w}} \|X\mathbf{w} - \mathbf{y}\|_2^2 + \mu \|\mathbf{w}\|_1 = \min_{\mathbf{w}} \|X\mathbf{w} - \mathbf{y}\|_2^2 + \mu \sum_j |w_j|$$✦ 促使部分参数严格为 0,自动完成特征选择,得到稀疏解 (Sparsity)!
岭回归 Ridge ($L_2$ 正则化,$\mu \ge 0$):
$$\min_{\mathbf{w}} \|X\mathbf{w} - \mathbf{y}\|_2^2 + \mu \|\mathbf{w}\|_2^2 = \min_{\mathbf{w}} \|X\mathbf{w} - \mathbf{y}\|_2^2 + \mu \sum_j w_j^2$$✦ 平滑收缩所有权重,当 $\mu > 0$ 时恒有唯一严格凸全局最优闭式解!
拖动下方滑块调节正则化惩罚强度 $\mu$(也可单指/鼠标在画布上拖拽蓝色 OLS 极小点 $w^*$)。观察:MSE 损失的椭圆等高线与 $L_1$ 菱形约束集首次相交于坐标轴尖角 ($w_2=0$),导致参数精确为 0;而与 $L_2$ 正圆约束集首次相交于光滑弧面,参数仅被平滑按比例衰减!
微积分无约束极值判定圣杯:一阶导数探查驻点斜率,二阶导数与 Hessian 曲率揭示凹凸凹陷。
设 $f \in C^1$。若 $\mathbf{x}^*$ 是局部极小点,则梯度必然为零:
驻点 (平稳点):满足 $\nabla f = 0$ 的点统称为驻点。
⚠️ 驻点可能为局部极小、局部极大或鞍点!
假设 $\nabla f(\mathbf{x}^*) \ne 0$。令下降方向 $\mathbf{d} = -\nabla f(\mathbf{x}^*)$。对于充分小的 $\alpha > 0$,由一阶泰勒展开: $$\phi(\alpha) = f(\mathbf{x}^* + \alpha \mathbf{d}) = f(\mathbf{x}^*) + \alpha \mathbf{d}^T \nabla f(\mathbf{x}^*) + o(\alpha)$$ $$= f(\mathbf{x}^*) - \alpha \|\nabla f(\mathbf{x}^*)\|^2 + o(\alpha) < f(\mathbf{x}^*)$$ 与 $\mathbf{x}^*$ 为局部极小点矛盾!
设 $f \in C^2$。若 $\mathbf{x}^*$ 是局部极小点,则梯度为零且 Hessian 矩阵半正定:
即所有特征值 $\lambda_i \ge 0$。曲面在任何方向上的局部曲率均不能向下弯曲。
假设 $\nabla^2 f(\mathbf{x}^*)$ 非半正定,即存在非零向量 $\mathbf{d}$ 使 $\mathbf{d}^T \nabla^2 f(\mathbf{x}^*) \mathbf{d} < 0$。由二阶泰勒展开: $$f(\mathbf{x}^* + \alpha \mathbf{d}) = f(\mathbf{x}^*) + 0 + \frac{1}{2} \alpha^2 \mathbf{d}^T \nabla^2 f(\mathbf{x}^*) \mathbf{d} + o(\alpha^2) < f(\mathbf{x}^*)$$ 与局部极小矛盾!故 $\nabla^2 f \succeq 0$ 必然成立。
设 $f \in C^2$。若驻点处 Hessian 矩阵严格正定:
则 $\mathbf{x}^*$ 必然是一个严格局部极小点!所有特征值 $\lambda_i > 0$。
令 $\nabla f(\mathbf{x}) = \mathbf{0}$,求出所有的候选点 $\mathbf{x}^*$(驻点)。若无实数解,则无内部极值。
计算 $\nabla^2 f(\mathbf{x}^*)$,通过顺序主子式 (Sylvester 准则) 或特征值 $\lambda_1, \dots, \lambda_n$ 判定定性。
• $\lambda_i > 0$(正定):严格局部极小 (SOSC)
• $\lambda_i < 0$(负定):严格局部极大
• 异号(不定):鞍点,非极值点
• 含 0 且同号(半定):失效,需高阶项探查
“必要”与“充分”不可轻易混淆!深入探索课件必考的三大反例,交互式 3D 曲面与切片剖析其内在机理。
在 $x = 0$ 处: $$f'(0) = 3(0)^2 = 0, \quad f''(0) = 6(0) = 0 \ge 0$$
核心要点:该点满足一阶条件 $f'=0$,也满足二阶半正定必要条件 $f'' \ge 0$。但对任意微小邻域,当 $x < 0$ 时 $f(x) = x^3 < 0 = f(0)$,当 $x > 0$ 时 $f(x) > 0$。它只是一个拐点 (Inflection Point),根本不是局部极值点!
在原点 $\mathbf{x}^* = (0, 0)^T$ 处: $$\nabla f(0, 0) = \begin{bmatrix} 2x_1 \\ -2x_2 \end{bmatrix} = \begin{bmatrix} 0 \\ 0 \end{bmatrix}, \quad \nabla^2 f(0, 0) = \begin{bmatrix} 2 & 0 \\ 0 & -2 \end{bmatrix}$$
核心要点:梯度为零,满足 FONC。然而 Hessian 特征值为 $\lambda_1 = +2, \lambda_2 = -2$(一正一负,不定)。沿 $x_1$ 轴切片是下凹抛物线(极小点),沿 $x_2$ 轴切片是上凸抛物线(极大点),整体形成马鞍形。
在 $x = 0$ 处:显然对所有 $x \ne 0$ 恒有 $x^4 > 0 = f(0)$,故 $x=0$ 是无可置疑的严格局部(及全局)极小点。
然而二阶导数:$f''(x) = 12x^2 \implies f''(0) = 0$(非严格正定)。因此在 $x=0$ 处并不满足 SOSC 充分条件!
凸优化何以成为工程界与学术界的黄金标杆?驻点即全局最优,但切莫忽略“最优解是否存在”的前提!
设 $f: \mathbb{R}^n \to \mathbb{R}$ 是连续可微凸函数。对于任意给定的 $\mathbf{x}^* \in \mathbb{R}^n$:
充要性双向推导:
• 充分性 ($\implies$):因为 $f$ 是凸函数,由凸函数一阶支撑切超平面性质,对任意 $\mathbf{x} \in \mathbb{R}^n$,恒有:
$$f(\mathbf{x}) - f(\mathbf{x}^*) \ge \nabla f(\mathbf{x}^*)^T (\mathbf{x} - \mathbf{x}^*)$$
代入 $\nabla f(\mathbf{x}^*) = \mathbf{0}$,立刻得到 $f(\mathbf{x}) - f(\mathbf{x}^*) \ge 0 \implies f(\mathbf{x}) \ge f(\mathbf{x}^*)$,因此 $\mathbf{x}^*$ 是全局最小解!
• 必要性 ($\impliedby$):$\mathbf{x}^*$ 是全局最优解 $\implies \mathbf{x}^*$ 必然是局部最优解 $\implies$ 根据无约束 FONC,必有 $\nabla f(\mathbf{x}^*) = \mathbf{0}$。
反思案例:考察一元指数函数 $f(x) = e^x$
• 二阶导数 $f''(x) = e^x > 0$ 恒成立,因此 $f(x) = e^x$ 是 $\mathbb{R}$ 上的严格凸函数。
• 但其一阶导数 $f'(x) = e^x = 0$ 在实数集 $\mathbb{R}$ 上无解!
• 当 $x \to -\infty$ 时,$e^x \to 0$。下确界 $\inf_{x \in \mathbb{R}} f(x) = 0$,但在有限实数域上根本取不到最小值,即最优解不存在!
完全还原 Slide 17 经典考题,提供因式分解推演、Hessian 特征值分解、2D 等高线地貌及自定义系数判别器。
考虑以下二元多项式无约束优化问题:
【求解目标】:求出目标函数所有的驻点,并通过 Hessian 矩阵判定它们是局部极小点、局部极大点还是鞍点。
输入二次函数 $f(x_1, x_2) = \frac{1}{2} (a x_1^2 + 2b x_1 x_2 + c x_2^2) - (d x_1 + e x_2) + f_0$ 的各项系数,一键计算梯度、Hessian、主子式、特征值并输出极值性质:
无需迭代搜索即可一步到位的解析解:深入二次型极小化 $Q\mathbf{x} = \mathbf{b}$ 与最小二乘正规方程矩阵求导。
设 $Q = Q^T \succ 0$ 为对称正定矩阵,优化问题: $$\min_{\mathbf{x} \in \mathbb{R}^n} f(\mathbf{x}) = \frac{1}{2} \mathbf{x}^T Q \mathbf{x} - \mathbf{b}^T \mathbf{x}$$
一阶求导 (FONC):
$$\nabla f(\mathbf{x}) = Q \mathbf{x} - \mathbf{b} = \mathbf{0} \implies Q \mathbf{x} = \mathbf{b}$$由于 $Q$ 正定,其行列式 $\det(Q) \ne 0$ 且必然可逆。两边左乘 $Q^{-1}$ 即得唯一闭式解:
• 二阶 Hessian 矩阵 $\nabla^2 f(\mathbf{x}) = Q \succ 0$ 恒正定,函数为严格凸函数,故该驻点必然是唯一的全局最小值点!
设 $A \in \mathbb{R}^{m \times n}$ ($m \ge n$) 且 $\text{rank}(A) = n$(列满秩),最小二乘问题: $$\min_{\mathbf{x} \in \mathbb{R}^n} \frac{1}{2} \|A\mathbf{x} - \mathbf{b}\|_2^2 = \frac{1}{2} (A\mathbf{x} - \mathbf{b})^T (A\mathbf{x} - \mathbf{b})$$
• 几何意义:残差向量 $A\mathbf{x}^* - \mathbf{b}$ 与 $A$ 的列空间 $\text{col}(A)$ 严格正交,实现欧氏空间正交投影!
目标函数添加 $L_2$ 正则项:$\min_{\mathbf{w}} \|X\mathbf{w} - \mathbf{y}\|_2^2 + \mu \|\mathbf{w}\|_2^2$($\mu > 0$)。
为什么加 $\mu I$ 能起死回生?
若 $X^T X$ 的特征值为 $\sigma_1 \ge \sigma_2 \ge \dots \ge \sigma_n \ge 0$。当特征多重共线性时,$\sigma_n \approx 0$,条件数 $\kappa = \sigma_1 / \sigma_n \to \infty$(矩阵病态奇异)。
加入 $\mu I$ 后,新矩阵特征值变为 $\sigma_i + \mu \ge \mu > 0$!恒定严格正定,绝对可逆,数值鲁棒性得到质的飞跃!