知识点回顾#
本章我们为抽象的向量空间赋予了丰富的几何直观。通过引入内积这一核心工具,我们得以定义和量化向量的长度、距离和角度,并深入探讨了正交性、投影和旋转等关键几何变换。这些概念不仅是理论的基石,更在机器学习的实践中扮演着至关重要的角色。
知识点脉络回顾#
本章的核心逻辑可以用以下链条进行梳理:
- 内积 (Inner Product): \(\langle \mathbf{x}, \mathbf{y} \rangle\)
- 定义: 一个满足对称性、双线性和正定性的映射。在 \(\mathbb{R}^n\) 中,任何内积都等价于一个对称正定矩阵 (SPD Matrix) \(\mathbf{A}\),形式为 \(\mathbf{x}^\top\mathbf{A}\mathbf{y}\)。
- 作用: 它是所有几何概念的源头。
- 引出 \(\downarrow\)
- 范数 (Norm) / 长度: \(\|\mathbf{x}\| = \sqrt{\langle \mathbf{x}, \mathbf{x} \rangle}\)
- 定义了向量的“大小”。
- 引出了向量间的距离: \(d(\mathbf{x}, \mathbf{y}) = \|\mathbf{x} - \mathbf{y}\|\)
- 角度 (Angle): \(\cos\omega = \frac{\langle \mathbf{x}, \mathbf{y} \rangle}{\|\mathbf{x}\| \|\mathbf{y}\|}\) (需 柯西-施瓦茨不等式 保证)
- 定义了向量间的“方向关系”。
- 引出了正交性 (Orthogonality): \(\langle \mathbf{x}, \mathbf{y} \rangle = 0\)
- 范数 (Norm) / 长度: \(\|\mathbf{x}\| = \sqrt{\langle \mathbf{x}, \mathbf{x} \rangle}\)
- 基于正交性的核心应用
- 标准正交基 (ONB): “最理想”的坐标系,计算极为简便。
- 构造方法: 格拉姆-施密特正交化,其核心是迭代地减去投影。
- 正交投影 (Orthogonal Projection): 寻找子空间中的“最佳近似”。
- 投影矩阵: \(\mathbf{P} = \mathbf{B}(\mathbf{B}^\top\mathbf{B})^{-1}\mathbf{B}^\top\)。若基 \(\mathbf{B}\) 是ONB,则简化为 \(\mathbf{P} = \mathbf{B}\mathbf{B}^\top\)。
- 正交变换: 保持长度和角度不变的变换。
- 正交矩阵: \(\mathbf{A}^\top\mathbf{A} = \mathbf{I}\)。代表旋转和反射。
- 标准正交基 (ONB): “最理想”的坐标系,计算极为简便。
解析几何在机器学习中的应用:“工具箱”视角#
本章学习的每个概念,都可以看作是解决机器学习问题的一个强大工具。
- 范数 \(\rightarrow\) 正则化 (Regularization)
- 目的: 防止模型过拟合,提高泛化能力。
- L2范数正则化 (岭回归/Weight Decay): 在损失函数中加入 \(\lambda\|\mathbf{w}\|_2^2\),倾向于让模型参数 \(\mathbf{w}\) 的值都比较小,但不会是0。
- L1范数正则化 (Lasso回归): 在损失函数中加入 \(\lambda\|\mathbf{w}\|_1\),倾向于产生稀疏解,即让许多模型参数变为0,从而实现特征选择。
- 内积/SPD矩阵 \(\rightarrow\) 核方法 (Kernel Methods) & 高斯过程 (Gaussian Processes)
- 核心思想: 许多线性算法的表达可以完全用样本间的内积来表示。
- 核技巧 (Kernel Trick): 通过一个核函数 \(k(\mathbf{x}, \mathbf{z})\),我们可以在原始空间中计算样本点在高维(甚至无限维)特征空间中的内积,而无需显式地进行高维映射。例如,支持向量机 (SVM) 正是利用核技巧来寻找非线性的决策边界。
- SPD矩阵的应用: 核函数计算出的核矩阵 (Gram Matrix) 必须是半正定的。高斯过程中的协方差矩阵也必须是SPD矩阵,保证了模型的有效性。
- 正交投影 \(\rightarrow\) 线性回归 (Linear Regression) & 主成分分析 (PCA)
- 线性回归: 求解线性回归的最小二乘解,在几何上完全等价于将目标观测向量 \(\mathbf{y}\) 正交投影到由特征数据张成的子空间上。法方程 \(\mathbf{X}^\top\mathbf{X}\mathbf{w} = \mathbf{X}^\top\mathbf{y}\) 正是投影公式的核心。
- 主成分分析 (PCA): 这是一种经典的降维算法。其目标是找到一个低维子空间,使得原始数据投影到该子空间后,信息的损失最小(即投影误差最小),或者说投影后的数据方差最大。这整个过程都依赖于正交投影的计算。
- 正交性/旋转 \(\rightarrow\) 数据预处理 & 独立成分分析 (ICA)
- 数据预处理: 在许多算法(如PCA)执行前,对数据进行“白化”(Whitening)处理,即通过旋转等变换,去除特征间的相关性并使方差归一,可以提高算法的性能和稳定性。
- 独立成分分析 (ICA): 这是一种盲源分离技术,旨在从混合信号中分离出统计上独立的原始信号。其核心假设是原始信号是非高斯的,并通过寻找一个旋转矩阵,使得输出信号的各分量之间的高阶统计量(如峰度)最大化,从而实现分离。
本章的解析几何知识为我们打开了一扇窗,让我们能够从几何的视角去理解和分析机器学习算法的内在机制。这些看似基础的数学工具,实则构成了现代数据科学的坚固基石。
