跳过正文
  1. 文章/

解析几何:范数

·2057 字·5 分钟
目录
解析几何 - 这篇文章属于一个选集。
§ 1: 本文

在「线性代数」系列中,我们从一个相对抽象的层面学习了向量、向量空间和线性映射。这一系列的目标是为这些抽象概念赋予几何直观。我们将深入探讨如何计算向量的长度、向量之间的距离和角度,这些都是我们理解和可视化数据的基础。

为了实现这一点,我们将引入解析几何中最核心的工具——内积 (Inner product)。如下图所示,内积是构建所有几何概念的基石,它能自然地“诱导”出向量的范数 (Norm)(即长度)和角度 (Angle)。基于这些概念,我们才能进一步讨论正交投影、旋转等重要操作。这些几何工具在机器学习的后续章节中扮演着至关重要的角色,例如,它们是理解线性回归、主成分分析和支持向量机的关键。

图3.1 概念关系图

当我们思考一个几何向量(一个从原点出发的箭头)时,它的“长度”是一个非常直观的属性。在数学中,我们将“长度”这一概念推广为范数

3.1 数学定义与性质
#

准确的数学定义

在向量空间 \(V\) 中,一个范数 (Norm) 是一个函数 \(|| · ||\),它将空间中的每一个向量 \(x\) 映射到一个非负实数,即它的“长度” \(||x||\)。

$$ \| \cdot \| : V \rightarrow \mathbb{R} \\ \mathbf{x} \mapsto \|\mathbf{x}\| $$

这个函数必须满足以下三个基本性质,对于所有向量 \(x, y \in V\) 和标量 \(\lambda \in R\) 均成立:

  1. 绝对齐次性 (Absolutely Homogeneous)

    $$ \|\lambda \mathbf{x}\| = |\lambda| \|\mathbf{x}\| $$
    • 直观解释: 将一个向量 \(x\) 拉伸或缩短 \(\lambda\) 倍,它的新长度是原长度的 \(|\lambda|\) 倍。方向反转(\(\lambda\)为负)不影响长度的缩放比例。
  2. 三角不等式 (Triangle Inequality)

    $$ \|\mathbf{x} + \mathbf{y}\| \le \|\mathbf{x}\| + \|\mathbf{y}\| $$
    • 直观解释: 这就是我们熟悉的“三角形两边之和大于第三边”。从原点出发,先走向量 \(x\) 的路径,再走向量 \(y\) 的路径,最终到达点 \(x+y\)。这条“折线”路径的长度 (\(||x|| + ||y||\)),永远不会比从原点直接走向量 \(x+y\) 的“直线”路径 (\(||x+y||\)) 更短。
  3. 正定性 (Positive Definite)

    $$ \|\mathbf{x}\| \ge 0 \quad \text{并且} \quad (\|\mathbf{x}\| = 0 \iff \mathbf{x} = \mathbf{0}) $$
    • 直观解释: 任何向量的长度都是非负的。只有零向量的长度是零,所有非零向量都有正的长度。

理解要点

  • 范数是向量“长度”或“大小”的数学推广。
  • 它不是一个具体的公式,而是一类满足上述三条公理的函数。
  • 不同的范数定义了衡量向量大小的不同方式。

3.2 重要的范数实例:L2范数与L1范数
#

在机器学习中,最常用的两种范数是L2范数和L1范数。

欧几里得范数 (Euclidean Norm, L2-norm)
#

这是我们最熟悉、最符合几何直觉的范数。

$$ \|\mathbf{x}\|_2 := \sqrt{\sum_{i=1}^n x_i^2} = \sqrt{\mathbf{x}^\top\mathbf{x}} $$
  • 变量说明:
    • \(x\): 一个 \(n\) 维向量 \(x ∈ R^n\)。
    • \(x_i\): 向量 \(x\) 的第 \(i\) 个分量。
  • 适用条件: 适用于任何 \(R^n\) 中的向量。
  • 直观解释: L2范数计算的是从原点到向量 \(x\) 所指向点的直线距离。在二维或三维空间中,这正是毕达哥拉斯定理(勾股定理)的应用。
  • 应用场景: 在机器学习中,L2范数广泛用于正则化(称为岭回归权重衰减),以防止模型过拟合。同时,它也是衡量误差(如均方误差)的基础。
  • 注意事项: 在本书中,如果没有特别指明,\(||x||\) 默认指的就是L2范数。

数值示例 假设有一个二维向量 \(x = [3, -4]^T\)。它的L2范数为:

$$ \|\mathbf{x}\|_2 = \sqrt{3^2 + (-4)^2} = \sqrt{9 + 16} = \sqrt{25} = 5 $$

曼哈顿范数 (Manhattan Norm, L1-norm)
#

L1范数提供了另一种衡量向量大小的方式。

$$ \|\mathbf{x}\|_1 := \sum_{i=1}^n |x_i| $$
  • 变量说明:
    • \(x\): 一个 \(n\) 维向量 \(x ∈ R^n\)。
    • \(x_i\): 向量 \(x\) 的第 \(i\) 个分量。
  • 适用条件: 适用于任何 \(R^n\) 中的向量。
  • 直观解释: L1范数计算的是向量所有分量绝对值之和。它的名字来源于“曼哈顿街区距离”,想象你在一个像曼哈顿那样的棋盘式街道网络中,从一个点到另一个点,你不能走斜线,只能沿着东西或南北方向的街道走,L1范数就是你需要走过的总路程。
  • 应用场景: L1范数在机器学习中同样用于正则化(称为Lasso回归)。它有一个非常重要的特性,就是倾向于产生稀疏解(即解向量的许多分量为0),这对于特征选择非常有用。

数值示例 对于同一个向量 \(x = [3, -4]^T\)。它的L1范数为:

$$ \|\mathbf{x}\|_1 = |3| + |-4| = 3 + 4 = 7 $$

3.3 几何直观:单位“圆”
#

理解不同范数的一个绝佳方式是观察在它们的定义下,所有长度为1的向量构成的集合是什么形状。这个集合被称为“单位圆”。

  • L2范数单位圆: 在二维空间中,所有满足 \(||x||_2 = 1\)(即 \(sqrt(x_1^2 + x_2^2) = 1\))的向量 \(x\) 构成了一个我们所熟悉的标准圆形
  • L1范数单位圆: 在二维空间中,所有满足 \(||x||_1 = 1\)(即 \(|x_1| + |x_2| = 1\))的向量 \(x\) 构成了一个旋转了45度的正方形(菱形)
图3.3 L1和L2范数的单位圆对比图

这两种形状的差异,尤其是L1范数单位圆的“尖角”,是其能够产生稀疏解的几何根源。

思考题

为什么说L1范数比L2范数更容易产生稀疏解?


章节知识点总结
#

  • 范数是向量长度的抽象,需满足绝对齐次性、三角不等式和正定性。
  • L2范数(欧几里得范数)是标准的直线距离,对应几何上的圆形。
  • L1范数(曼哈顿范数)是各分量绝对值之和,对应几何上的菱形。
  • 不同的范数在机器学习中(特别是正则化)有不同的应用和效果。

后续

尽管我们介绍了几种不同的范数,但你会发现欧几里得范数(L2范数)在许多方面都非常特殊且方便。它的“良好”性质,比如与旋转的不变性,源于一个比范数更深层次、更强大的结构——内积 (Inner Product)。内积不仅能自然地定义出L2范数,还能帮我们定义向量之间的角度,从而开启对正交性等更多几何概念的讨论。在下一节中,我们将深入探索内积的世界。

解析几何 - 这篇文章属于一个选集。
§ 1: 本文