项目目录

CSCI 678 / 课程笔记

Lecture 2 课件完整翻译

Lecture 2 课件的完整中文翻译:一致收敛与 Rademacher 复杂度、有限类、无限二分类类与 VC 维、Sauer 引理。数学符号、编号与证明结构依照原文保留。

进行中

2026 年秋季学期,授课教师:Haipeng Luo

本文为 Lecture 2 课件的完整中文翻译。数学符号、定理编号、引理编号、命题编号、公式编号和证明结构均依照原文保留。

1 一致收敛与 Rademacher 复杂度

本讲重点研究 。如上一讲所述,它完全刻画了类 在批量/统计学习框架下的可学习性。我们将连续对这一博弈值作上界松弛,得到一个更容易处理的形式,并在最后说明这些上界非常紧。

回顾博弈值的定义:

其中, 遍历从 个训练样本到最终预测器 的所有映射或这些映射上的所有分布; 遍历 上的所有数据生成分布。

作为松弛这一博弈值的第一步,我们考虑一个非常简单的算法:输出经验风险最小化器(Empirical Risk Minimizer, ERM):

这里,经验风险就是训练集上的平均损失。为简化讨论,假设至少存在一个这样的最小化器;这基本不损失一般性。显然,此时

在继续讨论之前,先对 ERM 作两点说明。

第一,寻找 ERM 是一个定义明确的优化问题,并且已有许多成熟的优化算法。上一讲已经提到,这一优化层面不属于本课程范围。一般来说,寻找 ERM 甚至可能是 NP 困难的;这里我们只关注问题在统计意义上是否可学习,而不关注它在计算意义上是否容易求解。

第二,人们可能会问:既然仅最小化训练损失在实践中可能导致过拟合,为什么还要研究这个看似“朴素”、没有“正则化”的算法?答案是,对许多问题而言,正则化 ERM

等价于在更小的函数类上做 ERM:

其中 是另一个常数。因此,正则化本质上是一种隐式地在受限制的类上学习的方法,而这个受限制的类有望在统计意义上更容易学习。

1.1 经验过程与一致收敛

下面继续简化式 (1)。令

则有[^1]

这里,由 索引的一族随机变量

称为一个经验过程(empirical process)。这些随机变量中的每一个,都只是函数在从 随机抽取的输入上的期望值,与它在一组来自相同分布的 i.i.d. 输入上的经验平均值之差。

显然,这些随机变量均为零均值;根据大数定律,当 很大时,每一个都应该很小。然而,要断言式 (2) 很小,在某种意义上必须证明这些随机变量同时都小,而这是否成立取决于函数类

如果

就称 满足一致收敛(uniform convergence)。也就是说,对任意数据生成分布,只要 足够大,经验过程上确界的期望就可以任意小。由式 (2) 显然可知,如果 满足一致收敛,那么 可学习。

1.2 对称化与 Rademacher 复杂度

对给定的类 ,怎样判断经验过程的期望上确界是否很小?为了回答这一问题,我们将使用一个重要技巧——对称化(symmetrization)——进一步松弛该量,并得到 Rademacher 复杂度。

首先定义一个 Rademacher 随机变量 :它以相同概率取 。对函数类 以及任意输入序列 ,定义 在这些输入上的条件 Rademacher 复杂度

其中 个 i.i.d. Rademacher 随机变量。

相对于支撑在 上的分布 的无条件 Rademacher 复杂度定义为

其中 是来自 个 i.i.d. 样本。

直观上,一个类的 Rademacher 复杂度衡量了它拟合随机符号的能力,因为当 同号时,相关项 很大。因此,Rademacher 复杂度越大,函数类的表达能力越强。

Rademacher 复杂度与经验过程的期望上确界之间的联系由下面的定理给出。

定理 1。 对任意数据生成分布 和任意函数类 ,都有

其中

证明。 按照定义,把 写成

从而得到

把期望 移到上确界之外,得到下面这个对称的上界:

接下来,我们声称有如下等式:

这一等式成立,是因为对序列 的每一种可能取值,

之间的差别,仅仅是在 时交换样例 。由于 服从相同分布,这种交换不会改变期望。

把上确界拆成两部分,可进一步得到上界

最后,注意 同分布,因此上面的两项都恰好等于

除以 后即得结论。

1.3 在监督学习中消去损失函数

对许多问题,特别是监督学习问题,分析 的 Rademacher 复杂度时,与损失函数有关的部分实际上并不那么重要,通常可以被消去。

具体而言,考虑 的监督学习问题。在下面两种情况下,可以很容易地联系

引理 1。、使用 0-1 损失的二分类问题,对任意序列 ,都有

从而

证明。 根据定义,

最后一步使用了 Rademacher 变量均值为零的事实,以及对任意标签 ,随机变量

仍然是 i.i.d. Rademacher 随机变量这一事实。

引理 2(收缩引理)。 考虑一个 的回归问题,损失具有形式

其中 关于第一个参数是 -Lipschitz 的,即对任意 ,有

则对任意序列 ,都有

从而

证明。 根据定义,

先对最后一个 Rademacher 变量 的两个取值求平均,得到

其中最后一步使用了 -Lipschitz 性。由对称性,在 内去掉最后一个表达式中的绝对值并不会改变结果。再次拆开这个上确界,得到

依次对 重复这一过程,即得结论。

注意,常见问题通常都满足 Lipschitz 条件。以平方损失

为例。如果 ,显然该损失是 -Lipschitz 的。

2 有限类

先对目前的结果作一个简短总结。通过一系列取上界步骤,我们把统计学习问题的博弈值松弛为函数类的 Rademacher 复杂度:

其中,对二分类问题,;对回归问题, 是损失函数的 Lipschitz 常数。

现在已经清楚,要理解一个问题的可学习性,理解函数类的 Rademacher 复杂度 至关重要。那么,应当如何计算它?

我们先从一个简单但基础的情形开始: 是有限类。之后关于无限类的所有讨论,最终都会使用有限类的结果。所需的关键引理是次高斯随机变量的最大值不等式。

回顾:如果零均值随机变量 对所有 都满足

即其矩母函数被方差为 的零均值高斯变量的矩母函数控制,就称 -次高斯的。例如,任何取值范围为 的零均值随机变量都是 -次高斯的。这就是 Hoeffding 引理。

引理 3(最大值不等式)。 是有限个 -次高斯随机变量,则

证明。 对任意 ,有

整理可得

该选择使上界最小,并得到

证明完毕。

下面应用最大值不等式,控制有限类的 Rademacher 复杂度。

定理 2(Massart 引理)。 是有限类, 是任意输入集合,则

因此,如果对某个 ,那么

证明。 注意

其中

下面的计算说明 -次高斯的,其中

事实上,对任意

第一步使用了 相互独立的事实;第二步使用了 -次高斯的事实。应用引理 3 即得结论。

上述定理说明,函数值被限制在 内的有限类都可学习,因为

趋于无穷时成立。事实上,它还给出了使用 ERM 学习时精确的 收敛量级。

读者可能注意到,也可以把最大值不等式直接应用于经验过程

而得到相同结论。但很快将看到,先在 Rademacher 复杂度上进行这一步为何十分重要。

3 无限类:分类

下面研究无限类的 Rademacher 复杂度。第一步考虑 的二分类问题。虽然引理 3 看起来不适用于无限类,但它实际上仍然会发挥关键作用。

主要观察如下:条件 Rademacher 复杂度可等价写成

其中

在输入集 上的投影。

虽然 是无限的,但 总是有限的,且其大小至多为 。基于这一直觉,定义 个输入上的增长函数

它表示使用 中的函数对 个样本进行标记时,最多可能得到多少种不同标记。由前面的观察和引理 3,立即得到

增长函数的平凡上界是 。将其代入上式,只会得到一个常数量级的 Rademacher 复杂度。因此,要使 Rademacher 复杂度趋于零,需要函数类具有温和得多的增长函数。下面讨论两个例子。

命题 1。,并考虑阈值函数类

从而

证明。 对任意 左侧的所有点标为 ,把右侧的所有点标为 。显然,对实线上的任意 个不同点,从左到右可以得到的全部 种标记是

证明完毕。

命题 2。,并考虑区间函数类

从而

证明。 任意 个不同点把实线分成 个区域。把区间端点 放入其中任意两个不同区域,会得到 种标记。把两个端点放入同一个区域,无论选择哪个区域,都只会额外产生一种所有标签都为 的标记。

值得说明的是,在 Rademacher 复杂度定义中,把 替换为 非常直观且直接;但不能对 或它的上界

直接进行同样的替换,因为 的依赖并不只通过 体现。

这凸显了通过对称化把上述量松弛为 Rademacher 复杂度的重要性,也解释了为什么在有限类情形下,我们没有直接把最大值不等式应用于经验过程。

3.1 VC 维与 Sauer 引理

增长函数是一种刻画函数类复杂度的良好方式,但并不总是容易计算。考虑 ,以及线性分类器类

其中,当 ,否则为 。这个类的 是多少?

为简化讨论,先从 开始。很明显,对任意 ,都能找到 个点,使 实现全部 种标记,因此

时又如何?首先有 ,因为对二维平面中的任意四个点,线性分类器都不可能实现全部 种标记。读者可以尝试说服自己这一点。

但是, 的准确值是多少?花一些时间或许也能算出来;可 ,以及任意 时的 呢?是否必须逐个求出这些值,进行这样繁琐的计算?

略显意外的是,前面提到的两个事实

已经足以对任意 导出相当紧的上界。为说明这一结果,先给出几个定义。

如果

能实现该输入集的全部 种标记,就称 打散(shatter)输入集

的 Vapnik–Chervonenkis(VC)维定义为能被 打散的最大输入集大小,即

如果该集合为空,则定义 ;如果该集合不是有限的,即对所有 都有 ,则定义

例如,前面讨论的二维线性分类器的 VC 维为 。下面这个奠基性结果建立了函数类增长函数与 VC 维之间的联系;证明推迟到下一小节。

引理 4(Sauer 引理)。 对 VC 维为有限值 的函数类 ,任意 都满足

根据 VC 维的定义,对任意 ,显然有 。Sauer 引理说明,一旦 大于 ,增长函数就会发生相变:原来的指数增长 突然变为多项式增长,大约为

结合前面的讨论,得到

这说明 VC 维有限的类总是可学习的。

需要强调的是,为证明 ,恰好需要证明两件事:

  1. 。也就是说,给出一个大小为 的具体输入集,并证明 能在该集合上实现所有可能的标记;
  2. 。也就是说,证明对任意大小为 的输入集,都存在一种 无法实现的标记。

这通常比求任意 的增长函数容易,正如在线性分类器例子中所看到的。下面给出更多例子。

命题 3。 一个函数类的 VC 维为 ,当且仅当它只包含一个函数。

命题 4。 命题 1 中定义的阈值函数类的 VC 维为

命题 5。 命题 2 中定义的区间函数类的 VC 维为

这些结论都不难证明。对阈值函数类和区间函数类,前面已经求出了精确的增长函数;可以看到,Sauer 引理给出的上界非常紧。

命题 6。 式 (3) 中定义的线性分类器类的 VC 维为

前面的讨论已经对 证明了这一结论。一般情形的证明将出现在作业 1 中。

此时读者可能已经注意到,VC 维通常与函数类的参数个数一致。参数数量确实通常可以用来快速猜测 VC 维,而且大多数时候这一猜测都准确。但它并不总是正确。下面的例子中,一个仅有单个参数的函数类却具有无穷 VC 维。直观原因是,当 足够大时,函数 可以在一个很小的区间内任意多次振荡。具体证明参见作业 1。

命题 7。,并令

3.2 Sauer 引理的证明

证明。

我们对 归纳证明:当 时,

基础情形 是显然的:唯一可能的配置是 ,此时

接下来假设结论对所有满足 都成立,并证明 。当 时结论仍然显然,因此假设

对任意不同的输入集 ,令

个输入 上的投影;再令 满足

也就是说,对 的任意标记 ,把 标成任意一个标签后,所得 标记都能由 实现。显然,

现在,把 看作只定义在 上的两个函数类,因此每个函数只是 中的一个向量。显然,

其中最后一步使用了归纳假设,以及 的 VC 维不可能大于 的 VC 维这一事实。

另一方面,

其中最后一步使用了归纳假设,以及 的 VC 维至多为 这一事实。

确实,如果 的 VC 维大于 ,那么 中就存在一个大小为 、可被 打散的子集。根据 的构造,把 加到该子集中,就会得到一个大小为 、可被 打散的集合,这与条件 矛盾。

综合以上结果,

因为该式对任意 都成立,所以

归纳证明完成。

引理中的第二个不等式成立,是因为

证明完毕。

4 总结与闭环

本讲可以用下面这一系列取上界步骤概括:

其中,对二分类问题,;对回归问题, 是损失的 Lipschitz 常数; 是函数值绝对值的上界;

最终,我们发现:对二分类问题,有限 VC 维是可学习性的充分条件。但它是否也是必要条件?换言之,这一系列取上界步骤是否足够紧?

答案是肯定的:有限 VC 维也是可学习性的必要条件,因此我们基本形成了一个闭环。

事实上,如果函数类 具有无穷 VC 维,那么对任意 ,都能找到一个含 个元素、可被 打散的子集 。也就是说, 在该集合上的行为与 相同。

因此,完全复用第 1 讲“没有免费的午餐”定理的论证,可以得到:对任意算法,都能找到一个支撑在 上的分布 ,使该算法承受至少 的超额风险。这说明 不可学习。

这也意味着,对二分类问题,如果一个函数类可学习,那么它一定可以通过简单的 ERM 算法学习。

最后说明一点:对一般统计学习问题,这一结论并不总是成立。

[^1]: 为简化讨论,我们忽略 可能不存在的问题;该问题可以很容易地处理。

源码审计版本 lecture2-full-translation@2026-09-14