2026 年秋季学期,授课教师:Haipeng Luo
本文为 Lecture 2 课件的完整中文翻译。数学符号、定理编号、引理编号、命题编号、公式编号和证明结构均依照原文保留。
1 一致收敛与 Rademacher 复杂度
本讲重点研究 。如上一讲所述,它完全刻画了类 在批量/统计学习框架下的可学习性。我们将连续对这一博弈值作上界松弛,得到一个更容易处理的形式,并在最后说明这些上界非常紧。
回顾博弈值的定义:
其中, 遍历从 个训练样本到最终预测器 的所有映射或这些映射上的所有分布; 遍历 上的所有数据生成分布。
作为松弛这一博弈值的第一步,我们考虑一个非常简单的算法:输出经验风险最小化器(Empirical Risk Minimizer, ERM):
这里,经验风险就是训练集上的平均损失。为简化讨论,假设至少存在一个这样的最小化器;这基本不损失一般性。显然,此时
在继续讨论之前,先对 ERM 作两点说明。
第一,寻找 ERM 是一个定义明确的优化问题,并且已有许多成熟的优化算法。上一讲已经提到,这一优化层面不属于本课程范围。一般来说,寻找 ERM 甚至可能是 NP 困难的;这里我们只关注问题在统计意义上是否可学习,而不关注它在计算意义上是否容易求解。
第二,人们可能会问:既然仅最小化训练损失在实践中可能导致过拟合,为什么还要研究这个看似“朴素”、没有“正则化”的算法?答案是,对许多问题而言,正则化 ERM
等价于在更小的函数类上做 ERM:
其中 是另一个常数。因此,正则化本质上是一种隐式地在受限制的类上学习的方法,而这个受限制的类有望在统计意义上更容易学习。
1.1 经验过程与一致收敛
下面继续简化式 (1)。令
则有[^1]
这里,由 索引的一族随机变量
称为一个经验过程(empirical process)。这些随机变量中的每一个,都只是函数在从 随机抽取的输入上的期望值,与它在一组来自相同分布的 i.i.d. 输入上的经验平均值之差。
显然,这些随机变量均为零均值;根据大数定律,当 很大时,每一个都应该很小。然而,要断言式 (2) 很小,在某种意义上必须证明这些随机变量同时都小,而这是否成立取决于函数类 。
如果
就称 满足一致收敛(uniform convergence)。也就是说,对任意数据生成分布,只要 足够大,经验过程上确界的期望就可以任意小。由式 (2) 显然可知,如果 满足一致收敛,那么 可学习。
1.2 对称化与 Rademacher 复杂度
对给定的类 ,怎样判断经验过程的期望上确界是否很小?为了回答这一问题,我们将使用一个重要技巧——对称化(symmetrization)——进一步松弛该量,并得到 Rademacher 复杂度。
首先定义一个 Rademacher 随机变量 :它以相同概率取 和 。对函数类 以及任意输入序列 ,定义 在这些输入上的条件 Rademacher 复杂度:
其中 是 个 i.i.d. Rademacher 随机变量。
相对于支撑在 上的分布 , 的无条件 Rademacher 复杂度定义为
其中 是来自 的 个 i.i.d. 样本。
直观上,一个类的 Rademacher 复杂度衡量了它拟合随机符号的能力,因为当 与 同号时,相关项 很大。因此,Rademacher 复杂度越大,函数类的表达能力越强。
Rademacher 复杂度与经验过程的期望上确界之间的联系由下面的定理给出。
定理 1。 对任意数据生成分布 和任意函数类 ,都有
其中
证明。 按照定义,把 写成
从而得到
把期望 移到上确界之外,得到下面这个对称的上界:
接下来,我们声称有如下等式:
这一等式成立,是因为对序列 的每一种可能取值,
与
之间的差别,仅仅是在 时交换样例 与 。由于 和 服从相同分布,这种交换不会改变期望。
把上确界拆成两部分,可进一步得到上界
最后,注意 与 同分布,因此上面的两项都恰好等于
除以 后即得结论。
1.3 在监督学习中消去损失函数
对许多问题,特别是监督学习问题,分析 的 Rademacher 复杂度时,与损失函数有关的部分实际上并不那么重要,通常可以被消去。
具体而言,考虑 、 的监督学习问题。在下面两种情况下,可以很容易地联系 与 。
引理 1。 对 、使用 0-1 损失的二分类问题,对任意序列 ,都有
从而
证明。 根据定义,
最后一步使用了 Rademacher 变量均值为零的事实,以及对任意标签 ,随机变量
仍然是 i.i.d. Rademacher 随机变量这一事实。
引理 2(收缩引理)。 考虑一个 的回归问题,损失具有形式
其中 关于第一个参数是 -Lipschitz 的,即对任意 ,有
则对任意序列 ,都有
从而
证明。 根据定义,
先对最后一个 Rademacher 变量 的两个取值求平均,得到
其中最后一步使用了 的 -Lipschitz 性。由对称性,在 内去掉最后一个表达式中的绝对值并不会改变结果。再次拆开这个上确界,得到
依次对 重复这一过程,即得结论。
注意,常见问题通常都满足 Lipschitz 条件。以平方损失
为例。如果 ,显然该损失是 -Lipschitz 的。
2 有限类
先对目前的结果作一个简短总结。通过一系列取上界步骤,我们把统计学习问题的博弈值松弛为函数类的 Rademacher 复杂度:
其中,对二分类问题,;对回归问题, 是损失函数的 Lipschitz 常数。
现在已经清楚,要理解一个问题的可学习性,理解函数类的 Rademacher 复杂度 至关重要。那么,应当如何计算它?
我们先从一个简单但基础的情形开始: 是有限类。之后关于无限类的所有讨论,最终都会使用有限类的结果。所需的关键引理是次高斯随机变量的最大值不等式。
回顾:如果零均值随机变量 对所有 都满足
即其矩母函数被方差为 的零均值高斯变量的矩母函数控制,就称 是 -次高斯的。例如,任何取值范围为 的零均值随机变量都是 -次高斯的。这就是 Hoeffding 引理。
引理 3(最大值不等式)。 设 是有限个 -次高斯随机变量,则
证明。 对任意 ,有
整理可得
取
该选择使上界最小,并得到
证明完毕。
下面应用最大值不等式,控制有限类的 Rademacher 复杂度。
定理 2(Massart 引理)。 设 是有限类, 是任意输入集合,则
因此,如果对某个 有 ,那么
证明。 注意
其中
下面的计算说明 是 -次高斯的,其中
事实上,对任意 ,
第一步使用了 相互独立的事实;第二步使用了 是 -次高斯的事实。应用引理 3 即得结论。
上述定理说明,函数值被限制在 内的有限类都可学习,因为
当 趋于无穷时成立。事实上,它还给出了使用 ERM 学习时精确的 收敛量级。
读者可能注意到,也可以把最大值不等式直接应用于经验过程
而得到相同结论。但很快将看到,先在 Rademacher 复杂度上进行这一步为何十分重要。
3 无限类:分类
下面研究无限类的 Rademacher 复杂度。第一步考虑 的二分类问题。虽然引理 3 看起来不适用于无限类,但它实际上仍然会发挥关键作用。
主要观察如下:条件 Rademacher 复杂度可等价写成
其中
是 在输入集 上的投影。
虽然 是无限的,但 总是有限的,且其大小至多为 。基于这一直觉,定义 在 个输入上的增长函数:
它表示使用 中的函数对 个样本进行标记时,最多可能得到多少种不同标记。由前面的观察和引理 3,立即得到
增长函数的平凡上界是 。将其代入上式,只会得到一个常数量级的 Rademacher 复杂度。因此,要使 Rademacher 复杂度趋于零,需要函数类具有温和得多的增长函数。下面讨论两个例子。
命题 1。 令 ,并考虑阈值函数类
则
从而
证明。 对任意 , 把 左侧的所有点标为 ,把右侧的所有点标为 。显然,对实线上的任意 个不同点,从左到右可以得到的全部 种标记是
证明完毕。
命题 2。 令 ,并考虑区间函数类
则
从而
证明。 任意 个不同点把实线分成 个区域。把区间端点 和 放入其中任意两个不同区域,会得到 种标记。把两个端点放入同一个区域,无论选择哪个区域,都只会额外产生一种所有标签都为 的标记。
值得说明的是,在 Rademacher 复杂度定义中,把 替换为 非常直观且直接;但不能对 或它的上界
直接进行同样的替换,因为 对 的依赖并不只通过 体现。
这凸显了通过对称化把上述量松弛为 Rademacher 复杂度的重要性,也解释了为什么在有限类情形下,我们没有直接把最大值不等式应用于经验过程。
3.1 VC 维与 Sauer 引理
增长函数是一种刻画函数类复杂度的良好方式,但并不总是容易计算。考虑 ,以及线性分类器类
其中,当 时 ,否则为 。这个类的 是多少?
为简化讨论,先从 开始。很明显,对任意 ,都能找到 个点,使 实现全部 种标记,因此
当 时又如何?首先有 ,因为对二维平面中的任意四个点,线性分类器都不可能实现全部 种标记。读者可以尝试说服自己这一点。
但是, 的准确值是多少?花一些时间或许也能算出来;可 、,以及任意 时的 呢?是否必须逐个求出这些值,进行这样繁琐的计算?
略显意外的是,前面提到的两个事实
已经足以对任意 的 导出相当紧的上界。为说明这一结果,先给出几个定义。
如果
即 能实现该输入集的全部 种标记,就称 打散(shatter)输入集 。
的 Vapnik–Chervonenkis(VC)维定义为能被 打散的最大输入集大小,即
如果该集合为空,则定义 ;如果该集合不是有限的,即对所有 都有 ,则定义 。
例如,前面讨论的二维线性分类器的 VC 维为 。下面这个奠基性结果建立了函数类增长函数与 VC 维之间的联系;证明推迟到下一小节。
引理 4(Sauer 引理)。 对 VC 维为有限值 的函数类 ,任意 都满足
根据 VC 维的定义,对任意 ,显然有 。Sauer 引理说明,一旦 大于 ,增长函数就会发生相变:原来的指数增长 突然变为多项式增长,大约为 。
结合前面的讨论,得到
这说明 VC 维有限的类总是可学习的。
需要强调的是,为证明 ,恰好需要证明两件事:
- 。也就是说,给出一个大小为 的具体输入集,并证明 能在该集合上实现所有可能的标记;
- 。也就是说,证明对任意大小为 的输入集,都存在一种 无法实现的标记。
这通常比求任意 的增长函数容易,正如在线性分类器例子中所看到的。下面给出更多例子。
命题 3。 一个函数类的 VC 维为 ,当且仅当它只包含一个函数。
命题 4。 命题 1 中定义的阈值函数类的 VC 维为 。
命题 5。 命题 2 中定义的区间函数类的 VC 维为 。
这些结论都不难证明。对阈值函数类和区间函数类,前面已经求出了精确的增长函数;可以看到,Sauer 引理给出的上界非常紧。
命题 6。 式 (3) 中定义的线性分类器类的 VC 维为 。
前面的讨论已经对 证明了这一结论。一般情形的证明将出现在作业 1 中。
此时读者可能已经注意到,VC 维通常与函数类的参数个数一致。参数数量确实通常可以用来快速猜测 VC 维,而且大多数时候这一猜测都准确。但它并不总是正确。下面的例子中,一个仅有单个参数的函数类却具有无穷 VC 维。直观原因是,当 足够大时,函数 可以在一个很小的区间内任意多次振荡。具体证明参见作业 1。
命题 7。 令 ,并令
则
3.2 Sauer 引理的证明
证明。 记
我们对 归纳证明:当 时,
基础情形 是显然的:唯一可能的配置是 、,此时
接下来假设结论对所有满足 且 的 都成立,并证明 。当 时结论仍然显然,因此假设
对任意不同的输入集 ,令
为 在 个输入 上的投影;再令 满足
也就是说,对 的任意标记 ,把 标成任意一个标签后,所得 标记都能由 实现。显然,
现在,把 和 看作只定义在 上的两个函数类,因此每个函数只是 中的一个向量。显然,
其中最后一步使用了归纳假设,以及 的 VC 维不可能大于 的 VC 维这一事实。
另一方面,
其中最后一步使用了归纳假设,以及 的 VC 维至多为 这一事实。
确实,如果 的 VC 维大于 ,那么 中就存在一个大小为 、可被 打散的子集。根据 的构造,把 加到该子集中,就会得到一个大小为 、可被 打散的集合,这与条件 矛盾。
综合以上结果,
因为该式对任意 都成立,所以
归纳证明完成。
引理中的第二个不等式成立,是因为
证明完毕。
4 总结与闭环
本讲可以用下面这一系列取上界步骤概括:
其中,对二分类问题,;对回归问题, 是损失的 Lipschitz 常数; 是函数值绝对值的上界;。
最终,我们发现:对二分类问题,有限 VC 维是可学习性的充分条件。但它是否也是必要条件?换言之,这一系列取上界步骤是否足够紧?
答案是肯定的:有限 VC 维也是可学习性的必要条件,因此我们基本形成了一个闭环。
事实上,如果函数类 具有无穷 VC 维,那么对任意 ,都能找到一个含 个元素、可被 打散的子集 。也就是说, 在该集合上的行为与 相同。
因此,完全复用第 1 讲“没有免费的午餐”定理的论证,可以得到:对任意算法,都能找到一个支撑在 上的分布 ,使该算法承受至少 的超额风险。这说明 不可学习。
这也意味着,对二分类问题,如果一个函数类可学习,那么它一定可以通过简单的 ERM 算法学习。
最后说明一点:对一般统计学习问题,这一结论并不总是成立。
[^1]: 为简化讨论,我们忽略 可能不存在的问题;该问题可以很容易地处理。