项目目录

CSCI 678 / 课程笔记

Lecture 3 课件完整翻译

Lecture 3 课件的完整中文翻译:覆盖函数、覆盖投影、Dudley 熵积分与 chaining 技巧、伪维数。数学符号、定理编号与证明结构均依照原文保留。

进行中

2026 年秋季学期,授课教师:Haipeng Luo

本文为 Lecture 3 课件的完整中文翻译。数学符号、定理编号、命题编号和证明结构均依照原文保留。

1 无限函数类:回归

在本讲中,我们继续研究如何刻画统计学习的可学习性。回顾上一讲,通过一系列取上界的步骤,我们得到

其中,对于二分类问题,;对于回归损失, 是其 Lipschitz 常数。对于函数值被限制在 内的有限函数类,我们应用最大值不等式,得到

基于这个结果,我们还讨论了如下事实:对于二分类问题 ,真正重要的只有投影

因此,可以通过引入函数类的增长函数和 VC 维,把无限类的情形化为有限类的情形。具体而言,我们证明了:若 ,则

本讲将注意力转向具有实值函数类的回归问题。不失一般性,我们假设输出已被归一化,使得

显然,关键仍然是理解 Rademacher complexity 。然而,因为 是一个实值函数类,它的投影

通常也是无限集合,因此我们不能直接应用有限类的结果。

解决这个问题的一个相当自然的想法,是用有限的离散化来近似无限函数类。实现这种想法有多种不同方式,下面讨论其中两种。

1.1 覆盖函数

第一种想法是构造一个有限函数类 ,使得对于每一个 ,都存在一个对应的代表函数 ,且 很接近。例如,可以用两个函数之间最大的逐点差异

来衡量它们的接近程度。

基于这一直觉,我们定义:如果有限函数类 满足,对于任意 ,都存在 ,使得对所有 都有

那么称 的一个逐点 -覆盖。相应地, 的逐点 -覆盖数定义为

如果不存在这样的有限覆盖,则将覆盖数定义为无穷大。显然, 关于 单调不增。

借助这个定义,我们可以再次把无限类的情形化为有限类的情形,并立即得到下面的结果。

定理 1。 对任意 ,都有

证明。 固定任意 。令 的一个逐点 -覆盖,其大小为 。对于每个 ,令 表示 的“代表”,满足

于是有

其中最后一步使用了 Massart 引理。因为这个结论对任意 都成立,所以定理得证。

自然地,这个上界体现了近似尺度 与覆盖大小之间的某种权衡。那么,逐点覆盖数可能有多大呢?

首先考虑线性情形:

其中 ,并且

这里

-范数单位球, 的定义类似。条件 意味着 的对偶范数,反之亦然。由 Hölder 不等式,

这个函数类涵盖了许多常见问题,例如带正则化的线性回归。我们先考察 (从而 )时逐点覆盖数的大小。

命题 1。

对于任意 ,都有

此外,当 时,

证明。 注意 就是一个边长为 2 的 维超立方体。固定任意 。我们把这个超立方体“均匀地”离散成

个互不相交、边长为 的小超立方体,并令 为由这些小超立方体的中心参数化的线性函数集合。

显然, 的逐点 -覆盖。事实上,对任意 ,令 是包含 的小超立方体的中心,并令 为相应的线性函数。于是,对任意 ,都有

这就证明了第一个结论。第二个结论通过应用定理 1,并取

得到。

脚注 1。 严格地说, 应写为 。我们忽略这一细微差别,因为它不会造成实质影响。

这意味着上面的线性函数类是可学习的;通过 ERM 可以得到大约 的学习速率。

对于一般的 ,容易看出

因此,如果仍然使用命题 1 的证明中构造的函数类 作为逐点覆盖,那么对任意 及其代表 ,以及任意 ,都有

这意味着 是一个逐点 -覆盖,从而逐点覆盖数满足

因此,对任意 ,这个线性函数类都是可学习的。

不过,在处理 -范数球 时,直觉上我们也应该用小的 -范数球来离散化它,而不是使用小超立方体。这样也许能够得到更小的覆盖。下一个命题表明,这一想法确实正确;但是,显式构造这样的覆盖似乎相当困难。幸运的是,证明会说明:有时即使不显式构造覆盖,也能给出覆盖数的上界。

命题 2。

其中 ,且 ,则对于任意 ,都有

此外,当 时,

证明。 固定任意 。记 为半径为 -范数球。关键想法是:在球 中放入尽可能多的、半径为 的小球

形式化地,令 是满足下述条件的最大子集:对任意两个不同的点 ,都有

这称为 的一个 -packing。

首先证明,相应的函数类

的一个逐点 -覆盖。事实上,对于任意 ,必然存在 ,使得

否则,仍可把 加入 ,同时保持 是一个 -packing,这与 的最大性矛盾。于是,对任意 ,显然有

剩下只需证明

为此,设想以 中的每个点为圆心,放置一个半径为 -范数球。由 的定义,这些球两两不相交。另一方面,它们全部包含在更大的球

之中。因此,所有小球的体积之和不超过大球的体积:

利用

并整理,可得

最后,再次应用定理 1 并取

便得到关于 的上界。

在作业 1 中,你还将使用类似的体积论证,证明对于这个线性函数类,量级为

的覆盖数是紧的。

接下来考虑一个非参数例子:,并令 为所有单调不减函数的集合。这个函数类常见于所谓的等序回归问题;在这类问题中,假设输出随输入单调变化是十分自然的。例如,可以把儿童身高预测为年龄的函数。

在这种情况下, 看起来是一个表达能力很强的函数类。事实上,如下面的命题所示,它的逐点覆盖数是无穷大。

命题 3。

是所有单调不减函数的集合,则对于任意 ,都有

证明。 考虑 的如下无穷子集:

不可能用同一个函数 逐点覆盖其中任意两个不同的函数 。这是因为

因此, 不可能同时与 的距离都不超过 。这说明 不存在有限的逐点覆盖。

这是否意味着该函数类不可学习呢?答案是否定的,下一节将说明这一点。重要的是,这表明逐点覆盖事实上并不是正确的复杂度度量,或者至少不是一个紧的复杂度度量。

1.2 覆盖投影

回顾一下:与分类问题中一样,对称化使我们只需要关注投影 ,而不必关注整个函数类 。这促使我们近似离散化 维空间 ,而不是离散化 本身。

形式化地,如果 满足:对任意 ,都存在 ,使得

那么称 关于 范数的一个 -覆盖。

注意,这里略微滥用了符号 :此时它表示一个 维向量,而在前文中它也表示 中的函数。关于 范数的 -覆盖数 ,定义为最小 范数 -覆盖的大小。

事实上,更仔细地检查定理 1 的证明后可以发现,我们不一定需要 覆盖。为此,对于任意 ,如果 满足:对任意 ,都存在 ,使得

或者等价地,

那么称 关于 范数的一个 -覆盖。

类似地,相应的 -覆盖数 ,定义为最小 范数 -覆盖的大小。

注意,这个定义中存在一个看起来有些“奇怪”但实际上是惯例的归一化。这个归一化保证

的单调递增函数;你可以通过 Hölder 不等式证明这一点。因此,

使用与定理 1 的证明相似的论证,可以得到下面的结果。

定理 2。 对任意 以及输入 ,都有

证明。 固定任意 。令 的一个 -覆盖,其大小为 。对于每个 ,令 是它的“代表”,满足

,则

最后一步使用了 Massart 引理。因为这个结论对任意 都成立,所以定理得证。

现在来看为什么覆盖投影优于覆盖函数。

首先,由于 位于 中,类似上一节的做法,把 离散成小超立方体,就可以很容易地证明

总是成立。然而,这个上界没有用处,因为把它代入定理 2 的上界后,只能得到 Rademacher complexity 的常数级上界。

其次,如果 的逐点 -覆盖,那么根据定义, 也是 关于 范数的 -覆盖。因此,

也就是说,覆盖投影永远不会比覆盖函数更差。

所以,对于前面讨论的线性函数类

同样有

事实上,不难看出,更一般地,只要 位于 的某个 维子空间中,它的覆盖数大致就是

的量级;参见作业 1。

最后,我们回到单调不减函数类,并说明:虽然 ,但 是有限的。这意味着,覆盖投影严格优于覆盖函数。

命题 4。

是所有单调不减函数的集合,则对于任意 ,都有

因此,

证明。 不失一般性,假设

是尺度为 的一个有限离散化,使得

并且对于任意 ,都存在 ,满足

根据构造,显然 关于 范数的一个 -覆盖。剩下只需计算 的大小。

不难看出, 恰好等于方程

的非负整数解 的数量,其中 表示 中第 小的元素在序列中出现的次数。解的精确数量是

不过,只需注意每个 最多有 种可能取值,就可以得到粗略估计

关于 Rademacher complexity 的上界,则通过直接应用定理 2 并选取最优的 得到。

这个结果说明,虽然所有单调不减函数组成的类看起来表达能力很强,但它事实上仍然可以通过 ERM 学习。这也再次展示了对称化技巧的重要性:它使我们只需关注函数类在样本上的投影,而不是函数本身。

最后需要指出,无论使用哪一种覆盖,覆盖论证都只出现在分析中,而不出现在算法本身。算法始终只是 ERM;即使对于等序回归这样的任务,ERM 也可能非常高效。

2 Dudley 熵积分

读者可能已经注意到,命题 4 给出的收敛速率大约是 ,慢于此前其他例子中常见的 速率。

这是否真的意味着,学习单调不减函数需要更多样本?还是仅仅因为我们的上界太松?事实证明,后者才是正确答案。为了改进这个上界,需要使用一种更紧的分析,即所谓的 Dudley 熵积分

定理 3。 对任意 以及输入 ,都有

证明推迟到下一小节。上述定理中的上界被称为函数类 的 Dudley 熵积分。“对数覆盖数”经常被称为度量熵,这也是该名称的由来。

这个上界使用的是 覆盖数,原因将在证明中变得清楚;此外,它同时考察多个不同尺度下的覆盖数。

忽略常数以及 之间的差别,这个上界不会比定理 2 给出的上界更差。原因是

关于 单调不增,因此

不过,它有可能严格更好,下面两个例子就说明了这一点。

命题 5。

其中 ,并且 ,则

证明。 使用上界

因此,

时,右侧是 ,因为

将这个结果代入 Dudley 熵积分并取 ,即可完成证明。

脚注 2。 更一般地,如果函数的值域不是 ,只需把定理中“”和“”里的 1 替换为 。作业 1 的第 1(b) 题会用到这个更一般的版本。

因此,使用 Dudley 熵积分可以消除命题 2 中线性函数 Rademacher complexity 上界里额外的 因子。下一个例子中的改进会更加显著。

命题 6。

是所有单调不减函数的集合,则

证明。 再次直接代入上界

并计算 Dudley 熵积分:

即完成证明。

这说明,学习单调不减函数的速率仍然大约是 ,而不是 。这展示了 Dudley 熵积分的力量。

2.1 Chaining 技巧

定理 3 的证明。 证明依赖于一个重要的 chaining 技巧,它同时考察不同的覆盖尺度。

具体地,对于

其中 稍后指定,令

并令 的一个关于 范数的 -覆盖,其大小为

另外,令 的平凡 -覆盖,其中只包含全零向量。

现在,对于每个 ,可以把它与一条代表链

关联起来,使得

,则

其中

上式最后一行中的第一项至多为 。这是因为,根据 Cauchy-Schwarz 不等式,

对于第二项,再次应用 Massart 引理:

其中

对于任意 ,存在某个 ,使得

因此,

这说明

于是,

最后一步使用了

关于 单调不增这一事实。

最后,对于任意 ,选择 使得

于是

因此,

对于 的情形,令 ,即可得到相同的上界。

注意,使用 范数覆盖的关键原因是: 的定义使用了 范数,而这继承自最大值不等式。

小结

总结一下,我们已经利用覆盖数,推导了实值函数类 Rademacher complexity 的三种不同上界;同时还使用两个贯穿始终的例子,说明每种上界能够达到怎样的效果。下表给出了总结。

表 1:利用覆盖数得到的 Rademacher complexity 上界总结

的上界线性函数单调不减函数

| | | | | | | |

3 组合参数:伪维数

注意,覆盖数所扮演的角色与分类问题中的增长函数非常相似。对于分类问题,我们还引入了 VC 维:它是函数类的一个组合参数,可能更容易求出,并且通过 Sauer 引理直接给出增长函数的上界。

这自然引出了一个问题:对于实值函数类,我们能否也提出某种组合参数,并用它直接控制覆盖数?

这样的组合参数的确存在。文献中最早出现的这类参数是伪维数,它基于一个非常自然的想法:通过观察实值函数的上图集,把实值函数化为二分类器。

具体而言,一个函数

自然地把空间

分为两个部分:

  • 满足 的部分,这部分称为 的上图集;
  • 满足 的部分。

因此,可以把 看作空间 上的一个二分类器。

的伪维数,直接定义为由此诱导出的二分类器类的 VC 维:

如果把 VC 维的定义完全展开,那么伪维数就是满足下面条件的最大整数 :存在 个输入-输出点对

使得对于任意标记

都存在 ,使得对于所有 ,都有

可以尝试在 的情形下画一幅图,以帮助理解这个定义。

再次以线性函数类为例:

其中 ,且

为了判断这个函数类的伪维数有多大,需要考察下列分类器类的 VC 维:

这个函数类与第 2 讲以及作业 1 中讨论的线性分类器类非常相似。不难验证,它的 VC 维恰好是 。因此,

有限的伪维数足以保证可学习性。事实上,可以证明一个类似 Sauer 引理的结论:忽略一些对数因子,

的量级为

这里不证明这一事实;但把这个上界直接代入定理 2,就可以得到

还要注意,对于线性函数类,这与表 1 中的上界几乎相同。

然而,有限的伪维数并不是可学习性的必要条件。为了说明这一点,再次考察所有单调不减函数组成的类。

我们声称:虽然这个函数类是可学习的,这一点已经在前面证明过,但它实际上具有无穷大的伪维数。这意味着,伪维数并不是“正确的”复杂度度量。

事实上,对于任意 ,考虑下列输入-输出点对:

对于任意标记

只要

我们总能找到一个单调不减函数,使它依次通过这些点:

显然,这样的函数对所有 都满足

这说明,诱导出的二分类器类能够打散任意大小的这类训练集,因此其伪维数是无穷大。

应该怎样解决这个问题?是否存在一个更好的组合参数,使得它的有限性成为可学习性的必要条件?这些问题将在下一讲中回答。

源码审计版本 lecture3-full-translation@2026-09-11