2026 年秋季学期,授课教师:Haipeng Luo
本文为 Lecture 3 课件的完整中文翻译。数学符号、定理编号、命题编号和证明结构均依照原文保留。
1 无限函数类:回归
在本讲中,我们继续研究如何刻画统计学习的可学习性。回顾上一讲,通过一系列取上界的步骤,我们得到
其中,对于二分类问题,;对于回归损失, 是其 Lipschitz 常数。对于函数值被限制在 内的有限函数类,我们应用最大值不等式,得到
基于这个结果,我们还讨论了如下事实:对于二分类问题 ,真正重要的只有投影
因此,可以通过引入函数类的增长函数和 VC 维,把无限类的情形化为有限类的情形。具体而言,我们证明了:若 ,则
本讲将注意力转向具有实值函数类的回归问题。不失一般性,我们假设输出已被归一化,使得
显然,关键仍然是理解 Rademacher complexity 。然而,因为 是一个实值函数类,它的投影
通常也是无限集合,因此我们不能直接应用有限类的结果。
解决这个问题的一个相当自然的想法,是用有限的离散化来近似无限函数类。实现这种想法有多种不同方式,下面讨论其中两种。
1.1 覆盖函数
第一种想法是构造一个有限函数类 ,使得对于每一个 ,都存在一个对应的代表函数 ,且 与 很接近。例如,可以用两个函数之间最大的逐点差异
来衡量它们的接近程度。
基于这一直觉,我们定义:如果有限函数类 满足,对于任意 ,都存在 ,使得对所有 都有
那么称 是 的一个逐点 -覆盖。相应地, 的逐点 -覆盖数定义为
如果不存在这样的有限覆盖,则将覆盖数定义为无穷大。显然, 关于 单调不增。
借助这个定义,我们可以再次把无限类的情形化为有限类的情形,并立即得到下面的结果。
定理 1。 对任意 ,都有
证明。 固定任意 。令 是 的一个逐点 -覆盖,其大小为 。对于每个 ,令 表示 的“代表”,满足
于是有
其中最后一步使用了 Massart 引理。因为这个结论对任意 都成立,所以定理得证。
自然地,这个上界体现了近似尺度 与覆盖大小之间的某种权衡。那么,逐点覆盖数可能有多大呢?
首先考虑线性情形:
其中 、,并且
这里
是 维 -范数单位球, 的定义类似。条件 意味着 是 的对偶范数,反之亦然。由 Hölder 不等式,
这个函数类涵盖了许多常见问题,例如带正则化的线性回归。我们先考察 (从而 )时逐点覆盖数的大小。
命题 1。 令
对于任意 ,都有
此外,当 时,
证明。 注意 就是一个边长为 2 的 维超立方体。固定任意 。我们把这个超立方体“均匀地”离散成
个互不相交、边长为 的小超立方体,并令 为由这些小超立方体的中心参数化的线性函数集合。
显然, 是 的逐点 -覆盖。事实上,对任意 ,令 是包含 的小超立方体的中心,并令 为相应的线性函数。于是,对任意 ,都有
这就证明了第一个结论。第二个结论通过应用定理 1,并取
得到。
脚注 1。 严格地说, 应写为 。我们忽略这一细微差别,因为它不会造成实质影响。
这意味着上面的线性函数类是可学习的;通过 ERM 可以得到大约 的学习速率。
对于一般的 ,容易看出
因此,如果仍然使用命题 1 的证明中构造的函数类 作为逐点覆盖,那么对任意 及其代表 ,以及任意 ,都有
这意味着 是一个逐点 -覆盖,从而逐点覆盖数满足
因此,对任意 ,这个线性函数类都是可学习的。
不过,在处理 -范数球 时,直觉上我们也应该用小的 -范数球来离散化它,而不是使用小超立方体。这样也许能够得到更小的覆盖。下一个命题表明,这一想法确实正确;但是,显式构造这样的覆盖似乎相当困难。幸运的是,证明会说明:有时即使不显式构造覆盖,也能给出覆盖数的上界。
命题 2。 若
其中 、,且 ,则对于任意 ,都有
此外,当 时,
证明。 固定任意 。记 为半径为 的 -范数球。关键想法是:在球 中放入尽可能多的、半径为 的小球 。
形式化地,令 是满足下述条件的最大子集:对任意两个不同的点 ,都有
这称为 的一个 -packing。
首先证明,相应的函数类
是 的一个逐点 -覆盖。事实上,对于任意 ,必然存在 ,使得
否则,仍可把 加入 ,同时保持 是一个 -packing,这与 的最大性矛盾。于是,对任意 ,显然有
剩下只需证明
为此,设想以 中的每个点为圆心,放置一个半径为 的 -范数球。由 的定义,这些球两两不相交。另一方面,它们全部包含在更大的球
之中。因此,所有小球的体积之和不超过大球的体积:
利用
并整理,可得
最后,再次应用定理 1 并取
便得到关于 的上界。
在作业 1 中,你还将使用类似的体积论证,证明对于这个线性函数类,量级为
的覆盖数是紧的。
接下来考虑一个非参数例子:,并令 为所有单调不减函数的集合。这个函数类常见于所谓的等序回归问题;在这类问题中,假设输出随输入单调变化是十分自然的。例如,可以把儿童身高预测为年龄的函数。
在这种情况下, 看起来是一个表达能力很强的函数类。事实上,如下面的命题所示,它的逐点覆盖数是无穷大。
命题 3。 若
且 是所有单调不减函数的集合,则对于任意 ,都有
证明。 考虑 的如下无穷子集:
不可能用同一个函数 逐点覆盖其中任意两个不同的函数 和 。这是因为
因此, 不可能同时与 和 的距离都不超过 。这说明 不存在有限的逐点覆盖。
这是否意味着该函数类不可学习呢?答案是否定的,下一节将说明这一点。重要的是,这表明逐点覆盖事实上并不是正确的复杂度度量,或者至少不是一个紧的复杂度度量。
1.2 覆盖投影
回顾一下:与分类问题中一样,对称化使我们只需要关注投影 ,而不必关注整个函数类 。这促使我们近似离散化 维空间 ,而不是离散化 本身。
形式化地,如果 满足:对任意 ,都存在 ,使得
那么称 是 关于 范数的一个 -覆盖。
注意,这里略微滥用了符号 :此时它表示一个 维向量,而在前文中它也表示 中的函数。关于 范数的 -覆盖数 ,定义为最小 范数 -覆盖的大小。
事实上,更仔细地检查定理 1 的证明后可以发现,我们不一定需要 覆盖。为此,对于任意 ,如果 满足:对任意 ,都存在 ,使得
或者等价地,
那么称 是 关于 范数的一个 -覆盖。
类似地,相应的 -覆盖数 ,定义为最小 范数 -覆盖的大小。
注意,这个定义中存在一个看起来有些“奇怪”但实际上是惯例的归一化。这个归一化保证
是 的单调递增函数;你可以通过 Hölder 不等式证明这一点。因此,
使用与定理 1 的证明相似的论证,可以得到下面的结果。
定理 2。 对任意 以及输入 ,都有
证明。 固定任意 。令 是 的一个 -覆盖,其大小为 。对于每个 ,令 是它的“代表”,满足
记 ,则
最后一步使用了 Massart 引理。因为这个结论对任意 都成立,所以定理得证。
现在来看为什么覆盖投影优于覆盖函数。
首先,由于 位于 中,类似上一节的做法,把 离散成小超立方体,就可以很容易地证明
总是成立。然而,这个上界没有用处,因为把它代入定理 2 的上界后,只能得到 Rademacher complexity 的常数级上界。
其次,如果 是 的逐点 -覆盖,那么根据定义, 也是 关于 范数的 -覆盖。因此,
也就是说,覆盖投影永远不会比覆盖函数更差。
所以,对于前面讨论的线性函数类
同样有
事实上,不难看出,更一般地,只要 位于 的某个 维子空间中,它的覆盖数大致就是
的量级;参见作业 1。
最后,我们回到单调不减函数类,并说明:虽然 ,但 是有限的。这意味着,覆盖投影严格优于覆盖函数。
命题 4。 若
且 是所有单调不减函数的集合,则对于任意 ,都有
因此,
证明。 不失一般性,假设
令 是尺度为 的一个有限离散化,使得
并且对于任意 ,都存在 ,满足
令
根据构造,显然 是 关于 范数的一个 -覆盖。剩下只需计算 的大小。
不难看出, 恰好等于方程
的非负整数解 的数量,其中 表示 中第 小的元素在序列中出现的次数。解的精确数量是
不过,只需注意每个 最多有 种可能取值,就可以得到粗略估计
关于 Rademacher complexity 的上界,则通过直接应用定理 2 并选取最优的 得到。
这个结果说明,虽然所有单调不减函数组成的类看起来表达能力很强,但它事实上仍然可以通过 ERM 学习。这也再次展示了对称化技巧的重要性:它使我们只需关注函数类在样本上的投影,而不是函数本身。
最后需要指出,无论使用哪一种覆盖,覆盖论证都只出现在分析中,而不出现在算法本身。算法始终只是 ERM;即使对于等序回归这样的任务,ERM 也可能非常高效。
2 Dudley 熵积分
读者可能已经注意到,命题 4 给出的收敛速率大约是 ,慢于此前其他例子中常见的 速率。
这是否真的意味着,学习单调不减函数需要更多样本?还是仅仅因为我们的上界太松?事实证明,后者才是正确答案。为了改进这个上界,需要使用一种更紧的分析,即所谓的 Dudley 熵积分。
定理 3。 对任意 以及输入 ,都有
证明推迟到下一小节。上述定理中的上界被称为函数类 的 Dudley 熵积分。“对数覆盖数”经常被称为度量熵,这也是该名称的由来。
这个上界使用的是 覆盖数,原因将在证明中变得清楚;此外,它同时考察多个不同尺度下的覆盖数。
忽略常数以及 和 之间的差别,这个上界不会比定理 2 给出的上界更差。原因是
关于 单调不增,因此
不过,它有可能严格更好,下面两个例子就说明了这一点。
命题 5。 若
其中 、,并且 ,则
证明。 使用上界
因此,
当 时,右侧是 ,因为
将这个结果代入 Dudley 熵积分并取 ,即可完成证明。
脚注 2。 更一般地,如果函数的值域不是 ,只需把定理中“”和“”里的 1 替换为 。作业 1 的第 1(b) 题会用到这个更一般的版本。
因此,使用 Dudley 熵积分可以消除命题 2 中线性函数 Rademacher complexity 上界里额外的 因子。下一个例子中的改进会更加显著。
命题 6。 若
且 是所有单调不减函数的集合,则
证明。 再次直接代入上界
并计算 Dudley 熵积分:
取 即完成证明。
这说明,学习单调不减函数的速率仍然大约是 ,而不是 。这展示了 Dudley 熵积分的力量。
2.1 Chaining 技巧
定理 3 的证明。 证明依赖于一个重要的 chaining 技巧,它同时考察不同的覆盖尺度。
具体地,对于
其中 稍后指定,令
并令 是 的一个关于 范数的 -覆盖,其大小为
另外,令 是 的平凡 -覆盖,其中只包含全零向量。
现在,对于每个 ,可以把它与一条代表链
关联起来,使得
记 ,则
其中
上式最后一行中的第一项至多为 。这是因为,根据 Cauchy-Schwarz 不等式,
对于第二项,再次应用 Massart 引理:
其中
对于任意 ,存在某个 ,使得
且
因此,
这说明
于是,
最后一步使用了
关于 单调不增这一事实。
最后,对于任意 ,选择 使得
于是
因此,
对于 的情形,令 ,即可得到相同的上界。
注意,使用 范数覆盖的关键原因是: 的定义使用了 范数,而这继承自最大值不等式。
小结
总结一下,我们已经利用覆盖数,推导了实值函数类 Rademacher complexity 的三种不同上界;同时还使用两个贯穿始终的例子,说明每种上界能够达到怎样的效果。下表给出了总结。
表 1:利用覆盖数得到的 Rademacher complexity 上界总结
| 的上界 | 线性函数 | 单调不减函数 |
|---|---|---|
| | | | | | | |
3 组合参数:伪维数
注意,覆盖数所扮演的角色与分类问题中的增长函数非常相似。对于分类问题,我们还引入了 VC 维:它是函数类的一个组合参数,可能更容易求出,并且通过 Sauer 引理直接给出增长函数的上界。
这自然引出了一个问题:对于实值函数类,我们能否也提出某种组合参数,并用它直接控制覆盖数?
这样的组合参数的确存在。文献中最早出现的这类参数是伪维数,它基于一个非常自然的想法:通过观察实值函数的上图集,把实值函数化为二分类器。
具体而言,一个函数
自然地把空间
分为两个部分:
- 满足 的部分,这部分称为 的上图集;
- 满足 的部分。
因此,可以把 看作空间 上的一个二分类器。
的伪维数,直接定义为由此诱导出的二分类器类的 VC 维:
如果把 VC 维的定义完全展开,那么伪维数就是满足下面条件的最大整数 :存在 个输入-输出点对
使得对于任意标记
都存在 ,使得对于所有 ,都有
可以尝试在 的情形下画一幅图,以帮助理解这个定义。
再次以线性函数类为例:
其中 、,且
为了判断这个函数类的伪维数有多大,需要考察下列分类器类的 VC 维:
这个函数类与第 2 讲以及作业 1 中讨论的线性分类器类非常相似。不难验证,它的 VC 维恰好是 。因此,
有限的伪维数足以保证可学习性。事实上,可以证明一个类似 Sauer 引理的结论:忽略一些对数因子,
的量级为
这里不证明这一事实;但把这个上界直接代入定理 2,就可以得到
还要注意,对于线性函数类,这与表 1 中的上界几乎相同。
然而,有限的伪维数并不是可学习性的必要条件。为了说明这一点,再次考察所有单调不减函数组成的类。
我们声称:虽然这个函数类是可学习的,这一点已经在前面证明过,但它实际上具有无穷大的伪维数。这意味着,伪维数并不是“正确的”复杂度度量。
事实上,对于任意 ,考虑下列输入-输出点对:
对于任意标记
只要
我们总能找到一个单调不减函数,使它依次通过这些点:
显然,这样的函数对所有 都满足
这说明,诱导出的二分类器类能够打散任意大小的这类训练集,因此其伪维数是无穷大。
应该怎样解决这个问题?是否存在一个更好的组合参数,使得它的有限性成为可学习性的必要条件?这些问题将在下一讲中回答。