项目目录

CSCI 678 / 课程笔记

Lecture 2 详细讲解报告:一致收敛与 Rademacher 复杂度

逐节展开 Lecture 2:从 ERM 的 minimax 上界到对称化、Rademacher 复杂度、Massart 引理、增长函数与 VC 维,含课件省略的辅助证明。

进行中
根据 Haipeng Luo 的 Lecture 2(2026 年秋季,原课件 8 页)展开。沿用 Lecture 3 讲解报告的形式,覆盖定理 1、2,引理 1–4,命题 1–7,以及讲义省略的辅助证明。每一步尽量说明使用的条件和它在整体论证中的作用。 原课件:lecture2.pdf(未在线发布)。本站配套:课件完整翻译;前后衔接:Lecture 1Lecture 3。默认函数类非空,必要的可测性、可积性成立;涉及有界集中界时另行写出有界条件。不假设所有优化问题都能高效求解。

阅读导航:把难求的 minimax 值逐步变成可计算的复杂度

Lecture 1 已定义学习的目标,但 很难直接计算。本讲通过一条上界链把它转成经验过程、Rademacher 复杂度,最后转成函数数量或 VC 维。

步骤使用的方法它解决的困难
固定算法为 ERM最小化经验风险不再优化所有可能算法
用统一偏差控制 ERM经验过程不必直接分析训练结果的具体形式
对称化引入独立副本和随机符号去掉难处理的总体风险项
去掉损失函数分类恒等式、Lipschitz 收缩把损失类转成预测函数类
有限类最大值不等式次高斯、Massart用函数数量的对数控制复杂度
无限二分类类投影增长函数无限个函数在有限样本上只有有限种行为
Sauer 引理VC 维用一个组合参数控制所有样本量的增长函数
无免费午餐反证无限 VC 维 ⇒ 恒定下界证明条件不仅充分,而且必要

本讲最终“闭环”的是二分类可学习性条件;并没有证明每个中间上界都在精确常数、对数因子或任意损失问题上最优。

1. 起点:ERM 为什么给出 minimax 上界

1.1 风险和博弈值

,定义

学习的博弈值为

算法可能有内部随机性,期望默认也包括它。

ERM 选择

因为对所有算法取 infimum 不大于任意一个具体算法的最坏误差,

这只是上界,不是声称一开始已经知道 ERM 最优。分析成功后才能说明 ERM 足以实现相应可学习性。

1.2 最小值不取到怎么办

即使 argmin 不存在,也可选择近似 ERM:

后文风险界只需加 。总体风险最优值不取到时,则用固定的 -最优函数比较,最后让 。因此存在性简写通常不会改变统计结论,但“可选择可测算法”仍是需要满足的技术条件。

1.3 正则化与约束类:补全论证并说明限制

最小化

。若有 满足 ,那么

矛盾。所以 也是约束类 上的 ERM。

这证明了“给定惩罚最优解,可以找到一个约束半径解释它”。但这里 可能依赖数据;反向“每个约束最优解都由某个惩罚参数得到”一般需要凸性、对偶性等条件。如果要对一个固定受限类应用后文泛化界,不能在观察数据后随意选 却忽略选择成本或统一控制。

2. 经验过程:单个函数的收敛为什么不够

2.1 ERM 到单侧统一偏差的完整推导

先假设 。它可依赖 ,但不依赖当前样本。于是

第一个等号使用无偏性 ;第二步使用 ERM 的经验最优性,减去更小的经验损失使差值更大;第三步把数据选出的一个函数放宽到整个类。

因此

这里没有额外的 2,因为只在期望中处理固定比较器的误差。常见的逐样本绝对偏差界 是另一条推导,不能把其常数任意混入 (7)。

2.2 经验过程是一整族随机变量

对每个固定 ,令

它均值为零。假设损失可积,大数定律说明对固定 。但算法根据样本选择函数,所以需要同时控制整族的最大偏差。

课件采用的期望单侧统一收敛条件是

“对每个固定 收敛”与“supremum 收敛”不能交换顺序;“对每个固定 ”和“对所有 统一”也不能混淆。常见教材还有概率意义、双侧绝对偏差形式的统一收敛定义,阅读时要看清当前使用哪一种。

2.3 补充反例:每个固定函数都收敛,样本最优却严重过拟合

令输入在 上均匀分布,真实标签恒为 。取函数类包含所有这样的函数:在某个有限集合上预测 ,在其余位置预测

任意固定函数只在有限个输入上正确;这些点的概率为零,所以总体 0–1 风险为 1。对任意固定函数,经验风险也几乎必然趋于 1。

但给定当前训练输入集,类中有函数在所有训练点上预测 ,因此训练损失为零、总体风险仍为 1:

这个例子专门说明逐点收敛不蕴含统一收敛。由于该特定类的最佳总体风险也为 1,它本身不能作为“ERM 超额风险为 1”的例子;若想同时得到那个结论,可再把恒 函数加入类,并让 ERM 的平局规则选取上述记忆函数。

3. Rademacher 复杂度:只测量类迎合随机符号的能力

对函数类 ,固定样本位置,定义

其中符号彼此独立。非条件版本为

期望外面的 supremum 可以在看过随机符号后选择函数,所以这个量不是“某个固定模型和噪声的相关性”。

三个直接可验证的性质:

  • 非空单函数类复杂度为零,因为每个 均值为零。
  • 若在不同样本点能任意取 ,则可选 ,复杂度为 1。
  • 在每个坐标加一个与 无关的常数 ,复杂度不变,因为新增项

本讲定义没有在 supremum 内加绝对值。若改为 ,单函数类一般不再为零,相应引理的形式和常数也需重核。

4. 定理 1:对称化完整证明

4.1 定义损失类

把预测器转成样本空间上的函数:

要证明

4.2 引入幽灵样本

为独立的 样本。由于

为何不等号是这个方向?对每个 ,其随机值不超过所有函数的 supremum,取期望后仍成立,再对 取 supremum,所以

4.3 随机符号为何能凭空出现

固定任意符号序列。当 时交换 ,当它为 时不交换。每对样本的联合分布都是 ,交换不改变它;各对之间仍然独立。因此

这不是对一份固定样本就成立的数值等式,而是对随机样本取期望后的分布等价。

4.4 拆分 supremum,得到因子 2

两项相同,因为 同分布、 同分布。结合 (16)–(18) 就证明定理 1。

得到的复杂度只依赖函数在样本上的值,不再单独含总体项 。这是后面能够把无限类替换为有限投影的关键。

5. 引理 1:二分类 0–1 损失为何恰好乘以

,有恒等式

因为同号时 ,异号时为 ,分别得到损失 0 与 1。固定有标签样本后,

第一项为零。因为 已固定、为 ,符号 仍然独立、等概率取 。于是再对样本取期望:

右侧实际只依赖输入边缘分布 。课件简写相同的 ,这里把分布标清楚以免误会。

6. 引理 2:Lipschitz 收缩的逐坐标证明

6.1 条件与目标

假设 ,且对于所有允许的预测值、标签,

要证明

6.2 先只替换最后一个坐标

固定 ,记

对最后一个符号的两个可能值取平均:

第二步用两个可以独立选择的 supremum 相加等于对有序对取 supremum。若最优值不取到,可选任意接近最优的两个函数再令误差趋零。

6.3 为什么可以去掉绝对值

在交换 时不变,而 改变符号。因此每个绝对值为正的差,都能通过交换顺序成为不带绝对值的正差:

重新把 supremum 拆回去:

于是最后坐标的非线性损失被 替换,复杂度不会变小。再对前面符号取期望,依次替换第 个坐标,得到

除以 即为 (23)。证明不要求 关于取负封闭,也没有要求 ,因为这里使用的是无绝对值的复杂度定义。

原课件第 4 页将两个 supremum 合并后,部分显示公式在 项前多印了一个 。正确项是 ,本文用 写法避免重复符号。

6.4 平方损失的常数为什么是 2

课件这里用的是半平方损失 。对

所以 。若损失没有前面的 ,则 ;若预测和标签可取任意实数,就没有这个全局常数。Lecture 1 的平方损失和本讲的半平方损失不能在常数上混用。

至此,分类取 ,回归取合法 Lipschitz 常数,有

7. 次高斯变量与课件未证明的 Hoeffding 引理

7.1 次高斯不是要求随机变量真的服从高斯分布

零均值随机变量 若满足

就称为 -次高斯。这里 是指数矩的方差代理,不一定等于实际方差。

指数矩控制能转成尾概率控制:对 ,Markov 不等式给出

时取 ,得 。这解释了“次高斯”表示类似高斯的尾部衰减,而不要求密度形状相同。

7.2 Hoeffding 引理的完整证明

,且 ,要证明

-次高斯。

。因 有界,可对期望求导。定义指数倾斜后的期望

直接对 求两次导数:

任意支持在 的变量,均值为 时,由 ,从而

最后一步是固定和的两个非负数乘积在相等时最大,或直接配方。

倾斜分布仍支持在 ,所以 也满足 (36)。又 ,积分余项形式的 Taylor 公式给出

这个形式同时适用于正、负 。指数化即 (33)。若 ,零均值意味着 ,结论直接成立。

8. 引理 3:最大值不等式为何只依赖

都是 -次高斯变量,不要求彼此独立。对任意

第一步是凸函数指数的 Jensen 不等式;第三步是非负数最大值不超过和。取对数除以

,对右侧求导,令 ,得到 。代入可得

时左侧为零; 时变量退化为零,也不需要上述除法。所有 可以高度相关,因为证明只分别控制了每个指数矩,从未分解不同 的联合分布。

9. 定理 2:Massart 引理与有限类学习

9.1 每个函数对应一个随机符号和

固定输入 ,对有限类 定义

对固定 ,各项独立、均值零。每项落在 ,由 Hoeffding 引理是 -次高斯。因此

第一步才是真正需要独立性的地方:是不同样本位置的随机符号独立,而不是不同 对应的 独立。

9.2 应用最大值引理并除以样本量

由 (40):

,则 ,所以

结合 (30):

固定有限类且 有限时,右侧趋零。若希望上界不超过 ,一个充分条件是

这是该方法给出的保证,不能仅凭上界叫它“所有有限类的精确最优速率”。例如单函数类的超额风险本来就是零,可实现分类还能得到不同的速率。

9.3 为何不直接对经验过程用最大值不等式

对固定有限类及有界损失 ,令 ,每个 -次高斯。证明:每个中心化项 均值零、区间长度为 ,独立求和再除以 ,指数矩参数平方变成

最大值引理直接给出

所以有限类确实可跳过对称化得到保证。然而无限类里, 不只由样本上预测值决定,不能仅凭有限投影把经验过程等价压缩。对称化的价值在于它为无限类提供了统一处理方式。

10. 无限二分类类:增长函数从哪里来

10.1 样本投影把“函数无限”转成“行为有限”

,定义

尽管 可能不可数,。而

这个等式成立是因为目标只读取 ;具有相同投影的函数贡献完全相同。

增长函数定义为所有样本位置上的最大行为数量:

由于可能数量是有限整数,最大值可用实际达到的最大整数理解。重复输入只能减少独立标记自由度;计算最坏增长函数时通常选不同输入。

10.2 复杂度界及平凡界的失败

每个投影向量的平方范数为 ,Massart 引理给出

二分类中的 ,因此

若只代入 ,得到常数 ,不能证明趋零;还可以用复杂度平凡界 1 使常数稍好,但仍不趋零。若增长函数只有 级别,取对数则为 ,除以 后可以趋零。

10.3 为什么总体风险不能直接压缩到投影

两个函数可以在训练点全部相同,却在训练集之外大量不同。它们的经验风险相同,总体风险可能不同,所以 不能只由投影向量恢复。

对称化将总体均值换为样本差,再通过随机符号分拆,才获得只依赖有限投影的量。这个步骤解释了整条上界链的设计目的。

11. 命题 1、2:阈值和区间的精确增长函数

11.1 单阈值类为何恰有 种标记

课件定义

排序不同样本 。正标签只能形成左侧前缀:前 个为 ,其余为 ,其中

每个 都能实现:,其他 。因此

上界与下界同时得到,才是“精确增长函数”的证明;不能只列举一部分可实现模式便断言恰好。

11.2 区间类为何是

区间内预测 ,区间外预测

非空正标签必须是一个连续块 ,其中 。块长度与位置的总数为

每个连续块都可用区间实现,再加上区间落在所有样本之外实现的全负标签,得到

于是 (52) 给出 。也可以从 个样本间隙中挑两个端点所在间隙来计数,但“正标签是一个连续块”更直接解释了为什么不会重复或遗漏。

12. VC 维的定义与命题 3–5 的完整证明

12.1 “打散”中的量词

一组 个输入被打散,意味着所有 个标签向量都可由类中函数实现:

VC 维为可打散点集大小的上确界:

证明 VC 维等于 ,要做两件不同的事:构造一组大小 的可打散点集;证明任意一组大小 的点都不能被打散。只证明某一组 个点失败不够。

若一个大集合被打散,其任意子集也被打散:对该子集上的任意标签,给剩余点任意补标签,再用大集合的实现函数即可。因此有限维 的类对于 都有

12.2 命题 3:VC 维为 0 当且仅当非空类只有一个函数

若类只有一个函数,任何单点最多只有一个标签,自然不能打散。反过来,若含两个不同函数 ,则存在 使 。二分类的两种标签就在这个点上都能实现,所以至少能打散一个点,VC 维至少为 1。

这里函数按实际映射区分,不是按不同参数写法区分;重复参数化同一个函数不增加类的 VC 维。还需保留“非空类”条件,否则空类是原陈述的边界例外。

12.3 命题 4:阈值类 VC 维是 1

任意单点 ,将阈值放左侧或右侧可得到两种标签,所以下界为 1。任意两个不同点 ,标签 不可能实现:若右点在阈值左侧,左点也一定在阈值左侧。因此上界为 1。

12.4 命题 5:区间类 VC 维是 2

对任意 ,四种标签均可实现:区间同时覆盖二者、只覆盖第一点、只覆盖第二点、或不覆盖任何一个,所以下界为 2。

对任意三个不同点 ,标签 不可实现,因为一个区间若包含两端,必须包含中间点。因此上界为 2。

这些例子显示 VC 维衡量的是可独立控制标签的点数,而不只是有多少种函数。

13. 命题 6:仿射线性分类器的 VC 维为输入维数加一

为避免与 VC 维符号混淆,这里用 表示输入空间维数。考虑

并按课件约定 ,否则为

13.1 显式构造下界

个点 。对任意标签 ,令

于是 。所有标签均被严格实现,因此

这说明的不是“任意 个点都能打散”,而是存在这组仿射独立点能打散。共线等退化配置可能做不到。

13.2 用仿射依赖证明任何 个点都失败

任取 个点,把它们增广成 。线性相关性保证存在不全为零的 ,使

因为系数和为零,非零系数中既有正数又有负数。给正系数点标 ,给负系数点标 ,零系数点任意。若由某个 实现,则

而当 时,负标签要求分数严格小于零,乘负系数后严格大于零。至少有一个负系数,所以

矛盾。因此任何 个点都不能打散,结合下界:

这个证明保留了符号函数在零点的约定,不需要把“边界上的点”含糊带过。若没有偏置 ,则是另一个函数类,不能直接套用

13.3 二维四点问题的直观和精确答案

二维时三个不共线点可以打散。四个点若组成凸四边形,沿边界交替标记 ,两组同标签点的连线相交,无法被一条直线分开。若一个点在其余三点的凸包中,把内部点与外部三点标相反标签也不能线性分开;退化情况已被 (63)–(64) 的一般论证覆盖。

课件问 究竟是多少。补充答案是 14:

  • 凸四边形上,全正、全负有 2 种;
  • 只正一个或只负一个有 种;
  • 相邻两点为正有 4 种;
  • 只有两种交替标签不能实现。

共 14 种。为什么其他四点配置不会超过 14?任何配置都至少有一种不可实现标签;在线性分类器的有限样本上,可实现标签对取反封闭。理由是先把偏置轻微上移,使所有原正点严格正、原负点仍严格负,再同时取反 即实现互补标签。因此不可实现标签也成对出现,最多 14 种。这是课件提问的补充证明,不是后续学习界所必需的精确计算。

14. 命题 7:一个参数的正弦类为何 VC 维无限

14.1 不能只说“频率高,所以复杂”

考虑

振荡次数可以很大只是直觉。要证明无限 VC 维,必须对任意 先固定一组 个输入,再用参数实现它们的全部 种标签,不能每个标签都换一组输入。

14.2 用二进制位给出显式构造

固定 ,选择

这些点互不相同,且全部在 。对任意希望的标签 ,定义比特 。令

于是

将 (68) 乘以 ,前 个二进制位形成整数部分,小数部分为

,尾项严格为正,而

因此 。若 ,则 。额外的 尾项保证没有任何输入恰好落在正弦为零的边界。

由于正弦每周期前半段为正、后半段为负,

任意标签都能实现,因此任意 都有一组可打散输入:

构造只有一个实参数 ,却利用了它任意精细的取值和越来越高的频率。参数个数可以帮助猜测简单类的 VC 维,但不是普遍定理。

14.3 一个可手算的三点例子

,输入 ,希望标签 ,因此比特为 。此时

三个相位分别为 ,正弦符号依次为正、负、正。这个例子只是展示通用构造如何计算;无限维结论来自前面对所有 的证明。

15. 引理 4:Sauer 引理的递推证明补全

15.1 定理及边界

若非空二分类类 VC 维至多为 ,则

,进一步有

的情形也写进 很有用:此时 ,是平凡界。这使递推遇到 时仍然有合法边界,不会错误使用仅对 陈述的归纳假设。

15.2 删除一个坐标后发生了什么

固定 个不同输入。令 是原投影删除第一个坐标后出现的所有长度 向量。令

每个 中的向量至少能接上一个首标签;若它属于 ,还能再接另一个。于是精确计数为

不是把整个 数两遍,只有“双延伸”的那一部分多贡献一次。

15.3 为什么第二类的 VC 维少一

看作定义在剩余有限输入集合上的二分类类。

的 VC 维至多为 :否则剩余点上能打散 个点,原类当然也能,矛盾。

的 VC 维至多为 :若它能打散剩余点中的 个点,则每个标签模式都来自一个可同时接上首标签 的向量。因此原类能打散这 个点加被删去的点,共 个,矛盾。

所以归纳得到

为空,它贡献零,不需要赋予空类特殊 VC 维。基本情形是 时只有一个标记模式,以及 时只有空向量。

15.4 Pascal 恒等式如何完成归纳

约定越界二项式系数为零。因为任意输入集合都满足这个界,再对输入取最大值得到 (73)。

15.5 从二项式和到

。当 时,,所以

最后的不等式来自 ,可由指数函数在零点的切线下界证明。除以 ,得到 (74)。若 ,直接使用增长函数为 1,不能往含 的式子硬代零。

15.6 “指数变多项式”的准确含义

时某些点集能实现全部 标签;当 后,增长函数被固定次数 的多项式量级控制。Sauer 给的是上界,不保证所有类实际恰按 增长。

阈值类 时,Sauer 上界为 ,与精确增长函数相同。区间类 时,

也与精确增长函数相同。这说明该组合上界至少在这些例子中确实可以达到。

16. 有限 VC 维为什么充分,无限 VC 维为什么必要

16.1 充分性:代入增长函数界

对二分类 0–1 损失、,结合 (52)、(74):

固定有限 ,有 ,因此可学习。若 ,用平凡风险上界 1;若 ,非空类只有一个函数,proper ERM 超额风险为零。

16.2 必要性:把无免费午餐限制到被打散点集

若 VC 维无限,对任意样本量 ,存在被 打散的 个输入 。因此每种二元标记都由某个类内函数实现。

均匀输入分布,并让标签由某种固定类内标记函数确定。对每个这样的候选分布,类内最佳风险为零。

固定任意算法和训练输入,至少一半的支持点没出现。对任意未见点,把所有标记按“只翻转这个点”配对:同一对产生完全相同的训练集,但在该测试点的真实标签相反。随机算法也可用同一随机种子配对,平均错误率为

因此平均候选分布风险至少 ,至少存在一个候选分布使算法风险不低于 。算法任意,所以

比较器只需在 上实现所有标签,类在其余输入上怎样取值不重要,因为分布不在那里放概率。这就是为何不需要参考类等于全体函数,也能复用 Lecture 1 的下界。

16.3 “闭环”到底闭合了什么

在本讲二分类、0–1 损失、iid、分布一致以及通常可测性条件下:

有限 VC 维还通过同一条上界链推出课件采用的统一收敛。反方向,统一收敛蕴含可学习,所以也蕴含有限 VC 维。

这些等价是针对该设置的条件刻画,不应推广成“所有统计学习只要可学习就一定由任何 ERM 学好”。原课件最后明确指出,一般统计学习不总满足这样的结论。

“上界链足够紧”在这里表示足以区分可学习与不可学习,不代表 的每个对数因子都已经是不可改进的下界。

17. 结果如何使用:样本量、置信度和适用范围

17.1 期望样本量

由 (81),要求上界至多 ,可以使用充分条件

忽略对数因子时,这体现 的样本依赖。但上式仍是本讲推导的充分条件,并非必要条件的精确表达。

阈值类参数 可取任意实数,函数数量不可数,却有 VC 维 1;它不需要按参数可能取值的数量支付样本代价。相反,正弦类只有一个实参数却有无限 VC 维。这两个例子一起解释了为何“参数个数”不足以代替类复杂度分析。

17.2 补充:有限类的高概率版本怎样推导

本讲主线使用期望。如果损失落在长度 的有界区间,对固定函数,由第 7 节的指数矩及尾界:

个函数使用并集界:

令右侧等于 ,取 。在这个概率至少 的事件上,插入两项经验风险得到

这里高概率定理的额外条件、置信项和双侧偏差的因子 2 都明确推导了,没有把期望上界直接换个符号当成高概率结论。

17.3 补充:为什么可实现分类可能有更快保证

若有限二分类类大小为 ,且存在零风险目标函数,则 ERM 训练误差为零。任取真实风险大于 的固定坏函数,它在全部 个独立训练样本上都不犯错的概率为

对坏函数并集取界,存在坏但训练误差为零的函数的概率至多 。因此

足以让 ERM 以概率至少 达到风险不超过

这与一般无知学习的 型上界不同,原因是可实现假设更强。这个补充帮助理解为何不能把本讲的 上界称为所有情况统一的“精确速率”。

17.4 与 Lecture 3 的连接

本讲二分类投影属于 ,因此自动有限。回归投影属于 ,即使 有限也可能有无穷多个向量。

Lecture 3 会把“精确计数不同标签”改成“在误差 下计数有限代表”,也就是覆盖数,再通过多尺度 chaining 改善估计。因此本讲的 Massart 引理、对称化和投影观点都会原封不动地成为下一讲的工具。

18. 严谨性清单与原课件证明索引

18.1 需要注意的简写与边界

容易误读的位置本报告的处理
argmin 必然存在用近似 ERM、固定近似总体最优函数处理
正则化总等价于固定小类 ERM证明单向关系,并指出约束半径可能依赖数据、反向需要条件
每个函数偏差均值为零 ⇒ 最大偏差很小给出逐点收敛不蕴含统一收敛的例子
对称化随机符号等式说明只在随机样本的分布及期望意义下成立
收缩证明合并项重复 使用正确的 形式
平方损失统一取 区分半平方、完整平方和无界值域
最大值引理要求所有变量独立不要求;Massart 只需不同位置的符号独立
有限类一定可学习本讲推导还依赖函数值及损失条件等,不能忽略重尾或无界风险问题
VC 维为零 iff 单函数保留非空类假设,函数按映射而非参数计数
证明 VC 下界就足够另需对任意更大点集证明存在不可实现标记
线性分类器维数等于输入维数本讲带偏置,所以是输入维数加一
正弦频率大就算证明无限 VC给出固定输入点和逐标签显式参数构造
Sauer 归纳只处理 补上 的边界
闭环意味着精确最优速率闭环是可学习性条件;不宣称所有因子都不可改进

18.2 按原课件编号定位

课件内容本报告中的完整推导
ERM 与原式 (1)第 1 节,(1)–(6)
原式 (2)、经验过程、统一收敛第 2 节,(7)–(11)
Rademacher 复杂度定义第 3 节,(12)–(13)
定理 1:对称化第 4 节,(14)–(18)
引理 1:分类损失第 5 节,(19)–(21)
引理 2:收缩第 6 节,(22)–(30)
次高斯定义、Hoeffding 引理第 7 节,(31)–(37)
引理 3:最大值不等式第 8 节,(38)–(40)
定理 2:Massart第 9 节,(41)–(47)
样本投影与增长函数第 10 节,(48)–(52)
命题 1:阈值增长函数第 11.1 节,(53)–(54)
命题 2:区间增长函数第 11.2 节,(55)–(57)
命题 3、4、5:基础 VC 维第 12 节,(58)–(59) 及各证明
命题 6:线性分类器 VC 维第 13 节,(60)–(65)
命题 7:正弦类无限 VC 维第 14 节,(66)–(72)
引理 4:Sauer 引理第 15 节,(73)–(80)
总结与必要性闭环第 16 节,(81)–(83)

18.3 学完后应能独立回答

  1. 为什么 ERM 选出的函数不能直接套用“固定函数”的大数定律?
  2. 对称化的每一次交换和不等式,分别利用了什么性质?
  3. 收缩证明为什么允许交换两个候选函数,而不要求函数类关于取负对称?
  4. 为什么无限二分类类仍然能应用有限集合的 Massart 引理?
  5. 怎样用“存在一组”和“任意一组”分别证明 VC 维的下界与上界?
  6. Sauer 证明中,能够双向延伸的投影类为什么 VC 维少一?
  7. 无限 VC 维怎样保证每个样本量下都存在常数难度的分布?
  8. 为什么有限 VC 维的可学习性等价,并不意味着当前速率已经最优?

源码审计版本 lecture2-explanation-report@2026-09-14