根据 Haipeng Luo 的 Lecture 2(2026 年秋季,原课件 8 页)展开。沿用 Lecture 3 讲解报告的形式,覆盖定理 1、2,引理 1–4,命题 1–7,以及讲义省略的辅助证明。每一步尽量说明使用的条件和它在整体论证中的作用。 原课件:lecture2.pdf(未在线发布)。本站配套:课件完整翻译;前后衔接:Lecture 1、Lecture 3。默认函数类非空,必要的可测性、可积性成立;涉及有界集中界时另行写出有界条件。不假设所有优化问题都能高效求解。
阅读导航:把难求的 minimax 值逐步变成可计算的复杂度
Lecture 1 已定义学习的目标,但 很难直接计算。本讲通过一条上界链把它转成经验过程、Rademacher 复杂度,最后转成函数数量或 VC 维。
| 步骤 | 使用的方法 | 它解决的困难 |
|---|---|---|
| 固定算法为 ERM | 最小化经验风险 | 不再优化所有可能算法 |
| 用统一偏差控制 ERM | 经验过程 | 不必直接分析训练结果的具体形式 |
| 对称化 | 引入独立副本和随机符号 | 去掉难处理的总体风险项 |
| 去掉损失函数 | 分类恒等式、Lipschitz 收缩 | 把损失类转成预测函数类 |
| 有限类最大值不等式 | 次高斯、Massart | 用函数数量的对数控制复杂度 |
| 无限二分类类投影 | 增长函数 | 无限个函数在有限样本上只有有限种行为 |
| Sauer 引理 | VC 维 | 用一个组合参数控制所有样本量的增长函数 |
| 无免费午餐反证 | 无限 VC 维 ⇒ 恒定下界 | 证明条件不仅充分,而且必要 |
本讲最终“闭环”的是二分类可学习性条件;并没有证明每个中间上界都在精确常数、对数因子或任意损失问题上最优。
1. 起点:ERM 为什么给出 minimax 上界
1.1 风险和博弈值
令 ,定义
学习的博弈值为
算法可能有内部随机性,期望默认也包括它。
ERM 选择
因为对所有算法取 infimum 不大于任意一个具体算法的最坏误差,
这只是上界,不是声称一开始已经知道 ERM 最优。分析成功后才能说明 ERM 足以实现相应可学习性。
1.2 最小值不取到怎么办
即使 argmin 不存在,也可选择近似 ERM:
后文风险界只需加 。总体风险最优值不取到时,则用固定的 -最优函数比较,最后让 。因此存在性简写通常不会改变统计结论,但“可选择可测算法”仍是需要满足的技术条件。
1.3 正则化与约束类:补全论证并说明限制
设 最小化
令 。若有 满足 且 ,那么
矛盾。所以 也是约束类 上的 ERM。
这证明了“给定惩罚最优解,可以找到一个约束半径解释它”。但这里 可能依赖数据;反向“每个约束最优解都由某个惩罚参数得到”一般需要凸性、对偶性等条件。如果要对一个固定受限类应用后文泛化界,不能在观察数据后随意选 却忽略选择成本或统一控制。
2. 经验过程:单个函数的收敛为什么不够
2.1 ERM 到单侧统一偏差的完整推导
先假设 。它可依赖 ,但不依赖当前样本。于是
第一个等号使用无偏性 ;第二步使用 ERM 的经验最优性,减去更小的经验损失使差值更大;第三步把数据选出的一个函数放宽到整个类。
因此
这里没有额外的 2,因为只在期望中处理固定比较器的误差。常见的逐样本绝对偏差界 是另一条推导,不能把其常数任意混入 (7)。
2.2 经验过程是一整族随机变量
对每个固定 ,令
它均值为零。假设损失可积,大数定律说明对固定 , 。但算法根据样本选择函数,所以需要同时控制整族的最大偏差。
课件采用的期望单侧统一收敛条件是
“对每个固定 收敛”与“supremum 收敛”不能交换顺序;“对每个固定 ”和“对所有 统一”也不能混淆。常见教材还有概率意义、双侧绝对偏差形式的统一收敛定义,阅读时要看清当前使用哪一种。
2.3 补充反例:每个固定函数都收敛,样本最优却严重过拟合
令输入在 上均匀分布,真实标签恒为 。取函数类包含所有这样的函数:在某个有限集合上预测 ,在其余位置预测 。
任意固定函数只在有限个输入上正确;这些点的概率为零,所以总体 0–1 风险为 1。对任意固定函数,经验风险也几乎必然趋于 1。
但给定当前训练输入集,类中有函数在所有训练点上预测 ,因此训练损失为零、总体风险仍为 1:
这个例子专门说明逐点收敛不蕴含统一收敛。由于该特定类的最佳总体风险也为 1,它本身不能作为“ERM 超额风险为 1”的例子;若想同时得到那个结论,可再把恒 函数加入类,并让 ERM 的平局规则选取上述记忆函数。
3. Rademacher 复杂度:只测量类迎合随机符号的能力
对函数类 ,固定样本位置,定义
其中符号彼此独立。非条件版本为
期望外面的 supremum 可以在看过随机符号后选择函数,所以这个量不是“某个固定模型和噪声的相关性”。
三个直接可验证的性质:
- 非空单函数类复杂度为零,因为每个 均值为零。
- 若在不同样本点能任意取 ,则可选 ,复杂度为 1。
- 在每个坐标加一个与 无关的常数 ,复杂度不变,因为新增项 。
本讲定义没有在 supremum 内加绝对值。若改为 ,单函数类一般不再为零,相应引理的形式和常数也需重核。
4. 定理 1:对称化完整证明
4.1 定义损失类
把预测器转成样本空间上的函数:
要证明
4.2 引入幽灵样本
令 为独立的 样本。由于 ,
为何不等号是这个方向?对每个 ,其随机值不超过所有函数的 supremum,取期望后仍成立,再对 取 supremum,所以 。
4.3 随机符号为何能凭空出现
固定任意符号序列。当 时交换 ,当它为 时不交换。每对样本的联合分布都是 ,交换不改变它;各对之间仍然独立。因此
这不是对一份固定样本就成立的数值等式,而是对随机样本取期望后的分布等价。
4.4 拆分 supremum,得到因子 2
两项相同,因为 同分布、 与 同分布。结合 (16)–(18) 就证明定理 1。
得到的复杂度只依赖函数在样本上的值,不再单独含总体项 。这是后面能够把无限类替换为有限投影的关键。
5. 引理 1:二分类 0–1 损失为何恰好乘以
当 ,有恒等式
因为同号时 ,异号时为 ,分别得到损失 0 与 1。固定有标签样本后,
第一项为零。因为 已固定、为 ,符号 仍然独立、等概率取 。于是再对样本取期望:
右侧实际只依赖输入边缘分布 。课件简写相同的 ,这里把分布标清楚以免误会。
6. 引理 2:Lipschitz 收缩的逐坐标证明
6.1 条件与目标
假设 ,且对于所有允许的预测值、标签,
要证明
6.2 先只替换最后一个坐标
固定 ,记
对最后一个符号的两个可能值取平均:
第二步用两个可以独立选择的 supremum 相加等于对有序对取 supremum。若最优值不取到,可选任意接近最优的两个函数再令误差趋零。
6.3 为什么可以去掉绝对值
在交换 时不变,而 改变符号。因此每个绝对值为正的差,都能通过交换顺序成为不带绝对值的正差:
重新把 supremum 拆回去:
于是最后坐标的非线性损失被 替换,复杂度不会变小。再对前面符号取期望,依次替换第 个坐标,得到
除以 即为 (23)。证明不要求 关于取负封闭,也没有要求 ,因为这里使用的是无绝对值的复杂度定义。
原课件第 4 页将两个 supremum 合并后,部分显示公式在 项前多印了一个 。正确项是 ,本文用 写法避免重复符号。
6.4 平方损失的常数为什么是 2
课件这里用的是半平方损失 。对 :
所以 。若损失没有前面的 ,则 ;若预测和标签可取任意实数,就没有这个全局常数。Lecture 1 的平方损失和本讲的半平方损失不能在常数上混用。
至此,分类取 ,回归取合法 Lipschitz 常数,有
7. 次高斯变量与课件未证明的 Hoeffding 引理
7.1 次高斯不是要求随机变量真的服从高斯分布
零均值随机变量 若满足
就称为 -次高斯。这里 是指数矩的方差代理,不一定等于实际方差。
指数矩控制能转成尾概率控制:对 ,Markov 不等式给出
当 时取 ,得 。这解释了“次高斯”表示类似高斯的尾部衰减,而不要求密度形状相同。
7.2 Hoeffding 引理的完整证明
若 ,且 ,要证明
即 是 -次高斯。
令 。因 有界,可对期望求导。定义指数倾斜后的期望
直接对 求两次导数:
任意支持在 的变量,均值为 时,由 得 ,从而
最后一步是固定和的两个非负数乘积在相等时最大,或直接配方。
倾斜分布仍支持在 ,所以 也满足 (36)。又 ,积分余项形式的 Taylor 公式给出
这个形式同时适用于正、负 。指数化即 (33)。若 ,零均值意味着 ,结论直接成立。
8. 引理 3:最大值不等式为何只依赖
设 都是 -次高斯变量,不要求彼此独立。对任意 :
第一步是凸函数指数的 Jensen 不等式;第三步是非负数最大值不超过和。取对数除以 :
当 ,对右侧求导,令 ,得到 。代入可得
时左侧为零; 时变量退化为零,也不需要上述除法。所有 可以高度相关,因为证明只分别控制了每个指数矩,从未分解不同 的联合分布。
9. 定理 2:Massart 引理与有限类学习
9.1 每个函数对应一个随机符号和
固定输入 ,对有限类 定义
对固定 ,各项独立、均值零。每项落在 ,由 Hoeffding 引理是 -次高斯。因此
第一步才是真正需要独立性的地方:是不同样本位置的随机符号独立,而不是不同 对应的 独立。
9.2 应用最大值引理并除以样本量
由 (40):
若 ,则 ,所以
结合 (30):
固定有限类且 有限时,右侧趋零。若希望上界不超过 ,一个充分条件是
这是该方法给出的保证,不能仅凭上界叫它“所有有限类的精确最优速率”。例如单函数类的超额风险本来就是零,可实现分类还能得到不同的速率。
9.3 为何不直接对经验过程用最大值不等式
对固定有限类及有界损失 ,令 ,每个 是 -次高斯。证明:每个中心化项 均值零、区间长度为 ,独立求和再除以 ,指数矩参数平方变成 。
最大值引理直接给出
所以有限类确实可跳过对称化得到保证。然而无限类里, 不只由样本上预测值决定,不能仅凭有限投影把经验过程等价压缩。对称化的价值在于它为无限类提供了统一处理方式。
10. 无限二分类类:增长函数从哪里来
10.1 样本投影把“函数无限”转成“行为有限”
对 ,定义
尽管 可能不可数,。而
这个等式成立是因为目标只读取 ;具有相同投影的函数贡献完全相同。
增长函数定义为所有样本位置上的最大行为数量:
由于可能数量是有限整数,最大值可用实际达到的最大整数理解。重复输入只能减少独立标记自由度;计算最坏增长函数时通常选不同输入。
10.2 复杂度界及平凡界的失败
每个投影向量的平方范数为 ,Massart 引理给出
二分类中的 ,因此
若只代入 ,得到常数 ,不能证明趋零;还可以用复杂度平凡界 1 使常数稍好,但仍不趋零。若增长函数只有 级别,取对数则为 ,除以 后可以趋零。
10.3 为什么总体风险不能直接压缩到投影
两个函数可以在训练点全部相同,却在训练集之外大量不同。它们的经验风险相同,总体风险可能不同,所以 不能只由投影向量恢复。
对称化将总体均值换为样本差,再通过随机符号分拆,才获得只依赖有限投影的量。这个步骤解释了整条上界链的设计目的。
11. 命题 1、2:阈值和区间的精确增长函数
11.1 单阈值类为何恰有 种标记
课件定义
排序不同样本 。正标签只能形成左侧前缀:前 个为 ,其余为 ,其中 。
每个 都能实现: 取 , 取 ,其他 取 。因此
上界与下界同时得到,才是“精确增长函数”的证明;不能只列举一部分可实现模式便断言恰好。
11.2 区间类为何是
区间内预测 ,区间外预测 :
非空正标签必须是一个连续块 ,其中 。块长度与位置的总数为
每个连续块都可用区间实现,再加上区间落在所有样本之外实现的全负标签,得到
于是 (52) 给出 。也可以从 个样本间隙中挑两个端点所在间隙来计数,但“正标签是一个连续块”更直接解释了为什么不会重复或遗漏。
12. VC 维的定义与命题 3–5 的完整证明
12.1 “打散”中的量词
一组 个输入被打散,意味着所有 个标签向量都可由类中函数实现:
VC 维为可打散点集大小的上确界:
证明 VC 维等于 ,要做两件不同的事:构造一组大小 的可打散点集;证明任意一组大小 的点都不能被打散。只证明某一组 个点失败不够。
若一个大集合被打散,其任意子集也被打散:对该子集上的任意标签,给剩余点任意补标签,再用大集合的实现函数即可。因此有限维 的类对于 都有 。
12.2 命题 3:VC 维为 0 当且仅当非空类只有一个函数
若类只有一个函数,任何单点最多只有一个标签,自然不能打散。反过来,若含两个不同函数 ,则存在 使 。二分类的两种标签就在这个点上都能实现,所以至少能打散一个点,VC 维至少为 1。
这里函数按实际映射区分,不是按不同参数写法区分;重复参数化同一个函数不增加类的 VC 维。还需保留“非空类”条件,否则空类是原陈述的边界例外。
12.3 命题 4:阈值类 VC 维是 1
任意单点 ,将阈值放左侧或右侧可得到两种标签,所以下界为 1。任意两个不同点 ,标签 不可能实现:若右点在阈值左侧,左点也一定在阈值左侧。因此上界为 1。
12.4 命题 5:区间类 VC 维是 2
对任意 ,四种标签均可实现:区间同时覆盖二者、只覆盖第一点、只覆盖第二点、或不覆盖任何一个,所以下界为 2。
对任意三个不同点 ,标签 不可实现,因为一个区间若包含两端,必须包含中间点。因此上界为 2。
这些例子显示 VC 维衡量的是可独立控制标签的点数,而不只是有多少种函数。
13. 命题 6:仿射线性分类器的 VC 维为输入维数加一
为避免与 VC 维符号混淆,这里用 表示输入空间维数。考虑
并按课件约定 当 ,否则为 。
13.1 显式构造下界
取 个点 。对任意标签 ,令
于是 , 。所有标签均被严格实现,因此
这说明的不是“任意 个点都能打散”,而是存在这组仿射独立点能打散。共线等退化配置可能做不到。
13.2 用仿射依赖证明任何 个点都失败
任取 个点,把它们增广成 。线性相关性保证存在不全为零的 ,使
因为系数和为零,非零系数中既有正数又有负数。给正系数点标 ,给负系数点标 ,零系数点任意。若由某个 实现,则
而当 时,负标签要求分数严格小于零,乘负系数后严格大于零。至少有一个负系数,所以
矛盾。因此任何 个点都不能打散,结合下界:
这个证明保留了符号函数在零点的约定,不需要把“边界上的点”含糊带过。若没有偏置 ,则是另一个函数类,不能直接套用 。
13.3 二维四点问题的直观和精确答案
二维时三个不共线点可以打散。四个点若组成凸四边形,沿边界交替标记 ,两组同标签点的连线相交,无法被一条直线分开。若一个点在其余三点的凸包中,把内部点与外部三点标相反标签也不能线性分开;退化情况已被 (63)–(64) 的一般论证覆盖。
课件问 究竟是多少。补充答案是 14:
- 凸四边形上,全正、全负有 2 种;
- 只正一个或只负一个有 种;
- 相邻两点为正有 4 种;
- 只有两种交替标签不能实现。
共 14 种。为什么其他四点配置不会超过 14?任何配置都至少有一种不可实现标签;在线性分类器的有限样本上,可实现标签对取反封闭。理由是先把偏置轻微上移,使所有原正点严格正、原负点仍严格负,再同时取反 即实现互补标签。因此不可实现标签也成对出现,最多 14 种。这是课件提问的补充证明,不是后续学习界所必需的精确计算。
14. 命题 7:一个参数的正弦类为何 VC 维无限
14.1 不能只说“频率高,所以复杂”
考虑
振荡次数可以很大只是直觉。要证明无限 VC 维,必须对任意 先固定一组 个输入,再用参数实现它们的全部 种标签,不能每个标签都换一组输入。
14.2 用二进制位给出显式构造
固定 ,选择
这些点互不相同,且全部在 。对任意希望的标签 ,定义比特 当 , 当 。令
于是
将 (68) 乘以 ,前 个二进制位形成整数部分,小数部分为
若 ,尾项严格为正,而
因此 。若 ,则 。额外的 尾项保证没有任何输入恰好落在正弦为零的边界。
由于正弦每周期前半段为正、后半段为负,
任意标签都能实现,因此任意 都有一组可打散输入:
构造只有一个实参数 ,却利用了它任意精细的取值和越来越高的频率。参数个数可以帮助猜测简单类的 VC 维,但不是普遍定理。
14.3 一个可手算的三点例子
取 ,输入 ,希望标签 ,因此比特为 。此时 。
三个相位分别为 ,正弦符号依次为正、负、正。这个例子只是展示通用构造如何计算;无限维结论来自前面对所有 的证明。
15. 引理 4:Sauer 引理的递推证明补全
15.1 定理及边界
若非空二分类类 VC 维至多为 ,则
当 ,进一步有
把 的情形也写进 很有用:此时 ,是平凡界。这使递推遇到 时仍然有合法边界,不会错误使用仅对 陈述的归纳假设。
15.2 删除一个坐标后发生了什么
固定 个不同输入。令 是原投影删除第一个坐标后出现的所有长度 向量。令
每个 中的向量至少能接上一个首标签;若它属于 ,还能再接另一个。于是精确计数为
不是把整个 数两遍,只有“双延伸”的那一部分多贡献一次。
15.3 为什么第二类的 VC 维少一
把 看作定义在剩余有限输入集合上的二分类类。
的 VC 维至多为 :否则剩余点上能打散 个点,原类当然也能,矛盾。
的 VC 维至多为 :若它能打散剩余点中的 个点,则每个标签模式都来自一个可同时接上首标签 的向量。因此原类能打散这 个点加被删去的点,共 个,矛盾。
所以归纳得到
若 为空,它贡献零,不需要赋予空类特殊 VC 维。基本情形是 时只有一个标记模式,以及 时只有空向量。
15.4 Pascal 恒等式如何完成归纳
对 :
约定越界二项式系数为零。因为任意输入集合都满足这个界,再对输入取最大值得到 (73)。
15.5 从二项式和到
令 。当 时,,所以
最后的不等式来自 ,可由指数函数在零点的切线下界证明。除以 ,得到 (74)。若 ,直接使用增长函数为 1,不能往含 的式子硬代零。
15.6 “指数变多项式”的准确含义
当 时某些点集能实现全部 标签;当 后,增长函数被固定次数 的多项式量级控制。Sauer 给的是上界,不保证所有类实际恰按 增长。
阈值类 时,Sauer 上界为 ,与精确增长函数相同。区间类 时,
也与精确增长函数相同。这说明该组合上界至少在这些例子中确实可以达到。
16. 有限 VC 维为什么充分,无限 VC 维为什么必要
16.1 充分性:代入增长函数界
对二分类 0–1 损失、,结合 (52)、(74):
固定有限 ,有 ,因此可学习。若 ,用平凡风险上界 1;若 ,非空类只有一个函数,proper ERM 超额风险为零。
16.2 必要性:把无免费午餐限制到被打散点集
若 VC 维无限,对任意样本量 ,存在被 打散的 个输入 。因此每种二元标记都由某个类内函数实现。
给 均匀输入分布,并让标签由某种固定类内标记函数确定。对每个这样的候选分布,类内最佳风险为零。
固定任意算法和训练输入,至少一半的支持点没出现。对任意未见点,把所有标记按“只翻转这个点”配对:同一对产生完全相同的训练集,但在该测试点的真实标签相反。随机算法也可用同一随机种子配对,平均错误率为 。
因此平均候选分布风险至少 ,至少存在一个候选分布使算法风险不低于 。算法任意,所以
比较器只需在 上实现所有标签,类在其余输入上怎样取值不重要,因为分布不在那里放概率。这就是为何不需要参考类等于全体函数,也能复用 Lecture 1 的下界。
16.3 “闭环”到底闭合了什么
在本讲二分类、0–1 损失、iid、分布一致以及通常可测性条件下:
有限 VC 维还通过同一条上界链推出课件采用的统一收敛。反方向,统一收敛蕴含可学习,所以也蕴含有限 VC 维。
这些等价是针对该设置的条件刻画,不应推广成“所有统计学习只要可学习就一定由任何 ERM 学好”。原课件最后明确指出,一般统计学习不总满足这样的结论。
“上界链足够紧”在这里表示足以区分可学习与不可学习,不代表 的每个对数因子都已经是不可改进的下界。
17. 结果如何使用:样本量、置信度和适用范围
17.1 期望样本量
由 (81),要求上界至多 ,可以使用充分条件
忽略对数因子时,这体现 的样本依赖。但上式仍是本讲推导的充分条件,并非必要条件的精确表达。
阈值类参数 可取任意实数,函数数量不可数,却有 VC 维 1;它不需要按参数可能取值的数量支付样本代价。相反,正弦类只有一个实参数却有无限 VC 维。这两个例子一起解释了为何“参数个数”不足以代替类复杂度分析。
17.2 补充:有限类的高概率版本怎样推导
本讲主线使用期望。如果损失落在长度 的有界区间,对固定函数,由第 7 节的指数矩及尾界:
对 个函数使用并集界:
令右侧等于 ,取 。在这个概率至少 的事件上,插入两项经验风险得到
这里高概率定理的额外条件、置信项和双侧偏差的因子 2 都明确推导了,没有把期望上界直接换个符号当成高概率结论。
17.3 补充:为什么可实现分类可能有更快保证
若有限二分类类大小为 ,且存在零风险目标函数,则 ERM 训练误差为零。任取真实风险大于 的固定坏函数,它在全部 个独立训练样本上都不犯错的概率为
对坏函数并集取界,存在坏但训练误差为零的函数的概率至多 。因此
足以让 ERM 以概率至少 达到风险不超过 。
这与一般无知学习的 型上界不同,原因是可实现假设更强。这个补充帮助理解为何不能把本讲的 上界称为所有情况统一的“精确速率”。
17.4 与 Lecture 3 的连接
本讲二分类投影属于 ,因此自动有限。回归投影属于 ,即使 有限也可能有无穷多个向量。
Lecture 3 会把“精确计数不同标签”改成“在误差 下计数有限代表”,也就是覆盖数,再通过多尺度 chaining 改善估计。因此本讲的 Massart 引理、对称化和投影观点都会原封不动地成为下一讲的工具。
18. 严谨性清单与原课件证明索引
18.1 需要注意的简写与边界
| 容易误读的位置 | 本报告的处理 |
|---|---|
| argmin 必然存在 | 用近似 ERM、固定近似总体最优函数处理 |
| 正则化总等价于固定小类 ERM | 证明单向关系,并指出约束半径可能依赖数据、反向需要条件 |
| 每个函数偏差均值为零 ⇒ 最大偏差很小 | 给出逐点收敛不蕴含统一收敛的例子 |
| 对称化随机符号等式 | 说明只在随机样本的分布及期望意义下成立 |
| 收缩证明合并项重复 | 使用正确的 形式 |
| 平方损失统一取 | 区分半平方、完整平方和无界值域 |
| 最大值引理要求所有变量独立 | 不要求;Massart 只需不同位置的符号独立 |
| 有限类一定可学习 | 本讲推导还依赖函数值及损失条件等,不能忽略重尾或无界风险问题 |
| VC 维为零 iff 单函数 | 保留非空类假设,函数按映射而非参数计数 |
| 证明 VC 下界就足够 | 另需对任意更大点集证明存在不可实现标记 |
| 线性分类器维数等于输入维数 | 本讲带偏置,所以是输入维数加一 |
| 正弦频率大就算证明无限 VC | 给出固定输入点和逐标签显式参数构造 |
| Sauer 归纳只处理 | 补上 、 的边界 |
| 闭环意味着精确最优速率 | 闭环是可学习性条件;不宣称所有因子都不可改进 |
18.2 按原课件编号定位
| 课件内容 | 本报告中的完整推导 |
|---|---|
| ERM 与原式 (1) | 第 1 节,(1)–(6) |
| 原式 (2)、经验过程、统一收敛 | 第 2 节,(7)–(11) |
| Rademacher 复杂度定义 | 第 3 节,(12)–(13) |
| 定理 1:对称化 | 第 4 节,(14)–(18) |
| 引理 1:分类损失 | 第 5 节,(19)–(21) |
| 引理 2:收缩 | 第 6 节,(22)–(30) |
| 次高斯定义、Hoeffding 引理 | 第 7 节,(31)–(37) |
| 引理 3:最大值不等式 | 第 8 节,(38)–(40) |
| 定理 2:Massart | 第 9 节,(41)–(47) |
| 样本投影与增长函数 | 第 10 节,(48)–(52) |
| 命题 1:阈值增长函数 | 第 11.1 节,(53)–(54) |
| 命题 2:区间增长函数 | 第 11.2 节,(55)–(57) |
| 命题 3、4、5:基础 VC 维 | 第 12 节,(58)–(59) 及各证明 |
| 命题 6:线性分类器 VC 维 | 第 13 节,(60)–(65) |
| 命题 7:正弦类无限 VC 维 | 第 14 节,(66)–(72) |
| 引理 4:Sauer 引理 | 第 15 节,(73)–(80) |
| 总结与必要性闭环 | 第 16 节,(81)–(83) |
18.3 学完后应能独立回答
- 为什么 ERM 选出的函数不能直接套用“固定函数”的大数定律?
- 对称化的每一次交换和不等式,分别利用了什么性质?
- 收缩证明为什么允许交换两个候选函数,而不要求函数类关于取负对称?
- 为什么无限二分类类仍然能应用有限集合的 Massart 引理?
- 怎样用“存在一组”和“任意一组”分别证明 VC 维的下界与上界?
- Sauer 证明中,能够双向延伸的投影类为什么 VC 维少一?
- 无限 VC 维怎样保证每个样本量下都存在常数难度的分布?
- 为什么有限 VC 维的可学习性等价,并不意味着当前速率已经最优?