根据 Haipeng Luo 的 Lecture 1(2026 年秋季,原课件 8 页)展开。结构沿用 Lecture 3 讲解报告:说明问题的目的、解释量词与符号、逐步证明公式、讨论例子及结论边界。标为“补充”的内容用于解释原文,而不是声称课件已经证明了额外定理。 原课件:lecture1.pdf(未在线发布)。本站配套:课件完整翻译;后续讲解:Lecture 2、Lecture 3。默认损失及随机变量可测,所写期望和差值有定义。有限空间上的论证不需要额外可测性技术;推广到一般空间时应保留相应条件。
阅读导航:第一讲为何花这么多篇幅定义问题
“从数据学到规律”还不足以成为一个可以证明的数学命题。至少需要回答:数据从哪里来,算法能看见什么,什么时候作决定,损失怎样计算,与谁比较,以及保证必须对哪些环境成立。
本讲依次建立三种模型:
| 模型 | 数据与信息 | 学习者输出 | 评价标准 |
|---|---|---|---|
| 统计学习 | 来自未知分布的独立同分布样本 | 看完训练集后输出一个预测器 | 相对类内最优的期望超额风险 |
| 全信息在线学习 | 逐轮产生数据,每轮结束看到完整结果 | 每轮先作一次决定 | 相对最佳固定决策的累计遗憾 |
| 部分信息在线学习 | 逐轮产生数据,只看到动作对应的反馈 | 每轮作决定并探索 | 在反馈限制下控制遗憾 |
两项核心定理分别说明“并非任何类都能学习”和“在线可学习蕴含统计可学习”。理解它们的量词比记住常数更重要。
1. 监督学习:从输入、输出到损失
1.1 数据、预测器与学习算法是三个对象
输入空间是 ,输出空间是 。训练集为
课件用 简写序列。本文把样本视作有序元组,允许重复点;在计算“见过多少不同输入”时,才取其中不同元素的集合。
预测器 是函数 。算法 则是“从训练集到预测器”的映射:
随机算法还依赖独立随机种子 ,即 。 是一个模型; 是训练模型的过程,二者不能混为一谈。
猫狗分类可把图像编码为 ,标签编码为 ;机器翻译、语言建模、视频摘要也能写成输入到输出的映射。这里只是数学建模,不意味着这些任务共享相同损失或相同计算难度。
1.2 损失到底衡量什么
一般损失写成
二分类的 0–1 损失与回归的平方损失分别为
前者只区分对错;后者还惩罚数值偏差的大小,例如误差从 1 变成 3,平方损失从 1 变成 9。平方损失可能无界,后续若使用集中不等式或 Lipschitz 收缩,必须另加有界性等条件。损失的选择是问题定义的一部分。
2. 为什么必须假设训练与测试有关
2.1 独立同分布假设拆开来看
假设存在未知分布 ,使训练样本与新测试点都来自它:
“同分布”让过去数据与未来目标一致;“独立”保证新点不携带被训练过程刻意筛选后的依赖。若训练集全来自一种环境、测试集来自完全任意另一种环境,单凭训练数据通常无法保证测试表现。
现实中的随机划分只有在原始数据也满足适当采样条件时,才能支持这种模型。随机划分本身不会消除重复样本、时间相关性或数据来源偏差。课件以它提供直觉,不是声称任意随机切分自动证明独立性。
2.2 风险为什么比有限测试误差更适合理论
固定一个 ,总体风险为
独立测试集 的测试误差为
由期望的线性性和同分布性,
因此测试误差是风险的无偏估计。若损失方差为 ,独立性还给出
风险去掉了有限测试集带来的额外随机波动。若 已知,原则上可以直接最小化 ,问题变成优化;统计学习之所以存在,是因为 未知,只有样本可用。
2.3 训练之后的风险为什么又是随机变量
固定 时, 是一个数。随机训练得到 时, 随 变化。因此学习算法的期望风险是
若测试集独立于训练过程,条件于 后,仍然有 。如果不断用同一测试集挑模型,这个条件独立性便不能直接使用。
3. 不可约噪声与“无知学习”的目标
3.1 公平硬币标签为何没人能预测得更好
假设对每个 ,都有 。独立的新标签与训练集及算法随机种子条件独立。固定 ,无论算法预测什么,
再取期望,任何学习算法的风险都为 。因此“对任意分布都学到接近零的绝对风险”不可能。
但这不等于这个分布上的超额风险无法趋零:若所有参考函数风险也都是 ,任何预测器的超额风险已为零。课件这里的反例否定的是不加比较基准的低绝对风险目标。
3.2 从假设分布转向选择参考类
课件用经典参数统计作对比:例如假设 为高斯向量、给定 后 为均值 的高斯变量,再估计参数。这是一个说明性的对比,不意味着全部现代统计学都只研究参数高斯模型。
无知(agnostic)学习选择参考类 ,要求算法与这个类中的最佳函数相比表现接近:
这里“不依赖分布”意味着不对 指定参数形式;仍保留 iid、给定损失以及必要的可积性条件。先验知识没有消失,而是进入 的选择,例如线性函数、树模型或某种网络结构。
如果 本身不能很好表达任务,接近它的最佳函数也未必意味着绝对风险很低。这一点将在第 8 节用误差分解表达。
4. 一般统计学习框架与可学习性的量词
4.1 从监督学习推广到抽象决策
令样本 ,决策 ,参考类 ,损失 。定义
当算法总输出 中的元素时称为 proper;允许输出类外决策时可称为 improper。课件用 描述 proper 的设置。严格说,即使 更大,某个具体算法也可能始终只输出 ,因而仍是 proper 算法。
Proper 算法的超额风险非负;improper 算法有时能优于参考类,差值可能为负,不能在所有推理中都默认它非负。
4.2 样本复杂度怎样从速率得到
若对所有允许分布有
要保证超额风险不超过 ,解不等式:
这里 可能依赖参考类的维数、损失范围等。说 并不是说任何模型都需要相同样本数。
4.3 点态收敛与分布一致收敛
下面两种话语不同:
- 对每个固定 ,当 足够大时误差小;需要多大样本可能依赖 。
- 存在一个不依赖 的样本量,让所有允许 的误差都小。
本课程的 minimax 形式研究后者。有限样本算法可以随 变化,但不能依赖未知 。无免费午餐定理针对的也是这个统一保证。
5. PAC 与密度估计:两个重要例子
5.1 可实现 PAC 与无知学习的区别
可实现二分类假设存在 ,使
0–1 损失下 ,所以
PAC 保证常写为:给定误差 、失败概率 ,对任意输入边缘分布 和任意目标 ,足够多训练样本后,
“Probably”对应 ,“Approximately Correct”对应误差 。课件写样本量为 ,隐含了类的复杂度等依赖,也不是对算法运行时间的保证。
5.2 期望保证和概率保证怎样关联
对 ,如果 (18) 成立,则
反过来,Markov 不等式给出
因此期望至多 足以得到失败概率至多 。这是基础转换,通常不是最紧的样本量分析,不能把它误认为两个框架在常数和速率上完全等价。
5.3 密度估计为何用对数损失
现在没有标签,样本 ,决策 是相对于共同基础测度的概率密度,损失为
若真实密度为 ,定义
在相关积分及差值有定义时,加减 :
为什么 KL 非负?若 在 的地方为零,则 KL 可能为 。否则用 :
所以 。辅助不等式由 在 取最小值零得到。
因此最小化期望对数损失,相当于找 KL 意义下最接近真实分布的类内密度;不要求 本身在参考类中。连续密度可以大于 1,所以对数损失本身可能为负;它不等同于一个总在 的分类损失。
6. 学习的博弈值:为什么先选算法,再选分布
6.1 Minimax 量与量词
课件定义
外层 寻找最佳学习规则;内层 检查这个规则在最不利分布下的表现。“先选算法”指承诺一套从数据到输出的策略,而不是在看到数据前就选定最终预测器。
若交换成 ,内层最优算法可以针对已知 设计,甚至直接输出其类内最佳决策,基本绕过了“分布未知”这件事。一般只有
不能无条件交换两者。证明 (25):对任意固定 ,有 ,依次取相应上下确界即可。
课件把
作为可学习性的正式刻画。在通常 proper、非负超额风险框架下,它就是最坏分布误差趋零。若最优策略的 infimum 不取到,为每个 选一个距离最优值至多 的策略,仍可得到趋零的算法序列。
6.2 哪些依赖被符号隐藏了
还依赖 及允许的分布集合。仅给函数类而改变损失或反馈模型,可能得到不同可学习性;不能把 当作唯一决定因素。
7. 定理 1:无免费午餐的完整下界证明
7.1 目标不是找到一个让所有算法失败的分布
对于所有二分类器组成的类 ,证明
量词是“对任意算法,存在一个难分布”,不是“存在一个固定分布,所有算法都失败”。算法可以随机化。原课件假设 连续;实际只需它对任意 都包含 个不同点,例如任何无限输入空间。
7.2 构造有限支持的候选分布
固定 个不同输入组成 ,令 为它们上的均匀分布。所有 种二元标记对应函数 ,其中 。
对每个 ,定义
每个 都是无噪声、可实现的:参考类包含 ,故最优风险为零。让标签随机地选择一个 ,只是证明时对候选分布取平均,不是说每个固定 的标签带硬币噪声。
7.3 为什么新测试点至少有一半概率未见过
固定训练输入序列 ,令 为其中不同输入的集合。它至多包含 个元素,而 有 个元素,所以
这个下界对每份训练输入序列都成立,允许采样重复。
7.4 未见点的配对论证:算法为何至少错一半
固定一个未见点 。把 种标记函数分成 对,每对 只在 上不同,其他 个点完全一样。
因为 不在训练集中,两者诱导的有标签训练集相同。因此确定性算法在 上的预测相同,但该点真实标签相反,有
随机算法可在两种情形使用同一随机种子耦合,逐种子仍满足此等式;再取期望即可。
对所有配对求和除以 ,得到平均错误率恰为 。因此对任意算法,
有限个数的平均值至少为 ,意味着至少一个 下的风险不低于 ,不意味着一定恰好等于 。因为算法任意,取 、再取 ,得到 (27)。
7.5 补充:未见概率的精确计算
固定测试点 ,每个训练点避开它的概率为 。独立性给出
所以配对论证实际上给出 。最后不等式也可由 Bernoulli 不等式 得到;它可对整数 用归纳法证明。课件只需要更简单的 常数。
7.6 这项定理的意义与范围
难分布可以随样本量 变化,所以结论针对分布一致可学习性。它不是说每个具体真实任务都无法学习,也不是说所有固定分布都很难。它说明:若允许类在未见输入上完全任意变化,就没有普遍有效的归纳规则。
一个类需要某种结构约束,才能让训练数据约束未见点的行为。Lecture 2 将用 VC 维把这种“结构约束”变成可以计算的参数。
8. 表达、泛化与优化误差怎样放在同一个式子里
设更大的比较空间最优风险为 ,类内最优为 。代数恒等式是
第二项是表达或近似误差。扩大 不会增大它,因为对更大集合取 infimum 只会更小。
为了展示泛化与优化的关系,设近似 ERM 输出 ,满足 。定义
选择类内最优或任意接近最优的 ,逐步得到
于是
三项分别对应泛化控制、优化误差、表达误差。这是上界,不是三种独立随机误差的精确分解。扩大类通常让表达更强,但 supremum 的范围更大,统一泛化控制可能更难;实际优化算法还可能偏向类的某个子集。本课程主要研究统计泛化部分。
9. 在线学习:改变的是决策协议
9.1 每轮允许看到什么
每轮 :
- 学习者根据过去信息选择 ,环境同时选择 。
- 学习者承受损失 。
- 全信息模型下,学习者观察完整 ,再进入下一轮。
统计学习是看完训练集才交付一个决策;在线学习是在反馈逐步到来时作出一串决策。不要求 独立或同分布,也不要求存在固定数据分布。
在课件的抽象监督学习实例中, 可以是一整个预测函数, 在随后揭示。若应用中先看到 再预测标签,则是带上下文的细化协议,需要明确哪些信息在哪一步揭示,不能默默改变当前定义。
9.2 遗憾中的 comparator 为什么必须固定
定义
对手是事后知道全部数据后挑出的同一个固定 。它不是每轮都能换一个最佳动作的 oracle:
左侧允许每轮单独最小化,因此更小,相比它的任务更困难。课件研究的是右侧的固定比较器。
例如两个动作的两轮损失依次为 、,两个固定动作都累计损失 1;若算法恰好先选第一个再选第二个,累计损失为零,遗憾是 。所以单个序列上的遗憾可以为负。
无遗憾学习要求最坏环境下的期望累计遗憾满足
不要求累计遗憾本身趋于零。累计 依然是无遗憾的。
10. 环境的能力:非自适应、自适应与当前动作
10.1 两种环境知道什么
非自适应环境(oblivious)知道学习算法,但在游戏开始前固定整个 ,不根据实际动作改变它。
自适应环境(adaptive)可以根据过去的实际动作和公共历史选择当前 。但在课件的同时行动协议中,它不能看到当前新抽出的动作 后再决定 。
可把公共历史写作
环境知道算法,所以能够推断当前动作的条件分布 ,但不知道这次随机抽样结果。知道“硬币正面概率”为 与知道这次是正面,信息完全不同。
10.2 补充:为什么随机化可能必不可少
考虑预测一个比特,损失为预测错误,参考类是两个常数预测器。对于确定性算法,环境可以从公开历史和算法推断当前预测,并令 。算法每轮损失 1,累计为 。两个常数的损失之和为 ,所以最佳常数损失至多 ,得到
这并没有赋予环境观察当前隐藏随机动作的能力,因为算法在这里是确定性的,动作已经可由过去信息推算。
随机化能使实际动作无法被精确推断,但不能单凭“随机”就保证小遗憾;算法仍需利用历史调节分布。如果允许环境看到当前实际随机动作再翻转标签,(40) 对随机算法也成立,这会改变问题本身。
11. 嵌套 minimax 的省略证明
11.1 在线博弈值
对指定环境类别 ,定义
自适应环境包含非自适应环境,所以
课件对自适应环境写出
每个后续 都可依赖此前实现的历史。它不是在开局一次性选好所有分布的表达式。
11.2 用后向归纳完整证明有限空间情形
先假设 有限、损失有限、轮数有限,避免可测策略选择问题。终局收益为
递归定义
最后一轮为何如此?给定历史,学习者选随机化分布 ,环境可根据 选 ,再抽出动作 。条件期望恰是右侧求和。算法要使最坏 的期望尽量小,因此外层是 。
归纳假设 已经等于每个后续历史的博弈值。下面分别证明 是可达的上界和不可突破的下界。
上界: 学习者在每个历史选达到或 -接近 (45) infimum 的 ,并在随后每个历史继续采用相应近似最优策略。无论环境如何选择,当前期望至多 ,后续累计近似误差至多剩余轮数乘 。所以最优策略的最坏收益不超过 。
下界: 任取学习者策略,它在当前历史诱导某个条件分布 。环境选择使右侧尽量接近 supremum 的 。实现动作后,在下一历史继续选择归纳保证的近似最坏回应。因此该策略的最坏收益至少 。
令 ,两边吻合,完成归纳。再把 (45) 从 展开,得到 (43)。
环境在当前 上再随机化并不能提高这一步的 supremum,因为随机化所得只是各个固定 收益的加权平均,不超过最大值。
11.3 为什么预先随机选算法与逐轮抽样可等价
课件把随机策略描述为“对一组确定性历史映射的分布”。有限历史树上,可在开局预先为每个可能历史抽取一个动作,形成完整确定性策略;真正到达某个历史时读取对应动作,就实现了给定的逐轮随机策略。
反方向,对任意预先随机选取的完整策略,在已实现公共历史下求当前动作的条件分布,便得到 。逐轮按这些条件分布采样,由条件概率乘法公式产生相同的路径分布。这里学习者记得自身过去动作与信息,即具有完全记忆。
所以不能只把所有轮次视作互不相关的固定混合动作;依赖历史的条件分布才是关键。
对一般无限空间,这个递归仍是标准直觉和形式化表达,但等式的完全严谨推广需要相应可测性、条件分布以及近似策略选择条件。课件对任意抽象空间略去的技术性证明,不能仅凭有限情形就无条件宣称全部解决。本文给出了有限情形的完整证明并标明推广条件。
12. 定理 2:在线到批量学习转换
12.1 转换算法如何执行
给定 iid 训练集 和任意在线算法:
- 依次把样本作为在线反馈输入算法。
- 第 个在线决策 必须在读取 之前产生。
- 独立均匀抽取 ,输出 。
随机选择一个历史决策保持输出空间不变,即使它不具有线性或凸结构也合法。
12.2 最重要的独立性等式
令 包含此前样本及生成 所需的算法随机性。因为 是新的 iid 点,与这些信息独立,
再取期望: 。如果算法先看了 才产生 ,这个等式通常就不成立,这正是转换要求时间顺序的原因。
12.3 每一步不等式
对任意固定 ,由均匀随机输出和 (46):
第三步是因为经验最优比较器损失不大于任何固定 的经验损失,减去较小的数使差值更大。
对左侧取 ,右侧不变,得到
注意我们没有错误地交换 与 。证明先固定 ,最后再取 supremum,正是为了避免这个问题。
12.4 从单个算法到博弈值
任意在线算法若对所有固定序列的期望平均遗憾不超过 ,则对随机生成的 iid 序列取平均后也不超过 。所以其转换得到的批量算法对所有 的超额风险不超过 。
对在线算法取 infimum,便得到
若在线累计遗憾为 ,批量超额风险便为 。因此在线可学习蕴含统计可学习;反向不由此推出。课件预告后续会给出严格不等的例子,本讲没有证明那些例子的具体性质。
12.5 补充:什么时候能取平均模型
若 是凸集、 对 凸,则 ,Jensen 不等式给出
此时可用平均决策代替随机挑一个决策。一般离散预测器或非凸决策空间没有这个保证,课件选择随机输出正是为了无需额外凸性假设。
13. 部分信息:多臂老虎机难在哪里
13.1 把问题写成课件的抽象符号
设有 个动作,
每轮环境设定损失向量 ,算法选择 ,只观察
遗憾仍相对最佳固定动作:
全信息模型能看到完整向量,因此可以计算这轮每个动作的损失;bandit 模型只看到选中动作的一个坐标。推荐系统看到用户是否点击了被推荐的项目,却没有看到用户对未推荐项目的反事实反馈,这是该模型的直观例子。
13.2 一个不可区分例子
假设算法一直只选动作 1,始终观察损失 。它无法区分“动作 2 的损失总为 0”和“动作 2 的损失总为 1”这两种环境,因为实际反馈完全相同。
在第一种环境里,始终选择动作 1 会产生线性遗憾 。这说明探索其他动作不是装饰性技巧,而是获取区分环境的信息所必需的。
13.3 补充:一个反馈估计公式解释探索的作用
若当前按 抽取动作,所有 ,可定义
条件于过去信息及当前已选定的 ,当前动作才被抽样,因此
但其二阶矩为
很小的抽样概率会放大估计波动,零概率则根本无法估计该坐标。这解释了探索与利用之间的张力。它只是帮助理解反馈的补充推导,不是完整 bandit 无遗憾算法证明。
13.4 为什么不能直接照抄全信息嵌套公式
在全信息模型里,两个不同 都被学习者观察到,后续策略可以针对它们分别选行动。在 bandit 模型里,只要它们给出相同的 ,学习者就无法区分它们,必须在这些历史下采取相同的条件策略。
如果仍在每个完整隐藏历史后放置一个独立的 ,就暗中允许学习者看到未揭示坐标,从而低估游戏难度。正确形式化必须保留“相同观察历史 ⇒ 相同策略”的信息约束,或引入信念状态等额外结构。
所以课件说没有明显的同款嵌套表达,并不意味着部分信息博弈完全不能形式化,而是全信息那种简单后向归纳不能未经修改直接使用。
14. 整体联系、边界条件与课件索引
14.1 三个层次的困难如何累计
统计学习面对未知分布,但 iid 结构提供了过去与未来的联系。在线学习去掉固定分布假设,要求每轮在反馈前决策。部分信息进一步限制反馈,使算法不仅要选择损失小的动作,还要获得足够的信息。
本讲不是证明三种框架下的具体最优速率,而是建立评价标准和两个基本逻辑结论:
Lecture 2 从 出发,找出能够控制它的复杂度;Lecture 3 则进一步处理实值无限类。
14.2 最容易误读的地方
| 课件说法或简写 | 严谨理解 |
|---|---|
| 风险是固定量 | 固定预测器时成立;随机训练得到的预测器,其风险随训练集随机 |
| Distribution-free | 不指定 的参数形式,仍有 iid 等建模条件 |
| 公平标签意味着“无法学习” | 不能降低绝对风险到 以下;相对同样受噪声限制的参考类,超额风险可以为零 |
| 就是 improper | 空间允许类外输出;具体算法是否 proper 取决于实际输出是否一直在类内 |
| No Free Lunch 假设连续输入空间 | 下界只需有足够多不同输入;并针对分布一致保证 |
| 平均风险至少 | 至少存在一个分布风险不低于 ,不是必然等于 |
| No-regret 是“遗憾趋零” | 正确要求平均遗憾趋零,即累计遗憾次线性 |
| 自适应环境很强 | 可以依赖过去实际动作,但不能在本协议中看完当前随机动作再回应 |
| 一般空间的嵌套游戏公式 | 有限空间可完整后向归纳;一般空间需补可测性和策略选择条件 |
| 在线到批量可以平均任意模型 | 随机挑一个总是保持合法;直接平均需要凸空间及凸损失等条件 |
| 部分信息只少看一些数字 | 还限制了哪些后续策略能够依赖哪些历史 |
14.3 逐项证明定位
| 原课件内容 | 本报告 |
|---|---|
| 输入、输出、预测器、损失 | 第 1 节,(1)–(4) |
| iid、测试误差、风险及其随机性 | 第 2 节,(5)–(10) |
| 公平硬币反例、无知学习动机 | 第 3 节,(11)–(12) |
| 一般设置、超额风险、样本量 | 第 4 节,(13)–(15) |
| PAC 例子 | 第 5.1–5.2 节,(16)–(20) |
| 密度估计与 KL 等式 | 第 5.3 节,(21)–(23) |
| 统计博弈值与可学习性 | 第 6 节,(24)–(26) |
| 定理 1:No Free Lunch | 第 7 节,(27)–(32) |
| 表达、泛化、优化三种误差 | 第 8 节,(33)–(35) |
| 在线协议、遗憾、环境类别 | 第 9–10 节,(36)–(40) |
| 原课件式 (2)、(3):嵌套游戏值 | 第 11 节,(41)–(45) |
| 定理 2:online-to-batch | 第 12 节,(46)–(50) |
| 部分信息与 MAB | 第 13 节,(51)–(56) |
14.4 学完后应能独立回答
- 为什么训练算法的风险需要对训练集的随机性再取期望?
- 为什么学习目标应与参考类最佳函数比较,而不是对所有分布要求绝对风险趋零?
- 无免费午餐证明里随机选择标签函数,和数据分布本身有随机标签有什么区别?
- 在线遗憾为什么与“每轮最佳动作”不同?
- 嵌套表达式中为什么 位于当前动作抽样的期望之前?
- Online-to-batch 证明在哪一步依赖 不读取 ?
- Bandit 为什么不能允许策略依赖完整隐藏损失向量?