项目目录

CSCI 678 / 课程笔记

Lecture 1 详细讲解报告:学习问题的形式化与三种模型

逐节展开 Lecture 1:监督学习的形式化、i.i.d. 假设、无免费午餐定理的完整证明、在线到批量转换,以及多臂老虎机的部分信息难点。

进行中
根据 Haipeng Luo 的 Lecture 1(2026 年秋季,原课件 8 页)展开。结构沿用 Lecture 3 讲解报告:说明问题的目的、解释量词与符号、逐步证明公式、讨论例子及结论边界。标为“补充”的内容用于解释原文,而不是声称课件已经证明了额外定理。 原课件:lecture1.pdf(未在线发布)。本站配套:课件完整翻译;后续讲解:Lecture 2Lecture 3。默认损失及随机变量可测,所写期望和差值有定义。有限空间上的论证不需要额外可测性技术;推广到一般空间时应保留相应条件。

阅读导航:第一讲为何花这么多篇幅定义问题

“从数据学到规律”还不足以成为一个可以证明的数学命题。至少需要回答:数据从哪里来,算法能看见什么,什么时候作决定,损失怎样计算,与谁比较,以及保证必须对哪些环境成立。

本讲依次建立三种模型:

模型数据与信息学习者输出评价标准
统计学习来自未知分布的独立同分布样本看完训练集后输出一个预测器相对类内最优的期望超额风险
全信息在线学习逐轮产生数据,每轮结束看到完整结果每轮先作一次决定相对最佳固定决策的累计遗憾
部分信息在线学习逐轮产生数据,只看到动作对应的反馈每轮作决定并探索在反馈限制下控制遗憾

两项核心定理分别说明“并非任何类都能学习”和“在线可学习蕴含统计可学习”。理解它们的量词比记住常数更重要。

1. 监督学习:从输入、输出到损失

1.1 数据、预测器与学习算法是三个对象

输入空间是 ,输出空间是 。训练集为

课件用 简写序列。本文把样本视作有序元组,允许重复点;在计算“见过多少不同输入”时,才取其中不同元素的集合。

预测器 是函数 。算法 则是“从训练集到预测器”的映射:

随机算法还依赖独立随机种子 ,即 是一个模型; 是训练模型的过程,二者不能混为一谈。

猫狗分类可把图像编码为 ,标签编码为 ;机器翻译、语言建模、视频摘要也能写成输入到输出的映射。这里只是数学建模,不意味着这些任务共享相同损失或相同计算难度。

1.2 损失到底衡量什么

一般损失写成

二分类的 0–1 损失与回归的平方损失分别为

前者只区分对错;后者还惩罚数值偏差的大小,例如误差从 1 变成 3,平方损失从 1 变成 9。平方损失可能无界,后续若使用集中不等式或 Lipschitz 收缩,必须另加有界性等条件。损失的选择是问题定义的一部分。

2. 为什么必须假设训练与测试有关

2.1 独立同分布假设拆开来看

假设存在未知分布 ,使训练样本与新测试点都来自它:

“同分布”让过去数据与未来目标一致;“独立”保证新点不携带被训练过程刻意筛选后的依赖。若训练集全来自一种环境、测试集来自完全任意另一种环境,单凭训练数据通常无法保证测试表现。

现实中的随机划分只有在原始数据也满足适当采样条件时,才能支持这种模型。随机划分本身不会消除重复样本、时间相关性或数据来源偏差。课件以它提供直觉,不是声称任意随机切分自动证明独立性。

2.2 风险为什么比有限测试误差更适合理论

固定一个 ,总体风险为

独立测试集 的测试误差为

由期望的线性性和同分布性,

因此测试误差是风险的无偏估计。若损失方差为 ,独立性还给出

风险去掉了有限测试集带来的额外随机波动。若 已知,原则上可以直接最小化 ,问题变成优化;统计学习之所以存在,是因为 未知,只有样本可用。

2.3 训练之后的风险为什么又是随机变量

固定 时, 是一个数。随机训练得到 时, 变化。因此学习算法的期望风险是

若测试集独立于训练过程,条件于 后,仍然有 。如果不断用同一测试集挑模型,这个条件独立性便不能直接使用。

3. 不可约噪声与“无知学习”的目标

3.1 公平硬币标签为何没人能预测得更好

假设对每个 ,都有 。独立的新标签与训练集及算法随机种子条件独立。固定 ,无论算法预测什么,

再取期望,任何学习算法的风险都为 。因此“对任意分布都学到接近零的绝对风险”不可能。

但这不等于这个分布上的超额风险无法趋零:若所有参考函数风险也都是 ,任何预测器的超额风险已为零。课件这里的反例否定的是不加比较基准的低绝对风险目标。

3.2 从假设分布转向选择参考类

课件用经典参数统计作对比:例如假设 为高斯向量、给定 为均值 的高斯变量,再估计参数。这是一个说明性的对比,不意味着全部现代统计学都只研究参数高斯模型。

无知(agnostic)学习选择参考类 ,要求算法与这个类中的最佳函数相比表现接近:

这里“不依赖分布”意味着不对 指定参数形式;仍保留 iid、给定损失以及必要的可积性条件。先验知识没有消失,而是进入 的选择,例如线性函数、树模型或某种网络结构。

如果 本身不能很好表达任务,接近它的最佳函数也未必意味着绝对风险很低。这一点将在第 8 节用误差分解表达。

4. 一般统计学习框架与可学习性的量词

4.1 从监督学习推广到抽象决策

令样本 ,决策 ,参考类 ,损失 。定义

当算法总输出 中的元素时称为 proper;允许输出类外决策时可称为 improper。课件用 描述 proper 的设置。严格说,即使 更大,某个具体算法也可能始终只输出 ,因而仍是 proper 算法。

Proper 算法的超额风险非负;improper 算法有时能优于参考类,差值可能为负,不能在所有推理中都默认它非负。

4.2 样本复杂度怎样从速率得到

若对所有允许分布有

要保证超额风险不超过 ,解不等式:

这里 可能依赖参考类的维数、损失范围等。说 并不是说任何模型都需要相同样本数。

4.3 点态收敛与分布一致收敛

下面两种话语不同:

  • 对每个固定 ,当 足够大时误差小;需要多大样本可能依赖
  • 存在一个不依赖 的样本量,让所有允许 的误差都小。

本课程的 minimax 形式研究后者。有限样本算法可以随 变化,但不能依赖未知 。无免费午餐定理针对的也是这个统一保证。

5. PAC 与密度估计:两个重要例子

5.1 可实现 PAC 与无知学习的区别

可实现二分类假设存在 ,使

0–1 损失下 ,所以

PAC 保证常写为:给定误差 、失败概率 ,对任意输入边缘分布 和任意目标 ,足够多训练样本后,

“Probably”对应 ,“Approximately Correct”对应误差 。课件写样本量为 ,隐含了类的复杂度等依赖,也不是对算法运行时间的保证。

5.2 期望保证和概率保证怎样关联

,如果 (18) 成立,则

反过来,Markov 不等式给出

因此期望至多 足以得到失败概率至多 。这是基础转换,通常不是最紧的样本量分析,不能把它误认为两个框架在常数和速率上完全等价。

5.3 密度估计为何用对数损失

现在没有标签,样本 ,决策 是相对于共同基础测度的概率密度,损失为

若真实密度为 ,定义

在相关积分及差值有定义时,加减

为什么 KL 非负?若 的地方为零,则 KL 可能为 。否则用

所以 。辅助不等式由 取最小值零得到。

因此最小化期望对数损失,相当于找 KL 意义下最接近真实分布的类内密度;不要求 本身在参考类中。连续密度可以大于 1,所以对数损失本身可能为负;它不等同于一个总在 的分类损失。

6. 学习的博弈值:为什么先选算法,再选分布

6.1 Minimax 量与量词

课件定义

外层 寻找最佳学习规则;内层 检查这个规则在最不利分布下的表现。“先选算法”指承诺一套从数据到输出的策略,而不是在看到数据前就选定最终预测器。

若交换成 ,内层最优算法可以针对已知 设计,甚至直接输出其类内最佳决策,基本绕过了“分布未知”这件事。一般只有

不能无条件交换两者。证明 (25):对任意固定 ,有 ,依次取相应上下确界即可。

课件把

作为可学习性的正式刻画。在通常 proper、非负超额风险框架下,它就是最坏分布误差趋零。若最优策略的 infimum 不取到,为每个 选一个距离最优值至多 的策略,仍可得到趋零的算法序列。

6.2 哪些依赖被符号隐藏了

还依赖 及允许的分布集合。仅给函数类而改变损失或反馈模型,可能得到不同可学习性;不能把 当作唯一决定因素。

7. 定理 1:无免费午餐的完整下界证明

7.1 目标不是找到一个让所有算法失败的分布

对于所有二分类器组成的类 ,证明

量词是“对任意算法,存在一个难分布”,不是“存在一个固定分布,所有算法都失败”。算法可以随机化。原课件假设 连续;实际只需它对任意 都包含 个不同点,例如任何无限输入空间。

7.2 构造有限支持的候选分布

固定 个不同输入组成 ,令 为它们上的均匀分布。所有 种二元标记对应函数 ,其中

对每个 ,定义

每个 都是无噪声、可实现的:参考类包含 ,故最优风险为零。让标签随机地选择一个 ,只是证明时对候选分布取平均,不是说每个固定 的标签带硬币噪声。

7.3 为什么新测试点至少有一半概率未见过

固定训练输入序列 ,令 为其中不同输入的集合。它至多包含 个元素,而 个元素,所以

这个下界对每份训练输入序列都成立,允许采样重复。

7.4 未见点的配对论证:算法为何至少错一半

固定一个未见点 。把 种标记函数分成 对,每对 只在 上不同,其他 个点完全一样。

因为 不在训练集中,两者诱导的有标签训练集相同。因此确定性算法在 上的预测相同,但该点真实标签相反,有

随机算法可在两种情形使用同一随机种子耦合,逐种子仍满足此等式;再取期望即可。

对所有配对求和除以 ,得到平均错误率恰为 。因此对任意算法,

有限个数的平均值至少为 ,意味着至少一个 下的风险不低于 ,不意味着一定恰好等于 。因为算法任意,取 、再取 ,得到 (27)。

7.5 补充:未见概率的精确计算

固定测试点 ,每个训练点避开它的概率为 。独立性给出

所以配对论证实际上给出 。最后不等式也可由 Bernoulli 不等式 得到;它可对整数 用归纳法证明。课件只需要更简单的 常数。

7.6 这项定理的意义与范围

难分布可以随样本量 变化,所以结论针对分布一致可学习性。它不是说每个具体真实任务都无法学习,也不是说所有固定分布都很难。它说明:若允许类在未见输入上完全任意变化,就没有普遍有效的归纳规则。

一个类需要某种结构约束,才能让训练数据约束未见点的行为。Lecture 2 将用 VC 维把这种“结构约束”变成可以计算的参数。

8. 表达、泛化与优化误差怎样放在同一个式子里

设更大的比较空间最优风险为 ,类内最优为 。代数恒等式是

第二项是表达或近似误差。扩大 不会增大它,因为对更大集合取 infimum 只会更小。

为了展示泛化与优化的关系,设近似 ERM 输出 ,满足 。定义

选择类内最优或任意接近最优的 ,逐步得到

于是

三项分别对应泛化控制、优化误差、表达误差。这是上界,不是三种独立随机误差的精确分解。扩大类通常让表达更强,但 supremum 的范围更大,统一泛化控制可能更难;实际优化算法还可能偏向类的某个子集。本课程主要研究统计泛化部分。

9. 在线学习:改变的是决策协议

9.1 每轮允许看到什么

每轮

  1. 学习者根据过去信息选择 ,环境同时选择
  2. 学习者承受损失
  3. 全信息模型下,学习者观察完整 ,再进入下一轮。

统计学习是看完训练集才交付一个决策;在线学习是在反馈逐步到来时作出一串决策。不要求 独立或同分布,也不要求存在固定数据分布。

在课件的抽象监督学习实例中, 可以是一整个预测函数, 在随后揭示。若应用中先看到 再预测标签,则是带上下文的细化协议,需要明确哪些信息在哪一步揭示,不能默默改变当前定义。

9.2 遗憾中的 comparator 为什么必须固定

定义

对手是事后知道全部数据后挑出的同一个固定 。它不是每轮都能换一个最佳动作的 oracle:

左侧允许每轮单独最小化,因此更小,相比它的任务更困难。课件研究的是右侧的固定比较器。

例如两个动作的两轮损失依次为 ,两个固定动作都累计损失 1;若算法恰好先选第一个再选第二个,累计损失为零,遗憾是 。所以单个序列上的遗憾可以为负。

无遗憾学习要求最坏环境下的期望累计遗憾满足

不要求累计遗憾本身趋于零。累计 依然是无遗憾的。

10. 环境的能力:非自适应、自适应与当前动作

10.1 两种环境知道什么

非自适应环境(oblivious)知道学习算法,但在游戏开始前固定整个 ,不根据实际动作改变它。

自适应环境(adaptive)可以根据过去的实际动作和公共历史选择当前 。但在课件的同时行动协议中,它不能看到当前新抽出的动作 后再决定

可把公共历史写作

环境知道算法,所以能够推断当前动作的条件分布 ,但不知道这次随机抽样结果。知道“硬币正面概率”为 与知道这次是正面,信息完全不同。

10.2 补充:为什么随机化可能必不可少

考虑预测一个比特,损失为预测错误,参考类是两个常数预测器。对于确定性算法,环境可以从公开历史和算法推断当前预测,并令 。算法每轮损失 1,累计为 。两个常数的损失之和为 ,所以最佳常数损失至多 ,得到

这并没有赋予环境观察当前隐藏随机动作的能力,因为算法在这里是确定性的,动作已经可由过去信息推算。

随机化能使实际动作无法被精确推断,但不能单凭“随机”就保证小遗憾;算法仍需利用历史调节分布。如果允许环境看到当前实际随机动作再翻转标签,(40) 对随机算法也成立,这会改变问题本身。

11. 嵌套 minimax 的省略证明

11.1 在线博弈值

对指定环境类别 ,定义

自适应环境包含非自适应环境,所以

课件对自适应环境写出

每个后续 都可依赖此前实现的历史。它不是在开局一次性选好所有分布的表达式。

11.2 用后向归纳完整证明有限空间情形

先假设 有限、损失有限、轮数有限,避免可测策略选择问题。终局收益为

递归定义

最后一轮为何如此?给定历史,学习者选随机化分布 ,环境可根据 ,再抽出动作 。条件期望恰是右侧求和。算法要使最坏 的期望尽量小,因此外层是

归纳假设 已经等于每个后续历史的博弈值。下面分别证明 是可达的上界和不可突破的下界。

上界: 学习者在每个历史选达到或 -接近 (45) infimum 的 ,并在随后每个历史继续采用相应近似最优策略。无论环境如何选择,当前期望至多 ,后续累计近似误差至多剩余轮数乘 。所以最优策略的最坏收益不超过

下界: 任取学习者策略,它在当前历史诱导某个条件分布 。环境选择使右侧尽量接近 supremum 的 。实现动作后,在下一历史继续选择归纳保证的近似最坏回应。因此该策略的最坏收益至少

,两边吻合,完成归纳。再把 (45) 从 展开,得到 (43)。

环境在当前 上再随机化并不能提高这一步的 supremum,因为随机化所得只是各个固定 收益的加权平均,不超过最大值。

11.3 为什么预先随机选算法与逐轮抽样可等价

课件把随机策略描述为“对一组确定性历史映射的分布”。有限历史树上,可在开局预先为每个可能历史抽取一个动作,形成完整确定性策略;真正到达某个历史时读取对应动作,就实现了给定的逐轮随机策略。

反方向,对任意预先随机选取的完整策略,在已实现公共历史下求当前动作的条件分布,便得到 。逐轮按这些条件分布采样,由条件概率乘法公式产生相同的路径分布。这里学习者记得自身过去动作与信息,即具有完全记忆。

所以不能只把所有轮次视作互不相关的固定混合动作;依赖历史的条件分布才是关键。

对一般无限空间,这个递归仍是标准直觉和形式化表达,但等式的完全严谨推广需要相应可测性、条件分布以及近似策略选择条件。课件对任意抽象空间略去的技术性证明,不能仅凭有限情形就无条件宣称全部解决。本文给出了有限情形的完整证明并标明推广条件。

12. 定理 2:在线到批量学习转换

12.1 转换算法如何执行

给定 iid 训练集 和任意在线算法:

  1. 依次把样本作为在线反馈输入算法。
  2. 个在线决策 必须在读取 之前产生。
  3. 独立均匀抽取 ,输出

随机选择一个历史决策保持输出空间不变,即使它不具有线性或凸结构也合法。

12.2 最重要的独立性等式

包含此前样本及生成 所需的算法随机性。因为 是新的 iid 点,与这些信息独立,

再取期望: 。如果算法先看了 才产生 ,这个等式通常就不成立,这正是转换要求时间顺序的原因。

12.3 每一步不等式

对任意固定 ,由均匀随机输出和 (46):

第三步是因为经验最优比较器损失不大于任何固定 的经验损失,减去较小的数使差值更大。

对左侧取 ,右侧不变,得到

注意我们没有错误地交换 。证明先固定 ,最后再取 supremum,正是为了避免这个问题。

12.4 从单个算法到博弈值

任意在线算法若对所有固定序列的期望平均遗憾不超过 ,则对随机生成的 iid 序列取平均后也不超过 。所以其转换得到的批量算法对所有 的超额风险不超过

对在线算法取 infimum,便得到

若在线累计遗憾为 ,批量超额风险便为 。因此在线可学习蕴含统计可学习;反向不由此推出。课件预告后续会给出严格不等的例子,本讲没有证明那些例子的具体性质。

12.5 补充:什么时候能取平均模型

是凸集、 凸,则 ,Jensen 不等式给出

此时可用平均决策代替随机挑一个决策。一般离散预测器或非凸决策空间没有这个保证,课件选择随机输出正是为了无需额外凸性假设。

13. 部分信息:多臂老虎机难在哪里

13.1 把问题写成课件的抽象符号

设有 个动作,

每轮环境设定损失向量 ,算法选择 ,只观察

遗憾仍相对最佳固定动作:

全信息模型能看到完整向量,因此可以计算这轮每个动作的损失;bandit 模型只看到选中动作的一个坐标。推荐系统看到用户是否点击了被推荐的项目,却没有看到用户对未推荐项目的反事实反馈,这是该模型的直观例子。

13.2 一个不可区分例子

假设算法一直只选动作 1,始终观察损失 。它无法区分“动作 2 的损失总为 0”和“动作 2 的损失总为 1”这两种环境,因为实际反馈完全相同。

在第一种环境里,始终选择动作 1 会产生线性遗憾 。这说明探索其他动作不是装饰性技巧,而是获取区分环境的信息所必需的。

13.3 补充:一个反馈估计公式解释探索的作用

若当前按 抽取动作,所有 ,可定义

条件于过去信息及当前已选定的 ,当前动作才被抽样,因此

但其二阶矩为

很小的抽样概率会放大估计波动,零概率则根本无法估计该坐标。这解释了探索与利用之间的张力。它只是帮助理解反馈的补充推导,不是完整 bandit 无遗憾算法证明。

13.4 为什么不能直接照抄全信息嵌套公式

在全信息模型里,两个不同 都被学习者观察到,后续策略可以针对它们分别选行动。在 bandit 模型里,只要它们给出相同的 ,学习者就无法区分它们,必须在这些历史下采取相同的条件策略。

如果仍在每个完整隐藏历史后放置一个独立的 ,就暗中允许学习者看到未揭示坐标,从而低估游戏难度。正确形式化必须保留“相同观察历史 ⇒ 相同策略”的信息约束,或引入信念状态等额外结构。

所以课件说没有明显的同款嵌套表达,并不意味着部分信息博弈完全不能形式化,而是全信息那种简单后向归纳不能未经修改直接使用。

14. 整体联系、边界条件与课件索引

14.1 三个层次的困难如何累计

统计学习面对未知分布,但 iid 结构提供了过去与未来的联系。在线学习去掉固定分布假设,要求每轮在反馈前决策。部分信息进一步限制反馈,使算法不仅要选择损失小的动作,还要获得足够的信息。

本讲不是证明三种框架下的具体最优速率,而是建立评价标准和两个基本逻辑结论:

Lecture 2 从 出发,找出能够控制它的复杂度;Lecture 3 则进一步处理实值无限类。

14.2 最容易误读的地方

课件说法或简写严谨理解
风险是固定量固定预测器时成立;随机训练得到的预测器,其风险随训练集随机
Distribution-free不指定 的参数形式,仍有 iid 等建模条件
公平标签意味着“无法学习”不能降低绝对风险到 以下;相对同样受噪声限制的参考类,超额风险可以为零
就是 improper空间允许类外输出;具体算法是否 proper 取决于实际输出是否一直在类内
No Free Lunch 假设连续输入空间下界只需有足够多不同输入;并针对分布一致保证
平均风险至少 至少存在一个分布风险不低于 ,不是必然等于
No-regret 是“遗憾趋零”正确要求平均遗憾趋零,即累计遗憾次线性
自适应环境很强可以依赖过去实际动作,但不能在本协议中看完当前随机动作再回应
一般空间的嵌套游戏公式有限空间可完整后向归纳;一般空间需补可测性和策略选择条件
在线到批量可以平均任意模型随机挑一个总是保持合法;直接平均需要凸空间及凸损失等条件
部分信息只少看一些数字还限制了哪些后续策略能够依赖哪些历史

14.3 逐项证明定位

原课件内容本报告
输入、输出、预测器、损失第 1 节,(1)–(4)
iid、测试误差、风险及其随机性第 2 节,(5)–(10)
公平硬币反例、无知学习动机第 3 节,(11)–(12)
一般设置、超额风险、样本量第 4 节,(13)–(15)
PAC 例子第 5.1–5.2 节,(16)–(20)
密度估计与 KL 等式第 5.3 节,(21)–(23)
统计博弈值与可学习性第 6 节,(24)–(26)
定理 1:No Free Lunch第 7 节,(27)–(32)
表达、泛化、优化三种误差第 8 节,(33)–(35)
在线协议、遗憾、环境类别第 9–10 节,(36)–(40)
原课件式 (2)、(3):嵌套游戏值第 11 节,(41)–(45)
定理 2:online-to-batch第 12 节,(46)–(50)
部分信息与 MAB第 13 节,(51)–(56)

14.4 学完后应能独立回答

  1. 为什么训练算法的风险需要对训练集的随机性再取期望?
  2. 为什么学习目标应与参考类最佳函数比较,而不是对所有分布要求绝对风险趋零?
  3. 无免费午餐证明里随机选择标签函数,和数据分布本身有随机标签有什么区别?
  4. 在线遗憾为什么与“每轮最佳动作”不同?
  5. 嵌套表达式中为什么 位于当前动作抽样的期望之前?
  6. Online-to-batch 证明在哪一步依赖 不读取
  7. Bandit 为什么不能允许策略依赖完整隐藏损失向量?

源码审计版本 lecture1-explanation-report@2026-09-14