R1068–86
+0.4% 的提升,和换个随机种子的波动比哪个大
推荐优先级:较高 · 族 A(公开数据与开源模型) · 参赛子类:Robotics and Intelligent Machines — 学习方法与评测 · 资源需求:零实物采购;云 GPU 几十机时约 ¥300–800,平台计费与学生可用性需核实 · 技能取向:实验设计 / 方差分解 / 算力预算管理
1 · 研究问题
在类增量学习(class-incremental learning)设定下,固定算法与数据、只改变随机种子与任务出现顺序,重复 20–30 次,末任务准确率的噪声带有多宽?近两届获奖工作报告的 +0.4% / +2.5% / +2.7% 提升,有几个落在这条噪声带之内?
2 · 研究背景与空白
背景。 持续学习(continual learning)研究的是模型分批学习新类别而不忘旧类别的能力,常用指标是学完全部任务后的"末任务准确率"。这个设定有一个众所周知却极少被量化的性质:它对任务出现顺序极端敏感。同一算法换一个任务序列,末任务准确率摆动几个百分点是常态——因为每一步能学到什么,取决于此前见过哪些类、当前这批类与它们有多像。因此,任何"我比现有方法高 X 个百分点"的主张,只有在 X 明显大于"什么都不改、只换顺序"所产生的波动时才有意义。而这条噪声带,需要把同一个实验重复几十次才能测出来。
已有工作到哪一步。 2025 年本类目有两篇持续学习的获奖作品。2025 ROBO019(Grand Award)"Improving Generalizability in Continual Learning"(SSLA + 频域高低通增强,评测于 CIFAR-100 / Tiny-ImageNet / Skin23)明确报告 achieved significant gains in last task accuracy over the state-of-the-art with +2.5%. +2.7%, and over the baseline with +0.4%——+0.4% 被称为 "significant gains",却没有任何种子重复。另一篇是 2025 ROBO013(Special Award)"Continual Learning by Navigating Parameter Space"(EWC + Range Matrix),结论是 the structure of the last Fully Connected (FC) Layer significantly affects accuracy。检索方面,mine_isef "continual" 五届仅此两项,"reproducibility" 五届零命中;词频统计中 ROBO 48 篇 standard deviation 0 次、error bar 0 次、sensitivity analys 0 次、repeatab 0 次。
空白在于:没有人给这个子领域画过噪声底线——即"在固定算法与数据下,纯粹由种子与任务顺序造成的末任务准确率波动有多大"。这个空白适合一年期学生课题:它属于"评价维度转换"型,不需要提出新算法;数据集全部公开、零实物采购;实验时间可以通过缩减设定来压缩(这是关键,见 §5 的机时预算);而且结论正负都成立——噪声带宽或窄,都直接给出一条可引用的判据。
3 · 可检验假设
H1 固定算法与数据、只改变任务顺序与随机种子重复 20–30 次,末任务准确率的标准差 ≥ 1.0 个百分点;因此 +0.4% 落在噪声带之内(|Δ| < 1σ),而 +2.5% 与 +2.7% 落在带外(> 2σ)。
数值依据:任务顺序改变会改变每一步的类别难度组合。在本课题必须采用的缩减设定下(CIFAR-10 分 5 任务,见 §5 的算力约束),末任务只含 2 个类,其准确率对这 2 个类的具体身份极度敏感——把"猫/狗"放在最后与把"飞机/卡车"放在最后,末任务准确率天然不同。1.0 个百分点因此是一个保守的预设否证阈值而非文献引用值:实测标准差若低于它,H1 即被推翻。
H2(机制假设,H1 被否证时仍有内容)任务顺序贡献的方差大于随机种子贡献的方差,比值 ≥ 2。若成立,则在固定机时预算下,把重复次数优先分配给"任务顺序"而非"种子"信息量更高——这条分配规则本身就是一个可交付、可被他人套用的结论,并且直接决定本课题自身的实验矩阵设计(见 §5、§8)。
4 · 量化验收标准
- 方法学校验(硬门槛,不过关则后续全部结论无效)。 在缩减设定下复现一个已发表的类增量基线(例如 EWC 或朴素微调下界)在同一设定下的公开数值,偏差 ≤ 2 个百分点(具体基线与其公开数值须自行核实后写入研究计划,不得引用未经核对的数字)。这一步不过关则后续全部结论无效——本课题要测的噪声带宽度只有 1–3 个百分点,若自己的实现整体偏了 5 个点,噪声带的位置就失去参照。
- 统计口径预先写死,三个 n 必须分开报。(a)同一任务顺序下只换种子的重复次数 n_seed;(b)不同任务顺序的数量 n_order;(c)同一份训练权重在不同评估子集上的重评估——(c)不构成独立重复,不得计入任何 n。这三个 n 不是一回事,混用是本类目最常见的错误。方差用嵌套设计分解(种子嵌套于顺序),报告两个方差分量及其自助法置信区间。
- 若做任何降噪优化,必须报告优化前后的同口径对比。 若尝试延长训练、增大批量、或平均多个检查点来压窄噪声带,必须在同一顺序集合、同一种子集合下给出优化前后的噪声带宽度对照,不得只报优化后的数。
- 参数点。 ≥ 2 个设定(缩减 CIFAR-10 五任务为主;算力允许再加 CIFAR-100 的 20 类子集)× ≥ 2 个算法族(至少含一个正则化类如 EWC 与一个重放类)。
- 结论必须落回机器人任务。 给出"低于 X 个百分点的提升在本设定下不可辩护"的判据,并说明它对机器人持续学习的部署含义——例如移动机器人在新环境中增量学习新物体类别时,多大的指标改善才值得改动已部署的模型。没有这一步,本课题会被判为机器学习方法学而非 ROBO。
- 可复现性。 训练脚本、任务顺序表与种子表、逐次运行日志、完整的准确率矩阵、方差分解代码全部开源;AI 生成的代码须显式引用并保留提示词日志。
5 · 数据与工具
| 用途 | 来源 / 工具 |
|---|---|
| 主数据集 | CIFAR-10 / CIFAR-100,公开可下载、无采购周期、格式转换开销近乎为零 |
| 对齐 ROBO019 设定的备选数据集 | Tiny-ImageNet 与 Skin23。Skin23 属医学图像,其可得性、注册流程与许可证需核实;若不可得,本课题不对 ROBO019 的原始设定直接下判断(见 §7) |
| 模型 | ResNet-18 的窄化版本(本文件既有建议),缩减通道数以压低单次实验时长 |
| 算法 | 正则化类(EWC 一类)与重放类各一,均用公开实现,版本须固定并记录 |
| 算力(本条唯一的硬约束) | 纯 CPU 笔记本跑 30 次 CIFAR-100 类增量实验不现实。必须改用缩减设定(CIFAR-100 的 20 类子集 + 窄化 ResNet-18,或直接用 CIFAR-10 分 5 任务),并显式声明结论限定于该规模。预算内可租用几十小时云 GPU(约 ¥300–800),但必须先在本地把单次实验压到 20 分钟以内再上云,否则会烧完预算 |
| 机时预算(须在第 1 周算清) | 按单次 20 分钟计:n_order = 20 × n_seed = 10 共 200 次运行 ≈ 67 机时,已超出"几十小时"的预算量级。因此实验矩阵定为 n_order = 20 × n_seed = 3 = 60 次运行 ≈ 20 机时,把重复优先分配给方差更大的因子——这正是 H2 的直接应用,也是本课题自身设计的可辩护理由 |
| 对照基准(仅用于校验与对比,不计入本项目的数据贡献) | ROBO019 的 +2.5%. +2.7%, and over the baseline with +0.4%;ROBO013 的 FC 层结论 |
能力边界须核实项: 云 GPU 平台的计费口径、学生账号可用性与支付方式(这是本条真正可能卡死的一环,见 §8);Skin23 与 Tiny-ImageNet 的可得性与许可证;ROBO019 的完整实验设定(任务划分数、缓冲区大小、骨干网络、训练轮数)——摘要未给全,须回原文核对;本地单次实验能否压到 20 分钟(必须实测)。上述引语中 +2.5%. +2.7%, 一处的标点与语法看似不完整,此处存疑,需回原文核对,本文件不作改写。
6 · 方法路径
- 装环境 + 复现基线数值 + 把单次实验压到 20 分钟以内 + 算出机时预算表。(§4 第 1 条硬门槛)这一步不过不许继续——尤其是机时预算表,它决定实验矩阵。
- 核实算力与工具能力边界。 逐条排查以下静默失败点(不报错但给错结果): - 随机种子没有真正生效。只设了框架的全局种子,而数据加载器工作进程、cuDNN 算法选择、数据增强的随机源未固定,导致"同种子"其实不同;或反过来全局固定过度,让所有"不同种子"共享同一数据顺序,噪声带被系统性压窄。这是最致命的一条:不报错,且直接决定主结论的数值。 - cuDNN 非确定性算子:即便种子全部固定,GPU 上的非确定性 kernel 仍会带来运行间差异,被误计入"种子方差"。 - 任务顺序的"随机"与种子共用同一个随机源,导致顺序与种子不独立,嵌套方差分解失效——分解结果照样能算出来。 - 云平台抢占式实例被中断后自动重启,训练是从头开始还是从检查点续跑,两种情况结果不同,日志里不一定看得出来。 - 早停或学习率调度依赖验证集,而类增量设定下验证集的构成本身随任务顺序变化,于是"调度策略"偷偷成了顺序的函数。
- 定死实验矩阵与机时预算(设定数、算法数、n_order、n_seed),写入研究计划。
- 本地跑通全流程的小规模版本,再上云跑满矩阵(60 次运行 ≈ 20 机时)。
- 做嵌套方差分解:分离顺序方差与种子方差,给出两个分量及其自助法置信区间,判定 H1 与 H2。
- 把 +0.4% / +2.5% / +2.7% 逐个放到噪声带上判定,并给出"低于 X 个百分点的提升在本设定下不可辩护"这一判据,同时按 §4 第 5 条落回机器人部署含义。
- 独立交叉校验。 用与嵌套方差分析完全不同的原理估计同一个量:对任务顺序做置换检验(permutation over task orders)独立估计噪声带;并换一个算法族(重放类 vs 正则化类)验证噪声带宽度的量级结论是否稳健。两条独立路径给出同量级的噪声带,是本课题最强的证据。
7 · 新颖性边界
本课题不声称: - 不声称提出新的持续学习算法。本课题不参加"谁的算法更强"这场比赛,它测的是这场比赛的裁判尺度有多粗。 - 不声称 ROBO019 的结论是错的。 +2.5% 与 +2.7% 很可能是真实的;本课题质疑的只是 +0.4% 被称作
significant gains这一句。而且ROBO019 的完整设定摘要未给全,本课题只能在自己的设定下说话,不得把噪声带结论直接套到它的 CIFAR-100 原始设定上——这条边界必须写进摘要,否则会被原文当场驳回。 - 不声称首次发现持续学习对任务顺序敏感。这在文献中已知,是本条 h 取 9 的原因。 - 不声称给出普适的噪声带。主张严格限定于本课题实测过的缩减设定与算法族。已有工作做到哪: ROBO019 报
achieved significant gains in last task accuracy over the state-of-the-art with +2.5%. +2.7%, and over the baseline with +0.4%,无种子重复;ROBO013 报the structure of the last Fully Connected (FC) Layer significantly affects accuracy;五届continual仅此两项,reproducibility零命中;ROBO 48 篇standard deviation与error bar各 0 次。本项目的贡献(属「方法可复现性贡献」型): 已有工作报告的是"我的方法高了几个百分点";本项目给出的是"在这个子领域的这个设定下,什么都不改只换顺序与种子就能产生多大的波动,因而多小的提升是不可辩护的",并附带一条可套用的重复次数分配规则(H2)。这条噪声带是主结论,不是附加内容。
为什么有价值: 持续学习正是机器人最需要的能力之一——部署在真实环境里的机器人必须增量地学新物体、新场景。而这个子领域在本类目连续两届获奖,却没有一篇报告过种子或顺序的重复。噪声带一旦画出来,后来者可以在提交前自查,评审也能用它当尺子。
若结论不显著: 若噪声带极窄(标准差 < 0.2 个百分点),则 +0.4% 是可辩护的——这同样是有效结论,而且比抓到问题更有价值,因为它给这个子领域发了一张可引用的通行证。但必须给出误差棒(噪声带宽度自身的置信区间)证明有能力分辨这个差异,否则等于没做。
8 · 决策门槛(go / no-go)
🟢 2026-08-25(第 3 周末):本地把单次实验压到 20 分钟以内,基线复现通过,机时预算表完成。 若压不到 20 分钟,立刻缩减设定(改 CIFAR-10 五任务、进一步窄化 ResNet-18、减少训练轮数),不许直接上云硬扛——那会在两周内烧完全部预算而拿不到完整矩阵。
🟡 2026-09-14(第 6 周末,算力 go/no-go 项):云 GPU 账号与计费打通,并完成 ≥ 20% 的实验矩阵。 若云资源不可得(实名、支付方式、区域限制、学生账号不开放任一原因),降级路径:全部改为 CPU 可跑的极简设定(MNIST / FashionMNIST 分 5 任务 + 小型 CNN),n_order 保持 20 不变,主结论框架(噪声带宽度 + "不可辩护阈值"判据 + 顺序方差与种子方差的比值)完全保留;代价是必须显式声明结论限定于该规模,且不得再对 ROBO019 的 CIFAR-100 结果直接下判断,只能做量级讨论。这个降级必须在方案里提前写好,而不是等到十月才发现。
🔴 2026-11-30:实验矩阵与全部口径定死。 2026-12-15:数据采集截止,留 3 周分析与展板。
⚠️ 与「附属赛后不得修改」的冲突点: 设定(数据集、任务划分、骨干网络、训练轮数)、n_order 与 n_seed、以及"不可辩护阈值 X"的判定规则,一旦在附属赛后想改就不被允许。事后补跑几个顺序、或事后调整阈值,都构成选择性报告——而本课题的整个立论正是反对这种做法,自己犯一次就无法答辩。全部必须在 11 月底前一次定死并写入研究计划。
须提前核实而非边做边发现的事项: 云平台计费口径与学生可用性(go/no-go 项,见上);ROBO019 的完整设定——摘要未给全,须回原文核对;Skin23 与 Tiny-ImageNet 的可得性与许可证;第 2 步中"随机源是否全部被固定"的逐项验证。另外,本文件顶部已声明"基于本地五届语料,未做外部文献核查",而本条的原创性天花板由外部机器学习文献决定,学生必须在开题前自行补一轮外部文献检索,查清"持续学习的种子/顺序方差"已有哪些工作,并据此收紧主张边界。
已知困难及其定位: 算力是本条唯一的硬约束。但机时预算本身就是研究设计的一部分——在固定预算下把重复次数分配给方差更大的因子(任务顺序而非种子),是 H2 的直接应用;这个分配决策是可辩护的研究内容,而不是被迫的妥协。答辩时应当主动讲清楚这一点。
选择前提: 适合能忍受"把同一个实验跑 60 次"的学生,以及愿意管理云机时预算的学生。学科契合方面:Fit=9 虽不低,但仍必须把结论落回机器人任务(§4 第 5 条的部署判据),否则会被判为机器学习方法学而非 ROBO。不适合想做实物装置的学生——展板全是小提琴图与噪声带图。
预算裁剪顺序: 无实物预算可裁(零采购),可裁的是机时。裁剪顺序:先砍第二个数据集设定,再砍第二个算法族,再把 n_seed 从 3 降到 2(不得低于 2,否则种子方差不可估,H2 直接失效),最后把 n_order 从 20 降到 12(低于 12 时噪声带的置信区间宽到无法支撑"不可辩护阈值"这一主张,这是硬下限)。砍到最后,"噪声带宽度 + 不可辩护阈值"这一主结论框架仍完整成立。
🔴 展台能否展示实物: 产出是小提琴图与噪声带图,无展示风险,展台限制对本条的影响为零。无实物、无液体、无电池组、无锐器。禁网址与二维码——数据集与代码仓库地址均不得以网址或二维码形式出现在展板上。
评分: O=7, W=9, F=7, S=7, Fit=9 → base=77.2,h=9 → [68, 86],置信度:中