K15
小参数量 CNN 从零训练 vs 预训练特征线性探针——CIFAR-10-C 腐蚀鲁棒性与校准的等墙钟对比
1 · 研究问题
在消费级纯 CPU 的固定墙钟预算(8 小时)内,「从零训练小 CNN」与「冻结预训练骨干 + 线性探针(linear probe)」两条路线,谁能在 CIFAR-10-C 腐蚀鲁棒性与概率校准上取得更好的前沿?精度、鲁棒性、校准三者在 0.1M–11M 参数区间内如何联动?
2 · 研究背景与空白
Hendrycks & Dietterich(ICLR 2019)建立 CIFAR-10-C 基准:15 种腐蚀 × 5 强度,指标为平均腐蚀误差 mCE;Ovadia 等(NeurIPS 2019)表明分布偏移下模型校准(ECE)系统性恶化。这些结论全部建立在 GPU 训练的中大型模型(WRN-28-10 等)上。
空白在:文献从未回答「无 GPU 的固定墙钟预算下,训练与探针两条路线的鲁棒性/校准前沿谁更优」——这恰是教育与边缘场景的真实约束;且 0.1M–1M 参数的极小模型区间在 CIFAR-10-C 上的精度–鲁棒性–校准联动无系统报告。评测本身零训练成本,结构性绕开算力墙:主要交付物是测量与联动规律,而非训练出的模型。
3 · 可检验假设
- H1:等 8 CPU 小时预算下,预训练 ResNet-18 特征 + 线性探针的 mCE 比最优从零训练小 CNN 低 ≥10 个相对百分点,但其 ECE 在高强度腐蚀(强度 4–5)下反而更差(过自信迁移)。
- H2:在从零训练路线内部,0.1M–1M 参数区间的相对 mCE(相对干净误差归一)与参数量近似无关(斜率 95% CI 含 0),即「小模型更脆弱」的直觉在该区间不成立。
4 · 量化验收标准
- 方法学校验(硬门槛):下载公开预训练 ResNet-18(CIFAR-10 版)checkpoint,复现其干净测试精度(约 93–95%,以模型卡为准)偏差 ≤1 个百分点,并复现文献报告的 CIFAR-10-C mCE 偏差 ≤5%。不过关则后续全部结论无效。
- 从零训练路线门槛:自训小 CNN 干净精度 ≥85%,否则该路线数据点无效。
- 统计口径预先写死:报 mCE(按 Hendrycks 原始口径以 AlexNet 归一或明确改用绝对误差并声明)、逐腐蚀类型误差、ECE(15 箱)与可靠性图;类别平衡数据不报 PR-AUC,报 top-1 误差。
- 每配置 5 个随机种子报均值 ± 标准差(探针路线对特征提取种子不敏感,报 3 次数据增广重复)。
- 等墙钟口径:两条路线各限 8 CPU 小时(含调参);另报「不限时收敛」口径,两种都报。
- 全部训练日志、checkpoint 与评测脚本开源。
5 · 数据与工具
| 用途 | 来源 / 工具 |
|---|---|
| 数据 | CIFAR-10(torchvision 内置);CIFAR-10-C(Zenodo 官方下载,约 2.9 GB)——仅作输入与对照,不计入本项目数据贡献 |
| 预训练骨干 | 公开 CIFAR-10 版 ResNet-18 checkpoint(huggingface / GitHub 社区权重,写明来源与哈希)与 ImageNet 预训练 MobileNetV3——不计入本项目模型贡献 |
| 训练 | PyTorch CPU。实测标尺(第 1 周校准):ResNet-18 全量 CIFAR-10 CPU 单轮约 25–60 分钟 → 100 轮超出范围;0.1–0.5M 参数自设计 CNN + 20k 子集单轮约 3–8 分钟 → 40 轮过夜可行 |
| 特征提取 | ResNet-18 对 5 万训练图一次性推理约 1–2 CPU 小时;线性探针(logistic 回归)秒级 |
| 评测 | CIFAR-10-C 全量 95 万张推理:小 CNN 约 2–4 小时/模型;预算内每条路线最多评 6 个模型点 |
6 · 方法路径
- 装环境,完成预训练模型的干净精度与 mCE 双校验(硬门槛)。
- 实测本机单轮/单张推理墙钟,写出能力边界表(哪些配置超 8 小时预算)。
- 设计 4–6 个参数量档位的小 CNN(0.1M/0.3M/1M/3M),在等预算内训练 × 5 种子。
- 构建探针路线:两种骨干 × 线性/浅 MLP 探针,等预算内完成。
- 全部模型过 CIFAR-10-C,计算 mCE、逐腐蚀误差与 ECE。
- 拟合参数量–相对 mCE 关系(H2),自助法给斜率置信区间。
- 交叉校验:用 numpy 独立实现 ECE 与 torchmetrics 结果互核(偏差 ≤1%)。
7 · 新颖性边界
- 本课题不声称提出新的鲁棒化方法;CIFAR-10-C 基准与「偏移下校准恶化」结论分别由 Hendrycks & Dietterich (2019)、Ovadia et al. (2019) 发表,不得声称为本项目发现。
- 已有工作:鲁棒性–模型规模关系在 GPU 大模型区间有报告(越大越稳);探针 vs 微调的迁移对比(Kumar et al. 2022)关注分布偏移精度,未覆盖 CPU 等墙钟口径与校准联动。
- 本项目贡献(主结论):消费级 CPU 等墙钟预算下两条路线的鲁棒性–校准前沿测绘 + 极小参数区间的联动规律。
- 价值:给「没有 GPU 的部署者该选哪条路」一个有误差棒的定量答案;H1 的任一半被否证都构成有信息量的结论。
8 · 决策门槛(go / no-go)
- 第 2 周末:完成墙钟实测。若单轮时间比估算高 >2 倍(老旧 CPU)→ 具名降级:数据子集降到 10k、腐蚀评测降采样每类 2000 张(分层抽样),主结论框架不变、CI 拉宽。
- 第 6 周末:从零训练路线若最优点仍 <85% 精度 → 该路线保留为「负结果数据点」,重心全转探针路线内部对比(骨干 × 探针容量 × 校准),H1 改为探针内部版本。
- 第 20 周:CIFAR-10-C 全量评测墙钟超支 → 固定降采样口径并对全量做一次抽检校准(偏差 ≤1%)。
- 预算裁剪顺序:先砍浅 MLP 探针,再砍 3M 参数档;5 种子降为 3 为最后手段。