Yau Awards Archive 2020 — 2025

K12

SMOTE 类重采样在梯度提升分类器与阈值调优对照下的真实收益——PR-AUC 与概率校准双口径的独立复检

优先级:高分族:评测审计 / 不平衡学习资源:纯 CPU / 零预算技能:Python + 统计类型:评价维度扩展

1 · 研究问题

Elor 等(2022)「对强分类器而言 SMOTE 类重采样基本无益」的结论,在极端不平衡(正类 <0.5%)的公开数据集与概率校准(calibration)这一新评价维度上是否仍然成立?重采样带来的排序指标变化与校准恶化之间是否存在系统性权衡?

2 · 研究背景与空白

SMOTE(Synthetic Minority Oversampling Technique, 2002)在少数类样本间线段上合成新样本,是不平衡分类最常被套用的预处理。Elor & Averbuch-Elor(2022, "To SMOTE, or not to SMOTE?")在 73 个数据集上系统检验,结论:对 XGBoost/Catboost 等强分类器,重采样在排序指标上无稳定收益,对弱分类器才有益;后续 benchmark(arXiv:2303.03094, 2023)进一步支持「恰当调阈值即可替代重采样」。

空白在:这批审计集中在中度不平衡与排序/分类指标;正类占比 <0.5% 的极端区间覆盖稀疏,且重采样对预测概率校准质量(欺诈风控、医疗分诊真正消费的量)的破坏少有系统量化。数据全公开、单模型训练秒级,结论正负都成立。

3 · 可检验假设

  • H1:在 ≥10 个正类占比 0.02%–2% 的公开数据集上,LightGBM + 阈值调优相对 LightGBM + SMOTE 的 PR-AUC 差异的 95% 置信区间包含 0(即极端区间上原结论复现)。
  • H2:SMOTE 使预测概率系统性偏高,Brier 分数与期望校准误差(ECE)相对不重采样恶化 ≥30%,且恶化幅度随过采样倍率单调上升。

4 · 量化验收标准

  1. 方法学校验(硬门槛):用原论文开源代码/协议在其 3 个数据集上重现「强分类器下 SMOTE 无益」的方向性结论,且 PR-AUC 数值偏差 ≤5%。不过关则后续全部结论无效。
  2. 统计口径预先写死:报 PR-AUC、召回、精确率、Brier、ECE 与可靠性图;不报 accuracy——正类 0.2% 时全预测负类即得 99.8% accuracy,该指标无信息。
  3. 5×2 分层交叉验证 × 5 随机种子,报均值 ± 标准差;配对差用自助法给 95% 置信区间。
  4. 不平衡率控制实验:对同一数据集降采样正类至 2%/0.5%/0.1%/0.02% 四档,画收益–不平衡率曲线(≥4 个参数点)。
  5. 对照方法 ≥5 种:不处理、类权重、阈值调优、SMOTE、Borderline-SMOTE、随机欠采样。
  6. 全部管线开源,第三方一键重跑;总计算量预估 <20 CPU 小时。

5 · 数据与工具

用途 来源 / 工具
极端不平衡数据 ULB Credit Card Fraud(Kaggle 公开,284,807 行,正类 0.17%);KDD Cup 1998、Santander、保险理赔等 OpenML 公开集(openml.org 按 imbalance 检索下载)——仅作输入,不计入本项目数据贡献
校验对照 Elor 2022 论文开源代码与其数据清单——仅用于校验,不计入贡献
重采样实现 imbalanced-learn(内置 SMOTE 全家族;文档层面核实默认 k 近邻参数与原论文一致)
分类器 LightGBM / XGBoost / logistic 回归(CPU 上单数据集训练秒–分钟级)
校准度量 scikit-learn calibration_curve、自实现 ECE(需自行实现分箱,写明箱数判据)

6 · 方法路径

  1. 装环境,复现原论文 3 个数据集结论,完成硬门槛校验。
  2. 核实 imbalanced-learn 各实现与原始算法论文的参数差异,写成对照表。
  3. 按不平衡率与领域分层选定 ≥10 个公开数据集,冻结清单后不再增删。
  4. 跑全因子实验:数据集 × 6 种处理 × 3 分类器 × 5 种子。
  5. 做不平衡率降采样控制实验,绘收益曲线。
  6. 分析排序指标与校准指标的权衡结构(H2),配可靠性图。
  7. 交叉校验:用另一套独立实现(如自写朴素 SMOTE)核对合成样本分布一致。

7 · 新颖性边界

  • 本课题声称提出新重采样方法;「强分类器下 SMOTE 无益」由 Elor et al. (2022) 与 2023 年 benchmark 已发表,不得声称为本项目发现。
  • 已有工作:Elor 2022 覆盖 73 个中度不平衡数据集、排序指标口径;2303.03094 加入调参对照。历届丘奖中 2025 优胜「Class-Imbalanced Semi-Supervised rPPG」是把不平衡学习应用于具体任务,与本题的方法审计方向不同。
  • 本项目贡献(主结论):把审计推进到极端不平衡区间(评价样本切片扩展)+ 校准维度(评价维度转换),并给出「排序收益 vs 校准代价」的量化权衡。
  • 价值:校准恶化直接影响风控/医疗中概率的可用性,这一代价在教程与实践中普遍被忽略;若校准并不恶化(H2 否证),同样是对社区流行说法的有效纠正。

8 · 决策门槛(go / no-go)

  • 第 3 周末:原论文代码若无法运行或结果偏差 >5% → 排查至第 5 周;仍不过则降级:以 imbalanced-learn 标准实现 + 自建协议重建基线,校验对象改为「重现 ULB 欺诈集上已发表的 LightGBM PR-AUC 区间」,审计框架不变。
  • 第 8 周末:确认 ≥10 个满足不平衡率区间且列可用的数据集;不足 → 用降采样构造(已在设计中),并明确标注为半合成切片。
  • 第 30 周:若 H1、H2 均呈「无显著差异」→ 不改题;以等价性检验(TOST)报告效应量上界,负结论成文。
  • 预算裁剪顺序:先砍 Borderline-SMOTE 等变体,再砍分类器至 2 种;数据集下限 8 个不可再砍。