P28
基于 SDO/HMI SHARP 磁场参数的耀斑预报模型在第 25 周新样本上的独立检验
来源说明:本则出自独立撰写的第二批方案。它与前 20 则同样遵循八块结构与硬门槛要求,但撰写时未做英文文献检索,新颖性边界依据的是历届获奖图谱与既有知识,而非当轮查新。因此其「需核实」条目更多,启动前须自行补一轮英文检索。
1 · 研究问题
用 Bobra & Couvidat(2015)的 SHARP 磁场特征集与同型线性分类器,在其训练年代(第 24 周)之外的第 25 周(2020–2026)数据上重新训练与测试,预报 M 级以上耀斑的技能(TSS、PR-AUC)相比原文是否显著下降?下降幅度能否由类别不平衡率与活动区群体分布的变化解释?
2 · 研究背景与空白
SDO/HMI 自 2010 年起对每个活动区输出 SHARP(Space-weather HMI Active Region Patch)参数——总无符号磁通、电流螺度代理等约 20 个标量,逐 12 分钟更新,是耀斑物理条件的标准指纹。耀斑预报因此可表述为极不平衡二分类:未来 24 h 内产生 M+ 耀斑的活动区时刻仅占百分之几。
Bobra & Couvidat(2015, ApJ)用 SHARP 特征 + SVM 在第 24 周数据上得到 TSS ≈ 0.76(准确数值需核实),成为该领域引用最多的基线;后续深度学习工作层出,但多数仍在相近年代的数据上交叉验证,存在"周期内乐观偏差"的公开讨论。
空白在于时间覆盖与评价维度:第 25 周构成一个真正独立的群体(极大期强度、活动区分布均不同),对基线模型做严格的跨周期外推检验、并把性能变化分解为"不平衡率变化 vs 特征分布漂移"的公开分析很少(需核实:搜索关键词 "SHARP flare prediction solar cycle 25 cross-cycle generalization")。表格级数据 + 线性模型,纯 CPU 完全可行。
3 · 可检验假设
- H1:在第 25 周按时间划分的测试集上,同型模型 TSS 相比原文报告值下降 ≥ 0.05(即跨周期外推存在可测退化);PR-AUC 相对第 24 周复现值下降 ≥ 10%。
- H2:对特征逐一做第 24/25 周分布比较(KS 检验),漂移最大的前 3 个特征被剔除后,跨周期性能差至少缩小一半;若 H1 不成立(无退化),"基线跨周期稳健"即为主结论。
4 · 量化验收标准
- 方法学校验(硬门槛):在原文时间范围与口径(样本定义、正负例窗口、特征集)内重建数据集并复现其分类性能,TSS 与原文差 ≤ 0.05。此条不过关,后续全部结论无效。
- 统计口径预先写死:极不平衡分类,主指标为 PR-AUC、召回、精确率与 TSS;明确不报 accuracy(不平衡率 ~2% 时全负预测即可得 98% accuracy,毫无意义)。训练/测试按时间划分(逐活动区整段划分防泄漏);另做一次随机划分对照,量化随机划分带来的乐观高估幅度并写入正文。
- 性能置信区间:对测试集按活动区整块自助重抽 ≥1000 次。
- 消融矩阵:全特征 / 剔除漂移特征 / 单特征基线(总无符号磁通)三档全报。
- 样本规模:第 25 周正例(M+ 前 24 h 时刻的活动区样本)≥ 300(第 4 周核实实际数)。
- 可复现性:特征提取查询语句、样本定义文档、训练脚本全部开源。
5 · 数据与工具
| 用途 | 来源 / 工具 |
|---|---|
| SHARP 参数 | 斯坦福 JSOC(jsoc.stanford.edu),通过 Python drms 包只拉取关键字表头(不下载磁图),第 25 周全表约 GB 级以下,纯 CPU;drms/SunPy 均开源 |
| 耀斑标签 | 同 T07 的 GOES 耀斑目录(NOAA,公开),按 NOAA 活动区号关联 |
| 建模 | Python:scikit-learn(SVM/逻辑回归),表格级训练秒-分钟级 CPU |
| 基线对照 | Bobra & Couvidat 2015 的特征定义与性能,仅用于校验与对比,不计入本项目的数据贡献 |
6 · 方法路径
- 装 drms/scikit-learn 环境,小批量拉取 SHARP 关键字验证查询通路。
- 按原文口径重建第 24 周数据集,复现基线性能(验收 1)。
- 用完全相同管线生成第 25 周数据集,冻结样本定义文档。
- 跨周期实验矩阵:24 训 25 测 / 25 训 25 测(时间划分)/ 随机划分对照。
- 特征分布漂移分析(逐特征 KS + 效应量),做消融(H2)。
- 自助法置信区间与结果表;负例欠采样敏感性检查。
- 独立交叉校验:用逻辑回归替换 SVM 复跑主矩阵,确认结论不依赖分类器选择。
7 · 新颖性边界
- 本课题不提出新预报方法、不声称超越深度学习现状;SHARP 特征集与 SVM 基线是 Bobra & Couvidat(2015)的已发表工作。
- 已有工作:原文在第 24 周数据上定义特征与基线;后续文献多在相近年代交叉验证。
- 本项目贡献(主结论):第 25 周真正跨周期的独立检验 + 性能变化的"不平衡率 vs 特征漂移"分解 + 随机划分乐观偏差的量化。属"新样本独立检验 + 评价维度转换"。
- 价值:预报模型的跨周期泛化是空间天气业务的真实痛点;"不退化"与"退化并可归因"都是有效结论,由自助法置信区间保证可分辨 0.05 的 TSS 差。
- 核对获奖清单:"Development of a High-Efficiency Objective-Prism Stellar Spectrograph And Construction of its Dedicated AI Classification Model"(2025 银奖)表明"物理 + ML"路线被评委接受;该题是自制仪器 + 分类,本题是公开档案 + 跨周期泛化检验,对象与贡献类型均不同。2021 铜奖 TESS 假阳性管线同为"档案 + 分类",但对象是凌星候选体,与太阳磁参数无重叠;报告中点名两者并写清差异。
8 · 决策门槛(go / no-go)
⚠️ 第 4 周末:核实 JSOC/drms 通路与第 25 周正例数(阈值 ≥ 300)。若 JSOC 批量查询受限,降级:改用社区整理的公开 SHARP 机器学习基准数据集(存在多个,具体可用性需核实:搜索关键词 "SHARP flare prediction benchmark dataset Liu 2019")作为特征源,跨周期检验框架不变。 ⚠️ 第 8 周末:验收 1 复现达标(TSS 差 ≤ 0.05);不达标则冻结新实验,按"样本窗口定义 → 特征版本 → 类权重"顺序排查。若 12 周仍不达标,降级:放弃复现原文绝对值,改为"同一自建口径下第 24 vs 25 周对照"(内部一致比较),独立检验框架保留。 ⚠️ 选择前提:学生需已具备 scikit-learn 基础;英文答辩须能解释 TSS/PR-AUC 为何优于 accuracy——这本身是加分点。