ISEF Topic Scoping 2027

P677–87

R² = 0.98 的灌溉模型,跟"明天和今天一样"比赢多少

推荐优先级:最高 · 参赛子类:Plant Sciences — Agriculture/Agronomy · 资源需求:一台笔记本,零器材成本,零合规,零生长周期风险 · 技能取向:时序验证设计 / 基线对照 / 统计推理

1 · 研究问题

一个用滞后土壤水分预测未来土壤水分的 NARX 模型报告 R² = 0.98——持续性基线(persistence baseline,即"预测值 = 上一时刻观测值")在同一份数据上的 R² 是多少?在滚动原点(rolling-origin)时序交叉验证下,两者的差距还剩多少,换算成实际节水量又是多少?

2 · 研究背景与空白

背景。 土壤水分是一个高度自相关的物理量:土壤是一个大热容、大水容的缓冲体,今天根区的总含水量与昨天的差别通常只有百分之几。这带来一个统计上极其常见但后果极其严重的陷阱——当模型的输入包含目标变量自身的滞后值时,一个什么都不学的"复读机"(预测值 = 上一时刻观测值)就已经能拿到极高的 R²。 更麻烦的是 R² 的定义:它衡量的是模型解释的方差占总方差的比例,而对一个缓慢变化的序列,总方差本身几乎全部由长期趋势贡献,日间波动只占很小一部分。因此在自相关序列上报告 R² = 0.98,可能意味着模型学到了物理,也可能意味着它只学会了"抄上一行",而这两种情况在 R² 这个数字上完全无法区分。 时序预测领域对此的标准做法是强制报告相对基线的技巧评分(skill score),而不是绝对拟合优度。

已有工作到哪一步。 PLNT031(2025,Grand Award,"Quantify Crop Water Requirement by NARX Model") 摘要原文:"Previous (lagged) total soil moisture (TSM) in the rootzone with average daily air temperature and relative humidity were used as the input variables into the NARX model to predict TSM"、"高 efficiency and accuracy (R2 value of 0.98) with an average water savings of 21.1% for the test set"。输入含滞后 TSM、输出是 TSM——这个设定下 R²=0.98 几乎是自相关的必然产物,而不是模型能力的证据。摘要中没有任何基线对照。 同一作者的 PLNT026(2026,Special Award,"NDVI-Based NARX Model for Predicting Soil Moisture") 报告 R = 0.91,同样无基线。两届连续获奖、同一方法论空白。 PLNT031 的方法学被明确描述为五步:"data collection and processing, model development, parameter selection, use of trained network for prediction, and model output analysis",五步中没有一步是基线对照;其数据来源为 "A data set from an olive orchard"。

空白在于整个 PLNT 语料里没有任何一个时序预测项目报告过基线对照,也没有任何一个说明训练/测试划分是按时间还是随机做的,因此这类模型的实际预测技巧是完全未知的。这个空白适合一年期学生课题的理由:数据全部公开且可在几小时内落盘;整条课题纯计算、零器材、零合规、零生长周期风险,是本文件里唯一完全不会因为植物长得慢而报废的一条;而且结论正负都成立——若 NARX 相对基线的技巧评分接近零,那是一个能推广到整类课题的方法学结论;若技巧评分显著为正,那就为这类模型提供了它们自己没给出的、真正的能力证明。

3 · 可检验假设

H1 在滚动原点时序交叉验证下,NARX 类模型相对持续性基线的技巧评分(skill score = 1 − MSE_model / MSE_persistence)低于 0.30,即模型相对"明天和今天一样"的改进不足三成;同时持续性基线自身在同一份数据上的 R² ≥ 0.90。判据来源:日尺度土壤水分的滞后 1 天自相关系数在多数站点高于 0.95,而 R² 与自相关系数的平方同阶,因此 R² ≥ 0.90 是自相关的直接后果而非模型能力。

H2(备择/机制假设,H1 被否证时仍有内容)技巧评分随预报提前期(lead time)单调衰减,且在提前期 ≥ 3 天时才显著为正——即模型的真实价值不在于复现明天,而在于多日预报;同时"随机划分 vs 时间划分"的对照将显示随机划分把技巧评分高估至少 0.15。若 H2 成立,本课题的结论就从"模型没用"细化为"模型在什么提前期上才有用、以及错误的验证方式高估了多少"——这是一条比单纯批评更有操作价值的判据。

4 · 量化验收标准

  1. 方法学校验(硬门槛,不过关则后续全部结论无效)。 自建管线必须重跑一个已发表算例并复现其数值:选取一个公开发表、且提供了原始数据与报告指标的时序预测算例(可以是公开数据集的基准论文,也可以是所选数据平台自带的示例分析),用自建管线复现其报告的 RMSE 或 R²,偏差须 ≤ 5%。同时管线必须通过一组已知答案的自检断言:对一段人工合成的、已知自相关系数为 ρ 的 AR(1) 序列,持续性基线的理论 R² 应为 ρ²,自建代码算出的值与理论值偏差须 ≤ 1%这一步不过关不许往下做,后续全部结论无效——本课题的全部主张就是"基线算出来是多少",基线算错则一切归零。
  2. 统计口径预先写死——训练/测试必须按时间划分,并额外做"随机划分 vs 时间划分"对照。 主验证方案为滚动原点时序交叉验证(≥ 5 个折,每折训练窗前推、测试窗紧随其后,绝不重叠)。明确写明不使用随机划分作为主结果及其原因:滞后输入下的随机划分会把测试期的相邻样本泄漏进训练集,系统性高估性能。 同时必须额外跑一次随机划分并报告两者差距——这个差距本身就是一个可发表的量化结论。
  3. 统计口径预先写死——主指标是技巧评分,不是 R²。 主结果为相对持续性基线的技巧评分及其自助抽样 95% 置信区间(按时间块自助抽样,block bootstrap,不得逐点重抽——逐点重抽会破坏自相关结构)。明确写明不以 R² 作为主结论及其原因:R² 在自相关序列上被总方差主导,对预测技巧不敏感。 同时报告 RMSE、MAE 与偏差分解。
  4. 基线必须 ≥ 3 条,且预先定死。 (i)持续性基线;(ii)季节性朴素基线(预测值 = 去年同期观测值,或按年内日序的气候态均值);(iii)多元线性回归(滞后 TSM + 气温 + 湿度)。三条基线在开题时写死,附属赛后不得增删。 NARX 类模型至少与这三条在完全相同的划分与完全相同的输入集上比较。
  5. 提前期扫描与站点数量下限。 预报提前期 ≥ 4 档(1 / 3 / 7 / 14 天),站点 ≥ 5 个且覆盖 ≥ 2 种气候类型,每站点连续记录 ≥ 3 年。若站点数不足 5 个,须在局限性中显式声明结论的外推范围。
  6. 农学意义必须量化到节水量,不能停在统计量。 必须把技巧评分换算为实际灌溉决策的差异:在同一套灌溉触发规则下,模型驱动与持续性基线驱动分别给出的年度灌溉水量与作物水分胁迫天数。这一条是本课题落在 PLNT 而非 CBIO 的关键——见 §8 选择前提。
  7. 可复现性。 全部数据下载脚本(含站点 ID 与抓取日期)、原始数据快照落盘、自检断言、基线与模型实现、滚动原点划分代码、block bootstrap 脚本全部开源,第三方可一键重跑得到相同的技巧评分与置信区间。

5 · 数据与工具

用途 来源 / 工具
长期土壤水分时序(主数据) 公开地面站网:USDA SCAN、国际土壤水分网络(ISMN)、各国农业气象站网。须核实:目标站点的记录完整性、缺测比例、土壤水分传感器的埋深层次与采样频率,以及是否同时提供气温与相对湿度。本报告未实测下载链路,一律写"需核实"
气象协变量 与土壤水分同站点的气温、相对湿度、降水记录;若站点不提供,需另找配对气象数据源。须核实:跨源配对时的时区与时间戳对齐方式——时区错位一小时会静默污染全部滞后特征
参考蒸散(可选协变量) 公开的 ET₀ 产品或由气象要素按公开公式计算。须核实:所用公式版本与其输入要素是否齐备
已发表算例(用于 §4 第 1 条校验) 一个提供原始数据与报告指标的公开时序预测基准。须核实:具体选哪一个——本报告未指定,学生须在 9 月前确定并实测复现
对照基准(仅用于校验与对比,不计入本项目的数据贡献 PLNT031(2025)的 R² = 0.98 与 21.1% 节水;PLNT026(2026)的 R = 0.91。注意:这两个数字来自不同的数据集,不能与本课题结果直接比较,只能作为"这类项目通常报告什么量级"的参照
模型与统计 Python + numpy/pandas/scikit-learn/statsmodels;NARX 可用带外生变量的滞后特征回归或小型 MLP 复现(sklearn.neural_network)。R 亦可。纯 CPU 笔记本即可,数据为 CSV,MB 量级
灌溉决策仿真(§4 第 6 条) 简单水量平衡模型 + 公开的作物系数表。须核实:所用作物系数表的来源与适用作物——原文无来源,写"需核实"
须核实项 本课题的唯一实质风险是数据可得性。 所有站点数据的实际可下载性、API 稳定性与历史记录长度均未在本报告中实测,学生必须在 9 月前逐一核实并一次性落盘,见 §8 条件 1

6 · 方法路径

  1. 建体系 + 跑通已知对照 + 完成 §4 第 1 条的校验。 实现数据读取管线与三条基线;用 AR(1) 合成序列验证持续性基线的 R² 等于 ρ²(偏差 ≤ 1%);用一个已发表算例复现其报告指标(偏差 ≤ 5%)。这一步不过不许继续。
  2. 核实工具与数据的能力边界。 这个方向有四个不报错但给错结果的静默失败点,必须逐一实测排除:(a)缺测值被静默插补——多数时序库的默认读取会把缺测前向填充,而前向填充恰恰就是持续性基线,这会让基线与"数据"变成同一个东西,主结论直接失效;必须显式检查缺测比例并对缺测段做删失处理而非填充;(b)时区与时间戳对齐错误——跨源配对气象数据时错位一小时不会报错,但会系统性削弱协变量的表观贡献;(c)随机划分导致的信息泄漏——train_test_split 的默认行为是随机打乱,对时序数据是致命的,且完全不报错;(d)标准化在划分之前做——若先对全序列标准化再划分,测试集的统计量已泄漏进训练集,同样不报错。这四条必须在代码里写成断言,而不是靠记性。
  3. 一次性落盘全部数据并记录抓取日期。 站点数据会随时间更新,首次抓取即冻结快照并记录日期,否则中途数据变动会让前后分析对不上。抓取只需数小时,没有理由拖延。
  4. 实现三条基线并在滚动原点划分上评估。 先跑基线、再跑模型——顺序很重要:先看到基线有多强,才能设计出有意义的模型对照。
  5. 实现 NARX 类模型并做等条件对照。 输入集、划分方案、评估指标与基线完全一致。"等条件"须给出明确、可复现的判据:预先写明哪些超参数被调、在哪个折上调、调参是否只用训练窗内的验证子窗(绝不允许用测试窗调参)。
  6. 做提前期扫描与"随机划分 vs 时间划分"对照。 产出主图:技巧评分 vs 提前期,两条曲线(时间划分 / 随机划分),带 block bootstrap 置信区间。
  7. 独立交叉校验。 用另一种方法算同一个量:把技巧评分换算为灌溉决策层面的差异——在同一套触发规则下仿真整年灌溉,报告模型与基线各自的用水量、超灌天数与欠灌天数。若统计层面的技巧评分显著为正但灌溉层面的用水量差异不足 1%,那本身就是本课题最有力的结论:模型在统计上赢了,在农学上没赢。

7 · 新颖性边界

本课题不声称: - 不声称首次指出时序模型需要基线对照。这是预测科学的基础常识,在气象与水文预报文献中技巧评分是强制报告项,学生必须主动引用而非当作发现。 - 不声称 PLNT031(2025,Grand Award)PLNT026(2026,Special Award) 的模型是错的。本课题没有它们的数据集(PLNT031 用的是 "a data set from an olive orchard",未公开),因此绝不能声称复现或反驳了它们的具体数值。 本课题只在自己的公开数据上回答"这类设定下基线有多强"。 - 不声称提出新的土壤水分预测模型或改进 NARX 算法。 - 不声称 21.1% 的节水量是错的。该数字来自本课题无法访问的数据集与灌溉规则。 - 不声称结果可外推到本课题未覆盖的气候类型或土壤质地。

已有工作做到哪: PLNT031 用滞后 TSM + 气温 + 湿度预测 TSM,报告 R² = 0.98 与测试集平均节水 21.1%;PLNT026 用 NDVI + 滞后 SM 预测 SM,报告 R 高达 0.91。两者都没有报告任何基线,也都没有说明训练/测试划分方式。

本项目的贡献(属「评价维度转换」型): 已有工作评估的是模型的绝对拟合优度;本项目评估的是这类设定下模型相对于最朴素基线的增量技巧,以及错误的验证方式会把这个增量高估多少。这是主结论,不是附加内容。

为什么有价值: "用机器学习预测农业时序"是学生项目里增长最快的一类,而它们几乎全部报告绝对拟合优度、几乎全部不报基线。若结论是"技巧评分接近零",那么这一整类课题的性能声称都需要重新表述;若技巧评分显著为正,那就为这类模型提供了它们自己没给出的、真正的能力证明。两种结果都改变这类课题的写法。

若结论不显著: 若 NARX 相对基线的技巧评分置信区间跨过零,即"在现有公开数据下无法分辨模型优于复读机"——这同样是有效结论,但必须给出误差棒证明有能力分辨这个差异:具体地,必须报告本设计(5 站点 × 3 年 × 5 折)能检出的最小技巧评分,否则"没测到优势"只是因为功效不足。

8 · 决策门槛(go / no-go)

🟡 条件 1(第 4 周末,即 2026 年 9 月初):≥ 5 个站点 × ≥ 3 年的配对数据必须实测下载成功并落盘。 本报告未实测确认任何数据源的可下载性。若 9 月初仍无法取得,立即降级:改用「单站点长序列 + 合成数据」路径——找到哪怕一个可下载的长序列站点作为真实案例,同时用已知统计性质的合成 AR 序列(可控自相关系数、可控噪声)系统扫描"自相关强度 → 基线 R² → 模型增量技巧"的关系。主结论框架保留(仍是"自相关如何伪造高 R²、真实技巧有多少"),且合成数据路径反而能给出一条更干净、更可推广的定量关系曲线。这条降级路径的数据风险为零。

🟡 条件 2(第 8 周末,即 2026 年 10 月初):缺测比例必须 ≤ 20% 且缺测不集中在特定季节。 若某站点缺测严重或缺测有季节结构,立即降级:剔除该站点并在局限性中显式声明;若剔除后站点不足 3 个,退回条件 1 的合成数据路径。主结论框架不变。

⚠️ 与「附属赛后不得修改」的冲突点: 五件事必须在 2026 年 11 月底前定死:(1)三条基线的精确定义;(2)滚动原点划分的折数、训练窗长与测试窗长;(3)主指标(技巧评分)与其置信区间方法(block bootstrap 及块长);(4)站点集合与数据快照日期;(5)灌溉触发规则。事后换站点或事后换划分方案会构成选择性报告,是评审最敏感的问题之一。 数据快照日期尤其关键——站点数据库是活的,不冻结快照则前后分析对不上。

须提前核实而非边做边发现的事项: - 本方向未做外部文献核查,「未找到前作」不等于「不存在前作」。 土壤水分预测的基线对照在水文与遥感文献中是标准做法(重点查 Water Resources ResearchJournal of HydrologyAgricultural Water Management)。学生必须在开题前查清并主动引用,新颖性主张须严格限定为"该对照未见于 ISEF 语料的学生项目实践"。 - 数据源的可下载性、API 稳定性与历史记录长度须在 9 月初前实测。这是本课题唯一的实质风险,也是唯一必须提前解决的事。 - 用于 §4 第 1 条校验的已发表算例须在 9 月前选定并实测复现。

已知困难及其定位: 本课题几乎没有技术困难,最大的风险是归类:它偏计算,容易被评委或组委会归到 CBIO(计算生物学)或 EAEV(地球与环境科学)而非 PLNT。应对方式已写进设计:§4 第 6 条强制把技巧评分换算为实际灌溉水量与作物水分胁迫天数,主结论必须以农学量收尾而非以统计量收尾。展板的标题句应当是"模型比复读机多省了多少水",不是"技巧评分是多少"。另一个困难——自相关如何伪造高 R²——本身就是研究内容,这正是课题要测量的对象。

选择前提: 适合数学/统计基础扎实、能接受"主结论可能是一个零结果"的学生。不适合希望做实验装置或需要视觉冲击力展板的学生——本课题的展板全是图表。 也不适合把"跑通别人的模型"当作研究的学生:本课题的全部价值在于对照设计,模型代码本身是现成的。

预算裁剪顺序: 无预算可裁(零成本)。时间不足时的裁剪顺序:先砍提前期档位从 4 档减到 2 档(保留 1 天与 7 天),再砍站点从 5 个减到 3 个,再砍第三条基线(多元线性回归),最后砍 §6 第 7 步的灌溉仿真——但灌溉仿真应当尽量保留,它是本课题落在 PLNT 类目的依据。 砍到最后主结论框架仍完整保留。

合规与表格: 本课题是全文件合规负担最低的一条:纯计算、零器材、无生物材料、无化学品、无装置。Form 1、Form 1A、Form 1BForm 2A(2027 新增学生支持披露表)为强制项无需 Form 3(无危险化学品与装置)。公开数据集研究免 IRB(人类受试者豁免第 2 类:公开的既有数据集且不与人互动)。不涉及 PHBA、rDNA、脊椎动物、人类受试者、非本地物种引入。注意:规则明文排除"文献综述、纯演示、说明模型、单纯复现"——本课题必须清楚地表明它有自己的研究问题、自己的假设与自己产生的分析结果,而不是复现 PLNT031。 AI 政策:研究计划、摘要、展板与引文不得由生成式 AI 撰写;本课题代码量最大,AI 生成代码的显式引用与提示词日志保留在这里尤其重要展台:无任何活体、液体、土壤或玻璃,展台合规风险为零。展位靠技巧评分 vs 提前期曲线、随机划分 vs 时间划分的对照图、灌溉水量对照条形图与自相关诊断图撑住——全部是图表,这既是它的安全之处也是它的局限。

生长周期时间轴: 2026-08 中旬提交 Form 1/1A/1B/2A → 审批 2–4 周(无 PHBA,不需额外 2–6 周;本课题审批负担最轻)→ 2026-09 初完成数据落盘与 §4 第 1 条校验 → 2026-09 至 2026-11 完成基线、模型、提前期扫描与灌溉仿真 → 2026-12-15 数据分析截止,留三周做展板。本课题不种植物,无播种日、无主结局测量日、无 60 天红线——它是本文件里唯一完全不受生长周期约束的课题之一(另一条是 P9)。 唯一的时间硬约束是数据快照必须在 11 月底前冻结,此后不得更换。

评分: O=8, W=9, F=9, S=7, Fit=7 → base=82.0,h=5 → [77, 87],置信度:高