C01
AqSolDB 水溶解度模型误差的来源分层归因:以测量可靠性等级与官能团亚群分解 MAE
1 · 研究问题
在公开水溶解度数据集 AqSolDB 上训练的描述符模型,其骨架划分(scaffold split)测试误差中有多大比例可归因于数据集自身的多来源测量不一致(由 AqSolDB 自带的 SD 列与来源分组标签度量),而非模型泛化能力不足?若按测量可靠性分层重新评估,不同建模方法之间的排名是否发生改变?
2 · 研究背景与空白
水溶解度(aqueous solubility,以 logS 表示)由晶格能、极性、氢键供受体数、疏水表面积共同决定,是定量结构-性质关系(QSPR,quantitative structure–property relationship)的经典试金石。Delaney 于 2004 年的 ESOL 方程仅用 logP、分子量、可旋转键数、芳香原子占比四个描述符,就把平均绝对误差压到约 0.75 log 单位,二十年来一直是"简单模型能做到多好"的参照点。
已有工作走到哪一步:Sorkun 等(Scientific Data, 2019, 6:143)把 9 个来源合并成 AqSolDB,共 9,982 条去重记录,并在数据集里显式保留了两个质量字段——SD(同一化合物在多来源中的测量标准差)与 Group 标签(按来源数量与一致性划分的可靠性分组,G1–G5,具体判定规则须回原文核实)。后续基准工作(SolTranNet, JCIM 2021;TDC 平台的 AqSolDB scaffold split 协议)报告的骨架划分 MAE 落在 0.74–1.0 log 单位——例如一项 2026 年的描述符+超参优化工作报 MAE = 0.739 ± 0.006、R² = 0.802 ± 0.003。随机划分因同一骨架跨越训练/测试集而高估性能已被反复指出;2026 年更有工作(arXiv:2607.10729)指出骨架划分本身也会掩盖"结构前沿"失效。
空白在:几乎所有基准论文都把 AqSolDB 当作一块均质的标签来用,报的是全库单一 MAE,而没有人系统性地问"这 0.74 log 单位里有多少本来就是实验值之间的分歧"。AqSolDB 已经把这个分歧量化在 SD 列里,却几乎无人把它作为分层变量。这属于评价维度的转换:数据全公开、门槛低(RDKit + scikit-learn),且无论误差主要来自数据还是来自模型,结论都成立。
3 · 可检验假设
H1 在 AqSolDB 的高可靠性子集(多来源一致、SD ≤ 0.5 log 单位)上,骨架划分 MAE 比全库 MAE 低至少 0.15 log 单位;即全库基准值中至少 20% 的表观误差来自标签噪声而非模型。
H2(备择/机制假设)不同建模方法(岭回归、随机森林、梯度提升、Morgan 指纹 + SVM)在全库上的排名,与在高可靠性子集上的排名不一致:至少有一对方法的相对次序发生翻转,且翻转在自助抽样 95% 置信区间上可分辨。若 H2 被否证(排名完全稳定),则说明现有基准排名对标签噪声稳健,这本身是对社区有用的负结论。
4 · 量化验收标准
- 方法学校验(硬门槛):用自建管线在 Delaney 原始 ESOL 分子集(1,1xx 个分子,须以原文为准)上重建其四描述符线性方程,复现的平均绝对误差与文献报告值(约 0.75 log 单位)偏差 ≤ 0.10 log 单位;同时在 TDC 的 AqSolDB scaffold split 协议下复现随机森林基线,MAE 与已发表值偏差 ≤ 0.10 log 单位。此条不过关,后续全部分层结论无效,因为无法区分"分层效应"与"自己管线的 bug"。
- 统计口径预先写死:主结果一律报 MAE 与 RMSE(单位 log 单位),划分方式为 Bemis–Murcko 骨架划分(RDKit
MurckoScaffold),并额外做一次随机划分对照,明确报出随机划分相对骨架划分的乐观高估幅度(Δ MAE)。所有点估计附 1,000 次自助重抽样的 95% 置信区间。不报 R² 作为唯一指标。 - 分层至少覆盖:可靠性分层(按
SD分 3 档 + 单来源组)、官能团分层(用 RDKit SMARTS 定义 ≥ 8 类,如羧酸、磺酰胺、硝基、卤代芳环等,每类样本量 ≥ 100 才纳入统计)。每一层给出 MAE ± 95% CI 与样本量。 - 至少 4 种建模方法 × 5 个随机种子,全部结果表格化;报告"方法排名在分层前后是否翻转"的具体次序表。
- 全部脚本(数据下载、描述符生成、划分、训练、分层统计、作图)开源到 GitHub,附
environment.yml,第三方一条命令可重跑;随机种子写死。
5 · 数据与工具
| 用途 | 来源 / 工具 |
|---|---|
| 主数据集 | AqSolDB,9,982 条 logS 记录,含 SD 与来源分组列。Harvard Dataverse(DOI 10.7910/DVN/OVHAW8)直接下载 CSV,约数 MB |
| 方法学校验基准 | Delaney ESOL 集(1,1xx 分子,MoleculeNet delaney.csv 镜像);TDC(Therapeutics Data Commons)Solubility_AqSolDB 的官方 scaffold split。仅用于校验与对比,不计入本项目的数据贡献 |
| 描述符 | RDKit(开源,pip/conda 装):内置 200+ 二维描述符、Morgan 指纹、MurckoScaffold 骨架提取、SMARTS 子结构匹配。Mordred 可选(约 1,800 描述符,10k 分子约 20–40 分钟单核,需核实本机实测) |
| 建模与统计 | scikit-learn(岭回归/随机森林/SVM)、LightGBM 或 XGBoost(CPU 版)、SciPy 自助抽样 |
| 算力 | 全程纯 CPU。RDKit 二维描述符生成 10k 分子约 1–3 分钟单核;随机森林在 10k×200 矩阵上训练秒级;4 方法 × 5 种子 × 2 划分 × 若干分层的全量实验,单机数小时内完成。无任何超出笔记本范围的步骤 |
6 · 方法路径
- 装环境(RDKit + scikit-learn),下载 AqSolDB 与 ESOL,重建 Delaney 四描述符方程并跑通方法学校验硬门槛(第 1–4 周)。
- 核实 AqSolDB 的
Group/SD字段定义(回 Scientific Data 原文与数据字典),写出明确、可复现的可靠性分层判据,判据一旦写定不得事后调整。 - 构建统一的描述符矩阵与骨架划分/随机划分两套索引,冻结为版本化文件。
- 训练 4 种模型 × 5 种子,先在全库复现已发表基线数字(第二道校验)。
- 按可靠性等级与官能团亚群做误差分解,逐层给 MAE ± 自助 95% CI,并画"误差 vs 标签 SD"的散点与分箱曲线。
- 做方法排名稳定性分析:全库排名 vs 高可靠子集排名,用配对自助检验判断次序翻转是否可分辨。
- 独立交叉校验:用一种完全不同的表征(Morgan 指纹 + 最近邻)重算同一套分层结论,确认结论不依赖描述符选择。
7 · 新颖性边界
- 本课题不声称提出新的溶解度预测方法,不声称刷新 AqSolDB 上的 SOTA,不声称"骨架划分优于随机划分"这一已被反复发表的结论为本项目发现。
- 已有工作具体完成了什么:Sorkun 等(2019)构建 AqSolDB 并提供质量字段;SolTranNet(2021)与 TDC 平台给出 scaffold split 下的标准基线;arXiv:2607.10729(2026)指出骨架划分仍会掩盖结构前沿失效。这些工作报告的都是聚合到全库的单一误差数字。
- 本项目的贡献是评价维度的转换,且这是主结论而非附加内容:把 AqSolDB 已有但未被使用的测量可靠性信息作为分层变量,给出"公开基准 MAE 中有多少是标签噪声地板"的定量估计,并检验现有方法排名对该噪声是否稳健。
- 为什么有价值:如果高可靠子集上的误差地板显著低于全库数字,说明社区一直在用一个被噪声抬高的基准衡量新方法的进步,后续方法比较应改用分层报告。
- "差异不显著"同样是有效结论:若分层后 MAE 与排名都不变,则说明 AqSolDB 的标签噪声对基准评估影响可忽略——但必须用自助置信区间证明本研究有能力分辨 0.1 log 单位量级的差异,否则"不显著"只是样本量不足。
8 · 决策门槛(go / no-go)
- 第 4 周末:方法学校验硬门槛必须通过(ESOL 复现偏差 ≤ 0.10 log 单位)。若失败,先排查描述符定义与单位;仍失败则降级为只用 MoleculeNet
delaney.csv做全流程(分子数少但标注干净),分层轴改为官能团单轴,主结论框架(误差分解 + 排名稳定性)完全保留。 - 第 8 周末:核实 AqSolDB 高可靠子集(
SD≤ 0.5)的样本量。若不足 1,500 个分子,骨架划分后测试集过小、置信区间会宽到无法判定,立即降级:其一,把分层阈值放宽到SD≤ 1.0 并改报三档趋势而非二分对比;其二,改用"来源数量"(单来源 vs 多来源)作为可靠性代理变量。两条降级路径都保留"误差分解 + 排名稳定性"这一主结论框架。 - 第 12 周末:若发现 AqSolDB 的
Group字段定义在原文中不足以支持可靠性排序(这一点必须在第 8 周前查清,不要边做边发现),则完全弃用该字段,只用SD数值列。 - 预算裁剪顺序:先砍 Mordred 大描述符集(改用 RDKit 内置 200 个),再砍模型种类(从 4 种减到 2 种),最后砍官能团分层类别数。砍到只剩"RDKit 描述符 + 2 模型 + SD 分层"时主结论仍成立。
- 选择前提:适合需要一条几乎不可能全盘失败的路线的学生,也适合作为团队保底题与高风险路线并行。