Yau Awards Archive 2020 — 2025

C03

ChEMBL 单靶点活性分类的时间外推衰减:以发表年份切分的独立检验与 PR-AUC 口径下的衰减-靶点属性关系

推荐优先级 高分族 化学信息学 / 数据库挖掘资源需求 纯 CPU + 约 50 GB 硬盘技能取向 SQL + Python + 不平衡分类统计失败风险 低-中

1 · 研究问题

在 ChEMBL 数据库中,把训练集与测试集按化合物首次发表年份切分(时间划分,time split)后,单靶点活性二分类模型的 PR-AUC 相对骨架划分与随机划分分别下降多少?这一下降幅度是否可由靶点的可观测属性(该靶点化学空间的年度扩张速率、活性化合物骨架多样性、正样本比例)预测?

2 · 研究背景与空白

QSAR(quantitative structure–activity relationship)模型在真实药物发现中的用法永远是"用过去预测未来",而学术基准常用的随机划分(random split)把同一化学系列同时放进训练与测试集,系统性高估前瞻性能。Sheridan(JCIM 2013)最早论证时间划分交叉验证(time-split cross-validation)比随机划分与留类法更接近真实前瞻预测的 R²。

已有工作走到哪一步:Lenselink 等(J. Cheminform. 2017)用 ChEMBL 19 训练、ChEMBL 20 新增活性做时间验证,覆盖数百靶点;后续工作用 ChEMBL 23→24 做同类前瞻验证。Landrum 与 Riniker 的 SIMPD 算法(J. Cheminform. 2023)从 ChEMBL 生成 99 个带时间特征的公开数据集。这些工作都确认了时间划分下性能会掉

空白在:现有工作报告的是"时间划分下性能更低"的平均效应,而没有把"衰减幅度"本身当作因变量去解释——即"哪些靶点的模型会掉得多,哪些几乎不掉,能否事先判断"。同时,前述工作的数据截止在 ChEMBL 19–24(2014–2018 年前后),2023 年之后新增的活性数据构成了一个完全独立的新时间切片。本课题同时占据"换样本"与"换问题方向"两条差异化轴。

3 · 可检验假设

H1 在 2023-01-01 之后首次出现的化合物构成的时间外测试集上,单靶点分类模型的 PR-AUC 中位数比骨架划分低 ≥ 0.05(绝对值),比随机划分低 ≥ 0.10;差异在靶点级自助 95% 置信区间上可分辨。

H2 衰减幅度(ΔPR-AUC = 骨架划分 PR-AUC − 时间划分 PR-AUC)与"测试期新骨架占比"呈正相关,Spearman ρ ≥ 0.4(自助 95% CI 下界 > 0)。若 H2 被否证,说明衰减不可由化学空间扩张速率预测,需另寻解释变量——这同样是有效结论,且直接反驳了一个直觉上很强的假设。

4 · 量化验收标准

  1. 方法学校验(硬门槛):选取 Lenselink 等(2017)或 SIMPD(2023)公开数据集中至少 3 个靶点,用自建管线(相同描述符、相同模型类别、相同划分)复现其报告的性能指标,偏差 ≤ 0.05(以其报告的主指标绝对值计)。此条不过关意味着数据抽取或建模流程与社区惯例不一致,后续跨靶点比较全部无效
  2. 统计口径预先写死:活性分类天然极不平衡(正样本常 < 10%),主指标一律为 PR-AUC,同时报召回率与精确率,明确不报 accuracy(在 5% 正例率下全预测为负即可得 95% accuracy,该指标无信息量)。划分方式三套并行:随机划分、Bemis–Murcko 骨架划分、按化合物首次发表年份的时间划分,三者必须在同一批靶点、同一模型、同一测试集规模下比较。所有点估计给靶点级 1,000 次自助 95% 置信区间;相关性分析(H2)给自助置信区间而非仅 p 值。
  3. 靶点纳入判据写死并冻结:每靶点在时间切点前需 ≥ 300 条带标准活性值(pChEMBL)的记录、切点后 ≥ 100 条;活性阈值统一取 pChEMBL ≥ 6(并做 ≥ 5 与 ≥ 7 的敏感性分析);只保留 assay_type = 'B'(结合实验)与单蛋白靶点。纳入靶点数 ≥ 30。
  4. 报告"时间划分测试集中的新骨架占比"分布,并给出 ΔPR-AUC 对该变量的回归斜率与自助置信区间。
  5. 全部 SQL 查询、抽取脚本、划分索引、模型代码开源;数据抽取结果以中间 CSV 形式随代码发布(受 ChEMBL 许可允许范围内),第三方可跳过数据库直接重跑分析。

5 · 数据与工具

用途 来源 / 工具
主数据 ChEMBL 全库 SQLite dump,EMBL-EBI FTP(ftp.ebi.ac.uk/pub/databases/chembl/ChEMBLdb/latest/)。解压后约 20–40 GB(版本相关,需核实当年版本实际体积)。年份信息取自 docs.year(文献发表年)关联 activitiesassaysdocs
轻量替代(降级) Papyrus 数据集(标准化的 ChEMBL+ExCAPE 生物活性集,含时间信息,体积远小于全库,需核实其年份字段完整性);或 ChEMBL 网页按靶点导出 CSV(单靶点几 MB)
方法学校验基准 Lenselink 等(2017)公开的 ChEMBL 19/20 基准集;SIMPD(2023)发布的 99 个数据集(GitHub, rdkit 组织下)。仅用于校验与对比,不计入本项目的数据贡献
描述符与模型 RDKit(Morgan 指纹 r=2, 2048 位 + 二维描述符)、scikit-learn(随机森林、逻辑回归)、LightGBM(CPU)
算力 纯 CPU。SQLite 查询在 SSD 上单靶点秒级、全库聚合查询分钟级;30 靶点 × 3 划分 × 2 模型 × 5 种子的训练总计单机数小时。瓶颈是硬盘空间与首次下载带宽,不是 CPU

6 · 方法路径

  1. 装 RDKit + SQLite,先用 SIMPD 或 Lenselink 公开集跑通全流程并通过方法学校验硬门槛(第 1–6 周),此阶段不需要下载全库
  2. 下载 ChEMBL SQLite dump,写并冻结靶点纳入 SQL(活性类型、单位统一、pChEMBL 阈值、重复记录合并规则),把抽取结果导出为版本化 CSV。
  3. 核实关键字段docs.year 的缺失率、同一化合物在多篇文献中出现时"首次年份"的取法、pchembl_value 的可用比例。这三项须在第 14 周前查清,不要边做边发现。
  4. 构建三套划分索引(随机 / 骨架 / 时间),强制三者测试集规模一致(时间划分决定规模,另两套按同规模抽样),否则 PR-AUC 不可比。
  5. 训练与评估,逐靶点记录三套划分下的 PR-AUC、召回、精确率与正例率;汇总为靶点级数据表。
  6. 计算每个靶点的解释变量(测试期新骨架占比、年度化合物增长率、正例率、训练集规模),做 ΔPR-AUC 的相关与多元回归,全部给自助置信区间。
  7. 独立交叉校验:把活性阈值改为 pChEMBL ≥ 5 与 ≥ 7 重跑,确认衰减幅度与相关性结论方向不变。

7 · 新颖性边界

  • 本课题声称提出新的划分方法或新模型,声称发现"时间划分比随机划分更严格"(Sheridan 2013 已确立),把 ChEMBL 数据库本身计入学生的数据贡献。
  • 已有工作具体完成了什么:Sheridan(2013)确立时间划分的必要性;Lenselink 等(2017)在 ChEMBL 19→20 上做大规模时间验证并比较模型族;Landrum 与 Riniker(2023, SIMPD)提供模拟时间划分的公开数据集生成算法与 99 个数据集。它们共同的输出形式是跨靶点平均的性能对比
  • 本项目的贡献有两条且都是主结论:其一,换样本——在 2023 年之后的全新时间切片上做一次独立检验,回答"十年前得到的衰减幅度在今天的 ChEMBL 上是否仍然成立";其二,换问题方向——把衰减幅度本身作为因变量,检验它能否由靶点的可观测属性预测,从而给出"哪些靶点的公开基准数字最不可信"的操作性判据。
  • 为什么有价值:如果衰减可预测,使用者在建模前就能估计自己的基准数字有多虚;如果不可预测,则说明必须逐靶点做时间验证,不能靠经验外推。两种结果都改变实践。

8 · 决策门槛(go / no-go)

  • 第 6 周末:方法学校验硬门槛必须通过。若无法复现已发表基准(偏差 > 0.05),先不下载全库,排查活性单位换算与去重规则;仍失败则降级为完全基于 SIMPD 的 99 个公开数据集做全部分析(这些数据集自带模拟时间划分),H1 改为"模拟时间划分 vs 骨架划分"的对比,H2 完全保留。
  • 第 14 周末:核实符合纳入判据的靶点数量。若 < 30 个,立即降级:其一,把切点从 2023 提前到 2020,换取更多切点后数据;其二,放宽到 assay_type 包含功能实验(F),并把实验类型作为协变量纳入回归。两条路径都保留"三划分对比 + 衰减可解释性"的主结论框架。
  • 硬盘风险:ChEMBL 全库解压需数十 GB。若本机空间不足,走上述 Papyrus / 按靶点导出 CSV 的轻量路径——这一项须在第 10 周前确认,不要等到下载失败
  • 预算裁剪顺序:先砍模型种类(保留随机森林一种),再砍活性阈值敏感性分析,再砍多元回归(只保留单变量 Spearman + 自助 CI),最后把靶点数从 30 降到 15。砍到只剩"15 靶点 × 3 划分 × 随机森林 + 单变量相关"时主结论仍成立。
  • 选择前提:适合已经会写 SQL、且能接受"H2 很可能被否证"的学生。若学生不能接受负结论,不要选这条。