B04
随机基因签名的预后显著性在 TCGA 泛癌中的分布:以增殖元基因校正为轴,检验已发表预后签名相对于随机零模型的增量价值
1 · 研究问题
在 TCGA 泛癌(Pan-Cancer Atlas)的 ≥ 15 种癌型中,一个随机抽取的 100 基因签名与患者生存显著相关的概率各是多少?这个"随机显著率"是否可由该癌型中增殖元基因(meta-PCNA)自身的预后强度预测?在此零模型下,已发表的预后基因签名中有多大比例的预后价值超出随机水平,且在扣除增殖信号后仍然成立?
2 · 研究背景与空白
背景。 "发现一组基因签名可预测某癌症预后"是肿瘤基因组学产出量最大的论文体裁之一,每年数以千计。其统计基础是:把签名基因的表达汇总成一个分数,按中位数分高低两组做 log-rank 检验或 Cox 比例风险回归。问题在于,肿瘤转录组存在一个占据大量方差的主轴——细胞增殖,它本身就与预后强相关,因此任何与增殖相关的基因组合都会"显著"。
已有工作到哪一步。 Venet、Dumont 与 Detours(PLOS Computational Biology, 2011)在乳腺癌中给出了决定性结果:任意随机抽取的 ≥ 100 个基因,有 90% 的概率与预后显著相关;47 个已发表乳腺癌签名中有 28 个(60%)的预后强度不强于随机预期;他们用"meta-PCNA"增殖元基因做校正后,多数签名基因的预后价值消失。另一条线是 Ramaker 等(Oncotarget, 2017)在 19 种癌症上做增殖分析,识别出一批"增殖信息型(proliferation-informative)"癌症并给出共同生存签名。
空白在于:Venet 的随机零模型只在乳腺癌一种癌型上建立过,而它的核心量——"随机签名显著率"——从未在泛癌尺度上被系统标定。 Ramaker 等虽然做了泛癌增殖分析,但其目标是构建签名,不是证伪签名;他们没有做随机零模型。于是今天研究者在肺癌、肝癌、胶质瘤上发表签名时,手边并没有对应癌型的"随机基线"可比。这个空白适合学生课题:TCGA 表达与临床结局均为开放访问数据、算力在小时级、方法学完全公开、结论正负都成立。
3 · 可检验假设
- H1:随机 100 基因签名在各 TCGA 癌型中的显著率(Cox 单变量、FDR < 0.05)跨癌型跨度极大,最高与最低癌型之差 ≥ 40 个百分点;且该显著率与该癌型 meta-PCNA 分数自身的 Cox 风险比(|log HR|)的 Spearman 相关 ≥ 0.6(FDR < 0.05)。
- H2(备择/机制假设):在按 meta-PCNA 分数校正后,随机签名的显著率在"增殖信息型"癌型中下降 ≥ 50%(相对值),但在非增殖信息型癌型中下降 < 20%——即增殖并非所有癌型预后信号的共同来源。若 H2 被否证(所有癌型下降幅度相近),则说明存在一个跨癌型通用的混杂主轴,需要另找解释变量(如免疫浸润或肿瘤纯度),这本身是更有价值的发现方向。
4 · 量化验收标准
- 方法学校验(硬门槛):用自建管线在 Venet 等 2011 使用的乳腺癌设定下复现其三项核心已发表结果:(a) 随机 100 基因签名的显著率 ≥ 85%(原文报 90%);(b) 复现原文点名的至少 5 个已发表乳腺签名的预后 p 值方向与量级(log10 p 的偏差 ≤ 0.5);(c) 复现 meta-PCNA 校正后显著性消失的定性结论。三项中任一不达标,管线不可信,全部泛癌结论无效。(若原文所用的 NKI/公开乳腺队列不可得,则在 TCGA-BRCA 上复现,并明确标注这是"设定迁移"而非严格复现。)
- 统计口径预先写死:(a) 生存终点严格按 Liu 等(Cell, 2018)TCGA 泛癌临床数据资源的官方推荐逐癌型选择——多数癌型用 PFI(progression-free interval)而非 OS(overall survival),事件数少的癌型不得用 OS,选择理由逐癌型写入表格;(b) 所有 p 值报 Benjamini–Hochberg FDR,不报裸 p 值;(c) 每个癌型必须报事件数与按 10 events-per-variable 规则计算的可容纳协变量上限,事件数 < 30 的癌型一律剔除并写明;(d) Cox 模型必须做比例风险假设检验(
cox.zph/ Schoenfeld 残差),违反者改用限制平均生存时间(RMST)差作为备用终点并两者都报;(e) 分组比较若涉及不平衡二分类的判别性能,报 PR-AUC 与 C-index,不报 accuracy,原因是事件率在多数癌型低于 30%,全判"无事件"即可得虚高 accuracy。 - 批次效应必须检查并写明:使用 Pan-Cancer Atlas 的 EB++ 批次校正版表达矩阵;同时用未校正版做一次敏感性分析,报告两版之间随机显著率的差值。肿瘤纯度(来自公开的 ABSOLUTE/共识纯度表)作为协变量做一次调整分析。
- 规模下限:≥ 15 个癌型,每个癌型 ≥ 200 例且事件数 ≥ 30;每个癌型 ≥ 5,000 次随机签名抽样(签名长度网格 {10, 50, 100, 250, 500});已发表签名 ≥ 60 条,覆盖 ≥ 6 个癌型。
- 签名来源的地位:所有已发表签名的基因列表仅作为对照与评估对象,不计入本项目的数据贡献;每条签名必须记录原文出处、癌型、原报告的效应量,形成可核查的附表。
- 可复现性:随机种子、癌型-终点对照表、全部脚本与结果 CSV 开源;提供 3 癌型的降规模复现包(≤ 1 小时可跑完)。
5 · 数据与工具
| 用途 | 来源 / 工具 |
|---|---|
| 泛癌表达矩阵 | UCSC Xena,TCGA Pan-Cancer Atlas 的 EB++AdjustPANCAN 基因表达(RSEM 归一化,约 20,500 基因 × 11,000 样本,压缩包数百 MB 至 1 GB 级;https://xenabrowser.net/datapages/ )。float32 存 20.5k×11k 约 0.9 GB,16 GB 内存下必须按癌型切片处理,不整表载入 pandas |
| 生存终点与临床变量 | TCGA-CDR(Liu et al., Cell 2018,"An Integrated TCGA Pan-Cancer Clinical Data Resource")的补充表,含 OS/DSS/DFI/PFI 四个终点及逐癌型的终点使用推荐。此表是本课题统计口径的权威依据 |
| 肿瘤纯度 | TCGA 公开的共识纯度估计表(Aran et al. 2015 等),用于协变量调整 |
| 已发表预后签名 | (a) MSigDB C2:CGP 基因集合中的预后相关集合;(b) 手工整理近五年针对目标癌型的"novel prognostic signature"论文(每条记录出处、基因列表、原报告 HR),目标 ≥ 60 条 |
| meta-PCNA 增殖元基因 | Venet 等 2011 补充材料给出的 meta-PCNA 基因列表;备用为 MSigDB Hallmark 的 E2F_TARGETS 与 G2M_CHECKPOINT |
| 受控访问核查 | TCGA 的基因表达(Level 3)与 TCGA-CDR 临床结局表为开放访问,可直接下载,无需 dbGaP DAC 审批;个体水平体细胞/胚系变异 VCF、BAM/CRAM 与部分详细临床字段为受控访问,中学生无法申请,本项目一律不使用。数据已去标识化,年龄 > 89 岁被掩码,不涉及可识别个人信息,无需伦理审批 |
| 生存分析 | Python lifelines(CoxPHFitter、proportional_hazard_test)或 R survival + survminer。单变量 Cox(n≈500)单次拟合约 3–10 ms |
| 算力口径 | 纯 CPU。15 癌型 × 5 长度 × 5,000 次 = 375,000 次 Cox 拟合,按 8 ms/次约 50 分钟(单核),多核或用 R coxph 的向量化更快。表达矩阵按癌型切片后每片约 20.5k × 500,内存 < 100 MB。全流程可在一个通宵内跑完,无算力风险 |
| 对照基准 | Venet 等 2011 的乳腺癌结果、Ramaker 等 2017 的 19 癌型增殖分析。仅用于校验与对比,不计入本项目的数据贡献 |
6 · 方法路径
- 装环境,下载 Xena 表达矩阵与 TCGA-CDR,先完成验收标准第 1 条的 Venet 复现,把三项复现结果与原文数值并列写入
validation/。 - 按 TCGA-CDR 官方推荐为每个癌型锁定生存终点,剔除事件数 < 30 的癌型,生成"癌型–终点–样本数–事件数"对照表(这张表必须在跑任何随机抽样之前冻结)。
- 在每个癌型上建立随机零模型:按长度网格抽取随机基因集,签名分数取标准化表达的均值,单变量 Cox 拟合,统计 FDR < 0.05 的比例;输出各癌型的随机显著率曲线(显著率 vs 签名长度)。
- 计算各癌型的 meta-PCNA 分数及其自身 Cox 结果,检验 H1 中的跨癌型相关。
- 把 ≥ 60 条已发表签名逐条放入对应癌型,计算其效应量在该癌型随机零分布中的分位数(这是本课题的核心量),并报出"超过随机 95 分位"的签名比例。
- 做 meta-PCNA 校正(把 meta-PCNA 分数作为协变量放入 Cox),重算第 3、5 步,检验 H2;同时做肿瘤纯度调整与未批次校正版的敏感性分析。
- 独立交叉校验:换一套完全独立的生存框架——非参数 log-rank(按中位数二分)与 RMST 差——重算主结论;再用一个 TCGA 之外的公开队列(如 GEO 上带随访信息的肺腺癌或肝癌表达数据集)复算至少 2 个癌型的随机显著率,验证结论不是 TCGA 特有的技术产物。
7 · 新颖性边界
本课题不提出新的预后模型,不声称发现任何新的癌症生物标志物,不声称"随机签名常常显著"与"增殖是主要混杂"为本项目发现——这两点由 Venet、Dumont、Detours(2011)在乳腺癌中确立,学生必须在正文首段明确归属。
已有工作具体完成了什么:Venet 等在乳腺癌一种癌型上建立随机零模型,量化 47 条已发表签名相对随机的增量,并提出 meta-PCNA 校正;Ramaker 等(2017)在 19 种癌症上做增殖分析并构建了一个共同生存签名,但没有随机零模型、没有对已发表签名做证伪。
本项目的贡献(且是主结论):把 Venet 的零模型从单癌型扩展到泛癌尺度并转成一张可查的基线表——给出每个癌型的"随机显著率 vs 签名长度"曲线,使任何新签名都能被放进对应癌型的随机分布里读出分位数。附带的第二个主结论是 H2 所检验的机制命题:增殖是否是所有癌型的共同混杂轴。这属于"新样本的独立检验 + 评价维度转换"的双重定位。
为什么有价值:过去十五年的预后签名文献几乎全部缺少癌型特异的随机基线。一张可直接查用的基线表把"这条签名是否值得相信"从主观判断变成可计算的分位数。
风险声明:"泛癌显著率高度一致、且与增殖强度无关"同样是有效结论(它会否定 Venet 结论的可推广性,同样重要),但必须给出自助法误差棒,证明本设计有能力分辨假设中的 40 个百分点差异与 0.6 的相关系数。
8 · 决策门槛(go / no-go)
- 第 5 周末(硬门槛):验收标准第 1 条必须通过。若 Venet 复现的随机显著率 < 85%,先排查表达值标准化方式与生存终点定义(这两项最常出错);三周内仍不通过则降级:把校验基准换成 Ramaker 等 2017 公布的癌型级增殖–生存关联(其补充材料给出逐癌型数值),校验阈值定为 Spearman ≥ 0.8。主结论框架不变。
- 第 8 周末:确认满足"≥ 200 例且事件数 ≥ 30"的癌型数量。若 < 12 个,立即降级:其一,把终点统一放宽到 PFI 并接受随访较短带来的检验力损失,在论文中量化这一损失;其二,把癌型合并为器官系统级分组(消化道 / 泌尿生殖 / 胸部 / 神经系统等 6 组),基线表由"逐癌型"变为"逐系统"。两条降级都保留"随机零模型 + 已发表签名分位数 + 增殖校正"的主结论框架。
- 第 16 周末:确认已发表签名的收集量。若可完整复原基因列表的签名 < 40 条,立即降级:改用 MSigDB C2:CGP 中的策展基因集作为"已发表基因集"的代理,明确标注这是代理而非真实预后签名,并把结论范围相应收窄。
- 第 24 周末:若 H1 的癌型间跨度 < 20 个百分点且相关系数不显著,按风险声明写"随机显著率跨癌型一致"结论,并把该结论转为一张统一基线表(对使用者同样有价值)。
- 第 36 周结果冻结,第 44 周英文 PPT 初稿。
- 需提前核实而非边做边发现:(a) Xena 的 EB++ 矩阵与 TCGA-CDR 的样本 ID 命名规则(TCGA barcode 前 12 位 vs 前 15 位)对齐方式,错位会导致全盘错误;(b) Venet 2011 补充材料中的 meta-PCNA 基因列表是否仍可下载;(c) 目标癌型是否存在同一患者多样本(需去重规则)。三项在第 6 周前查清。
- 选择前提:适合统计基础扎实、能接受"本课题的价值在于给他人的工作降温而非做出新发现"这一定位的学生。答辩时必须能清楚说明为什么"证伪型工作"是正当的科研贡献——这一点须提前准备英文表述。
- 预算裁剪顺序:先砍 GEO 外部队列复算(第 7 步后半),再砍肿瘤纯度调整,再砍签名长度网格(只保留 100 与 500 两点),最后把癌型数从 15 降到 10。砍到只剩"10 癌型 × 100 基因随机零模型 + 40 条签名分位数 + meta-PCNA 校正"时,主结论仍成立。