E10
机器学习横截面收益预测在 A 股的降配复现与 2021–2026 样本外再检验(Leippold–Wang–Zhou 框架)
1 · 研究问题
在特征集从 1000+ 压缩到 30 个、模型压缩到 5 类的 CPU 可行配置下,Leippold–Wang–Zhou (2022) 报告的 A 股机器学习收益可预测性(含"流动性类特征最重要、大盘与国企更可预测"两条结构性结论)在其样本截止(2020)后的 2021-01–2026-06 窗口中还剩多少?月度样本外 R² 与多空组合收益衰减各是多少?
2 · 研究背景与空白
Gu, Kelly & Xiu (2020, RFS) 确立了用机器学习做横截面收益预测的评估框架:以月度样本外 R²(R²_oos)与预测排序组合收益为准绳,比较 OLS、LASSO、树模型、神经网络。Leippold, Wang & Zhou (2022, JFE)《Machine learning in the Chinese stock market》把该框架搬到 A 股(约 2000–2020),核心发现:流动性类特征重要性居首(与美股相反)、散户主导使短期可预测性更强、大盘股与国企在长期限上高度可预测、树模型与神经网络优于线性基准。GKX 的美国特征数据集与代码公开(Dacheng Xiu 主页),LWZ 的中国数据依赖 CSMAR/Wind,不可免费获得——这决定本课题必须自建降配特征集。
空白在时间覆盖:2021–2026 覆盖量化大发展、2023 微盘风格极端化与 2024-02 崩盘、2024-09 政策脉冲——ML 可预测性是否已被套利资本吞噬是开放且结论正负都成立的问题。检索未见以 2021 后 A 股为样本外窗口、完整执行 GKX 口径推断的公开英文论文(LightGBM 应用类 preprint 存在但口径不严;第 8 周须再核)。
3 · 可检验假设
- H1:降配管线在 2021–2026 样本外窗口的最优模型月度 R²_oos > 0 但相对 2010–2020 验证期衰减 ≥ 50%;预测十分位多空组合(剔除最小 30% 市值,价值加权,月频调仓)毛收益 t < 3.0。
- H2(结构性结论复检):特征重要性排序中流动性类仍居前三——若被反转(如基本面类上升),说明散户主导结构在量化时代已变化。H1 的反向结果(可预测性完好)同样有效,指向 A 股套利容量约束。
4 · 量化验收标准
- 方法学校验(硬门槛):先用 GKX 公开的美国特征数据集与公开代码口径,复现其 OLS-3 与 LASSO 的月度 R²_oos(原文量级约 0.1–0.4%):符号一致、与原文表偏差 ≤ 0.2 个百分点、模型排序一致。此步不过关,A 股部分全部结论无效。(GKX 数据约 2–4 GB,CPU 上跑线性与树模型可行;神经网络降为 1–2 层小网络并明示与原文差异。)
- 时间划分写死:训练 2005–2015、验证 2016–2020、测试 2021–2026,滚动扩窗年度重拟合;绝不随机划分,并附一次随机划分对照量化泄漏引起的虚高。
- 统计口径:R²_oos 用 GKX 定义(分母为零基准);多空组合收益 Newey–West t;模型间比较用 DM 检验;全部组合收益报净成本版(口径同 E09 第 4.4 条);多重检验:模型 × 期限的检验族做 FDR q=0.10。
- 特征集预注册:30 个特征清单(估值、动量/反转、流动性、波动、基本面五类各约 6 个)在跑任何测试集之前冻结并存档,防止特征窥探。
- 幸存者与前视偏差:同 E02/E09 口径;财务特征滞后至公告日。
- 可复现性:GKX 复现脚本 + A 股管线开源;A 股全流程 CPU ≤ 24 小时(约 4000 股 × 200 月 × 30 特征 ≈ 2×10^7 行,LASSO/LightGBM 分钟–小时级,小网络数小时)。
5 · 数据与工具
| 用途 | 来源 / 工具 |
|---|---|
| GKX 美国特征数据集与代码(仅用于管线校验,不计入本项目数据贡献) | Dacheng Xiu 主页(dachxiu.chicagobooth.edu)公开下载;约 2–4 GB,免费(可得性需在第 2 周核实) |
| A 股行情、市值、换手、财务(2005–2026) | akshare 为主、tushare 免费额度交叉核对;退市覆盖问题按年披露 |
| CH-3 因子基准调整(仅对比) | Stambaugh 主页或 E02 管线 |
| 模型库 | scikit-learn(OLS/LASSO/弹性网)、LightGBM(树)、PyTorch CPU(小网络);全部开源免费 |
| 对照基准(仅对比,不计入贡献) | GKX (2020) 表 1;LWZ (2022) 表(原文量级,如月度 R²_oos 与特征重要性排序) |
6 · 方法路径
- 下载 GKX 数据集,完成第 4.1 条硬门槛复现(这一步同时是全套评估代码的联调)。
- 冻结 30 特征清单并存档(预注册文件带哈希与日期)。
- 用 akshare 构建 A 股月频特征面板,做缺失/极值处理(规则写死:横截面分位缩尾、缺失中位数填补并加缺失指示)。
- 训练 5 类模型,在验证期调参(超参网格预先写死),测试期一次性评估。
- 计算 R²_oos、多空组合毛/净收益、DM 检验与 FDR 校正(H1)。
- 用置换重要性与 SHAP(树模型)估计特征类重要性排序(H2),与 LWZ 原文排序对比。
- 交叉校验:以"仅线性模型 + 仅前 800 大市值股"的极简配置重跑,验证主结论不依赖复杂模型或小盘股数据质量。
7 · 新颖性边界
- 本课题不声称提出新预测方法——评估框架归 Gu–Kelly–Xiu (2020),A 股结论归 Leippold–Wang–Zhou (2022);"流动性最重要"等结构性发现是 LWZ 的,不得据为己有。降配(30 特征、5 模型)与原文(千级特征、11 模型)的差距必须在论文中定量声明,本课题检验的是"降配版可预测性"而非原文全量结论。
- 本项目贡献(主结论):2021–2026 纯样本外窗口的可预测性衰减估计 + 结构性结论(特征重要性、大盘/国企可预测性)的独立复检。衰减与否两个方向都回答"中国 ML 定价文献的结论是否已被市场自身消化"。
- 历届丘奖对照:2025 入围"Momentum ML vs Markowitz"与 2022 铜奖 LASSO-BiLSTM 汇率预测均属 ML 预测类但无预注册特征集、无 R²_oos 口径、无多重检验校正;本课题以 GKX 级评估纪律为差异化轴。
8 · 决策门槛(go / no-go)
- 第 2 周末:核实 GKX 数据集当前可得性。若下载入口失效,降级:硬门槛改为用 Ken French 25 组合复现 GKX 附录的组合级预测结果,或以 OpenAP(Chen–Zimmermann 开放资产定价数据,免费)替代做管线校验,主框架不变。
- 第 10 周末:GKX 复现硬门槛须达标;不达标先查收益对齐与缺失处理,第 14 周仍失败则整题终止并转向 E09(共享大部分 A 股管线,沉没成本最小)——这是 10 题中唯一设"终止转向"而非"降级"的门槛,选题时须知情。
- 第 20 周末:A 股特征面板若财务特征可用率 < 70%,降级为"价格类特征(动量/反转/波动/流动性)single 集"(约 18 个特征),LWZ 对比范围相应缩窄并明示。
- 第 32 周末:若测试期所有模型 R²_oos 的 CI 覆盖零且组合收益不显著,这就是 H1 的"完全衰减"结论——按预注册写成主结果,不得回头改特征集或超参(管线哈希存档即为此设)。
- 适配前提:仅适合编程强、能承受"复现失败即转向"风险、且团队 ≥ 2 人的学生;工时预算是 10 题之最(数据工程约占 50%)。放在 E10 是因为数据工程失败概率与工作量都最高,而非科学价值最低。