M12
重尾分布下均值估计器的有限样本对决:中位数-均值、截断均值与经验均值的偏差常数实测
1 · 研究问题
在只有 p ∈ (1,2] 阶矩的重尾分布下,中位数-均值估计器(median-of-means, MoM)与截断均值(trimmed mean)的实测偏差–置信水平曲线,与 Lugosi–Mendelson 理论上界之间的常数差距有多大?进一步:在哪个(尾指数, 样本量, 置信水平)区域,经验均值反而优于两种稳健估计器?
2 · 研究背景与空白
轻尾分布下经验均值最优;重尾下其偏差以多项式速率衰减,而 MoM 与截断均值可达次高斯型偏差 √(log(1/δ)/n)。理论已完备:Lugosi & Mendelson 2019 综述给出各估计器的非渐近上界,含显式常数;Devroye 等 2016 给出下界。
已有工作几乎全是理论上界与下界,常数普遍不紧;本次检索("median-of-means finite sample empirical comparison trimmed mean")确认公开文献缺少系统的有限样本模拟对照——检索结果本身指出"结果多为理论分析而非大规模实证比较"。
空白在评价维度:理论回答"上界是多少",本项目回答"实际偏差离上界多远、三种估计器的实测交叉边界在哪"。方法门槛只需概率论入门 + numpy,结论正负都成立(差距大或小都有信息量),适合学生课题。
3 · 可检验假设
- H1 对 Pareto(α)(α ∈ (1,2])与 Student-t(ν) 族,MoM 的实测 (1−δ) 分位偏差与理论上界之比在 δ ∈ [10⁻⁴, 10⁻¹] 内稳定(变化 ≤ 2 倍),且该比值 < 1(上界不紧的程度可量化)。
- H2 存在可测的交叉曲面:当尾指数 α > α(n, δ) 时经验均值实测偏差反超 MoM;α 随 n 的变化方向可测且单调。
4 · 量化验收标准
- 方法学校验(硬门槛):自建模拟管线在高斯分布(理论偏差有精确公式)上复现经验均值的偏差分位数,与解析值偏差 ≤ 2%;MoM 实现用 Lugosi–Mendelson 综述中的标准算例参数复核块数–置信水平对应关系。不过关则后续全部结论无效。
- 每个参数点 ≥ 10⁵ 次独立重复;偏差分位数报自助法 95% 置信区间;稀有事件分位(δ=10⁻⁴)的重复次数须 ≥ 100/δ。
- 明确不报均方误差单独作结论——重尾下 MSE 可能不存在或被极端值主导,主口径为分位偏差(deviation quantile),MSE 仅作参考并说明原因。
- 参数网格:α ∈ {1.1,...,2.0}(≥8 点)× n ∈ {10²,...,10⁵}(对数 4 点)× δ(4 点),交叉曲面用二分加密到相对精度 5%。
- 全部脚本与随机种子开源,一键重跑。
5 · 数据与工具
| 用途 | 来源 / 工具 |
|---|---|
| 随机数生成 | numpy.random(Pareto、Student-t、对数正态内置) |
| 估计器实现 | 全部自建(MoM ~10 行;截断均值 scipy.stats.trim_mean 内置,需与文献定义核对截断方式是否一致——需核实,不一致则自建) |
| 理论上界 | Lugosi & Mendelson 2019《Mean estimation and regression under heavy-tailed distributions: a survey》(arXiv:1906.04280)显式常数,人工转录并双人核对 |
| 对照基准 | 高斯情形解析公式,仅用于校验,不计入贡献 |
| 算力 | 单参数点 10⁵ 次 × n=10⁵ 采样,numpy 向量化 ~ 分钟级;全网格 < 30 小时 CPU,可分夜间批次 |
6 · 方法路径
- 装环境,实现三估计器,通过高斯校验(第 1 条验收)。
- 核实 trim_mean 的截断定义与理论文献是否一致,写入能力表。
- 转录理论上界公式,先在单点参数上做实测/上界比对,确定测量分辨率足够。
- 全参数网格扫描,绘制实测偏差/上界比值热图。
- 二分定位经验均值与 MoM 的交叉曲面 α*(n, δ)。
- 用 Julia(或纯 Python 另写一份独立实现)重算 3 个代表点交叉校验。
- 给出"什么时候值得换稳健估计器"的实用判据表。
7 · 新颖性边界
本课题不声称任何新估计器或新定理;所有理论界均出自已发表工作(Lugosi–Mendelson 2019 综述、Devroye et al. 2016)。已有工作完成了:非渐近上界证明(显式常数)、最优性下界、以及零散的小规模演示模拟。本项目的主结论是系统的有限样本常数差距地图与三估计器交叉边界的首次(据检索)定量测绘;检索未找到同等覆盖的发表模拟研究,但未找到不等于不存在,行文按"补充实证维度"而非"首创"定位。价值:理论常数不紧是该领域公认痛点,实测差距对使用者是直接可用的信息。若 H2 交叉曲面在网格内测不到(MoM 全域占优),该负结论同样有效,须给误差棒证明分辨能力。
8 · 决策门槛(go / no-go)
- 第 2 周末:高斯校验通过;纯编程风险,无科学风险。
- 第 5 周末:核实理论上界公式转录无误(用综述文中数值例复核)。若综述无数值例可核,降级路径 A:改以"文献间上界互相对比 + 实测"三方对照,把常数转录风险写成研究内容(不同文献常数不一致本身就是发现)。
- 第 12 周末:δ=10⁻⁴ 稀有分位的模拟规模是否可行(需 ≥10⁶ 次/点)。超预算则降级路径 B:把最小 δ 提到 10⁻³,网格砍半——交叉曲面主结论仍成立,只是外推范围缩小。
- 预算裁剪顺序:先砍分布族(保 Pareto 一族)、再砍 n 网格;主结论框架不受影响。
- 适合对象:概率兴趣强、编程中等的学生;风险接近 M11,但需要更强的统计表述纪律。