M16
稀疏与重尾随机矩阵最大特征值涨落对 Tracy–Widom 普适类的偏离:小规模可测的崩溃边界
1 · 研究问题
对稀疏 Wigner 矩阵(每行期望非零元 q 个)与重尾元素矩阵,最大特征值涨落偏离 Tracy–Widom(TW)分布的程度,作为 (N, q) 或 (N, 尾指数 α) 的函数如何标度?在笔记本可及的 N ≤ 4000 内,能否定量测绘"TW 区—崩溃区"的经验边界并与已发表的理论阈值对照?
2 · 研究背景与空白
GOE/GUE 最大特征值经标准化后收敛到 TW 分布是随机矩阵理论的中心结果;理论近年推进到定量层面:稀疏情形有限尺寸修正为 O(1/q)(远大于稠密情形),且存在明确相变——稀疏度低于阈值后极值特征值由最大度等局域机制主导,TW 普适性崩溃(arXiv:2507.19340《Quantitative Tracy-Widom laws for sparse random matrices》等 2022–2025 系列);重尾元素 α<4 时极值统计转为 Fréchet 型(Soshnikov 等)。
已有工作是渐近定理与收敛速率上界;空白在评价维度:定理给出的是 N→∞ 阈值与速率阶,有限 N 下崩溃边界实际落在哪里、O(1/q) 修正的常数多大,缺少系统的公开数值测绘(检索见理论文献为主;未找到不等于不存在)。特征值计算 numpy 一行即可,理论参照极硬,正负结论皆有效——是"用模拟给定理量常数"的典型学生形态。
3 · 可检验假设
- H1 稠密 GOE 在 N ∈ [200, 4000] 内,实测分布与 TW₁ 的 Kolmogorov–Smirnov 距离随 N 按 N^(-2/3) 标度(指数偏差 ≤ 15%),复现已知有限尺寸修正阶。
- H2 稀疏矩阵在固定 N 下扫 q,KS 距离在 q ~ log N 量级附近出现可测拐点(斜率变化 ≥ 3 倍),其位置随 N 的移动方向与理论(崩溃阈值 ~ log N)一致;重尾情形拐点位于 α ≈ 4 附近。
4 · 量化验收标准
- 方法学校验(硬门槛):稠密 GOE(N=1000, ≥10⁴ 样本)标准化最大特征值的经验分布与 TW₁ 参考值(均值 −1.2065、方差 1.6078,及分布表)偏差:均值差 ≤ 0.01、KS 距离 ≤ 0.02。不过关则后续全部结论无效。
- TW 参考分布来源写死:优先用已发表高精度表值(Bornemann 2010)或 TracyWidom Python 包(其精度需核实,用 Bornemann 表值抽查 ≥ 5 个分位点,差 > 10⁻³ 则弃用改查表)。
- 每个参数点 ≥ 10⁴ 独立矩阵样本;KS 距离给自助法 95% 置信区间;不使用 KS 检验 p 值作主口径(样本量大时必然拒绝,改报距离本身及其标度)。
- 标定 N^(-2/3) 用 ≥ 5 个 N 值双对数拟合 + Theil–Sen 交叉验证。
- 拐点位置用分段线性拟合定位,报告置信区间。
- 代码开源、一键重跑。
5 · 数据与工具
| 用途 | 来源 / 工具 |
|---|---|
| 矩阵生成与特征值 | numpy.random + numpy.linalg.eigvalsh(对称矩阵内置,N=4000 单次 ~ 秒级);稀疏情形只需最大特征值,可用 scipy.sparse.linalg.eigsh(Lanczos,内置) |
| TW 参考分布 | Bornemann 2010 高精度数值表(arXiv:0904.1581 附表)人工转录;TracyWidom PyPI 包作对照(精度需核实) |
| 理论阈值对照 | arXiv:2507.19340 及其引文中的稀疏阈值表述,仅用于对照,不计入贡献 |
| 算力 | N=1000×10⁴ 样本 ~ 2–4 小时/参数点(eigvalsh);稀疏 eigsh 更快;全项目约 80–150 小时 CPU,夜间批跑;N=4000 全谱点仅少量采样 |
6 · 方法路径
- 装环境,转录 TW₁ 参考表,通过稠密 GOE 校验(第 1 条验收)。
- 核实 TracyWidom 包精度与 eigsh 在稀疏 ± 符号矩阵上的收敛可靠性,写能力表。
- 稠密情形 N 扫描,复现 N^(-2/3) 修正标度(H1)。
- 固定 N ∈ {500, 1000, 2000},扫稀疏度 q,测 KS 距离曲线与拐点。
- 重尾元素(Student-t(α))扫 α ∈ [2, 8],定位 Fréchet–TW 过渡。
- 拐点位置 vs N 的移动与理论阈值形式对照。
- 交叉校验:一个参数点用 Julia(LinearAlgebra.eigvals)独立重算。
7 · 新颖性边界
本课题不声称任何新定理;TW 普适性、稀疏崩溃阈值、重尾 α=4 过渡均为已发表理论(arXiv:2507.19340、Soshnikov 等)。已有数值工作多服务于定理演示或统计应用(如 Wishart 近似,arXiv:1209.3394)。本项目的主结论是有限 N 崩溃边界的经验测绘与修正常数的量化,即把渐近定理翻译成"N=1000 时你实际会看到什么"的对照图——属"评价维度转换"。历届丘奖 2025 bronze《Geometric Analysis of the Eigenvalue Range of the Generalized Covariance Matrix》为理论谱分析,与本项目的普适性数值检验不重合。若拐点在可及 N 内不可测(过渡过缓),"过渡宽度下界"同样是有效结论,需误差棒支持。
8 · 决策门槛(go / no-go)
- 第 3 周末:GOE 校验通过;TW 参考表来源冻结。
- 第 6 周末:单参数点吞吐实测。若 10⁴ 样本 > 6 小时,降级路径 A:主力 N 降至 500、样本 5×10³,误差棒放宽——标度指数与拐点仍可测。
- 第 14 周末:稀疏扫描的拐点是否可见。若 KS 曲线平滑无拐点,降级路径 B:改测"KS 距离的 1/q 标度常数"(理论明确预言 O(1/q),只需拟合斜率),主框架(有限尺寸定量对照)保留。
- 第 26 周末:重尾部分若与稀疏部分撞算力,砍重尾(裁剪顺序:重尾 → N=2000 层 → 交叉校验点数),稀疏主线独立成文。
- 适合对象:线性代数扎实、对"普适性"叙事有热情的学生;理论文献阅读量是主要门槛。