K18
中文数学应用题的模板化扰动评测——数字替换、无关条件与叙述改写下大模型退化谱的测绘
1 · 研究问题
Apple GSM-Symbolic(2024)在英文 GSM8K 上证明:仅替换数字或加入无关条件即可使 LLM 数学准确率大幅下降。该退化谱在中文小学/初中应用题上形状如何?本地可跑的 1.5B 小模型与 API 大模型的退化幅度差多少倍?
2 · 研究背景与空白
GSM-Symbolic(Mirzadeh et al. 2024)把 GSM8K 题目模板化后重新实例化,发现改数字、加无关子句可致最高 65% 的准确率下降,质疑 LLM 的「推理」是否为模式匹配;GSM-Plus(2024)细分了数字替换/位数扩展/干扰句等八类扰动。检索确认:这一族工作全部基于英文基准,中文应用题的模板化扰动评测未见成熟发表(已换三种检索式确认;「未找到」不等于「不存在」,第 4 周做最终文献补查)。中文有公开题库 Math23K(2.3 万题)与 Ape210K 可作模板源。评测为纯推理,API + 小模型 CPU 推理可完成,结构性绕开算力墙。
3 · 可检验假设
- H1:同位数数字替换造成的准确率下降 ≤3 个百分点,而「加入含数字的无关条件」造成 ≥10 个百分点下降(方向与 GSM-Plus 英文结论一致),即退化主要来自干扰而非数值本身。
- H2:本地 Qwen2.5-1.5B-Instruct(4-bit 量化)的平均退化幅度 ≥ API 旗舰模型的 2 倍,且其对叙述改写(同一数学结构、换情境)的敏感度最高。
4 · 量化验收标准
- 方法学校验(硬门槛):自建评测管线(提示词 + 答案抽取器)先在 GSM8K 官方测试集 200 题上运行所选 API 模型,准确率与该模型公开报告值偏差 ≤5 个百分点(记录版本差异原因)。答案抽取器另在 100 题人工核对下错判率 ≤1%。不过关则后续全部结论无效。
- 题库工程:从 Math23K 抽 150 题模板化(数字变量化 + 单位/量纲校验脚本),每题生成 8 变体(原题、同位数替换 ×2、位数扩展、无关条件 ×2、叙述改写 ×2);每个模板实例经程序求解器验证答案正确后才入库。
- 统计口径预先写死:题级配对设计;退化量报准确率差 + McNemar 检验 + 配对自助 95% CI;temperature=0 贪心解码(确定性),另对 30 题子集做 temperature=0.7 × 5 采样敏感性附录;不报未配对的整体 accuracy 对比。
- 可复现性硬要求:API 模型版本号、调用日期、temperature、完整提示词开源;本地模型给 GGUF 文件哈希与 llama.cpp 版本号。
- 预算:150 题 × 8 变体 × 3 API 模型 ≈ 3600 次 × 约 1.5k token ≈ 8M token,估 20–60 元,上限 100 元。
- 本地推理墙钟:1.5B Q4 在 8 核 CPU 约 15–25 token/s,每题约 300 token 生成 ≈ 15–25 秒,3600 题次 ≈ 15–25 小时,过夜 3–4 晚(第 1 周实测校准)。
5 · 数据与工具
| 用途 | 来源 / 工具 |
|---|---|
| 中文题源 | Math23K(公开下载,23k 中文应用题带答案);Ape210K(GitHub,需核实当前可下载性)——仅作模板源输入,题库模板与扰动集是本项目的数据贡献 |
| 英文校验 | GSM8K(HuggingFace 公开)——仅用于管线校验与对照,不计入贡献 |
| API 模型 | 2–3 个国产 API(deepseek / GLM / Qwen 系列,版本冻结) |
| 本地模型 | Qwen2.5-0.5B / 1.5B-Instruct GGUF Q4_K_M + llama.cpp(纯 CPU;0.5B 约 40–60 token/s) |
| 变体验证 | SymPy 程序求解器对每个实例复算答案——这是入库硬条件 |
6 · 方法路径
- 搭管线,完成 GSM8K 校验与答案抽取器错判率核验(硬门槛)。
- 实测本地模型 token/s,冻结题量与变体数的墙钟预算表。
- 模板化 150 题:变量化、约束(正整数解等)、SymPy 复算,全部脚本化。
- 生成 8 变体 × 全模型评测,落盘原始输出。
- 配对分析各扰动类型退化量,检验 H1;对比本地/API 模型检验 H2。
- 错误类型标注(计算错 / 提取错 / 被干扰句带偏),判据写成可复现 codebook,双人标注一致性 κ ≥ 0.7。
- 交叉校验:30 题双语平行(人工翻译成英文)测同一模型,分离「语言效应」与「扰动效应」。
7 · 新颖性边界
- 本课题不声称发现「LLM 数学脆弱性」现象——GSM-Symbolic (2024)、GSM-Plus (2024) 已在英文上发表,不得声称为本项目发现;也不声称提出新推理方法。
- 历届丘奖 2024 金奖「LLM Mathematical Reasoning Grounded with Formal Verification」方向是用形式验证增强推理,与本题「扰动评测测绘」方向不同;Hrbench(2024 优胜)是历史学科基准构建,本题在扰动因果设计上更进一步。
- 本项目贡献(主结论):首个(以第 4 周文献补查为准)中文应用题模板化扰动评测集(程序验证过的 150 模板 × 8 变体)+ 中文退化谱与英文已发表结论的定量对照 + 小模型/大模型退化倍率。
- 价值:中文教育场景直接消费该结论(AI 判题/答疑可靠性);若中文退化谱与英文一致(H 不显著差异),普适性获独立支持——正反都成文。
8 · 决策门槛(go / no-go)
- 第 4 周末:文献补查若发现中文模板化扰动基准已发表 → 具名转向:保留全部管线,差异轴改为「小学 vs 初中难度分层 × 小模型量化档位」的新切片,主结论框架(退化谱测绘)不变。
- 第 8 周末:模板化速度若 <10 题/周 → 题量降到 80 题 × 5 变体(功效分析重算,CI 拉宽约 1.4 倍),不改框架。
- 第 12 周末:API 若涨价/停服导致预算超 100 元 → 砍至 1 个 API + 本地 0.5B/1.5B/3B 三档,H2 改为「模型规模–退化」曲线。
- 选择前提:适合能忍受「大量题目工程 + 脚本调试」的学生;数学结构校验本身是研究内容而非杂务。