Yau Awards Archive 2020 — 2025

K14

深度知识追踪的增益边界——DKT 相对最优逻辑回归在 ASSISTments 与 EdNet 冷启动切片上的等成本复检

优先级:高分族:教育技术 / 人机交互资源:纯 CPU / 零预算技能:Python + 教育数据类型:新样本 + 新切片复检

1 · 研究问题

Gervet 等(2020)「精心构造特征的逻辑回归(Best-LR)在多数数据集上与深度知识追踪(Deep Knowledge Tracing, DKT)打平」的结论,在学生冷启动切片(每个学生的前 10/25/50 次作答)上是否仍然成立?等 CPU 墙钟成本口径下,DKT 的剩余增益是否被训练成本抵消?

2 · 研究背景与空白

知识追踪根据学生历史作答序列预测下一题对错,是自适应学习系统的核心。Piech 等(NeurIPS 2015)的 DKT(LSTM)宣称在 ASSISTments 上 AUC 从 0.69 提到 0.86;但后续修正(数据重复行问题)与 Gervet 等(JEDM 2020)的系统对比表明:带时间窗特征的逻辑回归在 9 个数据集中的多数上与 DKT 打平(AUC 差 <0.01),仅在大数据集上 DKT 略优。

空白在:现有对比全部按「全历史平均」报 AUC;而真实部署最关键的是冷启动阶段(新学生前几十题)的预测质量——该切片上参数多的模型可能恰恰最弱,文献几乎不报。此外 EdNet(2020 公开)时间上晚于 Gervet 基准,可作独立新样本。数据全公开、模型量级小,纯 CPU 可完成。

3 · 可检验假设

  • H1:在按学生分组划分下,Best-LR 与 DKT 的全序列 AUC 差 ≤0.01(复现已发表结论);但在「学生前 10 次作答」切片上,Best-LR 的 AUC 反超 DKT ≥0.02(简单模型冷启动优势)。
  • H2:等 CPU 墙钟口径(每模型 1 小时)下,DKT 因训练不充分损失 AUC ≥0.015,而 Best-LR 无损失,即等成本口径改变胜负。

4 · 量化验收标准

  1. 方法学校验(硬门槛):用 Gervet 开源代码在 ASSISTments2009(去重版)上重现 Best-LR 与 DKT 的 AUC(约 0.77 量级),偏差 ≤2 个百分点。不过关则后续全部结论无效。
  2. 统计口径预先写死:主指标 AUC(领域惯例)+ 辅报 PR-AUC 与校准 ECE;不报 accuracy(作答正确率约 65% 且随切片漂移,accuracy 混淆先验与判别力)。划分必须按学生分组(同一学生不得跨训练/测试),另做一次按交互随机划分对照,量化学生泄漏的高估幅度。
  3. 冷启动切片预登记:前 10 / 25 / 50 次作答三档,切片判据在跑实验前冻结。
  4. 每配置 5 个随机种子,报均值 ± 标准差。
  5. 双成本口径:训练到收敛(早停)与等墙钟 1 CPU 小时,两组都报。
  6. 全部代码开源;ASSISTments09 使用社区去重版本并写明版本号(该数据集的重复行问题曾污染大量论文——第 2 周核实清楚)。

5 · 数据与工具

用途 来源 / 工具
校验与主数据 ASSISTments 2009(去重版)/ 2012 / 2017(官方站点公开下载,34 万–600 万交互)——仅作输入,不计入本项目数据贡献
独立新样本 EdNet-KT1(Riiid 公开,GitHub 下载,1.3 亿交互)→ 按学生随机降采样 1–2%(约 100–260 万交互)
基线实现 Gervet 官方仓库(GitHub: theophilee/learner-performance-prediction,含 Best-LR/DKT/SAKT)——需核实依赖可装
DKT PyTorch LSTM(约 10 万参数);ASSISTments09 上 CPU 单轮约 3–10 分钟,20 轮 1–3 小时,可行;EdNet 降采样切片约 3–5 倍
算力边界 EdNet 全量与 Transformer 类 KT 模型(SAINT 等)超出范围;SAKT 小配置可作可选加项

6 · 方法路径

  1. 装环境,跑通 Gervet 仓库,完成硬门槛校验并核实 ASSISTments09 版本问题。
  2. 实测 DKT 在本机的单轮墙钟,冻结等成本预算与能力边界表。
  3. 构造 EdNet 降采样切片与三档冷启动切片,发布构造脚本。
  4. 跑 Best-LR / DKT ×4 数据集 × 5 种子,双成本口径、双划分口径。
  5. 按冷启动切片分层计算 AUC,检验 H1 交叉。
  6. 分析冷启动差异随作答数增长的收敛曲线(给 95% 自助置信带)。
  7. 交叉校验:AUC 计算用 scikit-learn 与自实现两套互核。

7 · 新颖性边界

  • 本课题声称提出新 KT 模型;「LR 与 DKT 打平」由 Gervet et al. (2020)、Wilson et al. (2016) 发表,不得声称为本项目发现。
  • 已有工作:Gervet 覆盖 9 数据集全序列 AUC;Baker 组(EDM 2021)研究过「学生开始新技能时」的切片但未做冷启动 × 模型类别 × 等成本的交叉。
  • 本项目贡献(主结论):冷启动切片这一新评价维度上的系统对比 + EdNet 新样本独立复检 + 等墙钟口径。
  • 价值:冷启动质量直接决定自适应系统对新学生的最初体验;若 DKT 在冷启动不输(H1 后半否证),则「部署仍应选深度模型」获得证据——正反都成文。

8 · 决策门槛(go / no-go)

  • 第 3 周末:Gervet 仓库跑通且校验达标;依赖损坏 → 限期 2 周用 pyKT 库替代并以其论文数字为校验对象(协议差异写明)。
  • 第 7 周末:EdNet 下载与降采样管线完成;若下载受阻 → 具名降级:以 ASSISTments12 + 17 作为双独立样本,主结论框架不变。
  • 第 24 周:若冷启动切片上两模型差异不显著(CI 含 0 且等价界内)→ 以等价性结论成文,重心移到「等成本口径 + 学生泄漏量化」(H2 与口径 2 的对照已足够支撑正文)。
  • 预算裁剪顺序:先砍 SAKT 加项,再砍 ASSISTments17;冷启动三档与按学生划分不可砍。