A1164–82
步态分类模型的泄漏检验:换一只没见过的狗,准确率掉多少
1 · 研究问题
一个在分层随机划分下报告高性能的步态疾病分类器,改成严格按个体隔离的留一对象交叉验证后,PR-AUC、ROC-AUC 与灵敏度分别下降多少?进一步按品种留一时,模型还能否外推到训练中从未出现的品种?
2 · 研究背景与空白
可穿戴惯性传感器会把一段连续步态切成大量短窗口。窗口数看起来很多,但同一只动物的体型、佩戴位置、步频和传感器零偏会同时留在相邻窗口里;若随机把窗口分到训练与测试两边,模型可能学会识别个体,而不是识别疾病。此时测试集并不独立,高分不能回答“换一只没见过的狗是否仍然有效”。
已有工作已经做到高准确率。ANIM005(2025,Grand Award,"Gait Detection and Disease Screening in Canines",PawPath)写道:"Over several months, gait data was collected from canines, with veterinarians helping to label the data"、"using stratified data and demographic covariates";并分别训练 Belgian Malinois、German Shepherd、Golden Retriever、Indian Pariah 和 Labrador Retriever 的疾病检测模型,"All models achieved accuracies of over 90%"。但“stratified data”是保持标签比例的分层抽样,不等于按狗隔离;摘要没有报告 leave-one-dog-out 验证。
空白在于:同一数据和同一模型在“随机窗口划分”与“按个体划分”之间究竟差多少,以及按品种留一后还剩多少性能,尚未由该摘要回答。这个空白适合一年期学生课题,因为主工作是可审计的计算实验,不碰动物;即使性能不下降,也能形成“在该数据上未观察到泄漏损失”的有效边界结论。
3 · 可检验假设
H1 在预先固定的模型与特征下,按个体分组验证的 PR-AUC 将低于随机窗口划分,且配对重复中的中位下降幅度 ≥ 0.10;按品种留一的下降不小于按个体留一。
H2 若 H1 被否证,则个体身份并非主要捷径;备择机制是疾病相关信号跨个体稳定。此时检验“打乱个体 ID 后性能变化小于 0.02、而打乱疾病标签后 PR-AUC 回到阳性基础率附近”。
4 · 量化验收标准
- 方法学校验硬门槛。 先在自建管线上生成带已知标签、已知个体随机效应的合成时序;要求无个体效应时两种划分的 PR-AUC 偏差 ≤ 0.02,加入强个体效应后能检出预设的 ≥ 0.10 降幅。未通过则后续全部结论无效。
- 固定窗口长度、重叠率、特征、模型、调参与随机种子;所有预处理只在训练折拟合,测试折不得参与标准化、特征筛选或缺失值填补。
- 统计口径预先写死。 若疾病标签极不平衡,以 PR-AUC 为主指标并同时报告阳性率、ROC-AUC、灵敏度和特异度;不把 accuracy 作为主指标,因为全猜多数类也可能得到虚高 accuracy。连续时序还须按时间块划分,并把随机划分仅作为对照。
- 对随机窗口、按个体分组、按品种分组三种方案做相同次数的重复或完整留一,报告每折结果、配对差值和 95% 置信区间,不只报均值。
- 输出学习曲线,确认差距不是单纯由训练样本变少造成;另做标签置换阴性对照。
- 可复现性。 发布数据取得说明、对象 ID 映射、折分清单、环境锁定文件、代码与随机种子;若原数据许可不允许再分发,只发布可重建折分的脚本与校验哈希。
5 · 数据与工具
| 用途 | 来源 / 工具 |
|---|---|
| 主数据 | 带个体 ID 与病理标签的公开四足或人体可穿戴步态数据;具体数据集名称、许可、物种、标签定义与个体数均需核实 |
| 前作参照 | ANIM005 摘要中的五个品种与“每个品种准确率均超 90%”;仅用于校验与对比,不计入本项目的数据贡献 |
| 建模 | Python、常规机器学习库;具体版本需锁定,纯 CPU、16 GB 笔记本 |
| 分组验证 | 个体 ID、品种 ID、采集时间戳;缺任一关键字段时不得假定可恢复 |
| 审计 | 折分清单、标签置换、合成数据发生器与数据哈希 |
6 · 方法路径
- 装环境、生成已知答案的合成时序并完成校验,确认随机划分与分组划分实现无误。
- 核实工具能力边界与数据许可,确认是否真的含个体 ID、品种、病理标签和时间戳;逐条排查静默失败点:相邻窗口跨折、标准化在全数据拟合、同一对象多次就诊被当成不同对象、品种字段缺失却被推断、标签极不平衡仍报告 accuracy。
- 锁定分析协议,预先写死窗口、特征、模型、超参数搜索空间、主指标和折分规则。
- 重跑随机窗口基线,只用于复现和对比,不把其高分当作主结论。
- 运行按个体与按品种验证,逐折保存预测值,计算配对性能差和学习曲线。
- 做机制与稳健性检验,包括标签置换、个体 ID 扰动和时间块划分对照。
- 独立交叉校验,用第二种复杂度明显不同的模型重复全部折分;只有两类模型方向一致时才讨论外推边界。
7 · 新颖性边界
本课题不声称发明犬步态疾病分类器,也不声称 ANIM005 的模型无效;ANIM005(2025,Grand Award,PawPath)已经完成兽医辅助标注、五个品种建模并报告每个品种 accuracy >90%。已有工作做到哪一步:它证明了在其“stratified data”评估口径下可获得高分,但摘要未给出按个体或按品种隔离的验证。本项目贡献(属「评价维度转换」):把评价问题从“随机测试窗口分得多高”转换为“新个体、新品种能否外推”,主结论是三种折分协议之间的配对性能差及其不确定度。为何有价值:它直接决定模型分数能否解释为部署能力。若差异不显著同样是有效结论,但必须给出误差棒证明有能力分辨 0.10 的下降。
8 · 决策门槛(go / no-go)
第 3 周末必须确认至少一份可合法使用的数据含可分组的个体 ID、病理标签与足够的阳性对象,并成功跑通合成校验;若阳性对象不足 20 个或没有对象 ID,立即启用具名降级路径 “身份泄漏压力测试”:改用带个体 ID 的健康活动识别数据,人为构造对象相关标签,量化常见随机切窗流程会制造多大虚高,主结论仍是验证协议造成的性能差。
附属赛后不得修改的冲突点是主指标、折分单位、窗口长度与剔除标准,须在提交前写死。须提前核实公开数据许可、标签含义、对象是否重复入组;已知困难是可用犬病理 IMU 数据可能不存在,其定位是 go/no-go 的数据门槛而非分析后补洞。选择前提是学生能接受“审计评估”而非造新模型。预算裁剪顺序:先砍复杂神经网络,再砍多数据集外部验证,最后砍按品种留一;不得砍按个体分组、时间块对照和置换阴性对照。纯公开数据不触发脊椎动物实验;若改为自采,佩戴传感器属于互动,须在任何采集前走 Form 5A。展台不得放网址或二维码,AI 不得用于撰写研究计划、摘要、展板或引文。
评分: O=7, W=8, F=8, S=6, Fit=7 → base=73.0,h=9 → [64, 82],置信度:中