R971–89
12 张图上的 3.5 个百分点,能撑起一个结论吗
推荐优先级:较高 · 族 A(公开数据 + 少量自采) · 参赛子类:Robotics and Intelligent Machines — 感知与评测方法 · 资源需求:主体零采购,笔记本 CPU 足够;自采数据若需成像器材,量级 ¥300–1,800、一周内到货,多光谱相机价格与货期需核实 · 技能取向:统计推理 / 重抽样方法 / 数据采集与标注
1 · 研究问题
在 n = 10 / 30 / 100 / 300 张测试图的规模下,目标检测的 mAP 的自助法(bootstrap)置信区间有多宽?要让"A 比 B 高 3.5 个百分点"这一判断在 95% 置信下成立,最少需要多少张测试图?
2 · 研究背景与空白
背景。 mAP 不是一个物理常数,而是一个在测试集上计算出来的统计量:换一批测试图,它就会变。它的抽样分布可以用自助法估计——把测试图按图重抽样、每次重算一遍指标、看结果分散多宽。问题在于,机器人视觉任务的测试集往往只有几十张图(自采、自标注、时间紧),而这个规模下逐图难度差异极大,指标的抽样波动可以轻易盖过被比较的差值。换句话说,在小测试集上比较两个模型,你首先测到的是抽样噪声,其次才是模型。
已有工作到哪一步。 2025 ROBO004(Grand Award)"Designing a Plant Disease Suppression Robot" 是极诚实的项目——它自己写了 The limited final dataset of only 12 labeled multispectral images by the deadline likely affected generalization for both models——但仍然基于这 12 张图比较了 mAP@50 的 28.5% 与 25.0%,并给出 showing RGB pretraining led to superior final detection accuracy 的结论。同届 2025 ROBO041(Grand + Special)"Engineering an Intelligent ROV for Coral Research" 报 the water sampler was successful 9/9 times(在 9/9 上,真实的 95% 置信下限只有约 66%),且其 CTD 传感器的验证方式是 compared to calibration solutions and other same-model sensors——拿同型号传感器互比,误差是相关的,这不是独立验证。2026 ROBO028T(Grand) 的野外验证是 a 3-D model overlaid with 9 defects。检索方面,mine_isef "confidence interval statistical significance" 五届仅 6 项弱命中,无一以统计效力为主题;词频统计中 ROBO 48 篇 error bar 0 次、standard deviation 0 次、sensitivity analys 0 次。
空白在于:问题不在这些学生,而在于整个类目没有工具去判断"这个差是不是噪声"。从未有人给出一张针对"机器人视觉任务在 ISEF 可达数据规模下"的最小样本量对照表。这个空白适合一年期学生课题:可行性极高(自助法是重抽样不是重训,笔记本 CPU 秒级完成);主体零采购;产出是一张任何后来者可以直接查的表;而且结论正负都成立——需要 70 张还是 300 张,都是有用的数字。
3 · 可检验假设
H1 在 mAP@50 的典型工作点上,测试集 n = 12 张时,mAP 的自助法 95% 置信区间半宽 ≥ 10 个百分点;因而 ROBO004 报出的 3.5 个百分点差(28.5% vs 25.0%)完全落在抽样噪声之内。在配对口径(两个模型在同一批图上比较)下,要让 3.5 个百分点的差在 95% 置信下可分辨,需 n ≥ 70 张。
数值依据:设逐图指标的图像间标准差为 s,则均值的标准误约为 s/√n。检测任务中逐图 AP 的离散度很大(s 必须实测,不得假设,见 §5);若 s ≈ 0.20,则 n = 12 给出标准误约 0.058、95% 半宽约 11.3 个百分点,量级与 H1 相符。配对比较时用差值的标准差 s_d,所需样本量约 n ≈ (1.96·s_d / 0.035)²:s_d = 0.15 给出 n ≈ 70,s_d = 0.25 给出 n ≈ 196。因此 H1 给出的是一个可被实测 s_d 直接否证的预设区间,而不是从文献抄来的数。
H2(机制假设,H1 被否证时仍有内容)若实测区间远窄于 10 个百分点,则主导因素不是样本量而是测试图之间的相关性——同一场景或同一段视频的相邻帧不独立,按单图重抽样会系统性低估区间宽度。判据:按场景整块重抽样(block bootstrap)得到的区间,比按单图重抽样得到的宽 ≥ 1.5 倍。
4 · 量化验收标准
- 方法学校验(硬门槛,不过关则后续全部结论无效)。 自助法实现必须通过覆盖率检验:构造一个真值已知的合成总体,反复抽取容量为 n 的测试集并计算自助法 95% 区间,检验区间对真值的实际覆盖率落在 93%–97% 之间;对 n = 10 / 30 / 100 / 300 各做一遍。这一步不过关,整张最小样本量表就是错的,后续全部结论无效。另须在一个已发布评测数值的公开算例上复现官方 mAP,偏差 ≤ 1 个百分点。
- 统计口径预先写死,两个 n 必须分开报。「同一份权重在不同测试子集上重评估」测的是测试集抽样,这是本课题的主对象;「不同随机种子重训出的独立模型」测的是训练随机性,这两个 n 不是一回事。本课题必须额外用 ≥ 3 个种子重训的模型复核主结论,证明那张表不是被单一权重绑架的结果。自助重抽样次数 B ≥ 2,000。
- 参数点。 n ∈ {10, 30, 100, 300},每个 n 下重复抽样 ≥ 500 次;≥ 3 个数据集 × ≥ 2 组模型对;同时给出单图重抽样与整块重抽样两套结果。
- 必须用真实的机器人数据复现。 自采一小批真实数据(多光谱、深度或 RGB,视 §8 的器材裁决而定),样本量下限 ≥ 60 张,并给出可复现的采集与标注规程。这一条是本课题学科契合的锚点,不可省。
- 结论必须落回机器人任务。 最小样本量表须以机器人视觉任务的验收判据形式给出——"要声称 Δ 个百分点的提升,在这个 mAP 工作点上至少需要多少张测试图"——并对 ROBO004 的 3.5 个百分点、ROBO041 的 9/9 这两个真实案例逐一套用示范。
- 可复现性。 评估与自助法脚本、合成总体生成器、逐次抽样结果、自采图像与标注、最小样本量表的生成代码全部开源。
5 · 数据与工具
| 用途 | 来源 / 工具 |
|---|---|
| 公开数据集 | 公开检测数据集(VisDrone 一类),公开可下载、无采购周期;但注册、条款确认与格式转换会花时间,预留 2 周 |
| 自采真实机器人数据 | 普通网络摄像头 / USB 摄像头 / USB 显微镜,量级 ¥100–500,一周内到货(本类目已验证的安全采购清单);若要对齐 ROBO004 的多光谱模态,多光谱相机不在一周到货的安全清单内,价格与货期需核实,见 §8 的 go/no-go 项 |
| 深度模态备选 | 深度相机,本文件 R12 已给出实测量级:Intel RealSense D435 国内现货约 ¥1,300–1,800、一周内到货 |
| 模型 | 轻量检测器(YOLO nano 档一类)现成权重即可,本课题不需要训练强模型 |
| 精确区间参照 | 二项比例的精确区间方法(Clopper-Pearson),用于处理 9/9 这类退化情形 |
| 对照基准(仅用于校验与对比,不计入本项目的数据贡献) | ROBO004 的 mAP@50 28.5% vs 25.0%(n = 12);ROBO041 的 successful 9/9 times;ROBO028T 的 a 3-D model overlaid with 9 defects |
| 算力 | 纯 CPU 笔记本足够。自助法是重抽样而非重训,主要开销是一次前向推理加 B 次重采样,秒到分钟量级;无云 GPU 需求,因而无 GPU 预算 |
须实测而非引用的量: 逐图 AP 的实际离散度 s 与配对差值的离散度 s_d——它们决定整张表的每一个数字,必须在每个数据集上实测,不得假设、不得从文献套用。此外须核实:多光谱相机的价格与货期;各数据集的许可证是否允许竞赛使用与再分发;自采数据的场景是否足够多样以避免整块相关性把 s 人为压低。
6 · 方法路径
- 搭评估与自助法管线 + 跑通覆盖率校验(§4 第 1 条硬门槛)。这一步不过不许继续。
- 核实工具能力边界。 逐条排查以下静默失败点(不报错但给错结果): - 自助法在全成功或全失败的数据上返回零宽区间——对 9/9 重抽样,每次都是 9/9,区间是 [1, 1]。程序不会报错,但结论完全错误。正确做法是切换到 Clopper-Pearson 精确区间,这也正是 ROBO041 那个 9/9 应有的处理方式。 - 逐图 AP 的平均值不等于整集 mAP。 mAP 是在全集上按类累计 PR 曲线算出来的;按图重抽样后必须重算 PR 曲线,否则你算的是另一个统计量,而两个数看起来都很像 mAP。这是本课题最容易踩、且完全不报错的陷阱。 - 相邻帧不独立。 单图重抽样默认图像独立,同一段视频的帧高度相关,区间被系统性低估——这正是 H2 的判据来源。 - 自助样本里某个类别为空时 AP 未定义,不同实现分别按 0 计入或直接跳过,两种处理给出明显不同的区间宽度,都不报错。 - 标注错误率与抽样噪声混淆:小测试集上一两张错标就能移动几个百分点,若不单独估计标注一致性,会被整体计入"抽样波动"。
- 用合成总体建立骨架关系:区间宽度 vs n vs 工作点 mAP vs 逐图离散度 s。
- 在 ≥ 3 个真实公开数据集上复现该关系,检验骨架表是否外推成立,并给出单图与整块两套重抽样结果。
- 自采 ≥ 60 张真实机器人数据并完成标注,在其上复现主结论,锚定学科契合。
- 产出最小样本量表:给定要分辨的差 Δ 与 mAP 工作点,查所需最小 n;并对 ROBO004 与 ROBO041 两个真实案例做示范套用。
- 独立交叉校验。 用与自助法完全不同的原理估计同一个量:置换检验(permutation test)与解析近似(配对 t 检验 / Wilcoxon 符号秩检验)三者对照。若三者在同一 n 下给出显著不同的结论,须查明原因再下结论——三种方法一致,是这张表可信的最强证据。
7 · 新颖性边界
本课题不声称: - 不声称发明自助法或最小样本量计算。统计学界早有相关工作,这是本条 h 取 9 的原因。主张必须严格限定在"机器人视觉任务在 ISEF 可达数据规模下"这个具体语境。 - 不声称 ROBO004 的结论是错的。 它自己已经诚实写明
The limited final dataset of only 12 labeled multispectral images by the deadline likely affected generalization for both models——本课题提供的是判断工具,不是指控。这句话必须写进摘要,否则整个课题会被读成对某个学生的攻击,那是最糟糕的答辩姿态。 - 不声称首次指出小测试集问题。 - 不声称给出普适于所有视觉任务的样本量表。表的适用范围由本课题实测过的数据集与工作点界定。已有工作做到哪: ROBO004 在 12 张图上比较 28.5% 与 25.0%;ROBO041 报
successful 9/9 times且用other same-model sensors做验证;ROBO028T 用 9 处缺陷做野外验证;五届confidence interval statistical significance仅 6 项弱命中,无一以统计效力为主题;ROBO 48 篇error bar与standard deviation各 0 次。本项目的贡献(属「方法可复现性贡献」型): 已有工作报告的是"我测到了多大的差";本项目给出的是"在你这个样本量下,多大的差才是可分辨的"这张可查的表,以及配套的退化情形处理规程(9/9 该用精确区间、相邻帧该用整块重抽样)。这张表是主结论,不是附加内容。
为什么有价值: 本类目 48 篇获奖摘要里没有一个误差棒。这张表把"这个差是不是噪声"从一个需要统计训练才能回答的问题,变成一次查表操作——任何后来者都能在提交前自查,评审也能用它当尺子。
若结论不显著: 若区间宽度与 n 的关系完全落在经典 1/√n 上、没有任何机器人任务特有的成分,本课题的价值会退化为一次复现。这是本条最真实的风险,规避方式是 §4 第 4 条:用自采的真实机器人数据把 Fit 锚住,并把整块相关性(H2)作为机器人数据特有的成分正面测量。即便如此,区间宽度的绝对数值仍是有效结论,但必须给出误差棒(区间宽度自身的不确定度)证明有能力分辨。
8 · 决策门槛(go / no-go)
🟢 2026-08-25(第 3 周末):覆盖率校验通过,公开数据集下载与格式转换完成。 注册与格式转换预留 2 周,从第 1 周开始。
🔴 2026-09-14(第 6 周末,采购 go/no-go 项):自采数据的成像器材到位。 若多光谱相机的货期超过 4 周或价格超出预算,此项即判为不可行,降级路径:改用普通 RGB 摄像头或深度相机(R12 已实测 Intel RealSense D435 国内现货约 ¥1,300–1,800、一周内到货),主结论框架完全不变——最小样本量表本身与成像模态无关,模态只影响用来锚定学科契合的那一小批数据。该器材必须在 8 月内下单,不许拖到十月。
🟡 2026-10-12(第 10 周末):自采 ≥ 60 张数据的采集与标注完成。 若标注进度不足,降级路径:把自采部分从"独立数据集"降为"对公开数据集的一个补充子集",样本量下限降到 30 张并显式声明,主结论框架保留但学科契合的锚点变弱——这是本条最不愿走的降级,因此标注工作必须从九月就开始。
🔴 2026-11-30:n 的取值集合、B、要分辨的 Δ、显著性水平定死。 2026-12-15:数据采集截止,留 3 周分析与展板。
⚠️ 与「附属赛后不得修改」的冲突点: n 的取值集合、自助重抽样次数 B、要分辨的差 Δ、显著性水平,以及"整块重抽样时块的定义(按场景还是按视频)",一旦在附属赛后想改就不被允许。块的定义尤其危险——它直接决定 H2 的结论,事后调整等于事后选结论。全部必须在 11 月底前定死并写入研究计划。
须提前核实而非边做而发现的事项: 多光谱相机的价格与货期(go/no-go 项,见上);逐图 AP 离散度 s 的实测值;数据集许可证。尤其重要的是:本文件顶部已声明"基于本地五届语料,未做外部文献核查",而本条的原创性天花板由外部统计文献决定,学生必须在开题前自行补一轮外部文献检索,查清"检测指标的置信区间与最小样本量"已有哪些工作,并据此收紧自己的主张边界。这一步没做,本条会在答辩时被一篇现成论文当场压掉。
已知困难及其定位: 原创性有天花板——统计学界早有相关工作。这个困难的定位是把主张钉死在具体语境:不是"我发明了样本量计算",而是"我在机器人视觉任务的真实数据与真实规模上把这张表算了出来,并给出了退化情形的处理规程"。语境越具体,边界越好守。
选择前提: 适合统计基础扎实、愿意做枯燥标注工作的学生。学科契合是本条最低的一维(Fit=8):必须用真实机器人数据复现,否则会退化成纯统计练习。不适合想做实物装置的学生——展板全是图表与那张表。
预算裁剪顺序: 先砍多光谱模态(改 RGB 或深度),再砍第 7 步的置换检验交叉校验(保留解析近似一种对照),再把数据集数从 3 降到 2,最后把自采样本量从 60 降到 30 并显式声明。砍到最后,"最小样本量表 + 退化情形处理规程"这一主结论框架仍成立。
🔴 展台能否展示实物: 图表加那张最小样本量表,本身就是很好的展板内容,展台限制对本条的影响为零。相机是干燥固体、可上台但非必需;无液体、无粉末、无锐器。禁网址与二维码——数据集与代码仓库地址均不得以网址或二维码形式出现。
评分: O=7, W=9, F=9, S=7, Fit=8 → base=79.8,h=9 → [71, 89],置信度:中