ISEF Topic Scoping 2027

R778–88

把大模型放进导航回路,杀死你的是尾延迟不是均值

推荐优先级:高 · 族 B(低成本自建链路 + 公开 API) · 参赛子类:Robotics and Intelligent Machines — 系统与控制 · 资源需求:树莓派/笔记本 + 摄像头约 ¥300–800,LLM API 费用几百元可覆盖数万次调用;最长采购周期一周,型号与货期需核实 · 技能取向:系统测量 / 尾部统计 / 时序分析

1 · 研究问题

"感知 → 大语言模型(Large Language Model, LLM)推理 → 运动指令"这条闭环的端到端延迟分布长什么样,重点是 P95/P99 尾部而非均值?以行人 1.2 m/s 的步速换算,多长的延迟尾部会让一次"前方有台阶"的提示来不及?两级 LLM 串联相比单级,把尾延迟放大了多少倍?

2 · 研究背景与空白

背景。 对一个引导视障者行走的辅助系统而言,延迟不是性能指标而是安全指标本身:以 1.2 m/s 步速计,1.5 s 的延迟意味着提示发出时人已经又走了 1.8 m;若台阶在 2 m 外被识别,这次提示实际上是无效的。关键在于,安全由尾部而不是均值决定——一百次里九十九次及时、一次晚到 3 秒,评价系统的不是那个均值。而两级 LLM 串联(第一个模型生成场景摘要、第二个据此产生运动指令)会把两个重尾分布叠加,且两次调用共享同一条网络路径与同一服务端队列,尾事件是正相关的,这使得尾部的放大幅度可能显著超过独立假设下的预测。

已有工作到哪一步。 2025 ROBO066T(Grand + Special)"AI-Based Navigational Aid for Visually Impaired"(IntelliCane) 描述了 a two-stage LLM Aggregator fuses agent data and user intent,配合 YOLO 与深度图,整篇摘要里没有一个数字——它从未回答这条链路要花多久。同一问题域的后继者 2026 ROBO042(Grand Award)ScoutCane 报告 37 of 40 trials 成功、3× faster navigation,并 dynamically quantifies navigational uncertainty(这是 ROBO 48 篇里唯一的 uncertaint 命中,指的是导航置信度而非测量不确定度),同样未报告延迟。五届检索中 mine_isef "latency" 仅命中 2026 ROBO021(湿地机器人,control latency of ≤92 ms,那是本地 PID 不是 LLM)。词频统计上,ROBO 48 篇 standard deviation 0 次、error bar 0 次、sensitivity analys 0 次。

空白在于:把 LLM 放进机器人控制回路的项目已经连续两届获奖,却没有任何一篇量化过这条回路的时间开销,更没有人区分过均值与尾部。这个空白适合一年期学生课题:属于"评价维度转换"型;器材几乎零采购风险(树莓派/笔记本 + 摄像头 + API,一周内齐备);数据是自己产生的时间戳,几天就能积累到统计量足够的规模;而且结论正负都成立——尾部放大得厉害或不厉害,都直接给出一条可引用的设计判据。

3 · 可检验假设

H1 两级 LLM 串联的端到端 P99 延迟 ≥ 单级 P99 的 1.8 倍,显著高于"两次调用相互独立"假设下由单级实测分布卷积得到的预测值。

数值依据:若两次调用的延迟独立同分布,和的均值精确加倍,但高分位数是次可加的——用单级实测分布做数值卷积,预测的 P99 放大倍数通常落在 1.2–1.4 倍区间(该区间由本课题的单级实测分布现场算出,不引用外部数值)。因此"实测放大倍数逼近 2 倍上界"这一现象,只可能来自两次调用的尾事件正相关(共享网络路径、共享服务端队列、共享本机 CPU 调度与温控降频)。H1 因此是可被数据直接否证的:只要实测倍数落进卷积预测区间,H1 即被推翻。

H2(机制假设,H1 被否证时仍有内容)若串联放大倍数与独立卷积预测一致,则端到端尾部的主导分量不在 LLM 而在感知端:表现为纯视觉基线(无 LLM)的 P99 已占端到端 P99 的 ≥ 40%,且该分量与提示词长度、网络往返时间(Round-Trip Time, RTT)均不相关,而与取帧、解码、检测三段的调度抖动相关。

4 · 量化验收标准

  1. 方法学校验(硬门槛,不过关则后续全部结论无效)。 先证明计时链本身干净:用一段已知时长的本地回环(固定 sleep + 空操作)跑 ≥ 2,000 次,测得时长与设定值的偏差 ≤ 1%,且测量工具自身引入的抖动,其 P99 必须比最小被测延迟小一个数量级这一步不过关,后续所有结论无效——你要测的正是尾部,而尾部最容易被自己的计时工具污染(垃圾回收暂停、日志同步写盘阻塞、解释器调度)。
  2. 统计口径预先写死,两个 n 必须分开报。 每种配置总调用次数 n ≥ 2,000(P99 的自助法区间在 n 低于数百时宽到没有意义)。必须区分「同一次会话内的连续重复」与「不同时段、不同日期的独立会话」——前者共享 TCP 连接、服务端缓存与本机热状态,会系统性低估尾部,这两个 n 不是一回事,混用是本类目最常见的错误。规定为 ≥ 5 个独立会话 × ≥ 400 次调用,且跨早、晚两个时段。不确定度合成:A 类为分位数的自助法区间;B 类包含时钟分辨率、日志写盘阻塞、网络 RTT 基线漂移。
  3. 网络 RTT 必须作为可分离分量单独记录。 每次调用前后各打一次独立的 RTT 探测并入库,否则测到的是运营商而不是系统架构。
  4. 三种配置必测,且若做任何优化必须报告同口径对比。 三配置为:云端 API、本地量化小模型(CPU 上运行)、纯视觉基线(无 LLM)。若引入任何加速手段(流式输出提前触发、请求预热、并发预取),必须在同一 n、同一会话结构、同一时段分布下给出优化前后的 P50 / P95 / P99 三档对照,不得只报优化后的数。
  5. 结论必须落回机器人任务。 给出判据 t_max = (d − s)/v:其中 d 为障碍被识别时的距离、s 为使用者反应与制动所需的安全余量、v 为步速。对 v = 1.2 m/s 与 1.6 m/s 两个步速给出具体的最大可接受 P99 延迟数值表,并把三种配置逐一放上去判定通过与否。没有这一步,本课题会被判为机器学习方法学而非 ROBO。
  6. 可复现性。 采集脚本、提示词模板、逐次调用的原始时间戳、分量分解与分析脚本全部开源;AI 生成的代码须显式引用并保留提示词日志

5 · 数据与工具

用途 来源 / 工具
感知端 树莓派或笔记本 + USB / 网络摄像头,量级约 ¥300–800,一周内到货;具体型号与货期需核实
云端 LLM 商用 LLM API,API 费用几百元即可覆盖数万次调用;具体服务商、单价与速率限制需核实
本地小模型 CPU 上运行的量化小模型;具体模型、量化格式、许可证与其在目标 CPU 上的单次推理时间需核实,且必须在第 1 周实测而非查规格
纯视觉基线 YOLO 类检测器 + 深度图(ROBO066T 的感知端形态),nano 档即可
计时与日志 单调时钟(monotonic clock)+ 异步落盘的结构化日志;不得用同步写盘的日志库,见 §6 静默失败点
对照基准(仅用于校验与对比,不计入本项目的数据贡献 ROBO021 的 control latency of ≤92 ms(本地 PID);ROBO042 的 37 of 40 trials3× faster navigation
算力 纯 CPU 笔记本完全可行,无需云 GPU。本课题的负载是"等待"而不是"计算",数据量为逐次调用的时间戳表,MB 量级

能力边界须核实项: API 服务商的速率限制与重试策略——HTTP 429 触发的自动重试会伪装成一次超长推理,这是运营商行为不是架构行为;本地小模型在目标 CPU 上的实际单次推理时间(若单次超过 10 s,跑满 n ≥ 2,000 在净窗口内不成立,见 §8);提示词长度对延迟的影响关系;API 的计费口径与月度额度上限;摄像头驱动的帧缓冲深度(决定时间戳该打在曝光时刻还是解码时刻)。以上任何一项写"按规格书"都不算数,必须实测。

6 · 方法路径

  1. 搭链路 + 跑通计时校验。 摄像头 → 检测 → 序列化 → LLM → 指令解析全链打通,完成 §4 第 1 条的计时链校验。这一步不过不许继续。
  2. 核实器材与服务能力边界。 实测 API 限流阈值、本地模型单次推理时间、摄像头帧缓冲深度。本步须逐条排查以下静默失败点(不报错但给错结果): - HTTP 429 / 5xx 的自动重试被 SDK 静默吞掉,重试后成功的那次调用被记为一次超长推理——测到的是限流不是尾延迟。必须打开 SDK 的重试日志并把重试次数入库。 - 流式接口的"首 token 时间"与"完整响应时间"被混用,前者短得多,两者都能正常返回,但不是同一个量;运动指令需要完整响应。 - 日志同步写盘阻塞主线程,把测量工具自身的开销写进被测量,且只在磁盘忙时出现,正好污染尾部。 - 摄像头帧缓冲返回的是几帧之前的旧帧,时间戳打在解码后而非曝光时刻,端到端延迟被系统性低估——全程无任何报错。 - 本地模型首次调用包含权重加载与即时编译(JIT),冷启动被计入分布尾部,看起来像是架构问题。 - 长时间跑批时 CPU 温控降频,后半段系统性变慢,被误读为负载相关的尾部增长。
  3. 完成三配置 × ≥ 5 个独立会话 × ≥ 400 次调用的采集,跨早晚两个时段。
  4. 分解延迟分量: 取帧、检测、序列化、网络 RTT、服务端推理、响应解析、指令生成,逐段给出分布,确认各分量之和与端到端实测一致(不一致说明有未计入的开销)。
  5. 做串联放大分析。 用单级实测分布做数值卷积,预测独立假设下的两级 P99;与实测两级 P99 对照,量化正相关带来的超额,判定 H1 / H2。
  6. 落回机器人任务。 按 §4 第 5 条给出 t_max 判据表与步速换算,逐配置判定通过与否。
  7. 独立交叉校验。 用与软件计时完全不同的原理测同一个量:用高帧率视频同时拍下"场景变化时刻"(例如障碍物突然进入视野)与"系统输出时刻"(LED 或蜂鸣器响应),从帧数反算端到端延迟,与软件时间戳对照。所用设备的实际帧率必须实测标定,其时间分辨率须优于被测延迟一个量级;具体设备与帧率需核实。

7 · 新颖性边界

本课题不声称: - 不声称首次测量 LLM 的延迟分布。尾延迟监控在工业界是成熟实践,本课题只把它下放到"机器人闭环 + 学生可得资源"这个具体场景。 - 不声称 ROBO066T 的系统慢。 该摘要零量化结果——"没有报告"不等于"表现差"。任何超出"该量从未被报告"的断言都会被原文当场驳回。 - 不声称提出更快的架构或更好的导航算法。本课题不做优化竞赛,只画安全边界。 - 不声称对视障使用者做任何可用性评估。 那属于人类受试者研究,须 IRB 在招募动作之前批准,且 2027 版明令学生一律不得向受试者反馈研究数据或提供建议——本课题全程不涉及人类受试者,所有步速数值来自公开的行走速度取值并作为参数代入,不做实测招募。

已有工作做到哪: ROBO066T 描述了 a two-stage LLM Aggregator fuses agent data and user intent,摘要零量化结果;ROBO042 报 37 of 40 trials3× faster navigation,未报延迟;五届 latency 检索仅 ROBO021 的 control latency of ≤92 ms 一项,且那是本地 PID。

本项目的贡献(属「评价维度转换」型): 已有工作评估的是"这个导航系统好不好用";本项目评估的是"这条回路要花多久,尾部有多长,以及在给定步速下多长的尾部就已经不安全"。这条时间预算是主结论,不是附加内容。

为什么有价值: 把 LLM 放进控制回路已经是本类目的稳定分支(连续两届 Grand Award),而这个分支的核心安全参数从未被任何一篇报告过。给出 t_max 判据表意味着后来者可以直接查表判断自己的架构成不成立,而不必等到现场试验里出事。

若结论不显著: 若两级串联的 P99 放大倍数与独立卷积预测无显著差异,这同样是有效结论——它说明串联的代价是可预测的,架构设计者可以用单级测量外推多级系统。但必须给出误差棒(分位数的自助法区间)证明有能力分辨 1.4 倍与 1.8 倍这个差异,否则等于没做。

8 · 决策门槛(go / no-go)

🟢 2026-08-25(第 3 周末):链路搭通,计时校验通过,API 额度与限流阈值实测完成。 若 API 的速率限制导致无法在合理时间内跑满 n ≥ 2,000,须在此时改换服务商或改用本地模型为主配置,不许等到十月才发现

🟡 2026-09-14(第 6 周末):三种配置全部跑通一轮小规模预实验(各 ≥ 200 次)。 若本地量化小模型在可得 CPU 上单次推理超过 10 s,跑满 2,000 次需 5.5 小时以上连续占机且温控降频会污染数据,降级路径:把本地配置换成更小的量化模型,并把该配置的分位数口径从 P99 降到 P95、n 降到 500(P95 在 n = 500 时的自助区间仍可用)。主结论框架(尾部而非均值决定安全边界)完全不变,只是本地配置的尾部刻画粒度下降,须显式声明。

🔴 2026-11-30:三种配置的定义、提示词模板、n 与分位数口径定死。 2026-12-15:数据采集截止,留 3 周分析与展板。

⚠️ 与「附属赛后不得修改」的冲突点: 提示词模板、三配置的定义、n 与分位数口径一旦在附属赛后想改就不被允许。事后换提示词等于换了被测系统,此前的全部数据作废。必须在 11 月底前定死并写进研究计划。

须提前核实而非边做边发现的事项: API 服务商的限流、计费与月度额度;本地小模型在目标 CPU 上的实测推理时间;摄像头帧缓冲深度;交叉校验所用高帧率设备的真实帧率。另外,本文件顶部已声明"基于本地五届语料,未做外部文献核查",学生必须在开题前自行补一轮外部文献检索,重点查机器人系统的端到端延迟测量规程。

ISEF AI 政策(本条须逐字执行): 研究 AI 本身完全合法,以 LLM 为被测对象不构成任何问题。但不得用生成式 AI 撰写研究计划、摘要、展板或引文AI 生成的代码必须显式引用并保留提示词日志。这一条对本课题格外重要——你手上正好有 API 密钥,越界的操作成本极低,而 §4 第 6 条已要求把提示词日志作为开源产物的一部分,正好把合规做成交付物。

已知困难及其定位: 尾部估计需要大 n,而大 n 意味着长时间连续采集,而长时间采集本身会引入温控降频与网络状况漂移。这个困难就是研究内容——跨会话、跨时段的设计正是为了把这些漂移分离出来,而不是绕开它们。

选择前提: 适合能沉住气做系统测量、看得懂分布尾部与分位数区间的学生。学科契合是本条的主要非技术风险:必须把结论落回机器人任务(§4 第 5 条的 t_max 判据表),否则会被判为机器学习方法学而非 ROBO。不适合想做实物演示的学生——本课题的展板全是直方图与尾部曲线。

预算裁剪顺序: 先砍第 7 步的光学独立交叉校验(保留软件计时的自洽性检验),再砍本地小模型配置(保留云端 API 与纯视觉基线两档,串联放大分析仍成立),再把独立会话数从 5 降到 3,最后把 n 从 2,000 降到 800 并把口径改为 P95。砍到最后,"尾部而非均值决定安全边界"这一主结论框架仍完整成立。

🔴 展台能否展示实物: 本课题的产出是延迟直方图与尾部曲线,不依赖任何现场演示,展台限制对它的影响为零。树莓派与摄像头是干燥固体、电池远低于 100 Wh,可以上台但没有必要。禁网址与二维码——API 文档链接与代码仓库地址均不得以网址或二维码形式出现在展板上。

评分: O=8, W=8, F=9, S=8, Fit=9 → base=82.8,h=5 → [78, 88],置信度:高