Conrad Challenge Archive 2024 — 2026

A09

通用航空事故报告的文本挖掘与前兆模式识别

Mining Precursor Patterns from Public General-Aviation Accident Narratives

推荐优先级 ★★★☆☆软件与数据族原型 D+E资源:纯笔记本技能:NLP + 统计建议 2–3 人

1 · 创新命题

面向通用航空飞行俱乐部与保险方的风险简报工具,用 NNTSB/ASRS 公开事故与 事件报告文本,识别"事件(未遂)"叙述中反复出现的、最终演变为事故的前兆模式, 把现有靠人工阅读月报的做法替换为可量化排序的风险主题清单。 EN A risk-briefing tool that mines public NTSB/ASRS narratives for the precursor patterns that recur in near-misses and later show up in accidents — replacing hand-read monthly digests with a ranked, quantified list of what is actually trending.

2 · 背景与空白

通用航空事故率远高于运输航空。NTSB 事故报告与 ASRS 自愿报告系统均有大量公开文本。 已有工作:航空安全领域有基于 ASRS 的文本挖掘研究(主题模型、分类), 多发表于安全科学期刊;NASA 自己也做过 ASRS 分析工具。 空白在把"事件报告主题"与"后续事故"做时序关联、检验前兆性的公开研究稀少, 且没有面向飞行俱乐部的可操作输出。适合学生课题:数据完全公开、纯 CPU、 且结论正负都成立(若无前兆性,那也是重要的否定结论 —— 说明自愿报告系统的预警价值有限)。

3 · 可检验假设

H1 在给定机型类别上,ASRS 事件报告中某主题的季度频次上升, 可在领先 2–4 个季度上与 NTSB 同类事故频次正相关(Spearman ρ ≥ 0.35,p < 0.05)。 H2(备择)若无显著领先关系,则两者同期相关而无领先性, 说明自愿报告反映的是已发生风险的记录而非预警信号 —— 这一结论对安全管理同样重要。

4 · 量化验收标准

  1. 【方法学校验 · 硬门槛】 用自建 NLP 管线复现至少 1 项已发表的 ASRS 主题分析 的主要主题构成,主题重合度(如 top-10 关键词 Jaccard)≥ 0.5此条不过,后续关联分析无意义。
  2. 样本:ASRS ≥ 20,000 条报告,NTSB ≥ 3,000 起事故,覆盖 ≥ 15 年。
  3. 统计口径预先写死:时间序列相关必须做预白化(去趋势去季节)后再算相关, 否则共同趋势会造成伪相关 —— 这是本课题最容易犯的错; 多重比较(多主题 × 多滞后)必须做 FDR 校正并报告校正前后的差异。
  4. 必须做安慰剂检验:用随机打乱的主题序列重跑,确认显著性不是流程假象。
  5. 主题模型的主题数选择必须有依据(如一致性分数扫描),不得凭感觉定 K。
  6. 全部代码开源;因 ASRS/NTSB 数据公开,第三方可完全复现。

5 · 数据与工具

用途 来源 / 工具
事件报告 NASA ASRS 数据库(公开,可批量下载 CSV)
事故报告 NTSB CAROL 数据库(公开 API/下载)
NLP Python + gensim(LDA)或 BERTopic注意 AI 使用政策(见下)
统计 statsmodels(预白化、交叉相关)
对照基准 已发表 ASRS 主题分析论文 —— 仅用于校验,不计入本项目贡献

Conrad AI 政策注意:本课题使用主题模型/嵌入模型属于把 AI 做进产品(允许), 但简述中必须能解释模型如何工作;且若使用预训练语言模型, 需在参考文献 PDF 中按来源引用。不得让 AI 代写简述文本。

能力边界:ASRS 报告为自愿提交且经过去标识化处理,存在系统性报告偏倚 (某些机型/运营人报告率更高);必须在讨论中量化该偏倚的可能方向,不可当作随机样本。

6 · 赛季执行路径

  1. 第 1–2 周:下载数据;建清洗管线;完成方法学校验(复现已发表主题)。
  2. 第 3 周:主题数扫描;确定 K 并记录依据。
  3. 第 4–5 周:产出主题-时间序列;实现预白化。
  4. 第 6 周:交叉相关分析(多滞后);FDR 校正。
  5. 第 7 周:安慰剂检验 —— 这一步不做,结果不可信
  6. 第 8 周:报告偏倚分析;按机型/运营类别分层重跑。
  7. 第 9 周:向一位飞行教员或安全经理做结果评审访谈,取得引用许可。
  8. 第 10–12 周:风险简报原型(输出形态)+ 简述撰写。

7 · 新颖性边界

不声称:不提出新的 NLP 方法;不声称发现新的事故因果机制; 不声称本工具可预测具体事故(这是伦理红线,必须在简述中明确否认)。 已有工作:ASRS 文本挖掘有既有文献(主题模型、分类); NASA 有内部分析工具;安全科学领域有前兆理论(如 Heinrich 金字塔,且该理论本身有争议)。 本项目贡献首个公开可复现的、检验 ASRS 主题对 NTSB 事故是否具领先性的时序研究, 含安慰剂检验。H2 为真同样构成完整结论,且对安全管理实践有直接含义。 护城河类型工作流替换(D)—— 把"人工读月报"替换为量化排序; 诚实说明:方法可复制,护城河弱,真正价值在持续更新的风险基准库(E)。

8 · go/no-go

第 2 周末:若无法复现任何已发表主题分析(重合度 < 0.3),说明清洗或建模有误 → 降级为监督分类任务(用 NTSB 已标注的事故类别做有监督主题分配,绕开无监督主题模型的不稳定性), H1 框架不变。 第 7 周末:若安慰剂检验显示随机序列也能产生同等显著性 → 立即停止声称任何相关性,转为报告方法学否定结论: "在本数据规模与统计流程下,无法从 ASRS 主题中提取对 NTSB 事故的领先信号", 并分析所需样本量。这是诚实且完整的课题。