Conrad Challenge Archive 2024 — 2026

C01

离线优先的家庭文档隐私清点与可验证删改工具

Offline-First Privacy Inventory and Verifiable Redaction for Household Documents

推荐优先级 ★★★★★本地隐私与数据主权族原型 B+D资源:纯笔记本技能:文本处理 + 隐私工程建议 2–3 人

1 · 创新命题

面向需要向学校、房东、保险机构上传表格的家庭,做一个完全离线的文档隐私清点工具:在 本机标出姓名、证件号、住址、健康信息与隐藏元数据,生成可人工确认的删改副本和“不可恢复”验证报告, 相对把原件传给在线 PDF 编辑器的流程移除云端副本,并把漏删字段率量化到可审计。 EN An offline privacy inventory for families sharing forms with schools, landlords and insurers: it finds sensitive text and hidden metadata, produces a human-approved redacted copy, and verifies that removed content cannot be recovered—without uploading the original to a cloud editor.

2 · 背景与空白

家庭常用黑框遮盖 PDF,但视觉遮住不等于删除底层文字;EXIF、批注、历史对象和文件名也会泄漏。 Adobe Acrobat Pro 有 Redact,Microsoft Presidio 可识别 PII,ExifTool 可删元数据;三者分别解决 编辑、实体识别和元数据,却没有把“发现—人工确认—不可恢复验证—分享收据”做成普通家庭能理解的 离线流程。空白在:不是再训练一个命名实体模型,而是把多层泄漏面与验证步骤合成一份可交付证据。 项目允许得出否定结论:若 OCR 文档漏检过高,就明确限定只支持数字原生 PDF,而不假装覆盖所有文件。

3 · 可检验假设

H1 在预先注入已知 PII 与隐藏对象的数字 PDF/扫描件测试集中,离线管线对高风险字段的召回率 ≥ 0.95、每页误报中位数 ≤ 2,且经删改后的文件用 pdftotext、对象解包与元数据扫描均无法恢复目标字段。 H2(采纳)与“在线编辑器 + 手工检查”相比,首次使用者完成同一任务的中位时长不增加超过 20%, 并有 ≥ 80% 的受测者能正确解释验证报告中的“已删除”和“仅遮挡”差异。

4 · 量化验收标准

  1. 【方法学校验 · 硬门槛】 用自建管线复现 Microsoft Presidio 官方至少 3 组公开 PII 识别示例与 veraPDF/ExifTool 的已知元数据样例;实体边界 F1 与参考输出偏差 ≤ 5 个百分点,注入的 20 个隐藏字段检出率 100%。此条不过,后续全部结论无效。
  2. 自建测试集 ≥ 300 页,至少含数字 PDF、扫描 PDF、表格、批注层与图片元数据;敏感内容全部为 合成数据,不使用真实证件。
  3. 任务是极不平衡检测:报 PR-AUC、召回、精确率与每页误报数,明确不报 accuracy,因为绝大多数 token 不是 PII;按文档模板划分训练/测试,禁止同模板页面跨集。
  4. 删改后同时用文本提取、对象流解包、复制粘贴、缩略图和元数据五种恢复测试;任何一项恢复即失败。
  5. 完成 ≥ 10 名成年志愿者的可用性测试;只记录任务时间和错误类型,不留存其文件内容。

5 · 数据与工具

用途 来源 / 工具
公开校验 Microsoft Presidio 示例语料、veraPDF 测试文件、ExifTool 样例 —— 仅用于校验与对比,不计入本项目数据贡献
文档解析 PyMuPDF、OCRmyPDF/Tesseract;前者可读对象,后者 OCR,均不保证复杂表格顺序正确
PII 识别 Presidio + 自写规则;内置通用实体,地区证件格式需自己实现并逐项核实
恢复审计 pdftotextqpdf --qdf、ExifTool、veraPDF
硬件/成本 普通 8 GB 内存笔记本;无新增硬件,OCR 速度依机器而异,需实测

能力边界:离线不等于安全;恶意 PDF 解析仍需沙箱。最容易犯的致命错误是把黑色矩形覆盖 当作删除成功,因此“可恢复性五检”必须是核心证据,不是演示彩蛋。

6 · 赛季执行路径

  1. 第 1–2 周:建立合成注入器与恢复审计器,完成方法学校验。
  2. 第 3 周:实现数字 PDF 的对象级清点和安全重写,先不接 OCR。
  3. 第 4–5 周:接 Presidio 与地区规则;冻结实体类别和统计口径。
  4. 第 6 周:加入扫描件 OCR,按文档模板分组评估并记录失败类型。
  5. 第 7–8 周:做五种恢复攻击与格式回归测试,形成“隐私收据”。
  6. 第 9 周:可用性测试;第 10 周按错误而非主观偏好改界面。
  7. 第 11–12 周:威胁模型、单位经济与简述;学生须能白板解释规则、OCR 和实体识别的边界。

7 · 新颖性边界

不声称:不发明新的 OCR、NER 或 PDF 标准;不保证识别所有 PII;不把离线运行等同于合规认证。 已有工作:Adobe Acrobat Pro 提供 Redact;Microsoft Presidio 做 PII 检测;ExifTool 删除元数据; Dangerzone 把不可信文档转为安全 PDF。本项目贡献是面向家庭分享场景,把内容、对象层与元数据 的删改整合为可验证工作流,并输出第三方可复查的隐私收据。护城河类型:工作流替换(D)+ 零云资源约束(B);真正壁垒是持续扩充的失败文档库,不是可复制的识别模型。

8 · go/no-go

第 3 周末:数字 PDF 的 20 个注入字段若仍有任一可恢复,停止加入 OCR,降级为 “数字原生 PDF 可验证删改器”,主结论仍是离线发现—删除—证明闭环。 第 6 周末:扫描件高风险字段召回 < 0.85,则具名降级为 OCRmyPDF 预处理后人工双确认模式, 产品不再自动放行扫描件;第 9 周若任务中位时长超过基线 1.5 倍,则保留验证器,删去复杂自动编辑界面。