Conrad Challenge Archive 2024 — 2026

C05

浏览器内“数据出境收据”:把表单发送对象在提交前说清楚

Pre-Submission Data-Egress Receipts for Web Forms

推荐优先级 ★★★★☆本地隐私与数据主权族原型 D+E资源:纯笔记本技能:浏览器扩展 + 网络测量建议 2–3 人

1 · 创新命题

面向填写奖学金、租房与求职表单的用户,做一个浏览器本地扩展:在按下提交前,将字段类别、 目标域名、第三方接收者和跨境位置线索汇总成一页“数据出境收据”,允许保存证据或取消;相对隐私政策 长文与事后抓包,把一次具体提交会把什么送给谁变成即时、可复查的决定。 EN A local browser extension that shows a pre-submission data-egress receipt—field categories, destination domains, third parties and cross-border clues—so scholarship, rental and job applicants can see what this specific form will send before they click submit.

2 · 背景与空白

Chrome DevTools 能看网络请求,DuckDuckGo App Tracking Protection 面向 Android 应用,Apple App Privacy Report 偏事后汇总,Blacklight 扫描网站跟踪器;普通用户仍无法把“这个表单字段”与“哪个 请求接收”对应。浏览器扩展受 Manifest V3 权限和请求体可见性限制,跨域 iframe、加密前序列化也会 失败。空白在:在不上传表单内容的前提下,生成一次提交级、字段类别化而非原文泄漏的可验证收据, 并诚实显示 unknown,而不是声称看见所有流量。

3 · 可检验假设

H1 在含原生表单、XHR/fetch、第三方 iframe 与 SPA 的公开测试页中,扩展对已知接收域名的召回 ≥ 0.90、字段类别映射精确率 ≥ 0.90,且日志中零字段原文。 H2(采纳)在 ≥ 12 名成年志愿者的任务测试中,收据使正确识别第三方接收者的比例提高 ≥ 30 个 百分点,额外决策时间中位数 ≤ 20 秒。

4 · 量化验收标准

  1. 【方法学校验 · 硬门槛】 用自建扩展复现 Web Platform Tests/OWASP WebGoat 中至少 20 个 已知 form、fetch、XHR 与 iframe 提交算例,目标域名识别与浏览器 DevTools 参考 HAR 一致率 ≥ 95%。 此条不过,后续全部结论无效。
  2. ≥ 100 个获准测试的公开表单页面;不得提交真实个人信息,使用合成字段并遵守站点条款。
  3. 极不平衡第三方检测报 PR-AUC、召回、精确率,明确不报 accuracy;按网站 eTLD+1 划分测试, 同站页面不得跨集,并量化随机页面划分的高估幅度。
  4. 日志隐私测试:源代码、存储、导出与崩溃日志均搜索注入 canary,检出任一原文即失败。
  5. 与 DevTools HAR、Blacklight 输出做基线;后两者 仅用于校验与对比,不计入项目数据贡献

5 · 数据与工具

用途 来源 / 工具
扩展 Chromium Manifest V3;可观察能力受权限与浏览器版本影响,Firefox 支持 需核实
参考真值 Chrome DevTools HAR、Web Platform Tests、OWASP WebGoat
域名归属 Public Suffix List、RDAP、IP2Location 免费库或同类;公司归属与实际数据位置不可等同
第三方基线 Blacklight、DuckDuckGo Tracker Radar —— 仅用于校验与对比
用户测试 合成奖学金/租房任务;不采集受试者真实表单内容

能力边界:IP 地理位置只是服务器线索,不证明法律上的数据存储地。致命错误是把“请求发往某国 IP”写成“数据一定存储在该国”;收据必须使用“观察到/未知/需核实”三级措辞。

字段分类也必须在 DOM 变化前完成并只保留类别,例如“联系方式”“财务信息”,不得把姓名或答案复制 进调试日志。对同意管理平台、支付 iframe 和验证码造成的不可见部分,收据显示覆盖范围及证据时间, 而不是用绿色勾号掩盖。产品价值由用户是否改变决定来验证,不以“扫描到很多第三方”代替影响证据。 用户取消提交也不能被解释为工具成功:须追问是隐私顾虑、表单错误还是任务本身放弃,并把原因分开。 若扩展会改变页面脚本或请求顺序,测到的接收者就不再代表原流程,必须做无扩展 HAR 对照。

6 · 赛季执行路径

  1. 第 1–2 周:建合成测试页与 HAR 对照,完成硬门槛。
  2. 第 3 周:实现字段只分类不留原文;加 canary 自动审计。
  3. 第 4–5 周:处理 fetch/XHR/SPA;对 iframe 明确 unknown。
  4. 第 6–7 周:采集 100 页合成提交结果,按网站划分评估。
  5. 第 8 周:与 Blacklight/Tracker Radar 对照;做失败模式分类。
  6. 第 9–10 周:用户任务测试;第 11–12 周威胁模型、简述与演示。

7 · 新颖性边界

不声称:不取代法律隐私政策;不证明服务器最终存储地;不绕过浏览器安全边界;不读取密码。 已有工作:Chrome DevTools 提供 HAR;Blacklight 与 Tracker Radar 识别跟踪器;Apple App Privacy Report、DuckDuckGo App Tracking Protection 提供事后可见性。本项目贡献是提交前、单次事务级、 字段类别到接收者的本地映射及无原文收据。护城河类型:工作流替换(D)+ 累积数据(E); 跨站失败模式库比扩展代码本身更难复制。

8 · go/no-go

第 2 周末:20 个算例一致率 < 80%,具名降级为 提交后 HAR 解释器,放弃实时拦截,但仍生成 字段类别—接收域名收据并保留主结论。 第 7 周末:第三方召回 < 0.70,则限定为 原生 form + fetch 白名单场景并显示覆盖率;第 10 周 若理解提升 < 10 个百分点,降级为给隐私研究者的证据导出工具,不声称改善消费者决策。


族二 · 存量设备安全改造