Conrad Challenge Archive 2024 — 2026

C12

本地语音转写的“谁能复原原声”隐私审计

A Reconstruction-Risk Audit for On-Device Speech Transcription

推荐优先级 ★★☆☆☆本地隐私与数据主权族原型 B+D资源:纯笔记本技能:语音处理 + 隐私评估建议 2–3 人

1 · 创新命题

面向记者、辅导员和学生研究者的本地语音转写流程,做一个“最小留存”审计器:比较原始音频、 文字、时间戳、说话人嵌入与压缩特征中还能恢复多少身份和敏感内容,自动建议删除或降精度;相对“文件 没上传所以隐私安全”的笼统承诺,把每类中间产物的可识别风险变成实测收据。 EN A minimum-retention audit for on-device transcription that measures how much identity and sensitive content remain recoverable from audio, text, timestamps, speaker embeddings and compressed features, replacing the vague claim “it stayed local, so it is private” with an evidence-based deletion receipt.

2 · 背景与空白

OpenAI Whisper 开源模型、whisper.cpp 与 Vosk 支持本地转写;pyannote.audio 可做说话人分离,能力与 模型许可需核实。研究已表明说话人嵌入可能泄漏身份、属性或被用于重建,但具体风险随表示和攻击者能力 而变。空白在:给非专业用户一个按自身工作流测量“留哪些文件才够用”的工具,而非泛泛地把本地 推理等同零风险。项目只用公开许可或成年志愿者明确同意的语音,不推断敏感人口属性。

3 · 可检验假设

H1 删除原音并将说话人嵌入量化/扰动后,授权说话人验证攻击的 EER 相对原嵌入恶化 ≥ 15 个百分点, 同时转写 WER 增加 ≤ 3 个百分点、说话人轮次边界 F1 降低 ≤ 0.05。 H2(机制)时间戳精度从 10 ms 降到 1 s 对转写可用性影响很小,却能显著降低用外部事件时间线 链接个体的成功率;若无下降,则不把它包装成隐私收益。

4 · 量化验收标准

  1. 【方法学校验 · 硬门槛】 用自建管线复现 LibriSpeech/AMI 上 Whisper 或 Vosk 已公开的至少 2 组WER/说话人分离基线,绝对偏差 ≤ 3 个百分点。此条不过,后续全部结论无效。
  2. ≥ 50 名公开数据说话人、每人 ≥ 5 段;身份攻击的注册段与测试段按 session 分离。
  3. 身份判定不平衡:报 PR-AUC、召回、精确率与 EER,明确不报 accuracy;按说话人划分开发/测试, 并报告随机片段划分的高估幅度。
  4. 隐私—效用曲线必须同时报 WER、轮次 F1、存储量和攻击成功率;不只挑有利指标。
  5. 不训练人口属性推断;删除验证用 canary 与文件系统检查,SSD 安全擦除能力不作绝对承诺。

5 · 数据与工具

用途 来源 / 工具
语音基线 LibriSpeech、AMI Meeting Corpus;许可与说话人条款需遵守
转写 whisper.cpp/OpenAI Whisper、Vosk;模型本地运行不代表其输出无敏感信息
说话人 pyannote.audio 或 SpeechBrain ECAPA;模型下载许可/令牌 需核实
攻击评估 自建闭集/开放集说话人验证;不调用云 API
对照 官方模型卡与论文基线 —— 仅用于校验与对比,不计入数据贡献

能力边界:EER 只代表设定攻击者。致命错误是看到一个攻击器失败就宣称匿名化;必须写清攻击者 知识、注册语音量与未测试攻击。

使用者真正购买的不是“一个离线模型”,而是可核验的最小留存规则:录音何时删除、哪些派生文件仍 能链接到个人、删除后还能否完成校对。报告须把设备失窃者、同机普通用户和持有注册语音的攻击者分开, 因为三者能力不同;若只测试最弱攻击者,隐私结论没有商业意义。 文本本身也可能直接泄漏人名、住址和病情,因此审计器要把“声音身份风险”和“语义内容风险”分栏。 即便嵌入已扰动,只要转写中仍含明示身份,就不能给出总体匿名结论;删改规则须另行验证。

6 · 赛季执行路径

  1. 第 1–2 周:复现 WER/分离基线,完成硬门槛。
  2. 第 3 周:冻结攻击者模型、效用指标与保留产物。
  3. 第 4–5 周:建立身份攻击与 session 切分;第 6 周原始风险基线。
  4. 第 7–8 周:量化、扰动、时间降精度扫描,画隐私—效用曲线。
  5. 第 9 周:canary 删除与本地威胁测试;第 10 周用户工作流访谈。
  6. 第 11–12 周:收据原型、伦理边界和简述。

7 · 新颖性边界

不声称:不发明 Whisper、说话人匿名化或差分隐私;不保证匿名;不推断敏感属性。 已有工作:Whisper/whisper.cpp、Vosk 做本地转写;pyannote.audio/SpeechBrain 做说话人表示;已有 voice privacy 与 speaker anonymization 研究。本项目贡献是把中间产物逐项纳入实际留存决策,输出 攻击假设明确的隐私—效用收据。护城河类型:零云资源(B)+ 工作流替换(D);跨工具产物风险 基准库是资产,而非模型本身。

8 · go/no-go

第 2 周末:WER 基线偏差 > 6 个百分点,具名降级为 仅审计 Whisper 文本与时间戳留存,去掉 跨模型比较,主结论不变。 第 6 周末:说话人验证 EER 已接近随机、无可测攻击,改用原音/嵌入最近邻链接的较弱公开攻击; 第 8 周若任何变换都使 WER 增加 > 8 个百分点,则诚实给出“本数据下无可接受隐私—效用点”的否定结论。