Yau Awards Archive 2020 — 2025

K19

中国文化物象零样本识别差距的测绘——CLIP 与 Chinese-CLIP 在自建评测切片上的对比与提示语言消融

优先级:中低分族:多模态定量分析资源:纯 CPU / 零预算(图片收集工作量大)技能:Python + 数据集构建类型:新评测切片构建

1 · 研究问题

英文语料训练的 CLIP 在中国文化特定物象(节令食品、传统器物、戏曲行当、非遗工艺)上的零样本识别相对其通用类目基线退化多少?该差距中有多大比例可仅靠提示工程(英文加 "Chinese" 限定、改用中文提示 + Chinese-CLIP)收回?

2 · 研究背景与空白

对比视觉-语言模型(CLIP)零样本分类依赖训练语料的概念覆盖。已发表工作:Pouget 等(2024, "No Filter")证明英文过滤的 CLIP 在非西方地理切片上系统性退化;Yin 等(2024)表明提示中加国家名可在亚非样本上提升最高 +2.6 top-1;Chinese-CLIP(Yang et al. 2022)提供 2 亿中文图文对训练的对照模型。现有地理多样性数据集(Dollar Street、GeoDE)以日常用品为主,类目按「物体功能」组织。

空白在文化特定物象(同一功能、文化形制不同,如月饼 vs 西式糕点、二胡 vs 小提琴)的细粒度评测切片不存在,中国子类尤其粗。构建 40–60 类评测切片是学生可完成的数据贡献;全部推理 CPU 可行,结构性绕开算力墙。

3 · 可检验假设

  • H1:CLIP ViT-B/32 在文化切片上的 top-1 准确率比其在语义难度相当的通用对照类目组上低 ≥15 个百分点,而 Chinese-CLIP 的对应差距 ≤5 个百分点。
  • H2:英文提示加入 "Chinese/traditional Chinese" 限定词可收回 CLIP 差距的 ≥1/3;剩余差距在错误分析中主要表现为「映射到西方功能等价物」(占错误 ≥40%,按预登记 codebook 判定)。

4 · 量化验收标准

  1. 方法学校验(硬门槛):自建零样本推理管线复现 CLIP ViT-B/32 在 CIFAR-100 上公开报告的 zero-shot 准确率,偏差 ≤2 个百分点;同法复现 Chinese-CLIP 模型卡上一项基准数字偏差 ≤2 个百分点。不过关则后续全部结论无效。
  2. 评测切片规格:≥40 类 × 每类 ≥15 张,全部图片给出来源 URL 与许可(CC/公有领域),逐张记录;类目定义与「对照通用类目组」的配对判据(视觉粒度相当)预登记。
  3. 统计口径预先写死:报 top-1/top-5 与逐类召回;类间不平衡有限但仍不以总体 accuracy 单指标下结论,主口径为宏平均逐类召回 + 类级自助 95% CI(对「类」重抽样);提示模板效应报配对差。
  4. 错误分类 codebook 预登记,双人独立标注 200 个错例,一致性 κ ≥ 0.7。
  5. 提示消融 ≥4 组:CLIP 原版 80 模板均值 / 加限定词 / 中文直译提示 / Chinese-CLIP 中文提示。
  6. 评测集、脚本、逐张许可清单全部开源。

5 · 数据与工具

用途 来源 / 工具
评测切片图片 Wikimedia Commons、公有领域图库(按许可筛选)——切片的类目设计、筛选与标注是本项目的数据贡献;原始图片版权归属原作者
对照数据 CIFAR-100(校验用)、GeoDE 中国子集(对照)——仅作校验与对照,不计入贡献
模型 OpenAI CLIP ViT-B/32(open_clip 加载)、Chinese-CLIP ViT-B/16(官方仓库)——预训练模型不计入本项目模型贡献
算力量级 ViT-B/32 CPU 推理约 5–15 张/秒;1000 张 × 6 组提示 ≈ 每组 2–4 分钟,全项目推理 <10 CPU 小时(第 1 周实测校准)
图片查重 perceptual hash(imagehash 库)去重,阈值预登记

6 · 方法路径

  1. 装环境,完成 CIFAR-100 与 Chinese-CLIP 双校验(硬门槛)。
  2. 冻结类目表(40–60 类)与对照类目配对表,预登记判据。
  3. 收集图片:每类 15–25 张,逐张记录来源与许可,phash 去重,第二人抽检 20% 标签。
  4. 跑全部模型 × 提示组合,落盘 logits。
  5. 计算宏平均召回与配对提示效应,检验 H1/H2 前半。
  6. 按 codebook 做错误类型双人标注,检验 H2 后半。
  7. 交叉校验:10 类子集用另一实现(HuggingFace transformers 的 CLIP)复算,logits 偏差应可忽略。

7 · 新颖性边界

  • 本课题声称发现「CLIP 有文化/地理偏差」这一现象——Pouget et al. (2024)、Yin et al. (2024) 已发表,不得声称为本项目发现;也不训练任何模型。
  • 已有工作:GeoDE/Dollar Street 覆盖地理多样性但类目为功能性日用品;Chinese-CLIP 论文只在通用中文基准上评测,未做文化物象细粒度切片;历届丘奖 CelsiaNet(2024 铜奖)是多模态 VLM 框架构建,方向不同。
  • 本项目贡献(主结论):一个许可干净、逐张溯源的中国文化物象零样本评测切片 + CLIP/Chinese-CLIP 差距的量化测绘 + 提示语言可收回比例的因果分解。
  • 价值:为多模态模型的文化覆盖提供可复用的测量工具;若 CLIP 差距很小(H1 否证),则「文化偏差担忧在该类目尺度不成立」同样是有效结论。

8 · 决策门槛(go / no-go)

  • 第 6 周末:图片收集速率核查。若合格图片 <8 类/月 → 具名降级:类目降到 30 类、每类 12 张(类级 CI 拉宽),或改以 GeoDE 中国子集重标注细粒度标签为主、自采图片为补充;测绘框架不变。
  • 第 10 周末:核查许可合规抽检通过率 ≥95%;不达 → 暂停扩量,先修筛选规则(此为合规硬项,无降级)。
  • 第 24 周:若 CLIP 与 Chinese-CLIP 在切片上差距 <5 个百分点且 CI 窄 → 按 H1 否证路径成文,重心移到提示消融与错误类型结构。
  • 选择前提:适合愿意做细致数据工作的学生;图片许可与标注质量是本题的生命线,工作量占全程约 40%。