ISEF Topic Scoping 2027

A265–75

犬类偏侧性指标的重测信度:13/45 的一致率意味着什么

推荐优先级:中 · 参赛子类:Animal Sciences — Animal Behavior · 资源需求:一部手机 + 一台笔记本;零器材成本;须接触到足够数量的犬只(收容所/犬舍/公园) · 技能取向:信度统计 / 行为编码 / 观察设计

1 · 研究问题

"狗有惯用爪"这个结论里,有多少来自真实的个体特质,有多少来自单次测量的随机性?要重复多少次试次,才能得到一个组内相关系数(ICC)达到 0.7 的稳定偏侧性指数?

2 · 研究背景与空白

背景。 偏侧性(laterality)指个体系统性偏好使用身体一侧,在人身上就是惯用手。在动物身上它被当作大脑半球功能分化的行为指标,因此"某物种有没有群体层面的偏侧性"是一个有理论含义的问题。但这里有一个测量学前提常被跳过: 要说"这只狗是右爪的",前提是这个属性在同一只狗身上重复测量时稳定;若不稳定,那么"39/60 只狗右爪"这个群体比例测到的不是偏侧性,而是一堆随机硬币的一次投掷结果——一堆公平硬币各投一次,也会有大约一半以上落在同一面上的子集。判断某个量是不是"性状",靠的是重测信度而不是群体比例。心理测量学里对应的工具是组内相关系数(ICC,把总变异分解为个体间变异与个体内变异)与 Spearman-Brown 公式(由单次试次的信度反推达到目标信度所需的试次数)。

已有工作到哪一步。 ANIM010T(2026,Special Award,"Determining Paw Dominance in Dogs")做了一个规模不小的实测:105 只狗,三项任务(站立、行走、取零食),分两组——第一组 30 只收容所犬 + 30 只家养犬,第二组 45 只家养犬。分类规则是三项任务用同一只爪记为"完全右/左爪",两项一致记为"大多右/左爪"。结果:Group 1 中 39/60 只表现右爪优势、21 只左爪优势;而摘要原文同时写着 "Overall, 13 dogs remained consistent across three days, while the rest of Group 2 were inconsistent",以及 "The results supported the hypothesis that most dogs prefer their right paw... however, consistency was not supported"

空白在于前作自己报告了"跨三天一致性不成立"(45 只里只有 13 只一致),却仍然把群体层面的右爪优势当作结论输出——这两句话不能同时为真而不加限定。 没有人把这个矛盾量化过:一致率 13/45 对应的 ICC 是多少?在这个 ICC 下,"39/60" 这个比例有多少可信度?要测几次才够?这个空白适合一年期学生课题的理由是:它可以被设计成完全落入脊椎动物观察豁免的纯观察研究(零合规成本、零器材),核心统计工具是本科水平的方差分解,而且结论正负都成立——ICC 高说明偏侧性确是性状且前作低估了自己,ICC 低说明这一整类犬只偏侧性研究都需要重新报告所需试次数。

3 · 可检验假设

H1 以连续偏侧性指数 LI =(右爪次数 − 左爪次数)/ 总次数 为观测量,单次试次水平的个体内一致性低到使 单次试次 ICC < 0.4;据 Spearman-Brown 公式,达到 ICC ≥ 0.7 所需的最少试次数 N ≥ 5。判据明确:把每只狗的试次随机对半分成两组算相关,再用 Spearman-Brown 外推。

H2(备择/机制假设,H1 被否证时仍有内容)若单次试次 ICC ≥ 0.4,则偏侧性确为可测性状,此时可检验的替代命题是:同一只狗在不同任务类型之间的 LI 相关系数显著低于同一任务内跨天的 LI 相关系数,即"惯用爪"是任务专属的而非全身性的——这会解释前作为何"三项任务全一致"的狗只有 13 只,同时保留偏侧性本身的存在。

4 · 量化验收标准

  1. 方法学校验(硬门槛,不过关不许往下做,后续全部结论无效)。 在开始正式记录前,用已知答案的正对照验证编码流程:先录 20 段视频,由主评分者与一位独立评分者各自盲评(不知另一方结果、不知这只狗此前的记录),要求两人对"哪只爪先动"的判定一致率 ≥ 90%,Cohen's kappa ≥ 0.8。同时把其中 10 段做一次镜像翻转后混入重评,检验评分者是否有左右侧的系统性偏好——镜像翻转后的判定必须严格反号,若不反号则编码流程本身带侧偏,此时全部数据作废,必须先修判据。
  2. 统计口径预先写死——试次是技术重复、狗是生物学重复,只有狗进 n。 每只狗的多次试次不得当作独立样本参与群体比例检验(这是前作那个 39/60 的隐患所在);群体层面的 n 一律等于狗的头数,试次只进入个体内变异项。报告时必须同时写出"n = X 只狗,每只 Y 次试次,跨 Z 天"三个数。
  3. 统计口径预先写死——盲法与评分者间一致性在开测前定死。 主评分者在评一段视频时不得知道该狗此前的任何记录(视频文件重命名为随机码,由第三人保管对照表);≥ 2 位独立评分者对同一批 ≥ 20% 的视频重复评分,报告 Cohen's kappa(两人)或 Fleiss' kappa(三人及以上),kappa < 0.6 的行为指标一律从主分析中剔除,剔除规则在开测前写死。
  4. 样本量与试次数下限。 每只狗每天 ≥ 6 次试次跨 ≥ 3 个不同日期、狗数 ≥ 30 只。理由:ICC 的置信区间宽度主要由个体数决定,30 只是能给出可用置信区间的下限;跨天是把"日内状态"与"个体特质"分开的唯一手段。每只狗的试次数与天数必须配平,缺失需明确记录而非默默剔除。
  5. 主结果的量化形式。 报告:① 单次试次 ICC 及其 95% 置信区间(用双向随机效应、绝对一致性模型,模型选择在开测前定死);② 由 Spearman-Brown 反推的"达到 ICC ≥ 0.7 所需试次数 N";③ 用本课题实测的 ICC 对前作的分类规则做一次模拟重构——按实测的个体内变异生成虚拟数据,看"三项任务全一致"的比例期望是多少,与前作的 13/45 对照。
  6. 可复现性。 全部逐试次原始记录表、随机码对照表(脱敏后)、评分者一致性原始数据、ICC 与 Spearman-Brown 计算脚本开源存档,第三方可一键重跑。原始视频因涉及场地与主人隐私可不公开,但编码后的逐试次数据必须公开。

5 · 数据与工具

用途 来源 / 工具
行为记录 一部手机固定三脚架录像,帧率 ≥ 60 fps。这是本课题唯一必需的硬件,成本可视为零
观察对象 犬只来源须落入观察豁免:公园、犬只活动区等不受限制的公共场所,或经主人同意在其自有场地的自然活动。须核实当地对公共场所拍摄的规定,以及是否需要犬主口头/书面同意
行为编码 人工逐帧判读即可;可用 BORIS(开源行为学编码软件)规范化事件打点。需核实版本与是否支持所需的事件类型
统计 Python(pingouin 的 ICC 实现)或 R(psych::ICC)。ICC 有六种模型,必须在开测前指定用哪一种并写明理由,事后换模型即为挑结果
对照基准(仅用于校验与对比,不计入本项目的数据贡献 ANIM010T 公开摘要中的 105 只狗、39/60 右爪、13/45 跨三天一致;用作模拟重构的对照靶,其任何数字不得写成本项目结果
须核实项 ① 本地是否有可稳定接触到 ≥ 30 只犬的场所(公园高峰时段、犬只活动区、宠物友好商圈);② 收容所犬只是否可用——注意进入收容所并使用其犬只很可能被判定为"操纵动物环境",须提前向 SRC 确认,不得假设;③ 视频中若出现犬主本人,是否触及人类可识别信息——须裁切或模糊,且不得记录任何个人可识别数据,否则观察豁免的第 3 条前提被破坏
不可用路径(已排除) 取物/零食任务——给狗零食即构成与动物互动,直接失去观察豁免,须走 Form 5A + SRC 事前批准(2–6 周),与净窗口冲突。任何自制装置(门槛、迷宫、爪印板)都属于"操纵动物环境",同样出局

6 · 方法路径

  1. 建体系并完成 §4 第 1 条校验。 定死行为判据(哪些动作算一次可计数试次、"先动的爪"如何界定到帧、什么情况判为无效试次),录 20 段试拍视频,跑通双评分者盲评并达到 kappa ≥ 0.8 与镜像反号检验。这一步不过不许继续——判据不稳的话后面所有 ICC 都只是在测评分噪声。
  2. 核实观察设计的能力边界,逐条实测下列静默失败点:观察者预期偏差——评分者若记得"这只狗上次是右爪",判定会向该方向漂移,且完全不自觉,因此必须靠随机码 + 盲评封死;② 个体非独立——同一场地、同一时段的多只狗常来自同一群体或同一犬舍,行为相关,不得当作完全独立样本,须记录场地与时段并在模型中作为随机效应;③ 采样频率低于行为时长——起步动作可能只持续 100–200 ms,30 fps 录像会漏判先后顺序,必须实测确认所用帧率足以分辨,这是最典型的"不报错但给错结果";④ 删失与选择性记录——狗走到一半停下、被打断的试次若随手丢弃,会系统性剔除掉"犹豫"的那类试次而抬高一致性,无效试次必须记录并计入分母的统计说明;⑤ 昼夜与场地混杂——早晚时段的犬只活跃度不同,若某些狗只在特定时段被观察,时段效应会被误读成个体差异。
  3. 完成正式观察,逐试次落盘。 每只狗每天 ≥ 6 次、跨 ≥ 3 天、≥ 30 只。跨天数据是本课题不可替代的部分,缺了它 ICC 无法分离"个体特质"与"当天状态",且事后无法补做——所以第一优先级是把每只狗的跨天数据凑齐,而不是把狗的数量堆高。
  4. 完成盲法复评。 ≥ 20% 的视频交由独立评分者重评,算 kappa 并按预定规则剔除不达标指标。涉及主观判断的每一处(无效试次判定、动作起始帧)都须给出明确、可复现的判据并写入编码手册,手册随数据一同公开。
  5. 计算 LI、ICC 与 Spearman-Brown 所需试次数,给出置信区间;同时把前作那套"完全/大多右爪"的离散分类规则应用到本课题数据上,看它相比连续 LI 丢掉了多少信息。
  6. 做前作结果的模拟重构。 用本课题实测的个体内/个体间变异做参数化自助抽样,生成虚拟的"105 只狗 × 三任务"数据,看"三项全一致"的期望比例落在哪里,与 13/45 对照。这一步是把两条摘要句子的矛盾变成一个数的关键动作。
  7. 独立交叉校验:用另一种方法算同一个量。 用完全不同的统计路径重算个体稳定性——对每只狗的试次序列做二项检验(H₀:p = 0.5),统计"显著偏离 50/50 的狗的比例",与 ICC 路径给出的结论对照。两条路径若给出相反的图景,说明其中一条的模型假设被违反,须查清楚再下结论。

7 · 新颖性边界

本课题不声称: - 不声称首次研究犬类偏侧性。这是一个有既有文献的领域,学生必须自行补检索。 - 不声称发现"多数狗偏好右爪"。 这是 ANIM010T(2026,Special Award)在 105 只狗上报告的结果(Group 1 中 39/60),不得写成本项目发现。 - 不声称 ANIM010T 的观察是错的。它自己已经报告了一致性不成立,本课题做的是把它那句自承量化,不是推翻它。 这个姿态在答辩时必须讲清楚:前作诚实地写下了矛盾,本项目接着往下算。 - 不对犬只大脑半球功能分化做任何声称——本课题只测行为的重测信度,不涉及神经机制。

已有工作做到哪: ANIM010T(2026,Special Award)在 105 只狗上用三项任务(站立、行走、取零食)做了偏侧性分类,报告 Group 1 中 39/60 只右爪优势、21 只左爪优势,并明确写下 Group 2 中"13 dogs remained consistent across three days, while the rest ... were inconsistent"及"consistency was not supported"。它没有报告 ICC、没有报告评分者间一致性、没有把离散分类换成连续指数、没有给出达到稳定测量所需的试次数。

本项目的贡献(属「评价维度转换」型): 已有工作评估的是群体层面有多少比例的狗偏好某一侧;本项目评估的是这个被当作性状报告的量本身有多少信度、要测几次才算测到了它。这是主结论,交付物就是那个 ICC 与那个"所需试次数 N"。

为什么有价值: 犬类偏侧性被用作动物福利与工作犬选拔的行为指标,"要测几次"这个数直接决定这类评估的可用性;而目前任何看到"39/60 只狗右爪"的人都无法判断这句话有多少信息量。

若结论不显著: 若实测 ICC 高、H1 被否证,说明偏侧性确是稳定性状而前作的不一致来自任务差异而非测量噪声——这同样是有效结论,且直接引出 H2。但必须给出误差棒证明有能力分辨这个差异:ICC 的置信区间若宽到跨越 0.4 与 0.7,那就是样本量不足,不叫"信度高"。

8 · 决策门槛(go / no-go)

🟡 条件 1(第 6 周末,即 2026 年 9 月中旬):完成编码校验(kappa ≥ 0.8 + 镜像反号)并确认可稳定接触到 ≥ 30 只犬。 若 kappa 达不到 0.8,立即降级: 说明"先动的爪"这个判据本身模糊,降级路径是改用一个判定更硬的观察量——例如卧姿时压在上方的前爪(静态、无需分辨毫秒级先后)或自发转身方向(左右二分明确)。主结论框架完全保留(仍是"这个偏侧性指标的重测信度是多少、要测几次"),只是换了承载指标。 若接触不到 30 只犬,立即降级: 改为减少狗数、增加每只狗的试次与天数(例如 15 只 × 每天 10 次 × 5 天)。ICC 的个体内变异估计靠试次数,个体间变异估计靠狗数;狗少会让置信区间变宽,但主结论(所需试次数 N)仍可给出,只是须在结论中显式声明置信区间宽度这一限制。

🔴 条件 2(第 12 周末,即 2026 年 10 月底):每只狗的跨天数据必须已经凑齐 ≥ 3 天。 这是本课题唯一不可逆的时点。跨天数据无法事后补做——公共场所遇到的狗大多不会再遇到第二次,因此从第一天起就必须把"能否再次遇到同一只狗"作为纳入标准,而不是先收一大堆单次观察再回头找。这条必须写进研究计划。

⚠️ 与「附属赛后不得修改」的冲突点: 三件事一旦在附属赛后想改就不被允许——① 行为判据与无效试次的剔除规则;② ICC 的模型选择(六选一);③ kappa < 0.6 剔除指标这条阈值。必须在 11 月底前定死并写入研究计划,因为它们都能显著改变最终报出的 ICC。

须提前核实而非边做边发现的事项: - 本方向未做外部文献核查,"未找到前作"不等于"不存在前作"。 犬类偏侧性的重测信度很可能已有正式文献,学生必须在开题前自行补检索。若已有前作,课题不作废——定位从"首次量化"改为"在独立样本与更严的盲法下的独立复核",并在研究计划中列表说明与前作的差异。评委自己发现而学生没提,项目直接出局。 - 观察豁免的边界必须在开始前向附属赛 SRC 书面确认,不能自行判断。 规则的豁免条件是"与被观察动物无互动、不以任何方式操纵动物环境";给食物已经算互动。收容所场景、要求主人配合让狗走某条路线、在地上放置任何标记物,都可能被判定为操纵环境。判断权在 SRC 不在学生,必须事前问。 - 手机帧率是否足以分辨起步先后。必须实测,不能假设 30 fps 够用。

已知困难及其定位: 最大的困难是"同一只狗要能被重复遇到 ≥ 3 天"。这个困难本身就是研究内容的一部分——它正是前作只有 45 只狗做了跨天、且其中仅 13 只一致的原因;本课题把"重复测量的可获得性"当作设计约束显式处理,而不是假装它不存在。

选择前提: 适合能长期规律地在同一场地观察、且能接受"主结论可能是一个方法学否定结果"的学生。不适合想和动物互动的学生——本课题的核心合规策略正是全程不接触、不投喂、不布置任何装置;也不适合需要实验装置类展板的学生。

预算裁剪顺序: 零预算,无可裁。时间不足时的裁剪顺序为:先砍第 7 步(二项检验交叉校验),再砍第 6 步(前作模拟重构),再把狗数从 30 降到 20(不得低于 15,否则 ICC 置信区间宽到无法解读)。砍到只剩第 1–5 步时主结论(ICC + 所需试次数)仍完整成立。

合规与表格: - 脊椎动物红线: 犬是脊椎动物。规则要求不得死亡、不得超过瞬时或轻微疼痛、毒性研究全面禁止、体重下降上限 15%——本课题全部不触及,因为它不做任何处置。唯一豁免是"行为观察研究、与动物无互动、不以任何方式操纵动物环境",本课题的整套设计(不接触、不投喂、不放置任何物品、只在不受限制的公共场所拍摄)就是为了落进这个豁免。注意:给狗一块零食就已经算互动,会立即失去观察豁免,这也是本条必须放弃前作那项取物任务的原因。 - 若最终无法落入观察豁免(例如 SRC 认定接触犬主安排犬只属于操纵环境),则须走 Form 5A(脊椎动物-非 RRI)+ SRC 事前批准,且 SRC 须含兽医或有该物种经验的照护者。该审批需 2–6 周,必须从 2026 年 8 月起算的 3–4 个月净窗口里显式扣掉——扣完只剩约 2–3 个月,跨天数据的凑齐难度陡增。因此第 6 周末的条件 1 必须包含"豁免资格已获 SRC 书面确认"。 - 不触发 PHBA: 无生物制剂培养、无组织、无体液采样,因此不需要额外扣除 PHBA 的 2–6 周 SRC 事前审批。家中禁止培养任何潜在危险生物制剂(规则点名连 BSL-1 与 C. elegans 都不行)这一条与本课题无关。 - 人类受试者边界: 只要视频中不记录任何个人可识别数据、不与犬主做任何为研究目的的问询(包括"你家狗几岁"这类),就不构成人类受试者研究。一旦向犬主收集任何信息(年龄、品种、训练史),即触发 Form 4 与 IRB,且 IRB 必须在招募动作之前批准;2027 版还一律禁止向受试者反馈数据或给出任何建议。本课题的设计是完全不问、不收集,从而不触发。 - 须填表格: Form 1、Form 1A(含研究计划,须写明脊椎动物观察豁免的依据)、Form 1B、Form 2A(2027 新增,所有项目必填)Form 3(风险评估:户外观察的场地风险与犬只接近风险)、Abstract(实验后)。若豁免不成立则追加 Form 5A。 - 展台: 禁活体、液体(含水)、土壤、玻璃。本课题展台靠 ICC 曲线图、Spearman-Brown 外推曲线、评分者一致性矩阵与观察场景照片撑起;犬只照片须确认不含可识别的人。 - AI 政策: 不得用生成式 AI 撰写研究计划、摘要、展板或生成引文;ICC 与自助抽样脚本若由 AI 生成,须显式引用并保留提示词日志。

评分: O=6, W=8, F=8, S=5, Fit=9 → base=70.4,h=5 → [65, 75],置信度:高