- Quantity measured
- 单条目编码结果为四元组 (s, 元数据向量 m, evidence_id, rule_ids);本步骤不做任何合成计算。单调性校验:∀ i,平台 p, 波次 w:s_full(i,p,w) ≥ s_pre(i,p,w),违反数记为 monotonicity_violations(目标 0)。
- Fixed parameters
- 条目主序编码(偏倚控制);随机种子公开(可复现的顺序);摘录上限 25 词(版权合理引用与足够定位之间的取舍);<30 秒的 2 分编码触发抽查(基于校准阶段观测到的最短合理判定时长);两个视图强制单调(构念上 full 语料是 pre 语料的超集)。
- Sample size
- 测试集:5 平台 × 58 条目 × 2 视图 × 2 波次 × 2 评分员 = 4,640 条编码记录(wave2 只重编在 P01 中 SHA-256 发生变化的页面所涉条目,其余沿用并标注 carried_forward=1,实际编码量约 3,000 条)。一致性扩展集:7 平台 × 58 条目 × 1 视图 × 1 波次 × 2 评分员 = 812 条。合计 IRR 可用单元数 = (5+7) × 58 = 696 个 (平台×条目) 单元(pre 视图 wave1),足以支撑整体 α 及各维度 α 的区间估计。
- Control
- 控制变量:同一条目由同一名评分员在同一时段完成全部平台,避免跨日标准漂移;两名评分员使用相同的冻结语料(corpus_manifest),任何一方都不得临时补抓;编码工具不显示任何汇总分、不显示对方编码、不显示平台在其它维度的表现。full 视图证据由账户持有人统一去标识化后同时提供给两人,避免'谁有账户谁多看到'的信息不对称。
- Statistical treatment
- 本步骤只做数据质量统计:单调性违规数(应为 0)、缺失码分布、每条目平均编码时长与四分位、found_at_step 分布(识别高漏检风险条目)、异常快编码抽查通过率。分值的统计处理留给 P04/P07。
- Reproducibility check
- 随机顺序种子、每条目的预定义检索关键词、固定检索顺序、两名评分员的完整原始编码(不只是共识值)全部发布。第三方可以在同一批归档快照上重做编码并与我们的 R1/R2 逐条比对,差异集本身就是对量表清晰度的检验。工具自校验:编码工具内置单调性校验、必填字段校验、evidence_id 外键校验,三项在提交时硬拦截。
- Known pitfalls
- 最常见的失败模式是把 0 和 NA 混用,会同时污染分子和分母,因此工具强制 NA 必填理由;其次是把登录后看到的内容误记进 pre 视图(尤其当评分员浏览器保持登录态),必须用独立的干净配置文件做 pre 视图编码;再次是评分员为省时用站内搜索直接跳到答案,导致 depth 全部记 7,因此 found_at_step 与 depth 分离记录并抽查;最后是 wave2 的 carried_forward 被滥用,规则是只有 HTML 哈希完全未变才可沿用。
- Risk
- full 视图只使用团队自有实名账户,截图前必须遮蔽姓名、地址、账号、余额、交易记录与任何可识别个人的信息;去标识化后的证据才可进入数据集。不得为获取更多可见内容而提升账户等级到需要额外提交敏感证件的层级。不得在编码期间与平台客服套取未公开信息后计入完整性主分(此类答复只作补充证据单列)。