- Quantity measured
- PVI = 100 × Σ_{i=1..7} w_i·s_i / 4,s_i ∈ {0,1,2,3,4},w = {V1 0.12, V2 0.18, V3 0.22, V4 0.18, V5 0.10, V6 0.10, V7 0.10}(合计 1.00)。门控:V1=0 ⇒ PVI=0;(V2=0 ∨ verifier_theatre) ⇒ PVI ≤40;V3 ≤1 ⇒ PVI ≤60;V4=0 ⇒ PVI ≤55;多条触发取最小上限。一致性:加权 Cohen's κ(线性)与 Krippendorff's α(ordinal),阈值 α ≥0.67 方可直接采用。稳健性:Kendall's τ(主权重排序, 备选权重排序)。不确定度:PVI_interval = [min(PVI_raterA, PVI_raterB), max(PVI_raterA, PVI_raterB)]。
- Fixed parameters
- 评分员 2 名 + 仲裁 1 名;分值域为整数 0–4;权重与门控预注册冻结;α 阈值 0.67;备选权重 3 组;复测 1 轮。全部参数在预注册文件中固定并已打时间戳;事后修改必须升版本并并列公开新旧结果。
- Sample size
- 5 平台 × 7 轴 × 2 评分员 = 70 次独立打分,加若干仲裁条目;敏感性分析 3 组权重 × 5 平台 = 15 次重算;复测 1 轮 × 5 平台。样本单元是"一次 (平台, 轴, 评分员) 打分",一致性统计基于这 70 个单元。
- Control
- 评分员互盲(不看对方评分表);证据包尽可能遮蔽品牌名,遮蔽率如实报告;锚点与权重在见到任何平台数据之前冻结(OTS 时间戳为证);三组备选权重构成对"权重选择"这一编辑判断的敏感性对照;窗口首末双轮复测构成时间对照。
- Statistical treatment
- 轴分为有序分类:报告逐轴 κ 与 α、逐条分歧、仲裁后分数,不对轴分取平均。PVI 为约定合成量:报告点值 + 评分员区间 + 三组备选权重结果,绝不单独报告点值。跨平台比较只在同一版本、同一窗口内进行。n=5 个平台,任何跨平台的推断统计(相关、回归)一律禁止,只做并列展示。
- Reproducibility check
- 发布锚点全文、权重、门控规则、每个 (platform, axis, rater) 的分数及其 evidence_ids、全部分歧与仲裁记录、以及评分合成脚本。第三方拿到同一证据包按同一锚点重打应落入同一等级;我们公开自己的 κ/α 作为该锚点体系可复现性的上界估计——若我们自己两人都对不齐,锚点就不够可复现,这一事实必须与结果同等醒目地发布。
- Known pitfalls
- ①事后调整权重以获得"看起来合理"的排序(预注册 + OTS 时间戳专为封死此路);②把 NC 当 0(凭空制造低分)或把 D0 当 NC(抹掉一个真实结论);③用 PVI 做平台推荐或安全性排名;④评分员受品牌先验影响;⑤把窗口内的等级变化当噪声抹平(必须记 volatility_flag 并并列发布前后结果);⑥只发榜单数字不发向量;⑦跨版本比较 PVI(不同版本锚点与权重不同,数值不可比)。
- Risk
- 全流程中声誉与法律表述风险最高的一步。硬性要求:任何分数必须可追溯到具体 evidence_id;平台在回应窗口内提交的意见必须全文附录;我们自己发现的错误按勘误政策公开更正并升版本号,绝不静默修改。禁止将 PVI 与"安全""可信""推荐"等词并置。