- Quantity measured
- 对每条可核验声称 c,O(c) ∈ {MATCH_EXACT, MATCH_PARTIAL, NOT_FOUND, INCONCLUSIVE}。设 C_v = {c : 该声称指名了存在公开登记的机关或资格}。CVR = |{c ∈ C_v : O(c) = MATCH_EXACT}| / |C_v|,报 Wilson 95% 区间。INC_rate = |{c ∈ C_v : O(c) = INCONCLUSIVE}| / |C_v|,必须与 CVR 同版面同字号呈现——INC_rate 度量的是我方工具的局限,不是平台的属性。register_lag_window = T1 − T0(天),随任何 NOT_FOUND 结论一并发布。
- Fixed parameters
- T1 − T0 = 21 天(±3 天):给护照通知与登记公布留出可观察的滞后窗口,同时容纳 6–8 周总周期。每个登记至少覆盖 K1、K3 与 K4/K5 三类检索键。检索速率手动或 ≤1 req/s。对照每轮各 2 个(阳性/阴性)。归一化规则(去哪些后缀、如何处理变音符号)在 codebook 中穷举列出,不留裁量空间。
- Sample size
- 每条可核验声称 × 登记阶梯中适用的入口(≥6 个),每平台预计 ≥30 条检索记录;零结果与不适用同样成条。双时点(T0、T1)全量重复。对照 4 个/轮/登记族。20% 检索由第二操作者独立重做。
- Control
- 阳性对照验证流程能命中(防假阴性),阴性对照含一个随机构造的不存在名称(防假阳性与界面'模糊匹配'误导)。两名操作者对 20% 随机抽样的检索独立重做,比较 outcome 一致率作为操作者噪声估计。检索键与登记的组合顺序固定,避免'先搜到就停'带来的选择性。
- Statistical treatment
- 比例(CVR、INC_rate)报 Wilson 95% 区间,样本量小的情况下不使用正态近似。操作者一致率对 20% 重做样本计算并报告。NOT_FOUND 不做任何概率解释——它是一次检索事件的结果,不是关于资格的后验估计。跨平台只并列展示计数,不做显著性检验、不排序:平台间的业务范围与规模差异使得跨平台比较缺乏共同基线。
- Reproducibility check
- 发布每一次检索的完整检索串、入口 URL、UTC 时间戳与快照哈希,第三方可原样重放。对照命中率必须为 4/4,否则该轮作废——这是仪器自校验的硬门槛。两名操作者对 20% 抽样的 outcome 一致率随数据集发布;不一致项逐条列出原因,不做平滑。
- Known pitfalls
- 登记界面默认过滤器往往只显示 active 记录,会隐藏被撤销的历史条目;成员国登记需用本国语言的法人原名检索,用英译名会假阴性;分页有上限导致'看起来无结果';同名多实体不可区分却被记成命中;下载文件与网页界面口径不一致;MiCA 过渡安排期内确实可能尚未出现授权记录;已受监管实体走通知型准入(MiCA 第 60 条一类路径)不会出现在 CASP 授权名单中,只查一个名单必然漏判;把品牌名当法人名去搜(baerx 案例中 FINTRAC 的 Operating Name 未登记品牌名、Website 字段为空,正是这种键失配的典型形态)。
- Risk
- 只用公开检索:不绕过付费墙或登录、不自动化高频抓取;若某登记明示禁止自动化访问则全程手动并在 note 记录。不以客户身份套取机关口径——向机关询问必须表明研究者身份与用途。不检索、不记录、不发布自然人的个人数据明细(住址、出生日期等),即便登记页面上可见。