DOCUMENTARY RESEARCH / EN-IE7 EVIDENCE RUNS · PUBLIC EVIDENCE REVIEWED
AXIALPROOF / RESEARCH LAB

MEASUREMENT SPECIFICATION

披露完整性评分体系

用一套冻结版本的 58 条目量表,把"某中心化加密平台在其自有公开面上就法律主体、牌照及其法律含义、费率、托管、储备证明、安全控制、条款风险这七个域说了什么、说得多具体、能否被定位"转成两名评分员独立打分即可复现的数值向量,并同时量化该数值本身的评分员间一致性与不确定度。

METRIC ID
AXP-DISC-v1
PROCEDURES
9
RECORDED FIELDS
122
DATASET
NOT COLLECTED
DATASET / NOT COLLECTED

This page publishes a measurement specification, not results. No figure on it was produced by running the protocol against any venue. When a dataset exists it will be released separately, versioned against the metric identifier above, with the raw responses and their checksums attached.

RATIONALE

WHY THIS NEEDS A STANDARD

现有"透明度评分""信任分"几乎全部不可复现:量表条目不公开、锚点靠形容词("清晰""充分")而非可判定的必需成分、单人打分、没有一致性检验、没有捕获时间戳,因此换一个人或换一天重做会得到不同数字,读者无法判断分差是平台差异还是评分员差异。更严重的是三类构念混淆:(1) 把"披露完整"混同为"陈述属实";(2) 把"取得某项注册"混同为"受该项监管保护";(3) 把登录墙后才可见的内容与签约前可见的内容合并计分,掩盖了"签约前用户其实看不到"这一事实。AXP-DISC-v1 的价值不在于给平台排名,而在于把"可核对性"本身做成一个带公差的仪器读数:分数只回答"是否可被第三方定位并核对",并把"平台自述与官方登记记录的文本一致性"拆成独立子指标,绝不与完整性合成。欧盟语境下这尤其必要——MiCA 对 CASP 的信息与费用政策公开有明确要求(具体条款以欧盟官方文本为准),但监管要求的是"披露"这一行为,能否核对、核对后是否属实,是三件不同的事,本基准只测第一件并明确划界。

OUTPUT

WHAT GETS PUBLISHED

发布两件互相绑定的东西。其一是方法页 /methodology/disclosure(AXP-DISC-v1):构念定义与它明确不测什么、7 维度 58 条目全表(题干 + 必需成分 + 0/1/2 锚点)、12 条边界案例规则全文、pre/full 双视图设计与其理由、权重向量 ω 及其编辑判断依据与三种权重方案对照、全部公式(DCS/GAP/VOL/ACC/CUR/FID/MRD/α)、评分员资格认证与一致性检验的完整结果(含未达阈值的维度及其降级处理)、裁决影响度、两类不确定度区间的含义区分、语料边界与已知局限清单、伦理与法律红线、v1.1 修订待办(退役条目 + AD4 记录 + 高漏检风险条目)。方法页首屏固定展示四项标识:metric_id、捕获窗口 UTC、codebook SHA-256、MANIFEST SHA-256。其二是开放数据集 axp-disc-v1(CC BY 4.0,代码 MIT/Apache-2.0):platforms.csv、codebook_v1.csv、edge_rules.csv、corpus_manifest.csv、evidence.csv(URL + 哈希 + 归档链接 + ≤25 词摘录 + 定位符)、codings.csv(两名评分员的完整原始编码,不只是共识值)、adjudication_log.csv(裁决全文与所依规则号)、consensus.csv、claims_register.csv(平台原文与登记记录原文逐条对照)、irr.csv、scores.csv、errata.csv,外加 MANIFEST.sha256、datapackage.json、requirements.txt、README、以及一条命令的复现包(含'只用 R1'/'只用 R2'的反向复现开关)与 P02 的合成披露页及其金标准。完整页面捕获包因第三方著作权不整体再分发,按请求逐案提供,留存政策写入 README。

PREREQUISITES

What must exist before a single measurement is taken.

A benchmark that skips these produces numbers, not evidence. Every item is a precondition of the protocol, not a recommendation.

P-01

条目库(codebook)v1 必须在任何生产编码开始之前冻结:58 条目的题干、必需成分(required elements)、0/1/2 锚点、12 条边界案例判定规则、7 个维度权重向量 ω 全部写入 codebook_v1.csv,计算 SHA-256 并把哈希连同冻结时间(UTC)公开发布。编码开始后任何条目或锚点改动一律触发版本号递增(v1.1 / v2),不得回改 v1 数据。

REQUIRED
P-02

人员:至少 2 名独立评分员(R1、R2)+ 1 名仲裁员(A)。仲裁员不参与生产编码,只负责合成校准页制作、资格认证判定与分歧裁决。3 人不得在编码窗口内互相讨论具体平台,也不得阅读姊妹刊物已发布的相关平台评测。

REQUIRED
P-03

评分员资格认证通过:在校准集上与金标准编码的线性加权 κ ≥ 0.75,且在合成披露页上对已知植入要素的定位召回 ≥ 0.90。

REQUIRED
P-04

捕获工具链:可保存 HTTP 响应体+响应头、整页 PNG(视口宽 1440 与 390 各一)、打印 PDF,并对每个产物计算 SHA-256;一台可稳定访问目标站点的机器(使用团队真实所在地区的网络出口,禁止用 VPN/代理伪装成其它司法辖区)。

REQUIRED
P-05

存储与清单:约 20–40 GB 本地存储 + 一份异地备份;MANIFEST.sha256 与 datapackage.json(Frictionless Data Package 规范)随数据集一同发布。

REQUIRED
P-06

官方登记库访问清单:目标平台自称的每一项注册/牌照对应的官方查询入口(如加拿大 FINTRAC MSB 登记查询、各国公司登记处、欧盟/成员国 CASP 或 VASP 登记册)。部分登记处按次收费,预留 €0–150。

REQUIRED
P-07

full 视图(登录后)编码所需账户:优先复用本刊其它基准已开立的自有实名账户;确需单独开户时每平台最低入金 €20–50、合计上限 €250,且必须在数据集中标注哪些条目依赖此账户。禁止使用他人证件、他人银行账户或共享账户。

REQUIRED
P-08

语言处理流程:目标站点若无 en-IE/en-EU 版本,须记录实际使用的 locale,并在使用机器翻译时保留原文 + 译文 + 人工复核签字,翻译差异写入 note 字段。

REQUIRED
P-09

伦理与法律清单签署:仅访问公开或自有账户内的页面;抓取遵守 robots.txt;单并发、≤2 请求/秒;收到 429/403 立即停止并改为人工浏览;不做任何渗透测试、撞库、绕过登录或付费墙的尝试;不注册虚假身份。

REQUIRED
P-10

分析环境:Python 3.11+ 与固定版本依赖清单(requirements.txt 随数据集发布),一致性统计的实现必须先在 Krippendorff 原著公开示例数据上复算出与原文一致的 α 值,该复算作为单元测试随代码发布。

REQUIRED

PROTOCOL

9 procedures, each with its own evidence boundary.

Every procedure states what its output can support and what it cannot. The second of those is the one that keeps a measurement honest.

AXP-DISC-v1-P01

披露面边界界定与双波次证据捕获

  1. 界定'披露面'(disclosure surface):计入 = 平台官方主域及其明确链接的法律/费率/帮助子域页面、官方 PDF、官方帮助中心、官方 API 文档中的费率与安全章节、官方状态页、官方应用商店列表说明文本。不计入 = 社交媒体帖文、Telegram/Discord 聊天、第三方媒体稿、联盟营销落地页、一对一客服答复(后者另存为补充证据,不进入完整性主分)。边界必须先写死,因为它直接决定分数。
  2. 建立起点:从团队真实所在地区(IE/EU 出口)访问平台首页,记录被自动重定向到的 locale 版本与 URL,该版本即本次测量的'本地化首页'。若平台按地区提供不同实体/不同条款,以 EU/EEA 用户实际落地的版本为准,其它版本仅作 note。禁止用 VPN 切换地区来'找到更好的版本'。
  3. URL 发现三路并行并记录来源:(a) 从本地化首页出发的站内链接图,广度优先,最大深度 6;(b) sitemap.xml / robots.txt 声明的 URL;(c) 站内搜索(针对条目库中的关键词,如 'fee schedule'、'proof of reserves'、'custody'、'registration')。每个 URL 记录 discovery_mode ∈ {nav, sitemap, site_search, external_index} 与最小点击深度 depth;仅通过站内搜索命中的页面 depth 记为 7。
  4. 抓取参数固定:单并发、请求间隔 ≥0.5 s(≤2 req/s)、遵守 robots.txt、User-Agent 写明研究项目名与联系页 URL。任一 429/403/503 → 立即停止该域抓取,改人工浏览器逐页保存,并把中断时间与状态码写入 capture_log。
  5. 每个页面保存四件产物:HTTP 响应体、响应头、整页 PNG(1440 宽与 390 宽各一)、打印 PDF;逐件计算 SHA-256;记录 capture_utc(ISO 8601)、最终 URL(跟随重定向后)、HTTP 状态码。
  6. 独立时间戳:把每个进入计分的关键 URL 提交到公共网页归档服务生成快照,把归档 URL 写入 evidence.csv 的 archive_url。这样第三方无需索取我们的文件即可核对'当时页面确实是这么写的'。
  7. 分两个波次捕获:wave1 = T0;wave2 = T0 + 21 天(±3 天)。wave2 必须重跑完整的 URL 发现流程,而不是仅重抓 wave1 的 URL 列表,以捕捉新增或删除的页面。
  8. 登录后(full 视图)内容由持有账户的单一成员用浏览器人工保存,只保存自有账户可见页面,截图前遮蔽账号、余额、姓名、地址等个人信息;不得使用自动化脚本抓取登录态页面。
  9. 为每个平台生成 corpus_manifest.csv:URL、depth、discovery_mode、view、http_status、四件产物的 sha256、archive_url、capture_utc。该清单是后续所有编码的唯一可引用语料,编码期间禁止临时补抓(确需补抓则记为 wave1b 并写明原因)。
Quantity measured
corpus_coverage = 进入计分的 URL 数 / corpus_manifest 中该平台可达 URL 总数;页面留存率 retention = |URL(wave1) ∩ URL(wave2)| / |URL(wave1)|;内容变更率 churn = 在两波次均存在但 SHA-256(html) 不同的 URL 占比。
Fixed parameters
最大爬取深度 6(第 7 层收益递减且深度已作为可达性变量单列);请求速率 ≤2 req/s、单并发(低于常见 CDN 阈值,避免触发防护并降低对平台的负担);两波次间隔 21 天(长于多数平台的周度页面维护周期、短于 6–8 周项目窗口,能测出波动又不拖垮进度);视口 1440 与 390(桌面与手机,因为部分平台在移动版隐藏费率表);PDF 打印用于保留可能在滚动中懒加载的内容。
Sample size
测试集 5 个平台(baerx.io、Coinbase、Kraken、Crypto.com、Binance)× 2 波次 × 2 视图(pre/full);另加 7 个仅用于一致性检验的扩展平台,只做 pre 视图、只做 wave1。预计每平台 pre 视图 120–400 个 URL、full 视图 20–60 个页面。
Control
同一平台的两个波次必须由同一名成员、同一台机器、同一网络出口、同一浏览器版本执行,浏览器版本号写入 capture_log;变量若被迫改变(如浏览器自动升级)必须记录并在分析时作为潜在混淆项标注。跨平台之间抓取顺序随机化,避免'先抓的平台被抓得更细'。
Statistical treatment
corpus_coverage、retention、churn 三个比率各报点值与 Wilson 95% 置信区间(比例小样本下比正态近似稳健)。churn 只描述'页面变了',不推断变的方向,方向由 P07 的 VOL 指标处理。
Reproducibility check
第三方拿到 corpus_manifest.csv 后可做三件事:(1) 用 archive_url 打开归档快照,自行核对我们引用的原文;(2) 重跑同样的发现规则,比较自己得到的 URL 集合与我们的差集;(3) 对我们发布的证据摘录逐条比对页面定位符(CSS selector 或页码+段号)。我们额外发布捕获脚本与其依赖版本清单。仪器自校验:在一个团队自建、内容已知的静态页面上跑一遍全流程,确认 depth、discovery_mode、哈希与归档链接均按预期产生。
Known pitfalls
最常见的错误是把 A/B 测试或个性化页面当成稳定披露——同一 URL 对不同会话可能返回不同费率表,因此每次捕获必须用全新的干净浏览器配置文件并记录;其次是把 CDN 缓存的旧版本当成当前内容,需比对 response header 中的缓存字段;再次是懒加载表格在 HTML 里为空,必须用整页截图与 PDF 交叉核对;最后是把地理封锁误读为未披露,403/451 必须单列。
Risk
抓取必须温和:≤2 req/s、单并发、遵守 robots.txt、UA 可识别并附联系方式,429/403 即停。不得尝试绕过登录、付费墙、地区限制或人机验证。不得用 VPN 伪装成其它辖区去获取更宽松的条款版本。登录态页面只由账户持有人手工保存,截图必须遮蔽个人信息与账号余额。全程不触碰他人账户与他人证件。

SUPPORTS / 能确立:在指定 UTC 时间窗内,从指定地区出口访问该平台时,哪些 URL 存在、返回了什么内容、需要几次点击才能到达、两次捕获之间页面是否变化。所有后续评分都可回溯到一个带哈希与独立归档时间戳的具体产物。

DOES NOT SUPPORT / 不能确立页面内容是否属实,不能确立平台在其它地区/其它时间/其它设备上呈现什么,也不能确立未被发现的页面不存在——爬取只能证明'我们按这套规则找到了这些',不能证明'平台没有别的说明'。robots.txt 屏蔽或限频导致的缺失必须作为语料局限公开,不得当作平台未披露。归档快照只能证明该时刻页面如此,不能证明平台此前从未有过不同表述。

RECORDED FIELDS (13)
  • platform_id / 字符串 / 稳定短标识,如 baerx / coinbase;一经分配不得复用
  • url_requested / URL / 请求的原始 URL
  • url_final / URL / 跟随重定向后的最终 URL
  • locale_served / BCP-47 / 实际返回的语言/地区版本,如 en-IE、en-GB、en
  • view / 枚举 pre|full / pre = 免登录可读;full = 自有账户登录后可读
  • wave / 枚举 w1|w1b|w2|wR / wR 为右答复期后的补充波次
  • depth / 点击数(整数) / 从本地化首页出发的最小点击数;仅站内搜索可达记 7
  • discovery_mode / 枚举 / nav|sitemap|site_search|external_index
  • http_status / 整数 / 最终响应状态码
  • sha256_html / sha256_png1440 / sha256_png390 / sha256_pdf / 十六进制 64 字符 / 四件产物各一;缺失产物填 null 并在 note 说明原因
  • archive_url / URL / 公共归档快照地址;提交失败填 null 并记录失败原因
  • capture_utc / ISO 8601 UTC / 精确到秒
  • rate_limit_event / 布尔 + 状态码 / 是否触发限频及当时状态码,用于说明语料可能不完整
SPECIFICATION
AXP-DISC-v1-P02

条目库操作化、边界规则与评分员资格认证

  1. 固定 7 个维度与 58 个条目(v1)。LEG 法律主体 8 条:LEG-01 合同相对方法律全称、LEG-02 公司注册号与注册地、LEG-03 完整注册地址、LEG-04 品牌与运营实体及集团结构、LEG-05 服务 EU/EEA 用户的具体实体、LEG-06 法律送达与投诉受理入口、LEG-07 任一具名负责人(董事/高管/合规官)、LEG-08 LEI 或其它全局标识符(无则是否说明)。
  2. LIC 牌照与其法律含义 9 条:LIC-01 声称的注册/牌照名称与颁发机构、LIC-02 可在官方库检索的编号、LIC-03 该注册覆盖的业务范围、LIC-04 地域适用范围、LIC-05 该注册的法律含义与不覆盖范围的显式说明(例如'注册不等于牌照或背书')、LIC-06 官方登记库直链或检索指引、LIC-07 未取得的许可类别的明示(如证券类)、LIC-08 用户资金是否受任何赔偿/保障计划覆盖及上限(或明示不受)、LIC-09 注册状态的日期/有效期/最近更新。
  3. FEE 费率 9 条:FEE-01 现货 maker/taker 费率表与档位、FEE-02 档位计量口径(统计窗口、含哪些产品、结算时点与时区)、FEE-03 充值费用按资产/网络分列、FEE-04 提现费用按资产/网络分列及浮动规则与更新频率、FEE-05 法币出入金费用按通道分列及第三方通道费归属、FEE-06 汇率/点差政策(是否在汇率中加价、如何计算或上限)、FEE-07 非交易费用(不活跃费、账户费、转换费、最低提现额)、FEE-08 衍生品/杠杆/理财费用与资金费率规则(若提供)、FEE-09 费率变更的通知方式与提前期。
  4. CUS 托管 8 条:CUS-01 用户资产的法律性质与破产情形下的处置表述、CUS-02 与自有资产的分离及方式、CUS-03 托管人身份(自托管或具名第三方)、CUS-04 冷热钱包结构与比例政策、CUS-05 保险安排(承保人、范围、限额、是否覆盖个人账户)、CUS-06 是否将用户资产用于放贷/质押/再抵押及条件、CUS-07 法币资金存放方式与是否受存款保障、CUS-08 提现暂停或延迟的触发条件与告知机制。
  5. POR 储备证明 7 条:POR-01 是否发布及类型(Merkle PoR / 审计 / 第三方鉴证 / 仅声明)、POR-02 覆盖资产范围与快照频率、POR-03 负债端构成与是否经第三方核验、POR-04 用户自查机制(叶子与路径校验工具、能否离线验证)、POR-05 链上地址清单或地址控制权证明方式、POR-06 执行方名称、报告可获取性、报告类型与所依准则、POR-07 局限性声明(不覆盖什么、时点性)。
  6. SEC 安全控制 8 条:SEC-01 认证选项(2FA 类型、硬件密钥/passkey)、SEC-02 提现安全控制(白名单、冷却期、默认开关状态)、SEC-03 会话与设备管理、SEC-04 API 密钥权限模型与 IP 白名单、SEC-05 事故/漏洞披露政策与历史事件页、SEC-06 负责任披露或赏金渠道、SEC-07 第三方安全审计的存在、范围与日期、SEC-08 用户损失的责任分配与赔付条件表述。
  7. TRM 条款风险项 9 条:TRM-01 条款版本号/生效日期/历史版本可得性、TRM-02 单方变更机制与通知期、TRM-03 冻结/关闭/扣留资产的触发条件与救济路径、TRM-04 适用法律与管辖地、是否强制仲裁或集体诉讼弃权、TRM-05 责任限制与免责范围、TRM-06 自营/做市/关联方交易的利益冲突披露、TRM-07 下架/分叉/空投/清算处理规则、TRM-08 数据保留期、跨境传输与 GDPR 权利行使入口、TRM-09 争议解决与外部投诉渠道(监管投诉/ADR/ODR)。
  8. 为每个条目写死'必需成分'与三级锚点:0 = 在冻结语料中检索不到对该要素的任何陈述;1 = 提到该要素但缺少判定所需的具体成分(数值、条件、责任方、时点、限定范围中的任一项);2 = 包含该条目列出的全部必需成分,且可在单一定位(URL + 页内定位符)读到。示例(FEE-04):必需成分 = {按资产或网络分列的具体数额或计算式、计价单位、是否随链上费浮动、浮动时的更新频率或口径};四项齐全记 2,只写'提现需支付网络费'记 1,全站检索不到记 0。
  9. 写死 12 条边界案例规则并编号,编码时必须引用规则号:R1 多处出现且内容冲突 → 取 depth 最小处计分并置 conflict=1,冲突对照存证,冲突本身不降完整性分(避免与'矛盾'构念混同),单列 conflict_rate;R2 仅出现在 FAQ 而条款缺失 → 仍按语料内计分;R3 含'可能/通常/一般/视情况'导致数值不确定 → 上限 1;R4 单边表述('低至'/'最高')→ 上限 1;R5 需下载 PDF 才可见 → 不降完整性分,depth +1;R6 本地化版本与原语言版本内容不一致 → 以用户实际落地版本计分,差异入 note;R7 文字在图片中(无可选中文本)→ 照常计分,须附截图与人工转录并置 text_in_image=1;R8 仅站内搜索可达 → 照常计分,depth=7、discovery_mode=site_search;R9 链接存在但 404/403 → 该要素计 0 并置 broken_link=1;R10 该业务线不存在 → NA_NOT_APPLICABLE 并填理由码;R11 外链到第三方条款且平台未复述关键数值 → 上限 1(构念是平台自身披露);R12 同一句话满足两个条目 → 允许同时计入,evidence_id 相同,不做去重。
  10. 制作校准集:3 个不在测试集内的平台(真实语料)+ 1 份由仲裁员自建的合成披露文本(明确标注为测试夹具、绝不作为任何平台的数据发布),其中植入 12 个已知完整要素、6 个已知缺失要素、4 个已知模糊表述。仲裁员先独立产出金标准编码并封存。
  11. 资格认证:R1、R2 分别对校准集独立编码,与金标准计算线性加权 κ。合格线:加权 κ ≥ 0.75 且在合成页上对已知植入要素的定位召回 ≥ 0.90。未达线者由仲裁员逐条讲评分歧、修订边界规则说明(不改锚点定义)后重测一轮;两轮不过者不参与生产编码。
  12. 冻结:把 codebook_v1.csv、边界规则表、权重向量 ω、校准结果一并计算 SHA-256 并公开发布时间戳。此后编码期内不得修改任何条目定义;确需修改则冻结 v1 数据、开 v1.1。
Quantity measured
线性加权 κ_w = 1 − Σ w_ij·O_ij / Σ w_ij·E_ij,其中 w_ij = |i−j| / (k−1),k=3(0/1/2 三级);定位召回 = 正确定位的已知植入要素数 / 12。
Fixed parameters
三级锚点而非五级或七级:级数越多分辨力越高但一致性越差,0/1/2 对应'无/有但不具体/具体'三个语义上可判定的状态,是在一致性与信息量之间的显式取舍,并在 P04 用 α 检验这一取舍是否成立。资格线取 κ_w ≥ 0.75(介于常用的 0.61 尚可与 0.81 优秀之间,对训练成本可达)。合成页植入 12/6/4 的比例覆盖三种锚点各自的判定难点。
Sample size
校准集 4 个语料 × 58 条目 = 232 个认证单元/评分员,足以估计加权 κ 并定位系统性偏差条目(每条目 4 个观测,用于发现'某条目两人一贯理解不同')。
Control
金标准由不参与生产编码的仲裁员制作并封存,评分员在认证前不得看到;合成页由仲裁员独立撰写,R1/R2 不参与撰写;认证与生产编码之间不超过 5 个工作日,避免标准漂移;每周开始前用 2 个条目做一次 5 分钟的复校准(不改规则,只对齐理解),复校准记录入日志。
Statistical treatment
报告每名评分员的整体加权 κ 及其 bootstrap(1000 次,按条目重抽)95% CI;按维度分列 κ;对认证中出现 ≥2 次分歧的条目单独列表,作为 P04 条目退役的先验观察名单。
Reproducibility check
codebook_v1.csv、边界规则表、合成披露页全文、金标准编码、两名评分员的认证编码全部随数据集发布。第三方可自行用该合成页测试自己的评分员,或直接对我们的认证数据复算 κ。κ 计算实现须先在公开教科书示例上复算通过(单元测试随代码发布)。
Known pitfalls
最大的陷阱是锚点里混入了价值判断——例如把'条款对用户友好'写进 2 分条件,那测的就不再是披露完整性;每条锚点必须能由不认可平台好坏的人判定。第二个陷阱是必需成分定得过粗(如只写'包含费率信息'),会把分歧推给评分员;第三是认证材料与生产材料难度不匹配,导致认证过关但生产编码一致性崩塌,因此校准集必须用真实平台语料而非只用合成页。
Risk
合成披露页是内部测试夹具,发布时必须显著标注'虚构测试材料,不对应任何真实平台',且不得放入以平台命名的目录或数据表,避免被误读为某平台的实际披露。校准集所用的 3 个真实平台不进入发布的评分结果,仅发布其条目级编码用于一致性复算,并在方法页说明原因。

SUPPORTS / 能确立本量表在生产编码开始之前已经冻结、且两名评分员在同一批已知答案的材料上达到了可量化的对齐水平。发布 codebook 哈希与冻结时间,使第三方可以验证我们没有在看到结果之后调整过评分标准。

DOES NOT SUPPORT / 资格认证只能确立评分员之间以及评分员与金标准之间在校准材料上一致,不能确立这套条目'测的就是披露完整性'这个构念本身(构念效度需要与外部标准比对,本版本未做,属公开局限)。合成页只能检验仪器是否识别得出已知内容,不能替代真实语料的复杂度。加权 κ 高也不代表条目重要性权重设置正确——权重是编辑判断,在 P07 用敏感性分析暴露其影响,而不是靠一致性来证明。

RECORDED FIELDS (12)
  • item_id / 字符串 / 如 LIC-05;跨版本稳定,条目退役后编号不复用
  • dimension / 枚举 / LEG|LIC|FEE|CUS|POR|SEC|TRM
  • required_elements / 文本列表 / 记 2 分所需的全部成分,逐条可判定
  • anchor_0 / anchor_1 / anchor_2 / 文本 / 三级锚点的操作化描述,禁止使用'清晰''充分'等不可判定形容词
  • weight_v1 / 无量纲 / 条目权重,v1 全部为 1
  • edge_rules / 规则号列表 / 该条目高发的边界规则,如 R3;R11
  • rater_id / 字符串 / R1|R2|A
  • calibration_score / 0/1/2 / 认证编码值
  • gold_score / 0/1/2 / 金标准值
  • kappa_w / 无量纲 [−1,1] / 该评分员在校准集上的线性加权 κ
  • locate_recall / 比例 [0,1] / 合成页植入要素定位召回
  • codebook_sha256 / 十六进制 64 字符 / 冻结时刻的条目库哈希
SPECIFICATION
AXP-DISC-v1-P03

双视图(签约前/登录后)双人独立编码

  1. 把编码任务组织成'条目主序'(item-major)而非'平台主序':R1、R2 各自按条目顺序,对同一条目依次编码全部平台,然后进入下一条目。这样评分员在做判断时比较的是同类内容,难以围绕某个平台构建叙事,是本设计的核心偏倚控制。
  2. 平台呈现顺序对每个条目独立随机化(用固定随机种子生成并公开该种子与顺序表),避免顺序效应集中在某个平台上。
  3. 声明盲法边界:评分员无法对平台身份盲化(品牌无处不在),因此本研究采用部分盲化——盲化的是他人编码结果与任何合成分数。R1、R2 在裁决锁定前不得看到对方编码、不得看到任何维度分或总分,编码工具界面不显示实时汇总。
  4. 每条目每平台编码两次,对应两个视图:s_pre(仅依据免登录可读语料)与 s_full(可依据登录后语料)。二者必须满足单调性 s_full ≥ s_pre;出现 s_full < s_pre 一律判为编码错误,由系统自动拦截并要求重编。
  5. 每条编码必须同时填写:分值 s ∈ {0,1,2} 或 NA 码、支撑证据 evidence_id(对应 P01 的产物)、页内定位符(CSS selector 或 PDF 页码+段号)、≤25 词的原文摘录、所引用的边界规则号、以及以下元数据:anchored(是否带第三方可核锚:登记号/LEI/具名审计机构+报告链接/链上地址/条款版本号)、dated(是否带生效日期或版本号)、gated ∈ {0,1,2}(0 免登录、1 需注册登录、2 需完成 KYC 或入金)、depth(点击数)、discovery_mode、locale_match、conflict、broken_link、text_in_image。
  6. 缺失值只允许四种码,且必须填理由:NA_NOT_APPLICABLE(该业务线不存在)、NA_GATED(仅 full 视图因未开户不可得)、NA_TECH(页面 404/403/451/5xx,附状态码)、NA_LANG(仅有团队无法可靠阅读的语言版本,附语言代码与已尝试的处理方式)。空白与 0 不得混用:0 的含义是'在语料中检索不到该要素的陈述',是一个实测结论;NA 的含义是'该条目在此情形下不可测'。
  7. 每条目每平台的检索必须按固定顺序穷尽:(1) 条款与法律页;(2) 费率页;(3) 帮助中心;(4) 站内搜索关键词(条目库为每条目预定义了 2–4 个中英关键词,随 codebook 发布);(5) sitemap 中未被前四步覆盖的候选页。评分员记录实际命中步骤 found_at_step,用于事后分析'哪些条目容易被漏检'。
  8. 单条目单平台编码时长写入 minutes_spent(编码工具自动计时),用于估算复现成本并识别异常快的编码(<30 秒的 2 分编码触发抽查)。
  9. 编码窗口内禁止两名评分员讨论任何具体平台或具体条目判断;对规则本身的疑问只能提交给仲裁员,仲裁员的答复若属于新增判定规则,必须写入'规则澄清日志'并同步给两人(澄清只能细化既有锚点的适用,不得改变锚点定义;若无法在不改锚点的前提下澄清,则该条目当场标记为'v1 缺陷条目',进入 P04 退役流程)。
  10. 每个平台编码完成后,评分员提交一份'不确定条目清单'(自评把握度 low 的条目),该清单不影响分值,但用于 P04 检验'自评不确定'与'实际分歧'是否吻合,从而评估评分员的自我校准能力。
Quantity measured
单条目编码结果为四元组 (s, 元数据向量 m, evidence_id, rule_ids);本步骤不做任何合成计算。单调性校验:∀ i,平台 p, 波次 w:s_full(i,p,w) ≥ s_pre(i,p,w),违反数记为 monotonicity_violations(目标 0)。
Fixed parameters
条目主序编码(偏倚控制);随机种子公开(可复现的顺序);摘录上限 25 词(版权合理引用与足够定位之间的取舍);<30 秒的 2 分编码触发抽查(基于校准阶段观测到的最短合理判定时长);两个视图强制单调(构念上 full 语料是 pre 语料的超集)。
Sample size
测试集:5 平台 × 58 条目 × 2 视图 × 2 波次 × 2 评分员 = 4,640 条编码记录(wave2 只重编在 P01 中 SHA-256 发生变化的页面所涉条目,其余沿用并标注 carried_forward=1,实际编码量约 3,000 条)。一致性扩展集:7 平台 × 58 条目 × 1 视图 × 1 波次 × 2 评分员 = 812 条。合计 IRR 可用单元数 = (5+7) × 58 = 696 个 (平台×条目) 单元(pre 视图 wave1),足以支撑整体 α 及各维度 α 的区间估计。
Control
控制变量:同一条目由同一名评分员在同一时段完成全部平台,避免跨日标准漂移;两名评分员使用相同的冻结语料(corpus_manifest),任何一方都不得临时补抓;编码工具不显示任何汇总分、不显示对方编码、不显示平台在其它维度的表现。full 视图证据由账户持有人统一去标识化后同时提供给两人,避免'谁有账户谁多看到'的信息不对称。
Statistical treatment
本步骤只做数据质量统计:单调性违规数(应为 0)、缺失码分布、每条目平均编码时长与四分位、found_at_step 分布(识别高漏检风险条目)、异常快编码抽查通过率。分值的统计处理留给 P04/P07。
Reproducibility check
随机顺序种子、每条目的预定义检索关键词、固定检索顺序、两名评分员的完整原始编码(不只是共识值)全部发布。第三方可以在同一批归档快照上重做编码并与我们的 R1/R2 逐条比对,差异集本身就是对量表清晰度的检验。工具自校验:编码工具内置单调性校验、必填字段校验、evidence_id 外键校验,三项在提交时硬拦截。
Known pitfalls
最常见的失败模式是把 0 和 NA 混用,会同时污染分子和分母,因此工具强制 NA 必填理由;其次是把登录后看到的内容误记进 pre 视图(尤其当评分员浏览器保持登录态),必须用独立的干净配置文件做 pre 视图编码;再次是评分员为省时用站内搜索直接跳到答案,导致 depth 全部记 7,因此 found_at_step 与 depth 分离记录并抽查;最后是 wave2 的 carried_forward 被滥用,规则是只有 HTML 哈希完全未变才可沿用。
Risk
full 视图只使用团队自有实名账户,截图前必须遮蔽姓名、地址、账号、余额、交易记录与任何可识别个人的信息;去标识化后的证据才可进入数据集。不得为获取更多可见内容而提升账户等级到需要额外提交敏感证件的层级。不得在编码期间与平台客服套取未公开信息后计入完整性主分(此类答复只作补充证据单列)。

SUPPORTS / 能确立:在冻结语料范围内、按公开的锚点与规则,两名独立评分员各自认为每个条目的披露达到了哪一级,以及每条判断挂靠在哪一份带哈希的证据的哪一个位置。pre/full 双视图能确立'签约前可见'与'登录后可见'之间的差距是多少,这是单一视图评分体系无法产出的信息。

DOES NOT SUPPORT / 编码只能确立'语料里能否读到符合必需成分的陈述',不能确立陈述属实、不能确立平台实际按此执行、不能确立未被我们检索到的表述不存在(found_at_step 与检索关键词的公开是为了让第三方能挑战这一点)。self_confidence 是主观自评,不是不确定度的量化。评分员无法盲化平台身份这一事实必须写在方法页局限里,不能声称完全盲评。

RECORDED FIELDS (18)
  • coding_id / 字符串 / 主键,metric_version+platform+item+wave+view+rater 组合
  • metric_version / 字符串 / 固定为 AXP-DISC-v1
  • platform_id / item_id / wave / view / rater_id / 字符串/枚举 / 编码单元的完整坐标
  • score / 0|1|2|null / NA 时为 null,理由见 na_code
  • na_code / 枚举 / NA_NOT_APPLICABLE|NA_GATED|NA_TECH|NA_LANG|null
  • na_reason / 文本 / NA 时必填,含状态码或语言代码
  • evidence_id / 字符串 / 指向 evidence.csv;score>0 时必填
  • locator / 文本 / CSS selector 或 PDF 页码+段号
  • quote_excerpt / 文本 ≤25 词 / 原文摘录,用于第三方定位
  • rule_ids / 字符串列表 / 引用的边界规则号,如 R3;R11
  • anchored / dated / locale_match / conflict / broken_link / text_in_image / 布尔 0|1 / 元数据标志
  • gated / 0|1|2 / 0 免登录 / 1 需登录 / 2 需 KYC 或入金
  • depth / 点击数(整数,7 表示仅搜索可达) / 用于 ACC 指数
  • found_at_step / 1–5 / 固定检索顺序中的命中步骤
  • minutes_spent / 分钟(小数) / 工具自动计时,用于复现成本估算与异常抽查
  • self_confidence / 枚举 high|med|low / 评分员自评把握度,不影响分值
  • carried_forward / 布尔 / wave2 中页面哈希未变而沿用 wave1 编码
  • coded_at_utc / ISO 8601 UTC / 编码时间
SPECIFICATION
AXP-DISC-v1-P04

评分员间一致性检验、条目诊断与条目退役

  1. 确定分析单元:一个单元 = (平台 × 条目 × 视图 × 波次),两名评分员对同一单元各有一个观测。主分析用 pre 视图 wave1 的 12 个平台(5 测试 + 7 扩展)× 58 条目 = 696 个单元。
  2. 计算 Krippendorff's α,差异函数取 ordinal(因为 0/1/2 是有序的,把 0 与 2 的分歧看得比 0 与 1 更重):α = 1 − D_o / D_e。同时计算三个辅助量:简单一致率 P_a、Gwet's AC1(在边际分布极度偏斜时比 α 稳健,用于识别'一致率高但 α 低'的悖论情形)、以及每个分值等级的出现频率(prevalence)。
  3. 分层报告 α:整体(696 单元)、按维度(LEG 96、LIC 108、FEE 108、CUS 96、POR 84、SEC 96、TRM 108 单元)、按视图(pre vs full,full 仅 5 平台 × 58 = 290 单元)。所有 α 附 bootstrap 95% CI(按单元重抽 1000 次)。
  4. 单条目层面不报 α(每条目仅 12 个观测,估计不稳),改报:精确一致数/12、分歧的方向分布(谁系统性给得高)、以及'分歧是否集中在某一分值边界'(0↔1 还是 1↔2)。这三项直接指向锚点的哪一侧写得不够清楚。
  5. 设定发布阈值(对每个维度独立判定):α ≥ 0.80 → 该维度可发布单平台数值;0.667 ≤ α < 0.80 → 只发布维度向量并标注 tentative,禁止用于平台间排序;α < 0.667 → 该维度不发布任何合成数值,只发布条目级原始编码与分歧记录,并在方法页写明本版本在该维度未达到可发布的一致性。这三档采用 Krippendorff 的常规界值,且在数据出来之前即已预注册。
  6. 条目退役规则(同样预注册):某条目在 12 个平台中分歧 ≥ 4 次(即精确一致率 ≤ 2/3),标记为 v1 缺陷条目;缺陷条目仍保留在数据集中(原始编码全部发布),但从合成分的分子分母中剔除,并在 v1.1 的修订清单中给出锚点改写建议。剔除后该维度若剩余条目 < 5,则该维度整体不发布合成值。
  7. 检验自评校准:比较 self_confidence=low 的单元与实际分歧单元的重合度(报 Youden's J 或简单的敏感性/特异性),用于判断评分员是否知道自己在哪儿不确定;该结果只作方法学报告,不进入平台评分。
  8. 检验系统性偏倚:对每名评分员计算平均分差 Δ̄ = mean(s_R1 − s_R2),及其按维度分解;若某维度 |Δ̄| > 0.2 分(在 0–2 量表上即 10% 量程),必须在方法页披露并在裁决日志中说明该维度的分歧是否已被裁决规则系统性地倒向一方。
  9. 把 α、AC1、P_a、prevalence、分歧明细、退役条目清单写入 irr.csv 与 disagreements.csv,两表随数据集发布。
Quantity measured
α = 1 − D_o/D_e,其中 D_o 为观察到的不一致度、D_e 为期望不一致度,序数差异函数 δ²_ordinal 按 Krippendorff 定义;Gwet's AC1 = (P_a − P_e^{AC1}) / (1 − P_e^{AC1});条目精确一致率 = 两名评分员分值相同的平台数 / 该条目非 NA 的平台数;评分员偏倚 Δ̄ = mean(s_R1 − s_R2)(分,范围 −2 到 +2)。
Fixed parameters
序数差异函数(而非名义),因为把 0 判成 2 比判成 1 严重;发布阈值 0.80 / 0.667(Krippendorff 常规界值,预注册以防事后调整);条目退役阈值:12 平台中分歧 ≥4(≈33%,在小样本下仍能稳定识别系统性歧义条目);bootstrap 1000 次(在 CI 稳定与算力之间的常规取舍);扩展集 7 个平台的作用就是把 IRR 单元数从 290 提到 696,代价只是文档编码工时,不需要额外资金。
Sample size
主分析 696 单元(12 平台 × 58 条目,pre 视图 wave1);维度层面最小 84 单元(POR);full 视图 290 单元;波次二致性作为稳定性辅助分析。以 α 的 bootstrap CI 宽度作为样本量是否足够的事后判断依据,若某维度 CI 宽度 > 0.25 则该维度只报区间不报点值。
Control
IRR 必须在任何裁决与任何合成之前计算并锁定——一旦评分员经过讨论达成共识,其一致性就不再是独立的。α 的输入永远是 R1/R2 的原始独立编码,绝不使用共识值。NA 单元的处理规则预注册:一方判 NA、另一方给分,视为分歧(因为'是否适用'本身就是一个判断);两方都判 NA 且 na_code 相同,视为一致;na_code 不同则单列为'缺失码分歧'并单独报率。
Statistical treatment
α 与 AC1 均报点值与 bootstrap 95% CI;对 prevalence 极端(某一分值占比 > 0.85)的维度,α 可能因期望不一致度过低而失真,此时以 AC1 为主报量并显著标注原因;分歧方向用符号检验(binomial test)判断是否显著偏向某评分员;多重比较(7 个维度)用 Holm 校正,且明确说明这些检验是描述性的、不用于任何平台间推断。
Reproducibility check
发布 R1/R2 的完整原始编码矩阵(codings.csv)、α 计算脚本与固定版本依赖,第三方可直接复算所有报告数字。仪器自校验:α 实现必须先在 Krippendorff 原著给出的公开示例数据上复算出与原文完全一致的数值,该复算写成单元测试随代码发布;AC1 实现同样在其原始论文示例上复算通过。两项自校验的通过记录写入 irr.csv 的注释区。
Known pitfalls
最常见的错误是用共识值算 α(等于自证一致),必须由流程硬隔离;第二是 kappa/alpha 悖论——当某条目 95% 的平台都得 2 分时,一致率 0.95 但 α 可能接近 0,此时报 α 会误导读者以为量表失效,必须同时报 AC1 与 prevalence;第三是把每条目 12 个观测拿去算 α 并当真;第四是在看到 α 之后调整阈值,因此阈值必须预注册并公开冻结哈希。
Risk
一致性结果可能不好看(尤其 POR 与 CUS 这类表述高度非标准化的维度)。方法论刊物的义务是照实发布并降级该维度的发布层级,而不是通过合并条目、放宽锚点或增加讨论轮次把 α 做上去。任何在看到结果后对量表的改动都必须体现为版本号递增,且旧版本数据保持可访问。

SUPPORTS / 能确立本量表在本次实施中的可重复性到底有多高,且是分维度确立的——读者可以看到'牌照维度可发布、储备证明维度只能发条目级'这种诚实的分层结论。α 与退役清单一起发布,等于把量表自身的缺陷公开,使 v1.1 的修订有据可依。

DOES NOT SUPPORT / 高 α 只能确立两名评分员对同一份语料的读法一致,不能确立他们读得对(两人可能一致地误解同一个条目);因此 α 必须与 P02 的金标准认证结果并列报告,二者缺一不可。α 也不能确立本量表测的是'披露完整性'这一构念(构念效度未做)。α 更不能替代不确定度:一致不等于准确,P07 的区间估计仍然必须报。低 α 不代表平台披露差,只代表我们的仪器在该维度分辨力不足。

RECORDED FIELDS (13)
  • scope / 枚举 / overall|dimension:<D>|view:<v>|item:<id>
  • unit_n / 整数 / 参与计算的单元数
  • alpha_ordinal / 无量纲 [−1,1] / Krippendorff α,序数差异函数
  • alpha_ci_low / alpha_ci_high / 无量纲 / bootstrap 1000 次 95% CI
  • gwet_ac1 / 无量纲 / 偏斜稳健的辅助一致性统计
  • pct_agreement / 比例 [0,1] / 简单一致率
  • prevalence_0 / _1 / _2 / 比例 / 各分值出现频率,用于解释 α 与 P_a 的背离
  • rater_bias / 分(−2 至 +2) / mean(s_R1 − s_R2)
  • disagree_n / 整数 / 分歧单元数
  • disagree_boundary / 枚举 / 分歧集中的边界:0-1|1-2|0-2|mixed
  • na_code_conflict_rate / 比例 / 两方均判 NA 但理由码不同的占比
  • publish_tier / 枚举 / full|tentative|item_level_only,由预注册阈值自动判定
  • retired_items / 字符串列表 / 本维度被退役的条目号
SPECIFICATION
AXP-DISC-v1-P05

分歧裁决、共识值锁定与裁决规则可审计化

  1. 锁定顺序:P04 的 α 计算完成并封存之后,才允许开始裁决。封存方式是把 codings.csv 与 irr.csv 打包计算 SHA-256 并公开发布该哈希。
  2. 仲裁员逐条查看分歧单元,只依据冻结的 codebook 与 12 条边界规则作出裁定,不得引入新标准。裁定必须落到四种结果之一:AD1 采纳 R1 值(附规则号)、AD2 采纳 R2 值(附规则号)、AD3 采纳第三值(当双方都误用规则时,须写明正确规则的推演)、AD4 判定为条目缺陷(规则无法裁定),该单元共识值置为 null 并把条目送入 P04 的退役流程。
  3. 每条裁定写入 adjudication_log:分歧单元坐标、R1 值与其证据、R2 值与其证据、裁定结果、依据的规则号、一句话推理、裁决用时、裁决时间戳。裁决日志随数据集全文发布——这是第三方检验我们是否在裁决阶段偷偷改标准的唯一途径。
  4. 裁决盲化程度声明:仲裁员看得到平台身份(无法避免),但裁决界面隐藏该平台在其它条目的分值与任何汇总分,并把待裁分歧按条目分组、平台顺序随机呈现,防止仲裁员按'这个平台整体印象'来倒推单条裁定。
  5. 裁决一致性自检:从已裁定的分歧中随机抽 15%,间隔 ≥7 天由同一仲裁员重裁一次(不给看首次结果),计算裁决内一致性(intra-rater agreement)。若重裁一致率 < 0.85,则全部裁定作废重来,并在方法页披露此事。
  6. 生成 consensus.csv:非分歧单元的共识值 = 双方一致值;分歧单元的共识值 = 裁定值或 null(AD4)。每个共识值必须携带 disagreement_flag 与 adjudication_id,使任何一个最终分数都能一路回溯到两份原始编码与一条裁决记录。
  7. 裁决完成后再次运行全部数据质量校验:单调性(s_full ≥ s_pre)、外键完整性(每个 score>0 必有存在的 evidence_id)、NA 理由完整性、条目覆盖完整性(每平台每条目每视图恰有一个共识值或明确的 null)。任一校验失败即阻断进入 P07。
  8. 锁定:consensus.csv 计算 SHA-256 并公开;此后进入合成与发布,任何改动都必须以更正公告 + 版本号形式进行,不得静默覆盖。
Quantity measured
共识值 s*(i,p,v,w) = 一致时取共同值;分歧时取裁定值;AD4 时为 null。裁决内一致性 intra_rater = 重裁结果与首次裁定相同的比例;裁决影响度 impact = |DCS_d(用 R1 全量) − DCS_d(用 R2 全量)|,用于说明裁决在多大范围内可能改变结论。
Fixed parameters
重裁抽样比例 15%、间隔 ≥7 天(足以稀释记忆又不拖延项目);重裁一致性下限 0.85(低于此值说明裁决本身不稳定,整批作废);裁决只能引用冻结规则(防止事后立法);AD4 存在的意义是给'规则确实没覆盖'一个诚实出口,而不是逼仲裁员硬判。
Sample size
预期分歧率 15–30%,即 696 个 pre 视图单元中约 100–210 个待裁;加上 full 视图 290 单元的约 40–90 个,总裁决量约 140–300 条,按每条 3–6 分钟计约 10–25 工时。重裁抽样 21–45 条。
Control
仲裁员全程不参与生产编码,且在 P02 就已产出并封存金标准,因此其标准形成早于看到生产数据。裁决界面隐藏汇总信息、随机化平台顺序、按条目分组,控制光环效应。裁决在 α 封存之后进行,控制'为了提高一致性而裁决'的动机。
Statistical treatment
报告分歧率(总体与分维度)、四类裁定的占比、AD1:AD2 的比例(显著偏向一方用二项检验,说明可能存在评分员系统性偏倚被裁决固化)、intra_rater 一致率及其 Wilson CI、impact 的分维度分布(最大值、中位数)。impact 若在某维度超过该维度 MRD(见 P07),必须在方法页显著标注'该维度结论对裁决选择敏感'。
Reproducibility check
发布 codings.csv(原始)、adjudication_log.csv(全文)、consensus.csv 三张表及各自哈希,第三方可以:(1) 完全忽略我们的裁决,用 R1 或 R2 单人数据重算全部指标,看结论是否翻转;(2) 依据同样的冻结规则自行裁决同一批分歧,与我们的裁定逐条比对;(3) 核对 post_alpha_lock 与时间戳序列,验证裁决确实晚于一致性封存。
Known pitfalls
最危险的失败是仲裁员在裁决中悄悄发明新标准('我觉得这也算具体'),因此 rule_ids_applied 为空的裁定在工具层面被拒绝提交;第二是先裁决后算 α,会把一致性做成自证;第三是把 AD4 当垃圾桶,凡 AD4 占比 > 10% 说明规则严重不足,必须触发 v1.1 修订而非继续发布;第四是裁决与编码由同一人完成(小团队常见妥协),本协议明确禁止,若人力不足宁可减少平台数也不能合并角色。
Risk
角色分离是本协议的硬约束:2 人团队无法同时满足 2 名评分员 + 1 名独立仲裁员,此时必须外聘或延后,不得由某位评分员兼任仲裁员。若确实无法满足,必须在发布中明确写出'本次实施未满足 AXP-DISC-v1 的角色分离要求',并把该次结果标注为不符合规范的实施。

SUPPORTS / 能确立每一个最终共识分值的来源链条:两份独立编码 → 一条可审计的裁决 → 一个共识值,且裁决所依据的规则在数据产生之前就已公开冻结。impact 指标能确立'即使全部按 R1 或全部按 R2 计算,结论会变多少',这是对裁决权力的直接约束。

DOES NOT SUPPORT / 裁决只能确立在冻结规则下哪一个读法更站得住,不能确立该读法在客观上正确;AD3/AD4 的存在本身就承认规则有覆盖不到的地方。共识值不是'真值',它是'在本版本规则下两名评分员加一名仲裁员所能达成的最稳定读数'。裁决日志能防止事后改标准,但不能消除仲裁员自身的系统性倾向——因此 impact 与 intra_rater 必须一起发布。

RECORDED FIELDS (13)
  • adjudication_id / 字符串 / 主键
  • platform_id / item_id / view / wave / 字符串/枚举 / 分歧单元坐标
  • score_r1 / score_r2 / 0|1|2|null / 两份原始编码
  • evidence_r1 / evidence_r2 / 字符串 / 双方各自引用的证据 id,常常不同,本身即诊断信息
  • decision / 枚举 AD1|AD2|AD3|AD4 / 裁定类型
  • consensus_score / 0|1|2|null / AD4 时为 null
  • rule_ids_applied / 字符串列表 / 裁定所依据的冻结规则号;为空则不合法
  • reasoning / 文本 ≤60 字 / 一句话推理,公开发布
  • minutes_spent / 分钟 / 裁决用时
  • recheck_flag / 布尔 / 是否被抽入重裁样本
  • recheck_match / 布尔 / 重裁是否与首次一致
  • adjudicated_at_utc / ISO 8601 UTC / 裁决时间
  • post_alpha_lock / 布尔 / 必须为 true,证明裁决发生在 α 封存之后
SPECIFICATION
AXP-DISC-v1-P06

平台自述与官方登记记录的文本一致性核对(表述保真度子指标)

  1. 从冻结语料中穷尽抽取所有'监管状态类表述':凡包含 licensed / regulated / authorised / registered / supervised / compliant / approved 及其本地语言等价词,或出现监管机构名称、注册号、牌照编号的句子,全部抽取为一条 claim,保留 ≤25 词原文摘录、URL、locator、evidence_id。抽取由两人独立进行,取并集(漏抽比误抽代价大),并报抽取一致率。
  2. 对每条 claim 定位其所指向的官方一手记录:优先使用监管机构或登记处的官方查询系统,捕获查询结果页(HTML + PNG + PDF + SHA-256 + 归档链接),记录 register_name、register_id、查询日期、记录中的实体名称、状态、服务范围、地域范围、登记日期。只用官方来源,不用第三方数据库转述。
  3. 把 claim 与记录做文本层面的对照分类(A–E),分类只比对文本,不作法律判断:A 一致——claim 陈述的机构、编号、范围、地域与记录一致;B 省略限定——记录或该机构的官方说明中存在明确限定(例如某些注册机构公开声明'注册不构成牌照、不构成背书'),而 claim 未复述该限定;C 表述升格——claim 使用了记录不支持的类别词(例如记录为 registration 而 claim 写 licensed/regulated by);D 主体或范围错配——claim 把另一实体、另一辖区或另一业务线的状态归于本主体或本业务;E 无法核对——未能定位对应的官方记录,或记录不公开可查。
  4. 分类同样由两人独立完成,计算该分类任务的 Cohen's κ(名义),κ < 0.7 时必须重写分类定义并重做,重做过程写入日志。分歧由仲裁员按同一套规则裁决,裁决日志公开。
  5. 把 E 类单独统计,绝不计入违规分子或分母——'我们没找到记录'是我们的局限,不是平台的问题;同时公开我们为定位该记录所做的检索步骤,便于第三方补充。
  6. 对 B/C/D 类逐条生成'对照卡片':平台原文摘录 + 官方记录原文摘录 + 两者的差异点(机构/类别词/范围/地域/日期)+ 两份证据的哈希与归档链接。卡片只陈述文本差异,不写任何'因此该平台违规/涉嫌误导'之类的定性。
  7. 计算表述保真度 FID,并强制与 LIC 维度的完整性分并列呈现但绝不合成——一个平台可以在 LIC 维度拿高分(信息很全)同时 FID 很低(说得全但与记录不符),也可以反过来;把两者合成会同时摧毁这两个信息。
  8. 在方法页明确写出本子指标的性质:它测的是'平台的自我描述与官方记录文本之间是否吻合',这是一个可复核的文本比对问题;它不测'平台是否合法''是否满足 MiCA''该注册是否足够'——这些是法律定性,超出本刊物的能力与角色。
  9. 把所有 claim、记录、分类、证据写入 claims_register.csv 并随数据集发布。
Quantity measured
FID = 100 × n_A / (n_A + n_B + n_C + n_D),E 类排除在分母外并单独报 n_E 与 E 占比 = n_E / (n_A+n_B+n_C+n_D+n_E)。另报分类构成向量 (n_A, n_B, n_C, n_D, n_E) —— 构成向量是主报量,FID 只是摘要。
Fixed parameters
关键词表(英文 + 各目标 locale 等价词)随 codebook 发布,可被第三方扩充;摘录上限 25 词(版权合理引用);只采信官方一手登记来源(第三方聚合数据库不得作为分类依据,仅可作为定位线索);κ 阈值 0.7;E 类排除在分母外(避免把我们的检索失败算成平台的问题)。
Sample size
预计每平台 5–40 条监管状态类 claim(大型平台因多辖区实体会更多,需按辖区分组统计);5 个测试平台合计预计 60–200 条。若某平台 claim 数 < 5,FID 不报点值,只报分类构成向量(比例在极小样本下不稳)。
Control
claim 抽取与分类由两名成员独立完成,取并集与 κ 双重控制;对照必须成对捕获(平台页面与登记记录在同一工作日内捕获,日期差 ≤3 天写入记录),避免用旧记录对新页面;同一 claim 若在多页重复出现,只计一次但记录出现次数 occurrence_n,防止高频重复的营销语句主导统计。
Statistical treatment
主报分类构成向量与各类别的 Wilson 95% CI;FID 作为摘要指标报点值与 CI,且在 claim 数 < 5 时不报;分类任务的 Cohen's κ 与其 bootstrap CI 一并发布;按辖区分组报告(多实体平台不得合并成单一 FID)。不做跨平台显著性检验——claim 数量差异巨大且非随机抽样,任何 p 值都会误导。
Reproducibility check
每一条对照都提供两个归档链接(平台页面与登记记录)与两个哈希,第三方点开即可看到我们看到的原文;关键词表、检索步骤、分类定义、两人的独立分类全部发布。仪器自校验:在关键词表上跑一次已知答案的回归测试(用团队自建的合成披露页,其中含 2 条 A、1 条 B、1 条 C、1 条 D 类的已知构造),确认抽取与分类流程能正确识别,该测试结果随数据集发布。
Known pitfalls
最大的陷阱是把文本比对滑向法律判断——note 字段一旦出现'涉嫌''违规''不合法',整条记录作废重写;第二是用第三方聚合数据库当官方记录,很多此类库自身就是转述且滞后;第三是忽略同名/近似名实体导致 D 类误判,必须逐条核对注册号而非仅核对名称;第四是把营销页上的一句重复话术当成多条 claim 抬高分母,因此用 occurrence_n 去重;第五是记录与页面捕获日期相隔太远,规定 ≤3 天。
Risk
B/C/D 类结论对平台声誉影响直接,因此:(1) 每条对照卡片必须在发布前经仲裁员复核并双人签字;(2) 必须走 P09 的事实核对期,给平台不少于 10 个工作日以书面回应,回应原文与是否修改页面全部入库;(3) 发布语言严格限定为文本差异陈述,不使用任何法律定性词;(4) 若平台提供了我们未能检索到的官方记录,须立即重分类并公开更正。检索登记系统时遵守其使用条款与速率限制,不做批量抓取,不注册虚假身份获取查询权限。

SUPPORTS / 能确立:在指定日期,平台某处公开页面上写着这句话,而官方登记系统在同一时间窗内的记录写着那句话,两者在机构/类别词/范围/地域/日期这几个轴上是否一致。这是一个纯文本、可被任何人用我们提供的归档链接重做的比对。它也能确立平台是否复述了监管机构自己公开的限定说明(例如注册不等于牌照这类官方声明),这正是 LIC-05 条目的外部佐证。

DOES NOT SUPPORT / 绝对不能确立平台是否合法、是否违规、是否构成误导性商业行为、是否满足 MiCA 或任何具体法规——这些是主管机关与法院的职权,本刊物不做也无能力做法律定性。也不能确立平台在别处(如客服口头、广告投放、第三方渠道)的表述。E 类不能被解读为'该平台没有注册',只能解读为'我们未能定位到可公开查询的记录'。反过来,A 类也不能解读为背书:文本一致只说明说法与记录吻合,不说明该注册对用户提供了任何实质保护。

RECORDED FIELDS (16)
  • claim_id / 字符串 / 主键
  • platform_id / 字符串 / 平台标识
  • claim_excerpt / 文本 ≤25 词 / 平台原文摘录
  • claim_url / claim_locator / claim_evidence_id / URL / 文本 / 字符串 / 可回溯定位
  • occurrence_n / 整数 / 同一 claim 在语料中出现次数
  • claimed_authority / 文本 / claim 中提到的机构名称原文
  • claimed_id / 文本 / claim 中提到的注册/牌照编号原文
  • register_name / register_url / register_query_date / 文本 / URL / 日期 / 官方一手记录来源
  • register_entity_name / 文本 / 记录中的实体名称原文
  • register_status_text / 文本 / 记录中的状态字段原文,逐字转录
  • register_scope_text / 文本 / 记录中的服务范围原文
  • register_sha256 / register_archive_url / 十六进制 / URL / 记录页的哈希与独立归档
  • concordance_class / 枚举 A|B|C|D|E / 文本对照分类
  • class_r1 / class_r2 / class_final / 枚举 / 两人独立分类与裁定值
  • difference_axis / 枚举列表 / authority|category_word|scope|geography|entity|date
  • note / 文本 / 仅陈述文本差异,禁止法律定性用语
SPECIFICATION
AXP-DISC-v1-P07

指数合成、权重敏感性、分辨力与不确定度量化

  1. 维度分:DCS_{d,v,w} = 100 × Σ_{i∈d, s*≠null} u_i·s*_i / (2 × Σ_{i∈d, s*≠null} u_i),u_i 为条目权重(v1 全部为 1),NA 与退役条目一并从分子分母剔除。若某维度非 NA 条目占比 < 60%,该维度不出合成值,只发条目级数据并标注原因。
  2. 总分:DCS_total = Σ_d ω_d · DCS_d,预注册权重 ω = {LEG 0.15, LIC 0.20, FEE 0.15, CUS 0.15, POR 0.10, SEC 0.10, TRM 0.15}(合计 1.00)。权重是编辑判断而非测量结果,其理由须逐条写在方法页:LIC 最高是因为该维度的缺失会直接导致读者误判自己受何种保护;POR/SEC 较低是因为这两个域的文档披露与实际控制之间的落差最大,给高权重会放大文档证据的越界解读。
  3. 强制发布三种权重下的结果:W1 = 预注册 ω;W2 = 维度等权(各 1/7);W3 = 条目等权(忽略维度,全部 58 条目等权)。报告三者下的平台名次,并计算最大名次变动 Δrank_max。若某平台 Δrank_max ≥ 2,则该平台的总分被标注为'权重敏感',方法页与数据可视化中只呈现其维度向量,不呈现总分名次。
  4. 视图差:GAP_v = DCS_total(full) − DCS_total(pre),按维度亦同。GAP 必须单独呈现并解释为'需要登录/KYC 之后才增加的披露量',它衡量的是签约前信息可得性的缺口,而不是平台好坏。
  5. 披露波动:VOL_d = |DCS_d(w2) − DCS_d(w1)|,以及方向性 ΔDCS_d = DCS_d(w2) − DCS_d(w1)。VOL 绝不与 DCS 平均,它是一个独立读数,回答'这个分数在三周后还成立吗'。
  6. 可达性与时效性两个辅助指数:ACC_d = 100 × mean_{i: s*>0}(0.5·D_i + 0.3·G_i + 0.2·L_i),其中 D_i = max(0, 1 − (depth_i − 1)/5)(depth 1 → 1.0,depth ≥6 → 0)、G_i = 1 − gated_i/2、L_i = locale_match_i;CUR_d = 100 × n(dated_i=1) / n(s*_i>0)。ACC 与 CUR 独立报告,不并入 DCS,因为'说了'与'容易找到'是两件事,合成会让读者无法分辨低分的成因。
  7. 评分员不确定度(rater-uncertainty interval):蒙特卡洛 1000 次,每次对每个分歧单元从 {s_R1, s_R2} 中等概率抽取一个值(非分歧单元固定),重算 DCS,取 2.5/97.5 百分位。点估计仍用共识值。
  8. 内容抽样不确定度(content-sampling interval):对每个维度内的条目做非参数 bootstrap(1000 次,条目层重抽),重算 DCS_d,取 2.5/97.5 百分位。此区间回答'如果我们的条目库换一批同类条目,分数会飘多少'。
  9. 最终每个 DCS 值发布:点估计 + 两个区间(分别标注来源),并以两者中较宽者作为对外解读的默认区间。禁止只报点值。
  10. 最小可辨差 MRD:两平台在某维度的差异只有超过 MRD_d = 1.96 × sqrt(SE_a² + SE_b²)(SE 取评分员不确定度区间半宽/1.96)才可描述为'存在差异';否则必须写'在本方法的分辨力内不可区分'。所有对比图表必须画出该分辨力带。
  11. 把 scores.csv 生成完毕后运行一致性校验:三种权重下的总分是否都落在 [0,100]、维度分与条目数的对应关系、区间是否包含点估计、GAP 是否 ≥0。任一失败阻断发布。
Quantity measured
DCS_{d,v,w} = 100·Σu_i·s*_i / (2·Σu_i);DCS_total = Σ_d ω_d·DCS_d;GAP = DCS_total(full) − DCS_total(pre);VOL_d = |DCS_d(w2) − DCS_d(w1)|;ACC_d = 100·mean(0.5·D_i + 0.3·G_i + 0.2·L_i),D_i = max(0, 1 − (depth_i−1)/5),G_i = 1 − gated_i/2;CUR_d = 100·n(dated=1)/n(s*>0);MRD_d = 1.96·√(SE_a² + SE_b²)。所有指数无量纲,取值 0–100,不是百分比也不是及格线。
Fixed parameters
权重 ω 预注册并公开理由(编辑判断,必须可被质疑,故强制发布 W2/W3 对照);ACC 内部权重 0.5/0.3/0.2(深度权重最高,因为点击深度是用户实际遇到的第一道摩擦;地域版本权重最低,因为多数目标平台提供英文版);depth 归一上限 6(与 P01 爬取深度一致);蒙特卡洛与 bootstrap 各 1000 次;名次敏感阈值 Δrank ≥ 2;维度可发布的非 NA 条目占比下限 60%。
Sample size
每平台每视图每波次 58 个条目(扣除 NA 与退役后典型 45–55 个有效条目);维度层最少 7 个条目(POR),这也是为什么 POR 的 bootstrap 区间会明显更宽——这一点必须在图表中如实呈现而不是被平滑掉。5 个测试平台形成 5 个可比读数;扩展集 7 个平台不进入发布评分,只服务于 P04。
Control
合成脚本必须在 consensus.csv 哈希锁定之后运行,且脚本本身在编码开始前就已写好并公开哈希(防止按结果调参)。三种权重方案在数据产生之前即已声明。所有随机过程使用固定种子并公开。分析人员在运行合成前不得看到任何平台的部分汇总结果。
Statistical treatment
点估计用共识值;不确定度用蒙特卡洛(评分员)与非参数 bootstrap(条目)双路径,各报 95% 区间并声明两者衡量的是不同来源的误差,禁止合并成单一区间;平台间比较一律用 MRD 判定而非 t 检验(5 个平台不是随机样本,推断统计不适用);权重敏感性用名次变动而非分数变动来表述(读者关心的是排序是否稳健);所有区间在图表中必须可见,禁止只画柱状点值。
Reproducibility check
发布 consensus.csv + 合成脚本 + 固定种子 + requirements.txt,第三方运行一条命令即可从条目级数据复算出发布的每一个数字,包括所有区间。脚本内置断言:从 codings.csv 重建 consensus.csv 的过程必须与我们发布的 consensus.csv 逐行一致;三种权重下的总分必须落在其维度分的最小值与最大值之间;蒙特卡洛区间必须包含点估计。任一断言失败则拒绝出数。
Known pitfalls
最常见的滥用是把 DCS 当'透明度=可信度'的代理并直接排名,因此 rank_sensitive 与 MRD 是强制字段而非可选;第二是把 NA 当 0,会系统性压低业务线少的平台,必须靠分母剔除 + 60% 覆盖率门槛双重防护;第三是把 ACC 并进 DCS,会让'内容缺失'与'内容难找'两种完全不同的问题变得不可区分;第四是只报 wave1 而不报 VOL,等于向读者隐瞒了分数的保质期;第五是在看到结果后微调权重,故权重与脚本哈希必须先于数据公开。
Risk
总分是最容易被断章取义转载的数字。发布时必须:总分永不单独出现(始终与维度向量、区间、权重方案、捕获窗口同屏);rank_sensitive 为 true 的平台不呈现名次;社交卡片与摘要中不得只放一个数字。若某平台得分很低,正文必须同时说明低分的成因分布(是缺失、是不具体、还是难以定位),避免读者把'披露组织得差'读成'平台有问题'。

SUPPORTS / 能确立每个平台在每个维度、每个视图、每个波次上的披露完整性读数及其公差,并明确告诉读者:哪些差异大到可以谈、哪些差异在仪器分辨力之内不能谈、结论对权重选择有多敏感、登录墙后增加了多少披露、三周后分数漂了多少。GAP 与 VOL 是本设计相对于常见'透明度评分'的实质增量。

DOES NOT SUPPORT / DCS 不能确立平台的安全性、偿付能力、合规状态或可信度,也不能预测用户会不会出事。它不是风险评级,不能与费率、执行质量等实测指标合成为任何'总评分'——那会把一个文档层面的读数与运行时实测混为一谈。总分是三种权重之一的产物,本身带有编辑判断,任何'第一名/最后一名'的表述都必须附 MRD 与权重敏感标注。区间只覆盖评分员分歧与条目抽样两类误差,不覆盖语料不完整、地域差异、平台个性化呈现等系统误差,这些只能定性披露。

RECORDED FIELDS (14)
  • platform_id / dimension / view / wave / 字符串/枚举 / 读数坐标
  • dcs / 指数 0–100(无量纲) / 维度分或总分(dimension='TOTAL')
  • weight_scheme / 枚举 W1|W2|W3 / 三种权重方案各出一行
  • n_items_scored / n_na / n_retired / 整数 / 分母构成,必须与条目级数据可核对
  • rater_ci_low / rater_ci_high / 指数点 / 蒙特卡洛评分员不确定度区间
  • content_ci_low / content_ci_high / 指数点 / 条目层 bootstrap 区间
  • acc / cur / 指数 0–100 / 可达性与时效性辅助指数
  • gap_total / 指数点 / DCS_total(full) − DCS_total(pre)
  • vol / delta / 指数点 / 两波次绝对波动与方向性变化
  • rank_w1 / rank_w2 / rank_w3 / 整数 / 三种权重下的名次
  • rank_sensitive / 布尔 / Δrank_max ≥ 2 时为 true,此时禁止呈现总分名次
  • mrd_pairwise / 指数点 / 与每个对比平台的最小可辨差
  • publish_tier / 枚举 / 继承自 P04 的维度发布层级
  • seed / script_sha256 / 整数 / 十六进制 / 随机种子与合成脚本哈希
SPECIFICATION
AXP-DISC-v1-P08

开放数据集封装、校验与第三方复现包

  1. 确定发布的九张表:platforms.csv(平台与本次测量的元数据)、codebook_v1.csv(58 条目定义、锚点、权重、关键词、边界规则映射)、edge_rules.csv(12 条规则全文)、corpus_manifest.csv(P01)、evidence.csv(P01/P03,含摘录与归档链接)、codings.csv(P03 原始双人编码)、adjudication_log.csv(P05)、consensus.csv(P05)、claims_register.csv(P06)、irr.csv(P04)、scores.csv(P07)。原始编码必须发布,只发共识值等于隐藏了本刊最有价值的方法学证据。
  2. 版权与再分发边界:不整体再分发平台的条款、费率页或帮助中心全文(属第三方著作权材料)。数据集中只包含 (a) URL 与最终 URL、(b) 捕获 UTC 时间、(c) 产物 SHA-256、(d) 公共归档链接、(e) ≤25 词的定位性摘录、(f) 页内定位符。完整捕获包在本地留存并按请求逐案提供给复核者,留存政策与联系方式写入 README。这一取舍必须在方法页写明,因为它直接影响复现方式。
  3. 缺失值约定统一写死:CSV 中缺失一律为空字段(不写 NA、-、0),并配一个同名的 *_status 列承载缺失码(NA_NOT_APPLICABLE / NA_GATED / NA_TECH / NA_LANG);JSON 中缺失为 null。禁止用 0 表示缺失,禁止用空字符串表示 0。所有布尔字段用 0/1 而非 true/false 以避免各语言解析差异。
  4. 单位与格式约定:时间一律 ISO 8601 UTC 带 Z;指数 0–100 保留一位小数;比例保留三位小数;哈希小写十六进制 64 字符;金额以欧元为单位并注明汇率来源与日期(本基准仅在成本记录中涉及);文本字段 UTF-8、无 BOM、字段内换行统一为 \n。
  5. 完整性校验:为每个文件计算 SHA-256 写入 MANIFEST.sha256;再对 MANIFEST 本身计算哈希并在方法页正文中公布(使数据集被篡改可被发现)。附 datapackage.json(Frictionless Data Package 规范)声明每张表的字段、类型、单位、约束与外键关系。
  6. 外键与约束在发布前用脚本硬校验:codings.evidence_id → evidence.evidence_id;consensus 每行必须在 codings 中有两条对应记录;scores 的 n_items_scored 必须等于 consensus 中该维度非 null 行数;claims_register 每条 B/C/D 必须同时具备平台侧与登记侧的哈希与归档链接。任一失败阻断发布。
  7. 许可:数据与条目库以 CC BY 4.0 发布(要求署名与版本号);分析脚本以 MIT 或 Apache-2.0 发布;第三方著作权材料(平台页面原文)不在授权范围内,README 明确说明摘录属合理引用。
  8. 复现包:一个仓库,含 requirements.txt(固定版本)、一条命令的 make reproduce,从 codings.csv 出发重算 irr.csv 与 scores.csv 并与发布版逐行 diff,diff 非空即失败。仓库同时含 P02 合成披露页与其金标准,供他人训练自己的评分员。
  9. 版本与引用:数据集与方法页共用 metric_id(AXP-DISC-v1),发布日期、捕获窗口、codebook 哈希、MANIFEST 哈希四项必须出现在方法页首屏与数据集 README 首段。提供建议引用格式(含版本号与访问日期)。
  10. 变更管理:任何数据修正以追加方式进行——发布 errata.csv(记录被更正的行、原值、新值、原因、时间戳)并递增补丁版本(v1.0.1),旧版本文件与哈希保持可访问。条目定义或权重的任何改动一律升为 v1.1/v2 并重新采集,不得对 v1 数据回改。
Quantity measured
数据集完整性校验通过率 = 通过的约束数 / 约束总数(发布门槛 = 1.00);复现 diff 行数(发布门槛 = 0);字段填充率 = 非空字段数 / 应填字段数(分表报告,用于暴露哪些表的证据链最弱)。
Fixed parameters
CC BY 4.0(数据可被再利用但必须署名与版本,符合基准刊物的目标);不整体再分发第三方页面(版权风险与合理引用的取舍);摘录 ≤25 词;Frictionless datapackage.json(成熟的表格数据描述规范,无需自造);MANIFEST 哈希在正文公布(篡改可检测);缺失值双列设计(值列留空 + status 列带码)以兼容各种统计软件的默认读入行为。
Sample size
预计规模:codings.csv 约 3,800–4,600 行、evidence.csv 约 1,500–3,000 行、consensus.csv 约 1,900–2,300 行、claims_register.csv 约 60–200 行、corpus_manifest.csv 约 1,000–2,500 行。全部为文本表格,压缩后 < 50 MB,便于直接托管。
Control
发布前的校验脚本由未参与数据录入的成员运行;MANIFEST 与方法页正文中的哈希由第二人独立复算比对;数据集打包后在一台干净机器上按 README 从零执行一次复现流程,记录耗时与遇到的问题并写入 README 的'已知摩擦点'。
Statistical treatment
发布层面只做确定性校验(通过/不通过),不涉及推断统计。字段填充率按表报告并在 README 中解释低填充率字段的成因(例如 register_scope_text 在部分登记系统本就不提供该字段)。
Reproducibility check
三层:(1) 哈希层——MANIFEST + 正文公布的 MANIFEST 哈希;(2) 计算层——make reproduce 从 codings.csv 重算 irr.csv 与 scores.csv 并 diff,非零即失败;(3) 证据层——evidence.csv 的归档链接可被任何人打开核对摘录。此外提供一个'反向复现'入口:第三方可只用 R1 或只用 R2 的编码重算全部指标,脚本内置该开关,用于检验结论对裁决的依赖程度。
Known pitfalls
最常见的错误是只发共识值不发原始编码,使一致性无法被外部复算;第二是用 0 填充缺失,会系统性扭曲维度分;第三是把整站抓取包直接打包发布,带来版权与平台关系风险;第四是数据集与方法页版本脱节(页面更新了数字但数据集没更新),因此四项标识(版本、窗口、codebook 哈希、MANIFEST 哈希)必须在两处同步出现;第五是静默改数据,必须走 errata + 补丁版本。
Risk
发布前必须逐条检查证据摘录中是否混入了个人信息(团队成员姓名、账号、邮箱、订单号、余额、地址、KYC 相关内容),full 视图截图尤其高风险;发现即阻断发布。不得在数据集中包含任何账户凭证、cookie、token 或 API 密钥。第三方页面原文不整体再分发;若平台就摘录提出异议,按 P09 的更正流程处理,并保留原捕获与归档链接以维持记录完整性。

SUPPORTS / 能确立任何第三方在不联系我们的前提下,可以取得条目定义、原始双人编码、裁决记录、证据定位与哈希、以及一条命令的复算路径,从而独立验证我们发布的每一个数字是由这批编码按这套公式算出来的。归档链接使他们还能核对当时页面原文,而不必信任我们的截图。

DOES NOT SUPPORT / 数据集只能确立'计算过程可复算'与'当时证据可回看',不能确立我们的条目库测的就是披露完整性(构念效度另议),也不能确立我们没有漏掉平台的某些页面(语料完整性只能被第三方通过独立采集来挑战,这正是我们发布检索规则与关键词的原因)。哈希只能证明文件未被篡改,不能证明文件内容正确。CC BY 授权只覆盖我们生成的数据与条目库,不覆盖平台页面原文。

RECORDED FIELDS (12)
  • file_name / 字符串 / 数据集内文件名
  • sha256 / 十六进制 64 字符 / 文件哈希,写入 MANIFEST.sha256
  • row_count / 整数 / 行数,用于快速校验
  • schema_ref / 字符串 / datapackage.json 中对应 resource 名
  • fill_rate / 比例 [0,1] / 字段填充率,分表报告
  • constraint_pass / 比例 [0,1] / 约束校验通过率,发布门槛 1.00
  • license / 字符串 / CC-BY-4.0(数据)/ MIT 或 Apache-2.0(代码)
  • metric_version / 字符串 / AXP-DISC-v1,随每行携带以防表被拆散后失去版本上下文
  • capture_window_start / capture_window_end / ISO 8601 UTC / 本数据集覆盖的捕获窗口
  • codebook_sha256 / manifest_sha256 / 十六进制 / 条目库与清单的哈希,方法页正文同步公布
  • errata_ref / 字符串 / 若该行被更正,指向 errata.csv 的记录 id
  • reproduce_diff_lines / 整数 / 复现包 diff 行数,发布门槛 0
SPECIFICATION
AXP-DISC-v1-P09

事实核对期、更正流程与版本迭代

  1. 在计算完成、发布之前,向每个被测平台的公开投诉/媒体/合规联系入口发送一份事实核对包:包含该平台的条目级共识值、每条 score<2 的条目所依据的证据(URL + 捕获时间 + ≤25 词摘录 + 归档链接)、以及 P06 中该平台的全部 B/C/D 类对照卡片。不发送其它平台的数据,不发送总分排名,不索要商业条件。
  2. 给予不少于 10 个工作日的书面回应期,明确告知:我们要的是事实层面的指正(例如'该信息在 X 页面,你们漏检了'或'该注册号对应的记录范围是 Y'),不是对结论的意见征询;我们不会因回应而更改评分标准,只会更改被证明有事实错误的编码。
  3. 回应处理三分支:(1) 平台指出我们漏检了既有页面 → 核实该页面在原捕获窗口内确实存在(用归档或平台提供的证据核对捕获时间),成立则重编该条目并记入 errata,同时把该条目加入'高漏检风险'清单用于 v1.1 改进检索关键词;(2) 平台在回应期内新增或修改了页面 → 原捕获与原评分保持不变(评分绑定捕获窗口),新增内容记为 wave-R 并单独呈现为'核对期后变更',绝不回填到 wave1/wave2;(3) 平台不认同锚点或权重 → 原文收录到数据集的 platform_response 字段并在方法页链接,不改评分(标准早于数据冻结,事后按被测方意见调整标准会摧毁整套方法的意义)。
  4. 所有回应原文(或'未回应'这一事实与发送时间、渠道)一律入库并公开,包括对我们不利的部分。未回应不得被表述为默认承认。
  5. 更正公告:任何因事实错误产生的分值变更,通过 errata.csv + 方法页更正区 + 补丁版本号(v1.0.x)公开,写明原值、新值、触发原因、更正日期,并保留旧版本数据与哈希可访问。
  6. 版本迭代规则:条目定义、锚点、权重、边界规则、维度构成中任何一项改动 → 递增次版本号(v1.1)或主版本号(v2),并且必须重新采集数据,不得把新标准套用到旧语料上后与旧结果并列比较。方法页需给出 v1 与 v1.1 的差异清单与'历史数据是否可比'的明确结论。
  7. 把 P04 的退役条目清单、P05 的 AD4 记录、P09 的高漏检风险清单三者合并为 v1.1 的修订待办,公开发布。这份'我们知道自己哪里做得不够'的清单,是本刊区别于评测站的核心资产之一。
  8. 设定复测节奏:同一 metric_id 下的平台每 6–12 个月复测一次;复测必须用同一版本条目库才可与历史数据直接比较,若期间已升版,则同时用旧版与新版各跑一次以提供桥接数据(bridging),桥接结果单独发布。
Quantity measured
回应率 = 回应平台数 / 发送平台数;事实更正率 = 因平台指正而变更的条目数 / 该平台条目总数;核对期变更率 = 在回应期内被修改的页面数 / 该平台进入计分的页面数(此项本身就是一个有信息量的读数:它说明平台在被观察时的反应速度,但必须与评分严格分离呈现)。
Fixed parameters
回应期 ≥10 个工作日(足以让合规团队响应,又不至于拖垮 6–8 周窗口);只发该平台自身数据(避免把竞争对手信息泄露给对方,也避免被拿去做商业比较);不因意见分歧改标准(标准冻结先于数据);wave-R 单列(保护'评分绑定捕获窗口'这一根本约束)。
Sample size
5 个测试平台各发送 1 份核对包;预计回应 0–4 家(业界惯例回应率不高,无回应本身也是要如实报告的数据);预计事实更正 0–15 个条目。
Control
发送内容、发送时间、渠道、回执全部记录;由不参与编码的成员统一对外沟通,评分员不与平台直接联系,避免影响后续复测的独立性;任何来自平台的额外材料只有在其为公开可得或平台明确同意公开时才可进入数据集,否则只作核实用途并在方法页说明存在未公开材料。
Statistical treatment
回应率、事实更正率、核对期变更率各报点值与 Wilson 95% CI(5 家样本极小,CI 会很宽,必须如实呈现而非略去);更正前后的分值对照以配对形式呈现,不做显著性检验。
Reproducibility check
发送模板、发送时间戳、回执、回应原文(可公开部分)、errata.csv 全部发布,第三方可核对我们声称的更正是否与数据变动一一对应;旧版本数据与哈希保持可访问,任何人都能 diff 出 v1.0.0 与 v1.0.1 之间的确切差异。
Known pitfalls
最常见的失败是把核对期变成协商——一旦开始就'哪个分数可以调一调'讨价还价,整套方法就作废;因此模板中明确只接受事实层面的指正,且不参与编码的成员负责沟通;第二是把平台回应期内修改的页面回填到原波次,等于让被测方在考试后改答卷;第三是只发布对我们有利的回应;第四是升版后把新标准套旧语料再与旧结果并列比较,会制造虚假的时间趋势。
Risk
对外沟通必须使用刊物的正式身份与联系方式,不得冒充用户、研究机构或监管方,不得暗示我们具备任何监管或认证资格。不索取、不接受任何形式的付费、广告置换或优惠条件;若平台在沟通中提出商业合作,须记录并在方法页披露该事实。涉及 B/C/D 类对照卡片的沟通措辞必须保持文本差异陈述,不得出现法律定性用语,以免把事实核对变成指控。

SUPPORTS / 能确立我们在发布前给了被测方基于证据的指正机会,且所有指正、变更与未回应事实都在数据集中可查;能确立哪些分值变动源自事实纠错、哪些源自平台在被观察后修改页面——这两者被严格分开,是本协议对'观察者效应'的处理方式。

DOES NOT SUPPORT / 事实核对期不能确立平台认可我们的方法或结论;未回应不能被解读为默认承认,回应也不能被解读为背书。核对期内的页面修改不能证明平台是因我们才改的(因果不可确立),只能记录时间上的先后。平台提供的未公开材料不能进入完整性评分——本指标测的是公开披露,私下补充的信息在构念上不算数,这一点必须对平台事先说明。

RECORDED FIELDS (11)
  • platform_id / 字符串 / 平台标识
  • sent_at_utc / channel / recipient_type / ISO 8601 / 文本 / 枚举 / 发送时间、渠道、对方入口类型(合规/媒体/客服)
  • deadline_utc / ISO 8601 / 回应截止时间
  • responded / 布尔 / 是否回应
  • response_text / 文本 / 回应原文(经对方同意公开的部分)
  • response_class / 枚举 / factual_correction|page_changed|standard_dispute|no_response|other
  • items_corrected / 字符串列表 / 因指正而更正的条目号
  • errata_ids / 字符串列表 / 对应 errata.csv 记录
  • wave_r_pages / 整数 / 核对期内被新增或修改的页面数
  • score_change_total / 指数点 / 更正导致的总分变动,必须公开
  • version_after / 字符串 / 更正后的版本号,如 AXP-DISC-v1.0.1
SPECIFICATION
RPT

Reporting rules for this benchmark

How results from this protocol may and may not be described once a dataset exists. Author: Axial Proof Editorial Team. Independent reviewer: Axial Proof Review Team.

CONSTRAINTS

一、数字永不裸奔。任何 DCS 值出现时必须同屏携带五项:metric_id 与版本号、捕获窗口 UTC 起止、视图(pre 或 full)、权重方案(W1/W2/W3)、以及至少一个不确定度区间。禁止出现'某平台披露完整性 62 分'这样的孤立表述,社交卡片与摘要同样受此约束。 二、构念不得越界。DCS 只回答'平台是否说了、说得是否具体、能否被定位'。禁止由本指标推出以下任一表述:合规、持牌、受监管、安全、可信、稳健、值得信赖、风险低/高。禁止写'披露不完整,因此不可信'或'披露完整,因此可靠'。正确的桥接句式是:'该维度的披露在本方法下无法被第三方定位,因此关于该维度的任何主张目前都不可核对。' 三、文档证据的天花板必须写出来。审计报告的存在只能确立'存在一份声称经审计的文件',不能确立财务状况;储备证明页面只能确立'发布了一个结构可核对的承诺',其真伪需链上与负债端的独立验证(属另一基准);安全控制的披露只能确立'写了这些控制',不能确立控制实际生效;托管条款只能确立'条款如此约定',不能确立资产实际被如此持有。每篇引用本指标的文章都必须包含这一段边界说明,不得省略。 四、法律定性一律回避。P06 的 B/C/D 类只呈现平台原文与官方登记记录原文的文本差异,并列出差异轴(机构/类别词/范围/地域/日期)。禁止使用'违规''涉嫌误导''非法''不合规''假牌照'等定性词。可用表述:'平台页面使用了 X 一词,而该编号对应的官方记录中的字段原文为 Y。'欧盟语境下可以指出 MiCA 对 CASP 的信息与费用政策公开有明确要求(条款以欧盟官方文本为准),但只能说明本指标测的哪些条目与这类要求关注的信息类型相关,绝不做'满足/不满足'的判断。 五、排序受分辨力约束。平台间差异只有超过 MRD 才可描述为差异,否则必须明写'在本方法的分辨力内不可区分'。rank_sensitive 为 true 的平台不呈现名次,只呈现维度向量。一致性未达 α ≥ 0.80 的维度只能标注 tentative 且禁止用于平台间排序;α < 0.667 的维度不得发布任何合成数值。 六、成因必须拆开。低分要说明构成:是 0 分(检索不到)、1 分(不具体)、还是可达性差(ACC 低)。把'内容缺失'与'内容难找'混为一谈是本指标最常见的误读来源。GAP 要单独解释为签约前信息缺口,VOL 要单独解释为分数的保质期,三者都不得并入总分。 七、绝不与实测指标合成。DCS 不得与费率实测、执行质量、提现耗时等运行时基准加权成任何'综合评分'——文档层读数与运行时读数在证据等级上不同类,合成会让两者都失去含义。跨基准只做并列呈现与交叉引用。 八、被测方与我们的关系必须透明。发布必须写明:已向各平台发送事实核对包、回应期长度、哪些平台回应、哪些未回应(未回应不等于默认承认)、哪些条目因事实指正而更正、更正导致的分值变动。任何商业接触一律披露。 九、局限与自曝并重。每次发布必须包含:语料可能不完整(限频/robots/地理封锁导致的缺口)、评分员无法对平台身份盲化、构念效度未做外部验证、样本仅 5 个平台不具代表性、退役条目与 AD4 记录清单。方法论刊物的可信度来自把自己的缺陷写在正文而非脚注。 十、版本纪律。所有语言版本(中/英/其它)必须使用同一 metric_id、同一数据集、同一组数字;翻译不得重新解释锚点。数据修正走 errata + 补丁版本,标准修改走次版本/主版本并重新采集,旧版本永久可访问。引用本指标的第三方应被要求注明版本号与访问日期。