DOCUMENTARY RESEARCH / EN-IE7 EVIDENCE RUNS · PUBLIC EVIDENCE REVIEWED
AXIALPROOF / RESEARCH LAB

MEASUREMENT SPECIFICATION

流动性韧性

规定一套任意第三方可独立复现的测量程序,把中心化加密交易平台的「流动性韧性」从形容词变成带单位、带不确定度的数:冲击成本曲线 C(x)(把中间价推动 x bps 所需名义金额)、深度补充时间常数 τ 与非参数恢复时间 RT50/RT90、深度的时间稳定性与日内模式、以及幽灵深度率 GDR(展示深度与实际可成交深度之差);并规定一套扰动预算受控的主动探针设计,使测量本身不显著影响被测市场。

METRIC ID
AXP-LQR-v1
PROCEDURES
7
RECORDED FIELDS
125
DATASET
NOT COLLECTED
DATASET / NOT COLLECTED

This page publishes a measurement specification, not results. No figure on it was produced by running the protocol against any venue. When a dataset exists it will be released separately, versioned against the metric identifier above, with the raw responses and their checksums attached.

RATIONALE

WHY THIS NEEDS A STANDARD

现行做法几乎全部停在静态快照:±1% 深度、盘口价差截图、24h 成交量。这三个数都由平台自己吐出,成本极低且可被无成本地制造——挂单可以随时撤、成交量可以自成交刷出、深度图可以只渲染前若干档。更根本的问题是快照回答不了用户真正会遭遇的三个问题:真的下单能不能成交、吃掉一档之后多久补回来、行情剧烈时深度还在不在。 同时,横向比较在方法层面就是坏的:不同评测按档位聚合而非按 bps 聚合、采样时点差几十秒、把 BTC/USD 与 BTC/USDT 混为一谈、用均值报告被单笔巨额挂单拉高、把接口截断当成深度不足。这些差异会让同一家平台在两份评测里差出一个数量级,读者无法判断谁对。第三方聚合站(CoinGecko、CoinMarketCap 一类)的深度与流动性评分同样是从平台公开接口抓的展示深度,属于同源证据,不构成独立验证。 韧性还直接对应可量化的用户损失:滑点、压力期的深度撤离、清算连锁。欧盟视角下,MiCA Title V 对交易平台运营者规定了公平有序交易、订单执行政策与交易前/交易后透明度义务,交易前透明度的对象正是本基准测量的那批公开报价与深度数据;一个公开、可复现的「展示深度 vs 可成交深度」测量,给读者一个独立于平台自报的核对量。本基准只提供测量与数据,不对任何平台作合规定性或法律意见。

OUTPUT

WHAT GETS PUBLISHED

**(一)方法页 —— axialproof.com/methods/axp-lqr-v1** 内容包含:目标与边界声明(本基准能确立什么、不能确立什么,单列一节);术语与符号表(mid、δ、D(x)、I(N)、C(x)、τ、RT50/RT90、R∞、GDR_fill/GDR_price/GDR_net、g₀/g₁、SDR、σ_inst、n_eff);LQR-01 至 LQR-07 七条协议全文(含公式、固定参数与其取值理由);参数冻结表与 prereg.json 的 SHA-256 及冻结时间戳;探针规模规则、扰动预算上限与硬停条件;法律与伦理红线清单;统计与不确定度规范(三层不确定度、可分辨性闸门、删失与缺失约定、FDR);跨平台可比性规则(bps 聚合、删失闸门、计价币差异、时钟对齐、REST_POLL 平台的精度降级);表述规范与禁忌(即 reporting_notes 全文);复现套件使用说明(一条命令跑通);负控制与合成注入校验报告摘要;变更日志与版本迁移说明;利益冲突、资金来源与更正政策。方法页在没有任何实测数据的情况下也应当是完整、可执行、可批评的——这是本刊与评测站的分界线。 **(二)开放数据集 —— AXP-LQR 数据集 v1.x(GitHub release + Zenodo DOI)** 表(CSV RFC 4180 / UTF-8 与 Parquet 双格式,各配一份 Frictionless Table Schema): 1. `lqr_instrument` —— 采集仪校准、簿重建保真度、σ_inst 标定、限流实测(LQR-01) 2. `lqr_icc` —— 逐 1 秒快照的冲击成本曲线点与删失标记(LQR-02) 3. `lqr_recovery_events` —— 自然冲击事件、RT50/RT90、τ 与拟合质量、外生性分层(LQR-03) 4. `lqr_probes` —— 主动探针与空白对照的逐笔记录、扰动预算占用、硬停事件(LQR-04) 5. `lqr_gdr` 与 `lqr_gdr_model` —— 逐笔幽灵深度率、配对净值、延迟回归结果(LQR-05) 6. `lqr_quote_dynamics` —— 报价存活时间、闪烁频次等非侵入代理(LQR-05) 7. `lqr_stability` 与 `lqr_intraday` —— 稳定性、日内 96 桶曲线、压力期保有率(LQR-06) 外加 `lqr_manifest`(版本、哈希、许可、缺失约定、比较总数等发布元数据)。 随附:原始 WS/REST 归档(按平台/对/日分片,zstd 压缩)+ 逐片 SHA-256 清单——平台条款不允许再分发行情数据时降级为 HASH_ONLY 模式,只发哈希清单与采集代码并注明条款出处;采集器与分析代码(固定 commit + Dockerfile + 依赖锁 + container digest);随机种子与预生成的探针时刻表;prereg.json;golden test 期望输出哈希与 CI 运行记录;合成注入校验报告与合成数据(独立目录,文件名与 README 均标 SYNTHETIC,绝不混入观测表);负控制报告;两次独立执行的派生表哈希比对记录;stress 秒集合 S 的完整清单;固定参考汇率表。 许可与版本:数据 CC BY 4.0,代码 MIT,铸 DOI;规范版本 AXP-LQR-v1 与数据集 semver 分列于每张表的元数据中,勘误发补丁版本并永久保留旧版本可访问。

PREREQUISITES

What must exist before a single measurement is taken.

A benchmark that skips these produces numbers, not evidence. Every item is a precondition of the protocol, not a recommendation.

P-01

条款前置审查(一票否决项):先抓取并存档被测与对照平台的用户协议、API 条款、行情数据使用条款(记录 URL、版本日期、抓取 UTC 时间、页面哈希)。若条款禁止程序化下单或自动化行情采集,则该平台不执行 LQR-04/05 主动探针,仅执行 LQR-01/02/03/06 被动观察,并在方法页与数据集中显式披露「因条款限制未做主动测量」。禁止用 VPN 或任何地区伪装规避可用性限制;平台在爱尔兰/欧盟不可用时记为 NOT-AVAILABLE-IN-JURISDICTION,不得替换出口再测。

REQUIRED
P-02

账户:被测平台完成 KYC 的探针账户 1 个(仅现货、无杠杆、无借贷);行情采集走公开接口或独立只读通道。同一团队的任何其他账户在测试期内不得在被测交易对上留任何挂单——本设计全程不留挂单,禁止跨账户对敲、自成交或任何形式的互为对手方。

REQUIRED
P-03

对照平台:Binance(深度上限基准)与 Kraken、Crypto.com、Coinbase 之中至少两家(中型与受监管基准),具备同等现货权限;API key 一律 IP 白名单、禁用提现权限、禁用杠杆,key 与密钥不入库、不入数据集、不入截图。

REQUIRED
P-04

采集机:1 台专用主机或 VPS,chrony/NTP 持续同步,记录时钟 offset 与 jitter;全程同一网络出口、同一进程时基,禁止跨机器分别采两家平台。第二路采集器用于仪器噪声标定(见 LQR-01),条件允许时使用不同 IP 与不同账户状态。

REQUIRED
P-05

交易对映射表:逐平台登记 BTC/USDT、ETH/USDT(必测)与第三个在被测与至少两家对照平台同时存在的对;写清计价币(USDT/USDC/USD/EUR)、tick size、lot size、最小下单名义。计价币不同的对必须单独标注,且 USDT/USD 或 USDC/USD 的偏离要同期记录,作为 bps 口径的不确定度来源。

REQUIRED
P-06

通道探测与体量预估:正式采集前先做 24 小时试采样,登记每个平台可得的行情通道(REST 快照 / WS 增量 / 仅 DOM)、depth limit 上限、最深可得档位相对中间价的 bps 偏离、限流阈值;据实测体量配置存储(不要凭估计配盘),并据「最深可得档位」确定跨平台可比的 x 值上限。

REQUIRED
P-07

参数预注册:在正式采集开始前冻结全部可调参数(交易对集合、观测窗口、x 值集合、事件检测阈值 κ、恢复窗口 W、探针规模规则与硬上限、随机种子、降级优先级),生成 prereg.json 并公开其 SHA-256 与冻结时间戳。任何事后改动必须发新版本号并在变更日志中写明改了什么、为什么、对已发布结果的影响。

REQUIRED
P-08

资金:探针为真实市场单,涉及真实资金。建议单笔探针名义 €25–200(低流动性对取下限,由 LQR-04 的规模规则最终决定);单平台在测期间的账户余额上限建议 €300,全部平台合计营运资金建议 €600–1,200;预期手续费与往返滑点损耗按 LQR-04 的成本公式用导航样本实测后估算,不得凭空写数。资金必须为团队自有,禁止使用他人银行账户、禁止杠杆与借贷。测试结束后立刻发起全额提现并记录(提现能力本身不属于本基准,但资金安全属于执行纪律)。

REQUIRED
P-09

速率纪律:行情采集与探针共用一份速率预算,低于文档声明阈值的 50% 运行;收到 HTTP 429/418 或任何限流信号立即停止该轮、指数退避并记录事件,禁止换 IP 绕过。禁止任何渗透测试、撞库、鉴权绕过、未公开接口逆向;只使用平台公开文档接口或登录态下的正常前端请求。

REQUIRED
P-10

代码与数据纪律:采集器与分析代码全程版本控制,每一批数据绑定 commit hash 与随机种子;原始响应原样落盘(JSONL + 逐片 SHA-256),派生表一律可由原始档 + 代码重算,禁止只保存加工结果。

REQUIRED

PROTOCOL

7 procedures, each with its own evidence boundary.

Every procedure states what its output can support and what it cannot. The second of those is the one that keeps a measurement honest.

LQR-01

采集仪校准与订单簿重建保真度:先证明仪器没坏,再谈平台

  1. 建立统一时基。采集机启用 chrony/NTP,连续记录 offset 与 jitter;对每次请求同时记录本地发出时刻 t_send 与收到时刻 t_recv,取 t_mid = t_send + RTT/2 作为该快照的估计服务器时刻;若响应体含服务器时间戳,另记 skew = t_server − t_mid。要求 |offset| 中位数 ≤ 5 ms,否则暂停采集修复时钟。
  2. 逐平台建立订单簿本地重建管道:REST 全量快照做基线 + WS 增量流做更新,按各平台的序列号规则校验连续性,逐条记录 seq gap。无 WS 的平台退化为定频 REST 轮询,并在数据集中把 book_source 标为 REST_POLL(该平台的 τ 与 GDR 精度上限由轮询间隔决定,必须在报告中写明)。
  3. 把 depth limit 推到平台允许的上限,记录实际返回档位数与最深档相对中间价的 bps 偏离。这两个数决定后续 x 值集合的可比上限——不是文档声称值,是实测返回值。
  4. 重建簿对账:每 60 秒拉一次 REST 全量快照,与同时刻的本地重建簿比对前 20 档(价格与数量逐档全等),计算 mismatch_rate;同时统计交叉盘(best_bid ≥ best_ask)、零量档、重复价、乱序的出现次数。
  5. 仪器噪声标定(核心步骤):同一时段跑两路完全独立的采集器 A/B(独立进程,条件允许时独立 IP 与不同账户状态),把两路重建簿降采样到同一 1 秒网格,计算同侧同带宽深度的对数相对差 |ln(D_A/D_B)|,报告其 p50 与 p95,记为 σ_inst。此后所有跨平台差异必须大于 σ_inst(p95) 才允许被称为差异。
  6. 客户端差异性探查:A/B 两路若使用不同 IP 与不同登录态,比较两路看到的最优五档一致率。一致率显著低于对照平台的同项一致率,是一个需要记录的观测——但它不能单独证明平台按客户端定制订单簿,只能作为需要后续设计验证的线索。
  7. 金标准回放校验:在 Binance BTC/USDT 上跑完整管道,重建簿与该平台自身 REST 快照的 mismatch_rate 应落在预注册的合格阈内。管道在已知高流动性市场上就给出异常值,说明是仪器问题,此时禁止对任何平台出结论。
  8. 把限流阈值实测出来:从低频起步阶梯加压,记录首次 429 时的实际请求速率,随后把工作速率固定为该值的 50% 以下并写入参数表。触发 429 即停并退避,禁止换 IP 重试。
Quantity measured
skew = t_server − (t_send + RTT/2);mismatch_rate = #{60 秒对账中前 20 档不全等的次数} / #对账次数;σ_inst(x) = quantile_p50/p95 over t of |ln(D_A(t;x) / D_B(t;x))|,其中 D 为该侧 ±x bps 内名义深度;可比性门槛:任一跨平台比较量 |Λ| ≤ σ_inst(p95) 一律报为 NOT-DISTINGUISHABLE。
Fixed parameters
NTP offset 合格阈 |p50| ≤ 5 ms;对账频率 60 s;对账档位数 20;1 秒重采样网格(取该秒内最后一次有效簿状态);σ_inst 标定时长 ≥ 24 h 且跨越至少 6 个 UTC 时段;工作请求速率 ≤ 实测 429 阈值的 50%。取 60 秒对账是因为它足够密到能抓住重建漂移,又稀疏到不占用速率预算;20 档是各平台普遍都能返回的交集档位数,避免因某平台返回少而无法对账。
Sample size
每平台每对 ≥ 24 小时连续双路采集用于 σ_inst 标定,覆盖 ≥ 6 个 UTC 时段(含亚洲、欧洲、美洲活跃时段与各自的低谷);限流阶梯测试 2 轮(不同时段);时钟 offset 采样 ≥ 1000 点。σ_inst 的 CI 用 stationary bootstrap 给出;若 σ_inst(p95) > 0.15(即两路差异中位数级别已达 15%),判定管道不合格,先修管道再采数。
Control
三点对照同时成立:①同一进程、同一机器、同一网络出口对全部平台执行完全相同的探测与对账逻辑,任何平台专属的处理分支必须在代码中显式标注并在方法页披露;②Binance 作为金标准,管道在其上的表现是全部平台的仪器基线;③A/B 双采集器互为对照,把「平台的差异」与「我们的噪声」分开。
Statistical treatment
σ_inst 与各比率均报中位数与 p95,CI 用 stationary bootstrap(B=10,000,期望块长 L=2τ_ac,τ_ac 由 ln D 序列的积分自相关时间估计)。任何比率的分母(对账次数、快照数)必须随比率一起发布,禁止只报百分比。数据缺口不做插补,按缺口时段单独列表披露;缺口在压力期集中出现时,后续所有涉及压力期的结论必须做最坏情况敏感性分析。
Reproducibility check
发布 golden test:第三方用我们发布的原始 JSONL 与固定 commit 跑分析代码,应重算出逐位一致的 lqr_instrument 表(浮点容差 1e-9),CI 里固化期望输出哈希。第三方若自行采集,应在同一平台同对上得到落在我们 σ_inst 报告区间内的双路一致性——这是「我们没测错」的第一道证据。管道在 Binance 金标准上的 mismatch_rate 报告一并发布,供第三方与自己的管道横比。
Known pitfalls
最常见的坑是把 depth 接口默认返回的少数档位当成平台全部深度,必须先把 limit 推到上限;其次是用不同机器分别采两家平台,地域路由与延迟差会让快照时间对不齐;再次是把加工后数据落盘导致事后无法复算;还有一个隐蔽的坑是「1 秒网格取该秒第一条还是最后一条」在跨平台不一致,会系统性偏移深度——必须统一为最后一条并写进参数表。REST_POLL 平台的轮询间隔如果大于其他平台的 WS 更新间隔,恢复时间与幽灵率会被系统性低估或高估,必须在结论中降级表述。
Risk
不涉及资金。风险在于高频探测触发风控或封 IP:先低频试探、阶梯加压、429 即停并退避;压力探测使用与探针账户不同的通道与时段,避免影响后续下单账户的可用性。

SUPPORTS / 支持关于采集管道自身精度的定量陈述:时钟对齐水平、订单簿重建保真度、仪器噪声下界 σ_inst、各平台实测可得的最深档位与限流阈值;并为后续所有协议提供一条可被第三方复算的方法学地基与「差异必须大于噪声」的判定门槛。

DOES NOT SUPPORT / 完全不能支持任何关于流动性好坏的结论。有 API 不代表数据真实,没 API 也不代表流动性差;depth limit 低只是接口设计选择;偶发 5xx 不能读作平台不稳定,必须与对照平台同期基线比较。尤其要注意文档类证据的边界:平台 API 文档里写的 depth limit、限流阈值、「实时推送」「毫秒级撮合」,只能确立平台如此声称并提供了某个接口,不能确立返回的簿是完整的、真实的、或与撮合引擎一致的。第三方聚合站的深度指标抓的是同一批公开接口,属于同源证据,不构成独立验证。A/B 双路一致率低也不能证明平台按客户端定制订单簿——只能证明我们观测到了差异,归因需要专门设计。

EVIDENCE RETAINED / DevTools 导出的 HAR(覆盖每个平台的行情页与接口调用) · 每个接口的原始 JSON 响应含请求头与响应头(脱敏 key 后) · chrony/NTP 校时命令的完整输出 · 限流阶梯测试的完整请求日志与 429 原始响应 · A/B 双路的原始 JSONL 分片与逐片 SHA-256 清单 · 采集器与对账脚本的 commit hash 与运行日志
RECORDED FIELDS (20)
  • platform / / baerx / binance / kraken / crypto_com / coinbase,全小写下划线
  • pair / / 统一写 BASE/QUOTE,计价币必须写实,禁止把 USD 与 USDT 归一
  • collector_id / / A 或 B,标定双路一致性用
  • book_source / / WS_INCREMENTAL / REST_SNAPSHOT / REST_POLL / DOM_SCRAPE,决定该平台精度上限
  • capture_start_utc / capture_end_utc / ISO-8601 UTC ms / 该采集段的起止
  • clock_offset_p50_ms / clock_offset_p95_ms / ms / 采集机相对 NTP
  • server_skew_p50_ms / ms / 平台服务器时间戳 − 校准本地时刻;平台不返回时间戳时记 NA,不记 0
  • rtt_p50_ms / rtt_p95_ms / ms / 跨平台延迟差异的披露依据
  • ws_seq_gap_count / ws_msg_count / 次 / 条 / 增量流完整性
  • rebuild_mismatch_rate / % / 60 秒对账中前 20 档不全等的比例
  • crossed_book_count / zero_qty_level_count / dup_price_count / / 簿自洽性异常,分列不合并
  • depth_limit_max / / 实测返回的最大档位数,非文档声称值
  • deepest_offset_bps / bps / 最深档相对 mid 的偏离,买卖侧分记;决定 x 值可比上限
  • sigma_inst_p50 / sigma_inst_p95 / —(对数比绝对值) / 仪器噪声下界,跨平台差异的判定门槛
  • client_view_agreement_rate / % / A/B 双路最优五档完全一致的快照占比;单 IP 条件下记 NA
  • rate_limit_observed / req/s / 首次 429 时的实际速率
  • http_429_count / / 每次触发都要记录并说明退避处理
  • valid_second_ratio / % / 1 秒网格上有有效簿状态的比例,缺口时段单独列出
  • code_commit / seed / / 每批数据必须绑定,保证可复算
  • raw_archive_sha256 / / 该采集段原始 JSONL 分片的校验和清单文件哈希
SPECIFICATION
LQR-02

冲击成本曲线 ICC(x):把「深度」换成「把价格推动 x bps 要多少钱」

  1. 对 1 秒网格上的每个有效簿快照,取 mid m = (best_bid + best_ask)/2(一律用盘口中价,禁止用 last price 或指数价),计算每档相对偏离 δ_i = (p_i − m)/m × 10^4 [bps]。
  2. 单侧累积:买方向沿 ask 逐档累加名义 N_k = Σ_{i≤k} p_i·q_i 与数量 Q_k = Σ_{i≤k} q_i,VWAP(N) 在档内按比例线性插值;价格影响 I(N) = (VWAP(N)/m − 1) × 10^4 [bps]。卖方向沿 bid 对称处理,取符号绝对值。
  3. 求反函数得冲击成本曲线:C_side(x) = inf{N : I(N) ≥ x},用 I 的单调分段线性插值精确求解,而不是取「最接近的那一档」。x 取预注册集合 {5, 10, 25, 50, 100, 200} bps。
  4. 删失处理(关键):若该侧全簿的总名义 N_total 对应的 I(N_total) < x,说明簿根本推不到 x bps 或接口截断了,记 C_side(x) = CENSORED,同时记录下界 N_total 与 deepest_offset_bps。严禁记 0、严禁线性外推、严禁用「最后一档斜率」延伸。
  5. 跨平台可比性闸门:某个 x 只有在参与比较的全部平台该时刻都未删失时,才允许进入配对比较;否则该 x 在该时刻整体作废并计入 comparable_rate。全局的 x 上限由 LQR-01 实测的各平台 deepest_offset_bps 的最小值决定。
  6. 计算派生量:不对称度 A(x) = ln(C_ask(x)/C_bid(x));对称摘要 C̄(x) = sqrt(C_ask(x)·C_bid(x))(两侧任一删失则 C̄ 不可算,记 NA)。
  7. 跨平台配对比较:同一 1 秒时刻、同一交易对、同一 x,计算 Λ(x) = ln(C̄_target(x)/C̄_control(x)),对全部有效时刻取中位数与 block bootstrap CI。必须是逐时刻配对再汇总,不能各自先汇总再相除——后者会被两平台不同的缺口时段混淆。
  8. 汇率归一:报告保留原计价币金额,同时给出 EUR 折算列,汇率取每个 UTC 日 00:00 的单一固定参考汇率(来源与时点预注册并记录在案),不用逐笔实时汇率——固定汇率让第三方能用同一张汇率表复算。
Quantity measured
m = (p₁ᵇ + p₁ᵃ)/2;δ_i = (p_i − m)/m × 10⁴;D_side(x) = Σ_{|δ_i| ≤ x} p_i·q_i;I(N) = (VWAP(N)/m − 1) × 10⁴,VWAP 档内线性插值;C_side(x) = I⁻¹(x)(单调插值);若 I(N_total) < x → CENSORED,下界 = N_total;A(x) = ln(C_ask(x)/C_bid(x));C̄(x) = √(C_ask(x)·C_bid(x));跨平台比较量 Λ(x) = median_t [ ln(C̄_target(t;x)/C̄_control(t;x)) ]。
Fixed parameters
x ∈ {5, 10, 25, 50, 100, 200} bps(预注册);1 秒网格取该秒最后一个有效簿状态;深度带宽以 bps 而非档位聚合;EUR 折算用每 UTC 日 00:00 的固定参考汇率。选 bps 而非档位,是因为档位数在不同 tick size 下完全不可比;选 5 bps 作为下限,是因为它通常落在盘口一到两档内,能刻画最优报价的厚度;选 200 bps 作为上限,是因为再深就普遍触发删失、比较价值下降。
Sample size
每平台每对连续 ≥ 14 天(最低可接受 7 天)1 秒网格快照,三平台以上严格同窗;有效快照率 < 90% 时必须披露缺失率与缺失时段分布,并对涉及压力期的结论做敏感性分析。名义样本量 N ≈ 86,400 × 天数,但报告必须同时给出有效样本量 n_eff = N/(2·τ_ac)(τ_ac 为 ln D 的积分自相关时间,通常令 n_eff 比 N 小一到两个数量级)——所有 CI 基于 n_eff 而非 N。另做 20 组人工 UI 截图与同时刻 API 响应的配对核对,确认前端展示与接口口径一致。
Control
Binance 作为深度上限基准,Kraken 或 Crypto.com 作为中型基准,Coinbase 作为受监管美式基准;同一进程、同一 5 秒窗口内完成三家的同一交易对采集,同一 bps 聚合口径,同一插值实现。被测平台独有的交易对不设对照,明确标注 NO-CONTROL 且不参与任何跨平台陈述。计价币不同的对(USD vs USDT)必须单列,并把同期 USDT/USD 偏离作为该对 bps 口径的额外不确定度分量披露。
Statistical treatment
一律用分位数报告(p10/p25/p50/p75/p90),绝不用均值——单笔巨额挂单会把均值拉到毫无意义。CI 用 stationary bootstrap(Politis–Romano,B=10,000,期望块长 L = 2·τ_ac)以吸收强自相关。删失数据用生存分析处理:C(x) 的中位数用 Kaplan–Meier(右删失)估计;删失率 > 30% 时只报下界并标 CENSORED-DOMINANT,禁止报点估计。跨平台差异用配对对数比的 Hodges–Lehmann 估计 + bootstrap CI,不用 t 检验(分布重尾)。任何 |Λ| ≤ σ_inst(p95) 的差异一律报为 NOT-DISTINGUISHABLE。
Reproducibility check
C(x) 是簿的确定性函数:第三方拿到我们发布的原始簿归档与固定 commit,必须重算出逐行一致的 lqr_icc 表(浮点容差 1e-9),这是硬性 golden test。另发布一组人工构造的合成簿(含刻意的档内插值边界、删失边界、交叉盘异常)与期望的 C(x) 输出,作为插值实现的单元测试集——第三方用自己的实现跑这组合成簿,输出不一致即说明两边口径不同,可以在比较结果之前先对齐口径。
Known pitfalls
①按档位而非 bps 聚合会得到完全错误的跨平台结论;②三家平台采样时间错开哪怕 30 秒,遇行情跳动即不可比;③把 BTC/USDT 与 BTC/USD 混算;④用均值报告被单笔巨额挂单拉高;⑤把删失当成 0 或线性外推——这是最容易被外部批评击穿的一处;⑥接口截断导致 deepest_offset_bps 很小却没被发现,整个 x=100/200 档全是假的可比;⑦忘了剔除自己的挂单(本设计不留挂单,但仍需 OWN_ORDER_PRESENT 标记做保险);⑧档内线性插值的实现细节(是否按数量线性)在两个实现间不同,会造成系统性偏差,必须用合成簿单元测试锁死。
Risk
不涉及资金。主要风险是长时间高频采集触发限流:工作速率固定在实测 429 阈值的 50% 以下,遇 429 即停并退避;14 天连续采集要有断点续采与完整性核对,禁止用重采填补缺口后当作连续数据发布。

SUPPORTS / 支持这样的表述:在某段明确的 UTC 窗口内、以 N 个同步 1 秒快照观测、在指定交易对上,把中间价推动 x bps 所需的账面名义金额的配对中位数为对照平台的 k 倍(95% CI 给出),且在 x=… 档的删失率为 …%。也支持刻画买卖两侧的账面不对称度,以及跨平台可比时刻的占比。

DOES NOT SUPPORT / 不能证明这些挂单是真实的、可成交的——ICC 是账面(book-implied)冲击成本,与实际成交冲击的差正是 LQR-05 要测的量,必须由主动探针交叉验证。不能外推到簿最深档之外(删失点是硬边界)。不能由 ICC 推断成交量的真实性、平台是否有真实用户、偿付能力或提现能力。不能推广到未测交易对或观测期之外。文档类证据的边界尤其要写清:平台的深度图截图、白皮书里的「机构级流动性」、做市商合作公告、第三方聚合站的 depth 分数,都无法确立 ICC——因为它们的聚合口径(按档还是按百分比)、时点、是否截断全都不可知,而 ICC 的全部意义就在于口径被固定下来了。

EVIDENCE RETAINED / 逐条原始 depth JSON 的 JSONL 归档与逐片校验和 · ICC 计算脚本与 commit hash · 20 组 UI 截图与对应 API 响应的配对文件(含系统时间) · 删失事件的完整清单(时刻、平台、对、side、x、下界) · 有效/无效快照的完整日志与缺口时段表 · 固定参考汇率表及其来源截图
RECORDED FIELDS (18)
  • snapshot_ts_utc / ISO-8601 UTC ms / 1 秒网格时刻;另存 t_send/t_recv 两个原始时刻
  • platform / pair / side / / side ∈ {bid, ask},两侧分行不合并
  • mid / 计价币 / (bid₁+ask₁)/2,禁止用 last price
  • spread_bps / bps / (ask₁ − bid₁)/mid × 10⁴
  • x_bps / bps / 目标冲击档,取值限于预注册集合
  • C_x_notional / 计价币 / 把价格推动 x bps 所需名义金额;删失时留空并置 censored_flag
  • C_x_notional_eur / EUR / 用当日固定参考汇率折算,汇率与时点同行记录
  • censored_flag / / OK / CENSORED;CENSORED 时禁止在任何统计中当作数值参与
  • book_side_total_notional / 计价币 / 该侧全簿名义,删失时作为下界使用
  • deepest_offset_bps / bps / 该侧最深档偏离;小于 x 时必然删失
  • levels_returned / / 用于判断是否被接口截断
  • D_10bps / D_50bps / 计价币 / 带宽内名义深度,供 LQR-03/06 复用
  • asym_A_x / —(自然对数) / ln(C_ask/C_bid),任一侧删失记 NA
  • comparable_flag / / 该时刻该 x 是否全部对照平台均未删失;只有 TRUE 行进入跨平台比较
  • fx_rate_used / fx_rate_ts / — / ISO-8601 UTC / 固定参考汇率及其时点,保证第三方能复算 EUR 列
  • collector_id / code_commit / / 绑定采集路与代码版本
  • raw_ref / / 原始归档文件名 + 行号,保证任一数字可回溯到原始响应
  • quality_flag / / NORMAL / MULTI_PLATFORM_UNSYNCED / MAINTENANCE / DATA_GAP / OWN_ORDER_PRESENT
SPECIFICATION
LQR-03

深度补充速度:从自然冲击事件估计恢复时间常数(零扰动,可大规模统计)

  1. 在 1 秒网格(或可得的更细网格)上构造每侧 ±10 bps 名义深度序列 D(t),并同步保留 spread(t)。
  2. 事件检测三条件同时成立才算一个合格事件:①稳态前置——t ∈ [t₀−30s, t₀) 内 D 的变异系数 CV ≤ 0.25 且无数据缺口;②冲击——存在 t₀ 使 D 在 ≤ 1 秒内跌至 D_pre 的 (1−κ) 以下,κ = 0.40,D_pre = median D over [t₀−30s, t₀);③可归因——记录触发类型(有逐笔成交流时判为 TRADE_BURST,只有簿变化无成交判为 CANCEL_BURST,无法判定记 UNKNOWN)。
  3. 跟踪事件后窗口 W = 120 秒的 D(t),计算非参数恢复时间:RT_q = inf{u > 0 : D(t₀+u) ≥ q·D_pre 且在 [u, u+2s] 内持续成立},q ∈ {0.5, 0.9}。要求「持续 2 秒」是为了排除单点闪回造成的假恢复。窗口内未达标记 CENSORED@120s。
  4. 参数拟合:对 D(t),t ∈ (t₀, t₀+W] 拟合 D(t) = D_∞ − (D_∞ − D₀)·exp(−(t−t₀)/τ),非线性最小二乘,约束 τ ∈ [0.1s, 600s]。报告 τ 及其 CI、拟合 R² 与残差的 Ljung–Box 检验。只有 R² ≥ 0.7 且残差无显著自相关时才置 fit_accepted = TRUE;否则该事件只报 RT50/RT90,τ 记 NA——指数恢复只是一个模型假设,不合适就不用,不许硬套。
  5. 恢复水平:R_∞ = median D over [t₀+W−30s, t₀+W] / D_pre。这是「补回来了多少」,与「多快补回来」是两个独立的量,必须分开报——恢复很快但只补回 40% 与恢复慢但补满,是完全不同的两件事。
  6. 价差恢复:同步测 spread 从冲击峰值回到事件前中位数所需时间 spread_recovery_s,作为深度恢复的独立佐证。
  7. 外生性分离(关键对照):对每个事件,检查同一秒对照平台在同一交易对上是否也检测到合格事件。全市场行情驱动的冲击会在多家平台同时出现,平台特有的冲击不会。据此把事件集合分为 MARKET_WIDE 与 PLATFORM_SPECIFIC 两层,分层汇总;跨平台比较恢复速度时,只在 MARKET_WIDE 事件子集上做配对比较——这样才是同一个外生冲击下的横向对比。
  8. 汇总:每平台每对每侧分别汇总 RT50 的中位数与 CI、τ 在对数域的中位数、R_∞ 的中位数、事件频次(每小时合格事件数)。事件数不足时按精度停止规则处理(见样本量)。
Quantity measured
D_pre = median{D(t) : t ∈ [t₀−30s, t₀)};κ_obs = 1 − D(t₀⁺)/D_pre;RT_q = inf{u>0 : D(t₀+u) ≥ q·D_pre ∀ 持续 2s},q ∈ {0.5, 0.9};恢复模型 D(t) = D_∞ − (D_∞ − D₀)·e^{−(t−t₀)/τ};R_∞ = median{D(t) : t ∈ [t₀+90s, t₀+120s]}/D_pre;事件频次 λ = #events / 观测小时数。跨平台比较:在 MARKET_WIDE 子集上 ΔRT50 = Hodges–Lehmann{ln(RT50_target) − ln(RT50_control)}。
Fixed parameters
带宽 ±10 bps(贴近盘口,才是真正被吃掉又要补回的那部分);稳态窗 30 s;稳态 CV 阈 0.25;冲击阈 κ = 0.40 且下降在 ≤ 1 s 内完成;恢复窗 W = 120 s;持续判定 2 s;τ 约束 [0.1, 600] s;拟合接受阈 R² ≥ 0.7。κ 取 0.40 是为了排除常规报价抖动、只抓真正的档位被吃穿;W 取 120 s 是在覆盖绝大多数补充过程与控制删失率之间的折中,若某平台 CENSORED@120s 比例超过 30%,须在方法页披露并对该平台附加一组 W = 600 s 的补充测量(作为 v1.1 候选改动登记,不改 v1 已发布数据)。
Sample size
目标每平台每对每侧 ≥ 100 个合格事件;n < 30 时不报点估计、标 UNDERPOWERED;30 ≤ n < 100 时可报点估计但禁止跨平台比较。采用预注册的精度停止规则而非事后功效:持续采集直到 RT50 的 bootstrap 95% CI 半宽 ≤ 中位数的 40%,或达到 14 天上限为止,二者先到为准。事件频次本身也是要报告的结果——某平台在 14 天内合格事件极少,这一事实必须原样发布(可能意味着深度极稳定,也可能意味着簿几乎不动),不得因样本不足而静默丢弃该平台。
Control
三层对照:①同一秒的跨平台事件共现判定,把外生行情冲击与平台特有冲击分开,跨平台恢复比较只在 MARKET_WIDE 子集上做;②同一平台内买侧 vs 卖侧互为对照,检验恢复速度是否方向性不对称;③σ_inst 门槛——恢复曲线的深度序列本身带仪器噪声,任何小于 σ_inst(p95) 的深度变化不得触发事件检测(把 κ 的判定与噪声下界绑定)。
Statistical treatment
RT50/RT90 是右删失数据,用 Kaplan–Meier 估计中位数与 CI,绝不把 CENSORED 当作 120 秒参与均值。τ 右偏严重,一律在对数域汇总(几何中位数),CI 用 stationary bootstrap。事件之间可能成簇(一次行情里连续多个事件),bootstrap 按事件簇整块重抽(簇定义:间隔 < 300 s 的相邻事件归为一簇),否则 CI 会被严重低估。跨平台比较用 MARKET_WIDE 子集上的配对对数差 + Hodges–Lehmann;多个对 × 多个 side × 多个指标时用 Benjamini–Hochberg 控制 FDR(q = 0.10)并公布检验总数。
Reproducibility check
两道:①确定性复算——事件检测与拟合全是原始簿序列的确定性函数,第三方用发布的归档与固定 commit 必须重现出同一份事件表(event_id 逐个对上);②合成注入校验——用记录下来的真实 WS 流做离线回放,在已知时刻人为删除指定比例的档位并按已知 τ* 逐步补回,检验估计器能否识别事件并还原 τ*。合格标准预注册为 |median(τ̂/τ*) − 1| ≤ 0.15 且 IQR(τ̂/τ*) ≤ 0.5。合成数据只用于校验估计器,必须与观测数据物理隔离、单独存放、绝不进入结果数据集。
Known pitfalls
①把接口更新延迟当成恢复慢——REST_POLL 平台的 RT50 分辨率上限就是轮询间隔,必须降级表述;②不做「持续 2 秒」判定,单点闪回会把 RT50 系统性压低;③把 CENSORED 当 120 秒算进中位数,直接把结论做反;④不分外生/平台特有就跨平台比恢复速度,比的其实是两段不同的行情;⑤事件成簇却按独立样本 bootstrap,CI 假窄;⑥硬套指数模型:很多补充过程是阶跃式(机器人一次性重铺),R² 会很差,此时 τ 毫无意义,只能用 RT50/RT90;⑦忘了 R_∞ 单独报,只讲「恢复快」而不讲「只补回一半」。
Risk
不涉及资金,全程被动观察,对市场零扰动——这是本基准中唯一可以大规模、长时间、对所有平台无差别执行的韧性测量,也是主动探针受限或被条款禁止时的唯一退路。风险仅在于长时间采集的存储与限流管理。

SUPPORTS / 支持这样的表述:在某段 UTC 窗口内、以 n 个合格的全市场共现冲击事件观测,某平台某对买侧 ±10 bps 深度恢复到冲击前 50% 的中位时间为 … 秒(Kaplan–Meier 95% CI 给出,删失率 …%),恢复水平中位数为冲击前的 …%,与对照平台的配对对数差为 …。也支持刻画事件频次、买卖侧不对称、以及价差恢复与深度恢复是否同步。

DOES NOT SUPPORT / 恢复快不等于流动性真实——自动挂单程序可以在毫秒级重铺一层随时会撤的报价,恢复速度本身对真假是中性的,必须与 LQR-05 的幽灵深度率联合解读。恢复慢也不等于平台差,可能只是那段行情所有平台都在撤单,这正是必须用 MARKET_WIDE 子集配对比较的原因。不能确立冲击的成因(成交还是撤单)——没有逐笔成交流的平台一律 UNKNOWN,不许从簿变化倒推成交。不能确立平台是否有做市商、有几家、是不是关联方。文档类证据在这里格外无力:做市商合作公告、「7×24 深度保障」的营销页、交易所自己发布的深度恢复图表,都无法确立恢复时间常数——它们既不给口径,也无法复算,而恢复时间的全部意义在于它是从可归档的原始序列上按固定规则算出来的。

EVIDENCE RETAINED / 每个事件的完整 ±120 秒深度与价差序列(CSV,可直接画图) · 事件检测与拟合脚本、commit hash、参数文件 · 作废事件清单(含作废原因:缺口 / 前置不稳 / 噪声下界未过) · 跨平台共现判定的中间表 · 合成注入校验的完整报告与合成数据归档(单独目录,README 标注 SYNTHETIC-DO-NOT-PUBLISH-AS-OBSERVATION)
RECORDED FIELDS (18)
  • event_id / / platform_pair_side_t0 的确定性哈希,保证第三方重算出同一 id
  • platform / pair / side / / 买卖侧分行
  • t0_utc / ISO-8601 UTC ms / 冲击起始时刻
  • D_pre_notional / 计价币 / 事件前 30 秒 ±10bps 中位深度
  • pre_cv / / 稳态前置的变异系数,必须 ≤ 0.25
  • kappa_obs / / 实测跌幅比例 1 − D(t₀⁺)/D_pre
  • trigger_type / / TRADE_BURST / CANCEL_BURST / UNKNOWN;无逐笔成交流的平台一律 UNKNOWN,不得猜
  • trade_notional_in_event / 计价币 / 事件窗内成交名义;无成交流时记 NA
  • RT50_s / RT90_s / s / 恢复到 50%/90% 所需秒数;未恢复记 CENSORED@120
  • tau_s / tau_ci_low / tau_ci_high / s / 指数拟合时间常数;fit_accepted=FALSE 时记 NA
  • fit_r2 / fit_ljungbox_p / — / p 值 / 拟合质量,决定 τ 是否可用
  • fit_accepted / bool / R² ≥ 0.7 且残差无显著自相关
  • R_inf / / 恢复水平比;可以 > 1(补过头)
  • spread_pre_bps / spread_peak_bps / spread_recovery_s / bps / bps / s / 价差的独立恢复证据
  • exogeneity_class / / MARKET_WIDE / PLATFORM_SPECIFIC;由跨平台同秒共现判定
  • cooccurring_platforms / / 同秒检出合格事件的平台列表
  • data_gap_flag / bool / 事件窗内有缺口则整个事件作废并计入作废清单
  • code_commit / raw_ref / / 可回溯到原始簿归档
SPECIFICATION
LQR-04

最小扰动主动探针:规模规则、扰动预算、空白对照与硬停条件

  1. 条款闸门:确认该平台条款允许程序化下单;不允许则本协议对该平台整体跳过,在数据集中记 PROBING_NOT_PERMITTED 并披露理由与条款出处。这一步没有例外。
  2. 导航样本(pilot):每平台每对先跑 30 个最小规模探针,实测 taker 费率、实际滑点、拒单率与 RT90,用于确定正式探针规模与总成本估算。导航样本单独标记 is_pilot = TRUE,参与成本估算但不参与最终统计结论。
  3. 探针规模规则(三重取小):Q_probe = min{ 0.5 × C_book(5 bps), 0.05 × V_60s, Q_cap },其中 C_book(5bps) 由 LQR-02 在下单前一刻的簿实时算出,V_60s 为过去 60 秒该对的观测成交额,Q_cap = €200(预注册硬上限)。若 Q_probe 小于平台最小下单名义,则该对标记 NOT-PROBEABLE,只做被动观察——宁可测不了,也不放大扰动。
  4. 扰动预算:单对单日全部探针名义之和 ≤ 5×10⁻⁴ × V_24h,V_24h 取平台自报成交额与我们观测成交流二者的较小值(保守取小)。预算用尽即当日停测该对,budget_used_ratio 逐笔记录。
  5. 订单类型:一律 IOC 限价单,价格上限 cap = mid × (1 ± 20 bps)。用 IOC 是因为它绝不在簿上留残单——我们全程不提供流动性、不污染被观测的簿、也不可能与自己成交。禁止市价单(无价格保护),禁止任何会留存的挂单。
  6. 时刻表与随机化:探针触发时刻由固定随机种子在每个 UTC 时段内预生成(时刻表随规范一起公开),避免与做市程序的整分/整点刷新周期共振,也保证第三方能拿到同一张表检查我们没有挑时点。探针最小间隔 ≥ max(60 s, 10 × RT90_p50),保证前一次扰动完全消散、探针之间相互独立。
  7. 方向选择与库存控制:净库存 inv ≥ +Q/2 时下一次探针为 SELL,inv ≤ −Q/2 时为 BUY,否则由种子随机决定。库存被约束在约一个探针规模之内,方向性市场风险可忽略;每个采集时段结束时强制平掉残余库存并记录。禁止用「立刻反向对冲」的配对做法——那会让两次探针在 5 秒内相邻,破坏独立性。
  8. 空白对照(sham probe,核心设计):同一张随机时刻表的另一半时刻只观测簿、不下单,按与真实探针完全相同的 Δt 分布计算「如果下单会成交多少」。sham 与真实探针在时段、交易对、side 上做分层配对。它给出的是「不下单时簿在同样延迟内的自然演化」,是把延迟成分从幽灵深度率里扣掉的唯一干净手段。
  9. 同步对照探针:在同一时刻表上对至少两家对照平台执行同规格探针(规模按各自的 C_book(5bps) 规则各自计算,不强求金额相同),得到行业基线。缺了这一步,任何 GDR 数字都无法解读。
  10. 硬停条件(任一触发即停该对当日测试并记录):连续 3 次探针的实际冲击 I_real > 50 bps;收到 429/418 或任何风控提示;账户被限制或出现异常验证;价差扩大到常态中位数的 5 倍以上;当日扰动预算用尽;净库存超过 2×Q_cap。停测事件必须原样发布,不得删除。
Quantity measured
Q_probe = min{0.5·C_book(5bps), 0.05·V_60s, Q_cap};日预算约束 Σ_day Q ≤ 5×10⁻⁴ · V_24h;探针间隔 ≥ max(60 s, 10·RT90_p50);I_real = (VWAP_fill/m(t_obs) − 1)×10⁴ [bps],基准 mid 取观测时刻 t_obs 的 mid 以与 I_book 同基准;市场占用率 share = Q_probe / V_60s;预期资金损耗 E[cost] ≈ N_rt × Q × (2·f_taker + s̄_spread + 2·Ī_real)/10⁴,其中 N_rt 为等效往返次数、f 与 s 以 bps 计——用导航样本实测值代入,禁止凭空填数。
Fixed parameters
Q_cap = €200;价格保护 cap 偏移 20 bps;单对日预算系数 5×10⁻⁴;探针最小间隔 60 s 与 10×RT90 取大;导航样本 30 笔/对;硬停阈 I_real > 50 bps 连续 3 次、价差 5× 常态。20 bps 的价格保护是在「不因保护过紧而人为制造拒单」与「不因保护过松而承担极端滑点」之间取的折中,并与 x 值集合中的 25 bps 档错开,避免保护线正好落在测量点上。5×10⁻⁴ 的日预算系数意味着我们的全部探针合计不超过该对当日成交额的万分之五,这是对「不显著影响市场」的可核验承诺,而不是一句保证。
Sample size
正式探针目标每平台每对每侧 ≥ 120 笔(最低 60 笔),配套等量 sham,分布在 ≥ 6 个 UTC 时段 × ≥ 5 个日期,工作日与周末都要覆盖。所需 n 由导航样本给出的 GDR 标准差 ŝ 按 n = (1.96·ŝ/δ)² 计算,精度目标 δ = 0.05 预注册;若扰动预算或资金上限使可执行的 n 小于所需 n,必须在方法页写明「精度不足,只报 CI 不报比较结论」,并按预注册的降级顺序砍量:先砍 x=200 bps 档、再砍第三个交易对、再砍单笔规模,绝不砍 sham 对照。
Control
四重控制:①sham 空白对照分离延迟成分;②同时刻对照平台探针给出行业基线;③买卖侧交替给出方向对称性检查;④时刻随机化 + 公开种子,防止事后挑时点。所有对照探针与真实探针共用一个进程、一张时刻表、一套代码路径。
Statistical treatment
探针之间由 ≥60 s 且 ≥10×RT90 的间隔保证近似独立,可用普通 bootstrap;但同一时段内的探针仍可能共享行情状态,稳妥起见按「时段」整块重抽。拒单是信息不是缺失:拒单率单独作为一个结果指标报告(分子分母都给),并在 GDR 计算中按预注册规则处理(拒单行不参与 GDR_fill 的分位数,但计入拒单率)。导航样本与正式样本严格隔离,导航数据不得进入任何点估计。所有金额同时保留原计价币与 EUR。
Reproducibility check
第三方拿到公开的随机种子与时刻表,可以核对我们实际执行的探针时刻与预生成时刻一一对应、没有额外补做也没有静默丢弃——这是防「挑数据」的硬约束。sham 与真实探针的时刻交错关系同样可核对。第三方若自行执行探针,应在同一规模规则下于对照平台上得到与我们同量级的 I_real 与拒单率;若差异远超我们报告的 CI,说明两边的规模规则或延迟条件不同,应先对齐再比较。
Known pitfalls
①用市价单——没有价格保护,一次异常就会造成远超预期的扰动与损失;②留残单——瞬间从「测量者」变成「流动性提供者」,污染自己要测的簿;③立刻反向对冲导致两次探针相邻,破坏独立性;④探针规模用固定金额而非按簿实时计算,在低流动性对上就是一次人为砸盘;⑤忘了 sham,事后无法把延迟成分从幽灵率里扣掉,整组数据的解释力大打折扣;⑥导航样本混进主结论;⑦拒单直接丢弃而不报拒单率,系统性美化结果;⑧对照平台的探针规模强行取相同金额——那不是对照,那是在两个不同深度的市场上做两件不同的事,规模必须各自按规则算出。
Risk
本协议是全套规范中唯一涉及真实资金的部分。建议单笔 €25–200,单平台账户余额上限 €300,全部平台合计营运资金 €600–1,200;实际损耗按上面的成本公式用导航样本实测值估算。风险包括:市场瞬间跳动造成的滑点损失、库存的短时方向性敞口、新平台的提现风险(这是余额上限存在的理由,测试结束后应立即全额提现)。禁止杠杆、借贷、他人资金。伦理红线:不跨账户对敲、不自成交、不留挂单、不做任何形式的价格操纵;探针的唯一目的是测量,其规模规则与预算上限就是「不显著影响市场」这句话的可核验形式。

SUPPORTS / 支持在扰动预算可核验的前提下获得实际成交层面的观测:实际冲击 I_real 的分布、拒单率、实付费率、以及 LQR-05 所需的全部输入。也支持这样的表述:全部探针合计占该对当日观测成交额的比例低于万分之五,因此测量本身对市场的影响在可披露的上界之内。

DOES NOT SUPPORT / 探针只在很小的名义区间取样,绝不能外推到机构级大单——「€200 的探针滑点 x bps」不能推出「€200,000 会滑 1000x bps」,冲击函数是凹的且在大单区间由完全不同的机制主导。不能确立平台面对大单会怎么做。拒单不能直接读作恶意:可能是最小下单额、精度取整、风控或短暂不可用,reject_reason 必须原样保留而不是解释成动机。不能确立平台的偿付能力或提现能力。文档类证据在这里同样无力:条款里写着「最佳执行」「深度聚合」,或者费率页上的 taker 费率,都不能确立实际成交会以什么价格发生——本协议的实付费率列之所以要以成交回报为准而不是以费率页为准,正是因为文档只能确立平台的声称。

EVIDENCE RETAINED / 预生成的探针时刻表与种子文件(与 prereg.json 哈希绑定) · 每笔探针的下单请求与成交回报原始 JSON(脱敏 key) · 下单前最后一次簿快照的原始响应(与 probe_id 一一对应) · 账户成交明细与对账单导出(脱敏后) · 硬停事件日志与当时的市场状态快照 · 条款审查存档(证明程序化下单被允许)
RECORDED FIELDS (19)
  • probe_id / / 由种子与时刻确定性生成,第三方可核对我们没有隐藏或补做探针
  • is_sham / is_pilot / bool / 空白对照标记与导航样本标记,二者都不得混入主结论
  • platform / pair / side / / side 为本次探针吃的方向(BUY 吃 ask / SELL 吃 bid)
  • scheduled_ts_utc / seed / ISO-8601 UTC ms / — / 预生成时刻表与随机种子,随数据集公开
  • t_obs_utc / t_send_utc / t_ack_utc / t_fill_last_utc / ISO-8601 UTC ms / 四个时刻缺一不可,GDR 的延迟分解全靠它们
  • delta_t_ms / ms / t_send − t_obs,幽灵率延迟分层的自变量
  • order_type / price_cap / cap_offset_bps / — / 计价币 / bps / 一律 IOC_LIMIT;cap 与 mid 的关系必须可复算
  • Q_order_notional / Q_order_eur / 计价币 / EUR / 下单名义与 EUR 折算
  • Q_expected_notional / 计价币 / 按 t_obs 簿在 cap 内可成交的名义,与 Q_order 取小
  • Q_filled_notional / fill_count / 计价币 / 笔 / 实际成交名义与成交笔数;sham 行此二项记 NA
  • mid_at_obs / vwap_fill / 计价币 / 同基准计算 I_book 与 I_real 的两个价格
  • I_book_bps / I_real_bps / bps / 账面预测冲击与实际冲击
  • fee_paid / fee_rate_bps / 计价币 / bps / 实付手续费与实际费率(可能与费率页不同,以回报为准)
  • rejected_flag / reject_reason / bool / — / 拒单原样记录,reason 用平台原文不做解释性改写
  • share_of_v60s / % / 本笔占过去 60 秒成交额比例,扰动可核验性的关键列
  • budget_used_ratio / % / 当日该对已用扰动预算
  • inventory_after_eur / EUR / 探针后净库存,须始终在 ±Q_cap 内
  • halt_triggered / halt_reason / bool / — / 硬停事件必须发布,不得删除
  • code_commit / raw_ref / / 下单请求与回报的原始 JSON 位置
SPECIFICATION
LQR-05

幽灵深度率 GDR:把展示深度与可成交深度的差拆成延迟成分与非延迟成分

  1. 对每笔真实探针,用下单前最后一次簿快照 B(t_obs)(要求 t_obs 与 t_send 间隔可测且记录)计算 Q_expected = 在价格上限 cap 内可成交的名义,与 Q_order 取小;同时计算账面冲击 I_book。
  2. 从成交回报计算 Q_filled 与 VWAP_fill,进而得实际冲击 I_real(基准 mid 统一取 t_obs 时刻,与 I_book 同基准,这一点不能马虎)。
  3. 计算两个口径的幽灵率:成交量口径 GDR_fill = 1 − Q_filled/min(Q_order, Q_expected);价格口径 GDR_price = I_real − I_book [bps],同时给相对形式 (I_real − I_book)/I_book。两个口径必须都报——一笔全额成交但价格明显更差,与一笔只成交了一半,是两种不同的现象,单一口径会漏掉其中一种。
  4. 用 sham 对照算出延迟成分:对配对的 sham 时刻,GDR_sham = 1 − Q_expected(B(t_obs + Δt)) / Q_expected(B(t_obs)),Δt 从真实探针的 Δt 经验分布中抽取(分层配对,同平台同对同 side 同时段)。这是「不下单时,簿在同样延迟内自然变化会造成的表观缺口」。
  5. 净幽灵率:GDR_net = GDR_fill − GDR_sham,用配对差的 Hodges–Lehmann 估计 + bootstrap CI。机制上讲,GDR_fill 里混着三种东西:延迟期间簿的自然演化、撮合引擎与展示簿的不一致、以及接口口径差异(例如展示的是聚合簿而撮合用的是另一套)。sham 把第一种完整地扣掉,剩下的 GDR_net 才是值得讨论的量。
  6. 延迟分解的第二条独立路径:对真实探针按 Δt 分层([50,150)、[150,400)、[400,1000) ms)并做稳健回归 GDR_fill = g₀ + g₁·Δt(Huber 回归或分位数回归),截距 g₀ 是 Δt→0 的外推值,即与延迟无关的成分;斜率 g₁ 反映簿的自然刷新速度。g₀ 与 GDR_net 是两条独立的估计路径,两者应当量级一致;不一致本身就是一个必须披露的方法学警号。
  7. 非侵入代理指标(零成本、可对所有平台包括禁止程序化下单的平台计算):最优档报价存活时间中位数 quote_lifetime_p50、闪烁频次 flicker_rate(±10 bps 深度在 1 秒内变动超过 20% 的次数/分钟)、以及有逐笔成交流时的撤单成交比。这些与 GDR 相关但不等价,只能作为佐证与外部效度检查,绝不能替代 GDR。
  8. 基线化解读:GDR_net 与 g₀ 一律以同时段同规格的对照平台值作参照报告(差值与比值都给)。绝对的 GDR 数字没有意义——任何真实市场都有非零的幽灵率,问题永远是「相对同期基线高多少、CI 是否排除了基线」。
Quantity measured
GDR_fill = 1 − Q_filled / min(Q_order, Q_expected(t_obs));GDR_price = I_real − I_book [bps],相对形式 (I_real − I_book)/I_book;GDR_sham = 1 − Q_expected(B(t_obs+Δt))/Q_expected(B(t_obs));GDR_net = GDR_fill − GDR_sham(配对差,Hodges–Lehmann 汇总);延迟回归 GDR_fill = g₀ + g₁·Δt(Huber),g₀ 为延迟无关成分;跨平台差异 ΔGDR = GDR_net,target − GDR_net,control(同时段配对)。
Fixed parameters
Δt 分层边界 {50, 150, 400, 1000} ms;闪烁阈 20%/1 s;quote_lifetime 以最优档价格或数量任一变化为终止事件;GDR_fill 的定义域裁剪到 [−0.2, 1](超卖出上界说明簿快照或时间对齐有问题,须查而非截断)。分层边界按常见的往返延迟量级设定,且必须用 LQR-01 实测的 RTT 分布检查每层都有足够样本,否则合并相邻层并披露。
Sample size
与 LQR-04 共享样本:每平台每对每侧 ≥ 120 笔真实探针(最低 60)+ 等量 sham,每个 Δt 分层 ≥ 30 笔。所需 n 由导航样本的 ŝ(GDR) 按 n = (1.96·ŝ/δ)²、δ = 0.05 计算并预注册;达不到就写明精度不足、只报 CI。非侵入代理指标使用 LQR-02 的完整 14 天序列,样本量以 n_eff 报告。
Control
①sham 配对是主对照,分离延迟成分;②同时刻对照平台探针给出行业基线,GDR 只以相对基线的形式解读;③Δt 分层回归作为独立于 sham 的第二条估计路径,两条路径互为校验;④买卖侧互为对照;⑤σ_inst 门槛:小于仪器噪声的 GDR 差异一律 NOT-DISTINGUISHABLE。
Statistical treatment
GDR 分布重尾且可能双峰(全成交 vs 大幅缺口),一律用分位数与 Hodges–Lehmann,不用均值与 t 检验。配对差(真实 − sham)按时段整块 bootstrap。延迟回归用 Huber 稳健回归,同时报分位数回归(τ=0.5)作为稳健性检查,两者结论不一致时以更保守的为准并披露分歧。拒单不进入 GDR 分位数但单列拒单率。多平台 × 多对 × 多 side 的比较用 BH 控制 FDR(q = 0.10),并公布检验总数——不允许只挑显著的那几个报。所有点估计必须与 σ_inst(p95) 比对,未超过噪声门槛的一律报 NOT-DISTINGUISHABLE。
Reproducibility check
三道:①GDR 的每一个输入(t_obs 簿快照、下单回报、sham 簿快照)都在原始归档里,第三方可逐笔重算 GDR_fill 与 GDR_net;②负控制——在 Binance BTC/USDT 上,GDR_net 应当接近 0 且 CI 覆盖 0;如果我们的管道在这里给出显著非零的净幽灵率,说明是时间对齐或簿重建有问题,此时必须暂停对所有平台的 GDR 结论并回到 LQR-01 修管道。这一条是「我们没测错」的最强单项证据,必须随结果一起发布;③两条独立路径(sham 配对与 Δt 回归截距 g₀)的一致性报告。
Known pitfalls
①I_book 与 I_real 用了不同的基准 mid,直接把 GDR_price 做成噪声;②没有 sham,把延迟造成的自然簿变化全算成幽灵,系统性高估所有平台(尤其高估延迟大的平台);③Δt 分层里某一层样本太少却照样报回归斜率;④把 GDR_fill 的负值截断为 0,人为制造正偏;⑤用绝对 GDR 数字下结论而不给同期基线——任何真实市场的 GDR 都不为零;⑥拿非侵入代理(闪烁率、报价存活时间)直接当 GDR 用;⑦在没有逐笔成交流的平台上用簿变化倒推撤单成交比;⑧最危险的一条:把高 GDR 直接写成「刷量」或「虚假挂单」——这是归因,不是测量。
Risk
资金风险与 LQR-04 相同并共享同一套预算与硬停条件。额外的表述风险是本协议全套中最高的:GDR 是最容易被读者与被测方误读为「指控」的指标,因此 reporting_notes 中关于 GDR 的表述禁令是强制性的,任何引用都必须带 CI、带同期基线、带样本量,并带上「本测量不能确立成因与意图」这句话。

SUPPORTS / 支持这样的表述:在某段 UTC 窗口内、以 n 笔规模受控的 IOC 探针与 n 笔配对空白对照观测,某平台某对买侧的净幽灵深度率中位数为 …(95% CI 给出),比同时段同规格的对照平台高出 …(配对差与 CI),且该差异大于本次采集标定的仪器噪声下界 σ_inst(p95)。也支持刻画展示深度与可成交深度差异随延迟的变化关系(g₁),以及价格口径与成交量口径是否指向同一现象。

DOES NOT SUPPORT / 高 GDR 不能确立刷量、虚假挂单或欺诈意图。sham 对照只干净地扣掉了延迟成分,剩余项仍然是多因的:做市商正常的高频撤单策略、展示簿与撮合簿的技术性不一致、聚合口径差异、以及确实的幽灵挂单,本协议无法把它们进一步分开——要分开需要平台侧日志或逐笔成交流的额外证据,而我们没有。GDR 不能确立平台的偿付能力、储备状况或提现能力。不能推广到未测交易对、未测规模区间、观测窗口之外。文档类证据在这里彻底无效:平台声称的「零延迟撮合」「深度聚合自多家做市商」「订单薄真实无虚挂」,以及第三方聚合站的流动性评分,都无法确立或反驳幽灵深度率——前者是自述,后者与被测对象读的是同一批展示数据,二者都不构成独立验证。这正是本刊坚持要用带对照的实际成交探针的原因。

EVIDENCE RETAINED / 每笔探针的 t_obs 簿快照原始响应与成交回报原始 JSON · sham 时刻的簿快照序列 · GDR 计算脚本与延迟回归的完整输出(含残差图) · 负控制报告(Binance 基线上的 GDR_net 及其 CI) · 两条估计路径的一致性对照表 · 非侵入代理指标的计算脚本与中间序列
RECORDED FIELDS (17)
  • probe_id / / 关联 lqr_probes,一对一
  • platform / pair / side / / 分层键
  • delta_t_ms / delta_t_stratum / ms / — / 延迟及其分层标签
  • Q_expected_notional / Q_filled_notional / 计价币 / GDR_fill 的分母与分子来源
  • GDR_fill / —(0–1) / 成交量口径;可为负(成交超预期),负值原样保留不截断
  • I_book_bps / I_real_bps / GDR_price_bps / bps / 价格口径;GDR_price = I_real − I_book
  • GDR_price_rel / / 相对形式;I_book 接近 0 时记 NA 而非除爆
  • matched_sham_id / GDR_sham_fill / — / — / 配对的空白对照及其表观缺口
  • GDR_net_fill / / GDR_fill − GDR_sham,本协议的主结果量
  • quote_lifetime_p50_ms / ms / 最优档报价存活时间中位数,非侵入代理
  • flicker_rate_per_min / 次/min / ±10 bps 深度 1 秒内变动 >20% 的频次
  • cancel_to_trade_ratio / / 有逐笔成交流时才可算,否则 NA,禁止用簿变化倒推
  • baseline_platform / baseline_GDR_net / — / — / 同时段同规格对照平台的值,与本行成对发布
  • delta_vs_baseline / delta_ci_low / delta_ci_high / / 相对基线的差与 CI,这是唯一允许被引用的形式
  • model_g0 / model_g0_ci / model_g1_per_100ms / model_g1_ci / — / — / 每 100ms / — / 延迟回归结果,存于 lqr_gdr_model 汇总表
  • n_probes / n_sham / n_rejected / / 三个计数都必须随任何 GDR 数字一起出现
  • code_commit / raw_ref / / 可回溯
SPECIFICATION
LQR-06

深度的时间稳定性、日内模式与压力期保有率

  1. 从 LQR-02 的 1 秒网格序列构造每平台每对每侧的 D(t; 10 bps) 与 D(t; 50 bps)、spread(t),覆盖完整的 ≥14 天窗口。
  2. 短期稳定性:计算滚动 300 秒窗口的变异系数 CV_5m = sd/mean,报告其中位数与 IQR。这刻画的是「深度平不平稳」,与深度的绝对水平是两个独立维度。
  3. 持续性:估计 ln D 的积分自相关时间 τ_ac = 1 + 2·Σ_{k=1..K} ρ_k,K 用 Sokal 自动窗口规则确定。τ_ac 有双重用途:既是「深度状态能维持多久」的刻画,也是全部 bootstrap 的块长来源与 n_eff = N/(2τ_ac) 的分母。
  4. 日内模式:把 UTC 一天切成 96 个 15 分钟桶,逐桶计算深度中位数 D̃(b) 与 IQR,画出日内曲线。再做形状归一(各自除以自身 96 桶的中位数)后,计算被测平台与各对照平台日内形状的 Spearman 相关 ρ_shape。真实的全球流动性在亚洲/欧洲/美洲时段有稳定且跨平台高度一致的形状。
  5. 周期性差异:分别汇总工作日与周末、以及各平台公告的维护窗口时段,维护窗口单独标记且不参与常态统计。
  6. 压力期保有率(韧性的核心时刻):用外生的共同 stress 定义——以对照平台 Binance 的 mid 计算 1 分钟对数收益 |r|,取全样本 p99 作为阈值,得到一个 stress 秒集合 S。三家平台共用同一个 S,这样比较的才是「同一场行情下谁的深度还在」。SDR = median{D(t) : t ∈ S} / median{D(t) : t ∉ S}。
  7. 缺口与压力期的交互检查:统计数据缺口在 stress 秒上的富集程度。缺口若显著集中在压力期(这在评测中很常见,因为压力期也是接口最不稳的时候),则 SDR 会被系统性偏移,必须做最坏情况敏感性分析(缺口秒分别按「深度为 0」与「深度不变」两种极端填补,报告 SDR 的区间而非点值)。
  8. 跨平台配对汇总:全部比较量都以同时刻配对的对数比形式计算后再汇总(先配对后汇总,不是先各自汇总再相除),CI 用块长 2τ_ac 的 stationary bootstrap。
Quantity measured
CV_5m(t) = sd{D(u) : u ∈ [t−300s, t]} / mean{同窗},报告 median_t CV_5m;τ_ac = 1 + 2Σ_{k=1}^{K} ρ_k(ln D),K 由 Sokal 自动窗口确定;n_eff = N/(2τ_ac);日内桶 b 的 D̃(b) = median{D(t) : t ∈ b};形状相关 ρ_shape = Spearman( D̃_target(b)/median_b D̃_target , D̃_ctrl(b)/median_b D̃_ctrl ),b = 1..96;stress 集合 S = {t : |r_1min^{Binance}(t)| ≥ p99};SDR = median{D(t) : t∈S} / median{D(t) : t∉S}。
Fixed parameters
稳定性窗 300 s;日内桶宽 15 min(96 桶/天);stress 阈值 p99 的 1 分钟对数收益,以 Binance mid 为外生定义源;带宽 10 bps 与 50 bps 双档。选 15 分钟桶是因为它足够细到能分辨时段交接、又足够粗到每桶有 900 个 1 秒样本;stress 用外生源定义,是为了避免「各平台按自己的价格定义各自的压力期」这个致命的可比性缺陷——那样比较的会是三段不同的时间。
Sample size
每平台每对连续 ≥ 14 天(最低 7 天),严格同窗;日内曲线要求每个 15 分钟桶在窗口内至少有 10 个有效日的数据,不足的桶标 SPARSE 并在图上以不同样式呈现,不得静默平滑。stress 秒按 p99 定义约占全样本 1%,14 天约对应上万秒的量级,但必须按 n_eff 报告有效样本量而非原始秒数。所有比率的分子分母都要发布。
Control
①外生共同 stress 定义(Binance mid),保证三平台比的是同一场行情;②日内形状归一后再比较,把「深度水平差异」与「日内节律差异」分开——前者是规模问题,后者才是行为问题;③工作日/周末、维护窗口分层;④σ_inst 门槛贯穿所有比较;⑤缺口富集检查作为对 SDR 的内部效度控制。
Statistical treatment
全部用分位数报告。CI 用 stationary bootstrap,块长 2τ_ac;日内曲线的逐桶 CI 按「桶内按日重抽」(把每个桶的多天观测当作重抽单元)以吸收日内自相关。SDR 的不确定度必须包含缺口敏感性区间,并把区间宽度与 bootstrap CI 宽度分别列出——两种不确定度来源不能混在一个数字里。ρ_shape 的显著性用置换检验(打乱桶顺序),不用相关系数的正态近似。跨平台比较一律先配对后汇总。
Reproducibility check
稳定性与日内指标都是发布序列的确定性函数,第三方用发布归档 + 固定 commit 必须重算出逐行一致的 lqr_stability 与 lqr_intraday 表。另发布 stress 秒集合 S 的完整清单(时刻列表),第三方可以用自己独立采集的 Binance 数据重建 S 并比对——如果两份 S 高度一致,说明外生定义确实外生;不一致则说明采集窗口或 mid 口径有别,须先对齐。
Known pitfalls
①各平台各自定义压力期,比较变得毫无意义;②只看深度水平不做形状归一,把「规模小」误读成「节律异常」;③把维护窗口的零深度算进常态统计;④缺口集中在压力期却不做敏感性分析,SDR 直接失真;⑤按原始秒数报样本量,CI 假窄到荒谬;⑥某些桶只有一两天数据却和其他桶画在同一条曲线上;⑦用 Pearson 相关比较日内形状(重尾 + 非线性),应当用 Spearman + 置换检验;⑧看到平坦的日内曲线就下结论——平坦可能来自算法持续挂单,也可能来自别的原因,本协议只能记录形状,不能归因。
Risk
不涉及资金,全程被动观察。风险在于 14 天连续采集的工程纪律:断点续采必须完整记录、缺口不得用重采数据冒充连续、存储与限流预算要在开测前按 24 小时试采样的实测体量配好。压力期恰恰是接口最容易出问题的时候,缺口富集检查不是可选项。

SUPPORTS / 支持这样的表述:在某段 UTC 窗口内,某平台某对 ±10 bps 深度的滚动 5 分钟变异系数中位数为 …,深度状态的积分自相关时间为 … 秒;其日内形状与对照平台的 Spearman 相关为 …(置换检验 p 值给出);在以 Binance 1 分钟收益 p99 定义的共同压力秒上,深度保有率 SDR 为 …(bootstrap CI 与缺口敏感性区间分别给出)。这是本基准中最贴近「韧性」原意的一组数——深度在最需要它的时候还在不在。

DOES NOT SUPPORT / 日内形状与对照平台不相关,不能确立造假、刷量或虚挂——它可以来自完全不同的用户构成、单一算法做市商、或平台的撮合与展示机制,本协议只能记录这个形状事实。SDR 低不能确立平台会在压力期损害用户,也不能确立平台的风控或偿付状况。稳定性高不能确立深度可成交(那是 LQR-05 的事)。不能推广到未测交易对、未测带宽、观测窗口之外,也不能用来预测未来任何一天的表现。文档类证据在这里同样不能替代测量:平台自报的 24h 成交量、上架公告、「流动性合作伙伴」名单、以及第三方聚合站按小时给出的深度曲线,都无法确立日内稳定性或压力期保有率——自报成交量本身就是最容易被制造的数,而聚合站读的是同一批展示接口。

EVIDENCE RETAINED / 1 秒网格深度与价差序列的完整归档(分平台/对/日分片 + 校验和) · 日内曲线图与生成脚本(图必须可由数据一键重绘) · stress 秒集合 S 的完整清单 · 缺口时段表与缺口富集检查的中间结果 · 维护窗口的平台公告截图与时间戳 · 各汇总表的计算脚本与 commit
RECORDED FIELDS (16)
  • bucket_start_utc / ISO-8601 UTC / 15 分钟桶起点;日内汇总表的主键之一
  • platform / pair / side / / 分层键
  • D10_median / D10_iqr / 计价币 / ±10 bps 名义深度的桶内中位数与四分位距
  • D50_median / 计价币 / ±50 bps 深度,用于检查稳定性是否只存在于盘口
  • spread_bps_median / bps / 桶内价差中位数
  • cv5m_median / / 桶内滚动 5 分钟变异系数的中位数
  • tau_ac_s / s / ln D 的积分自相关时间;同时是 bootstrap 块长来源
  • n_raw / n_eff / 秒 / — / 原始秒数与有效样本量,二者必须同时出现
  • valid_sec_ratio / % / 桶内有效秒占比;低于 90% 的桶标 SPARSE
  • is_stress_bucket / stress_sec_count / bool / 秒 / 由外生 Binance 收益 p99 定义,三平台共用
  • is_weekend / is_maintenance / bool / 维护窗口不参与常态统计但必须保留在数据集中
  • shape_norm_value / / 桶深度中位数除以该平台 96 桶中位数,日内形状比较用
  • SDR / SDR_low / SDR_high / / 压力期保有率及其敏感性分析区间(缺口两种极端填补);汇总表列
  • rho_shape_vs_control / / 与各对照平台的日内形状 Spearman 相关;汇总表列
  • gap_enrichment_ratio / / 缺口在 stress 秒上的富集倍数;> 2 时 SDR 只报区间
  • code_commit / raw_ref / / 可回溯
SPECIFICATION
LQR-07

不确定度合成、复现套件与开放数据集发布

  1. 不确定度分层合成:每个发布值必须显式给出三层不确定度——①统计不确定度(stationary bootstrap 95% CI,B=10,000,块长 2τ_ac);②仪器不确定度(LQR-01 的 σ_inst(p95),作为可分辨性下限);③设计不确定度(删失率、缺口率、缺口在压力期的富集、探针精度是否达到预注册的 δ)。三层分别列出,禁止合成为一个看起来更漂亮的单一误差棒。
  2. 可分辨性闸门:任何跨平台差异,只有同时满足「bootstrap CI 排除零」与「效应量大于 σ_inst(p95)」时,才允许被表述为差异;否则一律发布为 NOT-DISTINGUISHABLE 并给出区间。这一条要写进代码,由发布脚本自动打标,而不是靠人自觉。
  3. 多重比较:统计全部做过的比较次数(平台 × 对 × side × 指标 × x 值),用 Benjamini–Hochberg 控制 FDR at q = 0.10,并把「检验总数」作为数据集的必填元数据发布。禁止只报显著的那几个。
  4. 估计器校验(合成注入):用记录的真实流做离线回放,注入已知 τ*、已知深度缺口比例的合成扰动,检验 LQR-03 的恢复估计器与 LQR-05 的 GDR 估计器能否还原真值。合格标准预注册:|median(τ̂/τ*) − 1| ≤ 0.15 且 IQR(τ̂/τ*) ≤ 0.5。合成数据放在独立目录,README 与文件名都标 SYNTHETIC,绝不进入观测数据集——这是校验估计器,不是造数据,边界必须物理隔离。
  5. 负控制报告:把管道在 Binance BTC/USDT 上的表现(GDR_net 是否覆盖零、mismatch_rate、σ_inst)作为一份独立报告随数据集发布。管道在已知高流动性市场上给出异常值时,全部结论暂停——这是本基准对「我们没测错」这个问题的正式回答。
  6. 数据再分发合规检查(发布前必做):逐平台核查行情数据的再分发条款。条款不允许再分发原始响应时,只发布派生表 + 原始文件的 SHA-256 清单 + 复现所需的采集代码与参数,并写明「原始档因条款限制不公开,第三方可用同一代码自行采集后比对哈希口径」。绝不因为条款限制就把派生表也藏起来。
  7. 打包数据集:7 张表以 CSV(UTF-8、RFC 4180、UTC ISO-8601 毫秒时间)与 Parquet 双格式发布,每张表配一份 Frictionless Table Schema(字段类型、单位、允许值域、缺失约定)。缺失约定统一:NA 表示不适用,NULL/空表示未观测到,CENSORED 表示右删失并另附下界列——三者语义不同,任何一个都绝不能用 0 代替。
  8. 版本与许可:规范版本 AXP-LQR-v1 与数据集版本 semver 分开,数据集元数据必须同时携带二者;数据 CC BY 4.0,代码 MIT,铸 DOI(Zenodo 一类)。勘误发新的补丁版本并保留旧版本可访问,变更日志写明改了什么、为什么、对已发布结论的影响。
  9. 发布复现套件:Dockerfile + 锁定依赖 + 一条命令跑通的入口脚本 + 随机种子 + 探针时刻表 + prereg.json 及其哈希 + golden test 期望输出哈希。目标是一个陌生人在不联系我们的情况下,能重算出全部派生表,并能用同一套代码自行采集一批新数据做独立比对。
Quantity measured
发布值 = 点估计(分位数)± bootstrap 95% CI,并附 σ_inst(p95) 与设计不确定度标签;可分辨性判据:DISTINGUISHABLE ⟺ (CI 排除 0) ∧ (|效应量| > σ_inst(p95));有效样本量 n_eff = N/(2τ_ac);FDR 控制:BH at q = 0.10 over 全部比较;估计器合格判据:|median(τ̂/τ*) − 1| ≤ 0.15 ∧ IQR(τ̂/τ*) ≤ 0.5;数据集完整性:每个分片 SHA-256 与 manifest 中登记值逐一相等。
Fixed parameters
bootstrap B = 10,000;置信水平 95%;FDR q = 0.10;块长 L = 2τ_ac;探针精度目标 δ = 0.05;估计器偏差容限 0.15;删失率红线 30%(超过只报下界);缺口富集红线 2×(超过只报区间)。这些阈值全部在 prereg.json 中冻结,事后改动必须发新规范版本号。
Sample size
复现套件本身要跑通完整流程至少 2 次独立执行(不同机器、不同日期)并比对派生表哈希;合成注入校验每个估计器 ≥ 200 次注入,覆盖至少 5 个不同的 τ* 与 3 个不同的缺口比例;负控制报告覆盖全部对照平台与全部测试对。数据集发布前做一次全表 schema 校验与全分片哈希校验,失败即阻断发布。
Control
①负控制(Binance 金标准)控制管道系统误差;②合成注入控制估计器偏差;③双采集器 σ_inst 控制观测噪声;④预注册控制研究者自由度(挑时点、挑参数、挑显著结果);⑤第三方 golden test 控制实现差异。五道控制共同回答同一个问题:这些数字里有多少是平台的,有多少是我们的。
Statistical treatment
本协议不产生新的观测统计量,它规定的是前六条协议全部输出的报告形态:分位数点估计 + 三层不确定度 + 可分辨性标签 + FDR 校正后的比较结论。任何一个数字进入方法页之前,必须由发布脚本自动检查是否携带 n、n_eff、CI、删失率、缺口率与 σ_inst 参照;缺任何一项即阻断发布。这条自动闸门比人工审校可靠。
Reproducibility check
完整的复现契约:第三方 (a) 下载数据集与复现套件;(b) 用固定 container digest 与 commit 跑一条命令,重算出全部派生表并与发布的哈希逐一比对(浮点容差 1e-9);(c) 用发布的 prereg.json 与时刻表核对我们执行的探针与预注册计划一致;(d) 用自己独立采集的一批新数据跑同一套代码,得到的 σ_inst 与负控制指标应落在我们报告的区间内;(e) 若 (d) 不一致,先比对 LQR-02 的合成簿单元测试与 LQR-01 的时钟报告以定位是口径差异还是真实差异。整条链条不需要联系我们。
Known pitfalls
①把三层不确定度合成一个误差棒,读者无法判断限制来自哪里;②只发派生表不发 schema 与缺失约定,第三方读不懂 NA/NULL/CENSORED 的区别,直接当 0 算;③用本地时间或不带时区的时间戳;④EUR 列不给汇率与时点,无法复算;⑤合成校验数据混进观测数据集(这是最严重的一条,会直接摧毁刊物的可信度,所以必须物理隔离 + 文件名标注 + 发布前扫描);⑥条款不允许再分发原始数据就干脆什么都不发;⑦不公开比较总数,事实上变成挑显著结果;⑧勘误直接覆盖旧文件,让引用过旧版本的人无法追溯。
Risk
不涉及资金。主要风险是发布环节的合规与表述风险:行情数据再分发可能受平台条款限制(发布前必须逐平台核查并按 HASH_ONLY 模式降级发布);个人数据、API key、账户标识必须在发布前扫描清除;被测方可能要求撤稿或更正,因此更正政策与版本保留策略要在首次发布前就写好并公开。合成校验数据与观测数据的物理隔离是硬红线,发布前的自动扫描必须把它当作阻断级检查。

SUPPORTS / 支持这样的表述:本基准的全部结论都可以由公开的数据集与代码在无需联系我们的情况下重算,且发布的每个数字都携带样本量、有效样本量、置信区间、删失与缺口比例,以及本次采集标定的仪器噪声下界;并支持说明哪些跨平台差异在统计与仪器两个意义上都是可分辨的,哪些不是。

DOES NOT SUPPORT / 复现一致只说明测量可重复,不说明测量测对了东西——可重复性是信度,不是效度;构念效度靠的是负控制与合成注入,而这两者也只能覆盖我们想到的失效模式。数据集不能确立任何因果或意图。发布 DOI、许可与校验和不会让结论更强,只会让结论更可查。特别要写清文档类证据的位置:引用他人的数据集、聚合站指标或平台自报数字,无论引用得多规范,都不能替代自采——因为本基准的全部价值在于口径被固定、原始档被归档、每个数字能回溯到一条原始响应,而外部数字通常三样都没有。同样,本数据集不能被用来对任何平台作 MiCA 或其他框架下的合规定性;它提供的是读者可以自行核对的测量,不是法律意见,也不是投资建议。

EVIDENCE RETAINED / prereg.json 及其冻结哈希与时间戳 · Dockerfile、依赖锁文件、container digest · 全部表的 Frictionless Table Schema · 原始分片 SHA-256 清单(或条款受限时的哈希-only 清单) · golden test 期望输出与 CI 运行记录 · 合成注入校验报告与合成数据归档(独立目录,SYNTHETIC 标注) · 负控制报告 · 两次独立执行的派生表哈希比对记录 · 变更日志与版本迁移说明 · 利益冲突与资金来源声明
RECORDED FIELDS (17)
  • spec_version / / 固定为 AXP-LQR-v1;规范迭代时数据必须能对上版本
  • dataset_version / semver / 与规范版本分开;勘误发补丁号并保留旧版
  • table_name / file_name / format / / 7 张表 × CSV/Parquet 双格式
  • row_count / column_count / 行 / 列 / schema 校验的基本项
  • sha256 / / 逐文件校验和;原始分片另有清单文件
  • schema_ref / / 对应的 Frictionless Table Schema 文件名
  • missing_convention / / 固定文案:NA=不适用 / NULL=未观测 / CENSORED=右删失(附下界列);禁止用 0
  • time_convention / / 全部 ISO-8601 UTC 毫秒;不存本地时间
  • currency_convention / / 原计价币金额 + EUR 折算列 + 固定参考汇率与时点
  • prereg_hash / prereg_frozen_at / — / ISO-8601 UTC / 参数冻结证明
  • code_commit / container_digest / seed / / 复现三要素
  • n_comparisons_total / fdr_q / 次 / — / 多重比较的分母,必须公开
  • sigma_inst_p95_ref / / 本批数据适用的仪器噪声下界
  • raw_redistribution_status / / PUBLISHED / HASH_ONLY_TERMS_RESTRICTED,附条款出处
  • license_data / license_code / doi / / CC BY 4.0 / MIT / DOI
  • known_issues / / 已知缺陷与未解决的方法学问题,必填,不许写「无」除非真的逐条查过
  • changelog_ref / / 变更日志文件
SPECIFICATION
RPT

Reporting rules for this benchmark

How results from this protocol may and may not be described once a dataset exists. Author: Axial Proof Editorial Team. Independent reviewer: Axial Proof Review Team.

CONSTRAINTS

**每个数字的最小披露单元。** 任何引用本基准的数值,必须同时携带:规范版本(AXP-LQR-v1)与数据集版本、平台、交易对与计价币、买/卖侧、观测窗口的 UTC 起止、样本量 n 与有效样本量 n_eff、95% CI、删失率与缺口率、本批数据的 σ_inst(p95)。缺任何一项,该数字不得进入正文——由发布脚本自动闸门执行,不靠人工自觉。 **可分辨性优先于显著性。** 只有当 bootstrap CI 排除零且效应量大于 σ_inst(p95) 时,才允许写「A 比 B 深/快/差」。否则一律写「在本次采集的精度下不可分辨(区间 …)」。不可分辨是一个合格的、必须发布的结果,不是失败。 **禁止无单位形容词。** 不写「流动性好/差/充足/薄」。写「在 2026-XX-XX 至 XX-XX 的 UTC 窗口内、n 个同步 1 秒快照上,把中间价推动 10 bps 所需的账面名义金额,配对中位数为对照平台的 k 倍(95% CI …)」。形容词是评测站的语言,本刊的语言是带单位的量。 **GDR 的表述禁令(最高优先级)。** 幽灵深度率一律表述为「展示深度与实测可成交深度的差异」。禁止写成刷量、虚假挂单、假深度、欺诈、操纵。禁止在同一段落里把 GDR 与平台的注册状态、成立时间、公司规模并置以暗示因果。每次引用 GDR 必须带同期同规格的对照平台基线、CI,并附一句「本测量不能确立成因与意图」。 **删失与缺失不得被数字化。** CENSORED 永不写成 0,永不参与均值,永不做线性外推;报告删失率与下界。NA(不适用)、NULL(未观测)、CENSORED(右删失)三者语义不同,在正文与数据集中都必须保持区分。 **恢复速度与恢复水平必须成对出现。** 只讲「恢复到 50% 用了 x 秒」而不讲「最终只补回原深度的 y%」是误导性的半句话。 **压力期结论必须附缺口敏感性。** 若缺口在压力秒上的富集倍数大于 2,SDR 只报区间不报点值,并在正文说明「压力期恰是接口最不稳的时候,这一限制我们无法消除」。 **外推禁令。** 不得跨交易对、跨规模区间、跨观测窗口推广。探针只在 €25–200 量级取样,任何关于大额订单会怎样的推断都不被本基准支持,正文中出现类似推断即为方法学错误。 **主动测量的披露义务。** 凡执行过主动探针的平台,必须公开披露:探针总笔数、总名义、占该对当日成交额的比例上界(≤ 万分之五)、硬停事件的完整清单。因条款限制未做主动探针的平台,必须写明「未做主动测量」及其理由与条款出处,且其 GDR 一栏留空——不得用非侵入代理指标顶替 GDR 数字。 **负面与失败运行必须发布。** 探针被拒、账户被限制、数据缺口、管道在负控制上失败、事件数不足导致 UNDERPOWERED、精度未达 δ,全部原样发布。只发好看的运行等于不发。 **多重比较的分母要公开。** 报告全部比较次数与 FDR 水平。禁止在正文只挑显著的那几个说。 **欧盟视角的边界。** 可以指出本指标与 MiCA Title V 项下交易平台的公平有序交易、订单执行政策、交易前/交易后透明度义务在测量对象上的重合(交易前透明度公开的正是我们测的那批报价与深度),并说明公开、可复现的测量给读者一个独立于平台自报的核对量。禁止写「符合/违反 MiCA」「未获授权」「构成违规」一类定性,禁止把本基准结果表述为监管意见或法律意见。 **注册状态与流动性不得互推。** baerx.io 的 FINTRAC MSB 注册(N300001098)不构成对其流动性质量的任何暗示,反向亦然;FINTRAC 官方明确注册不等于发牌或背书,不得在流动性章节引用注册事实作为正面或负面佐证。任何主体信息只在实体核验章节出现,且与本基准结果分列。 **不构成投资建议。** 全部输出为测量与方法,不含买卖建议、平台推荐或风险评级。 **利益冲突与资金来源。** 每次发布声明测试资金为团队自有、未接受被测方任何形式的资助或预沟通、探针账户与被测方无关联。 **更正政策。** 勘误发布补丁版本号,保留旧版本可访问并在新版本中写明改动内容、原因与对已发布结论的影响。被测方提出异议时,异议原文与我们的处理结论一并公开,数据不因异议而撤下,只因证明有误而更正。