DOCUMENTARY RESEARCH / EN-IE7 EVIDENCE RUNS · PUBLIC EVIDENCE REVIEWED
AXIALPROOF / RESEARCH LAB

MEASUREMENT SPECIFICATION

价格发现与锚定

在一个不含被测方、成分与权重全部预注册的多源共识指数下,量化平台展示价格的持久性偏离与动态跟随关系(领先滞后、信息份额、跳变响应、微观结构指纹),并给出区分「正常做市差异」与「价格不跟随外部市场」的可复算判据与不确定度。

METRIC ID
AXP-PRICE-v1
PROCEDURES
9
RECORDED FIELDS
112
DATASET
NOT COLLECTED
DATASET / NOT COLLECTED

This page publishes a measurement specification, not results. No figure on it was produced by running the protocol against any venue. When a dataset exists it will be released separately, versioned against the metric identifier above, with the raw responses and their checksums attached.

RATIONALE

WHY THIS NEEDS A STANDARD

价格准不准是判断平台是否连接真实外部市场的第一道信号,也是最容易被做得不可复现的一项。现有做法有五个问题:(1) 参考价直接取聚合站展示价,其成分、权重、剔除规则不透明且会回溯修订,别人无法复算;(2) 没有时钟同步与路径延迟基线,几百毫秒量级的领先滞后完全被仪器噪声淹没,得出的「滞后 2 秒」可能全是本机时钟漂移;(3) 不区分持久加价与动态跟随——零售转换定价、点差型收费、USDT 基差都会制造几十到几百 bps 的稳定偏离,但它对价格发现一个字都没说,而很多评测把它当成内盘证据;(4) 没有对照组,一个孤立的相关系数无法解读,因为没人知道两家公认真实的场所之间同样测法会得到多少;(5) 结论跳跃——从「价格贴近」推出「有真实流动性」,或从「价格偏离」推出「自撮合」,两个方向都不成立。本基准把参考指数构建、时钟与延迟校准、统计量定义、对照分布和仪器自校验全部写死成参数,并强制发布原始数据与一键复算包,使第三方能在不联系我们的前提下重采新窗口、跑同一流水线、检验我们是否测错。欧盟语境下,市场数据完整性与报价可核验性是 MiCA 框架下平台运营信息披露关注的对象之一,一个公开带版本号的测法比任何单次评测结论更有复用价值——但本基准只产出测量,不做法律定性。

OUTPUT

WHAT GETS PUBLISHED

发布两个相互引用的物件。一、方法页(axialproof.com 上的规范页,标识 AXP-PRICE-v1):完整包含 P1-P9 的步骤、全部固定参数及其取值理由、公式、采样与分层设计、统计处理与不确定度方法、三重对照设计(参考源两两经验分布、合成镜像校准面、合成真实场所阴性对照)、仪器自校验流程(250 ms 注入检验、双采集器 A/B、已知镜像序列的灵敏度检验)、每一步的 supports / does_not_support 边界声明、法律与伦理红线、版本历史与勘误记录、以及第三方复现报告的提交入口与差异处理流程。方法页不含任何实测数值。二、数据集(Zenodo 记录,CC BY 4.0 数据 + MIT 代码,带 DOI 与版本化):原始 L1 tick 分卷、1 s 与 100 ms 网格表、共识指数序列与剔除日志、admission 表(每源每条准入判据的实测值)、偏离逐点序列、领先滞后与信息份额结果表、跳变事件清单与响应曲线、指纹指标全量(含 EM 源×滞后矩阵与置换零分布)、P8 逐单原始记录、时钟与 RTT 日志、合成校准面全量结果、manifest.json(含每文件 sha256、预注册 commit、采集器 commit 与镜像 digest、冻结权重、被测行情面、偏离规范清单)、manifest 哈希的 OpenTimestamps 存证、以及 docker compose 一键复算包与 make verify 校验脚本。测评正文(若发)只是这两个物件的解读层,正文里的每个数字都必须能通过 DOI + 文件名 + 列名回到数据集,不能回溯的数字不得出现。

PREREQUISITES

What must exist before a single measurement is taken.

A benchmark that skips these produces numbers, not evidence. Every item is a precondition of the protocol, not a recommendation.

P-01

预注册文档:采集开始前把参考源候选与准入判据、交易对清单、窗口日期、事件阈值、P8 下单时刻候选表写入版本库并打 tag(spec/AXP-PRICE-v1/preregistration.md),commit 哈希写入数据集 manifest。窗口开始后不得增删参考源,不得事后挑选窗口。

REQUIRED
P-02

单宿主采集机:欧盟区 VPS 一台(4 vCPU / 8 GB / ≥320 GB NVMe,Ubuntu LTS),所有场所的采集器必须同宿主运行,使跨场所路径不对称成为可估计常数。约 €30-45/月 × 2 个月。

REQUIRED
P-03

时钟栈:chrony 同步至少 4 个 NTP 源,每 60 秒记录 offset/jitter/root dispersion;本地时间戳取 CLOCK_MONOTONIC 加一次性 CLOCK_REALTIME 锚点,避免 NTP 步进污染时间差。

REQUIRED
P-04

采集器与分析包:开源、带依赖锁文件、容器化,记录镜像 digest 与 git commit。WebSocket 为主,REST 仅作降级并在 src 字段标注。

REQUIRED
P-05

被测行情面的冻结:每个平台明确并冻结测的是哪一个价格面——公开订单簿 API / 专业版界面 / 零售一键兑换报价。三者在同一平台可能差几十到几百 bps,混用即作废。

REQUIRED
P-06

交易对清单:至少 3 对。BTC 与 ETH 的主流计价对(同计价币优先),加 1 个中小市值资产(参考集合中至少 4 家有连续挂牌)。被测平台上参考源不足 4 家的资产在 v1 下标注为「不可测」,不得记为「通过」。

REQUIRED
P-07

条款与限频合规记录:逐条阅读每个平台的用户协议、API 条款与公开速率限制并留档;采集速率不超过公开限额的 50%;收到 429 或 WS 限流即停止该源并记录,不重试绕过、不轮换 IP 规避、不使用 VPN 伪装地区规避区域限制。

REQUIRED
P-08

真实资金(仅 P8):账户由团队成员以本人身份完成 KYC,资金为团队自有;不借用他人证件或银行账户。每平台入金视为可损耗预算 €150-400,先完成一次小额提现验证再做下单测试。

REQUIRED
P-09

预算参考:VPS €60-90,备用观测点 €20-40,P8 手续费与点差 €150-400,平台可损耗入金 €600-1,200,发布与存证 €0(Zenodo + OpenTimestamps)。合计约 €830-1,730。

REQUIRED
P-10

法律与伦理红线:不伪造或借用证件;不做渗透、撞库或任何未授权访问;不跨账户对敲、不双向同时挂单、不撤单轰炸、不分层报价、不以影响价格为目的下单;不超限频抓取;不使用 VPN 伪装地区。任一平台条款禁止本规范中的某步 → 记为「未测(条款限制)」,不执行。

REQUIRED
P-11

右辩权流程:发表前给被测平台不少于 10 个工作日的答复期,提供其名下全部原始记录(含 P8 逐单明细)以便逐条核对,答复原文随文发布。

REQUIRED
P-12

角色分工:采集运维 1 人、统计分析 1 人、独立复核 1 人(复核者不参与采集与首次分析,负责跑 make verify 与重算三个关键数字)。

REQUIRED

PROTOCOL

9 procedures, each with its own evidence boundary.

Every procedure states what its output can support and what it cannot. The second of those is the one that keeps a measurement honest.

AXP-PRICE-v1/P1

参考源集合与共识指数的预注册定义

  1. 在任何采集开始前写下参考源候选清单与准入判据,提交版本库并打 tag;此后窗口内不得增删。
  2. 准入判据(须全部满足):C1 提供无需鉴权的公开 L1/L2 行情 WebSocket 与 REST,且公开文档化速率限制;C2 该交易对连续挂牌 ≥ 12 个月;C3 与被测平台及其他参考源无已知同一运营主体、同一撮合引擎或白标关系(用公司注册记录与数字指纹证据做剔除依据,仅用于剔除,不作为任何结论);C4 近 30 日该对公开成交额中位数 ≥ V_min(BTC 对取 ≥ 5,000 万 USD/日);C5 集合中至少 2 家在欧盟/EEA 提供服务——此项仅作为行情披露稳定性的启发式,不构成任何法律认定。
  3. 参考源数量:目标 7 家,最低 5 家。被测平台永远不得进入自身的参考集合(自指禁止)。同一集合用于全部被测平台,保证横向可比。
  4. 每源价格定义:mid m_s(t) = (bid_s + ask_s)/2;同时记录 microprice mp_s = (bid·Q_ask + ask·Q_bid)/(Q_bid+Q_ask) 作稳健性对照。以 mid 为主,因为 microprice 依赖各源不一致的数量字段。
  5. 计价币归一:优先同计价币比较。跨计价币时用同一方法独立构建换算腿指数(USDT/USD、EUR/USD 各 ≥3 源),把偏离分解为 d = d_asset + d_quote 分别报告。禁止假设 USDT = 1.0000。
  6. 权重:w_s ∝ sqrt(V_s^24h),V_s 取窗口开始时刻的公开 24h 名义成交额并在整个窗口内冻结(防止窗口内反馈与前视);按 35% 上限迭代封顶,超出部分按比例分配给未封顶源,最多 10 次迭代。
  7. 指数:C(t) = 加权中位数(下加权中位数与上加权中位数的算术平均);同时计算无权中位数 C_med 作稳健性对照,两者差异 > 5 bps 的时段必须在正文标注。
  8. 异常剔除(顺序固定):先算 M(t)=median(m_s)、MAD(t)=median(|m_s−M|),剔除 |m_s−M| > 5·1.4826·MAD(t) 的源;再剔除 staleness > τ_s、盘口交叉或锁定、本源价差 > 其自身 30 分钟滚动价差中位数 10 倍的源。
  9. 有效性门槛:存活源 < 4 → C(t)=NaN,该网格点从所有统计中剔除并计入 coverage 指标。
  10. 每一次剔除写入剔除日志(时间、源、代码、触发值),日志随数据集发布。
Quantity measured
C(t) = WeightedMedian({m_s(t)}, {w_s}),w_s ∝ sqrt(V_s^24h) 经 35% 迭代封顶后归一(Σw_s=1);剔除判据 |m_s(t) − median_s(m_s(t))| > 5 · 1.4826 · MAD_s(t);偏离 d(t) = 10^4 · (P_sut(t) − C(t)) / C(t),单位 bps。
Fixed parameters
MAD 系数 k=5(正态下约 3.37σ,兼顾灵敏与不误杀);权重指数 0.5(线性成交额权重会让单一最大场所主导并把其故障传导进指数,平方根压缩量纲差异同时保留信息量);封顶 35%(在 5 源最低配置下,任一源失效不能翻转加权中位数);n_min=4;τ_s = max(2000 ms, 该源 24h 预试验更新间隔的 p99.9);V_min(BTC 对)= 5,000 万 USD/日。
Sample size
参考源 5-7 家 × 3-4 个交易对;预注册文档 1 份;全部候选源 24 小时预试验用于实测 τ_s 与准入判据取值分布(不得用记忆或文档值代替实测)。
Control
被测平台与参考源使用完全相同的价格定义、剔除规则与时间戳处理。参考源两两之间的全部统计量在后续各步中作为对照分布计算,被测平台的数值只在该分布内解读。
Statistical treatment
加权中位数对单源故障不敏感(崩溃点由权重上限保证);不做任何平滑或插补;权重冻结消除窗口内反馈。
Reproducibility check
第三方按 C1-C5 独立筛选,应得到相同的准入集合;若不同,差异必须能追溯到某条判据的实测值,而不是主观取舍。发布 admission 表含每源每条判据的实测值。
Known pitfalls
用聚合站展示价当参考(成分权重不透明且回溯修订);把被测平台混进自己的指数;窗口内更新权重造成前视偏差;忽略 USDT/EUR 基差把计价币偏离算成资产偏离;用文档 tick size 而非实测值做后续取整分析。
Risk
若准入判据在窗口中途被迫放宽(如某源下线),必须记为规范偏离并升 minor 版本,不得静默替换。

SUPPORTS / 建立一个不含被测方、成分与权重可被第三方逐条复算的参考价基准,使「平台价格偏离」成为一个有定义、有单位、有不确定度的量。

DOES NOT SUPPORT / 共识指数不是「真实价格」,它只是这组场所在这段时间的加权中位数;参考源可能被同一因素同时影响(稳定币折价、同一做市商、同一行情供应商),指数并不独立于市场结构。更重要的是:平台自称聚合了哪几家流动性、合作方 logo、白皮书里的架构图、以及任何公司注册或 MSB 注册记录(含注册号、注册范围、成立日期),都不能确立任何关于价格来源或撮合方式的事实,也不能替代本步的实测构建——注册记录是行政事实,与价格数据之间没有推理通道。

EVIDENCE RETAINED / preregistration.md 与其 git tag · admission 表(每源每判据实测值) · 权重计算脚本与冻结时刻的 24h 成交额快照 · 剔除日志全量
RECORDED FIELDS (12)
  • spec_commit / sha / 预注册文档的 git commit,窗口开始前打 tag
  • venue_id / 枚举 / 参考源或被测平台标识,全刊统一命名
  • pair / 字符串 / 形如 BTC-USDT,必须含计价币
  • measured_surface / 枚举 / public_orderbook_api / pro_ui / retail_convert,同一平台不同面不得混用
  • admitted / bool / 是否进入参考集合
  • admission_values / JSON / C1-C5 每条的实测值,不是通过/不通过而是数值
  • vol_24h_usd / USD / 窗口开始时刻的公开 24h 名义成交额,窗口内冻结
  • w_s / 无量纲 / 封顶后归一权重,Σ=1
  • tick_size_doc / 报价币 / 文档声明的最小变动
  • tick_size_obs / 报价币 / 预试验实测最小非零变动,与文档值不符必须记录
  • tau_ms / ms / 该源 staleness 阈值,来自预试验 p99.9
  • quote_leg / 字符串 / 跨计价币换算腿标识,无则留空
SPECIFICATION
AXP-PRICE-v1/P2

采集基础设施、时钟同步与路径延迟基线

  1. 所有采集器在同一台欧盟区 VPS 上运行;记录实例规格、机房、内核版本、网卡队列设置。
  2. chrony 对至少 4 个 NTP 源同步;每 60 秒记录 offset / jitter / root dispersion;会话首尾各做一次 chronyc tracking 快照。
  3. 时钟硬门槛:|offset| ≤ 5 ms 且 root dispersion ≤ 20 ms,否则该时段标记 clock_suspect=1,从领先滞后与跳变响应分析中剔除(仍保留在偏离统计中,因为偏离对毫秒级时钟不敏感)。
  4. 所有本地时间戳由 CLOCK_MONOTONIC 加一次性 CLOCK_REALTIME 锚点合成 UTC 纳秒;不直接使用可能被 NTP 步进的墙钟。
  5. 每源延迟基线:每 5 分钟测 20 次 WS ping/pong(或最轻量 REST 端点),取 lat_s = p10(RTT)/2 作为单向传播时延估计(p10 而非中位数,因为最小 RTT 最接近纯传播时延),不确定度取 u_s = (p50−p10)/2。
  6. 领先滞后必须做延迟校正:ℓ_corrected = ℓ_raw − (lat_sut − lat_ref),并把 sqrt(u_sut² + u_ref²) 作为加性分量并入滞后的置信区间。
  7. 双采集器 A/B:对同一场所同时跑两个独立进程(独立连接),比较两者事件时间戳差与丢失率;该差的 p95 即本仪器的时间噪声下限,必须小于我们想分辨的最小滞后(目标 < 20 ms),达不到则不得报告 20 ms 以下的滞后差异。
  8. 断线与序列号:记录重连次数、gap 数、恢复方式;任何 seq 断裂的窗口标记并从该窗口分析中剔除。
  9. 记录采集器 git commit、锁文件哈希、容器镜像 digest。
Quantity measured
lat_s = p10(RTT_s)/2;u_s = (p50(RTT_s) − p10(RTT_s))/2;ℓ_corrected = ℓ_raw − (lat_sut − lat_ref);σ_ℓ,instrument = sqrt(u_sut² + u_ref² + (AB_p95/2)²)。
Fixed parameters
NTP 源 ≥4;采样 60 s;offset 门槛 5 ms;rootdisp 门槛 20 ms;RTT 每 5 分钟 20 次;A/B 目标 p95 < 20 ms;注入检验目标 250 ms、容差 ±20 ms。
Sample size
每源每天 ≥ 5,760 次 RTT 测量(288 轮 × 20 次);时钟记录每天 1,440 条;A/B 双采集覆盖至少 3 个完整 24h 日以及每个采样层。
Control
注入已知滞后的自校验序列作为阳性对照;同一场所双采集器作为仪器噪声对照。
Statistical treatment
RTT 用分位数而非均值(尾部由排队时延主导);仪器不确定度与统计不确定度分开报告,最终滞后 CI 为两者的合成。
Reproducibility check
把某参考源的行情整体人为延迟精确 250 ms 后重喂全流水线,估计器必须还原 250 ± 20 ms。还原失败说明时间链有 bug,全部结果作废重跑。该检验结果必须随数据集发布。
Known pitfalls
直接用墙钟做时间差;用平均 RTT 当传播时延(被排队时延污染);在多台机器上分散采集导致路径不对称不可估计;报告小于仪器噪声下限的滞后差异。
Risk
VPS 邻居噪声可能造成偶发 RTT 尖峰,必须用分位数而非最值;机房迁移会使 lat_s 基线失效,窗口中途不得迁移。

SUPPORTS / 确立本次测量在时间维度上的分辨率下限,使任何报告出的领先滞后数值都有可辩护的不确定度;把「平台滞后」与「我们机器慢」在数据上分开。

DOES NOT SUPPORT / 延迟基线只覆盖我们这台机器到各场所的路径。它不能确立平台内部撮合延迟、不能确立其它地区用户看到的报价时序,也不能排除平台按来源地区提供不同报价(CDN/边缘分发)。我们只从一个合法观测点观测,这是必须写明的边界。任何平台关于自身撮合延迟的宣传数字(如「撮合 5 微秒」)都是文档陈述,无法用本步或任何外部观测证实或证伪。

EVIDENCE RETAINED / chrony 日志全量 · RTT 测量表 · A/B 双采集对比表 · 250 ms 注入检验的输入输出与脚本
RECORDED FIELDS (11)
  • ts_utc_ns / ns / 合成 UTC 纳秒时间戳
  • ntp_offset_ms / ms / chronyc tracking 的 system time offset
  • ntp_rootdisp_ms / ms / root dispersion
  • clock_suspect / 0/1 / 超门槛标记,领先滞后分析必须剔除
  • rtt_p10_ms / ms / 该源该轮 RTT 的 p10
  • lat_est_ms / ms / 单向传播时延估计 = p10/2
  • lat_unc_ms / ms / (p50−p10)/2,并入滞后 CI
  • ab_ts_delta_p95_ms / ms / 双采集器时间戳差 p95,仪器噪声下限
  • ws_gap_count / / 序列号断裂次数
  • injected_lag_recovered_ms / ms / 250 ms 注入检验的还原值
  • collector_commit / sha / 采集器版本
SPECIFICATION
AXP-PRICE-v1/P3

连续采样、网格化与数据质量控制

  1. WS 订阅每源 L1 最优买卖(bookTicker 类)与逐笔成交;L2 前 20 档快照按 1 Hz 仅在每天 2 个预注册的 1 小时时段采集,其余时间 0.1 Hz(控制存储量,同时保证 P7 有足够深度样本)。
  2. 采样窗口:每个被测平台连续 14 × 24h(UTC),加 2 个预注册的事件加密窗口(日期在预注册文档中锁定,不得事后挑选)。
  3. 分层:EU 早盘 06:00-10:00 UTC、EU/US 重叠 13:00-17:00 UTC、亚洲 00:00-04:00 UTC、周末。所有统计按层分别报告并给全样本汇总;偏离与领先滞后都是强烈的时段依赖量,只报全样本汇总等于隐藏信息。
  4. 网格化:主网格 100 ms,副网格 1 s,均用 LOCF(末值前推)。禁止线性插值——它使用未来信息,会人为压低滞后估计。原始 tick 完整保留供 Hayashi-Yoshida 使用。
  5. 质量指标(必须发布):每源 uptime、消息数、gap 数、staleness 分布、被剔除网格点占比、clock_suspect 时长占比。
  6. 覆盖率门槛:某窗口若指数有效点占比 < 95%,该窗口降级为「仅描述性」,不进入主结果表。
  7. 存储:zstd 压缩 parquet;价格以 decimal 字符串保存避免二进制浮点损失;公开发布 1 s 网格全量 + L1 tick 分卷 + 全部校验和。
Quantity measured
网格值 x(t_k) = x(max{t ≤ t_k})(LOCF);staleness(t_k) = t_k − last_update_ts;coverage = #{t_k : n_sources(t_k) ≥ 4} / #{t_k}。
Fixed parameters
主网格 100 ms、副网格 1 s;L2 采样 1 Hz(2 h/天)与 0.1 Hz(其余);窗口 14 天;覆盖率门槛 95%;分层边界如上(UTC)。
Sample size
每平台 14 天 × 3-4 对;100 ms 网格约 1.21×10⁷ 点/对/14 天;每层 ≥ 2.0×10⁶ 点(100 ms 网格);L2 快照约 1.0×10⁵ 个/源/14 天。压缩后 L1 全量估计 10-20 GB(实测值填入 manifest)。
Control
每个被测平台与全部参考源在同一进程组、同一时段、同一网格规则下采集;任何只对被测平台生效的处理都是污染。
Statistical treatment
不做去噪、不做异常值修剪、不做重采样平滑;所有质量判定通过 qc_flag 标记而非删除,删除只发生在明确的剔除码下并留日志。
Reproducibility check
任何第三方可用自己的采集器采一段新窗口,运行同一网格化代码,其质量指标(gap 率、staleness 分布)应与我们同量级;量级差异超过 10 倍说明其采集链有问题,须先修复再比对结果。
Known pitfalls
用线性插值填格(引入前视);把 REST 轮询数据与 WS 数据混在同一列不标注 src;只报全样本汇总掩盖时段差异;把 staleness 大的点当正常值参与统计。
Risk
14 天窗口内平台若发生版本升级、行情端点变更或维护,必须记录并把该时段单列,不得平均掉。

SUPPORTS / 产出一份带完整质量指标、可被独立重算的时间序列底座;使后续所有统计量的样本量、覆盖率与剔除比例都可核查。

DOES NOT SUPPORT / 采样只覆盖公开行情端点看到的内容。它无法确立订单簿背后是否有真实挂单人、深度是否可成交、成交带是否完整(平台可延迟或聚合成交推送)。也无法确立平台在其它地区或其它客户端(App/Web/API)上展示的价格是否与本采样面一致——不同面必须分别采集,不能互相推断。

EVIDENCE RETAINED / 原始 L1 tick 分卷与校验和 · 1 s 网格全量表 · L2 快照集 · 每源每日质量指标表
RECORDED FIELDS (14)
  • ts_grid_ns / ns / 网格时间戳,UTC 纳秒整数
  • venue_id / 枚举 / 场所标识
  • pair / 字符串 / 交易对
  • bid / ask / 报价币 / decimal 字符串保存
  • bid_qty / ask_qty / 基础币 / 用于 microprice 与 P8 规模标定
  • mid / 报价币 / (bid+ask)/2
  • spread_bps / bps / 10^4·(ask−bid)/mid
  • staleness_ms / ms / 距该源上次更新的时长
  • src / 枚举 / ws / rest,REST 为降级来源
  • excl_code / 枚举 / none/mad/stale/crossed/widespread/gap
  • n_sources / / 该网格点存活参考源数,<4 则指数为空
  • C_wmed / C_med / 报价币 / 加权中位数与无权中位数
  • layer / 枚举 / eu_am / overlap / asia / weekend
  • qc_flag / 位掩码 / 质量标记,缺失值一律留空不填 0
SPECIFICATION
AXP-PRICE-v1/P4

偏离统计量、价差归一化与可执行套利边界

  1. 计算 d(t) 与 |d(t)|,按层与全样本分别汇总。
  2. 分解:持久项 b = median(d) over window(及各层 b_layer);瞬时项 d̃(t) = d(t) − rolling_median(d, 10 min)。此分解是本步的核心——对常数乘性加价,所有动态统计量不变,因此 b 不含任何价格发现信息。
  3. 报告 d 的 median / mean / IQR / p5 / p95 / MAD,以及 |d| 超过 25 / 50 / 100 / 250 bps 的时间占比。
  4. 价差归一化:z(t) = d(t) / (s_sut(t)/2),s_sut 为被测平台自身报价价差(bps)。|z| < 1 表示平台价格相对指数仍落在自身买卖价之内,属正常做市差异;|z| > 3 且持续表示整条报价在指数之外。报告 |z| 分布与 P(|z|>1)、P(|z|>3)。
  5. 包络检验:envelope_state ∈ {inside, above, below}。若 P_sut_bid > max_s(ask_s) 记 above,若 P_sut_ask < min_s(bid_s) 记 below。统计两态的时间占比与连续持续时长分布(p50/p95/max)。
  6. 可执行套利边界:A(t) = 10^4·(P_sut_bid − C_ask_best)/C_ask_best − (f_taker,sut + f_taker,ref + c_transfer),c_transfer 为按预注册假设摊销的转账成本(写明假设:单次提币费 / 名义额,不含时间风险与滑点)。统计 A > 0 的时间占比与持续时长分布——这才是有经济含义的锚定失效。
  7. 自相关与半衰期:对 d̃ 在 1 s 网格上拟合 AR(1),用 Newey-West 稳健标准误(带宽按 4(T/100)^{2/9});半衰期 t_half = ln(0.5)/ln(ρ)。同时对参考源两两之间计算同一统计作对照分布。
  8. 不确定度:所有分位数与时间占比用平稳块自助(Politis-Romano),块长由 Politis-White (2004) 自动规则确定(可用 arch 包的 optimal_block_length),B=1000,报告 95% 百分位置信区间。
  9. 长尾处理:不做 winsorize(尾部正是关注对象)。单列 top-20 最大 |d| 事件的时间戳、当时 n_sources 与剔除记录,供人工核查是否为采集故障而非市场现象。
Quantity measured
d(t) = 10^4·(P_sut(t) − C(t))/C(t) [bps];b = median_t d(t);d̃(t) = d(t) − median_{10min}(d);z(t) = 2·d(t)/s_sut(t);A(t) = 10^4·(P_sut_bid − C_ask_best)/C_ask_best − (f_taker,sut + f_taker,ref + c_transfer);t_half = ln0.5/lnρ,ρ 来自 d̃ 的 AR(1)。
Fixed parameters
滚动中位数窗口 10 min;阈值集 {25,50,100,250} bps;z 判据 1 与 3;AR(1) 在 1 s 网格;Newey-West 带宽 4(T/100)^{2/9};自助 B=1000、块长自动规则、CI 95%。
Sample size
每平台每对每层 ≥ 2.0×10⁶ 个 100 ms 网格点;AR(1) 在 1 s 网格上每层 ≥ 2.0×10⁵ 点;参考源两两对照 C(K,2) 组(K=5-7 时为 10-21 组)。
Control
参考源两两之间跑完全相同的 d、z、包络、半衰期计算,得到「已知真实场所之间」的经验分布;被测平台的每个数值都必须报告其在该分布中的分位位置,而不是与任何拍脑袋的绝对阈值比较。
Statistical treatment
高频序列强自相关,独立同分布假设失效,因此一律用平稳块自助而非解析标准误;分位数与占比类统计量直接自助;不做正态性假设;不修剪尾部。
Reproducibility check
发布 d 序列本身,第三方可直接从 1 s 网格表重算 b、z 分布与占比,与我们发布值的差异应在浮点容差内(README 给出容差)。另:用 P5 的合成序列(已知 b 与已知 Δ)跑本步,b 必须被准确还原。
Known pitfalls
把 b 当成内盘证据;不做价差归一化直接比较不同流动性平台的 d;用解析标准误导致 CI 严重过窄;对尾部做 winsorize 抹掉最有信息的事件;忘记扣除计价币基差 d_quote。
Risk
c_transfer 的假设强烈影响 A(t)>0 的占比,必须把假设参数与敏感性分析(±50% 变动)一起发布。

SUPPORTS / 给出平台展示价与共识指数之间偏离的完整分布刻画,并把它拆成对价格发现无信息的持久项与有信息的动态项;用价差归一化与包络检验给出「正常做市差异」与「整条报价在市场之外」的可复算分界;用套利边界给出经济上是否重要的判断。

DOES NOT SUPPORT / 大的持久偏离 b 只说明平台展示价与共识指数之间存在稳定价差,其常见合法解释包括点差型收费、零售转换定价、计价币基差、区域性溢价;b 本身不含任何关于是否连接外部市场的信息。d 的任何统计量都不能区分「内部撮合」与「外部路由但报价加成」——我们观测的是价格,不是订单路由。A(t)>0 也不等于套利真的可执行:提现速度、限额、KYC 门槛、转账确认时间都可能使它不可实现,本步只给账面边界。平台在费率页、帮助中心或白皮书里对价差来源的解释,只是其陈述,无法证实或证伪本步的任何数值。

EVIDENCE RETAINED / 逐点 d/z/envelope/A 序列表 · 分层汇总表含 CI · 参考源两两对照分布表 · top-20 极端偏离事件的人工核查记录
RECORDED FIELDS (12)
  • window_id / layer / 枚举 / 窗口与时段层标识
  • d_bps_median / mean / p5 / p95 / iqr / mad / bps / 偏离分布统计量,各附自助 CI
  • b_bias_bps / bps / 持久项,窗口中位数
  • z_abs_p50 / p95 / 无量纲 / 价差归一化偏离
  • p_absz_gt1 / p_absz_gt3 / % / 超出自身价差与显著超出的时间占比
  • envelope_above_pct / below_pct / % / 整条报价越过全部参考盘口的时间占比
  • envelope_run_p95_s / max_s / s / 越界连续持续时长
  • arb_margin_pos_pct / % / A(t)>0 的时间占比
  • arb_run_p95_s / s / 可执行套利窗口持续时长 p95
  • rho_ar1 / halflife_s / 无量纲 / s / 瞬时偏离的 AR(1) 系数与半衰期
  • ci_lo / ci_hi / boot_B / block_len / 同主量 / 次 / 点 / 自助置信区间与参数,缺一不可发布
  • control_pctile / % / 该数值在参考源两两对照分布中的分位位置
SPECIFICATION
AXP-PRICE-v1/P5

领先滞后、价格发现份额与合成校准面

  1. 在 100 ms 网格上取对数收益 r_sut(k)=ln P_sut(t_k)−ln P_sut(t_{k−1})、r_C(k) 同理,各自去均值。
  2. 互相关:CCF(ℓ) = corr(r_sut(k), r_C(k−ℓ)),ℓ ∈ [−100, +100] 网格步(±10 s)。ℓ̂ = argmax|CCF|,在峰值附近用三点抛物线插值得亚网格分辨率;再按 P2 做延迟校正。
  3. Hayashi-Yoshida:在原始异步 tick 上(不网格化)扫描 ℓ ∈ [−10 s, +10 s]、步长 10 ms,取 HY 相关最大处作为第二个滞后估计。此估计不受 Epps 效应(网格采样导致的高频相关衰减)影响。两个估计相差 > 200 ms 时必须在正文并列标注并解释,不得只报好看的那个。
  4. Hasbrouck 信息份额:在 1 s 与 5 s 网格上对 (ln P_sut, ln C) 建 VECM,因是同一资产故施加协整向量 (1, −1),滞后阶按 BIC 选(上限 30)。因 Cholesky 排序不唯一,报告信息份额的上下界区间,绝不报点值;同时报告与排序无关的 Gonzalo-Granger 成分份额。
  5. 不确定度:ℓ̂、CCF 峰值、IS 上下界均用平稳块自助 B=1000 得 95% CI;最终滞后 CI 再合成 P2 的仪器不确定度。
  6. 对照组(必做):对参考源两两组合跑完全相同的流水线,得到已知真实场所之间的 ℓ̂、CCF 峰、IS 区间的经验分布。被测平台的数值必须报告其在该分布中的分位位置。
  7. 合成校准面(仪器自校验):由指数 C 生成合成序列 P̂(t) = round(EMA_h(C(t−Δ)), δ) + ε,在 Δ ∈ {0,50,100,...,5000} ms × h ∈ {0,0.2,1,5,30} s 的网格上跑同一流水线,得到 (ℓ̂, CCF 峰, IS, 半衰期, 精确匹配率) 的校准面;把被测平台的观测点投影到该面,报告最接近的 (Δ, h) 邻域。这是描述性定位——「若该平台报价是对指数的延迟加平滑映射,参数大约落在何处」——不是因果结论。
  8. 合成阴性对照:生成 C + 独立 OU 噪声 + 泊松跳(模拟自有订单流)的序列,确认流水线在该情形下给出接近 0 的滞后与非零信息份额;若不能,流水线有问题。
Quantity measured
CCF(ℓ) = Corr(r_sut(k), r_C(k−ℓ));ℓ̂ = argmax_ℓ |CCF(ℓ)|,抛物线细化 ℓ* = ℓ̂ + 0.5·(C_{-1}−C_{+1})/(C_{-1}−2C_0+C_{+1})·Δgrid;HY 协方差 Σ_{i,j} Δp_sut(I_i)·Δp_C(J_j)·1{I_i ∩ J_j ≠ ∅};Hasbrouck IS_k = (Ψ Ω^{1/2})_k² / (Ψ Ω Ψ'),按两种 Cholesky 排序取上下界。
Fixed parameters
CCF 范围 ±10 s、主网格 100 ms;HY 步长 10 ms、范围 ±10 s;VECM 网格 1 s 与 5 s、协整向量固定 (1,−1)、滞后阶 BIC 上限 30;自助 B=1000、CI 95%;校准面 Δ 步长 50 ms 至 5 s、h ∈ {0,0.2,1,5,30} s。
Sample size
每平台每对每层 ≥ 2.0×10⁶ 个 100 ms 收益点用于 CCF;VECM 在 1 s 网格上每层 ≥ 2.0×10⁵ 点;HY 使用全部原始 tick;对照组 C(K,2) = 10-21 个场所对;校准面 101 × 5 = 505 个合成配置。
Control
三重对照:参考源两两的真实经验分布(横向基准)、合成镜像序列的校准面(阳性对照,已知 Δ 与 h)、合成真实场所序列(阴性对照,已知零滞后)。任何被测平台的数值只在这三者之间被解读。
Statistical treatment
高频收益强自相关且异方差,全部 CI 用平稳块自助;IS 只报区间不报点值;两种滞后估计(网格 CCF 与 HY)必须并列报告,一致性本身是结果的一部分;峰值显著性用块置换零分布(打乱 60 s 块后重算 CCF 峰)检验。
Reproducibility check
250 ms 注入检验(P2)必须先通过。校准面本身是可复算的:第三方用我们发布的指数序列即可重建整个 (Δ,h) 面并核对我们的投影位置。合成阴性对照必须给出接近 0 的滞后,否则流水线不可信。
Known pitfalls
用线性插值网格化压低滞后;只报网格 CCF 不做 HY 导致 Epps 效应偏差;把 IS 折成点值;没有对照组直接把相关系数当结论;忽略延迟校正;在 clock_suspect 时段计算滞后。
Risk
合成校准面依赖 EMA + 延迟 + 取整这一特定映射族;真实的镜像实现可能不属于该族,此时 calib_dist 会很大,必须如实报告而不是强行投影。

SUPPORTS / 确立被测平台价格序列与共识指数之间的时间方向关系与信息贡献份额,并把该数值放进已知真实场所的经验分布与已知参数的合成校准面中定位,使读者能判断它是靠近真实场所群还是靠近延迟平滑映射群。

DOES NOT SUPPORT / 滞后为正且大不能证明平台没有真实订单簿——地理路由、API 网关缓存、CDN、撮合引擎自身延迟、以及真实但稀薄的流动性都能产生滞后。信息份额接近 0 是「镜像」的必要非充分条件:任何没有信息交易者的小场所都会得到接近 0 的信息份额。反过来,滞后接近 0 也不能证明有真实外部流动性,镜像可以做到几乎无延迟。校准面上的 (Δ,h) 定位是描述性的,说的是「若是延迟平滑映射则参数在此」,不是「它就是延迟平滑映射」。本步测的是价格序列之间的统计关系,我们没有观测到任何一笔订单去了哪里;平台架构图、流动性合作方公告、以及任何注册或牌照类文件都不能补上这个观测缺口。

EVIDENCE RETAINED / CCF 全曲线(每个窗口) · HY 扫描曲线 · VECM 估计输出与 BIC 选阶记录 · 对照组两两结果表 · 合成校准面全量结果与生成脚本
RECORDED FIELDS (13)
  • window_id / pair / layer / 枚举 / 分析单元标识
  • lag_ccf_ms / ms / 网格 CCF 滞后估计,已延迟校正;正值表示平台滞后于指数
  • lag_ccf_ci_lo / ci_hi / ms / 合成统计与仪器不确定度后的 95% CI
  • ccf_peak / ccf_peak_ci / 无量纲 / 峰值相关及其 CI
  • ccf_perm_p / p 值 / 块置换零分布下峰值的显著性
  • lag_hy_ms / ms / Hayashi-Yoshida 滞后估计(原始 tick)
  • lag_disagree_ms / ms / 两估计之差,>200 ms 必须正文标注
  • is_lower / is_upper / % / Hasbrouck 信息份额上下界,禁止折成点值
  • gg_share / % / Gonzalo-Granger 成分份额(排序无关)
  • vecm_lags / grid_ms / 阶 / ms / BIC 选出的滞后阶与所用网格
  • control_pctile_lag / control_pctile_is / % / 在参考源两两对照分布中的分位位置
  • calib_delta_ms / calib_h_s / ms / s / 投影到合成校准面上的最近 (Δ,h) 邻域
  • calib_dist / 无量纲 / 投影残差,过大表示观测点不在校准面覆盖范围内
SPECIFICATION
AXP-PRICE-v1/P6

跳变事件响应研究

  1. 事件定义(预注册,不得事后调):在 1 s 网格上,指数对数收益 |r_C| > q·σ̂_t,q=6,σ̂_t 为 EWMA 已实现波动率(λ=0.94,回看 30 分钟);要求事件前后 60 s 内无其它事件(去重),且事件时刻 n_sources ≥ 5,且 clock_suspect=0。
  2. 目标事件数:每平台每对 ≥ 40 个。若 14 天不足 40 个,先延长窗口;仍不足才把 q 降至 5,且该改动必须记录为规范偏离并在正文标注。
  3. 对每个事件计算响应函数 R(u) = [P_sut(t0+u) − P_sut(t0−1s)] / [C(t0+u) − C(t0−1s)],u ∈ {0.1, 0.2, 0.5, 1, 2, 5, 10, 30, 60, 300} s。
  4. 提取五个量:达到 50% 与 90% 跟随所需时间 T50 / T90;u=60 s 时的跟随比例 R(60);过冲 max_u R(u) − 1;回复量 R(60) − R(300)(若先接近 1 再显著回落,说明报价被拉回某个内部参考,而不是被交易重新定价)。
  5. 分方向统计:上跳与下跳分别汇总并检验不对称(例如只在对平台有利的方向快速跟随)。这是零售点差型定价与真实盘口之间一个可检验的分野。
  6. 对照窗口:为每个事件匹配一个同层、同时段、同波动率桶但无事件的窗口,用同样公式计算 R,确认无事件时估计量不产生伪信号(分母接近 0 会放大噪声,必须显式检验并在必要时对分母设下限)。
  7. 参考源两两对照:同一流水线跑参考源之间,给出真实场所的 T50/T90/R(60) 分布,被测平台数值报告其分位位置。
  8. 统计:事件层面取中位数,用事件级自助(B=1000,按事件重抽样)给 95% CI。
Quantity measured
事件判据 |r_C(t)| > 6·σ̂_t,σ̂²_t = λσ̂²_{t−1} + (1−λ)r_C²(t−1),λ=0.94;响应 R(u) = ΔP_sut(u)/ΔC(u),Δ 均相对 t0−1s;T50 = min{u : R(u) ≥ 0.5};过冲 = max_u R(u) − 1;回复量 = R(60) − R(300)。
Fixed parameters
q=6(不足时降至 5 并标注);λ=0.94;波动率回看 30 min;去重半径 60 s;u 序列如上;分母下限设为该对典型 1 s 波动的 3 倍以避免除零放大;自助 B=1000。
Sample size
每平台每对 ≥ 40 个事件(目标 60),上跳下跳各 ≥ 15 个;每个事件配 1 个匹配对照窗口;参考源两两对照组同样每对 ≥ 40 事件。
Control
无事件匹配窗口(伪信号对照)+ 参考源两两(真实场所对照)+ P5 的合成序列(已知 Δ、h 的映射在本步应给出可预测的 T50/T90,用于验证本步估计器)。
Statistical treatment
事件级自助而非时点自助(事件之间近似独立,事件内部高度相关);中位数而非均值(R 的分母使分布重尾);分方向分层报告;分母下限与其敏感性一并发布。
Reproducibility check
事件清单(时间戳 + 跳幅 + n_sources)全量发布,第三方可直接复算每个事件的 R 曲线。合成序列(已知 Δ=500 ms、h=1 s)跑本步应给出与解析预期一致的 T50,偏差超过 20% 说明估计器实现有误。
Known pitfalls
事后挑选事件(必须预注册阈值);分母接近 0 时不设下限导致 R 爆炸;不分方向汇总掩盖不对称;把右删失(一直未达 50%)当缺失丢掉而不是单独统计;在 clock_suspect 时段取事件。
Risk
宏观数据发布时段事件密集,去重半径若过小会产生重叠事件;预注册的事件加密窗口应单列而不是混入常规统计。

SUPPORTS / 确立平台报价在外部市场发生可识别跳变时的跟随速度、跟随幅度、方向不对称与事后回复行为;这是比平均偏离更接近「是否跟随外部市场」的动态证据。

DOES NOT SUPPORT / 跟随慢或跟随不全,不能证明平台不与外部市场连接:真实但稀薄的盘口在跳变后本就需要时间被套利者拉回,风控暂停报价、熔断、限价保护也会产生同样的曲线形状。方向不对称也可能来自合规的动态点差风控。反过来,跟随快也不能证明有真实成交发生在这些价格上。T50 是对报价的测量,不是对可成交性的测量——可成交性属于执行质量与流动性基准的范围。平台关于风控或熔断机制的书面说明可以帮助解释曲线,但不能替代测量,也不能被当作曲线为何如此的证明。

EVIDENCE RETAINED / 事件清单全量 · 每事件 R(u) 曲线数据 · 匹配对照窗口清单 · 参考源两两对照分布
RECORDED FIELDS (12)
  • event_id / 字符串 / 事件唯一标识
  • t0_utc_ns / ns / 事件起始时刻
  • jump_bps / bps / 指数 1 s 跳幅
  • direction / 枚举 / up / down
  • n_sources_at_event / / 事件时刻存活参考源数,<5 不入选
  • R_u / 无量纲 / 各 u 上的跟随比例,长表存储
  • T50_ms / T90_ms / ms / 达到 50%/90% 跟随的时间,未达到记为右删失并单独统计
  • R_60s / 无量纲 / 60 秒时的跟随比例
  • overshoot / 无量纲 / 最大跟随比例减 1
  • revert_60_300 / 无量纲 / R(60)−R(300),正值大表示报价被拉回内部参考
  • matched_control_id / 字符串 / 匹配的无事件对照窗口
  • control_pctile_T50 / % / 在参考源两两对照分布中的分位位置
SPECIFICATION
AXP-PRICE-v1/P7

微观结构指纹与镜像检验

  1. 价格粒度:统计 P_sut 的最小非零变动及其对文档 tick size 的倍数分布;末位数字频次与均匀分布做 χ² 检验(真实盘口的末位分布通常非均匀,会在整数价位聚集);与全部参考源同一统计对照。
  2. 更新节拍:更新间隔直方图,并对更新指示序列做 Lomb-Scargle 周期图,检验是否存在 1 Hz / 0.5 Hz / 0.2 Hz 等严格周期分量(轮询式喂价的特征);峰值显著性用块置换零分布。
  3. 精确匹配率:对每个参考源 s 与每个滞后 ℓ,EM(s,ℓ) = P[round(P_sut(t), δ) == round(m_s(t−ℓ), δ)],δ 取两者 tick 的较粗者。用 60 s 块置换构造偶然匹配零分布,报告 EM 超出偶然水平的倍数与 CI。单一源在单一 ℓ 上显著高的 EM 是单源镜像的强指征——但粗 tick 会抬高偶然匹配,必须与零分布对比后才有意义。
  4. 冻结区间:mid 不变的连续时长分布(p50/p95/max);检验被测平台的冻结区间是否与某参考源的冻结或断线时间重合(Jaccard 重叠度 + 置换检验)。
  5. 深度形态(用 P3 的 L2 快照):各档挂单量的取整程度(是否恒为整数或 0.1 的整数倍)、各档量的唯一值数量与香农熵、深度的自相关、被消耗后恢复的半衰期;与参考源对照。
  6. 成交带一致性:公开成交价落在同时刻本平台盘口 [bid, ask] 之外的比例;成交时间戳与报价更新的时间关系;成交量的取整特征分布。
  7. 全部指纹指标必须同时对 5-7 家参考源计算,形成对照分布。单个平台的绝对值没有解释力,只有在对照分布中的位置有。
Quantity measured
EM(s,ℓ) = (1/N)·Σ_k 1{round(P_sut(t_k), δ) = round(m_s(t_k−ℓ), δ)};EM_excess = EM_obs / EM_perm(块置换零分布均值);深度熵 H = −Σ_i p_i ln p_i(p_i 为各档挂单量取值的经验频率);冻结重叠 Jaccard = |F_sut ∩ F_s| / |F_sut ∪ F_s|。
Fixed parameters
δ = max(tick_sut, tick_s)(实测值,非文档值);EM 扫描 ℓ ∈ [0, 5000] ms 步长 50 ms;块置换块长 60 s、重复 200 次;Lomb-Scargle 频率范围 0.05-10 Hz;χ² 自由度 9(末位 0-9);深度熵按前 20 档计算。
Sample size
每平台每对:≥ 1.2×10⁷ 个 100 ms 网格点用于 EM 与冻结统计;≥ 1.0×10⁵ 个 L2 快照用于深度形态;≥ 10⁵ 笔公开成交用于成交带一致性(不足则标注样本量不足并不做该项结论);对照组为全部参考源。
Control
每一项指纹都在 5-7 家参考源上计算,得到真实场所的取值范围;被测平台报告分位位置。EM 与节拍另有块置换零分布作为偶然水平对照。P5 的合成镜像序列在本步应给出极高 EM 与严格周期节拍,用于验证检验的灵敏度。
Statistical treatment
所有比率类指标与置换零分布对比后报告超出倍数与 CI,不报裸值;多重比较(K 个源 × 100 个滞后)用 Benjamini-Hochberg 控制 FDR 于 0.05;χ² 与周期图峰值均给出经置换校正的 p 值。
Reproducibility check
发布 EM 全矩阵(源 × 滞后)与置换零分布,第三方可直接复算。用一个已知的自我镜像序列(把某参考源延迟 300 ms 取整后当作被测平台)跑本步,EM 必须在 ℓ=300 ms 处出现显著峰;不出现则检验实现有误。
Known pitfalls
用文档 tick 而非实测 tick 做取整(EM 全错);不做置换基线直接报 EM 裸值;100 个滞后 × 7 个源不做多重比较校正必然出现假阳性;把参考源的冻结(我们自己断线造成)误算成平台冻结;成交样本不足仍下结论。
Risk
我方采集断线会同时制造被测平台与参考源的假冻结,必须用 P2 的 gap 日志把我方断线时段从冻结统计中排除,否则会得出完全错误的重叠结论。

SUPPORTS / 给出一组彼此独立、都有对照分布与偶然水平基线的结构性指标,用于评估「该平台报价是否表现出对某单一外部源的机械依赖」这一假设的相对可信度。

DOES NOT SUPPORT / 指纹一致不等于同源:两家平台可能采购同一家行情或做市服务而各自独立撮合。轮询式喂价可能只是前端展示层的实现方式,不代表撮合层如何工作。高 EM 在粗 tick 与低波动时段本就容易出现,必须依赖置换基线,且即使显著也只是提高某个解释的可信度,不能单独确立撮合方式。深度形态规整可能是做市商算法的正常输出。最关键的是:任何白皮书、聚合流动性说明页、合作方 logo、公司注册记录与 MSB 注册号(包括注册范围包含虚拟货币这一事实)都无法确立或反驳本步的任何一项——注册机构本身通常明示注册不等于发牌或背书,也从不核验价格来源。

EVIDENCE RETAINED / EM 全矩阵与置换零分布 · 更新间隔直方图与周期图 · 冻结区间清单(含我方断线时段标记) · L2 深度形态统计表 · 成交带一致性逐笔核对样本
RECORDED FIELDS (12)
  • lastdigit_chi2 / chi2_p_perm / 无量纲 / p 值 / 末位数字分布检验,p 值经置换校正
  • cadence_peak_hz / cadence_p / Hz / p 值 / Lomb-Scargle 主峰频率与显著性
  • interupdate_p50 / p99 / ms / 更新间隔分位数
  • em_max / em_venue / em_lag_ms / % / 枚举 / ms / 最高精确匹配率及其对应源与滞后
  • em_excess_ratio / em_ci / 倍 / 区间 / 相对块置换偶然水平的超出倍数与 CI
  • freeze_p95_s / freeze_max_s / s / mid 不变的连续时长
  • freeze_jaccard / freeze_p / 无量纲 / p 值 / 与各参考源冻结区间的重叠度及置换 p 值
  • depth_entropy / depth_round_pct / nat / % / 挂单量取值熵与整数取整占比
  • depth_replenish_halflife_s / s / 深度被消耗后恢复的半衰期
  • trade_outside_book_pct / % / 公开成交价落在同时刻自身盘口之外的比例
  • control_pctile / % / 各指标在参考源对照分布中的分位位置
  • fdr_adjusted_q / q 值 / 多重比较校正后的显著性
SPECIFICATION
AXP-PRICE-v1/P8

自有小额订单的价格影响验证(真实资金,受法律与伦理约束)

  1. 前置合规:账户由团队成员以本人身份完成 KYC,资金为团队自有。逐条阅读该平台用户协议与 API 条款,确认小额可成交订单测试不被禁止。若被禁止或条款存在歧义 → 记为「未测(条款限制)」,不执行。全程禁止:跨账户对敲、双向同时挂单(任何时刻只允许一侧存在活动订单)、撤单轰炸、分层报价、任何以影响价格为目的的操作。
  2. 规模标定:用 P3 的 L2 快照标定 Q,使其吃掉被测平台可见前 3 档深度的 20-40%;同时受两个上限约束——单笔名义额 ≤ €200,且 ≤ 该对 1 分钟中位成交额的 5%。两个上限冲突时取更小者。
  3. 时机:仅在指数已实现波动率低于其 30 分位的安静时段;每单前后 5 分钟内不得有本团队其它订单;下单时刻从预注册的候选时刻表中随机抽取(避免选择性)。
  4. 每平台每方向 ≥ 20 单(合计 ≥ 40)。每单记录:下单时刻、成交明细、手续费、下单前 1 s 平均 mid、下单后 0-200 ms / 1 s / 5 s / 30 s / 120 s 的 mid、同期指数变动、该笔成交是否出现在平台公开成交带及其延迟、被吃档位的恢复时间。
  5. 影响量:Impact(u) = 10^4·Δmid_sut(u)/mid_sut(t0) − 10^4·ΔC(u)/C(t0),即扣除同期市场变动后的净影响。
  6. 对照:为每单匹配一个同层、同波动率桶、无下单的窗口,计算同样的 Impact(u) 作为零假设分布;用配对自助(B=1000)比较。
  7. 功效:先用预试验估计 200 ms 尺度上 Δmid 的标准差 σ,预注册最小可检测效应 MDE,并按 n=20/臂、α=0.05 双侧、power=0.8 反推所需样本量。若 σ 过大使所需 n 不可行,明确报告「本平台该项功效不足,不做结论」——绝不用不足功效的数据下结论。
  8. 全部下单记录(时间、方向、数量、成交价、费用、订单号)随数据集发布,供平台行使答复权时逐条核对。
  9. 风险提示:被测平台若无法提现,投入资金可能全损。建议每平台投入 €150-400 且视为可损耗预算;先完成一次小额提现验证再执行本步。
Quantity measured
Impact(u) = 10^4·[mid_sut(t0+u) − mid_sut(t0−1s)]/mid_sut(t0−1s) − 10^4·[C(t0+u) − C(t0−1s)]/C(t0−1s),单位 bps;恢复半衰期由 Impact(u) 对 u 的指数衰减拟合得到;配对检验统计量为 Impact_order − Impact_matched_control 的中位数。
Fixed parameters
Q 目标为前 3 档深度的 20-40%;单笔名义额上限 €200;≤ 1 分钟中位成交额的 5%;波动率分位门槛 30%;订单间隔 ≥ 5 min;每方向 ≥ 20 单;u ∈ {0.2, 1, 5, 30, 120} s;配对自助 B=1000;α=0.05 双侧、power=0.8。
Sample size
每平台 ≥ 40 单(买卖各 ≥ 20),配 40 个匹配对照窗口;预试验另需 ≥ 10 单用于估计 σ 与标定 Q。全测试集 5 个平台合计 ≥ 200 单。
Control
同层同波动率桶的无下单匹配窗口(每单一配);同期共识指数变动作为市场因子被显式扣除;参考源上不下单,因此参考源之间的同期变动构成纯市场基线。
Statistical treatment
配对自助而非 t 检验(Impact 分布重尾);报告中位数与 95% CI;功效不足时报告 MDE 与实际样本量,明确写「不做结论」而不是报一个不显著的 p 值就说没有影响。
Reproducibility check
发布逐单原始记录与匹配对照窗口 ID,第三方可从我们的行情数据重算每单的 Impact;平台自身也可用其订单号核对我们是否如实记录。任何第三方用自有资金重做时应得到同量级结果(但不要求相同,因为市场状态不同)。
Known pitfalls
在高波动时段下单导致市场噪声淹没影响;不设匹配对照直接报绝对价格变动;样本量不足仍报「无显著影响」;双向同时挂单造成自成交风险;把平台的成交带延迟当成没有成交;忘记扣除同期指数变动。
Risk
涉及真实资金。被测平台可能限制提现、冻结账户或对频繁小额交易触发风控;投入资金应视为可损耗。若平台在测试期间对我方账户采取限制措施,必须如实记录并在正文披露,因为它本身是可观测事实,但不得据此推断动机。

SUPPORTS / 确立在该平台上一笔可成交的小额订单是否会移动该平台自身的中间价、该笔成交是否进入其公开成交带及延迟多少、被吃深度以多快速度恢复;配合同期指数无变动的对照,能确立「该平台报价对本地订单流是否有机械响应」。这是本基准中唯一带有干预的步骤,也是唯一能把「报价」与「本地成交」联系起来的一步。

DOES NOT SUPPORT / 不能证明订单是否被路由到外部、对手方是谁、是否存在其它真实用户。价格移动可能来自平台自身的做市或风控逻辑而非外部撮合;价格不移动也可能只是深度极厚,或平台按外部指数报价而在其上叠加自有库存管理。成交出现在公开成交带不证明它撮合了另一个真实用户的订单。本步只确立本地订单与本地报价之间的关系,不触及资金去向与对手方身份——那需要账本或监管权限,是我们没有也不应有的。同样,平台关于其撮合引擎、流动性提供方或订单路由的任何书面说明都不能替代或补充本步的观测。

EVIDENCE RETAINED / 逐单完整记录(含平台订单号与对账单截图作为附件而非数据) · 匹配对照窗口清单 · 条款审阅记录与执行/不执行决定 · 预试验 σ 估计与功效计算过程 · 入金与提现验证记录
RECORDED FIELDS (13)
  • order_id / venue_order_id / 字符串 / 我方标识与平台订单号,供平台核对
  • ts_place_utc_ns / ns / 下单时刻
  • side / qty / notional_eur / 枚举 / 基础币 / EUR / 方向、数量与名义额
  • avg_fill_px / fee / 报价币 / 报价币 / 成交均价与手续费
  • depth_top3_pre / 基础币 / 下单前可见前 3 档合计深度,用于核对规模比例
  • mid_pre_1s / 报价币 / 下单前 1 s 平均 mid
  • mid_post_200ms / 1s / 5s / 30s / 120s / 报价币 / 下单后各时点 mid
  • index_delta_bps_u / bps / 同期共识指数变动,用于扣除市场因子
  • impact_bps_u / bps / 净影响,各 u 一列
  • printed_on_tape / tape_delay_ms / bool / ms / 该笔成交是否出现在平台公开成交带及延迟
  • depth_replenish_s / s / 被吃档位恢复到下单前水平的时长
  • control_window_id / 字符串 / 匹配的无下单对照窗口
  • tos_permits / 枚举 / permitted / prohibited / ambiguous,ambiguous 与 prohibited 一律不执行
SPECIFICATION
AXP-PRICE-v1/P9

数据集封装、校验与第三方复现包

  1. 目录与文件清单固定:l1_ticks/(原始分卷)、grid_1s.parquet、grid_100ms.parquet、index.parquet、deviation.parquet、leadlag.csv、events.csv、fingerprint.csv、own_orders.csv、clock.csv、exclusions.csv、admission.csv、manifest.json。
  2. 缺失值约定:CSV 留空、parquet 为 null。禁止用 0、−1、N/A、空字符串以外的占位符。每张表必带 qc_flag,价格表必带 n_sources。
  3. 单位约定:价格用报价币原值并以 decimal 字符串保存(避免二进制浮点损失);偏离用 bps;时间用 UTC 纳秒整数;滞后用 ms;占比用 0-100 的百分数并在字段名标注 _pct。
  4. manifest.json 内容:spec_id=AXP-PRICE-v1、run_id、采集起止(UTC)、参考源集合与冻结权重、被测行情面、预注册 commit、采集器 commit 与镜像 digest、每个文件的 sha256 与行数、时区、许可、已知偏离规范之处的清单。
  5. 许可:数据 CC BY 4.0,代码 MIT。发布到 Zenodo 取得 DOI 并启用版本化;正文每一个数值都标注 DOI + 文件名 + 列名,做到数字与来源一一对应。
  6. 时间戳存证:对 manifest.json 的 sha256 做 OpenTimestamps 存证,随数据集发布 .ots 文件。它证明该数据集在某时刻已存在(用于平台在发表后改变行为时的时序对照),不证明数据正确——这一点必须在 README 中写明。
  7. 复现包:docker compose up 从原始 tick 一键重算全部表与图;make verify 校验全部 sha256 并重算三个关键数字(d 的窗口中位数、ℓ̂、IS 区间),与发布值比对,容差写在 README。
  8. 第三方独立验证路径:任何人可用自己的采集器按 P1-P3 重采一段新窗口,运行同一分析包,并用我们发布的参考源两两对照分布检验其结果是否落在同一区域。公开复现报告提交入口与我们的差异处理流程(收到差异 → 复算 → 若我方有误发 erratum 并升 patch 版本)。
  9. 版本策略:参数或估计器改变 → minor(v1.1);数值更正 → patch 并发 erratum;参考源集合变更 → major(v2)。数据集版本与规范版本在 manifest 中同时记录。
Quantity measured
— (本步不计算测量量,只定义封装与校验规则)
Fixed parameters
压缩 zstd level 10;parquet row group 128 MB;sha256 全文件校验;Zenodo 单记录默认容量约 50 GB,超出部分的原始 tick 分卷另行分发并在 manifest 中登记其 sha256;verify 容差:偏离中位数 ±0.1 bps、滞后 ±5 ms、IS 边界 ±1 个百分点。
Sample size
每次运行产出 1 个 manifest、13 类数据文件、1 个 .ots 存证、1 个复现包镜像;每个被测平台 1 组、参考源两两对照 1 组、合成校准面 1 组。
Control
独立复核人(未参与采集与首次分析)在干净环境中执行 make verify 并重算三个关键数字,结果写入发布记录。这是发布前的强制门禁。
Statistical treatment
— (封装步骤;但 verify 容差本身来自浮点与自助随机性的实测量级,容差取值理由须写入 README)
Reproducibility check
复核人在与分析者不同的机器、不同的操作系统上从零执行复现包,三个关键数字必须落在容差内;不通过则不得发布。此外发布后接受任何第三方提交的复现报告,差异处理流程公开。
Known pitfalls
用 0 填缺失值使后续统计静默出错;价格用 float 存储损失末位(直接毁掉 P7 的取整分析);正文数字与数据集列对不上;发布后修改文件却不升版本;把 OpenTimestamps 说成是数据正确性的证明。
Risk
原始 tick 体量可能超出免费托管额度,必须提前确定分发方案并在 manifest 中登记全部分卷的 sha256,避免出现「正文引用了但公众取不到」的数据。

SUPPORTS / 使这份基准成为可被独立重做的资产:任何人拿到 DOI 就能取到全部原始数据、参数、代码与校验和,重算我们发布的每一个数字,或重采新窗口做横向比较;也使数值更正有明确的版本与勘误路径。

DOES NOT SUPPORT / 校验和与时间戳存证只能证明「这份数据自我们发布起未被篡改、且在某时刻已存在」,不能证明数据采集正确、不能证明测量设计合理、更不能证明结论成立——数据完整性与测量效度是两件事。DOI 与开放许可也不构成任何形式的同行评审或背书。同样,本数据集不能被引用来支持任何关于平台合规状态、牌照资格或运营合法性的说法:那属于监管机构的职权,价格数据与之没有推理通道。

EVIDENCE RETAINED / manifest.json 与 .ots 存证 · Zenodo 记录与 DOI · 复现包镜像与 make verify 输出 · 复核人复现记录 · erratum 与版本历史
RECORDED FIELDS (13)
  • file_name / 字符串 / 数据文件名,与 manifest 一一对应
  • rows / / 行数,用于快速完整性检查
  • sha256 / hex / 文件校验和
  • spec_id / spec_version / 字符串 / AXP-PRICE-v1 与具体 patch 号
  • run_id / 字符串 / 本次采集运行标识
  • window_start_utc / window_end_utc / ISO8601 / 采集起止,UTC
  • reference_set / weights_frozen / JSON / 参考源集合与冻结权重
  • measured_surface / 枚举 / 被测行情面,与 P1 一致
  • license_data / license_code / 字符串 / CC BY 4.0 / MIT
  • doi / 字符串 / Zenodo DOI,含版本
  • ots_proof / 文件名 / manifest 哈希的 OpenTimestamps 存证
  • deviations_from_spec / JSON / 本次运行中偏离规范之处的清单,无则空数组
  • verify_result / 枚举 / pass / fail 与复核人标识、复核环境
SPECIFICATION
RPT

Reporting rules for this benchmark

How results from this protocol may and may not be described once a dataset exists. Author: Axial Proof Editorial Team. Independent reviewer: Axial Proof Review Team.

CONSTRAINTS

表述规范:(1) 每个数值必须同时带窗口标识、时段层、样本量与 95% 置信区间,以及它在参考源两两对照分布中的分位位置;没有对照分位的裸数值不得进正文。(2) 偏离必须永远拆成持久项 b 与动态项分别报告,并在同一段落明示:b 对常数乘性加价不变,因此它不含关于价格发现的信息;只用 b 大就说平台不跟随市场是错误推理。(3) 领先滞后必须同时报网格 CCF 与 Hayashi-Yoshida 两个估计,两者相差超过 200 ms 时并列呈现并说明,不得只选好看的一个。(4) Hasbrouck 信息份额只报上下界区间,禁止折成点值。(5) 合成校准面上的 (Δ, h) 定位必须写成条件句:「若该平台报价是对指数的延迟加平滑映射,则参数落在 Δ≈… / h≈… 的邻域」,并同时报告投影残差 calib_dist;残差大时必须说明观测点不在校准面覆盖范围内。(6) 未测项一律写「未测(原因)」,绝不写「通过」或留白;功效不足的项写「功效不足,不做结论」并给出 MDE 与实际样本量。(7) 所有数字标注 DOI + 文件名 + 列名。 禁忌:(1) 不得写「内盘」「自撮合」「假盘」作为结论——本基准的任何组合都无法确立撮合方式,只能给出各假设的相对可信度与在对照分布中的位置。(2) 不做法律定性:不写某平台违反 MiCA、不写未获牌照因此如何、不把公司注册记录或 FINTRAC MSB 注册号(及其注册范围、成立日期、Website 字段为空等事实)与价格数据混用作为解释或佐证——注册记录是行政事实,注册机构本身通常明示注册不等于发牌或背书,它与价格来源之间不存在推理通道。若正文需要提及此类记录,只能放在与本基准明确分隔的背景段落,并注明它对本基准的任何指标都不构成证据。(3) 不用截图代替数据;截图只能作插图,且必须能对应到数据集中的具体行。(4) 不把「价格贴近」写成有真实流动性的证据,也不把「价格偏离」写成没有真实市场的证据——两个方向都在 does_not_support 里被明确排除。(5) 不得把单一指纹指标(如高精确匹配率)单独拿出来做标题;指纹只在多项一致且都超出置换基线时才具有累积可信度,且仍不构成撮合方式的确立。(6) 不得报告小于仪器噪声下限(P2 的 A/B p95)的滞后差异。(7) 不使用绝对阈值分级(如「偏离超过 50 bps 即为不合格」)——本刊不发评级,只发测量与对照位置。(8) 发表前给被测平台不少于 10 个工作日答复期,答复原文随文发布;平台提出数值争议时,先复算再回应,若我方有误发 erratum 并升 patch 版本。(9) 版本号与数据集 DOI 必须与正文数值一一对应;规范迭代后旧文不改数字,只在页首标注其所依据的版本。