- Quantity measured
- σ_rig = 1.4826·MAD(rtt);σ_eff = sqrt(σ_rig² + σ_proc² + u_ts²);MDD = 1.96·σ_eff·sqrt(2/n)(均值差;中位数差以移动块 bootstrap 的 95% CI 半宽为准,二者取大);网络位置贡献 = sqrt(max(0, σ_cross² − σ_split²));Δ_platform(p,e) = q50(rtt(p,e)) − q50(rtt(p,ref_e(p)));线性度偏差 = median(recovered − injected)。
- Fixed parameters
- 采样 60 s ×14 天;注入档位 5/20/50 ms(覆盖我们预期的平台差异量级,且跨一个数量级以检验线性);Kendall τ 门槛 0.6;bootstrap 10,000 次、BCa 区间、块长 = ACF 首次跌破 1/e 的滞后 ×2(块长必须由数据决定,不得凭感觉设定)。
- Sample size
- R1/R2 每节点每参照 ≥20,000 点(60 s ×14 天);split-half、cross-node、process-AB 各 ≥10,000 配对点;注入实验每档 ≥1,000 点(三档合计 ≥3,000);冷/热连接各 ≥2,000 点。样本量按 MDD 公式反推:欲把 MDD 压到 σ_eff 的 5% 以下,n 需 ≈3,000 以上,故上述量级同时满足功效要求。
- Control
- R1 是唯一真值已知的正对照(我们控制服务端);R2 是我们不控制的第三方端点对照,二者 σ 之差反映服务端不可控性的量级;注入实验提供已知答案的正对照,直接检验"仪器能不能测出真实存在的差异"。
- Statistical treatment
- 全部用稳健统计(中位数、MAD、分位数),不做正态假设。CI 一律用移动块 bootstrap 以保留自相关(延迟序列强自相关,朴素 bootstrap 会把 CI 算得窄到荒谬)。跨节点排序一致性用 Kendall τ 及其 bootstrap CI。异常值不删除,用稳健估计量处理并单独发布异常清单及其 outcome_class。
- Reproducibility check
- 公开 echo 源码与镜像 digest,并对外提供公共校准 echo 端点,使第三方能对同一参照算出自己的 σ_rig 与我们横向对比——这是跨实验室可比性的桥梁。注入实验的全部原始数据公开,第三方可重算我们的线性度;若他们证明我们在 5 ms 档测不回来,我们所有小于 5 ms 的差异结论都应被推翻,这正是我们希望被检验的方式。
- Known pitfalls
- 用被测平台自身的端点当"稳定参照"是循环论证;用 min(rtt) 当噪声地板会低估噪声;忽略自相关会让 CI 荒谬地窄;σ_rig 不分时段会掩盖晚高峰的真实分辨力;CPU steal 高的时段必须单列;ref_e(p) 的选择本身是可争议的建模决定,不公开就等于把主观选择藏进了结论。
- Risk
- 公共校准端点会引来滥用流量,须限流并声明 best-effort、不承诺可用性,其成本(约 €5-10/月)计入基础设施预算。校准全程只用公开端点,不使用账户端点,避免账户状态污染仪器基线。