MCP 注册表随机抽样审计精读:48.8% 握手率背后的工具生态幸存者偏差

独立研究者 Haseeb Mohammed Afsar 对 MCP 注册表做首个未修复概率样本审计:24,135 服务器普查中概率抽 400 个 npm/stdio 服务器在线探测,仅 48.8% 完成 initialize 握手(手工精选框架 66.7%),37.5% 根本无法启动;能跑的 195 个硬一致性 100%,但安全注记缺失率 58.8% vs 精选 41.5%——整个领域的采样偏差第一次被量化。

September 12, 2026 · 1 min

The Double Measurement Confound in Agent Benchmarks 精读

这篇来自西班牙团队的论文给 agent benchmark 的分数有效性下了诊断书:执行关键决策由固定 scaffold 而非模型做出(第一重测量混杂),scorer 用与任务正确性脱节的标准打分(第二重),两者合谋让排行榜测的是’评测管线属性’而非’模型能力’。论文提出测量论框架+审计修复协议三步——把执行决策移交给模型(de-scaffolding)、种子化金标评分替代形状匹配、用最差情形/尾部风险报告超越均值的可靠性。在 ComtradeBench 上:无 LLM 的规则基线得 96.8 分 vs Kimi/Claude 的 97.5,联合干预把平坦排行榜变成’平均性能×种子鲁棒性’的可靠性谱。

September 11, 2026 · 1 min