One Success Isn't Reliability: Thinkingbox 沙盒与基准 精读
微软联合匹兹堡大学、西北大学、UC Irvine 发布 THINKINGBOX 沙盒与 THINKINGBOX-BENCH 基准:507 个政策条件化的有状态业务工作流,覆盖零售、酒店、车险、新银行 IT 与咨询 IT/HR 五域,用隔离的 MCP 工具会话、模拟用户与终端后端状态检查评测 Agent。最强模型 GPT-5.4 pass@1 仅 65.36%,pass@20 高达 91.12% 但 20 次全过的 pass^20 仅 25.25%,暴露「偶尔成功」与「可靠完成」之间的巨大鸿沟;79,853 次失败试验中 80.88% 干净终止且含写操作,证明响应级/调用级信号无法代理端到端完成。本精读覆盖其 POMDP 形式化、评测协议、失败归因与可靠性根源分析。