LongHorizon-Harness: Advancing Long-Horizon Agents for Real-World Tasks 精读
长程任务(long-horizon)是 Agent 走向真实世界的最后一块硬骨头。LongHorizon-Harness 把’执行-状态管理-完成评估’从一个不断增长的上下文里拆开,重构为 Manage-Execute-Audit(MEA)循环:Manager 只管状态不碰环境、Executor 每轮用新鲜上下文执行、Auditor 只读独立验证。这套架构让 Qwen 3.7-Plus 在 WeaveBench 上从 51.8% 跃升到 80.7%(近乎翻倍官方 SOTA),OSWorld 2.0 上把 Claude Opus 4.7 从 20.0% 提到 34.3%。本文从’状态-执行-审计’分离的第一性原理出发,解释为什么这套架构在难任务上收益更大、在更强模型上 token 反而更省。