Harness 的有效性边界:Malena × Finding the Right Fit 合读精读
同月两篇论文从正反两面划定 Agent Harness 工程的有效性边界。EPFL+Apple 的 Malena 用受控消融证明:骨干够强时,几乎全部收益来自编码 agent 运行时与骨干本身——给模型一个 shell 和文件系统(Chat→Oneshot)是测得的最大单一效应,搜索原语、多 agent 编排全部统计不显著(最大差距 Best-of-N vs UCB1 仅 2.71pp,CI 含 0),单会话极简 agent 在 MLE-bench 上以 62.5% medal 率碾压四个 SOTA Harness(最佳外部 47.1%)。NTU 的 Finding the Right Fit 用 66 配置矩阵证明另一半事实:换 Harness 模型排名完全反转(TB4 上 Claude−GPT 差距在 OpenHands +7.94、PI −30.16,摆幅 38.09pp),6204 条轨迹归因发现 Harness 的真实价值集中于「把失败转成模型可用的反馈」这一件事。合读结论:Harness 的价值不在「编排的丰富度」而在「反馈回路的完整性」,且随骨干增强而向运行时基底收缩。