What Does Multi-Harness RL Learn? — 评测 Harness 是 Agent RL 的主导变量 精读
本论文在同一 Qwen3-8B 热启动上回放相同任务-harness 记录(Aider/OpenHands/Qwen Code/SWE-agent),对比 GRPO 的 Within/Cross 两种分组规则,用 24,000 次密封 SWE-bench Verified 评估发现:评测 harness 使解决率从 2.14% 摆到 9.27%(4.3 倍),训练配方仅移动 1.16,分组规则不显著(+0.25pp,CI 含 0)。harness 工程对 Agent RL 的影响碾压算法选择。