RobustSGPO: Search-Space Control for Agent Harness Evolution 精读

语义梯度提示优化(SGPO)让 harness 能用执行反馈自动进化,但其局部更新规则把’这轮该改哪里、怎么改’留给运气——搜索空间悬空导致补丁无效率高、进化易破坏已有能力。武大×快手的 RobustSGPO 给出三步控制:显式指定本轮编辑(choose what to change)、构造并检查补丁(construct & check)、从现任或保留快照继续(防劣化回滚),配合周期性 1→2→3 权限调度。在快手 AgentX 头脑风暴工作流上(120 任务/95 运行/7350 候选),held-out 完成率 60.0%→80.0%、测试质量 3.77→4.14,结构化搜索补丁有效率 77.8% vs 48.9%。

September 11, 2026 · 1 min