AgentGrad: Intervention-guided Prompt Optimization for Multi-Agent Systems 精读

AgentGrad 对多智能体系统提示优化做出两个机制修正:梯度提取阶段用序贯干预(每次只改一个 agent 的行为)因果定位’改谁才能解决失败’,并把修改后输出作为 agent 级监督提取细粒度梯度;聚合阶段用语义聚类把相似梯度归簇、抽象出共享纠错模式的泛化梯度。五个 MAS 基准上 GPT-5-mini 平均 +11.76 分、Qwen3-8B +9.67 分,墙钟时间较最快基线缩短 2.5×,HotpotQA 上 1000 次 rollout 达到 GEPA 6000+ 次的水平。本文精读其因果消融式归因与梯度降噪机制为何同时带来效果与效率。

September 11, 2026 · 1 min

RobustSGPO: Search-Space Control for Agent Harness Evolution 精读

语义梯度提示优化(SGPO)让 harness 能用执行反馈自动进化,但其局部更新规则把’这轮该改哪里、怎么改’留给运气——搜索空间悬空导致补丁无效率高、进化易破坏已有能力。武大×快手的 RobustSGPO 给出三步控制:显式指定本轮编辑(choose what to change)、构造并检查补丁(construct & check)、从现任或保留快照继续(防劣化回滚),配合周期性 1→2→3 权限调度。在快手 AgentX 头脑风暴工作流上(120 任务/95 运行/7350 候选),held-out 完成率 60.0%→80.0%、测试质量 3.77→4.14,结构化搜索补丁有效率 77.8% vs 48.9%。

September 11, 2026 · 1 min

BONSAI: Evolvability-Guided Tree Search over Skills 精读

深度精读论文《BONSAI》——首个以『可进化性(evolvability)』而非当前适应度引导技能搜索的框架。面对『单一验证分数无法区分宽广平台与狭窄尖峰』这一根本盲区,BONSAI 将技能生长为蒙特卡洛搜索树,让节点下的平均分数免费估计变异邻域的可进化性,无需任何额外模型调用。在冻结 30B Agent 上、三个基准平均,BONSAI 比无技能 Agent 提升 23.13 点,比 GEPA 提升 3.87 点,比 SkillOpt 提升 3.97 点;消融实验证明可进化性信号本身在相同树上贡献 +2.14~+7.02 点。

August 11, 2026 · 8 min