AgentGrad: Intervention-guided Prompt Optimization for Multi-Agent Systems 精读
AgentGrad 对多智能体系统提示优化做出两个机制修正:梯度提取阶段用序贯干预(每次只改一个 agent 的行为)因果定位’改谁才能解决失败’,并把修改后输出作为 agent 级监督提取细粒度梯度;聚合阶段用语义聚类把相似梯度归簇、抽象出共享纠错模式的泛化梯度。五个 MAS 基准上 GPT-5-mini 平均 +11.76 分、Qwen3-8B +9.67 分,墙钟时间较最快基线缩短 2.5×,HotpotQA 上 1000 次 rollout 达到 GEPA 6000+ 次的水平。本文精读其因果消融式归因与梯度降噪机制为何同时带来效果与效率。