On the Fragility of Self-Improving Agents: Variance, Task Order, and Underspecification 精读
Salesforce AI Research对记忆式自改进agent做系统性重评测,揭露被忽视的可靠性问题:多次运行量化显示叠加自改进循环后71%的情形方差增大、同实验最好最差运行差可达10个百分点;默认任务顺序构成隐式课程——按默认顺序+1.5%改进,随机打乱后反而-4.5%。人工检查记忆提出欠规约(underspecification)假说:agent在缺乏清晰规约时生成’看似合理但不可用’的记忆(如纯浏览器环境推荐API用法),rubric与环境反馈注入可部分收窄退化。