ContinualSkillBench: Can LLM Agents Truly Evolve Their Capabilities? 精读
北大×BIGAI 提出 ContinualSkillBench,首次系统回答「Agent 技能库能否自主进化」:五个领域各 100 个按难度与技能依赖排序的关联子任务,三回合协议让 Codex CLI 与 Claude Code 在执行-反馈-反思中自建技能。15 组模型-领域设置中 14 组顺序执行提升归一化奖励(整体相对 +16.9%),但关键对照实验揭示:纯 ICL(不维护显式技能)平均 0.605 vs 显式技能 0.602,几乎无差异——顺序收益大部分来自保留上下文与反馈适应而非可复用技能抽象;且弱模型(GPT-4o)堆积 384 个碎片化技能,远多于强模型(GPT-5.3-Codex)的 205 个。