COBRA-Skills: Contextual Bandit-Guided Evolution for Agent Skill Optimization 精读
港中文深圳团队把 agent 技能优化重构为’动态候选空间上的预算受限序贯优化’:contextual bandit 优先级评分决定评估哪个候选(exploit 历史得分 + explore 不确定性),证据驱动的进化只做有界精炼不做全局重写。结果:6 个 benchmark × 3 模型平均提升 13.1/26.9/22.5pp,相对 SkillOpt 总成本砍 55-58%,每 benchmark 只用 50 个优化样本,且对 harness 更换鲁棒。