Role-Agent: 通过双角色自举实现 LLM 智能体-环境协同进化 精读

深度精读中科大 × 阿里AMAP团队 Role-Agent 论文——首个利用单一 LLM 同时扮演智能体与环境双角色,实现自举式协同进化的工作。从 Agent 强化学习背景补全、智能体-环境协同优化的研究脉络定位、双角色自举的问题抽象、WIA(世界内化于智能体)+ AIW(智能体内化于世界)双模块方法详解、必要知识反推到六条通用性灵感,全面拆解这项在 ALFWorld、WebShop、搜索增强QA 三大场景平均提升超 4% 的开创性研究。

June 12, 2026 · 5 min

SearchSwarm: Towards Delegation Intelligence in Agentic LLMs for Long-Horizon Deep Research 精读

深度精读 SearchSwarm——首个系统探索如何让 Agent 学会「委派」的工作。论文设计了精巧的 Harness 引导主 Agent 将子任务分派给子 Agent,用合成的轨迹数据通过 SFT 将「委派智能」内化到模型权重中。30B 参数的小模型在 BrowseComp、GAIA 等四个基准上达到同规模最佳,甚至超越 10 倍参数的模型。更令人惊喜的是,委派训练的智能还能泛化到单 Agent 设置和开放式研究任务。

June 12, 2026 · 3 min

Self-Harness: Harnesses That Improve Themselves 精读

深度精读上海人工智能实验室 Self-Harness 论文——首个让 LLM Agent 自主改进自身操作套件(Harness)的范式。从 Harness 概念补全、三大范式对比定位、三阶段闭环机制详解、模型特异性验证到通用性灵感提取,全面拆解这项在 Terminal-Bench-2.0 上取得高达 21.4% 绝对提升的开创性研究。

June 12, 2026 · 5 min

Skill-RM: 通过 Agent Skill 统一异构奖励评估标准 精读

深度精读中山大学、香港中文大学、北京大学、ETH苏黎世与阿里巴巴通义千问团队联合发表的 Skill-RM 论文——将奖励建模重新定义为可复用的’奖励评估技能’(Reward-Evaluation Skill),通过结构化的 Agent 技能编排异构评估资源(评分准则、验证器、检查清单、聚合规则),在 RewardBench2、RM-Bench、JudgeBench 三大基准上全面超越传统 LLM-as-a-Judge 和专用奖励模型,为 LLM 后训练提供统一、可解释、可扩展的奖励信号框架。

June 10, 2026 · 4 min

HarnessForge: Joint Harness and Policy Evolution for Adaptive Agent Systems 精读

深度精读北京航空航天大学与清华大学合著的 HarnessForge 论文——一个元自适应框架,将 LLM Agent 系统形式化为 harness-policy 对,通过故障引导的 harness 裁剪和 harness 条件化的策略对齐实现协同演化。在 5 个跨领域基准上超越所有 harness-only 和 policy-only 基线,最高增益达 12.0%,揭示了一个关键洞察:harness 和 policy 之间的可执行兼容性是 Agent 系统适应的核心。

June 9, 2026 · 6 min

Rethinking Continual Experience Internalization for Self-Evolving LLM Agents 精读

深度精读中国人民大学高瓴人工智能学院与美团联合发表的 Rethinking Continual Experience Internalization 论文——系统性地揭示了 LLM 智能体在多轮经验内化中出现的’能力崩塌’现象,从经验粒度、注入模式和内化机制三个维度诊断根因,提出’原则级经验 + 逐步注入 + Off-policy 蒸馏’的稳定自进化配方,使模型在连续迭代中实现可持续的性能提升而非渐进退化。

June 9, 2026 · 4 min

From Context to Skills: Can Language Models Learn from Context Skillfully? 精读

深度精读清华大学、DeepLang AI、UIUC 等机构联合发表的 Ctx2Skill 论文——一个无需人工标注和外部反馈的自进化技能发现框架。通过多智能体自博弈循环让 Challenger 和 Reasoner 共同进化技能集,配合 Cross-Time Replay 机制防止对抗性坍塌,在 CL-bench 四个上下文学习任务上跨模型一致提升解决率。

June 6, 2026 · 4 min

Skill0.5: Joint Skill Internalization and Utilization for OOD Generalization in Agentic RL 精读

深度精读 Skill0.5 论文——华东师大 × 美团联合提出的首个区分通用技能内化与任务特定技能利用的 Agent RL 框架。从 Skill/Harness 概念补全、四代技能增强方法演进定位、双范式困境的问题抽象、难度感知路由+特权蒸馏+反捷径利用三大机制详解、必要知识反推到七条通用性灵感,全面拆解这项在 OOD 泛化上大幅超越全部基线的创新研究。

June 1, 2026 · 5 min

Natural-Language Agent Harnesses 精读

深度精读清华+哈工大 NLAH 论文——首个系统性探索 Agent Harness 策略能否外化为可执行自然语言对象的工作。NLAH+IHR 四层架构用不到代码 5% 的篇幅表达完整策略,三大基准成绩可比,策略层从几万行代码中提炼为几千字文档。模块消融揭示反直觉结论:收紧验收纪律比扩大搜索范围更有效。

May 26, 2026 · 5 min

SkillOpt: Executive Strategy for Self-Evolving Agent Skills 精读

深度精读微软 SkillOpt 论文——首个将深度学习完整优化纪律系统迁移到文本空间 Agent 技能优化的工作。从 Skill/Harness 概念补全、六项前序工作定位、问题形式化抽象、五大核心机制详解、必要知识反推到七条通用性灵感,全面拆解这项在52个评估单元上全部取得最优的开创性研究。

May 26, 2026 · 5 min