Role-Agent: 通过双角色自举实现 LLM 智能体-环境协同进化 精读

深度精读中科大 × 阿里AMAP团队 Role-Agent 论文——首个利用单一 LLM 同时扮演智能体与环境双角色,实现自举式协同进化的工作。从 Agent 强化学习背景补全、智能体-环境协同优化的研究脉络定位、双角色自举的问题抽象、WIA(世界内化于智能体)+ AIW(智能体内化于世界)双模块方法详解、必要知识反推到六条通用性灵感,全面拆解这项在 ALFWorld、WebShop、搜索增强QA 三大场景平均提升超 4% 的开创性研究。

June 12, 2026 · 5 min

SearchSwarm: Towards Delegation Intelligence in Agentic LLMs for Long-Horizon Deep Research 精读

深度精读 SearchSwarm——首个系统探索如何让 Agent 学会「委派」的工作。论文设计了精巧的 Harness 引导主 Agent 将子任务分派给子 Agent,用合成的轨迹数据通过 SFT 将「委派智能」内化到模型权重中。30B 参数的小模型在 BrowseComp、GAIA 等四个基准上达到同规模最佳,甚至超越 10 倍参数的模型。更令人惊喜的是,委派训练的智能还能泛化到单 Agent 设置和开放式研究任务。

June 12, 2026 · 3 min

Self-Harness: Harnesses That Improve Themselves 精读

深度精读上海人工智能实验室 Self-Harness 论文——首个让 LLM Agent 自主改进自身操作套件(Harness)的范式。从 Harness 概念补全、三大范式对比定位、三阶段闭环机制详解、模型特异性验证到通用性灵感提取,全面拆解这项在 Terminal-Bench-2.0 上取得高达 21.4% 绝对提升的开创性研究。

June 12, 2026 · 5 min

Agentic Coding驱动工业制造通往自主通用智能

基于机器之心直播分享整理,深圳大学苏向宇博士介绍了被 ICRA 2026 接收并获选自动化领域最佳论文的工作 AIML(Industrial Multi-Robot Task Planning and Program Generation using Large Language Models)。该工作提出了一个利用大语言模型自动完成工业产线多机器人任务规划与执行程序生成的框架,核心思想是让 LLM 负责语义理解,用结构化工具保证约束满足和可执行性,实现了跨产线、跨任务的零样本泛化能力。

June 11, 2026 · 1 min

Skill-RM: 通过 Agent Skill 统一异构奖励评估标准 精读

深度精读中山大学、香港中文大学、北京大学、ETH苏黎世与阿里巴巴通义千问团队联合发表的 Skill-RM 论文——将奖励建模重新定义为可复用的’奖励评估技能’(Reward-Evaluation Skill),通过结构化的 Agent 技能编排异构评估资源(评分准则、验证器、检查清单、聚合规则),在 RewardBench2、RM-Bench、JudgeBench 三大基准上全面超越传统 LLM-as-a-Judge 和专用奖励模型,为 LLM 后训练提供统一、可解释、可扩展的奖励信号框架。

June 10, 2026 · 4 min

Agentic ASR: 面向类人交互式语音识别的智能体修正与语义评估 精读

深度精读上海交通大学 X-LANCE 实验室与阿里巴巴通义实验室联合发表的 Agentic ASR 论文——将语音识别从’单次转录’重新定义为’多轮语义精炼’,通过闭环 Agent 框架实现类人交互式纠错,并提出 S²ER 语义评估指标与交互式仿真系统 ISS,在多语言、命名实体密集和语码转换场景中将语义错误率降低最高达95%。

June 9, 2026 · 5 min

HarnessForge: Joint Harness and Policy Evolution for Adaptive Agent Systems 精读

深度精读北京航空航天大学与清华大学合著的 HarnessForge 论文——一个元自适应框架,将 LLM Agent 系统形式化为 harness-policy 对,通过故障引导的 harness 裁剪和 harness 条件化的策略对齐实现协同演化。在 5 个跨领域基准上超越所有 harness-only 和 policy-only 基线,最高增益达 12.0%,揭示了一个关键洞察:harness 和 policy 之间的可执行兼容性是 Agent 系统适应的核心。

June 9, 2026 · 6 min

Meta-Cognitive Memory Policy Optimization for Long-Horizon LLM Agents 精读

深度精读中国科学技术大学与腾讯合著的 MMPO 论文——一种元认知记忆策略优化方法,通过引入 Belief Entropy(信念熵)作为自监督代理信号,为 LLM Agent 的记忆摘要提供密集的中间监督。在 RULER-HotpotQA 基准上,即使扩展到 175 万 token 上下文,仍能保持 97.1% 的性能。核心洞察:记忆优化的目标不应仅仅是最终任务是否成功,更应关注中间记忆是否让模型保持对任务状态的清晰认知。

June 9, 2026 · 4 min

Rethinking Continual Experience Internalization for Self-Evolving LLM Agents 精读

深度精读中国人民大学高瓴人工智能学院与美团联合发表的 Rethinking Continual Experience Internalization 论文——系统性地揭示了 LLM 智能体在多轮经验内化中出现的’能力崩塌’现象,从经验粒度、注入模式和内化机制三个维度诊断根因,提出’原则级经验 + 逐步注入 + Off-policy 蒸馏’的稳定自进化配方,使模型在连续迭代中实现可持续的性能提升而非渐进退化。

June 9, 2026 · 4 min

From Context to Skills: Can Language Models Learn from Context Skillfully? 精读

深度精读清华大学、DeepLang AI、UIUC 等机构联合发表的 Ctx2Skill 论文——一个无需人工标注和外部反馈的自进化技能发现框架。通过多智能体自博弈循环让 Challenger 和 Reasoner 共同进化技能集,配合 Cross-Time Replay 机制防止对抗性坍塌,在 CL-bench 四个上下文学习任务上跨模型一致提升解决率。

June 6, 2026 · 4 min