Do Language Models Need Sleep? Offline Recurrence for Improved Online Inference 精读

深度精读马里兰大学与卡内基梅隆大学合著的「语言模型需要睡眠吗?」论文——受人类睡眠记忆巩固机制启发,提出离线循环(Offline Recurrence)机制:模型在’睡眠’阶段对累积上下文执行 N 轮离线反复遍历,将信息蒸馏为持久化快速权重(Fast Weights),然后清空 KV 缓存。在不增加在线推理延迟的前提下,成功解决常规 Transformer 和 SSM-Attention 混合模型均失败的多跳推理和数学推理任务。增加睡眠轮数 N 可以持续提升性能,且推理越深的样本获益越大(相关系数 r=0.92)。

June 15, 2026 · 5 min

Evolving Agents in the Dark: Retrospective Harness Optimization via Self-Preference 精读

深度精读香港城市大学 × 微软亚洲研究院 RHO 论文——首个仅利用无标签历史轨迹实现 Agent Harness 全链路自监督优化的工作。从 Harness 工程概念补全、六项前序工作定位、自偏好估计的问题抽象、三阶段核心方法详解、必要知识反推到七条通用性灵感,全面拆解这项在 SWE-Bench Pro 上将通过率从 59% 提升至 78% 的开创性研究。

June 12, 2026 · 3 min

Role-Agent: 通过双角色自举实现 LLM 智能体-环境协同进化 精读

深度精读中科大 × 阿里AMAP团队 Role-Agent 论文——首个利用单一 LLM 同时扮演智能体与环境双角色,实现自举式协同进化的工作。从 Agent 强化学习背景补全、智能体-环境协同优化的研究脉络定位、双角色自举的问题抽象、WIA(世界内化于智能体)+ AIW(智能体内化于世界)双模块方法详解、必要知识反推到六条通用性灵感,全面拆解这项在 ALFWorld、WebShop、搜索增强QA 三大场景平均提升超 4% 的开创性研究。

June 12, 2026 · 5 min

SearchSwarm: Towards Delegation Intelligence in Agentic LLMs for Long-Horizon Deep Research 精读

深度精读 SearchSwarm——首个系统探索如何让 Agent 学会「委派」的工作。论文设计了精巧的 Harness 引导主 Agent 将子任务分派给子 Agent,用合成的轨迹数据通过 SFT 将「委派智能」内化到模型权重中。30B 参数的小模型在 BrowseComp、GAIA 等四个基准上达到同规模最佳,甚至超越 10 倍参数的模型。更令人惊喜的是,委派训练的智能还能泛化到单 Agent 设置和开放式研究任务。

June 12, 2026 · 3 min

Self-Harness: Harnesses That Improve Themselves 精读

深度精读上海人工智能实验室 Self-Harness 论文——首个让 LLM Agent 自主改进自身操作套件(Harness)的范式。从 Harness 概念补全、三大范式对比定位、三阶段闭环机制详解、模型特异性验证到通用性灵感提取,全面拆解这项在 Terminal-Bench-2.0 上取得高达 21.4% 绝对提升的开创性研究。

June 12, 2026 · 5 min

QUBRIC: 协同设计查询与评分标准,突破可验证奖励的强化学习瓶颈 精读

深度精读 Amazon 与佐治亚理工学院联合发表的 QUBRIC 论文——一个协同设计查询(Query)和评分标准(Rubric)的框架,通过关键点锚定的查询重写、对比式评分标准生成和可学习性过滤,突破传统 Rubric-based RL 中’评分标准质量受限于查询结构’的根本瓶颈。在 ArenaHard 上取得 +5.5 的增益,并零样本迁移到法律、道德、叙事推理三个未见基准上,平均提升 +6.3 分。本文揭示了查询与评分标准的结构耦合关系,为将 RL 扩展到不可验证领域提供了实用路径。

June 10, 2026 · 4 min

Reconciling Contradictory Views on the Effectiveness of SFT in LLMs: An Interaction Perspective 精读

深度精读上海交通大学张拳石团队 arXiv 2026 论文,从交互视角揭示 SFT 在 LLM 中的真实作用机制——主要是在极短窗口内去除噪声交互,而非学习新的可靠表征。这一发现为早停策略提供了可解释的理论依据,有望节省 30%-50% 以上的训练算力。

June 10, 2026 · 3 min

Skill-RM: 通过 Agent Skill 统一异构奖励评估标准 精读

深度精读中山大学、香港中文大学、北京大学、ETH苏黎世与阿里巴巴通义千问团队联合发表的 Skill-RM 论文——将奖励建模重新定义为可复用的’奖励评估技能’(Reward-Evaluation Skill),通过结构化的 Agent 技能编排异构评估资源(评分准则、验证器、检查清单、聚合规则),在 RewardBench2、RM-Bench、JudgeBench 三大基准上全面超越传统 LLM-as-a-Judge 和专用奖励模型,为 LLM 后训练提供统一、可解释、可扩展的奖励信号框架。

June 10, 2026 · 4 min

Agentic ASR: 面向类人交互式语音识别的智能体修正与语义评估 精读

深度精读上海交通大学 X-LANCE 实验室与阿里巴巴通义实验室联合发表的 Agentic ASR 论文——将语音识别从’单次转录’重新定义为’多轮语义精炼’,通过闭环 Agent 框架实现类人交互式纠错,并提出 S²ER 语义评估指标与交互式仿真系统 ISS,在多语言、命名实体密集和语码转换场景中将语义错误率降低最高达95%。

June 9, 2026 · 5 min

HarnessForge: Joint Harness and Policy Evolution for Adaptive Agent Systems 精读

深度精读北京航空航天大学与清华大学合著的 HarnessForge 论文——一个元自适应框架,将 LLM Agent 系统形式化为 harness-policy 对,通过故障引导的 harness 裁剪和 harness 条件化的策略对齐实现协同演化。在 5 个跨领域基准上超越所有 harness-only 和 policy-only 基线,最高增益达 12.0%,揭示了一个关键洞察:harness 和 policy 之间的可执行兼容性是 Agent 系统适应的核心。

June 9, 2026 · 6 min