Recursive Harness Self-Improvement 精读

Sakana AI 与 UC Berkeley 提出 RHI(递归式框架自改进):把多智能体框架当作提示词级对象,仅用当前与上一版本的自我比较来迭代优化,少数几轮就能让低推理强度的 Agent 超越同族最高推理强度设置,同时把推理成本降低最高 60%。本文从 Harness 是什么、模型-框架协同进化讲起,拆解 RHI 的轨迹局部目标、算法流程、信息论隐式目标,并提炼可推广的通用性灵感。

July 23, 2026 · 6 min

AI时代什么值得学?知识、代码都贬值了,经验和技能才是硬通货

WAIC 2026期间,科大讯飞AI大学堂发布AI热点和AI Vault两大新功能。围绕"AI时代什么值得学",极客时间业务负责人王一鹏、科大讯飞开放平台总经理李佳琪、野生AI Hacker许恒在围炉夜话中展开了深度讨论:AI的角色正从"知识百科"转向"私人教练"和"军师谋士",个人知识库被AI记忆系统取代,系统化学习回归经典课程,人才供需的gap在持续拉大——这个时代真正奖励的是热爱、执行力和深度判断力。

July 22, 2026 · 1 min

2026-06 arXiv 智能体记忆系统(Agent Memory)领域综述:113 篇全文精读

智能体记忆子领域纵深综述。从 11930 篇 6 月 arXiv 预印本中筛定 113 篇核心集,全部下载 PDF 抽全文逐篇精读,提炼 7 大共识性问题(检索不等于使用、固化的保留与遗忘决策、上下文成本爆炸、一致性/矛盾解决、评测混淆变量、记忆即新攻击面、遗忘治理)与多项原创问题定义,关键新框架已联网交叉验证。

July 17, 2026 · 5 min

智能体技能演化(Skill Evolution 与 Self-Evolving Agents)综述:53 篇核心论文精读

技能演化与自演化智能体综述。从 116 篇候选中筛定 53 篇 CORE 论文下载全文精读,提炼技能库选择退化、技能创建与部署脱节、自演化缺乏可靠接受准则、上下文无界膨胀等共性问题,以及 16 个范式级新转变(PACE、Bayesian-Agent、Red Queen Godel、Trellis、MMG2Skill 等 5 个已联网验证)。

July 17, 2026 · 4 min

Why Supervised Fine-Tuning Fails to Learn: A Systematic Study of Incomplete Learning in Large Language Models 精读

这篇 ACL 2026 Main 论文首次系统性地揭示了「不完全学习现象」(ILP):即使训练损失收敛,LLM 仍有约15%的训练样本无法被正确复现。论文将这一现象归因为五个可诊断的来源,并提出了一个「先诊断、再对症下药」的框架,证明了SFT失败的异质性——不同原因需要不同解法。

July 13, 2026 · 4 min

Harness Engineering for Self-Improvement 精读

Lilian Weng(Thinking Machines Lab 联合创始人、前 OpenAI 研究副总裁)在这篇万字综述中系统梳理了「Harness 工程」——围绕基础模型的运行时系统——作为通往递归自我改进(RSI)现实路径的核心命题。文章从 RSI 的思想起源讲起,把 Harness 定义为决定模型如何思考、规划、调用工具、管理上下文、评估结果的系统层,并梳理了三大设计模式(工作流自动化、文件系统持久记忆、子代理并行)、四大优化方向(上下文工程、工作流设计、自我改进、进化搜索)以及与模型权重的联合优化,最后坦诚列出七大瓶颈。本精读将这篇综述放在 RSI→Harness 的研究脉络中定位,提炼其方法论骨架与可迁移的普适灵感。

July 7, 2026 · 8 min

SKILL-DISCO: Distilling and Compiling Agent Traces into Reusable Procedural Skills 精读

深度精读微软研究院与北京外国语大学合著的 SKILL-DISCO 论文——将 Agent 成功执行轨迹蒸馏为可重用的参数化控制流子图(PFSM),再编译为可调用、可执行、可验证的过程技能。在 ALFWorld 和 WebArena 上,仅用 5 个技能(对比 ASI 的 110 个)就将成功率推高至 99.3%,且技能可跨模型迁移——GPT-4o 归纳的技能让 Qwen3.5-9B 在 ALFWorld 上达到 98.5%。

June 29, 2026 · 4 min

Do Language Models Need Sleep? Offline Recurrence for Improved Online Inference 精读

深度精读马里兰大学与卡内基梅隆大学合著的「语言模型需要睡眠吗?」论文——受人类睡眠记忆巩固机制启发,提出离线循环(Offline Recurrence)机制:模型在’睡眠’阶段对累积上下文执行 N 轮离线反复遍历,将信息蒸馏为持久化快速权重(Fast Weights),然后清空 KV 缓存。在不增加在线推理延迟的前提下,成功解决常规 Transformer 和 SSM-Attention 混合模型均失败的多跳推理和数学推理任务。增加睡眠轮数 N 可以持续提升性能,且推理越深的样本获益越大(相关系数 r=0.92)。

June 15, 2026 · 5 min

Evolving Agents in the Dark: Retrospective Harness Optimization via Self-Preference 精读

深度精读香港城市大学 × 微软亚洲研究院 RHO 论文——首个仅利用无标签历史轨迹实现 Agent Harness 全链路自监督优化的工作。从 Harness 工程概念补全、六项前序工作定位、自偏好估计的问题抽象、三阶段核心方法详解、必要知识反推到七条通用性灵感,全面拆解这项在 SWE-Bench Pro 上将通过率从 59% 提升至 78% 的开创性研究。

June 12, 2026 · 3 min

Role-Agent: 通过双角色自举实现 LLM 智能体-环境协同进化 精读

深度精读中科大 × 阿里AMAP团队 Role-Agent 论文——首个利用单一 LLM 同时扮演智能体与环境双角色,实现自举式协同进化的工作。从 Agent 强化学习背景补全、智能体-环境协同优化的研究脉络定位、双角色自举的问题抽象、WIA(世界内化于智能体)+ AIW(智能体内化于世界)双模块方法详解、必要知识反推到六条通用性灵感,全面拆解这项在 ALFWorld、WebShop、搜索增强QA 三大场景平均提升超 4% 的开创性研究。

June 12, 2026 · 5 min