Self-Harness: Harnesses That Improve Themselves 精读

深度精读上海人工智能实验室 Self-Harness 论文——首个让 LLM Agent 自主改进自身操作套件(Harness)的范式。从 Harness 概念补全、三大范式对比定位、三阶段闭环机制详解、模型特异性验证到通用性灵感提取,全面拆解这项在 Terminal-Bench-2.0 上取得高达 21.4% 绝对提升的开创性研究。

June 12, 2026 · 5 min

HarnessForge: Joint Harness and Policy Evolution for Adaptive Agent Systems 精读

深度精读北京航空航天大学与清华大学合著的 HarnessForge 论文——一个元自适应框架,将 LLM Agent 系统形式化为 harness-policy 对,通过故障引导的 harness 裁剪和 harness 条件化的策略对齐实现协同演化。在 5 个跨领域基准上超越所有 harness-only 和 policy-only 基线,最高增益达 12.0%,揭示了一个关键洞察:harness 和 policy 之间的可执行兼容性是 Agent 系统适应的核心。

June 9, 2026 · 6 min

Rethinking Continual Experience Internalization for Self-Evolving LLM Agents 精读

深度精读中国人民大学高瓴人工智能学院与美团联合发表的 Rethinking Continual Experience Internalization 论文——系统性地揭示了 LLM 智能体在多轮经验内化中出现的’能力崩塌’现象,从经验粒度、注入模式和内化机制三个维度诊断根因,提出’原则级经验 + 逐步注入 + Off-policy 蒸馏’的稳定自进化配方,使模型在连续迭代中实现可持续的性能提升而非渐进退化。

June 9, 2026 · 4 min

From Context to Skills: Can Language Models Learn from Context Skillfully? 精读

深度精读清华大学、DeepLang AI、UIUC 等机构联合发表的 Ctx2Skill 论文——一个无需人工标注和外部反馈的自进化技能发现框架。通过多智能体自博弈循环让 Challenger 和 Reasoner 共同进化技能集,配合 Cross-Time Replay 机制防止对抗性坍塌,在 CL-bench 四个上下文学习任务上跨模型一致提升解决率。

June 6, 2026 · 4 min

SkillAdaptor: Self-Adapting Skills for LLM Agents from Trajectories 精读

深度精读浙江大学 ZJUNLP 团队 SkillAdaptor 论文——一个免训练的步骤级技能自适应框架。从 Skill/Harness 概念补全、步骤级归因 vs 轨迹级反思的核心区别、三阶段适应流水线(归因-修改-资格验证)、必要知识反推到通用性灵感提取,全面拆解这项在 WebShop/PinchBench/Claw-Eval 三个基准上均优于基线的创新工作。

June 3, 2026 · 4 min

Yunjue Agent: 零起点原位自进化智能体系统精读

深度精读 Yunjue Agent 技术报告——首个完全可复现的零起点原位自进化 Agent 系统。从自进化 Agent 三大支柱(工具/上下文/工作流)背景补全、四类自进化方法定位、工具进化为关键路径的问题抽象、多 Agent 协作+并行批进化+进化泛化损失指标详解、必要知识反推到通用性灵感,全面拆解这项在5个基准上零起点超越专有系统的开创性工作。

June 2, 2026 · 4 min

δ-mem: Efficient Online Memory for Large Language Models 精读

深度精读南洋理工大学 DeCLaRe Lab 的 δ-mem 论文——在冻结的大语言模型上添加仅 8×8 的在线联想记忆状态矩阵,通过 delta-rule 学习实现高效动态记忆。从 LLM 记忆困境背景补全、三大记忆路线定位、核心问题抽象、四步计算流程与三种写入策略详解、必要知识反推到六条通用性灵感,全面拆解这项在 MemoryAgentBench 上取得 1.31× 提升的轻量级记忆工作。

June 2, 2026 · 3 min