New LoRA Skills Should Read but Never Write 精读

LoRA 让大模型微调变得便宜,但把多个独立训练的适配器合并成一个模型始终是难题:直接在权重空间相加会互相干扰,全量重训昂贵且伤害旧技能,路由方案则放弃了「单一模型」的目标。本文追溯其困难根源,指出每个组合方法都在隐式做两个选择——因子坐标(规范自由度)与耦合方向(读写不对称),并提出 READ 方法:规范化因子坐标、只训练新技能的「读行」、折叠回基权重。在 32 个测试谱系中,READ 以平均 +0.073(95% CI +0.047 至 +0.101)战胜 14 种可折叠基线的逐谱系最强者,且全部 8 次失败均集中于 BBH 的新技能习得环节。本精读覆盖其背景、定位、方法、实验证据与优势根源的因果解释,并交叉验证相关谱系的研究结论。

September 29, 2026 · 6 min

Harness as a Language: A Minimalist Agent Framework With Maximal Expressivity 精读

MIT CSAIL 团队提出 JAZ:一个只比 agent loop 多一点点的极简智能体框架。它仅暴露一个 LLM 原语 invoke——一个函数体由 LLM 在运行时生成的函数——加上动态作用域与 hooks,就涌现出传统上需要专门 harness 才能实现的长程记忆与持续自改进能力:在 StuLife 远程回忆子集上以约 43% 的成本超越 Letta(MemGPT)8 个百分点,在 AppWorld 上以更低成本胜过专门的自改进框架 ACE。本文从语言原语的第一性原理出发,拆解 invoke 的两条定义性质、tail-recursive delegation 如何统一各类上下文管理为特例,并用 MemGPT、RLM、ACE、context rot 研究等外部文献交叉验证其效果优势的根源。

September 27, 2026 · 5 min

Just-in-Time Memory: Learning to Curate Task-Adaptive Memory for LLM Agents 精读

Salesforce AI Research 提出 JITMEM,把智能体记忆的「塑形」时机从写时推迟到读时:写时零损耗保存原始轨迹,读时由 curator LLM 联合当前任务与检索轨迹合成任务自适应 payload,用后即焚。因为 payload 在当前任务上被立即消费,curator 可用 GRPO 直接以任务原生得分训练,信用分配零步延迟。在 ALFWorld、WebShop、τ²-bench 上分别领先最强基线 16.2、16.3、3.9 个成功率点,输入 token 省约一半。本精读覆盖其问题定义、方法拆解、实验证据、根因分析与可迁移灵感。

September 27, 2026 · 4 min

内核证据检测与记忆家族隔离:Agent 基础设施二重奏精读

「二重奏」精读两篇 Agent 基础设施论文。第一篇《On the Effectiveness of Kernel-Level Evidence for Agent Security》构建 ACE 配对语料库(4047 会话×17 威胁模型),首次系统测量内核 syscall 证据对 Agent 安全检测的增益:Kernel-only 最高 OOD AUROC 0.922,跨层拼接普遍优于任一单层,Falco 默认规则近乎随机,证明内核证据应成为 Agent 检测的一等输入。第二篇《Scope Before You Persist》针对持久技能记忆的跨家族干扰,提出「认证范围=部署范围」原则与 Scoped-ORC:仅改变检索范围即把有害接受从 6/12 降到 0/63,27 流效用 +0.063,证明范围匹配而非更强的验证器才是持续适应的关键。

September 26, 2026 · 9 min

Continual Learning Mechanisms Compose for Long-Horizon Memorization 精读

让模型依次学 100 个知识任务且不留旧例、不给任务 ID——‘长程记忆化’设定下,任何单一持续学习机制都崩盘(保留率普遍个位数)。Johns Hopkins 的系统学研究证明机制要’组合’:锚点类型(data 复演/function 蒸馏/权重正则——保留什么)×低秩分配(merged LoRA——保留在哪)两维设计,任务级逐次减半搜索组合空间+因子实验量化交互。最优组合(三锚点+merged LoRA)把最终保留率从 1.2% 拉到 34.9%(28 倍),且 data 锚点×merged LoRA 在三个数据集上一致超可加——遗忘来源互补,组合解决结构问题。HF 日榜 281 赞当日第一。

September 17, 2026 · 2 min

Dream-RSI: Recursive Self-Improvement through Evolving Worlds 精读

RSI(递归自我改进)的核心瓶颈是探索策略管理:固定策略无法适应搜索空间扩张,在线策略优化又受困于长程 rollout 的延迟昂贵反馈。Dream-RSI 的关键洞察是——积累的发现历史本身就是已实现搜索空间上的重放模拟器,把探索策略的改进从昂贵的真实环境 rollout 搬到廉价的历史重放(做梦即训练)。Lasso 求解器发现任务上 agent 调用较 SimpleTES 削减 162×,held-out 运行时 3587→2931ms。本精读覆盖三环循环机制、重放模拟器的信息学根基与发现求解器的算法细节。

September 16, 2026 · 2 min

RSIAgent: Autonomous Exploration for Recursive Self-improvement in New Environments 精读

数字 Agent 进入新环境(接口/工具/失败模式预训练未覆盖)时如何无监督适应?RSIAgent 给出 training-free 答案:curriculum/actor/verifier 三类 Agent 协同自主探索,把’动作-条件-后果’因果关系沉淀为可冻结复用的记忆;广度+深度双探索消融显示完整 RSI 74.54% 显著优于单策略(65.52%/56.50%),并让 Kimi-K3、GLM-5.3 在 OSWorld-v2 与 Agent’s Last Exam 上反超 GPT-6 Astra。本精读覆盖因果记忆与轨迹记忆的本质差异、广深互补的机制解释与开源反超闭源的信号意义。

September 16, 2026 · 2 min

When Agents Slow Down: Elo-per-token 分析与 Agent 测试时策略 精读

Agent 在测试时的’减速’行为——更多 token 换来多少真实能力提升?本文提出 Elo-per-token 度量:以独立采样为理论参照(Elo 随 log compute 线性增长),定义 scaling inflection point(边际 Elo 增益跌至参照线的每会话预算)。4 个通用 Agent × 4 个开放基准、单会话最高 1 亿 token 的实验给出反直觉发现:AtCoder Heuristic Contest 上 Agent 超越历史最强人类选手的超线性提升是持续学习的证据——减速之后仍有巨大 headroom。本精读覆盖测试时 scaling 的度量学、独立采样参照的设计逻辑与’持续学习 vs 收益递减’的分界证据。

September 16, 2026 · 2 min

LifeMem: Enabling Lifelong Experience Reuse for LLM Agents 精读

北理工 BITHLP 实验室的 agent 记忆工作 LifeMem:针对跨环境经验迁移与灾难性遗忘两大难题,按底层 workflow 聚类交互轨迹提取可复用技能(结构级抽象而非表层相似),推理时召回技能+轨迹引导动作。在 5 场景 10 环境 13k+ 任务上验证(其中 4 环境新标注 2k+ 轨迹),遗忘降低与跨任务迁移双优;并发现任务流顺序影响学习、结构相似巩固有增益。数据集代码全开源。

September 15, 2026 · 1 min

Memory as Plans 精读:把记忆从执行期条件重构为规划期证据,机器人非马尔可夫任务 SOTA

哈工大×NTU×山大提出 MaP-WAM:将记忆依赖的世界-动作建模拆解为记忆锚定规划与计划条件执行两层——情景区段记忆作为规划期证据,因果世界模型(WAN-2.2-5B 微调)生成视觉计划,World-Action-Progress 模型把任务进度升级为一等模态。RMBench 83.3% SOTA、真机 78.0%,执行器延迟随历史增长恒定;Swap T/Press Button 达 96%。

September 13, 2026 · 1 min