RippleMem: 从孤立检索到联想式回忆 精读

问一个 Agent’该不该听 Sam 的推荐带 Maya 去 Harbor Grill 吃饭’,正确的回答需要三条分散在不同会话里的证据:晚餐计划、Maya 的海鲜过敏、这家店是海鲜餐厅——直接检索只命中第一条,无向图扩展可能带出无关的订座偏好却恰恰漏掉过敏这条安全约束。本文精读中国传媒大学联合智联英才科技的 RippleMem:它把记忆访问从’一次性查找’重构为’证据条件化的联想式回忆’——已召回的记忆不是检索的终点,而是寻找缺失支持的线索。系统把交互历史写成线索丰富的情景记忆单元,组织成事件中心图,查询时从初始锚点沿语义与结构双通道局部扩散,定向找回缺失证据。在 LoCoMo 上 F1 52.49、LLM 裁判准确率 87.14 均为最佳,temporal 类超 SimpleMem 9.66 分,multi-session 从 60.92 提到 78.20;建图成本约为 Mem0g/Zep 的 1/30。本精读重点拆解其写读两阶段设计,并用因果链解释’evidence-distributed 题型为何增益最大’与'30 倍成本下降为何来自延迟建图’。

August 16, 2026 · 3 min

AI for Science 爆发前夜:曹原谈验证瓶颈、概念抽象与 AGI 的最后一公里

Jeff Dean 带三位谷歌元老出走创立 Discovery Loop 当周,前 DeepMind 科学家、Unreasonable Labs 联合创始人曹原在硅谷101拆解 AI for Science 为何在此时爆发:代码与数学能力到位后科研成为下一个智能爆发点,但真正的瓶颈从建模移到了物理世界的验证环节;LLM 无法凭训练数据产生真正新的科学概念,概念抽象可能是 AGI 的"最后一公里"甚至不可计算;他主张 AI and Science 而非 AI for Science——科学难题是驱动 AI 本身进化的催化剂,并给出"AI 拿诺贝尔奖至少还需二三十年"的长期判断。

August 15, 2026 · 2 min

ComBodied Agents: a New Paradigm of Human-Centric Agentic AI 精读

Bang Liu 团队 38 页范式论文,提出继 Digital Agents(数字状态)和 Embodied Agents(物理状态)之后的第三种 Agentic AI 行动基底——Combodied Agents(以人的演化状态为核心)。文章构建了一个以事件级多模态感知、可纠正纵向记忆、Personal World Models、可接受干预策略四模块组成的闭环框架,并把’保留并增强人类 agency’首次系统化为可评估的指标体系。本文从背景、定位、问题抽象、解法机制、评估体系、优势根源、必要知识反推、通用性灵感八个维度逐层精读。

August 12, 2026 · 6 min

SkillZip: Evaluation-Free Skill Compression for Self-Evolving Agents by Discovering Reusable Structure 精读

深度精读阿里+浙大+杜克联合提出的 SkillZip——首个无需任务回放(evaluation-free)的 Agent 技能压缩方法。它把’自进化积累的技能’视为一份带类型签名的契约,用’解释一次,引用多次’的直觉统一了规则共享、作用域提升、工作流复用与例外编码,形式化为一个带硬覆盖约束的类型化最小描述长度(MDL)目标。实验显示:平均压缩 31.2%,性能甚至略超未压缩技能,压缩速度比最强基线 SkillReducer 快 3.5 倍,且零次任务 rollout。

August 12, 2026 · 6 min

DCAS: Decoupling CLI Agent Scaffolding to Internalize Planning across Scaffolds 精读

深度精读华为加拿大软件卓越中心与女王大学的 DCAS 论文——首个系统揭示开源 CLI Agent 存在’scaffold 锁定’现象的工作。论文发现:在 OpenHands 单一 scaffold 下微调的模型,迁移到其他 scaffold 时性能可从 52.6% 暴跌至 8.4%。通过提出 DCAS 后端替换拦截层和区分显式/隐式规划两种形式,论文给出了一条从 scaffold 制品到模型能力的可行迁移路径,仅用 576 条规划感知轨迹即可让模型在非训练 scaffold 上一致提升。

August 11, 2026 · 9 min

SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs 精读

当大语言模型需要同时掌握数学、代码、科学、逻辑多种推理能力时,SFT(监督微调)和 RL(强化学习)会表现出截然相反的行为:SFT 在多阶段训练中因梯度方向冲突而性能崩溃,RL 却因为「优势归一化 + on-policy 采样」产生的近似正交更新而稳定共存。本文通过参数级几何分析和高维浓度不等式,首次从理论上揭示了「SFT 干扰是范数受限的、RL 干扰是方差受限的」这一本质差异,并提出 Parallel-RL 范式——各任务独立 RL 后合并参数,在 DeepSeek-R1-Distill-Qwen-1.5B 上实现 ΔBase +10.7%、Retention 103.2%。本精读将从零讲清 SFT/RL/GRPO 的机制差异,建立「方法差异→参数更新几何→理论边界→指标提升」的完整因果链。

August 11, 2026 · 9 min

SkillProx: Self-Evolving Agent Skills via Proximal Textual Gradient Descent 精读

港科大的 SkillProx 把 LLM Agent 的「技能自进化」重新拆解为「近端梯度下降」的前向-后向两阶段:前向用闭环重执行拦截退化的诊断补丁,后向用冻结的留一效用审计配合验证门控选择性整合/降级/删除知识单元。相比最强梯度基线 SkillGrad 平均提升 3.0pp,且消融清晰地揭示了「闭环诊断 -1.5、近端收缩 -2.5」的因果分工。本精读以九部分结构,详解这套自进化框架的方法机制、实验证据、效果根源与可迁移灵感。

August 11, 2026 · 7 min

TEPA: Revoking Stale Memories for Conflict-Robust Language Agents 精读

深度精读 TEPA 论文——首次将 Agent 长期记忆的’记忆污染’形式化为可证伪性问题,提出可撤销的证据-记忆机制,让有效性成为记忆的显式状态。在完全反转场景下,append-only 跌至 0.210(甚至低于无记忆基线 0.309),而 TEPA 保持 0.950。真实文件执行场景同样再现这一模式,MemoryAgentBench SH-6k 上匹配强 last-write-wins 缓存(0.890)。边界测试揭示多跳和超长上下文是下一阶段架构挑战。

August 11, 2026 · 8 min

特修斯之船:Kimi K3如何把Transformer的零件全部换掉,还能逼近前沿

月之暗面K3是首个达到3T级别的开放权重模型,其47页技术报告揭示了一种"特修斯之船"式的架构哲学:注意力改成了线性+全局混合(KDA+MLA),残差变成了深度方向的Attention,FFN变成压缩空间的稀疏专家,甚至连位置编码都几乎被删掉。RadixArc创始成员赵晨阳和华盛顿大学博士生曾志远分别从Infer和算法两条线拆解K3:线性注意力在2.8T规模上实现了6.3倍解码加速,Quantile Balancing路由是3T稳定训练的关键之一,MOPD让九个领域专家模型高效合板,而KDA(Kernel Development Agent)证明RSI已在kernel优化领域高速运转。核心判断:权重只是一次训练的产物,环境才是能反复产出下一代权重的护城河。

August 6, 2026 · 1 min

TARL:面向长期Agent的可执行记忆管理精读

长期Agent的持久记忆里,一次错误的更新会像多米诺骨牌一样反复扭曲未来的检索与推理。现有系统把记忆更新简化为二元Write/Hold决策,无法区分’新增/忽略/修订/拒绝/延迟验证’这五种本质不同的处置。TARL把每条语句映射到五种可执行操作,通过Accepted/Pending/History三账本管理记忆生命周期,并用反事实执行监督——在训练时执行所有候选动作、比较产生的记忆状态质量——来训练模型选择导致正确结果的操作。5-way Macro F1 0.8286、Next State Accuracy 0.6621、Memory Pollution Rate改善10.1%,且完美二元标签仅能恢复28.6%的状态、五动作Oracle可达100%——这篇论文从机制因果上证明了为什么二元监督从根本上不足。

August 5, 2026 · 5 min