Reconstructing the Right Episode: Evaluating Interleaved Conversational Memory Beyond Long Context 精读

深度精读 UC San Diego 的 SCALE-QA 与 TSIM 论文——针对真实助手使用形态「单线程多主题混杂的长对话」定义并测量 episode integrity failure:决定性证据明明在对话里,系统却检索到貌似合理的碎片而非让局部约束生效的完整 episode。SCALE-QA 用 3000 题反事实基准(防预训练泄漏)+ 确定性运行时打包(16k-1M);TSIM 以语义漂移在线分段 + 三视图 episode 索引,在三个后端全部第一(比最强基线高 5.6-17.6 点),1M 诊断中用约 1.3k token 达 96.5% 而 Full Context 用 1.05M token 只有 87.2%。本文拆解「找回 episode 而非答对问题」才是瓶颈的完整证据链。

August 27, 2026 · 5 min

Recuris: Recursive Experiential-Working Memory Evolution for Long-Horizon Agent Harnesses 精读

Recuris(NUS × Stanford × Oxford × Princeton)把递归自我改进从『改模型/改智能体』收缩到『只演化外置记忆控制层』:工作记忆维护经检查器验证的任务状态并按需调用技能,跨任务的固定 Meta-Agent 读结构化轨迹、把失败归因到 E/W/ρ/C 四组件之一并只修补被归因组件,经修复源任务且不回退开发集的验证门才准入。在 4 个长程基准 × 10 个模型上 35/37 完成的模型-基准对成功率提升,GPT-5.6 Sol +17.8、Claude Opus 5 +15.6、最长任务 +32.2 分,六类长程失败模式下降 20–86%;机制上证明长程失败是执行问题而非检索问题,技能价值是『调用条件性』的,结构化轨迹使故障定位从 13.0% 提升到 64.8%。

August 27, 2026 · 3 min

Reflection Steering: Disentangling Reflection from Reasoning in Activation Space for Token-Efficient Inference 精读

香港四校合作提出 Reflection Steering:一个免训练的激活空间干预框架,用于抑制大推理模型中冗余的反思行为。方法通过 PCA 去噪、对共享推理方向正交化、逐层校准和有界投影删除四阶段,把「反思方向」从「通用推理方向」中解缠出来,在 6 个模型×基准设置中平均节省 16.9% 的思考 token,MATH-500 上精度统计等效。本精读完整拆解其方向净化机制、层校准协议与统计验证方法。

August 27, 2026 · 3 min

Repair or Resample? Rethinking Failure Debugging in LLM Multi-Agent Systems 精读

当多智能体系统(MAS)执行失败后,重跑一遍、自我反思、批评家反馈这些「修复」方法,究竟是真的修好了 bug,还是仅仅靠 LLM 采样的随机性碰巧撞对了答案?这篇来自华东师范大学等四所高校的论文用 SymTrace 回放框架与 536 条人工标注失败轨迹的 SymFail 数据集给出了冷峻的答案:无引导全量重跑的修复率仅 6.90%,自我反思 4.29%、批评家 3.73%,与随机重采样无异;而基于症状定位的选择性回放干预单次即修复 20.15%。本精读拆解其「冻结上游随机性」的受控评估方法论,并讨论它对整个 Agent 可靠性研究范式的冲击。

August 27, 2026 · 3 min

RePolicy: Reinforcement Learning for Safety-Policy Invocation in Agent Safeguards 精读

RePolicy(中科大+NUS+浙大等)把 agent 安全防护的关键一步——从动态策略库中调用适用安全策略——变成可优化的动作:rollout 结构为「策略调用→内容注入→有据推理→安全判断」,冷启动 SFT 后用 GRPO 配三项可验证奖励(格式/策略命中/判断正确)加策略上下文扰动(注入诱饵策略)训练。4B 模型在六个 agent 安全基准上 Overall Unsafe F1 达 88.15,超最强外部通用模型 Claude Sonnet 4.6 达 3.98 分、超最强专用 guard 达 8.46 分;策略命中率从 94.4% 升至 98.5%,诱饵选中率全程低于 1%。本精读拆解其任务形式化、数据构造与「调用-检索-推理」多算力换均衡错误权衡的机制因果链。

August 27, 2026 · 3 min

ReproAgent: Contract-Guided Paper-to-Code Reproduction 精读

ReproAgent(北航+上交+北大等纯高校合作)把论文复现代码生成失败归因于「split-specification」:显式的论文义务在长 agent 轨迹中漂移丢失,隐式的框架默认与仓库惯例根本不在论文里。它用持久化双通道实现契约对症下药——需求通道把论文片段钉成带 id 的代码义务,证据通道从参考文献仓库检索内容与结构证据,双双绑定到文件级契约并贯穿 Prepare–Plan–Generate–Repair 四阶段。在 PaperBench Code-Dev 上以 Claude-Sonnet-4.5 达到 73.7 分刷新纪录,同骨干对比超最强基线 9.2 分,通道消融显示去掉任一通道平均掉 14+ 分。本精读拆解其契约机制、覆盖不变量设计与两通道分工的因果证据。

August 27, 2026 · 3 min

SecOPD: Mitigating Adaptive Prompt Injections by On-Policy Distillation 精读

提示注入被 OWASP 列为 AI 智能体的头号威胁,而现有“安全 LLM“在自适应攻击下攻击成功率接近 100%。UC Berkeley 团队提出 SecOPD,把在线策略蒸馏(OPD)改造为注入防御训练信号:学生在被攻击输入上滚动生成,冻结的初始模型在对应干净输入上给同一 token 打分,实现 token 级信用分配。在 SEP + PISmith 自适应攻击下,防御后的 Qwen3.6-27B 攻击成功率仅 9.0%,比此前最强防御 Meta-SecAlign 的 94.0% 低一个数量级;同时七项效用基准平均 88.1%,与未防御模型持平。本精读覆盖问题定义、方法机制、实验证据、效果根源解释与可迁移灵感。

August 27, 2026 · 3 min

SimVerity: When Does Simulated Agent Success Survive Physical Deployment? 精读

Agent 产品上线前,模拟器给的「绿色对勾」在真实物理部署中还能信几分?帝国理工学院的 SimVerity 给出了第一个系统化量化:判定保真度 VF 与假清关风险 FCR。在真实智能家居测试床上,先进模拟器通过了全部 240 个开灯试验,相机却抓到 42 个亚秒级物理失败——同一执行裂解为完成/上报/可观察/沉淀四种判决。更惊人的是,假清关可以被预测:评测前 SHA-256 冻结的风险画像在从未物理测量过的路径上 11/11 会话全胜盲基线;而第二台合格模拟器与第一台零分歧——共识只是换了种方式放弃覆盖。本精读拆解这套「先证明证人资格、缺证据一律弃权」的判定迁移审计方法论。

August 27, 2026 · 4 min

Skill Issue: Are Skills Language-Invariant in LLMs? 精读

深度精读 A*STAR、Weizmann、MIT-IBM Watson AI Lab、Cambridge 与 EleutherAI 合作的跨语言技能不一致性测量论文——同一模型的两个实例在规则/状态/动作空间完全固定、仅语言界面不同的文字博弈中对战,共 51.84 万局自博弈,首次把「技能的语言条件化」从知识获取问题中正交分离出来。发现英语界面一致最强、希伯来语最弱;语言敏感度因博弈而异(Colonel Blotto 平均 1.07 最大、Kuhn Poker 0.13 最小);Nim 博弈的最优策略在阿/希界面下「存在但不可达」,且多数策略提及来自中途自发切换拉丁字母推理的对局;把推理语言换成英语可恢复 Gemma 德语界面 TTT 损失的 89.4%。语言影响的是决策的多个阶段,不只是输入理解。

August 27, 2026 · 3 min

SkillForge: Evolving Verifiable Skills for Reinforcement Learning Agents 精读

RL 训练的 LLM Agent 大多是’健忘’的:每个 episode 从零开始,过往经验无法沉淀。阿里高德(AMAP)团队提出的 SkillForge 让技能库在训练中持续进化——prompt 只注入紧凑技能目录,agent 用 <skill_call> 标签按需调用,每次调用成为轨迹中可观测、可归因的离散事件,GRPO 因此能同时优化环境动作与技能调用决策;证据驱动的技能验证(EMA 成功率+使用次数计算欠效分数)让低效技能被 reflexion 及时改写,多路径归纳从成功/失败/对比三通道合成新技能。在 ALFWorld/WebShop/AppWorld 三基准上全面超越 SkillRL(AppWorld SGC 近 3 倍),且 4B 小模型进化出的技能库迁移到 30B 模型能反超其自进化库——技能存的是可迁移知识而非模型私有产物。

August 27, 2026 · 4 min