TEPA: Revoking Stale Memories for Conflict-Robust Language Agents 精读

深度精读 TEPA 论文——首次将 Agent 长期记忆的’记忆污染’形式化为可证伪性问题,提出可撤销的证据-记忆机制,让有效性成为记忆的显式状态。在完全反转场景下,append-only 跌至 0.210(甚至低于无记忆基线 0.309),而 TEPA 保持 0.950。真实文件执行场景同样再现这一模式,MemoryAgentBench SH-6k 上匹配强 last-write-wins 缓存(0.890)。边界测试揭示多跳和超长上下文是下一阶段架构挑战。

August 11, 2026 · 8 min

MASS:用权威共享状态解耦多智能体世界模型——多人游戏架构如何破解视频世界模型的可扩展性瓶颈

MASS 借鉴在线游戏的权威服务器架构,将多人世界模型分解为推进权威类型化状态的 Logic Engine 与按需生成视角的 Rendering Engine,在匹配 Snake 基准上取得 0.764 的状态恢复(最强视频基线仅 0.128),并支持 1,024 个并发玩家、10,000 个循环 tick 的结构稳定预测。

August 9, 2026 · 3 min

经济世界模型蓝图:从经济代理到代理经济——六级能力阶梯如何定义下一代AI驱动经济仿真

深度精读《From Economic Agents to Agentic Economies: A Systems Blueprint for Economic World Models》,解析香港中文大学(深圳)、香港大学、南洋理工联合团队提出的经济世界模型(EWM)系统蓝图,详解六级能力阶梯 L1–L6、四大核心架构模块、五算子状态转移形式化,以及 737 篇文献揭示的研究空白。

August 9, 2026 · 4 min

Activity Frames: Deterministic Screen-Activity Compilation for Agent Memory and Replay 精读

深度精读 arXiv:2608.05784——独立研究者 Nossa Iyamu 提出的 Activity Frames,一个零模型、确定性的屏幕活动编译管道。它将屏幕捕获流分割为携带应用、站点、时序、输入量和证据指针的『活动帧』,在 128,756 帧、51 活跃天的真实语料上把单日上下文从 126,812 token 压缩到 1,469 token(86×),编译延迟仅 68ms,下游问答准确率 98.4%(LLM 摘要仅 66-80%),幻觉率 0%。同一编译器还首次测量了代理成本模型假设但从未实测的两个参数:Routine Overhead Ratio R=60-343x 和可委托复发率 h=7.7%(样本外)。核心洞察:把『解释』从『测量』中剥离,用最无趣的确定性代码填补捕获与记忆之间的缝隙。

August 8, 2026 · 8 min

AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning 精读

AgentOPSD 把 Agent 强化学习中长期被回避的’信用分配’难题重新拉回中心:在多轮交互、稀疏奖励的 Agent 任务里,GRPO 这类方法只能把最终成败均摊到每个动作上,导致长程任务里错误信号被稀释、优化方向被噪声淹没。本文提出一种无 critic 的递归自蒸馏方法——把教师(注入了成功技能 c+)与学生之间的 token 级对数概率差聚合为 turn 级证据,再在 log-odds 空间用类似贝叶斯更新的方式递归地累积成 turn 级信念 B_k,最后用 sigmoid 导数加权成有界优势重塑信号 Ã_k。这一过程把’稀疏结果监督’转化为’每一步的密集信用’,在 ALFWorld 上把 Qwen2.5-7B 从 81.2% 抬到 89.1%(+7.9pp),长程任务每轮交互衰减仅 0.54 点(GRPO 衰减 2.91 点)。消融实验进一步证明:先验锚定贡献 -10.2pp 是最关键设计,贝叶斯方向(符号保持)次之 -8.6pp。

August 8, 2026 · 8 min

CalibForge: Adversarial Solver Calibration for Scaling Learnable Terminal Tasks 精读

CalibForge 提出了一个自主终端任务合成系统,把求解器行为当作’构建时反馈’,通过多求解器校准和对比求解器校准两种对抗式策略,将候选任务反复修订到’可证明可解但又不被统一求解’的求解器相对可学习区间。基于 5,431 个校准任务蒸馏 SFT 后,Qwen3-30B-A3B 在 Terminal-Bench 2.0 从 7.87% 跃升到 32.58%,并在 SWE-bench Pro、Doc2Repo 两个分布外基准上同步取得 +27.68、+30.04 个百分点的迁移提升。本文从终端任务与可学习区间讲起,逐层拆解对抗式作者-求解器循环、轨迹反馈的三类修订模式,并从第一性原理分析’为何校准优于单求解器反馈’。

August 8, 2026 · 7 min

EnvACE: Internalizing Environment Dynamics via World Rehearsal for Agentic Reinforcement Learning 精读

蚂蚁集团与上海交通大学联合提出 EnvACE,让一个策略同时扮演「行动者」和「环境」两个角色:Acting 角色生成工具调用,Rehearsal 角色生成对应的环境响应,两个角色共享参数端到端联合优化。训练时完全不需要外部环境交互,却能在 BFCL-v4、τ²-Bench、VitaBench 三个 Agent 基准上全面超越依赖真实环境的 baseline,综合得分 32.91% 超过 14B 参数的 AWM。更精彩的是,模型内化出的「世界模型」还能在推理时用于 Test-Time Scaling,在提交执行前先在内部排练验证,把 Overall 推到 40.9%。本文从机制层面解释「世界排练为何比真实环境更高效」,并提炼出三条可迁移到其他领域的通用灵感。

August 8, 2026 · 6 min

OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models 精读

深度精读港大与腾讯联合出品的 OSReward——首个系统检验计算机使用 Agent(CUA)轨迹评判器可靠性的基准与开源奖励模型工作。论文构建了覆盖 Web/Windows/macOS/Ubuntu/Mobile 五大平台的 1,019 条人工标注轨迹基准,揭示了所有主流 VLM 评判器存在的系统性「宽容偏差」,并训练出成本降低 30-60 倍的开源奖励模型 OS-Shepherd。本精读从背景补全、研究脉络定位、问题抽象、方法机制、评估证据、效果根源、必要知识反推到可推广灵感,九部分完整拆解这项为 CUA 评判建立标准化评估体系的开创性研究。

August 8, 2026 · 8 min

When History Lies: Evaluating and Improving Tool Use under Misleading Multi-Turn Histories 精读

深度精读论文《When History Lies》——首次形式化『历史诱导的策略劫持』现象:结构有效、语义合理的历史轨迹仍可劫持 Agent 已有的正确策略,在 Qwen3-1.7B 上翻转 32.1% 的正确决策。论文提出 ContextPollute-Bench(同步三视图 Original/Polluted/Oracle State,十一类干扰算子)与 Oracle-OPD 方法(基于 Oracle State 的教师通过反向 KL 在策略蒸馏迁移到仅观察污染历史的学生),将 1.7B 模型的 BTA 从 47.2% 提升至 87.0%,8B 教师蒸馏后达 91.9%,并迁移到干净历史、未见工具与噪声多跳 QA。

August 8, 2026 · 4 min

When Self-Evolution Backfires: Pre-Commit Gating against Skill Contamination in LLM Agents 精读

深度精读浙江大学 VaG(Verifier-as-Gatekeeper)论文——首个正面刻画「自进化 Agent 中能力-污染相变」现象的工作。论文首次形式化了「技能池超过临界规模后新增技能反而降低性能」的非单调相变,并从数学上证明污染链具有结构不可逆性:有缺陷技能进入决策上下文后,其后代继承缺陷推理却从不引用原始缺陷源,导致事后回滚恢复率仅17%。VaG 采用「渐进信任层次 + 异构验证器检查不相交属性」的三级前commit门控(SchemaCritic 结构检查 / ExecCritic held-out重放 / AgentCritic 语义审查),配合边际增益贪心子集选择移除组合污染,在 Terminal-Bench 2 上以仅37个技能达到72% pass@1(Ungated崩溃至50%),技能池缩小近5倍,并在跨模型、跨基准迁移上全面领先。本文从背景、关联工作、问题抽象、三级门控解法、实验证据到不可逆性根源解释,完整拆解这一「前commit优于事后修复」的开创性研究,并提炼出可推广的系统安全设计灵感。

August 8, 2026 · 8 min