Progressive Agent Skill Generation via Reinforcement Learning (Skill-α) 精读

Agent 技能(Skill)是可复用的程序性知识,但生成技能缺乏自然监督信号——技能好不好只能看它能不能帮 Agent 在下游任务上做得更好。Skill-α 把技能生成形式化为序列编辑过程(Create/Update/Merge/Prune/Noop),核心创新是’回滚奖励’:对每个编辑,用同一锚定查询在原始技能和编辑后技能上分别运行固定工作器,编辑后更优才给正奖励。GPT-4o 工作器下 CL-Bench +3.3 点、tau2-bench +6.7 点超越最强基线。本文从’技能价值只能由下游表现定义’的第一性原理,解释为什么回滚奖励是技能生成的正确监督信号。

August 5, 2026 · 2 min

TARL:面向长期Agent的可执行记忆管理精读

长期Agent的持久记忆里,一次错误的更新会像多米诺骨牌一样反复扭曲未来的检索与推理。现有系统把记忆更新简化为二元Write/Hold决策,无法区分’新增/忽略/修订/拒绝/延迟验证’这五种本质不同的处置。TARL把每条语句映射到五种可执行操作,通过Accepted/Pending/History三账本管理记忆生命周期,并用反事实执行监督——在训练时执行所有候选动作、比较产生的记忆状态质量——来训练模型选择导致正确结果的操作。5-way Macro F1 0.8286、Next State Accuracy 0.6621、Memory Pollution Rate改善10.1%,且完美二元标签仅能恢复28.6%的状态、五动作Oracle可达100%——这篇论文从机制因果上证明了为什么二元监督从根本上不足。

August 5, 2026 · 5 min

Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction 精读

腾讯发布多领域编码 Agent 基准 WorkBuddy Bench,覆盖代码、前端、办公、安全四大真实工作场景。其核心贡献在于从真实 commit/CVE/业务场景逆向工程出抗污染的口语化任务,并将任务目录、环境镜像、评估框架、测试与参考方案完全开源。跨模型排行榜显示没有任何单一模型通吃,开源权重模型 GLM-5.2 在安全子集双框架登顶,为可信代码评测体系的构建提供了新的方法论范式。

August 5, 2026 · 6 min

Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent 精读

上海 AI Lab 等机构联合提出 Video-DeepResearch(Video-DR),把多模态 Deep Research Agent 从静态图像推进到连续视频流。论文诊断出当前 Agent 的两大顽疾——模态偏见(回避视觉工具转向文本搜索)与参数知识泄露(靠内部记忆蒙答案而非真正调用工具),并设计解耦感知-探索流水线 + 阶段式工具解锁 + SFT+GRPO 两阶段训练予以破解。其 35B-A3B 模型以 64.0% 平均准确率刷新 VideoDR-Bench SOTA,超越 Claude-4.5-Sonnet 5.0 分、GPT-5 11.5 分;30B 变体也追平 Claude-4.5-Sonnet。本文从机制因果层面解释:为何一个激活参数仅 3B 的模型能在视频 Deep Research 任务上反超数十倍体量的顶级闭源模型。

August 5, 2026 · 3 min

From RLVR to RLSVR: Task Transformation Induces Self-Verifiable Rewards for Open-Ended LLM Self-Improvement 精读

RLVR(带可验证奖励的强化学习)让 LLM 在数学、代码等可确定性判对的领域突飞猛进,却长期被「开放式任务没有标准答案」挡在门外。本文精读 COLM 2026 论文 RLSVR/SpyRL:借鉴自监督学习「构造前置任务」的思路,把摘要、创意写作这类开放任务变换成一个「谁是卧底」的多智能体博弈——因为卧底身份是预设的,投票结果天然可验证,从而第一次让开放域 LLM 自我改进脱离了外部评判器。实验在摘要、写作、数学三大领域全面超越 R-Zero、Absolute Zero,甚至击败 GPT-4o 作评判的 Rubric-as-Reward 方案,且成本为 0。

August 3, 2026 · 9 min

Mental World Modeling 精读

世界模型已经能很好地预测物理场景将如何演化,但它常常预测错人类会做什么——因为人不是被物理推动的,而是被自己的信念、目标、情绪和社会规范推动的。本文提出 Mental World Modeling(MWM)框架,把心理变量从’事后解释’提升为世界状态的’一等公民’,并用一个无需训练的六阶段基线 MENTIS 验证:在 448 条情境决策数据上,显式建模心智让 8 个大模型的决策预测 F1 平均提升到 87.9%,而删掉心智通道会掉 12.1 分,最大瓶颈是’耦合世界状态如何转移’。本精读按九部分结构展开,从’世界模型是什么’讲起,逐层拆解 MWM 的形式化、MENTIS 流水线、评估设计与瓶颈归因。

August 3, 2026 · 7 min

MANTA: Multi-Agent Network Topology Adaptation for Self-Evolving Multi-Agent Systems 精读

MANTA首次将多Agent系统的通信拓扑从’部署前固定的设计选择’重新定义为’推理时可自我演化的系统变量’。通过拓扑规划器、轨迹审计器和技能反射器三个编排组件,MANTA在任务执行期间监控协作过程并应用有界结构修复——修改角色、通信链路、执行顺序和信息可见性。在五个基准上平均74.0分,超越最强baseline 5.8分,且总token消耗最低。论文揭示了’拓扑是自我改进的独立层次’这一新范式。

August 2, 2026 · 3 min

Meta AI Proactive Memory Agent:记忆教练精读

Meta AI提出主动记忆智能体架构,用独立的’记忆教练’智能体在固定间隔审查行动智能体的近期步骤,更新结构化记忆库(私有状态/知识记忆/程序记忆),并决定是否注入定向提醒。核心创新在于’何时提醒’的策略决策——选择性干预优于全量检索。Terminal-Bench从38%提升至46%,tau2-Bench从55%提升至62%,超越Mem0生产记忆层。

August 2, 2026 · 2 min

Perception-Correction Distillation:多模态推理器感知蒸馏信用分配精读

中科院自动化所Hongyu Lin团队提出PCD(Perception-Correction Distillation),用下游失败和师生分歧作为互补见证的贝叶斯证据组合,形成软AND门精准识别’可纠正的感知失败’。乘法是唯一在任一见证缺失时归零的归一化双线性门。8B→2B从OPD的44.50提升至47.28,32B→8B从56.94提升至61.22。

August 2, 2026 · 1 min

ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow 精读

ShadowDancer提出影子对(shadow pairs)和跨影子预测(cross-shadow prediction),通过构造方式解决潜在动作模型的外观-动力学耦合问题。同一动力学轨迹在不同外观下重放,预测一个影子所需的表示必然是共享动力学本身。任何演示片段成为可复用动作资产,在新环境中重放无需动作标签、运动估计器或微调,跨五族动力学平均盲测胜率86%。论文揭示了’构造性不变量提取’的全新自监督范式。

August 2, 2026 · 3 min