LongHorizon-Harness: Advancing Long-Horizon Agents for Real-World Tasks 精读

长程任务(long-horizon)是 Agent 走向真实世界的最后一块硬骨头。LongHorizon-Harness 把’执行-状态管理-完成评估’从一个不断增长的上下文里拆开,重构为 Manage-Execute-Audit(MEA)循环:Manager 只管状态不碰环境、Executor 每轮用新鲜上下文执行、Auditor 只读独立验证。这套架构让 Qwen 3.7-Plus 在 WeaveBench 上从 51.8% 跃升到 80.7%(近乎翻倍官方 SOTA),OSWorld 2.0 上把 Claude Opus 4.7 从 20.0% 提到 34.3%。本文从’状态-执行-审计’分离的第一性原理出发,解释为什么这套架构在难任务上收益更大、在更强模型上 token 反而更省。

August 5, 2026 · 3 min

Progressive Agent Skill Generation via Reinforcement Learning (Skill-α) 精读

Agent 技能(Skill)是可复用的程序性知识,但生成技能缺乏自然监督信号——技能好不好只能看它能不能帮 Agent 在下游任务上做得更好。Skill-α 把技能生成形式化为序列编辑过程(Create/Update/Merge/Prune/Noop),核心创新是’回滚奖励’:对每个编辑,用同一锚定查询在原始技能和编辑后技能上分别运行固定工作器,编辑后更优才给正奖励。GPT-4o 工作器下 CL-Bench +3.3 点、tau2-bench +6.7 点超越最强基线。本文从’技能价值只能由下游表现定义’的第一性原理,解释为什么回滚奖励是技能生成的正确监督信号。

August 5, 2026 · 2 min

TARL:面向长期Agent的可执行记忆管理精读

长期Agent的持久记忆里,一次错误的更新会像多米诺骨牌一样反复扭曲未来的检索与推理。现有系统把记忆更新简化为二元Write/Hold决策,无法区分’新增/忽略/修订/拒绝/延迟验证’这五种本质不同的处置。TARL把每条语句映射到五种可执行操作,通过Accepted/Pending/History三账本管理记忆生命周期,并用反事实执行监督——在训练时执行所有候选动作、比较产生的记忆状态质量——来训练模型选择导致正确结果的操作。5-way Macro F1 0.8286、Next State Accuracy 0.6621、Memory Pollution Rate改善10.1%,且完美二元标签仅能恢复28.6%的状态、五动作Oracle可达100%——这篇论文从机制因果上证明了为什么二元监督从根本上不足。

August 5, 2026 · 5 min

Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction 精读

腾讯发布多领域编码 Agent 基准 WorkBuddy Bench,覆盖代码、前端、办公、安全四大真实工作场景。其核心贡献在于从真实 commit/CVE/业务场景逆向工程出抗污染的口语化任务,并将任务目录、环境镜像、评估框架、测试与参考方案完全开源。跨模型排行榜显示没有任何单一模型通吃,开源权重模型 GLM-5.2 在安全子集双框架登顶,为可信代码评测体系的构建提供了新的方法论范式。

August 5, 2026 · 6 min

Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent 精读

上海 AI Lab 等机构联合提出 Video-DeepResearch(Video-DR),把多模态 Deep Research Agent 从静态图像推进到连续视频流。论文诊断出当前 Agent 的两大顽疾——模态偏见(回避视觉工具转向文本搜索)与参数知识泄露(靠内部记忆蒙答案而非真正调用工具),并设计解耦感知-探索流水线 + 阶段式工具解锁 + SFT+GRPO 两阶段训练予以破解。其 35B-A3B 模型以 64.0% 平均准确率刷新 VideoDR-Bench SOTA,超越 Claude-4.5-Sonnet 5.0 分、GPT-5 11.5 分;30B 变体也追平 Claude-4.5-Sonnet。本文从机制因果层面解释:为何一个激活参数仅 3B 的模型能在视频 Deep Research 任务上反超数十倍体量的顶级闭源模型。

August 5, 2026 · 3 min

WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning 精读

VLA 模型做 RL 后训练时,critic(价值估计器)通常只看单帧画面——这和机器人控制’部分可观测’的本质根本不匹配。WCM(World Critic Model)基于 LeJEPA 架构,让 critic 同时预测未来潜在状态(世界建模)和估计价值,使 critic 的表示被显式训练去捕捉时序动态。在 149 个任务上,OpenVLA-OFT 的 in-distribution 成功率达 99.0%、out-of-distribution 达 77.9%;从 0.8% 的 zero-shot 提升超 12000%;7 个真实世界任务全面超越基线。本文从’纯标量回报回归不足以学时序动态’的第一性原理,解释为什么单纯加历史帧没用、必须加世界建模目标。

August 5, 2026 · 3 min

From RLVR to RLSVR: Task Transformation Induces Self-Verifiable Rewards for Open-Ended LLM Self-Improvement 精读

RLVR(带可验证奖励的强化学习)让 LLM 在数学、代码等可确定性判对的领域突飞猛进,却长期被「开放式任务没有标准答案」挡在门外。本文精读 COLM 2026 论文 RLSVR/SpyRL:借鉴自监督学习「构造前置任务」的思路,把摘要、创意写作这类开放任务变换成一个「谁是卧底」的多智能体博弈——因为卧底身份是预设的,投票结果天然可验证,从而第一次让开放域 LLM 自我改进脱离了外部评判器。实验在摘要、写作、数学三大领域全面超越 R-Zero、Absolute Zero,甚至击败 GPT-4o 作评判的 Rubric-as-Reward 方案,且成本为 0。

August 3, 2026 · 9 min

Mental World Modeling 精读

世界模型已经能很好地预测物理场景将如何演化,但它常常预测错人类会做什么——因为人不是被物理推动的,而是被自己的信念、目标、情绪和社会规范推动的。本文提出 Mental World Modeling(MWM)框架,把心理变量从’事后解释’提升为世界状态的’一等公民’,并用一个无需训练的六阶段基线 MENTIS 验证:在 448 条情境决策数据上,显式建模心智让 8 个大模型的决策预测 F1 平均提升到 87.9%,而删掉心智通道会掉 12.1 分,最大瓶颈是’耦合世界状态如何转移’。本精读按九部分结构展开,从’世界模型是什么’讲起,逐层拆解 MWM 的形式化、MENTIS 流水线、评估设计与瓶颈归因。

August 3, 2026 · 7 min

N₀-VTLA: Scaling Vision-Tactile-Language-Action Model with Latent Tactile Tokens 精读

N₀-VTLA由NeoteAI Team与复旦TEAI Team联合提出,是首个在大规模触觉数据上预训练的视觉-触觉-语言-动作(VTLA)基础模型。方法核心是三步训练配方:(1)在自建NeoData大规模视-触数据集上做视觉-触觉预训练学习广泛的接触先验;(2)分阶段触觉通路集成,用一个预测性触觉通路将大规模接触先验蒸馏为下游任务所需的精细运动调整;(3)ALTER——一种优势条件离线RL方法,将相对进展与轨迹事件比较转化为二元优势标签用于策略训练。N₀-VTLA赢得全部9个NeoReal真机任务,在20任务仿真套件上平均成功率63.8%(最强baseline π0.5为44.0%),ALTER训练策略在3个长程真机任务上达到75-95%成功率。

August 3, 2026 · 3 min

ODEWorld: A Continuous Predictive Architecture via Physical-Time Flow 精读

深度精读 arXiv:2607.27924——首个用物理时间 ODE 取代离散下一步预测的连续时间潜在世界模型。PT-Flow 把’未来预测’重新定义为’在紧凑潜在空间里对一个连续速度场做积分’,靠动力学解耦 + 直接一阶 JVP 监督,一举绕开 JEPA 长期头疼的表示坍缩难题;还能做离散模型做不到的任意时刻查询和后向预测。在 LIBERO 视频生成上 PSNR 比离散 baseline 高 3 分以上,64 帧长程预测延迟仅 0.072 秒,并在 LIBERO-LONG 和真实双臂 AgileX 机器人上把策略成功率推到 SOTA。

August 3, 2026 · 8 min