AWM: Answerable Working Memory for Long-Document VQA Agents 精读

深度精读 AWM 论文——Oslo 大学、Stuttgart 大学、HKUST(广州)、清华与 Bosch AI 中心合作提出的工作记忆质量评估与优化框架。论文发现:即便给了金标证据页,42.5% 答对的长文档 VQA 样本留下的工作记忆依然不足以独立支撑答案——现有评测存在「记忆质量盲区」。AWM-GRPO 用四格奖励把 memory-only answerability 信号注入 GRPO,同源受控对比下比 answer-only GRPO 再涨 2.3-2.7 点。本文拆解「答案对 ≠ 记忆对」的诊断设计、四格奖励的机制推演与蒙特卡洛验证,以及中间产物监督这一通用方法论。

August 27, 2026 · 4 min

MA-VLA: Multi-Arm Vision-Language-Action Model for Collaboration and Compositional Generalization 精读

大连理工牵头、联合牛津等七校提出 MA-VLA:面向多机械臂协作的组合泛化——测试时协作模式(角色/顺序/交互结构)训练中未见过,但原子动作全在分布内。方法三件套:VLM Planner 把高层指令分解为按时序的原子 prompt 分配到各臂、Pi0 执行器统一推断全臂动作、训练期 Arm Shuffle 置换各臂四元组打破身份绑定。OOD 协作中 Pi0/DP 基线全部归零,MA-VLA 达 13.0%;真机 SO101 上从全 0 到 10/20。「原子动作+角色洗牌」让语言成为主动协调通道。

August 27, 2026 · 3 min

V-Rubrics: Visual Faithfulness via Rubric-Based Reinforcement Learning 精读

南洋理工大学 S-Lab 联合 A*STAR、UIUC 提出 Visual Rubrics-Based RL:把视觉忠实性从「事后评测指标」转变为「细粒度 RL 训练信号」。方法将参考答案分解为视觉忠实性/推理一致性/指令遵循三维原子评分条目,构建 5 万例训练集,并用组件化+前缀局部化的优势分配改造 GRPO。在同 SFT 起点、同 RL 数据、同预算的受控对比下,比 answer-only GRPO 再提 1.79 分,增益集中于依赖接地中间推理的基准。

August 27, 2026 · 3 min

VBVR-Pro: A Scalable and Verifiable Suite for Native Visual Reasoning 精读

NTU 牵头、20 个机构 50 余位研究者共建的 VBVR-Pro,为「原生视觉推理」——把视觉生成当推理介质本身——建立了可训练、可验证、可优化、可受控比较的闭环测试床:300 个程序生成任务(347 万图+130 万视频)、100 个任务的确定性奖励评分器(人类对齐超 GPT-5.5 且完全可复现)、30+ 生成器受控比较。训练使 9 个开源模型平均 +0.29 并在 7 个外部基准迁移 +28 分级别;RLVR 优于 RLVLM;三面证据链证明「视觉轨迹比语言 CoT 更关键」是范式级发现。

August 27, 2026 · 3 min

VoiceMem: Streaming Dual-Brain Memory for Real-Time Interaction 精读

实时语音助手至今没有一套像样的记忆系统:文本 Agent 记忆动辄 top-100 检索、2–3 秒延迟,而语音对话只给得起 500 毫秒预算和 5 条记忆的空间。南洋理工、新加坡国立、清华、港中文联合团队的 VoiceMem 用「双脑」架构解题:左脑以 schema-entity 两级索引把候选池收窄到稠密子集,让 top-5 检索达到别家 top-100 的精度;右脑用独立/跨实体双节点分别建模稳定人格与情境情感;四阶段流式查询把检索藏进 VAD 静默窗——134ms 完成检索、零感知延迟。信息记忆均值 76.39 超最强基线 +10.6,token 省 4.4 倍;还贡献了 53 小时音频的 ChatMem-Bench 与首批带显式记忆访问的语音语言模型。

August 27, 2026 · 4 min

Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent 精读

上海 AI Lab 等机构联合提出 Video-DeepResearch(Video-DR),把多模态 Deep Research Agent 从静态图像推进到连续视频流。论文诊断出当前 Agent 的两大顽疾——模态偏见(回避视觉工具转向文本搜索)与参数知识泄露(靠内部记忆蒙答案而非真正调用工具),并设计解耦感知-探索流水线 + 阶段式工具解锁 + SFT+GRPO 两阶段训练予以破解。其 35B-A3B 模型以 64.0% 平均准确率刷新 VideoDR-Bench SOTA,超越 Claude-4.5-Sonnet 5.0 分、GPT-5 11.5 分;30B 变体也追平 Claude-4.5-Sonnet。本文从机制因果层面解释:为何一个激活参数仅 3B 的模型能在视频 Deep Research 任务上反超数十倍体量的顶级闭源模型。

August 5, 2026 · 3 min

Mental World Modeling 精读

世界模型已经能很好地预测物理场景将如何演化,但它常常预测错人类会做什么——因为人不是被物理推动的,而是被自己的信念、目标、情绪和社会规范推动的。本文提出 Mental World Modeling(MWM)框架,把心理变量从’事后解释’提升为世界状态的’一等公民’,并用一个无需训练的六阶段基线 MENTIS 验证:在 448 条情境决策数据上,显式建模心智让 8 个大模型的决策预测 F1 平均提升到 87.9%,而删掉心智通道会掉 12.1 分,最大瓶颈是’耦合世界状态如何转移’。本精读按九部分结构展开,从’世界模型是什么’讲起,逐层拆解 MWM 的形式化、MENTIS 流水线、评估设计与瓶颈归因。

August 3, 2026 · 7 min