Gander (Omni Interaction Agent Technical Report) 精读

腾讯混元语音与浙大等团队的 Gander 用’小脑-大脑’协作框架统一了全双工实时交互与长程 Agent 执行:9B 小脑以 Thinker-Talker 流式架构逐秒 chunk 决策听/说/打断,大脑免训练接入 Codex/Claude Code 执行长任务,编排运行时以 task_start/send/resolve 结构化调用衔接。Full-Duplex-Bench v3 上 turn-taking 100% 全场最佳、过早打断仅 8.0%(GPT-Realtime 13.5%);SpokenQA 全双工组第一。模型、代码、数据全部开源。

September 10, 2026 · 3 min

Beyond Retrieval: Progressive Latent Memory Evolution for Streaming Video Understanding 精读

流式视频理解的主流范式是’存历史、按需检索’,但外部证据永远只是临时上下文。南京理工×蚂蚁×NUS×港中文的 LatentStream 把范式翻转为’检索并内化’:分层流记忆 + 渐进扩张感受野的 latent token 把历史证据固化进固定长度潜记忆,用熵构造的渐进置信奖励在测试时联合优化。OVO-Bench 64.2%、StreamingBench 76.9%、MLVU +6.1,全部 SOTA。

September 7, 2026 · 2 min

LatentPress: Context Compression Beyond Text and Vision 精读

压缩后的上下文通常仍以文本或图像这两种’给人看’的形式存在。LatentPress 提出第三种表示:小型 writer 把对话/文档直接写成连续记忆 token,冻结解码器经输入嵌入接口读取,推理时零文本重建。LongMemEval 上 7.7× 压缩反而比未压缩证据更准(0.504 vs 0.490),写入 43ms 比摘要快一个量级——机器原生的记忆表示从此有了实证立足点。

September 7, 2026 · 3 min

AdaThinking-E: One-Token Entropy Regulation for Adaptive Thinking 精读

美团联合上海交大、中科院自动化所提出 AdaThinking-E,用一个 token 的熵调节教会文档理解多模态大模型自主决定何时深度思考。该方法把模式切换 token 与回答 token 分开优化,前者用熵奖励驱动从高熵探索到低熵决策的课程式过渡,后者只关心答案质量,从而避免了 GRPO/DAPO 训练中模式坍缩为全不思考的通病。在 8 个文档基准上,7B 模型以 27% 的思考率追平 SOTA 自适应思考模型 82% 思考率的效果,OCR-Reasoning 相对基座提升 10.8 个百分点,实现了该想才想、不该想不想的效率与精度兼得。

August 31, 2026 · 3 min

Code as Worlds: Agentic Discovery of Executable World Representations for Physical Reasoning 精读

深度精读 MirroS 联合清华、北大、南洋理工的技术报告 Code as Worlds。论文提出用可执行代码表示物理世界的组成、演化与外观(EWR 三元组),把’从观测恢复世界表示’建模为溯因式的 agent 发现环:提出-实例化-执行-渲染-验证迭代修正。再用验证过的世界免费生成带精确物理量标签的 VQA 数据训练 VLM,9B 模型在 QuantiPhy 上 55.4 分超过 Gemini-3.1 Flash 的 54.8,27B 推理变体 58.6 分超过全部基线。

August 31, 2026 · 3 min

GameWAM: A World Action Model for Video Games 精读

复旦、腾讯光子与清华深圳研究生院团队提出 GameWAM,首个面向电子游戏原生键鼠闭环控制(游戏玩法+GUI)的世界-动作模型。它用并行 Video-DiT 与 Action-DiT 做块因果联合流匹配,同时生成未来视觉观测与可执行动作;用每步动作路由器区分 gameplay/GUI 两种控制分布,用预测长执行短的块周期控制解耦规划与承诺,用分层历史压缩维持长时程记忆。在 Minecraft MCU 上平均成功率 50.7(次优 36.8)且执行步数全面最少,零样本迁移 VoxeLibre 达 59.2%。论文还发现并命名了 LASI 失效模式:采样动作源的低频分量会系统性牵引生成相机运动,复用可致原地旋转。整篇论文训练仅 2.79B token,是 Game-TARS 配方的 1/200。

August 31, 2026 · 3 min

VFA: Empowering Multilingual MLLMs via Vision-Free Adaptation 精读

南方科技大学、微软亚洲研究院、上海财经大学与北京大学团队提出 VFA(Vision-Free Adaptation),在不使用任何图文对数据的前提下增强多模态大模型的多语言能力。核心思路是把微调看作任务向量:在共享 LLM 底座上用 10 万条纯文本多语言数据微调基座 LLM 得到多语言任务向量,再用 WA/TA/TIES 三种合并算子注入到视觉对齐的 MLLM 语言骨干中,视觉编码器与投影层完全冻结。五个 MLLM 上六大多语言多模态基准平均增益 +0.57 到 +10.64,文化视觉推理 MaRVL 增益最大(Idefics3 +36.17),通用多模态能力持平或略升;而直接文本微调会让 Qwen2.5-VL 平均掉 11.92、MaRVL 从 53.50 崩到 0.00。VFA 仅用 Pangea 约 2% 的数据量达到 47.84 vs 50.34,训练成本约 10 A100 小时对 320 A100 小时,且框架可迁移到视觉编程等非多语言任务。

August 31, 2026 · 3 min

WeAgent-MMSearch: Native Text-Vision Interaction for Multimodal Search Agents 精读

多模态搜索智能体常被环境拖后腿:许多搜索环境只把网页转成文本喂给模型,工具返回的图片直接丢弃,号称多模态的轨迹实际退化成纯文本推理;长时程交互中的超时、超长输出、格式错误还会污染 RL 训练信号。腾讯微信 AI 与中山大学提出 WeAgent-Harness,把检索图像注册为可寻址的持久状态并跨轮回灌,配合失败感知的 FA-GSPO 训练算法与可诊断『检索失败还是感知失败』的 VisTarget-Bench,基于 30B 模型在 8 个基准上取得 55.97% 平均分,媲美约 10 倍参数量的前沿模型。本文按九部分结构精读其动机、机制、证据与可迁移灵感。

August 31, 2026 · 4 min

SpeechGym: An Audio-Native Gym for Training Voice Agents via Reinforcement Learning 精读

语音 Agent 必须完全通过语音完成工具调用与多轮对话,主流范式却在文本中训练。SpeechGym 在未修改的 τ²-bench 之上构建首个音频原生、多轮工具调用、可端到端 RL 训练的语音 Agent 环境:两个 Qwen3-Omni-30B 全模态模型以原生语音直接对话,工具接口保持文本以分离感知与行为错误。诊断发现文本到语音的落差主要源于感知缺陷——槽值误听率 32%,为文本通道的 16 倍;per-turn 过程奖励把携带梯度的组比例从 16% 提至 99.6%,破解 outcome-only GRPO 的梯度饥饿。训练后零调参迁移到独立实现的 τ-Voice 基准,pass@1 从 24% 升至 53%,开源 30B 模型升至排行榜第二、超过 GPT-Realtime-2,且轮数与 token 同步下降。

August 29, 2026 · 7 min

DeepChart: How Far are LLMs from Faithful Data-Science Chart Generation? 精读

深度精读中科大与华为的 DeepChart 基准:把数据科学图表生成形式化为 Extract–Reason–Visualize 管线,用 1482 条专家标注实例分阶段评估图表背后的数据路径。核心发现「隐藏幻觉」——提取与推理错误经渲染掩盖,外观评估完全不可见:多模态场景模型可执行率 0.782 但源数据保真 F1 仅 0.149;专有模型选 HTML 渲染优于 Python 却有 99.4% 的实例选了次优的 Python。

August 28, 2026 · 2 min