<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/"><channel><title>多模态 on MessageDaily</title><link>https://inkeast.github.io/MessageDaily/tags/%E5%A4%9A%E6%A8%A1%E6%80%81/</link><description>Recent content in 多模态 on MessageDaily</description><generator>Hugo</generator><language>zh-cn</language><lastBuildDate>Sat, 03 Oct 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://inkeast.github.io/MessageDaily/tags/%E5%A4%9A%E6%A8%A1%E6%80%81/index.xml" rel="self" type="application/rss+xml"/><item><title>GUI-HARVEST + DynaHarness + EvoGen-Harness 三篇合读：harness 自进化在 GUI、机器人、图像生成三条垂直域的落地</title><link>https://inkeast.github.io/MessageDaily/posts/2026-10-03-harness-vertical-trio-paper-reading/</link><pubDate>Sat, 03 Oct 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-10-03-harness-vertical-trio-paper-reading/</guid><description>「冻结骨干、进化运行时」正在成为 agent 自进化的主流路线：GUI-HARVEST 用重复视觉执行证据加行为预测双门，在 OSWorld 六个骨干上最高提升 12.33 个百分点；DynaHarness 用快慢脑加物理执行契约，把冻结 π0.5 机器人策略从 17.5% 拉到 74.25%；EvoGen-Harness 用 where+how 联合归因进化，让冻结文生图模型在 GenEval2 上从 0.4456 涨到 0.7089。三篇论文分别代表 GUI、物理机器人、图像生成三条垂直域的 harness 进化代表作，本文合读三者的共同骨架、域特化设计与实验证据链，并讨论 harness 工程的边界与反例。</description></item><item><title>Encoder-Free Scaling Laws × UMM-Reflection：统一多模态模型的架构与反思双问 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-30-multimodal-duet-paper-reading/</link><pubDate>Wed, 30 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-30-multimodal-duet-paper-reading/</guid><description>本精读合并解读两篇直指「统一多模态模型」根本问题的论文：腾讯 + CASIA + UCAS 的 Encoder-Free Scaling Laws 用两条架构共享同一 11 级稀疏 MoE 解码器阶梯（1.1B–44B 总参）与同数据同优化设置的受控对比，首次给出 encoder-free 与 encoder-based MLLM 的双向 scaling law——文本目标两架构前沿几乎重叠（γ 0.0973 vs 0.0979），多模态目标 encoder-free 当前更差但下降更快（γ 0.3778 vs 0.2998），外推交叉点 6.1×10²¹ FLOPs（比旗舰模型预训练算力低约三个数量级），分主题 STEM 最早追平、OCR/Caption 最晚，配注意力质量（0.217→0.645）+ 表征余弦 + 专家路由三层机制探针解释「视觉 token 先慢后骤降」的学习动力学；NTU + 上海交大 + 东京大学的 UMM-Reflection 则是首个对统一模型完整多轮反思轨迹做 RL 的工作——共享根采样（K=16 兄弟轨迹共用一张 detach 初始图，组优势只比反思策略不比首抽运气）+ 整轨迹单一优势同时更新文本头与流头，GenEval 从 0.71 升至 0.84（超 SFT +12.05 点）、条件修复率 20.59%→64.94% 翻三倍，换指令实验（48.4% vs 20.5%）与线性探针（AUC 0.804→0.815 几乎不动、失败图落入 pass 区 34%→62%）证明 RL 是在骨干已有修复分布中「选对的切片」而非创造新能力。一篇回答预训练的结构问题（要不要视觉编码器），一篇回答后训练的能力问题（会不会自我反思），合成统一模型路线的完整纵切面。</description></item><item><title>FuseReg: Regularizing Layer Fusion Mitigates the Reconstruction-Generation Gap in Representation Autoencoders 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-29-fusereg-paper-reading/</link><pubDate>Tue, 29 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-29-fusereg-paper-reading/</guid><description>本文精读 arXiv 2609.31620《FuseReg》。表示自编码器（RAE）用冻结视觉编码器的特征做扩散模型的 latent，但「融合哪些层」一直是个手工选择的固定配置：浅层利于重建、深层利于生成，一个固定融合把两个偏好不同的阶段绑死在一起。FuseReg 把层融合从「待选择的配置」重构为「训练分布」：训练时对编码器层做归一化随机子集采样，理论上证明该操作保持全层均值不变、恰好沿层间分歧方向注入方差，且二阶矩与任何确定性融合不可等价。仅换一个 FuseReg decoder 就把 ImageNet-256 无引导 gFID 从 3.01 降到 2.21（-27%），k=7 迁移场景从 27.73 降到 1.92，联合正则在 DiT-Base 上从 13.96 降到 9.93（-29%）。本精读覆盖背景、关联谱系、问题抽象、方法机制、实验证据链、外部交叉验证与可推广灵感。</description></item><item><title>AI 智能体行为的水印税与全模态 harness 双精读：Provenance Tax × Qwen3.8-Omni-Flash</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-27-duet-provenance-omni-paper-reading/</link><pubDate>Sun, 27 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-27-duet-provenance-omni-paper-reading/</guid><description>本期二重奏精读收录两项围绕「AI 智能体」的研究。上篇解读 Lasso Security 的企业研究 The Provenance Tax：Anthropic 即将在 Claude 中部署的 SynthID-Text 水印虽然宣称非失真，但改变了逐 token 采样过程，实验证明它会改变智能体的工具调用与拒绝行为，注入攻击下 gemma-3-27b 的逐项判定翻转率高达 23.5%。下篇解读阿里通义千问技术报告 Qwen3.8-Omni-Flash：一个原生全模态智能体模型，凭 Thinker-Talker 架构、1M 上下文与智能体式选择性感知，把音视频理解的准确率与 token 成本同时推向新平衡，并开源 Qwen-MM-Plugins 与 Qwen-Live-Harness 两个框架。两篇文章合起来，恰好构成 2026 年智能体工程的两条主线：模型行为的可靠性边界，与全模态 harness 的系统化设计。</description></item><item><title>Training Object Permanence in World Models 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-26-object-permanence-world-models-paper-reading/</link><pubDate>Sat, 26 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-26-object-permanence-world-models-paper-reading/</guid><description>16 所高校联合团队发布 WROP 基准与训练资源，用 150 个 Blender 参数化生成器、150 万样本的系统化合成数据，检验并训练视频世界模型的「客体永久性」与「客体固体性」两类核心认知先验。微调得到的 16B 模型 PWM-WROP 在 20 人盲测成对比较中以 Elo 1679.5 位列真续写模型第一、全场第三，超最强真续写对手 222.5 Elo，且在匹配分辨率下 LPIPS 0.081、MS-SSIM 0.921 全场最优。本精读覆盖背景、定位、问题定义、解法、实验证据、优势根源与外部交叉验证、知识反推与通用灵感九个部分。</description></item><item><title>7B模型挤进闭源效果区、8块钱的翻唱与六个人的偶像工厂：云栖2026视听生成专场复盘——当创作被批量供给，稀缺的成了故事与判断</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-24-yunqi2026-av-generation-closed-loop/</link><pubDate>Thu, 24 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-24-yunqi2026-av-generation-closed-loop/</guid><description>2026 云栖「视听生成：多模态创作与文化娱乐」专场复盘：千问Image 2.1 以 7B 开源挤进闭源效果区并获英特尔 Day Zero 端侧支持；Wan 3.0 与 Agentic PE 把视频生成推向导演思维；Happy Shrimp 1.1 要让不懂乐理的人「像写代码一样做音乐」；太合音乐总裁余灏摊开 8 元 AI 翻唱对 5000—30000 元实录的成本塌缩与 3000 个版本的维权困局；小旭音乐六人团队运营十几个 AI 歌手、四五个月全网播放破两亿。当供给端被无限放大，「为什么表达」成了全场最贵的提问。</description></item><item><title>从繁星到灯塔：当数据耗尽成为时间表，AI 竞争换到了哪条赛道</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-24-yunqi2026-data-evaluation-lighthouse/</link><pubDate>Thu, 24 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-24-yunqi2026-data-evaluation-lighthouse/</guid><description>云栖2026「从繁星到灯塔」数据与评测分论坛全程复盘：七场分享拼出一条主线——人类数据将在2026-2032年间触及上限，合成数据有塌缩与奖励欺骗两大天然短板，模型竞争从拼参数量转向数据资产厚度、闭环转速与评测可信度。文中整理数据飞轮七节点框架、基准设计的科学与艺术、科学/具身两条垂类数据基建，以及&amp;quot;人类数据是RSI锚点&amp;quot;的判断，并给出五条可观察的行业机制链。</description></item><item><title>入口在嘴、生产力在 Agent：语音大模型降价九成五之后——云栖2026 千问语音论坛综述</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-24-yunqi2026-qwen-audio-voice-model/</link><pubDate>Thu, 24 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-24-yunqi2026-qwen-audio-voice-model/</guid><description>2026 云栖大会千问语音论坛发布 Qwen-Audio-3.1：ASR 从转写走向理解、TTS 一次生成全声景、Realtime 前台双工加后台 Agent 框架，全线 API 降价最高九成五。得到、网易、人民日报、容联云四家展示了笔记、游戏、媒体、催收的落地。本文梳理其机制、二阶影响与读者可用的判断标准。</description></item><item><title>台前是 Agent，台后是数据湖：云栖 2026 多模态数据训推论坛复盘</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-24-yunqi2026-multimodal-data-training-inference/</link><pubDate>Thu, 24 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-24-yunqi2026-multimodal-data-training-inference/</guid><description>云栖 2026「多模态数据处理与模型训推论坛」八场演讲复盘：预训练红利见顶后，数据生产成本与模态复杂度同步上升，竞争焦点转向数据闭环与模型闭环的双飞轮。本文梳理卓驭一湖两域、PAI 的 token 经济学、TeleAgent 六十万员工规模化、DLF agentic lake、乐享元游 Data Agent 与微财 L0-L3 特征开发自动化六条主线，拆解&amp;quot;深度用户仅约 5%&amp;ldquo;背后的语义、权限与血缘瓶颈，并给出可迁移的机制—影响—启发链条。</description></item><item><title>存储走上业务关键路径：从具身数据洪流到Agent记忆底座——云栖2026「AI and Agentic存储解决方案」五场景实录</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-24-yunqi2026-ai-agentic-storage-solutions/</link><pubDate>Thu, 24 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-24-yunqi2026-ai-agentic-storage-solutions/</guid><description>云栖大会2026「AI and Agentic存储解决方案」专场，阿里云与穹彻智能、卓驭科技、小鹏、美图、智创星云沿数据旅程拆解存储如何从后台走到业务关键路径：具身数据年增477.78%下的众包上行与帧级随机读写、智驾闭环的稳快省、Lance加OSS加速器让30PB数据湖读吞吐提升20倍、AI重写存储治理范式，以及Session与Memory分家的Agent存储底座。附系统性同音词ASR校正实录。</description></item><item><title>数据平台正在易主：当Agent成为头号用户，语义和失控成了新账单</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-24-yunqi2026-agent-driven-omnimodal-bigdata/</link><pubDate>Thu, 24 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-24-yunqi2026-agent-driven-omnimodal-bigdata/</guid><description>云栖大会2026「Agent驱动的全模态大数据计算创新」论坛上，AMD与阿里云的对话给出一个共识：大数据与AI两张采购清单正在并成一张，MaxCompute、Hologres、开源大数据平台全面转向Agent原生。但真正的瓶颈不再是算力和格式，而是语义与可控——平台方用语义图谱、数据沙箱、血缘审计补课，客户侧已有具身智能、车企、物业把Agent推进生产线。文章拆解变化机制、二阶影响与可观察指标。</description></item><item><title>湖仓交棒Agent：Paimon生态补齐技术课后，语义层成了最后也最贵的一公里</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-24-yunqi2026-omnimodal-agentic-lake/</link><pubDate>Thu, 24 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-24-yunqi2026-omnimodal-agentic-lake/</guid><description>云栖大会2026「全模态Agentic Lake论坛」上，阿里云把数据平台的使用权交给Agent：Fluss毕业成Apache顶级项目、Paimon 2.0把多模态与向量索引装进同一张表、EMR与DataWorks补齐具身数据处理与语义图谱。但沃尔玛、博西、聚好看、骏伯、孩子王五家企业的一线实践指向同一个瓶颈——引擎早已智能体就绪，业务语义没人替你建，而数据错误在AI全自动执行下从报表瑕疵变成真金白银的损失。</description></item><item><title>onPanda: 通过 Token 级纠错高效标注 LLM 与 Agent 的同策略对齐数据 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-23-onpanda-paper-reading/</link><pubDate>Wed, 23 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-23-onpanda-paper-reading/</guid><description>onPanda（阶跃星辰 StepFun + 厦门大学）提出以 token 级纠错为核心的新型标注范式：标注者只需定位第一个不合适的 token，从模型候选集中点选或自由改写，系统随即截断后续内容并由模型从修正后的前缀继续生成（locate-correct-continue 循环）。该范式让绝大多数 token 由 rollout 模型原生生成，从而在低成本标注的同时高度保留同策略（on-policy）保真度，并自动产出可精细到位置的监督信号。本文按九部分结构精读其动机、系统设计、实验证据，并通过外部检索交叉验证标注效率、同策略数据价值与 RLHF 标注工具（Argilla/POTATO/Reptile）等相关工作。</description></item><item><title>RecreationWorld: Scalable and Verifiable Environments for Hybrid Computer-Use Agents 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-22-recreationworld-paper-reading/</link><pubDate>Tue, 22 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-22-recreationworld-paper-reading/</guid><description>RecreationWorld 由阿里巴巴 Token Hub 提出，围绕「应用复刻」构建五平台可验证环境，训练并评测能融合 GUI 探索与代码实现的混合计算机使用智能体(hybrid CUA)。本文梳理其背景、与 OSWorld/WebArena 的谱系定位、任务抽象、五平台+双通道测试生成+拒绝采样训练的解法、250 任务十模型评测与 OOD 迁移，并深究「为何满分复刻仅 2.8%」及优势根源。</description></item><item><title>统一智能体双璧：MintAct 空间统一与递归语言模型推理统一 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-22-unified-agent-duet-paper-reading/</link><pubDate>Tue, 22 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-22-unified-agent-duet-paper-reading/</guid><description>本篇合并精读两篇关于「统一智能体」的论文，二者分别从空间域与推理结构两个维度回答同一个问题：能否用一个模型替代一堆专用模型而不掉点？Apple 的 MintAct 用 2B/4B/8B 单一 VLM 统一 UI grounding、移动/桌面/网页/VTU 四域导航与视觉工具调用，靠四阶段训练（高分辨单步 SFT→低分辨多步均衡 SFT→每域 RL 专家拒绝采样蒸馏→联合异步 RL）与异步四机制（配额、背压、双裁剪、截断 IS）在 OSWorld-Verified 上以 48.9 同尺寸登顶。TTIC 的《Recursive Language Models Generalize Out of Domain》则从理论（MDL）与受控实验证明：递归模型用「隔离上下文栈」让 CoT 在分布内占到的「看得全」的便宜，在分布外变成致命捷径——mod-10 长度泛化上 RM 95.7% 对 CoT 6.2%。两文共同揭示：统一的代价不在模型容量，而在如何控制「每个子任务看到什么」。</description></item><item><title>ActionPiece 精读：用『物理秩一致性』拯救动作 tokenization 的关系保真</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-18-actionpiece-paper-reading/</link><pubDate>Fri, 18 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-18-actionpiece-paper-reading/</guid><description>华中科大×DeepCybo 等七机构联合提出 ActionPiece：自回归 VLA 模型的动作 tokenizer 传统上只用 MSE 评估重建精度，但点态误差小不等于关系保真——压缩后『不同情境所需的差异化动作』可能被压缩、扭曲甚至反转。论文提出 Physical Rank Consistency（PRC）度量局部物理距离排序的保持，并通过对表示学习与量化的联合监督（物理秩保持+量化正则）让离散 token 保留连续动作空间的局部序结构。同一 Qwen3-VL-4B 策略训练设置下：LIBERO 94.8%、未见 LIBERO-Plus 68.8%、SimplerEnv 71.9%。</description></item><item><title>One Skill Does Not Fit All: Automatic Discovery and Taxonomy-Guided Routing of Frame-Selection Skills for Long-Video Question Answering 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-15-autoskill-frame-selection-routing-paper-reading/</link><pubDate>Tue, 15 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-15-autoskill-frame-selection-routing-paper-reading/</guid><description>QMUL × Samsung AI 的产学研工作 AutoSkill：长视频 QA 中帧选择策略的有效性随问题语义类别剧烈变化，单一策略适配所有问题是错误假设。框架用 LLM agent 在小规模标注源池上迭代&amp;rsquo;提议-实现-评估-精炼&amp;rsquo;可执行帧选择技能，对目标 benchmark 仅用未标注的问题+选项文本归纳语义分类树，做&amp;rsquo;类别→技能&amp;rsquo;路由——零目标域标注，平均超 Qwen2.5-VL-7B 与 Qwen3.5-4B 基线 2.4%/1.2%。</description></item><item><title>Image Tokenizers as Visual Languages 精读：统一多模态 tokenizer 的测量学</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-13-image-tokenizers-visual-languages-paper-reading/</link><pubDate>Sun, 13 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-13-image-tokenizers-visual-languages-paper-reading/</guid><description>Amazon FAR×UW 构建受控纯自回归测试台，在多模态持续预训练中追踪任务分账验证损失（文本/图像/T2I/I2T 四路）的 scaling 行为，系统刻画统一模型中图像 tokenizer 的行为。两条核心发现：损失必须分任务分析（不同任务呈不同 scaling 且对 tokenizer 排名不同）；T2I 损失-性能关系随图像 token 空间漂移，I2T 损失在共享文本词表上计算、是更稳的跨 tokenizer 比较指标。</description></item><item><title>SpatialBlock 精读：合成积木课程与对照组设计的空间智能范式</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-13-spatialblock-synthetic-spatial-paper-reading/</link><pubDate>Sun, 13 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-13-spatialblock-synthetic-spatial-paper-reading/</guid><description>KAIST×AITRICS 借鉴儿童认知发展，用 15,000 道合成积木堆叠题（3D→2D 投影/视角变换/结构组合 + 对照组设计）训练 LVLM 空间智能：Qwen3-VL-4B 提升 25.1% 达 51.3% 开源最佳，7B 提升 17.6%，InternVL3 同样提升。对照组题目隔离语言捷径，渲染即真值消除标注噪声——数据质量根源性优于真实场景标注方案。</description></item><item><title>World in World 精读：免训练控制视频世界模型的统一证据接口</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-13-world-in-world-training-free-control-paper-reading/</link><pubDate>Sun, 13 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-13-world-in-world-training-free-control-paper-reading/</guid><description>西湖大学 AGI Lab 提出 World in World：training-free 推理时接口，把四类异构控制证据（源视频观测/目标视角投影/几何渲染/检索生成态）统一转为带相机与时间标注的干净视觉状态，经冻结视频世界模型的原生 self-attention 读入；对应路由器建立 token 对应关系，证据级 attention CFG（EWA）按通道独立调权。同一冻结骨干完成相机控制重渲染/长时程回访/人体动作迁移，重渲染全指标超 ReCamMaster 等训练方法（CLIP-Sim 92.5 vs 83.8）。</description></item><item><title>Gander (Omni Interaction Agent Technical Report) 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-10-gander-omni-interaction-agent-paper-reading/</link><pubDate>Thu, 10 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-10-gander-omni-interaction-agent-paper-reading/</guid><description>腾讯混元语音与浙大等团队的 Gander 用&amp;rsquo;小脑-大脑&amp;rsquo;协作框架统一了全双工实时交互与长程 Agent 执行：9B 小脑以 Thinker-Talker 流式架构逐秒 chunk 决策听/说/打断，大脑免训练接入 Codex/Claude Code 执行长任务，编排运行时以 task_start/send/resolve 结构化调用衔接。Full-Duplex-Bench v3 上 turn-taking 100% 全场最佳、过早打断仅 8.0%（GPT-Realtime 13.5%）；SpokenQA 全双工组第一。模型、代码、数据全部开源。</description></item><item><title>Beyond Retrieval: Progressive Latent Memory Evolution for Streaming Video Understanding 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-07-latentstream-progressive-latent-memory-paper-reading/</link><pubDate>Mon, 07 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-07-latentstream-progressive-latent-memory-paper-reading/</guid><description>流式视频理解的主流范式是&amp;rsquo;存历史、按需检索&amp;rsquo;，但外部证据永远只是临时上下文。南京理工×蚂蚁×NUS×港中文的 LatentStream 把范式翻转为&amp;rsquo;检索并内化&amp;rsquo;：分层流记忆 + 渐进扩张感受野的 latent token 把历史证据固化进固定长度潜记忆，用熵构造的渐进置信奖励在测试时联合优化。OVO-Bench 64.2%、StreamingBench 76.9%、MLVU +6.1，全部 SOTA。</description></item><item><title>LatentPress: Context Compression Beyond Text and Vision 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-07-latentpress-soft-token-context-compression-paper-reading/</link><pubDate>Mon, 07 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-07-latentpress-soft-token-context-compression-paper-reading/</guid><description>压缩后的上下文通常仍以文本或图像这两种&amp;rsquo;给人看&amp;rsquo;的形式存在。LatentPress 提出第三种表示：小型 writer 把对话/文档直接写成连续记忆 token，冻结解码器经输入嵌入接口读取，推理时零文本重建。LongMemEval 上 7.7× 压缩反而比未压缩证据更准（0.504 vs 0.490），写入 43ms 比摘要快一个量级——机器原生的记忆表示从此有了实证立足点。</description></item><item><title>AdaThinking-E: One-Token Entropy Regulation for Adaptive Thinking 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-31-adathinking-e-paper-reading/</link><pubDate>Mon, 31 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-31-adathinking-e-paper-reading/</guid><description>美团联合上海交大、中科院自动化所提出 AdaThinking-E，用一个 token 的熵调节教会文档理解多模态大模型自主决定何时深度思考。该方法把模式切换 token 与回答 token 分开优化，前者用熵奖励驱动从高熵探索到低熵决策的课程式过渡，后者只关心答案质量，从而避免了 GRPO/DAPO 训练中模式坍缩为全不思考的通病。在 8 个文档基准上，7B 模型以 27% 的思考率追平 SOTA 自适应思考模型 82% 思考率的效果，OCR-Reasoning 相对基座提升 10.8 个百分点，实现了该想才想、不该想不想的效率与精度兼得。</description></item><item><title>Code as Worlds: Agentic Discovery of Executable World Representations for Physical Reasoning 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-31-code-as-worlds-paper-reading/</link><pubDate>Mon, 31 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-31-code-as-worlds-paper-reading/</guid><description>深度精读 MirroS 联合清华、北大、南洋理工的技术报告 Code as Worlds。论文提出用可执行代码表示物理世界的组成、演化与外观（EWR 三元组），把&amp;rsquo;从观测恢复世界表示&amp;rsquo;建模为溯因式的 agent 发现环：提出-实例化-执行-渲染-验证迭代修正。再用验证过的世界免费生成带精确物理量标签的 VQA 数据训练 VLM，9B 模型在 QuantiPhy 上 55.4 分超过 Gemini-3.1 Flash 的 54.8，27B 推理变体 58.6 分超过全部基线。</description></item><item><title>GameWAM: A World Action Model for Video Games 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-31-gamewam-paper-reading/</link><pubDate>Mon, 31 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-31-gamewam-paper-reading/</guid><description>复旦、腾讯光子与清华深圳研究生院团队提出 GameWAM，首个面向电子游戏原生键鼠闭环控制（游戏玩法+GUI）的世界-动作模型。它用并行 Video-DiT 与 Action-DiT 做块因果联合流匹配，同时生成未来视觉观测与可执行动作；用每步动作路由器区分 gameplay/GUI 两种控制分布，用预测长执行短的块周期控制解耦规划与承诺，用分层历史压缩维持长时程记忆。在 Minecraft MCU 上平均成功率 50.7（次优 36.8）且执行步数全面最少，零样本迁移 VoxeLibre 达 59.2%。论文还发现并命名了 LASI 失效模式：采样动作源的低频分量会系统性牵引生成相机运动，复用可致原地旋转。整篇论文训练仅 2.79B token，是 Game-TARS 配方的 1/200。</description></item><item><title>VFA: Empowering Multilingual MLLMs via Vision-Free Adaptation 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-31-vfa-multilingual-paper-reading/</link><pubDate>Mon, 31 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-31-vfa-multilingual-paper-reading/</guid><description>南方科技大学、微软亚洲研究院、上海财经大学与北京大学团队提出 VFA（Vision-Free Adaptation），在不使用任何图文对数据的前提下增强多模态大模型的多语言能力。核心思路是把微调看作任务向量：在共享 LLM 底座上用 10 万条纯文本多语言数据微调基座 LLM 得到多语言任务向量，再用 WA/TA/TIES 三种合并算子注入到视觉对齐的 MLLM 语言骨干中，视觉编码器与投影层完全冻结。五个 MLLM 上六大多语言多模态基准平均增益 +0.57 到 +10.64，文化视觉推理 MaRVL 增益最大（Idefics3 +36.17），通用多模态能力持平或略升；而直接文本微调会让 Qwen2.5-VL 平均掉 11.92、MaRVL 从 53.50 崩到 0.00。VFA 仅用 Pangea 约 2% 的数据量达到 47.84 vs 50.34，训练成本约 10 A100 小时对 320 A100 小时，且框架可迁移到视觉编程等非多语言任务。</description></item><item><title>WeAgent-MMSearch: Native Text-Vision Interaction for Multimodal Search Agents 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-31-weagent-mmsearch-paper-reading/</link><pubDate>Mon, 31 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-31-weagent-mmsearch-paper-reading/</guid><description>多模态搜索智能体常被环境拖后腿：许多搜索环境只把网页转成文本喂给模型，工具返回的图片直接丢弃，号称多模态的轨迹实际退化成纯文本推理；长时程交互中的超时、超长输出、格式错误还会污染 RL 训练信号。腾讯微信 AI 与中山大学提出 WeAgent-Harness，把检索图像注册为可寻址的持久状态并跨轮回灌，配合失败感知的 FA-GSPO 训练算法与可诊断『检索失败还是感知失败』的 VisTarget-Bench，基于 30B 模型在 8 个基准上取得 55.97% 平均分，媲美约 10 倍参数量的前沿模型。本文按九部分结构精读其动机、机制、证据与可迁移灵感。</description></item><item><title>SpeechGym: An Audio-Native Gym for Training Voice Agents via Reinforcement Learning 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-29-speechgym-voice-agent-rl-paper-reading/</link><pubDate>Sat, 29 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-29-speechgym-voice-agent-rl-paper-reading/</guid><description>语音 Agent 必须完全通过语音完成工具调用与多轮对话，主流范式却在文本中训练。SpeechGym 在未修改的 τ²-bench 之上构建首个音频原生、多轮工具调用、可端到端 RL 训练的语音 Agent 环境：两个 Qwen3-Omni-30B 全模态模型以原生语音直接对话，工具接口保持文本以分离感知与行为错误。诊断发现文本到语音的落差主要源于感知缺陷——槽值误听率 32%，为文本通道的 16 倍；per-turn 过程奖励把携带梯度的组比例从 16% 提至 99.6%，破解 outcome-only GRPO 的梯度饥饿。训练后零调参迁移到独立实现的 τ-Voice 基准，pass@1 从 24% 升至 53%，开源 30B 模型升至排行榜第二、超过 GPT-Realtime-2，且轮数与 token 同步下降。</description></item><item><title>DeepChart: How Far are LLMs from Faithful Data-Science Chart Generation? 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-28-deepchart-faithful-charts-paper-reading/</link><pubDate>Fri, 28 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-28-deepchart-faithful-charts-paper-reading/</guid><description>深度精读中科大与华为的 DeepChart 基准：把数据科学图表生成形式化为 Extract–Reason–Visualize 管线，用 1482 条专家标注实例分阶段评估图表背后的数据路径。核心发现「隐藏幻觉」——提取与推理错误经渲染掩盖，外观评估完全不可见：多模态场景模型可执行率 0.782 但源数据保真 F1 仅 0.149；专有模型选 HTML 渲染优于 Python 却有 99.4% 的实例选了次优的 Python。</description></item><item><title>AWM: Answerable Working Memory for Long-Document VQA Agents 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-27-awm-workmemory-paper-reading/</link><pubDate>Thu, 27 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-27-awm-workmemory-paper-reading/</guid><description>深度精读 AWM 论文——Oslo 大学、Stuttgart 大学、HKUST(广州)、清华与 Bosch AI 中心合作提出的工作记忆质量评估与优化框架。论文发现：即便给了金标证据页，42.5% 答对的长文档 VQA 样本留下的工作记忆依然不足以独立支撑答案——现有评测存在「记忆质量盲区」。AWM-GRPO 用四格奖励把 memory-only answerability 信号注入 GRPO，同源受控对比下比 answer-only GRPO 再涨 2.3-2.7 点。本文拆解「答案对 ≠ 记忆对」的诊断设计、四格奖励的机制推演与蒙特卡洛验证，以及中间产物监督这一通用方法论。</description></item><item><title>MA-VLA: Multi-Arm Vision-Language-Action Model for Collaboration and Compositional Generalization 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-27-ma-vla-multiarm-paper-reading/</link><pubDate>Thu, 27 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-27-ma-vla-multiarm-paper-reading/</guid><description>大连理工牵头、联合牛津等七校提出 MA-VLA：面向多机械臂协作的组合泛化——测试时协作模式（角色/顺序/交互结构）训练中未见过，但原子动作全在分布内。方法三件套：VLM Planner 把高层指令分解为按时序的原子 prompt 分配到各臂、Pi0 执行器统一推断全臂动作、训练期 Arm Shuffle 置换各臂四元组打破身份绑定。OOD 协作中 Pi0/DP 基线全部归零，MA-VLA 达 13.0%；真机 SO101 上从全 0 到 10/20。「原子动作+角色洗牌」让语言成为主动协调通道。</description></item><item><title>V-Rubrics: Visual Faithfulness via Rubric-Based Reinforcement Learning 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-27-v-rubrics-visual-paper-reading/</link><pubDate>Thu, 27 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-27-v-rubrics-visual-paper-reading/</guid><description>南洋理工大学 S-Lab 联合 A*STAR、UIUC 提出 Visual Rubrics-Based RL：把视觉忠实性从「事后评测指标」转变为「细粒度 RL 训练信号」。方法将参考答案分解为视觉忠实性/推理一致性/指令遵循三维原子评分条目，构建 5 万例训练集，并用组件化+前缀局部化的优势分配改造 GRPO。在同 SFT 起点、同 RL 数据、同预算的受控对比下，比 answer-only GRPO 再提 1.79 分，增益集中于依赖接地中间推理的基准。</description></item><item><title>VBVR-Pro: A Scalable and Verifiable Suite for Native Visual Reasoning 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-27-vbvr-pro-paper-reading/</link><pubDate>Thu, 27 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-27-vbvr-pro-paper-reading/</guid><description>NTU 牵头、20 个机构 50 余位研究者共建的 VBVR-Pro，为「原生视觉推理」——把视觉生成当推理介质本身——建立了可训练、可验证、可优化、可受控比较的闭环测试床：300 个程序生成任务（347 万图+130 万视频）、100 个任务的确定性奖励评分器（人类对齐超 GPT-5.5 且完全可复现）、30+ 生成器受控比较。训练使 9 个开源模型平均 +0.29 并在 7 个外部基准迁移 +28 分级别；RLVR 优于 RLVLM；三面证据链证明「视觉轨迹比语言 CoT 更关键」是范式级发现。</description></item><item><title>VoiceMem: Streaming Dual-Brain Memory for Real-Time Interaction 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-27-voicemem-memory-paper-reading/</link><pubDate>Thu, 27 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-27-voicemem-memory-paper-reading/</guid><description>实时语音助手至今没有一套像样的记忆系统：文本 Agent 记忆动辄 top-100 检索、2–3 秒延迟，而语音对话只给得起 500 毫秒预算和 5 条记忆的空间。南洋理工、新加坡国立、清华、港中文联合团队的 VoiceMem 用「双脑」架构解题：左脑以 schema-entity 两级索引把候选池收窄到稠密子集，让 top-5 检索达到别家 top-100 的精度；右脑用独立/跨实体双节点分别建模稳定人格与情境情感；四阶段流式查询把检索藏进 VAD 静默窗——134ms 完成检索、零感知延迟。信息记忆均值 76.39 超最强基线 +10.6，token 省 4.4 倍；还贡献了 53 小时音频的 ChatMem-Bench 与首批带显式记忆访问的语音语言模型。</description></item><item><title>Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-05-video-deep-research-paper-reading/</link><pubDate>Wed, 05 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-05-video-deep-research-paper-reading/</guid><description>上海 AI Lab 等机构联合提出 Video-DeepResearch（Video-DR），把多模态 Deep Research Agent 从静态图像推进到连续视频流。论文诊断出当前 Agent 的两大顽疾——模态偏见（回避视觉工具转向文本搜索）与参数知识泄露（靠内部记忆蒙答案而非真正调用工具），并设计解耦感知-探索流水线 + 阶段式工具解锁 + SFT+GRPO 两阶段训练予以破解。其 35B-A3B 模型以 64.0% 平均准确率刷新 VideoDR-Bench SOTA，超越 Claude-4.5-Sonnet 5.0 分、GPT-5 11.5 分；30B 变体也追平 Claude-4.5-Sonnet。本文从机制因果层面解释：为何一个激活参数仅 3B 的模型能在视频 Deep Research 任务上反超数十倍体量的顶级闭源模型。</description></item><item><title>Mental World Modeling 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-03-mental-world-modeling-paper-reading/</link><pubDate>Mon, 03 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-03-mental-world-modeling-paper-reading/</guid><description>世界模型已经能很好地预测物理场景将如何演化，但它常常预测错人类会做什么——因为人不是被物理推动的，而是被自己的信念、目标、情绪和社会规范推动的。本文提出 Mental World Modeling（MWM）框架，把心理变量从&amp;rsquo;事后解释&amp;rsquo;提升为世界状态的&amp;rsquo;一等公民&amp;rsquo;，并用一个无需训练的六阶段基线 MENTIS 验证：在 448 条情境决策数据上，显式建模心智让 8 个大模型的决策预测 F1 平均提升到 87.9%，而删掉心智通道会掉 12.1 分，最大瓶颈是&amp;rsquo;耦合世界状态如何转移&amp;rsquo;。本精读按九部分结构展开，从&amp;rsquo;世界模型是什么&amp;rsquo;讲起，逐层拆解 MWM 的形式化、MENTIS 流水线、评估设计与瓶颈归因。</description></item></channel></rss>