MASS:用权威共享状态解耦多智能体世界模型——多人游戏架构如何破解视频世界模型的可扩展性瓶颈
MASS 借鉴在线游戏的权威服务器架构,将多人世界模型分解为推进权威类型化状态的 Logic Engine 与按需生成视角的 Rendering Engine,在匹配 Snake 基准上取得 0.764 的状态恢复(最强视频基线仅 0.128),并支持 1,024 个并发玩家、10,000 个循环 tick 的结构稳定预测。
MASS 借鉴在线游戏的权威服务器架构,将多人世界模型分解为推进权威类型化状态的 Logic Engine 与按需生成视角的 Rendering Engine,在匹配 Snake 基准上取得 0.764 的状态恢复(最强视频基线仅 0.128),并支持 1,024 个并发玩家、10,000 个循环 tick 的结构稳定预测。
深度精读《From Economic Agents to Agentic Economies: A Systems Blueprint for Economic World Models》,解析香港中文大学(深圳)、香港大学、南洋理工联合团队提出的经济世界模型(EWM)系统蓝图,详解六级能力阶梯 L1–L6、四大核心架构模块、五算子状态转移形式化,以及 737 篇文献揭示的研究空白。
CalibForge用对抗性求解器校准构建终端任务数据,30B模型Terminal-Bench 2.0从7.87%提升到32.58%(+24.71pp);Activity Frames用零模型确定性编译将屏幕活动压缩86倍,1.7B学生匹配Opus 4.5前沿模型;When History Lies首次形式化历史轨迹’策略劫持’现象,Oracle-OPD使1.7B工具调用准确率从47%提升到87%。产业端:Claude Code默认Auto模式、谷歌布林接管Gemini重组AI领导层、菲尔兹奖得主加入OpenAI。
深度精读 arXiv:2608.05784——独立研究者 Nossa Iyamu 提出的 Activity Frames,一个零模型、确定性的屏幕活动编译管道。它将屏幕捕获流分割为携带应用、站点、时序、输入量和证据指针的『活动帧』,在 128,756 帧、51 活跃天的真实语料上把单日上下文从 126,812 token 压缩到 1,469 token(86×),编译延迟仅 68ms,下游问答准确率 98.4%(LLM 摘要仅 66-80%),幻觉率 0%。同一编译器还首次测量了代理成本模型假设但从未实测的两个参数:Routine Overhead Ratio R=60-343x 和可委托复发率 h=7.7%(样本外)。核心洞察:把『解释』从『测量』中剥离,用最无趣的确定性代码填补捕获与记忆之间的缝隙。
AgentOPSD 把 Agent 强化学习中长期被回避的’信用分配’难题重新拉回中心:在多轮交互、稀疏奖励的 Agent 任务里,GRPO 这类方法只能把最终成败均摊到每个动作上,导致长程任务里错误信号被稀释、优化方向被噪声淹没。本文提出一种无 critic 的递归自蒸馏方法——把教师(注入了成功技能 c+)与学生之间的 token 级对数概率差聚合为 turn 级证据,再在 log-odds 空间用类似贝叶斯更新的方式递归地累积成 turn 级信念 B_k,最后用 sigmoid 导数加权成有界优势重塑信号 Ã_k。这一过程把’稀疏结果监督’转化为’每一步的密集信用’,在 ALFWorld 上把 Qwen2.5-7B 从 81.2% 抬到 89.1%(+7.9pp),长程任务每轮交互衰减仅 0.54 点(GRPO 衰减 2.91 点)。消融实验进一步证明:先验锚定贡献 -10.2pp 是最关键设计,贝叶斯方向(符号保持)次之 -8.6pp。
CalibForge 提出了一个自主终端任务合成系统,把求解器行为当作’构建时反馈’,通过多求解器校准和对比求解器校准两种对抗式策略,将候选任务反复修订到’可证明可解但又不被统一求解’的求解器相对可学习区间。基于 5,431 个校准任务蒸馏 SFT 后,Qwen3-30B-A3B 在 Terminal-Bench 2.0 从 7.87% 跃升到 32.58%,并在 SWE-bench Pro、Doc2Repo 两个分布外基准上同步取得 +27.68、+30.04 个百分点的迁移提升。本文从终端任务与可学习区间讲起,逐层拆解对抗式作者-求解器循环、轨迹反馈的三类修订模式,并从第一性原理分析’为何校准优于单求解器反馈’。
蚂蚁集团与上海交通大学联合提出 EnvACE,让一个策略同时扮演「行动者」和「环境」两个角色:Acting 角色生成工具调用,Rehearsal 角色生成对应的环境响应,两个角色共享参数端到端联合优化。训练时完全不需要外部环境交互,却能在 BFCL-v4、τ²-Bench、VitaBench 三个 Agent 基准上全面超越依赖真实环境的 baseline,综合得分 32.91% 超过 14B 参数的 AWM。更精彩的是,模型内化出的「世界模型」还能在推理时用于 Test-Time Scaling,在提交执行前先在内部排练验证,把 Overall 推到 40.9%。本文从机制层面解释「世界排练为何比真实环境更高效」,并提炼出三条可迁移到其他领域的通用灵感。
深度精读港大与腾讯联合出品的 OSReward——首个系统检验计算机使用 Agent(CUA)轨迹评判器可靠性的基准与开源奖励模型工作。论文构建了覆盖 Web/Windows/macOS/Ubuntu/Mobile 五大平台的 1,019 条人工标注轨迹基准,揭示了所有主流 VLM 评判器存在的系统性「宽容偏差」,并训练出成本降低 30-60 倍的开源奖励模型 OS-Shepherd。本精读从背景补全、研究脉络定位、问题抽象、方法机制、评估证据、效果根源、必要知识反推到可推广灵感,九部分完整拆解这项为 CUA 评判建立标准化评估体系的开创性研究。
深度精读论文《When History Lies》——首次形式化『历史诱导的策略劫持』现象:结构有效、语义合理的历史轨迹仍可劫持 Agent 已有的正确策略,在 Qwen3-1.7B 上翻转 32.1% 的正确决策。论文提出 ContextPollute-Bench(同步三视图 Original/Polluted/Oracle State,十一类干扰算子)与 Oracle-OPD 方法(基于 Oracle State 的教师通过反向 KL 在策略蒸馏迁移到仅观察污染历史的学生),将 1.7B 模型的 BTA 从 47.2% 提升至 87.0%,8B 教师蒸馏后达 91.9%,并迁移到干净历史、未见工具与噪声多跳 QA。
深度精读浙江大学 VaG(Verifier-as-Gatekeeper)论文——首个正面刻画「自进化 Agent 中能力-污染相变」现象的工作。论文首次形式化了「技能池超过临界规模后新增技能反而降低性能」的非单调相变,并从数学上证明污染链具有结构不可逆性:有缺陷技能进入决策上下文后,其后代继承缺陷推理却从不引用原始缺陷源,导致事后回滚恢复率仅17%。VaG 采用「渐进信任层次 + 异构验证器检查不相交属性」的三级前commit门控(SchemaCritic 结构检查 / ExecCritic held-out重放 / AgentCritic 语义审查),配合边际增益贪心子集选择移除组合污染,在 Terminal-Bench 2 上以仅37个技能达到72% pass@1(Ungated崩溃至50%),技能池缩小近5倍,并在跨模型、跨基准迁移上全面领先。本文从背景、关联工作、问题抽象、三级门控解法、实验证据到不可逆性根源解释,完整拆解这一「前commit优于事后修复」的开创性研究,并提炼出可推广的系统安全设计灵感。