MANTA: Multi-Agent Network Topology Adaptation for Self-Evolving Multi-Agent Systems 精读

MANTA首次将多Agent系统的通信拓扑从’部署前固定的设计选择’重新定义为’推理时可自我演化的系统变量’。通过拓扑规划器、轨迹审计器和技能反射器三个编排组件,MANTA在任务执行期间监控协作过程并应用有界结构修复——修改角色、通信链路、执行顺序和信息可见性。在五个基准上平均74.0分,超越最强baseline 5.8分,且总token消耗最低。论文揭示了’拓扑是自我改进的独立层次’这一新范式。

August 2, 2026 · 3 min

Meta AI Proactive Memory Agent:记忆教练精读

Meta AI提出主动记忆智能体架构,用独立的’记忆教练’智能体在固定间隔审查行动智能体的近期步骤,更新结构化记忆库(私有状态/知识记忆/程序记忆),并决定是否注入定向提醒。核心创新在于’何时提醒’的策略决策——选择性干预优于全量检索。Terminal-Bench从38%提升至46%,tau2-Bench从55%提升至62%,超越Mem0生产记忆层。

August 2, 2026 · 2 min

Perception-Correction Distillation:多模态推理器感知蒸馏信用分配精读

中科院自动化所Hongyu Lin团队提出PCD(Perception-Correction Distillation),用下游失败和师生分歧作为互补见证的贝叶斯证据组合,形成软AND门精准识别’可纠正的感知失败’。乘法是唯一在任一见证缺失时归零的归一化双线性门。8B→2B从OPD的44.50提升至47.28,32B→8B从56.94提升至61.22。

August 2, 2026 · 1 min

PhiZero: A World Model Built Around Physical Language 精读

PhiZero由中科院自动化所提出,通过自监督学习从野外视频中提取紧凑离散的’物理语言’表示世界状态转移,采用’先推理后渲染’范式:自回归VLM先推理物理语言序列,再由扩散解码器渲染为视频。4秒33帧视频仅需256个离散符号(比Wan2.2 VAE压缩175倍),在Physics-IQ、PhyGround、WorldModelBench、IntPhys2四个基准上物理一致性全面超越Sora 2、Cosmos3等。

August 2, 2026 · 2 min

ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow 精读

ShadowDancer提出影子对(shadow pairs)和跨影子预测(cross-shadow prediction),通过构造方式解决潜在动作模型的外观-动力学耦合问题。同一动力学轨迹在不同外观下重放,预测一个影子所需的表示必然是共享动力学本身。任何演示片段成为可复用动作资产,在新环境中重放无需动作标签、运动估计器或微调,跨五族动力学平均盲测胜率86%。论文揭示了’构造性不变量提取’的全新自监督范式。

August 2, 2026 · 3 min

SpatialCLI: Learning to Reason With Spatial Tools, Then Without Them 精读

SpatialCLI提出Call-Learn-Internalize三阶段框架,教VLM先用空间专家工具(定位/分割/深度/姿态)学会组合感知,再通过双视图训练将专家能力内化为无工具推理。8B模型内化后无工具达72.7%、带工具达91.3%,均超越GPT-5.6 Sol。论文揭示了’工具→RL→内化’的渐进式能力蒸馏新范式。

August 2, 2026 · 3 min

VideoCoCo: Code-as-CoT for Physically-Consistent Video Generation 精读

VideoCoCo由港中文Pheng-Ann Heng联合中国科学技术大学等26位作者提出,用可执行的Blender程序作为视频生成的过程级链式思维:编码智能体将文本提示合成为Blender代码,仿真引擎运行产生确定性时空草稿,生成式视频引擎通过草稿条件编辑转化为逼真视频。PhyGenBench从0.475提升至0.558,VBench-2.0从52.18提升至77.88。

August 2, 2026 · 2 min

β-OPSD: Deriving with Policy Optimization, Training with Self-Distillation 精读

β-OPSD揭示在线策略自蒸馏(OPSD)是KL正则化策略优化家族中β=1的特例,将β从隐式固定值变为可控参数后,最优策略变为参考策略与特权教师之间的几何插值。通过将RL推导的闭式解转化为蒸馏目标,用廉价的蒸馏近似昂贵的策略优化。Return-to-go信用分配纠正token级更新的短视性。在Qwen3-1.7B上数学推理平均提升5.74分,持续超越vanilla OPSD、SFT和GRPO。

August 2, 2026 · 2 min

LLMs Get Lost in Evolving User Intent 精读

本文精读 Microsoft Research 团队发表于 2026 年 7 月的论文《LLMs Get Lost in Evolving User Intent》。论文提出一个将任意静态单轮基准测试转化为动态多轮对话的框架,通过三种意图转移(论点揭示、论点修正、函数切换)模拟用户意图的真实演化过程,同时保留原始评估协议实现免标注的自动验证。跨数学、Text-to-SQL、搜索、编程四个领域的实验揭示了一个一致现象:在单轮设置下表现优异的模型,一旦用户意图动态演化,性能便大幅下降,最严重时直接归零。这一发现暴露了静态评估的盲区,对协作式 Agent 的未来发展具有关键启示。

August 1, 2026 · 5 min

RSIBench-Data: Benchmarking Data-Centric Research for Recursive Self-Improvement 精读

RSIBench-Data 是首个专门评估「LLM Agent 能否自动化数据中心化后训练研究」的受控基准。它固定训练/服务/评估基础设施,隔离 Agent 的研究决策能力。实验揭示了「发现-���靠性差距」:Agent 在 58.33% 的设置中能通过反馈迭代改进首次尝试,但在达到峰值后继续搜索时,78.26% 反而退化。强运行轨迹有四种模式:准确假设、验证信号、行为对齐数据、保留最佳检查点。

July 31, 2026 · 3 min