Memory as Plans 精读:把记忆从执行期条件重构为规划期证据,机器人非马尔可夫任务 SOTA

哈工大×NTU×山大提出 MaP-WAM:将记忆依赖的世界-动作建模拆解为记忆锚定规划与计划条件执行两层——情景区段记忆作为规划期证据,因果世界模型(WAN-2.2-5B 微调)生成视觉计划,World-Action-Progress 模型把任务进度升级为一等模态。RMBench 83.3% SOTA、真机 78.0%,执行器延迟随历史增长恒定;Swap T/Press Button 达 96%。

September 13, 2026 · 1 min

MetroLLM-Bench 精读:LLM 嵌入物理售票机,4B PEFT 学生超越 GPT-5.6 的容量-天花板曲线

Continker 发布 955 案例 × 6 真实地铁系统的 LLM 售票机策略层基准:模型须调结构化工具并提交机器可渲染终端状态,双层评分栈(14 确定性组件 + 8 语义组件)经双人标注校准。核心发现:4B Qwen3.5 学生 PEFT 后 Tier1 91.3 超 GPT-5.6 两档(90.6/90.0)匹配 GPT-5.4 满推理;PEFT 增益随基座规模单调衰减(2B +7.03 → 27B -0.91),给小模型蒸馏划出容量-天花板曲线。

September 13, 2026 · 1 min

Nemotron IMO Gold 精读:开源模型金牌的完整配方——自然语言证明生成与测试时搜索管线

NVIDIA 公开 IMO 2026 金牌系统全部配方:Nemotron 3 Ultra 基座上 SFT+RL 两个专精 checkpoint,加验证器/评分器构成生成-验证-精炼迭代搜索与高算力终选,全程纯自然语言(无形式化证明器/外部工具/互联网),得分 30/42 达金牌线。全套 artifact 开源:两个 checkpoint、SFT/RL 训练数据、训练与推理代码、提交的证明、Nemotron-IMO-Bench(200 道新题)。同日 25 位菲尔兹奖得主联合声明使本文的伦理语境格外微妙。

September 13, 2026 · 1 min

Recursive Code World Models 精读:global-local-global 递归构造可执行 3D 世界

佐治亚理工提出 RCWM:从单张参考图重建复杂 3D 世界为可执行场景代码。核心是递归场景程序(RSP)表示 + 自递归构造求解器——每次调用遵循建立整体→递归重建未解部分→回访整体精炼组合的 global-local-global 循环,参考对齐视图跨层级传播共享相机投影,父级回访修正局部精炼后浮现的边界错误。三级递归较固定二级 whole-frame PSNR 16.8→19.0、local SSIM 0.52→0.60,全面超越 image-to-scene-program 基线。

September 13, 2026 · 1 min

SpatialBlock 精读:合成积木课程与对照组设计的空间智能范式

KAIST×AITRICS 借鉴儿童认知发展,用 15,000 道合成积木堆叠题(3D→2D 投影/视角变换/结构组合 + 对照组设计)训练 LVLM 空间智能:Qwen3-VL-4B 提升 25.1% 达 51.3% 开源最佳,7B 提升 17.6%,InternVL3 同样提升。对照组题目隔离语言捷径,渲染即真值消除标注噪声——数据质量根源性优于真实场景标注方案。

September 13, 2026 · 1 min

World in World 精读:免训练控制视频世界模型的统一证据接口

西湖大学 AGI Lab 提出 World in World:training-free 推理时接口,把四类异构控制证据(源视频观测/目标视角投影/几何渲染/检索生成态)统一转为带相机与时间标注的干净视觉状态,经冻结视频世界模型的原生 self-attention 读入;对应路由器建立 token 对应关系,证据级 attention CFG(EWA)按通道独立调权。同一冻结骨干完成相机控制重渲染/长时程回访/人体动作迁移,重渲染全指标超 ReCamMaster 等训练方法(CLIP-Sim 92.5 vs 83.8)。

September 13, 2026 · 1 min

X-AuT 精读:渐进剪枝+跨尺度蒸馏的语音编码器压缩,18→16 层错误率不降反升

小鹏汽车提出 X-AuT:短行为探针选择可恢复的层组合,渐进式剪枝 Qwen3-ASR-0.6B 音频塔 18→16→14 层,表征对齐+跨尺度蒸馏(教师强制+计划学生策略)+LoRA 恢复,解码器骨干全程冻结。18→16 层宏平均错误率 5.61%→5.27%(不降反升);14 层 5.75%、参数 -20.7%、车载加速器延迟 -21.4%;渐进剪枝 5.75% vs 直接剪枝 6.73%。

September 13, 2026 · 1 min

A2ABreak 精读:把 A2A 协议规范编译成状态机之后,11 个新漏洞自己浮出水面

Purdue+UT Dallas(Elisa Bertino 组)对 Linux 基金会 A2A 协议做首个系统性安全分析:NL 规范→验证 FSM→受限 LLM 推理+对抗验证的三阶段框架。FSM 构建在 TCP ground-truth 上恢复 11/11 状态、19/20 转移(F1 0.84);在“攻击者完全合规”假设下发现 11 个新漏洞——跨客户端上下文注入、委托链多跳身份丢失凭证收割等,全部无需实现缺陷。

September 12, 2026 · 1 min

EvoSafeHarness 精读:Agent 安全没有万能线束,那就让线束自己进化

JHU/UC Berkeley/NVIDIA/UIUC/UW-Madison 五机构发布 EvoSafeHarness:为冻结 LLM Agent 自动搜索’模型×领域’专用安全 harness,DecodingTrust-Agent 上 ASR 45.6%→10.0%(utility 仅损 3.3 分),AgentDojo 82.8% utility @ 0 ASR。核心洞察:模型变体决定 enforcement 强度、领域变体决定谓词与状态——universal 安全 harness 在结构上就不存在。

September 12, 2026 · 2 min

GenV 精读:把 Z3 等价性判定蒸馏成语言模型的“第六感”

CWRU×AWS(实习合作)提出 GenV:把离线 Z3 等价 oracle 蒸馏为 reference-free 的连续等价分,专治 autoformalization 中“表面合法但语义错位”的欺骗性轨迹。GenV+HN 在 VPU 检测上 F1 0.832(process RM 仅 0.246),logit lens/SAE 机制分析证明信号真实存在于残差流而非捷径。

September 12, 2026 · 1 min