SimpleMemVLA:不做记忆模块的具身记忆——原生视频上下文的范式反转 精读

HUST×清华×面壁智能等推出 SimpleMemVLA:去掉检索/压缩/循环等专门记忆模块,把完整采样历史以时间戳视频格式直接喂给 VLM 主干,子任务隐藏状态作为唯一记忆通道。四个记忆基准全部 SOTA(RoboMME 88.3% vs 检索 31.5%/压缩 22.6%/循环 20.6%,真值感知上限也仅 84.1%),通用控制无损(LIBERO 97.5%),因果干预证实策略真实读取历史。

September 9, 2026 · 2 min

Split-LLM 隐私失效审计:返回梯度的零模式完美暴露真实数据 精读

独立研究者对两节点 split-LLM 训练的预注册审计:隐私损失忽略诱饵行→其返回梯度恰好为零→零模式逐帧完美暴露真实数据(9 种子 4096/4096 全中)。所有运行通过前向隐私检查与质量检查,加上返回梯度后同检查失败。逐行裁剪+加噪以 0.01 nats 代价封堵,并诚实声明五类未测攻击面。

September 9, 2026 · 2 min

TGOPD:在策略蒸馏前先验证教师——提示级可靠性门控 精读

AllSpark 团队推出 TGOPD:对每个提示用少量验证器打分的教师探针估计可靠性,通过门控路由密集 OPD 信号或验证器锚定的 GRPO。4B/35B 两尺度三域 6/6 设置全部超过 Vanilla OPD,35B LiveCodeBench 64.0(其他蒸馏方法全部负迁移),探针填充教师空闲算力使 GPU 利用率 9.8%→78.9%。

September 9, 2026 · 2 min

Uno:扩散增强 LLM 的无损加速范式——AR 与扩散在同一架构内的参数解耦 精读

MBZUAI×Cerebras 等推出 Uno:在同一 Transformer 内解耦 AR 权重(质量)与 rank-128 LoRA 扩散适配器(速度),冻结 AR 后仅用 7B token 做块级单步扩散蒸馏,配合 Ψ-Spec 采样器做 AR 验证的拒绝采样,实现严格无损、全 batch 区间保持的至高 3× 加速。8B 模型 SWE-bench Verified 68.4%,系统吞吐 5733 toks/s 全面超越 EAGLE-3/DFlash 与闭源 Mercury 2。

September 9, 2026 · 3 min

Bilevel Coordinated Reflection: 多智能体 LLM 系统的博弈论统一理论 精读

UCL×利物浦×华为的 BCR 把 orchestrator–worker 多智能体系统建模为双层协调博弈,证明 follower 子游戏是近似势博弈,并首次给出’只看文本的门控不可能可靠’的信息论不可能性定理。据此提出的 SRMA 仅在环境验证风险严格下降时接受候选记忆,SWE-bench 500 实例解决率 72.2%(免费反思仅 58.4%)。本文精读其双层博弈建模、漂移分析、不可能性定理与 SWE-bench 端到端验证的完整因果链。

September 8, 2026 · 2 min

CoSkill: 把元技能变成可学习智能体 — 分层技能库的联合强化学习 精读

中科院自动化所×人大的 CoSkill 把静态元技能工作流重构为可学习的 Meta-Skill Agent,与 Reasoning Agent 共享单骨干联合 RL:推理智能体条件于检索到的任务技能与子技能,任务表现反向指导元技能精炼。ALFWorld 98.4%(+3.5pp)、WebShop 90.6%(+6.2pp),样本效率与墙钟效率全面占优。本文精读’技能从被动对象到主动协作者’的范式转变。

September 8, 2026 · 2 min

EvoHarnessBench: 智能体能跟上不断进化的 Harness 吗 精读

Salesforce Research×UNC Chapel Hill×UW–Madison 的 EvoHarnessBench 把非平稳性从任务流转移到 harness 本身:17 条受控 harness 进化流(802 任务、520 工具、42 技能、62 智能体),分部署评估(能力保持)与自进化适应两设定。基准回答一个此前无人系统提问的问题:当工具、技能、子智能体持续增加时,已部署 agent 的既有能力何去何从。

September 8, 2026 · 2 min

Extremely Sparse Supervision: 0.05% 的 token 监督就能激励推理 精读

Amazon×Duke 在 on-policy 蒸馏设定下发现反直觉现象:每条推理轨迹仅监督 1–2 个关键 token(占全部生成 token 的 0.05%)即可匹配甚至超越全 token 训练的推理激励,跨 9 组师生配置、PPO-RLVR 与 Llama 模型一致成立。本文精读这一’有效学习不需要 token 密集’的证据链及其对后训练范式的改写意义。

September 8, 2026 · 2 min

HackProbe: 自进化语言模型的奖励黑客检测与免疫 精读

Fullive-AI×北大×京东×NTU×武大的 HackProbe 是一个通过两个黑盒钩子挂载到任意自进化回路的监控器:秘密固定分布对比核心保证跨代可比,轮换新鲜层抗共适应;四项检验+Šidak 校正输出族校准 p 值,风险感知免疫层从候选池重选诚实更新。本文精读’诊断之外还能恢复’的奖励黑客治理闭环。

September 8, 2026 · 2 min

InterOPT/OR-Clarify: 运筹学建模中'何时该问'的选择性完备性决策 精读

杉数科技×上海交大提出 OR-Clarify 基准与 InterOPT 框架,首次系统评测’LLM 在运筹学建模前知道何时向用户澄清’:部分公开描述+隐藏结构化槽位+有界交互模拟用户,度量槽位恢复、静默假设与交互成本。InterOPT 用 Dynamic Gap Search 识别规格关键缺口,choice-based 设定下 exact slot recovery 大幅超越全部基线。本文精读’澄清即决策’这一新问题定义。

September 8, 2026 · 1 min