MA-VLA: Multi-Arm Vision-Language-Action Model for Collaboration and Compositional Generalization 精读

大连理工牵头、联合牛津等七校提出 MA-VLA:面向多机械臂协作的组合泛化——测试时协作模式(角色/顺序/交互结构)训练中未见过,但原子动作全在分布内。方法三件套:VLM Planner 把高层指令分解为按时序的原子 prompt 分配到各臂、Pi0 执行器统一推断全臂动作、训练期 Arm Shuffle 置换各臂四元组打破身份绑定。OOD 协作中 Pi0/DP 基线全部归零,MA-VLA 达 13.0%;真机 SO101 上从全 0 到 10/20。「原子动作+角色洗牌」让语言成为主动协调通道。

August 27, 2026 · 3 min

MemUse: Moving Memory Evaluation from Direct QA to Natural Integration in Long-Term Human-AI Conversation 精读

对话式 LLM 的记忆系统一直用“直接问答“评测:问模型能否回忆先前对话里的事实 X。京都大学团队做了 4 个月真实部署(40 用户、1872 会话、7 种记忆条件)检验这个假设——Direct QA 准确率随容量从 19.7% 涨到 70.1%,用户满意度却纹丝不动。他们从中检出 72 个用户主动引用记忆的真实时刻,构建 MEMUSE 基准,用“自然整合“(回复是否真正织入被引用的记忆)替代召回评测:同一模型同一上下文,Direct QA 78.8% vs 自然整合仅 7.9%,71 分鸿沟;且只有自然整合与满意度相关(ρ=+0.29),Direct QA 完全不相关。Two-step 消融把瓶颈定位于对话生成层而非检索层——即使提取步骤已给出正确细节,生成仍有 77% 不使用。

August 27, 2026 · 3 min

Meta^n: Recursive Self-Improvement through Emergent Depth 精读

Meta^n(明尼苏达大学 × 首尔国立大学)针对自我改进系统『实现元深度只有约 2』的天花板,提出固定元操作 Ω 对自身输入递归:Ω 读下层栈的全任务执行轨迹+产生它们的代码栈,写出下一层(策略性预处理器+可调用辅助函数库),深度由收敛决定而非预先设定,进化档案在层链空间搜索。8 个基准族 × 2 骨干上至少一个估计器全面领先先前自改进 agent,ARC-AGI-2 held-out 上唯一非零(0.331 vs OpenEvolve 0.003);消融显示递归本身贡献 +0.131,其中层间条件化占约 72%;深度角色自发涌现——回滚角色在深度 2 恰为零、深度 3 出现 55%。

August 27, 2026 · 3 min

Narcissus: Program Synthesis Using Context-Aware LLM Approximations 精读

代尔夫特理工大学团队提出 Narcissus:当任务固定目标语言(CFG 定义的 DSL)时,LLM 提案通常违反语法或不满足规格——与其反复重提示,不如把提案一次性编译成「上下文感知」的搜索启发式。它将提案解析修复为语法树,用前缀对齐(相同上下文的提案是否用了同一规则)、子程序复用(提案反复出现的片段)与正则化(提案指示的程序规模+保底项)三个信号给每次扩展打分,搜索期间零 LLM 调用。在五个域、两种搜索后端上,Narcissus 在每个预算下击败静态先验:SLIA-70 上 51.4 对 32.2,ARC-100 上解决 40% 而原始提案仅 13%,到达提案区域快约 12 倍;DeepSeek 弱提案加搜索甚至超过 GPT-4o 直接采样。正则化保底项保证任何规则不被剪枝——错误提案只会延迟解、不会藏死解。

August 27, 2026 · 4 min

Ockhamareto: Pareto-Gated Segment-Level Credit Assignment for Concise Unit-Test Generation with Reinforcement Learning 精读

深度精读 NUS+UCL+KCL+港科大广州(25 Aug 2026)论文 Ockhamareto:用「帕累托门控奖励 + token 级分段信用」把单元测试生成从「堆数量」转向「讲效率」,单次生成 2.60 个测试拿下 49.9% 突变分数,比最强 RL 基线 MIST-RL 多抓 18.6 个百分点的 bug 且少用 44% 的测试,4B 模型反超未调优 27B。本文解析其双机制因果链、五基准实验证据与「每个函数该维护几个测试」的帕累托前沿分析。

August 27, 2026 · 6 min

On-policy Distillation with Verifiable Reward 精读

清华LeapLab提出的OPDVR用一道极简的ReLU门,把On-policy蒸馏的隐式奖励按轨迹正确性重新定号,使蒸馏信号永远不与验证器方向打架。理论上证明OPDVR恰好等于OPD去掉与验证器冲突的梯度分量,实验上同架构蒸馏6个数学基准平均49.1超过OPD的47.8,甚至反超教师;GRPD变体在AIME25上比GRPO高出10.9分。本文从RLVR与OPD互补困境讲起,逐层拆解门控机制的数学构造、约半数token被门控的动态证据与逆向门控消融的因果链。

August 27, 2026 · 2 min

Parason: Revealing Subtask- and Trial Parallelism in LLM Reasoning 精读

清华、MIT与NVIDIA合作的Parason瞄准推理模型的延迟瓶颈:自回归解码把整条推理链串行执行,难题要等数小时甚至数天。论文首先提出推理并行性的语义分类——Subtask并行(AND分支,分而治之)与Trial并行(OR分支,多路试探),并测量发现Trial并行占了可并行推理计算的多数(DeepSeek-V4在HLE上65.5%),而此前系统几乎只利用了前者。Parason用上下文无关文法把串行推理轨迹改写成引擎可解析的并行结构,配合PA-GRPO多目标奖励(正确性+关键路径延迟+两类并行比例)训练,经SGLang真实执行。AIME24/25等基准上平均加速约1.7×,8k token延迟预算下用25%预算匹配全额性能。

August 27, 2026 · 2 min

Praxist: From Experimental Artifacts to Solution Lineages 精读

自主 R&D Agent 已经会写代码、跑实验、改工件,但多数系统把每次尝试当作近乎独立的事件——日志记下了「发生了什么」,却没建立「哪个设计元素带来了提升、证据是否经受住验证、如何与其他元素重组」。长周期研究于是反复重学同样的教训。Sapient Intelligence 联合南洋理工、清华、CMU、UPenn 的 PRAXIST 提出「证据继承」:把可复现工件与评估结果转化为类型化的发现(正/负/诊断/不确定/程序性)、四车道 frontier(confirmed/candidate/diagnostic/validation)与世代议程,失败与诊断成为一等证据。MLE-bench 全 75 题拿下 60 枚奖牌(49 金),花费 3,054 美元——约为 Claude Code+Opus 4.8 基线(38,370 美元、55 枚、34 金)的十二分之一;火箭着陆案例从 4.03% 起步做到 12,288/12,288 满分。

August 27, 2026 · 4 min

Prefix Sliding for efficient test-time scaling 精读

斯坦福、华盛顿大学联合 Prime Intellect 等机构提出 Prefix Sliding:推理时只保留前缀(系统指令+prompt,充当注意力锚点)+ 最近数千 token 滑动窗口,丢弃中间推理 token。基于「中间 token 完成子任务后即失去重要性」的注意力概率观察,免训练即可让现有模型提速 3 倍而性能不降;配合截断反向传播,RL 可训练 10 万 token 级长推理轨迹。方法极简但解决了「无限测试时扩展必须有界每 token 成本」这一根本问题。

August 27, 2026 · 4 min

Reading Is Not Using: Retrieval, Judgment, and the Design of AI Financial Research Workflows 精读

AI 金融分析师能从 10 万 token 的年报里逐字背出契约阈值,但这条风险披露真的影响它的投资判断吗?Boston College 与 Columbia 商学院团队用固定信息集设计发现:随着无关上下文从 2K 扩到 128K token,一条风险披露对卖出倾向的影响从 +0.032 跌入实验噪声地板,而直接检索保持 12/12 公司满分——“读到了“与“用上了“彻底分离。机制实验定位到两条传输通道:固定容量的运行摘要与注意力查找,均随长度稀释。工作流实验给出解法:extract-then-decide 把 128K 下的影响保留率从 12% 提到 67%,而通用分块摘要在所有长度(含 2K)都将影响归零。核心教训:检索式评估会认证一套“证明了读得到、实际上不用“的判断系统。

August 27, 2026 · 3 min