HARTS: Efficient Agentic Reinforcement Learning for Hybrid-Attention Models over Arbitrary Rollout Trees 精读

深度精读蚂蚁集团的 HARTS 训练系统。Agentic RL 的 rollout 呈不规则树状、轨迹共享长前缀,逐轨迹独立训练重复计算共享前缀(实测冗余约 5.63 倍);而现有树结构训练系统只支持全注意力模型。HARTS 首次在真实混合注意力模型(MLA+KDA 的 Ling-3.0-tiny)上实现任意 rollout 树的前缀共享:联合微批规划、线性时间的最少调用执行规划、可微状态交接与语义多重性恢复 RL/MoE 目标。实测前向/反向/梯度加速 4.81–4.87 倍,logit 余弦相似度大于 0.9997,在线训练奖励趋势与基线一致。

August 31, 2026 · 4 min

Logos: An Agent Harness on a Cross-Process Bus 精读

深度精读 Sussex、浙江工商大学与上海书缘信息技术合作的 Logos(AAMAS 2027)。针对单进程 agent 框架插件与会话共存一个进程的单点故障问题,论文用四个引理证明时空可组合性演算的可逆性保证可跨进程成立——可靠性不变量只定义在状态空间上,而模型推理是无状态的;再构建 ROS 风格跨进程 harness:插件即进程、路由器只存路由表、唯一共享状态是 append-only 转录。80 个会话在四个击杀点上全部冷切换恢复且零重复效应,总线跳 0.215ms 仅为首 token 的 1/823;同故障下单进程停机 547.1ms 中断全部会话,对等构造只影响一个节点。

August 31, 2026 · 4 min

LoopArena: Benchmarking Models as Runtime Controllers for Loop Engineering 精读

深度精读阿里 DreamX 团队联合北邮、UNSW Sydney 与 Data61 CSIRO 推出的 LoopArena:首个把『模型作为运行时循环控制者』的编排能力本身作为被评测对象的基准。它冻结 Worker 编码智能体与全部执行环境,只比较 Controller 模型在 advance/verify/stop 三类决策上的表现;Type I/II/III 三级成本递减设置使其可低成本诊断循环控制能力。关键发现:完整任务上最强 Controller(GPT-5.5)Strict Success Rate 仅 24.69%,机械重复目标的 fixed control 在全任务上与无控制持平(18.52%),证明有用的循环控制必须随运行状态自适应切换;Type II 切片评估平均省 64.4% 成本且与全任务排序高度一致(Spearman ρ=0.9747)。

August 31, 2026 · 5 min

Lost in Compression 精读:抽取式提示压缩器的跨语言审计

提示压缩号称能砍掉 LLM 推理成本,但主流学习型压缩器几乎全部用英语训练和评估。这篇来自 Hostinger 与考纳斯理工大学的论文做了一次严格的受控跨语言审计:在十种语言、五种文字系统的完全平行数据上,用目标模型分词器做预算匹配对照,超过 25.8 万次评估调用后发现迁移差距真实存在且随压缩强度急剧放大——保持率 0.33 时英语保留 57 至 62 个百分点的上下文价值,中文几乎归零。差距由监督语言而非模型架构驱动:三种英语训练的压缩器全部复现差距,多语训练的 XProvence v1 完全没有差距,确定性基线也无差距。非英语的安全压缩预算只有英语的一半左右。

August 31, 2026 · 3 min

LowRankArena: A Standardized Evaluation Platform for SVD-Based LLM Compression 精读

SVD 低秩压缩号称能省显存又保精度,但各家论文的评测基准、压缩率定义、推理后端各不相同,「进步」到底是方法变强还是协议不同造成的?杜克大学与维克森林大学团队发布 LowRankArena:统一任务版本(LM-Eval-Harness v0.4.11)、统一精度下的 keep ratio 定义、统一 vLLM 0.18.1 端到端推理测量,并开放 3TiB 以上压缩 checkpoint 动物园。对 5 种代表方法(ASVD、SVD-LLM、DoBi-SVD、Basis Sharing、MoDeGPT)×3 个骨干模型的对齐审计发现:排名随骨干剧烈变动、MCQ 准确率可掩盖困惑度坍塌(ASVD 0.353 恰好贴着 0.357 随机地板)、低秩省的是 FLOPs 而非时间——prefill 提速最高 4.20 倍,decode 场景 SVD-LLM 吞吐反而跌到 0.80 倍,且 5 个方法在单张 H200 上压缩 70B 全部因工程问题失败。

August 31, 2026 · 3 min

Muon with Finite Newton-Schulz 精读:有限迭代不是误差,而是收敛的功臣

Muon 已被用于 Kimi K2、GLM-4.5 等前沿模型训练,其核心是用几步 Newton-Schulz 迭代近似动量的正交化。此前的理论要么把这一迭代换成精确极分解,要么把有限深度当作需要控制的逼近误差。本文反转视角:通过折扣在线到非凸转换框架证明,有限 Newton-Schulz 恰恰是让 Muon 在非光滑非凸目标上收敛的平滑机制。深度 q 调节惩罚项与稳定性项的权衡,取 q=O(log(1/ε)) 即可得到匹配最优界的平稳点复杂度,而精确极分解版 Muon 反而可能不收敛。

August 31, 2026 · 4 min

Mutual Debiasing via Dual-Seed Comparison for Probabilistic Sampling in Large Language Models 精读

LLM 能讲清概率分布,却抽不出一个符合分布的随机数——这是被多项研究证实的「认知-行为鸿沟」。山东大学与浙江师范大学团队提出 DSC(双种子比较):让模型生成两条独立随机字符串,逐位置比较 ASCII 序值得到 16 位比特串,再经透明算术管线转成均匀变量并映射到目标分布。理论上比较位偏离公平硬币的概率仅为字符碰撞率的一半;实验中 DSC 在 25 个模型-分布条件的 24 个上取得最低 KS 统计量,误差相对最强基线中位数降低 58.5%,在选择题答案位置控制与属性约束文生图等下游任务中同样显著去偏。

August 31, 2026 · 3 min

Neuro-symbolic PRM: Enhancing Scientific Reasoning via Structured Traces and Symbolic Verification 精读

工具增强 LLM 已经能消灭绝大多数计算与语法错误,但一个隐蔽的失败模式仍在:公式用对了变量却用错了——推理步语法完好、数学可执行、量纲一致,却完全脱离题意。本文提出 NS-PRM,把『推理正确』解耦为符号有效性 V 与语义接地性 G 两个维度:确定性符号验证器(JSON Schema 语法检查+数学等价+Pint 量纲分析,覆盖 128 个计算原语与 15 个逻辑原语)作为硬过滤器保证 V;PRM 只在验证器接受的空间上对 G 条件评分。训练侧引入反事实符号扰动 CSP,算法化生成『完美通过验证器但逻辑错误』的硬负例;推理侧采用验证器优先的约束 beam 搜索。最终 ProcessBench 平均 F1 达 74.2、PRMBench 77.3,均超 9 个 PRM 基线;同等算力下 beam 宽度近翻倍,MATH 零额外成本提升 4.5 个百分点。

August 31, 2026 · 3 min

Not Just Reason, Not Just Scan: Reinforcement Learning for Proactive Scientific Error Verification over Academic Paper 精读

深度精读北邮、北大与腾讯微信AI合作的 VERA-RL。论文研究’无预设问题、无预设证据’的全文科学错误检测:构建 Reason–Verify–Scan 三阶段课程链数据集 VERA-13K(12,900 样本、6 类错误),用 DAPO 算法与三维奖励(推理完整度+证据对齐+错误精确度)训练 Qwen3-VL-8B,Scan 综合分从 2.0 升至 19.5,超过 235B-Thinking 模型;消融证明单奖励训练会让 Scan 崩溃、纯 Scan 训练反而更差,三维奖励与混合课程缺一不可。

August 31, 2026 · 4 min

openJiuwen: Beyond Static Harnesses for Long-Horizon Coding Agents 精读

深度精读华为开源的 openJiuwen 编码智能体 harness。论文把 agent harness 提升为一等系统层,用两大设计原则回应长时程编码的挑战:结构可组合性(共享 Inner Loop/Outer Loop 执行基座 + Rail 生命周期钩子上的有序能力组合,同一执行语义从单智能体复用到子智能体与 Swarm Flow 多智能体流)与运行时适应性(在固定模型策略周围改变框架控制的运行时状态:Context Management 渐进压缩、Goal Mode 语义化验收停止、LSP 被动反馈闭环修正、Self-Reflection 跨任务经验蒸馏)。SWE-bench Verified 达 82.6%(超最强榜单 3.4 个百分点)、Terminal-Bench 2.1 达 87.19%;模型对齐对比下 1-4 小时长任务 52.38% vs mini-swe-agent 同设定 35.71%,佐证上下文管理在长轨迹上保住了深推理收益。

August 31, 2026 · 5 min