Muon with Finite Newton-Schulz 精读:有限迭代不是误差,而是收敛的功臣

Muon 已被用于 Kimi K2、GLM-4.5 等前沿模型训练,其核心是用几步 Newton-Schulz 迭代近似动量的正交化。此前的理论要么把这一迭代换成精确极分解,要么把有限深度当作需要控制的逼近误差。本文反转视角:通过折扣在线到非凸转换框架证明,有限 Newton-Schulz 恰恰是让 Muon 在非光滑非凸目标上收敛的平滑机制。深度 q 调节惩罚项与稳定性项的权衡,取 q=O(log(1/ε)) 即可得到匹配最优界的平稳点复杂度,而精确极分解版 Muon 反而可能不收敛。

August 31, 2026 · 4 min

Sliding-window beats linear attention 精读

深度精读微软 Applied Sciences Group 的评测批判型论文:后训练线性注意力(LoLCATs、MOHAWK、QRWKV 等)一直以『低成本解决 KV 缓存膨胀』为卖点,但从未与真正的强基线——免训练的带注意力 sink 滑窗注意力 SWA(64,4) 公平比较。本文在 11 个基础模型(1.3B 到 70B)上补上这场缺失的对比:短上下文 SWA 恢复基线平均性能 99.0%,长上下文 S-NIAH 与 BABILong 上领先 2 到 10 倍,且零后训练 token、解码最快、内存最低。一篇动摇整个『线性化改造』研究方向价值主张的论文。

August 31, 2026 · 5 min

Survival-Guided Length Control for Efficient Diffusion Language Models 精读:用生存分析一次前向测出生成长度

扩散语言模型(DLM)迭代去噪生成文本,但标准 AOAR 解码对全体样本使用统一的保守长度预算 Lmax=1024,大量去噪步浪费在精修真实结束位置之后的冗余画布上。本文把生成长度选择重新表述为 [EOS] token 上的离散时间生存问题:对长 mask 画布做一次前向传播,把各位置的 [EOS] 概率解释为危险率,经均场近似连乘得生存曲线,再用期望等于生存概率求和的标准恒等式闭式算出期望长度,作为该样本的解码预算。方法免训练、即插即用,在 LLaDA-8B-Base 与 Dream-7B-Base 上取得 3.1-6.6 倍解码加速(instruct 模型最高 7.3 倍),任务精度变化全部落在标准差之内;固定均值长度消融与逐步漂移分析进一步证明逐样本长度预测的必要性。

August 31, 2026 · 3 min

TreeGraft 精读:多起草器共嫁接一棵草稿树,让投机解码跨越快与好的单选题

树形投机解码用一个起草器建草稿树,陷入『小模型快但树差、大模型树好但慢』的两难。TreeGraft 让免训练 n-gram 小起草器与预训练中间起草器共同构建一棵共享草稿树:中间起草器可回看全树历史节点重新打分并复活被低估的路径(Where),嫁接时不覆盖既有子树(How),再由离线价值系统蒸馏出的 3265 参数轻量调度器逐步决定是否值得调用中间起草器(When)。在 10 个模型对 × 6 个基准上平均加速 1.60 倍,超两个单起草器端点中较优者 15.1%,且在留出模型对与完全留出的 MT-Bench 任务上仍保持 1.48 倍与 1.60 倍,证明调度器学到的是可迁移的成本-质量权衡。

August 31, 2026 · 3 min

Redwood: A Frontier AI Accelerator Designed, Verified, and Deployed from Scratch in 2 Weeks by AI 精读

Architect Labs 的 AI 系统在两名人类架构师只写高层规范的前提下,用不到两周自主生成性能模型、RTL、UVM 验证环境、形式证明、固件与计算内核,所有模块达成 95% 代码与功能覆盖率,首次上 FPGA 零 bug,架构变更 48 小时内完成再验证再部署;投影至 Samsung 8nm 工艺后,Redwood 以 49 tokens/s@1.335W 对比 Jetson Orin Nano 同模型实测 28 tokens/s@2.59W,能效提升 3.4 倍。本精读面向软件背景读者,补全 RTL、UVM、形式验证、FPGA、roofline 等概念,剖析单一规范源全栈协同生成的因果链,并提炼七条可迁移的系统设计灵感。

August 29, 2026 · 7 min

SKILL.state: Scalable Long-Horizon Agent Skills 精读

让 Agent 执行长任务时,主流运行时把所有推理、动作、观察不断追加进对话历史,prompt 随步数二次膨胀,token 烧钱、噪声污染、过期事实还会诱发幻觉。Google 与 Purdue 合作的 SKILL.state 干脆废除这个 append-only 历史:每一步模型只看到技能规范、结构化执行状态和最新观察,推理轨迹用完即弃,状态以 JSON 补丁形式确定性合并。prompt 尺寸从 O(T) 降为 O(1),百步任务 token 缩减 16.2 倍,CTF pass@1 提升 7.8 个点,外部篡改状态后零步恢复而基线幻觉 5 至 8 步。本文精读其运行时设计、预算匹配对照实验与效果根源。

August 29, 2026 · 4 min

The Reasoning Tax: Token Economics of LLM Reasoning Across Task Types and Deployment Contexts 精读

推理模型在回答前会生成大量思考 token,但这些思考是否值得其成本?联想基础设施方案集团的这篇论文提出边际效率指标 Token Economy Score(TES),用准确率增益除以生成 token 倍数来度量推理模式的性价比,并在 151 个模型-基准组合上给出三个部署结论:任务结构比名义难度更能预测推理收益,序列推理任务(数学竞赛、代码)高 TES 而知识回忆型任务(MMLU-Pro、GPQA)低 TES;提高推理努力档位呈尖锐边际递减甚至负增益;思考链占总推理成本中位数高达 94.7%,而自建 MoE 集群可把云端成本再降 2.0 至 25.6 倍。本精读覆盖指标设计、实验证据、因果解释与可迁移的通用灵感。

August 29, 2026 · 6 min

Agent Mesh: Reliability Primitives for Non-Idempotent Agent Delegation 精读

当Agent编排系统直接搬用服务网格的重试、超时、错误率熔断这三件套时会发生什么?这篇论文对一台生产级Agent交付平台(66,185行代码、59个模块)的147起编号事故做了回顾性失效研究,量化展示了三大可靠性假设在Agent场景全部失效:54次连续成功调用让错误率熔断全程失明、21个事件跨6次调用累积让完全正确的幂等组件永远无法通过测试、12起执法层阻断正确工作的事故。论文提炼出贯穿5个子系统的横切根因——身份充分性,并推导出以delegation为执法单元的7个新可靠性原语。对构建Agent基础设施的工程师来说,这是一份罕见的、带测量成本的真实现场失效档案。

August 28, 2026 · 1 min

AsymSpec: Context-Asymmetric Speculative Decoding for Agentic LLMs 精读

Agent 流水线的推理成本随上下文累积而飙升,压缩输入省钱却伤精度,而投机解码(SD)受制于「drafter 与 verifier 必须读同一份上下文」的对称性约束,无法破解这个两难。华为与中国科大的 AsymSpec 打破对称:小 drafter 读全文、大 verifier 只读压缩视图,通过同模型跨上下文的对比 δ-fusion 把被压缩丢弃的信息在 logit 空间回注,再用免调参的 JSD 散度门保持接受率稳定。结果:以 0.23 倍计算拿到 LongBench 59.7 F1(恢复压缩损失差距的 72%)、1.45 倍吞吐;恢复量随压缩严重度单调增长,近无损压缩处自动失活;还能让读原图的视觉 drafter 操纵只读文字的 verifier。

August 27, 2026 · 5 min

Beyond Scaling: Self-Evolving LLM Agents for Hardware Kernel Optimization 精读

深度精读 KOPE 论文——香港城市大学与华为联合提出的硬件内核优化自进化 Agent 框架。在公共语料极度稀缺的昇腾 NPU 场景下,KOPE 用经验图记忆保留「决策-结果」证据链,配合预算化三层上下文注入,使模型参数完全冻结的前提下通过率达 84.6%(最强基线 57.8%),token 消耗反而下降 93%。本文从内核优化领域背景、经验记忆机制、主动上下文管理、双消融实验到 RISC-V 跨硬件迁移,完整拆解「经验复用为何在语料稀缺场景碾压模型能力」的因果链。

August 27, 2026 · 5 min