Compile by Training: Turning Natural-Language Specifications into Local Neural Functions 精读

滑铁卢大学×哈佛的 Compile by Training 把’编译’概念引入神经函数:教师模型从自然语言规格合成监督数据,训练 LoRA 适配器特化冻结的 Qwen3-0.6B 解释器,产出可存储、可版本化、可组合的 .paw 程序。在 PAW 快速编译器零精确匹配的 FuzzyBench-Hard 上语义准确率从 0.224 提升至 0.836,编译仅需约 50 秒。本文精读其’训练即编译’范式、分钟级编译服务工程与速度-精度新权衡点。

September 7, 2026 · 3 min

LatentPress: Context Compression Beyond Text and Vision 精读

压缩后的上下文通常仍以文本或图像这两种’给人看’的形式存在。LatentPress 提出第三种表示:小型 writer 把对话/文档直接写成连续记忆 token,冻结解码器经输入嵌入接口读取,推理时零文本重建。LongMemEval 上 7.7× 压缩反而比未压缩证据更准(0.504 vs 0.490),写入 43ms 比摘要快一个量级——机器原生的记忆表示从此有了实证立足点。

September 7, 2026 · 3 min

Why Gated DeltaNet Survives 4-Bit Quantization: NVFP4 W4A4 for the Recurrent Half of a Hybrid 27B LLM 精读

社区量化混合架构 LLM 时一致保留循环半区(Gated DeltaNet)的高精度,理由是’循环误差会累积’。Minima 直接把 NVFP4 W4A4 打满全部 496 个线性层:五任务平均仅 -0.52(种子噪声内),显存 17.5 GiB 最小、prefill 提速 14-19%。四重机制研究(块缩放局域化离群值→门控非线性压缩误差→delta-rule 主动遗忘→逐 token 代价被冲刷)解释了为什么直觉是错的。

September 7, 2026 · 3 min

EarlyEval: Cheaper Agent Evaluation via Early Outcome Prediction 精读

跑一遍前沿模型在 SWE-bench Verified 上要花数百到数千美元,而 agent 开发需要反复评测。上海交大联合新加坡管理大学等提出 EarlyEval:agent 的最终成败往往在轨迹中段就已注定——训练一对 LightGBM 成功/失败分类器,一旦置信度过阈值就提前终止运行。三个基准上砍掉 13%–26% 步数、最高省 44.1% 输入 token,预测精度 89%–97%,排行榜排序保真度 Spearman ρ 高达 0.99。本精读拆解’轨迹内降本’与’基准蒸馏降任务数’的正交关系、行为特征为何比参考解更有用,以及阈值-保真度的可调权衡。

September 4, 2026 · 2 min

Language Models Can Control Their Own Attention 精读

长上下文解码时,模型每生成一个 token 都要把整个 KV cache 读一遍——1M token 上下文意味着每步约 15GB 的内存搬运,而注意力其实高度集中。KAIST AI 联合 Google DeepMind 提出 Declarative Attention:让模型在思维链里用 // 三种标签自己声明’现在需要看哪里’,推理引擎像解析工具调用一样解析声明并跳过绝大部分 KV 读取。零训练、零外部打分器,15 个长上下文任务上 Gemma-4-31B 注意 token 降 52.0%、精度仅降 1.27pp。本精读拆解三模式协议、与代理打分式稀疏注意力的机制差异,以及’模型自己最知道该看哪里’的第一性原理。

September 4, 2026 · 3 min

Repo-To-Skill: Distilling GitHub Repositories Into AI4AI Skills 精读

自主 ML 研究 agent 缺的不是更强的模型或更聪明的流程,而是’怎么把方法跑通’的操作知识层。BAAI 联合中科大、人大、港理工提出 DisCo 蒸馏框架,把 1000 个 GitHub 仓库蒸馏成 5353 个经过验证的技能,构建 AREX-Skill Library。在固定 GPT-5.5+Codex 的对照实验下,技能让 MLE-bench 相对提升 134.3%、PaperBench 提升 34.4%、FrontierCS 提升 9.2%、PassNet 提升 14.0%,并以更低 token 消耗帕累托支配 Claude Code。本精读拆解技能图三层结构、四阶段蒸馏流水线、对照实验设计,以及’试错成本越高、操作知识价值越大’的机制根源。

September 4, 2026 · 3 min

On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability 精读

Qwen Team 的 Qwen3.8-Flash-Next 架构报告展示了一次教科书级的’联合设计’实践:GDN 线性注意力混合 + 压缩索引稀疏注意力(QSA)+ 四分支门控残差 + 主机内存 n-gram 嵌入,125B 总参 6B 激活的模型以约 1/9 训练 FLOPs 在 14 个基准上 8 个超越 397B 旗舰,1M 上下文预填充加速 7.6 倍,且 4 倍学习率压力测试下全程零 loss spike。报告最宝贵的不是单个组件,而是’loss、基准、效率、稳定性必须当一个问题解’的方法论,以及大量’loss 与下游精度背离’的诚实披露。

September 2, 2026 · 3 min

Affix Cache for Diffusion Large Language Models 精读

扩散语言模型(DLLM)以双向注意力实现并行解码,但也因此丧失了自回归模型前缀缓存的红利——共享文本段的 KV 状态与不断演化的生成 token 相互耦合,直接跨请求复用会立刻过期。本文提出 ACache:在请求开始时用一次跨注意力探针找出少数对生成 token 影响最大的『锚点令牌』,之后只重算锚点与请求特有位置的 KV,其余共享段缓存跨请求复用。在 LLaDA-8B 与 Dream-7B 上,约 20% 锚点率即可恢复大部分精度损失;基于 Nano-vLLM 的原型将重算延迟最高降低 55.7%,端到端吞吐最高提升 1.68 倍,峰值 KV 显存最高下降 43.3%。这项工作首次把『跨请求缓存复用』引入 DLLM 推理系统,揭示了双向注意力下共享上下文管理的新范式。

August 31, 2026 · 3 min

Fast Weight Attention for Continual Learning 精读

深度精读 ByteDance Seed、Princeton、清华、UCLA 与 Hyperbolic Labs 合作的 Falcon 论文:把线性注意力与状态空间模型的状态转移显式化为在线学习规则,发现读后写语义下快记忆的正确训练对应是前缀配对 φ(k(t-1))→v(t) 而非常见的同对配对,并从平方误差回归与内积两个局部目标统一推导出 NLMS 归一化的六个变体族(Falcon-1/2/3 与 Falcon-1A/2A/3A),全部兼容 SSD 式 chunk 并行训练。语言建模上与最强递归基线互有胜负,变长加法外推上 Falcon-3A.3 以 87.2 平均精度大幅领先 Transformer 的 65.8。

August 31, 2026 · 6 min

LowRankArena: A Standardized Evaluation Platform for SVD-Based LLM Compression 精读

SVD 低秩压缩号称能省显存又保精度,但各家论文的评测基准、压缩率定义、推理后端各不相同,「进步」到底是方法变强还是协议不同造成的?杜克大学与维克森林大学团队发布 LowRankArena:统一任务版本(LM-Eval-Harness v0.4.11)、统一精度下的 keep ratio 定义、统一 vLLM 0.18.1 端到端推理测量,并开放 3TiB 以上压缩 checkpoint 动物园。对 5 种代表方法(ASVD、SVD-LLM、DoBi-SVD、Basis Sharing、MoDeGPT)×3 个骨干模型的对齐审计发现:排名随骨干剧烈变动、MCQ 准确率可掩盖困惑度坍塌(ASVD 0.353 恰好贴着 0.357 随机地板)、低秩省的是 FLOPs 而非时间——prefill 提速最高 4.20 倍,decode 场景 SVD-LLM 吞吐反而跌到 0.80 倍,且 5 个方法在单张 H200 上压缩 70B 全部因工程问题失败。

August 31, 2026 · 3 min