Can your AI agent be cheaper? Investigating the effects of task specifications on token spend in agentic coding tasks 精读

斯坦福单作者实证研究:固定模型、系统性变化任务描述本身,量化 prompt 信息量对编码 agent token 开销的影响。2,700 次受控运行显示——把完整规格砍到裸 user story 使成本 +29.7%、轮数 +16.4%(五个任务全部同向);prompt 只动均值不动方差(重复运行几何标准差恒为 ×1.34);输出 token 仅占 2.7% 却占 51.1% 花费;单次 $0.11 探测可把未知任务成本预测误差从 161% 降到 36%。「具体性而非要求的存在」才是省轮数关键。

August 27, 2026 · 3 min

Groundhog Bit-Flip Attack: Seeding Infinite Generation Loops in MoE LLMs 精读

MoE(混合专家)架构靠稀疏激活省钱省算力,但 Louisiana State、UCLA 等五校联合团队发现:终止 token(EOS/EOT)的生成权竟集中在极少数「终止相关专家」手里,路由层因此成了一个局部化的攻击面。Groundhog Bit-Flip Attack(GBFA)——首个针对 MoE LLM 的 bit-flip 型 Denial-of-Wallet 可用性攻击——只需翻转路由器权重中平均不到 4 个专家对应的少量 bit,就让平均输出膨胀 5912%(最严重 87 倍)、多数样本顶满 token 上限,而模型语义基本无损、PPL 几乎不变。攻击波及对话、推理(思考永不停)、Agent 规划(10 个沙盒全部顶满步数)三种模式。本精读拆解「专家-终止 token 特化」的发现、免推理的脆弱 bit 搜索,以及为什么防御如此棘手。

August 27, 2026 · 4 min

Parason: Revealing Subtask- and Trial Parallelism in LLM Reasoning 精读

清华、MIT与NVIDIA合作的Parason瞄准推理模型的延迟瓶颈:自回归解码把整条推理链串行执行,难题要等数小时甚至数天。论文首先提出推理并行性的语义分类——Subtask并行(AND分支,分而治之)与Trial并行(OR分支,多路试探),并测量发现Trial并行占了可并行推理计算的多数(DeepSeek-V4在HLE上65.5%),而此前系统几乎只利用了前者。Parason用上下文无关文法把串行推理轨迹改写成引擎可解析的并行结构,配合PA-GRPO多目标奖励(正确性+关键路径延迟+两类并行比例)训练,经SGLang真实执行。AIME24/25等基准上平均加速约1.7×,8k token延迟预算下用25%预算匹配全额性能。

August 27, 2026 · 2 min

Prefix Sliding for efficient test-time scaling 精读

斯坦福、华盛顿大学联合 Prime Intellect 等机构提出 Prefix Sliding:推理时只保留前缀(系统指令+prompt,充当注意力锚点)+ 最近数千 token 滑动窗口,丢弃中间推理 token。基于「中间 token 完成子任务后即失去重要性」的注意力概率观察,免训练即可让现有模型提速 3 倍而性能不降;配合截断反向传播,RL 可训练 10 万 token 级长推理轨迹。方法极简但解决了「无限测试时扩展必须有界每 token 成本」这一根本问题。

August 27, 2026 · 4 min

Reflection Steering: Disentangling Reflection from Reasoning in Activation Space for Token-Efficient Inference 精读

香港四校合作提出 Reflection Steering:一个免训练的激活空间干预框架,用于抑制大推理模型中冗余的反思行为。方法通过 PCA 去噪、对共享推理方向正交化、逐层校准和有界投影删除四阶段,把「反思方向」从「通用推理方向」中解缠出来,在 6 个模型×基准设置中平均节省 16.9% 的思考 token,MATH-500 上精度统计等效。本精读完整拆解其方向净化机制、层校准协议与统计验证方法。

August 27, 2026 · 3 min

Spectral Allocation: Why Muon Outperforms Adam, and How to Improve Muon 精读

剑桥大学与清华大学合作,用 out-of-sample 谱探测回答优化器领域的核心开放问题:Muon 为何快于 Adam?沿真实训练轨迹把动量缓冲做 SVD,在留出批次上估计每个奇异方向的最优步长,发现稳定且各向异性的谱剖面——单一「易变头」处于稳定性边缘(允许步长最小、恰等于 Muon 实际步长),「宽容主体」允许数倍步长。据此提出 SAMuon:头钉住、主体放大,比调优 Muon 少 13.3-24.0% token 达到同等验证损失。SGD→Adam→Muon→SAMuon 在统一谱分配视角下排成一条线。

August 27, 2026 · 3 min

领读Kimi K3技术报告:一个清华架构博士眼中的注意力谱系与「有效scaling」

一集面向技术读者的Kimi K3技术报告领读播客,嘉宾孙宇涛(清华计算机系博士生、上海创智学院pre-doc,研究方向LLM架构与预训练)从K3出发串联起十多篇前作,把KDA线性注意力的每一项公式还原成RetNet→Mamba→DeltaNet→Gated DeltaNet的历史叠加,讲清channel-wise衰减、low-rank dk与BF16 tile的kernel co-design,MLA+QK-norm式门控的稳定性逻辑,Latent MoE对通信开销的削减,以及Quantile Balancing如何用线性规划一步求出负载均衡bias。预训练侧K3反潮流回归cosine decay、在混合注意力里用NoPE让长上下文免调参外推;后训练侧on-policy蒸馏成为多teacher多reward的「多模型合板」方案。嘉宾的暴论:大模型架构没有本质创新了,K3最核心的变量是size——2.8T总参、百B激活、K2的2.5倍scaling效率,而把size做work才是真创新。

August 26, 2026 · 1 min

AsmEvo: Agentic Assembly-Level Optimization of AMD GPU Kernels with Functional Equivalence Verification 精读

深度精读 AMD 与南方科技大学合作的 arXiv 2026 论文 AsmEvo:当 GPU 内核源码不可得、部署二进制是唯一行为基准时,用智能体直接在汇编级优化已编译的 AMDGPU code object。恢复可重汇编表示、profiling 定位热窗编辑、ABI 保持重建、差分验证门控接受,在 MI308X 上让 30 个 KernelBench 内核中的 29 个提速,几何均值 1.35 倍、最大 3.88 倍;MI300X 生产负载(AITer、vLLM、SGLang)全部提升且全程保持功能等价。

August 25, 2026 · 4 min

Optimal Skill Selection for LLM Agents with Provable Bicriteria Guarantees 精读

当 Agent 技能库膨胀到成千上万份文档,往上下文装哪几份技能直接决定任务成败与 token 账单。清华交叉信息研究院 Longbo Huang 组首次把「技能选择」形式化为硬 token 预算下最大化「单调次模收益减线性上下文惩罚」,并提出多项式算法 BPS,证明该问题首个双准则(1−1/e, 1)近似保证,收益系数多项式时间最优。目标函数从执行记录拟合,拟合误差可证转移到有界选择regret。在污染受控 BigCodeBench 变体上,BPS 达 0.73 实测成功率,对已发布路由器、检索器与执行器自选的 0.20–0.52 全面胜出,且比最强路由器省 28% token。本精读拆解其形式化、BPS 算法、预算对齐插值证明,以及「上下文价值是集合级而非单体可打分」的核心洞察。

August 23, 2026 · 6 min

ReCache: 工具增强Agent的组合不变KV缓存复用 精读

工具增强Agent每个请求都要重新编码一遍以不同组合、不同顺序出现的工具与技能schema,标准前缀缓存对此无能为力。ReCache提出resource-wise attention,切断资源间注意力并重置资源内位置索引,使每个资源的KV块具有组合不变性、可独立缓存复用;再叠加贡献选择的层-KV头组路由与字段感知的语义剪枝,把KV张量内存降低92.43%、注意力加速1.423倍,同时Inv-F1基本不降。本精读覆盖其动机、机制、七数据集基准与效果根源分析。

August 23, 2026 · 3 min