TreeGraft 精读:多起草器共嫁接一棵草稿树,让投机解码跨越快与好的单选题

树形投机解码用一个起草器建草稿树,陷入『小模型快但树差、大模型树好但慢』的两难。TreeGraft 让免训练 n-gram 小起草器与预训练中间起草器共同构建一棵共享草稿树:中间起草器可回看全树历史节点重新打分并复活被低估的路径(Where),嫁接时不覆盖既有子树(How),再由离线价值系统蒸馏出的 3265 参数轻量调度器逐步决定是否值得调用中间起草器(When)。在 10 个模型对 × 6 个基准上平均加速 1.60 倍,超两个单起草器端点中较优者 15.1%,且在留出模型对与完全留出的 MT-Bench 任务上仍保持 1.48 倍与 1.60 倍,证明调度器学到的是可迁移的成本-质量权衡。

August 31, 2026 · 3 min

When the Canonical Completion Is Wrong: Formalizing and Measuring the Jump in Large Language Models 精读

「LLM 不能跳变(jump)」——即无法完成爱因斯坦式的从证据到新公理系统的溯因飞跃——是一个流传甚广的论断,但从来没人给出过「跳变」的形式化定义和可检验的度量。剑桥大学与新南威尔士大学团队用范畴论补上了这块拼图:把跳变拆成四步(默认补全是什么、何时被迫放弃、放弃何时正确、跳变如何复合),并测量第二步。左/右 Kan 扩张给出模型无约束时的「默认答案」(已被证明等价于误差最小化归纳,校准实验证实 98% 无约束输出确实是它);跳变实例则携带机器可验证证书保证正确答案存在、唯一且必异于默认。结果出人意料:4 个前沿模型在全部 248 次约束试验中,一次也没有退回被排除的默认答案(Kan-default 率为零)——选择步不是瓶颈,若无能真实存在,位于生成约束或发明框架的上游。

August 31, 2026 · 2 min

ProofEvolve: Neuro-Symbolic Evolution for Formal Automated Theorem Proving 精读

神经定理证明器一直有个结构性缺陷:证明经验要么锁在模型参数里、要再训练一轮才能影响后续问题,要么只在当前问题内共享,失败尝试中已验证的成果随搜索结束一起丢弃。UVA 与 Meta AI 的 ProofEvolve 把定理证明变成一场显式符号结构的进化:固定权重的 LLM 提出分解、修复、schema 重组三类变异,Lean 4 内核验证每一步转换,verified closure 把二值成败变成分级适应度,已证明的子结构提取为持久 schema 库跨问题继承。三个竞赛级基准平均解决率 57.8%,超最强基线 LEAP 7.3 个点,最依赖多引理组装的 IMO 级基准提升最大达 16.6 个点。本文精读其进化机制设计与效果优势的因果链条。

August 29, 2026 · 5 min

The Reasoning Tax: Token Economics of LLM Reasoning Across Task Types and Deployment Contexts 精读

推理模型在回答前会生成大量思考 token,但这些思考是否值得其成本?联想基础设施方案集团的这篇论文提出边际效率指标 Token Economy Score(TES),用准确率增益除以生成 token 倍数来度量推理模式的性价比,并在 151 个模型-基准组合上给出三个部署结论:任务结构比名义难度更能预测推理收益,序列推理任务(数学竞赛、代码)高 TES 而知识回忆型任务(MMLU-Pro、GPQA)低 TES;提高推理努力档位呈尖锐边际递减甚至负增益;思考链占总推理成本中位数高达 94.7%,而自建 MoE 集群可把云端成本再降 2.0 至 25.6 倍。本精读覆盖指标设计、实验证据、因果解释与可迁移的通用灵感。

August 29, 2026 · 6 min

Adaptive Triggering for Bias Correction in LLM Reasoning 精读

亚利桑那州立大学团队把「推理过程中何时注入反偏见干预」形式化为在线变点检测问题:每步计算一个偏见风险信号,喂入 CUSUM 统计量,仅当累积证据越过校准阈值时才注入定向反思提示。黑盒版(LLM 裁判打分)在 gpt-4o-mini 上以 0.33 次/题的干预频率恢复了固定周期干预损失的大部分消歧准确率(90.1% vs 82.9%),独立裁判下仍成立。白盒版(next-token 概率信号)在全部六个开源模型上提升歧义项准确率、却在五个模型上损害消歧项——它无法区分「依赖刻板印象」与「恰好与刻板印象一致的正当证据」,证明再好的触发时机也救不了错位的信号。论文还修复了 BBQ 基准四处未记录的标签匹配不一致,并指出「未完成率」是被误当准确率损失的一种独立干预代价。

August 27, 2026 · 3 min

Prefix Sliding for efficient test-time scaling 精读

斯坦福、华盛顿大学联合 Prime Intellect 等机构提出 Prefix Sliding:推理时只保留前缀(系统指令+prompt,充当注意力锚点)+ 最近数千 token 滑动窗口,丢弃中间推理 token。基于「中间 token 完成子任务后即失去重要性」的注意力概率观察,免训练即可让现有模型提速 3 倍而性能不降;配合截断反向传播,RL 可训练 10 万 token 级长推理轨迹。方法极简但解决了「无限测试时扩展必须有界每 token 成本」这一根本问题。

August 27, 2026 · 4 min

Reflection Steering: Disentangling Reflection from Reasoning in Activation Space for Token-Efficient Inference 精读

香港四校合作提出 Reflection Steering:一个免训练的激活空间干预框架,用于抑制大推理模型中冗余的反思行为。方法通过 PCA 去噪、对共享推理方向正交化、逐层校准和有界投影删除四阶段,把「反思方向」从「通用推理方向」中解缠出来,在 6 个模型×基准设置中平均节省 16.9% 的思考 token,MATH-500 上精度统计等效。本精读完整拆解其方向净化机制、层校准协议与统计验证方法。

August 27, 2026 · 3 min

BDH-CQ: In-Context Learning with Recurrent Latent Reasoning 精读

深度精读 Pathway 公司的 BDH-CQ(Dragon Hatchling 架构家族)——一种用 150M 参数挑战 ARC-AGI-1 的后 Transformer 序列模型。它抛弃了主流大模型’生成自然语言思维链’的推理范式,转而在高维潜在空间中迭代计算 R 次,把每次推理成本压到 0.85 GPU-秒、约 0.0007 美元,却能在 ARC-AGI-1 公共集上拿下 29.5% pass@2,比 GPT-5.6 Luna(Low) 便宜约 57 倍。本文用通俗类比讲透’潜在推理’、‘循环记忆’与’低秩通信’的本质,并解释为什么这套结构在’抽象推理流体智力’基准上能弯道超车大它三个数量级的模型。

August 11, 2026 · 9 min

一片晶圆的赌局:Cerebras如何从 Scaling Law 的实验室走向千亿推理市场

硅谷101专访Cerebras早期投资人周南、前百度研究员Greg Diamos及产品高管Angela,复盘这家"晶圆级引擎"公司十年史。从百度三亿参数模型发现Scaling Law、2016年赌注式投资、良率工程突破,到G42订单、OpenAI两百亿美元推理合同、千亿市值IPO,文章梳理了Cerebras如何从一个物理学的疯狂赌注,变成推理时代绕开HBM与CoWoS瓶颈的差异化基础设施,以及上市后毛利率、供应链和客户自研芯片带来的真实风险。

August 7, 2026 · 1 min