Thought without systematicity? Evaluating Reasoning Models on Rule Induction Tasks 精读

人类认知的核心特征 systematicity(系统性)——理解一个概念蕴含理解其变体。推理模型具备吗?普林斯顿(Brenden Lake 组)用规则归纳任务的同构变体(重组/替换)测试:能正确解决原任务的模型,常在同构变体上失败——表面正确掩盖了系统性缺失。这一发现对’benchmark 分数=认知能力’的解读划出硬边界:模型可能记住了解法而非掌握规则。本精读覆盖同构变体方法学、系统性缺失的证据结构与对推理评测的连锁含义。

September 16, 2026 · 1 min

When Agents Slow Down: Elo-per-token 分析与 Agent 测试时策略 精读

Agent 在测试时的’减速’行为——更多 token 换来多少真实能力提升?本文提出 Elo-per-token 度量:以独立采样为理论参照(Elo 随 log compute 线性增长),定义 scaling inflection point(边际 Elo 增益跌至参照线的每会话预算)。4 个通用 Agent × 4 个开放基准、单会话最高 1 亿 token 的实验给出反直觉发现:AtCoder Heuristic Contest 上 Agent 超越历史最强人类选手的超线性提升是持续学习的证据——减速之后仍有巨大 headroom。本精读覆盖测试时 scaling 的度量学、独立采样参照的设计逻辑与’持续学习 vs 收益递减’的分界证据。

September 16, 2026 · 2 min

推理芯片之战:带宽成为新算力,Groq、Cerebras 与 OpenAI 的三条路线与 Bill Dally 的 location 哲学

推理的瓶颈正在从算力转向带宽:每生成一个 token,都要把整个模型从存储介质读一遍。硅谷101本期请到两位正在做推理芯片创业的嘉宾——Bill Dally 的博士生 Mark 与前亚马逊 Annapurna 芯片软件栈科学家子阳,拆解 Groq 的静态调度、Cerebras 的晶圆级集成与 OpenAI Jalapeño 的 HBM4 通用路线为何是不同约束条件下的各自最优解,为什么中国关心 tokens per dollar 而美国关心 tokens per watt,以及推理速度如何决定模型智能的上限。

September 16, 2026 · 3 min

Nemotron IMO Gold 精读:开源模型金牌的完整配方——自然语言证明生成与测试时搜索管线

NVIDIA 公开 IMO 2026 金牌系统全部配方:Nemotron 3 Ultra 基座上 SFT+RL 两个专精 checkpoint,加验证器/评分器构成生成-验证-精炼迭代搜索与高算力终选,全程纯自然语言(无形式化证明器/外部工具/互联网),得分 30/42 达金牌线。全套 artifact 开源:两个 checkpoint、SFT/RL 训练数据、训练与推理代码、提交的证明、Nemotron-IMO-Bench(200 道新题)。同日 25 位菲尔兹奖得主联合声明使本文的伦理语境格外微妙。

September 13, 2026 · 1 min

Looped Flows 精读:把“想得更久”做进架构——循环流的局部训练之路

AITHYRA 访问研究者的 looped flows:状态化去噪器每步预测解并更新循环状态、ODE/SDE 步更新流状态,用局部训练目标绕开跨步反传的老大难。六个推理基准整体超先前 looped SOTA,ARC-AGI-1 58.8%、ARC-AGI-2 12.2%——循环模型在抽象推理上首次具备与主流推理范式对话的竞争力。

September 12, 2026 · 1 min

NSD 精读:教推理模型“别这么错”,比教它“该怎么对”更有效

UVA+Stanford 提出负面自蒸馏(NSD):针对 on-policy 自蒸馏(OPSD)模仿“带标准答案的伪自信轨迹”导致难推理任务退化的失败模式,构造“负条件”(注入已知缺陷的解)让学生显式规避。token 级自适应门控+gated unlikelihood 在七基准上 1.7B/4B/8B 平均 +2.3%/+7.5%/+6.0%,且保留自纠错行为——模型越大增益越高。

September 12, 2026 · 1 min

BeaconKV: Key-Value Cache Compression Guided by Beacon Queries for Efficient Large Reasoning Model Inference 精读

KV cache 压缩方法都用’最近的查询’预测未来注意力——本文发现长程推理中这个假设根本不成立:解码会不定期产生’思维重访令牌’(TRT),重新关注数千 token 之前的推理计划,而近期查询无法预知这次重访。关键观察是 TRT 对应的全局查询在嵌入空间聚成少数簇——只需为每簇维护一个’信标查询’(Continual FPS 在线选取),就能预判哪些 KV 将被重访。训练自由、无需改动架构:四个开源推理模型上内存最高压缩 5.8×、精度近全量、吞吐 +4.3×,对 RPC/R-KV 最高领先 31.7 个百分点。

September 10, 2026 · 2 min

ERPO: Entropy-Regularized Rank-Masked Policy Optimization for Test-Time RL in Code Generation 精读

测试时强化学习(TTRL)靠答案自投票构造奖励,但代码程序没有规范答案可比对——TTRL 由此与代码生成绝缘。本文提出 probe-driven TTRL:从题面自构造无输出探针输入,用候选程序行为一致性构造 Probe Consensus Reward;再用 ERPO 把 PCR 当作’负信号为主’的奖励——rank masking 屏蔽高共识半区、只抑制低共识程序,配合熵上限防止多样性坍缩。Qwen3-4B 在 LiveCodeBench 域内 pass@1 26.0→36.7、pass@16 34.4→46.3,零样本迁移 CodeContests 25.1→42.1,是唯一同时提升 pass@1 与 pass@k 的无标签方法。

September 10, 2026 · 2 min

Recognition-Refusal Misalignment in LLMs: Why Models Answer Structurally Unanswerable Questions 精读

LLM 会一本正经地回答 cot(-540°) 等于 0、(1).startswith(‘1’) 是 True——这些结构上不可能有答案的问题。是模型’不知道’还是’知道但不拒答’?USC/ASU 团队给出机制级答案:残差流中存在线性可解码的’不可能性方向’(AUC 0.939),但它与安全拒答方向近正交(cos 0.087),且 base 模型中该几何已存在——模型’知道’却把信号接错了线路。沿识别方向的双向因果干预以 +33~+52pp 的剂量响应翻转行为。自信地回答不可能问题的失败由此被定位为路由失败而非编码失败。

September 10, 2026 · 2 min

Extremely Sparse Supervision: 0.05% 的 token 监督就能激励推理 精读

Amazon×Duke 在 on-policy 蒸馏设定下发现反直觉现象:每条推理轨迹仅监督 1–2 个关键 token(占全部生成 token 的 0.05%)即可匹配甚至超越全 token 训练的推理激励,跨 9 组师生配置、PPO-RLVR 与 Llama 模型一致成立。本文精读这一’有效学习不需要 token 密集’的证据链及其对后训练范式的改写意义。

September 8, 2026 · 2 min