Cliff: Learning Process Rewards from the First Mistake 精读

RLVR 用最终答案的对错给整条推理链打分,粒度太粗;PRM 要训练专用奖励模型,OPD 要求师生推理同构。Amazon Web Services 联合 UIUC 的 Cliff 给出过程监督的最小充分形式:只用现成 LLM 定位每个错误 rollout 的’第一个错误步’(Pitfall Step),把轨迹切成正确前缀与错误后缀,前缀正优势、后缀负优势。12 个场景上一致超越:比 On-Policy Distillation 高约 15%、比标准 GRPO 高约 7%,且弱教师(27B)下依然有效。本精读拆解’错误前缀之后无信息’这一核心洞察、token 级优势的构造细节,以及教师定位能力与人类标注 80% 一致率的验证实验。

September 4, 2026 · 3 min

Language Models Can Control Their Own Attention 精读

长上下文解码时,模型每生成一个 token 都要把整个 KV cache 读一遍——1M token 上下文意味着每步约 15GB 的内存搬运,而注意力其实高度集中。KAIST AI 联合 Google DeepMind 提出 Declarative Attention:让模型在思维链里用 // 三种标签自己声明’现在需要看哪里’,推理引擎像解析工具调用一样解析声明并跳过绝大部分 KV 读取。零训练、零外部打分器,15 个长上下文任务上 Gemma-4-31B 注意 token 降 52.0%、精度仅降 1.27pp。本精读拆解三模式协议、与代理打分式稀疏注意力的机制差异,以及’模型自己最知道该看哪里’的第一性原理。

September 4, 2026 · 3 min

Post-Training Language Models for Gold-Medal Performance in Coding Competitions 精读

在 IOI 2026 上,一个 AI 系统在与人类选手完全相同的比赛时间、提交限制和网络封锁下拿到 535.4/600 分,超过金牌线 174.3 分、超过人类最高分选手 37.1 分——据作者所知这是 AI 首次在 IOI 题集上超越人类冠军。NVIDIA 的这份技术报告完整拆解了达成路径:22000 道竞赛题策展、120 万条合成推理轨迹、SFT+RL 的分工实证、以及 GenCorrect 迭代修正策略。本精读重点解析该论文罕见的组件归因实验——SFT 贡献大头、RL 只打磨边界、测试时计算放大差距,以及’纯 SFT 的 Ultra 反超 SFT+RL 的 Nano’背后的并行采样机制。

September 4, 2026 · 3 min

AdaThinking-E: One-Token Entropy Regulation for Adaptive Thinking 精读

美团联合上海交大、中科院自动化所提出 AdaThinking-E,用一个 token 的熵调节教会文档理解多模态大模型自主决定何时深度思考。该方法把模式切换 token 与回答 token 分开优化,前者用熵奖励驱动从高熵探索到低熵决策的课程式过渡,后者只关心答案质量,从而避免了 GRPO/DAPO 训练中模式坍缩为全不思考的通病。在 8 个文档基准上,7B 模型以 27% 的思考率追平 SOTA 自适应思考模型 82% 思考率的效果,OCR-Reasoning 相对基座提升 10.8 个百分点,实现了该想才想、不该想不想的效率与精度兼得。

August 31, 2026 · 3 min

Affix Cache for Diffusion Large Language Models 精读

扩散语言模型(DLLM)以双向注意力实现并行解码,但也因此丧失了自回归模型前缀缓存的红利——共享文本段的 KV 状态与不断演化的生成 token 相互耦合,直接跨请求复用会立刻过期。本文提出 ACache:在请求开始时用一次跨注意力探针找出少数对生成 token 影响最大的『锚点令牌』,之后只重算锚点与请求特有位置的 KV,其余共享段缓存跨请求复用。在 LLaDA-8B 与 Dream-7B 上,约 20% 锚点率即可恢复大部分精度损失;基于 Nano-vLLM 的原型将重算延迟最高降低 55.7%,端到端吞吐最高提升 1.68 倍,峰值 KV 显存最高下降 43.3%。这项工作首次把『跨请求缓存复用』引入 DLLM 推理系统,揭示了双向注意力下共享上下文管理的新范式。

August 31, 2026 · 3 min

Mutual Debiasing via Dual-Seed Comparison for Probabilistic Sampling in Large Language Models 精读

LLM 能讲清概率分布,却抽不出一个符合分布的随机数——这是被多项研究证实的「认知-行为鸿沟」。山东大学与浙江师范大学团队提出 DSC(双种子比较):让模型生成两条独立随机字符串,逐位置比较 ASCII 序值得到 16 位比特串,再经透明算术管线转成均匀变量并映射到目标分布。理论上比较位偏离公平硬币的概率仅为字符碰撞率的一半;实验中 DSC 在 25 个模型-分布条件的 24 个上取得最低 KS 统计量,误差相对最强基线中位数降低 58.5%,在选择题答案位置控制与属性约束文生图等下游任务中同样显著去偏。

August 31, 2026 · 3 min

Neuro-symbolic PRM: Enhancing Scientific Reasoning via Structured Traces and Symbolic Verification 精读

工具增强 LLM 已经能消灭绝大多数计算与语法错误,但一个隐蔽的失败模式仍在:公式用对了变量却用错了——推理步语法完好、数学可执行、量纲一致,却完全脱离题意。本文提出 NS-PRM,把『推理正确』解耦为符号有效性 V 与语义接地性 G 两个维度:确定性符号验证器(JSON Schema 语法检查+数学等价+Pint 量纲分析,覆盖 128 个计算原语与 15 个逻辑原语)作为硬过滤器保证 V;PRM 只在验证器接受的空间上对 G 条件评分。训练侧引入反事实符号扰动 CSP,算法化生成『完美通过验证器但逻辑错误』的硬负例;推理侧采用验证器优先的约束 beam 搜索。最终 ProcessBench 平均 F1 达 74.2、PRMBench 77.3,均超 9 个 PRM 基线;同等算力下 beam 宽度近翻倍,MATH 零额外成本提升 4.5 个百分点。

August 31, 2026 · 3 min

Privacy Without Regret: Differentially Private Inference-Time Alignment 精读

印度理工坎普尔提出推理时对齐的差分隐私方法 PrivBoN 与 PrivITP。核心洞察是:差分隐私与抗 reward hacking 本质上是同一个干预——把 Best-of-N 的硬 argmax 软化。PrivBoN 在奖励分数上加尺度 σ=2Δr/ε 的 Gumbel 噪声,等价于指数机制实现 ε-DP,同时等价于 KL 正则化对齐;当隐私预算超过阈值 ε* 时,隐私要求的噪声恰好就是对齐最优的正则,隐私零成本。PrivITP 进一步用 χ² 正则化拒绝采样加两阶段高斯机制,把正则参数与隐私参数解耦,隐私代价只随实际停时增长。实验中弱奖励模型下 BoN 出现负提升(GSM8K 上 −5.18%),而 PrivITP 反而 +0.81%,并在固定隐私预算下靠 FSRC 组合多答约 3 倍查询。

August 31, 2026 · 4 min

Survival-Guided Length Control for Efficient Diffusion Language Models 精读:用生存分析一次前向测出生成长度

扩散语言模型(DLM)迭代去噪生成文本,但标准 AOAR 解码对全体样本使用统一的保守长度预算 Lmax=1024,大量去噪步浪费在精修真实结束位置之后的冗余画布上。本文把生成长度选择重新表述为 [EOS] token 上的离散时间生存问题:对长 mask 画布做一次前向传播,把各位置的 [EOS] 概率解释为危险率,经均场近似连乘得生存曲线,再用期望等于生存概率求和的标准恒等式闭式算出期望长度,作为该样本的解码预算。方法免训练、即插即用,在 LLaDA-8B-Base 与 Dream-7B-Base 上取得 3.1-6.6 倍解码加速(instruct 模型最高 7.3 倍),任务精度变化全部落在标准差之内;固定均值长度消融与逐步漂移分析进一步证明逐样本长度预测的必要性。

August 31, 2026 · 3 min

The Approximation Rank of Softmax Attention: Sharp Geometric Laws and Robust Interaction Dimension 精读

Transformer 的注意力矩阵到底需要多高的秩才能被低秩近似?南洋理工大学与卡内基梅隆大学的理论工作给出了两条尖锐几何定律:当 query 与 key 都落在单位球面上时,输出保持的逼近秩按温度参数的 (d-1)/2 次幂增长;而换成整个单位球(多出一个径向自由度)后指数恰好变为 d/2。更有意思的是每个具体注意力头:softmax 的行归一化会精确商掉一批不可见的 logit 方向,剩下 r 维可见交互几何,逼近秩服从 minimax 尖锐的 r/2 指数定律。在 84 头 BERT-base 校准集上,SVD 有效维数与有限构造秩上证书的 Spearman 相关达 0.574/0.606,为『注意力头到底有多复杂』提供了可计算的几何量尺。

August 31, 2026 · 5 min