<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/"><channel><title>推理 on MessageDaily</title><link>https://inkeast.github.io/MessageDaily/tags/%E6%8E%A8%E7%90%86/</link><description>Recent content in 推理 on MessageDaily</description><generator>Hugo</generator><language>zh-cn</language><lastBuildDate>Wed, 30 Sep 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://inkeast.github.io/MessageDaily/tags/%E6%8E%A8%E7%90%86/index.xml" rel="self" type="application/rss+xml"/><item><title>EAPO × DN-MOPD × d-OPD：大模型训练信号的三个盲区与最小修正 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-30-training-signal-trio-paper-reading/</link><pubDate>Wed, 30 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-30-training-signal-trio-paper-reading/</guid><description>同日三篇论文各自修复了 LLM 训练信号的一处失真：KAIST+DeepAuto.ai 的 EAPO 发现正负反馈下 token 熵的信息量不对称——正优势应强化高熵的「惊人成功」、负优势应纠正低熵的「重复失败」，符号-熵耦合重分配使 Qwen3-4B 六基准平均 31.0%（超最强基线 5.6pp，AIME24 20.2 vs GRPO 12.5）；NTU+耶鲁+曼彻斯特的 DN-MOPD（当日 Hugging Face 日榜 up=111 第一）发现等权多教师蒸馏中 IF 域反馈离散度是池化信号 2.3–4.4 倍、占联合梯度 94% 而淹没数学信号，批内测离散度+有界乘子重缩放即恢复各域均衡（8K 下 +2.47~+3.08）；清华+MIT+NVIDIA 的 d-OPD 识别出 AR→块扩散蒸馏的目标条件失配——教师只看因果前缀而学生看得见未来，Bayes 未来重加权把 token 级 KL 从 0.4444 降到 0.1249，8B 平均 59.8 vs 55.9。三者共同示范了「先诊断信号失真、再做最小修正」的方法论。</description></item><item><title>Encoder-Free Scaling Laws × UMM-Reflection：统一多模态模型的架构与反思双问 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-30-multimodal-duet-paper-reading/</link><pubDate>Wed, 30 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-30-multimodal-duet-paper-reading/</guid><description>本精读合并解读两篇直指「统一多模态模型」根本问题的论文：腾讯 + CASIA + UCAS 的 Encoder-Free Scaling Laws 用两条架构共享同一 11 级稀疏 MoE 解码器阶梯（1.1B–44B 总参）与同数据同优化设置的受控对比，首次给出 encoder-free 与 encoder-based MLLM 的双向 scaling law——文本目标两架构前沿几乎重叠（γ 0.0973 vs 0.0979），多模态目标 encoder-free 当前更差但下降更快（γ 0.3778 vs 0.2998），外推交叉点 6.1×10²¹ FLOPs（比旗舰模型预训练算力低约三个数量级），分主题 STEM 最早追平、OCR/Caption 最晚，配注意力质量（0.217→0.645）+ 表征余弦 + 专家路由三层机制探针解释「视觉 token 先慢后骤降」的学习动力学；NTU + 上海交大 + 东京大学的 UMM-Reflection 则是首个对统一模型完整多轮反思轨迹做 RL 的工作——共享根采样（K=16 兄弟轨迹共用一张 detach 初始图，组优势只比反思策略不比首抽运气）+ 整轨迹单一优势同时更新文本头与流头，GenEval 从 0.71 升至 0.84（超 SFT +12.05 点）、条件修复率 20.59%→64.94% 翻三倍，换指令实验（48.4% vs 20.5%）与线性探针（AUC 0.804→0.815 几乎不动、失败图落入 pass 区 34%→62%）证明 RL 是在骨干已有修复分布中「选对的切片」而非创造新能力。一篇回答预训练的结构问题（要不要视觉编码器），一篇回答后训练的能力问题（会不会自我反思），合成统一模型路线的完整纵切面。</description></item><item><title>MassAlloc Attention × DaRoPE：注意力计算分配与位置编码的双子星重构 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-30-architecture-duet-paper-reading/</link><pubDate>Wed, 30 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-30-architecture-duet-paper-reading/</guid><description>本精读合并解读两篇重构 Transformer 核心算子的论文：HKUST(GZ)×BAAI×巴黎西岱的 MassAlloc Attention（MALA）把稀疏注意力改写为「分布条件化的运行时计算分配」——保留全部 QK 打分，用 online-softmax 演化归一化因子做逐 tile 贡献比测试，跳过低贡献 tile 的 post-score 计算，同一容差 τ=1 统一前向/反向/prefill/解码，训练 FLOPs -23.1% 而 PPL 无损、关联回忆 89.67% 贴近 FullAttn（NSA 仅 22.61%）；Meta AI 巴黎×Inria 的 DaRoPE（ICLR 2027）诊断出 RoPE 慢频带这一具体弱点，快带保序、慢带换成 sigmoid 有界的逐头内容坐标，外推免配置，K=256 键值回忆 30.5% vs 其他方法 ≤7.25%。二者共享同一哲学：不做一刀切裁剪，让算子自己知道「哪里重要」。</description></item><item><title>Opera × CER：长程编码智能体的评论家介入与早期奖励预测 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-30-test-time-supervision-duet-paper-reading/</link><pubDate>Wed, 30 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-30-test-time-supervision-duet-paper-reading/</guid><description>本精读合并解读两篇在「轨迹还没走完」时提供质量信号的长程编码 Agent 论文：Salesforce AI Research 的 Opera 构建口头评论家框架——把每次修正管理为持久化笔记（混合调度五事件触发审查 + 九个契约化类型算子诊断 + 准入/发布双审计把关投递与关闭，并把「遵从」与「解决」分开跟踪），在 Terminal-Bench 2.1 / SWE-Bench Pro / DeepSWE v1.1 三基准上把 Qwen3.8-27B 的 resolve rate 提升 7.9/4.0/8.9pp，去掉双审计后增益损失 2/3，证明误导性反馈的代价之高；UW 等机构的 CER 则在 rollout 结束前从 40 步前缀预测终端奖励——用检索经验库合成任务自适应 rubric、同父兄弟续跑组内共享打分（组内序保持即足以支撑排名类下游），TTS 上 Nemotron 3 Ultra RM@8 达 67.6%（+4.2pp）且只用 15.3% token 匹配最佳基线（省 84.7%），RL 上 40 步截断 + 弃权门控 DPPO 以 52.7% 更少在线 token 超过全轨迹 TMax（51.6% vs 49.7%）。一个向内诊断当前轨迹，一个向前预测最终结局，合看构成测试时监督的两条互补路径。</description></item><item><title>训练机制三重奏精读：对数线性稀疏注意力、置信度停止与跨段信用分配</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-29-training-mechanisms-trio-paper-reading/</link><pubDate>Tue, 29 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-29-training-mechanisms-trio-paper-reading/</guid><description>本文合并精读 2026 年 9 月下旬三篇聚焦「训练时机制创新」的论文：上交+字节 Seed 的 PISA 把块稀疏注意力的选择阶段压到 O(N log N) 并用 LSE 打分提升选块质量；马里兰+Capital One 的 ConfSFT 只监督置信度、不监督长度，就让四家族模型推理 token 下降 10%~19%；北大+深大+腾讯的 SLCA-GRPO 识别并结构性消除工具调用 RL 中的跨段信用错配，7B/8B 上 τ2-Bench 分别提升 9.15/10.03 个百分点。每篇覆盖背景、关联工作、问题、解法、实验证据、优势根源（含外部交叉验证）、知识反推与通用灵感九部分，最后合并讨论「选择、停止与信用分配」这一共同主题。</description></item><item><title>Learning to Discover Interesting Mathematics 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-27-interesting-math-paper-reading/</link><pubDate>Sun, 27 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-27-interesting-math-paper-reading/</guid><description>当 LLM 已经能证明定理，真正的瓶颈变成「哪些定理值得提出」。FAIR@Meta 联合 NYU 与巴黎综合理工的这篇论文给出了一个不依赖人类判断的答案：把定理的有趣度定义为证明代价与陈述描述长度之比。他们训练了一个 27B 难度预测器（比 GPT-5.5 与 Claude Opus 4.6 都准），用有趣度作奖励把 conjecturer 的平均有趣度提升 4.3 倍、与 mathlib 的重合率从 91.9% 压到 30.6%，并用推理期剪枝驱动一个自扩展定理库。本精读覆盖其方法拆解、关键实验、机制根源分析与可迁移灵感。</description></item><item><title>当互联网的主体不再是人：云栖2026云网络专场，网络为什么重新变成稀缺品</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-24-yunqi2026-cloud-network-ai-innovation/</link><pubDate>Thu, 24 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-24-yunqi2026-cloud-network-ai-innovation/</guid><description>2026云栖大会云网络专场（9月24日）年度发布梳理：当AI相关流量超过公网流量一半，网络从&amp;quot;尽力而为的管道&amp;quot;重新变成确定性交付的稀缺品。本文从尾延时与推理性价比、用通信换计算、推理下沉边缘、Agent成为网络新主体、数据语言统一五条机制链，拆解英特尔、阿里云、网易互娱、小鹏汽车、Maxinsights、Megaport六方的一线说法，并给出可迁移的判断框架。</description></item><item><title>统一智能体双璧：MintAct 空间统一与递归语言模型推理统一 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-22-unified-agent-duet-paper-reading/</link><pubDate>Tue, 22 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-22-unified-agent-duet-paper-reading/</guid><description>本篇合并精读两篇关于「统一智能体」的论文，二者分别从空间域与推理结构两个维度回答同一个问题：能否用一个模型替代一堆专用模型而不掉点？Apple 的 MintAct 用 2B/4B/8B 单一 VLM 统一 UI grounding、移动/桌面/网页/VTU 四域导航与视觉工具调用，靠四阶段训练（高分辨单步 SFT→低分辨多步均衡 SFT→每域 RL 专家拒绝采样蒸馏→联合异步 RL）与异步四机制（配额、背压、双裁剪、截断 IS）在 OSWorld-Verified 上以 48.9 同尺寸登顶。TTIC 的《Recursive Language Models Generalize Out of Domain》则从理论（MDL）与受控实验证明：递归模型用「隔离上下文栈」让 CoT 在分布内占到的「看得全」的便宜，在分布外变成致命捷径——mod-10 长度泛化上 RM 95.7% 对 CoT 6.2%。两文共同揭示：统一的代价不在模型容量，而在如何控制「每个子任务看到什么」。</description></item><item><title>Cache-to-Cache: Direct Semantic Communication Between Large Language Models 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-20-c2c-kv-communication-paper-reading/</link><pubDate>Sun, 20 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-20-c2c-kv-communication-paper-reading/</guid><description>多 LLM 协作系统里模型之间只能&amp;rsquo;说话&amp;rsquo;（生成文本）——高维内部表征被压缩成一维 token 串再被对方解码，既丢语义又付逐 token 解码延迟。清华牵头、五机构合作的 C2C（ICLR 2026）给出替代范式：用小神经网络把 Sharer 模型的 KV-Cache 投影融合进 Receiver 模型，可学习门控逐层决定注入。四个基准上 C2C 比单模型平均高 6.4-14.2%，比文本协作高 3.1-5.4% 且平均 2.5 倍加速。本精读拆解其 oracle 实验→fuser 设计→消融全链路，并对照 DroidSpeak、Skeleton-of-Thought 等工作交叉验证&amp;rsquo;绕过文本&amp;rsquo;路线的边界。</description></item><item><title>State of Thought Enables Endogenous Reasoning 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-17-state-of-thought-endogenous-reasoning-paper-reading/</link><pubDate>Thu, 17 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-17-state-of-thought-endogenous-reasoning-paper-reading/</guid><description>测试时推理的现有范式要么给模型套外部推理程序（CoT/Plan-and-Solve），要么暴力扩展搜索（Self-Consistency/MCTS）——控制信号都是外生的。NTU 提出 State of Thought（SoT）：从模型内部信息传递提取紧凑动力学-几何状态，582 参数控制器在冻结 backbone 上按当前推理状态选择性激活历史推理支持——推理变成&amp;rsquo;证据上的状态条件化过程&amp;rsquo;。16 数据集×3 LLM：量化/通用/符号代码/长上下文推理平均提升 1.34×/1.62×/1.76×/2.51×，同时 token −62.6%、延迟 −44.6%；training-free 与 embedding-only 设定下仍保留 38.2%/36.5% 增益，证明内生状态信号真实存在且可低成本利用。</description></item><item><title>Thought without systematicity? Evaluating Reasoning Models on Rule Induction Tasks 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-16-thought-without-systematicity-paper-reading/</link><pubDate>Wed, 16 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-16-thought-without-systematicity-paper-reading/</guid><description>人类认知的核心特征 systematicity（系统性）——理解一个概念蕴含理解其变体。推理模型具备吗？普林斯顿（Brenden Lake 组）用规则归纳任务的同构变体（重组/替换）测试：&lt;strong&gt;能正确解决原任务的模型，常在同构变体上失败&lt;/strong&gt;——表面正确掩盖了系统性缺失。这一发现对&amp;rsquo;benchmark 分数=认知能力&amp;rsquo;的解读划出硬边界：模型可能记住了解法而非掌握规则。本精读覆盖同构变体方法学、系统性缺失的证据结构与对推理评测的连锁含义。</description></item><item><title>When Agents Slow Down: Elo-per-token 分析与 Agent 测试时策略 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-16-elo-per-token-agents-slow-down-paper-reading/</link><pubDate>Wed, 16 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-16-elo-per-token-agents-slow-down-paper-reading/</guid><description>Agent 在测试时的&amp;rsquo;减速&amp;rsquo;行为——更多 token 换来多少真实能力提升？本文提出 Elo-per-token 度量：以独立采样为理论参照（Elo 随 log compute 线性增长），定义 scaling inflection point（边际 Elo 增益跌至参照线的每会话预算）。4 个通用 Agent × 4 个开放基准、单会话最高 1 亿 token 的实验给出反直觉发现：AtCoder Heuristic Contest 上 Agent 超越历史最强人类选手的超线性提升是持续学习的证据——减速之后仍有巨大 headroom。本精读覆盖测试时 scaling 的度量学、独立采样参照的设计逻辑与&amp;rsquo;持续学习 vs 收益递减&amp;rsquo;的分界证据。</description></item><item><title>推理芯片之战：带宽成为新算力，Groq、Cerebras 与 OpenAI 的三条路线与 Bill Dally 的 location 哲学</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-16-inference-chip-wars-groq-cerebras-openai/</link><pubDate>Wed, 16 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-16-inference-chip-wars-groq-cerebras-openai/</guid><description>推理的瓶颈正在从算力转向带宽：每生成一个 token，都要把整个模型从存储介质读一遍。硅谷101本期请到两位正在做推理芯片创业的嘉宾——Bill Dally 的博士生 Mark 与前亚马逊 Annapurna 芯片软件栈科学家子阳，拆解 Groq 的静态调度、Cerebras 的晶圆级集成与 OpenAI Jalapeño 的 HBM4 通用路线为何是不同约束条件下的各自最优解，为什么中国关心 tokens per dollar 而美国关心 tokens per watt，以及推理速度如何决定模型智能的上限。</description></item><item><title>Nemotron IMO Gold 精读：开源模型金牌的完整配方——自然语言证明生成与测试时搜索管线</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-13-nemotron-imo-gold-open-recipe-paper-reading/</link><pubDate>Sun, 13 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-13-nemotron-imo-gold-open-recipe-paper-reading/</guid><description>NVIDIA 公开 IMO 2026 金牌系统全部配方：Nemotron 3 Ultra 基座上 SFT+RL 两个专精 checkpoint，加验证器/评分器构成生成-验证-精炼迭代搜索与高算力终选，全程纯自然语言（无形式化证明器/外部工具/互联网），得分 30/42 达金牌线。全套 artifact 开源：两个 checkpoint、SFT/RL 训练数据、训练与推理代码、提交的证明、Nemotron-IMO-Bench（200 道新题）。同日 25 位菲尔兹奖得主联合声明使本文的伦理语境格外微妙。</description></item><item><title>Looped Flows 精读：把“想得更久”做进架构——循环流的局部训练之路</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-12-looped-flows-reasoning-paper-reading/</link><pubDate>Sat, 12 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-12-looped-flows-reasoning-paper-reading/</guid><description>AITHYRA 访问研究者的 looped flows：状态化去噪器每步预测解并更新循环状态、ODE/SDE 步更新流状态，用局部训练目标绕开跨步反传的老大难。六个推理基准整体超先前 looped SOTA，ARC-AGI-1 58.8%、ARC-AGI-2 12.2%——循环模型在抽象推理上首次具备与主流推理范式对话的竞争力。</description></item><item><title>NSD 精读：教推理模型“别这么错”，比教它“该怎么对”更有效</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-12-nsd-negative-self-distillation-paper-reading/</link><pubDate>Sat, 12 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-12-nsd-negative-self-distillation-paper-reading/</guid><description>UVA+Stanford 提出负面自蒸馏（NSD）：针对 on-policy 自蒸馏（OPSD）模仿“带标准答案的伪自信轨迹”导致难推理任务退化的失败模式，构造“负条件”（注入已知缺陷的解）让学生显式规避。token 级自适应门控+gated unlikelihood 在七基准上 1.7B/4B/8B 平均 +2.3%/+7.5%/+6.0%，且保留自纠错行为——模型越大增益越高。</description></item><item><title>BeaconKV: Key-Value Cache Compression Guided by Beacon Queries for Efficient Large Reasoning Model Inference 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-10-beaconkv-thought-revisiting-kv-compression-paper-reading/</link><pubDate>Thu, 10 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-10-beaconkv-thought-revisiting-kv-compression-paper-reading/</guid><description>KV cache 压缩方法都用&amp;rsquo;最近的查询&amp;rsquo;预测未来注意力——本文发现长程推理中这个假设根本不成立：解码会不定期产生&amp;rsquo;思维重访令牌&amp;rsquo;（TRT），重新关注数千 token 之前的推理计划，而近期查询无法预知这次重访。关键观察是 TRT 对应的全局查询在嵌入空间聚成少数簇——只需为每簇维护一个&amp;rsquo;信标查询&amp;rsquo;（Continual FPS 在线选取），就能预判哪些 KV 将被重访。训练自由、无需改动架构：四个开源推理模型上内存最高压缩 5.8×、精度近全量、吞吐 +4.3×，对 RPC/R-KV 最高领先 31.7 个百分点。</description></item><item><title>ERPO: Entropy-Regularized Rank-Masked Policy Optimization for Test-Time RL in Code Generation 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-10-erpo-probe-ttrl-code-paper-reading/</link><pubDate>Thu, 10 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-10-erpo-probe-ttrl-code-paper-reading/</guid><description>测试时强化学习（TTRL）靠答案自投票构造奖励，但代码程序没有规范答案可比对——TTRL 由此与代码生成绝缘。本文提出 probe-driven TTRL：从题面自构造无输出探针输入，用候选程序行为一致性构造 Probe Consensus Reward；再用 ERPO 把 PCR 当作&amp;rsquo;负信号为主&amp;rsquo;的奖励——rank masking 屏蔽高共识半区、只抑制低共识程序，配合熵上限防止多样性坍缩。Qwen3-4B 在 LiveCodeBench 域内 pass@1 26.0→36.7、pass@16 34.4→46.3，零样本迁移 CodeContests 25.1→42.1，是唯一同时提升 pass@1 与 pass@k 的无标签方法。</description></item><item><title>Recognition-Refusal Misalignment in LLMs: Why Models Answer Structurally Unanswerable Questions 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-10-recognition-refusal-misalignment-paper-reading/</link><pubDate>Thu, 10 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-10-recognition-refusal-misalignment-paper-reading/</guid><description>LLM 会一本正经地回答 cot(-540°) 等于 0、(1).startswith(&amp;lsquo;1&amp;rsquo;) 是 True——这些结构上不可能有答案的问题。是模型&amp;rsquo;不知道&amp;rsquo;还是&amp;rsquo;知道但不拒答&amp;rsquo;？USC/ASU 团队给出机制级答案：残差流中存在线性可解码的&amp;rsquo;不可能性方向&amp;rsquo;（AUC 0.939），但它与安全拒答方向近正交（cos 0.087），且 base 模型中该几何已存在——模型&amp;rsquo;知道&amp;rsquo;却把信号接错了线路。沿识别方向的双向因果干预以 +33~+52pp 的剂量响应翻转行为。自信地回答不可能问题的失败由此被定位为路由失败而非编码失败。</description></item><item><title>Extremely Sparse Supervision: 0.05% 的 token 监督就能激励推理 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-08-extremely-sparse-supervision-paper-reading/</link><pubDate>Tue, 08 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-08-extremely-sparse-supervision-paper-reading/</guid><description>Amazon×Duke 在 on-policy 蒸馏设定下发现反直觉现象：每条推理轨迹仅监督 1–2 个关键 token（占全部生成 token 的 0.05%）即可匹配甚至超越全 token 训练的推理激励，跨 9 组师生配置、PPO-RLVR 与 Llama 模型一致成立。本文精读这一&amp;rsquo;有效学习不需要 token 密集&amp;rsquo;的证据链及其对后训练范式的改写意义。</description></item><item><title>Cliff: Learning Process Rewards from the First Mistake 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-04-cliff-first-mistake-paper-reading/</link><pubDate>Fri, 04 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-04-cliff-first-mistake-paper-reading/</guid><description>RLVR 用最终答案的对错给整条推理链打分，粒度太粗；PRM 要训练专用奖励模型，OPD 要求师生推理同构。Amazon Web Services 联合 UIUC 的 Cliff 给出过程监督的最小充分形式：只用现成 LLM 定位每个错误 rollout 的&amp;rsquo;第一个错误步&amp;rsquo;（Pitfall Step），把轨迹切成正确前缀与错误后缀，前缀正优势、后缀负优势。12 个场景上一致超越：比 On-Policy Distillation 高约 15%、比标准 GRPO 高约 7%，且弱教师（27B）下依然有效。本精读拆解&amp;rsquo;错误前缀之后无信息&amp;rsquo;这一核心洞察、token 级优势的构造细节，以及教师定位能力与人类标注 80% 一致率的验证实验。</description></item><item><title>Language Models Can Control Their Own Attention 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-04-declarative-attention-paper-reading/</link><pubDate>Fri, 04 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-04-declarative-attention-paper-reading/</guid><description>长上下文解码时，模型每生成一个 token 都要把整个 KV cache 读一遍——1M token 上下文意味着每步约 15GB 的内存搬运，而注意力其实高度集中。KAIST AI 联合 Google DeepMind 提出 Declarative Attention：让模型在思维链里用 &lt;global&gt;/&lt;focus&gt;/&lt;local&gt; 三种标签自己声明&amp;rsquo;现在需要看哪里&amp;rsquo;，推理引擎像解析工具调用一样解析声明并跳过绝大部分 KV 读取。零训练、零外部打分器，15 个长上下文任务上 Gemma-4-31B 注意 token 降 52.0%、精度仅降 1.27pp。本精读拆解三模式协议、与代理打分式稀疏注意力的机制差异，以及&amp;rsquo;模型自己最知道该看哪里&amp;rsquo;的第一性原理。</description></item><item><title>Post-Training Language Models for Gold-Medal Performance in Coding Competitions 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-04-nemotron-ioi-gold-paper-reading/</link><pubDate>Fri, 04 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-04-nemotron-ioi-gold-paper-reading/</guid><description>在 IOI 2026 上，一个 AI 系统在与人类选手完全相同的比赛时间、提交限制和网络封锁下拿到 535.4/600 分，超过金牌线 174.3 分、超过人类最高分选手 37.1 分——据作者所知这是 AI 首次在 IOI 题集上超越人类冠军。NVIDIA 的这份技术报告完整拆解了达成路径：22000 道竞赛题策展、120 万条合成推理轨迹、SFT+RL 的分工实证、以及 GenCorrect 迭代修正策略。本精读重点解析该论文罕见的组件归因实验——SFT 贡献大头、RL 只打磨边界、测试时计算放大差距，以及&amp;rsquo;纯 SFT 的 Ultra 反超 SFT+RL 的 Nano&amp;rsquo;背后的并行采样机制。</description></item><item><title>AdaThinking-E: One-Token Entropy Regulation for Adaptive Thinking 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-31-adathinking-e-paper-reading/</link><pubDate>Mon, 31 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-31-adathinking-e-paper-reading/</guid><description>美团联合上海交大、中科院自动化所提出 AdaThinking-E，用一个 token 的熵调节教会文档理解多模态大模型自主决定何时深度思考。该方法把模式切换 token 与回答 token 分开优化，前者用熵奖励驱动从高熵探索到低熵决策的课程式过渡，后者只关心答案质量，从而避免了 GRPO/DAPO 训练中模式坍缩为全不思考的通病。在 8 个文档基准上，7B 模型以 27% 的思考率追平 SOTA 自适应思考模型 82% 思考率的效果，OCR-Reasoning 相对基座提升 10.8 个百分点，实现了该想才想、不该想不想的效率与精度兼得。</description></item><item><title>Affix Cache for Diffusion Large Language Models 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-31-acache-dllm-paper-reading/</link><pubDate>Mon, 31 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-31-acache-dllm-paper-reading/</guid><description>扩散语言模型（DLLM）以双向注意力实现并行解码，但也因此丧失了自回归模型前缀缓存的红利——共享文本段的 KV 状态与不断演化的生成 token 相互耦合，直接跨请求复用会立刻过期。本文提出 ACache：在请求开始时用一次跨注意力探针找出少数对生成 token 影响最大的『锚点令牌』，之后只重算锚点与请求特有位置的 KV，其余共享段缓存跨请求复用。在 LLaDA-8B 与 Dream-7B 上，约 20% 锚点率即可恢复大部分精度损失；基于 Nano-vLLM 的原型将重算延迟最高降低 55.7%，端到端吞吐最高提升 1.68 倍，峰值 KV 显存最高下降 43.3%。这项工作首次把『跨请求缓存复用』引入 DLLM 推理系统，揭示了双向注意力下共享上下文管理的新范式。</description></item><item><title>Mutual Debiasing via Dual-Seed Comparison for Probabilistic Sampling in Large Language Models 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-31-dsc-dual-seed-sampling-paper-reading/</link><pubDate>Mon, 31 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-31-dsc-dual-seed-sampling-paper-reading/</guid><description>LLM 能讲清概率分布，却抽不出一个符合分布的随机数——这是被多项研究证实的「认知-行为鸿沟」。山东大学与浙江师范大学团队提出 DSC（双种子比较）：让模型生成两条独立随机字符串，逐位置比较 ASCII 序值得到 16 位比特串，再经透明算术管线转成均匀变量并映射到目标分布。理论上比较位偏离公平硬币的概率仅为字符碰撞率的一半；实验中 DSC 在 25 个模型-分布条件的 24 个上取得最低 KS 统计量，误差相对最强基线中位数降低 58.5%，在选择题答案位置控制与属性约束文生图等下游任务中同样显著去偏。</description></item><item><title>Neuro-symbolic PRM: Enhancing Scientific Reasoning via Structured Traces and Symbolic Verification 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-31-ns-prm-paper-reading/</link><pubDate>Mon, 31 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-31-ns-prm-paper-reading/</guid><description>工具增强 LLM 已经能消灭绝大多数计算与语法错误，但一个隐蔽的失败模式仍在：公式用对了变量却用错了——推理步语法完好、数学可执行、量纲一致，却完全脱离题意。本文提出 NS-PRM，把『推理正确』解耦为符号有效性 V 与语义接地性 G 两个维度：确定性符号验证器（JSON Schema 语法检查+数学等价+Pint 量纲分析，覆盖 128 个计算原语与 15 个逻辑原语）作为硬过滤器保证 V；PRM 只在验证器接受的空间上对 G 条件评分。训练侧引入反事实符号扰动 CSP，算法化生成『完美通过验证器但逻辑错误』的硬负例；推理侧采用验证器优先的约束 beam 搜索。最终 ProcessBench 平均 F1 达 74.2、PRMBench 77.3，均超 9 个 PRM 基线；同等算力下 beam 宽度近翻倍，MATH 零额外成本提升 4.5 个百分点。</description></item><item><title>Privacy Without Regret: Differentially Private Inference-Time Alignment 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-31-privbon-dp-alignment-paper-reading/</link><pubDate>Mon, 31 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-31-privbon-dp-alignment-paper-reading/</guid><description>印度理工坎普尔提出推理时对齐的差分隐私方法 PrivBoN 与 PrivITP。核心洞察是：差分隐私与抗 reward hacking 本质上是同一个干预——把 Best-of-N 的硬 argmax 软化。PrivBoN 在奖励分数上加尺度 σ=2Δr/ε 的 Gumbel 噪声，等价于指数机制实现 ε-DP，同时等价于 KL 正则化对齐；当隐私预算超过阈值 ε* 时，隐私要求的噪声恰好就是对齐最优的正则，隐私零成本。PrivITP 进一步用 χ² 正则化拒绝采样加两阶段高斯机制，把正则参数与隐私参数解耦，隐私代价只随实际停时增长。实验中弱奖励模型下 BoN 出现负提升（GSM8K 上 −5.18%），而 PrivITP 反而 +0.81%，并在固定隐私预算下靠 FSRC 组合多答约 3 倍查询。</description></item><item><title>Survival-Guided Length Control for Efficient Diffusion Language Models 精读：用生存分析一次前向测出生成长度</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-31-survival-dllm-length-paper-reading/</link><pubDate>Mon, 31 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-31-survival-dllm-length-paper-reading/</guid><description>扩散语言模型（DLM）迭代去噪生成文本，但标准 AOAR 解码对全体样本使用统一的保守长度预算 Lmax=1024，大量去噪步浪费在精修真实结束位置之后的冗余画布上。本文把生成长度选择重新表述为 [EOS] token 上的离散时间生存问题：对长 mask 画布做一次前向传播，把各位置的 [EOS] 概率解释为危险率，经均场近似连乘得生存曲线，再用期望等于生存概率求和的标准恒等式闭式算出期望长度，作为该样本的解码预算。方法免训练、即插即用，在 LLaDA-8B-Base 与 Dream-7B-Base 上取得 3.1-6.6 倍解码加速（instruct 模型最高 7.3 倍），任务精度变化全部落在标准差之内；固定均值长度消融与逐步漂移分析进一步证明逐样本长度预测的必要性。</description></item><item><title>The Approximation Rank of Softmax Attention: Sharp Geometric Laws and Robust Interaction Dimension 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-31-softmax-approximation-rank-paper-reading/</link><pubDate>Mon, 31 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-31-softmax-approximation-rank-paper-reading/</guid><description>Transformer 的注意力矩阵到底需要多高的秩才能被低秩近似？南洋理工大学与卡内基梅隆大学的理论工作给出了两条尖锐几何定律：当 query 与 key 都落在单位球面上时，输出保持的逼近秩按温度参数的 (d-1)/2 次幂增长；而换成整个单位球（多出一个径向自由度）后指数恰好变为 d/2。更有意思的是每个具体注意力头：softmax 的行归一化会精确商掉一批不可见的 logit 方向，剩下 r 维可见交互几何，逼近秩服从 minimax 尖锐的 r/2 指数定律。在 84 头 BERT-base 校准集上，SVD 有效维数与有限构造秩上证书的 Spearman 相关达 0.574/0.606，为『注意力头到底有多复杂』提供了可计算的几何量尺。</description></item><item><title>TreeGraft 精读：多起草器共嫁接一棵草稿树，让投机解码跨越快与好的单选题</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-31-treegraft-paper-reading/</link><pubDate>Mon, 31 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-31-treegraft-paper-reading/</guid><description>树形投机解码用一个起草器建草稿树，陷入『小模型快但树差、大模型树好但慢』的两难。TreeGraft 让免训练 n-gram 小起草器与预训练中间起草器共同构建一棵共享草稿树：中间起草器可回看全树历史节点重新打分并复活被低估的路径（Where），嫁接时不覆盖既有子树（How），再由离线价值系统蒸馏出的 3265 参数轻量调度器逐步决定是否值得调用中间起草器（When）。在 10 个模型对 × 6 个基准上平均加速 1.60 倍，超两个单起草器端点中较优者 15.1%，且在留出模型对与完全留出的 MT-Bench 任务上仍保持 1.48 倍与 1.60 倍，证明调度器学到的是可迁移的成本-质量权衡。</description></item><item><title>When the Canonical Completion Is Wrong: Formalizing and Measuring the Jump in Large Language Models 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-31-llm-jump-formalization-paper-reading/</link><pubDate>Mon, 31 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-31-llm-jump-formalization-paper-reading/</guid><description>「LLM 不能跳变（jump）」——即无法完成爱因斯坦式的从证据到新公理系统的溯因飞跃——是一个流传甚广的论断，但从来没人给出过「跳变」的形式化定义和可检验的度量。剑桥大学与新南威尔士大学团队用范畴论补上了这块拼图：把跳变拆成四步（默认补全是什么、何时被迫放弃、放弃何时正确、跳变如何复合），并测量第二步。左/右 Kan 扩张给出模型无约束时的「默认答案」（已被证明等价于误差最小化归纳，校准实验证实 98% 无约束输出确实是它）；跳变实例则携带机器可验证证书保证正确答案存在、唯一且必异于默认。结果出人意料：4 个前沿模型在全部 248 次约束试验中，一次也没有退回被排除的默认答案（Kan-default 率为零）——选择步不是瓶颈，若无能真实存在，位于生成约束或发明框架的上游。</description></item><item><title>ProofEvolve: Neuro-Symbolic Evolution for Formal Automated Theorem Proving 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-29-proofevolve-theorem-proving-paper-reading/</link><pubDate>Sat, 29 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-29-proofevolve-theorem-proving-paper-reading/</guid><description>神经定理证明器一直有个结构性缺陷：证明经验要么锁在模型参数里、要再训练一轮才能影响后续问题，要么只在当前问题内共享，失败尝试中已验证的成果随搜索结束一起丢弃。UVA 与 Meta AI 的 ProofEvolve 把定理证明变成一场显式符号结构的进化：固定权重的 LLM 提出分解、修复、schema 重组三类变异，Lean 4 内核验证每一步转换，verified closure 把二值成败变成分级适应度，已证明的子结构提取为持久 schema 库跨问题继承。三个竞赛级基准平均解决率 57.8%，超最强基线 LEAP 7.3 个点，最依赖多引理组装的 IMO 级基准提升最大达 16.6 个点。本文精读其进化机制设计与效果优势的因果链条。</description></item><item><title>The Reasoning Tax: Token Economics of LLM Reasoning Across Task Types and Deployment Contexts 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-29-reasoning-tax-token-economics-paper-reading/</link><pubDate>Sat, 29 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-29-reasoning-tax-token-economics-paper-reading/</guid><description>推理模型在回答前会生成大量思考 token，但这些思考是否值得其成本？联想基础设施方案集团的这篇论文提出边际效率指标 Token Economy Score（TES），用准确率增益除以生成 token 倍数来度量推理模式的性价比，并在 151 个模型-基准组合上给出三个部署结论：任务结构比名义难度更能预测推理收益，序列推理任务（数学竞赛、代码）高 TES 而知识回忆型任务（MMLU-Pro、GPQA）低 TES；提高推理努力档位呈尖锐边际递减甚至负增益；思考链占总推理成本中位数高达 94.7%，而自建 MoE 集群可把云端成本再降 2.0 至 25.6 倍。本精读覆盖指标设计、实验证据、因果解释与可迁移的通用灵感。</description></item><item><title>Adaptive Triggering for Bias Correction in LLM Reasoning 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-27-adaptive-triggering-paper-reading/</link><pubDate>Thu, 27 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-27-adaptive-triggering-paper-reading/</guid><description>亚利桑那州立大学团队把「推理过程中何时注入反偏见干预」形式化为在线变点检测问题：每步计算一个偏见风险信号，喂入 CUSUM 统计量，仅当累积证据越过校准阈值时才注入定向反思提示。黑盒版（LLM 裁判打分）在 gpt-4o-mini 上以 0.33 次/题的干预频率恢复了固定周期干预损失的大部分消歧准确率（90.1% vs 82.9%），独立裁判下仍成立。白盒版（next-token 概率信号）在全部六个开源模型上提升歧义项准确率、却在五个模型上损害消歧项——它无法区分「依赖刻板印象」与「恰好与刻板印象一致的正当证据」，证明再好的触发时机也救不了错位的信号。论文还修复了 BBQ 基准四处未记录的标签匹配不一致，并指出「未完成率」是被误当准确率损失的一种独立干预代价。</description></item><item><title>Prefix Sliding for efficient test-time scaling 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-27-prefix-sliding-paper-reading/</link><pubDate>Thu, 27 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-27-prefix-sliding-paper-reading/</guid><description>斯坦福、华盛顿大学联合 Prime Intellect 等机构提出 Prefix Sliding：推理时只保留前缀（系统指令+prompt，充当注意力锚点）+ 最近数千 token 滑动窗口，丢弃中间推理 token。基于「中间 token 完成子任务后即失去重要性」的注意力概率观察，免训练即可让现有模型提速 3 倍而性能不降；配合截断反向传播，RL 可训练 10 万 token 级长推理轨迹。方法极简但解决了「无限测试时扩展必须有界每 token 成本」这一根本问题。</description></item><item><title>Reflection Steering: Disentangling Reflection from Reasoning in Activation Space for Token-Efficient Inference 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-27-reflection-steering-paper-reading/</link><pubDate>Thu, 27 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-27-reflection-steering-paper-reading/</guid><description>香港四校合作提出 Reflection Steering：一个免训练的激活空间干预框架，用于抑制大推理模型中冗余的反思行为。方法通过 PCA 去噪、对共享推理方向正交化、逐层校准和有界投影删除四阶段，把「反思方向」从「通用推理方向」中解缠出来，在 6 个模型×基准设置中平均节省 16.9% 的思考 token，MATH-500 上精度统计等效。本精读完整拆解其方向净化机制、层校准协议与统计验证方法。</description></item><item><title>BDH-CQ: In-Context Learning with Recurrent Latent Reasoning 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-11-bdh-cq-recurrent-latent-reasoning-paper-reading/</link><pubDate>Tue, 11 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-11-bdh-cq-recurrent-latent-reasoning-paper-reading/</guid><description>深度精读 Pathway 公司的 BDH-CQ（Dragon Hatchling 架构家族）——一种用 150M 参数挑战 ARC-AGI-1 的后 Transformer 序列模型。它抛弃了主流大模型&amp;rsquo;生成自然语言思维链&amp;rsquo;的推理范式，转而在高维潜在空间中迭代计算 R 次，把每次推理成本压到 0.85 GPU-秒、约 0.0007 美元，却能在 ARC-AGI-1 公共集上拿下 29.5% pass@2，比 GPT-5.6 Luna(Low) 便宜约 57 倍。本文用通俗类比讲透&amp;rsquo;潜在推理&amp;rsquo;、&amp;lsquo;循环记忆&amp;rsquo;与&amp;rsquo;低秩通信&amp;rsquo;的本质，并解释为什么这套结构在&amp;rsquo;抽象推理流体智力&amp;rsquo;基准上能弯道超车大它三个数量级的模型。</description></item><item><title>一片晶圆的赌局：Cerebras如何从 Scaling Law 的实验室走向千亿推理市场</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-07-cerebras-wafer-scale-inference/</link><pubDate>Fri, 07 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-07-cerebras-wafer-scale-inference/</guid><description>硅谷101专访Cerebras早期投资人周南、前百度研究员Greg Diamos及产品高管Angela，复盘这家&amp;quot;晶圆级引擎&amp;quot;公司十年史。从百度三亿参数模型发现Scaling Law、2016年赌注式投资、良率工程突破，到G42订单、OpenAI两百亿美元推理合同、千亿市值IPO，文章梳理了Cerebras如何从一个物理学的疯狂赌注，变成推理时代绕开HBM与CoWoS瓶颈的差异化基础设施，以及上市后毛利率、供应链和客户自研芯片带来的真实风险。</description></item></channel></rss>