Nemotron IMO Gold 精读:开源模型金牌的完整配方——自然语言证明生成与测试时搜索管线

NVIDIA 公开 IMO 2026 金牌系统全部配方:Nemotron 3 Ultra 基座上 SFT+RL 两个专精 checkpoint,加验证器/评分器构成生成-验证-精炼迭代搜索与高算力终选,全程纯自然语言(无形式化证明器/外部工具/互联网),得分 30/42 达金牌线。全套 artifact 开源:两个 checkpoint、SFT/RL 训练数据、训练与推理代码、提交的证明、Nemotron-IMO-Bench(200 道新题)。同日 25 位菲尔兹奖得主联合声明使本文的伦理语境格外微妙。

September 13, 2026 · 1 min

Gander (Omni Interaction Agent Technical Report) 精读

腾讯混元语音与浙大等团队的 Gander 用’小脑-大脑’协作框架统一了全双工实时交互与长程 Agent 执行:9B 小脑以 Thinker-Talker 流式架构逐秒 chunk 决策听/说/打断,大脑免训练接入 Codex/Claude Code 执行长任务,编排运行时以 task_start/send/resolve 结构化调用衔接。Full-Duplex-Bench v3 上 turn-taking 100% 全场最佳、过早打断仅 8.0%(GPT-Realtime 13.5%);SpokenQA 全双工组第一。模型、代码、数据全部开源。

September 10, 2026 · 3 min

Why Gated DeltaNet Survives 4-Bit Quantization: NVFP4 W4A4 for the Recurrent Half of a Hybrid 27B LLM 精读

社区量化混合架构 LLM 时一致保留循环半区(Gated DeltaNet)的高精度,理由是’循环误差会累积’。Minima 直接把 NVFP4 W4A4 打满全部 496 个线性层:五任务平均仅 -0.52(种子噪声内),显存 17.5 GiB 最小、prefill 提速 14-19%。四重机制研究(块缩放局域化离群值→门控非线性压缩误差→delta-rule 主动遗忘→逐 token 代价被冲刷)解释了为什么直觉是错的。

September 7, 2026 · 3 min

Post-Training Language Models for Gold-Medal Performance in Coding Competitions 精读

在 IOI 2026 上,一个 AI 系统在与人类选手完全相同的比赛时间、提交限制和网络封锁下拿到 535.4/600 分,超过金牌线 174.3 分、超过人类最高分选手 37.1 分——据作者所知这是 AI 首次在 IOI 题集上超越人类冠军。NVIDIA 的这份技术报告完整拆解了达成路径:22000 道竞赛题策展、120 万条合成推理轨迹、SFT+RL 的分工实证、以及 GenCorrect 迭代修正策略。本精读重点解析该论文罕见的组件归因实验——SFT 贡献大头、RL 只打磨边界、测试时计算放大差距,以及’纯 SFT 的 Ultra 反超 SFT+RL 的 Nano’背后的并行采样机制。

September 4, 2026 · 3 min

On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability 精读

Qwen Team 的 Qwen3.8-Flash-Next 架构报告展示了一次教科书级的’联合设计’实践:GDN 线性注意力混合 + 压缩索引稀疏注意力(QSA)+ 四分支门控残差 + 主机内存 n-gram 嵌入,125B 总参 6B 激活的模型以约 1/9 训练 FLOPs 在 14 个基准上 8 个超越 397B 旗舰,1M 上下文预填充加速 7.6 倍,且 4 倍学习率压力测试下全程零 loss spike。报告最宝贵的不是单个组件,而是’loss、基准、效率、稳定性必须当一个问题解’的方法论,以及大量’loss 与下游精度背离’的诚实披露。

September 2, 2026 · 3 min

A Single Suffix to Break Them All: Basin-Aware Jailbreaks for Merged Model Families 精读

RIKEN AIP、东京科学大学与浙江大学团队提出并利用了模型合并家族的族级越狱威胁:即使所有成分模型都独立安全对齐,从同一预训练骨架派生的合并模型仍共享源自骨架的脆弱方向。BAJ 方法把越狱后缀生成形式化为合并空间上的 min-max 优化,用任务算术参数化盆地,交替执行后缀变异搜索与合并系数梯度上升,迫使后缀攻破全族最难攻击的构型。六个主流骨架上族级迁移成功率 61.3-89.1%,领先最强基线 22-34 点;跨六种合并方法、水印与量化部署依然有效;Perplexity 等现有防御几乎无效。消融证实:系数最大化搜索换成随机采样 TSR 从 65.8 跌至 32.4,攻击普通微调模型降至 27-51%,跨骨架迁移显著弱于同骨架——证明漏洞确实源自预训练骨架且由合并结构暴露。

August 31, 2026 · 3 min

Affix Cache for Diffusion Large Language Models 精读

扩散语言模型(DLLM)以双向注意力实现并行解码,但也因此丧失了自回归模型前缀缓存的红利——共享文本段的 KV 状态与不断演化的生成 token 相互耦合,直接跨请求复用会立刻过期。本文提出 ACache:在请求开始时用一次跨注意力探针找出少数对生成 token 影响最大的『锚点令牌』,之后只重算锚点与请求特有位置的 KV,其余共享段缓存跨请求复用。在 LLaDA-8B 与 Dream-7B 上,约 20% 锚点率即可恢复大部分精度损失;基于 Nano-vLLM 的原型将重算延迟最高降低 55.7%,端到端吞吐最高提升 1.68 倍,峰值 KV 显存最高下降 43.3%。这项工作首次把『跨请求缓存复用』引入 DLLM 推理系统,揭示了双向注意力下共享上下文管理的新范式。

August 31, 2026 · 3 min

LowRankArena: A Standardized Evaluation Platform for SVD-Based LLM Compression 精读

SVD 低秩压缩号称能省显存又保精度,但各家论文的评测基准、压缩率定义、推理后端各不相同,「进步」到底是方法变强还是协议不同造成的?杜克大学与维克森林大学团队发布 LowRankArena:统一任务版本(LM-Eval-Harness v0.4.11)、统一精度下的 keep ratio 定义、统一 vLLM 0.18.1 端到端推理测量,并开放 3TiB 以上压缩 checkpoint 动物园。对 5 种代表方法(ASVD、SVD-LLM、DoBi-SVD、Basis Sharing、MoDeGPT)×3 个骨干模型的对齐审计发现:排名随骨干剧烈变动、MCQ 准确率可掩盖困惑度坍塌(ASVD 0.353 恰好贴着 0.357 随机地板)、低秩省的是 FLOPs 而非时间——prefill 提速最高 4.20 倍,decode 场景 SVD-LLM 吞吐反而跌到 0.80 倍,且 5 个方法在单张 H200 上压缩 70B 全部因工程问题失败。

August 31, 2026 · 3 min

Survival-Guided Length Control for Efficient Diffusion Language Models 精读:用生存分析一次前向测出生成长度

扩散语言模型(DLM)迭代去噪生成文本,但标准 AOAR 解码对全体样本使用统一的保守长度预算 Lmax=1024,大量去噪步浪费在精修真实结束位置之后的冗余画布上。本文把生成长度选择重新表述为 [EOS] token 上的离散时间生存问题:对长 mask 画布做一次前向传播,把各位置的 [EOS] 概率解释为危险率,经均场近似连乘得生存曲线,再用期望等于生存概率求和的标准恒等式闭式算出期望长度,作为该样本的解码预算。方法免训练、即插即用,在 LLaDA-8B-Base 与 Dream-7B-Base 上取得 3.1-6.6 倍解码加速(instruct 模型最高 7.3 倍),任务精度变化全部落在标准差之内;固定均值长度消融与逐步漂移分析进一步证明逐样本长度预测的必要性。

August 31, 2026 · 3 min

VFA: Empowering Multilingual MLLMs via Vision-Free Adaptation 精读

南方科技大学、微软亚洲研究院、上海财经大学与北京大学团队提出 VFA(Vision-Free Adaptation),在不使用任何图文对数据的前提下增强多模态大模型的多语言能力。核心思路是把微调看作任务向量:在共享 LLM 底座上用 10 万条纯文本多语言数据微调基座 LLM 得到多语言任务向量,再用 WA/TA/TIES 三种合并算子注入到视觉对齐的 MLLM 语言骨干中,视觉编码器与投影层完全冻结。五个 MLLM 上六大多语言多模态基准平均增益 +0.57 到 +10.64,文化视觉推理 MaRVL 增益最大(Idefics3 +36.17),通用多模态能力持平或略升;而直接文本微调会让 Qwen2.5-VL 平均掉 11.92、MaRVL 从 53.50 崩到 0.00。VFA 仅用 Pangea 约 2% 的数据量达到 47.84 vs 50.34,训练成本约 10 A100 小时对 320 A100 小时,且框架可迁移到视觉编程等非多语言任务。

August 31, 2026 · 3 min