训练前沿四重奏:蒸馏外推、规模解除、奖励治理与具身评测 精读

本篇合读 2026 年 9 月底集中出现的四篇训练侧前沿论文:RIDE 把「教师是方向不是终点」操作化为表示空间的 RL 残差外推,四组基座全部追平或超越教师;OASIS 诊断出在线自蒸馏的规模瓶颈源于「在教师不可模仿处监督」,用验证脚手架解除;ProRubric 把 Rubric-RL 奖励攻击的根因从准则文本转移到聚合方式,合取式协议级评分回收三分之一损失;GPT-6 Astra 具身评测则以六域系统实验界定前沿模型「任务决策强、物理控制弱」的能力边界。四篇合起来构成一条主线:监督信号放对了空间、放对了状态、用对了聚合、并诚实面对能力边界。

October 2, 2026 · 8 min

【每日AI前沿追踪】2026年09月30日 核心技术与产业动态速递

今日双主线:OpenAI DevDay 2026 以 Dots 常驻智能体+GPT-6.1 Sol 重塑智能体经济版图,与 Anthropic IPO 招股书披露 2 万亿美元估值野心;学术侧 58 篇深读呈现 Agent 可靠性研究爆发——从内源失配、基准作弊到 RSI 平稳性理论,代码智能全面进入’过程可信’时代。

September 30, 2026 · 12 min

AI娱乐的版本答案还没出现:从猫箱到动念引线,梁琛奇推演“烧token的新平台”

晚点聊对话96年生的前猫箱负责人梁琛奇。他在字节七年做过抖音朋友页、从零立过实时社交产品,2023年在Flow做出猫箱,2025年创立动念引线(Dayfold),先后做出AI漫画社区"松果时刻"等产品。他的核心推演:能诞生新平台的娱乐体验必须在"消费时"烧token而非只在创作时;文字ROI已在2025年打正,图片会沿"漫画先行"路径成熟;新体验的雏形将在一到两年内出现。本文拆解其推理链条、组织方法与行业分歧——泛创作普及,还是大部分人闲暇只会被动杀时间。

September 30, 2026 · 1 min

CAMG × Comet-9B:文件即记忆与程序状态推理的 Agent 训练新范式 精读

本篇精读两篇 2026 年 9 月的代码 Agent 训练论文:京东的 CAMG/CAMG-RL 发现专用记忆工具落在预训练分布之外(surprisal 6.371 vs 0.252 nats/token),转而用纯任务奖励让 shell 文件操作自发生长为记忆,4B 模型追平 35B;UCSB 与微软合作的 Comet-9B 不直接训练写补丁,而是训练「程序状态推理」(bug 何时触发、错误如何传播),反而把 SWE-bench Pro 从 24.35 推到 30.51。两篇论文共同指向一个反直觉结论:不直接优化目标行为,而是优化能迁移的中间能力。文章按背景、定位、问题、解法、证据、根源、知识反推、通用灵感九部分展开,并用外部文献交叉验证两大机制。

September 30, 2026 · 7 min

CoDeL × ReproBench:智能体安全的攻防共进化与漏洞复现评估 精读

本精读合读两篇智能体安全新工作:北航 CoDeL 将间接提示注入防御形式化为攻防共进化训练,首创「攻击潜伏期」可度量信号,在 AgentDojo 上将攻击成功率从 0.364 压到 0.042(−88.5%)同时受攻效用提升 38%;中科院软件所 ReproBench 则把 LLM 漏洞复现评估推入 pre-environment 设定,用真目标门控暴露出 45.3% 的「仿真替代」失败模式。一篇教智能体抵御攻击、一篇测智能体发起攻击的能力,恰构成安全能力的攻守双向标尺。

September 30, 2026 · 3 min

CodeSkill × NanoHarness:技能抽象与 Harness 效应——被低估的智能体性能杠杆 精读

本精读合并解读两篇从「模型权重之外」挖掘编码智能体性能的论文:清华+华为诺亚+上交的 CodeSkill 把长程 RL 从 token 级提升到技能级——teacher 蒸馏三级文本技能(目标/执行/控制),分层 VAE + Gumbel-Softmax 执行反馈门控边界把离散技能映射为连续隐变量 zH/zM/zL,以软提示前缀注入冻结 LLM(LoRA),PPO 在隐空间优化;SWE-bench Verified 76.2、EvalPlus 99.2 开源第一,交互步数 12.3→6.8(−45%),去掉 VAE 直接用文本技能+RL 则 BigCodeBench 从 94.8 掉到 88.4。南京理工+TUM+南京大学的 NanoHarness 首次把 harness(模型外基础设施)作为一等研究对象做组件级受控分解:固定模型下 harness 差 19.4pp vs 模型差 22.8pp;在 mini-SWE-agent 上增量加五组件,工具注册表 +4.57pp、任务特定子代理 +5.91pp,而上下文压缩 −4.86pp——机制是结构化工具把无序 shell 探索变针对性调用(jqlang 案例 133 次探测→43 次、通过率 24.68%→68.17%)。二者共同指向:技能结构与 harness 设计是被系统低估的性能杠杆。

September 30, 2026 · 6 min

Codoku × SecProbe:可再生谜题与自适应出题的评估方法学双星 精读

本精读合并解读两篇互为犄角的评估方法学论文:ETH Zurich(含 Zhendong Su)的 Codoku 用 semantic reification(PLDI'26)从零合成 witness 程序、掩码成程序推理谜题,以全局约束 Φ 验证任意有效填充——谜题不编译、不可执行,执行/调试/穷举三条捷径全部失效(16,200 个填充仅 6 个有效),GLM 5.2 五分钟解光 CruxEval 全部 1600 题,而 Codoku large 最强模型仅 54%,小谜题不足 40 行仍让最强模型漏 23%+,专有/开源差距从 26pp 拉大到 37pp;Notre Dame 等 8 机构的 SecProbe 把心理测量学的 2PL IRT 与自适应测试引入 agent 安全评测,用 information-gap 分数定位「能力密集但信息不足」区域,驱动五专家 agent 管线按 12 维难度向量按需合成仓库级漏洞修复任务(353 任务/151 CWE,最强 GLM-5.3 pass 仅 28.33%),同等估计精度比随机合成省 29.5% 任务、held-out 能力估计 RMSE 0.110 vs 0.140。一篇治污染与作弊,一篇治饱和与低效,合看是基准评估两大顽疾的两份独立解方。

September 30, 2026 · 4 min

Diffusion Reward Models × SOLO:成熟技术的首次规模化双案例 精读

同日两篇论文在各自领域做了同一件事:把一项被搁置多年的成熟技术,用一个机制创新首次推到现代规模。清华 thunlp+港中文+UIUC 的 Diffusion Reward Models(DRM,当日 Hugging Face 日榜 up=22)把扩散模型首次引入奖励建模——奖励从点估计变为条件密度估计 p(r|x,y),轻量 DiT 头无参数族假设地表示人类偏好的多峰结构(多峰率随标注分歧 37.6%→63.2%,Wasserstein 距离全表最低),同骨干同数据受控对比平均 66.2 vs ArmoRM 62.3(+3.9);中科院自动化所的 SOLO 把局部学习(local learning)首次推到十亿参数 LLM 预训练——用一个所有模块共享的终端 readout 只读副本打破 update locking,梯度对齐 cos 从 0.52 升至 0.70,流水线激活内存降近 p 倍、吞吐达 1F1B 的 1.44×。二者方法论同构:识别被搁置的旧技术、诊断其规模化障碍、用一个机制创新解锁,为「旧思想在新规模下复活」提供了可复用的模板。

September 30, 2026 · 9 min

EAPO × DN-MOPD × d-OPD:大模型训练信号的三个盲区与最小修正 精读

同日三篇论文各自修复了 LLM 训练信号的一处失真:KAIST+DeepAuto.ai 的 EAPO 发现正负反馈下 token 熵的信息量不对称——正优势应强化高熵的「惊人成功」、负优势应纠正低熵的「重复失败」,符号-熵耦合重分配使 Qwen3-4B 六基准平均 31.0%(超最强基线 5.6pp,AIME24 20.2 vs GRPO 12.5);NTU+耶鲁+曼彻斯特的 DN-MOPD(当日 Hugging Face 日榜 up=111 第一)发现等权多教师蒸馏中 IF 域反馈离散度是池化信号 2.3–4.4 倍、占联合梯度 94% 而淹没数学信号,批内测离散度+有界乘子重缩放即恢复各域均衡(8K 下 +2.47~+3.08);清华+MIT+NVIDIA 的 d-OPD 识别出 AR→块扩散蒸馏的目标条件失配——教师只看因果前缀而学生看得见未来,Bayes 未来重加权把 token 级 KL 从 0.4444 降到 0.1249,8B 平均 59.8 vs 55.9。三者共同示范了「先诊断信号失真、再做最小修正」的方法论。

September 30, 2026 · 5 min

Encoder-Free Scaling Laws × UMM-Reflection:统一多模态模型的架构与反思双问 精读

本精读合并解读两篇直指「统一多模态模型」根本问题的论文:腾讯 + CASIA + UCAS 的 Encoder-Free Scaling Laws 用两条架构共享同一 11 级稀疏 MoE 解码器阶梯(1.1B–44B 总参)与同数据同优化设置的受控对比,首次给出 encoder-free 与 encoder-based MLLM 的双向 scaling law——文本目标两架构前沿几乎重叠(γ 0.0973 vs 0.0979),多模态目标 encoder-free 当前更差但下降更快(γ 0.3778 vs 0.2998),外推交叉点 6.1×10²¹ FLOPs(比旗舰模型预训练算力低约三个数量级),分主题 STEM 最早追平、OCR/Caption 最晚,配注意力质量(0.217→0.645)+ 表征余弦 + 专家路由三层机制探针解释「视觉 token 先慢后骤降」的学习动力学;NTU + 上海交大 + 东京大学的 UMM-Reflection 则是首个对统一模型完整多轮反思轨迹做 RL 的工作——共享根采样(K=16 兄弟轨迹共用一张 detach 初始图,组优势只比反思策略不比首抽运气)+ 整轨迹单一优势同时更新文本头与流头,GenEval 从 0.71 升至 0.84(超 SFT +12.05 点)、条件修复率 20.59%→64.94% 翻三倍,换指令实验(48.4% vs 20.5%)与线性探针(AUC 0.804→0.815 几乎不动、失败图落入 pass 区 34%→62%)证明 RL 是在骨干已有修复分布中「选对的切片」而非创造新能力。一篇回答预训练的结构问题(要不要视觉编码器),一篇回答后训练的能力问题(会不会自我反思),合成统一模型路线的完整纵切面。

September 30, 2026 · 6 min