NSD 精读:教推理模型“别这么错”,比教它“该怎么对”更有效
UVA+Stanford 提出负面自蒸馏(NSD):针对 on-policy 自蒸馏(OPSD)模仿“带标准答案的伪自信轨迹”导致难推理任务退化的失败模式,构造“负条件”(注入已知缺陷的解)让学生显式规避。token 级自适应门控+gated unlikelihood 在七基准上 1.7B/4B/8B 平均 +2.3%/+7.5%/+6.0%,且保留自纠错行为——模型越大增益越高。
UVA+Stanford 提出负面自蒸馏(NSD):针对 on-policy 自蒸馏(OPSD)模仿“带标准答案的伪自信轨迹”导致难推理任务退化的失败模式,构造“负条件”(注入已知缺陷的解)让学生显式规避。token 级自适应门控+gated unlikelihood 在七基准上 1.7B/4B/8B 平均 +2.3%/+7.5%/+6.0%,且保留自纠错行为——模型越大增益越高。
UCD+CNR 提出“用户驱动自演化”新范式:终端用户用自然语言表达需求,软件在执行中自动生成并集成新功能。ReqEvolve 实现(需求解释→代码生成→运行时集成)在 72 个演化案例/18 项目基准上 Pass@1 89.2%,超 SpecFix +18.8pp(大效应量 r=0.79)。ASE 2026 已录用。
同日两篇论文从两端夹击“静态/测试通过=安全”的假设:Toronto Metropolitan 的 SPDF 度量静态过-动态败缺口(654 个静态干净样本中 14.53% 被运行时利用验证击穿);Tampere 大学的静默失败实证(1,030 条 Agent 修复轨迹中 170 例确认静默失败,Omission 占 48.2%)建立四维分类学。与 SWE-Gate、PatchBench 共同固化“测试通过≠安全”证据链。
Theseus Lab 32 人团队(含清华/上交,腾讯混元等六家工业案例)发布 RSI 系统综述:以改进闭环为分析单元、L1-L5 自治分级框架,用 HCI 指数量化 2023-2026 能力轨迹(工具 Agent 39.9 vs 数学 86.4——交互能力 headroom 最大),区分“结构递归”与“有效递归”,并给出安全继承/自治归因/可靠验证三大挑战的判定标准。
南京大学+九天团队提出 UniMPA:统一记忆-预测-动作模型,用共享的’动作锚定转移接口’解决 VLA 的转移可实现性缺口(转移歧义/预测失准/多阶段混淆)。LIBERO/LIBERO-Plus/RoboTwin 2.0 Hard/真机四线超 π0.5 达 1.7/11.7/18.5/12.6pp,只需 25-50% 训练 epoch。
WashU+SMU 发布 VP-Control:Agentic AI 提交门的代价感知验证组合设计。2880 场景确定性基准+2×2 因子实验证明:共享证据的跨模型投票批准 62.9% 不安全提案,独立证据源仅 22.9%——源效应 40.9pp vs 模型效应 11.3pp。共模数据失效让“多模型投票”这一直觉失效,组合控制器以部署可观测元数据实现 1.9% 不安全执行。
Manulife(加拿大金融集团)实证研究:Agent 技能检索器用合成任务微调后,最激进配置下 OOD recall 从 0.850 跌至 0.650(−20pp);合成数据使 Hit@10 持平但 Recall@10 −0.021——部分重排把额外正确技能挤出 top-10。同时证明 0.6B 紧凑检索器可追平更大混合系统:监督质量>模型规模。skill 数据飞轮假设的第一份系统性反例。
数据日 2026-09-11 两篇流程自动化论文合读:Meta 的 Auto-RecSys 把自主研究 Agent 部署到工业级推荐系统(分布式异步执行+集中记忆+认知-程序分离三大 harness 设计);Yale×芝大×腾讯的 ActReview 用 rebuttal 对齐数据+rubric 奖励训练同行评审生成模型(ActReview-40K 训练集+1,000 例人策基准)。
清华国际关系研究院名誉院长阎学通在与王骁的两小时半对谈中,以「个人利益驱动决策」为核心框架,重新解释了美伊战争为何爆发(内塔尼亚胡的求生欲与特朗普「最伟大总统」野心的合流)、为何两极化不等于新冷战(AI竞争没有代理人战争)、以及为何网络空间是平行于自然空间的「第二地缘」。他认为世界已进入「不安的和平」:逆全球化的弯已经拐完,未来十年国际合作越来越少、限制越来越多,而中美差距十年内缩小但不会全面反转——因为思想与文化影响力无法用钱买到。
9月10日主线:Harness 三部曲——语义接口下凡(Show-Harness 让 VLM 直接玩机器人、Programmable World Model 把世界状态变成可编程引擎)、harness 自动化生成三连发(Self-Play 蒸馏文本 harness、RobustSGPO 搜索空间控制、Cornell×MSR 的 Subagents vs Skills 实证);评测测量学危机深化(双测量混杂、Φ-Bench 揭示 LLM 工程化自身基础设施仅 36.5%);产业侧 DeepSeek V4.1 Flash 开源发布 + Apple AI 全家桶 + Anthropic 安全风波与 Jacob Coxon 离职潮。