IdeaAMBIG 精读:从论文想法到能跑的代码之间,隔着 660 个“没人写的细节”
Yale×TUM×腾讯发布 IdeaAMBIG:660 个证据落地的“实现关键缺口”基准(163 个真实缺口来自可复现性报告与 GitHub issue + 497 个受控合成缺口),评测 LLM 能否发现科研想法规格中的缺失决策。13 个 LLM 最好者 Macro Defect Recovery 仅 9.6%——想法到实现的鸿沟被首次量化,且当前模型几乎看不见它。
Yale×TUM×腾讯发布 IdeaAMBIG:660 个证据落地的“实现关键缺口”基准(163 个真实缺口来自可复现性报告与 GitHub issue + 497 个受控合成缺口),评测 LLM 能否发现科研想法规格中的缺失决策。13 个 LLM 最好者 Macro Defect Recovery 仅 9.6%——想法到实现的鸿沟被首次量化,且当前模型几乎看不见它。
AITHYRA 访问研究者的 looped flows:状态化去噪器每步预测解并更新循环状态、ODE/SDE 步更新流状态,用局部训练目标绕开跨步反传的老大难。六个推理基准整体超先前 looped SOTA,ARC-AGI-1 58.8%、ARC-AGI-2 12.2%——循环模型在抽象推理上首次具备与主流推理范式对话的竞争力。
独立研究者 Haseeb Mohammed Afsar 对 MCP 注册表做首个未修复概率样本审计:24,135 服务器普查中概率抽 400 个 npm/stdio 服务器在线探测,仅 48.8% 完成 initialize 握手(手工精选框架 66.7%),37.5% 根本无法启动;能跑的 195 个硬一致性 100%,但安全注记缺失率 58.8% vs 精选 41.5%——整个领域的采样偏差第一次被量化。
上海交大 Intern-NCP 团队发布 8.9B/5.73T tokens 的潜空间语言模型 NCP-ArchPreview:在 next-token prediction 之上引入 Next Concept Prediction 目标,仅用 51.3% 训练 tokens 追平 OLMo-3-7B 最终 loss,GSM8K +5.99 分,17M 参数 VQ 模块即可完成领域适配——迄今最大潜空间 LM 实证。
UVA+Stanford 提出负面自蒸馏(NSD):针对 on-policy 自蒸馏(OPSD)模仿“带标准答案的伪自信轨迹”导致难推理任务退化的失败模式,构造“负条件”(注入已知缺陷的解)让学生显式规避。token 级自适应门控+gated unlikelihood 在七基准上 1.7B/4B/8B 平均 +2.3%/+7.5%/+6.0%,且保留自纠错行为——模型越大增益越高。
UCD+CNR 提出“用户驱动自演化”新范式:终端用户用自然语言表达需求,软件在执行中自动生成并集成新功能。ReqEvolve 实现(需求解释→代码生成→运行时集成)在 72 个演化案例/18 项目基准上 Pass@1 89.2%,超 SpecFix +18.8pp(大效应量 r=0.79)。ASE 2026 已录用。
同日两篇论文从两端夹击“静态/测试通过=安全”的假设:Toronto Metropolitan 的 SPDF 度量静态过-动态败缺口(654 个静态干净样本中 14.53% 被运行时利用验证击穿);Tampere 大学的静默失败实证(1,030 条 Agent 修复轨迹中 170 例确认静默失败,Omission 占 48.2%)建立四维分类学。与 SWE-Gate、PatchBench 共同固化“测试通过≠安全”证据链。
Theseus Lab 32 人团队(含清华/上交,腾讯混元等六家工业案例)发布 RSI 系统综述:以改进闭环为分析单元、L1-L5 自治分级框架,用 HCI 指数量化 2023-2026 能力轨迹(工具 Agent 39.9 vs 数学 86.4——交互能力 headroom 最大),区分“结构递归”与“有效递归”,并给出安全继承/自治归因/可靠验证三大挑战的判定标准。
南京大学+九天团队提出 UniMPA:统一记忆-预测-动作模型,用共享的’动作锚定转移接口’解决 VLA 的转移可实现性缺口(转移歧义/预测失准/多阶段混淆)。LIBERO/LIBERO-Plus/RoboTwin 2.0 Hard/真机四线超 π0.5 达 1.7/11.7/18.5/12.6pp,只需 25-50% 训练 epoch。
WashU+SMU 发布 VP-Control:Agentic AI 提交门的代价感知验证组合设计。2880 场景确定性基准+2×2 因子实验证明:共享证据的跨模型投票批准 62.9% 不安全提案,独立证据源仅 22.9%——源效应 40.9pp vs 模型效应 11.3pp。共模数据失效让“多模型投票”这一直觉失效,组合控制器以部署可观测元数据实现 1.9% 不安全执行。