Large Discovery Models: Empirically-Grounded Model-Based Open-Ended Search 精读

UCL Jun Wang组联合五机构提出大发现模型(LDM)v0.1:把LLM生成器与贝叶斯非参奖励代理耦合为循环架构——生成器提出/精修候选设计,代理预测性能并量化认知不确定性,不确定性感知价值函数统一引导生成、精修与昂贵实验评估的选择,每次新观测同步更新发现记忆与代理。在三个昂贵黑盒域验证:AutoResearch神经网络训练搜索的验证BPB降幅是LLM-only反思的2.4倍(0.0727 vs 0.0301);抗体CDRH3设计200步后结合能低18.2%(-104.7±1.0 vs -91.1±3.2);分子多目标优化Pareto超体积较LLM-only/经典BO分别+62.4%/+63.1%。论文把推理时扩展从“廉价可重复验证器”域推广到“昂贵、噪声、稀疏反馈”的科学发现域。

August 19, 2026 · 2 min

LongRCA Bench: Diagnosing Responsible Roles and Root Causes in Long-Horizon Agent Failures 精读

中科院计算网络中心联合清华、阿里通义等七机构发布LongRCA Bench——首个面向长时程Agent失败“责任角色归属+精确根因定位”双任务基准:1140条来自SWE-bench Pro/Terminal Bench 2等五域的真实失败轨迹(中位145步、无注入错误、人工独立标注责任角色与最早决定性根因步骤)。配套提出训练无关的RCTA方法(分段摘要检索候选错误步→回溯更早handoff指令),达责任角色准确率51.1%、精确根因步骤24.1%——而最强基线仅13.2%。论文揭示:决定性错误远早于失败显现(中位根因到终点126步),角色与根因是两个独立预测目标,且“被修复的中间错误不应被选为根因”的标注准则把诊断与告警区分开来。

August 19, 2026 · 1 min

SA-MRPO: Saturation Aware Advantage Reweighting for Multi-Reward Policy Optimization 精读

UCSD联合五机构提出SA-MRPO——多奖励RL后训练的饱和感知优势重加权:针对固定标量化+组标准化的两大缺陷(奖励轮廓不同的rollout获得相同优势;已饱和目标仍按固定权重占用梯度预算),按每个奖励维度的实时饱和度自适应重加权,使梯度流向“还有提升空间的未竟目标”。Qwen2.5-7B三目标设置下15项基准对比12项超GDPO(AIME24 +5.0pp、MATH500 +3.5pp);自适应推理设置平均准确率+3.8且响应更短;代码基准Codeforces从10.6%升至12.9%。机制本质:把优化预算从“维持已会技能”重新分配到“攻克未会技能”。

August 19, 2026 · 2 min

StateM: Reaching 95.3% Raw Accuracy, or a $15 Frontier Run, on Terminal-Bench 2.1 via Harness Scaling 精读

四位独立研究者(含 UT Austin 张satz Atlas 王)在不改模型权重的前提下,用 YAML 状态机运行时 StateM 把 GPT-5.5 在 Terminal-Bench 2.1 上从 83.1% 拉到 92.1%,冻结迁移到 GPT-5.6 Sol 达 95.28% raw,把 DeepSeek-V4-Flash 适配到 88.09% 而最终评测成本仅约 15 美元——对照 GPT 参考运行的 574.68 美元。论文提出 harness scaling 作为与 model scaling 正交的能力轴:把可变状态外置、以状态为上下文与契约双重边界、用受检转换取代 agent 自证完成,将失败分类为认知缺口/程序记忆缺口/程序遵从缺口三类并逐一施加控制点。负迁移分析(RefactorBench -2.78 分)进一步证明控制必须挂在正确的执行边界上。

August 19, 2026 · 3 min

The Working Set of a Coding Agent: Coherence Debt in Repository-Scale Tasks 精读

马普所软件系统、EPFL、Apple与奥尔胡斯大学联合提出编码Agent的“一致性负债”(coherence debt)理论与实证框架:把仓库级任务建模为耦合事实图的重建——每次编辑所需事实要么来自近期上下文要么来自参数记忆,两通道都不覆盖的事实构成一致性负债。通过供应/扣押双通道与注入故障的因果操纵设计(虚构API迁移的闭卷/前置对照、真实Pydantic迁移及其全重命名孪生使记忆失效),在7模型×5 harness上证明:双通道皆空时无一模型能完成任务(能力下限),事实前置后即可解(瓶颈在事实可得性而非推理);上下文与记忆呈“亚可替代性”——更多上下文只在包含与当前编辑耦合的事实时才有帮助,分解只在让互相一致的事实同处一个分区时才有效。

August 19, 2026 · 1 min

UI-Mate: Advancing Open-Weight Foundation GUI Agents with In-Context Demonstrations 精读

腾讯Hy Frontier Team发布UI-Mate——开源权重GUI基础Agent及配套训练栈:闭环数据引擎(任务生成→环境构建→rollout→过滤→能力分层均衡)驱动SFT+在线RL;交互侧用上下文示范解决“同一指令多次运行漂移”问题——OSWorkerBench提供33个同任务自示范与45个变体任务人录示范配对,附进度清单harness把示范转化为里程碑-子任务结构。OSWorld-Verified上UI-Mate-27B达77.0%超Kimi-K2.6(73.1%)与Qwen3.7-Plus(73.3%)、逼近Claude Opus 4.8(83.4%);33任务自示范子集上单个示范使严格成功率17.2%→35.4%、进度67.9%→81.1%——示范把开放式意图消歧转化为对齐示例。

August 19, 2026 · 2 min

Ventor-QTest: Threat-Model-Driven Verification of Vendor-Hosted LLM APIs 精读

腾讯朱雀实验室提出第三方托管LLM API的威胁模型驱动黑盒审计方法:把“服务商是否真的在跑你购买的模型”形式化为随机路由过程估计问题——模型名只是声明而非密码学证明。Ventor-QTest无需目标API任何概率信息:重复请求组件对冻结约束上下文多次重发、从返回文本计数重构类别输出分布,联合报告平均保真损失(AFL)与最坏情况期望保真损失(EFL)双指标,覆盖“平均诚实但最坏降级”的攻击面。论文论证两指标须联合报告(尤其对长时程agentic任务的最坏行为敏感),工具已开源并入腾讯AI-Infra-Guard。

August 19, 2026 · 1 min

VibeWorlding: Can Multimodal Agents Construct 3D Open Worlds End-to-End? 精读

港科大广州与腾讯TEG AIPD联合发布VibeWorlding——首个面向vibe worlding agent(从用户查询端到端构建可交互3D开放世界)的开源基准+训练统一框架:VWE-Bench提供2616个高质量3D资产、323个人标种子世界、6828条逆向合成多模态查询与双约束验证器(物理可行性+意图满足);VibeWorlding-Gym把资产检索/编辑/渲染统一为MCP工具沙盒并以rubric奖励驱动GRPO多模态RL后训练。实验揭示GPT-5.5(57.3%)与Qwen3.8-Max(56.9%)均远未解决该任务、瓶颈定位在精确3D世界编辑;RL后训练使开源Qwen3-VL-30B-A3B从13.6%升至59.3%全场第一,8B版41.4%比肩Gemini 3.1-pro。验证器与人类判断系统级排序相关ρ=0.88,为agentic RL提供了可靠奖励服务。

August 19, 2026 · 2 min

AgentRewind: Recoverable Execution for Long-Horizon LLM Agents 精读

长程Agent任务中早期错误同时污染上下文与环境状态,现有方法(计划精化/安全检查)只防错不恢复。中科院与清华团队提出AgentRewind:对齐记录Agent上下文与受控环境的检查点,Agent判断无法推进时回滚到早期状态并以前次尝试摘要指导续作;配套MettleBench(含隐藏有序验收清单的长程工程任务)。Terminal-Bench 2.0全量上成功率83.1% vs Continue的78.7%与Restart的70.8%;回滚增益随执行horizon增长显著扩大。案例研究揭示三策略本质差异:Continue在污染状态上修补、Restart丢弃已完成成果、Rewind选择性回滚+经验注入。

August 18, 2026 · 1 min

Beyond Final Scores: A Systematic Evaluation of Agents for Long-Horizon AI Research and Development 精读

自动化研究Agent的评测长期被“最终分数”主导,无法回答进步从哪来、失败藏何处、经验是否有用。美团与中科院国科大团队花费约10万美元推理成本,对7个前沿模型36个长程任务756次rollout做系统解剖:提出C1方案构架/C2执行/C3反馈控制三个规则驱动的过程指标+任务内/跨任务经验复用反事实实验。结论是当前Agent更像“勤奋的工程优化器”而非自主研究者:avg@3差距0.237而best@3仅0.122(可靠性比峰值更具区分度);252个最优解中真正新颖方法仅3个(1.2%),钻评测空子的却有16个(6.3%);经验迁移使DeepSeek-V4-Pro +0.093却使Gemini-3.1-Pro -0.017;自动harness进化+0.123且可跨模型迁移。

August 18, 2026 · 1 min