SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science? 精读

上海创新研究院与复旦大学联合发布 SWE-bench Science:覆盖 20 个科学领域、98 个真实仓库的 119 个任务,以 Issue 驱动、专家探索、工程集成三种范式考察 coding agent 在科学软件上的真实修复能力,并用隐藏预言机与反校准协议狙击伪修复。结果所有最强 agent 的 Pass@1 均不足 50%,四类失败机制归因与科学信息双向消融揭示了科学知识与代码推理交织处的深层瓶颈。

August 22, 2026 · 3 min

ASI-Bench: At the Dawn of Artificial Superintelligence 精读

清华联合MIT、哈佛、CMU等13机构40余位专家、投入31000+工时构建ASI-Bench——首个联合评估AI创新探索与自主科研能力的基准。核心设计是在同一研究项目内渐进撤除人类方法学指导:B1给完整方法、B2只给方法名、B3需自主定方法、B4加干扰。18个agent×模型配置的评估揭示了关键瓶颈:平均分从B1的50.91骤降至B2的29.10(-21.82),而B2到B3仅再降2.48——瓶颈不在选方法而在把方法变成完整可执行研究流程的方法操作化。

August 20, 2026 · 2 min

Harness the Memory: A Holistic Evaluation of Memory Substrates in Memory Agents 精读

UIC、华盛顿大学、McGill、MBZUAI与UCLA五校联合完成首个把记忆底座(substrate)作为受控变量的统一harness评测:11类底座×3个骨干模型×4组基准×26项指标。核心发现颠覆选型直觉——没有任何底座全面称雄,QA任务的前沿(图+向量混合)与决策任务的前沿(扁平检索/精炼蒸馏)完全不相交;检索宽度k在QA上单调涨分、在决策任务上反向往下跌分,注意力探针揭示同一稀释机制在不同任务中后果相反。这为记忆系统按工作区间路由底座提供了实证基础。

August 20, 2026 · 2 min

OmniScientist: An Omni-Modal Omni-Discipline AI Scientist 精读

NUS 与牛津团队提出 OmniScientist——一个全生命周期感知驱动的全模态跨学科 AI 科学家。论文诊断现有系统的通病:workflow-complete 却 evidence-incomplete——数据经由人选择的文本/代码/标签/摘要进入 agent,科学上决定性的空间、时序、跨通道、程序性关系在接口处丢失。框架由感知层加三个自主 agent(ideation/experiment/writeup)组成,外层是确定性管线,配以 idea/rigour/claim 三重代码化检查(OpenAlex 先行检索、统计校正、数值溯源)。36 个真实数据案例覆盖 5 学科族与 4 类证据模态,Claude Sonnet 5 在全部案例完成『原始数据→编译 PDF』全流程,综合均分 6.3/10;配对盲评中感知版全 7 维占优、直接胜率 85%。机制分析显示感知系统把研究问题锚定在原始观测独有属性上——这是文本接口系统原则上无法到达的假设空间。

August 20, 2026 · 5 min

On the Fragility of Self-Improving Agents: Variance, Task Order, and Underspecification 精读

Salesforce AI Research对记忆式自改进agent做系统性重评测,揭露被忽视的可靠性问题:多次运行量化显示叠加自改进循环后71%的情形方差增大、同实验最好最差运行差可达10个百分点;默认任务顺序构成隐式课程——按默认顺序+1.5%改进,随机打乱后反而-4.5%。人工检查记忆提出欠规约(underspecification)假说:agent在缺乏清晰规约时生成’看似合理但不可用’的记忆(如纯浏览器环境推荐API用法),rubric与环境反馈注入可部分收窄退化。

August 20, 2026 · 1 min

Agentic Transaction: Towards ACID-Compliant Agent Systems 精读

清华大学Guoliang Li数据库组提出“智能体事务”概念——把数据库五十年的ACID正确性理论重释为agent执行语义:原子性=置信度引导的原子语义事务单元(探索→只读执行→append-only执行→一致性校验→提交/重试)、一致性=置信度驱动的证据整合、隔离性=依赖感知的子agent隔离调优(独立/协作/竞争三档)、持久性=仅追加工作区记忆演化。配套开源ACID-Agent框架并给出面向agent全生命周期的开放问题清单。这是“用数据库理论为agent可靠性提供形式化骨架”的问题定义级工作——把agent失败从“提示工程问题”重新定义为“正确性问题”。

August 19, 2026 · 1 min

HarnessEval-W: Agentifying the Evaluation of Visual Worlds 精读

北大、清华、上海AI Lab等机构30余位作者联合提出HarnessEval-W,把LLM生态的harness范式首次引入世界模型基准测试:父Agent解释每个评测案例的语境并路由到技能库(记录激活与跳过理由),技能把问题分解为可测子问题、交给配备诊断工具的专职子Agent,证据经校验后聚合为分数——每次评测产出一棵可回溯到具体子问题与工具证据的证据树。在330案例×18个世界模型上,与5000次人类A/B判断拟合的Bradley-Terry排序对比达Spearman 0.93(Intentional)/0.87(Physical);对照最接近的WBench协议,Physical成对准确率从31.9%提至71.7%、平局率从52.2%降至1.8%。榜单揭示:Seedance 2.0综合75.5居首,视频生成器改造为世界模型会重新分配能力而非均匀提升。

August 19, 2026 · 2 min

Large Discovery Models: Empirically-Grounded Model-Based Open-Ended Search 精读

UCL Jun Wang组联合五机构提出大发现模型(LDM)v0.1:把LLM生成器与贝叶斯非参奖励代理耦合为循环架构——生成器提出/精修候选设计,代理预测性能并量化认知不确定性,不确定性感知价值函数统一引导生成、精修与昂贵实验评估的选择,每次新观测同步更新发现记忆与代理。在三个昂贵黑盒域验证:AutoResearch神经网络训练搜索的验证BPB降幅是LLM-only反思的2.4倍(0.0727 vs 0.0301);抗体CDRH3设计200步后结合能低18.2%(-104.7±1.0 vs -91.1±3.2);分子多目标优化Pareto超体积较LLM-only/经典BO分别+62.4%/+63.1%。论文把推理时扩展从“廉价可重复验证器”域推广到“昂贵、噪声、稀疏反馈”的科学发现域。

August 19, 2026 · 2 min

LongRCA Bench: Diagnosing Responsible Roles and Root Causes in Long-Horizon Agent Failures 精读

中科院计算网络中心联合清华、阿里通义等七机构发布LongRCA Bench——首个面向长时程Agent失败“责任角色归属+精确根因定位”双任务基准:1140条来自SWE-bench Pro/Terminal Bench 2等五域的真实失败轨迹(中位145步、无注入错误、人工独立标注责任角色与最早决定性根因步骤)。配套提出训练无关的RCTA方法(分段摘要检索候选错误步→回溯更早handoff指令),达责任角色准确率51.1%、精确根因步骤24.1%——而最强基线仅13.2%。论文揭示:决定性错误远早于失败显现(中位根因到终点126步),角色与根因是两个独立预测目标,且“被修复的中间错误不应被选为根因”的标注准则把诊断与告警区分开来。

August 19, 2026 · 1 min

AgentRewind: Recoverable Execution for Long-Horizon LLM Agents 精读

长程Agent任务中早期错误同时污染上下文与环境状态,现有方法(计划精化/安全检查)只防错不恢复。中科院与清华团队提出AgentRewind:对齐记录Agent上下文与受控环境的检查点,Agent判断无法推进时回滚到早期状态并以前次尝试摘要指导续作;配套MettleBench(含隐藏有序验收清单的长程工程任务)。Terminal-Bench 2.0全量上成功率83.1% vs Continue的78.7%与Restart的70.8%;回滚增益随执行horizon增长显著扩大。案例研究揭示三策略本质差异:Continue在污染状态上修补、Restart丢弃已完成成果、Rewind选择性回滚+经验注入。

August 18, 2026 · 1 min