SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science? 精读
上海创新研究院与复旦大学联合发布 SWE-bench Science:覆盖 20 个科学领域、98 个真实仓库的 119 个任务,以 Issue 驱动、专家探索、工程集成三种范式考察 coding agent 在科学软件上的真实修复能力,并用隐藏预言机与反校准协议狙击伪修复。结果所有最强 agent 的 Pass@1 均不足 50%,四类失败机制归因与科学信息双向消融揭示了科学知识与代码推理交织处的深层瓶颈。