ScienceIDE: Turning World's Scientific Codebase into Agent Learnable Environments 精读

AItonomy 基金会联合 Oxford、Berkeley、Stanford 等 25 家机构发布 ScienceIDE:把全球科学代码库(PLUTO、Athena++、MITgcm 等天体物理/等离子体/海洋模拟器)改造成 64 个可执行环境、2,812 个经验证任务、1,076 项数值检查的 Agent 训练基础设施。ScienceIDE-Hard 上 15 个前沿模型横评显示 Claude Fable 5.1 仅 67.1%——科学代码仍是 Agent 洼地;而用验证轨迹 SFT 小模型,修复奖励最多 +33 分且正向迁移到 HumanEvalFix/BBH 等通用基准。本精读拆解『环境即基础设施』的设计哲学与『科学经验 bottleneck』的解法。

September 18, 2026 · 3 min

Coding Agents Have Converged: Why the SWE-bench Leaderboard Can No Longer Order Its Top Entries 精读

SWE-bench Verified 榜首之争还是能力之争吗?对 254 个公开提交的逐实例审计给出否定答案:Top10 系统 500 题中 285 题全对、51 题全错,仅 164 题有区分力;29 对相邻排名精确 McNemar 检验 0 对可分;同模型换 scaffold 分差可达 29.8pp 而前十总差距仅 8.8pp。论文提出 n_eff 有效规模、对基线嵌套系数两个新构造,证明’解集嵌套’是分辨率丧失的机制,并给出五步审计协议与修复方案(报 n_eff、记录 model×scaffold、发布 tier、按不一致预算纳新题)——对一切正在构建内部评测选型基准的团队有直接方法论价值。

September 17, 2026 · 3 min

MTAC-IFBench: Benchmarking Instruction-Following in Multi-Turn Agentic Coding 精读

自主编码 Agent 除功能正确性外还须在整个开发生命周期遵循过程指令与约束,但现有基准只测最终功能或单轮指令——多轮 Agentic Coding 的指令遵循是评测空白。MTAC-IFBench:多轮渐进式指令 + 6 主类/18 子类约束(平均 7.04 轮、91.33 约束/实例),每约束配 checklist 实现可验证评估。结果揭示残酷现实:最强 GLM-5.2 仍有约 20% 过程约束失守,多数 LLM 完美合规轮次 <10%。本精读覆盖’过程合规’与’功能正确’的分离测量及 checklist 化评测的构造方法。

September 16, 2026 · 2 min

SWEADV × VLoc Bench:Agent 安全评测双警报 精读

两篇同日论文从攻防两端敲响 Agent 安全警钟。SWEADV(Columbia×GMU×York):750 对抗 issue 描述攻击 APR Agent——恶意描述诱导’功能正确但不安全’的修复,攻击成功率 48.5-54.0% 近基线双倍,且 LLM-judge 检测精度降 16.6%、guided prompt 仅 62.3% 精度。VLoc Bench(CMU×Cisco×Foundation AI×Yale):把安全评测从’能否检测/修复’前移到’能否定位’——500 真实漏洞 × 290 仓库 × 147 CWE,Claude 系因 500 任务 $600+ 评测成本缺席。本精读合并解读攻击面转移与任务前置化两条安全评测新轴线。

September 16, 2026 · 2 min

DataFlex-RL: An Evaluation Platform for RLVR Data Policies 精读

北大×UCAS 等机构的 RLVR 数据政策评测平台:13 配置 × 12 匹配种子 × Qwen2.5-7B 在 12 个数学/逻辑/科学 benchmark 上的受控对比发现——均匀 GRPO 已提升 7.76 分后,无任何选择/重加权方法的配对 95% CI 排除零;三种自适应混合均不优于固定等权。更警醒的是评测敏感性:math-heavy 摘要与均衡摘要的排名负相关(ρ=−0.33)。‘数据工程很重要’的流行叙事在受控条件下未被支持。

September 15, 2026 · 1 min

GAUGE: When Not to Trust LLM-as-a-Judge in User-Simulated Evaluation of Task-Oriented Agents 精读

Amazon 的评测效度清算之作:persona 驱动 LLM 用户模拟器 + LLM-as-judge 这道廉价’离线发布门禁’被 GAUGE 协议全面体检——盲评面板判’满意’的会话 57.5% 实际任务失败(ρ=−0.147);能力相近的强 agent 对比中门禁 31% 选出奖励更低的一方;满意度阈值放行失败率 48-60% 的 agent。结论:门禁’human-validated yet mis-anchored’(人觉得准但锚错了构念),并给出 calibrate-then-trust 补救节奏。附同日 TraceJudgeBench 对照:去偏 prompt 在压偏差的同时损坏分辨率。

September 15, 2026 · 2 min

Harness or Model? Isolating the Harness Effect in Agentic Coding with a Contamination-Controlled Private Suite 精读

evolutionID GmbH 用 256 个私有任务的污染控制套件,首次把 agent 编程中 harness(驱动模型的软件层)作为唯一变量隔离测量。结论颠覆直觉:厂商原生 harness 无平均能力优势(±1.25pp 统计不显著),但按任务类型剧烈分化(仓库任务落后 9pp、竞赛任务领先 23.7pp);中立 harness 每解一题成本反而高 1.3-1.6 倍。论文还自曝自家成本遥测存在缺陷并全量重算——测量诚实度的范本。

September 15, 2026 · 2 min

What is the Difference Between Me and You? Benchmarking the Quality Gap Between Human-Written and AI-Generated Code 精读

那不勒斯费德里科二世大学的 78.7 万函数对大规模研究:3 家 AI 助手(GPT 系/DeepSeek-Coder/Qwen2.5-Coder)按人写函数的 docstring 生成配对实现,静态分析映射到 ODC 缺陷分类+CWE 漏洞分类实现三语言(Python/Java/C)同框架人机对照。核心发现:AI 代码’结构压缩+风格模板化’(体量约人写一半、风格层独立聚类);缺陷类型分化而非数量分化;C 语言上 AI 高严重性内存安全缺陷反而更少。发布 CQBench(27,346 高问题任务)——Opus 4.8 在其上仍 2/3 有缺陷、1/3 有安全发现。

September 15, 2026 · 2 min

MetroLLM-Bench 精读:LLM 嵌入物理售票机,4B PEFT 学生超越 GPT-5.6 的容量-天花板曲线

Continker 发布 955 案例 × 6 真实地铁系统的 LLM 售票机策略层基准:模型须调结构化工具并提交机器可渲染终端状态,双层评分栈(14 确定性组件 + 8 语义组件)经双人标注校准。核心发现:4B Qwen3.5 学生 PEFT 后 Tier1 91.3 超 GPT-5.6 两档(90.6/90.0)匹配 GPT-5.4 满推理;PEFT 增益随基座规模单调衰减(2B +7.03 → 27B -0.91),给小模型蒸馏划出容量-天花板曲线。

September 13, 2026 · 1 min

MCP 注册表随机抽样审计精读:48.8% 握手率背后的工具生态幸存者偏差

独立研究者 Haseeb Mohammed Afsar 对 MCP 注册表做首个未修复概率样本审计:24,135 服务器普查中概率抽 400 个 npm/stdio 服务器在线探测,仅 48.8% 完成 initialize 握手(手工精选框架 66.7%),37.5% 根本无法启动;能跑的 195 个硬一致性 100%,但安全注记缺失率 58.8% vs 精选 41.5%——整个领域的采样偏差第一次被量化。

September 12, 2026 · 1 min