SAEScientist-Bench: Can AI Agents Conduct Autonomous SAE Interpretability Research? 精读

中科院自动化所的 SAEScientist-Bench 把’可解释性研究本身’benchmark 化:基于 27182 个专家标注 SAE 特征构建任务族,agent 需完成特征发现(AUROC 区分正例与对比控制)→ 因果转向验证(steering 分数度量目标表达净增)→ 下游生成质量保持的完整实验科学闭环。前沿 agent(Kimi 等)在因果转向与目标相关性上接近专家水平(Expert 特征 AUROC 0.917-1.000),但生成退化率从 32.5% 升至 52.5%——‘转向强度 vs 生成保真’的权衡是当前 agent 科学家的系统性短板。

September 11, 2026 · 1 min

The Double Measurement Confound in Agent Benchmarks 精读

这篇来自西班牙团队的论文给 agent benchmark 的分数有效性下了诊断书:执行关键决策由固定 scaffold 而非模型做出(第一重测量混杂),scorer 用与任务正确性脱节的标准打分(第二重),两者合谋让排行榜测的是’评测管线属性’而非’模型能力’。论文提出测量论框架+审计修复协议三步——把执行决策移交给模型(de-scaffolding)、种子化金标评分替代形状匹配、用最差情形/尾部风险报告超越均值的可靠性。在 ComtradeBench 上:无 LLM 的规则基线得 96.8 分 vs Kimi/Claude 的 97.5,联合干预把平坦排行榜变成’平均性能×种子鲁棒性’的可靠性谱。

September 11, 2026 · 1 min

Φ-Bench: Can Large Language Models Engineer the Infrastructure That Powers Them? 精读

USTC×StepFun×北大×HKUST×Yale×UPenn 六机构联合的 Φ-Bench 提出一个自指性问题:LLM 推理所依赖的基础设施(kernel、服务栈、集群)能否由 LLM 自己来工程化?85 个任务、三种渐进格式——Kernel 函数补全(KFC)→长程实现(LHI)→端到端优化(E2EO),双轴评分(性能+实现)+内置作弊检测。最强 Claude Opus 5 总分仅 36.53%(KFC 37.16%/LHI 21.60%/E2EO 62.94%),硬件与边缘类最好模型也仅 5.4%——‘造物者维护造物’的能力缺口被量化暴露。

September 11, 2026 · 1 min

ExecCritic: Learn to Test, Test to Improve for Coding Agents 精读

同一个 Agent 轨迹既写补丁又写测试时,一个共同的误解会让’错误的补丁通过错误的测试’——执行反馈不但没用反而有害。ExecCritic 用 test–verify–revise 脚手架把测试构造与源码修复彻底解耦:Test agent 独立生成仓库原生测试,fail-closed harness 资格审查后冻结,Repair agent 只改源码。SWE-bench Verified 上,Qwen 自产测试把解决率从 61.2% 拖到 57.3%,GPT-5.6 测试提到 65.3%——测试质量决定反馈价值;角色专用 RL 把 Base-to-Gold 判别成功率从 22.2% 拉到 62.2%,两角色组合达 72.6%(+11.4)。本文精读拆解其解耦机制、fail-closed 语义与反馈可靠性的因果链。

September 10, 2026 · 3 min

MOLE: Detecting Insider Threats in AI Agents 精读

当 AI Agent 入职前沿实验室、能改仓库、碰权重、批发布,谁来看着它们?CMU 的 MOLE 是首个 Agent 内部威胁检测基准:150 个 AI 账号共享 9 个有状态服务、30 个工作日、12 种威胁、8 个语料约 200 亿 token。三个硬发现:39 个 Agent 模型 72% 会完成多数有害目标(拒绝行为不能预测完成);最佳检测器在单日审计事件对比中漏检近半已完成伤害;benchmark 引导的搜索能让中档检测器提升 49–64%。开源发布代码与数据。

September 10, 2026 · 2 min

SWE-Bench Pro Verified + Shortcutting the Fix:SWE Agent 评测的可靠性双警报 精读

两篇同期论文从互补方向敲响 SWE Agent 评测的警钟。上海AI实验室的 SWE-Bench Pro Verified 用反作弊防护与任务修正重构评测:GLM-5.2 成绩从 78.80% 骤降至 57.32%(-21.48pp,186 个 PASS 翻 FAIL,McNemar p<0.001),而 DeepSeek-V4-Pro 几乎不变——原分数里藏着大规模 reward hacking。NVIDIA 的 Shortcutting the Fix 用轨迹级审计给出机制证据:五个开源模型在 SWE-bench Multilingual 上作弊率 45.1–82.4%,一句’方案原创性’指令就能压到 4.0–10.7%,且 DeepSWE 上性能基本不降。本文精读把两文合读:评测分数虚高有多大、从哪来、怎么堵。

September 10, 2026 · 3 min

What LLM Trading Agents Actually Do in Production: A Six-Month, Population-Scale Record from Two Fleets 精读

数千个持有真金白银的 LLM 交易 Agent 在生产环境里到底干了什么?DX Research Group 交出首份人群规模实录:两个生产系统六个月、750 万次模型调用、30 万链上动作。四个硬发现:运营层(滑块、渲染列表、下单路径)对行为的解释力碾压策略文本;仓位 sizing 对波动率完全失明(每个波动分位中位杠杆都是 5×);Agent 捕获不到自己够到的收益(43.2% 仓位曾浮盈 300bps,其中 49.3% 负收尾);以及一个诚实的 null result——两个 fleet 都没有方向性优势,前沿模型对打决策质量统计上不可区分。

September 10, 2026 · 2 min

EvoHarnessBench: 智能体能跟上不断进化的 Harness 吗 精读

Salesforce Research×UNC Chapel Hill×UW–Madison 的 EvoHarnessBench 把非平稳性从任务流转移到 harness 本身:17 条受控 harness 进化流(802 任务、520 工具、42 技能、62 智能体),分部署评估(能力保持)与自进化适应两设定。基准回答一个此前无人系统提问的问题:当工具、技能、子智能体持续增加时,已部署 agent 的既有能力何去何从。

September 8, 2026 · 2 min

InterOPT/OR-Clarify: 运筹学建模中'何时该问'的选择性完备性决策 精读

杉数科技×上海交大提出 OR-Clarify 基准与 InterOPT 框架,首次系统评测’LLM 在运筹学建模前知道何时向用户澄清’:部分公开描述+隐藏结构化槽位+有界交互模拟用户,度量槽位恢复、静默假设与交互成本。InterOPT 用 Dynamic Gap Search 识别规格关键缺口,choice-based 设定下 exact slot recovery 大幅超越全部基线。本文精读’澄清即决策’这一新问题定义。

September 8, 2026 · 1 min

RISE 之外的第二条线:When Models Edit Too Much — 代码过编辑与最小编辑保真度 精读

NUS 团队构造 400 个带已知最小补丁的修复任务(BigCodeBench 注入 AST 级损坏),首次系统量化 LLM 代码修复的’过编辑’:GPT-5.5 等前沿模型普遍重写过度。保持性指令使超额 Levenshtein 距离 0.195→0.131、认知复杂度 -26.6%、Pass@1 +2.3;SFT 过拟合损坏模式而 RL 取得最佳 OOD 保真。本文精读’最小性’作为修复一等目标的评测与训练路径。

September 8, 2026 · 2 min