Signal or Noise? A Benchmark Study of Agent Skills in Web Development 精读

Signal or Noise(百度 NLP)用字节长度匹配对照(±5% 的无关 Skill 控制组)证明:向编码 Agent 注入匹配的 WebDev Skill 平均是负收益——4 个模型 ΔPass@2 全负(-1.3~-4.2pp),token 开销却 +72%~394%。更深一层,负效应有两种机制:Sonnet/Qwen 是’长度分心’(该缩短 prompt),GPT-5.1/DeepSeek 是’内容误导’(该审查内容),需要相反对策;且 Skill 效用的跨模型相关性近零(|r|≤0.12)——Skill 是 (Skill,项目,模型) 三元组属性,不是可移植资产。

August 25, 2026 · 2 min

SWE Refactor Bench: Can Coding Agents Complete a Long-Horizon, Whole-Repository Stack Migration? 精读

SWE Refactor Bench(Naver’s Lab × Einsia.AI × 清华)命名并防御了行为评测的 Blindness 盲区:迁移任务的起点测试本来就全绿,‘原样交回’的空 diff 可以骗过任何行为测试。该基准用 20 个真实开源项目(86.7 万行代码)+ 三阶段协议(迁移审计否决门 + 130,118 条固定检查 + 6 个对抗验证 Agent)证明:8 个前沿模型 520 个 run 中仅 5.4% 通过全部关卡,最强 claude-opus-5 也只拿 47/100——‘迁移完成’与’行为保持’是两种独立能力。

August 25, 2026 · 2 min

AI4AI-Bench: Benchmarking LLM Agents in Algorithmic Design for Recursive Self-Improvement 精读

Naver Labs、Einsia.AI 与清华大学推出 AI4AI-Bench:冻结 10 个真实研究仓库,覆盖 SFT、agentic RL、蒸馏、奖励建模、DPO、扩散 RL、遗忘、图扩散、权重平均与剪枝十族算法,测评 agent 能否改写仓库训练算法本身。agent 在单块 B300 用 4 小时改代码;提交后源码从零训练 12 小时,由冻结评估器打分,σ 坐标统一指标(0.1 为原算法,1.0 为最优)。负结果:290 格平均 0.166,最强系统 Claude Opus 5 仅 0.250;触及学习层者平均 0.226,远高于只动运行层的 0.126。

August 24, 2026 · 4 min

MemTrapBench: Benchmarking Cognitive Traps in LLM Memory Use 精读

浙江大学联合新加坡国立大学、东北大学、Heriot-Watt 大学与腾讯提出 MemTrapBench,首次系统评测记忆诱发的认知陷阱:忠实记录且语义相关的记忆,仍可能扭曲大模型的推理与信念,使表现跌破无记忆水平。基准按植入陷阱、噪声掩埋、触发陷阱三阶段生成 1050 个多轮对话实例,覆盖认知偏差、任务边界、创伤、安全四类场景;五个主流记忆框架在 Gemini 与 Qwen 上全部落后无记忆基线逾 10 个百分点,创伤场景去陷阱对照的正确性从 66.40% 回升至 91.07%,证明退化源于陷阱语义而非上下文长度。论文进一步提出推理时提示技能 AdaptiveMem,把是否该用记忆显式化为决策前的静默校验,最高提升 14.9 个百分点且不损害常规记忆基准表现。

August 24, 2026 · 4 min

Phantom Gains: Auditing Self-Improvement Against a Measured Null 精读

本文精读 arXiv 2608.20290《Phantom Gains: Auditing Self-Improvement Against a Measured Null》。论文指出:逐题得失(transition-level)分析已成为自我改进研究的标准证据,但一次得失是两个含噪估计之差,极易产生测量伪影。作者让一个从未训练的冻结模型走完完全相同的评估管道,实测每个统计量的噪声底,识别出七种测量失败——单次贪心解码、m=1 扩展统计量、固定 token 上限、欠功效、单训练种子、欠功效探针、只测一次的零假设——每一种在缺少对照时都会反转一个结论。受控审计表明:外部蒸馏能真正改进基模型几乎够不到的题,而三种自训练不能;自训练毁掉的题远超噪声底;其全部新增解均为锐化而非能力扩张。论文主张:逐题审计必须为每个统计量单独实测零假设。

August 24, 2026 · 5 min

ReguSim: Evaluating LLM Agent Rule Grounding in Financial Compliance 精读

深度精读 HKUST、HKBU 与 NTU 合作的 arXiv 2026 论文 ReguSim。论文构建可执行金融合规交易环境与 ReguBench 监控基准,将陈述推理、尝试动作、执行强制与监控证据四类工件分离审计,发现规则全文可见时 DeepSeek V4 Pro 仍有 24.2% 订单被拒,简单结构化基线反超最强 LLM 监控器,交易者自辩还会把独立监控者的误接受率从 25.0% 推高到 46.9%。

August 24, 2026 · 5 min

SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science? 精读

SWE-bench Science 由上海创新研究院与复旦大学联合提出,是一个仓库级科学软件工程基准:119 个任务、98 个真实 GitHub 仓库、覆盖 20 个科学领域,通过证据链协议将公有测试与私有科学断言物理隔离,并把任务分为 Issue 驱动、专家探索、工程集成三种范式。八个前沿 coding agent 横评中最高 Pass@1 仅 47.90%(Claude-Opus-5),而同配置公开分高达 96.64%,暴露出「表面修复」问题。论文还人工归因出四类失败机制,并用 91 任务配对消融证明科学知识注入并非普遍有益——错位信息反而诱发锚定。

August 24, 2026 · 4 min

What Makes Software Issue Resolution Tasks Difficult for Agents? 精读

这篇 ESEM 2026 论文回答一个基准测试长期回避的问题:对编码智能体而言,一个 issue 修复任务到底难在哪里、难度可否预知?作者在 CoderForge-Preview 的 45,769 个任务、1,553 个仓库上,用补丁、仓库、提示词三组共 54 个确定性静态特征预测智能体成功率,AUC 达 0.863、可解释 41% 的通过率方差。消融发现补丁碎片化与仓库规模几乎承载全部难度信号,而提示词的语言特征只有在中等难度区间才浮现(进入 top-5 贡献者占 70.3%),呈现清晰的分层结构。本精读覆盖其动机、特征体系、实验设计、根源解释与可迁移灵感。

August 24, 2026 · 3 min

A Jagged Frontier: 代码Agent对语义保持变换的锯齿鲁棒性 精读

当代码库被改写成语义等价的形式——控制流重写、死代码注入、标识符重命名——修 bug 的代码 Agent 还靠得住吗?Colorado State、Microsoft、UIUC 与 CMU 四方合作,用一套随机变体采样器对 2 个 Agent 框架 × 4 个前沿模型 × 54 个 SWE-bench 实例做了首个仓库级 Agent 鲁棒性系统评估:多数配置出现小幅退化(最大平均 6.7 个百分点,16 个配置中 6 个统计显著),但更扎心的发现是「锯齿前沿」——没有任何模型鲁棒性排名能跨框架、跨基准保持稳定,Qwen 在一个框架下最鲁棒、换一个框架反而最脆弱;更简单的框架反而更皮实;即使 solve 率不掉,token 成本最多也要多花 22.9%。本精读覆盖其 14 种语义保持变换的设计、非反馈采样的下界逻辑、配对实验统计方法,以及锯齿现象背后的机制因果链。

August 23, 2026 · 9 min

Adversarial Review: Structured Disagreement for Grounded Agentic Code Review 精读

康奈尔与斯坦福的两位研究者提出 Adversarial Review(AR):主编码 Agent 冻结工件后,reviewer 评审、critic 以结构化分歧审计这份评审,收敛后才允许修改代码。AR 在 LiveCodeBench 上以三个 Agent 取得 87% 最高通过率,胜过五 Agent 的 MARS;在 SWE-PRBench 上先暴露「伪共识」失败模式——Agent 为一致而一致,再用一次 prompt 迭代把分歧显式化即取得最高 F1 0.533;在 SWE-bench Verified 上以纯文本 SKILL.md 协议达到 75.2%。本精读拆解其构造式方法、三基准证据链,以及「分歧必须最小、结构化、有证据」的设计哲学。

August 23, 2026 · 7 min