VibeMemBench:在真实仓库任务上用可执行测试受控评测 Coding Agent 记忆系统

VibeMemBench 是首个把「真实仓库编程任务 + 可执行测试」与「持久记忆系统」接起来的受控评测基准:它不考记忆系统能否答对回忆题,而考注入的历史经验能否真正提升可执行的仓库修复结果。论文用 SIEVE 四阶段流水线(来源校验、补丁模式筛选、历史执行与经验蒸馏、验证 uplift 并冻结)从 90 个仓库筛出 111 个目标与 3634 条历史轨迹,并提出「只改记忆开关」的匹配干预协议。核心结论有反差感:冻结的、已被执行验证过有用的经验,迁移到 5 个预留 solver 时让 4 个的解决率提升 1.1~4.5 个百分点、且步数全面下降;但当 Mem0 / SimpleMem / MemoryOS / A-MEM 这四个现有记忆系统必须从同一段历史里自己写、自己检索经验时,12 组 solver×系统配对中有 11 组没能超过「不开记忆」的配对基线。失败归因显示主因不是「没检索到」(ranking miss 仅 1.3%),而是「记录形态崩坏」(form degradation 占 69.3%)——strip 消融进一步证明危害来自原始 transcript 的体积而非指令语义。本文按九部分结构拆解其背景、定位、问题定义、构建方法、评估协议、外部交叉验证、核心结果、根因分析与启示。

September 23, 2026 · 4 min

Agent 评测方法学三重奏:Next-Turn 指标为何失灵 精读

本文合并精读三篇同主题论文,剖析「next-turn(单轮/下一步)指标」为何无法可靠预测 Agent 的真实工作能力。A(Dialpad)用五级评测协议链证明:SFT 在金历史评测下让文本轮大幅提升,但闭环工作流成功率最高仅 10.4%、整体裁判 0/77,根源是金历史恢复了正确状态、测的是「响应预测」而非「状态构建」。B(LibreDB)用 8,199 次生产级真机运行与四类失败 taxonomy 证明:75.7% 的损失来自真正调用过工具的 run,而 5 项服务器侧(非模型侧)修复让 6/6 模型同时提升。产业基准 τ²-bench 提供「必须真实」的旁证:最强编码智能体仅过 23.9%。三篇合流结论:Agent 评测必须闭环、必须真实、必须归因到接口层。

September 22, 2026 · 6 min

After the Party: Growth, Governance, and Security Scanning in the OpenClaw Agent Skill Ecosystem 精读

OpenClaw 技能注册表 91 天近翻倍(33,399→65,175)后热潮退去,留下什么治理遗产?Monash 大学的三快照纵向研究给出冷峻答案:下载量 Top10% 占 46.93%(Gini 0.528);77.86% 的 skill 零星标零评论,但 85.06% 携带特权证据(shell 执行 58.08%)——4.2 万个零审查特权工件;7 个基线元数据关联在 pre-cutoff 队列 0/7 存活、下载量关联符号反转;三大安全扫描器对 23,702 个 skill 互相分歧,人工裁决参考标准下灵敏度仅 21.67%-61.06%。‘派对之后,账单由治理信号从未被验证过的注册表支付’——Goodhart 定律的 skill 生态版。

September 17, 2026 · 2 min

Coding Agents Have Converged: Why the SWE-bench Leaderboard Can No Longer Order Its Top Entries 精读

SWE-bench Verified 榜首之争还是能力之争吗?对 254 个公开提交的逐实例审计给出否定答案:Top10 系统 500 题中 285 题全对、51 题全错,仅 164 题有区分力;29 对相邻排名精确 McNemar 检验 0 对可分;同模型换 scaffold 分差可达 29.8pp 而前十总差距仅 8.8pp。论文提出 n_eff 有效规模、对基线嵌套系数两个新构造,证明’解集嵌套’是分辨率丧失的机制,并给出五步审计协议与修复方案(报 n_eff、记录 model×scaffold、发布 tier、按不一致预算纳新题)——对一切正在构建内部评测选型基准的团队有直接方法论价值。

September 17, 2026 · 3 min

MTAC-IFBench: Benchmarking Instruction-Following in Multi-Turn Agentic Coding 精读

自主编码 Agent 除功能正确性外还须在整个开发生命周期遵循过程指令与约束,但现有基准只测最终功能或单轮指令——多轮 Agentic Coding 的指令遵循是评测空白。MTAC-IFBench:多轮渐进式指令 + 6 主类/18 子类约束(平均 7.04 轮、91.33 约束/实例),每约束配 checklist 实现可验证评估。结果揭示残酷现实:最强 GLM-5.2 仍有约 20% 过程约束失守,多数 LLM 完美合规轮次 <10%。本精读覆盖’过程合规’与’功能正确’的分离测量及 checklist 化评测的构造方法。

September 16, 2026 · 2 min

SkillSeam: Six Principles for Auditing Agent Skill Collections 精读

一堆合格技能不等于一个可靠系统——技能在集合的’接缝’处失败:程序竞争注意力、别名重复加载、边界模糊。SkillSeam 提出六原则审计框架(持久梯度/系统连贯/机制门控/正交覆盖/触发流/粒度纪律),每条原则映射到失效机制→最强可观测信号→受控扰动测试。关键发现:破坏持久层级后 loaded-skill tokens +59.5% 而准确率不降——成本病在准确率病之前出现,准确率导向的评测对集合级架构债不敏感。本精读覆盖’按失效机制预测的信道评估’方法论与成本先行的预警价值。

September 16, 2026 · 2 min

GAUGE: When Not to Trust LLM-as-a-Judge in User-Simulated Evaluation of Task-Oriented Agents 精读

Amazon 的评测效度清算之作:persona 驱动 LLM 用户模拟器 + LLM-as-judge 这道廉价’离线发布门禁’被 GAUGE 协议全面体检——盲评面板判’满意’的会话 57.5% 实际任务失败(ρ=−0.147);能力相近的强 agent 对比中门禁 31% 选出奖励更低的一方;满意度阈值放行失败率 48-60% 的 agent。结论:门禁’human-validated yet mis-anchored’(人觉得准但锚错了构念),并给出 calibrate-then-trust 补救节奏。附同日 TraceJudgeBench 对照:去偏 prompt 在压偏差的同时损坏分辨率。

September 15, 2026 · 2 min

Harness or Model? Isolating the Harness Effect in Agentic Coding with a Contamination-Controlled Private Suite 精读

evolutionID GmbH 用 256 个私有任务的污染控制套件,首次把 agent 编程中 harness(驱动模型的软件层)作为唯一变量隔离测量。结论颠覆直觉:厂商原生 harness 无平均能力优势(±1.25pp 统计不显著),但按任务类型剧烈分化(仓库任务落后 9pp、竞赛任务领先 23.7pp);中立 harness 每解一题成本反而高 1.3-1.6 倍。论文还自曝自家成本遥测存在缺陷并全量重算——测量诚实度的范本。

September 15, 2026 · 2 min

MetroLLM-Bench 精读:LLM 嵌入物理售票机,4B PEFT 学生超越 GPT-5.6 的容量-天花板曲线

Continker 发布 955 案例 × 6 真实地铁系统的 LLM 售票机策略层基准:模型须调结构化工具并提交机器可渲染终端状态,双层评分栈(14 确定性组件 + 8 语义组件)经双人标注校准。核心发现:4B Qwen3.5 学生 PEFT 后 Tier1 91.3 超 GPT-5.6 两档(90.6/90.0)匹配 GPT-5.4 满推理;PEFT 增益随基座规模单调衰减(2B +7.03 → 27B -0.91),给小模型蒸馏划出容量-天花板曲线。

September 13, 2026 · 1 min

SpatialBlock 精读:合成积木课程与对照组设计的空间智能范式

KAIST×AITRICS 借鉴儿童认知发展,用 15,000 道合成积木堆叠题(3D→2D 投影/视角变换/结构组合 + 对照组设计)训练 LVLM 空间智能:Qwen3-VL-4B 提升 25.1% 达 51.3% 开源最佳,7B 提升 17.6%,InternVL3 同样提升。对照组题目隔离语言捷径,渲染即真值消除标注噪声——数据质量根源性优于真实场景标注方案。

September 13, 2026 · 1 min