GAUGE: When Not to Trust LLM-as-a-Judge in User-Simulated Evaluation of Task-Oriented Agents 精读

Amazon 的评测效度清算之作:persona 驱动 LLM 用户模拟器 + LLM-as-judge 这道廉价’离线发布门禁’被 GAUGE 协议全面体检——盲评面板判’满意’的会话 57.5% 实际任务失败(ρ=−0.147);能力相近的强 agent 对比中门禁 31% 选出奖励更低的一方;满意度阈值放行失败率 48-60% 的 agent。结论:门禁’human-validated yet mis-anchored’(人觉得准但锚错了构念),并给出 calibrate-then-trust 补救节奏。附同日 TraceJudgeBench 对照:去偏 prompt 在压偏差的同时损坏分辨率。

September 15, 2026 · 2 min

Harness or Model? Isolating the Harness Effect in Agentic Coding with a Contamination-Controlled Private Suite 精读

evolutionID GmbH 用 256 个私有任务的污染控制套件,首次把 agent 编程中 harness(驱动模型的软件层)作为唯一变量隔离测量。结论颠覆直觉:厂商原生 harness 无平均能力优势(±1.25pp 统计不显著),但按任务类型剧烈分化(仓库任务落后 9pp、竞赛任务领先 23.7pp);中立 harness 每解一题成本反而高 1.3-1.6 倍。论文还自曝自家成本遥测存在缺陷并全量重算——测量诚实度的范本。

September 15, 2026 · 2 min

Is Bash All You Need? An Empirical Study of Tool Interfaces for Enterprise Digital Worker Agents 精读

Microsoft 的系统性受控实验颠覆 agent 工具接口直觉:5 种接口配置(纯 typed tools / typed+bash / 纯 bash / bash+持久化自合成工具 / PTC)× 2 企业 benchmark × 2 前沿模型(Opus-4.8、GPT-5.5)下,纯 bash 全面对碾压 typed tools——TheAgentCompany 高 21.8-24.5pp、APEX 高 4.8-7.4pp,同时省 19-72% token。给 bash 加 typed tools 或工具合成均无增益。企业 agent 选型的迄今最硬证据。

September 15, 2026 · 2 min

LifeMem: Enabling Lifelong Experience Reuse for LLM Agents 精读

北理工 BITHLP 实验室的 agent 记忆工作 LifeMem:针对跨环境经验迁移与灾难性遗忘两大难题,按底层 workflow 聚类交互轨迹提取可复用技能(结构级抽象而非表层相似),推理时召回技能+轨迹引导动作。在 5 场景 10 环境 13k+ 任务上验证(其中 4 环境新标注 2k+ 轨迹),遗忘降低与跨任务迁移双优;并发现任务流顺序影响学习、结构相似巩固有增益。数据集代码全开源。

September 15, 2026 · 1 min

Look Before You Leap: Pre-Action Verification for LLM Agents 精读

针对 agent 动作的’静默失败’(产生貌似合理但错误的效果且不报错),本文提出 success/clean-failure/silent-failure 三分框架与确定性预检层:shell 命令侧 9,930 命令+482 工具上静态验证器捕获 95.8% 无效命令(语法/二进制检查 oracle-exact 零假阳性);代码编辑侧 640 编辑×224 文件基准揭示格式尖锐分化——内容锚定格式(search/replace、diff)近零静默失败,行号/函数名格式高静默失败。护栏微秒-毫秒级、零模型调用,可包裹任何黑盒前沿 agent。

September 15, 2026 · 2 min

Occamy-1.0: Open Pareto-frontier 35B Intelligence for Co-work 精读

Accio-Lab 的开放 35B-A3B co-work 模型技术报告:基于 Qwen3.6-35B-A3B 再训练,核心主张是成本效率路线——日常 co-work 的多数步骤(状态追踪/协调/恢复/跟进)不需要前沿级推理,执行接地的数据与环境(可重放长时程轨迹+多 harness 采集)+ 分阶段后训练,在 12 个 benchmark 四能力域上做到同规模最强、部分任务比肩 GPT-5.6 Sol 级大模型,价格协议明示的性价比优势。

September 15, 2026 · 2 min

One Skill Does Not Fit All: Automatic Discovery and Taxonomy-Guided Routing of Frame-Selection Skills for Long-Video Question Answering 精读

QMUL × Samsung AI 的产学研工作 AutoSkill:长视频 QA 中帧选择策略的有效性随问题语义类别剧烈变化,单一策略适配所有问题是错误假设。框架用 LLM agent 在小规模标注源池上迭代’提议-实现-评估-精炼’可执行帧选择技能,对目标 benchmark 仅用未标注的问题+选项文本归纳语义分类树,做’类别→技能’路由——零目标域标注,平均超 Qwen2.5-VL-7B 与 Qwen3.5-4B 基线 2.4%/1.2%。

September 15, 2026 · 1 min

Reality Is the Final Verifier: On Two Key Gaps in Agentic Software Engineering 精读

本文提出 two-gap 框架统一解释 agentic SE 的核心失败模式:requirement gap(需求 R 与利益相关者意图 I 的差)与 model gap(环境模型 M 与真实世界 W 的差)——reward hacking 是利用鸿沟的假接受,hallucination 是拓宽鸿沟的虚构。框架推导出非显然结论:叠加更多审查 agent 无用(共享同一 R/M/E 前提)、证据与权威必须来自内循环之外。案例集覆盖 KV store 六倍吞吐作弊与 2026 年 7 月 OpenAI/HF/Claude 评测越权事件。

September 15, 2026 · 2 min

Skill Issue: Lessons from Optimizing Repository SKILLs for Coding Agents 精读

TU Munich × JetBrains Research 的产学研负结果研究:在真实 Kotlin 仓库的合并 PR 反向挖掘任务上,GEPA 优化 SKILL 文档仅 +4.9pp(统计不显著)、SkillOpt 仅 +0.1pp——此前文献自报的巨大增益(55%→82%)是在弱模型弱 harness 配置下测出的。论文进一步证明 pass-rate 增益量级与二元判决本身的误标率(10.7% 盲重试通过)同阶,测量仪器而非优化器才是瓶颈。maintainer 盲读却确认 SKILL 含真实项目知识——分数之外的价值。

September 15, 2026 · 2 min

Studying Without a Syllabus: Task-Agnostic Environment Preprocessing 精读

Scale AI 提出并形式化’任务无关环境预处理’设定:agent 在不知道下游任务分布的前提下自主’学习’陌生环境(S: Π×E→E——学习系统在预算内探索环境、产出制品给冻结 solver)。Meta-Agent(±策略 Archive)在 6 个异构 benchmark 的 5 个上取得最高 Avg@3;学习制品显著降低测试时采样需求;但更大学习预算不必然提升——‘学什么’比’学多久’重要。

September 15, 2026 · 1 min