Evaluating Skills, Not Just Agents: Agentic Continuous Evaluation of Skills 精读

NVIDIA 提出 ACES,把 Agent 技能从「扫描文档」推进到「活体配对评测」:同一任务在有技能/无技能两种条件下运行,唯一变量是目标技能是否可用,六指标差值即 Skill Lift。145 个技能上结构分与 LLM 评分相关性仅 Spearman ρ=0.14,94.5% 通过结构门槛的技能与活体 Lift 相关性近零(-0.018);947 个配对案例显示平均复合 Skill Lift 为 0.2134,其中技能执行 +0.33、行为检查 +0.30 等过程指标贡献最大,且负 Lift 可区分「从未发现」与「发现但误用」两类失败——这是文档扫描永远看不到的信号。

August 25, 2026 · 3 min

EvoHarness-RL: Learning Self-Evolving Runtime Harness for Long-Horizon LLM Agents 精读

深度精读 UIUC×Meta AI 合作论文 EvoHarness-RL(已被 LLA@COLM 2026 接收):把长程智能体对外部 harness(记忆、工具、状态跟踪)的访问从提示词硬编码变成可学习的策略决策。通过 BPE 三态抽象(Belief/Progress/Experience)与四个元动作(track/commit/recall/note),配合教师轨迹 SFT 与代价感知 GRPO 两阶段训练,Qwen3-8B 在 ALFWorld 上从 ReAct 的 47.9% 跃升至 96.9%,逼近 Claude Opus 4.5;训练中还揭示“harness 退火”与“harness 演化”两个动力学过程。

August 25, 2026 · 5 min

LongWoF-Bench: Evaluating EvoMap Genes for Verifiable Long-Workflow Tasks 精读

LongWoF-Bench(EvoMap × 清华大学,778 个机器可验证长工作流任务)回答了一个技能资产化的核心问题:什么样的’经验’才值得复用?对照实验给出干净答案——‘验证器确认的执行经验’(Gene)在 7 个消费模型上稳定超越静态技能文档 8.7~15.5pp 且 token 更省;而没有经过验证器确认的’参考蒸馏’经验反而全面落后。经验的有效性来自’经过端到端验证的失败与修正信息’,而非表示形式。

August 25, 2026 · 2 min

MerchantBench: Benchmarking LLM Agents for Long-Term Coherence in E-Commerce Operations 精读

深度精读阿里巴巴×浙大×北大×复旦合作论文 MerchantBench——首个通过 365 天订单级电商仿真评测 LLM Agent 长期连贯性的基准。基于 1688 平台 98,843 条真实商品记录与 26 个工具,8 个主流大模型在 48 次全年运营中无一接近人类:最佳配置(Qwen3.7-Max + Hermes)最终净资产仅为人类参与者的 27.3%。论文提出操作连贯性与战略连贯性双维分析框架,揭示『活动衰减』与『战略漂移』两类渐进性失败,并提出 SWR(持续窗口率)这一可诊断『高分掩盖停摆』的过程指标。

August 25, 2026 · 4 min

MobilePA-Bench: Benchmarking Mobile Planner Agents on Complex Real-World Tasks 精读

MobilePA-Bench(阿里巴巴通义 MAI Team)填补了移动端 Agent 评测的中间地带:不是像素级 GUI 操作、也不是离线函数调用,而是’有状态沙箱里的中央规划器’——212 个真实工具×13 领域的活数据库沙箱,原生注入权限阻断/缺参/实体歧义等环境摩擦,并把子 Agent 协作、个性化记忆、技能加载设为三维能力门。1705 个任务上 13 个前沿模型最高只有 75.52%(Claude-Opus-5),且各维度冠军分散在 4 个不同模型——移动端没有全能规划器,Memory 维度全员不及格(最高 64.63%)。

August 25, 2026 · 1 min

Natural-Language Workflows Are Not Software Yet: Artifact-Driven Compilation for Reliable Agent Execution 精读

深度精读普渡大学 arXiv 2026 论文 ARTIC:自然语言工作流虽然给智能体提供了软件式接口,但数据依赖隐式、长分支指令难跟随,执行不可靠。ARTIC 把 NL 工作流编译为每步声明读写工件、约束门控产出、显式控制转移的形态,用约束优化精化高风险步骤,再以局部义务分解加场景干跑验证忠实性。在 11 个真实领域 488 个问题上,任务解决率较原始文本工作流提升 28 个百分点,跨模型执行一致性提升 32 个百分点,重复执行一致性提升 56 个百分点。

August 25, 2026 · 2 min

Neuro-Formal Verification: Agentic Language-Agnostic Formal Program Reasoning (NFV) 精读

NFV(Microsoft Research,单作者 Shuvendu K. Lahiri)让 AI Agent 当形式验证语言的前端:Python 开发者用自然语言问’这个函数对不对’,Agent 把程序与规范翻译到 Dafny,由成熟验证器逐条机器检查,证明可查、缺陷有 witness。在 206 条数据集上 57.3% 的条目给出机器检查证明 @92.2% 精度——而 LLM-as-judge 直接判定的精度只有 72% 且无 artifact;无纪律的’LLM+验证器自由证明’更是 98% 的正确程序和错误程序都被’证明’(精度 50%)。关键机制是’无证明即弃权’与 staged discipline(溯源标签+冻结翻译堵死为证明而改代码的捷径)。

August 25, 2026 · 2 min

Prime Agent: A Self-Improving RLM Harness 精读

Prime Agent(Prime Intellect × Princeton × MIT)用一个持久 IPython REPL + 递归子 Agent 的抽象,证明同一模型仅更换 harness 即可把 ARC-AGI-3 成绩从 30.2% 推到 95.5%、超过人类专家基线 95.4%。本精读拆解其两层核心抽象——Recursive Language Model(把上下文当变量、子 Agent 委派当函数调用)与 Continual Harness(把 harness 自身状态变成可 CRUD、可在线自我改进的数据),并解释为什么’harness 表达力’是被严重低估的能力放大器。

August 25, 2026 · 3 min

Repo2Skill-Evo: Repository Skills Go Stale in Silence 精读

Repo2Skill-Evo(字节跳动 × 北京大学 × 北京交通大学)提出并评测了一个此前无人命名的问题:‘仓库技能静默失效’——仓库版本升级后,从旧版蒸馏的 Agent 技能不报任何错、继续被加载检索,但内容已全面过时。基准要求 Agent 依据官方 release patch 维护技能集(删掉过时内容),用人工逐行验证的 12,217 行’黄金过时行集’做删除式指标:6 个前沿模型全部不及格,最强的 Claude-opus-4.6 也只有 69.7% F1,85/105 个版本转换低于 0.65 的 Easy 阈值。

August 25, 2026 · 2 min

Signal or Noise? A Benchmark Study of Agent Skills in Web Development 精读

Signal or Noise(百度 NLP)用字节长度匹配对照(±5% 的无关 Skill 控制组)证明:向编码 Agent 注入匹配的 WebDev Skill 平均是负收益——4 个模型 ΔPass@2 全负(-1.3~-4.2pp),token 开销却 +72%~394%。更深一层,负效应有两种机制:Sonnet/Qwen 是’长度分心’(该缩短 prompt),GPT-5.1/DeepSeek 是’内容误导’(该审查内容),需要相反对策;且 Skill 效用的跨模型相关性近零(|r|≤0.12)——Skill 是 (Skill,项目,模型) 三元组属性,不是可移植资产。

August 25, 2026 · 2 min