When “Must“ Becomes “Maybe“: Constraint Weakening in LLM Agent Workflows 精读

LLM 多角色工作流中,上游确立的安全约束(如“未获审批不得执行“)经摘要、计划、工单等交接变换传给下游后,是否仍然“说话算数“?深圳大学团队提出“操作性状态保持“概念并设计阶段分离受控实验:1296 个主实验 episode 中,直接交接对照 100% 保持约束,而正常级别的交接压缩使约束失活率达 100%、违规执行 54.2%;恢复全部四个状态字段则将两者归零。下游验证可在不改工件的情况下消除违规(0%),证明工件修复与端点遏制是互补的系统功能层。核心发现:语义可用不等于操作保持——内容还在,约束力没了。

August 27, 2026 · 2 min

Where vs What: Decomposing Structural and Content Failures in LLM Structured Outputs 精读

深度精读深圳大学 + 中科院深圳先进院论文:把 LLM 结构化输出失败分解为「值放错位置」(structural)与「值本身错误」(content)两种模式独立测量,发现跨 6 个模型一致的「结构先退化」剪刀差——前沿模型在最复杂任务上仍放错 24-35% 的值而小模型达 74%;机制消融指向语义捷径而非拓扑寻址;SA-RLVR 把结构感知奖励用于 GRPO,VPA 从 0.26 提到 0.63 而 SFT 仅 0.28。

August 27, 2026 · 2 min

CatchBench: When Can an Agent Failure Be Caught? 精读

CatchBench(USC,PyOD 作者 Yue Zhao)构建了首个在 PRE(运行前声明配置)/LIVE(运行中轨迹前缀)/POST(运行后完整轨迹)三种信息状态下统一评分 Agent 审计方法的竞技场:9 个计分板、72 个方法。它最大的贡献是方法学自律——公开每条标签的生成方式从而暴露自身语料的捷径(injecagent 源仅凭声明顺序即 F1=1.000)、给注入故障设’可采性门槛’、并如实发表 71/118 个无法分离的对比。‘分数在标签过程公开并检验其捷径之前不可解释’,这是对所有基准的警世恒言。

August 25, 2026 · 2 min

ContinualSkillBench: Can LLM Agents Truly Evolve Their Capabilities? 精读

北大×BIGAI 提出 ContinualSkillBench,首次系统回答「Agent 技能库能否自主进化」:五个领域各 100 个按难度与技能依赖排序的关联子任务,三回合协议让 Codex CLI 与 Claude Code 在执行-反馈-反思中自建技能。15 组模型-领域设置中 14 组顺序执行提升归一化奖励(整体相对 +16.9%),但关键对照实验揭示:纯 ICL(不维护显式技能)平均 0.605 vs 显式技能 0.602,几乎无差异——顺序收益大部分来自保留上下文与反馈适应而非可复用技能抽象;且弱模型(GPT-4o)堆积 384 个碎片化技能,远多于强模型(GPT-5.3-Codex)的 205 个。

August 25, 2026 · 3 min

DataSpace: Benchmarking Data Agents for Verifiable Analytics over Heterogeneous Workspaces 精读

深度精读HKUST(GZ)与清华大学合著的DataSpace基准:把数据智能体放进散落着数据库、CSV、长PDF与视频的异构工作区,要求其返回完整表格并通过确定性评测。410个跨语言任务、7439个工件、15.01GB规模下,六前沿模型×五智能体框架的最好成绩仅66.34%,换框架即拉差15.36点,视频证据与join是所有模型的共同短板。该基准同时是KDD Cup 2026数据智能体赛道的官方评测。

August 25, 2026 · 2 min

Evaluating Skills, Not Just Agents: Agentic Continuous Evaluation of Skills 精读

NVIDIA 提出 ACES,把 Agent 技能从「扫描文档」推进到「活体配对评测」:同一任务在有技能/无技能两种条件下运行,唯一变量是目标技能是否可用,六指标差值即 Skill Lift。145 个技能上结构分与 LLM 评分相关性仅 Spearman ρ=0.14,94.5% 通过结构门槛的技能与活体 Lift 相关性近零(-0.018);947 个配对案例显示平均复合 Skill Lift 为 0.2134,其中技能执行 +0.33、行为检查 +0.30 等过程指标贡献最大,且负 Lift 可区分「从未发现」与「发现但误用」两类失败——这是文档扫描永远看不到的信号。

August 25, 2026 · 3 min

LongWoF-Bench: Evaluating EvoMap Genes for Verifiable Long-Workflow Tasks 精读

LongWoF-Bench(EvoMap × 清华大学,778 个机器可验证长工作流任务)回答了一个技能资产化的核心问题:什么样的’经验’才值得复用?对照实验给出干净答案——‘验证器确认的执行经验’(Gene)在 7 个消费模型上稳定超越静态技能文档 8.7~15.5pp 且 token 更省;而没有经过验证器确认的’参考蒸馏’经验反而全面落后。经验的有效性来自’经过端到端验证的失败与修正信息’,而非表示形式。

August 25, 2026 · 2 min

MerchantBench: Benchmarking LLM Agents for Long-Term Coherence in E-Commerce Operations 精读

深度精读阿里巴巴×浙大×北大×复旦合作论文 MerchantBench——首个通过 365 天订单级电商仿真评测 LLM Agent 长期连贯性的基准。基于 1688 平台 98,843 条真实商品记录与 26 个工具,8 个主流大模型在 48 次全年运营中无一接近人类:最佳配置(Qwen3.7-Max + Hermes)最终净资产仅为人类参与者的 27.3%。论文提出操作连贯性与战略连贯性双维分析框架,揭示『活动衰减』与『战略漂移』两类渐进性失败,并提出 SWR(持续窗口率)这一可诊断『高分掩盖停摆』的过程指标。

August 25, 2026 · 4 min

MobilePA-Bench: Benchmarking Mobile Planner Agents on Complex Real-World Tasks 精读

MobilePA-Bench(阿里巴巴通义 MAI Team)填补了移动端 Agent 评测的中间地带:不是像素级 GUI 操作、也不是离线函数调用,而是’有状态沙箱里的中央规划器’——212 个真实工具×13 领域的活数据库沙箱,原生注入权限阻断/缺参/实体歧义等环境摩擦,并把子 Agent 协作、个性化记忆、技能加载设为三维能力门。1705 个任务上 13 个前沿模型最高只有 75.52%(Claude-Opus-5),且各维度冠军分散在 4 个不同模型——移动端没有全能规划器,Memory 维度全员不及格(最高 64.63%)。

August 25, 2026 · 1 min

Repo2Skill-Evo: Repository Skills Go Stale in Silence 精读

Repo2Skill-Evo(字节跳动 × 北京大学 × 北京交通大学)提出并评测了一个此前无人命名的问题:‘仓库技能静默失效’——仓库版本升级后,从旧版蒸馏的 Agent 技能不报任何错、继续被加载检索,但内容已全面过时。基准要求 Agent 依据官方 release patch 维护技能集(删掉过时内容),用人工逐行验证的 12,217 行’黄金过时行集’做删除式指标:6 个前沿模型全部不及格,最强的 Claude-opus-4.6 也只有 69.7% F1,85/105 个版本转换低于 0.65 的 Easy 阈值。

August 25, 2026 · 2 min